critères d'éligibilité
Les études étaient éligibles si elles répondaient à tous les critères suivants : (1) incluaient des femmes atteintes d'une tumeur maligne gynécologique quelconque ; (2) évaluaient une intervention définie en matière de mode de vie ou une intervention menée par des infirmières ; (3) rapportaient des données quantitatives sur la qualité de vie ; et (4) étaient soit des études comparatives (intervention versus contrôle), soit des études observationnelles de trajectoire fournissant des données descriptives pertinentes sur la qualité de vie ; (5) étaient publiées en anglais. . Pour la méta-analyse quantitative intervention versus contrôle, la présence d'un groupe témoin simultané était requise12. Deux études sans groupe comparateur ont été conservées uniquement pour la synthèse narrative13. Aucune restriction géographique n'a été appliquée.
Sources d'information
Le processus complet de sélection des études est illustré à la figure 1 sous la forme d'un diagramme de flux PRISMA. La recherche a été effectuée dans les bases Cochrane Library, Embase, Google Scholar, OVID et PubMed, depuis la création de chaque base jusqu'en juin 2026. Les références récupérées ont été importées dans EndNote 20 et les doublons ont été supprimés. Deux évaluateurs ont examiné indépendamment les titres et résumés, puis procédé à l'évaluation en texte intégral des études potentiellement éligibles. Les désaccords ont été résolus par discussion. Seules les publications en anglais ont été prises en compte pour l'inclusion, conformément aux critères d'éligibilité préétablis.
Stratégie de recherche
La stratégie de recherche a été élaborée à l’aide du cadre PICOS : Population — femmes atteintes de cancers gynécologiques ; Intervention — interventions liées au mode de vie ou aux soins infirmiers ; Comparaison — soins habituels ou interventions alternatives ; Résultat — qualité de vie ; Conception de l’étude — aucune restriction14. Un ensemble complet de mots-clés et de descripteurs normalisés a été utilisé dans toutes les bases de données ; les chaînes de recherche détaillées pour chaque base sont indiquées dans Tableau 113.
Processus de sélection
Après la récupération du texte intégral, deux évaluateurs ont vérifié indépendamment que chaque rapport satisfaisait à tous les critères d'éligibilité. Ils ont en outre comparé les listes d'auteurs, les noms des essais (par exemple SUCCEED, WALC, BENITA, TOPCAT‑G), les périodes de recrutement et les centres d'étude afin d'identifier d'éventuelles cohortes de patients chevauchantes. Les cohortes de patients potentiellement chevauchantes ont été identifiées et documentées. Lorsque des rapports chevauchants ont contribué à l'analyse principale, leur influence a été évaluée dans une analyse de sensibilité préspécifiée excluant le jeu de données chevauchant.
Extraction des données et mesures des résultats
Deux évaluateurs ont extrait indépendamment les données des 15 rapports inclus à l'aide d'un formulaire d'extraction de données normalisé et testé. Les désaccords ont été résolus par consensus avec l'auteur correspondant. Pour chaque étude, les informations suivantes ont été enregistrées : premier auteur, année de publication, pays, conception de l'étude, type de cancer, description de l'intervention, description du comparateur, taille de l'échantillon par groupe, âge des participants et stade de la maladie, instrument d'évaluation de la qualité de vie (QV), points temporels évalués, et toutes les données numériques sur la qualité de vie (moyennes, mesures de dispersion et tailles d'échantillon par bras)15.
Regroupement quantitatif (13 études comparatives)
Pour la méta-analyse de l'intervention par rapport au groupe témoin, les scores finaux après l'intervention (moyennes et écarts-types) ont été extraits aux points temporels prédéfinis (3 et 6 mois) pour les deux groupes. Lorsqu'une étude rapportait à la fois les scores finaux et les scores de variation, seuls les scores finaux ont été extraits16. L'approche méthodologique de la méta-analyse et l'évaluation de la qualité des études ont suivi les recommandations établies de Cochrane17. Le choix du modèle de méta-analyse a pris en compte l'hétérogénéité clinique et méthodologique attendue entre les études18, et l'hétérogénéité statistique a été quantifiée à l'aide de la statistique I2, selon la méthode décrite par Higgins et al.19. Les 13 études comparatives incluses dans la synthèse quantitative sont résumées dans le tableau 220,21,22,23,24,25,26,27,28,29,30,31,32.
Mesures des résultats sur la qualité de vie, alignement et métrique d'effet
L'instrument spécifique de qualité de vie utilisé dans chaque étude a été enregistré. Les échelles identifiées comprenaient l'évaluation fonctionnelle du cancer – général (FACT‑G), le FACT‑ovarien (FACT‑O), le FACT‑endomètre (FACT‑En), le questionnaire sur la qualité de vie de l'Organisation européenne pour la recherche et le traitement du cancer, version standard 30 (EORTC QLQ‑C30), la formule abrégée‑36 (SF‑36), ainsi que des échelles spécifiques à la pathologie. Pour tous les instruments, des scores plus élevés indiquaient une meilleure qualité de vie, et aucun instrument nécessitant une inversion de notation n'a été inclus. Toutes les données sur la qualité de vie extraites ont donc été harmonisées selon la même métrique, une différence moyenne (DM) positive favorisant systématiquement le groupe d'intervention.
Pour la méta-analyse principale, les scores finaux post-intervention ont été extraits plutôt que les scores de variation par rapport à la ligne de base. Cette décision s'appuie sur les raisons suivantes : (i) toutes les études ne rapportaient pas les scores de variation ni leurs écarts-types ; (ii) les scores finals reflètent l'état absolu de qualité de vie (QdV) après le traitement, ce qui revêt une signification clinique ; et (iii) l'utilisation des scores finaux a permis de maximiser le nombre d'études pouvant être regroupées. Lorsqu'une étude rapportait plusieurs sous-échelles de QdV, le score global de QdV ou le score total FACT-G était privilégié comme critère principal ; en cas d'indisponibilité, le sous-score relatif à la fonction physique était utilisé, cette dérogation étant explicitement notée en bas de page dans Tableau 2.
La différence moyenne brute (MD) a été utilisée comme mesure d'effet plutôt que la différence moyenne standardisée (DMS), car tous les instruments inclus sont validés pour mesurer le même construit sous-jacent.—qualité de vie liée à la santé—sur des échelles conceptuellement similaires (les scores totaux varient de 0–100 ou 0–148). La MD est directement interprétable dans les unités d'origine de ces échelles et revêt une signification clinique plus grande qu'une DMS exprimée en unités d'écart-type. Les estimations ajustées (par exemple, moyennes ajustées par ANCOVA) n'ont pas été utilisées car les covariables d'ajustement variaient largement d'une étude à l'autre, compromettant la comparabilité.
Conversions d'écart type
Lorsque les études rapportaient des erreurs standard (ES) ou des intervalles de confiance à 95 % au lieu des écarts-types, ceux-ci étaient convertis en écarts-types à l’aide de formules standard : ET = ES × √n pour les ES, et ET = √n × (IC supérieur – IC inférieur) / (2 × 1,96) pour les IC à 95 %. Pour les études présentant des médianes avec des étendues interquartiles (EI), les moyennes ou les écarts-types n’ont pas été imputés ; ces données ont été extraites sous forme narrative et n’ont pas été incluses dans les calculs du MD global. Aucune imputation de ce type n’a été nécessaire pour les 13 études ayant contribué à la synthèse quantitative.
Traitement des données manquantes
Des estimations en intention de traiter (ITT) ont été extraites de préférence lorsqu'elles étaient explicitement indiquées, car elles fournissent l'estimation la plus conservatrice et la moins biaisée de l'effet du traitement. Lorsque les données ITT n'étaient pas disponibles, les données selon le protocole ou les données des cas complets ont été extraites telles que rapportées par les auteurs originaux. Les moyennes, écarts-types (ET) ou valeurs de résultat manquants n'ont pas été imputés ; le caractère manquant a été noté pour chaque étude et pris en compte dans l'analyse de sensibilité. Les études avec des ET non rapportés pour des points temporels clés ont été signalées, et les auteurs correspondants ont été contactés par courrier électronique afin de demander les statistiques manquantes. En l'absence de réponse dans un délai de deux semaines, les données disponibles les plus conservatrices ont été utilisées (par exemple, l'ET de base groupée si l'ET post-intervention était manquant) ou le point temporel concerné a été exclu de l'analyse regroupée.
Plusieurs bras d'intervention et témoins partagés
Aucune étude incluse ne présentait plus d'un bras d'intervention axé sur un mode de vie actif ou des soins infirmiers comparé à un groupe témoin unique partagé, ce qui aurait nécessité de diviser l'échantillon témoin pour l'analyse. Dans l'unique étude de conception factorielle (McCloy et al.30), les données ont été extraites du bras combiné exercice-et-conscience pleine et du bras témoin de soins habituels afin de simplifier le regroupement et d'éviter tout comptage double. Pour les cohortes chevauchantes de l'essai SUCCEED (Von Gruenigen et al.21 et McCarroll et al.23), les deux rapports ont été conservés dans le tableau d'extraction. Pour la méta-analyse principale, les deux jeux de données ont été inclus (car ils rapportaient la qualité de vie au même point temporel). Dans une analyse de sensibilité préspecifiée, le dernier rapport a été exclu afin d'évaluer l'impact de la duplication des cohortes sur l'estimation regroupée ; les résultats sont indiqués dans le texte.
Études observationnelles non comparatives
Pour deux rapports (Budisan et al.33 et Betea et al.34), qui ne comportait pas de groupe témoin concurrent, les données comparatives entre intervention et contrôle n'ont pas été extraites (c'est-à-dire qu'aucune différence moyenne ne pouvait être calculée). En revanche, les données descriptives sur l'évolution de la qualité de vie ont été extraites. (les changements intra-groupe dans le temps) et présentés de manière narrative dans le texte et dans Tableau 2Ils n'ont pas été inclus dans aucune représentation graphique en forêt ni dans aucune synthèse quantitative regroupée.
Évaluation du risque de biais
Les biais de publication potentiels et autres effets liés aux petites études ont été évalués à l’aide de l’inspection visuelle des graphiques en entonnoir et du test de régression linéaire d’Egger (qui effectue une régression de l’effet standardisé de l’intervention sur sa précision). Étant donné que le test d’Egger présente une puissance statistique limitée lorsque le nombre d’études est faible (généralement <10), les graphiques en entonnoir et les tests d’Egger ont été prédéfinis et n’ont été réalisés que pour les méta-analyses comprenant 10 études ou plus. Pour les résultats provenant de moins de 10 études contributrices, les graphiques en entonnoir et les valeurs-p d’Egger ne sont pas rapportés, car ces tests manquent de puissance et pourraient produire des résultats trompeurs17.
Deux évaluateurs ont indépendamment évalué la qualité méthodologique des 15 rapports inclus, et les désaccords ont été résolus par discussion avec les auteurs correspondants. Comme les études incluses comprenaient à la fois des essais contrôlés randomisés (ECR ; n = 13) et des études de cohortes observationnelles non randomisées (n = 2 ; Budisan et al.33 ; Betea et al.34), des outils spécifiques à la conception ont été appliqués.
Pour les ECR (13 études), l'outil Cochrane RoB 2.0 a été utilisé (version révisée), évaluant chaque étude selon cinq domaines17 : (1) Processus de randomisation — génération de la séquence et masquage de l'allocation ; (2) Écarts par rapport aux interventions prévues — aveugle des participants et du personnel, et analyse en intention-de-traiter ; (3) Données manquantes sur les résultats — exhaustivité du suivi et prise en compte des abandons ; (4) Mesure du résultat — masquage des évaluateurs des résultats (particulièrement pertinent pour la qualité de vie autodéclarée, où le masquage est moins réalisable mais tout de même pris en compte) ; (5) Sélection des résultats rapportés — risque de publication sélective des résultats (vérifié à partir des registres d'essais ou des protocoles publiés, lorsque disponibles).
Chaque domaine a été évalué comme présentant un risque faible, des préoccupations ou un risque élevé. Un jugement global sur le risque de biais a ensuite été attribué à chaque étude : faible (tous les domaines à risque faible), des préoccupations (un ou plusieurs domaines avec des préoccupations), ou élevé (un domaine quelconque évalué à risque élevé ou plusieurs domaines avec des préoccupations). Pour les résultats autodéclarés, tels que la qualité de vie, l'aveugle des participants est souvent irréalisable ; un jugement de risque élevé n'a donc pas été automatiquement attribué en l'absence d'aveugle des participants. En revanche, l'absence d'aveugle a été explicitement notée comme une source potentielle de biais de performance dans l'évaluation du domaine 2.
Pour les études de cohortes observationnelles non randomisées (2 études), Budisan et al.33 et Betea et al.34 n'ont pas inclus de groupe comparateur simultané et n'ont pas été regroupés dans l'analyse méta-quantitative. Pour celles-ci, l'échelle Newcastle-Ottawa (NOS), adaptée aux études de cohortes, a été utilisée pour évaluer la sélection, la comparabilité (non applicable en raison de l'absence de groupe comparateur) et la vérification des résultats. Toutefois, en raison de l'absence de bras témoin, elles ont été jugées présenter un risque élevé de confusion et de biais de sélection dans toute inférence causale. Elles ont été conservées uniquement à des fins descriptives ; leurs profils de risque de biais n'affectent pas les estimations d'effet regroupées, mais sont documentés dans Table 2.
Résumé du risque de biais
Une figure récapitulative du risque de biais (graphique en feux de circulation) a été créée, affichant les évaluations par domaine pour chaque ECR. En bref, les problèmes les plus fréquents observés dans les ECR étaient : (i) l'absence d'aveuglage des participants et du personnel concernant les interventions sur le mode de vie (domaine 2 – certains risques/risque élevé dans 9 des 13 études), et (ii) des données de résultat incomplètes dues à l'abandon (domaine 3 – certains risques dans 4 études). Aucune étude n'a été jugée à faible risque dans tous les domaines ; la majorité (8/13) présentait certains risques, et 5/13 ont été classées à risque élevé globalement, principalement en raison de l'absence d'aveuglage et de tailles d'échantillons réduites entraînant une imprécision.
Degré de certitude des preuves (GRADE)
La certitude globale de l'ensemble des données probantes a été évaluée pour chaque résultat regroupé en utilisant le Cadre Grading of Recommendations Assessment, Development and Evaluation (GRADE), conformément au manuel GRADE et en utilisant le logiciel GRADEpro GDT. Le degré de certitude a été évalué comme élevé, modéré, faible, ou très faible dans cinq domaines : risque de biais, incohérence, absence de spécificité, imprécision et biais de publication. Les résultats évalués comprennent (1) la qualité de vie à 6 mois – gynécologie oncologique générale (MD regroupée provenant de 9 études comparatives) ; (2) qualité de vie à 6 mois – cancer de l'ovaire (différence moyenne regroupée issue de 2 études comparatives) ; (3) qualité de vie à 6 mois – cancer de l'endomètre (DM regroupée issue de 4 études comparatives, incluant des cohortes SUCCEED chevauchantes) ; (4) qualité de vie à 3 mois – gynécologie oncologique générale (MD groupée provenant de 6 études comparatives).
Mesure d'effet et modèle de méta-analyse
Des modèles aléatoires à variance inverse ont été utilisés pour les analyses générales à 6 mois et à 3 mois, car une hétérogénéité clinique et méthodologique importante était attendue entre les études, notamment en ce qui concerne les types de cancer, les composantes des interventions, l'intensité, la durée et les conditions de contrôle18. Des modèles à effet fixe à variance inverse ont été utilisés pour les analyses de sous-groupes concernant le cancer de l'ovaire et le cancer de l'endomètre, pour lesquels aucune hétérogénéité statistique n'a été observée (I2 = 0 %). L'hétérogénéité a été évaluée à l'aide de la statistique I219.
L'hétérogénéité a été quantifiée à l'aide de la statistique I2, les seuils de 25 %, 50 % et 75 % représentant respectivement une faible, modérée et forte hétérogénéité. En complément de I2, τ2 a été indiqué pour les analyses à effets aléatoires afin de quantifier l'ampleur absolue de la variance entre les études. Toutes les analyses ont été réalisées à l'aide des packages meta et metafor dans R (version 4.3.1).
Justification du regroupement malgré une hétérogénéité importante et prise en charge de l'hétérogénéité
Pour l'analyse primaire à 6 mois, je2 = 71 % indiquait une hétérogénéité importante. Le regroupement a été jugé approprié selon le modèle à effets aléatoires pour les raisons suivantes : (i) l'estimation regroupée représente la moyenne effet à travers une gamme d'interventions et de populations, ce qui constitue une question de synthèse légitime ; (ii) le modèle à effets aléatoires intègre explicitement la variance entre les études (τ2) dans l'erreur type, réduisant ainsi le risque d'intervalles de confiance faussement étroits ; (iii) des analyses préspécifiées par sous-groupe ont été réalisées selon le type de cancer (ovarien, endométrial) afin d'expliquer les sources cliniques d'hétérogénéité ; (iv) des analyses d'influence et de sensibilité ont été effectuées pour évaluer la robustesse de l'estimation regroupée.
La décision de regrouper les études malgré une hétérogénéité statistique importante s'est fondée sur les principes suivants : interprétation de l'I2 — des valeurs d'I2 de 25 %, 50 % et 75 % ont été prédéfinies pour représenter respectivement une faible, modérée et forte hétérogénéité. Un I2 dépassant 75 % indique une hétérogénéité considérable, ce qui pourrait rendre inapproprié le regroupement si cette hétérogénéité ne peut être expliquée de manière significative par des facteurs cliniques ou méthodologiques. Pour l'analyse générale principale à 6 mois (I2 = 71 %), des analyses de sous-groupes selon le type de cancer (ovarien, endométrial) ont été prédéfinies afin d'explorer les sources cliniques d'hétérogénéité. Le regroupement en sous-groupes a réduit de manière importante l'I2 à 0 % dans les deux sous-groupes (ovarien et endométrial), suggérant qu'une grande partie de l'hétérogénéité globale est attribuable aux différences de type de cancer et aux cibles thérapeutiques associées. Toutefois, étant donné que ces sous-groupes comprennent très peu d'études, on ne peut pas conclure de manière fiable que l'hétérogénéité est entièrement expliquée.
La réalisation d'un regroupement a été considérée comme justifiée pour l'analyse générale à 6 mois, car : (i) elle fournit un effet moyen résumé à travers un large éventail d'interventions, ce qui constitue une question méta-analytique légitime ; (ii) la valeur de τ2 est explicitement indiquée afin de quantifier la variance entre les études ; (iii) des analyses d'influence ont été effectuées pour vérifier la présence de résultats influencés par des valeurs aberrantes ; et (iv) l'estimation regroupée n'est pas considérée comme définitive ou applicable sur le plan clinique — elle est interprétée comme génératrice d'hypothèses et fortement nuancée dans la discussion.
Conformément au Guide Cochrane, lorsque l’I2 dépasse 75 % et que les analyses de sous-groupes n’expliquent pas de manière convaincante l’hétérogénéité, les estimations regroupées doivent être interprétées avec une extrême prudence. Étant donné le faible nombre d’études dans les sous-groupes, on ne peut affirmer avec certitude que l’hétérogénéité est entièrement expliquée. Par conséquent, l’estimation regroupée principale est présentée principalement à des fins descriptives et exploratoires et ne sert pas de base à des recommandations cliniques. Toutes les statistiques d’hétérogénéité (I2, τ2) et les analyses de sensibilité sont rapportées de manière transparente, permettant aux lecteurs d’évaluer eux-mêmes la stabilité des estimations.
Analyses de sous-groupes, de sensibilité et d'influence
Afin d'explorer les sources d'hétérogénéité, les analyses préspécifiées suivantes ont été réalisées, sans effectuer de méta-régression : 1) Pour les analyses de sous-groupes, le résultat général à 6 mois a été stratifié selon le type de cancer (ovarien, endométrial) afin d'examiner si l'effet différait selon le site tumoral ; 2) Analyse de sensibilité (cohorts chevauchantes) : afin d'évaluer l'impact des cohortes chevauchantes de l'essai SUCCEED (Von Gruenigen et al.21 et McCarroll et al.23), l'analyse de sous-groupe endométrial a été répétée en excluant l'étude de McCarroll et al.23 ; 3) Analyse d'influence par suppression d'une étude (leave-one-out) : chaque étude a été supprimée successivement, et la MD globale et l'I2 ont été recalculées pour le résultat général à 6 mois afin d'identifier si une étude unique influençait de manière disproportionnée les résultats ou l'hétérogénéité ; 4) Comparaison avec un modèle à effets fixes : par souci d'exhaustivité, les estimations regroupées ont également été calculées selon un modèle à effets fixes (pondération par la variance inverse) afin d'être comparées aux résultats du modèle à effets aléatoires ; toute différence notable indiquerait que l'hétérogénéité entre les études influence de façon significative l'estimation.
La méta-régression n’a pas été réalisée pour explorer les covariables continues (par exemple, l’âge, la qualité de vie à l’état initial, la durée de l’intervention) en raison du nombre insuffisant d’études par sous-groupe (≤9 pour l'issue générale à 6 mois) est insuffisant pour produire des coefficients de régression fiables. Avec <10 études par covariable, la métarégression est fortement sous-alimentée et sujette aux erreurs de type I, et les données disponibles sur les covariables ont été inconstamment rapportées entre les études.
Biais de publication
Aucun des résultats regroupés n'incluait 10 études ou plus. Par conséquent, les graphiques en entonnoir et les tests de régression d'Egger n'ont pas été réalisés, car ces évaluations seraient peu puissantes et potentiellement trompeuses compte tenu du nombre d'études disponibles.