Inclusiecriteria
Studies waren in aanmerking gekomen indien zij voldeden aan al de volgende criteria: (1) inclusie van vrouwen met een gynaecologische maligniteit; (2) evaluatie van een gedefinieerde leefstijlinterventie of een door verpleegkundigen geleide interventie; (3) rapportage van kwantitatieve gegevens over de kwaliteit van leven; en (4) het betreffen van ofwel vergelijkende studies (interventie versus controle) of observationele trajectstudies die relevante beschrijvende gegevens over de kwaliteit van leven verschaften (5) gepubliceerd waren in Nederlands. . Voor de kwantitatieve meta-analyse van interventie versus controle was een gelijktijdige vergelijkingsgroep vereist12Twee studies zonder comparator werden uitsluitend behouden voor narratieve synthese.13Er zijn geen geografische beperkingen toegepast.
Informatiebronnen
Het volledige proces voor de selectie van studies wordt in Figuur 1 weergegeven als een PRISMA-stroomschema. Er is gezocht in The Cochrane Library, Embase, Google Scholar, OVID en PubMed vanaf de start van de databases tot en met juni 2026. De opgehaalde records werden geïmporteerd in EndNote 20, waarna dubbele records werden verwijderd. Twee reviewers hebben onafhankelijk de titels en abstracts gescreend, gevolgd door een beoordeling van de volledige tekst van potentieel geschikte studies. Meningsverschillen werden via overleg opgelost. In overeenstemming met de vooraf vastgestelde geschiktheidscriteria werden alleen Engelstalige publicaties meegenomen voor inclusie.
Zoekstrategie
De zoekstrategie werd ontwikkeld met behulp van het PICOS-kader: Populatie—vrouwen met gynaecologische oncologie; Interventie—leefstijl- of verpleegkundige interventies; Vergelijking—gebruikelijke zorg of alternatieve interventies; Uitkomst—levenskwaliteit; Studieontwerp—geen beperkingen14. Een uitgebreide set trefwoorden en termen uit gecontroleerde vocabulaires werd in alle databanken gebruikt; de gedetailleerde zoekstrings voor elke databank zijn opgenomen in Tabel 113.
Selectieproces
Na het ophalen van de volledige teksten hebben twee reviewers onafhankelijk geverifieerd of elk rapport aan alle geschiktheidscriteria voldeed. Daarnaast hebben zij auteurslijsten, studienamen (bijv. SUCCEED, WALC, BENITA, TOPCAT‑G), wervingsperioden en studiecentra gecontroleerd om overlappende patiëntencohorten te identificeren. Potentieel overlappende patiëntencohorten werden geïdentificeerd en gedocumenteerd. Wanneer overlappende rapporten bijdroegen aan de primaire analyse, werd hun invloed geëvalueerd in een vooraf gespecificeerde sensitiviteitsanalyse waarbij de overlappende dataset werd uitgesloten.
Data-extractie en uitkomstmaten
Twee beoordelaars extraheerden onafhankelijk gegevens uit alle 15 geïncludeerde rapporten met behulp van een gestandaardiseerd, beproefd formulier voor gegevensextractie. Onenigheden werden bij consensus met de corresponderende auteur opgelost. Voor elke studie werd de volgende informatie geregistreerd: eerste auteur, publicatiejaar, land, onderzoeksopzet, kankertype, beschrijving van de interventie, beschrijving van de comparator, steekproefomvang per groep, leeftijd van de deelnemers en ziektestadium, instrument voor kwaliteit van leven (QoL), beoordeelde tijdstippen en alle numerieke QoL-gegevens (gemiddelden, spreidingsmaten en steekproefomvangen per arm)15.
Kwantitatieve pooling (13 vergelijkende studies)
Voor de meta-analyse van interventie versus controle werden de definitieve scores na interventie (gemiddelden en standaarddeviaties) geëxtraheerd op de vooraf vastgestelde tijdstippen (3 en 6 maanden) voor beide groepen. Wanneer een studie zowel definitieve scores als veranderscores rapporteerde, werden alleen de definitieve scores geëxtraheerd16. De methodologische aanpak voor de meta-analyse en de beoordeling van de studiekwaliteit volgde de vastgestelde Cochrane-richtlijnen17. Bij de keuze van het meta-analytische model werd rekening gehouden met de verwachte klinische en methodologische heterogeniteit tussen de studies18, en statistische heterogeniteit werd gekwantificeerd met behulp van de I2-statistiek zoals beschreven door Higgins et al.19. De 13 vergelijkende studies die zijn opgenomen in de kwantitatieve synthese worden samengevat in Tabel 220,21,22,23,24,25,26,27,28,29,30,31,32.
Uitkomstmaten voor kwaliteit van leven, uitlijning en effectmetriek
Het specifieke QoL-instrument dat in elke studie werd gebruikt, is genoteerd. De geïdentificeerde schalen waren onder meer de Functional Assessment of Cancer Therapy – General (FACT‑G), FACT‑Ovarian (FACT‑O), FACT‑Endometrial (FACT‑En), de European Organization for Research and Treatment of Cancer Quality of Life Questionnaire Core 30 (EORTC QLQ‑C30), de Short Form‑36 (SF‑36) en conditiespecifieke schalen. Voor alle instrumenten duidden hogere scores op een betere kwaliteit van leven, en er waren geen instrumenten met omgekeerde scoring opgenomen. Alle geëxtraheerde QoL-gegevens waren daarom afgestemd op dezelfde metriek, waarbij een positief gemiddeld verschil (MD) consistent in het voordeel van de interventiegroep was.
Voor de primaire meta-analyse werden de definitieve scores na de interventie geëxtraheerd in plaats van de scores ten opzichte van de nulmeting. Deze beslissing was gebaseerd op: (i) niet alle studies rapporteerden veranderingsscores of hun standaarddeviaties; (ii) definitieve scores weerspiegelen de absolute QoL-status na de behandeling, wat klinisch relevant is; en (iii) het gebruik van definitieve scores maximaliseerde het aantal studies dat gepoold kon worden. Wanneer een studie meerdere QoL-subschalen rapporteerde, kreeg de globale QoL-score of de totale FACT-G-score prioriteit als primaire uitkomstmaat; indien deze niet beschikbaar waren, werd de subschaal voor fysiek functioneren gebruikt, waarbij deze afwijking expliciet in een voetnoot bij Tabel 2 is vermeld.
Het ruwe MD werd gebruikt als maat voor het effect in plaats van het gestandaardiseerde gemiddelde verschil (SMD), omdat alle opgenomen instrumenten zijn gevalideerd om hetzelfde onderliggende construct—gezondheidsgerelateerde kwaliteit van leven—te meten op conceptueel vergelijkbare schalen (totale scores variëren van 0–100 of 0–148). Het MD is direct interpreteerbaar in de oorspronkelijke eenheden van deze schalen en is klinisch relevanter dan een SMD uitgedrukt in standaarddeviatie-eenheden. Gecorrigeerde schattingen (bijv. via ANCOVA-gecorrigeerde gemiddelden) werden niet gebruikt omdat de correctiecovariabelen sterk varieerden tussen de studies, wat de vergelijkbaarheid in gevaar zou brengen.
Conversies van de standaarddeviatie
Wanneer studies standaardfouten (SE's) of 95% betrouwbaarheidsintervallen rapporteerden in plaats van standaarddeviaties, werden deze omgezet naar SD's met behulp van standaardformules: SD = SE × √n voor SE's, en SD = √n × (bovenste CI – onderste CI) / (2 × 1.96) voor 95% CI's. Voor studies die medianen met interkwartielafstanden (IQR) presenteerden, werden gemiddelden of SD's niet geïmputeerd; dergelijke gegevens werden narratief geëxtraheerd en werden niet meegenomen in de gepoolde MD-berekeningen. Voor de 13 studies die bijdroegen aan de kwantitatieve synthese was dergelijke imputatie niet nodig.
Omgang met ontbrekende gegevens
Intention-to-treat (ITT)-schattingen werden bij voorkeur geëxtraheerd wanneer deze expliciet werden gerapporteerd, aangezien zij de meest conservatieve en onbevooroordeelde schatting van het behandelingseffect bieden. Wanneer ITT-gegevens niet beschikbaar waren, werden per-protocolgegevens of complete-case-gegevens geëxtraheerd zoals gerapporteerd door de oorspronkelijke auteurs. Ontbrekende gemiddelden, SD's of uitkomstwaarden werden niet geïmputeerd; het ontbreken van gegevens werd voor elke studie geregistreerd en meegewogen in de sensitiviteitsanalyse. Studies met niet-gerapporteerde SD's voor belangrijke tijdstippen werden genoteerd, en de corresponderende auteurs werden per e-mail benaderd om de ontbrekende statistieken op te vragen. Indien er binnen twee weken geen reactie werd ontvangen, werden de meest conservatieve beschikbare gegevens gebruikt (bijv. de gepoolde baseline SD als de SD na interventie ontbrak) of werd het specifieke tijdstip uitgesloten van pooling.
Meerdere interventiegroepen en gedeelde controles
Geen van de opgenomen studies presenteerde meer dan één actieve lifestyle- of verpleegkundige interventiegroep vergeleken met één gedeelde controlegroep, wat het splitsen van de controlegroep voor analyse zou hebben vereist. In de enige studie met een factorieel ontwerp (McCloy et al.30) werden gegevens geëxtraheerd uit de gecombineerde oefenings- en mindfulnessgroep en de controlegroep met gebruikelijke zorg om het poolen te vereenvoudigen en dubbeltellingen te voorkomen. Voor de overlappende SUCCEED-trialcohorten (Von Gruenigen et al.21 en McCarroll et al.23) werden beide rapporten in de extractietabel behouden. Voor de primaire meta-analyse werden beide datasets opgenomen (aangezien zij de QoL op hetzelfde tijdstip rapporteerden). In een vooraf gespecificeerde sensitiviteitsanalyse werd het laatste rapport uitgesloten om de impact van cohortduplicatie op de gepoolde schatting te beoordelen; de resultaten hiervan worden in de tekst gerapporteerd.
Niet-comparatieve observationele studies
Voor twee rapporten (Budisan et al.33 en Betea et al.34), waarbij een gelijktijdige controlegroep ontbrak, werden er geen vergelijkende gegevens tussen interventie en controle geëxtraheerd (d.w.z. er kon geen MD worden berekend). In plaats daarvan werden beschrijvende gegevens over het verloop van de QoL geëxtraheerd (binnen-groepsveranderingen over tijd) en narratief gepresenteerd in de tekst en in Tabel 2. Deze werden niet opgenomen in een forest plot of gepoolde kwantitatieve synthese.
Beoordeling van het risico op bias
Potentiële publicatiebias en andere effecten van kleine studies werden beoordeeld met behulp van zowel visuele inspectie van funnel plots als de lineaire regressietest van Egger (waarbij het gestandaardiseerde interventie-effect wordt geregreerd op de precisie ervan). Omdat de test van Egger een beperkte statistische kracht heeft wanneer het aantal studies klein is (over het algemeen <10), waren funnel plots en Egger-testen vooraf gespecificeerd en zouden deze alleen worden uitgevoerd voor meta-analyses bestaande uit 10 of meer studies. Voor uitkomsten met minder dan 10 bijdragende studies worden funnel plots en Egger p-waarden niet gerapporteerd, aangezien dergelijke testen onvoldoende kracht hebben en misleidende resultaten kunnen opleveren17.
Twee beoordelaars hebben onafhankelijk de methodologische kwaliteit van de 15 opgenomen rapporten beoordeeld, en onenigheden werden via overleg met de corresponderende auteurs opgelost. Omdat de opgenomen studies zowel bestonden uit gerandomiseerde gecontroleerde trials (RCT's; n = 13) als niet-gerandomiseerde observationele cohortstudies (n = 2; Budisan et al.33; Betea et al.34), zijn ontwerp specifieke instrumenten toegepast.
Voor RCT's (13 studies) werd de Cochrane RoB 2.0 tool gebruikt (herziene versie), waarbij elke studie werd geëvalueerd op vijf domeinen17: (1) Randomisatieproces -- sequentiegeneratie en toewijzingsverhulling; (2) Afwijkingen van de beoogde interventies -- blindering van deelnemers en personeel, en of de analyse intention‑to‑treat was; (3) Ontbrekende uitkomstgegevens -- volledigheid van de follow-up en de omgang met uitvallers; (4) Meting van de uitkomst -- blindering van de beoordelaars van de uitkomsten (met name relevant voor zelfgerapporteerde QoL, waarbij blindering minder haalbaar is maar toch in overweging wordt genomen); (5) Selectie van het gerapporteerde resultaat -- risico op selectieve rapportage van uitkomsten (gecontroleerd aan de hand van trial-registers of gepubliceerde protocollen indien beschikbaar).
Elk domein werd beoordeeld als laag risico, enkele zorgen of hoog risico. Vervolgens werd voor elke studie een algemeen oordeel over het risico op bias (risk-of-bias) toegewezen: laag (alle domeinen laag), enkele zorgen (één of meer domeinen met enkele zorgen) of hoog (elk domein beoordeeld als hoog risico of meerdere domeinen met enkele zorgen). Voor zelfgerapporteerde uitkomsten, zoals de kwaliteit van leven, is het blinderen van deelnemers vaak onhaalbaar; een oordeel van hoog risico werd daarom niet automatisch toegewezen bij het ontbreken van blindering van deelnemers. In plaats daarvan werd het gebrek aan blindering expliciet genoteerd als een potentiële bron van performance bias in de beoordeling van domein 2.
Voor niet-gerandomiseerde observationele cohortstudies (2 studies) hanteerden Budisan et al.33 en Betea et al.34 geen gelijktijdige vergelijkingsgroep, waardoor zij niet werden meegenomen in de kwantitatieve meta-analyse. Voor deze studies werd de Newcastle-Ottawa Scale (NOS) gebruikt, aangepast voor cohortstudies, om de selectie, vergelijkbaarheid (niet van toepassing vanwege het ontbreken van een vergelijker) en uitkomstvaststelling te beoordelen. Omdat zij echter geen controlegroep hadden, werden zij beschouwd als zijnde onder een hoog risico op confounding en selectiebias bij elke causale gevolgtrekking. Zij zijn uitsluitend voor beschrijvende doeleinden behouden; hun risicoprofielen voor bias hebben geen invloed op de gepoolde effectschattingen, maar zijn gedocumenteerd in Tabel 2.
Samenvatting van het risico op bias
Er is een samenvattende figuur van het risico op bias (traffic-light plot) gemaakt, waarin de beoordelingen op domeinniveau voor elke RCT worden weergegeven. Kort samengevat waren de meest voorkomende zorgen over de RCT's: (i) gebrek aan blindering van deelnemers en personeel voor leefstijlinterventies (domein 2 – enkele zorgen/hoog risico in 9 van de 13 studies), en (ii) incomplete uitkomstgegevens als gevolg van uitval (domein 3 – enkele zorgen in 4 studies). Geen enkele studie werd als laag risico beoordeeld over alle domeinen; de meerderheid (8/13) vertoonde enkele zorgen, en 5/13 werden beoordeeld als hoog risico over het geheel genomen, voornamelijk vanwege het gebrek aan blindering en kleine steekproefgroottes die leidden tot imprecisie.
Zekerheid van het bewijs (GRADE)
De algemene zekerheid van het bewijsmateriaal werd voor elke gepoolde uitkomst beoordeeld met behulp van de Grading of Recommendations Assessment, Development and Evaluation (GRADE)-raamwerk, conform het GRADE-handboek en met gebruik van de GRADEpro GDT-software. De zekerheid werd beoordeeld als hoog, matig, laag, of zeer laag over vijf domeinen: risico op bias, inconsistentie, indirectheid, imprecisie en publicatiebias. De beoordeelde uitkomsten omvatten (1) QoL na 6 maanden – algemene gynaecologische oncologie (gepoolde MD uit 9 vergelijkende studies); (2) QoL na 6 maanden – eierstokkanker (gepoolde MD uit 2 vergelijkende studies); (3) QoL na 6 maanden – endometriumcarcinoom (gepoold gemiddeld verschil uit 4 vergelijkende studies, inclusief overlappende SUCCEED-cohorten); (4) kwaliteit van leven na 3 maanden – algemene gynaecologische oncologie (gepoolde MD uit 6 vergelijkende studies).
Effectmaat en meta-analysemodel
Random-effects inverse-variance modellen werden gebruikt voor de algemene analyses van 6 maanden en 3 maanden, omdat er aanzienlijke klinische en methodologische heterogeniteit tussen de studies werd verwacht, waaronder verschillen in kankertypen, interventiecomponenten, intensiteit, duur en controlecondities18. Fixed-effect inverse-variance modellen werden gebruikt voor de subgroepanalyses van eierstok- en endometriumkanker, waarbij geen statistische heterogeniteit werd waargenomen (I2 = 0%). Heterogeniteit werd beoordeeld met behulp van de I2 statistiek19.
Heterogeniteit werd gekwantificeerd met behulp van de I2-statistiek, waarbij drempelwaarden van 25%, 50% en 75% respectievelijk stonden voor lage, matige en hoge heterogeniteit. Naast I2 werd τ2 gerapporteerd voor random-effects-analyses om de absolute grootte van de variantie tussen studies te kwantificeren. Alle analyses werden uitgevoerd met de meta en metafor packages in R (versie 4.3.1).
Rechtvaardiging voor het poolen ondanks aanzienlijke heterogeniteit en de omgang met heterogeniteit
Voor de primaire analyse van 6 maanden gaf I2 = 71% een aanzienlijke heterogeniteit aan. Pooling werd als passend beschouwd onder het random-effects model om de volgende redenen: (i) de gepoolde schatting vertegenwoordigt het gemiddelde effect over een reeks interventies en populaties, wat een legitieme samenvattende vraag is; (ii) het random-effects model incorporeert expliciet de variantie tussen studies (τ2) in de standaardfout, waardoor het risico op foutief smalle betrouwbaarheidsintervallen wordt verminderd; (iii) vooraf gespecificeerde subgroepanalyses werden uitgevoerd per kankertype (ovarium, endometrium) om klinische bronnen van heterogeniteit te verklaren; (iv) invloeds- en sensitiviteitsanalyses werden uitgevoerd om de robuustheid van de gepoolde schatting te beoordelen.
De beslissing om studies te poolen ondanks aanzienlijke statistische heterogeniteit werd geleid door de volgende principes: interpretatie van I2 — I2-waarden van 25%, 50% en 75% waren vooraf vastgesteld om respectievelijk lage, matige en hoge heterogeniteit te vertegenwoordigen. Een I2 die 75% overschrijdt, duidt op aanzienlijke heterogeniteit, wat pooling ongepast kan maken als de heterogeniteit niet zinvol kan worden verklaard door klinische of methodologische factoren. Voor de primaire algemene analyse over 6 maanden (I2 = 71%) waren subgroepanalyses per kankertype (ovarium, endometrium) vooraf vastgesteld om klinische bronnen van heterogeniteit te onderzoeken. Subgroepering reduceerde I2 aanzienlijk tot 0% in zowel de ovarium- als de endometriumsubgroepen, wat suggereert dat een groot deel van de totale heterogeniteit toewijsbaar is aan verschillen in kankertype en de daarmee geassocieerde interventiedoelen. Omdat deze subgroepen echter zeer weinig studies bevatten, kan er niet betrouwbaar worden geconcludeerd dat de heterogeniteit volledig is verklaard.
Het voortzetten van het poolen werd gerechtvaardigd geacht voor de algemene analyse over 6 maanden omdat: (i) het een samenvattend gemiddeld effect biedt over een breed scala aan interventies, wat een legitieme meta-analytische vraag is; (ii) τ2 expliciet wordt gerapporteerd om de variantie tussen studies te kwantificeren; (iii) invloedsanalyses zijn uitgevoerd om te controleren op resultaten die door uitschieters worden gedreven; en (iv) de gepoolde schatting niet wordt beschouwd als definitief of klinisch toepasbaar — deze wordt geïnterpreteerd als hypothese-genererend en wordt in de discussie voorzien van zware kanttekeningen.
In overeenstemming met het Cochrane Handbook, wanneer ik2 overschrijdt de 75% en subgroepanalyses de heterogeniteit niet overtuigend verklaren, moeten de gepoolde schattingen met uiterste voorzichtigheid worden geïnterpreteerd. Gezien het geringe aantal studies in de subgroepen kan er niet met zekerheid worden gesteld dat de heterogeniteit volledig is verklaard. Daarom wordt de primaire gepoolde schatting hoofdzakelijk gepresenteerd voor beschrijvende en verkennende doeleinden en vormt deze geen basis voor klinische aanbevelingen. Alle heterogeniteitsstatistieken (I2, τ2) en sensitiviteitsanalyses worden transparant gerapporteerd, zodat lezers de stabiliteit van de schattingen zelf kunnen beoordelen.
Subgroep-, sensitiviteits- en invloedsanalyses
Om bronnen van heterogeniteit te onderzoeken, werden de volgende vooraf gespecificeerde analyses uitgevoerd, zonder meta-regressie uit te voeren: 1) Voor subgroepanalyses werd de algemene uitkomst na 6 maanden gestratificeerd naar kankertype (ovarium, endometrium) om te onderzoeken of het effect verschilde per tumorgelokaliseerde plaats; 2) Sensitiviteitsanalyse (overlappende cohorten): Om de impact van de overlappende SUCCEED-trialcohorten te beoordelen (Von Gruenigen et al.21 en McCarroll et al.23), werd de subgroepanalyse voor endometrium herhaald met uitsluiting van McCarroll et al.23. 3) Leave-one-out invloedsanalyse: Elke studie werd sequentieel verwijderd, waarna het gepoolde MD en de I2 werden herberekend voor de algemene uitkomst na 6 maanden om vast te stellen of een enkele studie onevenredig de resultaten of de heterogeniteit beïnvloedde; 4) Vergelijking met fixed-effect model: Voor de volledigheid werden gepoolde schattingen ook berekend onder een fixed-effect model (inverse-variantie weging) om deze te vergelijken met de random-effects resultaten; elke substantiële discrepantie zou erop wijzen dat heterogeniteit tussen studies de schatting significant beïnvloedt.
Meta-regressie werd niet uitgevoerd om continue covariabelen (bijv. leeftijd, baseline QoL, duur van de interventie) te onderzoeken, omdat het aantal studies per subgroep (≤9 voor de algemene uitkomst na 6 maanden) onvoldoende is om betrouwbare regressiecoëfficiënten op te leveren. Bij <10 studies per covariabele is meta-regressie sterk onderpowered en gevoelig voor type I-fouten, en de beschikbare gegevens over covariabelen werden inconsistent gerapporteerd in de verschillende studies.
Publicatiebias
Geen van de gepoolde resultaten omvatte 10 of meer studies. Daarom zijn er geen funnel plots en regressietoetsen van Egger uitgevoerd, omdat deze beoordelingen onvoldoende statistische power zouden hebben en potentieel misleidend zouden zijn gezien het aantal beschikbare studies.