Kryteria kwalifikacji
Badania kwalifikowały się do analizy, jeśli spełniały wszystkie następujące kryteria: (1) obejmowały kobiety z dowolnym nowotworem ginekologicznym; (2) oceniały określoną interwencję w zakresie stylu życia lub interwencję prowadzoną przez pielęgniarki; (3) raportowały ilościowe dane dotyczące jakości życia; (4) były badaniami porównawczymi (interwencja vs. kontrola) lub obserwacyjnymi badaniami trajektorii, które dostarczały odpowiednich opisowych danych o jakości życia; (5) zostały opublikowane w języku angielskim. Do ilościowej metaanalizy interwencji w porównaniu z grupą kontrolną wymagana była jednoczesna grupa porównawcza12. Dwa badania bez grupy porównawczej zachowano wyłącznie do syntezy opisowej13. Nie zastosowano ograniczeń geograficznych.
Źródła informacji
Pełny proces wyboru badań przedstawiono na Rysunku 1 w formie diagramu przepływu PRISMA. Przeszukiwanie baz danych Cochrane Library, Embase, Google Scholar, OVID i PubMed przeprowadzono od momentu ich utworzenia do czerwca 2026 roku. Pobrane rekordy zaimportowano do programu EndNote 20, a następnie usunięto duplikaty. Dwóch recenzentów niezależnie oceniło tytuły i streszczenia, po czym przeprowadzono analizę pełnych tekstów potencjalnie kwalifikujących się badań. Rozbieżności rozstrzygano w drodze dyskusji. Zgodnie z wcześniej określonymi kryteriami kwalifikacji, do analizy uwzględniono wyłącznie publikacje w języku angielskim.
Strategia wyszukiwania
Strategię wyszukiwania opracowano w oparciu o schemat PICOS: Populacja — kobiety z nowotworami ginekologicznymi; Interwencja — interwencje związane ze stylem życia lub pielęgniarskie; Porównanie — standardowa opieka lub alternatywne interwencje; Wynik — jakość życia; Projekt badania — brak ograniczeń14. We wszystkich bazach danych zastosowano kompleksowy zestaw słów kluczowych i terminów ze słowników kontrolowanych; szczegółowe zapytania wyszukiwania dla każdej bazy danych przedstawiono w Tabeli 113.
Proces selekcji
Po pobraniu pełnych tekstów dwóch recenzentów niezależnie zweryfikowało, czy każdy raport spełnia wszystkie kryteria kwalifikacji. Dodatkowo sprawdzono listy autorów, nazwy badań (np. SUCCEED, WALC, BENITA, TOPCAT‑G), okresy rekrutacji oraz ośrodki badawcze w celu zidentyfikowania nakładających się kohort pacjentów. Potencjalnie nakładające się kohorty pacjentów zostały zidentyfikowane i udokumentowane. W przypadkach, gdy nakładające się raporty włączono do analizy głównej, ich wpływ oceniono w zaplanowanej analizie wrażliwości, w której wykluczono nakładający się zestaw danych.
Ekstrakcja danych i miary wyników
Dwoje recenzentów niezależnie wyekstrahowało dane ze wszystkich 15 włączonych raportów, korzystając ze zestandaryzowanego, przetestowanego formularza ekstrakcji danych. Rozbieżności rozstrzygano drogą konsensusu z autorem korespondencyjnym. Dla każdego badania zapisano następujące informacje: pierwszy autor, rok publikacji, kraj, projekt badania, typ nowotworu, opis interwencji, opis komparatora, wielkość próby w grupie, wiek uczestników i stopień zaawansowania choroby, narzędzie do oceny jakości życia (QoL), oceniane punkty czasowe oraz wszystkie numeryczne dane QoL (średnie, miary rozproszenia i wielkość próby w każdym ramieniu)15.
Kwantytatywne łączenie danych (13 badań porównawczych)
W celu przeprowadzenia metaanalizy porównującej grupę interwencyjną z kontrolną, końcowe wyniki po interwencji (średnie i odchylenia standardowe) zostały pobrane dla obu grup w określonych wcześniej punktach czasowych (3 i 6 miesięcy). W przypadku badań, w których raportowano zarówno wyniki końcowe, jak i zmiany wyników, pobrano jedynie wyniki końcowe16. Podejście metodologiczne do metaanalizy oraz ocena jakości badań opierały się na uznanych wytycznych Cochrane17. Przy wyborze modelu metaanalitycznego uwzględniono przewidywaną heterogeniczność kliniczną i metodologiczną między badaniami18, a heterogeniczność statystyczną określono za pomocą statystyki I2 zgodnie z opisem Higginsa i wsp.19. 13 badań porównawczych włączonych do syntezy ilościowej zostało zestawionych w Tabeli 220,21,22,23,24,25,26,27,28,29,30,31,32.
Mierniki wyników jakości życia, dopasowanie i metryka efektu
Odnotowano konkretne narzędzie do oceny jakości życia (QoL) wykorzystane w każdym badaniu. Zidentyfikowane skale obejmowały Functional Assessment of Cancer Therapy – General (FACT‑G), FACT‑Ovarian (FACT‑O), FACT‑Endometrial (FACT‑En), kwestionariusz Core 30 Europejskiej Organizacji ds. Badań i Leczenia Nowotworów (EORTC QLQ‑C30), Short Form‑36 (SF‑36) oraz skale specyficzne dla danej jednostki chorobowej. We wszystkich instrumentach wyższe wyniki wskazywały na lepszą jakość życia i nie uwzględniono narzędzi z odwróconą skalą punktową. Wszystkie wyekstrahowane dane dotyczące QoL zostały zatem sprowadzone do tej samej miary, przy czym dodatnia różnica średnich (MD) konsekwentnie przemawiała na korzyść grupy interwencyjnej.
W głównej metaanalizie wyodrębniono końcowe wyniki po interwencji, a nie wyniki zmiany względem poziomu bazowego. Decyzja ta była oparta na następujących przesłankach: (i) nie wszystkie badania raportowały wyniki zmiany lub ich odchylenia standardowe; (ii) wyniki końcowe odzwierciedlają bezwzględny stan jakości życia (QoL) po leczeniu, co jest istotne klinicznie; oraz (iii) zastosowanie wyników końcowych maksymalizowało liczbę badań, które można było połączyć. W przypadku, gdy badanie raportowało wiele podskal QoL, jako główny punkt końcowy priorytetowo traktowano globalny wynik QoL lub całkowity wynik FACT-G; w razie ich braku stosowano podskalę funkcjonowania fizycznego, co zostało wyraźnie zaznaczone w przypisach w Tabeli 2.
Jako miarę efektu zastosowano surową różnicę średnich (MD) zamiast standaryzowanej różnicy średnich (SMD), ponieważ wszystkie uwzględnione instrumenty są zwalidowane do pomiaru tego samego konstruktu podstawowego—jakości życia związanej ze zdrowiem—na koncepcyjnie podobnych skalach (całkowite wyniki mieszczą się w zakresie 0–100 lub 0–148). MD jest bezpośrednio interpretowalne w oryginalnych jednostkach tych skal i ma większe znaczenie kliniczne niż SMD wyrażone w jednostkach odchylenia standardowego. Nie zastosowano szacunków skorygowanych (np. średnich skorygowanych za pomocą ANCOVA), ponieważ kowarianty korekcyjne znacznie różniły się między badaniami, co naruszałoby porównywalność.
Konwersje odchylenia standardowego
W przypadku badań, w których raportowano błędy standardowe (SE) lub 95% przedziały ufności zamiast odchyleń standardowych, dokonano konwersji na SD przy użyciu standardowych wzorów: SD = SE × √n dla SE oraz SD = √n × (górna granica CI – dolna granica CI) / (2 × 1.96) dla 95% CI. W badaniach prezentujących mediany wraz z rozstępami międzykwartylnymi (IQR) nie imputowano średnich ani SD; takie dane wyodrębniono opisowo i nie uwzględniono ich w zbiorczych obliczeniach MD. W przypadku 13 badań, które weszły w skład syntezy ilościowej, taka imputacja nie była wymagana.
Obsługa brakujących danych
Preferencyjnie wyodrębniano szacunki w analizie intencji leczenia (ITT), gdy były one wyraźnie raportowane, ponieważ zapewniają one najbardziej konserwatywny i nieobciążony szacunek efektu terapeutycznego. W przypadku braku danych ITT, wyodrębniano dane zgodnie z protokołem (per-protocol) lub dane z pełnych przypadków, zgodnie z raportami oryginalnych autorów. Braki w średnich, SD lub wartościach wyników nie były uzupełniane metodą imputacji; braki odnotowano dla każdego badania i uwzględniono w analizie wrażliwości. Odnotowano badania, w których nie podano SD dla kluczowych punktów czasowych, a z autorami korespondencyjnymi skontaktowano się drogą elektroniczną w celu uzyskania brakujących statystyk. Jeśli w ciągu dwóch tygodni nie otrzymano odpowiedzi, wykorzystano najbardziej konserwatywne dostępne dane (np. połączone SD bazowe, jeśli brakowało SD po interwencji) lub wykluczono konkretny punkt czasowy z analizy zbiorczej.
Wieloramienne interwencje i wspólne grupy kontrolne
Żadne z włączonych badań nie przedstawiało więcej niż jednego ramienia interwencji w zakresie stylu życia lub opieki pielęgniarskiej w porównaniu z jedną wspólną grupą kontrolną, co wymagałoby podzielenia próby kontrolnej na potrzeby analizy. W jednym badaniu o modelu faktorialnym (McCloy et al.30) dane wyekstrahowano z połączonego ramienia ćwiczeń i uważności oraz z ramienia kontrolnego opieki standardowej, aby uprościć łączenie danych i uniknąć podwójnego liczenia. W przypadku nakładających się kohort badania SUCCEED (Von Gruenigen et al.21 oraz McCarroll et al.23) oba raporty zachowano w tabeli ekstrakcji. W głównej metaanalizie uwzględniono oba zestawy danych (ponieważ raportowano QoL w tym samym punkcie czasowym). W zaplanowanej analizie wrażliwości wykluczono ten drugi raport, aby ocenić wpływ duplikacji kohorty na oszacowanie zbiorcze; wyniki przedstawiono w tekście.
Nieporównawcze badania obserwacyjne
W przypadku dwóch raportów (Budisan et al.33 oraz Betea et al.34), w których brakowało równoległej grupy kontrolnej, nie wyodrębniono porównawczych danych dotyczących interwencji względem grupy kontrolnej (tj. nie można było obliczyć MD). Zamiast tego wyodrębniono opisowe dane dotyczące trajektorii QoL (zmiany wewnątrzgrupowo w czasie), które przedstawiono opisowo w tekście oraz w Tabeli 2. Nie zostały one uwzględnione w żadnym wykresie leśnym ani w zbiorczej syntezie ilościowej.
Ocena ryzyka błędu
Potencjalną błąd publikacji oraz inne efekty małych badań oceniano zarówno poprzez wizualną inspekcję wykresów lejkowych, jak i test regresji liniowej Eggera (który regresuje standaryzowany efekt interwencji względem jego precyzji). Ponieważ test Eggera ma ograniczoną moc statystyczną przy małej liczbie badań (zazwyczaj <10), wykresy lejkowe i testy Eggera zostały określone a priori i miały być przeprowadzane wyłącznie dla metaanaliz obejmujących 10 lub więcej badań. W przypadku wyników, w których uczestniczyło mniej niż 10 badań, nie podano wykresów lejkowych ani wartości p testu Eggera, ponieważ takie testy mają zbyt małą moc i mogą prowadzić do błędnych wniosków17.
Jakość metodologiczna 15 włączonych raportów została niezależnie oceniona przez dwóch recenzentów, a rozbieżności rozstrzygano w drodze dyskusji z autorami korespondencyjnymi. Ponieważ włączone badania obejmowały zarówno randomizowane badania kontrolowane (RCT; n = 13), jak i nierandomizowane obserwacyjne badania kohortowe (n = 2; Budisan et al.33; Betea et al.34), zastosowano narzędzia specyficzne dla danego projektu badania.
W przypadku RCT (13 badań) zastosowano narzędzie Cochrane RoB 2.0 (wersja zaktualizowana), oceniając każde badanie w pięciu domenach17: (1) proces randomizacji – generowanie sekwencji i maskowanie alokacji; (2) odchylenia od zamierzonych interwencji – maskowanie uczestników i personelu oraz określenie, czy analiza była przeprowadzona zgodnie z zasadą intencji leczenia (intention-to-treat); (3) brakujące dane dotyczące wyników – kompletność obserwacji i sposób postępowania z osobami, które wypadły z badania; (4) pomiar wyniku – maskowanie osób oceniających wyniki (szczególnie istotne w przypadku samoopisowej jakości życia, gdzie maskowanie jest trudniejsze do osiągnięcia, ale nadal brane pod uwagę); (5) wybór raportowanego wyniku – ryzyko selektywnego raportowania wyników (weryfikowane na podstawie rejestrów badań klinicznych lub opublikowanych protokołów, jeśli były dostępne).
Każda domena została oceniona jako niskie ryzyko, pewne zastrzeżenia lub wysokie ryzyko. Następnie dla każdego badania przypisano ogólną ocenę ryzyka błędu systematycznego: niskie (wszystkie domeny niskie), pewne zastrzeżenia (jedna lub więcej domen z pewnymi zastrzeżeniami) lub wysokie (jakakolwiek domena oceniona jako wysokie ryzyko lub wiele domen z pewnymi zastrzeżeniami). W przypadku wyników raportowanych przez pacjentów, takich jak jakość życia, zaślepienie uczestników jest często niewykonalne; w związku z tym brak zaślepienia uczestników nie skutkował automatycznym przypisaniem oceny wysokiego ryzyka. Zamiast tego brak zaślepienia został wyraźnie odnotowany jako potencjalne źródło błędu wykonania w ocenie domeny 2.
W przypadku nierandomizowanych obserwacyjnych badań kohortowych (2 badania), Budisan i wsp.33 oraz Betea i wsp.34 nie uwzględnili jednoczesnej grupy porównawczej, w związku z czym nie zostały one włączone do ilościowej metaanalizy. W badaniach tych, w celu oceny doboru próby, porównywalności (nie dotyczy ze względu na brak grupy porównawczej) oraz ustalenia wyników, zastosowano skalę Newcastle-Ottawa (NOS) dostosowaną do badań kohortowych. Jednakże z powodu braku ramienia kontrolnego uznano je za obarczone wysokim ryzykiem czynników zakłócających i błędu selekcji w przypadku jakichkolwiek wniosków przyczynowych. Zachowano je wyłącznie do celów opisowych; ich profile ryzyka błędu nie wpływają na zbiorcze szacunki efektu, lecz są udokumentowane w Tabeli 2.
Podsumowanie ryzyka błędu systematycznego
Stworzono zbiorczy schemat ryzyka błędu systematycznego (wykres sygnalizacji świetlnej), prezentujący oceny na poziomie poszczególnych domen dla każdego badania RCT. W skrócie, najczęstsze zastrzeżenia w badaniach RCT dotyczyły: (i) braku zaślepienia uczestników i personelu w odniesieniu do interwencji związanych ze stylem życia (domena 2 – niektóre obawy/wysokie ryzyko w 9 z 13 badań) oraz (ii) niepełne dane dotyczące wyników z powodu utraty uczestników (domena 3 – niektóre zastrzeżenia w 4 badaniach). Żadne badanie nie zostało ocenione jako niskie ryzyko we wszystkich domenach; większość (8/13) wykazała pewne wątpliwości, a 5/13 oceniono wysokie ryzyko ogólnie, głównie ze względu na brak ślepej próby oraz małe wielkości próby, co prowadzi do niskiej precyzji.
Pewność dowodów (GRADE)
Ogólną pewność zbioru dowodów dla każdego z połączonych wyników oceniono przy użyciu metodyka Grading of Recommendations Assessment, Development and Evaluation (GRADE), zgodnie z Podręcznikiem GRADE i przy użyciu oprogramowania GRADEpro GDT. Pewność oceniono jako wysoki, umiarkowany, niski, lub bardzo niski w pięciu obszarach: ryzyka błędu systematycznego, niespójności, pośredniości, nieprecyzyjności oraz błędu publikacji. Oceniare wyniki obejmują (1) jakość życia (QoL) po 6 miesiącach – ogólna onkologia ginekologiczna (połączone MD z 9 badań porównawczych); (2) QoL po 6 miesiącach – rak jajnika (połączona MD z 2 badań porównawczych); (3) jakość życia w 6. miesiącu – rak endometrium (połączona Różnica Średnich z 4 badań porównawczych, w tym nakładających się kohort SUCCEED); (4) jakość życia w 3. miesiącu – ogólna onkologia ginekologiczna (połączone MD z 6 badań porównawczych).
Miara efektu i model meta-analizy
Do ogólnych analiz za okres 6 miesięcy i 3 miesięcy zastosowano modele odwrotnej wariancji z efektami losowymi, ponieważ przewidywano znaczną heterogeniczność kliniczną i metodologiczną między badaniami, w tym różnice w typach nowotworów, komponentach interwencji, jej intensywności, czasie trwania oraz warunkach kontrolnych18. Modele odwrotnej wariancji z efektami stałymi zastosowano w analizach podgrup raka jajnika i endometrium, dla których nie zaobserwowano heterogeniczności statystycznej (I2 = 0%). Heterogeniczność oceniano przy użyciu statystyki I219.
Heterogeniczność została określona ilościowo przy użyciu statystyki I²2 statystyka, w której progi 25%, 50% i 75% reprezentują odpowiednio niską, umiarkowaną i wysoką heterogeniczność. Dodatkowo I2, τ2 zgłoszono dla analiz z efektami losowymi w celu określenia bezwzględnej wielkości wariancji międzybadaniowej. Wszystkie analizy przeprowadzono przy użyciu meta i metafor pakiety w programie R (wersja 4.3.1).
Uzasadnienie łączenia próbek pomimo znacznej heterogeniczności oraz sposób postępowania z heterogenicznością
W przypadku głównej analizy 6-miesięcznej wartość I2 = 71% wskazywała na znaczną heterogeniczność. Uznano, że pooling jest odpowiedni w ramach modelu efektów losowych z następujących powodów: (i) połączona estymacja reprezentuje średni efekt w różnych interwencjach i populacjach, co stanowi zasadne pytanie podsumowujące; (ii) model efektów losowych w sposób jawny włącza wariancję międzybadawczą (τ2) do błędu standardowego, co zmniejsza ryzyko błędnego uzyskania zbyt wąskich przedziałów ufności; (iii) przeprowadzono wcześniej określone analizy podgrup według typu nowotworu (jajnika, błony śluzowej trzonu macicy), aby wyjaśnić kliniczne źródła heterogeniczności; (iv) wykonano analizy wpływu i wrażliwości w celu oceny odporności połączonej estymacji.
Decyzja o łączeniu badań pomimo znacznej heterogeniczności statystycznej była podyktowana następującymi zasadami: interpretacja I2 — wartości I2 wynoszące 25%, 50% i 75% zostały uprzednio określone jako reprezentujące odpowiednio niską, umiarkowaną i wysoką heterogeniczność. Wartość I2 przekraczająca 75% wskazuje na znaczną heterogeniczność, co może sprawić, że łączenie danych będzie niewłaściwe, jeśli heterogeniczność ta nie może zostać w sposób znaczący wyjaśniona czynnikami klinicznymi lub metodologicznymi. Dla głównej ogólnej analizy 6-miesięcznej (I2 = 71%) zaplanowano analizy w podgrupach według rodzaju nowotworu (jajnika, endometrium), aby zbadać kliniczne źródła heterogeniczności. Podział na podgrupy znacznie zredukował I2 do 0% zarówno w podgrupie raka jajnika, jak i endometrium, co sugeruje, że główna część ogólnej heterogeniczności wynika z różnic w typie nowotworu i związanych z nimi celach interwencji. Jednak ze względu na to, że podgrupy te obejmują bardzo niewiele badań, nie można z całą pewnością stwierdzić, że heterogeniczność została w pełni wyjaśniona.
Przystąpienie do łączenia danych uznano za uzasadnione dla ogólnej analizy 6-miesięcznej, ponieważ: (i) pozwala to na uzyskanie średniego efektu podsumowującego dla szerokiego zakresu interwencji, co stanowi dopuszczalne pytanie w analizie metaanalitycznej; (ii) wartość τ2 została wyraźnie podana w celu ilościowego określenia wariancji między badaniami; (iii) przeprowadzono analizy wpływu, aby sprawdzić, czy wyniki nie są determinowane przez wartości odstające; oraz (iv) połączona ocena nie jest traktowana jako rozstrzygająca lub klinicznie wdrożeniowa — jest ona interpretowana jako generująca hipotezy i jest objęta licznymi zastrzeżeniami w dyskusji.
Zgodnie z podręcznikiem Cochrane, gdy I2 przekracza 75%, a analizy podgrup nie wyjaśniają w sposób przekonujący heterogeniczności, oszacowania zbiorcze należy interpretować z najwyższą ostrożnością. Ze względu na niewielką liczbę badań w podgrupach nie można z pewnością stwierdzić, że heterogeniczność została w pełni wyjaśniona. W związku z tym główny szacunek zbiorczy jest przedstawiony przede wszystkim w celach opisowych i eksploracyjnych i nie stanowi podstawy do zaleceń klinicznych. Wszystkie statystyki heterogeniczności (I2, τ2) oraz analizy wrażliwości są raportowane w sposób przejrzysty, co pozwala czytelnikom na ocenę stabilności samych oszacowań.
Analizy podgrup, analizy wrażliwości oraz analizy wpływu
W celu zbadania źródeł heterogeniczności przeprowadzono następujące z góry określone analizy, bez przeprowadzania metaregresji: 1) W ramach analizy podgrup ogólny wynik po 6 miesiącach został rozwarstwiony według typu nowotworu (jajnika, endometrium), aby zbadać, czy efekt różnił się w zależności od lokalizacji guza; 2) Analiza wrażliwości (nakładające się kohorty): Aby ocenić wpływ nakładających się kohort badania SUCCEED (Von Gruenigen i wsp.21 oraz McCarroll i wsp.23), powtórzono analizę podgrupy z nowotworem endometrium, wykluczając badanie McCarroll i wsp.23. 3) Analiza wpływu metodą leave-one-out: Każde badanie usuwano sekwencyjnie, a następnie ponownie obliczano łączną MD oraz I2 dla ogólnego wyniku po 6 miesiącach, aby zidentyfikować, czy pojedyncze badanie w nieproporcjonalny sposób wpływało na wyniki lub heterogeniczność; 4) Porównanie z modelem efektów stałych: Dla kompletności obliczono również szacunki łączone przy użyciu modelu efektów stałych (ważenie odwrotnością wariancji), aby porównać je z wynikami modelu efektów losowych; każda istotna rozbieżność wskazywałaby, że heterogeniczność międzybadaniowa w znaczący sposób wpływa na szacunki.
Nie przeprowadzono meta-regresji w celu zbadania ciągłych współzmiennych (np. wieku, wyjściowej jakości życia, czasu trwania interwencji), ponieważ liczba badań w każdej podgrupie (≤(9 dla ogólnego wyniku po 6 miesiącach) jest niewystarczająca, aby uzyskać wiarygodne współczynniki regresji. Z <przy 10 badaniach na jedną zmienną towarzyszącą meta-regresja ma bardzo niską moc statystyczną i jest podatna na błędy I rodzaju, a dostępne dane dotyczące zmiennych towarzyszących były raportowane niespójnie w różnych badaniach.
Błąd publikacji
Żaden z połączonych wyników nie obejmował 10 lub więcej badań. W związku z tym nie wykonano wykresów lejkowych ani testów regresji Eggera, ponieważ oceny te miałyby zbyt niską moc statystyczną i mogłyby być potencjalnie mylące, biorąc pod uwagę liczbę dostępnych badań.