Критерии соответствия
Исследования считались подходящими, если они соответствовали всем следующим критериям: (1) включали женщин с любыми гинекологическими злокачественными новообразованиями; (2) оценивали определенное вмешательство по изменению образа жизни или вмешательство под руководством медсестер; (3) содержали количественные данные о качестве жизни; (4) были либо сравнительными (вмешательство в сравнении с контрольной группой), либо обсервационными исследованиями траекторий, предоставлявшими соответствующие описательные данные о качестве жизни; (5) были опубликованы в Английский. Для проведения количественного метаанализа сравнения группы вмешательства с контрольной группой требовалось наличие параллельной группы сравнения.12Два исследования без контрольной группы были включены только для описательного синтеза.13Географические ограничения не применялись.
Источники информации
Полный процесс отбора исследований представлен на Рисунке 1 в виде блок-схемы PRISMA. Поиск в базах данных The Cochrane Library, Embase, Google Scholar, OVID и PubMed проводился с момента их создания по июнь 2026 года. Полученные записи были импортированы в EndNote 20, после чего дубликаты были удалены. Два рецензента независимо провели скрининг названий и аннотаций, за которым следовала оценка полнотекстовых версий потенциально подходящих исследований. Разногласия разрешались путем обсуждения. В соответствии с заранее определенными критериями приемлемости, для включения рассматривались только публикации на английском языке.
Стратегия поиска
Стратегия поиска была разработана с использованием структуры PICOS: Популяция (Population) — женщины с гинекологическими онкологическими заболеваниями; Вмешательство (Intervention) — вмешательства в образ жизни или сестринский уход; Сравнение (Comparison) — стандартный уход или альтернативные вмешательства; Результат (Outcome) — качество жизни; Дизайн исследования (Study design) — без ограничений14. Во всех базах данных использовался исчерпывающий набор ключевых слов и терминов контролируемого словаря; подробные поисковые запросы для каждой базы данных приведены в Таблице 113.
Процесс отбора
После получения полных текстов два рецензента независимо подтвердили, что каждый отчет соответствует всем критериям приемлемости. Кроме того, они провели перекрестную проверку списков авторов, названий исследований (например, SUCCEED, WALC, BENITA, TOPCAT‑G), периодов набора участников и исследовательских центров для выявления перекрывающихся когорт пациентов. Потенциально перекрывающиеся когорты пациентов были выявлены и задокументированы. В случаях, когда перекрывающиеся отчеты включались в основной анализ, их влияние оценивалось в ходе заранее определенного анализа чувствительности, в котором перекрывающиеся наборы данных исключались.
Извлечение данных и показатели исходов
Два рецензента независимо извлекали данные из всех 15 включенных отчетов, используя стандартизированную, апробированную форму извлечения данных. Разногласия разрешались путем достижения консенсуса с автором, ответственным за переписку. Для каждого исследования регистрировалась следующая информация: первый автор, год публикации, страна, дизайн исследования, тип рака, описание вмешательства, описание группы сравнения, размер выборки в группе, возраст участников и стадия заболевания, инструмент оценки качества жизни (QoL), оцениваемые временные точки и все числовые данные QoL (средние значения, меры рассеяния и размер выборки в каждой группе)15.
Количественный пул (13 сравнительных исследований)
Для проведения метаанализа сравнения группы вмешательства с контрольной группой были извлечены итоговые показатели после вмешательства (средние значения и стандартные отклонения) в заранее определенных временных точках (3 и 6 месяцев) для обеих групп. В случаях, когда в исследовании приводились как итоговые показатели, так и показатели изменения, извлекались только итоговые баллы16. Методологический подход к метаанализу и оценке качества исследований соответствовал установленным рекомендациям Кокрейновского сотрудничества (Cochrane guidance)17. При выборе модели метаанализа учитывалась ожидаемая клиническая и методологическая неоднородность исследований18, а статистическая неоднородность количественно оценивалась с помощью статистики I2 согласно описанию Хиггинса и соавт. (Higgins et al.)19. 13 сравнительных исследований, включенных в количественный синтез, обобщены в таблице 220,21,22,23,24,25,26,27,28,29,30,31,32.
Показатели качества жизни, согласованность и метрика эффекта
Был зафиксирован конкретный инструмент оценки качества жизни (QoL), использованный в каждом исследовании. Выявленные шкалы включали функциональную оценку терапии рака – общую (FACT‑G), FACT‑Ovarian (FACT‑O), FACT‑Endometrial (FACT‑En), основной опросник качества жизни Европейской организации по исследованию и лечению рака из 30 пунктов (EORTC QLQ‑C30), краткий опросник SF‑36 (SF‑36) и специфические для данного заболевания шкалы. Для всех инструментов более высокие баллы указывали на лучшее качество жизни; инструменты с обратной шкалой оценивания не использовались. Таким образом, все извлеченные данные о качестве жизни были приведены к единой метрике, при которой положительная средняя разность (MD) последовательно указывала на преимущество группы вмешательства.
Для основного метаанализа извлекались итоговые показатели после вмешательства, а не показатели изменения относительно исходного уровня. Данное решение было обусловлено тем, что: (i) не во всех исследованиях сообщалось о показателях изменения или их стандартных отклонениях; (ii) итоговые показатели отражают абсолютный статус QoL после лечения, что имеет клиническое значение; и (iii) использование итоговых показателей позволило максимально увеличить количество исследований, которые можно было объединить. В случаях, когда в исследовании приводились данные по нескольким субшкалам QoL, в качестве основного исхода приоритет отдавался глобальному показателю QoL или общему баллу FACT-G; при их отсутствии использовалась субшкала физического функционирования, что было эксплицитно указано в примечании к Таблице 2.
В качестве показателя эффекта использовалась необработанная средняя разность (MD), а не стандартизированная средняя разность (SMD), поскольку все включенные инструменты валидированы для измерения одного и того же базового конструкта—качества жизни, связанного со здоровьем—по концептуально схожим шкалам (общие баллы варьируются от 0–100 или 0–148). MD напрямую интерпретируется в исходных единицах этих шкал и является более клинически значимой, чем SMD, выраженная в единицах стандартного отклонения. Скорректированные оценки (например, средние значения, скорректированные с помощью ANCOVA) не использовались, так как ковариаты коррекции сильно различались в разных исследованиях, что нарушало сопоставимость.
Преобразование стандартного отклонения
В случаях, когда в исследованиях приводились стандартные ошибки (SE) или 95% доверительные интервалы вместо стандартных отклонений, они были пересчитаны в SD с использованием стандартных формул: SD = SE × √n для SE и SD = √n × (верхняя граница CI – нижняя граница CI) / (2 × 1.96) для 95% CI. Для исследований, в которых представлены медианы с межквартильным размахом (IQR), средние значения или SD не импутировались; такие данные извлекались в описательном виде и не включались в расчеты объединенного MD. Подобная импутация не потребовалась для 13 исследований, вошедших в количественный синтез.
Обработка пропущенных данных
При наличии явных данных предпочтение отдавалось оценкам по принципу «назначенного лечения» (ITT), так как они обеспечивают наиболее консервативную и несмещенную оценку эффекта лечения. В случаях отсутствия данных ITT извлекались данные по протоколу (per-protocol) или данные по завершившим исследование пациентам (complete-case), как они были представлены авторами оригинальных работ. Пропущенные значения средних, SD или показатели исходов не восстанавливались с помощью импутации; факт отсутствия данных фиксировался для каждого исследования и учитывался при проведении анализа чувствительности. Исследования с неуказанными значениями SD для ключевых временных точек были отмечены, и с соответствующими авторами была установлена связь по электронной почте для запроса недостающих статистических данных. Если ответ не был получен в течение двух недель, использовались наиболее консервативные доступные данные (например, объединенное значение SD на исходном уровне, если отсутствовало значение SD после вмешательства) либо конкретная временная точка исключалась из объединения данных.
Несколько групп вмешательства и общие группы контроля
Ни в одном из включенных исследований не было представлено более одного варианта активного вмешательства (изменение образа жизни/сестринский уход) по сравнению с одной общей контрольной группой, что потребовало бы разделения контрольной выборки для анализа. В одном исследовании с факториальным дизайном (McCloy et al.30) данные были извлечены из объединенной группы упражнений и осознанности и контрольной группы обычного ухода для упрощения объединения данных и предотвращения двойного учета. Для перекрывающихся когорт исследования SUCCEED (Von Gruenigen et al.21 и McCarroll et al.23) в таблице извлечения данных были сохранены оба отчета. Для основного метаанализа были включены оба набора данных (так как в них сообщалось о качестве жизни в один и тот же момент времени). В заранее определенном анализе чувствительности последний отчет был исключен для оценки влияния дублирования когорт на объединенную оценку; результаты представлены в тексте.
Несравнительные обсервационные исследования
Для двух отчетов (Budisan et al.33 и Betea et al.34), в которых отсутствовала параллельная контрольная группа, сравнительные данные «вмешательство против контроля» не извлекались (т. е. расчет MD был невозможен). Вместо этого были извлечены описательные данные о траектории QoL (внутригрупповые изменения с течением времени), которые представлены в текстовом виде и в Таблице 2. Эти данные не были включены ни в одну форест-диаграмму или объединенный количественный синтез.
Оценка риска систематической ошибки
Потенциальная систематическая ошибка публикации и другие эффекты малых исследований оценивали с помощью визуального анализа воронкообразных графиков и линейного регрессионного теста Эггера (который регрессирует стандартизированный эффект вмешательства по его точности). Поскольку тест Эггера обладает ограниченной статистической мощностью при малом количестве исследований (обычно <10), воронкообразные графики и тесты Эггера были определены заранее и проводились только для метаанализов, включающих 10 или более исследований. Для показателей, в которых участвовало менее 10 исследований, воронкообразные графики и значения p теста Эггера не приводятся, так как такие тесты недостаточно мощны и могут дать вводящие в заблуждение результаты17.
Два рецензента независимо оценили методологическое качество 15 включенных отчетов, а разногласия разрешались путем обсуждения с соответствующими авторами. Поскольку в число включенных исследований вошли как рандомизированные контролируемые испытания (РКИ; n = 13), так и нерандомизированные обсервационные когортные исследования (n = 2; Budisan et al.33; Betea et al.34), применялись инструменты оценки, специфичные для каждого типа дизайна.
Для РКИ (13 исследований) использовался инструмент Cochrane RoB 2.0 (пересмотренная версия), оценивающий каждое исследование по пяти доменам17: (1) процесс рандомизации — генерация последовательности и скрытие распределения; (2) отклонения от запланированных вмешательств — ослепление участников и персонала, а также проведение анализа исходя из назначенного лечения (intention-to-treat); (3) отсутствие данных об исходах — полнота последующего наблюдения и обработка случаев выбывания участников; (4) измерение исхода — ослепление лиц, оценивающих результаты (особенно актуально для показателей качества жизни, оцениваемых самостоятельно, где ослепление менее осуществимо, но все равно учитывается); (5) выбор сообщаемого результата — риск селективного сообщения об исходах (проверялся по реестрам клинических исследований или опубликованным протоколам, если таковые имелись).
Каждый домен оценивался как имеющий низкий риск, вызывающий некоторые опасения или высокий риск. Затем для каждого исследования выносилось общее суждение о риске систематической ошибки: низкий (все домены с низким риском), некоторые опасения (один или несколько доменов с некоторыми опасениями) или высокий (любой домен с высоким риском или несколько доменов с некоторыми опасениями). Для результатов, сообщаемых самими пациентами, таких как качество жизни, ослепление участников часто неосуществимо; поэтому отсутствие ослепления участников не приводило к автоматическому присвоению высокого риска. Вместо этого отсутствие ослепления было четко отмечено как потенциальный источник ошибки исполнения при оценке домена 2.
Для нерандомизированных обсервационных когортных исследований (2 исследования) Budisan et al.33 и Betea et al.34 одновременная группа сравнения отсутствовала, поэтому они не были включены в количественный метаанализ. Для их оценки использовалась шкала Ньюкасла-Оттавы (NOS), адаптированная для когортных исследований, для анализа отбора, сопоставимости (неприменимо из-за отсутствия группы сравнения) и достоверности исходов. Однако из-за отсутствия контрольной группы данные исследования были признаны имеющими высокий риск смешивания и систематической ошибки отбора при любом выводе о причинно-следственной связи. Они были оставлены только для описательных целей; их профили риска систематической ошибки не влияют на объединенные оценки эффекта, но они задокументированы в Таблице 2.
Резюме риска систематической ошибки
Был создан сводный рисунок риска систематической ошибки (график «светофор»), отображающий оценки по каждому домену для каждого РКИ. Вкратце, наиболее распространенными проблемами в РКИ были: (i) отсутствие ослепления участников и персонала в отношении модификаций образа жизни (домен 2 – некоторые опасения/высокий риск в 9 из 13 исследований) и (ii) неполные данные об исходах из-за выбывания участников (домен 3 – некоторые опасения в 4 исследованиях). Ни одно исследование не было оценено как имеющее низкий риск по всем доменам; большинство (8/13) имели некоторые опасения, а 5/13 были оценены как имеющие высокий риск в целом, главным образом из-за отсутствия ослепления и малых размеров выборки, что привело к неточности данных.
Достоверность доказательств (GRADE)
Общая степень достоверности совокупности доказательств для каждого объединенного результата оценивалась с помощью системы Grading of Recommendations Assessment, Development and Evaluation (GRADE) в соответствии с руководством GRADE и с использованием программного обеспечения GRADEpro GDT. Достоверность оценивалась как высокая, умеренная, низкая или очень низкая по пяти доменам: риск систематической ошибки, несогласованность, косвенность, неточность и систематическая ошибка публикации. Оцениваемые результаты включали (1) качество жизни (QoL) через 6 месяцев – общая гинекологическая онкология (объединенная MD по 9 сравнительным исследованиям); (2) QoL через 6 месяцев – рак яичников (объединенная MD по 2 сравнительным исследованиям); (3) QoL через 6 месяцев – рак эндометрия (объединенная MD по 4 сравнительным исследованиям, включая перекрывающиеся когорты SUCCEED); (4) QoL через 3 месяца – общая гинекологическая онкология (объединенная MD по 6 сравнительным исследованиям).
Показатель эффекта и модель метаанализа
Для общего анализа за 6 и 3 месяца использовались модели обратной дисперсии со случайными эффектами, поскольку ожидалась значительная клиническая и методологическая гетерогенность между исследованиями, включая различия в типах рака, компонентах вмешательства, его интенсивности, продолжительности и условиях контрольных групп18. Для анализа подгрупп с раком яичников и эндометрия, в которых статистическая гетерогенность не наблюдалась (I2 = 0%), использовались модели обратной дисперсии с фиксированным эффектом. Гетерогенность оценивали с помощью статистики I219.
Гетерогенность оценивали с помощью статистики I2, при этом пороговые значения 25%, 50% и 75% соответствовали низкой, умеренной и высокой гетерогенности соответственно. В дополнение к I2, для анализа с использованием модели случайных эффектов приводили значение τ2 для количественной оценки абсолютной величины межгрупповой вариативности исследований. Все анализы проводились с использованием пакетов meta и metafor в среде R (версия 4.3.1).
Обоснование объединения образцов, несмотря на значительную неоднородность, и способы учета этой неоднородности
При основном анализе через 6 месяцев показатель I2 = 71% указывал на существенную неоднородность. Объединение данных было признано целесообразным с использованием модели случайных эффектов по следующим причинам: (i) объединенная оценка представляет собой средний эффект для ряда вмешательств и популяций, что является обоснованным обобщающим вопросом; (ii) модель случайных эффектов эксплицитно включает межгрупповую дисперсию (τ2) в стандартную ошибку, что снижает риск получения ложно узких доверительных интервалов; (iii) для объяснения клинических источников неоднородности был проведен заранее определенный анализ в подгруппах по типу рака (яичников, эндометрия); (iv) для оценки надежности объединенной оценки был проведен анализ влияния и анализ чувствительности.
Решение об объединении данных исследований, несмотря на существенную статистическую неоднородность, основывалось на следующих принципах: интерпретация I2 — значения I2 25%, 50% и 75% были заранее определены как низкая, умеренная и высокая неоднородность соответственно. Значение I2, превышающее 75%, указывает на значительную неоднородность, что может сделать объединение данных нецелесообразным, если эта неоднородность не может быть обоснованно объяснена клиническими или методологическими факторами. Для основного общего анализа за 6 месяцев (I2 = 71%) были заранее определены анализы в подгруппах по типу рака (яичников, эндометрия) с целью изучения клинических источников неоднородности. Разделение на подгруппы существенно снизило I2 до 0% как в группе рака яичников, так и в группе рака эндометрия, что свидетельствует о том, что значительная часть общей неоднородности обусловлена различиями в типе рака и соответствующих мишенях вмешательства. Однако, поскольку в эти подгруппы входит очень мало исследований, нельзя с уверенностью заключить, что неоднородность объяснена полностью.
Объединение данных было признано оправданным для общего 6-месячного анализа, так как: (i) оно позволяет получить усредненный эффект по широкому спектру вмешательств, что является законным вопросом метаанализа; (ii) значение τ2 приводится отдельно для количественной оценки межгрупповой дисперсии; (iii) был проведен анализ влияния для проверки результатов на наличие выбросов; и (iv) объединенная оценка не рассматривается как окончательная или имеющая клиническое значение — она интерпретируется как способ выдвижения гипотез и сопровождается множеством оговорок в разделе обсуждения.
В соответствии с руководством Cochrane Handbook, если I2 превышает 75%, а анализ в подгруппах не дает убедительного объяснения гетерогенности, объединенные оценки следует интерпретировать с крайней осторожностью. Ввиду малого количества исследований в подгруппах нельзя с уверенностью утверждать, что гетерогенность полностью объяснена. Таким образом, основная объединенная оценка представлена преимущественно в описательных и поисковых целях и не служит основанием для клинических рекомендаций. Все показатели гетерогенности (I2, τ2) и результаты анализа чувствительности представлены прозрачно, что позволяет читателям самостоятельно оценить стабильность полученных оценок.
Анализы подгрупп, чувствительности и влияния
Для изучения источников неоднородности были проведены следующие заранее определенные анализы без проведения метарегрессии: 1) Для анализа в подгруппах общий результат через 6 месяцев был стратифицирован по типу рака (яичников, эндометрия), чтобы проверить, зависел ли эффект от локализации опухоли; 2) Анализ чувствительности (перекрывающиеся когорты): чтобы оценить влияние перекрывающихся когорт исследования SUCCEED (Von Gruenigen et al.21 и McCarroll et al.23), анализ подгруппы с раком эндометрия был повторен с исключением данных McCarroll et al.23. 3) Анализ влияния методом исключения по одному исследованию (leave-one-out): каждое исследование последовательно исключалось, и суммарные MD и I2 пересчитывались для общего результата через 6 месяцев, чтобы определить, не оказывало ли какое-либо одно исследование несоразмерного влияния на результаты или неоднородность; 4) Сравнение с моделью с фиксированным эффектом: для полноты данных суммарные оценки также были рассчитаны с использованием модели с фиксированным эффектом (взвешивание по обратной дисперсии) для сравнения с результатами модели со случайными эффектами; любое существенное расхождение указывало бы на то, что межгрупповая неоднородность значительно влияет на оценку.
Метарегрессионный анализ не проводился для изучения непрерывных ковариат (например, возраста, исходного качества жизни, продолжительности вмешательства), так как количество исследований в каждой подгруппе (≤9 для общего результата через 6 месяцев) недостаточно для получения надежных коэффициентов регрессии. С <при наличии менее 10 исследований на одну ковариату метарегрессионный анализ обладает крайне низкой статистической мощностью и подвержен ошибкам I рода, кроме того, имеющиеся данные по ковариатам были представлены в исследованиях неоднородно.
Систематическая ошибка публикации
Ни один из совокупных результатов не включал 10 или более исследований. Следовательно, построение воронообразных графиков и проведение регрессионных тестов Эггера не осуществлялись, так как при имеющемся количестве исследований данные методы анализа обладали бы недостаточной статистической мощностью и могли привести к ошибочным выводам.