Criterios de elegibilidad
Los estudios eran elegibles si cumplían todos los siguientes criterios: (1) incluían mujeres con cualquier tipo de malignidad ginecológica; (2) evaluaban una intervención definida sobre el estilo de vida o una intervención dirigida por enfermería; (3) informaban datos cuantitativos sobre la calidad de vida; y (4) eran estudios comparativos (intervención frente a control) o estudios observacionales de trayectoria que proporcionaran datos descriptivos relevantes sobre la calidad de vida; (5) estaban publicados en inglés. . Para el metaanálisis cuantitativo de intervención frente a control, se requería un grupo comparador concurrente12. Dos estudios sin grupo comparador se conservaron únicamente para la síntesis narrativa13. No se aplicaron restricciones geográficas.
Fuentes de información
El proceso completo de selección de estudios se muestra en la Figura 1 como un diagrama de flujo PRISMA. Se realizó una búsqueda en The Cochrane Library, Embase, Google Scholar, OVID y PubMed desde la creación de cada base de datos hasta junio de 2026. Los registros recuperados se importaron a EndNote 20 y se eliminaron los duplicados. Dos revisores evaluaron de forma independiente los títulos y resúmenes, seguido de la evaluación del texto completo de los estudios potencialmente elegibles. Las discrepancias se resolvieron mediante discusión. Solo se consideraron publicaciones en inglés para inclusión, de acuerdo con los criterios de elegibilidad preestablecidos.
Estrategia de búsqueda
La estrategia de búsqueda se desarrolló utilizando el marco PICOS: Población—mujeres con oncología ginecológica; Intervención—intervenciones de estilo de vida o de enfermería; Comparación—atención habitual u otras intervenciones; Resultado—calidad de vida; Diseño del estudio—sin restricciones14. Se utilizó un conjunto exhaustivo de palabras clave y términos de vocabulario controlado en todas las bases de datos; las cadenas detalladas de búsqueda para cada base de datos se proporcionan en Tabla 113.
Proceso de selección
Tras la recuperación del texto completo, dos revisores verificaron de forma independiente que cada informe cumpliera todos los criterios de elegibilidad. Además, revisaron cruzadamente las listas de autores, los nombres de los ensayos (por ejemplo, SUCCEED, WALC, BENITA, TOPCAT‑G), los períodos de reclutamiento y los centros del estudio para identificar cohortes de pacientes superpuestas. Se identificaron y documentaron las cohortes de pacientes potencialmente superpuestas. Cuando los informes superpuestos contribuían al análisis primario, su influencia se evaluó en un análisis de sensibilidad prespecificado que excluía el conjunto de datos superpuesto.
Extracción de datos y medidas de los resultados
Dos revisores extrajeron de forma independiente los datos de los 15 informes incluidos utilizando un formulario estandarizado y previamente probado para la extracción de datos. Las discrepancias se resolvieron por consenso con el autor correspondiente. Para cada estudio, se registró la siguiente información: primer autor, año de publicación, país, diseño del estudio, tipo de cáncer, descripción de la intervención, descripción del comparador, tamaño de la muestra por grupo, edad de los participantes y estadio de la enfermedad, instrumento de calidad de vida (CV), puntos temporales evaluados, y todos los datos numéricos de calidad de vida (medias, medidas de dispersión y tamaños de muestra por brazo)15.
Acumulación cuantitativa (13 estudios comparativos)
Para la metaanalítica de intervención frente al grupo control, se extrajeron las puntuaciones finales posteriores a la intervención (medias y desviaciones estándar) en los puntos temporales preespecificados (3 y 6 meses) para ambos grupos. Cuando un estudio informaba tanto las puntuaciones finales como las de cambio, únicamente se extrajeron las puntuaciones finales16. El enfoque metodológico para la metaanalítica y la evaluación de la calidad de los estudios siguió las directrices establecidas por Cochrane17. La elección del modelo metaanalítico consideró la heterogeneidad clínica y metodológica esperada entre los estudios18, y la heterogeneidad estadística se cuantificó utilizando el estadístico I2, según lo descrito por Higgins et al.19. Los 13 estudios comparativos incluidos en la síntesis cuantitativa se resumen en la Tabla 220,21,22,23,24,25,26,27,28,29,30,31,32.
Medidas de resultados sobre la calidad de vida, alineación y métrica del efecto
Se registró el instrumento específico de calidad de vida utilizado en cada estudio. Las escalas identificadas incluyeron la Evaluación Funcional de la Terapia contra el Cáncer – General (FACT‑G), FACT‑Ovario (FACT‑O), FACT‑Endometrio (FACT‑En), el Cuestionario de Calidad de Vida del Organismo Europeo para la Investigación y el Tratamiento del Cáncer, Módulo Central 30 (EORTC QLQ‑C30), la Forma Breve‑36 (SF‑36) y escalas específicas de la condición. Para todos los instrumentos, puntuaciones más altas indicaron una mejor calidad de vida, y no se incluyeron instrumentos con puntuación invertida. Por lo tanto, todos los datos de calidad de vida extraídos se alinearon a la misma métrica, con una diferencia media (MD) positiva que favoreció consistentemente al grupo de intervención.
Para el metaanálisis principal, se extrajeron las puntuaciones finales posteriores a la intervención en lugar de las puntuaciones de cambio respecto a la línea base. Esta decisión se basó en: (i) no todos los estudios informaron las puntuaciones de cambio ni sus desviaciones estándar; (ii) las puntuaciones finales reflejan el estado absoluto de la calidad de vida (QoL) tras el tratamiento, lo cual es clínicamente significativo; y (iii) el uso de puntuaciones finales maximizó el número de estudios que podían agruparse. Cuando un estudio informaba múltiples subescalas de QoL, se priorizaba como resultado principal la puntuación global de QoL o la puntuación total FACT-G; si no estaba disponible, se utilizaba la subescala de función física, indicando explícitamente esta desviación en una nota al pie de Tabla 2.
La MD cruda se utilizó como medida del efecto en lugar de la diferencia media estandarizada (DME), ya que todos los instrumentos incluidos están validados para medir el mismo constructo subyacente—calidad de vida relacionada con la salud—en escalas conceptualmente similares (los puntajes totales oscilan entre 0–100 o 0–148). La DM es directamente interpretable en las unidades originales de estas escalas y tiene una mayor relevancia clínica que una DMC expresada en unidades de desviación estándar. No se utilizaron estimaciones ajustadas (por ejemplo, medias ajustadas por ANCOVA) porque las covariables de ajuste variaban ampliamente entre los estudios, lo que comprometía la comparabilidad.
Conversiones de desviación estándar
Cuando los estudios informaron errores estándar (EE) o intervalos de confianza del 95 % en lugar de desviaciones estándar, se convirtieron a DE utilizando fórmulas estándar: DE = EE × √n para EE, y DE = √n × (IC superior – IC inferior) / (2 × 1.96) para IC del 95 %. Para los estudios que presentaron medianas con rangos intercuartílicos (RIC), no se imputaron medias ni DE; dichos datos se extrajeron de forma narrativa y no se incluyeron en los cálculos del DM agrupado. No se requirió ninguna imputación de este tipo para los 13 estudios que contribuyeron a la síntesis cuantitativa.
Manejo de datos faltantes
Se extrajeron preferentemente las estimaciones de intención de tratar (ITT) cuando se informaron explícitamente, ya que proporcionan la estimación más conservadora e imparcial del efecto del tratamiento. Cuando no había disponibles datos ITT, se extrajeron los datos por protocolo o de casos completos tal como los reportaron los autores originales. No se imputaron medias, desviaciones estándar (SD) ni valores de resultados faltantes; la ausencia de datos se registró para cada estudio y se tuvo en cuenta en el análisis de sensibilidad. Se anotaron los estudios con desviaciones estándar no reportadas para puntos temporales clave, y se contactó por correo electrónico a los autores correspondientes para solicitar las estadísticas faltantes. Si no se recibió respuesta dentro de las dos semanas, se utilizaron los datos disponibles más conservadores (por ejemplo, la desviación estándar agrupada de la línea base si faltaba la desviación estándar postintervención) o se excluyó el punto temporal específico del agrupamiento.
Brazos de intervención múltiples y controles compartidos
Ningún estudio incluido presentó más de un brazo activo de intervención sobre estilo de vida o cuidados de enfermería comparado con un único grupo control compartido, lo cual habría requerido dividir la muestra control para el análisis. En el único estudio con diseño factorial (McCloy et al.30), los datos se extrajeron del brazo combinado de ejercicio y atención plena, y del brazo control de atención habitual, con el fin de simplificar la agrupación y evitar el recuento duplicado. Para las cohortes solapadas del ensayo SUCCEED (Von Gruenigen et al.21 y McCarroll et al.23), ambos informes se mantuvieron en la tabla de extracción. Para el metaanálisis principal, se incluyeron ambos conjuntos de datos (ya que informaron sobre la calidad de vida en el mismo punto temporal). En un análisis de sensibilidad preespecificado, se excluyó el último informe para evaluar el impacto de la duplicación de cohortes en la estimación agrupada; los resultados se presentan en el texto.
Estudios observacionales no comparativos
Para dos informes (Budisan et al.33 y Betea et al.34), que carecía de un grupo control concurrente, no se extrajeron datos comparativos de intervención frente a control (es decir, no pudo calcularse una DM). En su lugar, se extrajeron datos descriptivos sobre la trayectoria de la calidad de vida (cambios intra-grupo a lo largo del tiempo) y presentados de forma narrativa en el texto y en Tabla 2No se incluyeron en ningún gráfico de bosque ni en ninguna síntesis cuantitativa agrupada.
Evaluación del riesgo de sesgo
Se evaluó el posible sesgo de publicación y otros efectos de estudios pequeños mediante la inspección visual de gráficos en embudo y la prueba de regresión lineal de Egger (que realiza una regresión del efecto estandarizado de la intervención sobre su precisión). Dado que la prueba de Egger tiene un poder estadístico limitado cuando el número de estudios es pequeño (generalmente <10), se estableció previamente que los gráficos en embudo y las pruebas de Egger se realizarían únicamente para metaanálisis que incluyeran 10 o más estudios. Para los resultados con menos de 10 estudios incluidos, no se presentan los gráficos en embudo ni los valores p de Egger, ya que dichas pruebas tienen poca potencia y podrían arrojar resultados engañosos17.
Dos revisores evaluaron de forma independiente la calidad metodológica de los 15 informes incluidos, y las discrepancias se resolvieron mediante discusión con los autores correspondientes. Dado que los estudios incluidos comprendían tanto ensayos controlados aleatorizados (RCTs; n = 13) como estudios de cohorte observacionales no aleatorizados (n = 2; Budisan et al.33; Betea et al.34), se aplicaron herramientas específicas según el diseño.
Para los ECA (13 estudios), se utilizó la herramienta Cochrane RoB 2.0 (versión revisada), evaluando cada estudio en cinco dominios17: (1) Proceso de aleatorización: generación de la secuencia y ocultación de la asignación; (2) Desviaciones respecto a las intervenciones previstas: enmascaramiento de participantes y personal, y si el análisis fue por intención de tratar; (3) Datos ausentes sobre el resultado: completitud del seguimiento y manejo de las pérdidas; (4) Medición del resultado: enmascaramiento de los evaluadores de los resultados (particularmente relevante para la calidad de vida autoinformada, donde el enmascaramiento es menos factible pero aún así considerado); (5) Selección del resultado informado: riesgo de informe selectivo de resultados (verificado frente a registros de ensayos o protocolos publicados cuando estuvieron disponibles).
Cada dominio se calificó como riesgo bajo, algunas preocupaciones o riesgo alto. Luego se asignó un juicio general sobre el riesgo de sesgo para cada estudio: bajo (todos los dominios con riesgo bajo), algunas preocupaciones (uno o más dominios con algunas preocupaciones) o alto (cualquier dominio con riesgo alto o múltiples dominios con algunas preocupaciones). Para resultados autoinformados, como la calidad de vida, a menudo no es factible el enmascaramiento de los participantes; por lo tanto, no se asignó automáticamente un juicio de riesgo alto por falta de enmascaramiento de los participantes. En cambio, la falta de enmascaramiento se indicó explícitamente como una fuente potencial de sesgo de desempeño en la evaluación del dominio 2.
Para estudios de cohorte observacionales no aleatorizados (2 estudios), Budisan et al.33 y Betea et al.34 no incluyeron un grupo comparador concurrente y no se incluyeron en el metaanálisis cuantitativo. Para estos, se utilizó la Escala Newcastle-Ottawa (NOS), adaptada para estudios de cohorte, para evaluar la selección, la comparabilidad (no aplicable debido a la ausencia de un grupo comparador) y la verificación del resultado. Sin embargo, debido a que carecían de un grupo control, se consideró que tenían un alto riesgo de confusión y sesgo de selección en cualquier inferencia causal. Se mantuvieron únicamente con fines descriptivos; sus perfiles de riesgo de sesgo no afectan las estimaciones del efecto agrupado, pero se documentan en Tabla 2.
Resumen del riesgo de sesgo
Se creó una figura resumen del riesgo de sesgo (gráfico de semáforo) que muestra las evaluaciones a nivel de dominio para cada ECA. En resumen, las principales preocupaciones en los ECA fueron: (i) la falta de enmascaramiento de los participantes y del personal respecto a las intervenciones de estilo de vida (dominio 2 – algunas preocupaciones/alto riesgo en 9 de 13 estudios) y (ii) datos de resultado incompletos debido a la deserción (dominio 3 – algunas preocupaciones en 4 estudios). Ningún estudio fue clasificado como de bajo riesgo en todos los dominios; la mayoría (8/13) tuvo algunas preocupaciones, y 5/13 fueron clasificados de alto riesgo en general, principalmente debido a la falta de enmascaramiento y tamaños muestrales pequeños que provocan imprecisión.
Certidumbre de la evidencia (GRADE)
La certeza general del conjunto de evidencia se evaluó para cada resultado agrupado utilizando el marco de Grado de Evaluación de Recomendaciones, Desarrollo y Evaluación (GRADE), siguiendo la Guía GRADE y utilizando el software GRADEpro GDT. La certeza se calificó como alta, moderada, baja o muy baja en cinco dominios: riesgo de sesgo, inconsistencia, indirectividad, imprecisión y sesgo de publicación. Los resultados evaluados incluyen: (1) calidad de vida (QoL) a los 6 meses – oncología ginecológica general (diferencia media agrupada [MD] de 9 estudios comparativos); (2) QoL a los 6 meses – cáncer de ovario (MD agrupada de 2 estudios comparativos); (3) QoL a los 6 meses – cáncer de endometrio (MD agrupada de 4 estudios comparativos, incluyendo cohortes SUCCEED superpuestas); (4) QoL a los 3 meses – oncología ginecológica general (MD agrupada de 6 estudios comparativos).
Medida del efecto y modelo de metanálisis
Se utilizaron modelos de efectos aleatorios por varianza inversa para los análisis generales a los 6 meses y a los 3 meses, ya que se anticipó una heterogeneidad clínica y metodológica sustancial entre los estudios, incluyendo diferencias en los tipos de cáncer, componentes de la intervención, intensidad, duración y condiciones de control18. Se emplearon modelos de efectos fijos por varianza inversa para los análisis de subgrupos de cáncer ovárico y de endometrio, en los cuales no se observó heterogeneidad estadística (I2 = 0%). La heterogeneidad se evaluó utilizando el estadístico I219.
La heterogeneidad se cuantificó utilizando el estadístico I2, con umbrales del 25%, 50% y 75% que representan heterogeneidad baja, moderada y alta, respectivamente. Además del I2, se informó τ2 para los análisis de efectos aleatorios con el fin de cuantificar la magnitud absoluta de la varianza entre estudios. Todos los análisis se realizaron utilizando los paquetes meta y metafor en R (versión 4.3.1).
Justificación para la combinación de datos a pesar de la heterogeneidad sustancial y manejo de la heterogeneidad
Para el análisis primario a los 6 meses, I2 = 71 % indicó una heterogeneidad sustancial. Se consideró apropiado realizar la agrupación bajo el modelo de efectos aleatorios por las siguientes razones: (i) la estimación agrupada representa el efecto promedio en una variedad de intervenciones y poblaciones, lo cual constituye una pregunta de resumen legítima; (ii) el modelo de efectos aleatorios incorpora explícitamente la varianza entre estudios (τ2) en el error estándar, reduciendo el riesgo de intervalos de confianza falsamente estrechos; (iii) se realizaron análisis de subgrupos preespecificados según el tipo de cáncer (ovárico, endometrial) para explicar las fuentes clínicas de heterogeneidad; (iv) se llevaron a cabo análisis de influencia y sensibilidad para evaluar la solidez de la estimación agrupada.
La decisión de agrupar estudios a pesar de la heterogeneidad estadística sustancial se basó en los siguientes principios: interpretación de I2 — se establecieron previamente valores de I2 del 25%, 50% y 75% para representar heterogeneidad baja, moderada y alta, respectivamente. Un valor de I2 superior al 75% indica una heterogeneidad considerable, lo cual podría hacer inapropiada la agrupación si la heterogeneidad no puede explicarse de manera significativa por factores clínicos o metodológicos. Para el análisis general primario a los 6 meses (I2 = 71%), se planificaron previamente análisis por subgrupos según tipo de cáncer (ovárico, endometrial) para explorar fuentes clínicas de heterogeneidad. La división en subgrupos redujo considerablemente la I2 a 0% tanto en los subgrupos de cáncer ovárico como endometrial, lo que sugiere que una parte importante de la heterogeneidad general se debe a diferencias en el tipo de cáncer y a los objetivos terapéuticos asociados. Sin embargo, dado que estos subgrupos incluyen muy pocos estudios, no puede concluirse con fiabilidad que la heterogeneidad esté completamente explicada.
Se consideró justificado proceder con la agrupación de datos para el análisis general a los 6 meses porque: (i) proporciona un efecto promedio resumido a través de una amplia gama de intervenciones, lo cual constituye una pregunta metaanalítica legítima; (ii) se informa explícitamente τ2 para cuantificar la varianza entre estudios; (iii) se realizaron análisis de influencia para verificar resultados impulsados por valores atípicos; y (iv) la estimación agrupada no se considera definitiva ni aplicable clínicamente — se interpreta como generadora de hipótesis y se acompaña de numerosas advertencias en la discusión.
De acuerdo con el Manual Cochrane, cuando la I2 supera el 75 % y los análisis de subgrupos no explican de manera convincente la heterogeneidad, las estimaciones agrupadas deben interpretarse con extrema precaución. Dado el reducido número de estudios en los subgrupos, no puede afirmarse con certeza que la heterogeneidad esté completamente explicada. Por lo tanto, la estimación agrupada principal se presenta principalmente con fines descriptivos y exploratorios, y no constituye la base para recomendaciones clínicas. Todas las estadísticas de heterogeneidad (I2, τ2) y los análisis de sensibilidad se informan de forma transparente, permitiendo a los lectores evaluar por sí mismos la estabilidad de las estimaciones.
Análisis de subgrupos, sensibilidad e influencia
Para explorar las fuentes de heterogeneidad, se realizaron los siguientes análisis preespecificados, sin llevar a cabo una meta-regresión: 1) Para los análisis por subgrupos, el resultado general a los 6 meses se estratificó según el tipo de cáncer (ovárico, endometrial) para examinar si el efecto difería según el sitio tumoral; 2) Análisis de sensibilidad (cohortes superpuestas): para evaluar el impacto de las cohortes superpuestas del ensayo SUCCEED (Von Gruenigen et al.21 y McCarroll et al.23), se repitió el análisis por subgrupos de endometrial excluyendo a McCarroll et al.23. 3) Análisis de influencia eliminando un estudio cada vez: cada estudio se eliminó secuencialmente y se recalculó la DM agrupada y la I2 para el resultado general a los 6 meses, con el fin de identificar si algún estudio individual influía desproporcionadamente en los resultados o en la heterogeneidad; 4) Comparación con el modelo de efectos fijos: por completitud, las estimaciones agrupadas también se calcularon bajo un modelo de efectos fijos (ponderación por varianza inversa) para compararlas con los resultados de efectos aleatorios; cualquier discrepancia sustancial indicaría que la heterogeneidad entre estudios influye significativamente en la estimación.
La meta-regresión no se realizó para explorar covariables continuas (por ejemplo, edad, calidad de vida basal, duración de la intervención) debido al número de estudios por subgrupo (≤9 para el resultado general a los 6 meses) es insuficiente para obtener coeficientes de regresión confiables. Con <10 estudios por covariable, la meta-regresión tiene un poder estadístico muy bajo y es propensa a errores de tipo I, y los datos disponibles de las covariables se informaron de manera inconsistente entre los estudios.
Sesgo de publicación
Ninguno de los resultados combinados incluyó 10 o más estudios. Por lo tanto, no se realizaron gráficos en embudo ni pruebas de regresión de Egger, ya que estas evaluaciones tendrían poca potencia estadística y podrían ser engañosas dada la cantidad de estudios disponibles.