Critérios de elegibilidade
Os estudos foram considerados elegíveis se atendessem a todos os seguintes critérios: (1) incluíram mulheres com qualquer malignidade ginecológica; (2) avaliaram uma intervenção definida de estilo de vida ou uma intervenção conduzida por enfermagem; (3) relataram dados quantitativos sobre qualidade de vida; e (4) eram estudos comparativos (intervenção versus controle) ou estudos observacionais de trajetória que fornecessem dados descritivos relevantes sobre qualidade de vida; (5) foram publicados em inglês. . Para a meta-análise quantitativa de intervenção versus controle, era necessário um grupo comparador concorrente12. Dois estudos sem grupo comparador foram mantidos apenas para síntese narrativa13. Nenhuma restrição geográfica foi aplicada.
Fontes de informação
O processo completo de seleção de estudos é apresentado na Figura 1 como um diagrama de fluxo PRISMA. A Biblioteca Cochrane, o Embase, o Google Acadêmico, o OVID e o PubMed foram pesquisados desde a criação dos bancos de dados até junho de 2026. Os registros recuperados foram importados para o EndNote 20 e os registros duplicados foram removidos. Dois revisores analisaram independentemente os títulos e resumos, seguidos da avaliação em texto completo dos estudos potencialmente elegíveis. Os desacordos foram resolvidos por meio de discussão. Apenas publicações em língua inglesa foram consideradas para inclusão, conforme os critérios de elegibilidade previamente especificados.
Estratégia de busca
A estratégia de busca foi desenvolvida utilizando o framework PICOS: População—mulheres com oncologia ginecológica; Intervenção—intervenções de estilo de vida ou de enfermagem; Comparação—atenção habitual ou intervenções alternativas; Desfecho—qualidade de vida; Desenho do estudo—sem restrições14. Um conjunto abrangente de palavras-chave e termos de vocabulário controlado foi utilizado em todas as bases de dados; as cadeias detalhadas de busca para cada base de dados estão apresentadas na Tabela 113.
Processo de seleção
Após a recuperação do texto completo, dois revisores verificaram independentemente se cada relatório atendia a todos os critérios de elegibilidade. Além disso, eles cruzaram as listas de autores, nomes dos ensaios (por exemplo, SUCCEED, WALC, BENITA, TOPCAT‑G), períodos de recrutamento e centros de estudo para identificar coortes de pacientes sobrepostos. Coortes de pacientes potencialmente sobrepostos foram identificados e documentados. Quando relatórios sobrepostos contribuíram para a análise primária, sua influência foi avaliada em uma análise de sensibilidade previamente especificada que excluiu o conjunto de dados sobreposto.
Extração de dados e medidas de desfecho
Dois revisores extraíram independentemente os dados dos 15 relatórios incluídos utilizando um formulário padronizado e testado de extração de dados. As discordâncias foram resolvidas por consenso com o autor correspondente. Para cada estudo, as seguintes informações foram registradas: primeiro autor, ano de publicação, país, delineamento do estudo, tipo de câncer, descrição da intervenção, descrição do comparador, tamanho da amostra por grupo, idade dos participantes e estágio da doença, instrumento de qualidade de vida (QV), pontos temporais avaliados e todos os dados numéricos de QV (médias, medidas de dispersão e tamanhos de amostra por braço)15.
Pool quantitativo (13 estudos comparativos)
Para a meta-análise de intervenção versus controle, as pontuações finais pós-intervenção (médias e desvios padrão) foram extraídas nos pontos de tempo previamente especificados (3 e 6 meses) para ambos os grupos. Quando um estudo relatou tanto as pontuações finais quanto as de mudança, somente as pontuações finais foram extraídas16. A abordagem metodológica para a meta-análise e a avaliação da qualidade dos estudos seguiram as orientações estabelecidas do Cochrane17. A escolha do modelo meta-analítico considerou a heterogeneidade clínica e metodológica esperada entre os estudos18, e a heterogeneidade estatística foi quantificada utilizando a estatística I2, conforme descrito por Higgins et al.19. Os 13 estudos comparativos incluídos na síntese quantitativa são resumidos na Tabela 220,21,22,23,24,25,26,27,28,29,30,31,32.
Medidas de desfecho de qualidade de vida, alinhamento e métrica de efeito
O instrumento específico de QV utilizado em cada estudo foi registrado. As escalas identificadas incluíram o Assessment Funcional da Terapia do Câncer – Geral (FACT‑G), FACT‑Ovariano (FACT‑O), FACT‑Endometrial (FACT‑En), o Questionário de Qualidade de Vida da Organização Europeia para Pesquisa e Tratamento do Câncer, Módulo Básico 30 (EORTC QLQ‑C30), o Formulário Breve‑36 (SF‑36) e escalas específicas da condição. Para todos os instrumentos, escores mais altos indicavam melhor qualidade de vida, e nenhum instrumento com pontuação invertida foi incluído. Todos os dados de QV extraídos foram, portanto, alinhados à mesma métrica, com uma diferença média (DM) positiva favorecendo consistentemente o grupo de intervenção.
Para a meta-análise primária, foram extraídas as pontuações finais pós-intervenção, em vez das pontuações de mudança em relação à linha de base. Essa decisão foi baseada em: (i) nem todos os estudos relataram as pontuações de mudança ou seus desvios padrão; (ii) as pontuações finais refletem o estado absoluto de qualidade de vida (QoL) após o tratamento, o que é clinicamente relevante; e (iii) o uso das pontuações finais maximizou o número de estudos que poderiam ser agrupados. Quando um estudo relatou múltiplas subescalas de QoL, a pontuação global de QoL ou a pontuação total FACT-G foi priorizada como desfecho primário; se indisponível, foi utilizada a subescala de função física, com esse desvio explicitamente indicado em nota de rodapé na Tabela 2.
A diferença média bruta foi utilizada como medida de efeito em vez da diferença média padronizada (DMP), porque todos os instrumentos incluídos são validados para medir o mesmo constructo subjacente—qualidade de vida relacionada à saúde—em escalas conceitualmente semelhantes (pontuações totais variam de 0 a–100 ou 0–148). A DM é diretamente interpretável nas unidades originais dessas escalas e é mais clinicamente significativa do que uma DPM expressa em unidades de desvio padrão. Estimativas ajustadas (por exemplo, médias ajustadas por ANCOVA) não foram utilizadas porque as covariáveis de ajuste variavam amplamente entre os estudos, comprometendo a comparabilidade.
Conversões de desvio padrão
Quando os estudos relataram erros padrão (EPs) ou intervalos de confiança de 95% em vez de desvios padrão, foram convertidos para DP usando fórmulas padrão: DP = EP × √n para EPs, e DP = √n × (IC superior – IC inferior) / (2 × 1,96) para ICs de 95%. Para estudos que apresentaram medianas com intervalos interquartis (IIQ), as médias ou DPs não foram imputadas; esses dados foram extraídos de forma descritiva e não foram incluídos nos cálculos do DM agrupado. Nenhuma imputação foi necessária para os 13 estudos que contribuíram para a síntese quantitativa.
Tratamento de dados ausentes
As estimativas de intenção-de-tratar (ITT) foram extraídas preferencialmente quando explicitamente relatadas, pois fornecem a estimativa mais conservadora e imparcial do efeito do tratamento. Quando os dados de ITT não estavam disponíveis, foram extraídos os dados por protocolo ou de casos completos, conforme relatado pelos autores originais. Médias, desvios padrão (SD) ou valores de desfecho ausentes não foram imputados; a ausência foi registrada para cada estudo e considerada na análise de sensibilidade. Os estudos com desvios padrão não informados para pontos temporais-chave foram anotados, e os autores correspondentes foram contatados por e-mail para solicitar as estatísticas faltantes. Caso nenhuma resposta fosse recebida em até duas semanas, os dados disponíveis mais conservadores foram utilizados (por exemplo, desvio padrão basal agrupado, caso o desvio padrão pós-intervenção estivesse ausente) ou o ponto temporal específico foi excluído da análise agrupada.
Vários braços de intervenção e controles compartilhados
Nenhum estudo incluído apresentou mais de um braço ativo de intervenção de estilo de vida/enfermagem comparado a um único grupo controle compartilhado, o que teria exigido dividir a amostra controle para análise. No único estudo com desenho fatorial (McCloy et al.30), os dados foram extraídos do braço combinado de exercício e atenção plena e do braço controle de cuidado habitual para simplificar a agregação e evitar contagem dupla. Para as coortes sobrepostas do ensaio SUCCEED (Von Gruenigen et al.21 e McCarroll et al.23), ambos os relatórios foram mantidos na tabela de extração. Para a meta-análise principal, ambos os conjuntos de dados foram incluídos (já que relataram qualidade de vida no mesmo ponto temporal). Em uma análise de sensibilidade previamente especificada, o último relatório foi excluído para avaliar o impacto da duplicação da coorte na estimativa agrupada; os resultados são relatados no texto.
Estudos observacionais não comparativos
Para dois relatos (Budisan et al.33 e Betea et al.34), que não possuía um grupo controle contemporâneo, os dados comparativos de intervenção versus controle não foram extraídos (ou seja, nenhuma DM pôde ser calculada). Em vez disso, foram extraídos dados descritivos sobre a trajetória da QV (mudanças intra-grupo ao longo do tempo) e apresentados de forma narrativa no texto e em Tabela 2Eles não foram incluídos em nenhum gráfico florestal ou síntese quantitativa agrupada.
Avaliação do risco de viés
A possível existência de viés de publicação e outros efeitos de estudos pequenos foi avaliada por meio da inspeção visual de gráficos em funil e do teste de regressão linear de Egger (que realiza a regressão do efeito padronizado da intervenção sobre sua precisão). Como o teste de Egger possui poder estatístico limitado quando o número de estudos é pequeno (geralmente <10), os gráficos em funil e os testes de Egger foram pré-especificados e seriam realizados apenas para metanálises compostas por 10 ou mais estudos. Para desfechos com menos de 10 estudos contribuintes, os gráficos em funil e os valores-p de Egger não são relatados, pois tais testes têm baixo poder e podem gerar resultados enganosos17.
Dois revisores avaliaram independentemente a qualidade metodológica dos 15 relatórios incluídos, e as discordâncias foram resolvidas por meio de discussão com os autores correspondentes. Como os estudos incluídos compreendiam ensaios controlados randomizados (ECRs; n = 13) e estudos de coorte observacionais não randomizados (n = 2; Budisan et al.33; Betea et al.34), foram utilizadas ferramentas específicas para cada delineamento.
Para os ECRs (13 estudos), foi utilizada a ferramenta Cochrane RoB 2.0 (versão revisada), avaliando cada estudo em cinco domínios17: (1) Processo de randomização — geração da sequência e ocultação da alocação; (2) Desvios das intervenções planejadas — cegamento de participantes e equipe, e se a análise foi por intenção de tratar; (3) Dados ausentes de desfecho — completude do acompanhamento e tratamento dos desistentes; (4) Medição do desfecho — cegamento dos avaliadores dos desfechos (particularmente relevante para a qualidade de vida autorrelatada, em que o cegamento é menos viável, mas ainda considerado); (5) Seleção do resultado relatado — risco de relato seletivo de desfechos (verificado mediante registros de ensaios ou protocolos publicados, quando disponíveis).
Cada domínio foi classificado como risco baixo, algumas preocupações ou risco alto. Em seguida, foi atribuída uma avaliação geral de risco de viés para cada estudo: baixo (todos os domínios com risco baixo), algumas preocupações (um ou mais domínios com algumas preocupações) ou alto (qualquer domínio classificado como risco alto ou múltiplos domínios com algumas preocupações). Para desfechos autorrelatados, como qualidade de vida, o mascaramento dos participantes frequentemente é inviável; portanto, uma classificação de risco alto não foi automaticamente atribuída pela ausência de mascaramento dos participantes. Em vez disso, a falta de mascaramento foi explicitamente indicada como uma possível fonte de viés de desempenho na avaliação do domínio 2.
Para estudos de coorte observacionais não randomizados (2 estudos), Budisan et al.33 e Betea et al.34 não incluíram um grupo comparador contemporâneo e não foram agrupados na meta-análise quantitativa. Para esses estudos, foi utilizada a Escala de Newcastle-Ottawa (NOS), adaptada para estudos de coorte, para avaliar seleção, comparabilidade (não aplicável devido à ausência de um comparador) e verificação do desfecho. No entanto, por não possuírem um braço de controle, foram considerados com alto risco de confusão e viés de seleção em qualquer inferência causal. Foram mantidos apenas para fins descritivos; seus perfis de risco de viés não afetam as estimativas do efeito agrupado, mas estão documentados na Tabela 2.
Resumo do risco de viés
Foi criada uma figura de resumo do risco de viés (gráfico de semáforo), exibindo julgamentos em nível de domínio para cada ECR. Em resumo, as principais preocupações nas ECRs foram: (i) ausência de cegamento de participantes e equipe em relação às intervenções de estilo de vida (domínio 2 – algumas preocupações/risco alto em 9 dos 13 estudos) e (ii) dados de desfecho incompletos devido à perda de participantes (domínio 3 – algumas preocupações em 4 estudos). Nenhum estudo foi classificado como de baixo risco em todos os domínios; a maioria (8/13) apresentou algumas preocupações, e 5/13 foram classificados alto risco global, principalmente devido à falta de cegamento e tamanhos amostrais pequenos que levaram à imprecisão.
Certeza das evidências (GRADE)
A certeza geral do conjunto de evidências foi avaliada para cada resultado agrupado utilizando a estrutura Grading of Recommendations Assessment, Development and Evaluation (GRADE), seguindo o Manual GRADE e utilizando o software GRADEpro GDT. A certeza foi classificada como alta, moderada, baixa ou muito baixa em cinco domínios: risco de viés, inconsistência, indirecção, imprecisão e viés de publicação. Os resultados avaliados incluem (1) QV aos 6 meses – Oncologia Ginecológica geral (DM agrupado de 9 estudos comparativos); (2) QV aos 6 meses – câncer de ovário (DM agrupado de 2 estudos comparativos); (3) QV aos 6 meses – câncer de endométrio (DM agrupado de 4 estudos comparativos, incluindo coortes SUCCEED sobrepostas); (4) QV aos 3 meses – Oncologia Ginecológica geral (DM agrupado de 6 estudos comparativos).
Medida de efeito e modelo de metanálise
Modelos de efeitos aleatórios com variância inversa foram utilizados para as análises gerais de 6 e 3 meses, pois foi antecipada heterogeneidade clínica e metodológica substancial entre os estudos, incluindo diferenças nos tipos de câncer, componentes da intervenção, intensidade, duração e condições de controle18. Modelos de efeitos fixos com variância inversa foram utilizados nas análises de subgrupos de câncer de ovário e endometrial, para os quais nenhuma heterogeneidade estatística foi observada (I2 = 0%). A heterogeneidade foi avaliada utilizando a estatística I219.
A heterogeneidade foi quantificada utilizando a estatística I2, com limiares de 25%, 50% e 75% representando baixa, moderada e alta heterogeneidade, respectivamente. Além do I2, o τ2 foi relatado nas análises de efeitos aleatórios para quantificar a magnitude absoluta da variância entre estudos. Todas as análises foram realizadas utilizando os pacotes meta e metafor no R (versão 4.3.1).
Justificativa para a combinação de dados apesar da heterogeneidade substancial e tratamento da heterogeneidade
Para a análise primária de 6 meses, I2 = 71% indicou heterogeneidade substancial. A agregação foi considerada apropriada segundo o modelo de efeitos aleatórios pelos seguintes motivos: (i) a estimativa agregada representa o média dos efeitos em uma variedade de intervenções e populações, o que constitui uma questão legítima de resumo; (ii) o modelo de efeitos aleatórios incorpora explicitamente a variância entre estudos (τ2) no erro padrão, reduzindo o risco de intervalos de confiança incorretamente estreitos; (iii) análises prescritas de subgrupos foram realizadas por tipo de câncer (ovariano, endometrial) para explicar as fontes clínicas de heterogeneidade; (iv) análises de influência e sensibilidade foram conduzidas para avaliar a robustez da estimativa agregada.
A decisão de agrupar estudos apesar da heterogeneidade estatística substancial foi orientada pelos seguintes princípios: interpretação de I2 — valores de I2 de 25%, 50% e 75% foram previamente definidos para representar baixa, moderada e alta heterogeneidade, respectivamente. Um valor de I2 superior a 75% indica heterogeneidade considerável, o que pode tornar o agrupamento inadequado se a heterogeneidade não puder ser explicada de forma significativa por fatores clínicos ou metodológicos. Para a análise geral primária em 6 meses (I2 = 71%), análises de subgrupos por tipo de câncer (ovariano, endometrial) foram previamente definidas para explorar fontes clínicas de heterogeneidade. A subdivisão reduziu substancialmente o valor de I2 para 0% tanto no subgrupo ovariano quanto no endometrial, sugerindo que grande parte da heterogeneidade geral é atribuível a diferenças no tipo de câncer e aos alvos terapêuticos associados. No entanto, como esses subgrupos contêm muito poucos estudos, não é possível concluir com confiabilidade que a heterogeneidade tenha sido totalmente explicada.
Prosseguir com a análise de agrupamento foi considerado justificado para a análise geral de 6 meses porque: (i) ela fornece um efeito médio resumido ao longo de uma ampla gama de intervenções, o que constitui uma questão meta-analítica legítima; (ii) τ2 é explicitamente relatado para quantificar a variância entre estudos; (iii) foram realizadas análises de influência para verificar resultados impulsionados por valores atípicos; e (iv) a estimativa agrupada não é tratada como definitiva ou clinicamente aplicável — ela é interpretada como geradora de hipóteses e é amplamente ressalvada na discussão.
Conforme o Cochrane Handbook, quando o I2 ultrapassa 75% e as análises de subgrupos não explicam de forma convincente a heterogeneidade, as estimativas agrupadas devem ser interpretadas com extrema cautela. Dado o pequeno número de estudos nos subgrupos, não se pode afirmar com confiança que a heterogeneidade esteja totalmente explicada. Portanto, a estimativa agrupada principal é apresentada principalmente com fins descritivos e exploratórios e não constitui base para recomendações clínicas. Todas as estatísticas de heterogeneidade (I2, τ2) e análises de sensibilidade são relatadas de forma transparente, permitindo que os leitores avaliem por si mesmos a estabilidade das estimativas.
Análises de subgrupo, sensibilidade e influência
Para explorar fontes de heterogeneidade, as seguintes análises pré-especificadas foram realizadas, sem realizar meta-regressão: 1) Para análises de subgrupos, o desfecho geral aos 6 meses foi estratificado por tipo de câncer (ovariano, endometrial) para verificar se o efeito diferia conforme o sítio tumoral; 2) Análise de sensibilidade (coortes sobrepostas): Para avaliar o impacto dos coortes sobrepostos do ensaio SUCCEED (Von Gruenigen et al.21 e McCarroll et al.23), a análise de subgrupo para câncer endometrial foi repetida excluindo McCarroll et al.23. 3) Análise de influência leave-one-out: Cada estudo foi removido sequencialmente e a DM agrupada e o I2 foram recalculados para o desfecho geral aos 6 meses, a fim de identificar se qualquer estudo individual influenciava desproporcionalmente os resultados ou a heterogeneidade; 4) Comparação com modelo de efeitos fixos: Para completude, as estimativas agrupadas também foram calculadas sob um modelo de efeitos fixos (ponderação pela variância inversa) para comparação com os resultados de efeitos aleatórios; qualquer discrepância substancial indicaria que a heterogeneidade entre estudos influencia significativamente a estimativa.
A meta-regressão não foi realizada para explorar covariáveis contínuas (por exemplo, idade, qualidade de vida basal, duração da intervenção) devido ao número de estudos por subgrupo (≤9 para o resultado geral aos 6 meses) é insuficiente para gerar coeficientes de regressão confiáveis. Com <10 estudos por covariável, a meta-regressão possui poder estatístico muito baixo e é propensa a erros do tipo I, e os dados de covariáveis disponíveis foram relatados de forma inconsistente entre os estudos.
Viés de publicação
Nenhum dos resultados agrupados incluiu 10 ou mais estudos. Portanto, os gráficos em funil e os testes de regressão de Egger não foram realizados, pois essas avaliações teriam baixa potência estatística e poderiam ser enganosas, considerando o número de estudos disponíveis.