Criterios de elegibilidad
Se incluyeron estudios si cumplían todos los siguientes criterios, organizados según el marco PICOS (Población, Intervención, Comparador, Resultados, Diseño del Estudio)17. Todas las plataformas y materiales utilizados en este estudio están listados en la Tabla de Materiales. Todas las búsquedas en la base de datos se realizaron en noviembre de 2025. No se utilizó ningún software propietario adicional (por ejemplo, SAS, SPSS, R) más allá de RevMan 5.3 y EndNote 20. La evaluación GRADE se realizó manualmente utilizando la herramienta online GRADEpro GDT; la versión se registra a fecha de acceso.
Población (P)
Los participantes presentaron síntomas depresivos clínicamente significativos, definidos como un diagnóstico formal de trastorno depresivo mayor (TDM) o distimia según los criterios del DSM (cualquier versión) o criterios de la CIE, confirmados mediante entrevistas clínicas estructuradas (por ejemplo, SCID, MINI, CIDI); o una puntuación superior al corte validado en un instrumento estandarizado de cribado de depresión (por ejemplo, Beck Depression Inventory ≥ 14, Hamilton Depression Rating Scale ≥ 14, CES-D ≥ 16, PHQ-9 ≥ 10, Geriatric Depression Scale ≥ 11). Los participantes podían tener cualquier edad (niños, adolescentes, adultos, adultos mayores) 18 años. Los estudios que incluyeron participantes con condiciones médicas o psiquiátricas comórbidas (por ejemplo, enfermedades cardiovasculares, diabetes, trastornos de ansiedad, trastornos por consumo de sustancias) solo se incluyeron si el análisis principal informó resultados por separado para el subgrupo de depresión o si el ≥80% de los participantes cumplía los criterios de depresión. Se excluyeron los estudios en los que la depresión era un resultado secundario en una población no deprimida (por ejemplo, pacientes con insuficiencia cardíaca sin cribado de depresión). No hubo restricción en la gravedad basal de la depresión (leve, moderada, grave), pero se extrajo la gravedad para análisis de subgrupos.
Intervención (I)
La intervención consistió en ejercicio físico estructurado y planificado, definido como cualquier forma de ejercicio aeróbico, de resistencia, mixto (aeróbico + resistencia) o alternativo (yoga, tai chi, baile) realizado durante al menos 2 semanas. Las intervenciones de ejercicio pueden ser supervisadas (por un entrenador, terapeuta o instructor) o no supervisadas (en casa, autodirigidas). Los estudios en los que el ejercicio se combinó con otra intervención activa (por ejemplo, ejercicio + farmacoterapia, ejercicio + atención plena) solo se incluyeron si el efecto del ejercicio podía aislarse (por ejemplo, ejercicio + farmacoterapia frente a farmacoterapia única). Se excluyeron los estudios en los que la intervención consistió únicamente en asesoramiento sobre actividad física (sin necesidad de prescripción estructurada de ejercicio) o asesoramiento sobre estilo de vida.
Comparador (C)
El grupo control no recibió intervención estructurada de ejercicio. Las condiciones de control aceptables se clasificaron como controles pasivos (sin intervención terapéutica activa), por ejemplo, lista de espera (tratamiento retrasado), atención habitual (manejo médico estándar sin ejercicio estructurado) o sin intervención; y controles activos (intervenciones terapéuticas no relacionadas con el ejercicio), por ejemplo, control de la atención (por ejemplo, educación para la salud sin ejercicio, sesiones de relajación o estiramientos ligeros que no cumplen los criterios de intensidad del ejercicio), farmacoterapia (solo antidepresivos) o psicoterapia (terapia psicológica sin ejercicio). Se excluyeron los estudios en los que el grupo control recibió algún tipo de ejercicio estructurado (incluyendo ejercicio mínimo o estiramientos que cumpliera los criterios de intensidad del ejercicio). Nota sobre la discrepancia: aunque la sección de innovación indicaba que se excluyeron los estudios con intervenciones psicológicas activas o controles de estiramiento/relajación, posteriormente se ampliaron los criterios de elegibilidad para incluir comparadores activos (farmacoterapia, psicoterapia, control de atención) para reflejar la cuestión clínica real de cómo se compara el ejercicio con otros tratamientos establecidos. Esta discrepancia se aborda en la discusión. Todos los análisis se estratifican por tipo de control (pasivo vs. activo) para examinar la influencia del tipo de control en el tamaño del efecto.
Resultados (O)
El estudio informó al menos una medida de resultado específica para la depresión: remisión de depresión (dicotómica, definida por los autores del estudio como que ya no cumplía los criterios diagnósticos o que estaba por debajo del límite en una escala validada); O (b) cambio en la puntuación de gravedad de la depresión continua medida en una escala validada (por ejemplo, HAM-D, BDI, CES-D, PHQ-9, GDS, MADRS). Se excluyeron los estudios que solo informaron medidas de estado de ánimo no específicas (por ejemplo, "bienestar", "estado emocional" sin una escala de depresión validada).
Diseño del estudio (S)
Solo se incluyeron ensayos controlados aleatorizados (ECA). Se excluyeron los estudios de cohortes prospectivos, estudios de casos y controles, estudios retrospectivos, series de casos y reportes de casos porque presentan un alto riesgo de confusión y sesgo de selección al estimar los efectos del tratamiento. Los estudios podían ser de diseño de grupos paralelos o de cruce (solo se extraía la primera fase para ensayos de cruce). Se requería que los estudios tuvieran al menos 10 participantes por brazo al inicio para minimizar los efectos en pequeños estudios. No se aplicaron restricciones lingüísticas, pero los estudios no ingleses solo se incluían si disponía de una traducción completa.
Criterios de exclusión
Se excluyeron los estudios en los que la depresión no era el resultado principal o en los que la población no fue seleccionada para la depresión (por ejemplo, poblaciones médicas generales con depresión como medida secundaria). Se excluyeron los estudios en los que la intervención de ejercicio se realizó como parte de una intervención de estilo de vida multicomponente, sin un efecto aislado del ejercicio. Se excluyeron los estudios en los que el grupo control recibió algún tipo de ejercicio estructurado. Se excluyeron los estudios con datos insuficientes para calcular tamaños de efecto (medias, desviaciones estándar o puntuaciones de cambio no reportadas y no obtenibles de los autores). Se excluyeron las publicaciones duplicadas de la misma cohorte de estudio (solo se incluyó el informe más completo o el más reciente). Se excluyeron resúmenes de congresos, tesis y manuscritos inéditos sin disponibilidad de texto completo.
Fuentes de información
El estudio completo se muestra en la Figura 1 como un diagrama de flujo PRISMA. Se incluyó literatura en el estudio si se cumplían los siguientes criterios de inclusión: el estudio era un ensayo controlado aleatorizado (ECA); Los pacientes seleccionados para la investigación tenían depresión; y la condición de control era no ejercicio. Los grupos de control aceptados incluían la atención habitual (manejo médico estándar sin ejercicio estructurado), lista de espera (tratamiento retrasado), sin intervención, control de atención (por ejemplo, educación para la salud sin ejercicio, sesiones de relajación o estiramientos ligeros que no cumplían los criterios de prescripción de ejercicio) o tratamiento farmacológico (antidepresivos solos). Se excluyeron los estudios en los que el grupo control recibió entrenamiento aeróbico, de resistencia o de ejercicio mixto estructurado. Los estudios en los que los grupos de control recibieron psicoterapia o terapia cognitivo-conductual sin componente de ejercicio solo se incluyeron si se definieron claramente como no ejercicio.
El estudio comparó las intervenciones de ejercicio con condiciones de control. Los grupos control se definieron como comparadores no ejercitistas, incluyendo atención habitual, lista de espera, ausencia de tratamiento, control de atención (por ejemplo, educación sanitaria, relajación o estiramientos que no cumplieran los criterios de intensidad del ejercicio) o tratamiento farmacológico en solitario. Se excluyeron estudios si el grupo control recibía alguna intervención estructurada de ejercicio o si el ejercicio se comparaba solo con otro régimen de ejercicio, sin un brazo control no ejercitario. Se excluyeron los estudios que no evaluaron los efectos de la intervención con ejercicio para los síntomas de depresión, los estudios sobre depresión en pacientes sin ejercicio ni control, y los estudios sin grupo de comparación.
Gestión de estudios multibrazo
Para estudios con más de dos brazos relevantes (por ejemplo, múltiples intervenciones de ejercicio o múltiples grupos comparadores), se aplicaron las siguientes estrategias para evitar errores de doble recuento y unidades de análisis como múltiples brazos de ejercicio frente a un solo grupo de control. Cuando un estudio comparó dos o más intervenciones diferentes (por ejemplo, aeróbico vs. entrenamiento de resistencia) con un solo grupo control, los brazos de ejercicio se combinaron en un único grupo agrupado utilizando fórmulas recomendadas por el Cochrane Manual (Capítulo 23). Este enfoque evita contar dos veces a los participantes del grupo de control mientras preserva la independencia estadística; Ejercicio vs. Comparadores múltiples no relacionados con ejercicio. Cuando un estudio comparó el ejercicio con dos o más condiciones de control distintas (por ejemplo, atención habitual y farmacoterapia), solo se seleccionó la condición de control que mejor se ajustaba a la definición de 'control no ejercitante' (orden de prioridad: lista de espera ≥ atención habitual ≥ control de atención > farmacoterapia > psicoterapia).
Si había varios controles no ejercitores, se seleccionó el comparador más conservador (menos activo) para evitar sobreestimar el efecto del ejercicio; Ejercicio vs. solo ejercicio (sin control sin ejercicio). Los estudios que compararon solo diferentes tipos de ejercicio (por ejemplo, de alta intensidad vs. baja intensidad) sin un brazo control no ejercitista fueron excluidos del análisis primario, ya que no cumplían el criterio de comparación de 'ejercicio vs. control'. En las intervenciones combinadas de los estudios, donde el brazo de intervención incluía ejercicio más otro componente activo (por ejemplo, ejercicio + farmacoterapia, ejercicio + atención plena), el brazo solo se incluyó si el efecto del ejercicio podía aislarse. Si se comparó el brazo combinado con el mismo componente no relacionado con el ejercicio (por ejemplo, ejercicio + farmacoterapia vs. farmacoterapia sola), la diferencia se interpretó como reflejo del efecto del ejercicio. Si no era posible tal aislamiento, el estudio quedaba descartado. Para evaluar la robustez de la estrategia de agrupación en ensayos multibrazo, se realizó un análisis de sensibilidad excluyendo todos los estudios multibrazo, y los resultados se compararon con los del análisis principal. Se reportan diferencias sustanciales.
La selección del brazo control cuando hay múltiples comparadores no relacionados con el ejercicio se realizó de la siguiente manera: si un estudio comparaba el ejercicio con dos o más condiciones de control distintas (por ejemplo, cuidado habitual y farmacoterapia), se aplicó una regla jerárquica de selección para evitar elecciones arbitrarias, ya que los controles pasivos (lista de espera ≥ atención habitual ≥ sin intervención) priorizaban sobre los controles activos para aislar mejor el efecto específico del ejercicio. Si solo hubo controles activos disponibles, se seleccionó el comparador más conservador (farmacoterapia ≥ psicoterapia ≥ control de atención) para evitar sobreestimar el efecto del ejercicio, y se realizaron análisis de sensibilidad, incluyendo todos los brazos de control disponibles (dividiendo el grupo de ejercicio entre comparadores) para comprobar si la regla de selección influía en la estimación agrupada. Los resultados de estos análisis de sensibilidad se informan en los Materiales Complementarios.
Estrategia de búsqueda
Las siguientes bases de datos electrónicas fueron buscadas sistemáticamente desde su inicio hasta noviembre de 2025: PubMed, Embase (plataforma OVID), Cochrane Central Register of Controlled Trials (CENTRAL), MEDLINE (plataforma OVID) y Google Scholar. Las estrategias de búsqueda completas, incluyendo términos MeSH, términos Emtree, palabras clave, operadores booleanos, truncamiento y etiquetas de campos, se proporcionan en la Tabla 1. En PubMed y Embase, las búsquedas se limitaron a estudios humanos y al idioma inglés. Para CENTRAL y MEDLINE, las búsquedas se limitaron a ensayos controlados aleatorizados. Para Google Scholar, los primeros 500 registros ordenados por relevancia se buscaron usando una cadena de búsqueda simplificada ('ejercicio Y depresión Y (remisión O medicación O tratamiento)') debido a las limitaciones de la plataforma en la búsqueda booleanacompleja 19.
Además de las búsquedas en bases de datos, se realizaron las siguientes búsquedas complementarias: búsqueda manual de listas de referencias de todos los estudios incluidos y revisiones sistemáticas relevantes (búsqueda en bola de nieve), seguimiento de citas de estudios clave incluidos usando Google Scholar y Web of Science, búsqueda manual de revistas clave (Mental Health and Physical Activity, Journal of Affective Disorders, Depression and Anxiety y Psychosomatic Medicine) para los años 2020–2025. y la búsqueda en registros de ensayos clínicos (ClinicalTrials.gov, ICTRP de la OMS) para ensayos no publicados o en curso utilizando los términos de búsqueda 'ejercicio' Y 'depresión'. El historial completo de búsqueda, incluyendo el número de registros recuperados en cada paso para cada base de datos, se proporciona en la Tabla Suplementaria 1. Se siguió la lista de verificación de informes de búsqueda PRISMA 2020 (Archivo Suplementario 1).
Proceso de selección
Todos los registros identificados se exportaron a EndNote 20 para su eliminación de duplicados. Tras la deduplicación, dos revisores independientes realizaron un ejercicio de calibración sobre una muestra aleatoria de 100 registros para asegurar la aplicación consistente de los criterios de elegibilidad. Tras confirmar el acuerdo aceptable (κ ≥ 0,80), los revisores revisaron de forma independiente los títulos y resúmenes de todos los registros restantes según los criterios de elegibilidad preestablecidos. Los registros considerados potencialmente relevantes por cualquiera de los revisores se enviaban para revisión en texto completo. Los artículos en texto completo fueron obtenidos y evaluados de forma independiente por los mismos dos revisores. Las razones de exclusión en la fase de texto completo se documentaron según las directrices de PRISMA (por ejemplo, sin intervención de ejercicio, sin diagnóstico de depresión, sin grupo de control, diseño no comparativo, publicación duplicada). Los desacuerdos en cualquiera de las dos fases de cribado se resolvían mediante la discusión; si no se alcanzaba consenso, el autor correspondiente tomaba la decisión final. El acuerdo entre evaluadores para la inclusión del texto completo se calculó utilizando la estadística kappa de Cohen. Aunque EndNote 20 se utilizó para la eliminación inicial de duplicados, se identificaron y eliminaron duplicados adicionales que no fueron detectados por el software (por ejemplo, debido a ligeras variaciones en los títulos, nombres de autores o abreviaturas de revistas) durante la selección manual de títulos/resúmenes por los dos revisores independientes.
El proceso de selección y selección se resume en el diagrama de flujo PRISMA 2020 (Figura 1), que incluye el número de registros identificados, duplicados eliminados, registros revisados, informes solicitados para recuperación, informes evaluados para elegibilidad y estudios incluidos, con razones específicas de exclusión en cada etapa. Se buscó en Google Scholar usando la cadena simplificada 'ejercicio Y depresión Y (remisión O medicación O tratamiento)' con las siguientes opciones: ordenar por relevancia, excluir citas e incluir patentes. Se revisaron los primeros 500 discos. La búsqueda se llevó a cabo el 15 de noviembre de 2025, a las 10; 00 AM GMT, sin personalización activada, y se repitió el 16 de noviembre de 2025 para verificar la consistencia.
Extracción de datos
Dos revisores extrajeron de forma independiente los datos de cada estudio incluido utilizando un formulario de extracción de datos estandarizado y probado por un piloto. Se recopiló la siguiente información: nombre del primer autor, año de publicación, país donde se realizó el estudio, tamaño de la muestra (total, grupo de ejercicio, grupo control), características de los participantes (edad, diagnóstico o método de cribado de depresión, gravedad inicial de la depresión), detalles de la intervención (modo de ejercicio, intensidad, frecuencia, duración, supervisión, formato), descripción del grupo de control, medidas de resultados para la depresión (nombre y rango de escala), momento de la evaluación de resultados, y resultados estadísticos (medias, desviaciones estándar, estimaciones de efecto, intervalos de confianza, valores p)20. Los desacuerdos entre revisores se resolvían mediante discusión o consultando al autor correspondiente.
Elementos de datos
Los datos se recopilaron de forma independiente basándose en una valoración de la intervención al ejercicio para síntomas de depresión cuando un estudio produjo resultados diferentes.
Evaluación del riesgo de sesgo
Dos autores evaluaron de forma independiente el riesgo de sesgo en cada estudio incluido utilizando la herramienta Cochrane RoB 2 para ensayos controlados aleatorizados (versión de agosto de 2019). La herramienta RoB 2 evalúa cinco dominios de sesgo derivados del proceso de aleatorización, desviaciones respecto a las intervenciones previstas, datos de resultados ausentes, medición del resultado y selección del resultado reportado. Para cada dominio, los revisores asignaron un juicio de 'bajo riesgo de sesgo', 'algunas preocupaciones' o 'alto riesgo de sesgo'. Luego se derivó un juicio global de riesgo de sesgo para cada estudio según los algoritmos de RoB 2: 'bajo riesgo' (todos los dominios de bajo riesgo), 'algunas preocupaciones' (al menos un dominio con algunas preocupaciones pero ningún de alto riesgo) o 'alto riesgo' (cualquier dominio calificado de alto riesgo o múltiples dominios con algunas preocupaciones). Los desacuerdos entre revisores se resolvían mediante discusión, con el autor correspondiente arbitrando cuando era necesario. No se excluyeron los estudios basándose en juicios de riesgo de sesgo; En su lugar, se planificaron análisis de sensibilidad para restringir el metaanálisis a estudios con juicios generales de 'bajo riesgo' o 'bajo riesgo + algunas preocupaciones', con el fin de examinar la solidez de los hallazgos. El acuerdo entre evaluadores para los juicios globales de riesgo de sesgo se calculó utilizando el kappa21 de Cohen.
Análisis de subgrupos (análisis de moderadores)
Para explorar posibles fuentes de heterogeneidad e identificar moderadores de la eficacia del ejercicio, se realizó una serie de análisis a priori de subgrupos basados en variables clínica y metodológicamente relevantes. Los análisis de subgrupos se realizaron solo para resultados con al menos 10 estudios por subgrupo (para asegurar una potencia estadística adecuada). Se especificaron las siguientes variables de subgrupo.
Características del ejercicio
Modo de ejercicio como aeróbico (por ejemplo, caminar, correr, ciclismo) frente a resistencia (por ejemplo, entrenamiento con pesas) vs. mixto (aeróbico + resistencia) vs. otro (yoga, baile, movimiento basado en mindfulness).
La intensidad del ejercicio es ligera (por ejemplo, caminata suave, estiramientos) frente a moderada (por ejemplo, caminata rápida, ciclismo moderada) frente a vigorosa (por ejemplo, carrera, entrenamiento interválico de alta intensidad), clasificada usando criterios estándar de frecuencia cardíaca o de esfuerzo percibido reportados en cada estudio.
La duración del ejercicio (semanas) es corta (≤8 semanas) vs. media (9–12 semanas) vs. larga (≥13 semanas).
Supervisión supervisada (sesiones de ejercicio dirigidas por un instructor, formador o terapeuta) frente a no supervisada (en casa o autodirigida sin supervisión directa).
Formato en grupo frente a individual (en casa o uno contra uno).
Características de la población
El diagnóstico de depresión se clasificó como trastorno depresivo mayor (TDM), diagnosticado mediante una entrevista clínica estructurada como la entrevista clínica estructurada para trastornos del DSM (SCID) o la mini entrevista neuropsiquiátrica internacional (MINI), o síntomas depresivos elevados identificados mediante herramientas de cribado validadas basadas en puntuaciones de corte establecidas, incluyendo la escala de depresión del Center for Epidemiologic Studies (CES-D ≥ 16). Inventario de depresión de Beck (BDI ≥ 14), o cuestionario de salud del paciente-9 (PHQ-9 ≥ 10). El grupo de edad se clasificó como adultos (18–59 años) o adultos mayores (≥60 años). La severidad basal de la depresión se categorizó como moderada o grave según las puntuaciones estándar de corte para cada escala de evaluación, definiéndose, por ejemplo, como una puntuación de la Hamilton Depression Rating Scale (HAM-D) de 14–18 o una puntuación BDI de 14–19, y la depresión severa definida como una puntuación HAM-D de ≥19 o una puntuación BDI de ≥20.
Características del diseño del estudio
El tipo de grupo control se categorizó como pasivo, incluyendo listas de espera, sin tratamiento o condiciones de control habituales, o activo, incluyendo intervenciones de control de atención, farmacoterapia o psicoterapia. El año de publicación se clasificó en tres periodos—pre-2010, 2010–2019 y 2020–2025—para examinar posibles tendencias temporales en los hallazgos del estudio. El riesgo de sesgo se evaluó utilizando la herramienta Cochrane Risk of Bias 2 (RoB 2) y se clasificó como de bajo riesgo, algunas preocupaciones o alto riesgo. El tamaño de la muestra se clasificó como pequeño (n < 50 participantes totales), mediano (50–99 participantes) o grande (≥100 participantes). El tipo de grupo de control se categorizó como pasivo (lista de espera, atención habitual, sin intervención); estos controles no ofrecen una alternativa terapéutica activa, por lo que el efecto del ejercicio puede ser mayor debido a los efectos de expectativa o atención; y activo (control de atención, farmacoterapia, psicoterapia): estos controles proporcionan una intervención no relacionada con el ejercicio y valor terapéutico creíble, proporcionando una estimación más conservadora del efecto específico del ejercicio. Un efecto significativamente mayor para controles pasivos frente a activos (p para la interacción < 0,10), como se hipotetizó, fue confirmado en los resultados (véase Tabla 3).
Métodos estadísticos para análisis de subgrupos
Para cada análisis de subgrupo, los estudios dentro de cada subgrupo se agruparon utilizando un modelo de efectosaleatorios 22. Para comparar subgrupos, se utilizaron meta-regresión de efectos mixtos o pruebas de interacción con subgrupos. Específicamente, se calculó la estadística Q para las diferencias entre subgrupos y se reportó el valor p asociado a la interacción. Se consideró estadísticamente significativo un valor p < 0,10 (en lugar de 0,05) para las diferencias de subgrupos, reconociendo el bajo poder de las pruebas de interacción en metaanálisis. No se realizó ajuste por comparación múltiple (12 análisis de subgrupos); por lo tanto, los hallazgos de subgrupos deben interpretarse como exploratorios.
Análisis de sensibilidad
Para evaluar la robustez de los hallazgos primarios, se realizaron los siguientes análisis de sensibilidad predefinidos. Elección del modelo como re-análisis de ambos resultados utilizando un modelo de efectos fijos (método de varianza inversa) para comparar con los resultados primarios de efectos aleatorios, exclusión de estudios de alto riesgo de sesgo como estudios excluidos con un criterio global de RoB 2 de 'alto riesgo de sesgo' (n = 17), y reanálisis de los estudios restantes (bajo riesgo + algunas preocupaciones), exclusión de ensayos multibrazo como estudios excluidos donde se combinaron múltiples brazos de ejercicio o donde se utilizó un solo grupo control para múltiples comparaciones (n = 9) y reanalizaron solo ensayos de dos brazos, excluyeron los estudios con datos imputados o asumidos como excluidos donde se asumieron desviaciones estándar para las puntuaciones de cambio (r = 0,50) en lugar de reportadas (n = 6), excluyó los estudios previos a CONSORT como excluidos publicados antes de 2001 (n = 5) para evaluar si la mejora en los estándares de reporte influyó en las estimaciones de efectos, análisis de influencia (leave-one-out) como realizó un meta-análisis leave-one-out, Eliminando secuencialmente cada estudio y recalculando el efecto agrupado para identificar los estudios influyentes (definidos como aquellos cuya eliminación cambia la estimación puntual en un >10% o mueve el intervalo de confianza más allá de los límites originales), y análisis de seguimiento a largo plazo como para los estudios que reportaron datos de seguimiento a ≥6 meses tras la intervención (n = 6), estos datos se agruparon por separado para examinar la durabilidad de los efectos del ejercicio, Sin mezclarse con los datos del endpoint principal (post-intervención). Todos los análisis de sensibilidad se realizaron utilizando modelos de efectos aleatorios, salvo que se especifique lo contrario. Los resultados de los análisis de sensibilidad se informan en la sección de Resultados y en materiales complementarios. Cualquier desviación de estos análisis preespecificados se informa de forma transparente.
Extracción de datos de resultados continuos (puntuaciones de depresión)
Para cada estudio incluido, la puntuación media de depresión y su desviación estándar (DS) para ambos grupos de ejercicio y control se extrajeron en el punto final principal (definido como el momento más cercano al final de la intervención de ejercicio). Para maximizar la consistencia entre estudios, se aplicó la siguiente regla jerárquica de extracción: se priorizaron estimaciones ajustadas del efecto (por ejemplo, diferencias entre grupos derivadas de ANCOVA con IC o SEs del 95%) cuando estaban disponibles, ya que tienen en cuenta los desequilibrios de la línea base y normalmente proporcionan la estimación menos sesgada del efecto de la intervención. Se extrajeron los resultados de cambio respecto a la línea inicial (post-menos antes o porcentaje de cambio) y sus DE cuando no se reportaron efectos ajustados. Si las puntuaciones de cambio de la DE no se reportaban directamente, se calculaban usando la fórmula:
(1)
donde se asumió un coeficiente de correlación conservador de r = 0,5 a menos que el estudio proporcionara una correlación reportada o imputable. Solo se extrajeron las puntuaciones posteriores a la intervención (sin ajustes ni cambios) cuando no se disponía ni de efectos ajustados ni de cambios. Esta fue la opción menos preferida porque no tiene en cuenta las posibles diferencias de referencia entre grupos. Conversión desde otras estadísticas, como si medias y DE no se reportaran directamente, las estadísticas disponibles (medianas y IQR, t-estadísticas, estadísticas F, p-valores o IC del 95%) se convirtieron en medias y DS usando fórmulas estándar del Manual Cochrane (Capítulo 6). Los estudios que reportaban solo medianas y rangos se incluyeron solo si los tamaños de muestra eran lo suficientemente grandes (n ≥ 25 por grupo) para asumir una normalidad aproximada, o si los autores del estudio proporcionaban medias y detas a petición.
En varios puntos temporales, como en los estudios que reportan múltiples puntos de seguimiento, se extrajo el momento más cercano al final del periodo de intervención activa (típicamente 8–12 semanas). Se extrajeron datos de seguimiento a largo plazo (≥6 meses tras la intervención) para un análisis secundario planificado de durabilidad, pero estos datos no se agruparon con los datos de los criterios finales primarios. Múltiples escalas de depresión. Cuando un estudio reportó más de una escala de depresión (por ejemplo, tanto HAM-D como BDI), se priorizaron las escalas valoradas por clínicos (HAM-D, MADRS) sobre las escalas de autoinforme (BDI, CES-D, PHQ-9, GDS) porque las escalas valoradas por clínicos se consideran el estándar de oro en los ensayos sobre depresión. Si ambos se reportaron, se extrajo la medida de resultado primaria definida por los autores del estudio. Imputación de SDs ausentes como si faltaran desviaciones estándar y no pudieran calcularse a partir de las estadísticas disponibles; se imputaron tomando el DS medio de estudios con tamaños de muestra similares y la misma escala de depresión. Se realizaron análisis de sensibilidad, excluyendo estudios con SD imputadas, para evaluar el impacto de esta imputación. Todas las decisiones de extracción de datos se realizaron de forma independiente por dos autores utilizando un formulario estandarizado de extracción de datos. Las discrepancias se resolvían mediante discusión o por el autor correspondiente. Se registraron la regla de extracción y cualquier desviación.
Medidas de efecto
Para el resultado dicotómico (remisión por depresión), se calcularon razones de probabilidades (OR) con intervalos de confianza (IC) del 95%. Para el resultado continuo (puntuaciones de gravedad de la depresión), se anticipaba que los estudios incluidos utilizaran diferentes escalas de valoración de depresión (por ejemplo, Hamilton Depression Rating Scale, Beck Depression Inventory, PHQ-9, CES-D, Geriatric Depression Scale). Aunque los estudios incluidos utilizaron diferentes escalas de valoración de depresión, se reportó la diferencia media estándar (DME) porque todas las escalas tenían ecuaciones de conversión establecidas a HAM-D.
Síntesis estadística
Para el resultado dicotómico (remisión por depresión), se calcularon razones de probabilidades (OR) agrupadas con intervalos de confianza (IC) del 95%. Para el resultado continuo (puntuaciones de gravedad de la depresión), se calcularon diferencias medias estandarizadas agrupadas (SMDs, Hedges' g) con IC del 95% porque los estudios incluidos utilizaron diferentes escalas de valoración de depresión. Dada la diversidad clínica y metodológica prevista entre estudios (variaciones en protocolos de ejercicio, poblaciones, condiciones de control y medidas de resultado), se eligió a priori un modelo de efectos aleatorios (método DerSimoniano y Laird) para todos los análisisprimarios 22. La heterogeneidad se cuantificó usando la estadística I2 , interpretada con criterios del Manual Cochrane como el siguiente 0–40% (puede no ser importante), 30–60% (heterogeneidad moderada), 50–90% (heterogeneidad sustancial) y 75–100% (heterogeneidad considerable). También se estimó la varianza entre estudios (tau2), y se calcularon intervalos de predicción del 95% para los efectos agrupados cuando era apropiado.
Análisis estadístico y heterogeneidad
Debido a la diversidad clínica y metodológica esperada entre los estudios incluidos (incluyendo variaciones en el tipo de ejercicio, intensidad, duración, supervisión, características poblacionales, gravedad de la depresión, condiciones de control y escalas de medición de la depresión), se eligió a priori un modelo de efectos aleatorios (método DerSimoniano y Laird) para todos los análisis primarios22. El modelo de efectos aleatorios asume que el efecto real varía entre estudios y proporciona una estimación más conservadora con intervalos de confianza más amplios, lo cual es apropiado dada la heterogeneidad anticipada.
Evaluación de la heterogeneidad
La heterogeneidad se cuantificó utilizando la estadística I2 , que representa el porcentaje de variación total entre estudios debido a la verdadera heterogeneidad más que al azar. I2 valores se interpretaron de la siguiente manera: 0–40% (puede que no sea importante); 30–60% (heterogeneidad moderada); 50–90% (heterogeneidad sustancial); 75–100% (considerable heterogeneidad), como en los criterios del Manual Cochrane. Además de I2, se estimaron la varianza entre estudios (tau2) y los intervalos de predicción del 95% para el efecto agrupado cuando era apropiado.
Justificación de la selección de modelos
No se utilizó un modelo de efectos fijos para ningún análisis primario porque los estudios no son funcionalmente idénticos (varían en protocolos de ejercicio, poblaciones y medidas de resultado), la suposición de un único efecto verdadero compartido por todos los estudios es inverosímil en la investigación sobre depresión por ejercicio, e incluso cuando I2 aparece baja (por ejemplo, I2 = 48% para remisión), la diversidad clínica por sí sola justifica un enfoque de efectos aleatorios. Para mayor exhaustividad, también se realizaron análisis de sensibilidad utilizando un modelo de efectos fijos para examinar si la elección del modelo influyó en las conclusiones; Estos resultados se presentan en los materiales complementarios.
Evaluación del sesgo de publicación
El sesgo de publicación y los efectos de pequeños estudios se evaluaron utilizando tanto la inspección visual de los gráficos de embudo como la prueba de regresión lineal de Egger. Para cada resultado, se generaron diagramas de embudo que mostraban el tamaño del efecto (logarítmic de la razón de remisión; diferencia media estandarizada para las puntuaciones de depresión) frente a su error estándar. Para la evaluación cuantitativa, la prueba de Egger regresa la estimación del efecto estandarizado respecto a su precisión (el inverso del error estándar). Un intercepto estadísticamente significativo (p < 0,10 en metaanálisis con ≥10 estudios) sugiere la presencia de asimetría en el diagrama de embudo, lo que puede indicar sesgo de publicación o efectos en estudios pequeños. Por el contrario, p ≥ 0,10 indica que no hay evidencia estadística de tal sesgo.
Intervalos de predicción
Para el metaanálisis primario de efectos aleatorios, se calcularon intervalos de predicción del 95%, que estiman el rango dentro del cual caería el efecto real de un estudio futuro. Los intervalos de predicción amplios indican que el efecto del ejercicio puede variar sustancialmente entre entornos y poblaciones, con importantes implicaciones clínicas. Para estudios de varios brazos en los que se combinaron varios brazos de ejercicio en un solo grupo, se utilizaron las fórmulas del Manual Cochrane para calcular medias combinadas, desviaciones estándar y tamaños de muestra. Para los estudios que usaron un solo brazo de control en múltiples comparaciones de ejercicios, se evitó el doble conteo dividiendo el tamaño de muestra del grupo de control por el número de brazos de ejercicio al calcular el tamaño del efecto. Todos los análisis se realizaron utilizando la versión 5.3 del Gestor de Revisores, con el manejo multibrazo verificado de forma independiente por dos autores.
Cálculo del número necesario para tratar (NNT)
El número necesario para tratar (NNT) se calculó a partir de la razón de probabilidades agrupada (OR) para la remisión utilizando la fórmula

donde la CER (tasa de evento control) era la tasa de remisión agrupada en todos los estudios incluidos. NNT también se calculó utilizando el método alternativo propuesto por Furukawa y Leucht (2011), que convierte la d de Cohen (de SMD) a NNT usando el área bajo la curva normal. Los valores de NNT se calcularon para el análisis principal (todos los estudios), para subgrupos (estudios de bajo riesgo de sesgo, estudios solo con TDM, estudios supervisados con ejercicio) y para comparación con valores publicados de NNT para psicoterapia y medicación antidepresiva. Una NNT de ≤ 10 se consideró clínicamente significativa.
Conversión a métricas clínicamente familiares (BDI y HAM-D)
Para facilitar la interpretabilidad clínica, la diferencia de medias estandarizadas (SMD) agrupada para las puntuaciones de depresión se convirtió en diferencias medias estimadas en dos escalas de depresión comúnmente utilizadas: el Inventario de Depresión Beck (BDI, rango 0–63) y la Escala de Calificación de Depresión de Hamilton (HAM-D, rango 0–52). La conversión utilizó la siguiente fórmula

donde SDagrupaba, la referencia era la desviación estándar combinada de los estudios que utilizaron el BDI (n = 8 estudios) o HAM-D (n = 16 estudios), respectivamente. Este enfoque asume que el tamaño del efecto DME es consistente a través de las escalas. Las diferencias medias observadas en estos estudios también se informan como un control de sensibilidad. Un cambio de ≥3 puntos en el BDI o HAM-D se consideró clínicamente significativo según las directricesdel NICE 5.
Comparación con tratamientos establecidos para la depresión
Para contextualizar el efecto del ejercicio en comparación con otros tratamientos de primera línea para la depresión, se comparó la NNT agrupada para el ejercicio con los valores publicados de NNT de metaanálisis recientes de alta calidad. La psicoterapia, como informaron Cuijpers et al. (2020), tiene una NNT de 2,5 para psicoterapia en todos los grupos de edad. Los antidepresivos, según informaron Cipriani et al. (2018), tienen un NNT de 4,3 para medicación frente a placebo. Estas comparaciones son descriptivas y no se basan en ensayos directos. Los datos de ejercicio no se agruparon con los datos de psicoterapia o medicación, y las diferencias en las poblaciones del estudio, definiciones de resultados y momentos de tiempo limitan la comparabilidad directa.
Evaluación del sesgo de notificación (sesgo de publicación)
Se generaron gráficos de embudo para cada resultado (puntuación de remisión y depresión), y gráficos de embudo que muestran el tamaño del efecto (razón logarítmica de probabilidades para remisión; diferencia media estandarizada para puntuaciones de depresión) frente a su error estándar. La asimetría en el gráfico de embudo puede indicar sesgo de publicación, efectos en estudios pequeños o heterogeneidad. La prueba de regresión de Egger, también conocida como la prueba de regresión lineal de Egger, se realizó para evaluar formalmente la asimetría del diagrama embudo. La prueba de Egger regresa la estimación estandarizada del efecto en su precisión (el inverso del error estándar). Un intercepto estadísticamente significativo (p < 0,10 para la prueba de Egger, según lo recomendado por el Manual Cochrane para resultados con menos de 10 estudios, o p < 0,05 para metaanálisis más grandes) sugiere la presencia de efectos en estudios pequeños o sesgo de publicación. Por el contrario, p ≥ 0,05 (o p ≥ 0,10) indica que no hay evidencia estadísticamente significativa de tal sesgo. Advertencia de interpretación: ya que la asimetría del diagrama embudo no es sinónimo de sesgo de publicación; También puede surgir de una verdadera heterogeneidad, diferencias en la calidad del estudio o en el azar, y los resultados deben interpretarse en consecuencia23.
Certeza de la evidencia (evaluación GRADE)
La certeza global de la evidencia para cada resultado (puntuación de remisión y depresión) se evaluó utilizando el marco de Evaluación de Calificación de Recomendaciones, Desarrollo y Evaluación (GRADE). Dos autores valoraron de forma independiente la certeza y resolvieron los desacuerdos mediante la discusión. El enfoque GRADE considera cinco dominios que pueden reducir la certeza: riesgo de sesgo (basado en evaluaciones RoB 2, incluyendo la proporción de estudios con bajo riesgo, algunas preocupaciones o alto riesgo), inconsistencia (basada en la estadística I2 , intervalos de predicción y solapamiento de intervalos de confianza), indirectidad (basada en diferencias entre poblaciones estudiadas, intervenciones, comparadores y resultados relativos a la pregunta de revisión), imprecisión (basada en el tamaño óptimo de la información y si los intervalos de confianza del 95% cruzan umbrales clínicamente importantes, como una razón de probabilidades de 1,0 para la remisión o una diferencia media estandarizada de 0,2 para un pequeño efecto en las puntuaciones de depresión), y sesgo de publicación (basado en asimetría de diagramas de embudo y la prueba de Egger). La certeza se calificó de la siguiente manera: Alta (es muy poco probable que investigaciones posteriores cambien la confianza en la estimación del efecto); Moderado (Investigaciones adicionales probablemente tendrán un impacto importante en la confianza y podrían cambiar la estimación); Bajo (Es muy probable que la investigación posterior tenga un impacto importante en la confianza y cambie la estimación); y Muy bajo (cualquier estimación del efecto es muy incierta). Se realizaron evaluaciones de certeza por separado para remisión (resultado dicotómico) y puntuaciones de depresión (resultado continuo).