Критерии допуска
Исследования включались, если они соответствовали всем следующим критериям, организованным в рамках PICOS (Популяция, Вмешательство, Сравнительный анализ, Результаты, Дизайн Исследования)17. Все платформы и материалы, использованные в этом исследовании, перечислены в Таблице материалов. Все поиски в базе данных были проведены в ноябре 2025 года. Дополнительное проприетарное программное обеспечение (например, SAS, SPSS, R) не использовалось после RevMan 5.3 и EndNote 20. Оценка GRADE проводилась вручную с помощью онлайн-инструмента GRADEpro GDT; версия записана на дату доступа.
Население (P)
Участники имели клинически значимые депрессивные симптомы, определяемые как формальный диагноз большого депрессивного расстройства (ВДП) или дистимии согласно критериям DSM (любая версия) или критериям ИКБ, подтверждённые структурированным клиническим интервью (например, SCID, MINI, CIDI); или балл выше валидированного порога на стандартизированном инструменте скрининга депрессии (например, Beck Depression Inventory ≥ 14, Hamilton Depression Rating Scale ≥ 14, CES-D ≥ 16, PHQ-9 ≥ 10, Geriatric Depression Scale ≥ 11). Участники могут быть любого возраста (дети, подростки, взрослые, пожилые люди)18. Исследования, в которых участвовали участники с сопутствующими медицинскими или психиатрическими состояниями (например, сердечно-сосудистые заболевания, диабет, тревожные расстройства, расстройства употребления психоактивных веществ), включались только в том случае, если первичный анализ публиковал результаты отдельно для подгруппы депрессии или если ≥80% участников соответствовали критериям депрессии. Исследования, в которых депрессия была вторичным исходом в недепрессивной популяции (например, пациенты с сердечной недостаточностью без скрининга на депрессию), были исключены. Ограничения по исходной тяжести депрессии (лёгкая, умеренная, тяжёлая), не было, но для анализов подгрупп была выделена тяжесть.
Вмешательство (I)
Вмешательство состояло из структурированных, запланированных физических упражнений, определяемых как любая форма аэробных, сопротивляющихся, смешанных (аэробное + сопротивление) или альтернативных упражнений (йога, тайцзи, танцы), выполняемых не менее 2 недель. Физические вмешательства могут быть под наблюдением (тренером, терапевтом или инструктором) или без присмотра (дома, самостоятельно). Исследования, в которых упражнения сочетались с другим активным вмешательством (например, упражнения + фармакотерапия, упражнения + осознанность), включались только в том случае, если можно было выделить эффект упражнений (например, упражнения + фармакотерапия против только фармакотерапии). Исследования, в которых вмешательство состояло только из консультаций по физической активности (без назначения структурированных упражнений) или консультаций по образу жизни, были исключены.
Компаратор (C)
Контрольная группа не получила структурированного вмешательства в упражнениях. Допустимые контрольные состояния классифицировались как пассивные контроли (отсутствие активного терапевтического вмешательства), например, лист ожидания (задержка лечения), обычное лечение (стандартное медицинское лечение без структурированных упражнений) или отсутствие вмешательства; и активные контроли (терапевтические вмешательства без физических нагрузок), например, контроль внимания (например, образование о здоровье без физических нагрузок, релаксационные сессии или лёгкая растяжка, не соответствующая критериям интенсивности упражнений), фармакотерапия (только антидепрессанты) или психотерапия (психологическая терапия без физических упражнений). Исследования, в которых контрольная группа получала любые формы структурированных упражнений (включая минимальные упражнения или растяжку, соответствующие критериям интенсивности упражнений), были исключены. Примечание о несоответствии: хотя раздел инноваций указывал, что исследования с активными психологическими вмешательствами или контролями растяжки/релаксации были исключены, впоследствии критерии допуска для включения активных компараторов (фармакотерапия, психотерапия, контроль внимания) для отражения реального клинического вопроса о том, как упражнения соотносятся с другими устоявшимися методами лечения, были расширены. Это несоответствие рассматривается в обсуждении. Все анализы стратифицируются по типу контроля (пассивному и активному), чтобы изучить влияние типа контроля на размеры эффектов.
Результаты (O)
В исследовании была описана как минимум одна мера исхода, специфичная для депрессии: ремиссия депрессии (дихотомичная, которую авторы исследования определяют как не соответствующую диагностическим критериям или ниже порога по валидированной шкале); ИЛИ (b) изменение оценки тяжести непрерывной депрессии, измеряемой по валидированной шкале (например, HAM-D, BDI, CES-D, PHQ-9, GDS, MADRS). Исследования, сообщавшие только о неспецифических показателях настроения (например, «благополучие», «эмоциональное состояние» без валидированной шкалы депрессии), были исключены.
Дизайн исследования (S)
Включены только рандомизированные контролируемые исследования (РКИ). Проспективные когортные исследования, исследования случай-контроль, ретроспективные исследования, серии случаев и отчёты случаев были исключены, поскольку они имеют высокий риск смешивания и отбора при оценке эффектов лечения. Исследования могут быть выполнены в параллельных группах или кроссоверных проектах (только первая фаза извлекается для кроссоверных испытаний). В исследованиях требовалось участие не менее 10 участников в каждой группе на начальном этапе, чтобы минимизировать эффект небольших исследований. Языковые ограничения не применялись, но неанглийские занятия включались только при наличии полного перевода.
Критерии исключения
Исследования, в которых депрессия не была первичным исходом или где популяция не была отобрана для депрессии (например, общие медицинские популяции с депрессией как вторичной мерой), были исключены. Исследования, в которых физическое вмешательство проводилось в рамках многокомпонентного образа жизни без изолированного эффекта физической активности, были исключены. Исследования, в которых контрольная группа получала любые формы структурированных упражнений, были исключены. Были исключены исследования с недостаточными данными для расчёта размеров эффектов (средние, стандартные отклонения или изменения оценок, не представленные и недоступные от авторов). Дублирующие публикации одной и той же когорты исследования (включался только самый полный или самый свежий отчёт) были исключены. Тезисы конференций, диссертации и неопубликованные рукописи без полноценного текста были исключены.
Источники информации
Полное исследование показано на рисунке 1 в виде блок-схемы PRISMA. Литература включалась в исследование, если были выполнены следующие критерии включения: исследование было рандомизированным контролируемым испытанием (РКИ); пациенты, отобранные для обследования, страдали от депрессии; а условие управления — отсутствие физической нагрузки. Допустимые контрольные группы включали обычное лечение (стандартное медицинское лечение без структурированных упражнений), лист ожидания (отсрочка лечения), отсутствие вмешательства, контроль внимания (например, обучение здоровью без физических нагрузок, сеансы релаксации или лёгкое растяжение, не соответствующее критериям назначения упражнений) или фармакологическое лечение (только антидепрессанты). Исследования, в которых контрольная группа получала структурированную аэробную, сопротивительную или смешанную тренировку, были исключены. Исследования, в которых контрольные группы получали психотерапию или когнитивно-поведенческую терапию без компонента упражнений, были включены только при чётком определении как не занимающиеся физическими упражнениями.
В исследовании сравнивались упражнения с контрольными состояниями. Контрольные группы были определены как незанимающиеся спортом, включая обычный уход, лист ожидания, отсутствие лечения, контроль внимания (например, просвещение здоровья, релаксация или растяжки, не соответствующие критериям интенсивности упражнений) или только фармакологическое лечение. Исследования исключались, если контрольная группа получила какое-либо структурированное вмешательство или если упражнения сравнивались только с другим режимом упражнений, без контрольной группы, не занимающейся спортом. Были исключены исследования, не оценивающие влияние вмешательства с физическими упражнениями на симптомы депрессии, исследования депрессии у пациентов без физической активности или контроля, а также исследования без сравнительной группы.
Обработка многорукавных исследований
Для исследований с более чем двумя релевантными руками (например, множественные упражнения или несколько компаративных групп) применялись следующие стратегии, чтобы избежать ошибок двойного подсчёта и единицы анализа, как несколько упражнений, против одной контрольной руки. При сравнении двух или более различных упражнений (например, аэробных и силовых тренировок) с одной контрольной группой, упражнения были объединены в одну объединённую группу упражнений с использованием рекомендованных Cochrane формул Справочник (глава 23). Этот подход избегает двойного подсчёта участников контрольной группы, сохраняя при этом статистическую независимость; Упражнения против нескольких компараторов без физических нагрузок. Когда исследование сравнивало упражнения с двумя или более различными контрольными состояниями (например, обычное лечение и фармакотерапия), выбиралось только то контрольное состояние, которое лучше всего соответствовало определению «контроля без физической активности» (приоритетный порядок: лист ожидания ≥ обычное лечение ≥ контроль внимания > фармакотерапии > психотерапии).
Если присутствовало несколько контрольных элементов, не занимающихся физическими упражнениями, выбирался самый консервативный (наименее активный) компаратор, чтобы не переоценивать эффект упражнений; Упражнения против только упражнений (без контроля без упражнений). Исследования, сравнивающие только разные виды упражнений (например, высокоинтенсивные и низкоинтенсивные) без контрольной группы, не занимающейся спортом, были исключены из первичного анализа, поскольку они не соответствовали критерию сравнения «упражнения против контроля». Комбинированные вмешательства для исследований, где группа интервенции включала упражнения плюс другой активный компонент (например, упражнения + фармакотерапия, упражнения + осознанность), рука включалась только в случае, если эффект упражнений можно было изолировать. Если сравнивать комбинированную руку с одним и тем же компонентом, не связанным с физическими упражнениями (например, упражнения + фармакотерапия против только фармакотерапии), различие интерпретировалось как отражение эффекта физических упражнений. Если такая изоляция не была возможна, исследование исключалось. Для оценки надёжности стратегии объединения для многогрупповых испытаний был проведён анализ чувствительности, исключивший все многогрупповые исследования, и результаты сравнивались с результатами первичного анализа. Сообщается о любых существенных отличиях.
Выбор контрольной группы при наличии нескольких компараторов, не связанных с физическими упражнениями, проводился следующим образом: если исследование сравнивало упражнения с двумя или более различными контрольными состояниями (например, обычным уходом и фармакотерапия), применялось иерархическое правило отбора для предотвращения произвольных выборов, поскольку пассивные контроли (лист ожидания ≥ обычное лечение ≥ отсутствие вмешательства) ставили приоритет активным контролям для лучшего выделения специфического эффекта упражнений. Если бы были доступны только активные контрольные группы, был выбран самый консервативный компаратор (фармакотерапия ≥ психотерапия ≥ контроль внимания), чтобы избежать переоценки эффекта упражнений, и проводился анализ чувствительности, включая все доступные контрольные группы (путём разделения группы упражнений на компараторы), чтобы проверить, влияет ли правило отбора на объединённую оценку. Результаты этих анализов чувствительности публикуются в дополнительных материалах.
Стратегия поиска
С момента запуска до ноября 2025 года систематически проводились следующие электронные базы данных: PubMed, Embase (платформа OVID), Центральный реестр контролируемых испытаний Кокрейна (CENTRAL), MEDLINE (ПЛАТФОРМА OVID) и Google Scholar. Полные стратегии поиска, включая термины MeSH, термины Emtree, ключевые слова, булевые операторы, усечение и теги полей, приведены в таблице 1. Для PubMed и Embase поиск ограничивался изучением человека и английским языком. Для CENTRAL и MEDLINE поиск ограничивался рандомизированными контролируемыми исследованиями. Для Google Scholar первые 500 записей, отсортированных по релевантности, были поиском с помощью упрощённой поисковой строки («упражнения И депрессия И (ремиссия ИЛИ медикаментозное лечение)») из-за ограничений платформы по сложному булевомупоиску 19.
Помимо поиска в базе данных, были проведены следующие дополнительные поиски: ручной поиск по спискам литературы по всем включённым исследованиям и соответствующим систематическим обзорам (снежный ком), отслеживание цитирования ключевых исследований с помощью Google Scholar и Web of Science, ручной поиск по ключевым журналам (Mental Health and Physical Activity, Journal of Affective Disorders, Depression and Anxiety и Psychosomatic Medicine) за 2020–2025 годы, а также поиск в реестрах клинических испытаний (ClinicalTrials.gov, ВОЗ ICTRP) для неопубликованных или текущих исследований с использованием поисковых терминов 'exercise' И 'depression'. Полная история поиска, включая количество записей, полученных на каждом этапе для каждой базы данных, приведена в Дополнительной таблице 1. Следовал контрольный список отчётности по поиску PRISMA 2020 (Дополнительный файл 1).
Процесс отбора
Все выявленные записи были экспортированы в EndNote 20 для удаления дублирующих документов. После дедупликации два независимых рецензента провели калибровку случайной выборки из 100 записей, чтобы обеспечить последовательное применение критериев соответствия. После подтверждения приемлемого согласия (κ ≥ 0,80) рецензенты независимо отбирали заголовки и аннотации всех оставшихся записей по заранее заданным критериям. Записи, признанные потенциально релевантными любым из рецензентов, отправлялись на полноценное рассмотрение. Полнотекстовые статьи были получены и независимо оценены теми же двумя рецензентами. Причины исключения на этапе полнотекстового составления были задокументированы согласно рекомендациям PRISMA (например, отсутствие вмешательства физических упражнений, отсутствие диагноза депрессии, отсутствие контрольной группы, несравнительный дизайн, дублирование публикаций). Разногласия на обоих этапах отбора решались путем обсуждения; если консенсуса не удалось достичь, окончательное решение принимал соответствующий автор. Межоценочное соглашение о включении полного текста было рассчитано с использованием статистики каппы Коэна. Хотя EndNote 20 использовался для первоначального удаления дубликатов, дополнительные дубликаты, которые не были обнаружены программным обеспечением (например, из-за небольших различий в названиях, имёнах авторов или сокращениях журналов), были выявлены и удалены двумя независимыми рецензентами во время ручного отбора заголовков/аннотации.
Процесс отбора и отбора изложен в блок-диаграмме PRISMA 2020 (рисунок 1), которая включает количество выявленных записей, удаленных дубликатов, проверенных документов, отчётов для извлечения, отчётов, оцененных на соответствие требованиям, и включенных исследований, с конкретными причинами исключения на каждом этапе. В Google Scholar был поиск по упрощённой строке 'exercise AND depression AND (remission OR medication OR treatment)' со следующими параметрами: сортировка по релевантности, исключение цитат и включение патентов. Первые 500 пластинок были показаны. Поиск был проведён 15 ноября 2025 года в 10:00; 00 утра по Гринвичу, без включённой персонализации, повторение было повторено 16 ноября 2025 года для проверки согласованности.
Извлечение данных
Два рецензента независимо извлекали данные из каждого включённого исследования с помощью стандартизированной, пилотно протестированной формы извлечения данных. Была собрана следующая информация: имя автора, год публикации, страна проведения исследования, размер выборки (общая, группа упражнений, контрольная группа), характеристики участника (возраст, метод диагностики или скрининга депрессии, исходная степень тяжести депрессии), детали вмешательства (режим упражнений, интенсивность, частота, продолжительность, надзор, формат), описание контрольной группы, показатели исхода депрессии (название шкалы и диапазон), время оценки результатов, и статистические результаты (средние, стандартные отклонения, оценки эффекта, доверительные интервалы, p-значения)20. Разногласия между рецензентами решались путем обсуждения или консультации с соответствующим автором.
Элементы данных
Данные были собраны независимо на основе оценки вмешательства физических упражнений при симптомах депрессии, когда исследование дало иные результаты.
Оценка риска предвзятости
Два автора независимо оценивали риск смещения для каждого из включённых исследований с помощью инструмента Cochrane RoB 2 для рандомизированных контролируемых исследований (версия августа 2019 года). Инструмент RoB 2 оценивает пять областей смещения, возникающих в результате процесса рандомизации, отклонений от предполагаемых вмешательств, отсутствующих данных о результатах, измерения результата и выбора сообщаемого результата. Для каждой области рецензенты присваивали оценку «низкий риск предвзятости», «некоторые опасения» или «высокий риск предвзятости». Для каждого исследования по алгоритмам RoB 2 получалось общее суждение о риске предвзятости, согласно алгоритмам RoB 2: «низкий риск» (все домены низкорисковые), «некоторые опасения» (по крайней мере один домен с определёнными проблемами, но без доменов высокого риска) или «высокий риск» (любой домен с высоким риском или несколько доменов с определёнными проблемами). Разногласия между рецензентами решались путем обсуждения, при необходимости арбитром выступал соответствующий автор. Исследования не были исключены на основании оценок риска предвзятости; Вместо этого планировалось провести анализ чувствительности, чтобы ограничить метаанализ исследованиями с общими оценками «низкорисковый» или «низкий риск + некоторые опасения», чтобы оценить надёжность результатов. Межоценочное согласие по общему оценке риска предвзятости было рассчитано с использованиемkappa 21 Коэна.
Анализ подгрупп (анализ модераторов)
Для изучения потенциальных источников гетерогенности и выявления модераторов эффективности упражнений была проведена серия априорных подгрупповых анализов на основе клинически и методологически значимых переменных. Анализ подгрупп проводился только для результатов с не менее 10 исследованиями в каждой подгруппе (для обеспечения достаточной статистической мощности). Были заранее определены следующие переменные подгруппы.
Характеристики упражнений
Режим упражнений как аэробный (например, ходьба, бег, велоспорт) против сопротивления (например, силовые тренировки) против смешанного (аэробные + сопротивления) и другие (йога, танцы, движения на основе осознанности).
Интенсивность упражнений как лёгкая (например, мягкая ходьба, растяжка) и умеренная (например, быстрая ходьба, умеренный велосипед) и интенсивная (например, бег, интервальные тренировки высокой интенсивности) — классифицируется по стандартному пульсу или критериям предполагаемой нагрузки, описанной в каждом исследовании.
Продолжительность упражнений (недели) как короткая (≤8 недель) против средней (9–12 недель) и длинная (≥13 недель).
Супервизия под наблюдением (занятия с инструктором, тренером или терапевтом) против неконтролируемого (домашнее или самостоятельное без прямого присмотра).
Форматируйте как групповое или индивидуальное (домашнее или индивидуальное).
Характеристики популяции
Диагноз депрессии классифицировался как либо большое депрессивное расстройство (МПД), диагностируемое через структурированное клиническое интервью, такое как структурированное клиническое интервью для расстройств DSM (SCID) или мини-международное нейропсихиатрическое интервью (MINI), либо как повышенные депрессивные симптомы, выявленные с помощью валидированных скрининговых инструментов на основе установленных пороговых баллов, включая шкалу депрессии Центра эпидемиологических исследований (CES-D ≥ 16). Инвентаризация депрессии Бека (BDI ≥ 14) или опросник здоровья пациента-9 (PHQ-9 ≥ 10). Возрастная группа классифицировалась как взрослые (18–59 лет) или взрослые (≥60 лет). Базовая тяжесть депрессии классифицировалась как умеренная или тяжёлая в соответствии со стандартными пороговыми баллами для каждой шкалы оценки, при этом умеренная депрессия определялась, например, как балл по шкале оценки депрессии Гамильтона (HAM-D) от 14 до 18 или балл BDI 14–19, а тяжелая депрессия — как балл HAM-D ≥19 или BDI ≥20.
Характеристики дизайна исследования
Тип контрольной группы классифицировался как пассивные, включая лист ожидания, без лечения или обычные контролирующие состояния, либо активные, включая вмешательства с контролем внимания, фармакотерапию или психотерапию. Год публикации был классифицирован на три периода — до 2010, 2010–2019 и 2020–2025 — для изучения возможных временных тенденций в результатах исследования. Риск смещения оценивался с помощью инструмента Cochrane Risk of Bias 2 (RoB 2) и классифицировался как низкорисковый, с некоторыми проблемами или с высоким риском. Размер выборки был классифицирован как малый (n < 50 участников), средний (50–99 участников) или большой (≥100 участников). Тип контрольной группы был классифицирован как пассивный (лист ожидания, обычный уход, без вмешательства) — эти контрольные группы не предоставляют активной терапевтической альтернативы, поэтому эффект упражнений может быть выше из-за ожидания или внимания; и активные (контроль внимания, фармакотерапия, психотерапия) — эти методы контроля обеспечивают нефизические упражнения и имеют достоверную терапевтическую ценность, что позволяет более консервативно оценить конкретный эффект упражнений. В результатах был подтверждён значительно больший эффект для пассивных и активных контролей (p для взаимодействия < 0,10), как предполагалось (см. таблицу 3).
Статистические методы анализа подгрупп
Для анализа каждой подгруппы исследования внутри каждой подгруппы объединялись с использованием модели случайныхэффектов 22. Для сравнения подгрупп использовались мета-регрессионные тесты с смешанными эффектами или подгрупповые взаимодействия. В частности, была рассчитана Q-статистика для различий между подгруппами, и соответствующее p-значение для взаимодействия было представлено. p-значение < 0,10 (вместо 0,05) считалось статистически значимым для различий между подгруппами, что учитывало низкую мощность тестов взаимодействия в мета-анализах. Корректировка с множественными сравнениями (анализ 12 подгрупп) не проводилась; поэтому результаты подгрупп следует интерпретировать как исследовательские.
Анализ чувствительности
Для оценки устойчивости первичных результатов были проведены следующие заранее определённые анализы чувствительности. Выбор модели как повторный анализ обоих исходов с использованием модели с фиксированным эффектом (метод обратной дисперсии) для сравнения с первичными результатами случайных эффектов, исключение исследований с высоким риском ошибки как исключённых с общей оценкой RoB 2 — «высокий риск смещения» (n = 17), повторный анализ оставшихся исследований (низкий риск + некоторые опасения), исключение многогрупповых исследований как исключённых, где комбинировано несколько упражнений, или где использовалась одна контрольная группа для множественных сравнений (n = 9) и повторно проанализировали только испытания с двумя группами, исключив исследования с вчисленными или предполагаемыми данными как исключённые исследования, где предполагались стандартные отклонения для оценок изменений (r = 0,50), а не сообщались (n = 6), исключая исследования до CONSORT как исключённые исследования, опубликованные до 2001 года (n = 5), чтобы оценить, повлияли ли улучшенные стандарты отчетности на оценку эффекта, анализ влияния (оставленный по отдельности) как выполненный мета-анализ с оставшей и выручением, последовательно исключая каждое исследование и пересчитывая объединённый эффект для выявления влиятельных исследований (определяемых как те, чьё удаление изменяет точковую оценку на >10% или перемещает доверительный интервал за исходные границы), а также долгосрочный анализ последующих исследований для исследований, сообщающих данные о последующих наблюдениях через ≥6 месяцев после вмешательства (n = 6), эти данные были объединены отдельно для изучения долговечности эффектов упражнений, без смешивания с первичными данными конечной точки (после вмешательства). Все анализы чувствительности проводились с использованием моделей случайных эффектов, если не указано иное. Результаты анализа чувствительности публикуются в разделе «Результаты» и дополнительных материалах. Любое отклонение от этих заранее определённых анализов сообщается прозрачно.
Извлечение непрерывных данных о результатах (оценки депрессии)
Для каждого включённого исследования средний балл депрессии и его стандартное отклонение (SD) для групп упражнений и контрольной группы были извлечены в первичной конечной точке (определяемой как временная точка, ближайшая к концу тренировочного вмешательства). Для максимизации согласованности между исследованиями применялось следующее иерархическое правило экстракции: скорректированные оценки эффекта (например, различия между группами, полученные по ANCOVA с 95% CI или SE) были приоритизированы, поскольку учитывают исходные дисбалансы и обычно дают наименее предвзятую оценку эффекта вмешательства. Изменения от базовых баллов (после минус-до или процентного изменения) и их SD были извлечены, если скорректированные эффекты не были зафиксированы. Если оценка SD изменений не указывалась напрямую, она рассчитывалась по формуле:
(1)
где предполагался консервативный коэффициент корреляции r = 0,5, если в исследовании не была представлена или предполагаемая корреляция. Только оценки после вмешательства (без скорректировки или изменений) были получены, когда ни скорректированные эффекты, ни оценки изменений были доступны. Это был наименее предпочтительный вариант, поскольку он не учитывает возможные исходные различия между группами. Преобразование из других статистических данных, как если бы средние и SD не указывались напрямую, доступная статистика (медианы и IQR, t-статистика, F-статистика, p-значения или 95% CI) конвертировалась в средние значения и SD с использованием стандартных формул из Кокрановского справочника (глава 6). Исследования, сообщавшие только медианы и диапазоны, включались только в том случае, если размеры выборки были достаточно большими (n ≥ 25 на группу), чтобы предполагать приблизительную нормальность, или если авторы исследования предоставляли средние показатели и SD по запросу.
Несколько временных точек: В исследованиях, сообщавших о нескольких точках наблюдения, была выделена точка, ближайшая к концу активного периода вмешательства (обычно 8–12 недель). Долгосрочные данные наблюдения (≥6 месяцев после вмешательства) были извлечены отдельно для планируемого вторичного анализа долговечности, но эти данные не объединялись с первичными данными конечных точек. Множественные шкалы депрессии. Когда в исследовании сообщалось более чем одна шкала депрессии (например, как HAM-D, так и BDI), шкалы, оценённые клиницистами (HAM-D, MADRS), отдавались приоритетом над шкалами самоотчёта (BDI, CES-D, PHQ-9, GDS), поскольку шкалы, оценённые клиницистами, считаются золотым стандартом в исследованиях депрессии. Если оба были зафиксированы, извлекалась первичная мера исхода, определённая авторами исследования. Импутация отсутствующих SD так, будто стандартные отклонения отсутствуют и не могут быть вычислены на основе доступной статистики; они были зачислены на основе среднего SD из исследований с похожими размерами выборок и одинаковой шкалой депрессии. Были проведены анализы чувствительности, исключая исследования с влименированными SD, чтобы оценить влияние этой импутации. Все решения по извлечению данных принимались независимо двумя авторами с использованием стандартизированной формы извлечения данных. Несоответствия разрешались путем обсуждения или соответствующего автора. Правило извлечения и любые отклонения фиксировались.
Показатели эффекта
Для дихотомического исхода (ремиссия депрессии) рассчитывались коэффициенты шансов (OR) с 95% доверительными интервалами (CI). Для непрерывного результата (оценки тяжести депрессии) предполагалось, что включенные исследования будут использовать различные шкалы оценки депрессии (например, шкала оценки депрессии Гамильтона, инвентаризация депрессии Бека, PHQ-9, CES-D, шкала гериатрической депрессии). Хотя включённые исследования использовали разные шкалы оценки депрессии, стандартная средняя разница (SMD) была зафиксирована, поскольку на всех шкалах были установлены уравнения преобразования в HAM-D.
Статистический синтез
Для дихотомического исхода (ремиссия депрессии) рассчитывались объединённые коэффициенты шансов (ОР) с 95% доверительными интервалами (ДИ). Для непрерывного исхода (оценки тяжести депрессии) были рассчитаны объединённые стандартизированные средние различия (SMD, Хеджес-g) с 95% ДИ, поскольку в включенных исследованиях использовались различные шкалы оценки депрессии. Учитывая ожидаемое клиническое и методологическое разнообразие между исследованиями (различия в протоколах упражнений, популяциях, контрольных условиях и показателях исхода), для всех первичных анализов была выбрана модель случайных эффектов (метод ДерСимониана и Лэрда). Гетерогенность количественно оценивалась с помощью статистикиI-2, интерпретировалась по критериям Руководства Кокрана как следующие 0–40% (возможно, не важно), 30–60% (умеренная гетерогенность), 50–90% (значительная гетерогенность) и 75–100% (значительная гетерогенность). Также была оценена дисперсия между исследованиями (tau 2), и при необходимости рассчитаны 95% интервалы прогнозирования объединённых эффектов.
Статистический анализ и гетерогенность
Из-за ожидаемого клинического и методологического разнообразия в включённых исследованиях (включая вариации типа упражнений, интенсивности, продолжительности, супервизии, характеристик популяции, тяжести депрессии, контрольных условий и шкалы измерения депрессии), для всех первичных анализов была выбрана модель случайных эффектов (метод ДерСимониана и Лэрда)22. Модель случайных эффектов предполагает, что истинный эффект варьируется в разных исследованиях, и предоставляет более консервативную оценку с более широкими доверительными интервалами, что уместно с учётом предполагаемой гетерогенности.
Оценка гетерогенности
Гетерогенность была количественно измерена с помощью статистикиI2 , которая отражает процент общей вариации между исследованиями, обусловленную истинной гетерогенностью, а не случайностью. I2 значения интерпретировались следующим образом: 0–40% (может быть неважно); 30–60% (умеренная гетерогенность); 50–90% (значительная гетерогенность); 75–100% (значительная гетерогенность), как в критериях Кокрана Справочника. В дополнение к I2 оценивались интервалы прогнозирования между исследованиями (tau 2) и 95% интервалы прогнозирования объединённого эффекта, когда это было уместно.
Обоснование выбора модели
Модель с фиксированным эффектом не использовалась для первичного анализа, поскольку исследования функционально не идентичны (они различаются по протоколам упражнений, популяциям и показателям исходов), предположение о едином истинном эффекте, разделённом во всех исследованиях, неправдоподобно в исследованиях упражнений и депрессии, и даже если I2 показан низким (например, I2 = 48% при ремиссии), клиническое разнообразие оправдывает подход случайных эффектов. Для полноты также проводились анализы чувствительности с использованием модели фиксированного эффекта, чтобы выяснить, влияет ли выбор модели на выводы; Эти результаты представлены в дополнительных материалах.
Оценка предвзятости публикаций
Смещение публикаций и эффекты небольших исследований оценивались с помощью визуального осмотра графиков воронки и линейного регрессионного теста Эггера. Для каждого результата были построены воронковые графики, показывающие размер эффекта (логарифмическое отношение шансов на ремиссию; стандартизированная средняя разница для оценок депрессии) по сравнению со стандартной ошибкой. Для количественной оценки тест Эггера регрессирует стандартизированную оценку эффекта по её точности (обратную к стандартной ошибке). Статистически значимый перехват (p < 0,10 в мета-анализах с ≥10 исследований) указывает на наличие асимметрии воронкового графика, что может указывать на публикационную смещённость или влияние небольших исследований. В то же время p ≥ 0.10 не указывает на статистические доказательства такого искажения.
Интервалы прогнозирования
Для первичного мета-анализа случайных эффектов было рассчитано 95% интервалов прогнозирования, которые оценивают диапазон, в пределах которого будет опасть истинный эффект будущего исследования. Широкие интервалы прогнозирования указывают на то, что эффект физических упражнений может существенно различаться в зависимости от учреждений и популяций, что имеет важные клинические последствия. Для многоручных исследований, в которых несколько физических рук объединялись в одну группу, для расчёта комбинированных средних оценок, стандартных отклонений и размеров выборки использовались формулы из Руководства Кокрана. В исследованиях с использованием одной контрольной руки для сравнения нескольких упражнений двойного подсчёта избегали, деля размер выборки контрольной группы на количество упражнений, применяемых при расчёте размеров эффектов. Все анализы проводились с использованием Reviewer Manager версии 5.3, при этом многогранная обработка верифицировалась двумя авторами независимо.
Число, необходимое для лечения (NNT) расчёт
Число, необходимое для лечения (NNT), рассчитывалось из объединённого коэффициента шансов (OR) на ремиссию с помощью формулы

где CER (частота контрольных событий) — это совокупная скорость ремиссии по всем включённым исследованиям. NNT также рассчитывался с использованием альтернативного метода, предложенного Фурукавой и Лейхтом (2011), который преобразует d Коэна (из SMD) в NNT, используя площадь под нормальной кривой. Значения NNT рассчитывались для первичного анализа (все исследования), для подгрупп (исследования с низким риском предвзятости, исследования только с MDD, исследования с контролируемыми упражнениями) и для сравнения с опубликованными значениями NNT для психотерапии и антидепрессантов. NNT ≤ 10 считался клинически значимым.
Переход к клинически знакомым метрикам (BDI и HAM-D)
Для улучшения клинической интерпретации объединённая стандартизированная средняя разница (SMD) для оценок депрессии была преобразована в оценочные средние различия по двум широко используемым шкалам депрессии: Инвентаризация депрессии Бека (BDI, диапазон 0–63) и шкала оценки депрессии Гамильтона (HAM-D, диапазон 0–52). Преобразование использовалось по следующей формуле

где SDобъединяется, референсом был объединённый базовый стандартный отклонение от исследований, использовавших BDI (n = 8 исследований) или HAM-D (n = 16 исследований) соответственно. Этот подход предполагает, что размер SMD-эффекта согласован на разных масштабах. Наблюдаемые средние различия в этих исследованиях также сообщаются как проверка чувствительности. Изменение на ≥3 балла по BDI или HAM-D считалось клинически значимым согласно рекомендациямNICE 5.
Сравнение с проверенными методами лечения депрессии
Для контекста эффекта физических упражнений по сравнению с другими методами лечения депрессии первой линии, объединённый NNT для упражнений был сравнин с опубликованными значениями NNT в недавних высококачественных мета-анализах. Психотерапия, как отмечали Cuijpers и др. (2020), имеет NNT 2,5 для психотерапии во всех возрастных группах. Антидепрессанты, как сообщали Cipriani и др. (2018), имеют NNT 4,3 по сравнению с плацебо. Эти сравнения носят описательный характер и не основаны на личных соревнованиях. Данные о физических упражнениях не объединялись с данными психотерапии или медикаментов, а различия в популяциях исследований, определениях исходов и временных точках ограничивают прямую сопоставимость.
Оценка смещения в отчетности (публикационная смещённость)
Были построены вороночные графики для каждого результата (ремиссия и балл депрессии), вороночные графики, показывающие размер эффекта (логарифмическое отношение шансов ремиссии; стандартизированная средняя разница для оценок депрессии) по сравнению со стандартной ошибкой. Асимметрия в воронковой графике может указывать на смещение публикаций, влияние малых исследований или гетерогенность. Регрессионный тест Эггера, также известный как линейный регрессионный тест Эггера, был проведён для формальной оценки асимметрии графика воронки. Тест Эггера регрессирует стандартизированную оценку эффекта на её точность (обратную к стандартной ошибке). Статистически значимый перехват (p < 0,10 для теста Эггера, как рекомендовано Руководством Кокрана для результатов с менее чем 10 исследованиями, или p < 0,05 для более крупных мета-анализов) указывает на наличие эффектов небольших исследований или смещения публикаций. Наоборот, p ≥ 0,05 (или p ≥ 0,10) не указывает на статистически значимые доказательства такого искажения. Осторожность с интерпретацией, поскольку асимметрия сюжета Воронки не является синонимом предвзятости публикации; Он также может возникать из-за истинной гетерогенности, различий в качестве исследования или случайности, и результаты следует интерпретировать соответственно23.
Уверенность доказательств (оценка GRADE)
Общая достоверность доказательств по каждому результату (балл ремиссии и депрессии) оценивалась с помощью системы оценки оценки, развития и оценки (GRADE). Два автора независимо оценивали достоверность и разрешали разногласия путем обсуждения. Подход GRADE рассматривает пять областей, которые могут снижать определённость: риск смещения (на основе оценок RoB 2, включая долю исследований с низким риском, с некоторыми опасениями или высоким риском), несоответствие (на основе статистики I2 , интервалов прогнозирования и пересечения доверительных интервалов), косвенности (на основе различий между группами исследований, вмешательствами, сравнителями и результатами относительно вопроса обзора) неточности (на основе оптимального размера информации и того, пересекают ли 95% доверительные интервалы клинически важные пороги, такие как отношение шансов 1,0 для ремиссии или стандартизированная средняя разница 0,2 при небольшом влиянии на баллы депрессии), а также публикационная смещённость (на основе асимметрии воронкового графика и теста Эггера). Определённость оценивалась следующим образом: высокая (дальнейшие исследования вряд ли изменят доверие к оценке эффекта); Умеренный (дальнейшие исследования, вероятно, существенно повлияют на доверие и могут изменить оценку); Низкий (дальнейшие исследования, скорее всего, окажут значительное влияние на доверие и, скорее всего, изменят оценку); и Очень низкий (любая оценка эффекта очень неопределенна). Оценки уверенности проводились отдельно для ремиссии (дихотомический исход) и депрессии (непрерывный исход).