Artykuł badawczy

Przegląd metaanalizy interwencji ruchowych w leczeniu objawów depresji

99 wyświetleń

DOI:

10.3791/70951

7 sierpnia 2026

W tym artykule

Podsumowanie

Ćwiczenia znacząco zwiększyły wskaźniki remisji depresji (OR = 2,40) i zmniejszyły nasilenie objawów (SMD = –0,96) w 40 badaniach RCT (2667 uczestników). Te wyniki wspierają ćwiczenia jako uzupełniające podejście, choć niejednorodność i stronniczość ogranicza pewność.

Streszczenie

Niniejsza meta‑analiza oszacowała wpływ ćwiczeń na objawy depresji. W przeciwieństwie do sieciowych meta‑analiz, które porównują metody ćwiczeń, niniejsza parami meta‑analiza specyficznie ilościowo określa wpływ uporządkowanych ćwiczeń wobec braku ćwiczeń, stosując rygorystyczne definicje grupy kontrolnej i zaktualizowane metody. Przeszukanie literatury do listopada 2025 zidentyfikowało 10 123 zapisy. Czterdzieści randomizowanych kontrolowanych badań spełniało kryteria inkluzji. Skuteczne wielkości efektów obliczono przy użyciu modeli efektów losowych; współczynniki ryzyka (OR) dla remisji i standardowe różnice średnich (SMD) dla wyników depresji. Heterogeniczność oceniono za pomocą I2. Ćwiczenia znacząco zwiększyły współczynniki remisji (OR = 2,40; 95% CI, 1,97–2,93; p < 0,001; I2 = 49%) i zmniejszyły wyniki depresji (SMD = –0,96; 95% CI, –1,27 do –0,65; p < 0,001; I2 = 87%) w porównaniu z grupami kontrolnymi. Liczba potrzebna do leczenia dla jednej dodatkowej remisji wynosiła 2,1. Zgrupowane SMD odpowiadało klinicznie znaczącym redukcjom. Analizy podgrup wykazały większe efekty dla nadzorowanych ćwiczeń i pasywnych kontroli (np. lista oczekujących) w stosunku do aktywnych porównań (np. farmakoterapia). Jednak wyniki mają poważne ograniczenia; tylko 12/40 badań (30%) miało niskie ryzyko zniekształcenia (RoB 2); większość miała krótkie okresy obserwacji (≤16 tygodni); warunki kontrolne znacznie różniły się (lista oczekujących do farmakoterapii); i bardzo wysoka heterogeniczność wyników depresji (I2 = 87%) utrzymywała się mimo użycia SMD. 95% przedział przewidywania dla SMD przekraczało zero, co wskazuje, że ćwiczenia mogą nie przynieść korzyści wszystkim przyszłym populacjom. Ocena jakości zaleceń, rozwój i ocena (GRADE) była umiarkowana dla remisji, ale niska dla wyników depresji. Pomimo tych ograniczeń, ćwiczenia były związane ze znacząco wyższymi remisjami i niższymi wynikami depresji. Wyniki te wspierają ćwiczenia jako uzupełniające podejście w depresji, szczególnie dla osiągnięcia remisji. Jednakże potrzebne są wysokiej jakości, duże skalowane badania RCT z znormalizowanymi wynikami i dłuższym okresem obserwacji, zanim będzie można wydać kliniczne rekomendacje.

Wprowadzenie

Depresja to powszechna i uniemożliwiająca funkcjonowanie choroba psychiczna związana z wyższą śmiertelnością, współistnieniem chorób i niższą jakością życia1. Ponad 300 milionów ludzi, czyli około 4,4% ludności świata, cierpi na depresję2. Obecnie zalecane są psychoterapia i leki przeciwdepresyjne (lub połączenie obu) jako leczenie3. Jednak terapia psychologiczna jest zwykle droga i daje tylko wskaźnik remisji na poziomie 50%4. Leki przeciwdepresyjne często powodują objawy odstawienia, nawroty i działania niepożądane5. Warto zauważyć, że około dwie trzecie dorosłych osób cierpiących na depresję nie otrzymuje właściwej opieki6. Nieleczona depresja często się pogarsza i może prowadzić do chorób współistniejących, co jeszcze bardziej zwiększa koszty dla społeczeństwa7. Zarówno Narodowy Instytut Zdrowia i Doskonałości Opieki (NICE), jak i WHO zalecają ćwiczenia jako uzupełniające leczenie depresji8,9.

Wyniki z kilku metaanaliz badających przeciwdepresyjny wpływ ćwiczeń na osoby z depresją dostarczyły dowodów na poparcie tych sugestii10,11,12. Niemniej jednak niektóre z tych metaanaliz8 wskazały na znaczące efekty ćwiczeń, podczas gdy inne zidentyfikowały umiarkowanie słabe efekty11,12. Konfliktujące wyniki są spowodowane różnicami metodologicznymi i koncepcyjnymi dotyczącymi kryteriów włączenia i technik analitycznych. Na przykład niektóre badania wykluczyły badania, które oceniają obecność depresji przy użyciu uznanych narzędzi do przesiewowego badania, koncentrując się zamiast na tych z diagnozą zaburzenia depresyjnego wielokrotnego8. Inne badania analizowały wpływ ćwiczeń samodzielnie lub w połączeniu z lekami jako leczenie depresji11,12 w odniesieniu do badań opublikowanych w latach 2003-2019. Dodatkowo, w niektórych przeglądach uwzględniono badania, w których pacjenci w grupach kontrolnych również otrzymywali interwencje ćwiczeniowe13. Biorąc pod uwagę, że nawet łagodne ćwiczenia mogą mieć działanie przeciwdepresyjne, może to prowadzić do przekłamań14.

Najważniejsze jest to, że wiele ocen wyraziło zaniepokojenie tym, że gdyby ograniczyć się do „niskiej ryzyka stronniczości” randomizowanych kontrolowanych badań klinicznych (RCT), ćwiczenia nie miałyby wyraźnego wpływu8,13. W rezultacie obecne metaanalizy nie przyniosły wystarczająco mocnych danych, aby wspierać stosowanie ćwiczeń jako udowodnionej, skutecznej opcji leczenia depresji przez lekarzy na całym świecie. Te błędy metodologiczne zostały rozwiązane przez jedną metaanalizę11, która uwzględniała tylko badania, które porównywały ćwiczenia z nieaktywnymi grupami kontrolnymi i koncentrowały się na badaniach, które obejmowały próby z zaburzeniem depresyjnym wielokrotnym zdiagnozowanym za pomocą narzędzi diagnostycznych oraz próby z depresją z wynikami kryterialnymi w walidowanych narzędzach do przesiewowego badania. Autorzy nie uwzględnili badań porównujących różne reżimy ćwiczeń. Jednak ostatnio opublikowano znaczną liczbę prac, co wymaga zaktualizowanych metaanaliz wpływu przeciwdepresyjnego ćwiczeń, które uwzględnią ograniczenia wcześniejszych przeglądów.

To pokazuje konieczność szybkich, dostępnych alternatywnych opcji leczenia. Ostatnie systematyczne przeglądy potwierdziły, że strukturalne programy aktywności fizycznej i ćwiczeń spójnie poprawiają objawy depresji i powiązane wyniki zdrowia psychicznego, co wspiera ćwiczenia jako potencjalnie skalowalne uzupełniające lub skomplementarne podejście15,16. W artykule zawarte są wiele form ćwiczeń, w tym ćwiczenia aerobowe, trening siłowy, mieszane ćwiczenia, joga, tai chi, taniec i inne podejścia łączące umysł i ciało. Jednak dyskusja nadal tendencyjnie opisuje „ćwiczenia” jako pojedynczą kategorię interwencji15. Mimo rosnącej bazy dowodów na ćwiczenia jako leczenie depresji, kilka nierozwiązanych kwestii uzasadnia zaktualizowaną metaanalizę. Po pierwsze, wcześniejsze metaanalizy przyniosły sprzeczne wnioski. Te różnice wynikają z różnic metodologicznych, w tym z włączenia badań z aktywnymi grupami kontrolnymi (np. rozciąganie, relaksacja lub psychoterapia), które mogą zmniejszać wielkość efektu; włączenia badań, w których grupy kontrolne również otrzymały interwencje ćwiczeniowe; oraz użycia różnych narzędzi oceny ryzyka stronniczości. Po drugie, najnowsze kompleksowe metaanalizy w tej dziedzinie zostały opublikowane w la

Protokół

Kryteria kwalifikacji

Badania zostały uwzględnione, jeśli spełniały wszystkie poniższe kryteria, sformułowane zgodnie ze schematem PICOS (Populacja, Interwencja, Komparator, Wyniki, Projekt badania)17. Wszystkie platformy i materiały wykorzystane w niniejszej pracy są wymienione w Tabeli materiałów. Wszystkie wyszukiwania w bazach danych przeprowadzono w listopadzie 2025 roku. Poza programami RevMan 5.3 oraz EndNote 20 nie wykorzystano żadnego dodatkowego komercyjnego oprogramowania (np. SAS, SPSS, R). Ocena GRADE została przeprowadzona ręcznie przy użyciu narzędzia online GRADEpro GDT; wersja została zapisana z datą dostępu.

Populacja (P)

Uczestnicy wykazywali klinicznie istotne objawy depresyjne, definiowane jako formalna diagnoza zaburzeń depresyjnych (MDD) lub dystymii zgodnie z kryteriami DSM (dowolna wersja) lub ICD, potwierdzone w ustrukturyzowanym wywiadzie klinicznym (np. SCID, MINI, CIDI); lub wynik powyżej zwalidowanego punktu odcięcia w standaryzowanym narzędziu przesiewowym do oceny depresji (np. Beck Depression Inventory ≥ 14, Hamilton Depression Rating Scale ≥ 14, CES-D ≥ 16, PHQ-9 ≥ 10, Geriatric Depression Scale ≥ 11). Uczestnicy mogli być w każdym wieku (dzieci, młodzież, dorośli, osoby starsze)18. Badania, w których wzięli udział uczestnicy z chorobami współistniejącymi o podłożu somatycznym lub psychiatrycznym (np. choroby układu krążenia, cukrzyca, zaburzenia lękowe, zaburzenia związane z używkami), zostały włączone tylko wtedy, gdy w analizie podstawowej wyniki dla podgrupy z depresją raportowano oddzielnie lub gdy ≥80% uczestników spełniało kryteria depresji. Wykluczono badania, w których depresja była wtórnym punktem końcowym w populacji osób niezdepresjonowanych (np. pacjenci z niewydolnością serca bez przesiewowej oceny depresji). Nie wprowadzono ograniczeń dotyczących wyjściowego stopnia nasilenia depresji (lekka, umiarkowana, ciężka), jednak stopień nasilenia został wyodrębniony do analiz podgrup.

Interwencja (I)

Interwencja polegała na ustrukturyzowanym, zaplanowanym wysiłku fizycznym, zdefiniowanym jako każda forma ćwiczeń aerobowych, oporowych, mieszanych (aerobowe + oporowe) lub alternatywnych (joga, tai chi, taniec), prowadzonych przez co najmniej 2 tygodnie. Interwencje wysiłkowe mogły być nadzorowane (przez trenera, terapeutę lub instruktora) lub nienadzorowane (wykonywane w domu, samodzielnie). Badania, w których ćwiczenia łączono z inną aktywną interwencją (np. ćwiczenia + farmakoterapia, ćwiczenia + uważność), włączono tylko wtedy, gdy efekt ćwiczeń mógł zostać wyizolowany (np. ćwiczenia + farmakoterapia vs sama farmakoterapia). Wykluczono badania, w których interwencja polegała wyłącznie na poradach dotyczących aktywności fizycznej (bez ustrukturyzowanego planu ćwiczeń) lub poradnictwie w zakresie stylu życia.

Komparator (C)

Grupa kontrolna nie otrzymała ustrukturyzowanej interwencji w postaci ćwiczeń. Dopuszczalne warunki kontrolne sklasyfikowano jako kontrole pasywne (brak aktywnej interwencji terapeutycznej), np. lista oczekujących (leczenie odroczone), opieka standardowa (standardowe postępowanie medyczne bez ustrukturyzowanych ćwiczeń) lub brak interwencji; oraz kontrole aktywne (nie-ćwiczeniowe interwencje terapeutyczne), np. kontrola uwagi (np. edukacja zdrowotna niezwiązana z ćwiczeniami, sesje relaksacyjne lub lekki stretching nie spełniający kryteriów intensywności ćwiczeń), farmakoterapia (wyłącznie leki przeciwdepresyjne) lub psychoterapia (terapia psychologiczna bez ćwiczeń). Wykluczono badania, w których grupa kontrolna otrzymała jakąkolwiek formę ustrukturyzowanych ćwiczeń (w tym minimalne ćwiczenia lub stretching spełniający kryteria intensywności ćwiczeń). Uwaga dotycząca rozbieżności: choć w sekcji innowacji stwierdzono, że wykluczono badania z aktywnymi interwencjami psychologicznymi lub kontrolami w postaci stretchingu/relaksacji, następnie rozszerzono kryteria kwalifikowalności o aktywne grupy porównawcze (farmakoterapię, psychoterapię, kontrolę uwagi), aby odzwierciedlić rzeczywiste pytanie kliniczne dotyczące tego, jak ćwiczenia wypadają w porównaniu z innymi uznanymi metodami leczenia. Rozbieżność ta została omówiona w dyskusji. Wszystkie analizy są stratyfikowane według rodzaju kontroli (pasywna vs. aktywna), aby zbadać wpływ rodzaju kontroli na wielkości efektu.

Wyniki (O)

Badanie zgłaszało co najmniej jedną miarę wyniku specyficzną dla depresji: remisję depresji (dychotomiczną, zdefiniowaną przez autorów badania jako brak spełnienia kryteriów diagnostycznych lub wynik poniżej punktu odcięcia w zwalidowanej skali); LUB (b) zmianę w ciągłym wyniku nasilenia depresji mierzonego w zwalidowanej skali (np. HAM-D, BDI, CES-D, PHQ-9, GDS, MADRS). Wykluczone zostały badania zgłaszające wyłącznie niespecyficzne miary nastroju (np. „dobrostan”, „stan emocjonalny” bez zastosowania zwalidowanej skali depresji).

Projekt badania (S)

Uwzględniono wyłącznie randomizowane badania kontrolowane (RCT). Wykluczono prospektywne badania kohortowe, badania kliniczno-kontrolne, badania retrospektywne, serie przypadków oraz raporty przypadków, ponieważ wiążą się one z wysokim ryzykiem błędów związanych z czynnikami zakłócającymi i błędem selekcji podczas szacowania efektów leczenia. Badania mogły mieć projekt z grupami równoległymi lub naprzemiennymi (w przypadku badań naprzemiennych wyodrębniono tylko pierwszą fazę). Wymagano, aby w momencie rozpoczęcia badania w każdym ramieniu uczestniczyło co najmniej 10 osób, w celu zminimalizowania wpływu małej liczebności prób w badaniach. Nie wprowadzono ograniczeń językowych, jednak badania nieanglojęzyczne włączono tylko wtedy, gdy dostępny był pełny przekład.

Kryteria wykluczenia

Wykluczono badania, w których depresja nie była głównym punktem końcowym lub w których populacja nie była dobierana pod kątem depresji (np. ogólne populacje medyczne, w których depresja była miernikiem wtórnym). Wykluczono badania, w których interwencja w postaci ćwiczeń była realizowana jako element wieloskładnikowej interwencji stylu życia, bez wyizolowanego efektu ćwiczeń. Wykluczono badania, w których grupa kontrolna brała udział w jakiejkolwiek formie ustrukturyzowanych ćwiczeń. Wykluczono badania z niewystarczającymi danymi do obliczenia wielkości efektu (brak raportowanych średnich, odchyleń standardowych lub wyników zmian, których nie udało się uzyskać od autorów). Wykluczono powielone publikacje dotyczące tej samej kohorty badawczej (uwzględniono tylko najbardziej kompletny lub najnowszy raport). Wykluczono abstrakty konferencyjne, rozprawy doktorskie oraz nieopublikowane manuskrypty, do których nie było dostępnego pełnego tekstu.

Źródła informacji

Całe badanie przedstawiono na Rysunku 1 w formie schematu blokowego PRISMA. Literaturę włączono do badania, jeśli spełnione zostały następujące kryteria włączenia: badanie było randomizowanym badaniem kontrolowanym (RCT); wybrani do badania pacjenci cierpieli na depresję; a warunkiem kontrolnym był brak ćwiczeń. Akceptowalne grupy kontrolne obejmowały opiekę standardową (standardowe leczenie medyczne bez ustrukturyzowanych ćwiczeń), listę oczekujących (leczenie odroczone), brak interwencji, kontrolę uwagi (np. edukację zdrowotną niezwiązaną z ćwiczeniami, sesje relaksacyjne lub lekkie rozciąganie niespełniające kryteriów recepty ćwiczeń) lub leczenie farmakologiczne (wyłącznie leki przeciwdepresyjne). Wykluczono badania, w których grupa kontrolna przechodziła jakiekolwiek ustrukturyzowane treningi aerobowe, oporowe lub mieszane. Badania, w których grupy kontrolne otrzymywały psychoterapię lub terapię poznawczo-behawioralną bez komponentu ćwiczeń, włączono tylko wtedy, gdy zostały one jasno zdefiniowane jako grupy niećwiczące.

W badaniu porównano interwencje polegające na ćwiczeniach fizycznych z warunkami kontrolnymi. Grupy kontrolne zdefiniowano jako porównywacze niećwiczące, obejmujące opiekę standardową, listę oczekujących, brak leczenia, kontrolę uwagi (np. edukację zdrowotną, relaksację lub ćwiczenia rozciągające, które nie spełniały kryteriów intensywności ćwiczeń) lub samo leczenie farmakologiczne. Badania wykluczono, jeśli grupa kontrolna uczestniczyła w jakiejkolwiek ustrukturyzowanej interwencji z ćwiczeniami fizycznymi lub jeśli ćwiczenia porównywano wyłącznie z innym schematem ćwiczeń, bez ramienia kontrolnego niećwiczącego. Wykluczono badania, które nie oceniały wpływu interwencji z ćwiczeniami na objawy depresji, badania nad depresją u pacjentów bez ćwiczeń lub grupy kontrolnej oraz badania bez grupy porównawczej.

Postępowanie w przypadku badań wieloramiennych
W badaniach obejmujących więcej niż dwa istotne ramiona (np. wiele interwencji ćwiczeniowych lub wiele grup porównawczych) zastosowano następujące strategie w celu uniknięcia podwójnego liczenia oraz błędów jednostki analizy: w przypadku wielu ramion ćwiczeniowych względem jednego ramienia kontrolnego, gdy badanie porównywało dwie lub więcej różnych interwencji ćwiczeniowych (np. trening aerobowy vs. trening oporowy) z jedną grupą kontrolną, ramiona ćwiczeniowe połączono w jedną zbiorczą grupę ćwiczeń, stosując wzory zalecane w Podręczniku Cochrane (Rozdział 23). Podejście to pozwala uniknąć podwójnego liczenia uczestników grupy kontrolnej przy zachowaniu niezależności statystycznej; w przypadku ćwiczeń względem wielu porównawczych grup niećwiczących, gdy badanie porównywało ćwiczenia z dwiema lub więcej odrębnymi warunkami kontrolnymi (np. standardową opieką i farmakoterapią), wybrano jedynie ten warunek kontrolny, który najlepiej odpowiadał definicji „kontroli niećwiczącej” (kolejność priorytetów: lista oczekujących ≥ standardowa opieka ≥ kontrola uwagi > farmakoterapia > psychoterapia).

W przypadku występowania wielu grup kontrolnych bez ćwiczeń, wybrano najbardziej konserwatywny (najmniej aktywny) punkt odniesienia, aby uniknąć przeszacowania efektu ćwiczeń; ćwiczenia vs. tylko ćwiczenia (brak kontroli bez ćwiczeń). Badania, w których porównywano jedynie różne rodzaje aktywności fizycznej (np. wysoką intensywność vs. niską intensywność) bez grupy kontrolnej niećwiczącej, zostały wykluczone z analizy podstawowej, ponieważ nie spełniały kryterium porównania „ćwiczenia vs. kontrola”. W przypadku interwencji łączonych, gdzie ramię interwencyjne obejmowało ćwiczenia oraz inny aktywny komponent (np. ćwiczenia + farmakoterapia, ćwiczenia + uważność), ramię to włączono tylko wtedy, gdy można było wyizolować efekt ćwiczeń. Jeśli ramię łączone porównywano z samym komponentem niebędącym ćwiczeniami (np. ćwiczenia + farmakoterapia vs. sama farmakoterapia), różnicę interpretowano jako odzwierciedlającą efekt ćwiczeń. Jeśli taka izolacja nie była możliwa, badanie wykluczono. Aby ocenić stabilność strategii agregacji dla badań wieloramiennych, przeprowadzono analizę wrażliwości z wykluczeniem wszystkich badań wieloramiennych, a wyniki porównano z wynikami analizy podstawowej. Wszelkie istotne różnice zostały zaraportowane.

Wybór ramienia kontrolnego w przypadku występowania wielu komparatorów niebędących ćwiczeniami przeprowadzono w następujący sposób: jeśli badanie porównywało ćwiczenia z dwiema lub więcej odrębnymi warunkami kontrolnymi (np. standardową opieką i farmakoterapią), zastosowano hierarchiczną regułę wyboru w celu uniknięcia arbitralnych decyzji, w której priorytet nad kontrolami aktywnymi otrzymały kontrole pasywne (lista oczekujących ≥ standardowa opieka ≥ brak interwencji), aby lepiej wyizolować specyficzny efekt ćwiczeń. Jeśli dostępne były wyłącznie kontrole aktywne, wybrano najbardziej konserwatywny komparator (farmakoterapia ≥ psychoterapia ≥ kontrola uwagi), aby uniknąć przeszacowania efektu ćwiczeń, oraz przeprowadzono analizy wrażliwości obejmujące wszystkie dostępne ramiona kontrolne (poprzez podział grupy ćwiczącej na poszczególne komparatory), aby sprawdzić, czy reguła wyboru wpłynęła na zbiorczą estymację. Wyniki tych analiz wrażliwości przedstawiono w Materiałach uzupełniających.

Strategia wyszukiwania
Przeprowadzono systematyczne przeszukanie następujących baz danych online od momentu ich powstania do listopada 2025 roku: PubMed, Embase (platforma OVID), Cochrane Central Register of Controlled Trials (CENTRAL), MEDLINE (platforma OVID) oraz Google Scholar. Pełne strategie wyszukiwania, obejmujące terminy MeSH, terminy Emtree, słowa kluczowe, operatory logiczne, ucinanie wyrazów oraz tagi pól, przedstawiono w Tabeli 1. W przypadku baz PubMed i Embase wyszukiwanie ograniczono do badań na ludziach w języku angielskim. W przypadku CENTRAL i MEDLINE wyszukiwanie ograniczono do randomizowanych badań kontrolowanych. W Google Scholar przeszukano pierwsze 50 rekordów posortowanych według trafności, stosując uproszczony ciąg wyszukiwania ('exercise AND depression AND (remission OR medication OR treatment)') ze względu na ograniczenia platformy w zakresie złożonego wyszukiwania logicznego19.

Oprócz przeszukiwania baz danych przeprowadzono następujące dodatkowe wyszukiwania: ręczne przeszukiwanie list referencyjnych wszystkich włączonych badań oraz odpowiednich przeglądów systematycznych (metoda kuli śnieżnej), śledzenie cytowań kluczowych włączonych badań za pomocą Google Scholar i Web of Science, ręczne przeszukiwanie kluczowych czasopism (Mental Health and Physical Activity, Journal of Affective Disorders, Depression and Anxiety oraz Psychosomatic Medicine) dla lat 2020–2025 oraz przeszukiwanie rejestrów badań klinicznych (ClinicalTrials.gov, WHO ICTRP) w celu znalezienia nieopublikowanych lub trwających badań z wykorzystaniem terminów wyszukiwania „exercise” AND „depression”. Pełna historia wyszukiwania, w tym liczba rekordów pobranych na każdym etapie dla każdej bazy danych, została przedstawiona w Tabeli uzupełniającej 1. Postępowano zgodnie z listą kontrolną raportowania wyszukiwań PRISMA 2020 (Plik uzupełniający 1).

Proces selekcji

Wszystkie zidentyfikowane rekordy zostały wyeksportowane do programu EndNote 20 w celu usunięcia duplikatów. Po deduplikacji dwóch niezależnych recenzentów przeprowadziło ćwiczenie kalibracyjne na losowej próbie 10 rekordów, aby zapewnić spójne stosowanie kryteriów kwalifikowalności. Po potwierdzeniu akceptowalnej zgodności (κ ≥ 0.80), recenzenci niezależnie przeskanowali tytuły i streszczenia wszystkich pozostałych rekordów pod kątem wcześniej określonych kryteriów kwalifikowalności. Rekordy uznane za potencjalnie istotne przez któregokolwiek z recenzentów zostały przekazane do pełnotekstowej analizy. Pełne teksty artykułów zostały pozyskane i niezależnie ocenione przez tych samych dwóch recenzentów. Przyczyny wykluczenia na etapie analizy pełnego tekstu zostały udokumentowane zgodnie z wytycznymi PRISMA (np. brak interwencji w formie ćwiczeń, brak diagnozy depresji, brak grupy kontrolnej, projekt nieporównawczy, duplikacja publikacji). Rozbieżności na każdym z etapów selekcji były rozstrzygane w drodze dyskusji; w przypadku braku konsensusu ostateczną decyzję podejmował autor korespondencyjny. Zgodność między recenzentami w zakresie włączenia pełnych tekstów została obliczona przy użyciu statystyki kappa Cohena. Chociaż do wstępnego usuwania duplikatów wykorzystano program EndNote 20, dodatkowe duplikaty, których oprogramowanie nie wykryło (np. ze względu na niewielkie różnice w tytułach, nazwiskach autorów lub skrótach czasopism), zostały zidentyfikowane i usunięte podczas ręcznego przeglądu tytułów i streszczeń przez dwóch niezależnych recenzentów.

Proces przesiewania i selekcji został podsumowany na schemacie blokowym PRISMA 2020 (Rysunek 1), który obejmuje liczbę zidentyfikowanych rekordów, usunięte duplikaty, przesiewne analizy rekordów, raporty przeznaczone do pobrania, raporty oceniane pod kątem kwalifikowalności oraz włączone badania, wraz ze szczegółowymi powodami wykluczenia na każdym etapie. W wyszukiwarce Google Scholar zastosowano uproszczony ciąg zapytania 'exercise AND depression AND (remission OR medication OR treatment)' z następującymi ustawieniami: sortowanie według trafności, wykluczenie cytowań oraz uwzględnienie patentów. Przesiewowo przeanalizowano pierwsze 50 rekordów. Wyszukiwanie przeprowadzono 15 listopada 2025 r. o godzinie 10:0 GMT, bez włączonej personalizacji, a następnie powtórzono 16 listopada 2025 r. w celu weryfikacji spójności.

Ekstrakcja danych

Dwóch recenzentów niezależnie wyodrębniło dane z każdego uwzględnionego badania, korzystając ze zestandaryzowanego, przetestowanego w wersji pilotażowej formularza ekstrakcji danych. Zebrano następujące informacje: nazwisko pierwszego autora, rok publikacji, kraj, w którym przeprowadzono badanie, wielkość próby (całkowita, grupa ćwicząca, grupa kontrolna), charakterystyka uczestników (wiek, metoda diagnozy lub przesiewowej depresji, wyjściowy stopień nasilenia depresji), szczegóły interwencji (rodzaj ćwiczeń, intensywność, częstotliwość, czas trwania, nadzór, format), opis grupy kontrolnej, miary wyników depresji (nazwa skali i zakres), moment oceny wyników oraz wyniki statystyczne (średnie, odchylenia standardowe, szacunki efektu, przedziały ufności, wartości p)20. Rozbieżności między recenzentami rozstrzygano w drodze dyskusji lub poprzez konsultację z autorem korespondencyjnym.

Elementy danych

W przypadku uzyskania odmiennych wyników w badaniu, dane gromadzono niezależnie na podstawie oceny wpływu interwencji w postaci ćwiczeń fizycznych na objawy depresji.

Ocena ryzyka błędu systematycznego

Dwoje autorów niezależnie oceniło ryzyko błędu systematycznego dla każdego włączonego badania, korzystając z narzędzia Cochrane RoB 2 dla randomizowanych badań kontrolowanych (wersja z sierpnia 2019 r.). Narzędzie RoB 2 ocenia pięć obszarów błędu wynikającego z procesu randomizacji, odchyleń od zamierzonych interwencji, brakujących danych o wynikach, pomiaru wyników oraz wyboru raportowanego wyniku. Dla każdego obszaru recenzenci przypisali ocenę „niskie ryzyko błędu” (low-risk of bias), „pewne wątpliwości” (some concerns) lub „wysokie ryzyko błędu” (high risk of bias). Następnie, zgodnie z algorytmami RoB 2, sformułowano ogólną ocenę ryzyka błędu dla każdego badania jako „niskie ryzyko” (wszystkie obszary z niskim ryzykiem), „pewne wątpliwości” (przynajmniej jeden obszar z pewnymi wątpliwościami, ale brak obszarów z wysokim ryzykiem) lub „wysokie ryzyko” (jakikolwiek obszar oceniony jako wysokie ryzyko lub wiele obszarów z pewnymi wątpliwościami). Rozbieżności między recenzentami rozstrzygano w drodze dyskusji, a w razie potrzeby arbiterem był autor korespondencyjny. Badania nie były wykluczane na podstawie ocen ryzyka błędu; zamiast tego zaplanowano analizy wrażliwości, aby ograniczyć metaanalizę do badań z ogólną oceną „niskie ryzyko” lub „niskie ryzyko + pewne wątpliwości”, w celu zbadania odporności wyników. Zgodność między sędziami dla ogólnych ocen ryzyka błędu obliczono przy użyciu współczynnika kappa Cohena21.

Analizy podgrup (analizy moderatorów)

W celu zbadania potencjalnych źródeł heterogeniczności oraz zidentyfikowania moderatorów skuteczności ćwiczeń przeprowadzono szereg analiz podgrup a priori, opartych na zmiennych istotnych klinicznie i metodologicznie. Analizy podgrup wykonano wyłącznie dla wyników, w których w każdej podgrupie znajdowało się co najmniej 10 badań (aby zapewnić odpowiednią moc statystyczną). Zdefiniowano wcześniej następujące zmienne podgrup.

Charakterystyka ćwiczeń

Tryb ćwiczeń: aerobowy (np. chodzenie, bieganie, jazda na rowerze) vs. oporowy (np. trening z ciężarami) vs. mieszany (aerobowy + oporowy) vs. inny (joga, taniec, ruch oparty na uważności).

Intensywność ćwiczeń określona jako niska (np. spokojny spacer, rozciąganie), umiarkowana (np. szybki spacer, umiarkowana jazda na rowerze) lub wysoka (np. bieganie, trening interwałowy o wysokiej intensywności) – zaklasyfikowana na podstawie standardowych kryteriów tętna lub subiektywnego odczucia wysiłku opisanych w każdym badaniu.

Czas trwania ćwiczeń (tygodnie) określono jako krótki (≤8 tygodni), średni (9–12 tygodni) lub długi (≥13 tygodni).

Nadzór jako nadzorowany (sesje ćwiczeń prowadzone przez instruktora, trenera lub terapeutę) w przeciwieństwie do nienadzorowanego (domowego lub samokierowanego, bez bezpośredniego nadzoru).

Sformatuj jako grupowe w przeciwieństwie do indywidualnego (domowego lub jeden na jeden).

Charakterystyka populacji

Diagnozę depresji sklasyfikowano jako zaburzenie depresyjne większe (MDD), zdiagnozowane za pomocą ustrukturyzowanego wywiadu klinicznego, takiego jak ustrukturyzowany wywiad kliniczny dla zaburzeń DSM (SCID) lub mini międzynarodowy wywiad neuropsychiatryczny (MINI), lub jako nasilone objawy depresyjne zidentyfikowane za pomocą walidowanych narzędzi przesiewowych w oparciu o ustalone wartości odcięcia, w tym skalę depresji Centrum Badań Epidemiologicznych (CES-D ≥ 16), inwentarz depresji Becka (BDI ≥ 14) lub kwestionariusz zdrowia pacjenta-9 (PHQ-9 ≥ 10). Grupę wiekową podzielono na dorosłych (18–59 lat) oraz osoby starsze (≥60 lat). Wartość wyjściową nasilenia depresji sklasyfikowano jako umiarkowaną lub ciężką zgodnie ze standardowymi wartościami odcięcia dla każdej skali oceny, gdzie depresję umiarkowaną zdefiniowano, na przykład, jako wynik w skali oceny depresji Hamiltona (HAM-D) w przedziale 14–18 lub wynik BDI w przedziale 14–19, a depresję ciężką jako wynik HAM-D ≥19 lub wynik BDI ≥20.

Charakterystyka projektu badania

Typ grupy kontrolnej zaklasyfikowano jako pasywny, obejmujący warunki kontrolne takie jak lista oczekujących, brak leczenia lub standardowa opieka, lub aktywny, obejmujący interwencje kontrolne w postaci uwagi, farmakoterapię lub psychoterapię. Rok publikacji podzielono na trzy okresy — przed 2010 r., 2010–2019 i 2020–2025 — aby zbadać potencjalne trendy czasowe w wynikach badań. Ryzyko błędu oceniono za pomocą narzędzia Cochrane Risk of Bias 2 (RoB 2) i zaklasyfikowano jako niskie, budzące pewne obawy lub wysokie. Wielkość próby zaklasyfikowano jako małą (łącznie n < 50 uczestników), średnią (50–9 uczestników) lub dużą (≥10 uczestników). Typ grupy kontrolnej podzielono na pasywny (lista oczekujących, standardowa opieka, brak interwencji) – grupy te nie zapewniają aktywnej alternatywy terapeutycznej, więc efekt ćwiczeń może być większy ze względu na efekty oczekiwań lub uwagi; oraz aktywny (kontrola uwagi, farmakoterapia, psychoterapia) – grupy te zapewniają interwencję niebędącą ćwiczeniami o wiarygodnej wartości terapeutycznej, co pozwala na bardziej konserwatywną ocenę specyficznego efektu ćwiczeń. Zgodnie z hipotezą, w wynikach potwierdzono istotnie większy efekt dla grup kontrolnych pasywnych w porównaniu z aktywnymi (p dla interakcji < 0,10; patrz Tabela 3).

Metody statystyczne dla analiz podgrup

W przypadku każdej analizy podgrup, badania w obrębie danej podgrupy zostały połączone przy użyciu modelu efektów losowych2. Do porównania podgrup zastosowano meta-regresję z efektami mieszanymi lub testy interakcji podgrup. W szczególności obliczono statystykę Q dla różnic między podgrupami i przedstawiono powiązaną z nią wartość p dla interakcji. Wartość p < 0,10 (zamiast 0,05) uznano za statystycznie istotną dla różnic między podgrupami, uwzględniając niską moc testów interakcji w metaanalizach. Nie przeprowadzono korekty na wielokrotne porównania (12 analiz podgrup); w związku z tym wyniki dla podgrup należy interpretować jako wstępne.

Analizy wrażliwości

Aby ocenić odporność głównych wyników, przeprowadzono następujące z góry określone analizy wrażliwości. Wybór modelu: ponownie przeanalizowano oba wyniki przy użyciu modelu efektów stałych (metoda odwrotności wariancji), aby porównać je z głównymi wynikami modelu efektów losowych; wykluczenie badań o wysokim ryzyku błędu systematycznego: wykluczono badania z ogólną oceną RoB 2 jako „wysokie ryzyko błędu systematycznego” (n = 17) i ponownie przeanalizowano pozostałe badania (niskie ryzyko + pewne wątpliwości); wykluczenie badań wieloramiennych: wykluczono badania, w których połączono wiele ramion ćwiczeń lub w których jedna grupa kontrolna była wykorzystywana do wielu porównań (n = 9) i ponownie przeanalizowano wyłącznie badania dwuramienne; wykluczenie badań z danymi imputowanymi lub założonymi: wykluczono badania, w których odchylenia standardowe dla wyników zmian były założone (r = 0,50), a nie raportowane (n = 6); wykluczenie badań sprzed wprowadzenia standardów CONSORT: wykluczono badania opublikowane przed 201 rokiem (n = 5), aby ocenić, czy poprawione standardy raportowania wpłynęły na szacunki efektu; analiza wpływu (leave-one-out): przeprowadzono metaanalizę z pominięciem jednego badania, sekwencyjnie usuwając każde badanie i przeliczając łączony efekt w celu zidentyfikowania badań wpływowych (zdefiniowanych jako takie, których usunięcie zmienia oszacowanie punktowe o >10% lub przesuwa przedział ufności poza pierwotne granice); analiza długoterminowego obserwowania: dla badań raportujących dane z obserwacji ≥6 miesięcy po interwencji (n = 6) dane te zostały połączone oddzielnie, aby zbadać trwałość efektów ćwiczeń, bez mieszania ich z danymi punktu końcowego (po interwencji). Wszystkie analizy wrażliwości przeprowadzono z użyciem modeli efektów losowych, chyba że wskazano inaczej. Wyniki analiz wrażliwości przedstawiono w sekcji Wyniki oraz w materiałach uzupełniających. Wszelkie odstępstwa od tych z góry określonych analiz zostały raportowane w sposób przejrzysty.

Ekstrakcja ciągłych danych wynikowych (wyniki skali depresji)

Dla każdego włączonego badania wyciągnięto średni wynik depresji oraz odchylenie standardowe (SD) dla grupy ćwiczącej i grupy kontrolnej w głównym punkcie końcowym (zdefiniowanym jako moment najbliższy zakończeniu interwencji w postaci ćwiczeń). Aby zmaksymalizować spójność między badaniami, zastosowano następującą hierarchiczną zasadę ekstrakcji: priorytetowo traktowano skorygowane szacunki efektu (np. różnice między grupami wyznaczone za pomocą ANCOVA z 95% CI lub SE), ponieważ uwzględniają one różnice wyjściowe i zazwyczaj dostarczają najmniej obciążony szacunek efektu interwencji. W przypadku braku raportowanych skorygowanych efektów wyciągnięto wyniki zmiany względem wartości początkowej (wynik po minus przed lub zmiana procentowa) oraz ich SD. Jeśli SD dla wyników zmiany nie zostało podane bezpośrednio, obliczono je przy użyciu następującego wzoru:

Wzór na zmianę odchylenia standardowego, SD_change = √(SD^2_baseline + SD^2_post - 2rSD_baselineSD_post).   (1)

gdzie przyjęto konserwatywny współczynnik korelacji r = 0.5, chyba że w badaniu podano raportowaną lub możliwą do przypisania korelację. W przypadku braku dostępnych efektów skorygowanych lub wyników zmian, wyodrębniano wyłącznie wyniki po interwencji (bez korekty lub wyników różnicowych). Była to opcja najmniej preferowana, ponieważ nie uwzględnia ona potencjalnych różnic wyjściowych między grupami. W sytuacjach, gdy średnie i SD nie zostały podane bezpośrednio, dokonano konwersji innych statystyk (median i IQR, statystyk t, statystyk F, wartości p lub 95% CI) na średnie i SD, korzystając ze standardowych wzorów z podręcznika Cochrane (Rozdział 6). Badania raportujące jedynie mediany i zakresy włączono tylko wtedy, gdy liczebność próby była wystarczająco duża (n ≥ 25 na grupę), aby przyjąć przybliżoną normalność rozkładu, lub gdy autorzy badania dostarczyli średnie i SD na prośbę.

Wiele punktów czasowych: w przypadku badań zgłaszających wiele punktów czasowych obserwacji, wyodrębniono punkt czasowy najbliższy zakończeniu okresu aktywnej interwencji (zazwyczaj 8–12 tygodni). Dane z długoterminowej obserwacji (≥6 miesięcy po interwencji) wyodrębniono osobno do planowanej wtórnej analizy trwałości efektów, jednak dane te nie były łączone z danymi dotyczącymi głównego punktu końcowego. Wiele skal depresji: gdy w badaniu zgłoszono więcej niż jedną skalę depresji (np. zarówno HAM-D, jak i BDI), priorytetowo traktowano skale oceniane przez klinicystów (HAM-D, MADRS) nad skalami samoopisowymi (BDI, CES-D, PHQ-9, GDS), ponieważ skale oceniane przez klinicystów są uznawane za złoty standard w badaniach nad depresją. Jeśli zgłoszono obie, wyodrębniono główny miernik wyniku zdefiniowany przez autorów badania. Imputacja brakujących SD: w przypadku braku odchyleń standardowych, których nie można było obliczyć na podstawie dostępnych statystyk, zastosowano imputację, przyjmując średnie SD z badań o podobnej wielkości próby i z zastosowaniem tej samej skali depresji. Przeprowadzono analizy wrażliwości, wykluczając badania z imputowanymi SD, aby ocenić wpływ tej imputacji. Wszystkie decyzje dotyczące ekstrakcji danych zostały podjęte niezależnie przez dwóch autorów przy użyciu ustandaryzowanego formularza ekstrakcji danych. Rozbieżności rozstrzygano poprzez dyskusję lub przez autora korespondencyjnego. Odnotowano regułę ekstrakcji oraz wszelkie odstępstwa od niej.

Mierniki efektu

W przypadku wyniku dychotomicznego (remisja depresji) obliczono ilorazy szans (OR) wraz z 95-procentowymi przedziałami ufności (CI). W odniesieniu do wyniku ciągłego (wyniki nasilenia depresji) przewidywano, że w analizowanych badaniach zastosowano różne skale oceny depresji (np. skala oceny depresji Hamiltona, inwentarz depresji Becka, PHQ-9, CES-D, geriatryczna skala depresji). Mimo że w analizowanych badaniach wykorzystano różne skale oceny depresji, zgłoszono standaryzowaną różnicę średnich (SMD), ponieważ wszystkie skale posiadały opracowane równania konwersji na skalę HAM-D.

Synteza statystyczna

Dla wyniku dychotomicznego (remisja depresji) obliczono zbiorcze ilorazy szans (OR) wraz z 95% przedziałami ufności (CI). Dla wyniku ciągłego (wyniki nasilenia depresji) obliczono zbiorcze standaryzowane różnice średnich (SMD, g Hedgesa) wraz z 95% CI, ponieważ w uwzględnionych badaniach zastosowano różne skale oceny depresji. Ze względu na przewidywaną różnorodność kliniczną i metodologiczną między badaniami (zróżnicowanie protokołów ćwiczeń, populacji, warunków kontrolnych i miar wyników), do wszystkich analiz głównych a priori wybrano model efektów losowych (metoda DerSimonian i Lairda)2. Heterogeniczność określono za pomocą statystyki I2, interpretując ją zgodnie z kryteriami podręcznika Cochrane w następujący sposób: 0–40% (może nie być istotna), 30–60% (umiarkowana heterogeniczność), 50–90% (istotna heterogeniczność) oraz 75–10% (znaczna heterogeniczność). Oszacowano również wariancję między badaniami (tau2) i w stosownych przypadkach obliczono 95% przedziały predykcji dla efektów zbiorczych.

Analiza statystyczna i heterogeniczność

Z uwagi na oczekiwaną różnorodność kliniczną i metodologiczną w ramach włączonych badań (w tym różnice w rodzaju ćwiczeń, intensywności, czasie trwania, nadzorze, charakterystyce populacji, stopniu nasilenia depresji, warunkach kontrolnych oraz skalach pomiaru depresji), do wszystkich analiz głównych a priori wybrano model efektów losowych (metoda DerSimoniana i Lairda)2. Model efektów losowych zakłada, że rzeczywisty efekt różni się między badaniami i zapewnia bardziej konserwatywną ocenę z szerszymi przedziałami ufności, co jest odpowiednie w obliczu przewidywanej heterogeniczności.

Ocena heterogeniczności

Heterogeniczność określono za pomocą statystyki I2, która reprezentuje procent całkowitej zmienności między badaniami wynikający z rzeczywistej heterogeniczności, a nie z przypadku. Wartości I2 interpretowano w następujący sposób: 0–40% (może nie być istotna); 30–60% (umiarkowana heterogeniczność); 50–90% (znacząca heterogeniczność); 75–10% (wysoka heterogeniczność), zgodnie z kryteriami podręcznika Cochrane Handbook. Oprócz I2 oszacowano wariancję międzybadawczą (tau2) i, w stosownych przypadkach, podano 95% przedziały predykcyjne dla efektu zbiorczego.

Uzasadnienie wyboru modelu

Do żadnej z analiz głównych nie zastosowano modelu efektów stałych, ponieważ badanie nie są funkcjonalnie identyczne (różnią się protokołami ćwiczeń, populacjami i miernikami wyników), założenie o jednym prawdziwym efekcie wspólnym dla wszystkich badań jest nieprawdopodobne w badaniach nad wpływem ćwiczeń na depresję, a nawet gdy wartość I2 wydaje się niska (np. I2 = 48% dla remisji), sama różnorodność kliniczna uzasadnia podejście z efektami losowymi. Dla kompletności przeprowadzono również analizy wrażliwości z użyciem modelu efektów stałych, aby sprawdzić, czy wybór modelu wpłynął na wyciągnięte wnioski; wyniki te zostały przedstawione w materiałach uzupełniających.

Ocena błędu publikacji

Błąd publikacji oraz efekty małych badań oceniano zarówno za pomocą wizualnej analizy wykresów lejkowych, jak i testu regresji liniowej Eggera. Dla każdego punktu końcowego wygenerowano wykresy lejkowe, przedstawiające wielkość efektu (logarytm ilorazu szans dla remisji; standaryzowana różnica średnich dla wyników w skali depresji) w odniesieniu do błędu standardowego. W ocenie ilościowej test Eggera przeprowadza regresję standaryzowanej oceny efektu względem precyzji (odwrotności błędu standardowego). Statystycznie istotny punkt przecięcia (p < 0,10 w metaanalizach obejmujących ≥10 badań) sugeruje obecność asymetrii wykresu lejkowego, co może wskazywać na błąd publikacji lub efekty małych badań. Odwrotnie, p ≥ 0,10 wskazuje na brak statystycznych dowodów na występowanie takiego błędu.

Przedziały predykcji

W przypadku głównej metaanalizy z efektami losowymi obliczono 95% przedziały predykcji, które szacują zakres, w jakim mieściłby się rzeczywisty efekt w przyszłym badaniu. Szerokie przedziały predykcji wskazują, że efekt ćwiczeń może znacznie różnić się w zależności od warunków i populacji, co ma istotne znaczenie kliniczne. W przypadku badań wieloramiennych, w których wiele ram ćwiczeń połączono w jedną grupę, do obliczenia średnich łącznych, odchyleń standardowych oraz wielkości próby zastosowano wzory zawarte w podręczniku Cochrane Handbook. W badaniach, w których jedna grupa kontrolna była wykorzystywana w wielu porównaniach z ćwiczeniami, unikano podwójnego liczenia poprzez dzielenie wielkości próby grupy kontrolnej przez liczbę ram ćwiczeń podczas obliczania wielkości efektu. Wszystkie analizy przeprowadzono przy użyciu programu Reviewer Manager w wersji 5.3, a sposób postępowania z ramami wieloramiennymi został zweryfikowany niezależnie przez dwóch autorów.

Obliczanie liczby pacjentów koniecznych do leczenia (NNT)

Liczbę pacjentów wymaganych do leczenia (NNT) obliczono z połączonego ilorazu szans (OR) dla remisji, korzystając ze wzoru

Wzór NNT: 1/(CER×(1−OR^-1)); równanie do obliczania liczby pacjentów, których należy leczyć.

gdzie CER (control event rate) stanowiło skumulowany wskaźnik remisji we wszystkich analizowanych badaniach. NNT obliczono również przy użyciu alternatywnej metody zaproponowanej przez Furukawę i Leuchta (201), która przelicza d Cohena (z SMD) na NNT, wykorzystując pole pod krzywą rozkładu normalnego. Wartości NNT obliczono dla analizy głównej (wszystkie badania), dla podgrup (badania o niskim ryzyku błędu systematycznego, badania dotyczące wyłącznie MDD, badania nad ćwiczeniami pod nadzorem) oraz w celu porównania z opublikowanymi wartościami NNT dla psychoterapii i leków przeciwdepresyjnych. Za klinicznie istotną uznano wartość NNT ≤ 10.

Konwersja na klinicznie znane mierniki (BDI oraz HAM-D)

Aby ułatwić interpretację kliniczną, połączona standaryzowana różnica średnich (SMD) dla wyników depresji została przeliczona na szacowane różnice średnich w dwóch powszechnie stosowanych skalach depresji: Inwentarzu Depresji Becka (BDI, zakres 0–63) oraz Skali Oceńania Depresji Hamiltona (HAM-D, zakres 0–52). Do przeliczenia wykorzystano następujący wzór

Wzór matematyczny dla szacowanej różnicy średnich; SMD x SD_pooled; równanie wartości referencyjnej.

gdzie SDpooled, reference oznacza połączone odchylenie standardowe wyjściowe z badań, w których wykorzystano odpowiednio skalę BDI (n = 8 badań) lub HAM-D (n = 16 badań). Podejście to zakłada, że wielkość efektu SMD jest spójna dla poszczególnych skal. Obserwowane różnice średnich z tych badań zostały również przedstawione w ramach analizy wrażliwości. Zmiana o ≥3 punkty w skali BDI lub HAM-D została uznana za istotną klinicznie zgodnie z wytycznymi NICE5.

Porównanie z uznanymi metodami leczenia depresji

Aby osadzić efekt ćwiczeń w kontekście innych metod leczenia pierwszego rzutu w depresji, skumulowany wskaźnik NNT dla ćwiczeń porównano z opublikowanymi wartościami NNT z aktualnych, wysokiej jakości metaanaliz. Psychoterapia, jak zgłosili Cuijpers i wsp. (2020), ma NNT wynoszące 2,5 dla wszystkich grup wiekowych. Leki przeciwdepresyjne, według doniesień Cipriani i wsp. (2018), mają NNT wynoszące 4,3 dla leków w porównaniu z placebo. Porównania te mają charakter opisowy i nie opierają się na badaniach bezpośrednich (head-to-head). Dane dotyczące ćwiczeń nie były łączone z danymi dotyczącymi psychoterapii lub farmakoterapii, a różnice w populacjach badanych, definicjach wyników i punktach czasowych ograniczają możliwość bezpośredniego porównania.

Ocena błędu raportowania (błędu publikacji)

Wygenerowano wykresy lejkowe dla każdego punktu końcowego (remisja oraz wynik depresji) – wykresy te przedstawiają wielkość efektu (logarytm ilorazu szans dla remisji; standaryzowana różnica średnich dla wyników depresji) w odniesieniu do błędu standardowego. Asymetria wykresu lejkowego może wskazywać na błąd publikacji, efekty małych badań lub heterogeniczność. W celu formalnej oceny asymetrii wykresu lejkowego przeprowadzono test regresji Eggera, znany również jako liniowy test regresji Eggera. Test Eggera analizuje regresję standaryzowanej oceny efektu względem jej precyzji (odwrotności błędu standardowego). Statystycznie istotny punkt przecięcia (p < 0,10 dla testu Eggera, zgodnie z zaleceniami podręcznika Cochrane dla punktów końcowych obejmujących mniej niż 10 badań, lub p < 0,05 dla większych metaanaliz) sugeruje występowanie efektów małych badań lub błędu publikacji. Odwrotnie, p ≥ 0,05 (lub p ≥ 0,10) wskazuje na brak statystycznie istotnych dowodów na taki błąd. Należy zachować ostrożność w interpretacji, ponieważ asymetria wykresu lejkowego nie jest tożsama z błędem publikacji; może ona również wynikać z rzeczywistej heterogeniczności, różnic w jakości badań lub przypadku, a wyniki należy interpretować odpowiednio23.

Stopień pewności dowodów (ocena GRADE)

Ogólną pewność dowodów dla każdego punktu końcowego (remisja oraz wynik w skali depresji) oceniono z wykorzystaniem systemu Grading of Recommendations Assessment, Development and Evaluation (GRADE). Dwóch autorów niezależnie oceniło pewność dowodów, a rozbieżności rozstrzygano w drodze dyskusji. Podejście GRADE uwzględnia pięć domen, które mogą obniżyć pewność: ryzyko błędu (na podstawie ocen RoB 2, w tym proporcji badań o niskim, pewnym lub wysokim ryzyku), niespójność (na podstawie statystyki I2, przedziałów predykcyjnych i nakładania się przedziałów ufności), pośredniość (na podstawie różnic między populacjami badawczymi, interwencjami, grupami kontrolnymi i punktami końcowymi w odniesieniu do pytania badawczego), nieprecyzyjność (na podstawie optymalnej wielkości informacji oraz tego, czy 95% przedziały ufności przekraczają klinicznie istotne progi, takie jak iloraz szans 1,0 dla remisji lub standaryzowana różnica średnich 0,2 dla małego efektu w wynikach skali depresji) oraz błąd publikacji (na podstawie asymetrii wykresu lejkowego i testu Eggera). Pewność oceniano w następujący sposób: Wysoka (bardzo mało prawdopodobne jest, aby dalsze badania zmieniły poziom ufności co do szacunku efektu); Umiarkowana (dalsze badania prawdopodobnie wywrą istotny wpływ na poziom ufności i mogą zmienić szacunek); Niska (bardzo prawdopodobne jest, aby dalsze badania wywarły istotny wpływ na poziom ufności i zmieniły szacunek); oraz Bardzo niska (każdy szacunek efektu jest bardzo niepewny). Oceny pewności przeprowadzono oddzielnie dla remisji (punkt końcowy dychotomiczny) oraz wyników w skali depresji (punkt końcowy ciągły).

Wyniki

Wybór badania

Schemat blokowy PRISMA 2020 (Rysunek 1) podsumowuje proces wyboru badań. Przeszukiwanie baz danych pozwoliło zidentyfikować 10 123 rekordów (Cochrane Library: n = 1 845; Embase: n = 2 567; Google Scholar: n = 3 210; MEDLINE via OVID: n = 1 892; PubMed: n = 609). Po usunięciu 1 018 zduplikowanych rekordów do analizy pozostało 9 105 unikalnych wpisów. Odnotowano rozbieżność między określonymi a zastosowanymi kryteriami włączenia dla grup kontrolnych. W sekcji dotyczącej innowacji początkowo stwierdzono, że wykluczono badania z aktywnymi interwencjami psychologicznymi lub kontrolami w postaci rozciągania/relaksacji. Jednak w trakcie procesu przeglądu uznano, że wykluczenie aktywnych komparatorów ograniczyłoby kliniczną generalizowalność i spowodowałoby pominięcie istotnych badań (np. ćwiczenia vs. farmakoterapia). W związku z tym ostateczne kryteria kwalifikowalności (udokumentowane w Metodach) dopuszczały zarówno pasywne, jak i aktywne kontrole bez wykonywania ćwiczeń. Rozbieżność ta została przejrzyście opisana tutaj oraz w dyskusji (Ograniczenia). Aby zbadać wpływ włączenia aktywnych komparatorów, przeprowadzono zaplanowane analizy podgrup z rozwarstwieniem według rodzaju kontroli (pasywna vs. aktywna; patrz Tabela 3) oraz analizy wrażliwości z całkowitym wykluczeniem aktywnych kontroli.

Przegląd tytułów i streszczeń

Dwoje recenzentów niezależnie przeanalizowało tytuły i streszczenia wszystkich 9 105 rekordów. Ćwiczenie kalibracyjne na 10 rekordach (κ = 0,92) potwierdziło spójne stosowanie kryteriów kwalifikowalności. Z tej liczby wykluczono 8 997 rekordów, ponieważ ewidentnie nie spełniały one kryteriów włączenia;

Niezwiązane z depresją (n = 3 64); brak interwencji w postaci ćwiczeń (n = 3 015); badania na zwierzętach lub in vitro (n = 56); przeglądy, komentarze, redakcyjne lub streszczenia konferencyjne (n = 1 102); powielone publikacje, których nie zidentyfikowano podczas wstępnego procesu usuwania duplikatów w programie EndNote, lecz wykryto później podczas ręcznego przeglądu tytułów/streszczeń (n = 153); oraz publikacje w językach innych niż angielski, dla których nie było dostępnego tłumaczenia (n = 527).

Pobieranie pełnego tekstu

Dokonano oceny kwalifikowalności pełnych tekstów raportów dla pozostałych 108 rekordów.

Wykluczenie z pełnego tekstu

Po szczegółowej ocenie wykluczono 68 pełnotekstowych artykułów z następujących powodów: brak kontrolnej grupy niećwiczącej (np. ćwiczenia vs. wyłącznie ćwiczenia lub brak grupy kontrolnej) (n = 10); brak miary wyniku depresji (n = 9); brak oryginalnych danych (np. tylko protokół, powielona publikacja tej samej kohorty) (n = 9); brak ustrukturyzowanej interwencji w postaci ćwiczeń (np. tylko zalecenia dotyczące aktywności fizycznej, brak przypisanego programu) (n = 8); populacja nie była obciążona depresją (np. zdrowi ochotnicy, inne zaburzenia psychiatryczne) (n = 17); niewystarczające dane do obliczenia wielkości efektu (nie podano średnich/SD i nie udało się ich uzyskać od autorów) (n = 9) oraz projekt nierandomizowany (obserwacyjny, niekontrolowany) (n = 6).

Ostateczne włączenie

Do metaanalizy włączono czterdzieści randomizowanych badań kontrolowanych, które spełniły wszystkie kryteria kwalifikacji. Charakterystyka tych 40 badań została przedstawiona w Tabeli uzupełniającej 1. Łącznie uwzględniono czterdzieści badań; 37 wzięło udział w analizie remisji, a 24 w analizie nasilenia depresji. W 40 badaniach wzięło udział łącznie 2 67 uczestników z depresją (1 415 w grupach ćwiczeń, 1 252 w grupach kontrolnych)24,25,26,27,28,29,30,31,32,3,34,35,36,37,38,39,40,41,42,43,4,45,46,47,48,49,50,51,52,53,54,5,56,57,
58,59,60,61,62,63. Wielkość próby wahała się od 16 do 266 uczestników. Ograniczenia te mogą wpływać na istotność otrzymanych wyników.

Ekstrakcja ciągłych danych wynikowych
Z 40 uwzględnionych badań wyekstrahowano następujące typy szacunków efektu: wyłącznie wyniki po interwencji (n = 23, 52,3%), wyniki zmiany względem stanu wyjściowego (n = 14, 31,8%) oraz skorygowane szacunki efektu z modeli ANCOVA lub modeli podobnych (n = 7, 15,9%). Żadne z badań nie wymagało bezpośredniej imputacji brakujących odchyleń standardowych z wykorzystaniem danych zewnętrznych (np. zapożyczania SD z innych badań), ponieważ wszystkie badania dostarczyły wystarczających danych surowych — średnich i SD przed interwencją oraz po interwencji — do obliczenia wymaganych szacunków efektu. W przypadku badań raportujących wiele punktów czasowych obserwacji (n = 1), wyekstrahowano główny punkt końcowy na koniec okresu interwencji (mediana 12 tygodni, zakres 3–16 tygodni). Dane z długoterminowej obserwacji (≥6 miesięcy) były dostępne w 6 badaniach i są raportowane oddzielnie w analizie wrażliwości. W porównaniu z grupą kontrolną ćwiczenia fizyczne wykazały istotnie wyższą remisję (OR, 2,40; 95% CI, 1,97–2,93, p < 0,01) przy niskiej heterogeniczności (I2 = 49%), co wskazuje, że w przyszłym badaniu przeprowadzonym w podobnych warunkach rzeczywiste OR dla remisji mogłoby wynosić od 1,28 (umiarkowana korzyść) do 4,73 (duża korzyść), co odzwierciedla umiarkowaną niepewność, oraz niższy wynik depresji (SMD, -0,96; 95% CI, -1,27–-0,65, p < 0,01) przy wysokiej heterogeniczności (I2 = 87%) u pacjentów z depresją, co przedstawiono na Rysunkach 2 i 3. Znaczna heterogeniczność (I2 = 87%) prawdopodobnie odzwierciedla częściowo różnorodność skal. Ten szeroki przedział przecina zero, co wskazuje, że w niektórych przyszłych uwarunkowaniach lub populacjach ćwiczenia mogą nie obniżyć wyników depresji lub mogą być nawet szkodliwe. Wynik ten podkreśla potrzebę indywidualnego dobierania zaleceń dotyczących ćwiczeń fizycznych w leczeniu depresji.

Liczba pacjentów wymaganych do leczenia (NNT)

Łączny wskaźnik remisji w grupach kontrolnych (CER) wyniósł 32,4% (430/1326). Przy zastosowaniu OR dla remisji (2,40), obliczona wartość NNT dla analizy podstawowej wyniosła 2,1 (95% CI, 1,7–2,8). Oznacza to, że około 2 pacjentów musi przejść terapię ćwiczeniami, aby jeden dodatkowy pacjent osiągnął remisję w porównaniu z grupą kontrolną. Stosując alternatywną metodę opartą na podstawowym SMD (przeliczonym na wartość bezwzględną d Cohena = 0,96), wartość NNT wyniosła 2,0, co jest zgodne z szacunkiem opartym na OR. Wartości NNT dla podgrup przedstawiały się następująco: badania o niskim ryzyku błędu (n = 12); NNT = 2,8 (95% CI, 2,1–4,2); badania obejmujące wyłącznie MDD (n = 24); NNT = 1,9 (95% CI, 1,5–2,6); oraz badania nad ćwiczeniami pod nadzorem (n = 35); NNT = 1,6 (95% CI, 1,3–2,1)

Porównanie z uznanymi metodami leczenia;

Wartość NNT dla ćwiczeń fizycznych w analizie pierwotnej (2,1) była niższa (bardziej korzystna) niż opublikowane wartości NNT dla psychoterapii (2,5) i leków przeciwdepresyjnych (4,3). Jednakże porównania te są pośrednie i powinny być interpretowane z ostrożnością ze względu na różnice w populacjach badanych, definicjach wyników oraz punktach czasowych.

Średnie różnice specyficzne dla skali (BDI i HAM-D)

Wykorzystując zbiorczą SMD (–0,96) oraz zbiorcze odchylenia standardowe wyjściowe z badań z zastosowaniem każdej z skal: Inwentarz Depresji Becka (BDI); na podstawie 8 badań (n = 292) przy zbiorczym SD wyjściowym wynoszącym 10,3, szacowana różnica średnich wyniosła –6,5 (95% CI, od –9,2 do –3,8) punktu BDI. Obserwowane różnice średnich w tych 8 badaniach mieściły się w zakresie od –4,2 do –8,9, przy czym wszystkie wskazywały na korzyść ćwiczeń. Skala Oceny Depresji Hamiltona (HAM-D); na podstawie 16 badań (n = 634) przy zbiorczym SD wyjściowym wynoszącym 4,5, szacowana różnica średnich wyniosła –4,7 (95% CI, od –6,9 do –2,5) punktu HAM-D. Obserwowane różnice średnich w tych 16 badaniach mieściły się w zakresie od –3,1 do –6,8, przy czym wszystkie wskazywały na korzyść ćwiczeń. Obie szacowane różnice przekraczają próg istotności klinicznej NICE (≥3 punkty w BDI lub HAM-D), co sugeruje, że ćwiczenia prowadzą do klinicznie znaczącej redukcji objawów depresyjnych.

Wyniki oceny ryzyka błędu systematycznego

Podsumowanie ocen RoB 2 dla wszystkich 40 włączonych badań przedstawiono w Tabeli 2. W obrębie pięciu domen proporcja badań ocenionych jako „niskie ryzyko błędu” (low-risk of bias), „pewne wątpliwości” (some concerns) i „wysokie ryzyko błędu” (high risk of bias) prezentowała się następująco: ocena ryzyka błędu wykazała zmienną jakość metodologiczną w pięciu domenach RoB 2. W Domenie 1 (proces randomizacji) 24 badania (60%) oceniono jako niskie ryzyko błędu, w 10 badaniach (25%) wystąpiły pewne wątpliwości, a 6 badań (15%) uznano za obarczone wysokim ryzykiem. W Domenie 2 (odstępstwa od zamierzonych interwencji) 15 badań (37,5%) oceniono jako niskie ryzyko, 15 badań (37,5%) wykazało pewne wątpliwości, a 10 badań (25%) zaklasyfikowano jako wysokie ryzyko. W Domenie 3 (brakujące dane dotyczące wyników) 18 badań (45,0%) oceniono jako niskie ryzyko, podczas gdy w 12 badaniach (30%) wystąpiły pewne wątpliwości, a 10 badań (25%) wiązało się z wysokim ryzykiem. Domena 4 (pomiar wyników) wykazała najkorzystniejsze oceny: 27 badań (67,5%) zakwalifikowano do grupy niskiego ryzyka, 9 badań (2,5%) jako wykazujące pewne wątpliwości i tylko 4 badania (10%) jako wysokie ryzyko. Wreszcie, w Domenie 5 (wybór raportowanego wyniku) 21 badań (52,5%) oceniono jako niskie ryzyko, 14 badań (35%) wykazało pewne wątpliwości, a 5 badań (12,5%) uznano za obarczone wysokim ryzykiem błędu. W ogólnych ocenach RoB 2: 12 badań (30%) oceniono jako „niskie ryzyko błędu” (wszystkie pięć domen z niskim ryzykiem), 13 badań (32,5%) jako „pewne wątpliwości” (przynajmniej jedna domena z pewnymi wątpliwościami, ale brak domen z wysokim ryzykiem) oraz 15 badań (37,5%) jako „wysokie ryzyko błędu” (każda domena oceniona jako wysokie ryzyko lub wiele domen z pewnymi wątpliwościami).

Najczęstszymi powodami ocen „wysokiego ryzyka” były: niewystarczające zaślepienie uczestników i personelu (Domena 2, 2,7%), wysoki lub niezbalansowany wskaźnik rezygnacji bez odpowiedniej imputacji danych (Domena 3, 2,7%) oraz niewystarczająca maskacja alokacji (Domena 1, 13,6%). Badania opublikowane przed 201 rokiem (era przed-CONSORT, n = 5) stanowiły 4 z 15 ocen „wysokiego ryzyka”. Zgodność między sędziami w odniesieniu do ogólnych ocen ryzyka błędu była znacząca (κ = 0,79; 95% CI, 0,68–0,8). Żadne badania nie zostały wykluczone na podstawie ocen ryzyka błędu; zamiast tego poniżej przedstawiono analizy wrażliwości ograniczone do badań o „niskim ryzyku” lub „niskim ryzyku + pewne zastrzeżenia”.

Analizy podgrup

Tabela 3 przedstawia wyniki wszystkich zdefiniowanych wcześniej analiz podgrup dla parametru remisji (OR) oraz parametru wyniku depresji (SMD). Kluczowe wnioski obejmują: rodzaj ćwiczeń, zarówno w formie treningu aerobowego (OR, 2,54; 95% CI, 2,01–3,21; n = 24), jak i oporowego (OR, 2,38; 95% CI, 1,72–3,29; n = 8), wykazał istotne efekty, przy braku istotnej różnicy między tymi rodzajami (p dla interakcji = 0,68). Mieszany trening aerobowy i oporowy wykazał mniejszy efekt (OR, 1,92; 95% CI, 1,31–2,81; n = 6), choć interakcja nie była istotna (p = 0,21). Nadzór w postaci ćwiczeń nadzorowanych (OR, 2,71; 95% CI, 2,18–3,36; n = 31) przyniósł większe efekty niż ćwiczenia nienadzorowane (OR, 1,8; 95% CI, 1,34–2,64; n = 9), a różnica ta była istotna statystycznie (p dla interakcji = 0,04). Typ grupy kontrolnej w postaci kontroli biernej (lista oczekujących/standardowa opieka) przyniósł większe efekty (OR, 2,89; 95% CI, 2,31–3,61; n = 24) niż kontrole aktywne (dopuszczono aktywne kontrole bez ćwiczeń) (kontrola uwagi/farmakoterapia/psychoterapia; OR, 1,79; 95% CI, 1,34–2,38; n = 16; p dla interakcji = 0,02). Diagnoza depresji: badania wymagające formalnej diagnozy MDD (OR, 2,32; 95% CI, 1,82–2,95; n = 20) wykazały podobne efekty jak badania wykorzystujące wartości odcięcia narzędzi przesiewowych (OR, 2,61; 95% CI, 1,9–3,42; n = 20; p dla interakcji = 0,41). Ryzyko błędu: badania o niskim ryzyku błędu (OR, 2,08; 95% CI, 1,52–2,85; n = 12) wykazały mniejsze efekty niż badania z pewnymi zastrzeżeniami (OR, 2,68; 95% CI, 1,94–3,70; n = 13) lub wysokim ryzykiem (OR, 2,54; 95% CI, 1,81–3,56; n = 15), jednak różnice te nie były istotne statystycznie (p dla interakcji = 0,34). Wielkość próby: większe badania (n ≥ 10) wykazały mniejsze efekty (OR, 1,96; 95% CI, 1,45–2,65; n = 8) niż badania średnie (OR, 2,61; 95% CI, 1,99–3,42; n = 16) lub małe (OR, 2,58; 95% CI, 1,86–3,58; n = 16), co sugeruje potencjalny wpływ małych badań, choć interakcja nie była istotna (p = 0,28). Test Eggera nie wykrył błędu publikacji (p = 0,87), ale wzorzec ten jest zgodny z pewnym stopniem błędu lub heterogeniczności.

W przypadku wyników oceny depresji (SMD) wnioski były w dużej mierze zgodne z wynikami dla remisji, choć szerokie przedziały ufności i wysoka heterogeniczność ograniczyły interpretowalność dla kilku podgrupy. Szczegółowe wyniki wszystkich analiz podgrup przedstawiono w Tabeli 3. Choć ćwiczenia aerobowe były najczęściej badaną formą aktywności (28 badań), trening oporowy i protokoły mieszane również wykazały istotne efekty, a nakładające się przedziały ufności sugerują brak wyraźnej przewagi jednej formy nad drugą.

Pewność dowodów (GRADE)

Stosując ramy GRADE, pewność dowodów w odniesieniu do remisji depresji oceniono jako umiarkowaną (Tabela 3). Pewność została obniżona o jeden poziom ze względu na poważne ryzyko błędu systematycznego (37,5% badań z ogólną oceną „wysokiego ryzyka” według RoB 2). Niespójność nie była poważna (I2 = 48%; przedział predykcyjny nie przecinał wartości 1,0), nie stwierdzono pośredniości, brak precyzji nie był poważny (osiągnięto optymalny rozmiar informacji), a błąd publikacji nie został wykryty. Wskazuje to na umiarkowaną pewność, że ćwiczenia zwiększają remisję depresji w porównaniu z warunkami kontrolnymi; jednak dalsze wysokiej jakości badania mogą zmienić tę ocenę. W przypadku wyników nasilenia depresji (SMD) pewność dowodów oceniono jako niską (Tabela 4). Pewność została obniżona o jeden poziom ze względu na poważne ryzyko błędu systematycznego (z tego samego powodu, co powyżej) oraz o dodatkowy poziom ze względu na bardzo poważną niespójność (I2 = 87%; 95% przedział predykcyjny od −1,42 do 0,20, który przecina efekty zerowe). Szeroki przedział predykcyjny wskazuje, że w niektórych przyszłych uwarunkowaniach ćwiczenia mogą nie obniżyć wyników depresji lub mogą nawet przynieść efekt odwrotny do zamierzonego. Niska pewność oznacza, że zaufanie do oszacowania efektu jest ograniczone, a rzeczywisty efekt może znacząco różnić się od oszacowania punktowego.

Analiza czułości w zależności od rodzaju ekstrakcji

Aby ocenić, czy wybór metody ekstrakcji wpłynął na połączoną wielkość efektu, badania podzielono na warstwy ze względu na rodzaj wyekstrahowanego szacunku efektu. Nie stwierdzono statystycznie istotnych różnic między tymi podgrupami (p dla interakcji = 0,54), co sugeruje, że metoda ekstrakcji nie wprowadziła systematycznego błędu do wyników. Jednak we wszystkich podgrupach wystąpiła znaczna heterogeniczność, przy czym najniższą heterogeniczność zaobserwowano w podgrupie efektów skorygowanych (I2 = 72%).

Zastosowanie modeli warstwowych w celu zbadania wpływu określonych czynników nie było możliwe ze względu na brak danych, takich jak płeć, pochodzenie etniczne i wiek, w odniesieniu do wyników porównawczych. Wizualna ocena wykresu lejkowego dla remisji (Rysunek 4) wykazała przybliżoną symetrię. Test regresji Eggera dla remisji dał wartość p wynoszącą 0,87, co wskazuje na brak statystycznie istotnych dowodów na występowanie efektów małych badań lub błędu publikacji dla tego punktu końcowego. W przypadku wyników depresji (Rysunek 5) wykres lejkowy wydawał się w przybliżeniu symetryczny, a wartość p w teście Eggera wyniosła 0,68, co analogicznie sugeruje brak dowodów na błąd publikacji. Jednakże, biorąc pod uwagę wysoką heterogeniczność wyników depresji (I2 = 87%), nie można wykluczyć asymetrii wykresu lejkowego wynikającej z heterogeniczności, a nie z błędu. Ocena RoB 2 wykazała, że 15 z 40 badań (37,5%) oceniono jako wykazujące ogólnie „wysokie ryzyko błędu”, głównie ze względu na niewystarczającą zaślepienie uczestników i personelu (Domena 2), niepełne dane dotyczące wyników (Domena 3) oraz niewystarczające ukrycie alokacji (Domena 1). Dodatkowe 13 badań (32,5%) budziło „pewne wątpliwości”. Tylko 12 badań (30%) oceniono jako ogólnie „niskie ryzyko błędu”. Selektywne raportowanie (Domena 5) uznano za niskie ryzyko w większości badań (56,8%), co sugeruje, że błąd raportowania nie stanowił głównego problemu.

Obsługa badań wieloramiennych

Z 40 uwzględnionych badań 9 (20,5%) posiadało wieloramienne projekty wymagające szczególnego podejścia. W przypadku badań z wieloma ramionami ćwiczeń w porównaniu z jedną grupą kontrolną (n = 5), ramiona ćwiczeń połączono, aby uniknąć podwójnego liczenia uczestników grupy kontrolnej. W przypadku badań z ramionami ćwiczeń oraz wieloma ramionami porównawczymi bez ćwiczeń (n = 4), wybrano najbardziej konserwatywną grupę kontrolną bez ćwiczeń (priorytetyzując listę oczekujących lub standardową opiekę nad farmakoterapią lub psychoterapią). Analiza wrażliwości z wyłączeniem wszystkich badań wieloramiennych dała wyniki podobne do analizy głównej (remisja: OR, 2,38; 95% CI, 1,94–2,91 w porównaniu do głównego OR 2,46; SMD dla depresji: −0,58; 95% CI, −0,87 do −0,29 w porównaniu do głównego SMD −0,96), co wskazuje, że sposób traktowania prób wieloramiennych nie wpłynął znacząco na wyniki.

DOSTĘPNOŚĆ DANYCH:

Zestawy danych analizowane w niniejszym badaniu są dostępne w

https;//zenodo.org/records/1980462. Nowa lista kontrolna PRISMA została dołączona jako Plik uzupełniający 1.

OPISY RYSUNKÓW I TABEL:

Schemat procesu przeglądu systematycznego szczegółowo opisujący wybór badań do metaanalizy.
Rycina 1Diagram przepływu PRISMA procesu wyboru badań. Schemat przedstawia liczbę rekordów zidentyfikowanych, przesiewowych, ocenionych pod kątem kwalifikowalności oraz włączonych do metaanalizy. Prostokąty reprezentują kolejne etapy procesu przeglądu: identyfikację, przesiew, ocenę kwalifikowalności oraz włączenie. Strzałki wskazują przepływ rekordów przez każdy etap. Przyczyny wykluczenia wraz z odpowiadającymi im liczbami podano w polach wykluczeń. Skróty: n = liczba rekordów lub badań; PRISMA = preferowane elementy sprawozdawczości dla przeglądów systematycznych i metaanaliz. Kliknij tutaj, aby wyświetlić powiększoną wersję tej figury.

Wykres lejkowy (forest plot), analiza ilorazu szans w badaniach porównujących interwencje polegające na ćwiczeniach fizycznych z grupą kontrolną.
Rysunek 2Wykres leśny wpływu ćwiczeń fizycznych w porównaniu z grupą kontrolną na remisję depresji (iloraz szans). Każda linia pozioma reprezentuje pojedyncze badanie (n = 37). Kwadrat w centrum każdej linii reprezentuje oszacowanie punktowe (iloraz szans, OR), przy czym rozmiar kwadratu jest proporcjonalny do wagi badania w analizie zbiorczej (metoda odwrotnej wariancji) w modelu efektów losowych (DerSimonian i Laird). Linia pozioma reprezentuje 95% przedział ufności (CI). Pionowa przerywana linia przy OR = 1,0 reprezentuje linię braku efektu. Romb na dole reprezentuje zbiorcze oszacowanie efektu; środek rombu to zbiorczy OR (2,40), a jego szerokość reprezentuje 95% CI (od 1,97 do 2,93). Statystyki heterogeniczności (I2 = 49%) oraz pwartość p dla efektu całkowitego (p < 0,01) przedstawiono poniżej rombu. W tej analizie głównej nie zastosowano modelu efektów stałych. Skróty: OR = iloraz szans; CI = przedział ufności; model efektów losowych (DerSimonian i Laird). Prosimy kliknąć tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Wykres leśny z metaanalizy efektu interwencji w postaci ćwiczeń fizycznych, przedstawiający wyniki standaryzowanej różnicy średnich.
Rysunek 3Wykres leśny efektu ćwiczeń fizycznych w porównaniu z grupą kontrolną w odniesieniu do nasilenia depresji (standaryzowana różnica średnich, SMD). Każda pozioma linia reprezentuje poszczególne badanie (n = 24). Kwadrat w centrum każdej linii przedstawia oszacowanie punktowe (SMD, g Hedgesa), przy czym rozmiar kwadratu jest proporcjonalny do wagi badania w analizie zbiorczej (metoda odwrotnej wariancji). Linia pozioma reprezentuje 95% przedział ufności (CI). Ujemne wartości SMD wskazują na korzyść z ćwiczeń fizycznych (zmniejszenie nasilenia depresji). Pionowa linia ciągła przy SMD = 0 reprezentuje linię braku efektu. Romb na dole przedstawia zbiorcze oszacowanie efektu z zastosowaniem modelu efektów losowych (metoda DerSimoniana i Lairda); środek rombu to zbiorcze SMD (−0,96), a jego szerokość reprezentuje 95% CI (−1,27 do −0,65). Statystyki heterogeniczności (I2 = 87%, tau2 = 0,46), a wartość p dla efektu całkowitego (p < 0,01) znajdują się poniżej rombu. Skróty: SMD = standaryzowana różnica średnich (g Hedgesa); CI = przedział ufności; IV = odwrotna wariancja; Random = model efektów losowych. Proszę kliknąć tutaj, aby wyświetlić powiększoną wersję tej figury.

Wykres lejkowy przedstawiający SE(log[OR]) w funkcji OR, stosowany do wykrywania błędu publikacji w metaanalizie.
Rysunek 4Wykres lejkowy dla remisji (iloraz szans). Każdy punkt reprezentuje poszczególną analizę (n = 37). Linia pionowa reprezentuje zbiorczą ocenę efektu (OR = 2,40). Linie ukośne reprezentują pseudo-95% przedziały ufności. Przybliżona symetria wykresu oraz test Eggera (p = 0,87) sugeruje brak dowodów na błąd publikacji lub efekt małych badań. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Wykres lejkowy przedstawiający zależność błędu standardowego od standaryzowanej różnicy średnich w statystycznej analizie danych.
Rysunek 5Wykres lejkowy (funnel plot) służący do oceny potencjalnego błędu publikacji dla wyniku ciężkości depresji (standaryzowana różnica średnich, SMD). Każde koło reprezentuje pojedyncze porównanie w ramach badania (n = 24). Linia pionowa oznacza zbiorczą ocenę efektu (SMD = −0,96). Badania naniesiono na wykres w zależności od wielkości efektu (oś x) i błędu standardowego (SE; oś y). Większe badania z mniejszymi błędami standardowymi znajdują się w górnej części wykresu, natomiast mniejsze badania w jego dolnej części. Wizualna ocena sugeruje przybliżoną symetrię, choć widoczne jest rozproszenie wynikające ze znacznej heterogeniczności międzybadawczej (I2 = 87%). Test regresji Eggera nie był istotny statystycznie (punkt przecięcia = −0,25, 95% CI od −1,08 do 0,58; p = 0,68), co wskazuje na brak statystycznych dowodów na występowanie efektu małych badań. Skróty: SMD = standaryzowana różnica średnich; SE = błąd standardowy; CI = przedział ufności. Aby wyświetlić powiększoną wersję tego rysunku, kliknij tutaj.

Baza danych (platforma)Data wyszukiwaniaPełna składnia wyszukiwaniaLimity/filtry
PubMedListopad 2025("ćwiczenia"[MeSH Terms] OR "ćwiczenia"[tiab] OR "aktywność fizyczna"[tiab] OR "aerobowy"[tiab] OR "trening oporowy"[tiab] OR "trening siłowy"[tiab] OR "joga"[tiab] OR "chodzenie"[tiab]) AND ("depresja"[MeSH Terms] OR "zaburzenia depresyjne"[MeSH Terms] OR "depresja"[tiab] OR "objawy depresyjne"[tiab] OR "ciężka depresja"[tiab] OR "dystymia"[tiab]) AND ("remisja"[MeSH Terms] OR "remisja"[tiab] OR "leki przeciwdepresyjne"[MeSH Terms] OR "leki"[tiab] OR "farmakoterapia"[tiab] OR "wynik leczenia"[MeSH Terms])Ludzie; język angielski; bez ograniczeń daty
Embase (OVID)Listopad 2025(exp ćwiczenia/ lub exp aktywność fizyczna/ lub (ćwiczenia lub aktywność fizyczna lub aerobowy lub trening oporowy lub trening siłowy lub joga lub chodzenie).ti,ab.) AND (exp depresja/ lub exp ciężka depresja/ lub (depresja lub objawy depresyjne lub ciężkie zaburzenia depresyjne lub dystymia).ti,ab.) AND (exp remisja/ lub exp farmakoterapia/ lub (remisja lub leki lub farmakoterapia lub wynik leczenia).ti,ab.)Ludzie; język angielski; artykuły w prasie; bez ograniczeń czasowych
Cochrane Central Register of Controlled Trials (CENTRAL)Listopad 2025#1 deskryptor MeSH: [Exercise] rozwiń wszystkie drzewa LUB deskryptor MeSH: [Physical Activity] rozwiń wszystkie drzewa LUB (exercise* LUB „physical activity” LUB aerobic LUB „resistance training” LUB „strength training” LUB yoga LUB walking):ti,ab,kwTylko badania kliniczne (domyślne CENTRAL); brak ograniczeń daty
#2 deskryptor MeSH: [Depression] rozszerz wszystkie drzewa LUB deskryptor MeSH: [Depressive Disorder] rozszerz wszystkie drzewa LUB (depression* LUB „depressive symptoms” LUB „major depressive disorder” LUB dysthymia):ti,ab,kw
#3 deskryptor MeSH: [Remission] rozwiń wszystkie drzewa LUB deskryptor MeSH: [Antidepressive Agents] rozwiń wszystkie drzewa LUB (remission* LUB medication* LUB pharmacotherapy* LUB "treatment outcome"):ti,ab,kw
#4 #1 I #2 I #3
MEDLINE (OVID)lis-25(exp ćwiczenia/ lub exp aktywność fizyczna/ lub (ćwiczenia$ lub aktywność fizyczna$ lub trening aerobowy$ lub trening oporowy lub trening siłowy lub joga lub chodzenie).ti,ab.) AND (exp depresja/ lub exp zaburzenia depresyjne/ lub (depresja$ lub objawy depresyjne lub epizod ciężkiej depresji lub dystymia).ti,ab.) AND (exp remisja/ lub exp leki przeciwdepresyjne/ lub (remisja$ lub leki$ lub farmakoterapia$ lub wynik leczenia$).ti,ab.)Ludzie; język angielski; randomizowane badania kontrolowane; brak ograniczeń czasowych
Google ScholarListopad 2025„ćwiczenia” AND „depresja” AND („remisja” OR „leki” OR „leczenie”)Pierwsze 50 rekordów posortowanych według trafności; bez ograniczeń daty; tylko język angielski
Dodatkowe źródłaListopad 2025Listy referencyjne włączonych badań oraz odpowiednie przeglądy (metoda kuli śnieżnej); ręczne przeszukiwanie kluczowych czasopism (Mental Health and Physical Activity, Journal of Affective Disorders, Depression and Anxiety)Nie dotyczy

Tabela 1: Strategie wyszukiwania w bazach danych. Pełna składnia wyszukiwania zastosowana dla każdej bazy danych, obejmująca słownictwo kontrolowane (MeSH, Emtree), słowa kluczowe, tagi pól, operatorów logicznych oraz ucinanie wyrazów. Wyszukiwania przeprowadzono w listopadzie 2025 roku. Zastosowane ograniczenia: badania na ludziach, język angielski, brak ograniczeń czasowych (z wyjątkiem zaznaczonych przypadków). Legenda: #1, #2, #3 = kolejne numery zestawów wyszukiwania reprezentujące następujące po sobie etapy wyszukiwania. Symbole ucinania zostały użyte w celu objęcia wariantów końcówek słów (np. exercise wyszukuje exercise, exercises oraz exercising): $ w Ovid oraz * w PubMed i Cochrane. W przypadku wyszukiwań w Ovid przeszukiwaną bazą była MEDLINE (platforma Ovid). Ze względu na ograniczenia Google Scholar w zakresie złożonego wyszukiwania logicznego zastosowano uproszczony ciąg wyszukiwania; wyniki ograniczono do pierwszych 50 rekordów posortowanych według trafności. Wyszukiwanie w Google Scholar przeprowadzono 15 listopada 2025 roku o godzinie 10:0 GMT przy wyłączonej personalizacji. Skróty: MeSH = Medical Subject Headings (PubMed); /exp = explode (terminy Emtree w Embase); ti, ab = tytuł i streszczenie; kw = słowa kluczowe (Cochrane); kw = słowa kluczowe autora (OVID); All Fields = wyszukiwanie nieokreślone we wszystkich indeksowanych polach. Proszę kliknąć tutaj, aby pobrać tę tabelę.

BadanieD1: RandomizacjaD2: OdchyleniaD3: Braki w danychD4: Pomiar wynikówD5: Raportowany wynikOgólnie
Nimmo, 198624Kilka zastrzeżeńWysokie ryzykoWysokie ryzykoKilka kwestii budzących wątpliwościKilka wątpliwościWysokie ryzyko
Doyne, 198725Kilka kwestii budzących niepokójWysokie ryzykoKilka kwestii budzących niepokójNiektóre wątpliwościKilka kwestii do rozważeniaWysokie ryzyko
McNeil, 19126Kilka kwestii budzących obawyWysokie ryzykoWysokie ryzykoKilka wątpliwościKilka kwestii do rozważeniaWysokie ryzyko
Veale, 19227Wysokie ryzykoWysokie ryzykoNiektóre wątpliwościWysokie ryzykoWysokie ryzykoWysokie ryzyko
Singh, 19728Wysokie ryzykoWysokie ryzykoWysokie ryzykoWysokie ryzykoKilka zastrzeżeńWysokie ryzyko
Mather, 20229Wysokie ryzykoWysokie ryzykoKilka kwestii budzących niepokójWysokie ryzykoKilka kwestii budzących niepokójWysokie ryzyko
Nabkasorn, 20530Niskie ryzykoNiskie ryzykoWysokie ryzykoNiskie ryzykoWysokie ryzykoWysokie ryzyko
Singh, 20531Niskie ryzykoKilka uwagNiskie ryzykoNiskie ryzykoKilka uwagKilka zastrzeżeń
Sims, 20632Kwestie budzące niepokójKilka kwestii do rozważeniaWysokie ryzykoNiektóre zastrzeżeniaKilka kwestii budzących niepokójWysokie ryzyko
Brenes, 20733Kilka uwagWysokie ryzykoNiektóre zastrzeżeniaKilka zastrzeżeńKilka zastrzeżeńWysokie ryzyko
Blumenthal, 20734Niskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzyko
Pilu, 20735Wysokie ryzykoWysokie ryzykoWysokie ryzykoKilka wątpliwościWysokie ryzykoWysokie ryzyko
Vieira, 20736Wysokie ryzykoWysokie ryzykoWysokie ryzykoNiektóre wątpliwościWysokie ryzykoWysokie ryzyko
Williams, 20837Kilka zastrzeżeńKilka zastrzeżeńWysokie ryzykoKilka kwestii budzących wątpliwościKwestie problematyczneWysokie ryzyko
Sims, 20938Niskie ryzykoNiektóre obawyKilka kwestii budzących niepokójNiskie ryzykoNiektóre obawyKilka kwestii budzących wątpliwości
Shahidi, 20139Kilka zastrzeżeńKilka wątpliwościNiskie ryzykoNiskie ryzykoKilka uwagKilka uwag
Mota-Pereira, 20140Niskie ryzykoNiektóre zastrzeżeniaNiektóre wątpliwościNiskie ryzykoNiskie ryzykoKilka kwestii do rozważenia
Prakhinkit, 201341Niskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzyko
Legrand, 201442Kilka zastrzeżeńKilka kwestii budzących niepokójNiskie ryzykoNiskie ryzykoNiskie ryzykoKilka uwag
Pfaff, 201443Niskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzyko
Danielsson, 201444Niskie ryzykoPewne wątpliwościKilka kwestii do rozważeniaNiskie ryzykoNiskie ryzykoKilka kwestii budzących niepokój
Oertel-Knöchel, 201445Wysokie ryzykoWysokie ryzykoWysokie ryzykoNiektóre wątpliwościWysokie ryzykoWysokie ryzyko
Hallgren, 201546Niskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzyko
Carneiro, 201547Niskie ryzykoNiektóre zastrzeżeniaKilka uwagNiskie ryzykoNiskie ryzykoKwestie budzące wątpliwości
Doose, 201548Niskie ryzykoKilka zastrzeżeńKilka uwagNiskie ryzykoNiskie ryzykoKilka zastrzeżeń
Schuch, 201549Niskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzyko
Gao, 201650Niskie ryzykoKwestie budzące obawyKilka wątpliwościNiskie ryzykoKilka kwestii budzących obawyKilka kwestii budzących niepokój
Schneider, 201651Kilka kwestii budzących niepokójNiektóre wątpliwościWysokie ryzykoNiskie ryzykoKilka wątpliwościWysokie ryzyko
Lok, 201752Niskie ryzykoNiskie ryzykoNiskie ryzykoWysokie ryzykoNiskie ryzykoWysokie ryzyko
Cheung, 201853Niskie ryzykoNiskie ryzykoKilka kwestii do rozważeniaNiskie ryzykoNiskie ryzykoKilka kwestii budzących niepokój
Roy, 201854Niskie ryzykoKilka zastrzeżeńNiektóre zastrzeżeniaNiskie ryzykoNiskie ryzykoKilka kwestii budzących wątpliwości
Abdelbasset, 201955Niskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzyko
Makizako, 202056Niskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzyko
La Rocque, 202157Niskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzyko
Chau, 20258Niskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzyko
Nicholas, 202459Kilka uwagKilka kwestii budzących zastrzeżeniaNiskie ryzykoNiskie ryzykoKilka zastrzeżeńKilka kwestii budzących zastrzeżenia
Woolf, 202460Niskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzyko
James Vibin, 202461Niskie ryzykoKilka zastrzeżeńNiskie ryzykoNiskie ryzykoNiskie ryzykoKilka kwestii budzących obawy
Chang, 202562Niskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzyko
Wei, 202563Niskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzykoNiskie ryzyko

Tabela 2: Ocena ryzyka błędu systematycznego (risk-of-bias) dla włączonych badań z wykorzystaniem narzędzia RoB 2.Tabela ta przedstawia oceny ryzyka błędu systematycznego dla każdego z 40 włączonych randomizowanych badań kontrolowanych, przeprowadzonych przy użyciu narzędzia Cochrane RoB 2 (wersja z sierpnia 2019 r.). Dla każdego badania oceniono pięć domen: D1 (proces randomizacji), D2 (odchylenia od zamierzonych interwencji), D3 (brakujące dane dotyczące wyników), D4 (pomiar wyników) oraz D5 (wybór raportowanego wyniku). Dla każdej domeny ocena została zaklasyfikowana jako „niskie ryzyko błędu” (low-risk of bias), „pewne wątpliwości” (some concerns) lub „wysokie ryzyko błędu” (high risk of bias). Ogólna ocena ryzyka błędu systematycznego została wyznaczona zgodnie z algorytmami RoB 2: „niskie ryzyko”, jeśli wszystkie domeny wykazują niskie ryzyko; „pewne wątpliwości”, jeśli co najmniej jedna domena budzi pewne wątpliwości, ale żadna nie wykazuje wysokiego ryzyka; oraz „wysokie ryzyko”, jeśli jakakolwiek domena zostanie oceniona jako wysokie ryzyko lub jeśli kilka domen budzi pewne wątpliwości. Zgodność między oceniającymi w odniesieniu do ocen ogólnych była istotna (κ = 0,79). Badania nie zostały wykluczone na podstawie ryzyka błędu; zamiast tego przeprowadzono analizy wrażliwości ograniczone do badań o niskim ryzyku oraz badań o niskim ryzyku i pewnych wątpliwościach. Skróty: D1 = Proces randomizacji; D2 = Odchylenia od zamierzonych interwencji; D3 = Brakujące dane dotyczące wyników; D4 = Pomiar wyników; D5 = Wybór raportowanego wyniku. Aby pobrać tę tabelę, kliknij tutaj.

Zmienna podgrupowaPoziom podgrupyLiczba badańSzacunek efektu (OR lub MD) [95% CI]I² (%)p dla interakcjiPołączone SMD (95% CI)
Tryb ćwiczeńTlenowy24OR 2,54 [2,01–3,21]44%0.68−0,92 (−1,28 do −0,56)
Oporność8OR 2,38 [1,72–3,29]41%−1,04 (−1,45 do −0,63)
Mieszany6OR 1,92 [1,31–2,81]52%−0,78 (−1,18 do −0,38)
Inne (joga/taniec)2OR 2,15 [1,23–3,76]0%−0,85 (−1,32 do −0,38)
NadzórNadzorowane31OR 2,71 [2,18–3,36]45%0.04−1,12 (−1,48 do −0,76)
Nienadzorowane9OR 1,8 [1,34–2,64]39%−0,65 (−1,02 do −0,28)
Typ kontroliPasywna (lista oczekujących/standardowa opieka/brak interwencji)24OR 2,89 [2,31–3,61]42%0.02−1,18 (−1,56 do −0,80)
Aktywny (uwaga/farmakoterapia/psychoterapia)16OR 1,79 [1,34–2,38]51%−0,68 (−1,05 do −0,31)
Diagnoza depresjiFormalna diagnoza MDD (zaburzenia depresyjnego większego)20OR 2,32 [1,82–2,95]49%0.41−0,98 (−1,35 do −0,61)
Wartość odcinająca narzędzia przesiewowego20OR 2,61 [1,9–3,42]46%−0,92 (−1,30 do −0,54)
Ryzyko błędu (RoB 2)Niskie ryzyko12OR 2,08 [1,52–2,85]38%0.34−0,48 (−0,82 do −0,14)
Kilka kwestii budzących obawy13OR 2,68 [1,94–3,70]44%−1,06 (−1,45 do −0,67)
Wysokie ryzyko15OR 2,54 [1,81–3,56]51%−1,14 (−1,52 do −0,76)
Wielkość próby (całkowite N)Małe (<50)16OR 2,58 [1,86–3,58]48%0.28−1,08 (−1,48 do −0,68)
Średnie (50–99)16OR 2,61 [1,9–3,42]46%−0,96 (−1,34 do −0,58)
Duże (≥10)8OR 1,96 [1,45–2,65]35%−0,72 (−1,10 do −0,34)
Grupa wiekowaDorośli (18–59 lat)20OR 2,4 [1,94–3,07]47%0.92−0,94 (−1,32 do −0,56)
Osoby starsze (≥60 lat)20OR 2,48 [1,8–3,27]49%−0,98 (−1,36 do −0,60)
Czas trwania ćwiczeńKrótki (≤8 tygodni)16OR 2,61 [2,01–3,39]43%0.58−1,02 (−1,40 do −0,64)
Średnio (9–12 tygodni)18OR 2,38 [1,84–3,08]49%−0,94 (−1,32 do −0,56)
Długi (≥13 tygodni)6OR 2,28 [1,51–3,4]52%−0,82 (−1,2 do −0,42)
Rok publikacjiPrzed 2010 r.14OR 2,32 [1,76–3,06]51%0.67−0,8 (−1,26 do −0,50)
2010–201917OR 2,51 [1,93–3,26]46%−0,98 (−1,36 do −0,60)
2020–20259OR 2,54 [1,8–3,43]44%−1,02 (−1,40 do −0,64)

Tabela 3: Wyniki analizy podgrup. Tabela ta przedstawia wyniki określonych apriorycznie analiz podgrup, badających potencjalne moderatory skuteczności ćwiczeń w remisji depresji (iloraz szans). Zmienne podgrup obejmują charakterystykę ćwiczeń (rodzaj, nadzór, czas trwania), charakterystykę populacji (typ diagnozy depresji, grupa wiekowa, stopień nasilenia objawów wyjściowych) oraz cechy projektu badania (typ grupy kontrolnej, ryzyko błędu systematycznego, wielkość próby, rok publikacji). Dla każdego poziomu podgrupy w tabeli podano liczbę badań, połączony iloraz szans z 95% przedziałem ufności oraz I2 statystyka heterogeniczności oraz pwartość p dla interakcji między podgrupami. A pwartość p przyjęto, że interakcja na poziomie poniżej 0,10 jest istotna statystycznie, uwzględniając niską moc testów interakcji w metaanalizach. Statystycznie istotne różnice w podgrupach (p < 0,10) zostały pogrubione w tabeli. Typ grupy kontrolnej sklasyfikowano jako pasywny (lista oczekujących, standardowa opieka, brak interwencji) lub aktywny (kontrola uwagi, farmakoterapia, psychoterapia). Ryzyko błędu systematycznego oceniono za pomocą narzędzia Cochrane RoB 2. Wszystkie analizy w podgrupach przeprowadzono z użyciem modeli efektów losowych (metoda DerSimonian i Lairda). Pogrubione p dla wartości interakcji wskazuje na statystycznie istotne różnice między podgrupami (p < 0.10). Proszę kliknąć tutaj, aby pobrać tę tabelę.

WynikLiczba uczestników (Badania)Szacunek efektu (95% CI)Ocena pewnościpewność GRADE
Remisja depresji267 (40 RCT)OR 2,40 (1,97–2,93)Ryzyko błędu: Poważne (−1) – 37,5% badań o wysokim ryzykuUmiarkowany Równowaga statyczna, ΣFx=0, ΣFy=0, schemat, równowaga sił, analiza wektorowa, zasady inżynieryjne.Równowaga statyczna, ΣFx=0, ΣFy=0, schemat, równowaga sił, analiza wektorowa, zasady inżynierii.Równowaga statyczna, ΣFx=0, ΣFy=0, schemat, równowaga sił, analiza wektorowa, zasady inżynieryjne.
Niespójność: Niewielka – I² = 48%, przedział predykcji 1,28–4,73 (nie obejmuje wartości 1,0)
Pośredniość: Niespoważna – porównanie bezpośrednie
Nieprecyzyjność: Niepoważna – spełniono kryteria OIS, CI wyklucza brak efektu
Błąd publikacji: Nie wykryto (test Eggera p = 0,87)
Ciężkość depresji (SMD)267 (40 RCT)SMD −0,96 (−1,27–0,65)Ryzyko błędu systematycznego: Poważne (−1) – 37,5% badań o wysokim ryzykuNiski Równowaga statyczna, ΣFx=0, ΣFy=0, schemat, równowaga sił, analiza wektorowa, zasady inżynieryjne.Równowaga statyczna, ΣFx=0, ΣFy=0, schemat, równowaga sił, analiza wektorowa, zasady inżynieryjne.◯◯
Niespójność: Poważna (−1) – I² = 87%, przedział prognozy od −1,42 do 0,20 (przecina zero)
Pośredniość: Nieistotna – porównanie bezpośrednie
Precyzja: Nieistotna – spełniono kryteria OIS
Błąd publikacji: nie stwierdzono (test Eggera p = 0,68)

Tabela 4: Podsumowanie wyników (GRADE) – ćwiczenia fizyczne w porównaniu z grupą kontrolną w odniesieniu do objawów depresji. W tabeli przedstawiono pewność dowodów zgodnie z systemem Grading of Recommendations Assessment, Development and Evaluation (GRADE) dla dwóch głównych punktów końcowych: remisji depresji (zmienna dychotomiczna) oraz nasilenia depresji (zmienna ciągła, raportowana jako standaryzowana różnica średnich). Dla każdego punktu końcowego tabela podaje liczbę uczestników i badań, połączoną szacunkową wartość efektu z 95% przedziałem ufności oraz ustrukturyzowaną ocenę pewności w pięciu obszarach: ryzyka błędu systematycznego (na podstawie ocen RoB 2), niespójności (na podstawie statystyki I2 i przedziałów predykcji), pośredniości (na podstawie różnic w populacji, interwencji, komparatorze i punktach końcowych), nieprecyzyjności (na podstawie optymalnej wielkości informacji oraz przekroczenia klinicznie istotnych progów przez przedział ufności) oraz błędu publikacyjnego (na podstawie asymetrii wykresu lejkowego i testu Eggera). Pewność oceniono jako wysoką, umiarkowaną, niską lub bardzo niską. W przypadku remisji pewność obniżono o jeden poziom ze względu na poważne ryzyko błędu systematycznego, co skutkowało umiarkowaną pewnością. Dla wyników nasilenia depresji pewność obniżono o jeden poziom z powodu poważnego ryzyka błędu systematycznego i o dodatkowy poziom z powodu bardzo poważnej niespójności (I2 = 87% i przedział predykcji przekraczający zero), co skutkowało niską pewnością. Wyjaśnienie ocen pewności: Pewność umiarkowana (remisja): autorzy są umiarkowanie pewni, że rzeczywisty efekt jest prawdopodobnie bliski szacowanemu efektowi, choć dalsze badania mogą zmienić tę wartość. Pewność niska (wyniki depresji): autorzy mają ograniczoną pewność co do szacowanego efektu; rzeczywisty efekt może znacząco różnić się od szacunku, co odzwierciedla szeroki przedział predykcji przekraczający linię braku efektu oraz bardzo wysoka heterogeniczność statystyczna (niespójność). Skróty: OR = iloraz szans; SMD = standaryzowana różnica średnich; CI = przedział ufności; OIS = optymalna wielkość informacji; GRADE = Grading of Recommendations Assessment, Development and Evaluation. Kliknij tutaj, aby pobrać tę tabelę.

Tabela uzupełniająca 1: Charakterystyka 40 badań uwzględnionych w metaanalizie. Badania zostały uporządkowane chronologicznie według roku publikacji. Wszystkie wartości reprezentują liczbę uczestników (n), chyba że zaznaczono inaczej. Całkowite wielkości prób obejmują wszystkich zrandomizowanych uczestników (populacje intencji leczenia, jeśli zgłoszono). W przypadku badań z wieloma ramionami ćwiczeń, liczba osób w grupie ćwiczeń stanowi sumę uczestników ze wszystkich ramion ćwiczeń, a liczba osób w grupie kontrolnej reprezentuje pierwotne ramię kontrolne (niedzielone), aby uniknąć podwójnego liczenia (patrz Metody w zakresie postępowania z badaniami wieloramiennymi). Legenda: Nazwy krajów są podane tak, jak przedstawiono je w oryginalnych badaniach. Ćwiczenia (n) = liczba uczestników zrandomizowanych do grupy/grup interwencyjnych z ćwiczeniami; w przypadku badań z wieloma ramionami ćwiczeń n reprezentuje łączną wielkość próby we wszystkich ramionach ćwiczeń. Kontrola (n) = liczba uczestników zrandomizowanych do grupy kontrolnej (bez ćwiczeń); w przypadku badań z wieloma ramionami kontrolnymi uwzględniono tylko grupę kontrolną bez ćwiczeń, stosując następującą hierarchię priorytetów: lista oczekujących > standardowa opieka > kontrola uwagi > farmakoterapia > psychoterapia. Wielkości prób odzwierciedlają liczbę uczestników zrandomizowanych w punkcie wyjścia i nie uwzględniają ubytków podczas obserwacji. Dla badań opublikowanych przed 201 rokiem (era przed CONSORT; n = 5: Nimmo 1986, Doyne 1987, McNeil 191, Veale 192 oraz Singh 197) wielkości prób są podane zgodnie z oryginalnymi publikacjami. Żadne badania nie wymagały imputacji brakujących danych o wielkości próby. Klasyfikacja typu kontroli: Pasywna = lista oczekujących, standardowa opieka lub brak interwencji; Aktywna = kontrola uwagi, farmakoterapia lub psychoterapia. Badania z wieloma ramionami kontrolnymi były obsługiwane zgodnie z hierarchicznym podejściem do wyboru opisanym w Metodach, z priorytetem kontroli pasywnych nad aktywnymi. Skróty: N = całkowita wielkość próby (uczestnicy z grupy ćwiczeń + kontroli); UK = Zjednoczone Królestwo; USA = Stany Zjednoczone Ameryki; N/A = nie dotyczy.Prosimy kliknąć tutaj, aby pobrać ten plik.

Plik uzupełniający 1: NOWA lista kontrolna PRISMA.Kliknij tutaj, aby pobrać ten plik.

Dyskusja

Ta meta‑analiza 40 randomizowanych kontrolowanych badań klinicznych (2667 uczestników z depresją)24,25,26,27,28,29,30,31,32,33,34,35,36,37,38,39,40,41,42,43,44,45,46,47,48,49,50,51,52,53,54,55,56,57,
58,59,60,61,62,63, wykazała, że ćwiczenia znacząco zwiększały wskaźniki remisji (OR = 2,40; 95% CI, 1,97–2,93; I2 = 49%) i obniżały wskaźniki nasilenia depresji (SMD = −0,96; 95% CI, −1,27 do −0,65; I2 = 87%) w porównaniu do kontroli bez ćwiczeń. Liczba potrzebna do leczenia (NNT) dla jednej dodatkowej remisji wynosiła 2,1, a zgrupowana SMD przełożyła się na klinicznie istotne obniżenia (≈6,5 punktów w Beck Depression Inventory, ≈4,7 punkty w Hamilton Depression Rating Scale). Te wyniki dostarczają wstępnego wsparcia dla ćwiczeń jako efektywnej interwencji uzupełniającej w leczeniu depresji, szczególnie w osiąganiu remisji. Jednakże bardzo wysoka heterogeniczność dla ciągłych wyników (I2 = 87%) oraz fakt, że tylko 12 z 40 badań (30%) zostało ocenione jako niskiego ryzyka zafałszowania, wymaga ostrożnej interpretacji. Duża heterogeniczność dla wyników depresji pochodzi z wielu źródeł: różnice w protokołach ćwiczeń, czas trwania interwencji (3–16 tygodni), status nadzoru, typy grup kontrolnych (lista oczekujących, zwykła opieka, farmakoterapia, psychoterapia), początkowe nasilenie depresji oraz skale wyników15,16. Włączone badania zastosowali różne modalności—aerobowe, oporowe, mieszane, joga, tai chi i taniec—które mogą się różnić mechanizmami przeciwdepresyjnymi, akceptowalnością oraz przywiązaniem16.

Analizy podgrup nie wykazały żadnej wyraźnej wyższości żadnej pojedynczej modalności, ale nadzorowane ćwiczenia wywoływały większe efekty niż nienadzorowane (p = 0,04), a pasywne kontrole (lista oczekujących/zwykła opieka) dawały większe efekty niż aktywne porównania (p = 0,02). Te wyniki wskazują, że zarówno natura interwencji jak i wybór porównania wpływają na obserwowane wielkości efektów. Opcje ćwiczeń o niskim natężeniu i obciążeniu zasługują na dalszą rozważność, ponieważ wielu pacjentów z depresją ma niską początkową sprawność, zmęczenie i niską motywację64,65. Przyszłe badania powinny sprawdzić, czy takie interwencje dają klinicznie istotne efekty w populacjach, które nie są w stanie lub nie chcą angażować się w programy o umiarkowanym do wysokiego natężeniu. Te wyniki zgadzają się z Schuch i wsp. (2016; SMD = −0,62)10,11,12 ale rozszerzają bazę dowodów, uwzględniając 23 dodatkowe badania opublikowane po 2019 roku. W przeciwieństwie do Krogh i wsp. (2017)12, którzy nie znaleźli efektu po ograniczeniu do badań niskiego ryzyka zafałszowania, niniejsza analiza wrażliwości, ograniczona do badań niskiego ryzyka, wciąż wykazała znaczący, ale osłabiony efekt (SMD = −0,48). Ta sprzeczność może odzwierciedlać użycie zaktualizowanych narzędzi RoB 2 i włączenie nowszych badań wysokiej jakości. Liczba potrzebna do leczenia (NNT = 2,1) porównywalnie dobrze sprawdza się z opublikowanymi NNT dla psychoterapii (2,5)66 i leków przeciw

Oświadczenia

Autorzy nie mają żadnych konkurencyjnych interesów do zadeklarowania.

Podziękowania

Nie dotyczy.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Assumed correlation coefficient for change-score SDImputation of Missing DataCochrane Handbook defaultr = 0.5 (sensitivity analysis performed)
ClinicalTrials.govClinical Trial RegistriesU.S. National Library of MedicineBaza danych na dzień 10 listopada 2025 (bez filtra szczegółowego NCT)
Cochrane Central Register of Controlled Trials (CENTRAL)Bazy danychCochrane LibraryNumer 11 z 12, listopad 2025
Cochrane Handbook formulasFormuły & KalkulacjeCochrane CollaborationWersja podręcznika 6.4 (zaktualizowany wrzesień 2024)
Egger’s linear regression testAsymetria wykresu lejkaRevMan 5.3 / własny makroN/A
Embase (OVID platform)Bazy danychElsevier / OVID TechnologiesEmbase Classic+Embase 1947 do 2025 Tydzień 47
EndNoteZarządzanie odniesieniamiClarivate Analytics (Londyn, UK)Wersja 20 (wersja 20.1.0.16478)
Google ScholarBazy danychGoogle LLCWyszukiwanie przeprowadzone 15-16 listopada 2025 (pierwsze 500 rekordów według istotności)
GRADE (Grading of Recommendations Assessment, Development and Evaluation)Pewność dowodówGRADE Working GroupGRADEpro GDT (wersja online, dostęp w listopadzie 2025)
MEDLINE (OVID platform)Bazy danychOVID TechnologiesOvid MEDLINE® 1946 do 14 listopada 2025
NNT from SMD (Furukawa & Leucht method)Konwersja wielkości efektuNa podstawie obszaru pod normalnym krzywymN/A
Number needed to treat (NNT) from ORKonwersja wielkości efektuFormuła: NNT = 1 / [CER × (1 – OR-¹)]N/A
PubMedBazy danychU.S. National Library of MedicineNLM ID: 101775772 (wersja bazy danych 2025)
Review Manager (RevMan)Statystyczne & Oprogramowanie do metaanalizyCochrane CollaborationWersja 5.3 (Kopenhaga: The Nordic Cochrane Centre)
RoB 2 toolOcena ryzyka stronniczościCochrane CollaborationWersja: sierpień 2019 (najnowsza aktualizacja)
Standardized mean difference (Hedges’ g)Konwersja wielkości efektuWłasne obliczenia w RevMan 5.3N/A
WHO International Clinical Trials Registry Platform (ICTRP)Bazy danychWorld Health OrganizationPortal wyszukiwania wersja 1.6 (dostęp w listopadzie 2025)

Bibliografia

  1. James SL, et al. Global, regional, and national incidence, prevalence, and years lived with disability for 354 diseases and injuries for 195 countries and territories, 1990&2013;2017: a systematic analysis for the Global Burden of Disease Study 2017. The Lancet. 2018;392(10159):1789-858.
  2. Organization WH. Depression and other common mental disorders: global health estimates. World Health Organization; 2017.
  3. Malhi GS, et al. The 2020 Royal Australian and New Zealand College of Psychiatrists clinical practice guidelines for mood disorders. Australian & New Zealand Journal of Psychiatry. 2021;55(1):7-117.
  4. Cuijpers P, et al. Psychological Treatment of Depression Compared With Pharmacotherapy and Combined Treatment in Primary Care: A Network Meta-Analysis. The Annals of Family Medicine. 2021;19(3):262-70.
  5. Wise J. NICE guidance on depression: 35 health organizations demand “full and proper” revision. BMJ. 2019;365:l2356.
  6. Thornicroft G, et al. Undertreatment of people with major depressive disorder in 21 countries. British Journal of Psychiatry. 2017;210(2):119-24.
  7. Kessler RC. The costs of depression. Psychiatr Clin North Am. 2012;35(1):1-14.
  8. Activity MP, Team W. WHO guidelines on physical activity and sedentary behavior. World Health Organization. 2020.
  9. McAllister-Williams RH. NICE guidelines for the management of depression. British Journal of Hospital Medicine. 2006;67(2):60-1.
  10. Schuch FB, et al. Exercise as a treatment for depression: A meta-analysis adjusting for publication bias. Journal of Psychiatric Research. 2016;77:42-51.
  11. Morres ID, et al. Aerobic exercise for adult patients with major depressive disorder in mental health services: A systematic review and meta-analysis. Depression and Anxiety. 2019;36(1):39-53.
  12. Krogh J, et al. Exercise for patients with major depression: a systematic review with meta-analysis and trial sequential analysis. BMJ Open. 2017;7(9):e014820.
  13. North TC, McCullagh P, Tran ZV. Effect of Exercise on Depression. Exercise and Sport Sciences Reviews. 1990;18(1).
  14. Honey EP. I shrunk the pooled SMD! Guide to critical appraisal of systematic reviews and meta-analyses using the Cochrane review on exercise for depression as example. Ment Health Phys Act. 2015;8:21-36.
  15. Yu Q, et al. Comparative Effectiveness of Multiple Exercise Interventions in the Treatment of Mental Health Disorders: A Systematic Review and Network Meta-Analysis. Sports Medicine - Open. 2022;8(1):135.
  16. Singh B, et al. Effectiveness of physical activity interventions for improving depression, anxiety, and distress: an overview of systematic reviews. British Journal of Sports Medicine. 2023;57(18):1203-9.
  17. Stroup DF, et al. Meta-analysis of observational studies in epidemiology: a proposal for reporting. JAMA. 2000;283(15):2008-12.
  18. Page MJ, et al. The PRISMA 2020 statement: an updated guideline for reporting systematic reviews. BMJ. 2021;372:n71.
  19. Liberati A, et al. The PRISMA statement for reporting systematic reviews and meta-analyses of studies that evaluate health care interventions: explanation and elaboration. J Clin Epidemiol. 2009;62(10):e1-e34.
  20. Gupta S, et al. Efficacy of generic oral directly acting agents in patients with hepatitis C virus infection. J Viral Hepat. 2018;25(7):771-8.
  21. Higgins J, et al. eds. Cochrane Handbook for Systematic Reviews of Interventions. 2nd ed. Chichester, UK: Wiley & Sons; 2019.
  22. DerSimonian R, Laird N. Meta-analysis in clinical trials. Controlled Clinical Trials. 1986;7(3):177-88.
  23. Higgins JP, Thompson SG, Deeks JJ, Altman DG. Measuring inconsistency in meta-analyses. Bmj. 2003;327(7414):557-60.
  24. Nimmo MA, McLean D, Mutrie N, McKenzie S. A holistic approach to recovery from an overuse injury in a games player. British Journal of Sports Medicine. 1986;20(3):103-6.
  25. Doyne EJ, et al. Running versus weight lifting in the treatment of depression. Journal of consulting and clinical psychology. 1987;55(5):748.
  26. McNeil JK, LeBlanc EM, Joyner M. The effect of exercise on depressive symptoms in the moderately depressed elderly. Psychology and aging. 1991;6(3):487.
  27. Veale D, et al. Aerobic Exercise in the Adjunctive Treatment of Depression: A Randomized Controlled Trial. Journal of the Royal Society of Medicine. 1992;85(9):541-4.
  28. Singh NA, Clements KM, Fiatarone MA. A Randomized Controlled Trial of Progressive Resistance Training in Depressed Elders. The Journals of Gerontology: Series A. 1997;52A(1):M27-M35.
  29. Mather AS, et al. Effects of exercise on depressive symptoms in older adults with poorly responsive depressive disorder: Randomized controlled trial. British Journal of Psychiatry. 2002;180(5):411-5.
  30. Nabkasorn C, et al. Effects of physical exercise on depression, neuroendocrine stress hormones, and physiological fitness in adolescent females with depressive symptoms. European Journal of Public Health. 2005;16(2):179-84.
  31. Singh NA, et al. A Randomized Controlled Trial of High Versus Low Intensity Weight Training Versus General Practitioner Care for Clinical Depression in Older Adults. The Journals of Gerontology: Series A. 2005;60(6):768-76.
  32. Sims J, et al. Exploring the feasibility of a community-based strength training program for older people with depressive symptoms and its impact on depressive symptoms. BMC Geriatrics. 2006;6(1):18.
  33. Brenes GA, et al. Treatment of minor depression in older adults: a pilot study comparing sertraline and exercise. Aging Ment Health. 2007;11(1):61-8.
  34. Blumenthal JA, et al. Exercise and pharmacotherapy in the treatment of major depressive disorder. Psychosomatic medicine. 2007;69(7):587-96.
  35. Pilu A, et al. Efficacy of physical activity in the adjunctive treatment of major depressive disorders: preliminary results. Clinical Practice and Epidemiology in Mental Health. 2007;3(1):8.
  36. Vieira JLL, Porcu M, Rocha PGMd. A prática de exercícios físicos regulares como terapia complementar ao tratamento de mulheres com depressão. Jornal Brasileiro de Psiquiatria. 2007;56:23-8.
  37. Williams CL, Tappen RM. Exercise training for depressed older adults with Alzheimer's disease. Aging & Mental Health. 2008;12(1):72-80.
  38. Sims J, et al. Regenerate: assessing the feasibility of a strength-training program to enhance the physical and mental health of chronic post stroke patients with depression. International Journal of Geriatric Psychiatry. 2009;24(1):76-83.
  39. Shahidi M, et al. Laughter yoga versus group exercise program in elderly depressed women: a randomized controlled trial. International Journal of Geriatric Psychiatry. 2011;26(3):322-7.
  40. Mota-Pereira J, et al. Moderate exercise improves depression parameters in treatment-resistant patients with major depressive disorder. Journal of Psychiatric Research. 2011;45(8):1005-11.
  41. Prakhinkit S, Suppapitiporn S, Tanaka H, Suksom D. Effects of Buddhism Walking Meditation on Depression, Functional Fitness, and Endothelium-Dependent Vasodilation in Depressed Elderly. The Journal of Alternative and Complementary Medicine. 2013;20(5):411-6.
  42. Legrand FD. Effects of Exercise on Physical Self-Concept, Global Self-Esteem, and Depression in Women of Low Socioeconomic Status With Elevated Depressive Symptoms. Journal of Sport and Exercise Psychology. 2014;36(4):357-65.
  43. Pfaff JJ, et al. ACTIVEDEP: a randomised, controlled trial of a home-based exercise intervention to alleviate depression in middle-aged and older adults. British Journal of Sports Medicine. 2014;48(3):226-32.
  44. Danielsson L, et al. Exercise or basic body awareness therapy as add-on treatment for major depression: A controlled study. Journal of Affective Disorders. 2014;168:98-106.
  45. Oertel-Knöchel V, et al. Effects of aerobic exercise on cognitive performance and individual psychopathology in depressive and schizophrenia patients. European Archives of Psychiatry and Clinical Neuroscience. 2014;264(7):589-604.
  46. Hallgren M, et al. Physical exercise and internet-based cognitive–behavioral therapy in the treatment of depression: Randomized controlled trial. British Journal of Psychiatry. 2015;207(3):227-34.
  47. Carneiro LSF, et al. Effects of structured exercise and pharmacotherapy vs. pharmacotherapy for adults with depressive symptoms: A randomized clinical trial. Journal of Psychiatric Research. 2015;71:48-55.
  48. Doose M, et al. Self-selected intensity exercise in the treatment of major depression: A pragmatic RCT. International Journal of Psychiatry in Clinical Practice. 2015;19(4):266-75.
  49. Schuch FB, et al. Exercise and severe major depression: Effect on symptom severity and quality of life at discharge in an inpatient cohort. Journal of Psychiatric Research. 2015;61:25-32.
  50. Gao L, Zhang L, Qi H, Petridis L. Middle-aged female depression in perimenopausal period and square dance intervention. Psychiatria Danubina. 2016;28(4):372-8.
  51. Schneider KL, et al. Feasibility of Pairing Behavioral Activation With Exercise for Women With Type 2 Diabetes and Depression: The Get It Study Pilot Randomized Controlled Trial. Behavior Therapy. 2016;47(2):198-212.
  52. Lok N, Lok S, Canbaz M. The effect of physical activity on depressive symptoms and quality of life among elderly nursing home residents: Randomized controlled trial. Archives of Gerontology and Geriatrics. 2017;70:92-8.
  53. Cheung LK, Lee S. A randomized controlled trial on an aerobic exercise program for depression outpatients. Sport Sciences for Health. 2018;14(1):173-81.
  54. Roy A, Govindan R, Muralidharan K. The impact of an add-on video-assisted structured aerobic exercise module on mood and somatic symptoms among women with depressive disorders: A study from a tertiary care center in India. Asian Journal of Psychiatry. 2018;32:118-22.
  55. Abdelbasset WK, et al. Examining the impacts of 12 weeks of low to moderate-intensity aerobic exercise on depression status in patients with systolic congestive heart failure- A randomized controlled study. Clinics. 2019;74:e1017.
  56. Makizako H, et al. Exercise and Horticultural Programs for Older Adults with Depressive Symptoms and Memory Problems: A Randomized Controlled Trial. Journal of Clinical Medicine. 2020;9(1):99.
  57. La Rocque CL, et al. Randomized controlled trial of Bikram yoga and aerobic exercise for depression in women: Efficacy and stress-based mechanisms. Journal of Affective Disorders. 2021;280:457-66.
  58. Chau RMW, et al. Effectiveness of a structured physical rehabilitation program on the physical fitness, mental health, and pain for Chinese patients with major depressive disorders in Hong Kong – a randomized controlled trial with 9-month follow-up outcomes. Disability and Rehabilitation. 2022;44(8):1294-304.
  59. Nicholas M, Nsibambi An, Ojuka E, Maghanga M. Twelve Weeks Aerobic Exercise Improves Anxiety and Depression in HIV Positive Clients on Art in Uganda. International Journal of Sport Exercise and Training Sciences - IJSETS. 2024;10(4):288-98.
  60. Woolf C, et al. A feasibility, randomized controlled trial of Club Connect: a group-based healthy brain aging cognitive training program for older adults with major depression within an older people’s mental health service. BMC Psychiatry. 2024;24(1):208.
  61. James Vibin A, et al. Effect of Integrated Yoga as an add-on therapy in adults with clinical depression – A randomized controlled trial. International Journal of Social Psychiatry. 2024;70(4):709-19.
  62. Chang Q, et al. Effects of varying exercise intensities on muscle strength and depressive symptoms in Chinese adolescents: A 12-week randomized controlled trial. PLOS ONE. 2025;20(11):e0336894.
  63. Wei X, et al. Efficacy of a Combined Aerobic Exercise and Mindfulness Intervention on Depressive Symptoms: A Pilot Randomized Controlled Trial. Research on Social Work Practice. 2025;10497315251316844.
  64. Ross R, Janssen I, Tremblay MS. Public health importance of light intensity physical activity. Journal of Sport and Health Science. 2024;13(5):674-5.
  65. Maltagliati S, et al. Effort minimization: A permanent, dynamic, and surmountable influence on physical activity. J Sport Health Sci. 2025;14:100971.
  66. Cuijpers P, et al. Psychotherapy for Depression Across Different Age Groups: A Systematic Review and Meta-analysis. JAMA Psychiatry. 2020;77(7):694-702.
  67. Cipriani A, et al. Comparative efficacy and acceptability of 21 antidepressant drugs for the acute treatment of adults with major depressive disorder: a systematic review and network meta-analysis. The Lancet. 2018;391(10128):1357-66.
  68. Stubbs B, et al. Challenges Establishing the Efficacy of Exercise as an Antidepressant Treatment: A Systematic Review and Meta-Analysis of Control Group Responses in Exercise Randomized Controlled Trials. Sports Medicine. 2016;46(5):699-713.
  69. Gupta SK. Intention-to-treat concept: A review. Perspectives in Clinical Research. 2011;2(3).
  70. Cullen W, Gulati G, Kelly BD. Mental health in the COVID-19 pandemic. QJM: An International Journal of Medicine. 2020;113(5):311-2.
  71. Hardcastle SJ, et al. A randomized controlled trial of Promoting Physical Activity in Regional and Remote Cancer Survivors (PPARCS). J Sport Health Sci. 2024;13(1):81-9.
  72. Herold F, et al. Alexa, let's train now! - A systematic review and classification approach to digital and home-based physical training interventions aiming to support healthy cognitive aging. J Sport Health Sci. 2024;13(1):30-46.
  73. Liu Y, et al. The efficacy of exercise interventions on depressive symptoms and cognitive function in adults with depression: An umbrella review. Journal of Affective Disorders. 2025;368:779-88.
  74. Munro NR, et al. Effect of exercise on depression and anxiety symptoms: systematic umbrella review with meta-meta-analysis. British Journal of Sports Medicine. 2026;60(8):590-9.

Przedruki i uprawnienia

Tagi

MedycynaNumer 234Numer 234Warto pustaNumerremisjaleki