Uygunluk kriterleri
Çalışmalar, aşağıdaki kriterlerin tamamını karşılıyorsa ve PICOS çerçevesine (Nüfus, Müdahale, Karşılaştırma, Sonuçlar, Çalışma Tasarımı) göre düzenlenmişse, dahil edilmiştir17. Bu çalışmada kullanılan tüm platformlar ve malzemeler Materyaller Tablosu'nda listelenmiştir. Tüm veritabanı aramaları Kasım 2025'te gerçekleştirildi. RevMan 5.3 ve EndNote 20'nin ötesinde ek bir özel yazılım (örneğin SAS, SPSS, R) kullanılmadı. GRADE değerlendirmesi, GRADEpro GDT çevrimiçi aracı kullanılarak manuel olarak gerçekleştirildi; Sürüm, erişim tarihinden itibaren kaydedilmiştir.
Nüfus (P)
Katılımcılar, DSM kriterlerine (herhangi bir versiyonu) veya ICD kriterlerine göre resmi bir majör depresif bozukluk (MDB) veya distimi tanısı olarak tanımlanan klinik açıdan anlamlı depresif semptomlara sahipti ve yapılandırılmış klinik mülakata (örneğin, SCID, MINI, CIDI) göre doğrulandı; veya standart depresyon tarama aracında doğrulanmış sınırın üzerinde bir puan (örneğin, Beck Depresyon Envanteri ≥ 14, Hamilton Depresyon Değerlendirme Ölçeği ≥ 14, CES-D ≥ 16, PHQ-9 ≥ 10, Geriatrik Depresyon Ölçeği ≥ 11). Katılımcılar herhangi yaştan (çocuklar, ergenler, yetişkinler, yaşlılar) olabilirler18. Kardiyovasküler hastalık, diyabet, anksiyete bozuklukları, madde kullanımı bozuklukları gibi komorbid tıbbi veya psikiyatrik durumları olan katılımcıları dahil eden çalışmalar, yalnızca birincil analiz depresyon alt grubu için ayrı olarak sonuçları bildirmişse veya katılımcıların %≥80'i depresyon kriterlerini karşılıyorsa dahil edilmiştir. Depresyonun, depresif olmayan bir popülasyonda ikincil sonuç olduğu çalışmalar (örneğin, depresyon taraması yapılmayan kalp yetmezliği olan hastalar) hariç tutuldu. Başlangıç depresyon şiddetinde (hafif, orta, şiddetli) bir kısıtlama yoktu, ancak alt grup analizleri için şiddet çıkarıldı.
Müdahale (I)
Müdahale, en az 2 hafta boyunca uygulanan herhangi bir aerobik, direnç, karma (aerobik + direnç) veya alternatif egzersiz (yoga, tai chi, dans) şeklinde tanımlanan yapılandırılmış, planlı fiziksel egzersizlerden oluşuyordu. Egzersiz müdahaleleri (eğitmen, terapist veya eğitmen tarafından) veya gözetimsiz (evde yapılan, kendi kendine yönlendirilen) olabilir. Egzersizin başka bir aktif müdahaleyle (örneğin, egzersiz + farmakoterapi, egzersiz + farkındalık) birleştirildiği çalışmalar, yalnızca egzersizin etkisi izole edilebilirse dahil edildi (örneğin, egzersiz + farmakoterapi vs. sadece farmakoterapi). Müdahalenin yalnızca fiziksel aktivite tavsiyesi (yapılandırılmış egzersiz reçetesi olmadan) veya yaşam tarzı danışmanlığından oluştuğu çalışmalar hariç tutuldu.
Karşılaştırıcı (C)
Kontrol grubuna yapılandırılmış egzersiz müdahalesi yapılmadı. Kabul edilebilir kontrol koşulları pasif kontroller (aktif terapötik müdahale yok) olarak kategorize edildi; örneğin bekleme listesi (gecikmeli tedavi), normal bakım (yapılandırılmış egzersiz olmadan standart tıbbi yönetim) veya müdahale yok; ve aktif kontroller (egzersiz dışı terapötik müdahaleler) örneğin dikkat kontrolü (örneğin, egzersiz dışı sağlık eğitimi, rahatlama seansları veya egzersiz yoğunluğu kriterlerini karşılamayan hafif esneme), farmakoterapi (sadece antidepresan ilaçlar) veya psikoterapi (egzersiz olmadan psikolojik terapi). Kontrol grubunun herhangi bir yapılandırılmış egzersiz (egzersiz yoğunluğu kriterlerini karşılayan minimum egzersiz veya esneme dahil) aldığı çalışmalar hariç tutuldu. Tutarsızlık notu, yenilik bölümünde aktif psikolojik müdahaleler veya esneme/gevşeme kontrolleriyle yapılan çalışmaların hariç tutulduğu belirtilse de, aktif karşılaştırıcıların (farmakoterapi, psikoterapi, dikkat kontrolü) dahil edilmesi doğrultusunda, egzersizin diğer yerleşik tedavilerle nasıl karşılaştırıldığına dair gerçek klinik soruyu yansıtmak için uygunluk kriterleri genişletildi. Bu fark tartışmada ele alınmıştır. Tüm analizler, kontrol tipinin etki boyutları üzerindeki etkisini incelemek için kontrol tipine (pasif ve aktif) göre katmanlanır.
Sonuçlar (O)
Çalışma, en az bir depresyona özgü sonuç ölçütü bildirdi: depresyon remisyonu (ikili olarak, çalışma yazarları tarafından artık tanı kriterlerini karşılamayan veya doğrulanmış bir ölçekte sınırın altında puan alan olarak tanımlanmıştır); VEYA (b) doğrulanmış bir ölçekte (örneğin, HAM-D, BDI, CES-D, PHQ-9, GDS, MADRS) ölçülen sürekli depresyon şiddet puanındaki değişim. Yalnızca belirli olmayan ruh hali ölçümlerini (örneğin, doğrulanmış depresyon ölçeği olmadan "iyilik hali", "duygusal durum" gibi gösterilen) rapor eden çalışmalar hariç tutuldu.
Çalışma tasarımı (S)
Yalnızca randomize kontrollü çalışmalar (RCT) dahil edildi. Prospektif kohort çalışmaları, vaka-kontrol çalışmaları, retrospektif çalışmalar, vaka serileri ve vaka raporları, tedavi etkilerinin tahmininde karıştırıcı ve seçilme yanlılığı riski yüksek olduğu için dışlandı. Çalışmalar paralel grup veya çapraz tasarım olabilir (sadece ilk faz çapraz denemeler için çıkarılmıştır). Çalışmalar, küçük çalışmaların etkilerini en aza indirmek için başlangıçta kol başına en az 10 katılımcı olması gerekiyordu. Dil kısıtlamaları uygulanmadı, ancak İngilizce dışı çalışmalar yalnızca tam bir çeviri mevcut ise dahil edildi.
Dışlama kriterleri
Depresyonun birincil sonuç olmadığı veya nüfusun depresyon için seçilmediği çalışmalar (örneğin, depresyonun ikincil ölçüt olarak olduğu genel tıbbi popülasyonlar) hariç tutuldu. Egzersiz müdahalesinin, izole bir egzersiz etkisi olmadan çok bileşenli yaşam tarzı müdahalesinin parçası olarak uygulandığı çalışmalar hariç tutuldu. Kontrol grubunun herhangi bir yapılandırılmış egzersiz yaptığı çalışmalar hariç tutuldu. Etki boyutlarını hesaplamak için yeterli veri olmayan çalışmalar (ortalamalar, standart sapmalar veya rapor edilmemiş ve yazarlardan alınamayan değişim puanları) hariç tutuldu. Aynı çalışma kohortunun tekrarlanan yayınları (yalnızca en tam veya en güncel rapor dahil edilmiştir) hariç tutuldu. Konferans özetleri, tezler ve tam metin erişimi olmayan yayımlanmamış makaleler hariç tutuldu.
Bilgi kaynakları
Tam çalışma, Şekil 1'de PRISMA Akış Şeması olarak gösterilmiştir. Aşağıdaki dahil etme kriterleri karşılanırsa literatür çalışmaya dahil edildi: çalışma randomize kontrollü bir çalışma (RCT); Soruşturma için seçilen hastalarda depresyon vardı; ve kontrol durumu egzersiz dışındaydı. Kabul edilebilir kontrol grupları arasında normal bakım (yapılandırılmış egzersiz olmadan standart tıbbi yönetim), bekleme listesi (gecikmeli tedavi), müdahale yok, dikkat kontrolü (örneğin, egzersiz dışı sağlık eğitimi, gevşeme seansları veya egzersiz reçete kriterlerine uymayan hafif esneme seansları) veya farmakolojik tedavi (sadece antidepresanlar) yer alıyordu. Kontrol grubunun yapılandırılmış aerobik, direnç veya karma egzersiz eğitimi aldığı çalışmalar hariç tutuldu. Kontrol gruplarının egzersiz bileşeni olmadan psikoterapi veya bilişsel-davranışçı terapi aldığı çalışmalar, yalnızca egzersiz yapmayan olarak açıkça tanımlandığı durumlarda dahil edilmiştir.
Çalışma, egzersiz müdahalelerini kontrol koşullarıyla karşılaştırdı. Kontrol grupları, egzersiz yapmayan karşılaştırıcılar olarak tanımlandı; bunlar arasında normal bakım, bekleme listesi, tedavi yok, dikkat kontrolü (örneğin, sağlık eğitimi, gevşeme veya egzersiz yoğunluğu kriterlerine uymayan esneme aktiviteleri) veya sadece farmakolojik tedavi bulunuyordu. Kontrol grubu herhangi bir yapılandırılmış egzersiz müdahalesi aldıysa veya egzersiz sadece başka bir egzersiz programıyla karşılaştırıldığında, egzersiz yapmayan bir kontrol kolu olmadan çalışmalar hariç tutuldu. Depresyon semptomları için egzersiz müdahalesinin etkilerini değerlendirmeyen çalışmalar, egzersiz veya kontrol dışı hastalarda depresyon üzerine yapılan çalışmalar ve karşılaştırma grubu olmayan çalışmalar hariç tutuldu.
Çok kollu çalışmaların yönetimi
İkiden fazla ilgili kol içeren çalışmalar için (örneğin, çoklu egzersiz müdahaleleri veya birden fazla karşılaştırıcı grup), çoklu egzersiz kolu ile tek kontrol kolu arasında çift sayım ve analiz birimi hatalarını önlemek için aşağıdaki stratejiler uygulandı: Bir çalışma, iki veya daha fazla farklı egzersiz müdahalesini (örneğin, aerobik ve direnç antrenmanı) tek bir kontrol grubuna karşılaştırdığında, egzersiz kolları Cochrane tarafından önerilen formüller kullanılarak tek bir birleştirilmiş egzersiz grubuna dönüştürüldü El Kitabı (Bölüm 23). Bu yaklaşım, kontrol grubu katılımcılarını çift saymaktan kaçınırken istatistiksel bağımsızlığı korur; egzersiz vs. birden fazla egzersiz dışı karşılaştırıcı. Bir çalışma, egzersizi iki veya daha fazla farklı kontrol durumuyla (örneğin, normal bakım ve farmakoterapi) karşılaştırdığında, yalnızca 'egzersiz yapmayan kontrol' tanımına en uygun kontrol durumu seçildi (öncelik sırası: bekleme listesi ≥ olağan bakım ≥ dikkat kontrolü > farmakoterapi > psikoterapi).
Birden fazla egzersiz yapmayan kontrol varsa, egzersizin etkisini fazla tahmin etmemek için en muhafazakar (en az aktif) karşılaştırıcı seçildi; Egzersiz mi yoksa sadece egzersiz (egzersiz dışı kontrol yok). Sadece farklı egzersiz türlerini (örneğin, yüksek yoğunluklu ve düşük yoğunluklu) egzersiz yapmayan kontrol kolu olmadan karşılaştıran çalışmalar, 'egzersiz ve kontrol' karşılaştırma kriterini karşılamadıkları için birincil analizden dışlandı. Çalışmalar için kombinasyon müdahalelerde, müdahale kolu egzersiz ve başka bir aktif bileşeni (örneğin, egzersiz + farmakoterapi, egzersiz + farkındalık) içeriyordu; kol sadece egzersizin etkisi izole edilebilirse dahil edildi. Eğer birleşik kol aynı egzersiz dışı bileşenle tek başına karşılaştırıldığında (örneğin, egzersiz + farmakoterapi vs. sadece farmakoterapi), fark egzersizin etkisini yansıtıyor olarak yorumlandı. Böyle bir izolasyon mümkün değilse, çalışma hariç tutuldu. Çok kollu denemeler için birleştirme stratejisinin sağlamlığını değerlendirmek amacıyla, tüm çoklu kol çalışmaları hariç tutan bir duyarlılık analizi yapıldı ve sonuçlar birincil analizin sonuçlarıyla karşılaştırıldı. Önemli farklılıklar bildirilir.
Birden fazla egzersiz dışı karşılaştırıcı varsa kontrol kolu seçimi şu şekilde yapıldı: Bir çalışma, egzersizi iki veya daha fazla farklı kontrol durumuyla (örneğin, olağan bakım ve farmakoterapi) karşılaştırırsa, egzersizin spesifik etkisini daha iyi izole etmek için pasif kontroller (bekleme listesi ≥ olağan bakım ≥ müdahalesiz) aktif kontrollere öncelik verildiğinde, keyfi seçimlerden kaçınmak için hiyerarşik bir seçim kuralı uygulandı. Sadece aktif kontroller varsa, egzersiz etkisinin aşırı tahmin edilmesini önlemek için en konservatif karşılaştırıcı (farmakoterapi ≥ psikoterapi ≥ dikkat kontrolü) seçildi ve seçilme kuralının birleştirilmiş tahmini etkileyip etkilemediğini test etmek için mevcut tüm kontrol kolları dahil olmak üzere hassasiyet analizleri yapıldı. Bu duyarlılık analizlerinin sonuçları Ek Materyallerde bildirilmiştir.
Arama stratejisi
Başlangıçtan Kasım 2025'e kadar sistematik olarak şu elektronik veritabanları aranmıştır: PubMed, Embase (OVID platformu), Cochrane Kontrollü Denemeler Merkezi Kaydı (CENTRAL), MEDLINE (OVID platformu) ve Google Scholar. MeSH terimleri, Emtree terimleri, anahtar kelimeler, Boolean operatörleri, kesinti ve alan etiketleri dahil olmak üzere tüm arama stratejileri Tablo 1'de sunulmaktadır. PubMed ve Embase için aramalar insan çalışmaları ve İngilizce dili ile sınırlıydı. CENTRAL ve MEDLINE için aramalar randomize kontrollü çalışmalarla sınırlıydı. Google Scholar için, ilk 500 kayıt, karmaşık Boolean aramasında platform sınırlamaları nedeniyle basitleştirilmiş bir arama dizisiyle ('egzersiz VE depresyon VE (remisyon OR ilaç VEYA tedavi)') aranmıştır19.
Veritabanı aramalarına ek olarak, aşağıdaki ek aramalar yapılmıştır: dahil edilen tüm çalışmaların referans listelerinin ve ilgili sistematik incelemelerin elle araması (kar topu araması), Google Scholar ve Web of Science kullanılarak temel dahil edilen çalışmaların atıf takibi, 2020–2025 yılları için önemli dergilerin (Mental Health and Physical Activity, Journal of Affective Disorders, Depression and Anxiety ve Psychosomatic Medicine) elle araması, ve klinik çalışma kayıtlarında (ClinicalTrials.gov, WHO ICTRP) yayımlanmamış veya devam eden çalışmalar için 'egzersiz' VE 'depresyon' arama terimleriyle arama yapıldı. Her veritabanı için her adımda alınan kayıt sayısı dahil olmak üzere tam arama geçmişi, Ek Tablo 1'de sunulmaktadır. PRISMA 2020 arama raporlama kontrol listesi takip edildi (Ek Dosya 1).
Seçim süreci
Tüm tanımlanan kayıtlar tekrarların kaldırılması için EndNote 20'ye aktarıldı. Deduplication sonrasında, iki bağımsız incelemeci, uygunluk kriterlerinin tutarlı uygulanmasını sağlamak için rastgele 100 kayıt örnekleminde kalibrasyon çalışması yaptı. Kabul edilebilir anlaşmayı onayladıktan sonra (κ ≥ 0.80), incelemeciler kalan tüm kayıtların başlıklarını ve özetlerini önceden belirlenmiş uygunluk kriterlerine göre bağımsız olarak taradılar. Her iki incelemeci tarafından potansiyel olarak ilgili olarak değerlendirilen kayıtlar tam metin incelemesi için gönderildi. Tam metin makaleler aynı iki hakem tarafından elde edilip bağımsız olarak değerlendirildi. Tam metin aşamasında dışlanma nedenleri PRISMA yönergelerine göre belgelenmiştir (örneğin, egzersiz müdahalesi yok, depresyon tanısı yok, kontrol grubu yok, karşılaştırmasız tasarım, tekrarlı yayın). Her iki tarama aşamasındaki anlaşmazlıklar tartışma yoluyla çözüldü; Eğer uzlaşmaya ulaşılamazsa, nihai kararı ilgili yazar verirdi. Tam metin dahil olmak için değerlendiriciler arası anlaşma, Cohen'in kappa istatistiği kullanılarak hesaplandı. İlk kopya kaldırma için EndNote 20 kullanılsa da, yazılım tarafından tespit edilmeyen ek kopyalar (örneğin, başlıklar, yazar isimleri veya dergi kısaltmalarındaki hafif farklılıklar nedeniyle) manuel başlık/özet taraması sırasında iki bağımsız gözden geçirici tarafından çıkarıldı.
Tarama ve seçim süreci, PRISMA 2020 akış diyagramında (Şekil 1) özetlenmiştir; bu diyagramda tanımlanan kayıt sayısı, kaldırılan kopyalar, taranan kayıtlar, geri alınmak üzere istenen raporlar, uygunluk değerlendirilen raporlar ve dahil edilen çalışmalar dahil edilmiştir; her aşamada özel hariç tutma nedenleri yer alır. Google Scholar, basitleştirilmiş 'egzersiz VE depresyon VE (remisyon OR ilaç OR tedavi)' dizisiyle şu ayarlarla arandı: alaka göre sırala, atıfları hariç tut ve patentleri dahil et. İlk 500 kayıt izlendi. Arama 15 Kasım 2025 saat 10'da gerçekleştirildi; 00 GMT'de, kişiselleştirme etkinleştirilmedi ve tutarlılığı doğrulamak için 16 Kasım 2025'te tekrarlandı.
Veri çıkarımı
İki incelemeci, dahil edilen her çalışmadan bağımsız olarak standartlaştırılmış, pilot tarafından test edilmiş veri çıkarma formu kullanarak veri çıkardı. Aşağıdaki bilgiler toplandı: ilk yazar adı, yayın yılı, çalışmanın yapıldığı ülke, örneklem büyüklüğü (toplam, egzersiz grubu, kontrol grubu), katılımcı özellikleri (yaş, depresyon tanısı veya tarama yöntemi, başlangıç depresyon şiddeti), müdahale detayları (egzersiz modu, yoğunluk, sıklık, süre, denetim, format), kontrol grubu tanımı, depresyon sonuç ölçütleri (ölçek adı ve aralığı), sonuç değerlendirme zamanlaması, ve istatistiksel sonuçlar (ortalamalar, standart sapmalar, etki tahminleri, güven aralıkları, p-değerler)20. Hakemler arasındaki anlaşmazlıklar tartışma yoluyla veya ilgili yazara danışarak çözülürdü.
Veri öğeleri
Veriler, farklı sonuçlar verdiğinde, depresyon semptomları için egzersiz müdahalesinin değerlendirilmesine dayalı olarak bağımsız olarak toplanmıştır.
Önyargı riski değerlendirmesi
İki yazar, dahil edilen her çalışmanın önyargı riskini Cochrane RoB 2 aracı kullanılarak (Ağustos 2019 versiyonu) değerlendirdi. RoB 2 aracı, rastgeleleştirme sürecinden kaynaklanan beş önyargı alanını, amaçlanan müdahalelerden sapmaları, eksik sonuç verilerini, sonucun ölçümü ve bildirilen sonucun seçimini değerlendirir. Her alan için incelemeciler 'düşük önyargı riski', 'bazı endişeler' veya 'yüksek önyargı riski' olarak bir yargı verdiler. Her çalışma için RoB 2 algoritmalarına göre genel bir risk önyargısı çıkarıldı: 'düşük risk' (tüm alanlar düşük riskli), 'bazı endişeler' (en az bir alan bazı endişeleri var ama yüksek riskli alanlar yok) veya 'yüksek risk' (yüksek riskli herhangi bir alan veya bazı endişeleri olan birden fazla alan). Değerlendirmeciler arasındaki anlaşmazlıklar tartışma yoluyla çözüldü ve gerektiğinde ilgili yazar tahkim etti. Çalışmalar, risk önyargısı değerlendirmelerine dayanarak dışlanmamıştır; Bunun yerine, bulguların sağlamlığını incelemek için meta-analizi 'düşük risk' veya 'düşük riskli + bazı endişeler' genel değerlendirmelerine sahip çalışmalarla sınırlamak üzere hassasiyet analizleri planlandı. Genel risk taraflı kararlar için değerlendiriciler arası anlaşma, Cohen'in kappa21'i kullanılarak hesaplandı.
Alt grup analizleri (moderatör analizleri)
Heterojenliğin potansiyel kaynaklarını araştırmak ve egzersiz etkinliğinin moderatörlerini belirlemek için, klinik ve metodolojik olarak ilgili değişkenlere dayanan bir dizi öncelikli alt grup analizi yapıldı. Alt grup analizleri, yeterli istatistiksel gücü sağlamak için her alt grup başına en az 10 çalışmanın olduğu sonuçlar için yapıldı. Aşağıdaki alt grup değişkenleri önceden belirlenmiştir.
Egzersiz özellikleri
Egzersiz modu aerobik (ör. yürüyüş, koşma, bisiklet) ile direnç (ör. ağırlık antrenmanı) ile karma (aerobik + direnç) ile diğer (yoga, dans, farkındalık temelli hareket) olarak kullanılır.
Egzersiz yoğunluğu hafif (örneğin, hafif yürüyüş, esneme) ile orta (örneğin, hızlı yürüyüş, orta bisiklet sürme) ve yoğun (ör. koşu, yüksek yoğunluklu aralıklı antrenman) olarak sınıflandırılmıştır – her çalışmada bildirilen standart kalp atış hızı veya algılanan eser kriterleri kullanılarak sınıflandırılmıştır.
Egzersiz süresi (haftalar) kısa (≤8 hafta) ile orta (9–12 hafta) ve uzun (≥13 hafta) olarak değerlendirin.
Denetim (eğitmen, eğitmen veya terapist tarafından yürütülen egzersiz seansları) ile denetimsiz (evde veya doğrudan gözetim olmadan kendi kendine yönlendirilen) denetleme.
Grup tabanlı ve bireysel (evde veya bire bir) formatında formatlanın.
Nüfus özellikleri
Depresyon teşhisi, ya DSM bozuklukları için yapılandırılmış klinik mülakat (SCID) veya mini uluslararası nöropsikiyatrik mülakat (MINI) gibi yapılandırılmış klinik mülakata (örneğin yapılandırılmış klinik mülakat ile teşhis edilen majör depresif bozukluk (MDD) veya belirlenmiş kesim puanlarına dayalı doğrulanmış tarayıcı araçları kullanılarak tanımlanan yükselmiş depresif semptomlar olarak kategorize edildi; bunlar arasında Center for epidemiyolojik çalışmalar depresyon ölçeği (CES-D ≥ 16) yer alıyordu, Beck depresyon envanteri (BDI ≥ 14) veya hasta sağlık anketi-9 (PHQ-9 ≥ 10). Yaş grubu yetişkinler (18–59 yaş) veya daha yaşlı yetişkinler (≥60 yaş) olarak sınıflandırıldı. Başlangıç depresyon şiddeti, her değerlendirme ölçeği için standart kesme puanlarına göre orta veya şiddetli olarak sınıflandırıldı; orta depresyon örneğin Hamilton Depresyon Derecelendirme Ölçeği (HAM-D) skoru 14–18 veya BDI puanı 14–19 olarak tanımlandı; ağır depresyon ise ≥19 HAM-D puanı veya ≥20 BDI puanı olarak tanımlandı.
Çalışma tasarımı özellikleri
Kontrol grubu tipi ya bekleme listesi, tedavi edilmemiş veya olağan bakım kontrol koşulları dahil pasif, ya da dikkat kontrol müdahaleleri, farmakoterapi veya psikoterapi dahil aktif olarak kategorize edildi. Yayın yılı, çalışma bulgularındaki potansiyel zamansal eğilimleri incelemek için üç döneme ayrıldı—2010 öncesi, 2010–2019 ve 2020–2025. Önyargı riski, Cochrane Risk of Bias 2 (RoB 2) aracı kullanılarak değerlendirildi ve düşük riskli, bazı endişeler veya yüksek riskli olarak kategorize edildi. Örneklem büyüklüğü küçük (toplam 50 katılımcı <), orta (50–99 katılımcı) veya büyük (≥100 katılımcı) olarak sınıflandırıldı. Kontrol grubu tipi pasif olarak kategorize edildi (bekleme listesi, normal bakım, müdahale yok) – bu kontroller aktif bir terapötik alternatif sunmaz, bu nedenle egzersizin etkisi beklenti veya dikkat etkileri nedeniyle daha büyük olabilir; ve aktif (dikkat kontrolü, farmakoterapi, psikoterapi) – bu kontroller, egzersiz dışı ve güvenilir terapötik değere sahip bir müdahale sağlar ve egzersizin özgün etkisinin daha muhafazakar bir tahminini sağlar. Sonuçlarda varsayımsal olduğu gibi, pasif ve aktif kontroller için ( etkileşim için p < 0.10) anlamlı derecede daha büyük bir etki olduğu doğrulandı (bkz. Tablo 3).
Alt grup analizleri için istatistiksel yöntemler
Her alt grup analizi için, her alt grup içindeki çalışmalar rastgele etkimodeli 22 kullanılarak bir topa toplanmıştır. Alt grupları karşılaştırmak için karışık etkiler meta-regresyon veya alt grup etkileşim testleri kullanıldı. Özellikle, alt gruplar arası farklar için Q-istatistiği hesaplanmış ve etkileşim için ilgili p-değeri rapor edilmiştir. Alt grup farklılıkları için < p-değeri (0.05 yerine) istatistiksel olarak anlamlı olarak kabul edildi ve meta-analizlerde etkileşim testlerinin düşük gücünü kabul etti. Çoklu karşılaştırma ayarlaması (12 alt grup analizi) yapılmadı; bu nedenle, alt grup bulguları keşif amaçlı olarak yorumlanmalıdır.
Duyarlılık analizleri
Birincil bulguların sağlamlığını değerlendirmek için aşağıdaki önceden belirlenmiş hassasiyet analizleri yapılmıştır. Model seçimi, her iki sonucu da sabit etkili model (ters varyans yöntemi) kullanarak birincil rastgele etkilerle karşılaştırdı, yüksek riskli yanlılık çalışmalarının genel olarak 'yüksek önyargı riski' (n = 17) yargısına sahip hariç çalışma olarak hariç tutuldu ve kalan çalışmaları (düşük risk + bazı endişeler) yeniden analiz etti, çoklu egzersiz kolu birleştirildiği veya çoklu karşılaştırmalar için tek bir kontrol grubunun kullanıldığı çok kollu çalışmaların hariç tutulması (n = 9) ve yalnızca iki kollu çalışmaları yeniden analiz etti; değişim puanları için standart sapmaların (r = 0.50) rapor edilmediği (n = 6) yerine varsayılan veya varsayılan verilere sahip çalışmaların hariç tutulduğu çalışmalar olarak hariç tutuldu; 2001'den önce yayımlanan hariç çalışma olarak CONSORT öncesi çalışmaların hariç tutulması (n = 5) iyileştirilmiş raporlama standartlarının etki tahminlerini etkileyip etkilemediğini değerlendirmek için, etki analizini (bir dışarıdan çıkarma) ve bir dışarı bırakılmış meta-analiz yapıldı, Her çalışmayı sıralı olarak çıkarıp birleştirilmiş etkinin yeniden hesaplanarak etkili çalışmaları (kaldırılması puan tahminini %>10 değiştiren veya güven aralığını orijinal sınırların ötesine taşıyanlar olarak tanımlanan) ve uzun vadeli takip analizleri yapıldı. Müdahaleden sonraki ≥6 ay sonra, N = 6) takip verilerini bildiren çalışmalar için bu veriler ayrı ayrı birleştirilerek egzersiz etkilerinin dayanıklılığını inceledi, birincil son nokta (müdahale sonrası) verileriyle karıştırılmadan. Tüm duyarlılık analizleri, aksi belirtilmedikçe rastgele etki modelleri kullanılarak yapılmıştır. Duyarlılık analizlerinin sonuçları Sonuçlar bölümünde ve ek materyallerde bildirilmektedir. Bu önceden belirlenmiş analizlerden herhangi bir sapma şeffaf şekilde bildirilir.
Sürekli sonuç verilerinin çıkarılması (depresyon puanları)
Her dahil edilen çalışma için, egzersiz ve kontrol grupları için ortalama depresyon puanı ve standart sapması (SD) birincil son noktada (egzersiz müdahalesinin sonuna en yakın zaman noktası olarak tanımlanmıştır) çıkarılmıştır. Çalışmalar arasında tutarlılığı en üst düzeye çıkarmak için aşağıdaki hiyerarşik çıkarma kuralı uygulandı: ayarlanmış etki tahminleri (örneğin, %95 CI veya SE'ye sahip ANCOVA'dan türetilen gruplar arası farklar) mevcut olduğunda önceliklendirildi; çünkü bunlar temel dengesizlikleri hesaba katıyor ve genellikle müdahale etkisinin en az taraflı tahminini sağlıyor. Başlangıç sonrası (eksi-pre veya yüzde değişimi sonrası) ve SD'leri düzeltilmiş etkiler bildirilmediğinde alındı. Değişim puanlarının SD'si doğrudan bildirilmediyse, şu formülle hesaplandı:
(1)
burada r = 0.5 muhafazakar korelasyon katsayısı varsayılmıştır, ancak çalışma rapor edilen veya atnatabilecek bir korelasyon sunmamaktadır. Sadece müdahale sonrası puanlar (ayarlama veya değişiklik puanları olmadan) ne düzeltilmiş etkiler ne de değişiklik puanları mevcut olduğunda alınmıştır. Bu, gruplar arasındaki potansiyel temel farklılıkları hesaba katmadığı için en az tercih edilen seçenekti. Ortalama ve SD'ler doğrudan raporlanmamış gibi diğer istatistiklerden dönüşüm yapıldığında, mevcut istatistikler (medyanlar ve IQR'ler, t-istatistikler, F-istatistikler, p-değerler veya %95 CI'ler) Cochrane El Kitabı'ndan (Bölüm 6) standart formüller kullanılarak ortalamalara ve SD'lere dönüştürüldü. Yalnızca medyanlar ve aralıklar bildiren çalışmalar, yalnızca örneklem büyüklükleri (grup başına n ≥ 25) yaklaşık normalliği varsayacak kadar büyükse veya çalışma yazarları talep üzerine ortalama ve SD sağlamışsa dahil edilmiştir.
Birden fazla zaman noktası Birden fazla takip zaman noktası rapor edilen çalışmalarda, aktif müdahale döneminin sonuna en yakın zaman noktası (genellikle 8–12 hafta) çıkarıldı. Uzun vadeli takip verileri (≥müdahaleden 6 ay sonra) planlı ikincil dayanıklılık analizi için ayrı alındı, ancak bu veriler birincil son nokta verileriyle birleştirilmedi. Birden fazla depresyon ölçeği. Bir çalışma birden fazla depresyon ölçeği bildirdiğinde (örneğin, hem HAM-D hem de BDI), klinisyen tarafından derecelendirilen ölçekler (HAM-D, MADRS) kendi raporlama ölçeklerine (BDI, CES-D, PHQ-9, GDS) öncelik verilmiştir çünkü klinisyen dereceli ölçekler depresyon denemelerinde altın standart olarak kabul edilir. Her ikisi de rapor edildiyse, çalışma yazarları tarafından tanımlanan birincil sonuç ölçütü çıkarıldı. Eksik SD'lerin standart sapmalar eksikmiş ve mevcut istatistiklerden hesaplanamayacakmış gibi atfedilmesi; benzer örneklem büyüklükleri ve aynı depresyon ölçeğine sahip çalışmalardan ortalama SD alınarak atfedilirdi. Bu atama etkisini değerlendirmek için duyarlılık analizleri, atletilmiş SD'lerle yapılan çalışmalar hariç tutuldu. Tüm veri çıkarma kararları, iki yazar tarafından standart bir veri çıkarma formu kullanılarak bağımsız olarak gerçekleştirilmiştir. Tutarsızlıklar tartışma yoluyla veya ilgili yazar tarafından çözüldü. Çıkarma kuralı ve herhangi bir sapma kaydedildi.
Etki ölçütleri
İkili sonuç (depresyon remisyonu) için, %95 güven aralıklı (CI) olasılık oranları (OR) hesaplandı. Sürekli sonuç (depresyon şiddet puanları) için, dahil edilen çalışmaların farklı depresyon derecelendirme ölçekleri (örneğin, Hamilton Depresyon Değerlendirme Ölçeği, Beck Depresyon Envanteri, PHQ-9, CES-D, Geriatrik Depresyon Ölçeği) kullanılması bekleniyordu. Dahil edilen çalışmalar farklı depresyon derecelendirme ölçekleri kullansa da, standart ortalama farkı (SMD) bildirildi çünkü tüm ölçeklerde HAM-D'ye dönüşüm denklemleri kurulmuştu.
İstatistiksel sentez
İkitotomik sonuç (depresyon remisyonu) için, %95 güven aralıkları (CI) ile birleştirilmiş olasılık oranları (OR) hesaplandı. Sürekli sonuç (depresyon şiddet puanları) için, dahil edilen çalışmaların farklı depresyon derecelendirme ölçekleri kullandığı için %95 GA ile birleştirilmiş standart ortalama farklar (SMD, Hedges' g) hesaplandı. Çalışmalar arasında beklenen klinik ve metodolojik çeşitlilik (egzersiz protokolleri, popülasyonlar, kontrol koşulları ve sonuç ölçütlerindeki farklılıklar) göz önüne alındığında, tüm birincil analizler için önceden rastgele etki modeli (DerSimonian ve Laird yöntemi) seçilmiştir 22. Heterojenlik, Cochrane Handbook kriterleriyle yorumlanan I2 istatistiğiyle nicelendirildi; bu nedenle %0–%40 (önemli olmayabilir), %30–60 (orta heterojenlik), %50–90 (önemli heterojenlik) ve %75–100 (önemli heterojenlik) olarak yorumlandı. Çalışma arası varyans (tau2) da tahmin edildi ve uygun olduğunda toplanan etkiler için %95 tahmin aralıkları hesaplandı.
İstatistiksel analiz ve heterojenlik
Dahil edilen çalışmalarda beklenen klinik ve metodolojik çeşitlilik nedeniyle (egzersiz türü, yoğunluk, süre, gözetim, popülasyon özellikleri, depresyon şiddeti, kontrol koşulları ve depresyon ölçüm ölçekleri dahil olmak üzere), tüm birincil analizler için önceden rastgele etki modeli (DerSimonian ve Laird yöntemi)seçildi 22. Rastgele etki modeli, gerçek etkinin çalışmalar arasında değiştiğini varsayar ve daha geniş güven aralıklarıyla daha muhafazakar bir tahmin sunar; bu da beklenen heterojenlik göz önüne alındığında uygundur.
Heterojenliğin değerlendirilmesi
Heterojenlik, tesadüften ziyade gerçek heterojenlikten kaynaklanan çalışmalar arasındaki toplam varyasyonun yüzdesini temsil eden I2 istatistiğiyle nicel edildi. I2 değerleri şu şekilde yorumlandı: %0–%40 (önemli olmayabilir); %30–60 (orta derecede heterojenlik); %50–90 (önemli heterojenlik); %75–100 (önemli heterojenlik), Cochrane El Kitabı kriterlerinde olduğu gibi. I2'ye ek olarak, uygun olduğunda toplanmış etki için çalışma arası varyans (tau2) ve rapor %95 tahmin aralıkları tahmin edildi.
Model seçimi gerekçesi
Sabit etkili bir model herhangi bir birincil analiz için kullanılmadı çünkü çalışmalar işlevsel olarak aynı değildir (egzersiz protokolleri, popülasyonlar ve sonuç ölçütleri farklıdır), tüm çalışmalarda paylaşılan tek bir gerçek etkinin varsayımı egzersiz-depresyon araştırmalarında inandırıcı değildir ve I2 düşük görünse bile (örneğin, I2 = %48 remisyon için), sadece klinik çeşitlilik rastgele etkiler yaklaşımını haklı çıkarır. Tamlık için, sabit etkili model kullanılarak duyarlılık analizleri de yapıldı ve model seçiminin sonuçları etkileyip etkilemediğini inceledi; Bu sonuçlar ek materyallerde rapor edilmiştir.
Yayın önyargısı değerlendirmesi
Yayın yanlılığı ve küçük çalışma etkileri, hem huni grafiklerinin görsel incelenmesi hem de Egger'in doğrusal regresyon testi kullanılarak değerlendirildi. Her sonuç için, etki boyutunu (remisyon için log oranı; depresyon puanları için standart ortalama fark) standart hataya karşı gösteren huni grafikleri oluşturuldu. Nicel değerlendirme için, Egger testi standartlaştırılmış etki tahminini onun hassasiyetine (standart hatanın tersi) göre regresyona çevirir. İstatistiksel olarak anlamlı bir kesinti (≥10 çalışmayla meta-analizlerde p < 0.10), huni grafik asimetrisinin varlığını gösterir; bu da yayın yanlılığını veya küçük çalışmaları etkilerini gösterebilir. Buna karşılık, p ≥ 0.10 bu tür bir yanlılığa dair istatistiksel kanıt göstermemektedir.
Tahmin aralıkları
Birincil rastgele etkiler meta-analizi için, gelecekteki bir çalışmanın gerçek etkisinin içinde olacağı aralıkları tahmin eden %95 tahmin aralıkları hesaplandı. Geniş tahmin aralıkları, egzersizin etkisinin ortamlar ve popülasyonlar arasında önemli ölçüde değişebileceğini ve bunun önemli klinik sonuçları olabileceğini göstermektedir. Çoklu egzersiz kollarının tek bir grupta birleştirildiği çok kollu çalışmalarda, Cochrane El Kitabı'ndaki formüller birleşik ortalamalar, standart sapmalar ve örneklem boyutları hesaplamak için kullanıldı. Birden fazla egzersiz karşılaştırmasında tek bir kontrol kolu kullanan çalışmalarda, etki boyutları hesaplanırken kontrol grubu örneklem büyüklüğü egzersiz kolu sayısına bölünerek çift sayım önlendi. Tüm analizler, iki yazar tarafından bağımsız olarak doğrulanan çoklu kol yönetimi ile Reviewer Manager Sürüm 5.3 kullanılarak gerçekleştirilmiştir.
Tedavi için gereken sayı (NNT) hesaplaması
Tedavi için gereken sayı (NNT), remisyon için birleştirilmiş olasılık oranından (OR) şu formülle hesaplandı

burada CER (kontrol olay oranı), dahil edilen tüm çalışmalarda toplanan remisyon oranıydı. NNT ayrıca, Furukawa ve Leucht (2011) tarafından önerilen alternatif yöntemle hesaplandı; bu yöntem, normal eğriyi altındaki alan kullanılarak Cohen'in d'sini (SMD'den) NNT'ye dönüştürür. NNT değerleri, birincil analiz için (tüm çalışmalar), alt gruplar için (düşük riskli önyargı çalışmaları, MDD için çalışmalar, denetimli egzersiz çalışmaları) ve psikoterapi ile antidepresan ilaçlar için yayımlanmış NNT değerleri için karşılaştırma için hesaplandı. NNT ≤ 10 klinik olarak anlamlı kabul edildi.
Klinik olarak bilinen metriklere (BDI ve HAM-D) dönüşüm
Klinik yorumlanabilirliği artırmak için, depresyon puanları için birleştirilmiş standartlaştırılmış ortalama farkı (SMD), yaygın olarak kullanılan iki depresyon ölçeğinde tahmini ortalama farklarına dönüştürüldü: Beck Depresyon Envanteri (BDI, 0–63 aralığı) ve Hamilton Depresyon Değerlendirme Ölçeği (HAM-D, 0–52 aralığı). Dönüşüm aşağıdaki formülü kullandı

SDbir havuzda olduğunda, referans olarak sırasıyla BDI (n = 8 çalışma) veya HAM-D (n = 16 çalışma) kullanılan çalışmalardan toplanan başlangıç standart sapmasıdır. Bu yaklaşım, SMD etkisi boyutunun ölçekler arasında tutarlı olduğunu varsayar. Bu çalışmalardan gözlemlenen ortalama farklılıklar da bir hassasiyet kontrolü olarak bildirilmiştir. BDI veya HAM-D üzerinde ≥3 puanlık bir değişiklik, NICE yönergelerine göre klinik açıdan anlamlı olarak kabuledildi 5.
Yerleşik depresyon tedavileriyle karşılaştırma
Egzersizin etkisini diğer birinci basamak depresyon tedavilerine kıyasla bağlamlandırmak için, egzersiz için toplanan NNT, yakın zamanda yapılan yüksek kaliteli meta-analizlerden yayımlanmış NNT değerleriyle karşılaştırıldı. Cuijpers ve ark. (2020)'nin bildirdiği gibi, psikoterapi tüm yaş gruplarında 2.5 NNT'ye sahiptir. Cipriani ve ark. (2018)'in bildirdiği gibi, antidepresan ilaçların NNT'si plaseboya göre 4.3'tür. Bu karşılaştırmalar betimleyicidir ve birebir denemelere dayanmaz. Egzersiz verileri psikoterapi veya ilaç verileriyle birleştirilmedi ve çalışma popülasyonları, sonuç tanımları ve zaman noktalarındaki farklılıklar doğrudan karşılaştırılabilirliği sınırlandırdı.
Raporlama yanlılığının (yayın yanlılığı) değerlendirmesi
Her sonuç için (remisyon ve depresyon puanı) için huni grafikleri, etki boyutunu (remisyon için log olasılık oranı; depresyon puanları için standart ortalama fark) standart hataya karşı gösteren huni grafikleri oluşturuldu. Huni grafikindeki asimetri, yayın yanlılığı, küçük çalışma etkileri veya heterojenliği gösterebilir. Egger'in regresyon testi, diğer adıyla Egger'in doğrusal regresyon testi, huni grafik asimetrisini resmen değerlendirmek için yapıldı. Egger'in testi, standartlaştırılmış etki tahminini hassasiyetine (standart hatanın tersi) göre regresyona çevirir. İstatistiksel olarak anlamlı bir kesinti (Cochrane Handbook'< 10'dan az çalışmaya sahip sonuçlar için önerildiği gibi Egger testi için p 0.10, daha büyük meta-analizler için p < 0.05) küçük çalışmalar etkilerinin veya yayın yanlılığının varlığını gösterir. Buna karşılık, p ≥ 0.05 (veya p ≥ 0.10) bu tür bir yanlılığın istatistiksel olarak anlamlı bir kanıtı olmadığını göstermektedir. Yorumlama uyarısı, çünkü Huni kurgu asimetrisi, yayın önyargısıyla eşanlamlı değildir; Ayrıca gerçek heterojenlikten, çalışma kalitesindeki farklılıklar veya şans nedeniyle de ortaya çıkabilir ve sonuçlar buna göre yorumlanmalıdır23.
Kanıtın kesinliği (GRADE değerlendirmesi)
Her sonuç için kanıtların genel kesinliği (remisyon ve depresyon puanı) Önerilerin Derecelendirilmesi, Gelişim ve Değerlendirme (GRADE) çerçevesi kullanılarak değerlendirildi. İki yazar kesinliği bağımsız olarak değerlendirdi ve anlaşmazlıkları tartışma yoluyla çözdü. GRADE yaklaşımı, kesinliği düşürebilecek beş alanı dikkate alır: önyargı riski (RoB 2 değerlendirmelerine dayanarak, düşük riskli, bazı endişeli veya yüksek riskli çalışmaların oranı dahil), tutarsızlık (I2 istatistikleri, tahmin aralıkları ve güven aralıklarının örtüşmesine dayanarak), dolaylılık (çalışma popülasyonları, müdahaleler, karşılaştırıcılar ve sonuçlar arasındaki farklara dayanarak, inceleme sorusuna göre değişir), kesintisizlik (optimal bilgi boyutuna ve %95 güven aralıklarının klinik olarak önemli eşikleri aşıp aşmadığına göre, örneğin remisyon için 1.0 oran veya depresyon puanlarında küçük bir etki için 0.2 standart ortalama farkı gibi) ve yayın yanlılığı (huni grafik asimetrisi ve Egger testine dayanarak). Kesinlik şu şekilde derecelendirildi: Yüksek (Daha fazla araştırmanın etki tahminine olan güveni değiştirmesi pek olası değildir); Orta (Daha fazla araştırma güven üzerinde önemli bir etkiye sahip olabilir ve tahmini değiştirebilir); Düşük (Daha fazla araştırmanın güven üzerinde önemli bir etkisi olacağı ve tahmini değiştirmesi muhtemeldir); ve Çok düşük (Herhangi bir etki tahmini çok belirsizdir). Kesinlik değerlendirmeleri, remisyon (ikili sonuç) ve depresyon puanları (sürekli sonuç) için ayrı ayrı yapıldı.