Zatwierdzenie komisji etycznej nie było wymagane dla niniejszego badania, ponieważ jest ono systematycznym przeglądem i metaanalizą opartą wyłącznie na wcześniej opublikowanych badaniach i nie wiązało się z bezpośrednim udziałem ludzi, gromadzeniem nowych danych ani dostępem do identyfikowalnych informacji o pacjentach.
Projekt badania
Niniejszy przegląd systematyczny i metaanaliza zostały przeprowadzone i opisane zgodnie z wytycznymi Preferred Reporting Items for Systematic Reviews and Meta-Analyses (PRISMA) z 2020 roku (Plik uzupełniający 1). Protokół przeglądu został prospektywnie zarejestrowany w bazie danych PROSPERO (numer rejestracyjny: CRD42024526811).
Przegląd literatury
Przeprowadzono kompleksowe przeszukiwanie literatury w bazach PubMed, MEDLINE, Embase, Cochrane Central Register of Controlled Trials (CENTRAL), China National Knowledge Infrastructure (CNKI), Wanfang Database, China Biomedical Literature Database (CBM) oraz VIP Chinese Journal Full-Text Database (VIP). Wszystkie bazy przeszukano od momentu ich powstania do 30 czerwca 2025 roku. Szczegółowa strategia wyszukiwania została przedstawiona w Pliku uzupełniającym 2.
Kryteria włączenia
Badania zostały włączone, jeśli spełniały następujące kryteria:
- Populacja: Uczestnicy z diagnozą depresji pierwotnej zgodnie z kryteriami ICD-10, CCMD-3, DSM-IV lub DSM-5. Badania obejmujące mieszane populacje psychiatryczne kwalifikowały się do analizy tylko wtedy, gdy dane dotyczące wyników dla uczestników z depresją pierwotną mogły zostać wyodrębnione osobno. Badania, w których nie można było wyizolować danych specyficznych dla depresji, zostały wykluczone.
- Projekt badania: RCT. Uwzględniono wyłącznie badania wyraźnie opisane jako randomizowane lub stosujące uznane metody losowego przydziału (np. tablice liczb losowych lub sekwencje randomizacji generowane komputerowo). Wykluczono badania kwazi-randomizowane stosujące metody przydziału takie jak naprzemienność, data urodzenia, numer dokumentacji szpitalnej lub inne procedury nielosowe.
- Interwencje i komparatory: Grupa interwencyjna otrzymywała samą akupunkturę lub akupunkturę w połączeniu z SSRI. Grupy kontrolne obejmowały akupunkturę pozorowaną (sham), listę oczekujących, psychoterapię lub SSRI. Akupunkturę manualną zdefiniowano jako wprowadzenie igieł z samą stymulacją manualną. Elektroakupunkturę zdefiniowano jako akupunkturę wykonywaną z zastosowaniem stymulacji elektrycznej poprzez wprowadzone igły. Akupunktura pozorowana obejmowała niepenetrujące urządzenia pozorujące, nakłuwanie powierzchowne lub nakłuwanie w punktach nieakupunkturowych. Psychoterapia obejmowała ustrukturyzowane interwencje psychologiczne, takie jak terapia poznawczo-behawioralna lub poradnictwo. Leczenie SSRI obejmowało każdy selektywny inhibitor zwrotnego wychwytu serotoniny podawany zgodnie ze standardową praktyką kliniczną.
- Wyniki: Główne punkty końcowe obejmowały wyniki w skali Hamilton Depression Rating Scale (HAMD), Self-Rating Depression Scale (SDS) oraz WHOQOL-BREF. Działania niepożądane oceniano za pomocą Side Effect Rating Scale for Antidepressants (SERS). Wyodrębniono wszystkie raportowane punkty czasowe ocen. Na potrzeby metaanalizy wyniki pogrupowano w zdefiniowane wcześniej przedziały (0–3 tygodnie, 4 tygodnie, 6 tygodni oraz 8–12 tygodni), aby ułatwić porównania między badaniami.
Kryteria wykluczenia
Badania zostały wykluczone, jeśli spełniały którekolwiek z następujących kryteriów:
- Niepełne lub niedostępne dane do analizy ilościowej: Wykluczono badania, w których dane niezbędne do syntezy ilościowej były niepełne lub niedostępne. Badania z częściowo brakującymi danymi dotyczącymi wyników włączono w przypadku dostępności wystarczających informacji ilościowych do obliczenia szacunków efektu. Jeśli niezbędnych danych nie można było uzyskać z opublikowanego raportu, badanie zostało wykluczone z metaanalizy.
- Duplikaty publikacji.
- Wyraźnie nieodpowiedni projekt badania lub poważne wady metodologiczne: Wykluczono badania o wyraźnie nieodpowiednim projekcie lub poważnych wadach metodologicznych. Do poważnych wad metodologicznych zaliczono: brak randomizacji, brak grupy kontrolnej, istotną nierównowagę wyjściową między grupami badawczymi, znaczące braki w raportowaniu wyników, niemożność weryfikacji danych dotyczących głównego punktu końcowego lub niewystarczające informacje wymagane do analizy ilościowej.
- Brakujące lub niepełne dane dotyczące głównego punktu końcowego.
Wybór badań
Wszystkie pobrane rekordy zostały zaimportowane do programu EndNote X9 w celu usunięcia duplikatów i przesiewu. Dwóch recenzentów (JG i NW) niezależnie przeanalizowało tytuły i streszczenia, a następnie dokonano oceny pełnych tekstów zgodnie z predefiniowanymi kryteriami kwalifikowalności. Rozbieżności rozstrzygano w drodze dyskusji, a w razie potrzeby poprzez arbitraż dodatkowego recenzenta (PL). Badania z niejasnymi lub nierandomizowanymi metodami przydziału zostały wykluczone, aby zapewnić rygor metodologiczny. Proces przeszukiwania literatury i wyboru badań przedstawiono na Rysunku 1.

Rysunek 1. Proces wyboru badań i identyfikacja badań kwalifikujących się do analizy. Diagram przepływu PRISMA 2020 ilustrujący proces wyboru badań do przeglądu systematycznego i metaanalizy. Rekordy zidentyfikowano poprzez przeszukanie ośmiu elektronicznych baz danych, przesiewowo przeanalizowano po usunięciu duplikatów, oceniono pod kątem kwalifikowalności poprzez przegląd pełnych tekstów i włączono zgodnie z zdefiniowanymi kryteriami włączenia i wykluczenia. Łącznie 76 randomizowanych badań kontrolowanych z udziałem 5 864 uczestników zostało uwzględnionych w syntezie jakościowej i ilościowej metaanalizie. Skróty: CBM, China Biomedical Literature Database; CNKI, China National Knowledge Infrastructure; PRISMA, Preferred Reporting Items for Systematic Reviews and Meta-Analyses. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.
Ekstrakcja danych
Dwoje recenzentów (JG i NW) niezależnie przeprowadziło ekstrakcję danych przy użyciu ustandaryzowanego formularza ekstrakcji danych (Supplementary File 3). Wyekstrahowane informacje obejmowały charakterystykę badania (pierwszy autor, rok publikacji, wielkość próby oraz metoda randomizacji), charakterystykę uczestników (wiek i kryteria diagnostyczne), szczegóły interwencji, mierniki efektów oraz punkty czasowe oceny wyników. Charakterystyka włączonych badań została podsumowana w Supplementary Table 1. Wszelkie rozbieżności rozstrzygano w drodze dyskusji, a w razie potrzeby poprzez arbitraż trzeciego recenzenta (PL).
Ocena ryzyka błędu w analizowanych badaniach
Ryzyko błędu w uwzględnionych badaniach RCT oceniono przy użyciu narzędzia Cochrane Risk of Bias Tool w wersji 2.0 (ROB 2.0). Narzędzie to ocenia błędy w obszarach obejmujących proces randomizacji, odchylenia od planowanych interwencji, brakujące dane dotyczące wyników, pomiar wyników oraz selekcję raportowanych rezultatów. Każde badanie sklasyfikowano jako wykazujące niskie ryzyko, pewne wątpliwości lub wysokie ryzyko błędu. Dwóch recenzentów (JG i NW) przeprowadziło oceny niezależnie, a rozbieżności rozstrzygano w drodze dyskusji lub konsultacji z trzecim recenzentem (PL).
Analiza statystyczna
Analizy statystyczne przeprowadzono przy użyciu programu RevMan w wersji 5.4. Dla wyników ciągłych obliczono różnice średnich (MDs) wraz z odpowiadającymi im 95% przedziałami ufności (CIs).
Heterogeniczność statystyczną oceniono za pomocą testu chi-kwadrat (χ2) oraz statystyki I2. Heterogeniczność interpretowano jako niską (I2 < 50%), umiarkowaną (50%–75%) lub znaczną (>75%). Metaanalizy z efektami losowymi przeprowadzono z wykorzystaniem modelu efektów losowych DerSimonian–Lairda.
W przypadku stwierdzenia znacznej heterogeniczności (I2 > 50%) przeprowadzono analizy w podgrupach, aby zbadać potencjalne źródła tej heterogeniczności, w tym rodzaj skali oceny depresji (HAMD-17, HAMD-24, HAMD-NS), rodzaj interwencji akupunkturowej (akupunktura manualna w porównaniu z elektroakupunkturą) oraz czas trwania leczenia i punkty czasowe obserwacji. Predefiniowane kategorie czasu trwania leczenia obejmowały okresy 0–3 tygodnie, 4 tygodnie, 6 tygodni oraz 8–12 tygodni. Analizy obserwacyjne przeprowadzono zgodnie z najbliższym zgłoszonym odstępem oceny. Zbiorcze wyniki analizy głównej, analiz w podgrupach oraz analiz wrażliwości przedstawiono w Tabeli uzupełniającej 2.
Analizy wrażliwości przeprowadzono z zastosowaniem alternatywnych modeli statystycznych (efekty stałe versus efekty losowe) oraz miar efektu (różnica średnich versus standaryzowana różnica średnich) w celu oceny rzetelności oszacowań zbiorczych.
Jeśli nie można było w sposób wystarczający wyjaśnić heterogeniczności, wyniki interpretowano ostrożnie, a pewność dowodów odpowiednio obniżano. Błąd publikacji oceniano za pomocą wykresów lejkowych w przypadku dostępności co najmniej 10 badań.
Pewność dowodów
Pewność dowodów dla każdego punktu końcowego oceniono z wykorzystaniem systemu GRADE. Dowody z randomizowanych badań kontrolowanych oceniono początkowo jako wysoką pewność, a następnie obniżono tę ocenę w oparciu o pięć domen: ryzyko błędu, niespójność, pośredniość, nieprecyzyjność oraz błąd publikacji. Ogólną pewność dowodów zaklasyfikowano jako wysoką, umiarkowaną, niską lub bardzo niską. Oceny pewności dowodów dla wszystkich głównych punktów końcowych podsumowano w Tabeli 1.
Tabela 1: Podsumowanie wyników i ocena pewności GRADE dla interwencji z użyciem akupunktury i elektroakupunktury u pacjentów z depresją pierwotną. Połączone szacunki efektów z randomizowanych badań kontrolowanych porównujących akupunkturę, elektroakupunkturę oraz ich kombinacje z selektywnymi inhibitorami zwrotnego wychwytu serotoniny (SSRIs) z psychoterapią, grupą kontrolną na liście oczekujących, akupunkturą pozorowaną lub samą terapią SSRIs. Wyniki obejmują punkty w skali Hamiltona dla depresji (HAMD) przy różnych czasach trwania leczenia, punkty w skali samooceny depresji (SDS) oraz działania niepożądane oceniane za pomocą skali oceny efektów ubocznych leków przeciwdepresyjnych (SERS). Dla każdego wyniku w tabeli przedstawiono ocenę ryzyka błędu, niespójności, pośredniości, nieprecyzyjności oraz błędu publikacji zgodnie z systemem Grading of Recommendations Assessment, Development and Evaluation (GRADE), wraz z liczbą uczestników i badań, połączonymi szacunkami efektów wyrażonymi jako różnice średnich (MDs) z 95% przedziałami ufności (CIs) oraz ogólną pewnością dowodów. Poziomy pewności skategoryzowano jako wysoki (⊕⊕⊕⊕), umiarkowany (⊕⊕⊕◯), niski (⊕⊕◯◯) lub bardzo niski (⊕◯◯◯). Kliknij tutaj, aby pobrać tę tabelę.
Interpretacja wyników była ściśle oparta na ocenach GRADE, przy czym wnioski poparte dowodami o niskiej lub bardzo niskiej pewności interpretowano ostrożnie i opisywano przy użyciu języka unikającego stwierdzeń przyczynowo-skutkowych i uwzględniającego niepewność.