$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Badania zostały zatwierdzone przez Komitet Etyki Biomedycznej Uniwersytetu Pekińskiego (IRB00001052-11015). Wszyscy badani wyrazili świadomą zgodę.
Populacja badawcza
Dane do tego badania pochodzą z CHARLS 2020, które obejmuje 150 jednostek na poziomie hrabstwa oraz 450 jednostek na poziomie wiosek w całym kraju, obejmując około 10 000 gospodarstw domowych oraz 19 395 osób w średnim i starszym wieku w wieku 45 lati starszych w wieku 45 lat i starszych. Badanie zastosowało wieloetapowe próbkowanie prawdopodobieństwa. Osoby były uwzględniane, jeśli spełniały następujące kryteria: wiek 45 lat lub więcej; wybrane mieszkanie w odpowiedzi na pytanie z kwestionariusza BA007: Jaki jest rodzaj zamieszkania pod adresem zamieszkania?; oraz udzielił jasnej odpowiedzi na 10-punktową skalę depresji Centrum Badań Epidemiologicznych (CES-D-10). Osoby zostały wykluczone, jeśli spełniały jedno lub więcej z następujących kryteriów: odpowiedzi wskazujące na miejsce zamieszkania niebędące zamieszkaniem (w tym społeczności, szpitale i inne lub zaginione); brak informacji o depresji; brak informacji o odpowiednich kowarianach. Ostatecznie do badania uwzględniono 14 466 dorosłych spełniających początkowe kryteria. Szczegółowy proces wyboru uczestników przedstawiono na Rysunku 1.

Rysunek 1: Schemat przepływowy wyboru populacji badawczej. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.
Definicja zmiennych
Objawy depresji oceniano za pomocą uproszczonej wersji CES-D-10, która wykazuje wysoką wiarygodność i wiarygodność w poprzednich badaniach 22,23. CES-D-10 składa się z 10 pozycji w czterech skalach: 0 = nigdy, 1 = czasem lub rzadko, 2 = często oraz 3 = zawsze, a piąty i ósmy punkt są punktowane w odwrotnym układzie24. Całkowity wynik skali depresji uzyskuje się przez sumowanie ocen wszystkich 10 pozycji, w zakresie od 0 do 30; Im wyższy wynik, tym poważniejsze objawy depresyjne danej osoby. Na podstawie wcześniejszych badań populacji średniego i starszego 25,26, uczestnicy z wynikiem CES-D-10 ≥10 zostali sklasyfikowani jako mającycy objawy depresyjne, natomiast wyniki <10 jako osoby niedepresyjne.
Informacje zebrane od wszystkich uczestników badania obejmują dane demograficzne (wiek, płeć, stan cywilny, miejsce zamieszkania i poziom wykształcenia), nawyki życiowe i stan zdrowia fizycznego (aktywność fizyczna, palenie, picie, interakcje społeczne, samoocena zdrowia, stan chorób przewlekłych oraz czas drzemki) oraz informacje dotyczące warunków życia i dzieci (satysfakcja z warunków życia, stan cywilny potomstwa, oraz stan zdrowia potomstwa). Choroby przewlekłe są diagnozowane przez lekarzy i obejmują nadciśnienie, dyslipidemię, nowotwory, przewlekłe choroby płuc, choroby serca, udar, artretyzm oraz reumatyzm.
Analiza statystyczna
Binarna analiza regresji logistycznej
Zmienne kategoryczne przedstawiane są jako częstotliwości i procenty. Testy chi-kwadrat zostały przeprowadzone, aby zbadać różnice w częstości występowania depresji pomiędzy różnymi cechami demograficznymi w populacji badanej. Przeprowadzono analizę binarnej regresji logistycznej w celu zidentyfikowania istotnych czynników związanych z objawami depresji. Analizy te zostały przeprowadzone za pomocą oprogramowania SPSS (wersja 21.0).
Regresja LASSO
W wersji R 4.3.2 zbiór danych był losowo podzielony na zestaw treningowy i zestaw testowy w stosunku 7:3, używając stałego losowego ziarna, aby zapewnić powtarzalność. Konkretnie, 70% danych zostało przypisanych do zbioru treningowego do tworzenia modeli, a 30% do zestawu testowego do niezależnej walidacji. Po pierwsze, zmienne statystycznie istotne (p < 0,05) w binarnej regresji logistycznej zostały uwzględnione w analizie regresji LASSO, aby zapobiec nadmiernemu dopasowaniu poprzez zmniejszenie współczynników. Optymalna wartość lambda została określona za pomocą 10-krotnej walidacji krzyżowej. Lambda.1se został wybrany na podstawie jednej reguły błędu standardowego, aby osiągnąć optymalną wydajność wyboru zmiennej. Kurczenie LASSO zastosowano, aby zapobiec nadmiernemu dopasowaniu poprzez redukcję współczynników mniej istotnych zmiennych do zera. Szczegółowe informacje można znaleźć w Pliku Uzupełniającym 1 (pozycja 1).
Budowa nomogramu
Względne znaczenie wybranych predyktorów było oceniane według bezwzględnej wielkości ich standaryzowanych współczynników i zwizualizowane za pomocą wykresu leśnego. Wykonano nomogram predykcyjny z wykorzystaniem pakietu rms, oparty na ostatecznym równaniu regresji logistycznej. Szczegółowe informacje można znaleźć w Pliku Uzupełniającym 1 (pozycja 2).
Walidacja modelu
Rozróżnianie oceniano poprzez obliczenie pola pod charakterystyką pracy odbiornika (AUC) za pomocą pakietu pROC. AUC był obliczany oddzielnie dla zbioru treningowego i testowego. Zazwyczaj AUC większe niż 0,75 oznacza dobrą dyskryminację. Szczegółowe informacje można znaleźć w Pliku Uzupełniającym 1 (pozycja 3).
Kalibracja: Kalibracja modelu została oceniona za pomocą testu dopasowania Hosmera-Lemeshowa i zwizualizowana za pomocą krzywych kalibracyjnych generowanych przez pakiet RMS, przedstawiających przewidywane prawdopodobieństwa względem obserwowanych częstotliwości. Test nieistotny Hosmera-Lemeshowa (s. > 0,05) wskazuje na dobrą kalibrację. Szczegółowe informacje można znaleźć w Pliku Uzupełniającym 1 (pozycja 4).
Użyteczność kliniczna: Użyteczność kliniczna została oceniona za pomocą analizy krzywej decyzyjnej (DCA) w ramach pakietu RMDA, obliczając korzyści netto na progowych prawdopodobieństwach od 0% do 100%. Szczegółowe informacje można znaleźć w Pliku Uzupełniającym 1 (pozycja 5).
Walidacja lasu losowego: Jako uzupełnienie zaimplementowano model losowego lasu przy użyciu pakietu randomForest, aby ocenić stabilność i uogólnialność modelu. Krzywa zbieżności wskaźnika błędów została narysowana, aby ocenić zależność między liczbą drzew a dokładnością predykcji zarówno w zbiorach treningowych, jak i testowych. Dwustronna wartość p < 0,05 została uznana za wskazaną statystycznie istotną różnicę. Szczegółowe informacje można znaleźć w Pliku Uzupełniającym 1 (pozycja 6).