$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Исследование было одобрено Комитетом по биомедицинской этике Пекинского университета (IRB00001052-11015). Все участники предоставили информированное согласие.
Исследуемая популяция
Данные для этого исследования были получены в рамках CHARLS 2020, который охватывает 150 единиц окружного и 450 деревень по всей стране, охватывая примерно 10 000 домохозяйств и 19 395 людей среднего и пожилого возраста в возрасте 45 лет истарше 21 года. Опрос использовал многоступенчатый подход вероятностной выборки. Лица включались, если они соответствовали следующим критериям: возраст 45 лет и старше; выбрал дом в ответ на вопрос BA007: Каков тип проживания по адресу проживания?; а также дал ясный ответ на 10-пунктную шкалу депрессии Центра эпидемиологических исследований (CES-D-10). Лица исключались, если они соответствовали одному или нескольким из следующих критериев: ответы, указывающие на проживание вне дома (включая сообщества, больницы и другие, или отсутствовать); отсутствие информации о депрессии; отсутствие информации о соответствующих ковариатах. В итоге в исследование были включены 14 466 взрослых, соответствующих первоначальным критериям. Подробный процесс отбора участников иллюстрирован на рисунке 1.

Рисунок 1: Блок-схема для выбора популяций исследований. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Определение переменных
Симптомы депрессии оценивались с помощью упрощённой версии CES-D-10, который обладает высокой надёжностью и валидностью в предыдущихисследованиях 22,23. В CES-D-10 10 10 предметов с четырьмя гаммами: 0 = никогда, 1 = иногда или редко, 2 = часто и 3 = всегда, а пятый и восьмой предметы оцениваются обратной24. Общий балл шкалы депрессии получается суммированием оценок всех 10 заданий, варьирующихся от 0 до 30; Чем выше балл, тем серьёзнее симптомы депрессии у человека. Согласно предыдущим исследованиям среднего и пожилого населения25,26, участники с баллами CES-D-10 ≥10 классифицировались как имеющие депрессивные симптомы, тогда как баллы <10 классифицировались как недепрессивные.
Информация, собранная от всех участников исследования, включает демографические данные (возраст, пол, семейное положение, место жительства и уровень образования), жизненные привычки и физическое состояние здоровья (физическая активность, курение, алкоголь, социальные взаимодействия, самооценка здоровья, статус хронических заболеваний и время дневного сна), а также сведения, связанные с условиями жизни и детьми (удовлетворённость условиями жизни, семейное положение потомства, и состояние здоровья потомства). Хронические заболевания диагностируются врачами и включают гипертонию, дислипидемию, злокачественные опухоли, хронические заболевания лёгких, болезни сердца, инсульт, артрит и ревматизм.
Статистический анализ
Бинарный логистический регрессионный анализ
Категориальные переменные представлены в виде частот и процентов. Были проведены тесты хи-квадрата для изучения различий в частоте депрессии по различным демографическим характеристикам в исследуемой популяции. Для выявления значимых факторов, связанных с депрессивными симптомами, был проведен бинарный логистический регрессионный анализ. Эти статистические анализы проводились с использованием программного обеспечения SPSS (версия 21.0).
Регрессия LASSO
В версии R 4.3.2 набор данных случайным образом делился на обучающий набор и тестовый набор с соотношением 7:3 с использованием фиксированного случайного заседа для обеспечения воспроизводимости. В частности, 70% данных были выделены в обучающий набор для разработки моделей, а 30% — в тестовый набор для независимой валидации. Во-первых, переменные, статистически значимые (p < 0,05) в бинарной логистической регрессии, были включены в анализ регрессии LASSO, чтобы предотвратить переподгонку путём уменьшения коэффициентов. Оптимальное значение лямбда определялось с помощью 10-кратной перекрёстной валидации. Lambda.1se был выбран на основе одного стандартного правила ошибки для достижения оптимальной производительности выбора переменных. Сжатие LASSO применялось для предотвращения переподгонки путём снижения коэффициентов менее важных переменных к нулю. Для получения дополнительной информации, пожалуйста, обратитесь к Дополнительному файлу 1 (пункт 1).
Конструкция номограмм
Относительная значимость выбранных предикторов была ранжирована по абсолютной величине их стандартизированных коэффициентов и визуализирована на лесном участке. С помощью пакета rms была построена предсказательная номограмма, основанная на итоговом логистическом регрессионном уравнении. Для получения дополнительной информации, пожалуйста, обратитесь к Дополнительному файлу 1 (пункт 2).
Валидация модели
Дискриминация оценивалась путём вычисления площади под кривой рабочей характеристики приёмника (AUC) с использованием пакета pROC. AUC рассчитывался отдельно для тренировочного и тестового набора. Обычно AUC выше 0,75 означает хорошую дискриминацию. Для получения дополнительной информации, пожалуйста, обратитесь к Дополнительному файлу 1 (пункт 3).
Калибровка: Калибровка модели была оценена с помощью теста Hosmer-Lemeshow на прилагопасение и визуализирована с помощью калибровочных кривых, сгенерированных корпусом rms, с графиком прогнозируемых вероятностей на основе наблюдаемых частот. Незначительный тест Хосмера-Лемешоу (p > 0,05) показывает хорошую калибровку. Для получения дополнительной информации, пожалуйста, обратитесь к Дополнительному файлу 1 (пункт 4).
Клиническая полезность: Клиническая полезность оценивалась с помощью анализа кривой принятия решения (DCA) с помощью пакета RMDA, рассчитывающего чистую выгоду по пороговым вероятностям от 0% до 100%. Для получения дополнительной информации, пожалуйста, обратитесь к Дополнительному файлу 1 (пункт 5).
Валидация случайных лесов: В качестве дополнительной валидации была реализована модель случайного леса с использованием пакета randomForest для оценки стабильности и обобщённости модели. Кривая сходимости уровня ошибок была построена для оценки связи между количеством деревьев и точностью предсказания как в обучающем, так и в тестовом наборах. Двустороннее значение p < 0,05 считалось статистически значимым разницей. Для получения дополнительной информации, пожалуйста, обратитесь к Дополнительному файлу 1 (пункт 6).