$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
La investigación fue aprobada por el Comité de Ética Biomédica de la Universidad de Pekín (IRB00001052-11015). Todos los sujetos dieron su consentimiento informado.
Población estudiada
Los datos de este estudio se obtuvieron de CHARLS 2020, que abarca 150 unidades a nivel de condado y 450 unidades a nivel de aldea en todo el país, abarcando aproximadamente 10.000 hogares y 19.395 personas de mediana edad y personas mayores de 45 años ymás. La encuesta empleó un enfoque de muestreo probabilístico en varias etapas. Se incluyeron individuos si cumplían los siguientes criterios: 45 años o más; vivienda seleccionada en respuesta al ítem del cuestionario BA007: ¿Cuál es el tipo de residencia en la dirección de vivienda?; y proporcionó una respuesta clara a la escala de depresión del Centro de Estudios Epidemiológicos de 10 ítems (CES-D-10). Se excluyó a las personas si cumplían uno o más de los siguientes criterios: respuestas que indicaban residencia fuera del hogar (incluyendo comunidades, hospitales y otros o desaparecidas); falta de información sobre la depresión; falta de información sobre covariables relevantes. Finalmente, se incluyeron 14.466 adultos que cumplían los criterios iniciales en este estudio. El proceso detallado de selección de participantes se ilustra en la Figura 1.

Figura 1: Un diagrama de flujo para la selección poblacional del estudio. Por favor, haga clic aquí para ver una versión ampliada de esta figura.
Definición de las variables
Los síntomas depresivos se evaluaron utilizando una versión simplificada del CES-D-10, que tiene alta fiabilidad y validez en estudiosprevios 22,23. El CES-D-10 tiene 10 ítems con cuatro escalas: 0 = nunca, 1 = a veces o rara vez, 2 = a menudo y 3 = siempre, y el quinto y octavo ítems se puntuan enel reverso de 24. La puntuación total de la escala de depresión se obtiene sumando las valoraciones de los 10 ítems, que van de 0 a 30; Cuanto mayor sea la puntuación, más graves serán los síntomas depresivos de la persona. Según estudios previos con poblaciones de mediana edad ypersonas mayores, 25,26, los participantes con puntuaciones CES-D-10 ≥10 fueron clasificados como presentadores de síntomas depresivos, mientras que los <10 se clasificaron como no deprimidos.
La información recogida de todos los participantes incluye datos demográficos (edad, género, estado civil, residencia y nivel educativo), hábitos de vida y estado de salud física (actividad física, tabaco, alcohol, interacciones sociales, autoevaluación de la salud, estado de enfermedad crónica y tiempo de siesta), e información relacionada con las condiciones de vida y los hijos (satisfacción con las condiciones de vida, estado civil de la descendencia, y el estado de salud de la descendencia). Las enfermedades crónicas son diagnosticadas por los médicos e incluyen hipertensión, dislipidemia, tumores malignos, enfermedades pulmonares crónicas, enfermedades cardíacas, ictus, artritis y reumatismo.
Análisis estadístico
Análisis de regresión logística binaria
Las variables categóricas se presentan como frecuencias y porcentajes. Se realizaron pruebas de chi-cuadrado para examinar las diferencias en la incidencia de depresión a lo largo de diversas características demográficas dentro de la población estudiada. Se realizó un análisis de regresión logística binaria para identificar factores significativos asociados a los síntomas depresivos. Estos análisis estadísticos se realizaron utilizando el software SPSS (versión 21.0).
Regresión LASSO
En la versión 4.3.2 de R, el conjunto de datos se particionó aleatoriamente en un conjunto de entrenamiento y otro de prueba en una proporción 7:3 usando una semilla aleatoria fija para asegurar la reproducibilidad. Específicamente, el 70% de los datos se asignaron al conjunto de entrenamiento para el desarrollo del modelo, y el 30% al conjunto de pruebas para validación independiente. Primero, las variables estadísticamente significativas (p < 0,05) en la regresión logística binaria se incluyeron en el análisis de regresión LASSO para evitar el sobreajuste reduciendo los coeficientes. El valor óptimo de lambda se determinó mediante una validación cruzada de 10 veces. El lambda.1se se seleccionó basándose en la única regla de error estándar para lograr el rendimiento óptimo de selección de variables. Se empleó la contracción LASSO para evitar el sobreajuste reduciendo los coeficientes de variables menos importantes hacia cero. Para más detalles, consulte el Archivo Suplementario 1 (punto 1).
Construcción del nomograma
La importancia relativa de los predictores seleccionados se clasificó según la magnitud absoluta de sus coeficientes estandarizados y se visualizó usando un gráfico forestal. Se construyó un nomograma predictivo utilizando el paquete rms, basado en la ecuación final de regresión logística. Para más detalles, consulte el Archivo Suplementario 1 (punto 2).
Validación del modelo
La discriminación se evaluó calculando el área bajo la curva característica de funcionamiento del receptor (AUC) utilizando el paquete pROC. El AUC se calculaba por separado para el conjunto de entrenamiento y el conjunto de prueba. Normalmente, una AUC superior a 0,75 indica buena discriminación. Para más detalles, consulte el Expediente Suplementario 1 (punto 3).
Calibración: La calibración del modelo se evaluó utilizando la prueba de ajuste Hosmer-Lemeshow y se visualizó con curvas de calibración generadas por el paquete rms, representando las probabilidades predichas en función de las frecuencias observadas. Una prueba de Hosmer-Lemeshow no significativa (p > 0,05) indica una buena calibración. Para más detalles, consulte el Expediente Suplementario 1 (punto 4).
Utilidad clínica: La utilidad clínica se evaluó mediante análisis de curva de decisión (DCA) con el paquete RMDA, calculando el beneficio neto a través de probabilidades umbral del 0% al 100%. Para más detalles, consulte el Expediente Suplementario 1 (punto 5).
Validación de bosque aleatorio: Como validación complementaria, se implementó un modelo de bosque aleatorio utilizando el paquete randomForest para evaluar la estabilidad y generalizabilidad del modelo. La curva de convergencia de la tasa de error se graficó para evaluar la relación entre el número de árboles y la precisión de la predicción tanto en conjuntos de entrenamiento como de prueba. Se consideró que un valor p bilateral < 0,05 indicaba una diferencia estadísticamente significativa. Para más detalles, consulte el Archivo Suplementario 1 (punto 6).