$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
A pesquisa foi aprovada pelo Comitê de Ética Biomédica da Universidade de Pequim (IRB00001052-11015). Todos os sujeitos deram consentimento informado.
População estudada
Os dados deste estudo foram obtidos do CHARLS 2020, que abrange 150 unidades em nível de condado e 450 unidades em nível de vila em todo o país, abrangendo aproximadamente 10.000 domicílios e 19.395 indivíduos de meia-idade e idosos com 45 anos ou mais de21 anos. A pesquisa utilizou uma abordagem de amostragem probabilística em múltiplas etapas. Indivíduos foram incluídos se atendessem aos seguintes critérios: idade de 45 anos ou mais; selecionou residência domiciliar em resposta ao item do questionário BA007: Qual é o tipo de residência no endereço de moradia?; e forneceu uma resposta clara à Escala de Depressão do Center for Epidemiological Studies, composta por 10 itens (CES-D-10). Indivíduos foram excluídos se atendessem a um ou mais dos seguintes critérios: respostas indicando residência fora do domicílio (incluindo comunidades, hospitais e outros casos ou desaparecidos); falta de informações sobre depressão; Falta de informações sobre covariáveis relevantes. No total, 14.466 adultos que atenderam aos critérios iniciais foram incluídos neste estudo. O processo detalhado de seleção dos participantes é ilustrado na Figura 1.

Figura 1: Um fluxograma para seleção populacional do estudo. Por favor, clique aqui para ver uma versão maior deste número.
Definição das variáveis
Os sintomas depressivos foram avaliados usando uma versão simplificada do CES-D-10, que possui alta confiabilidade e validade em estudosanteriores 22,23. O CES-D-10 possui 10 itens com quatro escalas: 0 = nunca, 1 = às vezes ou raramente, 2 = frequente e 3 = sempre, e o quinto e oitavo itens são pontuadosinvertido 24. A pontuação total da escala de depressão é obtida somando as avaliações de todos os 10 itens, variando de 0 a 30; Quanto maior a pontuação, mais graves são os sintomas depressivos do indivíduo. Com base em estudos anteriores com populações de meia-idade eidosas, 25,26, participantes com escores CES-D-10 ≥10 foram classificados como apresentando sintomas depressivos, enquanto escores <10 foram classificados como não deprimidos.
As informações coletadas de todos os participantes incluem dados demográficos (idade, gênero, estado civil, residência e nível de escolaridade), hábitos de vida e estado de saúde física (atividade física, tabagismo, bebida, interações sociais, saúde autoavaliada, status de doença crônica e hora de soneca), e informações relacionadas às condições de vida e aos filhos (satisfação com as condições de vida, estado civil da prole, e o estado de saúde dos filhotes). Doenças crônicas são diagnosticadas por médicos e incluem hipertensão, dislipidemia, tumores malignos, doenças pulmonares crônicas, doenças cardíacas, derrame, artrite e reumatismo.
Análise estatística
Análise de regressão logística binária
Variáveis categóricas são apresentadas como frequências e percentagens. Testes de qui-quadrado foram realizados para examinar diferenças na incidência de depressão entre várias características demográficas dentro da população do estudo. Foi realizada uma análise de regressão logística binária para identificar fatores significativos associados aos sintomas depressivos. Essas análises estatísticas foram realizadas usando o software SPSS (versão 21.0).
Regressão LASSO
Na versão 4.3.2 do R, o conjunto de dados foi particionado aleatoriamente em um conjunto de treinamento e um conjunto de teste em uma proporção de 7:3, usando uma semente aleatória fixa para garantir a reprodutibilidade. Especificamente, 70% dos dados foram alocados ao conjunto de treinamento para desenvolvimento do modelo, e 30% ao conjunto de teste para validação independente. Primeiro, variáveis estatisticamente significativas (p < 0,05) na regressão logística binária foram incluídas na análise de regressão LASSO para evitar o sobreajuste ao reduzir os coeficientes. O valor ótimo de lambda foi determinado por meio de validação cruzada de 10 vezes. O lambda.1se foi selecionado com base na única regra padrão de erro para alcançar o desempenho ótimo na seleção de variáveis. A retração LASSO foi empregada para evitar o sobreajuste, reduzindo os coeficientes de variáveis menos importantes para zero. Para mais detalhes, consulte o Arquivo Suplementar 1 (item 1).
Construção do nomograma
A importância relativa dos preditores selecionados foi classificada de acordo com a magnitude absoluta de seus coeficientes padronizados e visualizada usando um gráfico de floresta. Um nomograma preditivo foi construído usando o pacote rms, baseado na equação final de regressão logística. Para mais detalhes, consulte o Arquivo Suplementar 1 (item 2).
Validação do modelo
A discriminação foi avaliada calculando a área sob a curva característica operacional do receptor (AUC) usando o pacote pROC. O AUC era calculado separadamente para o conjunto de treinamento e o conjunto de teste. Normalmente, um AUC maior que 0,75 indica boa discriminação. Para mais detalhes, consulte o Arquivo Suplementar 1 (item 3).
Calibração: A calibração do modelo foi avaliada usando o teste de boa capacidade de ajuste Hosmer-Lemeshow e visualizada com curvas de calibração geradas pelo pacote rms, plotando probabilidades previstas em relação às frequências observadas. Um teste Hosmer-Lemeshow não significativo (p > 0,05) indica boa calibração. Para mais detalhes, consulte o Arquivo Suplementar 1 (item 4).
Utilidade clínica: A utilidade clínica foi avaliada usando análise da curva de decisão (DCA) com o pacote RMDA, calculando o benefício líquido entre probabilidades limiar de 0% a 100%. Para mais detalhes, consulte o Arquivo Suplementar 1 (item 5).
Validação de floresta aleatória: Como validação suplementar, um modelo de floresta aleatória foi implementado usando o pacote randomForest para avaliar a estabilidade e a generalização do modelo. A curva de convergência da taxa de erro foi plotada para avaliar a relação entre o número de árvores e a precisão da previsão tanto em conjuntos de treinamento quanto de teste. Um valor p bilateral < 0,05 foi considerado indicativo de uma diferença estatisticamente significativa. Para mais detalhes, consulte o Arquivo Suplementar 1 (item 6).