Uma visão geral esquemática do pré-processamento do EEG, extração de características e fluxo de trabalho de classificação é apresentada na Figura 1. Os materiais e softwares utilizados no estudo estão listados na Tabela de Materiais.

Figura 1: Fluxo de trabalho do pré-processamento de EEG, extração de características e classificação. Visão esquemática do fluxo de trabalho do estudo, incluindo verificação dos dados de EEG, filtragem passa-faixa e re-referenciação, extração das características de raiz quadrada média (RMS), densidade espectral de potência (PSD) e entropia, inclusão da idade, divisão entre treino e teste, desenvolvimento do modelo Random Forest, análise de estabilidade das características, análise SHAP, análise do tamanho do efeito de Cohen’s d, seleção integrada de características, ablação de características de entropia, retratamento do modelo e avaliação de desempenho. Clique aqui para visualizar uma versão maior desta figura.
1. Aquisição de dados
O conjunto de dados de EEG de repouso de acesso público foi obtido do repositório OpenNeuro (conjunto de dados ds004504, versão 1.0.9)33. Os rótulos dos participantes e as informações demográficas foram verificados. O conjunto de dados era composto por 88 participantes, incluindo 36 com doença de Alzheimer (AD), 23 com demência frontotemporal (FTD) e 29 controles saudáveis (HC).
2. Importação da gravação de EEG
Para cada participante, a gravação de EEG foi carregada utilizando a biblioteca MNE-Python. Cada arquivo de EEG foi verificado para confirmar que estava acessível, podia ser importado com sucesso e continha um identificador válido do participante. As gravações com arquivos ausentes ou corrompidos foram excluídas. A frequência original de amostragem de EEG de 500 Hz foi mantida nesta etapa. Os sinais foram subamostrados para reduzir a carga computacional, preservando todas as informações de EEG clinicamente relevantes para este estudo.
3. Filtragem passa-faixa
Os registros contínuos de EEG foram filtrados utilizando um filtro passa-faixa de quarta ordem com uma frequência de corte inferior de 0,5 Hz e uma frequência de corte superior de 40 Hz.
4. Referenciação por média comum e epoquetagem
A referenciação por média comum (CAR) foi aplicada aos registros de EEG filtrados. Em cada amostra de tempo, o sinal médio em todos os canais de EEG disponíveis foi calculado e subtraído de cada canal. Os sinais de EEG referenciados foram mantidos para análises posteriores. Cada registro de EEG referenciado foi segmentado em épocas de duração fixa utilizando a função make_fixed_length_epochs() no MNE-Python. Foi utilizada uma duração de época de 10 s com sobreposição de 0 s.
5. Validação dos épocas
Para cada participante, apenas épocas completas de 10 s foram mantidas. Qualquer segmento restante de EEG com duração inferior a 10 s no final de uma gravação foi descartado. Cada época mantida foi posteriormente utilizada como uma amostra individual para a extração de características.
6. Preparação das características
Embora os dados do Exame Cognitivo Simplificado (Mini-Mental State Examination, MMSE) estivessem disponíveis no conjunto de dados original, foram excluídos da presente análise. As características extraídas do EEG foram combinadas com as informações demográficas dos participantes, incluindo idade e rótulos diagnósticos, obtidas do arquivo de metadados participants.csv. O identificador do participante foi usado como chave comum, e somente os participantes com registros de características de EEG e informações demográficas correspondentes foram mantidos.
A matriz multidimensional de características incluiu cinco características de raiz quadrada média (RMS) (delta_rms, theta_rms, alpha_rms, beta_rms e gamma_rms), cinco características de densidade espectral de potência (PSD) (delta_psd, theta_psd, alpha_psd, beta_psd e gamma_psd) e cinco características de entropia (delta_entropy, theta_entropy, alpha_entropy, beta_entropy e gamma_entropy). A idade foi incluída como uma variável demográfica complementar. Como as distribuições de idade podem diferir entre os grupos diagnósticos, não foi possível excluir completamente a interferência de fatores demográficos. O grupo diagnóstico, definido como DA, CS ou DFT, foi atribuído como rótulo alvo.
7. Pré-processamento dos dados e divisão em conjuntos de treinamento e teste
Durante o pré-processamento, as gravações foram subamostradas de 500 Hz para 250 Hz para reduzir os requisitos computacionais, mantendo ao mesmo tempo as informações de frequência de EEG de interesse.
O conjunto de dados foi dividido em subconjuntos de treinamento (80%) e teste (20%) no nível dos participantes, utilizando uma estratégia de divisão agrupada. As previsões por participante foram subsequentemente obtidas por votação majoritária entre as épocas previstas pertencentes a cada participante. A avaliação principal utilizou uma divisão agrupada por participante entre treinamento e teste, a fim de evitar que épocas do mesmo participante aparecessem em ambos os subconjuntos. As previsões por participante foram obtidas por meio de votação majoritária nas épocas previstas associadas a cada participante. O conjunto de dados foi inspecionado quanto a valores ausentes, e observações faltantes foram removidas ou imputadas conforme aplicável. As etiquetas diagnósticas foram codificadas. Um StandardScaler foi ajustado aos dados de treinamento e posteriormente aplicado aos conjuntos de dados de treinamento e teste.
8. Desenvolvimento do modelo de floresta aleatória
Um classificador de Floresta Aleatória foi inicializado com 80 árvores, profundidade máxima de árvore de 10, no máximo quatro características, mínimo de cinco amostras por folha e estado aleatório de 42. O classificador foi treinado utilizando o conjunto de dados de treinamento padronizado.
9. Avaliação do modelo
Foram previstas etiquetas de classe para os conjuntos de dados de treinamento e teste. Foi construída uma matriz de confusão, e foram calculados a precisão, a sensibilidade, a pontuação F1 e o relatório de classificação. As precisões de treinamento e teste foram registradas.
Para a avaliação por participante, certifique-se de que todas as épocas de um determinado participante foram atribuídas exclusivamente ao subconjunto de treinamento ou ao de teste. O classificador Floresta Aleatória foi treinado utilizando os mesmos hiperparâmetros da análise primária.
10. Validação cruzada
Como procedimento adicional de avaliação do modelo, realizou-se validação cruzada estratificada em cinco partes usando shuffle = True e random_state = 30. Foram calculadas a precisão média e o desvio padrão nas cinco partes. Essa análise foi considerada separadamente da avaliação principal por retenção de sujeitos.
11. Análise de estabilidade das características
A estabilidade das características foi avaliada repetindo o treinamento da Floresta Aleatória 10 vezes, utilizando sementes aleatórias de 0 a 9. Em cada execução, foram registradas a precisão no conjunto de teste e as pontuações de importância das características. A média e o desvio padrão da pontuação de importância de cada preditor foram calculados ao longo das 10 execuções, e os preditores foram classificados de acordo com sua estabilidade. Essa análise foi utilizada para avaliar a consistência das classificações das características, e não para substituir a avaliação principal em nível de sujeito.
12. Análise de inteligência artificial explicável
O SHAP TreeExplainer foi aplicado ao modelo de Floresta Aleatória treinado. Os valores SHAP foram calculados para estimar a contribuição de cada característica nas previsões do modelo. O valor absoluto médio de SHAP foi calculado para cada característica, e as características foram classificadas de acordo com suas contribuições SHAP. Características com valores SHAP consistentemente baixos foram identificadas e comparadas com os resultados das análises de estabilidade de características e de d de Cohen. As características que apresentaram contribuições consistentemente baixas foram selecionadas para ablação subsequente e retrinamento do modelo.
13. Análise do tamanho do efeito estatístico
O d de Cohen foi calculado para cada biomarcador de EEG nas comparações DA versus SC, DA versus DFT e DFT versus SC. As magnitudes do tamanho do efeito foram interpretadas utilizando limiares de 0,20 para um efeito pequeno, 0,50 para um efeito médio e 0,80 para um efeito grande.
14. Seleção integrada de características
Os resultados da análise de importância de características do Random Forest, da análise SHAP e da análise de Cohen’s d foram comparados. Os preditores que consistentemente exibiram baixa importância de característica, baixa contribuição SHAP e pequenos tamanhos de efeito foram identificados como candidatos à remoção.
15. Ablação de características
As características de entropia foram avaliadas em uma análise exploratória de ablação, e uma matriz reduzida de características contendo RMS, PSD e idade foi construída. O classificador Random Forest foi treinado novamente usando os mesmos hiperparâmetros. O treinamento do modelo, teste, validação cruzada e análise da curva característica de operação do receptor (ROC) foram repetidos utilizando o conjunto reduzido de características.
16. Análise ROC
As probabilidades das classes foram obtidas a partir do classificador Random Forest otimizado. Curvas ROC multiclasse foram geradas utilizando um esquema um-contra-todosversusestratégia um-contra-resto. Foram calculados os valores da área sob a curva (AUC) específicos para cada classe e a AUC média.
17. Comparação de desempenho
O desempenho do modelo de características completo foi comparado ao do modelo de características reduzido obtido após a ablação da característica de entropia.