Artigo de método

Fusão de Eletroencefalografia e Ressonância Magnética Funcional baseada em Mistura de Especialistas para Diagnóstico de Transtornos Cerebrais Assistido por Computador Interpretável

0 visualizações

⸱

DOI:

10.3791/73432

⸱

25 de setembro de 2026

Neste artigo

Resumo

Este protocolo apresenta o Brain Mixture-of-Experts, um framework adaptativo e interpretável de fusão de eletroencefalografia e ressonância magnética funcional para o diagnóstico assistido por computador de transtornos cerebrais. O método integra representações heterogêneas de EEG e fMRI por meio de especialistas específicos para cada modalidade, um especialista compartilhado de estado neural e roteamento adaptativo, mantendo a interpretabilidade e a inferência sob condições simuladas de ausência de modalidade.

Resumo

A eletroencefalografia (EEG) e a imagem por ressonância magnética funcional (fMRI) fornecem informações complementares sobre a função cerebral e têm demonstrado grande potencial na detecção de anormalidades funcionais em diversos transtornos cerebrais. No entanto, as distintas características dos sinais e os espaços representacionais díspares da EEG e da fMRI representam desafios severos para uma fusão multimodal eficaz, o que dificulta o diagnóstico assistido por computador de transtornos cerebrais com modelos fixos convencionais. Este estudo apresenta o Brain Mixture-of-Experts (BrainMoE), um framework adaptativo e interpretável de fusão EEG-fMRI para diagnóstico assistido por computador de transtornos cerebrais, que integra características cerebrais multimodais por meio de especialistas específicos para cada modalidade, um especialista compartilhado de estado neural e um mecanismo adaptativo de roteamento. O BrainMoE primeiro projeta os sinais de EEG e fMRI em um espaço unificado de regiões de interesse (ROI) do atlas Desikan-Killiany (DK), e depois utiliza codificadores de grafos para extrair representações específicas da rede cerebral por modalidade. O módulo de roteamento suave produz uma representação de roteamento, e o Expert Gate no Módulo de Fusão gera pesos específicos para cada amostra, combinando as representações da EEG, da fMRI e do especialista de estado neural compartilhado. Para lidar com cenários de aquisição incompletos, máscaras de estado modal e tokens para modalidades ausentes são incorporados, permitindo que o mesmo modelo treinado realize inferência completa com EEG-fMRI, apenas EEG ou apenas fMRI. Finalmente, a análise por oclusão de nós fornece mapas de atribuição em nível de ROI para previsões derivadas tanto da EEG quanto da fMRI. O framework foi avaliado no conjunto de dados Healthy Brain Network (HBN) em cinco tarefas de classificação binária de transtornos cerebrais, incluindo transtorno depressivo maior, transtorno de ansiedade, dificuldade de leitura, transtorno do espectro autista e transtorno de dficita de atenção/hiperatividade. O BrainMoE superou algoritmos comparativos de estado da arte, alcançando uma AUC média de 86,9 ± 3,0%, e experimentos de ablação confirmaram a contribuição dos componentes de roteamento e de fusão de especialistas. Além disso, a análise de interpretabilidade identifica contribuições em nível de grupo das ROI para a classificação de doenças, consistentes com achados neuroimagemológicos previamente relatados. Este método apoia o diagnóstico assistido por computador de transtornos cerebrais ao abordar o desafio da integração de representações neurais heterogêneas de EEG-fMRI, mantendo a interpretabilidade e a inferência em condições simuladas de ausência de modalidade.

Introdução

Os transtornos cerebrais envolvem mudanças complexas na atividade neural e na organização da rede cerebral que são difíceis de caracterizar com uma única modalidade de imagem1. Após a reconstrução da fonte2, o EEG fornece atividade eletrofisiológica (EEG) em nível regional, enquanto a imagem por ressonância magnética funcional (fMRI) captura a conectividade funcional em nível regional, oferecendo visões complementares da função cerebral. Para facilitar sua integração, trabalhos multimodais anteriores mapearam ambas as modalidades para o atlas Desikan-Killiany (DK) de 68 regiões3. Embora essa correspondência espacial não implique equivalência na resolução temporal ou na origem fisiológica, ela fornece um índice anatômico unificado para fusão de grafos em nível de nó, dimensões fixas de grafos e interpretação consistente em nível de região de interesse (ROI), preservando ao mesmo tempo as informações específicas de cada modalidade. A integração dessas representações alinhadas anatomicamente, mas específicas de cada modalidade, pode enriquecer as representações de sinais cerebrais relacionados a doenças e apoiar o diagnóstico computadorizado de transtornos cerebrais3,4.

Apesar do potencial da fusão EEG-fMRI para o diagnóstico assistido por computador de distúrbios cerebrais, a heterogeneidade entre as duas modalidades representa um desafio técnico para sua integração eficaz. Métodos clássicos de aprendizado de máquina, como SVM e MLP, podem fornecer modelos de classificação básicos, mas têm capacidade limitada para capturar interações não lineares entre modalidades. Modelos genéricos de aprendizado profundo, incluindo GNN5, ResNet6e Transformer7 arquiteturas, oferecem um aprendizado de representação mais forte, mas não são especificamente projetadas para grafos cerebrais em nível de ROI ou para modelagem de estado-modalidade. Modelos avançados recentes3,8,9 apresentam complexidade não linear aumentada para modelar melhor as redes cerebrais. BrainNetCNN8 foi introduzido para adaptar operações convolucionais a matrizes de conectividade cerebral; o BrainGNN9 modelou ainda a topologia de grafos em nível de ROI utilizando redes neurais em grafos e agrupamento; e BNT10 posteriormente fortaleceu a análise de redes cerebrais funcionais com atenção multi-nível baseada em transformadores. No entanto, esses avanços ainda foram desenvolvidos principalmente para configurações de única modalidade. MultiEpilepsyNet11 em seguida, estendeu a aprendizagem multmodal para a detecção de crises EEG-MRI por meio de um framework híbrido federado, e o seu módulo EpiSkullNet++ no lado da MRI aprimorou a segmentação e o pré-processamento cerebrais. SZAtt-Net12 desenvolveu posteriormente um modelo de classificação multimodal de esquizofrenia combinando blocos CNN, BiGRU e MLP com mecanismos de atenção de canal, auto, espacial e temporal. No entanto, esses métodos permaneceram específicos a tarefas e basearam-se em designs de fusão relativamente fixos, sem oferecer suporte explícito ao roteamento adaptativo em estados de modalidade completa e ausente.

Modelos de Mistura de Especialistas (MoE)13,14 têm sido cada vez mais adotados na aprendizagem multimodal porque permitem que fontes heterogêneas de informação sejam processadas por módulos especializados e combinadas dinamicamente por meio de mecanismos de roteamento. O gateamento por Softmax fornece pesos normalizados dos especialistas dependentes da entrada e tem sido caracterizado teoricamente em termos de taxas de convergência15. Arquiteturas multigates relacionadas demonstraram ainda que portas separadas podem aprender combinações dependentes da tarefa de especialistas compartilhados em aprendizagem multitarefa em larga escala16. Em pesquisas neurocientíficas e estudos cerebrais, variantes do MoE17,18,19 têm sido usadas com crescente frequência para facilitar a fusão de características heterogêneas. O dFCExpert17 utilizou especialistas baseados em modularidade e estados para modelar padrões dinâmicos de conectividade funcional a partir de fMRI. O EvoMoE18 utilizou ainda uma rede de gateamento para selecionar especialistas adequados para classificação independente de usuário de SSVEP-EEG. O NeuroMoE++19 explorou fusão multimodal adaptativa ao paciente para a classificação de distúrbios neurológicos. Apesar de seu sucesso, esses modelos geralmente dependem de mistura grosseira e roteamento discreto, o que ignora a natureza altamente sincronizada dos estados neurais cruzados, dificultando a detecção de padrões sutis, mas informativos, críticos para o diagnóstico de distúrbios cerebrais. Além disso, sem um mecanismo dedicado para separar nuances específicas de modalidade a partir de um estado neural compartilhado e unificado, esses modelos oferecem interpretabilidade limitada e sofrem de degradação de desempenho quando uma modalidade crucial (fMRI ou EEG) está ausente.

Para superar essas limitações, este estudo apresenta o Brain Mixture-of-Experts (BrainMoE), um framework adaptativo e interpretável de fusão EEG-fMRI para diagnóstico assistido por computador de cinco categorias de transtornos cerebrais, incluindo transtorno depressivo maior (TDM), transtorno de ansiedade (TA), transtorno específico de aprendizagem com prejuízo na leitura (PL), transtorno do espectro autista (TEA) e transtorno de déficit de atenção e hiperatividade (TDAH). O protocolo alinha primeiro as características reconstruídas da fonte de EEG e fMRI ao espaço de ROI do atlas DK20 e, em seguida, constrói representações modais baseadas em grafos para ambas as modalidades. O BrainMoE utiliza um especialista em EEG, um especialista em fMRI e um especialista compartilhado de estado neural, que são integrados por um módulo de roteamento suave para combinar informações específicas da modalidade e informações compartilhadas. Máscaras de estado modal e tokens de modalidade ausente são incorporados para permitir inferência completa com EEG-fMRI, apenas EEG ou apenas fMRI dentro de um único modelo treinado. Para apoiar a interpretabilidade biológica, o protocolo aplica ainda análise de oclusão de nós, na qual cada ROI do atlas DK é seletivamente mascarado, e a alteração resultante na probabilidade de predição da doença é usada para estimar as contribuições regionais derivadas de EEG e fMRI. Este protocolo descreve todo o fluxo de trabalho para alinhamento de dados, construção do modelo, treinamento, avaliação e interpretação de ROI baseada em oclusão de nós, fornecendo uma estratégia adaptativa e interpretável para diagnóstico assistido por computador de transtornos cerebrais por meio da fusão heterogênea de sinais cerebrais EEG-fMRI. Para facilitar a reprodutibilidade e futuras extensões, o repositório público no GitHub disponibiliza o modelo BrainMoE, bem como os códigos de treinamento e avaliação, enquanto o pré-processamento de EEG e fMRI foi realizado utilizando softwares de terceiros de acesso público. O repositório está disponível em https://github.com/zhongruizhe123/BrainMoE.

Protocolo

Este estudo utilizou dados desidentificados do banco de dados Healthy Brain Network (HBN)21, concentrando-se em cinco transtornos clínicos distintos para tarefas de classificação diagnóstica posterior. A aprovação ética e o consentimento informado por escrito já haviam sido obtidos previamente pela iniciativa HBN em todos os locais e participantes envolvidos. As gravações de EEG e fMRI foram adquiridas em sessões separadas, e não simultaneamente, e foram pareadas utilizando os identificadores de participante e de sessão disponíveis no HBN.

1. Prepare o ambiente computacional e os dados de entrada

  1. Configure o ambiente computacional
    1. Crie e ative um ambiente virtual Python 3.12.4: python -m venv brainmoe_env
      source brainmoe_env/bin/activate
    2. Instale os pacotes necessários e suas versões fixas usando o arquivo requirements.txt fornecido no repositório público do GitHub: pip install -r requirements.txt
    3. Verifique a configuração do PyTorch e do CUDA antes do treinamento: python -c "import torch; print(torch.__version__); print(torch.version.cuda); print(torch.cuda.is_available())." Confirme se a saída informa PyTorch 2.6.0+cu124, CUDA 12.4 e se a disponibilidade do CUDA é True. Realize o treinamento do modelo utilizando uma GPU compatível com CUDA.
  2. Verifique todos os arquivos de entrada H5 antes do treinamento do modelo.
    1. Confirme que cada arquivo contém sLORETA_mean_func para as características dos nós do EEG, sLORETA_mean_CorrMatrix para o grafo do EEG, fMRI-DK68-node-mat para as características dos nós do fMRI, fMRI-DK68-edge-mat para o grafo do fMRI e um rótulo para o diagnóstico. Exclua arquivos com chaves ausentes, entradas não numéricas, rótulos inválidos ou dimensões incompatíveis com o atlas Desikan-Killiany de 68 regiões. Execute o script de verificação de entrada H5 da seguinte forma: python checkH5.py (Arquivo Suplementar 1).

2. Alinhar as características de EEG e fMRI a um espaço anatômico comum

  1. Pré-processar os dados de fMRI.
    1. Processar os dados de fMRI usando o C-PAC (versão 1.8.7). Executar o script de pré-processamento do C-PAC da seguinte forma: bash run_cpac_brainmoe.sh <BIDS_DIR> <OUTPUT_DIR> (Arquivo Suplementar 2). Descartar os primeiros cinco volumes para reduzir os efeitos iniciais de sinal não estacionário.
    2. Realizar correção de aquisição por fatias (slice-timing), correção de movimento, correção de distorção, registro, normalização para o espaço anatômico MNI152 e suavização espacial. Regredir 24 parâmetros de incômodo relacionados ao movimento.
    3. Aplicar filtragem temporal passa-banda em 0,01–0,08 Hz.
  2. Gerar características de fMRI alinhadas ao atlas.
    1. Processar a ressonância magnética estrutural correspondente usando o FreeSurfer (versão 7.4.1). Executar os scripts da seguinte forma: bash Step01_mgz_2_nifti.sh. Realizar o coregistro da parcellização cortical Desikan-Killiany resultante para o espaço nativo de fMRI do participante. Executar os scripts da seguinte forma: python Step02_CoRegistration.py. Calcular o sinal médio por voxel dentro de cada uma das 68 regiões corticais. Executar os scripts da seguinte forma: python Step03_fMRI_Signal_Extraction.py (Arquivo Suplementar 3).
    2. Manter 370 pontos de tempo consecutivos de fMRI sem preenchimento temporal para obter uma matriz de características nó-fMRI de 68 × 370, onde 68 denota as regiões corticais DK e 370 denota os pontos de tempo de fMRI mantidos.
  3. Construir o grafo de fMRI.
    1. Calcular as correlações de Pearson entre as séries temporais de 370 pontos das 68 regiões DK. Armazenar a matriz resultante de conectividade funcional 68 × 68 como a matriz de arestas de fMRI.
  4. Pré-processar os dados de EEG.
    1. Processar as gravações de EEG de 129 canais usando a caixa de ferramentas EEGLAB (versão 2022.1) no MATLAB (versão R2022a). Executar os dois scripts de pré-processamento do EEGLAB sequencialmente da seguinte forma: matlab -batch "run('eegpre_mark.m'); run('eegpre_mark_after.m')" (Arquivo Suplementar 4). Manter a taxa de amostragem de 500 Hz e aplicar um filtro passa-banda de 0,2–40 Hz. Identificar segmentos ruidosos e eletrodos defeituosos e interpolar canais ruins usando o sinal médio dos eletrodos adjacentes.
    2. Usar análise de componentes independentes com o plugin ICLabel para classificar os componentes independentes. Remover componentes com probabilidade de classificação como artefato ocular ou muscular maior que 0,90. Aplicar re-referenciação média. Excluir gravações que contenham menos de 250 s de dados utilizáveis após pré-processamento e rejeição de artefatos.
  5. Gerar características de EEG alinhadas ao atlas.
    1. Construir um modelo individualizado de cabeça com o Método de Elementos de Contorno (BEM) de três camadas a partir da ressonância magnética estrutural de cada participante. Definir o espaço fonte na superfície cortical individual de cada participante. Registrar as posições dos eletrodos de EEG à superfície BEM e calcular a matriz de campo direto (lead-field).
    2. Aplicar um operador inverso regularizado usando a matriz de covariância de ruído da linha de base. Definir a relação sinal-ruído em 3,0, resultando em λ2 = 1/SNR2 = 1/9 (aproximadamente 0,1111), e realizar a localização de fontes usando a tomografia eletromagnética de baixa resolução padronizada (sLORETA) implementada no MNE-Python (versão 1.9).
    3. Agregar as estimativas de fonte por vértice dentro de cada parcela Desikan-Killiany por média aritmética para obter séries temporais em 68 ROIs. Manter o primeiro segmento contínuo de 250 s e dividir cada série temporal de ROI em 250 épocas consecutivas e não sobrepostas de 1 s.
    4. Calcular a potência na banda alfa em 8–12 Hz dentro de cada época para obter uma matriz de características nó-EEG de 68 × 250, onde 68 denota as regiões corticais DK e 250 denota as 250 épocas consecutivas e não sobrepostas de 1 s.
  6. Construir o grafo de EEG e verificar o alinhamento cruzado-modal.
    1. Calcular as correlações de Pearson entre as séries temporais de potência alfa de 250 épocas em 8–12 Hz das 68 regiões DK. Armazenar a matriz resultante 68 × 68 como o grafo de EEG.
    2. Confirmar que as matrizes de EEG e fMRI utilizam a mesma ordem de regiões DK e usar o mesmo arquivo de índice de regiões DK para entrada no modelo, atribuição e visualização. Executar o script de localização de fontes e extração de características do MNE-Python da seguinte forma: python "Extract features - templates.py" (Arquivo Suplementar 5).
  7. Normalizar as características dos nós dentro de cada amostra.
    1. Aplicar normalização por escore z por nó nas matrizes de características nó-EEG e nó-fMRI. Manter as matrizes de grafos como entradas de conectividade e aplicar normalização de grafo dentro do modelo BrainMoE.
    2. Realizar o pré-processamento de EEG e fMRI independentemente para cada participante usando configurações fixas, sem utilizar informações dos folds de validação cruzada para determinar os parâmetros de pré-processamento.

3. Construir tarefas de classificação binária específicas para a doença

  1. Defina cinco tarefas de classificação binária específicas para cada doença.
    1. Codifique os controles saudáveis (CS) como classe 0 em todas as tarefas e codifique apenas o grupo de doença selecionado como classe 1 dentro de sua própria tarefa.
    2. Construa tarefas separadas de saudável versus doença para depressão, transtorno de ansiedade, transtorno do neurodesenvolvimento com transtorno específico de aprendizagem e prejuízo na leitura, transtorno do espectro autista e transtorno do déficit de atenção e hiperatividade.
  2. Caracterize as coortes do estudo e examine possíveis efeitos de sexo e local de aquisição.
    1. Para cada tarefa específica de doença, inclua participantes do HBN com dados completos de EEG, fMRI e imagens de ressonância magnética estrutural (sMRI) e com um rótulo diagnóstico válido. Exclua participantes com diagnósticos comórbidos das coortes positivas para a doença. Exclua gravações de EEG que contenham menos de 250 s de dados utilizáveis após o pré-processamento e rejeição de artefatos, e mantenha apenas os arquivos de entrada que atenderam aos critérios de controle de qualidade descritos na seção 1.2.
    2. Resuma os números de registros multimodais mantidos e participantes únicos, as proporções entre doença e controle, as faixas etárias, as distribuições por sexo e as distribuições por local de aquisição para a coorte compartilhada de CS e cada coorte de doença na Tabela 4.
      NOTA: A mesma coorte de CS foi reutilizada como classe 0 em todas as cinco tarefas, portanto, as estimativas de desempenho em nível de tarefa não são estatisticamente independentes. Essa dependência decorre da coorte de CS compartilhada, e não da sobreposição entre os grupos de doença.
    3. Estratifique o desempenho por sexo e local de aquisição e compare os valores resultantes utilizando testes t de Welch bicaudais ao longo das execuções repetidas de validação cruzada de 5 dobras.
  3. Selecione os arquivos H5 específicos para cada tarefa e defina as divisões para validação cruzada.
    1. Para cada tarefa, mantenha apenas os CS e o grupo da doença-alvo. Gere 10 repetições de validação cruzada de 5 dobras no nível do participante. Estratefique os participantes únicos pelo rótulo de classe binária, CS versus a doença-alvo, para preservar a distribuição de classes entre as dobras.
    2. Utilize o identificador único do participante como variável de agrupamento e atribua todas as sessões e registros multimodais do mesmo participante à mesma dobra. Utilize as sementes aleatórias de 1 a 10, respectivamente, para gerar as 10 partições repetidas de validação cruzada. Utilize uma semente aleatória fixa igual a 1 para a inicialização e treinamento do modelo.
    3. Reserve a dobra mantida exclusivamente para a avaliação final e salve os identificadores dos participantes, listas de arquivos e índices de partição para cada dobra com o ponto de controle correspondente. Para cada dobra de treinamento, calcule os pesos de classe a partir dos rótulos de treinamento e utilize-os na perda de entropia cruzada para reduzir o viés causado pelo desequilíbrio de classes.

4. Construir a arquitetura BrainMoE para diagnóstico assistido por computador de transtornos cerebrais

OBSERVAÇÃO: A arquitetura BrainMoE foi projetada como um framework compacto de fusão EEG-fMRI com modalidade ausente que combina um codificador de grafos, roteamento suave de estados neurais compartilhados e integração de características baseada em especialistas para diagnóstico binário específico de doença. A arquitetura geral é mostrada na Figura 1, e o código de implementação é fornecido no Arquivo Suplementar 6.

  1. Defina as entradas do BrainMoE e os estados de modalidade. Utilize a Modalidade EEG e a Modalidade fMRI após o alinhamento no espaço fonte como entradas de grafos pareados. Aqui, X denota uma matriz de características regionais, A denota um grafo cerebral específico à modalidade, e cada linha corresponde a uma das 68 regiões de Desikan-Killiany.
    figure-protocol-1
    figure-protocol-2
    Defina a Máscara de Disponibilidade de Modalidade como m = [mEEG, mfMRI]. Utilize m = [1,1] para entrada completa de EEG-fMRI, m = [1,0] para entrada somente de EEG e m = [0,1] para entrada somente de fMRI.
  2. Codificador de grafo: Para cada modalidade q, em que q é EEG ou fMRI, passe a matriz de características Xq e gráfico Aq em seu Codificador de Grafo específico à modalidade. O codificador é um módulo neural treinável que inclui projeção de nós, passagem de mensagens no grafo, normalização, ativação e dropout (p=0,3).
    figure-protocol-3
    OBSERVAÇÃO: Nesta notação, Zq é a representação latente no nível de ROI produzida pelo Codificador de Grafos de EEG ou pelo Codificador de Grafos de fMRI. O Codificador de Grafos de EEG mapeia cada matriz de entrada 68 × 250 para uma representação latente 68 × 128, enquanto o Codificador de Grafos de fMRI mapeia cada matriz de entrada 68 × 370 para uma representação latente 68 × 128. Cada codificador utiliza uma projeção de entrada seguida por duas camadas residuais de convolução em grafos com 128 dimensões ocultas, ativação GELU, normalização de camada e dropout.
  3. Tokens treináveis para modalidades ausentes: Seja Tq seja o token para a modalidade q e mq seja o indicador de disponibilidade correspondente. Esta etapa produz uma representação sensível ao estado que preserva o mesmo layout de 68 regiões sob entradas completas e de modalidade única.
    figure-protocol-4
    OBSERVAÇÃO: Cada token treinável de modalidade ausente é um vetor de 128 dimensões e é expandido ao longo das 68 linhas de ROI quando a modalidade correspondente não está disponível.
  4. Módulo Compartilhado de Roteamento Suave por Estado Neural: Primeiro, combine a representação da EEG com percepção de estado ZEEG, a representação de fMRI com consciência de estado ZfMRI, e a Máscara de Disponibilidade de Modalidade incorporada. A Máscara de Disponibilidade de Modalidade é incorporada por meio de uma MLP com dimensões 2 → 128, ativação GELU e normalização de camada. O Roteador consiste em duas camadas convolucionais unidimensionais com dimensões de canal 384 → 128 → 128, tamanho do kernel 3 e preenchimento 1. A ativação GELU é aplicada após cada convolução, com dropout (p=0,3) após a primeira convolução.
    figure-protocol-5
    figure-protocol-6
  5. Especialista em estado neural compartilhado.
    1. Concatenar a representação do EEG com consciência do estado ZEEG, a representação de fMRI com consciência de estado ZfMRI, e a representação de roteamento flexível R ao longo da dimensão de características. Aplique uma camada de fusão totalmente conectada (384 para 128), seguida de normalização da camada, ativação GELU e dropout (p=0,3), e realize o agrupamento médio (mean-pooling) da representação resultante ao longo das 68 ROI para obter a representação fundida no nível do sujeito, com 128 dimensões zfundido:
      figure-protocol-7
    2. Passar zfundido por meio do especialista de estado neural compartilhado, que consiste em uma camada totalmente conectada (128 para 128), normalização por camada, ativação GELU e dropout (p=0,3). Denote a representação do especialista compartilhado resultante, de 128 dimensões, por Ecompartilhado:
      figure-protocol-8
  6. Especialistas em EEG e fMRI
    1. Para cada modalidade, aplicar média nos valores da representação com base no estado ao longo das 68 ROI e passar a representação resultante de 128 dimensões pelo Especialista específico da modalidade correspondente:
      figure-protocol-9
    2. Cada Especialista específico por modalidade consiste em uma camada totalmente conectada (128 para 128), normalização por camada, ativação GELU e dropout (p=0,3). Denote as representações resultantes de 128 dimensões específicas por modalidade por EEEG e EfMRI, respectivamente.
  7. Módulo de fusão.
    1. Para calcular os pesos dos especialistas, concatene a representação fundida no nível do sujeito com dimensão 128 zfusão com a Máscara de Disponibilidade de Modalidade em 2 dimensões m, gerando uma entrada de 130 dimensões para o Gate. O Módulo Fuse contém um Expert Gate que gera os pesos específicos da amostra utilizados para a fusão dos especialistas. O Expert Gate consiste em uma camada totalmente conectada (130 para 128), seguida de ativação GELU, dropout (p = 0,3) e uma camada de saída totalmente conectada (128 para 3). Aplique a função softmax aos três logits de saída para obter os pesos específicos do especialista por amostra:figure-protocol-10
    2. Os pesos resultantes são não negativos e somam 1 para cada amostra:
      figure-protocol-11
    3. Multiplique cada representação de especialista de 128 dimensões pelo seu respectivo peso da porta (Gate) e some as três representações ponderadas:
      figure-protocol-12
      OBSERVAÇÃO: Esta operação implementa fusão densa com MoE suave.
    4. Passe a representação final do especialista com 128 dimensões resultante efundido à classificação de diagnóstico de distúrbio cerebral descrita na seção 4.8.
  8. Classificação do diagnóstico de transtorno cerebral: Passe a representação final do especialista de 128 dimensões por uma camada de classificação composta por normalização de camada, dropout (p = 0,3) e uma camada totalmente conectada que transforma 128 dimensões em 2 logits de saída. Aplique a função softmax para obter a probabilidade de HC e a probabilidade da doença-alvo. Atribua a amostra à classe da doença quando a probabilidade da doença-alvo for pelo menos 0,5.
    figure-protocol-13
  9. Verifique a consistência da implementação antes do treinamento. Execute uma passagem direta simulada com m = [1,1], m = [1,0] e m = [0,1]. Confirme que as representações de EEG, fMRI, com reconhecimento de estado, de roteamento e fundidas mantêm 68 linhas de ROI, salvo se explicitamente agrupadas, e confirme que os pesos dos especialistas somam 1 na ordem Especialista em EEG, Especialista em fMRI e Especialista compartilhado de estado neural.

5. Treinar os cinco modelos BrainMoE para o diagnóstico de transtornos cerebrais

  1. Treine um modelo BrainMoE para cada tarefa binária específica de doença.
    1. Use a mesma arquitetura e hiperparâmetros padrão para todas as tarefas: 30 épocas, tamanho de lote 16, taxa de aprendizado 0,001, decaimento de peso 0,0001. Fixe a arquitetura do modelo e os hiperparâmetros antes da avaliação na dobra de teste e mantenha-os inalterados em todas as dobras, repetições e tarefas específicas de doença.
    2. Não use o desempenho na dobra de teste reservada para seleção de modelo ou ajuste de hiperparâmetros. Para cada lote mini, execute três passagens diretas usando as máscaras completa, somente EEG e somente fMRI com pesos do modelo compartilhados. Execute o treinamento do BrainMoE conforme a seguir: python train.py --config configs/brain_moe.json --task <TASK> --data_dir <H5_DIR> (Arquivo Suplementar 6). Defina <TASK> como depression, anxiety, reading_disorder, autism ou adhd.
  2. Optimize a perda média de classificação de três estados. Calcule a perda de entropia cruzada ponderada por classe Ls para cada estado como
    figure-protocol-14
    e média as perdas como
    figure-protocol-15
  3. Zere os gradientes, faça a retropropagação e atualize todos os parâmetros treináveis com AdamW.

6. Avalie os estados de inferência completos e com modalidades ausentes

  1. Método de avaliação: Carregue o ponto de controle (checkpoint) para a tarefa da doença selecionada e utilize a lista de arquivos de teste salva no mesmo ponto de controle. Use m = [1,1] para inferência completa com EEG-fMRI, m = [1,0] para inferência apenas com EEG e m = [0,1] para inferência apenas com fMRI. Por fim, aplique a função softmax para obter a probabilidade da doença-alvo e atribua a classe da doença quando a probabilidade for pelo menos 0,5.
  2. Métricas de avaliação: Calcule as métricas de avaliação a partir da matriz de confusão, onde VP denota amostras positivas para a doença corretamente classificadas como doença, VN denota controles saudáveis (HC) corretamente classificados como saudáveis, FP denota controles saudáveis incorretamente classificados como doença e FN denota amostras positivas para a doença incorretamente classificadas como saudáveis.
    figure-protocol-16
    figure-protocol-17
    figure-protocol-18
    figure-protocol-19
    figure-protocol-20
  3. Utilize a acurácia para relatar a taxa geral de classificação correta. Utilize a sensibilidade para quantificar a detecção de casos positivos para a doença e a especificidade para quantificar a identificação de controles saudáveis.
  4. Utilize o escore F1 para resumir o equilíbrio entre precisão e sensibilidade. Utilize a acurácia balanceada para reduzir a influência do desequilíbrio entre classes. Além disso, calcule a AUC para avaliar a discriminação independente de limiar ao longo de diferentes limiares de decisão.
  5. Para cada repetição, calcule a média de cada métrica de desempenho nas cinco partições mantidas. Relate os resultados finais como a média e o desvio padrão das médias obtidas nas 10 repetições.
  6. Compare o BrainMoE com métodos de referência (baselines). Todos os métodos de referência utilizaram as mesmas partições por participante e entradas completas de EEG-fMRI que o BrainMoE, com configurações fixadas antes da avaliação com dados mantidos. O BrainMoE foi comparado com cada baseline utilizando testes t pareados bicaudais com ajuste de Holm.

7. Realizar a atribuição por oclusão de nós em nível de grupo em cinco transtornos cerebrais

  1. Defina a coorte de atribuição. Carregue o ponto de controle treinado do BrainMoE e o arquivo com os nomes das regiões do atlas DK. Selecione as amostras de teste positivas para a doença que são corretamente classificadas no estado completo de EEG-fMRI com m = [1,1]. Utilize esta coorte para a análise de atribuição em nível grupal e salve a probabilidade basal de doença-alvo de cada amostra.
  2. Calcule os escores de oclusão de nó específicos por modalidade. Para a atribuição derivada de EEG, oculte uma região de interesse (ROI) de EEG por vez, definindo o vetor de características do nó de EEG selecionado e a linha e coluna correspondentes do grafo de EEG como zero, mantendo inalterada a entrada de fMRI. Para a atribuição derivada de fMRI, aplique a mesma operação à matriz de características dos nós de fMRI e ao grafo de fMRI, mantendo inalterada a entrada de EEG. Repita este procedimento em todas as 68 regiões do atlas DK. Execute a análise de atribuição por oclusão de nó utilizando o código fornecido no Arquivo Suplementar 7.
  3. Calcule e visualize as contribuições das ROI em nível grupal. Para cada ROI e cada modalidade, calcule o escore de contribuição como a diminuição média na probabilidade de doença-alvo após a oclusão, considerando todas as amostras selecionadas. Ordene os escores derivados de EEG e de fMRI separadamente, exporte as 10 principais ROI para cada modalidade e identifique no gráfico a ROI com classificação mais alta.

Resultados

Desempenho do BrainMoE em diferentes transtornos e estados de modalidade
O protocolo gerou cinco classificadores específicos por doença do tipo cérebro-misto (BrainMoE) para saudável versus doença e produziu tabelas de predição para os estados de inferência completo com EEG-fMRI, somente EEG e somente fMRI. O estado completo com EEG-fMRI apresentou discriminação consistentemente alta em todas as cinco tarefas, com valores de AUC variando de 84,4 ± 3,2% para RI a 88,4 ± 3,8% para TEA (Tabela 1). O desempenho macro-médio no estado completo nas cinco tarefas atingiu AUC de 86,9 ± 3,0%, acurácia de 81,4 ± 3,1%, acurácia balanceada de 81,4 ± 2,5% e pontuação F1 de 81,2 ± 3,0%.

Nas condições simuladas de modalidade ausente, o BrainMoE manteve um desempenho utilizável quando uma modalidade de entrada era mascarada. No estado somente com EEG, o modelo alcançou uma AUC macro-média de 83,1 ± 3,7%, com a maior AUC observada no EEG apenas para TDAH, de 87,9 ± 2,8%. No estado somente com fMRI, a AUC macro-média foi de 80,0 ± 3,9%. Essas faixas de desempenho e a vantagem esperada no desempenho no estado completo servem como referências práticas para uma implementação bem-sucedida, indicando que o framework BrainMoE treinado pode realizar inferência completa, somente com EEG e somente com fMRI, sem modelos separados para cada modalidade.

Um resultado subótimo representativo é a falha em reproduzir a vantagem esperada do desempenho no estado completo, por exemplo, quando a AUC de EEG-fMRI completo for menor do que a AUC de EEG isolado ou fMRI isolado. Em contraste, uma implementação bem-sucedida deve reproduzir a vantagem do estado completo e as faixas de desempenho de referência relatadas na Tabela 1. Quando um padrão subótimo for observado, verifique as dimensões de entrada H5, a ordem das regiões DK, a atribuição da máscara de disponibilidade da modalidade e as partições salvas da validação cruzada antes de interpretar a saída do modelo.

Comparação de referência
O modelo BrainMoE proposto foi comparado com métodos clássicos de aprendizado de máquina (máquina de vetores de suporte (SVM) e perceptron multicamadas (MLP)), métodos gerais de aprendizado profundo (Transformer7, 3D-CNN22 e ResNet6), métodos avançados de aprendizado profundo (BrainNetCNN8, BNT10, BrainGNN9, MultiEpilepsyNet11, SZAtt-Net12) e métodos de aprendizado profundo baseados em MoE (dFCExpert17, EvoMoE18, e NeuroMoE++19) (Tabela 2). O BrainMoE obteve a maior AUC média entre todos os métodos comparados, de 86,9 ± 3,0%.

Os métodos clássicos de aprendizado de máquina apresentaram desempenho médio inferior, com a SVM alcançando uma AUC média de 66,7 ± 4,5% e a MLP de 64,6 ± 6,3%. Os métodos gerais de aprendizado profundo apresentaram desempenho variável, com a ResNet alcançando uma AUC média de 71,0 ± 3,3% e o Transformer de 63,8 ± 4,7%. Entre as linhas de base avançadas de aprendizado profundo, BNT, BrainGNN, MultiEpilepsyNet e SZAtt-Net superaram a maioria dos métodos clássicos e gerais de aprendizado profundo, ainda que suas AUCs médias tenham permanecido abaixo da do BrainMoE.

Para fornecer suporte estatístico à comparação de referência, o BrainMoE foi comparado com a linha de base mais forte para cada métrica de desempenho (Tabela 3). O BrainMoE superou o NeuroMoE++ na AUC e na acurácia balanceada (BA) e superou o SZAtt-Net no escore F1 e na acurácia. Todas as comparações permaneceram significativas após o ajuste de Holm.

Análise por subgrupos por sexo e local de aquisição
As características específicas da coorte, incluindo os números de registros multimodais retidos, as proporções entre doença e controle, as contagens de participantes únicos, os resumos de idade, as distribuições por sexo e as distribuições por local de aquisição, são resumidas na tabela de características da coorte (Tabela 4). As proporções entre doença e controle são calculadas a partir da contagem de registros multimodais, enquanto as características demográficas e por local de aquisição são resumidas no nível de participante único.

Para avaliar os possíveis efeitos do sexo e do local de aquisição, o desempenho do BrainMoE foi estratificado por esses fatores (Tabela 5). O subgrupo masculino apresentou médias maiores de AUC, BA, escore F1 e acurácia em comparação ao subgrupo feminino, enquanto os valores de p de Welch não ajustados correspondentes variaram de 0,089 a 0,321. De forma semelhante, o subgrupo RUBIC mostrou desempenho médio superior ao do subgrupo Staten Island, com valores de p entre 0,055 e 0,309. Nenhuma diferença significativa entre subgrupos foi detectada nessas análises.

Análise de ablação dos componentes do BrainMoE
Foram realizados experimentos de ablação para avaliar a contribuição da máscara de disponibilidade de modalidade, do roteador convolucional, do especialista compartilhado e do design de fusão de especialistas em MoE (Tabela 6). A remoção da incorporação da máscara reduziu a AUC média para 79,2 ± 3,1%, e a substituição do roteador convolucional por um roteador MLP reduziu-a para 79,3 ± 3,7%. A remoção do especialista compartilhado reduziu a AUC somente para fMRI para 73,5 ± 3,3%, a menor entre as variantes testadas. A remoção de todos os especialistas MoE também reduziu a acurácia balanceada geral para 74,2 ± 3,0%. Esses resultados de ablação mostraram que o design completo do BrainMoE alcançou o desempenho geral mais forte em ambos os estados com modalidades completas e com modalidades ausentes, enquanto a incorporação da máscara, o roteador convolucional, o especialista compartilhado e a fusão de especialistas MoE contribuíram cada uma para o comportamento final do modelo.

Resultados de interpretabilidade em nível de ROI para cinco transtornos cerebrais
Para examinar as contribuições regionais subjacentes às previsões do BrainMoE, realizou-se atribuição por oclusão de nós em amostras corretamente classificadas como positivas para a doença no estado completo de EEG-fMRI. As contribuições das ROI derivadas de EEG e de fMRI foram classificadas separadamente mediante a medição da diminuição na probabilidade da doença-alvo após a oclusão de cada região do atlas DK. A análise identificou padrões de contribuição específicos à modalidade em todas as cinco tarefas de doença (Figura 2). Para a atribuição derivada de fMRI, as regiões com classificação mais alta foram o cíngulo posterior esquerdo na DDM, o córtex pericalcarino direito na ANS, o córtex parahipocampal esquerdo na RI, o pars triangularis direito no TEA e o córtex entorrinal esquerdo no TDAH. Para a atribuição derivada de EEG, as regiões com classificação mais alta foram as margens do sulco temporal superior esquerdo na DDM, o córtex pré-central esquerdo na ANS, o cunéus esquerdo na RI, o córtex lingual esquerdo no TEA e a ínsula direita no TDAH. As ROI derivadas de EEG e fMRI com as classificações mais altas para cada transtorno são visualizadas nas superfícies corticais na Figura 3. Esses resultados mostraram que o BrainMoE forneceu interpretabilidade em nível de ROI, mantendo simultaneamente perfis de atribuição separados para representações derivadas de EEG e de fMRI. Para amostras corretamente classificadas como positivas para a doença, a estabilidade cruzada foi avaliada utilizando a frequência da ROI Top-1 em 50 dobras mantidas (Tabela 7). As frequências observadas variaram de 36% a 68%, superando o valor de referência teórico de seleção aleatória de 1/68 (1,47%) e apoiando a interpretação com base em classificações relativas em vez de magnitudes absolutas de contribuição. Comparações com achados neuroimagemológicos anteriores foram realizadas a posteriori e usadas apenas para contextualizar os resultados de atribuição, não como validação independente.

figure-results-1
Figura 1: Visão geral do framework BrainMoE com fusão adaptativa de EEG e fMRI para diagnóstico assistido por computador de distúrbios cerebrais. As características de ROI de EEG e fMRI alinhadas à fonte são processadas por Codificadores de Grafos separados. As representações resultantes são enviadas aos Especialistas de EEG e fMRI e, juntamente com a Máscara de Disponibilidade de Modalidade, ao Módulo Compartilhado de Roteamento Suave. As representações modais e a representação de roteamento são fundidas e processadas pelo Especialista Compartilhado de estado neural. As três saídas dos especialistas são então combinadas no Módulo de Fusão e encaminhadas à Cabeça de Classificação de Diagnóstico para gerar as probabilidades de HC e da doença-alvo. Clique aqui para visualizar uma versão maior desta figura.

figure-results-2
Figura 2: Análise de contribuição de ROI baseada na oclusão de nós. As 10 principais contribuições de ROI derivadas de EEG e fMRI foram visualizadas para cada tarefa de doença no estado completo de inferência EEG-fMRI. Os painéis (A–E) mostram os resultados derivados de fMRI para DDM, ANS, IR, TSA e TDAH, respectivamente, e os painéis (F–J) mostram os resultados correspondentes derivados de EEG na mesma ordem. Apenas o ROI com classificação mais alta foi rotulado em cada gráfico. A contribuição de ROI foi definida como a diminuição na probabilidade da doença-alvo após a oclusão da região correspondente no atlas DK. Clique aqui para visualizar uma versão maior desta figura.

figure-results-3
Figura 3: Mapas de interpretabilidade no nível de ROI cortical em cinco transtornos cerebrais. Os painéis (A–E) mostram, respectivamente, TDM, ANX, RI, TEA e TDAH. Cada painel exibe a região de interesse (ROI) derivada de EEG com classificação mais alta em vermelho e a ROI derivada de fMRI com classificação mais alta em laranja na superfície cortical DK. As cores indicam a modalidade, não a magnitude da contribuição; portanto, nenhuma escala cromática quantitativa é aplicada. Os prefixos lh e rh indicam os hemisférios esquerdo e direito, respectivamente. Clique aqui para visualizar uma versão maior desta figura.

Tarefa de doençaEstadoAUCAcuráciaBAF1SensibilidadeEspecificidade
MDDCompleto88,0 ± 3,2%84,8 ± 3,7%82,0 ± 2,3%76,2 ± 4,1%72,7 ± 3,0%91,3 ± 4,7%
MDDApenas EEG83,4 ± 3,4%81,8 ± 4,5%77,9 ± 3,0%73,7 ± 3,9%68,2 ± 2,8%87,6 ± 4,2%
MDDApenas fMRI82,1 ± 3,3%78,5 ± 4,7%74,0 ± 4,1%71,8 ± 4,9%66,6 ± 3,5%81,3 ± 5,6%
ANXCompleto85,5 ± 2,5%76,1 ± 2,4%78,2 ± 2,0%79,4 ± 3,3%78,1 ± 3,6%78,2 ± 3,1%
ANXApenas EEG81,7 ± 3,9%73,2 ± 3,2%75,6 ± 3,1%78,1 ± 3,9%76,6 ± 3,8%74,6 ± 4,0%
ANXApenas fMRI74,8 ± 4,1%74,4 ± 3,7%72,8 ± 3,6%76,4 ± 4,2%72,6 ± 3,9%73,0 ± 4,4%
RICompleto84,4 ± 3,2%76,5 ± 3,0%77,3 ± 2,9%76,7 ± 2,8%77,9 ± 3,1%76,7 ± 3,3%
RIApenas EEG80,2 ± 4,0%71,5 ± 4,4%73,4 ± 3,5%73,0 ± 3,4%73,8 ± 3,9%72,9 ± 3,3%
RIApenas fMRI81,3 ± 4,5%71,1 ± 3,9%67,9 ± 3,7%68,5 ± 3,2%69,4 ± 4,5%66,3 ± 4,2%
ASDCompleto88,4 ± 3,8%79,5 ± 3,5%81,4 ± 3,0%81,0 ± 2,8%83,4 ± 2,9%79,4 ± 3,0%
ASDApenas EEG82,5 ± 4,3%77,3 ± 4,1%78,2 ± 3,7%78,6 ± 3,5%79,3 ± 3,4%77,1 ± 4,1%
ASDApenas fMRI81,3 ± 4,4%73,8 ± 3,7%74,4 ± 3,4%75,0 ± 3,2%76,1 ± 4,2%72,6 ± 4,5%
ADHDCompleto88,2 ± 2,2%90,3 ± 2,7%88,4 ± 2,5%92,8 ± 1,9%87,0 ± 2,4%89,7 ± 2,5%
ADHDApenas EEG87,9 ± 2,8%88,1 ± 2,6%86,4 ± 3,1%90,2 ± 3,4%85,1 ± 3,1%87,7 ± 3,0%
ADHDApenas fMRI80,5 ± 3,2%85,7 ± 3,0%84,7 ± 3,5%87,9 ± 4,1%83,2 ± 3,6%86,2 ± 3,4%

Tabela 1: Desempenho da classificação BrainMoE em diferentes tarefas de doença e estados de disponibilidade de modalidades. Desempenho do BrainMoE em cinco tarefas de classificação saudável versus doença nos estados de inferência com EEG-fMRI completo, apenas EEG e apenas fMRI. As métricas são apresentadas como média ± desvio padrão e incluem a área sob a curva ROC (AUC), acurácia, acurácia balanceada (BA), escore F1, sensibilidade e especificidade.

MétodoGrupo de métodoAUC médiaBA médiaF1 médiaAcurácia média
SVMML clássico66,7 ± 4,5%70,6 ± 3,4%61,7 ± 5,8%70,7 ± 4,6%
MLPML clássico64,6 ± 6,3%63,5 ± 8,2%64,5 ± 6,1%64,2 ± 6,2%
TransformerDL genérico63,8 ± 4,7%64,4 ± 4,8%65,2 ± 5,1%66,1 ± 4,9%
3D-CNNDL genérico65,3 ± 4,3%65,2 ± 4,0%64,8 ± 4,5%60,0 ± 4,2%
ResNetDL genérico71,0 ± 3,3%70,2 ± 3,6%67,5 ± 3,8%69,3 ± 3,0%
BrainNetCNNDL avançado70,2 ± 3,6%70,9 ± 3,1%69,2 ± 3,6%71,2 ± 3,1%
BNTDL avançado73,6 ± 3,1%76,4 ± 2,7%74,7 ± 2,3%76,6 ± 2,6%
BrainGNNDL avançado72,4 ± 2,8%72,7 ± 2,3%71,0 ± 3,4%72,3 ± 2,5%
MultiEpilepsyNetDL avançado78,3 ± 3,7%75,2 ± 3,5%76,5 ± 3,6%77,2 ± 3,3%
SZAtt-NetDL avançado78,7 ± 3,2%76,1 ± 3,8%77,4 ± 3,9%78,1 ± 3,4%
dFCExpertDL baseado em MoE80,1 ± 3,2%77,3 ± 2,9%76,7 ± 3,1%77,6 ± 2,9%
EvoMoEDL baseado em MoE79,6 ± 3,6%76,2 ± 3,1%76,2 ± 3,3%76,5 ± 3,2%
NeuroMoE++DL baseado em MoE81,5 ± 2,8%77,9 ± 2,7%77,1 ± 3,4%78,0 ± 2,7%
BrainMoE (nosso)DL baseado em MoE86,9 ± 3,0%81,4 ± 2,5%81,2 ± 3,0%81,4 ± 3,1%

Tabela 2: Desempenho médio de classificação do BrainMoE comparado com métodos clássicos de aprendizado de máquina, modelos genéricos de aprendizado profundo e arquiteturas avançadas de aprendizado profundo para neuroimagem. Os resultados são agregados ao longo das tarefas de classificação de doenças avaliadas e apresentados como média ± desvio padrão para AUC, BA, pontuação F1 e acurácia.

ComparaçãoAUC médiaBA médiaF1 médiaAcurácia média
Baseline mais forteNeuroMoE++NeuroMoE++SZAtt-NetSZAtt-Net
Desempenho do baseline mais forte81,5 ± 2,8%77,9 ± 2,7%77,4 ± 3,9%78,1 ± 3,4%
BrainMoE86,9 ± 3,0%81,4 ± 2,5%81,2 ± 3,0%81,4 ± 3,1%
Diferença+5,4+3,5+3,8+3,3
p do teste t0,00060,00650,01870,0276
p ajustado de Holm*p < 0,01p < 0,05p < 0,05p < 0,05
dz de Cohen1,631,110,910,83

Tabela 3: Comparação do BrainMoE com a linha de base mais forte para cada métrica de desempenho. Os valores de P foram calculados utilizando testes t pareados bicaudais e ajustados usando o procedimento de Holm. O dz de Cohen denota a diferença pareada padronizada.

CohorteRegistros multimodais (n)Razão doença-controleParticipantes únicos (n)Faixa etária (anos)Sexo (Masculino/Feminino)Local de aquisição (Staten Island/RUBIC)
HC115--755,02–21,9035/4026/49
MDD520,45:1338,36–19,7314/1915/18
ANX1561,36:1985,53–21,0046/5245/53
RI1411,23:1855,75–19,6647/3839/46
TEA820,71:1515,66–19,7945/627/24
TDAH5554,83:13385,04–21,72241/97136/202

Tabela 4: Características dos cohorts do estudo utilizados nas cinco tarefas de classificação específicas para doenças. A tabela relata o número de registros multimodais retidos, as proporções entre doenças e controles, as contagens únicas de participantes, as características demográficas e as distribuições dos locais de aquisição.

SubgrupoNúmeroAUC médiaBA médiaF1 médiaAcurácia média
Sexo
Masculino70587,2 ± 3,783,4 ± 3,282,1 ± 3,582,5 ± 3,8
Feminino39685,6 ± 3,381,2 ± 4,079,7 ± 3,879,6 ± 3,4
Diferença+1,6+2,2+2,4+2,9
p de Welch--0,3210,1920,1590,089
Local de aquisição
RUBIC67487,6 ± 4,083,3 ± 3,182,3 ± 3,783,4 ± 3,5
Staten Island42785,2 ± 3,681,7 ± 3,779,4 ± 3,480,1 ± 3,7
Diferença+2,4+1,6+2,9+3,3
p de Welch--0,1760,3090,0850,055

Tabela 5: Desempenho do BrainMoE estratificado por sexo e local de aquisição. Os resultados são apresentados como média ± desvio padrão ao longo de 10 repetições de validação cruzada com 5 dobras. A diferença representa o primeiro subgrupo menos o segundo, e os valores de P foram obtidos utilizando testes t de Welch bicaudais.

VarianteAUC totalAUC somente EEGAUC somente fMRIAUC médiaBA média
sem incorporação de máscara83,2 ± 2,9%79,5 ± 3,9%76,4 ± 3,7%79,2 ± 3,1%76,1 ± 3,4%
sem roteador Conv84,6 ± 3,6%80,7 ± 3,5%78,2 ± 4,2%81,6 ± 3,3%75,7 ± 3,1%
Roteador MLP82,8 ± 2,7%80,1 ± 4,1%76,6 ± 4,4%79,3 ± 3,7%74,1 ± 3,8%
sem Especialista Compartilhado83,3 ± 3,6%80,8 ± 4,0%73,5 ± 3,3%80,1 ± 3,6%75,5 ± 3,2%
sem Especialistas MoE81,9 ± 3,3%78,7 ± 3,6%78,0 ± 3,8%80,8 ± 4,1%74,2 ± 3,0%
BrainMoE (nosso)86,9 ± 3,0%83,1 ± 3,7%80,0 ± 3,9%86,9 ± 3,0%81,4 ± 2,5%

Tabela 6: Análise de ablação dos componentes principais do BrainMoE. Resultados de ablação mostrando a contribuição da máscara de disponibilidade de modalidade, do roteador convolucional, do especialista compartilhado e do design de fusão de especialistas em MoE. Cada variante é avaliada nas condições de inferência completa EEG-fMRI, apenas EEG e apenas fMRI, com a AUC média e a BA média resumindo o desempenho geral.

DoençaEEG: ROI com classificação mais altaEEG: Frequência Top-1, n/N (%)fRMI: ROI com classificação mais altafRMI: Frequência Top-1, n/N (%)Referência aleatória (%)
DMRbancos esquerdos do sulco temporal superior22/50 (44%)cíngulo posterior esquerdo25/50 (50%)1,47
ANScórtex pré-central esquerdo18/50 (36%)córtex pericalcarino direito21/50 (42%)1,47
IRcunêus esquerdo26/50 (52%)córtex parahipocampal esquerdo29/50 (58%)1,47
TEAcórtex lingual esquerdo27/50 (54%)pars triangularis direito28/50 (56%)1,47
TDAHínsula direita31/50 (62%)córtex entorrinal esquerdo34/50 (68%)1,47

Tabela 7: Estabilidade cruzada dos ROI derivados de EEG e fMRI com melhor classificação. A frequência do primeiro colocado indica o número e a porcentagem de análises em 50 dobras nas quais o ROI relatado ocupou a primeira posição. A referência teórica de seleção aleatória foi de 1/68 (1,47%).

Arquivo Suplementar 1: Script de verificação de entrada H5. Script Python para verificar as chaves obrigatórias de entrada H5, tipos de dados, rótulos diagnósticos e dimensões de entrada compatíveis com o DK-atlas antes do treinamento do BrainMoE. Clique aqui para baixar este arquivo.

Arquivo Suplementar 2: script de pré-processamento de fMRI. Arquivos de configuração e execução do C-PAC utilizados para o pré-processamento de fMRI, incluindo remoção de volumes iniciais, correção de movimento e distorção, registro e normalização, regressão de ruídos, filtragem temporal e suavização espacial. Clique aqui para baixar este arquivo.

Arquivo Suplementar 3: Scripts de processamento FreeSurfer. Scripts para processar dados de RM estrutural, realizar a co-registração da parcellação cortical Desikan-Killiany ao espaço nativo de fRM e extrair sinais de fRM em nível de ROI. Clique aqui para baixar este arquivo.

Arquivo Suplementar 4: Scripts de pré-processamento de EEG. Scripts MATLAB/EEGLAB utilizados para o pré-processamento de EEG, incluindo filtragem, identificação e remoção de componentes de artefatos e re-referenciação. Clique aqui para baixar este arquivo.

Arquivo Suplementar 5: Script de localização de fonte e extração de características no MNE-Python. Script Python para localização de fonte em EEG, extração de ROI do atlas DK e geração de características de EEG em nível de ROI utilizadas como entradas para o BrainMoE. Clique aqui para baixar este arquivo.

Arquivo Suplementar 6: Código de implementação do BrainMoE. Código Python e arquivos de configuração para a arquitetura BrainMoE, codificadores de grafos, manipulação de modalidade-estado, roteamento e fusão de especialistas, treinamento do modelo, avaliação e variantes de ablação. Clique aqui para baixar este arquivo.

Arquivo Suplementar 7: Código de atribuição por oclusão de nós. Código Python para análise de oclusão de nós específica por modalidade, cálculo dos escores de contribuição de ROI, classificação de ROIs derivados de EEG e fMRI e geração de saídas de atribuição. Clique aqui para baixar este arquivo.

Discussão

A análise multimodal de sinais cerebrais tornou-se uma direção importante para o diagnóstico computadorizado de distúrbios cerebrais, pois o EEG e o fMRI fornecem informações complementares sobre a atividade neural. Na comparação de referência, métodos clássicos de aprendizado de máquina, como SVM e MLP, proporcionaram desempenho diagnóstico básico, mas apresentaram capacidade limitada de modelar interações hierárquicas, com estrutura de grafo e entre modalidades. Modelos genéricos de aprendizado profundo, incluindo 3D-CNN, ResNet e Transformer, ofereceram maior capacidade de modelagem não linear, mas essas arquiteturas não foram especificamente projetadas para fusão EEG-fMRI ou representações de redes cerebrais. Métodos avançados de aprendizado profundo alcançaram desempenho superior à maioria dos modelos clássicos e genéricos, mas muitos ainda dependem de estratégias fixas de integração de características e não separam explicitamente informações específicas de cada modalidade das informações compartilhadas sobre o estado neural.

Este estudo propôs o BrainMoE para abordar esse problema de fusão combinando codificadores de modalidade baseados em grafos, especialistas específicos para cada modalidade, um especialista compartilhado de estado neural e um mecanismo de roteamento adaptativo. Esse design permitiu que representações derivadas de EEG e de fMRI fossem modeladas separadamente e depois integradas por meio de fusão em nível de especialista. Ao introduzir máscaras de estado-modalidade e tokens para modalidades ausentes, o mesmo modelo treinado também pôde realizar inferência apenas com EEG e apenas com fMRI, sem a necessidade de construir modelos separados para cada condição de modalidade ausente. Os resultados experimentais mostraram que o BrainMoE alcançou o melhor desempenho geral nas cinco tarefas de classificação binária de doenças e manteve um desempenho utilizável tanto no estado apenas com EEG quanto apenas com fMRI. A análise de ablação reforçou ainda a contribuição da incorporação de máscara, do roteador convolucional, do especialista compartilhado e da fusão de especialistas MoE. Esses achados indicam que o desempenho aprimorado não se deve a um único componente, mas ao design coordenado de codificação em grafos, modelagem de estado-modalidade, roteamento adaptativo e fusão de especialistas.

Passos críticos do protocolo e solução de problemas
Os passos críticos do protocolo incluem manter a mesma ordem de 68 regiões DK nas matrizes de nós e grafos do EEG e fMRI, aplicar as configurações predefinidas de pré-processamento independentemente para cada participante e impor a validação cruzada em nível de participante, de modo que todos os registros do mesmo participante permaneçam em uma única dobra. A Máscara de Disponibilidade de Modalidade também deve corresponder às entradas fornecidas para cada estado de inferência.

Se a inferência falhar ou a vantagem esperada de desempenho no estado completo não for reproduzida, verifique primeiro as chaves H5 exigidas, as dimensões das matrizes de EEG e fMRI, a ordem das regiões DK, a atribuição da Máscara de Disponibilidade de Modalidade e as partições de validação cruzada salvas. Arquivos com chaves ausentes, dimensões inválidas ou ordenamento inconsistente de regiões devem ser excluídos antes do treinamento ou da avaliação. O framework pode ser modificado para parcellamentos corticais alternativos ou representações de características de EEG/fMRI, desde que ambas as modalidades sejam mapeadas em uma mesma ordenação de ROI e as dimensões de entrada correspondentes do modelo sejam ajustadas. A cabeça de classificação específica para a doença também pode ser adaptada a outras tarefas de classificação binária, mantendo-se o framework de codificação de grafos e fusão de especialistas. Tais modificações exigem novo treinamento e validação, e não a aplicação direta dos modelos aqui relatados.

Análise de interpretabilidade baseada na oclusão de nós
A análise de oclusão de nós forneceu ainda interpretabilidade em nível de ROI para as previsões do BrainMoE, com as ROIs associadas às doenças mais relevantes mostradas na Figura 3. A ROI posterior esquerda derivada de EEG identificada pelo BrainMoE é consistente com evidências prévias de meta-análise baseada em voxel23, que relataram alterações na atividade cerebral intrínseca em regiões corticais posteriores na DDM. As ROIs pré-central esquerda e pericalcarina direita derivadas de EEG/fMRI são consistentes com evidências neuroimagemológicas anteriores em transtornos de ansiedade: uma meta-análise de espessura cortical24 relatou aumento da espessura cortical no giro pré-central esquerdo em pacientes com transtornos de ansiedade, enquanto um estudo de rede de covariância estrutural25 em transtorno de ansiedade social relatou centralidade nodal anormal envolvendo o córtex pericalcarino direito. Para o transtorno de leitura, a ROI de cunéus esquerdo derivada de EEG é consistente com um estudo de conectividade de todo o cérebro26 que relatou conectividade alterada do cunéus esquerdo na dislexia, enquanto a ROI parahipocampal esquerda derivada de fMRI é consistente com um estudo separado27 que relatou acoplamento anormal entre parahipocampo/hipocampo em adolescentes com déficits específicos de compreensão leitora. Na tarefa de transtorno do espectro do autismo, a ROI de giro lingual esquerdo destacada pela atribuição derivada de EEG ecoa evidências prévias de fMRI de estado de repouso28 de redução do ReHo no giro lingual esquerdo em meninos pré-púberes com TEA. A ROI de pars triangularis direito derivada de fMRI também é biologicamente plausível, já que alterações no ALFF na pars triangularis direita do giro frontal inferior já foram relatadas29 em crianças autistas. Para TDAH, a ROI de ínsula direita derivada de EEG está de acordo com evidências de RM estrutural30 que mostram redução do volume da ínsula anterior em jovens com TDAH, particularmente envolvendo o giro curto da ínsula direita. A ROI entorinal esquerda derivada de fMRI pode refletir um achado mais específico de subtipo, já que um estudo separado do Psychological Medicine31 relatou menor volume do córtex entorinal esquerdo em um subgrupo TDAH-C após correção FDR. Esses achados devem, contudo, ser interpretados considerando a dependência inter-regional, pois sinais de ROI correlacionados podem impedir que a oclusão de um único nó isole completamente a contribuição de uma região individual e podem levar a estimativas conservadoras.

Limitações e direções futuras
Embora a validação cruzada repetida de 5 vezes tenha sido utilizada para obter estimativas internas de desempenho, estudos futuros que empreguem validação cruzada aninhada ou validação externa independente poderiam fortalecer ainda mais a avaliação da estabilidade na seleção de modelos e sua generalização. Como as saídas baseadas apenas em EEG e apenas em fMRI foram geradas mascarando uma modalidade em registros multimodais completos e não foram avaliadas em uma coorte de validação externa, estudos futuros deveriam incluir coortes externas de validação de modalidade única para avaliar a generalização. Uma limitação adicional é que o delineamento saudável versus doença única não capta apresentações com comorbidades, o que limita a generalização clínica e motiva estudos futuros sobre classificação multirrótulo e diagnóstico diferencial. Trabalhos futuros também poderiam avaliar a robustez das associações no nível de fonte do EEG utilizando estimadores de conectividade sensíveis a vazamentos. Embora a parcellação DK compartilhada forneça uma interface anatomicamente fundamentada para a fusão multimodal, trata-se de uma suposição de modelagem que pode não capturar plenamente as diferenças específicas de modalidade na resolução temporal e na origem fisiológica. Além das cinco doenças avaliadas aqui, a estrutura poderia ser adaptada a outras tarefas de classificação neurológicas ou psiquiátricas que envolvam dados cerebrais multimodais anatomicamente alinhados e estendida a aplicações de classificação multirrótulo ou diagnóstico diferencial.

Conclusão
Em resumo, o BrainMoE fornece um framework prático e interpretável para a fusão de EEG-fMRI no diagnóstico assistido por computador de transtornos cerebrais. Seu principal benefício reside na integração adaptativa de características multimodais, impulsionada por uma arquitetura multiexperta e um mecanismo de roteamento suave que equilibra dinamicamente informações específicas de cada modalidade e informações compartilhadas. Além disso, ao incorporar perfeitamente máscaras de estado modal e tokens para modalidades ausentes, o mesmo modelo treinado alcança desempenho robusto durante inferência com modalidades incompletas, sem necessidade de configurações separadas. Crucialmente, o framework interpretável fornece trajetórias de atribuição regional transparentes em nível de grupo para cinco transtornos cerebrais distintos, transformando a arquitetura tradicional do tipo caixa-preta em uma ferramenta fisiologicamente informada para diagnóstico assistido por computador. Isso é importante para futuros fluxos de trabalho em neuroimagem computacional, nos quais fontes heterogêneas de dados, disponibilidade incompleta de modalidades e saídas explicáveis de modelos são considerações centrais.

Divulgações

Os autores declaram não haver conflitos de interesse. Os autores declaram que nenhuma ferramenta de inteligência artificial generativa foi utilizada na preparação deste manuscrito, seu código, análise de dados ou criação de gráficos.

Agradecimentos

Esta pesquisa foi financiada pela Fundação Nacional de Ciências Naturais da China sob os números de concessão 62433002, 62277001 e U25A20446, pelo Projeto de Construção e Apoio a Equipes Inovadoras de Alto Nível das Instituições Municipais de Pequim sob o número de concessão BPHR20220104, e pelo Programa Beijing Scholars sob o número de concessão 099.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
BashProjeto GNU5.1.16(1)-releaseSoftware
C-PACFCP-INDIVersão 1.8.7; tag do contêiner release-v1.8.7.dev1Software
Toolkit CUDANVIDIA CorporationVersão 12.4Software
GPU compatível com CUDANVIDIA CorporationGeForce RTX 4060 Laptop GPUEquipamento
Atlas cortical Desikan-KillianyFreeSurfer, Athinoula A. Martinos Center for Biomedical Imaging, Massachusetts General Hospitalaparc; 68 regiões corticais (RRID:SCR_001847)Atlas/recurso
EEGLABSwartz Center for Computational Neuroscience, University of California San DiegoVersão 2022.1 (RRID:SCR_007292)Software
FreeSurferAthinoula A. Martinos Center for Biomedical Imaging, Massachusetts General HospitalVersão 7.4.1 (RRID:SCR_001847)Software
FSLFMRIB, University of OxfordIncluso no C-PAC 1.8.7; versão exata não especificada (RRID:SCR_002823)Software
Conjunto de dados Healthy Brain Network (HBN)Child Mind InstituteRRID:SCR_016989Conjunto de dados
MATLABMathWorksR2022a (RRID:SCR_001622)Software
MNE-PythonEquipe de Desenvolvimento MNE-PythonVersão 1.9 (RRID:SCR_005972)Software/biblioteca
PythonPython Software FoundationVersão 3.12.4 (RRID:SCR_008394)Software
PyTorchPyTorch FoundationVersão 2.6.0+cu124 (RRID:SCR_018536)Biblioteca

Referências

  1. Shao Y, et al. Exploring cognitive workload recognition using CogRepLKNet with EEG-fMRI. Neural Netw. 2026;198:108575.
  2. Jatoi MA, et al. A survey of methods used for source localization using EEG signals. Biomed Signal Process Control. 2014;11:42-52.
  3. Wei X, et al. Multi-modal cross-domain self-supervised pre-training for fMRI and EEG fusion. Neural Netw. 2025;184:107066.
  4. Lang J, Yang LZ, Li H. Multi-modal dynamic brain graph representation learning for brain disorder diagnosis via temporal sequence model. Neurocomputing. 2025;656:131509.
  5. Zhu W, et al. CGLK-GNN: a connectome generation network with large kernels for GNN based Alzheimer's disease analysis. Neural Netw. 2026;199:108689.
  6. Wu Z, Shen C, van den Hengel A. Wider or deeper: revisiting the ResNet model for visual recognition. Pattern Recogn. 2019;90:119-33.
  7. Vaswani A, et al. Attention is all you need [conference paper]. Presented at: 31st Conference on Neural Information Processing Systems; Long Beach, CA; 2017. Available from: https://papers.nips.cc/paper/7181-attention-is-all-you-need
  8. Kawahara J, et al. BrainNetCNN: convolutional neural networks for brain networks; towards predicting neurodevelopment. Neuroimage. 2017;146:1038-49.
  9. Li X, et al. BrainGNN: interpretable brain graph neural network for fMRI analysis. Med Image Anal. 2021;74:102233.
  10. Kan X, et al. Dynamic brain transformer with multi-level attention for functional brain network analysis [conference paper]. Presented at: 2023 IEEE EMBS International Conference on Biomedical and Health Informatics; Pittsburgh, PA; 2023. Available from: https://doi.org/10.1109/BHI58575.2023.10313480
  11. Khan MAR, et al. MultiEpilepsyNet: an EEG and MRI data based multimodal seizure detection model using hybrid deep learning model. Brain Res Bull. 2025;233:111645.
  12. Saha A, Ghosh D, Ali F, Singh PK. SZAtt-Net: a unified deep learning model with different attention mechanisms for schizophrenia classification from multimodal data. Med Nov Technol Devices. 2026;29:100428.
  13. Liu J, et al. A survey on inference optimization techniques for mixture of experts models. ACM Comput Surv. 2026;58(10):1-37.
  14. Xu H, et al. MCMoE: completing missing modalities with mixture of experts for incomplete multimodal action quality assessment [conference paper]. Presented at: 40th Annual AAAI Conference on Artificial Intelligence; Singapore; 2026. Available from: https://doi.org/10.1609/aaai.v40i13.38104
  15. Nguyen H, Ho N, Rinaldo A. Convergence rates for softmax gating mixture of experts. IEEE Trans Inf Theory. 2025;72(2):1276-304.
  16. Ma J, et al. Modeling task relationships in multi-task learning with multi-gate mixture-of-experts [conference paper]. Presented at: 24th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining; London, United Kingdom; 2018. Available from: https://doi.org/10.1145/3219819.3220007
  17. Chen T, Li H, Zheng H, Fan Y. dFCExpert: learning dynamic functional connectivity patterns with modularity and state experts. IEEE Trans Med Imaging. 2026;45(3):1088-98.
  18. Yang X, et al. EvoMoE: evolutionary mixture-of-experts for SSVEP-EEG classification with user-independent training. IEEE J Biomed Health Inform. 2025;29(9):6538-50.
  19. Raza WH, et al. NeuroMoE++: patient-adaptive multi-level multimodal fusion with mixture-of-experts for neurological disorder classification. IEEE Trans Biomed Eng. 2026;73(8):2784-94.
  20. Desikan RS, et al. An automated labeling system for subdividing the human cerebral cortex on MRI scans into gyral based regions of interest. Neuroimage. 2006;31(3):968-80.
  21. Alexander LM, et al. An open resource for transdiagnostic research in pediatric mental health and learning disorders. Sci Data. 2017;4(1):170181.
  22. Ji S, Xu W, Yang M, Yu K. 3D convolutional neural networks for human action recognition. IEEE Trans Pattern Anal Mach Intell. 2013;35(1):221-31.
  23. Gong J, et al. Common and distinct patterns of intrinsic brain activity alterations in major depression and bipolar disorder: voxel-based meta-analysis. Transl Psychiatry. 2020;10(1):353.
  24. Wang L, et al. Alterations in cortical thickness in anxiety disorders and their association with atlas-based neurotransmitter maps. Acad Radiol. 2026;33(7):3011-22.
  25. Zhang X, et al. Disrupted brain gray matter connectome in social anxiety disorder: a novel individualized structural covariance network analysis. Cereb Cortex. 2023;33(16):9627-38.
  26. Finn ES, et al. Disruption of functional networks in dyslexia: a whole-brain, data-driven analysis of connectivity. Biol Psychiatry. 2014;76(5):397-404.
  27. Cutting LE, et al. Not all reading disabilities are dyslexia: distinct neurobiology of specific comprehension deficits. Brain Connect. 2013;3(2):199-211.
  28. Yue X, et al. Brain functional alterations in prepubertal boys with autism spectrum disorders. Front Hum Neurosci. 2022;16:891965.
  29. Karavallil Achuthan S, Coburn KL, Beckerson ME, Kana RK. Amplitude of low frequency fluctuations during resting state fMRI in autistic children. Autism Res. 2023;16(1):84-98.
  30. Lopez-Larson MP, et al. Reduced insular volume in attention deficit hyperactivity disorder. Psychiatry Res Neuroimaging. 2012;204(1):32-9.
  31. Yamashita M, Shou Q, Mizuno Y. Unsupervised machine learning for identifying attention-deficit/hyperactivity disorder subtypes based on cognitive function and their implications for brain structure. Psychol Med. 2024;54(14):3917-29.

Reimpressões e permissões

Etiquetas

Fusão EEG-fMRIImagem Cerebral MultimodalDiagnóstico Assistido por ComputadorCodificadores de GrafoMapas de Atribuição de ROIEspecialista de Estado NeuralMáscaras de Estado de ModalidadeAnálise de Oclusão de Nós

Este artigo foi publicado

Vídeo em breve