Artículo de método

Fusión de electroencefalografía y resonancia magnética funcional mediante mezcla de expertos para el diagnóstico interpretable de trastornos cerebrales asistido por computadora

0 visualizaciones

⸱

DOI:

10.3791/73432

⸱

25 de septiembre de 2026

En este artículo

Resumen

Este protocolo presenta Brain Mixture-of-Experts, un marco de fusión adaptable e interpretable de electroencefalografía e imágenes por resonancia magnética funcional para el diagnóstico asistido por computadora de trastornos cerebrales. El método integra representaciones heterogéneas de EEG y fMRI mediante expertos específicos por modalidad, un experto compartido de estado neural y enrutamiento adaptativo, manteniendo al mismo tiempo la interpretabilidad y la inferencia bajo condiciones simuladas de ausencia de modalidad.

Resumen

La electroencefalografía (EEG) y la imagen por resonancia magnética funcional (fMRI) proporcionan información complementaria sobre la función cerebral y han mostrado una promesa significativa en la detección de anomalías funcionales en diversas enfermedades cerebrales. Sin embargo, las distintas características de las señales y los espacios representacionales dispares del EEG y el fMRI plantean serios desafíos para la fusión multimodal efectiva, dificultando así un diagnóstico asistido por computadora preciso de trastornos cerebrales mediante modelos convencionales fijos. Este estudio presenta Brain Mixture-of-Experts (BrainMoE), un marco adaptativo e interpretable para la fusión de EEG-fMRI en el diagnóstico asistido por computadora de trastornos cerebrales, que integra características cerebrales multimodales a través de expertos específicos por modalidad, un experto compartido de estado neural y un mecanismo de enrutamiento adaptativo. BrainMoE primero proyecta las señales de EEG y fMRI en un espacio unificado de regiones de interés (ROI) del atlas Desikan-Killiany (DK), y luego utiliza codificadores de grafos para extraer representaciones específicas por modalidad de las redes cerebrales. El módulo de enrutamiento suave produce una representación de enrutamiento, y la Puerta de Expertos en el Módulo de Fusión genera pesos específicos por muestra para combinar las representaciones del experto de EEG, del experto de fMRI y del experto compartido de estado neural. Para manejar escenarios de adquisición incompletos, se incorporan máscaras de estado de modalidad y tokens de modalidad ausente, permitiendo que el mismo modelo entrenado realice inferencias completas con EEG-fMRI, solo EEG o solo fMRI. Finalmente, el análisis de oclusión de nodos proporciona mapas de atribución a nivel de ROI tanto para las predicciones derivadas del EEG como del fMRI. El marco fue evaluado en el conjunto de datos Healthy Brain Network (HBN) en cinco tareas de clasificación binaria de trastornos cerebrales, incluyendo trastorno depresivo mayor, trastorno de ansiedad, dificultad lectora, trastorno del espectro autista y trastorno por déficit de atención con hiperactividad. BrainMoE superó a los algoritmos comparativos más avanzados, alcanzando un AUC promedio de 86,9 ± 3,0 %, y experimentos de ablación respaldaron la contribución de los componentes de enrutamiento y fusión de expertos. Además, el análisis de interpretabilidad identifica contribuciones a nivel grupal de ROI en la clasificación de enfermedades que son coherentes con hallazgos de neuroimagen previamente reportados. Este método apoya el diagnóstico asistido por computadora de trastornos cerebrales al abordar el desafío de integrar representaciones neuronales heterogéneas de EEG-fMRI, manteniendo al mismo tiempo la interpretabilidad y la inferencia bajo condiciones simuladas de modalidad ausente.

Introducción

Los trastornos cerebrales implican cambios complejos en la actividad neuronal y en la organización de las redes cerebrales que son difíciles de caracterizar con una única modalidad de imagen1. Tras la reconstrucción de la fuente2, el EEG proporciona actividad electrofisiológica a nivel regional (EEG), mientras que la imagen por resonancia magnética funcional (fMRI) captura la conectividad funcional a nivel regional, ofreciendo visiones complementarias de la función cerebral. Para facilitar su integración, estudios previos multimodales han asignado ambas modalidades al atlas anatómico de 68 regiones de Desikan-Killiany (DK)3. Aunque esta correspondencia espacial no implica equivalencia en resolución temporal ni en origen fisiológico, proporciona un índice anatómico unificado para la fusión de grafos a nivel de nodos, dimensiones fijas del grafo e interpretación coherente a nivel de regiones de interés (ROI), al tiempo que conserva la información específica de cada modalidad. La integración de estas representaciones alineadas anatómicamente, pero específicas de cada modalidad, puede enriquecer las representaciones de señales cerebrales relacionadas con enfermedades y apoyar el diagnóstico asistido por computadora de trastornos cerebrales3,4.

A pesar del potencial de la fusión EEG-fMRI para el diagnóstico asistido por computadora de trastornos cerebrales, la heterogeneidad entre ambas modalidades representa un desafío técnico para su integración efectiva. Los métodos clásicos de aprendizaje automático, como SVM y MLP, pueden proporcionar modelos de clasificación básicos, pero tienen una capacidad limitada para capturar interacciones no lineales entre modalidades. Modelos genéricos de aprendizaje profundo, incluyendo GNN5, ResNet6y Transformador7 arquitecturas, ofrecen un aprendizaje de representación más potente, pero no están diseñadas específicamente para grafos cerebrales a nivel de ROI ni para modelado de estado-modalidad. Modelos recientes avanzados3,8,9 han aumentado la complejidad no lineal para modelar mejor las redes cerebrales. BrainNetCNN8 fue introducido para adaptar las operaciones convolucionales a matrices de conectividad cerebral; BrainGNN9 modeló además la topología de grafos a nivel de ROI utilizando redes neuronales de grafos y agrupación; y BNT10 posteriormente fortaleció el análisis de redes cerebrales funcionales con atención multi-nivel basada en transformadores. Sin embargo, estos avances aún se desarrollaron principalmente para entornos de una sola modalidad. MultiEpilepsyNet11 luego amplió el aprendizaje multimodal a la detección de crisis mediante EEG y MRI a través de un marco híbrido federado, y su módulo EpiSkullNet++ en el lado de MRI mejoró la segmentación cerebral y el preprocesamiento. SZAtt-Net12 posteriormente desarrolló un modelo de clasificación multimodal de esquizofrenia combinando bloques CNN, BiGRU y MLP con mecanismos de atención de canal, autoatención, espacial y temporal. Sin embargo, estos métodos permanecieron específicos para cada tarea y dependieron de diseños de fusión relativamente fijos, sin apoyar explícitamente el enrutamiento adaptativo en estados de modalidad completa y modalidad faltante.

Los modelos de Mezcla de Expertos (MoE)13,14 han sido adoptados cada vez más en el aprendizaje multimodal porque permiten que fuentes heterogéneas de información sean procesadas por módulos expertos especializados y combinadas dinámicamente mediante mecanismos de enrutamiento. La compuerta softmax proporciona pesos normalizados de expertos dependientes de la entrada y ha sido caracterizada teóricamente en términos de tasas de convergencia15. Arquitecturas relacionadas con múltiples compuertas han demostrado además que compuertas separadas pueden aprender combinaciones dependientes de la tarea de expertos compartidos en el aprendizaje multitarea a gran escala16. En la investigación neurocientífica y los estudios cerebrales, variantes de MoE17,18,19 han sido utilizadas cada vez más para facilitar la fusión de características heterogéneas. dFCExpert17 utilizó expertos basados en modularidad y estados para modelar patrones dinámicos de conectividad funcional a partir de fMRI. EvoMoE18 empleó además una red de compuertas para seleccionar expertos adecuados en la clasificación independiente del usuario de SSVEP-EEG. NeuroMoE++19 exploró la fusión multimodal adaptativa al paciente para la clasificación de trastornos neurológicos. A pesar de su éxito, estos modelos generalmente dependen de mezclas de gran escala y enrutamiento discreto que ignoran la naturaleza altamente sincronizada de los estados neuronales cruzados, lo que dificulta la detección de patrones sutiles pero informativos, críticos para el diagnóstico de trastornos cerebrales. Además, sin un mecanismo dedicado para separar matices específicos de cada modalidad de un estado neuronal compartido unificado, estos modelos ofrecen una interpretabilidad limitada y presentan una degradación del rendimiento cuando falta una modalidad crucial (fMRI o EEG).

Para abordar estas limitaciones, este estudio presenta Brain Mixture-of-Experts (BrainMoE), un marco adaptativo e interpretable para la fusión de EEG-fMRI destinado al diagnóstico asistido por computadora de cinco categorías de trastornos cerebrales, incluyendo el trastorno depresivo mayor (TDM), el trastorno de ansiedad (TA), el trastorno específico del aprendizaje con dificultad lectora (DL), el trastorno del espectro autista (TEA) y el trastorno por déficit de atención con hiperactividad (TDAH). El protocolo primero alinea las características reconstruidas de la fuente de EEG y fMRI al espacio de ROI del atlas DK20 y luego construye representaciones modales basadas en grafos para ambas modalidades. BrainMoE utiliza un experto en EEG, un experto en fMRI y un experto compartido de estado neural, que se integran mediante un módulo de enrutamiento blando para combinar información específica de cada modalidad y compartida. Se incorporan máscaras de estado modal y tokens para modalidad faltante con el fin de permitir inferencias completas de EEG-fMRI, así como inferencias exclusivas de EEG o fMRI dentro de un único modelo entrenado. Para favorecer la interpretabilidad biológica, el protocolo aplica además un análisis de oclusión nodal, en el cual cada ROI del atlas DK se enmascara selectivamente y el cambio resultante en la probabilidad de predicción de enfermedad se utiliza para estimar las contribuciones regionales derivadas de EEG y fMRI. Este protocolo describe el flujo de trabajo completo para la alineación de datos, construcción del modelo, entrenamiento, evaluación e interpretación de ROI basada en oclusión nodal, proporcionando una estrategia adaptable e interpretable para el diagnóstico asistido por computadora de trastornos cerebrales mediante la fusión heterogénea de señales cerebrales EEG-fMRI. Para facilitar la reproducibilidad y futuras extensiones, el repositorio público en GitHub ofrece el modelo BrainMoE, así como el código para entrenamiento y evaluación, mientras que el preprocesamiento de EEG y fMRI se realizó utilizando software de terceros disponible públicamente. El repositorio está disponible en https://github.com/zhongruizhe123/BrainMoE.

Protocolo

Este estudio utilizó datos desidentificados de la base de datos Healthy Brain Network (HBN)21, centrándose en cinco trastornos clínicos distintos para tareas de clasificación diagnóstica posterior. La aprobación ética y el consentimiento informado por escrito ya habían sido obtenidos previamente por la iniciativa HBN de todos los sitios y participantes involucrados. Las grabaciones de EEG y fMRI se adquirieron en sesiones separadas, no de forma simultánea, y se emparejaron utilizando los identificadores de participante y de sesión disponibles en HBN.

1. Preparar el entorno computacional y los datos de entrada

  1. Configurar el entorno computacional
    1. Cree y active un entorno virtual de Python 3.12.4: python -m venv brainmoe_env
      source brainmoe_env/bin/activate
    2. Instale los paquetes requeridos y sus versiones fijas utilizando el archivo requirements.txt proporcionado en el repositorio público de GitHub: pip install -r requirements.txt
    3. Verifique la configuración de PyTorch y CUDA antes del entrenamiento: python -c "import torch; print(torch.__version__); print(torch.version.cuda); print(torch.cuda.is_available())." Confirme que la salida indique PyTorch 2.6.0+cu124, CUDA 12.4 y que la disponibilidad de CUDA sea True. Realice el entrenamiento del modelo utilizando una GPU compatible con CUDA.
  2. Revise todos los archivos de entrada en formato H5 antes del entrenamiento del modelo.
    1. Confirme que cada archivo contenga sLORETA_mean_func para las características de los nodos de EEG, sLORETA_mean_CorrMatrix para el grafo de EEG, fMRI-DK68-node-mat para las características de los nodos de fMRI, fMRI-DK68-edge-mat para el grafo de fMRI y una etiqueta para el diagnóstico. Excluya los archivos con claves faltantes, entradas no numéricas, etiquetas inválidas o dimensiones inconsistentes con el atlas de 68 regiones de Desikan-Killiany. Ejecute el script de verificación de entradas H5 de la siguiente manera: python checkH5.py (Supplementary File 1).

2. Alinear las características de EEG y fMRI a un espacio anatómico compartido

  1. Preprocesar datos de fMRI.
    1. Procesar los datos de fMRI utilizando C-PAC (versión 1.8.7). Ejecutar el script de preprocesamiento de C-PAC de la siguiente manera: bash run_cpac_brainmoe.sh <BIDS_DIR> <OUTPUT_DIR> (Archivo Suplementario 2). Descartar los primeros cinco volúmenes para reducir los efectos iniciales del señal no estacionaria.
    2. Realizar corrección por orden de adquisición de cortes, corrección por movimiento, corrección por distorsión, registro, normalización al espacio anatómico MNI152 y suavizado espacial. Regresar 24 parámetros de ruido relacionados con el movimiento.
    3. Aplicar filtrado temporal de paso de banda entre 0,01 y 0,08 Hz.
  2. Generar características de fMRI alineadas con el atlas.
    1. Procesar la resonancia magnética estructural correspondiente utilizando FreeSurfer (versión 7.4.1). Ejecutar los scripts de la siguiente manera: bash Step01_mgz_2_nifti.sh. Realizar el coregistro de la parcelación cortical Desikan-Killiany resultante al espacio nativo de fMRI del participante. Ejecutar los scripts de la siguiente manera: python Step02_CoRegistration.py. Calcular la señal media por vóxel dentro de cada una de las 68 regiones corticales. Ejecutar los scripts de la siguiente manera: python Step03_fMRI_Signal_Extraction.py (Archivo Suplementario 3).
    2. Mantener 370 puntos temporales consecutivos de fMRI sin relleno temporal para obtener una matriz de características nodo-fMRI de 68 × 370, donde 68 denota las regiones corticales DK y 370 denota los puntos temporales de fMRI retenidos.
  3. Construir el grafo de fMRI.
    1. Calcular las correlaciones de Pearson entre las series temporales de 370 puntos de las 68 regiones DK. Almacenar la matriz resultante de conectividad funcional de 68 × 68 como la matriz de aristas de fMRI.
  4. Preprocesar datos de EEG.
    1. Procesar las grabaciones de EEG de 129 canales utilizando la caja de herramientas EEGLAB (versión 2022.1) en MATLAB (versión R2022a). Ejecutar los dos scripts de preprocesamiento de EEGLAB secuencialmente de la siguiente manera: matlab -batch "run('eegpre_mark.m'); run('eegpre_mark_after.m')" (Archivo Suplementario 4). Mantener la frecuencia de muestreo de 500 Hz y aplicar un filtro de paso de banda de 0,2–40 Hz. Identificar segmentos ruidosos y electrodos defectuosos, e interpolar los canales malos utilizando la señal promedio de los electrodos adyacentes.
    2. Utilizar análisis de componentes independientes con el complemento ICLabel para clasificar los componentes independientes. Eliminar los componentes con una probabilidad de clasificación como artefacto ocular o muscular mayor a 0,90. Aplicar re-referenciación promedio. Excluir grabaciones que contengan menos de 250 s de datos utilizables tras el preprocesamiento y la eliminación de artefactos.
  5. Generar características de EEG alineadas con el atlas.
    1. Construir un modelo individualizado de cabeza de Método de Elementos de Contorno (BEM) de tres capas a partir de la resonancia magnética estructural de cada participante. Definir el espacio fuente sobre la superficie cortical individual de cada participante. Registrar las posiciones de los electrodos de EEG a la superficie BEM y calcular la matriz de campo guía.
    2. Aplicar un operador inverso regularizado utilizando la matriz de covarianza del ruido de referencia. Establecer la relación señal-ruido en 3,0, obteniendo λ2 = 1/SNR2 = 1/9 (aproximadamente 0,1111), y realizar la localización de fuentes utilizando tomografía electromagnética de baja resolución estandarizada (sLORETA) implementada en MNE-Python (versión 1.9).
    3. Agrupar las estimaciones de fuentes por vértice dentro de cada parcela Desikan-Killiany mediante promedio aritmético para obtener 68 series temporales a nivel de ROI. Mantener el primer segmento continuo de 250 s y dividir cada serie temporal de ROI en 250 épocas consecutivas y no superpuestas de 1 s.
    4. Calcular la potencia en la banda alfa de 8–12 Hz dentro de cada época para obtener una matriz de características nodo-EEG de 68 × 250, donde 68 denota las regiones corticales DK y 250 denota las 250 épocas consecutivas y no superpuestas de 1 s.
  6. Construir el grafo de EEG y verificar el alineamiento cruzado de modalidades.
    1. Calcular las correlaciones de Pearson entre las series temporales de potencia alfa de 8–12 Hz de 250 épocas de las 68 regiones DK. Almacenar la matriz resultante de 68 × 68 como el grafo de EEG.
    2. Confirmar que las matrices de EEG y fMRI utilicen el mismo orden de regiones DK y empleen el mismo archivo de índices de regiones DK para entrada del modelo, atribución y visualización. Ejecutar el script de localización de fuentes y extracción de características de MNE-Python de la siguiente manera: python "Extract features - templates.py" (Archivo Suplementario 5).
  7. Normalizar las características de los nodos dentro de cada muestra.
    1. Aplicar normalización z-score por nodo a las matrices de características nodo-EEG y nodo-fMRI. Mantener las matrices de grafos como entradas de conectividad y aplicar la normalización del grafo dentro del modelo BrainMoE.
    2. Realizar el preprocesamiento de EEG y fMRI de forma independiente para cada participante utilizando configuraciones fijas, sin utilizar información de los pliegues de validación cruzada para determinar los parámetros de preprocesamiento.

3. Construir tareas de clasificación binaria específicas para la enfermedad

  1. Defina cinco tareas de clasificación binaria específicas para cada enfermedad.
    1. Codifique los controles sanos (CS) como clase 0 en todas las tareas, y codifique únicamente el grupo de enfermedad seleccionado como clase 1 dentro de su propia tarea.
    2. Construya tareas separadas de sano versus enfermedad para depresión, trastorno de ansiedad, trastorno del neurodesarrollo con trastorno específico del aprendizaje e impedimento en la lectura, trastorno del espectro autista y trastorno por déficit de atención con hiperactividad.
  2. Caracterice las cohortes del estudio y examine posibles efectos del sexo y del sitio de adquisición.
    1. Para cada tarea específica de enfermedad, incluya participantes del HBN con datos completos de EEG, fMRI y resonancia magnética estructural (RMN estructural) y una etiqueta diagnóstica válida. Excluya participantes con diagnósticos comórbidos de las cohortes positivas para la enfermedad. Excluya grabaciones de EEG que contengan menos de 250 s de datos utilizables tras el preprocesamiento y la eliminación de artefactos, y conserve únicamente los archivos de entrada que cumplan con los criterios de control de calidad descritos en la sección 1.2.
    2. Resuma los números de registros multimodales conservados y participantes únicos, las proporciones entre enfermedad y control, los rangos de edad, las distribuciones por sexo y las distribuciones por sitio de adquisición para la cohorte compartida de CS y cada cohorte de enfermedad en Tabla 4.
      NOTA: La misma cohorte de CS se reutilizó como clase 0 en las cinco tareas, por lo que las estimaciones de rendimiento a nivel de tarea no son estadísticamente independientes. Esta dependencia surge de la cohorte de CS compartida y no del solapamiento entre los grupos de enfermedad.
    3. Estratifique el rendimiento por sexo y por sitio de adquisición y compare los valores resultantes mediante pruebas t de Welch bilaterales a través de las repeticiones de validación cruzada de 5 pliegues.
  3. Seleccione archivos H5 específicos para cada tarea y defina divisiones de validación cruzada.
    1. Para cada tarea, conserve únicamente los CS y el grupo de enfermedad objetivo. Genere 10 repeticiones de validación cruzada de 5 pliegues a nivel de participante. Estratefique los participantes únicos según la etiqueta de clase binaria, CS frente al grupo de enfermedad objetivo, para preservar la distribución de clases a través de los pliegues.
    2. Utilice el identificador único del participante como variable de agrupamiento y asigne todas las sesiones y registros multimodales del mismo participante al mismo pliegue. Utilice semillas aleatorias del 1 al 10, respectivamente, para generar las 10 particiones repetidas de validación cruzada. Utilice una semilla aleatoria fija de 1 para la inicialización y entrenamiento del modelo.
    3. Reserve el pliegue retenido exclusivamente para la evaluación final y guarde los identificadores de participantes, listas de archivos e índices de partición para cada pliegue junto con el punto de control correspondiente. Para cada pliegue de entrenamiento, calcule los pesos de clase a partir de las etiquetas de entrenamiento y utilícelos en la función de pérdida de entropía cruzada para reducir el sesgo causado por el desequilibrio de clases.

4. Construir la arquitectura BrainMoE para el diagnóstico asistido por computadora de trastornos cerebrales

NOTA: La arquitectura BrainMoE fue diseñada como un marco compacto de fusión de EEG-fMRI con modalidad faltante que combina un codificador de grafos, enrutamiento blando de estados neuronales compartidos y una integración de características basada en expertos para el diagnóstico binario específico de enfermedades. La arquitectura general se muestra en la Figura 1, y el código de implementación se proporciona en el Archivo Suplementario 6.

  1. Definir las entradas de BrainMoE y los estados de modalidad. Utilice la modalidad EEG y la modalidad fMRI tras la alineación en el espacio fuente como entradas gráficas apareadas. Aquí, X denota una matriz de características regionales, A denota un grafo cerebral específico de la modalidad, y cada fila corresponde a una de las 68 regiones de Desikan-Killiany.
    figure-protocol-1
    figure-protocol-2
    Defina la máscara de disponibilidad de la modalidad como m = [mEEG, mfMRI]. Utilice m = [1,1] para entrada completa de EEG-fMRI, m = [1,0] para entrada de EEG únicamente y m = [0,1] para entrada de fMRI únicamente.
  2. Codificador de grafos: Para cada modalidad q, donde q es EEG o fMRI, pase la matriz de características Xq y gráfico Aq en su Codificador de Gráfica específico para cada modalidad. El codificador es un módulo neuronal entrenable que incluye proyección de nodos, paso de mensajes en grafos, normalización, activación y dropout (p=0.3).
    figure-protocol-3
    NOTA: En esta notación, Zq es la representación latente a nivel de ROI producida por el Codificador de Grafos de EEG o el Codificador de Grafos de fMRI. El Codificador de Grafos de EEG transforma cada matriz de entrada de 68 x 250 en una representación latente de 68 x 128, mientras que el Codificador de Grafos de fMRI transforma cada matriz de entrada de 68 x 370 en una representación latente de 68 x 128. Cada codificador utiliza una proyección de entrada seguida de dos capas residuales de convolución gráfica con 128 dimensiones ocultas, activación GELU, normalización de capa y dropout.
  3. Tokens entrenables para modalidades faltantes: Sea Tq sea el token para la modalidad q y mq será el indicador de disponibilidad correspondiente. Este paso produce una representación sensible al estado que conserva la misma disposición de 68 regiones bajo entradas completas y de modalidad única.
    figure-protocol-4
    NOTA: Cada token entrenable de modalidad ausente es un vector de 128 dimensiones y se expande a lo largo de las 68 filas de ROI cuando la modalidad correspondiente no está disponible.
  4. Módulo de enrutamiento suave de estado neural compartido: Primero, combine la representación del EEG sensible al estado ZEEG, la representación de fMRI con conocimiento del estado ZfMRI, y la Máscara de Disponibilidad de Modalidad integrada. La Máscara de Disponibilidad de Modalidad se integra mediante un MLP con dimensiones 2 → 128, activación GELU y normalización de capa. El Router consta de dos capas convolucionales unidimensionales con dimensiones de canal 384 → 128 → 128, tamaño de kernel 3 y relleno 1. Se aplica la activación GELU después de cada convolución, con abandono aleatorio (p=0,3) después de la primera convolución.
    figure-protocol-5
    figure-protocol-6
  5. Experto en estados neuronales compartidos.
    1. Concatenar la representación EEG con conocimiento del estado ZEEG, la representación de fMRI sensible al estado ZfMRI, y la representación de enrutamiento suave R a lo largo de la dimensión de características. Aplicar una capa de fusión completamente conectada (de 384 a 128), seguida de normalización de capa, activación GELU y dropout (p=0.3), y realizar un promedio de agrupamiento (mean-pooling) de la representación resultante a través de las 68 ROI para obtener la representación fusionada a nivel de sujeto de 128 dimensiones zfusionado:
      figure-protocol-7
    2. Paso zfusionado a través del experto de estado neuronal compartido, que consiste en una capa completamente conectada (128 a 128), normalización de capa, activación GELU y dropout (p=0.3). Denotar la representación del experto compartido resultante de 128 dimensiones por Ecompartido:
      figure-protocol-8
  6. Expertos en EEG y fMRI
    1. Para cada modalidad, realizar un promedio espacial de la representación con conocimiento del estado a través de las 68 ROI y pasar la representación resultante de 128 dimensiones a través del Experto específico de la modalidad correspondiente:
      figure-protocol-9
    2. Cada Experto específico por modalidad consiste en una capa completamente conectada (128 a 128), normalización por capas, activación GELU y abandono aleatorio (p=0,3). Denotar las representaciones resultantes específicas por modalidad de 128 dimensiones mediante EEEG y EfMRI, respectivamente.
  7. Módulo de fusión.
    1. Para calcular los pesos de los expertos, concatene la representación combinada a nivel de sujeto de 128 dimensiones zfusionado con la máscara de disponibilidad de modalidades bidimensional m, obteniendo así una entrada de 130 dimensiones para la compuerta. El módulo de fusión contiene una compuerta de expertos que genera los pesos específicos de la muestra utilizados para la fusión de expertos. La compuerta de expertos consiste en una capa completamente conectada (de 130 a 128), seguida de una activación GELU y una capa de dropout (p = 0,3) y una capa de salida completamente conectada (128 a 3). Aplicar softmax a los tres logits de salida para obtener los pesos de expertos específicos de la muestra:figure-protocol-10
    2. Los pesos resultantes son no negativos y suman 1 para cada muestra:
      figure-protocol-11
    3. Multiplique cada representación de experto de 128 dimensiones por su peso correspondiente de la puerta (Gate) y sume las tres representaciones ponderadas:
      figure-protocol-12
      NOTA: Esta operación implementa la fusión densa suave de MoE.
    4. Pasar la representación final del experto de 128 dimensiones resultante efusionado a la clasificación de diagnóstico de trastornos cerebrales descrita en la sección 4.8.
  8. Clasificación del diagnóstico de trastorno cerebral: Pase la representación final del experto de 128 dimensiones a través de una cabeza de clasificación compuesta por normalización de capa, dropout (p = 0,3) y una capa completamente conectada que transforma 128 dimensiones en 2 logits de salida. Aplicar softmax para obtener la probabilidad de HC y la probabilidad de la enfermedad objetivo. Asignar la muestra a la clase de enfermedad cuando la probabilidad de la enfermedad objetivo sea al menos 0,5.
    figure-protocol-13
  9. Verifique la consistencia de la implementación antes del entrenamiento. Realice una pasada hacia adelante simulada con m = [1,1], m = [1,0] y m = [0,1]. Confirme que las representaciones de EEG, fMRI, consciente del estado, de enrutamiento y fusionada mantengan 68 filas de ROI a menos que se agrupen explícitamente, y verifique que los pesos de los expertos sumen 1 en el orden: Experto en EEG, Experto en fMRI y Experto compartido del estado neural.

5. Entrenar los cinco modelos BrainMoE para el diagnóstico de trastornos cerebrales

  1. Entrene un modelo BrainMoE para cada tarea binaria específica de la enfermedad.
    1. Utilice la misma arquitectura y los mismos hiperparámetros predeterminados para todas las tareas: 30 épocas, tamaño de lote 16, tasa de aprendizaje 0.001, decaimiento del peso 0.0001. Fije la arquitectura del modelo y los hiperparámetros antes de la evaluación del conjunto de prueba, y manténgalos sin cambios en todos los pliegues, repeticiones y tareas específicas de la enfermedad.
    2. No utilice el desempeño en el conjunto de prueba reservado para la selección del modelo ni para el ajuste de hiperparámetros. Para cada mini-lote, realice tres pases hacia adelante utilizando las máscaras completa, solo EEG y solo fMRI con pesos del modelo compartidos. Ejecute el entrenamiento de BrainMoE como sigue: python train.py --config configs/brain_moe.json --task <TASK> --data_dir <H5_DIR> (Archivo Suplementario 6). Establezca <TASK> como depression, anxiety, reading_disorder, autism, o adhd.
  2. Optimice la pérdida promedio de clasificación de tres estados. Calcule la pérdida de entropía cruzada ponderada por clase Ls para cada estado como
    figure-protocol-14
    y promedie las pérdidas como
    figure-protocol-15
  3. Reinicie los gradientes, realice la retropropagación y actualice todos los parámetros entrenables con AdamW.

6. Evaluar los estados de inferencia completos y con modalidades faltantes

  1. Método de evaluación: Cargue el punto de control para la tarea de enfermedad seleccionada y utilice la lista de archivos de prueba guardada del mismo punto de control. Use m = [1,1] para inferencia completa de EEG-fMRI, m = [1,0] para inferencia solo de EEG y m = [0,1] para inferencia solo de fMRI. Finalmente, aplique softmax para obtener la probabilidad de la enfermedad objetivo y asigne la clase de enfermedad cuando la probabilidad sea al menos 0,5.
  2. Métricas de evaluación: Calcule las métricas de evaluación a partir de la matriz de confusión, donde TP denota muestras positivas para la enfermedad clasificadas correctamente como enfermedad, TN denota controles sanos (HC) clasificados correctamente como sanos, FP denota controles sanos clasificados incorrectamente como enfermedad y FN denota muestras positivas para la enfermedad clasificadas incorrectamente como sanas.
    figure-protocol-16
    figure-protocol-17
    figure-protocol-18
    figure-protocol-19
    figure-protocol-20
  3. Utilice la exactitud para informar la tasa general de clasificación correcta. Utilice la sensibilidad para cuantificar la detección de casos positivos para la enfermedad y la especificidad para cuantificar la identificación de controles sanos.
  4. Utilice el puntaje F1 para resumir el equilibrio entre precisión y sensibilidad. Utilice la exactitud balanceada para reducir la influencia del desequilibrio entre clases. Además, calcule el AUC para evaluar la discriminación independiente del umbral a través de diferentes umbrales de decisión.
  5. Para cada repetición, promedie cada métrica de desempeño a través de las cinco particiones excluidas. Reporte los resultados finales como la media y la desviación estándar de las medias a nivel de las 10 repeticiones.
  6. Compare BrainMoE con los métodos de referencia. Todos los métodos de referencia utilizaron las mismas particiones a nivel de participante y las mismas entradas completas de EEG-fMRI que BrainMoE, con configuraciones fijadas antes de la evaluación con datos excluidos. BrainMoE se comparó con cada método de referencia mediante pruebas t pareadas bilaterales con ajuste de Holm.

7. Realizar la atribución por oclusión de nodos a nivel de grupo en cinco trastornos cerebrales

  1. Defina la cohorte de atribución. Cargue el punto de control entrenado de BrainMoE y el archivo con los nombres de las regiones DK. Seleccione muestras de prueba positivas para la enfermedad que se clasifican correctamente bajo el estado completo de EEG-fMRI con m = [1,1]. Utilice esta cohorte para el análisis de atribución a nivel grupal y guarde la probabilidad basal de enfermedad objetivo de cada muestra.
  2. Calcule las puntuaciones específicas por modalidad para la oclusión de nodos. Para la atribución derivada del EEG, ocluya una región de interés (ROI) del EEG a la vez, estableciendo el vector de características del nodo del EEG seleccionado y la fila y columna correspondientes de la gráfica del EEG en cero, manteniendo sin cambios la entrada de fMRI. Para la atribución derivada de fMRI, aplique la misma operación a la matriz de características del nodo de fMRI y a la gráfica de fMRI, manteniendo sin cambios la entrada de EEG. Repita este procedimiento en las 68 regiones DK. Ejecute el análisis de atribución por oclusión de nodos utilizando el código proporcionado en Archivo Suplementario 7.
  3. Calcule y visualice las contribuciones de las ROI a nivel grupal. Para cada ROI y cada modalidad, calcule la puntuación de contribución como la disminución media en la probabilidad de enfermedad objetivo tras la oclusión en todas las muestras seleccionadas. Ordene por separado las puntuaciones derivadas del EEG y las derivadas de fMRI, exporte las 10 ROI principales para cada modalidad y etiquete en la figura la ROI con mayor puntuación.

Resultados

Rendimiento de BrainMoE en distintos trastornos y estados de modalidad
El protocolo generó cinco clasificadores específicos de enfermedad BrainMoE para sano frente a enfermedad y produjo tablas de predicción para los estados de inferencia completo EEG-fMRI, solo EEG y solo fMRI. El estado completo EEG-fMRI produjo una discriminación consistentemente alta en las cinco tareas, con valores de AUC que oscilaron desde 84,4 ± 3,2 % para RI hasta 88,4 ± 3,8 % para TEA (Tabla 1). El rendimiento macro-promediado en estado completo a través de las cinco tareas alcanzó un AUC de 86,9 ± 3,0 %, una exactitud de 81,4 ± 3,1 %, una exactitud equilibrada de 81,4 ± 2,5 % y una puntuación F1 de 81,2 ± 3,0 %.

Bajo condiciones simuladas de modalidad ausente, BrainMoE mantuvo un rendimiento utilizable cuando se enmascaraba una modalidad de entrada. En el estado solo con EEG, el modelo alcanzó un AUC promediado macro del 83,1 ± 3,7 %, observándose el AUC más alto en condiciones solo con EEG para el TDAH, con un valor del 87,9 ± 2,8 %. En el estado solo con fMRI, el AUC promediado macro fue del 80,0 ± 3,9 %. Estos rangos de rendimiento y la ventaja esperada en el rendimiento en estado completo sirven como puntos de referencia prácticos para una implementación exitosa, lo que indica que el marco entrenado de BrainMoE puede realizar inferencias completas, solo con EEG y solo con fMRI, sin necesidad de modelos separados para cada modalidad.

Un resultado subóptimo representativo es la incapacidad de reproducir la ventaja esperada del estado completo, por ejemplo, cuando el AUC completo de EEG-fMRI es menor que el AUC de solo EEG o de solo fMRI. En contraste, una implementación exitosa debería reproducir la ventaja del estado completo y los rangos de rendimiento de referencia reportados en la Tabla 1. Cuando se observa un patrón subóptimo, verifique las dimensiones de entrada H5, el orden de las regiones DK, la asignación de la máscara de disponibilidad de modalidad y las particiones guardadas de validación cruzada antes de interpretar la salida del modelo.

Comparación de referencia
El modelo BrainMoE propuesto se comparó con métodos clásicos de aprendizaje automático (máquina de vectores de soporte (SVM) y perceptrón multicapa (MLP)), métodos generales de aprendizaje profundo (Transformer7, 3D-CNN22 y ResNet6), métodos avanzados de aprendizaje profundo (BrainNetCNN8, BNT10, BrainGNN9, MultiEpilepsyNet11, SZAtt-Net12) y métodos de aprendizaje profundo basados en MoE (dFCExpert17, EvoMoE18 y NeuroMoE++19) (Tabla 2). BrainMoE alcanzó el AUC medio más alto entre todos los métodos comparados, con un valor de 86,9 ± 3,0 %.

Los métodos clásicos de aprendizaje automático mostraron un rendimiento medio más bajo, con una AUC media del 66,7 ± 4,5 % para SVM y del 64,6 ± 6,3 % para MLP. Los métodos generales de aprendizaje profundo mostraron un rendimiento variable, con una AUC media del 71,0 ± 3,3 % para ResNet y del 63,8 ± 4,7 % para Transformer. Entre las líneas base avanzadas de aprendizaje profundo, BNT, BrainGNN, MultiEpilepsyNet y SZAtt-Net superaron a la mayoría de los métodos clásicos y generales de aprendizaje profundo, aunque sus AUC medias siguieron siendo inferiores a las de BrainMoE.

Para proporcionar respaldo estadístico a la comparación de referencia, BrainMoE se comparó con el modelo de referencia más fuerte para cada métrica de rendimiento (Tabla 3). BrainMoE superó a NeuroMoE++ en AUC y precisión equilibrada (BA) y superó a SZAtt-Net en puntuación F1 y precisión. Todas las comparaciones siguieron siendo significativas tras el ajuste de Holm.

Análisis por subgrupos según el sexo y el sitio de adquisición
Las características específicas de la cohorte según la tarea, incluidos los números de registros multimodales retenidos, las proporciones entre enfermedad y control, los conteos únicos de participantes, resúmenes de edad, distribuciones por sexo y distribuciones por sitio de adquisición, se resumen en la tabla de características de la cohorte (Table 4). Las proporciones entre enfermedad y control se calculan a partir del número de registros multimodales, mientras que las características demográficas y por sitio de adquisición se resumen a nivel de participante único.

Para evaluar los posibles efectos del sexo y del sitio de adquisición, el rendimiento de BrainMoE se estratificó según estos factores (Tabla 5). El subgrupo masculino mostró una AUC media, BA, puntuación F1 y precisión más altas que el subgrupo femenino, mientras que los valores p de Welch no ajustados correspondientes oscilaron entre 0,089 y 0,321. De manera similar, el subgrupo RUBIC mostró un rendimiento medio más alto que el subgrupo de Staten Island, con valores p entre 0,055 y 0,309. No se detectó ninguna diferencia entre subgrupos estadísticamente significativa en estos análisis.

Análisis de ablación de los componentes de BrainMoE
Se realizaron experimentos de ablación para evaluar la contribución de la máscara de disponibilidad de modalidad, el enrutador convolucional, el experto compartido y el diseño de fusión de expertos en MoE (Tabla 6). La eliminación del incrustado de la máscara redujo el AUC medio a 79,2 ± 3,1 %, y reemplazar el enrutador convolucional por un enrutador MLP lo redujo a 79,3 ± 3,7 %. La eliminación del experto compartido redujo el AUC solo de fMRI a 73,5 ± 3,3 %, el más bajo entre las variantes probadas. Eliminar todos los expertos MoE también redujo la precisión equilibrada general a 74,2 ± 3,0 %. Estos resultados de ablación mostraron que el diseño completo de BrainMoE logró el mejor rendimiento general en estados con modalidades completas y con modalidades faltantes, mientras que el incrustado de la máscara, el enrutador convolucional, el experto compartido y la fusión de expertos MoE contribuyeron cada uno al comportamiento final del modelo.

Resultados de interpretabilidad a nivel de ROI para cinco trastornos cerebrales
Para examinar las contribuciones regionales subyacentes a las predicciones de BrainMoE, se realizó una atribución por oclusión de nodos en muestras correctamente clasificadas como positivas para la enfermedad en el estado completo de EEG-fMRI. Las contribuciones de ROI derivadas de EEG y de fMRI se clasificaron por separado midiendo la disminución en la probabilidad de la enfermedad objetivo tras ocluir cada región del atlas DK. El análisis identificó patrones de contribución específicos de cada modalidad en las cinco tareas de enfermedad (Figura 2). En la atribución derivada de fMRI, las regiones mejor clasificadas fueron el cíngulo posterior izquierdo en el TDE, la corteza pericalcarina derecha en ANX, la corteza parahipocampal izquierda en RI, el pars triangularis derecho en TEA y la corteza entorrinal izquierda en TDAH. En la atribución derivada de EEG, las regiones mejor clasificadas fueron los bancos izquierdos del surco temporal superior en el TDE, la corteza precentral izquierda en ANX, el cuneus izquierdo en RI, la corteza lingual izquierda en TEA y la ínsula derecha en TDAH. Las ROI derivadas de EEG y fMRI con mayor clasificación para cada trastorno se visualizan en superficies corticales en la Figura 3. Estos resultados mostraron que BrainMoE proporcionó interpretabilidad a nivel de ROI al tiempo que conservaba perfiles de atribución separados para representaciones derivadas de EEG y de fMRI. Para las muestras correctamente clasificadas como positivas para la enfermedad, se evaluó la estabilidad cruzada mediante la frecuencia del ROI número uno en 50 divisiones excluidas (Tabla 7). Las frecuencias observadas oscilaron entre el 36 % y el 68 %, superando el valor teórico de referencia del azar de 1/68 (1,47 %) y respaldando la interpretación basada en clasificaciones relativas en lugar de magnitudes absolutas de contribución. Las comparaciones con hallazgos previos de neuroimagen se realizaron a posteriori y se utilizaron únicamente para contextualizar los resultados de atribución, no como validación independiente.

figure-results-1
Figura 1: Vista general del marco BrainMoE con fusión adaptativa de EEG-fMRI para el diagnóstico asistido por computadora de trastornos cerebrales. Las características de las regiones de interés (ROI) de EEG y fMRI alineadas con la fuente son procesadas por codificadores de grafos separados. Las representaciones resultantes se envían a los expertos en EEG y fMRI y, junto con la máscara de disponibilidad de modalidad, al módulo compartido de enrutamiento suave. Las representaciones de modalidad y la representación de enrutamiento se fusionan y procesan mediante el experto compartido en estado neural. Las tres salidas de los expertos se combinan luego en el módulo de fusión y se envían a la cabecera de clasificación de diagnóstico para producir las probabilidades de salud mental (HC) y de la enfermedad objetivo. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-2
Figura 2: Análisis de la contribución de la ROI basado en la oclusión de nodos. Se visualizaron las 10 principales contribuciones de ROI derivadas de EEG y de fMRI para cada tarea de enfermedad en el estado completo de inferencia EEG-fMRI. Los paneles (A–E) muestran los resultados derivados de fMRI para el TDM, ANX, RI, TEA y TDAH, respectivamente, y los paneles (F–J) muestran los resultados correspondientes derivados de EEG en el mismo orden. Solo se etiquetó la ROI con el rango más alto en cada gráfico. La contribución de la ROI se definió como la disminución en la probabilidad de la enfermedad objetivo tras ocluir la región correspondiente del atlas DK. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-3
Figura 3: Mapas de interpretabilidad a nivel cortical de ROI en cinco trastornos cerebrales. Los paneles (A–E) muestran respectivamente el TDE, ANX, RI, TEA y TDAH. Cada panel muestra el ROI derivado de EEG mejor clasificado en rojo y el ROI derivado de fMRI mejor clasificado en naranja sobre la superficie cortical de DK. Los colores indican la modalidad y no la magnitud de la contribución; por lo tanto, no se aplica ninguna escala cromática cuantitativa. Los prefijos lh y rh indican los hemisferios izquierdo y derecho, respectivamente. Haga clic aquí para ver una versión más grande de esta figura.

Tarea de enfermedadEstadoAUCPrecisiónBAF1SensibilidadEspecificidad
MDDCompleto88.0 ± 3.2%84.8 ± 3.7%82.0 ± 2.3%76.2 ± 4.1%72.7 ± 3.0%91.3 ± 4.7%
MDDsolo EEG83.4 ± 3.4%81.8 ± 4.5%77.9 ± 3.0%73.7 ± 3.9%68.2 ± 2.8%87.6 ± 4.2%
MDDsolo fMRI82.1 ± 3.3%78.5 ± 4.7%74.0 ± 4.1%71.8 ± 4.9%66.6 ± 3.5%81.3 ± 5.6%
ANXCompleto85.5 ± 2.5%76.1 ± 2.4%78.2 ± 2.0%79.4 ± 3.3%78.1 ± 3.6%78.2 ± 3.1%
ANXsolo EEG81.7 ± 3.9%73.2 ± 3.2%75.6 ± 3.1%78.1 ± 3.9%76.6 ± 3.8%74.6 ± 4.0%
ANXsolo fMRI74.8 ± 4.1%74.4 ± 3.7%72.8 ± 3.6%76.4 ± 4.2%72.6 ± 3.9%73.0 ± 4.4%
RICompleto84.4 ± 3.2%76.5 ± 3.0%77.3 ± 2.9%76.7 ± 2.8%77.9 ± 3.1%76.7 ± 3.3%
RIsolo EEG80.2 ± 4.0%71.5 ± 4.4%73.4 ± 3.5%73.0 ± 3.4%73.8 ± 3.9%72.9 ± 3.3%
RIsolo fMRI81.3 ± 4.5%71.1 ± 3.9%67.9 ± 3.7%68.5 ± 3.2%69.4 ± 4.5%66.3 ± 4.2%
ASDCompleto88.4 ± 3.8%79.5 ± 3.5%81.4 ± 3.0%81.0 ± 2.8%83.4 ± 2.9%79.4 ± 3.0%
ASDsolo EEG82.5 ± 4.3%77.3 ± 4.1%78.2 ± 3.7%78.6 ± 3.5%79.3 ± 3.4%77.1 ± 4.1%
ASDsolo fMRI81.3 ± 4.4%73.8 ± 3.7%74.4 ± 3.4%75.0 ± 3.2%76.1 ± 4.2%72.6 ± 4.5%
ADHDCompleto88.2 ± 2.2%90.3 ± 2.7%88.4 ± 2.5%92.8 ± 1.9%87.0 ± 2.4%89.7 ± 2.5%
ADHDsolo EEG87.9 ± 2.8%88.1 ± 2.6%86.4 ± 3.1%90.2 ± 3.4%85.1 ± 3.1%87.7 ± 3.0%
ADHDsolo fMRI80.5 ± 3.2%85.7 ± 3.0%84.7 ± 3.5%87.9 ± 4.1%83.2 ± 3.6%86.2 ± 3.4%

Tabla 1: Rendimiento de la clasificación BrainMoE en tareas de enfermedad y estados de disponibilidad de modalidades. Rendimiento de BrainMoE en cinco tareas de clasificación sano frente a enfermedad bajo condiciones de inferencia con EEG-fMRI completos, solo EEG y solo fMRI. Las métricas se reportan como media ± desviación estándar e incluyen el área bajo la curva de característica de operación del receptor (AUC), exactitud, exactitud balanceada (BA), puntuación F1, sensibilidad y especificidad.

MétodoGrupo de métodoAUC promedioBA promedioF1 promedioPrecisión promedio
SVMML clásica66.7 ± 4.5%70.6 ± 3.4%61.7 ± 5.8%70.7 ± 4.6%
MLPML clásica64.6 ± 6.3%63.5 ± 8.2%64.5 ± 6.1%64.2 ± 6.2%
TransformerDL genérica63.8 ± 4.7%64.4 ± 4.8%65.2 ± 5.1%66.1 ± 4.9%
3D-CNNDL genérica65.3 ± 4.3%65.2 ± 4.0%64.8 ± 4.5%60.0 ± 4.2%
ResNetDL genérica71.0 ± 3.3%70.2 ± 3.6%67.5 ± 3.8%69.3 ± 3.0%
BrainNetCNNDL avanzada70.2 ± 3.6%70.9 ± 3.1%69.2 ± 3.6%71.2 ± 3.1%
BNTDL avanzada73.6 ± 3.1%76.4 ± 2.7%74.7 ± 2.3%76.6 ± 2.6%
BrainGNNDL avanzada72.4 ± 2.8%72.7 ± 2.3%71.0 ± 3.4%72.3 ± 2.5%
MultiEpilepsyNetDL avanzada78.3 ± 3.7%75.2 ± 3.5%76.5 ± 3.6%77.2 ± 3.3%
SZAtt-NetDL avanzada78.7 ± 3.2%76.1 ± 3.8%77.4 ± 3.9%78.1 ± 3.4%
dFCExpertDL basada en MoE80.1 ± 3.2%77.3 ± 2.9%76.7 ± 3.1%77.6 ± 2.9%
EvoMoEDL basada en MoE79.6 ± 3.6%76.2 ± 3.1%76.2 ± 3.3%76.5 ± 3.2%
NeuroMoE++DL basada en MoE81.5 ± 2.8%77.9 ± 2.7%77.1 ± 3.4%78.0 ± 2.7%
BrainMoE (nuestro)DL basada en MoE86.9 ± 3.0%81.4 ± 2.5%81.2 ± 3.0%81.4 ± 3.1%

Tabla 2: Rendimiento medio de clasificación de BrainMoE en comparación con métodos clásicos de aprendizaje automático, modelos genéricos de aprendizaje profundo y arquitecturas avanzadas de aprendizaje profundo para neuroimágenes. Los resultados se agrupan según las tareas de clasificación de enfermedades evaluadas y se presentan como media ± desviación estándar para el AUC, BA, puntuación F1 y exactitud.

ComparaciónAUC mediaBA mediaF1 mediaExactitud media
Línea base más fuerteNeuroMoE++NeuroMoE++SZAtt-NetSZAtt-Net
Rendimiento de la línea base más fuerte81,5 ± 2,8%77,9 ± 2,7%77,4 ± 3,9%78,1 ± 3,4%
BrainMoE86,9 ± 3,0%81,4 ± 2,5%81,2 ± 3,0%81,4 ± 3,1%
Diferencia+5,4+3,5+3,8+3,3
p del test t0,00060,00650,01870,0276
p ajustada por Holm*p < 0,01p < 0,05p < 0,05p < 0,05
dz de Cohen1,631,110,910,83

Tabla 3: Comparación de BrainMoE con la mejor línea base para cada métrica de rendimiento. Los valores p se calcularon mediante pruebas t pareadas bilaterales y se ajustaron utilizando el procedimiento de Holm. El dz de Cohen indica la diferencia pareada estandarizada.

CohorteRegistros multimodales (n)Relación enfermedad-controlParticipantes únicos (n)Rango de edad (años)Sexo (Masculino/Femenino)Sitio de adquisición (Staten Island/RUBIC)
HC115--755.02–21.9035/4026/49
MDD520.45:1338.36–19.7314/1915/18
ANX1561.36:1985.53–21.0046/5245/53
RI1411.23:1855.75–19.6647/3839/46
ASD820.71:1515.66–19.7945/627/24
ADHD5554.83:13385.04–21.72241/97136/202

Tabla 4: Características de las cohortes de estudio utilizadas en las cinco tareas de clasificación específicas de enfermedades. La tabla informa el número de registros multimodales retenidos, las proporciones entre enfermedad y control, los recuentos de participantes únicos, las características demográficas y las distribuciones por sitio de adquisición.

SubgrupoNúmeroAUC mediaBA mediaF1 mediaPrecisión media
Sexo
Hombre70587.2 ± 3.783.4 ± 3.282.1 ± 3.582.5 ± 3.8
Mujer39685.6 ± 3.381.2 ± 4.079.7 ± 3.879.6 ± 3.4
Diferencia+1.6+2.2+2.4+2.9
p de Welch--0.3210.1920.1590.089
Sitio de adquisición
RUBIC67487.6 ± 4.083.3 ± 3.182.3 ± 3.783.4 ± 3.5
Staten Island42785.2 ± 3.681.7 ± 3.779.4 ± 3.480.1 ± 3.7
Diferencia+2.4+1.6+2.9+3.3
p de Welch--0.1760.3090.0850.055

Tabla 5: Rendimiento de BrainMoE estratificado por sexo y sitio de adquisición. Los resultados se presentan como media ± desviación estándar a lo largo de 10 repeticiones de una validación cruzada de 5 pliegues. La diferencia representa el primer subgrupo menos el segundo, y los valores P se obtuvieron utilizando pruebas t de Welch bilaterales.

VarianteAUC completaAUC solo EEGAUC solo fMRIAUC mediaBA media
sin incrustación de máscara83.2 ± 2.9%79.5 ± 3.9%76.4 ± 3.7%79.2 ± 3.1%76.1 ± 3.4%
sin enrutador Conv84.6 ± 3.6%80.7 ± 3.5%78.2 ± 4.2%81.6 ± 3.3%75.7 ± 3.1%
Enrutador MLP82.8 ± 2.7%80.1 ± 4.1%76.6 ± 4.4%79.3 ± 3.7%74.1 ± 3.8%
sin experto compartido83.3 ± 3.6%80.8 ± 4.0%73.5 ± 3.3%80.1 ± 3.6%75.5 ± 3.2%
sin expertos MoE81.9 ± 3.3%78.7 ± 3.6%78.0 ± 3.8%80.8 ± 4.1%74.2 ± 3.0%
BrainMoE (nuestro)86.9 ± 3.0%83.1 ± 3.7%80.0 ± 3.9%86.9 ± 3.0%81.4 ± 2.5%

Tabla 6: Análisis de ablación de componentes clave de BrainMoE. Resultados de ablación que muestran la contribución de la máscara de disponibilidad de modalidad, el enrutador convolucional, el experto compartido y el diseño de fusión de expertos mediante MoE. Cada variante se evalúa bajo condiciones de inferencia completas de EEG-fMRI, solo EEG y solo fMRI, con el AUC medio y el BA medio que resumen el rendimiento general.

EnfermedadEEG: ROI con mayor puntuaciónEEG: Frecuencia Top-1, n/N (%)fMRI: ROI con mayor puntuaciónfMRI: Frecuencia Top-1, n/N (%)Referencia aleatoria (%)
MDDbancos izquierdos del surco temporal superior22/50 (44%)cíngulo posterior izquierdo25/50 (50%)1.47
ANXcorteza precentral izquierda18/50 (36%)corteza pericalcarina derecha21/50 (42%)1.47
RIcuneo izquierdo26/50 (52%)corteza parahipocampal izquierda29/50 (58%)1.47
TEAcorteza lingual izquierda27/50 (54%)pars triangularis derecha28/50 (56%)1.47
TDAHínsula derecha31/50 (62%)corteza entorrinal izquierda34/50 (68%)1.47

Tabla 7: Estabilidad cruzada de los ROI derivados de EEG y fMRI mejor clasificados. La frecuencia del primero denota el número y porcentaje de análisis a nivel de 50 pliegues en los que el ROI informado ocupó el primer lugar. La referencia teórica de selección aleatoria fue 1/68 (1,47 %).

Archivo complementario 1: Script de verificación de entrada H5. Script de Python para verificar las claves requeridas del archivo de entrada H5, los tipos de datos, las etiquetas diagnósticas y las dimensiones de entrada compatibles con el atlas DK antes del entrenamiento de BrainMoE. Haga clic aquí para descargar este archivo.

Archivo complementario 2: script de preprocesamiento de fMRI. Archivos de configuración y ejecución de C-PAC utilizados para el preprocesamiento de fMRI, incluyendo la eliminación de volúmenes iniciales, corrección de movimiento y distorsión, registro y normalización, regresión de factores de confusión, filtrado temporal y suavizado espacial. Haga clic aquí para descargar este archivo.

Archivo complementario 3: Scripts de procesamiento FreeSurfer. Scripts para procesar datos de resonancia magnética estructural, realizar la co-registración de la parcelación cortical Desikan-Killiany al espacio nativo de fMRI y extraer señales de fMRI a nivel de ROI. Haga clic aquí para descargar este archivo.

Archivo complementario 4: Scripts de preprocesamiento de EEG. Scripts de MATLAB/EEGLAB utilizados para el preprocesamiento de EEG, incluyendo filtrado, identificación y eliminación de componentes de artefactos, y re-referenciación. Haga clic aquí para descargar este archivo.

Archivo complementario 5: Script de localización de fuentes y extracción de características en MNE-Python. Script de Python para la localización de fuentes EEG, extracción de ROI del atlas DK y generación de características EEG a nivel de ROI utilizadas como entradas para BrainMoE. Haga clic aquí para descargar este archivo.

Código de implementación de BrainMoE, Archivo Suplementario 6. Código Python y archivos de configuración para la arquitectura BrainMoE, codificadores de grafos, manejo de estado-modalidad, enrutamiento y fusión de expertos, entrenamiento del modelo, evaluación y variantes de ablation. Haga clic aquí para descargar este archivo.

Archivo complementario 7: Código de atribución por oclusión de nodos. Código Python para el análisis de oclusión de nodos específico por modalidad, cálculo de puntuaciones de contribución de ROI, clasificación de ROI derivados de EEG y fMRI, y generación de resultados de atribución. Haga clic aquí para descargar este archivo.

Discusión

El análisis multimodal de señales cerebrales se ha convertido en una dirección importante para el diagnóstico asistido por computadora de trastornos cerebrales, ya que el EEG y la fMRI proporcionan información complementaria sobre la actividad neuronal. En la comparación de referencia, métodos clásicos de aprendizaje automático como SVM y MLP ofrecieron un rendimiento diagnóstico básico, pero tuvieron capacidad limitada para modelar interacciones jerárquicas, estructuradas en forma de grafo y entre modalidades. Modelos genéricos de aprendizaje profundo, incluyendo 3D-CNN, ResNet y Transformer, ofrecieron una mayor capacidad de modelado no lineal, pero estas arquitecturas no fueron diseñadas específicamente para la fusión EEG-fMRI ni para representaciones de redes cerebrales. Los métodos avanzados de aprendizaje profundo lograron un mejor rendimiento que la mayoría de los modelos clásicos y genéricos, pero muchos aún dependen de estrategias fijas de integración de características y no separan explícitamente la información específica de cada modalidad de la información compartida del estado neuronal.

Este estudio propuso BrainMoE para abordar este problema de fusión mediante la combinación de codificadores de modalidad basados en grafos, expertos específicos por modalidad, un experto compartido de estado neural y un mecanismo de enrutamiento adaptativo. Este diseño permitió modelar por separado las representaciones derivadas de EEG y de fMRI, y luego integrarlas mediante fusión a nivel de expertos. Al introducir máscaras de estado-modalidad y tokens de modalidad faltante, el mismo modelo entrenado también pudo realizar inferencias únicamente con EEG y únicamente con fMRI, sin necesidad de construir modelos independientes para cada condición de modalidad ausente. Los resultados experimentales mostraron que BrainMoE logró el mejor rendimiento general en las cinco tareas de clasificación binaria de enfermedades, y mantuvo un rendimiento utilizable tanto en condiciones únicamente con EEG como únicamente con fMRI. El análisis de ablación respaldó adicionalmente la contribución del incrustado de máscara, el enrutador convolucional, el experto compartido y la fusión de expertos mediante MoE. Estos hallazgos indican que el mejor rendimiento no se debió a un único componente, sino al diseño coordinado de la codificación mediante grafos, la modelización del estado-modalidad, el enrutamiento adaptativo y la fusión de expertos.

Pasos críticos del protocolo y solución de problemas
Los pasos críticos del protocolo incluyen mantener el mismo orden de las 68 regiones de DK en las matrices de nodos y grafos del EEG y del fMRI, aplicar los ajustes predefinidos de preprocesamiento de forma independiente para cada participante y aplicar una validación cruzada a nivel de participante, de modo que todos los registros del mismo participante permanezcan en un único grupo. La Máscara de Disponibilidad de Modalidad también debe corresponder a las entradas proporcionadas para cada estado de inferencia.

Si la inferencia falla o no se reproduce la ventaja esperada de rendimiento en estado completo, primero verifique las claves H5 requeridas, las dimensiones de las matrices de EEG y fMRI, el orden de las regiones DK, la asignación de la máscara de disponibilidad de modalidad y las particiones guardadas de validación cruzada. Los archivos con claves faltantes, dimensiones inválidas o ordenamiento inconsistente de regiones deben excluirse antes del entrenamiento o la evaluación. El marco puede modificarse para parcelaciones corticales alternativas o representaciones de características de EEG/fMRI, siempre que ambas modalidades se asignen a un ordenamiento consistente de ROI y se ajusten las dimensiones de entrada del modelo correspondientes. La cabecera de clasificación específica para la enfermedad también puede adaptarse a otras tareas de clasificación binaria mientras se conserva el marco de codificación gráfica y fusión de expertos. Dichas modificaciones requieren un nuevo entrenamiento y validación, en lugar de la aplicación directa de los modelos descritos aquí.

Análisis de interpretabilidad basado en la oclusión de nodos
El análisis de oclusión de nodos proporcionó además interpretabilidad a nivel de ROI para las predicciones de BrainMoE, mostrándose los ROI asociados a enfermedades mejor clasificados en la Figura 3. El ROI posterior izquierdo derivado del EEG identificado por BrainMoE es coherente con evidencia metaanalítica basada en vóxeles previa23 que informa de una actividad cerebral intrínseca alterada en regiones corticales posteriores en el trastorno depresivo mayor (MDD). Los ROI derivados del EEG/fMRI en el precentral izquierdo y el pericalcarino derecho son consistentes con evidencia neuroimaging previa en trastornos de ansiedad: un metaanálisis de grosor cortical24 informó de un aumento del grosor cortical en el giro precentral izquierdo en pacientes con trastornos de ansiedad, mientras que un estudio de red de covarianza estructural25 en el trastorno de ansiedad social reportó una centralidad nodal anormal que involucra la corteza pericalcarina derecha. Para el trastorno de la lectura, el ROI del cuneus izquierdo derivado del EEG es consistente con un estudio de conectividad cerebral completo26 que informa de una conectividad alterada del cuneus izquierdo en la dislexia, mientras que el ROI del parahipocampo izquierdo derivado del fMRI es coherente con un estudio independiente27 que reporta acoplamiento anormal del parahipocampo/hipocampo en adolescentes con déficits específicos de comprensión lectora. En la tarea del trastorno del espectro autista, el ROI del giro lingual izquierdo destacado por la atribución derivada del EEG refleja evidencia previa de fMRI en estado de reposo28 de una ReHo reducida en el giro lingual izquierdo en niños prepuberales con TEA. El ROI del pars triangularis derecho derivado del fMRI también es biológicamente plausible, ya que se ha reportado una ALFF alterada en el pars triangularis derecho del giro frontal inferior29 en niños autistas. Para el TDAH, el ROI de la ínsula derecha derivado del EEG concuerda con evidencia de RM estructural30 que muestra un volumen reducido de la ínsula anterior en jóvenes con TDAH, particularmente que involucra el giro corto de la ínsula derecha. El ROI del entorrinal izquierdo derivado del fMRI podría reflejar un hallazgo más específico de subtipo, ya que un estudio independiente de Psychological Medicine31 informó de un volumen menor del cortex entorrinal izquierdo en un subgrupo de TDAH-C tras la corrección FDR. No obstante, estos hallazgos deben interpretarse considerando la dependencia interregional, porque las señales de ROI correlacionadas pueden impedir que la oclusión de un solo nodo aísle completamente la contribución de una región individual y puede llevar a estimaciones conservadoras.

Limitaciones y direcciones futuras
Aunque se utilizó una validación cruzada repetida de 5 pliegues para obtener estimaciones internas del rendimiento, estudios futuros que empleen validación cruzada anidada o validación externa independiente fortalecerían aún más la evaluación de la estabilidad y generalización de la selección del modelo. Dado que las salidas basadas únicamente en EEG y únicamente en fMRI se generaron enmascarando una modalidad dentro de registros multimodales completos y no se evaluaron en una cohorte externa de validación, estudios futuros deberían incluir cohortes externas de validación de una sola modalidad para evaluar la generalización. Otra limitación es que el diseño saludable frente a enfermedad única no captura presentaciones con comorbilidades, lo que limita la generalización clínica y motiva futuros estudios sobre clasificación multi-etiqueta y diagnóstico diferencial. Trabajos futuros también podrían evaluar la robustez de las asociaciones en el nivel de fuente del EEG utilizando estimadores de conectividad conscientes del filtrado. Aunque la parcelación DK compartida proporciona una interfaz anatómicamente fundamentada para la fusión multimodal, constituye una suposición del modelo que podría no capturar completamente las diferencias específicas de cada modalidad en resolución temporal y origen fisiológico. Más allá de los cinco trastornos evaluados aquí, el marco podría adaptarse a otras tareas de clasificación neurológica o psiquiátrica que involucren datos cerebrales multimodales anatómicamente alineados, y extenderse a aplicaciones de múltiples etiquetas o diagnóstico diferencial.

Conclusión
En resumen, BrainMoE proporciona un marco práctico e interpretable para la fusión de EEG-fMRI en el diagnóstico asistido por computadora de trastornos cerebrales. Su principal ventaja radica en la integración adaptativa de características multimodales, impulsada por una arquitectura de múltiples expertos y un mecanismo de enrutamiento suave que equilibra dinámicamente la información específica de cada modalidad y la información compartida. Además, al incorporar de forma fluida máscaras de estado modal y tokens para modalidades faltantes, el mismo modelo entrenado logra un rendimiento robusto durante la inferencia con modalidades incompletas sin necesidad de configuraciones separadas. Esencialmente, el marco interpretable ofrece rutas de atribución regional a nivel grupal a través de cinco trastornos cerebrales distintos, transformando la arquitectura convencional de caja negra en una herramienta informada fisiológicamente para el diagnóstico asistido por computadora. Esto es fundamental para futuros flujos de trabajo en neuroimagen computacional en los que fuentes de datos heterogéneas, disponibilidad incompleta de modalidades y salidas explicables de modelos son consideraciones centrales.

Divulgaciones

Los autores declaran que no existen conflictos de interés. Los autores declaran que no se utilizaron herramientas de inteligencia artificial generativa en la elaboración de este manuscrito, su código, análisis de datos o creación de gráficos.

Agradecimientos

Esta investigación fue financiada por la Fundación Nacional de Ciencias Naturales de China bajo los números de beca 62433002, 62277001 y U25A20446, el Proyecto de Construcción y Apoyo para Equipos Innovadores de Alto Nivel de las Instituciones Municipales de Beijing bajo el número de beca BPHR20220104, y el Programa de Becarios de Beijing bajo el número de beca 099.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
BashProyecto GNU5.1.16(1)-releaseSoftware
C-PACFCP-INDIVersión 1.8.7; etiqueta del contenedor release-v1.8.7.dev1Software
Kit de herramientas CUDANVIDIA CorporationVersión 12.4Software
GPU compatible con CUDANVIDIA CorporationGeForce RTX 4060 Laptop GPUEquipo
Atlas cortical de Desikan-KillianyFreeSurfer, Centro Athinoula A. Martinos para Imagen Biomédica, Hospital General de Massachusettsaparc; 68 regiones corticales (RRID:SCR_001847)Atlas/recurso
EEGLABCentro Swartz para Neurociencia Computacional, Universidad de California en San DiegoVersión 2022.1 (RRID:SCR_007292)Software
FreeSurferCentro Athinoula A. Martinos para Imagen Biomédica, Hospital General de MassachusettsVersión 7.4.1 (RRID:SCR_001847)Software
FSLFMRIB, Universidad de OxfordIncluido con C-PAC 1.8.7; versión exacta no especificada (RRID:SCR_002823)Software
Conjunto de datos de la Red del Cerebro Sano (HBN)Instituto Child MindRRID:SCR_016989Conjunto de datos
MATLABMathWorksR2022a (RRID:SCR_001622)Software
MNE-PythonEquipo de desarrollo de MNE-PythonVersión 1.9 (RRID:SCR_005972)Software/biblioteca
PythonPython Software FoundationVersión 3.12.4 (RRID:SCR_008394)Software
PyTorchPyTorch FoundationVersión 2.6.0+cu124 (RRID:SCR_018536)Biblioteca

Referencias

  1. Shao Y, et al. Exploring cognitive workload recognition using CogRepLKNet with EEG-fMRI. Neural Netw. 2026;198:108575.
  2. Jatoi MA, et al. A survey of methods used for source localization using EEG signals. Biomed Signal Process Control. 2014;11:42-52.
  3. Wei X, et al. Multi-modal cross-domain self-supervised pre-training for fMRI and EEG fusion. Neural Netw. 2025;184:107066.
  4. Lang J, Yang LZ, Li H. Multi-modal dynamic brain graph representation learning for brain disorder diagnosis via temporal sequence model. Neurocomputing. 2025;656:131509.
  5. Zhu W, et al. CGLK-GNN: a connectome generation network with large kernels for GNN based Alzheimer's disease analysis. Neural Netw. 2026;199:108689.
  6. Wu Z, Shen C, van den Hengel A. Wider or deeper: revisiting the ResNet model for visual recognition. Pattern Recogn. 2019;90:119-33.
  7. Vaswani A, et al. Attention is all you need [conference paper]. Presented at: 31st Conference on Neural Information Processing Systems; Long Beach, CA; 2017. Available from: https://papers.nips.cc/paper/7181-attention-is-all-you-need
  8. Kawahara J, et al. BrainNetCNN: convolutional neural networks for brain networks; towards predicting neurodevelopment. Neuroimage. 2017;146:1038-49.
  9. Li X, et al. BrainGNN: interpretable brain graph neural network for fMRI analysis. Med Image Anal. 2021;74:102233.
  10. Kan X, et al. Dynamic brain transformer with multi-level attention for functional brain network analysis [conference paper]. Presented at: 2023 IEEE EMBS International Conference on Biomedical and Health Informatics; Pittsburgh, PA; 2023. Available from: https://doi.org/10.1109/BHI58575.2023.10313480
  11. Khan MAR, et al. MultiEpilepsyNet: an EEG and MRI data based multimodal seizure detection model using hybrid deep learning model. Brain Res Bull. 2025;233:111645.
  12. Saha A, Ghosh D, Ali F, Singh PK. SZAtt-Net: a unified deep learning model with different attention mechanisms for schizophrenia classification from multimodal data. Med Nov Technol Devices. 2026;29:100428.
  13. Liu J, et al. A survey on inference optimization techniques for mixture of experts models. ACM Comput Surv. 2026;58(10):1-37.
  14. Xu H, et al. MCMoE: completing missing modalities with mixture of experts for incomplete multimodal action quality assessment [conference paper]. Presented at: 40th Annual AAAI Conference on Artificial Intelligence; Singapore; 2026. Available from: https://doi.org/10.1609/aaai.v40i13.38104
  15. Nguyen H, Ho N, Rinaldo A. Convergence rates for softmax gating mixture of experts. IEEE Trans Inf Theory. 2025;72(2):1276-304.
  16. Ma J, et al. Modeling task relationships in multi-task learning with multi-gate mixture-of-experts [conference paper]. Presented at: 24th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining; London, United Kingdom; 2018. Available from: https://doi.org/10.1145/3219819.3220007
  17. Chen T, Li H, Zheng H, Fan Y. dFCExpert: learning dynamic functional connectivity patterns with modularity and state experts. IEEE Trans Med Imaging. 2026;45(3):1088-98.
  18. Yang X, et al. EvoMoE: evolutionary mixture-of-experts for SSVEP-EEG classification with user-independent training. IEEE J Biomed Health Inform. 2025;29(9):6538-50.
  19. Raza WH, et al. NeuroMoE++: patient-adaptive multi-level multimodal fusion with mixture-of-experts for neurological disorder classification. IEEE Trans Biomed Eng. 2026;73(8):2784-94.
  20. Desikan RS, et al. An automated labeling system for subdividing the human cerebral cortex on MRI scans into gyral based regions of interest. Neuroimage. 2006;31(3):968-80.
  21. Alexander LM, et al. An open resource for transdiagnostic research in pediatric mental health and learning disorders. Sci Data. 2017;4(1):170181.
  22. Ji S, Xu W, Yang M, Yu K. 3D convolutional neural networks for human action recognition. IEEE Trans Pattern Anal Mach Intell. 2013;35(1):221-31.
  23. Gong J, et al. Common and distinct patterns of intrinsic brain activity alterations in major depression and bipolar disorder: voxel-based meta-analysis. Transl Psychiatry. 2020;10(1):353.
  24. Wang L, et al. Alterations in cortical thickness in anxiety disorders and their association with atlas-based neurotransmitter maps. Acad Radiol. 2026;33(7):3011-22.
  25. Zhang X, et al. Disrupted brain gray matter connectome in social anxiety disorder: a novel individualized structural covariance network analysis. Cereb Cortex. 2023;33(16):9627-38.
  26. Finn ES, et al. Disruption of functional networks in dyslexia: a whole-brain, data-driven analysis of connectivity. Biol Psychiatry. 2014;76(5):397-404.
  27. Cutting LE, et al. Not all reading disabilities are dyslexia: distinct neurobiology of specific comprehension deficits. Brain Connect. 2013;3(2):199-211.
  28. Yue X, et al. Brain functional alterations in prepubertal boys with autism spectrum disorders. Front Hum Neurosci. 2022;16:891965.
  29. Karavallil Achuthan S, Coburn KL, Beckerson ME, Kana RK. Amplitude of low frequency fluctuations during resting state fMRI in autistic children. Autism Res. 2023;16(1):84-98.
  30. Lopez-Larson MP, et al. Reduced insular volume in attention deficit hyperactivity disorder. Psychiatry Res Neuroimaging. 2012;204(1):32-9.
  31. Yamashita M, Shou Q, Mizuno Y. Unsupervised machine learning for identifying attention-deficit/hyperactivity disorder subtypes based on cognitive function and their implications for brain structure. Psychol Med. 2024;54(14):3917-29.

Reimpresiones y permisos

Etiquetas

Fusión EEG-fMRIImágenes Cerebrales MultimodalesDiagnóstico Asistido por ComputadoraCodificadores de GrafosMapas de Atribución de ROIExperto de Estado NeuralMáscaras de Estado de ModalidadAnálisis de Oclusión de Nodos

Este artículo ha sido publicado

Video próximamente