$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudio fue aprobado por la Junta de Revisión Institucional del Hospital General de la Universidad de Shenzhen (número de aprobación del IRB). KYLL-2026-077-1). El requisito de consentimiento informado por escrito fue eximido debido al diseño retrospectivo del estudio.
1. Cohorte de estudio
Los pacientes con ictus isquémico agudo (AIS) que se sometieron a una resonancia magnética multiparamétrica fueron identificados retrospectivamente a partir de la base de datos clínica institucional. El flujo de trabajo general del estudio, que incluye la partición de conjuntos de datos, el desarrollo de modelos de imagen, la construcción de modelos clínicos y la fusión multimodal, se ilustra en la Figura 1.

Figura 1: Flujo de trabajo del marco multimodal de predicción de resultados. (A) Adquisición de datos. Se identificaron retrospectivamente a los pacientes con ictus isquémico agudo (AIS) que cumplían criterios de inclusión predefinidos. El conjunto de datos se dividió en una cohorte de validación de entrenamiento (n = 250), una cohorte interna independiente de prueba (n = 50) y una cohorte externa de prueba (n = 37). Se realizó una validación cruzada estratificada cinco veces dentro de la cohorte de validación de entrenamiento. (B) Desarrollo de modelos de imagen. Las secuencias de resonancia magnética multiparamétrica, incluyendo imágenes ponderadas por difusión (DWI), coeficiente de difusión aparente (ADC) y recuperación de inversión atenuada por fluido T2 (T2-FLAIR), se procesaron utilizando una arquitectura híbrida de red neuronal convolucional tridimensional y transformador de visión (CNN-ViT) para la predicción de resultados. (C) Desarrollo de modelos clínicos. Se utilizaron variables clínicas estructuradas para entrenar modelos de aprendizaje automático para la predicción del resultado funcional a 90 días. (D) Estrategia de fusión multimodal. Las predicciones generadas por los modelos de imagen y clínicos se integraron utilizando un meta-aprendiz de regresión logística apilada para producir predicciones de resultados finales. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Los exámenes de resonancia magnética se realizaron utilizando sistemas clínicos de resonancia magnética. Se utilizaba una bobina de cabeza dedicada de matriz en fase para la adquisición de imágenes. Todas las secuencias se adquirieron en el plano axial utilizando una posición consistente de cortes entre modalidades. La imagen ponderada por difusión (DWI) se obtuvo utilizando una secuencia de imagen ecoplanar de espín-eco de un solo disparo con un tiempo de repetición (TR) de 3.000–5.000 ms y tiempo de eco (TE) de 80–90 ms. La sensibilización por difusión se aplicó usando valores b de 0 y 800–1.000 s/mm 2 en al menos 3 direcciones ortogonales. El campo de visión oscilaba entre 220 y 240 mm, con un tamaño de matriz de 128 × 128. El grosor de la corte era de 5–6 mm con un espacio entre cortes de 1–1,5 mm. Se adquirieron promedios de señal de dos a cuatro.
Los mapas de coeficientes de difusión aparentes (ADC) se generaban automáticamente a partir de datos DWI en la estación de trabajo del escáner usando ajuste monoexponencial basado en los valores b adquiridos. Los valores de ADC se calculaban voxel a nivel y se exportaban para análisis cuantitativo. Las imágenes de recuperación por inversión atenuada por fluido T2 (T2-FLAIR) se adquirieron utilizando una secuencia de recuperación por inversión con TR de 8.000–10.000 ms, TE de 80–140 ms y tiempo de inversión de 2.200–2.600 ms. El campo de visión oscilaba entre 220 y 240 mm, con un tamaño de matriz de 192 × 192 a 256 × 256. El grosor de la corte era de 4–5 mm con una separación entre cortes de 1–1,5 mm.
2. Preprocesamiento de datos
Los datos clínicos se importaron de hojas de cálculo estructuradas que contenían identificadores de casos, puntuaciones de resultados de la mRS, etiquetas divididas en el conjunto de datos y variables demográficas y clínicas. Los identificadores de casos se estandarizaron para garantizar la coherencia con los nombres de archivos de imagen. Las variables clínicas incluyeron características demográficas, gravedad del ictus medida mediante la Escala de Ictus de los Institutos Nacionales de Salud (NIHSS), factores de riesgo vasculares y condiciones comórbidas registradas en el momento del ingreso.
El resultado principal fue el estado funcional 90 días después del inicio del ictus, medido mediante la Escala de Rankin modificada (mRS). Un resultado favorable se definió como mRS ≤ 2 y un resultado desfavorable como mRS > 2. El conjunto de datos se dividió aleatoriamente en cohortes de validación de entrenamiento y pruebas internas independientes, utilizando muestreo estratificado basado en la distribución de mRS para preservar el equilibrio de resultados. Una cohorte de prueba externa se procesó por separado y no se utilizó durante el desarrollo del modelo. Dentro de la cohorte de validación de entrenamiento, se aplicó la validación cruzada estratificada k-fold para mantener distribuciones consistentes de resultados entre pliegues.
Todos los volúmenes DWI, ADC y T2-FLAIR se preprocesaron antes del entrenamiento del modelo para garantizar la consistencia espacial y numérica entre modalidades. La misma cadena de preprocesamiento se aplicó a las cohortes de validación de entrenamiento, pruebas internas y pruebas externas sin modificaciones. Las imágenes se reorientaron a la orientación canónica de RAS y se convirtieron en matrices de coma flotante. La resolución espacial en plano se remuestreó a 256 × 256 mediante interpolación lineal. La dimensión del plano pasante se estandarizó a 20 cortes usando una estrategia basada en el centro: los volúmenes que contenían más de 20 cortes se recortaban en el centro, mientras que los volúmenes con menos de 20 cortes se rellenaban simétricamente en cero. El tamaño final del volumen fue de 256 × 256 × 20.
La normalización de intensidad se realizó de forma independiente para cada volumen utilizando la normalización de puntuación z:

donde x denota la intensidad del vóxel, μ es la intensidad media del volumen, y σ es la desviación estándar. Si σ = 0, no se aplicó la normalización para evitar la inestabilidad numérica. Los volúmenes procesados se guardaban en formato NIfTI con una matriz afín estandarizada para el análisis de aprendizaje profundo posterior.
3. Desarrollo de modelos clínicos
Se utilizaron variables clínicas estructuradas para desarrollar modelos de aprendizaje automático para la predicción de resultados. Los predictores candidatos incluían características demográficas, factores de riesgo vasculares, etiología del ictus y medidas iniciales de gravedad clínica. Las variables continuas se imputaron usando valores medianos y se estandarizaron. Las variables categóricas se imputaron usando la categoría más frecuente y se codificaron usando la codificación one-hot.
Se evaluaron múltiples algoritmos de aprendizaje automático, incluyendo regresión logística, bosque aleatorio, aumento de gradiente, máquinas de vectores de soporte (SVM), aumento extremo de gradiente y modelos de máquinas de aumento de gradiente de luz. El desarrollo del modelo siguió un marco estratificado de cinco validaciones cruzadas dentro de la cohorte de entrenamiento-validación para estimar el rendimiento generalizado. Las predicciones finales para las cohortes de prueba interna y externa se generaron promediando las predicciones de modelos entrenados en cada pliegue de validación cruzada. No se utilizaron muestras externas durante la validación cruzada o selección del modelo.
4. Arquitectura de modelos de aprendizaje profundo
Se implementó una arquitectura híbrida CNN-ViT tridimensional para la predicción de resultados a partir de volúmenes de resonancia magnética multimodal. La red fue diseñada para combinar la extracción de características espaciales locales con modelado contextual global dentro de un marco unificado. Los volúmenes de entrada consistían en imágenes tridimensionales multicanal procesadas de extremo a extremo.
La extracción de características se realizó inicialmente utilizando una columna vertebral jerárquica convolucional tridimensional compuesta por 4 etapas. Cada etapa incluía 2 capas convolucionales con un tamaño de núcleo de 3 × 3 × 3 y un relleno de 1 voxel, seguida de normalización por lotes y activación lineal rectificada por unidades. La resolución espacial se redujo progresivamente usando capas de max-pooling tridimensionales aplicadas tras las primeras 3 etapas, mientras que la profundidad del canal de características aumentó en cada nivel para capturar representaciones semánticas de nivel superior. La regularización de dropout (tasa de dropout = 0,1) se aplicó tras la etapa convolucional final para reducir el sobreajuste. La columna vertebral convolucional transformaba el volumen de entrada de tamaño C × D × H × W en una representación compacta de características de alto nivel con dimensiones espaciales reducidas.
El mapa de características resultante fue remodelado en una secuencia de fichas aplanando dimensiones espaciales de modo que el número de fichas correspondía a:
N = D' x H' x W'
Las relaciones contextuales globales entre tokens se modelaron utilizando capas codificadoras Transformer compuestas por redes de autoatención y feedforward de múltiples cabezas. La autoatención se calculó como:

donde Q, K y V denotan las matrices de consulta, clave y valor, respectivamente, y d representa la dimensión de incrustación. La normalización de capas y el dropout se aplicaron dentro de cada capa de codificador para mejorar la estabilidad del entrenamiento. El módulo Transformer constaba de 3 capas codificadoras con 8 cabezas de atención y una dimensión de incrustación de 256.
Tras la codificación por transformador, se extrajo y normalizó la representación correspondiente al token de clasificación. Una capa lineal totalmente conectada producía una única salida logit para la clasificación binaria.
La arquitectura híbrida propuesta CNN-ViT fue diseñada intencionadamente como un modelo ligero y eficiente en parámetros para equilibrar la capacidad representacional y el riesgo de sobreajuste. El modelo comprendía 3,79 millones de parámetros entreenables (aproximadamente 14,4 MB en precisión fp32), incluyendo 1,38 millones en la columna vertebral convolucional y 2,37 millones en el codificador Transformer.
5. Entrenamiento de modelos de imagen
El entrenamiento del modelo de imagen se realizó utilizando un marco estratificado de validación cruzada de cinco partes para preservar la distribución de resultados entre pliegues y mejorar la robustez de la estimación del rendimiento. El conjunto de datos se dividió en una cohorte de validación de entrenamiento y una cohorte interna de prueba independiente utilizando muestreo estratificado basado en la distribución de resultados. Dentro de la cohorte de validación de entrenamiento, se aplicó una validación cruzada estratificada de cinco vínculos. Para cada plegado, el modelo de imagen se entrenó usando el subconjunto de entrenamiento y se evaluó usando el subconjunto de validación correspondiente, mientras que la cohorte de prueba retenida se reservó exclusivamente para la evaluación final del rendimiento.
La optimización del modelo se realizó utilizando un marco de aprendizaje profundo en una estación de trabajo equipada con GPU y optimizador AdamW, tasa de aprendizaje de 3 × 10⁻5 y decaimiento de peso de 3 × 10⁻4. La formación se realizaba utilizando un lote de 8 para hasta 200 épocas. Se utilizó la entropía cruzada binaria con logits como función de pérdida.
Para abordar el desequilibrio de clases, se calculó un factor de ponderación de clase positiva para cada pliegue basado en la proporción de muestras negativas a positivas e incorporado a la función de pérdida. Se aplicó el recorte de normas de gradiente con una norma máxima de 0,5 para mejorar la estabilidad numérica durante la optimización. Se habilitó el entrenamiento automático de precisión mixta para mejorar la eficiencia computacional.
La detención temprana se implementó cuando el rendimiento de validación no mejoró al menos 1 × 10⁻4 durante 30 épocas consecutivas. Se mantuvo el punto de control del modelo con mejor rendimiento de cada pliegue. Tras completar todos los pliegues, se generaron predicciones para las cohortes de prueba interna y externa utilizando cada modelo específico de pliegue, y las probabilidades finales se obtuvieron promediando las predicciones entre los 5 modelos para generar resultados en conjunto.
6. Modelo de fusión multimodal
Se implementó una estrategia de fusión apilada para integrar predicciones derivadas de imágenes con información clínica estructurada. El modelo de imagen de aprendizaje profundo y el modelo de predicción clínica sirvieron como base de aprendices, y sus probabilidades predichas se utilizaron como características de entrada para un meta-aprendiz de regresión logística. Se incorporaron características adicionales de interacción, incluyendo el producto y la diferencia absoluta de probabilidades predichas, para capturar información complementaria entre la imagen y las predicciones clínicas.
Para evitar fugas de información, el meta-aprendiz fue entrenado utilizando probabilidades predichas fuera de pliegue generadas a partir de la cohorte de validación de entrenamiento. Las probabilidades fuera de pliegue validadas cruzadamente de los modelos de imagen y clínico se combinaron por identificador de paciente para construir el conjunto de datos de entrenamiento del meta-aprendiz. Para las cohortes de pruebas internas y externas, se utilizaron probabilidades correspondientes del conjunto de pruebas de los modelos de imagen y clínicos como entradas para el meta-aprendiz entrenado para generar probabilidades fusionadas. El meta-aprendiz entrenado se aplicó a ambas cohortes de prueba sin reajustar.
7. Estudio de ablación
Se realizaron experimentos de ablación para evaluar las contribuciones de secuencias individuales de resonancia magnética y del componente Transformador de Visión utilizando los mismos ajustes de entrenamiento y evaluación que el modelo principal. Las ablaciones de secuencias incluían modelos de secuencia única, modelos de dejar una secuencia fuera y el modelo multiparamétrico completo. Para evaluar la contribución del módulo Vision Transformer, la arquitectura híbrida propuesta se comparó además con una línea base solo CNN en la que se eliminó el codificador Transformer manteniendo la misma columna vertebral convolucional.
8. Análisis estadístico
El rendimiento del modelo se evaluó por separado en la cohorte de prueba independiente interna y la cohorte externa utilizando el área bajo la curva característica de operación del receptor (AUC) como métrica principal de discriminación. Las curvas de característica de funcionamiento del receptor (ROC) se construyeron utilizando probabilidades predichas generadas por cada modelo. Se calcularon además la sensibilidad, especificidad y precisión global para caracterizar el rendimiento en la clasificación.
Se generaron resultados binarios utilizando umbrales determinados según el índice de Youden. Posteriormente, se calcularon sensibilidad, especificidad y precisión en el umbral óptimo. Todos los análisis estadísticos, el desarrollo de modelos de aprendizaje automático y el entrenamiento de modelos de aprendizaje profundo se implementaron utilizando paquetes estándar de computación científica y software de aprendizaje automático.