Artículo de investigación

Modelado híbrido CNN-ViT para predecir resultados funcionales tras un ictus isquémico: un estudio retrospectivo

DOI:

10.3791/71552

12 de junio de 2026

* These authors contributed equally

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Un modelo híbrido CNN-ViT extrajo características multiparamétricas de la resonancia magnética y apiló regresión logística fusionando imágenes y predicciones clínicas para estimar el resultado funcional a 90 días tras un ictus isquémico agudo. El modelo de fusión logró el mayor rendimiento interno en pruebas, con un AUC de 0,885 y una precisión de 0,840, y mostró un rendimiento de validación externa alentador.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El ictus isquémico agudo (AIS) es una causa principal de muerte y discapacidad a largo plazo, y la predicción temprana de la recuperación funcional es importante para guiar la toma de decisiones clínicas y la planificación de rehabilitación. El resultado funcional a los 90 días se evalúa habitualmente utilizando la Escala de Rankin modificada (mRS), pero predecir el resultado a largo plazo a partir de la información clínica y de imagen temprana sigue siendo un reto. Planteamos la hipótesis de que integrar la imagen por resonancia magnética multiparamétrica (IRM) con variables clínicas estructuradas utilizando una arquitectura híbrida de red neuronal convolucional (CNN) y Transformador de Visión (ViT) mejoraría la predicción de resultados funcionales a 90 días en comparación con los modelos monomodales. Se analizó y dividió una cohorte retrospectiva de 300 pacientes con SIA que se sometieron a una resonancia magnética multiparamétrica en una cohorte de validación de entrenamiento (n = 250) y una cohorte interna independiente de prueba (n = 50). Se incluyó una cohorte externa adicional de 37 pacientes con SIA para evaluar la generalizabilidad del modelo. Se desarrolló un modelo híbrido CNN-ViT para extraer características de la resonancia magnética multiparamétrica, y se integraron las predicciones de imagen y clínicas mediante regresión logística apilada. El rendimiento del modelo se evaluó utilizando el área bajo la curva característica de funcionamiento del receptor (AUC), sensibilidad, especificidad y precisión. Entre los modelos clínicos evaluados, la máquina de vectores de soporte logró el mayor AUC en pruebas internas (0,878). El modelo de imagen alcanzó una AUC de 0,782. El modelo de fusión multimodal logró el mejor rendimiento interno global, con un AUC de 0,885, sensibilidad de 0,920, especificidad de 0,760 y precisión de 0,840. Se observaron tendencias de rendimiento similares en la cohorte externa de pruebas. Estos hallazgos sugieren que la fusión apilada de resonancia magnética multiparamétrica y predicciones clínicas podría mejorar la predicción de resultados funcionales a 90 días tras la AIS. Sin embargo, se requieren estudios de validación multicéntrica de mayor tamaño antes de la implementación clínica.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El ictus isquémico agudo (AIS) sigue siendo una de las principales causas de muerte y discapacidad a largo plazo, y los clínicos deben estimar la recuperación temprana cuando las decisiones de tratamiento y alta sean más sensibles altiempo 1. Por tanto, la predicción precoz y precisa de la recuperación funcional es clínicamente importante para guiar las estrategias de tratamiento, la planificación de la rehabilitación y la toma de decisiones tras el alta. El resultado funcional a noventa días es un punto final estándar en la investigación y atención del ictus y se mide más comúnmente mediante la Escala de Rankin modificada (mRS), que ha establecido validez y fiabilidad en ensayos clínicos y estudiosobservacionales 2,3. A pesar de su uso rutinario, predecir la mSR a 90 días a partir de los datos de admisión sigue siendo difícil porque la discapacidad refleja tanto una lesión tisular irreversible como la carga de reserva premórbida y comorbilidad, que influyen en la recuperación incluso cuando los hallazgos agudos de imagen sonsimilares 2,4.

La resonancia magnética multiparamétrica proporciona biomarcadores clínicamente útiles de la lesión isquémica temprana y el estado tisular que no se capturan completamente con un solo contraste de imagen. La imagen ponderada por difusión (DWI) es muy sensible a los cambios isquémicos tempranos. La imagen aparente de coeficientes de difusión (ADC) cuantifica la restricción de difusión y ha demostrado utilidad pronóstica en cohortes de ictusagudo 5. La recuperación por inversión atenuada por líquido T2 (T2-FLAIR) complementa la imagen de difusión al mejorar la visualización de la evolución de la lesión y es central en los enfoques de desajuste DWI-FLAIR utilizados para estimar la edad de la lesión y la elegibilidad para el tratamiento cuando el momento de inicio esincierto 6,7. Grandes estudios multicéntricos y ensayos aleatorizados han demostrado que la incompatibilidad entre DWI y FLAIR identifica a los pacientes dentro de una ventana terapéutica de 4,5 horas y apoya la trombólisis guiada por resonancia magnética en un ictus de inicio desconocido, subrayando la relevancia pronóstica de DWI y FLAIR más allá deldiagnóstico 6,7. En conjunto, estas observaciones apoyan estrategias de modelado que integran DWI, ADC y T2-FLAIR para capturar tanto características isquémicas tempranas del núcleo como información temporal que puede influir en la recuperación funcional.

Paralelamente, las variables clínicas establecidas proporcionan una señal pronóstica fuerte y están disponibles rutinariamente en laadmisión 4. La Escala de Ictus de los Institutos Nacionales de Salud (NIHSS) es una medida ampliamente utilizada de la gravedad del déficit neurológico y predice fuertemente el resultado clínico. El subtipo etiológico del ictus, incluyendo la clasificación Trial of Org 10172 en Tratamiento del Ictus Agudo (TOAST), puede aportar información pronóstica adicional más allá del NIHSS en algunosanálisis 8,9. Trabajos previos también han demostrado que los factores de riesgo vascular y las condiciones comórbidas se identifican repetidamente entre los candidatos a predictores de malos resultados en cohortes de ictus isquémicos y estudiospronósticos 4,10. Comorbilidades específicas como la fibrilación auricular, la insuficiencia cardíaca descompensada y la diabetes se asocian consistentemente con peores resultados funcionales trasun ictus 1,11,12. El tabaquismo se asocia con peores resultados funcionales a 90 días, mientras que el consumo de alcohol muestra asociaciones más débiles o dependientes de la dosis, y los trastornos lipídicos muestran relaciones más complejas con la discapacidad post-ictus 13,14,15,16,17. Estos hallazgos apoyan la combinación de predictores clínicos estructurados que capturan la gravedad del ictus, la etiología y la carga de comorbilidad con una resonancia magnética multiparamétrica en lugar de depender únicamente de cualquiera de las modalidades.

Estudios recientes de aprendizaje automático sugieren que los modelos computacionales pueden integrar biomarcadores heterogéneos para mejorar la predicción del resultado del ictus, aunque el rendimiento depende en gran medida de la modalidad de los datos, la composición de cohortes, el diseño del modelo y las estrategias de manejo de desequilibrios de clase 18,19,20. Los métodos de aumento de gradiente y conjuntos han demostrado viabilidad para predecir la mRS a 90 días utilizando variables de imagen, demografía y clínicas, especialmente para la clasificación binaria de un resultado desfavorable (mRS > 2)18. Estudios recientes multicéntricos que combinan características de resonancia magnética convolucional tridimensional derivadas de redes neuronales convolucionales (CNN) de DWI, ADC y FLAIR con variables clínicas estructuradas han demostrado que los modelos multimodales capturan información pronóstica complementaria más allá de los enfoquesmonomodales 21. Se han reportado hallazgos similares utilizando modalidades de imagen individuales como la imagen ponderada por difusión o la tomografía computarizada sin contraste fusionada con variablesclínicas 18,22. Los estudios representativos que utilizan modelos multimodales de inteligencia artificial para la predicción del resultado del ictus se resumen en la Tabla 1.

EstudioModalidad de imagenTécnica de IA (modelo)ObjetivoResumen
Liu et al.18Resonancia magnética (DWI) + ClínicoModelo predictivo de aprendizaje profundo (DLPD, red de imágenes basada en CNN + red de características clínicas)Predecir la mRS ordinal a 90 días utilizando imágenes fusionadas e información clínica.El modelo fusionado superó significativamente a los modelos solo por imagen y solo clínicos, y logró una alta precisión para predecir resultados desfavorables.
Jung et al.21RESONANCIA MAGNÉTICA (DWI, ADC, FLAIR) + ClínicoModelo de aprendizaje profundo en conjunto que combina redes de imagen 3D-CNN y modelo clínico multicapa de perceptrón (MLP)Desarrollar un modelo DL multimodal en conjunto para la predicción de resultados funcionales en AIS.La integración multimodal mejoró la predicción de los resultados a 3 meses en comparación con los modelos monomodales en una gran cohorte multicéntrica.
Wei et al.27RM (DWI, ADC) + ClínicoRadiómica + aprendizaje automático (selección de características LASSO + regresión logística / clasificadores de bosque aleatorio)Predecir los resultados funcionales a largo plazo utilizando la RM, la radiografía y variables clínicas.El modelo radiomónico-clínico logró un mejor rendimiento pronóstico que los modelos solo por imagen o solo clínicos.
Liu et al.22TC sin contraste + ClínicoModelo de fusión de aprendizaje profundo (codificador de imagen CNN + red MLP clínica)Predecir los resultados funcionales a 90 días a partir de la TC en fase aguda y datos clínicos.La fusión multimodal mejoró significativamente la precisión de la predicción en comparación con los modelos monomodales.
Liu et al.19Resonancia magnética (DWI) + ClínicoModelo predictivo de aprendizaje profundo (DLPD, modelo de fusión basado en CNN)Evalúa el modelo de predicción de resultados de aprendizaje profundo frente a las predicciones de los médicos.El modelo de IA logró un rendimiento comparable al de los especialistas en ictus en la predicción de resultados de la mRS a 90 días.
Rehman et al.20ClínicoAprendizaje profundo híbrido (CNN+GRU con ADASYN)Predecir el riesgo de ictus a partir de datos clínicos desequilibradosEl aprendizaje profundo híbrido con ADASYN mejoró el rendimiento en la predicción del riesgo de ictus, demostrando el valor del balanceo avanzado de datos y el aprendizaje multimodelo.
Ali et al.29MRI/fMRI/rs-fMRIMeta-revisión sistemática de modelos ML, DL e híbridosEvaluar técnicas de inteligencia computacional para el diagnóstico basado en neuroimagenLos modelos híbridos generalmente superaron a los enfoques independientes de ML y DL, apoyando el valor de las arquitecturas híbridas para la predicción basada en neuroimagen.

Tabla 1: Resumen de estudios previos sobre la predicción basada en inteligencia artificial de resultados funcionales tras un ictus isquémico agudo. Se resumen los estudios representativos que utilizan imagen, variables clínicas o enfoques multimodales para la predicción de los resultados funcionales post-ictus, incluyendo modalidad de imagen, técnica de inteligencia artificial, objetivo del estudio y hallazgos principales. Por favor, haz clic aquí para descargar esta tabla.

Sin embargo, muchos estudios existentes dependen de secuencias de imagen individuales o modelos convencionales de aprendizaje profundo que capturan principalmente características espaciales locales y pueden no modelar completamente las relaciones contextuales a largo plazo dentro de los datos de imagen cerebral. En consecuencia, persiste una brecha específica en el desarrollo y evaluación externa de un enfoque multimodal que utilice conjuntamente DWI, ADC y T2-FLAIR con variables clínicas estructuradas, combinando la extracción local de características de la lesión y modelado contextual global. Aunque las CNN están bien establecidas para la extracción de características a nivel de lesión, arquitecturas basadas en Transformers como los Vision Transformers (ViTs) permiten modelar relaciones contextuales a largo plazo mediante mecanismos de atención, proporcionando así representaciones globalescomplementarias 23,24. Por tanto, los modelos híbridos CNN-ViT proporcionan un marco racional para codificar conjuntamente el detalle morfológico local y el contexto cerebral global. Los algoritmos de aprendizaje automático son igualmente adecuados para modelar relaciones complejas no lineales dentro de datos clínicos estructuradosy heterogéneos 25. Guiado por principios recientes de aprendizaje multimodal que enfatizan la integración complementariaintermodal 26, este estudio combinó la resonancia magnética multiparamétrica dentro de una columna vertebral de imagen CNN-ViT e integró estas características con un modelo clínico de aprendizaje automático para la predicción de resultados a 90 días. La novedad del estudio radica en el desarrollo y evaluación externa de un marco de fusión multimodal apilado que integra secuencias complementarias de resonancia magnética, representaciones de imagen CNN-ViT local-global y predictores clínicos estructurados dentro de un modelo unificado de predicción de resultados a 90 días.

La hipótesis del estudio era que integrar la resonancia magnética multiparamétrica con variables clínicas estructuradas utilizando una arquitectura híbrida CNN-ViT mejoraría la predicción de los resultados funcionales a 90 días tras el AIS en comparación con los modelos monomodales. Por ello, el objetivo era desarrollar y evaluar un marco multimodal de aprendizaje profundo que integrara secuencias de resonancia magnética DWI, ADC y T2-FLAIR con predictores clínicos estructurados para estimar los resultados de la mRS a 90 días en pacientes con AIG.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio fue aprobado por la Junta de Revisión Institucional del Hospital General de la Universidad de Shenzhen (número de aprobación del IRB). KYLL-2026-077-1). El requisito de consentimiento informado por escrito fue eximido debido al diseño retrospectivo del estudio.

1. Cohorte de estudio

Los pacientes con ictus isquémico agudo (AIS) que se sometieron a una resonancia magnética multiparamétrica fueron identificados retrospectivamente a partir de la base de datos clínica institucional. El flujo de trabajo general del estudio, que incluye la partición de conjuntos de datos, el desarrollo de modelos de imagen, la construcción de modelos clínicos y la fusión multimodal, se ilustra en la Figura 1.

Figura 1
Figura 1: Flujo de trabajo del marco multimodal de predicción de resultados. (A) Adquisición de datos. Se identificaron retrospectivamente a los pacientes con ictus isquémico agudo (AIS) que cumplían criterios de inclusión predefinidos. El conjunto de datos se dividió en una cohorte de validación de entrenamiento (n = 250), una cohorte interna independiente de prueba (n = 50) y una cohorte externa de prueba (n = 37). Se realizó una validación cruzada estratificada cinco veces dentro de la cohorte de validación de entrenamiento. (B) Desarrollo de modelos de imagen. Las secuencias de resonancia magnética multiparamétrica, incluyendo imágenes ponderadas por difusión (DWI), coeficiente de difusión aparente (ADC) y recuperación de inversión atenuada por fluido T2 (T2-FLAIR), se procesaron utilizando una arquitectura híbrida de red neuronal convolucional tridimensional y transformador de visión (CNN-ViT) para la predicción de resultados. (C) Desarrollo de modelos clínicos. Se utilizaron variables clínicas estructuradas para entrenar modelos de aprendizaje automático para la predicción del resultado funcional a 90 días. (D) Estrategia de fusión multimodal. Las predicciones generadas por los modelos de imagen y clínicos se integraron utilizando un meta-aprendiz de regresión logística apilada para producir predicciones de resultados finales. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Los exámenes de resonancia magnética se realizaron utilizando sistemas clínicos de resonancia magnética. Se utilizaba una bobina de cabeza dedicada de matriz en fase para la adquisición de imágenes. Todas las secuencias se adquirieron en el plano axial utilizando una posición consistente de cortes entre modalidades. La imagen ponderada por difusión (DWI) se obtuvo utilizando una secuencia de imagen ecoplanar de espín-eco de un solo disparo con un tiempo de repetición (TR) de 3.000–5.000 ms y tiempo de eco (TE) de 80–90 ms. La sensibilización por difusión se aplicó usando valores b de 0 y 800–1.000 s/mm 2 en al menos 3 direcciones ortogonales. El campo de visión oscilaba entre 220 y 240 mm, con un tamaño de matriz de 128 × 128. El grosor de la corte era de 5–6 mm con un espacio entre cortes de 1–1,5 mm. Se adquirieron promedios de señal de dos a cuatro.

Los mapas de coeficientes de difusión aparentes (ADC) se generaban automáticamente a partir de datos DWI en la estación de trabajo del escáner usando ajuste monoexponencial basado en los valores b adquiridos. Los valores de ADC se calculaban voxel a nivel y se exportaban para análisis cuantitativo. Las imágenes de recuperación por inversión atenuada por fluido T2 (T2-FLAIR) se adquirieron utilizando una secuencia de recuperación por inversión con TR de 8.000–10.000 ms, TE de 80–140 ms y tiempo de inversión de 2.200–2.600 ms. El campo de visión oscilaba entre 220 y 240 mm, con un tamaño de matriz de 192 × 192 a 256 × 256. El grosor de la corte era de 4–5 mm con una separación entre cortes de 1–1,5 mm.

2. Preprocesamiento de datos

Los datos clínicos se importaron de hojas de cálculo estructuradas que contenían identificadores de casos, puntuaciones de resultados de la mRS, etiquetas divididas en el conjunto de datos y variables demográficas y clínicas. Los identificadores de casos se estandarizaron para garantizar la coherencia con los nombres de archivos de imagen. Las variables clínicas incluyeron características demográficas, gravedad del ictus medida mediante la Escala de Ictus de los Institutos Nacionales de Salud (NIHSS), factores de riesgo vasculares y condiciones comórbidas registradas en el momento del ingreso.

El resultado principal fue el estado funcional 90 días después del inicio del ictus, medido mediante la Escala de Rankin modificada (mRS). Un resultado favorable se definió como mRS ≤ 2 y un resultado desfavorable como mRS > 2. El conjunto de datos se dividió aleatoriamente en cohortes de validación de entrenamiento y pruebas internas independientes, utilizando muestreo estratificado basado en la distribución de mRS para preservar el equilibrio de resultados. Una cohorte de prueba externa se procesó por separado y no se utilizó durante el desarrollo del modelo. Dentro de la cohorte de validación de entrenamiento, se aplicó la validación cruzada estratificada k-fold para mantener distribuciones consistentes de resultados entre pliegues.

Todos los volúmenes DWI, ADC y T2-FLAIR se preprocesaron antes del entrenamiento del modelo para garantizar la consistencia espacial y numérica entre modalidades. La misma cadena de preprocesamiento se aplicó a las cohortes de validación de entrenamiento, pruebas internas y pruebas externas sin modificaciones. Las imágenes se reorientaron a la orientación canónica de RAS y se convirtieron en matrices de coma flotante. La resolución espacial en plano se remuestreó a 256 × 256 mediante interpolación lineal. La dimensión del plano pasante se estandarizó a 20 cortes usando una estrategia basada en el centro: los volúmenes que contenían más de 20 cortes se recortaban en el centro, mientras que los volúmenes con menos de 20 cortes se rellenaban simétricamente en cero. El tamaño final del volumen fue de 256 × 256 × 20.

La normalización de intensidad se realizó de forma independiente para cada volumen utilizando la normalización de puntuación z:

Ecuación 1

donde x denota la intensidad del vóxel, μ es la intensidad media del volumen, y σ es la desviación estándar. Si σ = 0, no se aplicó la normalización para evitar la inestabilidad numérica. Los volúmenes procesados se guardaban en formato NIfTI con una matriz afín estandarizada para el análisis de aprendizaje profundo posterior.

3. Desarrollo de modelos clínicos

Se utilizaron variables clínicas estructuradas para desarrollar modelos de aprendizaje automático para la predicción de resultados. Los predictores candidatos incluían características demográficas, factores de riesgo vasculares, etiología del ictus y medidas iniciales de gravedad clínica. Las variables continuas se imputaron usando valores medianos y se estandarizaron. Las variables categóricas se imputaron usando la categoría más frecuente y se codificaron usando la codificación one-hot.

Se evaluaron múltiples algoritmos de aprendizaje automático, incluyendo regresión logística, bosque aleatorio, aumento de gradiente, máquinas de vectores de soporte (SVM), aumento extremo de gradiente y modelos de máquinas de aumento de gradiente de luz. El desarrollo del modelo siguió un marco estratificado de cinco validaciones cruzadas dentro de la cohorte de entrenamiento-validación para estimar el rendimiento generalizado. Las predicciones finales para las cohortes de prueba interna y externa se generaron promediando las predicciones de modelos entrenados en cada pliegue de validación cruzada. No se utilizaron muestras externas durante la validación cruzada o selección del modelo.

4. Arquitectura de modelos de aprendizaje profundo

Se implementó una arquitectura híbrida CNN-ViT tridimensional para la predicción de resultados a partir de volúmenes de resonancia magnética multimodal. La red fue diseñada para combinar la extracción de características espaciales locales con modelado contextual global dentro de un marco unificado. Los volúmenes de entrada consistían en imágenes tridimensionales multicanal procesadas de extremo a extremo.

La extracción de características se realizó inicialmente utilizando una columna vertebral jerárquica convolucional tridimensional compuesta por 4 etapas. Cada etapa incluía 2 capas convolucionales con un tamaño de núcleo de 3 × 3 × 3 y un relleno de 1 voxel, seguida de normalización por lotes y activación lineal rectificada por unidades. La resolución espacial se redujo progresivamente usando capas de max-pooling tridimensionales aplicadas tras las primeras 3 etapas, mientras que la profundidad del canal de características aumentó en cada nivel para capturar representaciones semánticas de nivel superior. La regularización de dropout (tasa de dropout = 0,1) se aplicó tras la etapa convolucional final para reducir el sobreajuste. La columna vertebral convolucional transformaba el volumen de entrada de tamaño C × D × H × W en una representación compacta de características de alto nivel con dimensiones espaciales reducidas.

El mapa de características resultante fue remodelado en una secuencia de fichas aplanando dimensiones espaciales de modo que el número de fichas correspondía a:

N = D' x H' x W'

Las relaciones contextuales globales entre tokens se modelaron utilizando capas codificadoras Transformer compuestas por redes de autoatención y feedforward de múltiples cabezas. La autoatención se calculó como:

Ecuación 2

donde Q, K y V denotan las matrices de consulta, clave y valor, respectivamente, y d representa la dimensión de incrustación. La normalización de capas y el dropout se aplicaron dentro de cada capa de codificador para mejorar la estabilidad del entrenamiento. El módulo Transformer constaba de 3 capas codificadoras con 8 cabezas de atención y una dimensión de incrustación de 256.

Tras la codificación por transformador, se extrajo y normalizó la representación correspondiente al token de clasificación. Una capa lineal totalmente conectada producía una única salida logit para la clasificación binaria.

La arquitectura híbrida propuesta CNN-ViT fue diseñada intencionadamente como un modelo ligero y eficiente en parámetros para equilibrar la capacidad representacional y el riesgo de sobreajuste. El modelo comprendía 3,79 millones de parámetros entreenables (aproximadamente 14,4 MB en precisión fp32), incluyendo 1,38 millones en la columna vertebral convolucional y 2,37 millones en el codificador Transformer.

5. Entrenamiento de modelos de imagen

El entrenamiento del modelo de imagen se realizó utilizando un marco estratificado de validación cruzada de cinco partes para preservar la distribución de resultados entre pliegues y mejorar la robustez de la estimación del rendimiento. El conjunto de datos se dividió en una cohorte de validación de entrenamiento y una cohorte interna de prueba independiente utilizando muestreo estratificado basado en la distribución de resultados. Dentro de la cohorte de validación de entrenamiento, se aplicó una validación cruzada estratificada de cinco vínculos. Para cada plegado, el modelo de imagen se entrenó usando el subconjunto de entrenamiento y se evaluó usando el subconjunto de validación correspondiente, mientras que la cohorte de prueba retenida se reservó exclusivamente para la evaluación final del rendimiento.

La optimización del modelo se realizó utilizando un marco de aprendizaje profundo en una estación de trabajo equipada con GPU y optimizador AdamW, tasa de aprendizaje de 3 × 10⁻5 y decaimiento de peso de 3 × 10⁻4. La formación se realizaba utilizando un lote de 8 para hasta 200 épocas. Se utilizó la entropía cruzada binaria con logits como función de pérdida.

Para abordar el desequilibrio de clases, se calculó un factor de ponderación de clase positiva para cada pliegue basado en la proporción de muestras negativas a positivas e incorporado a la función de pérdida. Se aplicó el recorte de normas de gradiente con una norma máxima de 0,5 para mejorar la estabilidad numérica durante la optimización. Se habilitó el entrenamiento automático de precisión mixta para mejorar la eficiencia computacional.

La detención temprana se implementó cuando el rendimiento de validación no mejoró al menos 1 × 10⁻4 durante 30 épocas consecutivas. Se mantuvo el punto de control del modelo con mejor rendimiento de cada pliegue. Tras completar todos los pliegues, se generaron predicciones para las cohortes de prueba interna y externa utilizando cada modelo específico de pliegue, y las probabilidades finales se obtuvieron promediando las predicciones entre los 5 modelos para generar resultados en conjunto.

6. Modelo de fusión multimodal

Se implementó una estrategia de fusión apilada para integrar predicciones derivadas de imágenes con información clínica estructurada. El modelo de imagen de aprendizaje profundo y el modelo de predicción clínica sirvieron como base de aprendices, y sus probabilidades predichas se utilizaron como características de entrada para un meta-aprendiz de regresión logística. Se incorporaron características adicionales de interacción, incluyendo el producto y la diferencia absoluta de probabilidades predichas, para capturar información complementaria entre la imagen y las predicciones clínicas.

Para evitar fugas de información, el meta-aprendiz fue entrenado utilizando probabilidades predichas fuera de pliegue generadas a partir de la cohorte de validación de entrenamiento. Las probabilidades fuera de pliegue validadas cruzadamente de los modelos de imagen y clínico se combinaron por identificador de paciente para construir el conjunto de datos de entrenamiento del meta-aprendiz. Para las cohortes de pruebas internas y externas, se utilizaron probabilidades correspondientes del conjunto de pruebas de los modelos de imagen y clínicos como entradas para el meta-aprendiz entrenado para generar probabilidades fusionadas. El meta-aprendiz entrenado se aplicó a ambas cohortes de prueba sin reajustar.

7. Estudio de ablación

Se realizaron experimentos de ablación para evaluar las contribuciones de secuencias individuales de resonancia magnética y del componente Transformador de Visión utilizando los mismos ajustes de entrenamiento y evaluación que el modelo principal. Las ablaciones de secuencias incluían modelos de secuencia única, modelos de dejar una secuencia fuera y el modelo multiparamétrico completo. Para evaluar la contribución del módulo Vision Transformer, la arquitectura híbrida propuesta se comparó además con una línea base solo CNN en la que se eliminó el codificador Transformer manteniendo la misma columna vertebral convolucional.

8. Análisis estadístico

El rendimiento del modelo se evaluó por separado en la cohorte de prueba independiente interna y la cohorte externa utilizando el área bajo la curva característica de operación del receptor (AUC) como métrica principal de discriminación. Las curvas de característica de funcionamiento del receptor (ROC) se construyeron utilizando probabilidades predichas generadas por cada modelo. Se calcularon además la sensibilidad, especificidad y precisión global para caracterizar el rendimiento en la clasificación.

Se generaron resultados binarios utilizando umbrales determinados según el índice de Youden. Posteriormente, se calcularon sensibilidad, especificidad y precisión en el umbral óptimo. Todos los análisis estadísticos, el desarrollo de modelos de aprendizaje automático y el entrenamiento de modelos de aprendizaje profundo se implementaron utilizando paquetes estándar de computación científica y software de aprendizaje automático.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cohorte de estudio

Se incluyeron un total de 300 pacientes con ictus isquémico agudo (AIS) tras la aplicación de criterios predefinidos de inclusión y exclusión. El conjunto de datos se dividió en una cohorte de validación de entrenamiento (n = 250) y una cohorte interna de prueba independiente (n = 50) utilizando muestreo estratificado basado en la distribución funcional de resultados. Además, se incluyó una cohorte externa de prueba de 37 pacientes con SIA de un conjunto de ...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio desarrolló y evaluó un marco multimodal de inteligencia artificial que integra la resonancia magnética multiparamétrica y variables clínicas estructuradas para la predicción del resultado funcional a 90 días tras un ictus isquémico agudo (AIS). El modelo de fusión propuesto demostró un rendimiento predictivo superior al modelo de imagen o clínico por sí solo. Concretamente, el modelo multimodal apilado que integra predicciones del modelo clínico basado en máquina de vectores...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no declaran intereses en competencia.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta investigación no recibió ninguna subvención específica de ninguna agencia financiadora en los sectores público, comercial o sin ánimo de lucro.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

```html

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Sistema de resonancia magnética ((Discovery MR750 3.0T)GE Healthcarehttps://www.gehealthcare.in/products/magnetic-resonance-imaging/3-0t/discovery-mr750Escáner de resonancia magnética clínica utilizado para la adquisición de imágenes DWI, ADC y T2-FLAIR
Bobina de cabeza en faseGE Healthcarehttps://services.gehealthcare.com/gehcstorefront/p/5450630Bobina de cabeza utilizada para la recepción de señal de MRI
Unidad de procesamiento gráfico (RTX 4090)NVIDIAhttps://www.nvidia.com/en-us/geforce/graphics-cards/40-series/rtx-4090/GPU utilizada para el entrenamiento de modelos de aprendizaje profundo
Marco de trabajo de aprendizaje profundo (PyTorch v2.1)PyTorch Foundationhttps://pytorch.org/Marco utilizado para implementar el modelo CNN-Transformer
Lenguaje de programación (Python v3.10)Python Software Foundationhttps://www.python.org/downloads/release/python-3100/Entorno utilizado para el desarrollo de modelos y procesamiento de datos
Biblioteca de aprendizaje automático (scikit-learn)scikit-learn Developershttps://scikit-learn.org/stable/Utilizado para modelos de aprendizaje automático clínico y análisis estadístico
Biblioteca de impulso por gradiente (XGBoost)DMLChttps://xgboost.readthedocs.io/en/release_3.2.0/Utilizado para la implementación de modelos de impulso por gradiente
Biblioteca de impulso por gradiente (LightGBM)Microsofthttps://lightgbm.readthedocs.io/en/stable/Utilizado para el modelo clínico LightGBM
```

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Predicci n del Resultado FuncionalRM Multiparam tricaRed Neuronal ConvolucionalVision TransformerEscala de Rankin ModificadaRegresi n Log stica ApiladaM quina de Vectores de SoporteFusi n Multimodal

Artículos relacionados