Este artículo presenta un marco multimodal de aprendizaje profundo de varios disparos para la clasificación precisa de tumores de la glándula parótida utilizando secuencias de resonancia magnética.
Artículo de método
Este artículo presenta un marco multimodal de aprendizaje profundo de varios disparos para la clasificación precisa de tumores de la glándula parótida utilizando secuencias de resonancia magnética.
Es imprescindible diferenciar con precisión entre tumores parótidos benignos y malignos para el pronóstico del paciente. Sin embargo, debido al alto grado de heterogeneidad de los tumores parótidos y a la limitada disponibilidad de datos de imagen, el diagnóstico preoperatorio sigue siendo un desafío importante. Para abordar este problema, el presente estudio propone un marco multimodal de aprendizaje profundo basado en el aprendizaje de muestras reducidas. Este marco integra información de resonancia magnética multisecuencia e incorpora un mecanismo de atención espacial a escala múltiple para mejorar el rendimiento de extracción y clasificación de características en situaciones donde las muestras son limitadas. El modelo fue evaluado sistemáticamente utilizando una cohorte recogida retrospectivamente de 198 pacientes con tumores primarios de la glándula parótida confirmados histopatológicamente (107 benignos, 91 malignos) que se sometieron a una resonancia magnética preoperatoria completa —incluyendo imágenes ponderadas en T1, T2 y ponderadas por difusión— en nuestra institución, sin tratamiento previo para la lesión parotídea. La cohorte se dividió a nivel de paciente en entrenamiento (70%), validación (15%) y test (15%) utilizando muestreo aleatorio estratificado para preservar la proporción benigna a maligna, asegurando subconjuntos mutuamente excluyentes y evitando fugas de datos. El modelo alcanzó un área bajo la curva (AUC) de 0,9822. Este hallazgo subraya la capacidad del sistema para diferenciar entre tumores benignos y malignos. Además, el modelo mostró ventajas sustanciales en términos de precisión diagnóstica en comparación con radiólogos experimentados, subrayando su posible aplicación en la diferenciación benigna-maligna preoperatoria y el apoyo clínico a la decisión para tumores parótidos.
Los datos epidemiológicos indican que la incidencia de tumores de la glándula parótida está aumentando. La glándula parótida, la glándula salival más grande del cuerpohumano, es uno de los lugares de mayor incidencia de tumores de cabeza y cuello. Aunque los tumores de la glándula parótida son relativamente poco comunes, representando aproximadamente el 5% de los tumores de cabeza y cuello, las lesiones benignas superan con creces a las malignas, constituyendo aproximadamente el 80% de todos los tumores de la glándulaparótida 2,3. Los tumores parotídeos benignos y malignos presentan diferencias significativas en el comportamiento biológico, las estrategias de tratamiento y el pronóstico. Los tumores benignos suelen crecer lentamente, mostrar crecimiento expansil y rara vez metastatizaron. Los resultados favorables tras la resección quirúrgica completa. En cambio, los tumores malignos muestran patrones de crecimiento invasivos distintivos y frecuentemente invaden los tejidos circundantes, como el nervio facial, la piel y el hueso. También son capaces de metástasis a distancia, lo que resulta en un pronóstico peor 4,5.
No obstante, la diferenciación preoperatoria entre tumores parótidos benignos y malignos sigue siendo un desafío clínico diagnóstico. Debido a la ausencia de manifestaciones clínicas específicas, el síntoma inicial de la mayoría de los tumores parótidos (independientemente de la malignidad) es una masa indolora, lo que complica la diferenciación basada únicamente en signos osíntomas 6,7. Aunque síntomas como el dolor o la parálisis facial suelen considerarse indicadores potenciales de malignidad, son poco comunes en lesiones malignas tempranas. Por el contrario, algunos tumores benignos con respuestas inflamatorias pueden presentar manifestaciones similares. La evaluación preoperatoria de tumores parótidos se realiza principalmente mediante estudios de imagen, que representan el método no invasivo principal para dicha evaluación. Sin embargo, cabe señalar que cada modalidad de imagen tiene sus limitaciones. La resonancia magnética (RM) se considera la modalidad óptima para la evaluación de tumores parótidos debido a su excepcional resolución de tejidos blandos, con estudios que demuestran una precisión máxima del 93% en la diferenciación de lesiones benignas demalignas 8. Sin embargo, las secuencias convencionales presentan una superposición significativa en las características dela señal 9. La TC se utiliza principalmente para evaluar la afectación ósea; sin embargo, su sensibilidad es menor que la de la resonancia magnética a la hora de distinguir tumores benignos demalignos 10,11. La ecografía es una modalidad viable para la evaluación preliminar de lesiones superficiales; sin embargo, su eficacia depende de la experiencia deloperador 12. El PET-CT se caracteriza por su alta sensibilidad metabólica; sin embargo, su alto coste y la tasa de falsos positivos limitan su uso en el diagnóstico inicial, haciéndolo más adecuado para la estadificación y seguimiento de tumores malignos. En consecuencia, las modalidades de imagen individuales a menudo no logran diagnósticos precisos, y la diferenciación preoperatoria entre lesiones benignas y malignas suele depender de un análisis exhaustivo de la información multimodal.
En los últimos años, el campo de la inteligencia artificial (IA), en particular el subconjunto de tecnologías de aprendizaje profundo (DL) representado por las redes neuronales convolucionales (CNN), ha surgido como un contribuyente significativo a los avances en el diagnóstico de imagen tumoral. Esto se debe a las potentes capacidades de extracción de características de imagen y reconocimiento de patrones que ofrecen estas tecnologías. Los modelos de aprendizaje profundo extraen automáticamente características complejas a múltiples escalas a través de redes neuronales multicapa, reduciendo significativamente la dependencia del diseño manual de características y mejorando el rendimiento diagnóstico. Un cuerpo considerable de investigación ha validado su potencial en imagen médica multimodal. Gu Jionghui et al.13 desarrollaron un sistema multimodal de aprendizaje profundo que integraba ecografía mamaria y resonancia magnética que predecía eficazmente la respuesta a la quimioterapia neoadyuvante, superando los métodos tradicionales. Lu G et al.14 lograron una diferenciación precisa entre tumores benignos y malignos de mama integrando imágenes de ultrasonidos, mamografías y resonancias magnéticas con estrategias de aprendizaje por transferencia, dando lugar a una AUC de 0,947. Horasan A et al.15 realizaron análisis de fusión de resonancia magnética multiparamétrica prostática (mpMRI) utilizando CNN 3D con arquitecturas ResNet e Inception, logrando una precisión aproximada del 91,3%. En imagen parotídea, Zhang G et al.16 construyeron un modelo de aprendizaje profundo que integra datos de ultrasonido y clínicos para la diferenciación benigna-maligna; Hu X y Wang H.17 lograron una precisión de clasificación del 92,3% (AUC=0,96) utilizando el modelo aResNet50 basado en imágenes CT. La evidencia colectiva de estos estudios indica los beneficios sustanciales de emplear modelos de aprendizaje profundo para el análisis de imágenes de tumores parótidos y otros sólidos.
Sin embargo, los métodos tradicionales de aprendizaje profundo dependen frecuentemente de conjuntos de datos sustanciales para alcanzar un rendimiento óptimo. El cáncer de parótida, como cáncer de baja incidencia, posee datos relativamentelimitados 18. Además, los tumores parótidos demuestran una alta heterogeneidad de imagen, caracterizada por variaciones intrincadas en la intensidad de la señal, la estructura morfológica y las relaciones con el tejido glandular circundante. Estas características abarcan diversas escalas espaciales —por ejemplo, la morfología tumoral global y la definición de límites, así como características locales como la heterogeneidad interna de la señal y los patrones infiltrativos— lo que dificulta que los métodos de extracción de características simples o a escala única capturen completamente las distinciones clave entre lesiones benignas y malignas. Además, estudios previos a menudo se han basado en secuencias individuales de resonancia magnética (por ejemplo, solo imágenes estructurales o funcionales), lo que limita la capacidad de obtener representaciones completas de las características tumorales, como se informó en trabajosprevios 19,20.
Para abordar estos desafíos, proponemos que un marco de aprendizaje profundo multimodal de muestra pequeña que integre resonancia magnética multisecuencia y un mecanismo de atención espacial a múltiples escalas puede diferenciar eficazmente tumores parótidos benignos y malignos bajo condiciones de datos limitados, y superar los enfoques convencionales y la evaluación radióloga. Específicamente, este marco emplea una estrategia de aprendizaje21 de pocas disparaciones para aprender características discriminativas de un número limitado de casos representativos benignos y malignos. El modelo utiliza un mecanismo de atención espacial para centrarse en regiones clave de la lesión, mejorando así la precisión del modelo para distinguir tumores parótidos benignos de malignos. El modelo fue evaluado mediante una cohorte recogida retrospectivamente de 198 pacientes con tumores de la glándula parótida confirmados patológicamente en nuestra institución. Este estudio integra secuencias estructurales (T1WI, T2WI) y funcionales (DWI) para apoyar información morfológica y funcional. El marco propuesto está diseñado para facilitar la diferenciación preoperatoria entre tumores parótidos benignos y malignos.
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
Todos los datos de pacientes utilizados en este estudio se recopilaron exclusivamente en el Hospital Popular de Wuxi y consistieron en 198 casos de tumor parotídeo confirmados patológicamente. Este estudio fue aprobado por la Junta de Revisión Institucional del Hospital Popular de Wuxi (IRB No. KY24068) y se lleva a cabo de acuerdo con las directrices institucionales y los estándares éticos internacionales. Todos los datos fueron completamente anonimizados antes del análisis.
Adquisición de imágenes por resonancia magnética
Todas las secuencias de resonancia magnética (imágenes ponderadas en T1, T2 y difusión) se adquirieron en un escáner de resonancia magnética de 3,0 Tesla (Siemens MAGNETOM Verio o Prisma) utilizando una bobina de cabeza y cuello de 16 canales. Los parámetros de adquisición fueron los siguientes: imágenes ponderadas en T1 se obtuvieron con TR/TE = 500/15 ms, grosor de corte = 3 mm, matriz = 256 × 256, campo de visión = 240 mm; Se adquirieron imágenes ponderadas en T2 con TR/TE = 4000/90 ms, grosor de corte = 3 mm, matriz = 320 × 320, campo de visión = 240 mm; Se obtuvieron imágenes ponderadas por difusión con TR/TE = 5000/80 ms, valores b = 0 y 1000 s/mm 2, grosor de corte = 3 mm, matriz = 128 × 128, campo de visión = 240 mm, con mapas aparentes de coeficientes de difusión generados automáticamente. Todas las secuencias se adquirieron en el plano axial sin separación entre cortes.
Diseño del estudio
Este estudio retrospectivo analizó datos de resonancia magnética preoperatoria de 198 pacientes con tumores primarios de la glándula parótida confirmados histopatológicamente (107 benignos y 91 malignos). Todos los pacientes se sometieron a exámenes completos de resonancia magnética parotídea en nuestra institución, incluyendo imágenes ponderadas en T1, imágenes ponderadas en T2 y secuencias de imagen ponderadas por difusión, sin tratamiento previo para la lesión parotídea. Utiliza muestras de resección quirúrgica o biopsias de núcleo como estándar de referencia. Los criterios de inclusión fueron un tumor primario de la glándula parótida confirmado histopatológicamente, resonancia magnética preoperatoria con todas las secuencias requeridas disponibles en nuestra institución, y no haber cirugía previa, radioterapia, quimioterapia ni ablación para la lesión parótida. Los criterios de exclusión comprendieron tumores metastásicos en la glándula parótida, artefactos significativos de movimiento o secuencias incompletas que hacían que las imágenes no fueran diagnósticas, y tumores recurrentes tras tratamientos previos. La cohorte total estaba compuesta por 118 hombres (59,6%) y 80 mujeres (40,4%) con edades que iban de 26 a 89 años (media ± DE 53,0 ± 12,8 años), y las características demográficas estratificadas por tipo de tumor fueron las siguientes: grupo benigno (n=107) con 59 hombres (55,1%) y 48 mujeres (44,9%), rango de edad 28–87 años (media ± DE 54,2 ± 12,1 años), y grupo maligno (n=91) con 59 hombres (64,8%) y 32 mujeres (35,2%), rango de edad 26–89 años (media ± DE 51,6 ± 13,4 años); Se empleó un enfoque de muestreo aleatorio estratificado para dividir los 198 pacientes en entrenamiento (70%, N=138), validación (15%, N=30) y test (15%, n=30), preservando la proporción benigna a maligna en todos los subconjuntos (los conjuntos de validación y prueba contenían cada uno 16 casos benignos y 14 malignos), realizando la división a nivel de paciente en lugar de por corte o por imagen, asegurando que todos los conjuntos de entrenamiento, validación y pruebas fueran mutuamente excluyentes, sin solapamiento de pacientes entre ellos, para evitar fugas de datos y permitir una evaluación imparcial de la generalizabilidad del modelo.
Preprocesamiento de datos
El estudio implementó un preprocesamiento estandarizado en todas las imágenes de la resonancia magnética mediante cuatro pasos principales: registro y remuestreo de imágenes, reducción de ruido, aumento de datos y normalización. Para abordar variaciones en los protocolos de resonancia magnética y la posición del paciente, todos los volúmenes T1WI, T2WI y DWI fueron registrados rígidamente en la secuencia T1WI como espacio de referencia y remuestreados a una resolución isotrópica de 1 mm3 mediante interpolación trilineal. A continuación, se realizó la reducción de ruido en todos los volúmenes registrados usando el algoritmo de Media No Local (NLM) 22, con el parámetro de suavizado establecido automáticamente a 0,8 veces la desviación estándar estimada del ruido, una ventana de búsqueda de 21×21×21 vóxeles y una ventana de similitud de 7×7×7 vóxeles. Este enfoque reduce eficazmente el ruido aleatorio mientras preserva detalles estructurales importantes. Posteriormente, para ampliar el tamaño efectivo de la muestra de entrenamiento, mejorar la generalización del modelo y mitigar el sobreajuste en el conjunto limitado de datos, se aplicaron múltiples estrategias de aumento de datos, incluyendo rotación aleatoria (±15°) y escalado aleatorio (0,9–1,1)23,24, exclusivamente sobre la marcha a las imágenes del conjunto de entrenamiento durante cada época, generándose todas las transformaciones usando una semilla aleatoria fija de 42 para una reproducibilidad total; los conjuntos de validación y prueba permanecieron sin aumentar para garantizar la evaluación objetiva del modelo. Finalmente, para eliminar variaciones sistemáticas en la intensidad de la señal entre diferentes dispositivos y sesiones de escaneo, se aplicó la normalización Z-score a cada volumen restando la media y dividiéndola por la desviación estándar, tras lo cual los valores normalizados de píxeles se escalaron linealmente al rango [0, 1] para cumplir con los requisitos de entrada del marco de aprendizaje profundoPyTorch 25.
Arquitectura del modelo
El presente estudio propone un marco multimodal de aprendizaje profundo basado en el aprendizaje de pocas disparos que integra información complementaria de múltiples secuencias de resonancia magnética (imagen ponderada en T1, imagen ponderada en T2 e imagen ponderada por difusión) e incorpora un mecanismo de atención espacial a múltiples escalas para mejorar la representación de características y el rendimiento en la clasificación bajo condiciones de muestra limitada. Todos los volúmenes de la resonancia magnética se adquirieron en el plano axial del mismo escáner; antes de la entrada, se sometieron a un registro rígido para asegurar la alineación espacial entre secuencias, con la calidad del alineamiento verificada manualmente por un radiólogo senior, y los volúmenes 3D completos centrados en la lesión parótida fueron recortados a una región estandarizada de interés, remuestreados hasta resolución isotrópica y redimensionados a dimensiones consistentes. Al combinar el paradigma de aprendizaje de pocas fotos, el módulo de atención espacial multiescala y la fusión de características intermodales mediante concatenación canal a canal, el marco aborda los desafíos asociados a la generalización de modelos en entornos con pocos datos y permite un aprendizaje robusto de características discriminativas a partir de un pequeño número de muestras anotadas, con la arquitectura completa ilustrada en la Figura 1. Aunque el conjunto de datos incluye 198 pacientes, se adopta el enfoque de pocas disparos porque los tumores parotídeos presentan una alta heterogeneidad en imágenes y los datos volumétricos multimodales anotados siguen siendo relativamente limitados en relación con la complejidad de la tarea, simulando así mejor escenarios clínicos del mundo real con escasos ejemplos etiquetados; también se evaluó un enfoque convencional de entrenamiento supervisado para comparación, y las ventajas de la configuración de pocas disparos se demuestran en los estudios de ablación en la sección de Resultados. La red troncal emplea R3D-1826 (una variante 3D de ResNet-18 con convoluciones espaciotemporales completas), preentrenada en Kinetics-400, como extractor de características de peso compartido para cada secuencia de resonancia magnética; Durante la adaptación, se utiliza una cabeza de red prototípica para la clasificación de pocas tomas, insertando el módulo de atención espacial multiescala siguiendo las etapas convolucionales de cada rama específica de modalidad, seguida de fusión cross-modal y un clasificador compartido. La novedad del mecanismo propuesto de atención espacial multiescala radica en su uso de caminos convolucionales paralelos con tamaños de núcleo de 1×1, 3×3 y 5×5, donde cada camino genera de forma independiente un mapa de atención espacial en un campo receptivo diferente que posteriormente se normaliza usando softmax y se fusiona adaptativamente con las características de entrada mediante suma ponderada; Este diseño captura explícitamente las características de la lesión a través de múltiples escalas espaciales—desde detalles locales finos como la heterogeneidad de la señal interna hasta estructuras contextuales más amplias como los márgenes tumorales e interfaces con los tejidos circundantes—y ofrece un rendimiento superior en comparación con los módulos de atención convencionales. La estrategia de ajuste fino avanza en dos fases: inicialmente, las capas de columna vertebral preentrenadas de R3D-18 se congelan para conservar representaciones espaciotemporales generales, mientras que solo se entrenan los módulos de atención, las capas de fusión y la cabeza prototípica; posteriormente, los dos últimos bloques residuales (capa 3 y capa 4) de cada columna vertebral se descongelan para permitir la adaptación de extremo a extremo a características volumétricas específicas de la resonancia magnética. El entrenamiento se realizaba usando el optimizador Adam con una tasa de aprendizaje inicial de 0,0001, reducida por un factor de 0,1 cada 20 épocas mediante la programación de decaimiento por pasos; El modelo pasó por 100 épocas de entrenamiento episódico con un tamaño de lote de 8 episodios (cada uno compuesto por conjuntos de soporte y consultas), siguiendo el protocolo estándar de pocas disparos en una configuración K-shot bidireccional (con K=5 durante el metaentrenamiento y evaluación primaria); todos los experimentos se realizaron en una GPU de alto rendimiento con 24 GB de memoria, y se aplicó una semilla aleatoria fija de 42 durante la partición de datos, inicialización de pesos y aumento para asegurar la reproducibilidad completa.
Paradigma de tareas de aprendizaje en pocos disparos para la clasificación de tumores de glándulas parótidas
Dada la limitada disponibilidad de datos anotados de alta calidad para tumores de la glándula parótida y la alta heterogeneidad de imagen de estas lesiones, este estudio adopta un paradigma de aprendizaje basado en métricas de pocas fotos, aunque el conjunto total de datos comprende 198 pacientes. La estructura de tareas conjunto de soporte–conjunto de consultas se emplea para simular el proceso de razonamiento diagnóstico en la práctica clínica, donde normalmente solo hay un pequeño número de ejemplos representativos disponibles para subtipos tumorales raros o heterogéneos. Cada tarea de entrenamiento está definida en un formato K-shot de N-vías (N=2, correspondiente a la clasificación benigna/maligna), lo que permite al modelo aprender representaciones discriminativas de características a partir de un pequeño número de muestras. Específicamente, para cada tarea, el conjunto de soporte incluye K muestras multimodales (imagen ponderada T1, imagen ponderada T2 e imagen ponderada por difusión) por clase para construir prototipos de clase, mientras que el conjunto de consultas contiene muestras a clasificar. El modelo realiza decisiones de clasificación basadas en métricas de distancia calculando la similitud entre las características de la muestra de consulta y los prototipos de clase en el espacio de incrustación. Este mecanismo de aprendizaje es notable por su capacidad para liberar el modelo de la dependencia de datos anotados a gran escala, haciéndolo así más adecuado para aplicaciones prácticas en entornos clínicos con pocos datos. Para comparación directa, también se evaluó un enfoque convencional de entrenamiento supervisado utilizando el conjunto completo de entrenamiento sin muestreo episódico de pocas disparos, y las ventajas de la configuración de pocas disparos en términos de generalización y estabilidad bajo condiciones de muestra limitada se demuestran cuantitativamente en los estudios de ablación presentados en la sección de Resultados.
En la fase de clasificación, este estudio emplea una red prototípica como clasificador. Para cada categoría c en el conjunto de soporte, el vector prototipo p_c se calcula como la media de las muestras de soporte embebidas:
(1)
donde f(·) denota la función de incrustación (extractor de características),
es la i-ésima muestra de soporte de la categoría c, y K es el número de disparos por clase.
Para una muestra de consulta dada x, la probabilidad de pertenecer a la categoría c se calcula usando la función softmax sobre distancias euclidianas negativas:
(2)
donde d(·, ·) representa la función de distancia euclidiana.
Arquitectura basada en la fusión de características multimodales
Para aprovechar plenamente el valor complementario de los datos de resonancia magnética multisecuencia, este estudio diseñó una red de fusión de características de tres ramas que procesa por separado las secuencias de imagen ponderada en T1 (T1WI), T2 y de imagen ponderada por difusión (DWI). Cada secuencia primero se extrae características utilizando un modelo R3D-18 de peso compartido preentrenado en el conjunto de datos Kinetics-400 con pesos obtenidos de la implementación oficial de PyTorch TorchVision; durante la adaptación, se aplicó una estrategia de ajuste fino en dos etapas en la que todas las capas de la columna vertebral preentrenada se mantuvieron inicialmente fijas para preservar las representaciones espaciotemporales generales, mientras que solo se entrenaban los módulos de atención espacial multiescala, las capas de fusión cross-modal y la cabeza de red prototípica, tras lo cual se descongelaban los dos últimos bloques residuales (capa 3 y capa4) de cada columna vertebral para su adaptación de extremo a extremo a características volumétricas específicas de la resonancia magnética. con las capas anteriores (capa 1 y capa 2) permaneciendo congeladas durante todo el entrenamiento. Esta red utiliza núcleos convolucionales 3D que se deslizan a través de dimensiones espaciales y temporales para capturar eficazmente la morfología volumétrica tumoral e información contextual espacial. Durante la fusión de características, se emplea una estrategia cross-modal basada en la concatenación en la que las representaciones de características mejoradas por la atención de las tres modalidades se concatenan a lo largo de la dimensión del canal para formar un vector multimodal completo. Este enfoque de fusión preserva la información única de cada modalidad—la claridad anatómica de T1WI, la sensibilidad a la composición tisular de T2WI y la funcionalidad de densidad celular de DWI—al tiempo que logra una complementariedad efectiva de la información diagnóstica, aumentando así significativamente la riqueza de expresión de características y el poder discriminativo.
Mecanismo de Atención Espacial Multiescala
Este estudio incorpora un módulo de atención espacial a varias escalas para capturar características de lesiones a diferentes escalas espaciales. Como se muestra en la Figura 2, el módulo emplea caminos convolucionales paralelos con tamaños de núcleo de 1×1, 3×3 y 5×5. Cada camino genera de forma independiente un mapa de atención espacial, que se normaliza usando softmax y luego se fusiona adaptativamente con las características de entrada mediante suma ponderada. Este diseño permite al modelo centrarse en regiones más relevantes para distinguir lesiones benignas de malignas, al tiempo que reduce la influencia de áreas de fondo irrelevantes. Los mapas de atención resultantes pueden ayudar a resaltar áreas de interés en las imágenes.
DISPONIBILIDAD DE DATOS:
Un subconjunto representativo de secuencias de resonancia magnética multimodal totalmente anonimizadas (T1WI, T2WI, DWI) de la cohorte del estudio está disponible públicamente en el repositorio Zenodo en: https://doi.org/10.5281/zenodo.17744149 (Versión v1). Estos datos se comparten bajo una licencia Creative Commons Attribution 4.0 International (CC-BY 4.0) sin restricciones de acceso. El conjunto de datos completo y anonimizado aún no está disponible públicamente y será publicado en una versión posterior del repositorio tras la publicación formal de este manuscrito, sujeto a la aprobación institucional y ética.
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
Resumen del rendimiento del modelo
Para evaluar el rendimiento diagnóstico del modelo, se empleó un conjunto de métricas estándar, incluyendo precisión, exactitud, recuerdo y puntuación F1. Bajo la configuración de 5 disparos bidireccionales, el modelo multimodal de aprendizaje de pocas inyecciones basado en R3D-18 logró los siguientes resultados en el conjunto de pruebas para la clasificación de tumores de glándulas parótidas: precisión del 9...
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
En este estudio, planteamos la hipótesis de que un marco multimodal de aprendizaje profundo de pocos disparos, que integra la resonancia magnética multisecuencia (imágenes ponderadas en T1, T2 y ponderadas por difusión) con un mecanismo de atención espacial a múltiples escalas, puede diferenciar con precisión tumores benignos y malignos de la glándula parótida bajo condiciones limitadas de datos anotados y superar tanto los enfoques convencionales de aprendizaje profundo como a los radió...
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
Los autores no declaran que no hay intereses financieros o no financieros en competencia.
Esta investigación fue financiada por la Fundación Nacional de Ciencias Naturales de China (Nº 82473200), el Proyecto Clave de Investigación Médica de la Comisión Provincial de Salud de Jiangsu (Nº K2023061) y el proyecto de la Comisión Provincial de Salud de Jiangsu sobre Salud de los Mayores (KLM2023019) para YJH
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
| Nombre | Empresa | Número de catálogo | Comentarios |
|---|---|---|---|
| Grad-CAM | https://github.com/jacobgil/pytorch-grad-cam | ||
| NumPy 1.25 | Desarrolladores NumPy | https://numpy.org/ | |
| Pandas 2.1 | Pandas Developers | https://pandas.pydata.org/ | |
| Pycharm | JetBrains | https://www.jetbrains.com/zh-cn/pycharm/ | |
| Python 3.10 | Fundación de Software Python | https://www.python.org/ | |
| PyTorch 2.1 | Meta Platforms, Inc. | https://pytorch.org/ | |
| scikit-learn 1.3 | Desarrolladores de Scikit-learn | https://scikit-learn.org/ | |
| SHAP | https://github.com/slundberg/shap | ||
| Sistema de resonancia magnética Siemens MAGNETOM Prisma 3.0T | Siemens Healthineers | https://www.siemens-healthineers.cn/magnetic-resonance-imaging/3t-mri-scanner/magnetom-prisma |
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE
Solicitar permiso