El trabajo propuesto tiene como objetivo diseñar e implementar una nueva técnica de aprendizaje por transferencia para permitir una mejor comprensión de los resultados de salud a largo plazo y respaldar conocimientos epidemiológicos personalizados.
Research Article
El trabajo propuesto tiene como objetivo diseñar e implementar una nueva técnica de aprendizaje por transferencia para permitir una mejor comprensión de los resultados de salud a largo plazo y respaldar conocimientos epidemiológicos personalizados.
Las secuelas posagudas del SARS-CoV-2 (PASC) representan un entorno de riesgo extremo con graves consecuencias, especialmente para los adultos de mediana edad y mayores y aquellos con afecciones crónicas como enfermedades cardiovasculares, cánceres, enfermedades respiratorias y diabetes. Los trastornos físicos incluyen dolores corporales severos y persistentes, fatiga y dificultad con los movimientos corporales. De manera similar, los trastornos del estado de ánimo como la depresión, los cambios de humor, los sentimientos de desesperanza y la dificultad para concentrarse son predictores significativos de PASC. Las personas, predominantemente de mediana edad y ancianos, enfrentan mayores consecuencias físicas y mentales, incluidas hospitalizaciones frecuentes, condiciones médicamente inestables y, en algunos casos, muertes inesperadas. La identificación oportuna de PASC es esencial para mitigar la gravedad de los problemas de salud asociados. Esta investigación recomienda un modelo de transferencia latente para integrar datos de pacientes de diferentes regiones, extraer información sobre los datos y ofrecer soluciones de atención médica personalizadas. Este estudio presenta el potencial del modelo de aprendizaje por transferencia latente para mejorar la simplificación de datos, la generalización, la personalización, la detección de conocimientos, la variabilidad, la escalabilidad y la adaptabilidad para mejorar los resultados de salud pública.
La enfermedad por coronavirus de 2019 (COVID-19) se identificó por primera vez en Wuhan, China. El 31de diciembre de 2019, China informó a la Organización Mundial de la Salud (OMS) sobre enfermedades inflamatorias pulmonares de etiología desconocida observadas en la ciudad de Wuhan, provincia de Hubei, China1. Desde el 31de diciembre de 2019 hasta el 3de enero de 2020, 44 personas fueron infectadas por este virus y tenían antecedentes de contacto con el mercado mayorista: "Huanan Seafood". Inicialmente, los pacientes tenían fiebre, fatiga y tos seca. El brote de este virus ocurrió el 30de enero de 2020 y fue anunciado como una emergencia de salud pública de importancia internacional por la OMS1. A mediados de febrero de 2020, más de 25 países se vieron afectados por el nuevo coronavirus, con 70.635 y 794 casos en China y otros países, respectivamente. Mil setecientas setenta y dos muertes (1772) en China y tres muertes en todos los países fueron declaradas oficialmente. El 31de diciembre de 2019, se informaron varios casos de infección por neumonía y la OMS informó que no se informaron muertes en Wuhan. En Tailandia, el primer caso se anunció en Bangkok el 13de enero de 2020 para una mujer china de 61 años que regresó de la ciudad de Wuhan el 8de enero de 2020 después de visitar la ciudad de Wuhan. Tenía síntomas con dolor de garganta, tos, fiebre, escalofríos y dolor de cabeza. La persona dio positivo en la prueba de COVID-19 en vigilancia térmica el 8de enero de 2020 y fue ingresada en el hospital ese día por oficiales tailandeses. La persona se recuperó de la enfermedad. La estructura de secuenciación genética del virus fue compartida por el gobierno chino y permitió que más países examinaran y diagnosticaran a los pacientes de manera eficiente2.
En los Estados Unidos de América, el primer caso se informó en Washington el 19de enero de 2020 para un hombre de 35 años que regresó de la ciudad de Wuhan el 15de enero de 2020 después de su reunión familiar. Tenía síntomas de tos y fiebre desde el 15de enero de 2020 y se le aconsejó que se sometiera a pruebas médicas. No tuvo contacto con una persona infectada con COVID-19, pero durante su visita a Wuhan, se infectó con COVID-19 debido al brote en China. Dio positivo en la prueba de COVID el 20de enero de 2020 y fue puesto en cuarentena en una unidad de aislamiento aéreo de un centro médico. Después de su ingreso en la sala de aislamiento, estaba normal con una frecuencia cardíaca de 110/min, presión arterial de 134/87 mmHg, temperatura corporal de 37,2 °C, frecuencia respiratoria de 16 lpm y saturación de oxígeno del 96% con auscultación pulmonar normal. Se realizaron pruebas periódicas de monitoreo e investigación de COVID, y se observó tos, náuseas y vómitos durante dos días3. Al segundo día de ingreso, se quejó de molestias abdominales y, al día siguiente, no hubo evidencia de anomalías en la radiografía de tórax. Sin embargo, al quinto día, se observó evidencia significativa de neumonía en la radiografía de tórax y la saturación de oxígeno se redujo al 90%. Se le aconsejó que se sometiera a oxigenoterapia, que se complementó para mejorar los niveles de saturación. Aloctavo día, su condición mejoró y fue dada de alta de la clínica. En India, el primer caso se informó en Kerala el 27de enero de 2020 para una mujer de 20 años que había regresado de la ciudad de Wuhan debido al brote de COVID-19 en China. Estuvo asintomática desde el 23de enero de 2020 hasta el 26de enero de 2020 y fue testigo de dolor de garganta y tos leve desde el 27de enero de 2020. No tuvo contacto con las personas infectadas con COVID-19, pero durante su viaje en tren de Wuhan a Kunming, notó a varias personas con problemas respiratorios, resfriados y tos. Por lo tanto, las autoridades del gobierno de Kerala le ordenaron que permaneciera en un lugar aislado y visitara un centro médico por cualquier síntoma de COVID desarrollado en los próximos días. Después de su ingreso en el hospital general, estaba normal con una frecuencia de pulso de 82/min, presión arterial de 130/80 mmHg, temperatura corporal de 98.5 ° F y saturación de oxígeno del 96% con auscultación pulmonar normal. Se realizaron pruebas periódicas de monitoreo e investigación de COVID el día3, 7 y 20 desde el día de la enfermedad. Las pruebas de hisopos orofaríngeos se realizaron el primer día y cada día alterno durante 23 días a partir del día de la enfermedad, y dieron negativo a partirdel día 17. Fue autorizada con todas las pruebas y fue dada de alta del hospital el 20de febrero de 20204.
En el Reino Unido, el primer caso de COVID-19 fue notificado el 23de enero de 2020 por una mujer de 50 años que había regresado de la ciudad de Wuhan después de su visita. Inicialmente, era asintomática y desarrolló síntomas de fiebre, debilidad, dolor de garganta y tos seca el 26de enero de 2020. Después de su ingreso en el hospital general, estaba normal con una frecuencia respiratoria de 18/min, presión arterial de 120/80 mmHg, temperatura corporal de 37,6 °C y saturación de oxígeno del 97%. Se realizaron pruebas periódicas de monitoreo e investigación de COVID, y la condición del paciente es clínicamente estable. Los exámenes iniciales informaron que tenía linfopenia leve y un aumento de la proteína C reactiva. Después del3er día de ingreso en el hospital, fue liberada de todos los síntomas y las pruebas de hisopo orofaríngeo se revelaron como COVID negativas desde el segundo día en el hospital. Estuvo aislada durante 2 semanas y sus pruebas de hisopos de nariz y garganta fueron negativas5.
Los coronavirus (CoV) se descubrieron en la década de 1960 y se clasificaron de la siguiente manera. Orthornavirae se denomina el reino/reino de varios virus que contienen genomas hechos de ácido ribonucleico (ARN) y que se traducen con una ARN polimerasa dependiente de ARN (RdRp). RdRp transcribe el genoma del ARN viral en ARN mensajero (ARNm) y replica el genoma. Las características de los virus que se encuentran en Orthornavirae incluyen evolución, mutaciones genéticas, recombinación y reordenamiento6. Los genomas que están hechos de ARN son de tres tipos, a saber, virus de ARN de cadena positiva, virus de ARN de cadena negativa (virus -ssRNA) y virus de ARN bicatenario (virus dsRNA). Los virus de ARN de cadena positiva (+virus de ARNss) son una colección de virus asociados que tienen ARN monocatenario de sentido positivo. El genoma del virus +ssRNA se puede utilizar como ARN mensajero (ARNm) y los ribosomas de las células huésped lo transforman directamente en proteínas relacionadas con el virus. Los virus +ssRNA están asociados con los filos como Pisuviricota, Kitrinoviricota y Lenarviricota. Los virus de ARN de cadena positiva contienen varios patógenos como el hepacivirus C, el dengue, el ébola, el sarampión, la rabia, la gripe, el síndrome respiratorio agudo severo CoV, el coronavirus CoV del síndrome respiratorio de Oriente Medio y el síndrome respiratorio agudo severo CoV7. Los virus de ARN de cadena negativa (virus -ssRNA) son una colección de virus asociados que tienen ARN monocatenario de sentido negativo. El genoma del virus -ssRNA puede verse como ARN mensajero (ARNm) y producido por una enzima llamada ARN polimerasa dependiente de ARN (RdRp). -Los virus de ssRNA constituyen el filo Negarnaviricota. Los virus de ARN de cadena negativa contienen dos ramas principales en el filo, a saber, Haploviricotina y Polyploviricotina. Los virus ssRNA de vertebrados importantes son el ébola, la hanta, la influenza, la fiebre de Lassa y la rabia. Los virus de ARN bicatenario (virus dsRNA) son una colección de virus polifiléticos que tienen genomas de ARN bicatenario. El genoma de dsRNA transcribe un +ssRNA por la ARN polimerasa dependiente de ARN viral (RdRp). El genoma del virus +ssRNA se puede utilizar como ARN mensajero (ARNm) y los ribosomas de las células huésped lo transforman abiertamente en proteínas relacionadas con el virus. Mientras que el genoma del virus -ssRNA puede servir como ARN mensajero (ARNm) y ser producido por una enzima ARN polimerasa dependiente de ARN (RdRp). Los virus dsRNA están asociados con los filos Duplornaviricota y Pisuviricota. Los virus de ARN bicatenario incluyen rotavirus (que afectan a niños pequeños) y virus de la lengua azul (que afecta a bovinos y ovinos)8.
Pisuviricota se denomina un filo de virus de ARN, que incluye todos los virus + ssRNA y dsRNA. Su clasificación inferior contiene tres clases, a saber, Duplopiviricetes, Pisoniviricetes y Stelpaviricetes. Pisoniviricetes es una clase de virus +ssRNA que infectan y contaminan eucariotas. Su clasificación inferior contiene tres subclases, a saber, Nidovirales, Picornavirales y Sobelivirales. Nidovirales es un orden de +ssRNA envuelto que infecta y contamina vertebrados e invertebrados9. Contiene un suborden de virus, a saber, Abnidovirineae, Cornidovirineae, Nanidovirinae, Arnidovirineae, Mesnidovirineae y Tornidovirineae. Varias familias se reconocen bajo Nidovirales, como Abyssoviridae, Coronaviridae, Nanghoshaviridae, Nanhypoviridae, Arteriviridae, Medioniviridae, Cremegaviridae, Mesoniviridae, Euroniviridae, Gresnaviridae, Roniviridae, Tobaniviridae, Mononiviridae y Olifoviridae8. Coronaviridae es una familia de virus +ssRNA con envoltura que infecta a mamíferos, anfibios y aves. Su clasificación inferior contiene dos subfamilias, Letovirinae y Orthocoronavirinae. Los miembros de Orthocoronavirinae se identifican como coronavirus. Los coronavirus son una subfamilia de Coronaviridae, que está relacionada con los virus de ARN que causan infecciones en mamíferos y aves. En mamíferos y aves, estos virus causan infecciones de hisopos respiratorios de leves a graves, como infecciones de hisopos de las vías respiratorias superiores e infecciones de hisopos de las vías respiratorias inferiores10. Estos virus causan SARS, MERS y COVID-19 en humanos y algunos mamíferos, diarrea en cerdos y vacas, hepatitis y encefalomielitis. Los coronavirus están envueltos +ssRNA que pertenecen al Reino de Orthornavirae, Phylum of Pisuviricota, Class of Pisoniviricetes, Subclass of Nidovirales, Family Coronaviridae y Subfamily of Orthocoronavirinae. Los coronavirus se clasifican en cuatro géneros, a saber, coronavirus alfa, coronavirus beta, coronavirus gamma y coronavirus delta11. A partir de esta investigación, se forman las siguientes hipótesis.
La mutación de la espiga del Coronavirus del Síndrome Respiratorio Agudo Severo-2 (SARS-CoV-2) está extremadamente glicosilada. Es de vital importancia examinar las consecuencias biológicas de estas mutaciones de pico. Más de una mutación puede originarse en la misma posición en la secuencia de la proteína de pico. Las secuencias de proteínas de pico brindaron la oportunidad de estimar el amplio espectro de mutaciones detectadas en todo el mundo, y están representadas en la Tabla 1. Las mutaciones consideradas fueron consecuencia de la transmisión del virus de persona a persona. La vacunación provocó reacciones inmunitarias capaces de neutralizar poderosamente el SARS-CoV-212. Aunque las investigaciones científicas descubrieron el advenimiento de variantes del SARS-CoV-2 que ocultan mutaciones en el pico, el objetivo principal siguió siendo la neutralización de los anticuerpos del huésped. Hubo una indicación evolutiva de neutralización reducida de algunas variantes del SARS-CoV-2 después de la vacunación. Los fabricantes de vacunas formularon varias plataformas para una posible actualización de las estructuras de las vacunas, y se realizaron estudios de variaciones genéticas y antigénicas en la población mundial de virus con experimentos para iluminar las influencias fenotípicas de las mutaciones13.
La base de datos de virus del Centro Nacional de Información Biotecnológica (NCBI) contiene 10333 proteínas de pico del SARS-CoV-2 humano de África, Asia, Europa, América del Norte, América del Sur y Oceanía. La diseminación de varias mutaciones en las proteínas de pico examinadas desde diferentes ubicaciones geográficas se muestra en la tabla anterior. Los detalles del coronavirus Alfa, Beta, Gamma y Delta con sus géneros, características y descripciones se proporcionan en la tabla anterior. Cada género se describe por sus características, como fundamento, variantes, significado, forma, medida, estructura, fusión de membranas, liberación, contaminación y síntesis14.
Como se menciona en la Tabla 1, las cepas de virus como HCoV-229E, HCoV-OC43, HCoV-NL63 y HCoV-HKU1 observaron síntomas leves a moderados de enfermedad, mientras que el SARS-CoV, el MERS-CoV y el SARS-CoV-2 observaron síntomas críticos graves de enfermedad en humanos. Los microorganismos virales pasan a través del cuerpo e infectan la célula huésped. Dependiendo de la categoría de coronavirus, infecta células en diferentes partes del cuerpo huésped. Tan pronto como se ha adherido a la célula fuerte y sana, entra en ella15. Una vez que el virus se asiente dentro de la célula huésped, se despejará y su ADN y ARN emanarán y viajarán hacia el núcleo. Se moverán en un fragmento, lo que dará lugar a varias reproducciones del virus. Estas copias saldrán del núcleo para ser ensambladas y recibir proteínas, que protegen su ADN y ARN. Estas nuevas reproducciones del virus abandonarán las células previamente infectadas y enfermas para contaminar otras células huésped sanas nuevamente y multiplicarse. Si el sistema inmunológico del huésped logra combatir el coronavirus, el individuo no se enfermará; de lo contrario, pueden ocurrir complicaciones poco saludables. Si el sistema inmunológico no logra controlar el coronavirus, se produce una patogénesis. Con esto, el virus ingresa al cuerpo e infecta diferentes órganos. Dependiendo de la gravedad de los signos o síntomas, el individuo descansará o buscará asistencia médica16. El ciclo de vida y varias cepas de coronavirus se representan en la Figura 1.
La figura anterior muestra el ciclo de vida y las etapas del coronavirus de manera detallada. Hay siete etapas, a saber, (1) unión y admisión, (2) fusión y endocitosis, (3) proteólisis, (4) traducción y escisión, (5) replicación, (6) exocitosis y (7) liberación de virus maduros. En la fase de adhesión y admisión, los microorganismos del Coronavirus son admitidos en el huésped, y el objetivo es el reconocimiento resistente al huésped y las estrategias de intervención. Para ingresar a las células huésped, estos virus primero se adhieren al receptor de superficie de una célula para unirse, luego ingresan a los endosomas y, finalmente, comienzan la fusión. Más tarde, el coronavirus se fusiona con las vainas lisosomales y relacionadas con el virus en la célula huésped. Una proteína de pico fijada en la superficie del virus interfiere con la entrada de estos virus. La endocitosis es un proceso celular en el que una sustancia es transportada a la célula huésped17. El material que se va a adoptar está encerrado por una serie de vainas celulares, que luego se disparan dentro de la célula huésped para generar una vesícula que abarca la sustancia ingerida. La endocitosis comprende pinocitosis y fagocitosis; el primero es beber células y el segundo es comer células. La proteólisis es el desglose de proteínas relacionadas con virus en polipéptidos/aminoácidos menores. La conversión estructurada de ARNm es un proceso postranscripcional que frena la comunicación génica y diverge rápidamente la profusión de proteínas. Tiene una parte principal en abundantes procedimientos biológicos como el crecimiento celular, el progreso celular, la plasticidad sináptica, las retortas de estrés y el desarrollo viral productivo18. El procedimiento de traducción viral se puede dividir en tres fases, a saber, instigación, elongación y disolución.
La replicación viral es el proceso de generación de virus genéticos a través de la contaminación de las células huésped infectadas. Para que ocurra la reproducción viral, los virus primero deben ingresar a la célula huésped. Al replicar repetidamente su genoma viral y encapsular estas copias, los virus sobreviven y continúan propagándose infectando nuevas células huésped19. La exocitosis es el mecanismo a través del cual las vesículas que contienen partículas virales se secretan y liberan de la célula infectada, lo que permite que los virus recién formados ingresen al cuerpo huésped e infecten células sanas adicionales. Las secuelas postagudas del SARS-CoV-2 (PASC) se reconocen como un síndrome que afecta principalmente a los pulmones, aunque puede afectar múltiples órganos, lo que resulta en daño orgánico o incluso insuficiencia orgánica20. Tales complicaciones pueden provocar la muerte o problemas de salud a largo plazo. Por ejemplo, el corazón puede desarrollar un mayor riesgo de insuficiencia cardíaca u otras complicaciones; los pulmones pueden sufrir dificultades respiratorias a largo plazo después de la neumonía; el cerebro puede verse afectado por accidentes cerebrovasculares, convulsiones o síndrome de Guillain-Barré; y los riñones pueden sufrir daños que pueden provocar un shock séptico. La lesión hepática puede ocurrir debido a un desequilibrio enzimático, mientras que la rabdomiólisis conduce a la descomposición del tejido muscular, liberando mioglobina en el torrente sanguíneo, que puede volverse fatal si los riñones no pueden filtrarla rápidamente. Las complicaciones adicionales incluyen la formación de coágulos sanguíneos anormales que causan hemorragia interna e insuficiencia orgánica, infecciones secundarias por bacterias como estreptococos o estafilococos, coagulación intravascular diseminada debido a respuestas de coagulación disfuncionales y fatiga crónica, a menudo acompañada de niebla mental, cansancio intenso, mareos o deterioro del pensamiento. Sobre la base de estos desafíos, se proponen las siguientes hipótesis: H1: La utilización de un algoritmo de aprendizaje por transferencia puede mejorar considerablemente la precisión de la predicción y la transferibilidad de los modelos mediante la aplicación de datos epidemiológicos para identificar PASC específicos de la región. H1a: Los modelos de aprendizaje profundo que se ajustan con datos epidemiológicos funcionan mejor que otros modelos. H1b: La combinación de determinantes PASC específicos de la región con modelos de aprendizaje por transferencia mejora la precisión y la eficiencia de la clasificación y la agrupación. H1c: Esta combinación también puede revelar patrones específicos de la región no revelados previamente o pasados por alto. H1d: El aprendizaje por transferencia permite reducir el tiempo de entrenamiento y acelerar la convergencia en comparación con otros modelos.
Access restricted. Please log in or start a trial to view this content.
Este estudio se realizó de acuerdo con las pautas éticas para la investigación con datos humanos. Todos los datos de los pacientes utilizados en este estudio se anonimizaron por completo antes del acceso y el análisis. No se utilizó información de identificación personal. El protocolo de investigación fue revisado y aprobado por la Junta de Revisión Institucional (IRB), de conformidad con la Declaración de Helsinki. Cuando correspondía, los permisos de acceso a los datos se obtuvieron de las autoridades pertinentes o de los repositorios de datos. Como este estudio implica un análisis secundario de datos no identificados, el IRB renunció al consentimiento informado. El modelo de transferencia latente propuesto es una técnica de aprendizaje semisupervisado basada en el aprendizaje automático diseñada para encontrar los patrones ocultos y transferirlos del conjunto de datos de origen al conjunto de datos de destino, lo que garantiza que sea muy apropiado para analizar problemas epidemiológicos de PASC16. Las afecciones posteriores a COVID a menudo se manifiestan con diversos síntomas en diferentes poblaciones, lo que lleva a datos inconsistentes y escasos. El trabajo propuesto aborda el problema de los datos dispersos debido a diversos síntomas en diferentes regiones mediante el aprendizaje de representaciones latentes mejoradas para representar patrones de salud ocultos de los conjuntos de datos y representándolos como conjuntos de datos emergentes. Para realizar esta conversión, estas técnicas de transferencia latente utilizan codificadores automáticos o variacionales para representar los datos de origen y destino en un espacio latente común. Y este espacio común salvaguarda los patrones ocultos obtenidos, ya que los grupos de síntomas posteriores a COVID están bien conservados en diversas regiones21. El prototipo puede avanzar aún más a través de una generalización mejorada con adaptación de dominio. Con este enfoque, el modelo puede ayudar a reconocer y predecir grupos en riesgo y apoyar la vigilancia de la salud pública en áreas remotas. Este trabajo también mejora el aprendizaje al reducir la dependencia de datos completamente etiquetados. Con esto, el enfoque propuesto se convierte en una poderosa herramienta para analizar las brechas debido a su enfoque generalizado hacia diversas poblaciones.
1. Fuentes de datos y recopilación
Este estudio utilizó conjuntos de datos de Kaggle disponibles públicamente (conjunto de datos de enfermedades cardiovasculares, conjunto de datos de predicción del cáncer, conjunto de datos de predicción de diabéticos en etapa temprana y conjunto de datos de predicción de salud mental). Por lo tanto, no se requiere la aprobación del IRB en esta presentación.
Para conjuntos de datos que involucran datos de imágenes, el preprocesamiento se realizó utilizando Python con bibliotecas TensorFlow y OpenCV. Los pasos de preprocesamiento incluyeron el cambio de tamaño de la imagen (por ejemplo, 224 × 224 píxeles), la conversión en escala de grises o RGB, la normalización de los valores de píxeles al rango [0, 1] y las técnicas de aumento de datos (rotación, volteo, zoom) para mejorar la generalización del modelo y reducir el sobreajuste. Luego, las matrices de imágenes se convirtieron en matrices NumPy para su posterior procesamiento y entrada de modelos.
Para la selección de características, la eliminación recursiva de características (RFE) se implementó utilizando la clase RFE de Scikit-learn, generalmente junto con un estimador de regresión logística o bosque aleatorio. El número de características seleccionadas varió según el conjunto de datos, pero una configuración común fue reducir la dimensionalidad a las 10-15 características más influyentes en función de la puntuación recursiva. Este método mejoró la precisión de la clasificación al tiempo que redujo la complejidad computacional y el sobreajuste del modelo.
Este estudio utilizó cuatro conjuntos de datos disponibles públicamente de Kaggle. El conjunto de datos de enfermedades cardiovasculares, el conjunto de datos de predicción del cáncer de mama, el conjunto de datos de predicción de diabetes en etapa temprana y el conjunto de datos de predicción de salud mental. Estos conjuntos de datos se descargaron directamente de Kaggle y consisten en datos tabulares estructurados que contienen atributos clínicos y basados en encuestas. El preprocesamiento de datos se realizó utilizando Python con bibliotecas clave como Pandas para la manipulación de datos, NumPy para operaciones numéricas y Scikit-learn para el preprocesamiento de datos, la selección de características y el modelado. Los valores faltantes se imputaron utilizando estrategias de media o moda, las variables categóricas se codificaron a través de One-Hot o Label Encoding, y las características numéricas se escalaron usando StandardScaler o MinMaxScaler. Para las clases desequilibradas, se aplicó SMOTE (Synthetic Minority Oversampling Technique) del paquete imblearn. La eliminación recursiva de características (RFE) se implementó utilizando el módulo RFE de Scikit-learn con estimadores como Regresión logística y Bosque aleatorio, y el número de características generalmente se redujo a las 10-15 más influyentes en función de las métricas de rendimiento del modelo, como ROC-AUC y precisión.
2. Arquitectura del modelo
Esta investigación propone una variante del algoritmo de red neuronal llamado modelo de transferencia latente para entrenar imágenes de entrada de la base de datos de imágenes COVID-19. Este trabajo es eficaz para superar el problema del gradiente de desaparición al construir una red neuronal profunda. Aunque hay varias variantes de redes neuronales disponibles con diferentes configuraciones de capas, este trabajo se centra principalmente en la implementación de técnicas de aprendizaje residual durante el proceso de entrenamiento de redes neuronales profundas. El modelo de transferencia latente propuesto utiliza un algoritmo mejorado de ResNet-50 con un marco de capa convolucional de 7 x 7, junto con redes de capas aplanadas y densas. Estas capas se utilizan en la transformación de imágenes y la clasificación multiclase de pacientes con PASC, por región, para extraer patrones22. Este trabajo considera imágenes de entrada de tamaño 256 x 256 x 3, utilizando hiperparámetros eficientes, comportamiento de aprendizaje, procedimientos de optimización y volúmenes de lotes. El modelo de transferencia latente propuesto considera un conjunto de datos de 12,946 imágenes para clasificar a los pacientes en riesgo activo de desarrollar problemas cardiovasculares, cáncer, enfermedades respiratorias crónicas, diabetes y problemas de salud mental. Los detalles del conjunto de datos y los hiperparámetros se dan en la Tabla 2 y la Tabla 3, respectivamente.
Para garantizar la reproducibilidad, todos los pasos de implementación, preprocesamiento y evaluación del modelo se llevaron a cabo en un entorno controlado utilizando Python dentro de Jupyter Notebook en un sistema con Windows 11, equipado con un procesador Intel Core i7 (11.ª generación), 16 GB de RAM y GPU NVIDIA GeForce RTX 3060 (para cualquier procesamiento acelerado, aunque la GPU no era esencial para estos conjuntos de datos). Las bibliotecas de software utilizadas incluyen Pandas 1.5.3, NumPy 1.24, Scikit-learn 1.3.0, Imbalanced-learn 0.11.0 para SMOTE, Matplotlib 3.7.1 y Seaborn 0.12.2 para visualización. El preprocesamiento implicó el manejo de valores faltantes a través de la imputación de media/modo, la codificación de variables categóricas mediante One-Hot o Label Encoding, y el escalado de características mediante StandardScaler. El desarrollo del modelo utilizó clasificadores como Regresión Logística, Bosque Aleatorio y Máquinas de Vectores de Soporte, con Eliminación de Características Recursivas (RFE) para la reducción de dimensionalidad. Los modelos se evaluaron mediante una validación cruzada de 5 veces y el rendimiento se midió utilizando métricas que incluyen exactitud, precisión, recuperación y puntuación ROC-AUC, lo que garantiza una canalización consistente y reproducible.
3. Preprocesamiento e ingeniería de características
Para recuperar características estadísticamente significativas de estos conjuntos de datos, se utiliza una técnica de preprocesamiento denominada "Selección de características mediante eliminación recursiva de características (RFE)" y una canalización de modelado denominada "Aprendizaje por transferencia con perceptrón multicapa (MLP)".
4. Formación y validación
Se utilizó un enfoque organizado de capacitación y validación para evaluar el enfoque propuesto para el análisis y la predicción de los síntomas de PASC. Al principio, se aplicó una división jerárquica de entrenamiento y prueba para obtener el sistema acumulativo de etiquetas de clase con una proporción de 80:20 de los datos de entrenamiento y prueba. Seguido de la validación cruzada de k veces con k = 5, se implementó en los datos de entrenamiento para evaluar la solidez del modelo en varias divisiones de los datos. Se aplicó un clasificador MLP con dos capas ocultas (64 y 32 neuronas) y 300 iteraciones. Se implementaron más técnicas de representación de características y aprendizaje por transferencia.
5. Métricas de evaluación
Se calcularon la precisión, la medida F, la media G, MAPE, la sensibilidad y la especificidad en los datos de prueba para comparar el rendimiento del modelo propuesto. Los resultados ilustran la mejora de las métricas de evaluación, la precisión, la medida F, la media G, MAPE, la sensibilidad y la especificidad en los datos de prueba para comparar el rendimiento del modelo propuesto con otros modelos de última generación, a saber, VGG-16 CNN, VGG-19 CNN, DenseNet-121 CNN, InceptionV3 CNN, ResNet-101 CNN, MobileNetV2 CNN y el modelo de transferencia latente propuesto. El conjunto de datos anterior contiene muestras de entrenamiento, validación y pruebas de datos cardiovasculares, de cáncer, respiratorios crónicos, de diabetes y relacionados con enfermedades mentales.
Todos los experimentos se realizaron en un entorno de Windows 11 utilizando Python 3.10 en un sistema con un procesador Intel Core i7, 16 GB de RAM y una GPU NVIDIA RTX 3060. Los conjuntos de datos de Kaggle disponibles públicamente se preprocesaron utilizando Pandas, NumPy y Scikit-learn para la imputación de valores faltantes, la codificación, el escalado y la selección de características a través de la eliminación recursiva de características (RFE). Los modelos como Regresión Logística, Bosque Aleatorio y SVM se entrenaron y evaluaron mediante validación cruzada de 5 veces con métricas que incluyen exactitud, precisión, recuperación y ROC-AUC para garantizar la reproducibilidad y la consistencia del rendimiento.
La tabla anterior muestra los detalles de los hiperparámetros y la técnica o algoritmo que los utiliza. La tasa de aprendizaje, la técnica de parada temprana, el tamaño del lote, el tamaño de la época, las devoluciones de llamada, la función de pérdida y las métricas para medir la eficiencia se dan para el algoritmo optimizador de Adam.
Access restricted. Please log in or start a trial to view this content.
El modelo propuesto se compara con los modelos de transferencia existentes, incluidos VGG-16 CNN, VGG-19 CNN, DenseNet-121 CNN, InceptionV3 CNN, ResNet-101 CNN y MobileNetV2 CNN. Los detalles de los parámetros y los resultados de la comparación se muestran en la Tabla 4, la Tabla 5 y la Figura 2, respectivamente. Los resultados ilustran la mejora de las métricas de evaluación mediante el uso del modelo propuesto sobre los otros modelos, a saber, VGG-16 CNN, ...
Access restricted. Please log in or start a trial to view this content.
La propuesta se centra en la construcción de un modelo de aprendizaje de transferencia latente para manejar los impactos del PASC. Esta estructura conduce a graves problemas de salud física y mental, particularmente en personas de mediana edad y ancianos, y aquellos sujetos a enfermedades crónicas previas, como enfermedades cardiovasculares, cáncer, enfermedades respiratorias y diabetes. El objetivo final es unificar diversos datos de pacientes de diferentes poblaciones con la ayuda de u...
Access restricted. Please log in or start a trial to view this content.
Los autores declaran que no existen conflictos de intereses con respecto a la publicación de este artículo.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| Entorno de computación en la nube (por ejemplo, Google Colab / AWS EC2) | Google / Amazon | N/A | Se utiliza para entrenar modelos de aprendizaje profundo con aceleración de GPU |
| Conjunto de datos epidemiológicos (secuelas posagudas del SARS-CoV-2, específicas de la región) | Repositorios de datos de salud pública (p. ej., OMS, CDC, ICMR, hospitales regionales) | N/A | Conjunto de datos para experimentos de aprendizaje por transferencia |
| Jupyter Notebook | Proyecto Jupyter | Código abierto | Entorno interactivo para codificación y documentación |
| Keras | Código abierto | Integrado con TensorFlow | API de alto nivel para crear y entrenar modelos de aprendizaje profundo |
| Matplotlib / Seaborn | Código abierto | N/A | Bibliotecas de visualización utilizadas para gráficos y análisis de tendencias epidemiológicas |
| NumPy | Código abierto | N/A | Biblioteca de cálculo numérico |
| Pandas | Código abierto | N/A | Biblioteca de manipulación y análisis de datos |
| Modelos CNN/Transformer preentrenados (por ejemplo, EfficientNet, modelos basados en BERT) | TensorFlow Hub / HuggingFace | Específico del modelo | Se utiliza para el aprendizaje por transferencia y el ajuste fino para la predicción epidemiológica |
| Python (v3.8 o superior) | Fundación de software Python | Código abierto | Lenguaje de programación utilizado para el preprocesamiento de datos, el entrenamiento de modelos y la evaluación |
| Scikit-learn | Código abierto | N/A | Biblioteca de aprendizaje automático para preprocesamiento, métricas de evaluación y modelos de línea base |
| TensorFlow (v2.x) | Código abierto | Marco de aprendizaje profundo utilizado para el aprendizaje por transferencia y la implementación de modelos |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission