$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Estrategia de búsqueda y selección de estudios
Se realizó una búsqueda bibliográfica dirigida y no sistemática en PubMed, Embase y Web of Science desde enero de 2016 hasta octubre de 2025. La fecha de inicio de 2016 se eligió para capturar publicaciones fundamentales de aprendizaje automático anteriores al reciente auge de la investigación en aprendizaje profundo, manteniendo un enfoque contemporáneo; su selección se justifica específicamente por la inclusión de Myers et al. (2016)10, un estudio seminal que estableció enfoques metodológicos fundamentales para la predicción de ICP basada en aprendizaje automático. La búsqueda se complementó con el filtro manual de las listas de referencias de revisiones sistemáticas identificadas y estudios primarios.
Los términos de búsqueda se combinaron utilizando operadores booleanos e incluían: "lesión cerebral traumática", "TCE", "inteligencia artificial", "aprendizaje automático", "aprendizaje profundo", "red neuronal", "presión intracraneal", "convulsión", "coagulopatía", "sepsis", "neumonía asociada a ventilación", "predicción de resultados" y "pronóstico".
Criterios de inclusión:
(1) estudios de investigación originales o revisiones sistemáticas publicadas; (2) centrarse en la predicción de complicaciones secundarias o resultados clínicos por IA o aprendizaje automático en pacientes con TCE; (3) la notificación de al menos una métrica cuantitativa de rendimiento (por ejemplo, AUC, sensibilidad/especificidad, precisión); (4) publicación en una revista revisada por pares o en actas indexadas de congresos con texto completo accesible.
Criterios de exclusión:
(1) estudios que emplean únicamente modelos estadísticos convencionales sin componentes de IA o aprendizaje automático; (2) estudios restringidos a la clasificación de gravedad de la lesión o caracterización primaria de la lesión sin predecir complicaciones o resultados; (3) estudios preclínicos (animales) o in vitro; (4) revisar artículos sin datos primarios relevantes para los objetivos de predicción de interés.
Se seleccionaron quince estudios primarios como ejemplos representativos en los cinco dominios de predicción, priorizados por calidad metodológica, diversidad de enfoques de validación y relevancia clínica. Se identificaron dos estudios adicionales de predicción ICP mediante seguimiento manual de referencias que se incluyen para ofrecer una cobertura más amplia de este dominio. Como una revisión narrativa más que sistemática, la selección orientada a una cobertura representativa en lugar de una enumeración exhaustiva; El sesgo de selección no puede excluirse completamente. No se aplicó ningún instrumento formal de evaluación de calidad o riesgo de sesgo (por ejemplo, PROBAST o la lista de verificación de informes TRPOD) a estudios individuales, una limitación abordada en la sección de Limitaciones.
Importancia clínica de la predicción de complicaciones secundarias
Las complicaciones secundarias tras el TCE son comunes, frecuentemente prevenibles con intervención oportuna e influyen profundamente en los resultadosclínicos 3,5. Comprender el contexto clínico de cada tipo de complicación aclara por qué las herramientas de predicción pueden ser transformadoras en la práctica de cuidados críticos. La ICP elevada es una de las complicaciones más graves y críticas en tiempo tras una LCT grave 4,10. Cuando la ICP supera persistentemente los 20–22 mmHg, la presión de perfusión cerebral disminuye y la lesión secundaria isquémica sepropaga 4. Si los clínicos pudieran anticipar de forma fiable las crisis de la CPI antes de su inicio, podrían optimizar proactivamente la posición de la cabeza, ajustar la sedación, administrar terapia osmótica o preparar la descompresión quirúrgica—transiciones de la gestión de crisis reactiva a la intervención preventiva que podrían reducir sustancialmente la carga de la lesión isquémicasecundaria 10,11.
Las convulsiones postraumáticas tempranas pueden causar lesiones secundarias mediante aumento de la demanda metabólica, excitotoxicidad sostenida y propagación de despolarizaciones corticales. Una estratificación precisa del riesgo informaría las decisiones sobre la terapia profiláctica anticonvulsiva, el umbral para la monitorización electroencefalográfica continua (EEG) y la intensidad de la vigilancia deconvulsiones 12,13. La TIC afecta hasta al 60% de los pacientes con LCT grave y se asocia con un aumento de la mortalidad de tres a cuatroveces 14, 15, 16. La identificación temprana de pacientes coagulopáticos permite una corrección de coagulación dirigida antes de que la hemorragia empeore. Los cuidados intensivos prolongados con ventilación mecánica y monitorización invasiva aumentan sustancialmente el riesgo de infección, y las herramientas de predicción basadas en IApodrían permitir protocolos de prevención de infecciones estratificados por riesgo para reducir significativamente las tasas de complicaciones infecciosas. En todos estos ámbitos, la predicción precisa también informa las decisiones sobre la intensidad del tratamiento, la comunicación familiar, la planificación de rehabilitación y las discusiones sobre objetivos de cuidado 5,7,19.
Evidencia actual para la predicción basada en IA
La investigación que examina la predicción de la IA en el TCE se ha ampliado considerablemente en la últimadécada 5,6,7. La revisión sistemática y el metaanálisis de Courville et al. demostraron que los algoritmos de ML pueden superar a los modelos tradicionales de regresión logística en la predicción de resultados adversos de LCT, identificando la puntuación GCS de admisión, la edad del paciente y biomarcadores séricos seleccionados como las características predictivas más consistentementeimportantes 6. La revisión sistemática exhaustiva de Malhotra et al., que abarcó 39 estudios y 592.323 pacientes, confirmó que los factores predictivos más fuertes—edad, puntuación GCS, respuesta pupilar y hallazgos de TC—se solapan sustancialmente con características que los clínicos experimentados ya incorporan en surazonamiento 5,7. Cuando los modelos de IA se restringen a estas mismas variables de nivel de admisión que las calculadoras tradicionales, las mejoras en precisión pueden sermodestas 6. Sin embargo, cuando se dispone de flujos de datos longitudinales más ricos —tendencias de monitorización fisiológica continuas, paneles de laboratorio seriados y neuroimagen cuantitativa— los enfoques de IA pueden ofrecer mayores ventajas frente a las herramientas convencionales. Las características y estrategias de validación de los estudios representativos en estos cinco dominios se resumen en la Tabla 1, y la cadena de predicción conceptual se ilustra en la Figura 1.
Predicción de la presión intracraneal
De todos los dominios de complicaciones secundarias, la predicción de la ICP ha acumulado la base de evidencia más robusta. Los sistemas de IA pueden predecir elevaciones peligrosas de ICP aproximadamente 30 minutos antes, proporcionando una ventana potencialmente accionable para la intervenciónpreventiva 10,11. Myers et al. establecieron una metodología fundamental utilizando ML para predecir tanto crisis de presión parcial de oxígeno en el tejido cerebral como las crisis de presión parcial de oxígeno (PbtO₂) a partir de formas de onda de monitorización continua enUCI 10. Carra et al. desarrollaron y validaron externamente modelos de aprendizaje automático para predecir dosis acumuladas perjudiciales de ICP utilizando el conjunto de datos Collaborative European NeuroTrauma Effectiveness Research in Traumatic Brain Injury (CENTER-TBI), demostrando una robusta generalizabilidad cruzada11. Lee et al. desarrollaron una arquitectura híbrida de red neuronal convolucional (CNN)–memoria a corto plazo (LSTM) aplicada a datos de forma de onda continua de ICP, logrando una predicción precisa de la trayectoria de ICP dentro delpaciente 20. Mataczyński et al. propusieron un comité de modelo explicable basado en TabNet aplicado a métricas fisiológicas multimodales derivadas de señales, logrando un alto recuerdo (0,94) para predecir crisis ICP con 30 minutos de antelación y mejorando los enfoques convencionales basados enumbrales 21. Este dominio se beneficia de múltiples estudios de replicación independientes, validación externa y una clara justificación fisiológica para la aplicabilidad clínica de las predicciones tempranas.
Predicción de crisis postraumáticas
En cuanto a convulsiones postraumáticas, los estudios que emplean características basadas en neuroimagen y EEG han demostrado un rendimiento discriminativo moderado en la identificación de pacientes de alto riesgo12,13. Garner et al. aplicaron un clasificador de bosque aleatorio a datos de conectividad por resonancia magnética funcional (fMRI) en estado de reposo en pacientes con TCE, logrando una precisión cruda del 69% en la validación cruzada para predecir la susceptibilidad a lasconvulsiones 12. Faghihpirayesh et al. aplicaron aprendizaje profundo a datos EEG para detectar anomalías epileptiformes en LCT agudo, reportando una sensibilidad de 0,78 y una especificidad de 0,8413. Estos resultados requieren una evaluación metodológica crítica: las convulsiones postraumáticas tempranas ocurren en aproximadamente el 4–15% de los pacientes con LCTgrave (22,23), lo que genera un desequilibrio sustancial de clases en los conjuntos de datos de predicción. En este contexto, una precisión del 69% no es significativamente superior a un clasificador ingenuo que predice la clase negativa para todas las observaciones; La AUC y el área bajo la curva de precisión-recuerdo constituyen medidas de rendimiento mucho más informativas para estos problemas de predicción clínica desequilibrados, y ninguna de las dos fue informada por Garner et al. Cabe destacar que ambos estudios en este ámbito se publicaron como actas de congresos indexados en lugar de artículos completos revisados por pares, lo que subraya aún más el estado incipiente de esta base de evidencia. La predicción de las convulsiones representa actualmente el dominio de evidencia menos maduro, sin estudios de validación externa publicados, tamaños de muestra limitados y métricas de rendimiento que justifiquen una interpretación cautelosa.
Predicción TIC
Para TIC, Yang et al. desarrollaron modelos de aprendizaje automático utilizando clasificadores XGBoost, bosque aleatorio y regresión logística, logrando valores AUC de 0,82–0,85 en validación interna en una cohorte24 específica para LCT. Li K et al. desarrollaron de forma independiente un modelo ensamblado de ML para la predicción de coagulopatía traumática aguda en pacientes hospitalizados en urgencias, reportando un AUC de 0,8925. Estos estudios complementarios demuestran perfiles de rendimiento consistentes en poblaciones de pacientes parcialmente solapadas. Xiong et al. emplearon diez modelos transcéntricos en 13.235 pacientes con trauma general (incluyendo, pero no limitándose a, casos de LCT) y demostraron un desempeño consistente en validación externa en cuatro institucionesindependientes 26; sin embargo, la generalización de estos hallazgos específicamente a la coagulopatía relacionada con el TCE justifica una evaluación más profunda en cohortes dedicadas al TCE. La predicción de la coagulopatía tiene una madurez de evidencia moderada: el rendimiento de validación interna es consistente entre estudios, pero la validación externa específica para LCE—especialmente para el fenotipo coagulopático altamente letal que afecta hasta al 60% de los pacientes con LCE grave e incrementa la mortalidad entre tres y cuatroveces 15,16—sigue siendo una brecha sin cubrir.
Predicción de sepsis e infección
Liu et al. desarrollaron un modelo explicable basado en XGBoost diseñado específicamente para la predicción de sepsis relacionada con LCT, logrando un AUC de 0,81 en la validación interna y 0,76 en la validación externa utilizando la base de datos colaborativade investigación eICU 17. Los valores de las explicaciones aditivas de Shapley (SHAP) proporcionaron una atribución transparente de características, identificando predictores clave de sepsis, incluidos biomarcadores inflamatorios y señales tempranas de deterioro clínico. Hu et al. desarrollaron y validaron internamente modelos de aprendizaje automático —que abarcan regresión logística, bosque aleatorio y XGBoost— para estratificar el riesgo de sepsis a 30 días en el ingreso en UCI en pacientes con TCE, logrando un AUC de 0,7918. Li et al. desarrollaron un modelo XGBoost en tiempo real para la predicción de sepsis utilizando datos MIMIC-IV cada hora en pacientes con trauma, con validación temporal que confirmó un rendimiento predictivo sostenido durante el curso27 en UCI. Wang et al. demostraron una predicción eficaz de neumonía asociada al ventilador (PAV) en pacientes con TCE utilizando métodos de conjunto aplicados a MIMIC-III, logrando un AUC de 0,87-28. La presencia de un modelo validado externamente (Liu et al.) distingue la literatura sobre predicción de sepsis; sin embargo, los cuatro estudios se basaron en bases de datos administrativas o de registro retrospectivas en lugar de cohortes de pacientes potenciales, limitando la generalizabilidad de las estimaciones de rendimiento reportadas.
Mortalidad y predicción de resultados funcionales
La predicción de mortalidad y resultados funcionales tiene la base de evidencia más amplia y ampliamente validada entre los dominios revisados. Pease et al. desarrollaron un modelo de aprendizaje profundo utilizando tomografías computarizadas craneales que logró una AUC de 0,92 para la predicción de mortalidad en validación interna, superando tanto el modelo IMPACT como el rendimiento delneurocirujano 29. En la validación externa utilizando el conjunto de datos Transforming Research and Clinical Knowledge in Traumatic Cerebral Injury (TRACK-TBI), el rendimiento del modelo disminuyó hasta un AUC de 0,80 —un nivel comparable al modelo IMPACT— lo que subraya el riesgo bien reconocido de estimaciones optimistas de validacióninterna 29. Hibi et al. desarrollaron un modelo multimodal de pronóstico de aprendizaje automático que integra datos clínicos e imagen cuantitativa por TC utilizando tanto los conjuntos de datos CENTER-TBI como Comparative Indian Neurotrauma Effectiveness Research in Traumatic Brain Injury (CINTER-TBI), demostrando que la fusión multimodal de datos mejoró la precisión del pronóstico más allá de los enfoquesunimodales 30. Warman et al. compararon el desempeño de la predicción de mortalidad por aprendizaje automático entre países de ingresos altos (HIC) y países de ingresos bajos y medios (PIB), constituyendo un análisis de generalizabilidad entre poblaciones en lugar de una validación interna o externa estándar; La degradación del rendimiento en entornos de medios de pago puso de manifiesto limitaciones importantes relacionadas con laequidad 31. Raj et al. desarrollaron modelos dinámicos de predicción de mortalidad utilizando regresión logística aplicada a datos fisiológicos en evolución de las UCI, con la AUC mejorando de 0,67–0,72 en el día 1 a 0,81–0,84 en el día 5 de monitorización, demostrando un rendimiento superior en comparación con los modelos estáticos basados eningresos 32. Estos estudios representan colectivamente la base de evidencia más desarrollada para la predicción de la IA en el TCE, con múltiples validaciones internacionales externas exitosas.
Barreras críticas en la evaluación e implementación
Discriminación predictiva frente a utilidad clínica
Una distinción fundamental—frecuentemente confundida en la literatura publicada—separa la discriminación predictiva de la evidencia de utilidad clínica. La discriminación predictiva, cuantificada por AUC, mide la capacidad de un modelo para clasificar a los pacientes por riesgo; no determina si actuar según esas predicciones mejora los resultados clínicos. Para una implementación clínica responsable, se requiere una cadena probatoria completa: (1) calibración, confirmando que las probabilidades predichas coinciden con las tasas de eventos observadas; (2) análisis de la curva de decisión (DCA) que demuestra el beneficio clínico neto a lo largo de un rango de umbrales de decisión; y (3) evidencia prospectiva—idealmente aleatorizada—de que las intervenciones clínicas guiadas por algoritmos se traducen en mejores resultados centrados en el paciente. Ningún estudio publicado sobre la predicción de la IA sobre TBI ha completado aún esta cadena de evidencia, representando la carencia probatoria más crítica en el campo.
Validación y rigor metodológico
Los valores de AUC reportados en los estudios revisados deben interpretarse con conciencia de las importantes limitaciones metodológicas 5,33. La mayoría de los modelos publicados carecen de validación externa en conjuntos de datos independientes; de los 39 estudios revisados por Malhotra et al., solo aproximadamente un tercio fue validadoexternamente 5. La aplicación de la herramienta de evaluación cuantitativa APPRAISE-AI reveló que la conducta metodológica (puntuación mediana 35%), la robustez de los resultados (20%) y la reproducibilidad (35%) fueron los dominios con puntuación más baja en estaliteratura 5. Ningún ensayo aleatorizado ha demostrado que las decisiones clínicas guiadas por IA mejoren los resultados para los pacientes, una brecha evidencia crítica que no puede ser cubierta únicamente con métricas de precisión retrospectiva.
Calibración, desequilibrio de clases y comparadores de línea base
Más allá de la discriminación, varias deficiencias metodológicas adicionales limitan la interpretabilidad de los hallazgos publicados. La calibración rara vez se evalúa o se informa; Un modelo bien discriminado pero mal calibrado puede tergiversar sistemáticamente el riesgo absoluto, lo que puede inducir decisiones clínicas engañosas. El desequilibrio de clases es un desafío generalizado en la predicción de complicaciones: eventos raros como las convulsiones postraumáticas crean conjuntos de datos dominados por observaciones negativas, inflando métricas de precisión sin proporcionar una utilidad predictiva significativa. Las estrategias para abordar el desequilibrio de clases—incluyendo el sobremuestreo, el aprendizaje sensible al coste y el ajuste del umbral de decisión—se informan de forma inconsistente. La evaluación comparativa frente a líneas base de regresión logística sólidas suele omitirse, lo que dificulta determinar si las mejoras de rendimiento reflejan ventajas específicas genuinas de ML o simplemente una ingeniería de características adecuada. El DCA demuestra un beneficio clínico neto en menos de una quinta parte de los estudios revisados.
Interpretabilidad
Muchos modelos de IA de alto rendimiento funcionan como cajas negras, proporcionando predicciones sin una justificacióninterpretable 5,6,33,34. London examinó los compromisos teóricos entre precisión y explicabilidad en la IA médica, señalando que la toma de decisiones opaca ya es común en medicina y que las expectativas de explicabilidad pueden necesitar lacalibración 33. Hassija et al. proporcionaron una revisión técnica exhaustiva de metodologías explicables de IA aplicables a entornosclínicos 35. Ghassemi et al. ofrecieron un contraargumento, argumentando que los enfoques actuales de IA explicable pueden proporcionar falsas garantías sobre seguridad y responsabilidad sin mejorar materialmente la calidad de la decisión a nivelde paciente 36. Los clínicos dudan razonablemente en confiar en resultados que no pueden evaluar de forma independiente, y las implicaciones médico-legales de las decisiones influenciadas por la IA siguen sin resolverse en la mayoría de las jurisdicciones.
Infraestructura, integración y fatiga de alertas
El despliegue práctico requiere infraestructura computacional, pipelines de integración de datos y capacidades de mantenimiento de sistemas que muchas instituciones—especialmente en entornos con pocos recursos—no poseen actualmente5. Los sistemas de predicción en tiempo real deben calibrarse cuidadosamente para equilibrar la sensibilidad con la especificidad y evitar la fatiga por alarmas, una amenaza bien documentada para la seguridad del paciente en entornos de cuidados intensivos. La integración con las plataformas existentes de historias clínicas electrónicas presenta desafíos sustanciales de interoperabilidad, latencia y interrupción de flujo de trabajo que rara vez se abordan en estudios publicados de desarrollo de algoritmos.
Equidad y generalizabilidad
Los sistemas de IA entrenados con conjuntos de datos no representativos pueden rendir de forma desigual —y potencialmente perjudicial— entre subgrupos de pacientes 5,31. La mayoría de los modelos revisados se desarrollaron utilizando datos de centros médicos académicos de altos ingresos, creando un riesgo de sesgo de desempeño geográfico, institucional ydemográfico 5. Warman et al. abordaron explícitamente esta preocupación, demostrando una degradación medible del rendimiento cuando se aplicaron modelos entrenados con HIC en entornosLMIC 31. Ningún estudio revisado evaluó formalmente el rendimiento de los modelos entre subgrupos demográficos definidos por edad, sexo, raza o etnia, una omisión fundamental dada la diversidad de poblaciones atendidas por los centros de trauma TBI en todo el mundo.
Madurez de la evidencia comparativa entre dominios de predicción
Los cinco dominios de predicción revisados difieren sustancialmente en la madurez de la evidencia. La predicción de la ICP tiene la base más sólida: se beneficia de estudios fundamentales, validación externa utilizando datos de CENTER-TBI, replicación independiente entre múltiples grupos y un flujo de trabajo clínico claramente articulado y fisiológicamente plausible para actuar según las predicciones. La predicción de mortalidad y resultados funcionales cuenta con la mayor literatura publicada, con múltiples estudios internacionales de validación externa que utilizan los conjuntos de datos TRACK-TBI, CENTER-TBI y CINTER-TBI. La predicción de la coagulopatía demuestra un rendimiento interno consistente en la validación, pero la validación externa específica para LCE sigue ausente en la literatura. La predicción de sepsis tiene al menos un modelo validado externamente (Liu et al.), pero la dependencia de bases de datos administrativas limita la confianza en la generalización del rendimiento. La predicción de convulsiones tiene la base de evidencia menos madura: no existe validación externa, los estudios disponibles son pequeños y el desequilibrio de clases limita sustancialmente la interpretabilidad de las métricas de rendimiento reportadas. Esta madurez diferencial tiene implicaciones directas para priorizar la inversión en investigación y para la cautela necesaria en cualquier futura discusión sobre traducción clínica.
Direcciones futuras y prioridades de investigación
La validación externa rigurosa y preregistrada en diversos entornos clínicos constituye la prioridad de investigaciónmás urgente 5,6. Marcos multiinstitucionales como CENTER-TBI y TRACK-TBI proporcionan plantillas e infraestructura establecidas para dichavalidación 29,30. Se necesitan estudios prospectivos, incluidos ensayos aleatorizados en plataformas con brazos de intervención guiados por IA, para determinar si estas herramientas mejoran de manera significativa los resultados para los pacientes más allá de la atenciónestándar 5. El desarrollo de sistemas de IA que proporcionen explicaciones clínicamente interpretables y específicas de cada caso aumentaría sustancialmente la confianza de los clínicos, identificaría modos de fallo y facilitaría la aprobaciónregulatoria 5,6,33,34. Las mejoras metodológicas —evaluación estandarizada de calibración, DCA como métrica de rendimiento obligatoria, manejo transparente del desequilibrio de clases y comparación con líneas base clínicas sólidas— deberían convertirse en estándares mínimos de reporte. Son necesarios estudios diseñados específicamente para evaluar el rendimiento predictivo entre subgrupos demográficos y geográficos antes de poder hacer una recomendación clínica amplia 5,31. La adopción del estándar de reporte TRIPOD para la transparencia del modelo de predicción y de la herramienta de evaluación de riesgo de sesgo PROBAST debería ser obligatoria por parte de las revistas que publiquen en este ámbito para mejorar la reproducibilidad y la comparabilidad.
Consideraciones éticas
La integración de herramientas de predicción por IA en la medicina de cuidados críticos plantea consideraciones éticas que van mucho más allá de las métricas técnicasde rendimiento 5,33. Las preocupaciones sobre la equidad son centrales: los modelos entrenados con poblaciones de pacientes no representativas pueden perjudicar sistemáticamente a los pacientes de grupos subrepresentados, ampliando en lugar de reducir las disparidades existentes en los resultados de TBI. El desarrollo responsable de herramientas requiere una formación deliberada, diversificación de datos y exige una evaluación del rendimiento de los subgrupos antes de cualquier despliegue. La transparencia y la rendición de cuentas en las decisiones clínicas influenciadas por la IA siguen sin resolverse: cuando una recomendación de IA contribuye a un resultado adverso, las cuestiones de responsabilidad y consentimiento informado aún no se abordan adecuadamente en los marcos legales o regulatoriosexistentes 33,34. La implicación de pacientes y familias en las decisiones de despliegue de IA y la comunicación clara sobre la naturaleza probabilística e incierta de las predicciones de IA representan obligaciones éticas adicionales para las instituciones implementadoras.
Limitaciones de esta reseña
Varias limitaciones de esta revisión merecen un reconocimiento explícito. En primer lugar, como una revisión narrativa y no sistemática, no se emplearon protocolos formales de búsqueda de literatura, documentación de flujo PRISMA ni enumeración exhaustiva de estudios; La selección de los estudios estuvo guiada por la cobertura representativa, y no se puede excluir el sesgo de selección. En segundo lugar, no se aplicó ningún instrumento formal de evaluación de calidad o riesgo de sesgo—como PROBAST o la lista de verificación de informes TRPOD—a los estudios individuales revisados, lo que limita la confianza con la que se pueden extraer conclusiones sobre la calidad de la evidencia. En tercer lugar, la rápida evolución de la literatura en esta área significa que los estudios publicados después del corte de búsqueda de octubre de 2025 pueden abordar algunas de las limitaciones identificadas. En cuarto lugar, el sesgo de publicación probablemente infla la aparente precisión de los modelos de IA en la literatura conservada, ya que los estudios con bajo rendimiento predictivo tienen sistemáticamente menos probabilidades de publicarse. Quinto, la heterogeneidad en las definiciones de resultados, la combinación de casos de los pacientes, las fuentes de datos y las métricas de rendimiento entre estudios limita las comparaciones directas entre estudios y la síntesis metaanalítica.