$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Stratégie de recherche et sélection d’études
Une recherche ciblée et non systématique de la littérature a été menée sur PubMed, Embase et Web of Science de janvier 2016 à octobre 2025. La date de début de 2016 a été choisie pour recueillir les publications fondamentales en apprentissage automatique antérieures à la récente montée en recherche sur l’apprentissage profond tout en conservant une orientation contemporaine ; sa sélection est spécifiquement justifiée par l’inclusion de Myers et al. (2016)10, une étude majeure qui a établi des approches méthodologiques fondamentales pour la prédiction de l’ICP basée sur l’apprentissage automatique. La recherche a été complétée par un tri manuel des listes de références des revues systématiques identifiées et des études primaires.
Les termes de recherche ont été combinés à l’aide d’opérateurs booléens et comprenaient : « traumatisme crânien », « TCC », « intelligence artificielle », « apprentissage automatique », « apprentissage profond », « réseau neuronal », « pression intracrânienne », « crise », « coagulopathie », « sepsis », « pneumonie associée au ventilateur », « prédiction des résultats » et « pronostication ».
Critères d’inclusion :
(1) des études de recherche originales ou des revues systématiques publiées ; (2) se concentrer sur la prédiction de complications secondaires ou de résultats cliniques par IA ou ML chez les patients traumatisés (TCC) ; (3) la déclaration d’au moins une métrique quantitative de performance (par exemple, AUC, sensibilité/spécificité, précision) ; (4) publication dans une revue à comité de lecture ou des actes de conférence indexés avec un texte intégral accessible.
Critères d’exclusion :
(1) des études utilisant uniquement des modèles statistiques conventionnels sans composantes d’IA ou d’apprentissage automatique ; (2) des études limitées à la classification de la gravité des blessures ou à la caractérisation primaire des blessures sans prédire complications ou résultats ; (3) études précliniques (animales) ou in vitro ; (4) des articles de revue sans données primaires pertinentes pour les cibles de prédiction d’intérêt.
Quinze études primaires ont été sélectionnées comme exemples représentatifs dans les cinq domaines de prédiction, prioritaires selon la qualité méthodologique, la diversité des approches de validation et la pertinence clinique. Deux études supplémentaires de prédiction ICP ont été identifiées via le suivi manuel des références et sont incluses pour offrir une couverture plus large de ce domaine. En tant que récit plutôt qu’une revue systématique, la sélection visait à une couverture représentative plutôt qu’à une énumération exhaustive ; Le biais de sélection ne peut être totalement exclu. Aucun instrument formel d’évaluation de la qualité ou du risque de biais (par exemple, PROBAST ou liste de contrôle de rapport TRPOD) n’a été appliqué à des études individuelles — une limitation abordée dans la section Limitations.
Importance clinique de la prédiction des complications secondaires
Les complications secondaires après un TCC sont fréquentes, souvent évitables grâce à une intervention rapide, et influencent profondément les résultatscliniques 3,5. Comprendre le contexte clinique de chaque type de complication clarifie pourquoi les outils de prédiction pourraient s’avérer transformateurs dans la pratique des soins intensifs. Une PII élevée est l’une des complications les plus graves et les plus critiques en temps de temps après un TCCsévère 4,10. Lorsque la PII dépasse de façon persistante 20–22 mmHg, la pression de perfusion cérébrale diminue et la lésion secondaire ischémique sepropage 4. Si les cliniciens pouvaient anticiper de manière fiable les crises de la PII avant leur apparition, ils pourraient optimiser de manière proactive le positionnement de la tête, titrer la sédation, administrer une thérapie osmotique ou préparer une décompression chirurgicale — des transitions de la gestion de crise réactive à l’intervention préventive qui pourraient réduire considérablement le fardeau des lésions ischémiquessecondaires 10,11.
Les crises post-traumatiques précoces peuvent entraîner des lésions secondaires par une demande métabolique élevée, une excitotoxicité soutenue et la propagation de dépolarisations corticales. Une stratification précise du risque éclairerait les décisions concernant la thérapie anticonvulsivante prophylactique, le seuil de surveillance électroencéphalographique (EEG) continue, et l’intensité de la surveillance des crises12,13. Le TIC touche jusqu’à 60 % des patients atteints de TCC sévère et est associé à une augmentation de la mortalité par trois à quatrefois (14, 15, 16). L’identification précoce des patients coagulopathes permet une correction ciblée de la coagulation avant que l’hémorragie ne s’aggrave. Des soins intensifs prolongés avec ventilation mécanique et surveillance invasive augmentent considérablement le risque d’infection, et des outils de prédiction basés sur l’IA17,18 pourraient permettre aux protocoles de prévention des infections stratifiés par risque de réduire de manière significative les taux de complications infectieuses. Dans tous ces domaines, une prédiction précise informe également les décisions sur l’intensité du traitement, la communication familiale, la planification de la rééducation et les discussions sur les objectifs de soins 5,7,19.
Preuves actuelles en faveur de la prédiction basée sur l’IA
Les recherches portant sur la prédiction de l’IA dans les TCC se sont considérablement étendues au cours de la dernièredécennie 5,6,7. La revue systématique et la méta-analyse de Courville et al. ont démontré que les algorithmes ML peuvent surpasser les modèles de régression logistique traditionnels dans la prédiction des résultats néfastes des TCC, le score GCS d’admission, l’âge du patient et certains biomarqueurs sériques identifiés comme les caractéristiques prédictives les plus importantesde manière constante 6. La revue systématique complète de Malhotra et al., qui a englobé 39 études et 592 323 patients, a confirmé que les facteurs prédictifs les plus forts — âge, score GCS, réponse pupillaire et résultats CT — recoupent largement les caractéristiques que les cliniciens expérimentés intègrent déjà dans leurraisonnement 5,7. Lorsque les modèles d’IA sont limités à ces mêmes variables de niveau d’admission que les calculateurs traditionnels, les gains de précision peuvent êtremodestes 6. Cependant, lorsqu’on dispose de flux de données plus riches et longitudinaux—tendances physiologiques continues de surveillance, bilans de laboratoire en série et neuroimagerie quantitative—les approches d’IA peuvent offrir des avantages plus importants que les outils conventionnels. Les caractéristiques et stratégies de validation des études représentatives dans ces cinq domaines sont résumées dans le tableau 1, et le pipeline de prédiction conceptuelle est illustré à la figure 1.
Prédiction de la pression intracrânienne
Parmi tous les domaines secondaires de complication, la prédiction de la PII a constitué la base de preuves la plus solide. Les systèmes d’IA peuvent prédire les altitudes dangereuses des ICP environ 30 minutes à l’avance, offrant une fenêtre potentiellement exploitable pour une interventionpréventive 10,11. Myers et al. ont établi une méthodologie fondamentale utilisant l’apprentissage automatique automatique pour prédire à la fois les crises de pression partielle de l’ICP et de la pression partielle d’oxygène (PbtO₂) des tissus cérébraux à partir des formes d’onde de surveillance continue en soinsintensifs 10. Carra et al. ont ensuite développé et validé externalement des modèles d’apprentissage automatique pour prédire les doses cumulatives nocives de PIC en utilisant le jeu de données Collaborative European NeuroTrauma Effectiveness Research in Traumatic Brain Injury (CENTER-TBI), démontrant une généralisation intercentrerobuste 11. Lee et al. ont développé une architecture hybride de réseau neuronal convolutionnel (CNN) – mémoire à long terme (LSTM) appliquée aux données continues de formes d’onde ICP, permettant d’obtenir une prédiction de trajectoire ICPprécise à l’intérieur du patient 20. Mataczyński et al. ont proposé un comité de modèle explicable basé sur TabNet, appliqué à des métriques physiologiques multimodales dérivées du signal, obtenant une mémoire élevée (0,94) pour prédire les crises ICP 30 minutes à l’avance et améliorant les approches conventionnelles basées surdes seuils 21. Ce domaine bénéficie de multiples études de réplication indépendantes, d’une validation externe et d’une justification physiologique claire de l’actionnabilité clinique des prédictions précoces.
Prédiction des crises post-traumatiques
Pour les crises post-traumatiques, des études utilisant des caractéristiques basées sur la neuroimagerie et l’EEG ont démontré une performance discriminative modérée pour identifier les patients à haut risque12,13. Garner et al. ont appliqué un classificateur de forêt aléatoire aux données de connectivité par imagerie magnétique fonctionnelle (IRMf) en état de repos chez des patients traumatisés crâniens, obtenant une précision brute de 69 % lors de la validation croisée pour prédire la susceptibilité auxcrises 12. Faghihpirayesh et al. ont appliqué l’apprentissage profond aux données EEG pour détecter des anomalies épileptiformes dans les TCC aigus, rapportant une sensibilité de 0,78 et une spécificité de 0,8413. Ces résultats nécessitent une évaluation méthodologique critique : les crises post-traumatiques précoces surviennent chez environ 4 à 15 % des patients atteints de TCCsévère 22,23, créant un déséquilibre de classe important dans les ensembles de données de prédiction. Dans ce contexte, une précision de 69 % n’est pas significativement supérieure à celle d’un classificateur naïf qui prédit la classe négative pour toutes les observations ; L’AUC et la zone sous la courbe de rappel précise constituent des mesures de performance bien plus informatives pour de tels problèmes de prédiction clinique déséquilibrés, et aucune des deux n’a été rapportée par Garner et al. Notamment, les deux études dans ce domaine ont été publiées sous forme d’actes de conférences indexés plutôt que d’articles complets évalués par des pairs, soulignant encore l’état naissant de cette base de preuves. La prédiction des crises d’épilepsie représente actuellement le domaine de preuve le moins mature, sans études de validation externes publiées, avec des tailles d’échantillons limitées et des indicateurs de performance justifiant une interprétation prudente.
Prédiction TIC
Pour le TIC, Yang et al. ont développé des modèles ML utilisant XGBoost, des classificateurs de forêt aléatoire et de régression logistique, atteignant des valeurs AUC de 0,82–0,85 lors de la validation interne dans une cohortespécifique aux TCC 24. Li K et al. ont développé indépendamment un modèle d’ensemble ML pour la prédiction de la coagulopathie traumatique aiguë chez les patients hospitalisés en urgence traumatisme, rapportant un AUC de 0,8925. Ces études complémentaires démontrent des profils de performance cohérents dans des populations de patients partiellement chevauchantes. Xiong et al. ont utilisé dix modèles intercentriques sur 13 235 patients traumatisés généraux (y compris, mais sans s’y limiter, les cas de TCC) et ont démontré une performance de validation externe cohérente dans quatre institutionsindépendantes 26 ; cependant, la généralisation de ces résultats spécifiquement à la coagulopathie liée aux TCC justifie une évaluation plus approfondie dans les cohortes dédiées aux TCC. La prédiction de la coagulopathie présente une maturité modérée des preuves : la performance de validation interne est cohérente entre les études, mais la validation externe spécifique aux TCC — en particulier pour le phénotype coagulopathique hautement létal qui touche jusqu’à 60 % des patients traumatiques crâniens sévères et multiplie la mortalitépar trois à quatre fois 15,16 — reste un écart non comblé.
Sepsis et prédiction de l’infection
Liu et al. ont développé un modèle explicable basé sur XGBoost, spécifiquement conçu pour la prédiction de la septicémie liée aux TCC, obtenant un AUC de 0,81 pour la validation interne et de 0,76 pour la validation externe en utilisant la base de données collaborative de rechercheeICU 17. Les valeurs des explications additives de Shapley (SHAP) ont permis d’attribuer des caractéristiques de façon transparente, identifiant les principaux prédicteurs de sepsis, notamment les biomarqueurs inflammatoires et les signaux précoces de détérioration clinique. Hu et al. ont développé et validé en interne des modèles ML — englobant la régression logistique, la forêt aléatoire et XGBoost — pour stratifier le risque de septicémie à 30 jours à l’admission en réanimation chez les patients traumatisés crâniens, obtenant un AUC de 0,7918. Li et al. ont développé un modèle XGBoost en temps réel pour la prédiction de la septicémie en utilisant des données MIMIC-IV horaires chez des patients traumatisés, la validation temporelle confirmant une performance prédictive durable sur le cycle27 en réanimation. Wang et al. ont démontré une prédiction efficace de pneumonie associée au ventilateur (PAV) chez des patients traumatisés (TCC) en utilisant des méthodes d’ensemble appliquées à MIMIC-III, obtenant un AUC de0,87-28. La présence d’un modèle validé externalement (Liu et al.) distingue la littérature sur la prédiction de la sepsis ; cependant, les quatre études se sont appuyées sur des bases de données administratives ou de registre rétrospectives plutôt que sur des cohortes de patients potentiels, limitant la généralisation des estimations de performance rapportées.
Mortalité et prédiction des résultats fonctionnels
La prédiction de la mortalité et des résultats fonctionnels dispose de la base de preuves la plus étendue et la plus largement validée parmi les domaines examinés. Pease et al. ont développé un modèle d’apprentissage profond utilisant des scanners de la tête qui a obtenu un AUC de 0,92 pour la prédiction de mortalité sur validation interne, dépassant à la fois le modèle IMPACT et la performance duneurochirurgien à 29. Lors de la validation externe utilisant le jeu de données Transforming Research and Clinical Knowledge in Traumatic Cerebral Injury (TRACK-TBI), la performance du modèle a diminué à un AUC de 0,80 — un niveau comparable au modèle IMPACT — soulignant le risque bien reconnu d’estimations optimistes de validation interne29. Hibi et al. ont développé un modèle multimodal de pronostication ML intégrant données cliniques et imagerie CT quantitative à la fois en utilisant les ensembles de données CENTER-TBI et Comparative Indian Neurotrauma Effectiveness Research in Traumatic Brain Injury (CINTER-TBI), démontrant que la fusion multimodale des données améliorait la précision de la pronostication au-delà des approchesunimodales 30. Warman et al. ont comparé la performance de la prédiction de mortalité en apprentissage automatique entre les pays à revenu élevé (HIC) et les pays à faible et moyen revenu (PRET), constituant une analyse de généralisabilité inter-populations plutôt qu’une validation interne ou externe standard ; la dégradation des performances dans les contextes des PRMI a mis en lumière des limitations importantes liées aux capitauxpropres 31. Raj et al. ont développé des modèles dynamiques de prédiction de mortalité en utilisant la régression logistique appliquée à l’évolution des données physiologiques des soins intensifs, avec une amélioration de l’AUC passant de 0,67–0,72 le jour 1 à 0,81–0,84 au jour 5 de surveillance, démontrant une performance supérieure par rapport aux modèles d’admissionstatique basés sur le 32. Ces études représentent collectivement la base de preuves la plus développée pour la prédiction de l’IA dans les TCC, avec de multiples validations internationales externes réussies.
Obstacles critiques à l’évaluation et à la mise en œuvre
Discrimination prédictive versus utilité clinique
Une distinction fondamentale — souvent confondue dans la littérature publiée — sépare la discrimination prédictive des preuves d’utilité clinique. La discrimination prédicte, quantifiée par l’AUC, mesure la capacité d’un modèle à classer les patients selon le risque ; elle ne détermine pas si l’action sur ces prédictions améliore les résultats cliniques. Pour une mise en œuvre clinique responsable, une chaîne de preuves complète est requise : (1) étalonnage, confirmant que les probabilités prédites correspondent aux taux d’événements observés ; (2) analyse de la courbe de décision (DCA) démontrant un bénéfice clinique net sur une gamme de seuils de décision ; et (3) des preuves prospectives — idéalement randomisées — montrant que les interventions cliniques guidées par algorithmes se traduisent par de meilleurs résultats centrés sur le patient. Aucune étude publiée sur la prédiction de l’IA pour le TCC n’a encore complété cette chaîne de preuves, représentant la lacune de preuve la plus critique dans le domaine.
Validation et rigueur méthodologique
Les valeurs AUC rapportées dans les études examinées doivent être interprétées en tenant compte des limites méthodologiquessubstantielles 5,33. La plupart des modèles publiés manquent de validation externe sur des ensembles de données indépendants ; parmi les 39 études examinées par Malhotra et al., seulement environ un tiers ont fait l’objet d’une validation externe5. L’application de l’outil d’évaluation quantitative APPRAISE-AI a révélé que la conduite méthodologique (score médian 35 %), la robustesse des résultats (20 %) et la reproductibilité (35 %) étaient les domaines les plus faibles de cettelittérature 5. Aucun essai randomisé n’a démontré que les décisions cliniques guidées par l’IA améliorent les résultats pour les patients — un écart de preuve critique qui ne peut être comblé uniquement par des indicateurs de précision rétrospectifs.
Étalonnage, déséquilibre de classe et comparateurs de référence
Au-delà de la discrimination, plusieurs autres lacunes méthodologiques limitent l’interprétabilité des résultats publiés. L’étalonnage est rarement évalué ou rapporté ; Un modèle bien discriminant mais mal calibré peut systématiquement déformer le risque absolu, ce qui peut tromper les décisions cliniques. Le déséquilibre de classe est un défi omniprésent dans la prédiction des complications : des événements rares tels que les crises post-traumatiques créent des ensembles de données dominés par des observations négatives, gonflant les métriques de précision sans fournir une utilité prédictive significative. Les stratégies pour traiter le déséquilibre de classe — y compris le suréchantillonnage, l’apprentissage sensible aux coûts et l’ajustement du seuil de décision — sont rapportées de manière incohérente. L’évaluation comparative par rapport à de fortes bases de régression logistique est fréquemment omise, rendant difficile de déterminer si les gains de performance reflètent de véritables avantages spécifiques au ML ou simplement une ingénierie de caractéristiques adéquate. La DCA présente un bénéfice clinique net dans moins d’un cinquième des études examinées.
Interprétabilité
De nombreux modèles d’IA performants fonctionnent comme des boîtes noires, fournissant des prédictions sans justificationinterprétable 5,6,33,34. London a examiné les compromis théoriques entre précision et explicabilité en IA médicale, notant que la prise de décision opaque est déjà courante en médecine et que les attentes en explicabilité pourraient nécessiter unecalibration 33. Hassija et al. ont fourni une revue technique complète des méthodologies d’IA explicables applicables aux milieuxcliniques 35. Ghassemi et al. ont proposé un contre-argument, arguant que les approches actuelles d’IA explicables peuvent fournir de fausses assurances quant à la sécurité et à la responsabilité sans améliorer de manière significative la qualité des décisions auniveau du patient 36. Les cliniciens hésitent raisonnablement à faire confiance à des résultats qu’ils ne peuvent pas évaluer de manière indépendante, et les implications médico-légales des décisions influencées par l’IA restent non résolues dans la plupart des juridictions.
Infrastructure, intégration et fatigue des alertes
Le déploiement pratique nécessite une infrastructure de calcul, des pipelines d’intégration de données et des capacités de maintenance système que de nombreuses institutions — en particulier dans des contextes à ressources réduites — ne possèdentpas actuellement. Les systèmes de prédiction en temps réel doivent être soigneusement calibrés pour équilibrer sensibilité et spécificité afin d’éviter la fatigue d’alarme, une menace bien documentée pour la sécurité des patients en soins intensifs. L’intégration avec les plateformes existantes de dossiers médicaux électroniques présente des défis importants d’interopérabilité, de latence et de perturbation des flux de travail qui sont rarement abordés dans les études publiées sur le développement d’algorithmes.
Équité et généralisabilité
Les systèmes d’IA entraînés sur des ensembles de données non représentatifs peuvent performer de manière inégale — et potentiellement nuisible — entre les sous-groupes de patients 5,31. La plupart des modèles examinés ont été développés à partir de données provenant de centres médicaux universitaires à haut revenu, créant un risque de biais de performance géographique, institutionnelet démographique 5. Warman et al. ont explicitement abordé cette préoccupation, démontrant une dégradation mesurable des performances lorsque des modèles entraînés au HIC étaient appliqués dans des contextesLMIC 31. Aucune étude évaluée formellement n’a évalué la performance des modèles à travers des sous-groupes démographiques définis par âge, sexe, race ou ethnie — une omission fondamentale compte tenu de la diversité des populations desservies par les centres de traumatologie traumatique à travers le monde.
Maturité des preuves comparatives à travers les domaines de prédiction
Les cinq domaines de prédiction examinés diffèrent considérablement en termes de maturité des preuves. La prédiction de l’ICP repose sur la base la plus solide : elle bénéficie d’études fondamentales, d’une validation externe utilisant les données CENTER-TBI, d’une réplication indépendante entre plusieurs groupes, et d’un flux de travail clinique clairement articulé et physiologiquement plausible pour agir sur la base des prédictions. La mortalité et la prédiction des résultats fonctionnels disposent de la plus grande littérature publiée, avec de multiples études internationales de validation externe utilisant les ensembles de données TRACK-TBI, CENTER-TBI et CINTER-TBI. La prédiction de la coagulopathie démontre une performance interne cohérente en validation, mais la validation externe spécifique aux TCC reste absente de la littérature. La prédiction de la septicémie dispose d’au moins un modèle validé externalement (Liu et al.), mais la dépendance aux bases de données administratives limite la confiance dans la généralisation des performances. La prédiction des crises possède la base de preuves la moins mature : aucune validation externe n’existe, les études disponibles sont limitées, et le déséquilibre de classe limite considérablement l’interprétabilité des indicateurs de performance rapportés. Cette maturité différente a des implications directes pour la priorisation des investissements en recherche et pour la prudence requise dans toute future discussion sur la traduction clinique.
Orientations futures et priorités de recherche
La validation rigoureuse et préalablement enregistrée externe à travers divers environnements cliniques constitue la priorité de recherchela plus urgente 5,6. Des cadres multi-institutionnels tels que CENTER-TBI et TRACK-TBI fournissent des modèles et une infrastructure établis pour cette validation29,30. Des études prospectives, y compris les essais randomisés sur plateformes avec des groupes d’intervention guidés par IA, sont nécessaires pour déterminer si ces outils améliorent de manière significative les résultats pour les patients au-delà des soinsstandards 5. Le développement de systèmes d’IA fournissant des explications cliniquement interprétables et spécifiques au cas renforcerait considérablement la confiance des cliniciens, identifierait les modes de défaillance et faciliterait l’approbation réglementaire 5,6,33,34. Les améliorations méthodologiques — évaluation standardisée de l’étalonnage, DCA comme mesure de performance obligatoire, gestion transparente des déséquilibres de classe et comparaison avec des références cliniques solides — devraient devenir des normes minimales de déclaration. Des études spécifiquement conçues pour évaluer la performance prédictive à travers les sous-groupes démographiques et géographiques sont nécessaires avant qu’une recommandation clinique large puisse êtreformulée 5,31. L’adoption de la norme de reporting TRIPOD pour la transparence des modèles de prédiction et de l’outil d’évaluation du risque de biais PROBAST devrait être imposée par les revues publiant dans ce domaine afin d’améliorer la reproductibilité et la comparabilité.
Considérations éthiques
L’intégration des outils de prédiction par IA dans la médecine des soins intensifs soulève des considérations éthiques qui vont bien au-delà des indicateurs de performance technique 5,33. Les préoccupations liées à l’équité sont centrales : les modèles entraînés sur des populations de patients non représentatives peuvent systématiquement désavantager les patients issus de groupes sous-représentés, élargissant potentiellement plutôt que de réduire les disparités existantes dans les résultats des TBI. Le développement responsable des outils nécessite une formation délibérée, une diversification des données, et impose une évaluation des performances des sous-groupes avant tout déploiement. La transparence et la responsabilité des décisions cliniques influencées par l’IA restent non résolues : lorsqu’une recommandation d’IA contribue à un résultat négatif, les questions de responsabilité et de consentement éclairé ne sont pas encore suffisamment traitées dans les cadres juridiques ou réglementairesexistants 33,34. L’engagement des patients et des familles dans les décisions de déploiement de l’IA et la communication claire de la nature probabiliste et incertaine des prédictions de l’IA représentent des obligations éthiques supplémentaires pour les institutions en place.
Limites de cette critique
Plusieurs limitations de cet examen méritent une reconnaissance explicite. Premièrement, en tant que révision narrative plutôt qu’à revue systématique, les protocoles formels de recherche de littérature, la documentation du flux PRISMA et l’énumération exhaustive des études n’ont pas été utilisés ; La sélection de l’étude a été guidée par une couverture représentative, et le biais de sélection ne peut être exclu. Deuxièmement, aucun instrument formel d’évaluation de la qualité ou du risque de biais — tel que PROBAST ou la liste de contrôle de rapport TRIPOD — n’a été appliqué aux études individuelles examinées, limitant la confiance avec laquelle les conclusions sur la qualité des preuves peuvent être tirées. Troisièmement, l’évolution rapide de la littérature dans ce domaine signifie que les études publiées après la date limite de recherche d’octobre 2025 pourraient répondre à certaines des limites identifiées. Quatrièmement, le biais de publication gonfle probablement la précision apparente des modèles d’IA dans la littérature conservée, car les études avec de faibles performances prédictives sont systématiquement moins susceptibles d’être publiées. Cinquièmement, l’hétérogénéité dans la définition des résultats, le mix de cas des patients, les sources de données et les indicateurs de performance entre les études limite les comparaisons croisées directes et la synthèse méta-analytique.