Research Article

L’apprentissage personnalisé piloté par l’intelligence artificielle améliore la formation aux instruments en salle d’opération : une étude observationnelle prospective

DOI:

10.3791/70487

April 17th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude observationnelle prospective a démontré qu’un système d’apprentissage personnalisé alimenté par l’intelligence artificielle améliorait significativement la compétence à long terme en salle d’opération, réduisait les incidents de sécurité et améliorait l’efficacité de la formation par rapport à l’enseignement traditionnel.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La formation traditionnelle aux instruments en salle d’opération repose souvent sur un enseignement universel, entraîne une mauvaise rétention des compétences à long terme et contribue à des erreurs chirurgicales évitables. La présente étude a émis l’hypothèse qu’un système d’apprentissage personnalisé alimenté par l’intelligence artificielle (IA) pourrait améliorer la compétence technique, la sécurité des patients et l’efficacité de la formation en adaptant la pratique aux profils individuels des apprenants. Un système d’apprentissage personnalisé (APLS) alimenté par l’IA a été développé, combinant le phénotypage de l’apprenant basé sur les données, la reconnaissance d’instruments basée sur l’apprentissage profond, la prédiction d’ensemble des trajectoires de compétences et l’apprentissage par renforcement afin de fournir un retour multimodal adaptatif lors d’un entraînement basé sur la simulation. Dans une étude observationnelle prospective avec une allocation départementale basée sur des clusters (introduisant des éléments quasi-expérimentaux) dans un hôpital tertiaire, 107 membres du personnel multidisciplinaire de blocs opératoires ont suivi soit le programme piloté par l’IA, soit une formation standard dirigée par un instructeur. Le critère principal était la conservation de la compétence de manipulation des instruments sur 12 mois, mesurée par l’échelle de compétence des instruments périopératoires (PIPS) ; Les résultats secondaires comprenaient les incidents de sécurité en salle d’opération, le temps de formation et le coût par professionnel compétent. Comparé à la formation traditionnelle, le système personnalisé était associé à des scores de compétence sur 12 mois nettement plus élevés (APLS 84,1 ± 9,2 contre Témoins 58,9 ± 18,7, p < 0,001), moins d’événements liés à la sécurité en pratique clinique, et près de la moitié du temps de formation tout en réduisant les coûts globaux de formation de 38,3 %. L’ensemble IA a également surpassé ses composants individuels d’apprentissage automatique lors de la prédiction des performances des apprenants et du choix des stratégies de rétroaction. Ces résultats suggèrent que l’intégration de la découverte de phénotypes non supervisée, de la prédiction supervisée et de l’apprentissage par renforcement dans une plateforme unifiée peut améliorer de manière significative la formation aux instruments en salle d’opération et offrir un cadre évolutif pour le développement de la main-d’œuvre basé sur les données en soins périopératoires.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’environnement de salle d’opération représente l’un des environnements les plus complexes du secteur de la santé, dans lequel une collaboration multidisciplinaire efficace impacte directement les résultats en matière de sécurité des patients etla qualité chirurgicale 1,2. Une formation insuffisante aux compétences aux instruments contribue à environ 15 000 erreurs chirurgicales évitables chaque année rien que dans les hôpitaux chinois, les défaillances de communication et les déficiences techniques représentant 72 % des événements indésirablespériopératoires 3. Les approches traditionnelles de formation reposent sur des méthodologies standardisées qui ne tiennent pas compte des différences d’apprentissage individuelles, des variations du traitement cognitif et des trajectoires de développement personnalisédes compétences 4,5.

D’un point de vue théorique, plusieurs cadres éducatifs illustrent pourquoi les approches personnalisées peuvent être supérieures à l’enseignement standardisé dans des domaines psychomoteurs complexes. La théorie de la charge cognitive6 postule que la conception pédagogique doit tenir compte de la capacité limitée de la mémoire de travail, en particulier lorsque les apprenants doivent simultanément traiter des informations procédurales, conceptuelles et perceptuelles nouvelles dans des environnements haute fidélité, comme la salled’opération 7. En adaptant la difficulté du contenu et la modalité de présentation aux profils cognitifs individuels, les systèmes personnalisés peuvent optimiser l’équilibre entre la charge cognitive intrinsèque et la charge cognitive superflue. Le cadre de la pratique délibérée suggère en outre que l’acquisition de compétences est maximisée lorsque la formation intègre des niveaux de défi individualisés, un retour d’information correctif immédiat et une répétition ciblée sur les faiblesses identifiées, des éléments difficiles à mettre en œuvre de manière cohérente dans les modèles traditionnels d’apprentissage mais qui sont naturellement opérationnels par une adaptationalgorithmique 8. De plus, la zone de développement proximal fournit une base théorique pour l’ajustement adaptatif de la difficulté, suggérant que l’apprentissage est le plus efficace lorsque les tâches sont calibrées pour dépasser légèrement la capacité indépendante actuelle del’apprenant 9. Ces considérations théoriques soutiennent collectivement l’hypothèse qu’un système d’IA capable d’ajuster dynamiquement les paramètres pédagogiques selon les caractéristiques individuelles de l’apprenant devrait surpasser un entraînement statique et universel.

Les avancées récentes en apprentissage automatique et en analyse de performance en temps réel ont offert un potentiel significatif pour relever les défis éducatifs 6,7. Les applications contemporaines de l’IA dans l’enseignement chirurgical ont montré des promesses, des études rapportant des améliorations substantielles dans l’acquisition des compétences lorsque des systèmes de retour d’information pilotés par l’IA sontmis en œuvre 9. Cependant, les plateformes de formation chirurgicale existantes basées sur l’IA, y compris des systèmes commerciaux tels que Touch Surgery et des plateformes similaires examinées dans une étudeprécédente, se sont principalement appuyées sur des architectures à algorithme unique, généralement des réseaux neuronaux isolés ou des arbres de décision, qui offrent des répétitions de procédures via des guides visuels étape par étape sans retour adaptatif en temps réel ni optimisation individualisée des voies d’apprentissage. Les études antérieures n’ont pas intégré le traitement multimodal de fusion des capteurs de flux de données hétérogènes (suivi oculaire, capture de mouvement et surveillance physiologique) avec des mécanismes de rétroaction adaptative qui s’ajustent dynamiquement aux trajectoires d’apprentissage individuelles via l’apprentissagepar renforcement 10,11. De plus, les systèmes existants n’ont pas combiné la découverte non supervisée des phénotypes avec des méthodes de prédiction supervisée au sein d’un cadre éducatifunifié 12,13. Ces lacunes représentent des occasions manquées, car la littérature théorique sur l’apprentissage personnalisé suggère fortement que les systèmes adaptatifs intégrés et multicomposants devraient être plus efficaces que les approches à composanteunique 14.

Les cadres éducatifs actuels en milieu périopératoire présentent plusieurs limitations importantes 8,15. Les modèles traditionnels d’apprentissage offrent des expériences d’apprentissage incohérentes, avec une grande variabilité de la qualité des enseignants, de la standardisation des retours d’information et de la fiabilité de l’évaluation des compétences. Ces approches ne tiennent pas compte de styles d’apprentissage divers, ne s’adaptent pas aux taux de progression individuels et manquent des analyses sophistiquées nécessaires pour optimiser les résultats éducatifs11,15. Pour répondre à ces besoins non satisfaits, cette étude introduit le système d’apprentissage personnalisé alimenté par l’IA (APLS), une intervention éducative complète qui unifie quatre composants algorithmiquement distincts au sein d’une seule plateforme adaptative conçue pour la formation multidisciplinaire aux instruments en salle d’opération. À notre connaissance, ce système est parmi les premiers à intégrer empiriquement les capacités suivantes dans la littérature sur l’éducation chirurgicale : une architecture hybride qui associe le clustering non supervisé pour la découverte de phénotypes par les apprenants basée sur les données avec la classification supervisée pour l’attribution de phénotypes en temps réel ; un pipeline d’apprentissage par transfert adaptant un réseau de neurones convolutionnel pré-entraîné à la reconnaissance visuelle d’instruments chirurgicaux en utilisant des données spécifiques limitées au domaine ; un module d’apprentissage par renforcement qui affine de manière itérative le timing et la modalité de rétroaction grâce à l’interaction avec l’apprenant ; et un cadre de prédiction d’ensemble qui synthétise les résultats de multiples algorithmes hétérogènes pour prévoir les trajectoires de compétences avec plus de précision que n’importe quel modèle constitutif seul. En comparant l’APLS avec la formation standard dirigée par un instructeur à travers une comparaison prospective de 12 mois des résultats d’apprentissage, des indicateurs de performance clinique, de l’efficacité de la formation et de la rentabilité, cette étude cherche à déterminer si une plateforme personnalisée unifiée pilotée par l’IA peut faire progresser de manière significative l’enseignement des instruments périopératoires au-delà de la pratique pédagogique actuelle.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude a été réalisée conformément à la Déclaration d’Helsinki et approuvée par le Comité d’éthique de l’hôpital Sir Run Run Shaw, faculté de médecine de l’Université du Zhejiang (Numéro d’approbation : 0480, approuvé le 10 août 2025). Tous les participants ont donné leur consentement éclairé écrit avant la participation.

Conception et cadre de l’étude
Une étude observationnelle prospective avec une allocation départementale basée sur des clusters a été menée de janvier 2024 à février 2025 à l’hôpital Sir Run Run Shaw, faculté de médecine de l’Université du Zhejiang, à Hangzhou, Chine. La stratégie d’allocation basée sur les départements introduit des éléments quasi-expérimentaux à cette conception ; En conséquence, les inférences causales doivent être interprétées avec la prudenceappropriée 16. L’étude a utilisé une comparaison par groupes parallèles avec l’allocation basée sur l’affectation départementale afin d’empêcher le partage d’informations entre groupes. Un recrutement stratifié a été mis en place pour garantir des caractéristiques de base comparables. L’hôpital disposait d’un laboratoire de simulation dédié équipé d’environnements standardisés de salle d’opération, d’instruments chirurgicaux, d’équipements de surveillance et de capacités d’enregistrement vidéo.

Sélection de l’échantillon et participants
Les professionnels de santé ont été recrutés par échantillonnage aléatoire stratifié parmi tout le personnel périopératoire éligible (n = 342) à l’hôpital Sir Run Run Shaw entre novembre 2023 et janvier 2024. Les variables de stratification comprenaient le rôle professionnel (infirmiers, technologues chirurgicaux et techniciens en anesthésie), le niveau d’expérience (<5, 5–10, 10–15 et >15 ans), le niveau d’éducation (diplômes d’associé, licence et master), et le département clinique (chirurgie générale, chirurgie orthopédique, chirurgie cardiovasculaire et autres spécialités). Des nombres aléatoires générés par ordinateur (logiciel R, set.seed = 12345 pour la reproductibilité) ont été appliqués dans chaque strate en utilisant la fonction d’échantillonnage afin d’assurer un échantillonnage représentatif dans toutes les catégories démographiques et professionnelles. La taille de l’échantillon a été calculée à l’aide du logiciel G*Power 3.1.9.7 sur la base de données pilotes préliminaires (n = 30) avec une taille d’effet anticipée d = 0,60, un niveau de signification à deux queues α = 0,05, et une puissance statistique souhaitée (1 − β) = 0,80, indiquant un besoin minimum de 90 participants (45 par groupe). Pour tenir compte du taux d’abandon (attrition) anticipé de 15 % basé sur les données historiques institutionnelles, l’objectif d’inscription a été fixé à 104 participants. L’effectif effectif a atteint 120 participants, fournissant 87 % de puissance après avoir pris en compte les 11 % d’attrition finale.

Critères d’inclusion requis
(1) emploi actuel à l’hôpital Sir Run Run Shaw dans des rôles périopératoires ; (2) minimum 6 mois d’expérience en salle d’opération ; (3) disponibilité pour toute la durée de l’étude de 13 mois ; (4) la volonté de participer à toutes les activités d’évaluation ; et (5) la littératie informatique de base, définie comme la capacité à naviguer dans les navigateurs web et à utiliser indépendamment les entrées clavier/souris.

Critères d’exclusion inclus
Congé prolongé prévu pendant la période d’étude, participation à d’autres programmes de formation aux instruments chirurgicaux au cours des 6 derniers mois, déficience visuelle non corrigible à une vision de 20/40 ou mieux, et inscription actuelle à des programmes formels de licence en technologie chirurgicale. Un total de 120 participants ont été initialement recrutés, dont 107 ont complété le protocole complet de l’étude (taux de complétion de 89,2 %). Les raisons du retrait comprenaient les changements d’emploi (n = 7), les circonstances personnelles (n = 4) et les difficultés liées à la technologie (n = 2). L’analyse d’attrition utilisant la régression logistique n’a montré aucune association significative entre le retrait et les caractéristiques de base, y compris l’âge (OR = 1,03, p = 0,52), le sexe (OR = 0,87, p = 0,85), le rôle professionnel (p = 0,73) ou les scores PIPS de base (OR = 1,01, p = 0,67), indiquant un schéma manquant au hasard confirmé par le test MCAR de Little (χ2 = 43,2, df = 38, p = 0,26).

Affectation en groupe
Pour minimiser les effets de contamination inhérents aux interventions éducatives, les participants ont été répartis dans des groupes d’intervention ou de contrôle selon leur affiliation départementale. Les départements (n = 8) ont été appariés en paires selon le volume de cas chirurgical et la taille du personnel, puis assignés aléatoirement à des conditions APLS ou témoins via randomisation générée par ordinateur (logiciel R, seed = 54321). Cette approche basée sur les clusters a été adoptée car la randomisation individuelle au sein des départements risquerait une contamination croisée importante à mesure que les collègues partagent leurs connaissances et leurs expériences de formation. Il est reconnu que la culture départementale, la qualité du leadership, les pratiques éducatives de base et la répartition des cas peuvent influencer indépendamment les résultats, représentant des sources potentielles de confusion résiduelle qui ne peuvent être entièrement traitées dans un plan randomisénon individualisé 16. L’échantillonnage stratifié a permis de garantir des caractéristiques de base comparables. Les évaluateurs de résultats effectuant des évaluations PIPS ont été aveugles à l’attribution de groupe grâce à des identifiants codés des participants. Les analystes statistiques recevaient des ensembles de données désidentifiés avec des étiquettes de groupe masquées jusqu’à la fin des analyses primaires.

Architecture système APLS et implémentation technique
L’APLS comprend quatre composantes informatiques intégrées fonctionnant sur une plateforme cloud (Table of Materials). Le système a été développé en utilisant des cadres d’apprentissage profond open source et une interface web (voir Table of Materials) avec des protocoles API RESTful (interface de programmation d’applications par transfert d’état représentatif, permettant une communication standardisée basée sur HTTP entre le client front-end et les modules d’apprentissage automatique côté serveur), une authentification basée sur JSON Web Token (JWT) (garantissant que seuls les utilisateurs autorisés et les composants système puissent accéder aux données des apprenants et modéliser les points de terminais). et le chiffrement TLS 1.3 de la couche de transport (sécurisant toutes les données en transit entre les appareils clients, le serveur d’applications et l’infrastructure de service de modèles basée sur le cloud) pour la sécurité des données. Une description complète de l’environnement logiciel, incluant les spécifications de dépendance (requirements.txt), la structure du fichier de configuration et les commandes d’initialisation du pipeline de données, est fournie dans le Fichier Supplémentaire 1.

Configuration matérielle et calibration
Avant chaque séance d’entraînement, la séquence de calibration matérielle suivante était effectuée. Un dispositif de suivi oculaire (voir Tableau des matériaux) était positionné à 60–70 cm des yeux du participant sur un support réglable en hauteur, et l’étalonnage était effectué selon le protocole standard à 9 points du fabricant avec une précision d’un angle visuel de ≤0,5°. Un réseau de huit caméras (voir Tableau des matériaux) a été disposé en configuration circulaire avec un rayon de 2,5 m à partir du centre de la station d’entraînement, positionné à des hauteurs alternant entre 1,8 m et 2,4 m, et calibré selon la procédure de baguette du fabricant avec un seuil d’erreur résiduel de ≤0,3 mm. Des marqueurs réfléchissants (n = 16, diamètre = 12,7 mm) ont été fixés sur des repères anatomiques standardisés sur les deux mains et poignets selon le protocole de placement des marqueurs décrit dans le Fichier Supplémentaire 2. Des dispositifs de surveillance physiologique étaient fixés conformément aux instructions du fabricant et vérifiés pour la qualité du signal avant le début de la séance.

Composante 1 : Système de classification des phénotypes de l’apprenant
Le système de classification utilise une approche hybride en deux étapes qui combine apprentissage non supervisé et supervisé. Au niveau 1, le regroupement k-means est utilisé sur les données d’évaluation de base pour découvrir les regroupements naturels d’apprenants. Les caractéristiques d’entrée (n = 37) incluent les scores de référence du domaine PIPS (4 caractéristiques), les scores d’inventaire du style d’apprentissage VARK (4 caractéristiques), la vitesse de traitement cognitif des tâches informatisées de temps de réaction (3 caractéristiques), les scores de confort technologique (1 caractéristique), les variables démographiques (3 caractéristiques), la capacité de mémoire de travail issue des tests d’étendue des chiffres (2 caractéristiques), le raisonnement spatial issu des tâches de rotation mentale (1 caractéristique), les scores de référence des compétences motrices fines (3 caractéristiques), Les cinq grands traits de personnalité (5 caractéristiques) et les indicateurs de performance antérieurs issus des dossiers institutionnels (3 caractéristiques). Des spécifications détaillées de prétraitement, des procédures d’optimisation des hyperparamètres et des classements d’importance des caractéristiques sont fournis dans le Fichier Supplémentaire 1 (Section S2). Les trois groupes résultants étaient caractérisés comme étant rapides (30,9 %), moyens (49,1 %) et apprenants lents (20,0 %). Au niveau 2, la classification supervisée est réalisée à l’aide de machines à vecteurs de support entraînées sur des labels de cluster afin de permettre la classification en temps réel des nouveaux apprenants. L’espace complet de recherche des hyperparamètres, les résultats de validation croisée et les métriques de classification par classe sont rapportés dans le Fichier Supplémentaire 1 (Section S2.3).

Composante 2 : Intégration multimodale des données et système de fusion de capteurs
La plateforme intègre cinq flux de données hétérogènes : données de suivi oculaire, données de capture de mouvement, surveillance physiologique (variabilité de la fréquence cardiaque, réponse galvanique cutanée et cortisol salivaire), analyse de performance via analyse vidéo automatisée et enregistrement des interactions. Les spécifications détaillées des capteurs, les pipelines de prétraitement, les procédures d’extraction de caractéristiques et l’architecture du réseau de neurones convolutionnel pour l’estimation de l’état cognitif sont décrites dans le Fichier Supplémentaire 1 (Section S3). Le système de fusion produit des représentations des états cognitifs qui sont mises à jour tous les 1 secondes et encodent l’attention intégrée, l’exécution motrice, la charge cognitive et la performance des tâches.

Composante 3 : Moteur d’analytique prédictive
Le système de prédiction d’ensemble combine trois algorithmes complémentaires : la forêt aléatoire, la machine d’amplification de gradient (XGBoost) et un réseau de neurones profond avec des couches de mémoire à long terme (LSTM) traitant les plongements d’états cognitifs sous forme de séries temporelles. L’agrégation d’ensemble utilise un vote souple pondéré avec des pondérations optimisées à partir des données de validation. Les spécifications algorithmiques complètes, les valeurs d’hyperparamètres, les procédures d’entraînement et les diagnostics de convergence sont fournis dans le Fichier Supplémentaire 1 (Section S4). Les ensembles de données de formation, validation, déploiement et évaluation étaient strictement séparés ; Le développement du modèle a utilisé exclusivement des données d’une étude pilote antérieure de 150 participants (80 % d’entraînement, 20 % de validation), et les participants actuels constituaient un ensemble de données entièrement conservé. Le réentraînement continu pendant le déploiement n’utilisait que les données d’interaction des 7 jours précédents et n’intégrait pas les données d’évaluation des résultats, évitant ainsi la fuite des résultats vers les modèles de prédiction.

Composante 4 : Système de retour adaptatif basé sur l’apprentissage par renforcement
Le système de rétroaction adaptative utilise l’apprentissage Q, formulant la sélection par rétroaction comme un processus décisionnel de Markov. L’espace d’états (25 dimensions) encode l’état cognitif actuel, le contexte temporel, les paramètres de la tâche et les caractéristiques de l’apprenant. L’espace d’actions comprend 25 actions discrètes représentant des combinaisons de modalité de rétroaction, de timing et de spécificité. La fonction de récompense intègre l’amélioration des performances, l’évitement de la surcharge cognitive, le maintien de l’engagement et la latence de correction. La formulation mathématique de l’espace d’états, de l’espace d’actions, de la fonction récompense, des paramètres de mise à jour Q-learning et des critères de convergence est détaillée dans le Fichier Supplémentaire 1 (Section S5).

Flux de travail des sessions d’entraînement
Chaque session de formation APLS se déroule selon la séquence standardisée suivante. (1) Le participant se connecte à la plateforme APLS en utilisant les identifiants attribués au poste de travail de formation désigné. (2) L’étalonnage matériel a été vérifié (eye-tracker, capture de mouvement et capteurs physiologiques) avec des contrôles de qualité automatiques confirmant une intégrité du signal acceptable. (3) Le système récupère la classification actuelle du phénotype de l’apprenant et la trajectoire prédite des compétences du participant afin de configurer les paramètres de la session. (4) Un module d’échauffement initial (5 min) présente une revue du contenu de la session précédente, adaptée au schéma de rétention du participant. (5) Le module d’entraînement de base (40-50 min) présente l’identification des instruments, la gestion et les tâches procédurales à des niveaux de difficulté déterminés par l’algorithme adaptatif, avec un retour multimodal en temps réel fourni selon une politique Q-learning. (6) Un résumé de la session et un tableau de bord de performance sont affichés, montrant les progrès en fonction du parcours d’apprentissage personnel du participant et des jalons de compétences. (7) Le participant remplit un bref questionnaire de satisfaction (2 min). (8) Les données de session sont automatiquement téléchargées sur le serveur cloud pour la mise à jour du modèle.

Procédures du groupe de contrôle
Le groupe témoin a reçu une formation traditionnelle aux instruments en salle d’opération selon des protocoles institutionnels standardisés. La formation comprenait une session didactique initiale de 8 heures en classe par des enseignants infirmiers seniors en salle d’opération (OR), couvrant les catégories d’instruments, la nomenclature, les principes de manipulation et la technique stérile ; un manuel de formation imprimé (187 pages) contenant des photographies d’instruments, des spécifications et des descriptions organisées par spécialité chirurgicale ; deux ateliers pratiques 4 heures dans des laboratoires de simulation avec des ensembles d’instruments physiques sous supervision de l’instructeur (ratio instructeur/apprenant 1:6) ; l’accès au système de gestion de l’apprentissage institutionnel contenant des supports de formation numériques pour une évaluation autodirigée ; et des séances de remise à niveau trimestrielles programmées (2 h) pour revoir les instruments souvent confus. Le temps total structuré d’enseignement était de 20 heures sur la période d’étude. Aucun algorithme adaptatif, voie personnalisée ou composante améliorée par IA n’a été intégré.

Mesures de résultat
Le critère principal était la rétention des connaissances évaluée à 12 mois après la formation à l’aide de l’échelle de compétence des instruments périopératoires (PIPS) validée. Le processus complet de développement du PIPS, incluant la génération d’éléments à partir d’une revue de littérature et des groupes de discussion d’experts, la validation de contenu Delphi modifiée en trois tours (indice de validité du contenu = 0,94), l’analyse factorielle exploratoire et confirmatoire, ainsi que la grille d’évaluation complète ancrée sur le comportement, est documenté dans le Fichier Supplémentaire 3. L’instrument a démontré de fortes propriétés psychométriques (α de Cronbach = 0,92, test-re-test ICC = 0,91 à un intervalle de 2 semaines). Le PIPS se compose de 24 éléments répartis dans quatre domaines : identification des instruments (6 éléments), maîtrise de la manipulation (6 éléments), protocoles de sécurité (6 éléments) et communication d’équipe (6 éléments). Chaque élément utilise une échelle de Likert en cinq points (1 = novice à 5 = expert) avec des descripteurs ancrés sur le comportement. Le score total varie de 24 à 120, les scores plus élevés indiquant une plus grande maîtrise.

Les évaluations PIPS ont été réalisées par des évaluateurs formés (six infirmières chirurgicales avec >10 ans d’expérience en salle d’opération ayant suivi un programme de formation standardisé de 8 heures) au départ, immédiatement après l’intervention, et aux retours de 1, 3, 6 et 12 mois. Les évaluateurs ont été aveuglés par le devoir de groupe grâce à des identifiants codés des participants et ont évalué des enregistrements vidéo montés pour éliminer tout élément d’interface ou affichage de rétroaction visible spécifique à l’APLS. Les évaluateurs n’ont pas été informés de la modalité de formation reçue par les participants. La fiabilité inter-évaluateurs a été établie par un double codage de 20 % des évaluations (n = 128), obtenant un ICC > 0,85 dans tous les domaines (score total ICC = 0,89, IC 95 % : 0,85-0,92).

Les résultats secondaires étaient les suivants : (1) compétence pratique évaluée à travers l’évaluation objective structurée des compétences techniques (OSATS) adaptée à la manipulation des instruments, comprenant six stations standardisées (maximum 30 points), administrée par des évaluateurs experts aveugles (ICC = 0,87) au départ et à 3, 6 et 12 mois. (2) L’efficacité du temps de formation était mesurée comme le nombre total d’heures nécessaires pour atteindre le seuil de compétence (PIPS ≥ 75). (3) L’efficacité des coûts est calculée comme le coût par apprenant compétent, en intégrant les coûts directs et indirects, avec des coûts normalisés au yuan chinois de 2024 à l’aide des données comptables institutionnelles. (4) La satisfaction des apprenants a été évaluée à l’aide d’un questionnaire sur l’échelle de Likert en 5 points (27 items, cohérence interne α = 0,91). (5) Indicateurs exploratoires de performance clinique issus des systèmes institutionnels de rapport de sécurité : rapports d’incidents liés aux instruments durant la période de 12 mois post-formation, avec des taux pour 1 000 cas chirurgicaux ajustés en fonction de la complexité des cas. Les résultats des incidents de sécurité ont été classés comme exploratoires car l’étude n’était pas propulsée pour détecter les différences dans ces événements de faible fréquence.

Méthodes d’analyse statistique
Toutes les analyses statistiques ont été réalisées en utilisant la version 4.3.0 de R avec l’interface RStudio et les packages suivants : lme4 pour les modèles à effets mixtes, emmeans (« moyennes marginales estimées » ; un package R pour calculer les moyennes de groupe ajustées par modèle et réaliser des comparaisons post-hoc par paires de Tukey, Bonferroni ou Scheffé à partir de modèles à effets mixtes ajustés), psych pour les analyses psychométriques, effsize (un package R pour calculer des tailles d’effet standardisées, incluant le d de Cohen et le g de Hedges, avec intervalles de confiance) pour les calculs de taille d’effet, et des souris pour l’imputation multiple. Le seuil de signification a été établi a priori à α = 0,05 (à deux queues) pour tous les tests d’hypothèse.

Des corrections comparatives multiples ont été appliquées comme suit. Pour le critère principal (score total PIPS à travers les points temporels), l’inférence a été tirée de l’interaction Group × Time dans le modèle linéaire à effets mixtes en utilisant les degrés de liberté de Kenward-Roger, qui ne nécessite pas de correction séparée pour plusieurs moments temporels. Pour les sous-échelles du domaine PIPS (quatre comparaisons simultanées), une correction de Bonferroni a été appliquée (ajustée α = 0,0125). Pour les résultats secondaires (quatre mesures : score d’efficacité OR, incidents de sécurité, score de communication TEAM et fréquence d’erreurs), la procédure de taux de fausse découverte de Benjamini-Hochberg a été appliquée (q = 0,05). Pour les indicateurs de performance des systèmes d’IA (dix comparaisons internes), la correction de Bonferroni a été appliquée (ajusté α = 0,005). Toutes les valeurs p rapportées et toutes les déterminations de signification font explicitement référence à la correction applicable.

Tous les résultats primaires et secondaires entre groupes ont été analysés à l’aide de modèles linéaires à effets mixtes avec des effets fixes pour le groupe, le temps et leur interaction, ainsi que des interceptions aléatoires pour les participants et les départements (pour tenir compte de la corrélation intraclasse résultant de l’allocation basée sur les clusters). Le coefficient de corrélation intraclasse au niveau départemental a été estimé pour quantifier le degré de regroupement. Les schémas de données manquants ont été évalués à l’aide du test MCAR de Little ; les données ont été déterminées comme complètement absentes au hasard et traitées par imputation multiple utilisant une correspondance prédictive de moyennes (m = 20 ensembles de données imputés, résultats regroupés selon les règles de Rubin). Des analyses de sensibilité avec analyse complète du cas, des nombres d’imputation variables (m = 10, m = 50) et des scénarios du pire et du meilleur des cas ont évalué la robustesse.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Caractéristiques des participants
L’échantillon final comprenait 107 participants avec une excellente rétention (Figure 1). L’analyse d’attrition comparant les complétistes (n = 107) avec les sevrages (n = 13) n’a révélé aucune différence significative dans les caractéristiques de base : âge (t = 0,89, p = 0,38), sexe (χ2 = 0,21, p = 0,64), rôle professionnel (χ2 = 1,45, p = 0,48), scores PIPS de base (t = 0,62, p = ...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude observationnelle prospective, intégrant des éléments quasi-expérimentaux via une allocation départementale basée sur des clusters, apporte des preuves qu’un système d’apprentissage personnalisé alimenté par l’IA intégrant plusieurs algorithmes d’apprentissage automatique est associé à des améliorations substantielles des résultats d’entraînement des instruments en salle d’opération par rapport aux approches pédagogiques traditionnelles. Ces résultats ont des implications à la...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs déclarent qu’ils n’ont aucun intérêt financier ou non financier concurrent lié à cette œuvre.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs remercient le personnel de la salle d’opération et l’équipe de formation infirmière de l’hôpital Sir Run Run Shaw pour leur soutien dans la mise en œuvre du programme de formation et la collecte de données. Cette recherche a été soutenue par le Zhejiang Medical and Health Project (numéro de subvention : 2025HY0440 et 2023KY781). L’organisme de financement n’avait aucun rôle dans la conception de l’étude, la collecte de données, l’analyse des données, l’interprétation des données ou la rédaction des manuscrits.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Simulateur chirurgical à retour haptique (Touch X)3D Systems (anciennement Sensable)PHANToM Premium 3.0Dispositif haptique à six degrés de liberté ; utilisé comme interface principale pour la transmission par rétroaction de force pilotée par l’IA lors de tâches simulées de manipulation et de suture tissulaire
Plateforme logicielle de simulation (SimSurgery&trade ; AI Suite)Sur mesure / Développé en interneN/ALogiciel d’entraînement propriétaire piloté par IA intégrant des modules de réseaux neuronaux convolutionnels (CNN) pour la classification des performances en temps réel et la génération de retour adaptatif
Capteur de force/coupleATI Automatisation IndustrielleNano17 SI-12-0.12Mesures les forces de l’instrument appliquées (résolution : 0,003 N) lors des exercices de manipulation et de suture des tissus ; données introduites dans l’algorithme de classification de l’IA
Système de suivi de mouvementNorthern Digital Inc. (NDI)Polaris Vega STSuivi optique des trajectoires des instruments chirurgicaux ; précision volumétrique RMS de 0,12 mm ; Utilisé pour l’évaluation de la précision de la navigation aux instruments
Ensemble d’instruments laparoscopiques (Entraînement)Karl Storz SE & Comté KG26003 AA / 33310 DBPince laparoscopique standard de 5 mm et porte-aiguille, utilisés aussi bien dans les bras d’entraînement pilotés par IA que dans les armes d’entraînement conventionnelles
Fantôme tissulaire haute fidélité (modèle des tissus mous)SynDaver LabsModèle chirurgical abdominal (SKU : SYN-ABD)Substitut de tissu synthétique validé pour la suture, la dissection et les exercices de manipulation des tissus ; remplacé toutes les 50 utilisations selon les recommandations du fabricant
Station de travail GPUNVIDIA / DellDell Precision 7920 avec NVIDIA A6000 (48 Go de VRAM)Matériel de calcul pour exécuter l’inférence IA en temps réel (latence de classification CNN < 15 ms) ; Serveur dédié connecté à un dispositif haptique
Cadre de réseau neuronalOpen source (Meta AI)PyTorch v2.1.0Cadre d’apprentissage profond utilisé pour l’entraînement du modèle, la validation et l’inférence en temps réel de l’algorithme de rétroaction adaptative
Logiciels d’analyse statistiqueIBM Corp.IBM SPSS Statistiques v29.0Utilisé pour la modélisation à effets mixtes, les tests t par échantillons indépendants et l’ANOVA à mesures répétées dans toutes les analyses de résultats primaires et secondaires
Logiciels de visualisation et de graphisme des donnéesLogiciel GraphPadGraphPad Prism v10.0Utilisé pour générer toutes les figures manuscrites, y compris les barres d’erreur (SD et IC à 95 %), les courbes de rétention et les graphiques à barres groupés
Système d’enregistrement vidéoStryker Corp.Plateforme AIM 4K 1688Capture vidéo intraopératoire et en session de simulation pour une évaluation experte post-hoc aveugle (score OSATS)
Outil d’évaluation structurée (OSATS)N/A & mdash ; Instrument publié validéMartin et al., 1997 (Br J Surg)Évaluation objective et structurée des compétences techniques ; Échelle mondiale de notation à sept items (1 & ndash ; 5 par article) utilisé pour l’évaluation experte aveugle de la suture et de la manipulation des tissus
Logiciels de randomisation et de gestion des donnéesOpen sourceREDCap v13.7.2Capture électronique des données pour l’allocation des participants (départements par cluster), la collecte de données démographiques et le suivi longitudinal des scores
Module de rétroaction audioSur mesure / Développé en interneN/AModule logiciel fournissant des indices auditifs correctifs en temps réel (alertes codées par ton) intégrés au système de rétroaction multimodal
Questionnaire institutionnel (Enquête sur la satisfaction des apprenants)Sur mesure / Développé en interneN/AÉchelle Likert de 18 items (1&ndash ; 5) questionnaire évaluant l’efficacité perçue de la formation, l’utilisabilité du système et la confiance des apprenants ; administré après l’entraînement et au suivi à 24 semaines

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Bajpai, S., Lindeman, B. The trainee’s role in patient safety. Surgical Clinics of North America. 101 (1), 149-160 (2021).
  2. Weiner, L. M., et al. Antimicrobial-resistant pathogens associated with healthcare-associated infections: Summary of data reported to the national healthcare safety network at the Centers for Disease Control and Prevention, 2011–2014. Infection Control & Hospital Epidemiology. 37 (11), 1288-1301 (2016).
  3. Peterson, G., Bramhall, J. Patient safety training: National patient safety goals and cms hospital quality. MedEdPORTAL. , (2013).
  4. Ali, M., Wahab, I. B. A., Huri, H. Z., Yusoff, M. S. Personalised learning in higher education for health sciences: A scoping review protocol. Systematic Reviews. 13 (1), 93(2024).
  5. Hossain, I., Madani, A., Laplante, S. Machine learning perioperative applications in visceral surgery: A narrative review. Frontiers in Surgery. 11, 1493379(2024).
  6. Sweller, J., Van Merriënboer, J. J. G., Paas, F. Cognitive architecture and instructional design: 20 years later. Educational Psychology Review. 31 (2), 261-292 (2019).
  7. Laplante, S., Madani, A. in Artificial Intelligence in Clinical Practice. , 211-216 (2024).
  8. Shahrezaei, A., Sohani, M., Taherkhani, S., Zarghami, S. Y. The impact of surgical simulation and training technologies on general surgery education. BMC Medical Education. 24 (1), 1297(2024).
  9. Ericsson, K. A. Deliberate practice and the acquisition and maintenance of expert performance in medicine and related domains. Academic Medicine. 79, S70-S81 (2004).
  10. Gordon, M., et al. A scoping review of artificial intelligence in medical education: Beme guide no. 84. Medical Teacher. 46 (4), 446-470 (2024).
  11. Knopp, M. I., et al. Ai-enabled medical education: Threads of change, promising futures, and risky realities across four potential future worlds. JMIR Medical Education. 9, e50373(2023).
  12. Escobar-Castillejos, D., Barrera-Animas, A. Y., Noguez, J., Magana, A. J., Benes, B. Transforming surgical training with AI techniques for training, assessment, and evaluation: Scoping review. J Med Internet Res. 27, e58966(2025).
  13. Hla, D. A., Hindin, D. I. Generative AI & machine learning in surgical education. Current Problems in Surgery. 63, 101701(2025).
  14. Masters, K. Submitting artificial intelligence in health professions education papers to medical teachers. Medical Teacher. 46 (10), 1256-1257 (2024).
  15. Abahuje, E., Tuyishime, E., Alayande, B. T. Global surgical simulation education, current practices, and future directions. Surgery. 180, 109050(2025).
  16. Campbell, M. K., Piaggio, G., Elbourne, D. R., Altman, D. G. Consort 2010 statement: Extension to cluster randomised trials. BMJ. 345 (1), e5661-e5661 (2012).
  17. Garibaldi, B. T., Hollon, M. M., Woodworth, G. E., Winkel, A. F., Desai, S. V. Navigating the landscape of precision education: Insights from on-the-ground initiatives. Academic Medicine. 99 (1), S71-S76 (2023).
  18. Desai, S. V., et al. Precision education: The future of lifelong learning in medicine. Academic Medicine. 99 (1), S14-S20 (2024).
  19. Bekbolatova, M., Mayer, J., Ong, C. W., Toma, M. Transformative potential of AI in healthcare: Definitions, applications, and navigating the ethical landscape and public perspectives. Healthcare. 12 (2), 125(2024).
  20. Singh, G., Kumar, J. Advances in Healthcare Information Systems and Administration. ch015, 240-260 (2024).
  21. Schumacher, D. J., Santen, S. A., Pugh, C. M., Burk-Rafel, J. Foreword: The next era of assessment and precision education. Academic Medicine. 99 (Supplement_1), S1-S6 (2023).
  22. Xiaowen, Y., Jingjing, D., Biao, W., Shenzhong, Z., Yana, W. Design strategies for artificial intelligence-based future learning centers in medical universities. BMC Medical Education. 25 (1), (2025).
  23. Ahsan, Z. Integrating artificial intelligence into medical education: A narrative systematic review of current applications, challenges, and future directions. BMC Medical Education. 25 (1), (2025).
  24. Ali, M., Wahab, I. A., Huri, H. Z., Yusoff, M. S. Personalised learning in higher education for health sciences: A scoping review. BMC Medical Education. 25 (1), 969(2025).
  25. Vrdoljak, J., Boban, Z., Vilović, M., Kumrić, M., Božić, J. A review of large language models in medical education, clinical decision support, and healthcare administration. Healthcare. 13 (6), 603(2025).
  26. Bayly-Castaneda, K., Ramirez-Montoya, M. S., Morita-Alexander, A. Crafting personalized learning paths with AI for lifelong learning: A systematic literature review. Frontiers in Education. 9, 1424386(2024).
  27. Vp, V. The role of metafora in revolutionizing personalized learning through AI in higher education. SSRN Electronic Journal. , (2025).
  28. Varas, J., et al. Innovations in surgical training: Exploring the role of artificial intelligence and large language models (LLM). Rev Col Bras Cir. 50, e20233605(2023).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Artificial Intelligence TrainingPersonalized LearningOperating Room TrainingInstrument HandlingSimulation Based TrainingDeep Learning RecognitionReinforcement LearningCompetency PredictionPatient SafetySurgical Skill Retention

Related Articles