Research Article

L'apprendimento personalizzato guidato dall'intelligenza artificiale migliora l'addestramento degli strumenti in sala operatoria: uno studio osservazionale prospettico

DOI:

10.3791/70487

April 17th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio osservazionale prospettico ha dimostrato che un sistema di apprendimento personalizzato alimentato dall'intelligenza artificiale ha significativamente migliorato la competenza strumentale a lungo termine in sala operatoria, ha ridotto gli incidenti di sicurezza e migliorato l'efficienza della formazione rispetto all'istruzione tradizionale.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L'addestramento tradizionale agli strumenti in sala operatoria spesso si basa su un insegnamento uniforme, produce una scarsa ritenzione delle competenze a lungo termine e contribuisce a errori chirurgici evitabili. Il presente studio ha ipotizzato che un sistema di apprendimento personalizzato basato su intelligenza artificiale (IA) possa migliorare la competenza tecnica, la sicurezza del paziente e l'efficienza della formazione adattando la pratica ai profili individuali degli apprendenti. È stato sviluppato un sistema di apprendimento personalizzato (APLS) basato su IA che combina fenotipizzazione basata sui dati dello studente, riconoscimento di strumenti basato su deep learning, previsione complessiva delle traiettorie delle competenze e apprendimento per rinforzo per fornire feedback multimodale adattivo durante l'addestramento basato su simulazione. In uno studio osservazionale prospettico con allocazione dipartimentale basata su cluster (introdurre elementi quasi-sperimentali) in un ospedale terziario, 107 membri multidisciplinari dello staff di sala operatoria hanno completato il curriculum guidato dall'IA o la formazione standard guidata da istruttori. L'esito primario è stato la conservazione di competenza nella gestione degli strumenti in 12 mesi, misurata dalla scala di competenza dello strumento perioperatorio (PIPS); Gli esiti secondari includevano incidenti di sicurezza in sala operatoria, tempo di formazione e costi per professionista competente. Rispetto alla formazione tradizionale, il sistema personalizzato era associato a punteggi di competenza a 12 mesi sostanzialmente più alti (APLS 84,1 ± 9,2 vs. Control 58,9 ± 18,7, p < 0,001), meno eventi legati alla sicurezza nella pratica clinica e quasi la metà del tempo di formazione, riducendo i costi complessivi della formazione del 38,3%. L'ensemble di IA ha inoltre superato i suoi singoli componenti di apprendimento automatico nella previsione delle prestazioni degli studenti e nella selezione delle strategie di feedback. Questi risultati suggeriscono che integrare la scoperta non supervisionata dei fenotipi, la previsione supervisionata e l'apprendimento per rinforzo in una piattaforma unificata può migliorare significativamente l'addestramento degli strumenti in sala operatoria e offrire un quadro scalabile per lo sviluppo della forza lavoro basato sui dati nella cura perioperatoria.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L'ambiente della sala operatoria rappresenta uno degli ambienti più complessi del settore sanitario, in cui una collaborazione multidisciplinare efficace influisce direttamente sugli esiti di sicurezza del paziente e sulla qualitàchirurgica 1,2. Una formazione inadeguata sulle competenze strumentali contribuisce a circa 15.000 errori chirurgici prevenibili ogni anno solo negli ospedali cinesi, con fallimenti di comunicazione e carenze tecniche che rappresentano il 72% degli eventi avversi perioperatori3. Gli approcci tradizionali di formazione si basano su metodologie standardizzate che non tengono conto delle differenze di apprendimento individuali, delle variazioni nell'elaborazione cognitiva e delle traiettorie di sviluppo delle competenzepersonalizzate 4,5.

Da un punto di vista teorico, diversi quadri educativi illuminano perché gli approcci personalizzati possano essere superiori all'istruzione standardizzata in ambiti psicomotori complessi. La teoria del caricocognitivo 6 sostiene che la progettazione didattica debba tenere conto della limitata capacità della memoria di lavoro, in particolare quando gli studenti devono elaborare simultaneamente nuove informazioni procedurali, concettuali e percettive in ambienti ad alta fedeltà, come la salaoperatoria 7. Adattando la difficoltà del contenuto e la modalità di presentazione ai profili cognitivi individuali, i sistemi personalizzati possono ottimizzare l'equilibrio tra carico cognitivo intrinseco ed estraneo. Il quadro della pratica deliberata suggerisce inoltre che l'acquisizione delle competenze sia massimizzata quando la formazione incorpora livelli di sfida individualizzati, feedback correttivo immediato e ripetizione focalizzata sulle debolezze identificate, elementi difficili da implementare in modo coerente nei modelli tradizionali di apprendistato ma che sono naturalmente operativi tramite adattamentoalgoritmico 8. Inoltre, la zona di sviluppo prossimale fornisce una base teorica per l'adattamento della difficoltà, suggerendo che l'apprendimento è più efficace quando i compiti sono calibrati per andare appena oltre la capacità indipendente attualedello studente 9. Queste considerazioni teoriche supportano collettivamente l'ipotesi che un sistema di IA capace di regolare dinamicamente i parametri didattici alle caratteristiche individuali dello studente dovrebbe superare un addestramento statico e uniforme per tutti.

I recenti progressi nel machine learning e nell'analisi delle prestazioni in tempo reale hanno offerto un potenziale significativo per affrontare le sfide educative 6,7. Le applicazioni contemporanee dell'IA nell'educazione chirurgica hanno mostrato potenzialità, con studi che riportano miglioramenti sostanziali nell'acquisizione delle competenze quando vengono implementati sistemi di feedback basati sull'IA. Tuttavia, le piattaforme di formazione chirurgica basate sull'IA esistenti, inclusi sistemi commercialmente disponibili come Touch Surgery e piattaforme simili esaminate in uno studioprecedente 8, si sono basate principalmente su architetture a singolo algoritmo, tipicamente reti neurali isolate o alberi decisionali, che forniscono prove procedurali tramite guide visive passo dopo passo senza feedback adattivo in tempo reale o ottimizzazione individualizzata dei percorsi di apprendimento. Studi precedenti non hanno integrato l'elaborazione multimodale della fusione dei sensori di flussi di dati eterogenei (eye-tracking, motion capture e monitoraggio fisiologico) con meccanismi di feedback adattivo che si adattano dinamicamente alle traiettorie di apprendimento individuali tramite reinforcementlearning 10,11. Inoltre, i sistemi esistenti non hanno combinato la scoperta non supervisionata del fenotipo con metodi di previsione supervisionata all'interno di un quadro educativounificato 12,13. Queste lacune rappresentano opportunità mancate, poiché la letteratura teorica sull'apprendimento personalizzato suggerisce fortemente che i sistemi adattivi integrati e multicomponente dovrebbero essere più efficaci degli approcci a singolocomponente 14.

I quadri educativi attuali in contesti perioperatori presentano diverse limitazioni importanti 8,15. I modelli tradizionali di apprendistato offrono esperienze di apprendimento incoerenti, con significativa variabilità nella qualità degli insegnanti, nella standardizzazione del feedback e nell'affidabilità della valutazione delle competenze. Questi approcci non riescono a gestire stili di apprendimento diversi, non si adattano ai tassi di progresso individuali e mancano delle analisi sofisticate necessarie per ottimizzare i risultati educativi11,15. Per rispondere a questi bisogni insoddisfatti, questo studio introduce il sistema di apprendimento personalizzato basato su IA (APLS), un intervento educativo completo che unifica quattro componenti algoritmicamente distinti all'interno di un'unica piattaforma adattiva progettata per l'addestramento multidisciplinare degli strumenti in sala operatoria. Per quanto ne sappiamo, il sistema è tra i primi ad integrare empiricamente le seguenti capacità nella letteratura sull'educazione chirurgica: un'architettura ibrida che abbina il clustering non supervisionato per la scoperta di fenotipi basati sui dati sullo studente con la classificazione supervisionata per l'assegnazione di fenotipi in tempo reale; una pipeline di transfer learning che adatta una rete neurale convoluzionale pre-addestrata al riconoscimento visivo di strumenti chirurgici utilizzando dati limitati specifici per dominio; un modulo di apprendimento per rinforzo che affina iterativamente il tempo e la modalità di feedback attraverso l'interazione con lo studente; e un framework di previsione di ensemble che sintetizza output da più algoritmi eterogenei per prevedere le traiettorie delle competenze con maggiore precisione rispetto a qualsiasi modello costitutivo. Valutando l'APLS rispetto alla formazione standard guidata da istruttori attraverso un confronto prospettico di 12 mesi tra risultati di apprendimento, indicatori di performance clinica, efficienza della formazione e costo-efficacia, questo studio mira a determinare se una piattaforma personalizzata unificata guidata dall'IA possa promuovere in modo significativo l'educazione sugli strumenti perioperatori oltre la pratica pedagogica attuale.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio è stato condotto in conformità con la Dichiarazione di Helsinki ed approvato dal Comitato Etico del Sir Run Run Shaw Hospital, Scuola di Medicina dell'Università di Zhejiang (Numero di approvazione: 0480, approvato il 10 agosto 2025). Tutti i partecipanti hanno fornito un consenso informato scritto prima della partecipazione.

Progettazione dello studio e contesto
Uno studio osservazionale prospettico con assegnazione dipartimentale basata su cluster è stato condotto da gennaio 2024 a febbraio 2025 presso il Sir Run Run Shaw Hospital, Zhejiang University School of Medicine, Hangzhou, Cina. La strategia di allocazione basata sui dipartimenti introduce elementi quasi-sperimentali in questo disegno; Di conseguenza, le inferenze causali devono essere interpretate con la dovuta cautela16. Lo studio ha utilizzato un confronto parallelo con l'allocazione basata sull'assegnazione dipartimentale per prevenire la condivisione di informazioni tra gruppi. È stata implementata una registrazione stratificata per garantire caratteristiche di base comparabili. L'ospedale manteneva un laboratorio di simulazione dedicato dotato di ambienti standardizzati in sala operatoria, strumenti chirurgici, apparecchiature di monitoraggio e capacità di registrazione video.

Selezione di campioni e partecipanti
I professionisti sanitari sono stati reclutati tramite campionamento casuale stratificato da tutto il personale perioperatorio idoneo (n = 342) presso il Sir Run Run Shaw Hospital tra novembre 2023 e gennaio 2024. Le variabili di stratificazione includevano il ruolo professionale (infermieri, tecnologi chirurgici e tecnici anestesi), livello di esperienza (<5, 5–10, 10–15 e >15 anni), livello di istruzione (lauree associate (laurea magistrale, triennale e magistrale) e dipartimento clinico (chirurgia generale, chirurgia ortopedica, chirurgia cardiovascolare e altre specialità). Numeri casuali generati al computer (software R, set.seed = 12345 per la riproducibilità) sono stati applicati all'interno di ogni strato utilizzando la funzione campione per garantire un campionamento rappresentativo in tutte le categorie demografiche e professionali. La dimensione del campione è stata calcolata utilizzando il software G*Power 3.1.9.7 basato su dati preliminari del pilota (n = 30) con una dimensione d'effetto prevista d di Cohen = 0,60, livello di significanza a due code α = 0,05 e potenza statistica desiderata (1 − β) = 0,80, indicando un requisito minimo di 90 partecipanti (45 per gruppo). Per tenere conto del tasso previsto di abbandono scolastico del 15% (abbandono) basato sui dati storici istituzionali, l'iscrizione obiettivo è stata fissata a 104 partecipanti. L'iscrizione effettiva ha raggiunto 120 partecipanti, fornendo l'87% di potere dopo aver considerato l'ultimo 11% di abbandono.

Criteri di inclusione richiesti
(1) impiego attuale presso il Sir Run Run Shaw Hospital in ruoli perioperatori; (2) minimo 6 mesi di esperienza in sala operatoria; (3) disponibilità per l'intera durata di 13 mesi dello studio; (4) disponibilità a partecipare a tutte le attività di valutazione; e (5) alfabetizzazione informatica di base, definita come la capacità di navigare nei browser web e utilizzare tastiera/mouse in modo indipendente.

Criteri di esclusione inclusi
Congedo prolungato pianificato durante il periodo di studio, partecipazione ad altri programmi di formazione per strumenti chirurgici negli ultimi 6 mesi, disabilità visiva non correggibile a 20/40 o superiore e iscrizione attuale a programmi formali di laurea in tecnologia chirurgica. Inizialmente sono stati reclutati 120 partecipanti, di cui 107 hanno completato l'intero protocollo dello studio (tasso di completamento dell'89,2%). Le ragioni del ritiro includevano cambi di lavoro (n = 7), circostanze personali (n = 4) e difficoltà legate alla tecnologia (n = 2). L'analisi di attrito tramite regressione logistica non ha mostrato associazioni significative tra ritiro e caratteristiche basali, inclusi età (OR = 1,03, p = 0,52), genere (OR = 0,87, p = 0,85), ruolo professionale (p = 0,73) o punteggi PIPS basali (OR = 1,01, p = 0,67), indicando un pattern mancante a caso confermato dal test MCAR di Little (χ2 = 43,2, df = 38, p = 0,26).

Assegnazione di gruppo
Per minimizzare gli effetti di contaminazione insiti negli interventi educativi, i partecipanti sono stati assegnati a gruppi di intervento o di controllo in base all'affiliazione al dipartimento. I reparti (n = 8) sono stati abbinati in coppie in base al volume di casi chirurgici e alla dimensione del personale, poi assegnati casualmente a APLS o condizioni di controllo tramite randomizzazione generata al computer (software R, seed = 54321). Questo approccio basato su cluster è stato adottato perché la randomizzazione individuale all'interno dei dipartimenti avrebbe rischiato una contaminazione incrociata sostanziale mentre i colleghi condividono conoscenze ed esperienze di formazione. Si riconosce che la cultura dipartimentale, la qualità della leadership, le pratiche educative di base e il mix di casi possono influenzare indipendentemente gli esiti, rappresentando potenziali fonti di confondimento residuo che non possono essere completamente affrontate in un disegno randomizzatonon individualizzato 16. Il campionamento stratificato ha garantito caratteristiche di base comparabili. I valutatori di esito che conducevano valutazioni PIPS sono stati accecati all'assegnazione di gruppo tramite identificatori codificati dei partecipanti. Gli analisti statistici hanno ricevuto dataset de-identificati con etichette di gruppo mascherate fino al completamento delle analisi primarie.

Architettura del sistema APLS e implementazione tecnica
L'APLS comprende quattro componenti computazionali integrati che operano su una piattaforma cloud (Table of Materials). Il sistema è stato sviluppato utilizzando framework open-source di deep learning e un frontend web (vedi Tabella dei Materiali) con protocolli API RESTful (interfaccia di programmazione applicativa per trasferimento di stato rappresentativo, che consente una comunicazione standardizzata basata su HTTP tra il client front-end e i moduli di machine learning lato server), autenticazione basata su JSON Web Token (JWT) (che garantisce che solo gli utenti autorizzati e i componenti di sistema possano accedere ai dati degli studenti e modellare gli endpoint). e crittografia a livello di trasporto TLS 1.3 (che protegge tutti i dati in transito tra dispositivi client, server applicativo e infrastruttura cloud-based model-service) per la sicurezza dei dati. Una descrizione completa dell'ambiente software, incluse specifiche di dipendenza (requirements.txt), struttura dei file di configurazione e comandi di inizializzazione della pipeline dati, è fornita nel File Supplementare 1.

Configurazione hardware e calibrazione
Prima di ogni sessione di addestramento, veniva eseguita la seguente sequenza di calibrazione hardware. Un dispositivo di tracciamento oculare (vedi Tabella dei materiali) era posizionato a 60–70 cm dagli occhi del partecipante su un supporto regolabile in altezza, e la calibrazione veniva eseguita utilizzando il protocollo standard a 9 punti del produttore con un'accuratezza di ≤0,5°. Un array di otto telecamere (vedi Tabella dei Materiali) era disposto in una configurazione circolare con un raggio di 2,5 m dal centro della stazione di addestramento, posizionato ad altezze alternate tra 1,8 m e 2,4 m, e calibrato utilizzando la procedura della bacchetta del produttore con una soglia di errore residuo di ≤0,3 mm. I marcatori riflettenti (n = 16, diametro = 12,7 mm) sono stati applicati ai punti di riferimento anatomici standardizzati su entrambe mani e polsi secondo il protocollo di posizionamento dei marcatori descritto nel File Supplementare 2. I dispositivi di monitoraggio fisiologico venivano collegati secondo le istruzioni del produttore e verificati per la qualità del segnale prima dell'inizio della sessione.

Componente 1: Sistema di classificazione fenotipica degli studenti
Il sistema di classificazione adotta un approccio ibrido in due fasi che combina apprendimento non supervisionato e supervisionato. Nella Fase 1, il clustering k-means viene utilizzato sui dati di valutazione di base per scoprire raggruppamenti naturali degli apprendenti. Le caratteristiche di input (n = 37) includono punteggi di dominio PIPS di base (4 caratteristiche), punteggi dell'inventario dello stile di apprendimento VARK (4 caratteristiche), velocità di elaborazione cognitiva da compiti computerizzati sul tempo di reazione (3 caratteristiche), punteggi di comfort tecnologico (1 caratteristica), variabili demografiche (3 caratteristiche), capacità di memoria di lavoro dai test di span delle cifre (2 caratteristiche), ragionamento spaziale da compiti di rotazione mentale (1 caratteristica), punteggi di base delle abilità motorie fini (3 caratteristiche), I Cinque Grandi tratti della personalità (5 caratteristiche) e metriche di performance precedenti dai registri istituzionali (3 funzionalità). Specifiche dettagliate di preprocessing, procedure di ottimizzazione degli iperparametri e classifiche di importanza delle caratteristiche sono fornite nel File Supplementare 1 (Sezione S2). I tre cluster risultanti sono stati caratterizzati come veloci (30,9%), nella media (49,1%) e nell'apprendimento lento (20,0%). Nella Fase 2, la classificazione supervisionata viene eseguita utilizzando macchine a vettori di supporto addestrate su etichette cluster per consentire la classificazione in tempo reale dei nuovi apprendenti. Lo spazio completo di ricerca per iperparametri, i risultati di validazione incrociata e le metriche di classificazione per classe sono riportati nel File Supplementare 1 (Sezione S2.3).

Componente 2: Integrazione multimodale dei dati e sistema di fusione dei sensori
La piattaforma integra cinque flussi di dati eterogenei: dati di eye-tracking, dati di motion capture, monitoraggio fisiologico (variabilità della frequenza cardiaca, risposta galvanica della pelle e cortisolo salivari), analisi delle prestazioni tramite analisi video automatizzata e registrazione delle interazioni. Specifiche dettagliate dei sensori, pipeline di pre-elaborazione, procedure di estrazione delle caratteristiche e l'architettura della rete neurale convoluzionale per la stima dello stato cognitivo sono descritte nel File Supplementare 1 (Sezione S3). Il sistema di fusione produce rappresentazioni degli stati cognitivi che vengono aggiornate ogni 1 secondi e codificano attenzione integrata, esecuzione motoria, carico cognitivo e performance del compito.

Componente 3: Motore di analisi predittiva
Il sistema di previsione dell'ensemble combina tre algoritmi complementari: foresta casuale, macchina per il gradiente boosting (XGBoost) e una rete neurale profonda con strati di memoria a breve termine (LSTM) che elaborano gli embeddings di stato cognitivo come serie temporali. L'aggregazione di ensemble utilizza il voto soft ponderato con pesi ottimizzati tramite dati di validazione. Le specifiche algoritmiche complete, i valori degli iperparametri, le procedure di addestramento e la diagnostica della convergenza sono fornite nel File Supplementare 1 (Sezione S4). I dataset di addestramento, validazione, distribuzione e valutazione erano strettamente separati; Lo sviluppo del modello ha utilizzato dati esclusivamente da uno studio pilota precedente con 150 partecipanti (80% addestramento, 20% validazione), e i partecipanti attuali costituivano un dataset di distribuzione interamente conservato. Il riaddestramento continuativo durante il dispiegamento utilizzava solo i dati di interazione dei 7 giorni precedenti e non incorporava i dati della valutazione degli esiti, prevenendo così la perdita di esiti dagli esiti della valutazione nei modelli di previsione.

Componente 4: Sistema di feedback adattivo basato sull'apprendimento per rinforzo
Il sistema di feedback adattivo impiega Q-learning, formulando la selezione del feedback come un processo decisionale di Markov. Lo spazio degli stati (25 dimensionali) codifica lo stato cognitivo corrente, il contesto temporale, i parametri del compito e le caratteristiche dello studente. Lo spazio delle azioni comprende 25 azioni discrete che rappresentano combinazioni di modalità di feedback, tempismo e specificità. La funzione di ricompensa incorpora il miglioramento delle prestazioni, l'evitamento del sovraccarico cognitivo, il mantenimento dell'engagement e la latenza di correzione. La formulazione matematica dello spazio degli stati, dello spazio delle azioni, della funzione ricompensa, dei parametri di aggiornamento Q-learning e dei criteri di convergenza è dettagliata nel File Supplementare 1 (Sezione S5).

Flusso di lavoro delle sessioni di formazione
Ogni sessione di addestramento APLS procede secondo la seguente sequenza standardizzata. (1) Il partecipante effettua l'accesso alla piattaforma APLS utilizzando le credenziali assegnate presso la postazione di addestramento designata. (2) La calibrazione hardware è stata verificata (eye-tracker, motion capture e sensori fisiologici) con controlli automatici di qualità che confermano un'integrità del segnale accettabile. (3) Il sistema recupera la classificazione fenotipica attuale dello studente e la traiettoria di competenza prevista per configurare i parametri della sessione. (4) Un modulo di riscaldamento iniziale (5 min) presenta una revisione dei contenuti della sessione precedente, adattata al modello di fidelizzazione del partecipante. (5) Il modulo di addestramento base (40-50 min) presenta l'identificazione, la gestione e compiti procedurali degli strumenti a livelli di difficoltà determinati dall'algoritmo adattivo, con feedback multimodale in tempo reale fornito secondo una politica Q-learning. (6) Vengono mostrati un riepilogo della sessione e un cruscotto delle prestazioni, che mostrano i progressi in relazione al percorso di apprendimento personale del partecipante e alle tappe di competenza. (7) Il partecipante completa un breve sondaggio di soddisfazione (2 min). (8) I dati della sessione vengono caricati automaticamente sul server cloud per l'aggiornamento dei modelli.

Procedure del gruppo di controllo
Il gruppo di controllo ricevette la formazione tradizionale agli strumenti in sala operatoria seguendo protocolli istituzionali standardizzati. La formazione comprendeva una sessione didattica iniziale di 8 ore in aula da parte di educatori infermieristici senior in sala operatoria (OR) che copriva categorie di strumenti, nomenclatura, principi di gestione e tecnica sterile; un manuale di formazione stampato (187 pagine) contenente fotografie degli strumenti, specifiche e descrizioni organizzate per specialità chirurgica; due workshop pratici 4 ore in laboratori di simulazione con set di strumenti fisici sotto supervisione dell'istruttore (rapporto istruttore-apprendente 1:6); l'accesso al sistema di gestione dell'apprendimento istituzionale contenente materiali di formazione digitali per la revisione autodiretta; e sessioni di aggiornamento trimestrali programmate (2 ore) per rivedere strumenti comunemente confusi. Il tempo totale strutturato di istruzione era di 20 ore durante il periodo di studio. Non sono stati incorporati algoritmi adattivi, percorsi personalizzati o componenti potenziati dall'IA.

Misure di risultato
L'esito primario è stato la ritenzione delle conoscenze valutata a 12 mesi dall'addestramento utilizzando la Perioperative Instrument Proficiency Scale (PIPS) validata. L'intero processo di sviluppo dei PIPS, inclusa la generazione di item da una revisione della letteratura e focus group di esperti, la validazione dei contenuti Delphi modificati in tre round (indice di validità del contenuto = 0,94), l'analisi fattoriale esplorativa e confermativa, e la rubrica di valutazione completamente ancorata al comportamento, è documentato nel Supplementary File 3. Lo strumento ha dimostrato forti proprietà psicometriche (α di Cronbach = 0,92, test-re-test ICC = 0,91 a intervalli di 2 settimane). Il PIPS è composto da 24 elementi distribuiti in quattro ambiti: identificazione degli strumenti (6 elementi), competenza nella gestione (6 elementi), protocolli di sicurezza (6 elementi) e comunicazione del team (6 elementi). Ogni elemento utilizza una scala di Likert a cinque punti (1 = principiante a 5 = esperto) con descrittori ancorati al comportamento. Il punteggio totale varia da 24 a 120, con punteggi più alti che indicano una maggiore competenza.

Le valutazioni PIPS sono state condotte da valutatori formati (sei infermieri chirurgici con >10 anni di esperienza in sala operatoria che avevano completato un programma di formazione standardizzato di 8 ore) al punto di partenza, immediatamente dopo l'intervento e ai follow-up di 1, 3, 6 e 12 mesi. I valutatori sono stati accecati all'assegnazione di gruppo tramite identificatori codificati dei partecipanti e hanno valutato registrazioni video modificate per rimuovere eventuali elementi di interfaccia specifici di APLS o display di feedback visibili. I valutatori non sono stati informati su quale modalità di formazione i partecipanti avessero ricevuto. L'affidabilità tra valutatori è stata stabilita tramite la doppia codifica del 20% delle valutazioni (n = 128), ottenendo un ICC > 0,85 in tutti i domini (punteggio totale ICC = 0,89, IC 95%: 0,85-0,92).

Gli esiti secondari sono stati i seguenti: (1) competenza pratica valutata attraverso la valutazione oggettiva e strutturata delle competenze tecniche (OSATS) adattata per la gestione degli strumenti, comprendente sei stazioni standardizzate (massimo 30 punti), amministrata da valutatori esperti ciechi (ICC = 0,87) al momento della linea di partenza e a 3, 6 e 12 mesi. (2) L'efficienza del tempo di formazione è stata misurata come il numero totale di ore per raggiungere la soglia di competenza (PIPS ≥ 75). (3) L'efficacia dei costi si calcola come il costo per apprendente competente, incorporando costi diretti e indiretti, con i costi normalizzati al 2024 Yuan cinese utilizzando dati contabili istituzionali. (4) La soddisfazione degli studenti è stata valutata utilizzando un questionario sulla scala Likert a 5 punti (27 item, coerenza interna α = 0,91). (5) Metriche esplorative di performance cliniche dai sistemi istituzionali di segnalazione della sicurezza: rapporti sugli incidenti correlati agli strumenti durante il periodo post-formazione di 12 mesi, con tassi per 1.000 casi chirurgici adeguati in base alla complessità del caso. Gli esiti degli incidenti di sicurezza sono stati classificati come esplorativi perché lo studio non era alimentato per rilevare differenze in questi eventi a bassa frequenza.

Metodi di analisi statistica
Tutte le analisi statistiche sono state condotte utilizzando la versione R 4.3.0 con l'interfaccia RStudio e i seguenti pacchetti: lme4 per modelli a effetti misti, emmeans ("medie marginali stimate"; un pacchetto R per calcolare medie di gruppo aggiustate dal modello e per condurre confronti post hoc a coppie da modelli a effetti misti adattati), psych per analisi psicometriche, effsize (un pacchetto R per calcolare dimensioni standardizzate degli effetti, inclusi d di Cohen e g di Hedges, con intervalli di confidenza) per i calcoli delle dimensioni dell'effetto, e topi per imputazioni multiple. La soglia di significatività è stata stabilita a priori a α = 0,05 (a due code) per tutti i test di ipotesi.

Sono state applicate correzioni di confronto multiple come segue. Per l'esito primario (punteggio totale PIPS su più punti temporali), è stata tratta un'inferenza dall'interazione Group × Time all'interno del modello lineare a effetti misti utilizzando i gradi di libertà di Kenward-Roger, che non richiede correzioni separate per più punti temporali. Per le sottoscale del dominio PIPS (quattro confronti simultanei), è stata applicata la correzione di Bonferroni (aggiustata α = 0,0125). Per gli esiti secondari (quattro misure: punteggio di efficienza OR, incidenti di sicurezza, punteggio di comunicazione TEAM e frequenza degli errori), è stata applicata la procedura del tasso di false scoperte di Benjamini-Hochberg (q = 0,05). Per le metriche di performance dei sistemi di IA (dieci confronti interni), è stata applicata la correzione di Bonferroni (aggiustata α = 0,005). Tutti i valori p riportati e le determinazioni di significatività fanno riferimento esplicito alla correzione applicabile.

Tutti gli esiti primari e secondari tra gruppi sono stati analizzati utilizzando modelli lineari a effetti misti con effetti fissi per gruppo, tempo e la loro interazione, e intercetti casuali sia per i partecipanti che per i dipartimenti (per tenere conto della correlazione intraclasse derivante dall'allocazione basata su cluster). Il coefficiente di correlazione intraclasse a livello di dipartimento è stato stimato per quantificare il grado di clustering. I pattern di dati mancanti sono stati valutati utilizzando il test MCAR di Little; i dati sono stati ritenuti completamente mancanti a caso e gestiti tramite imputazioni multiple tramite matching predittivo delle medie (m = 20 dataset imputati, risultati aggregati secondo le regole di Rubin). Analisi di sensibilità con analisi completa del caso, numeri variabili di imputazione (m = 10, m = 50) e scenari peggiori/migliori scenari valutarono la robustezza.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Caratteristiche dei partecipanti
Il campione finale includeva 107 partecipanti con eccellente ritenzione (Figura 1). L'analisi di attrito confrontando i completatori (n = 107) con i ritiri (n = 13) non ha rilevato differenze significative nelle caratteristiche di base: età (t = 0,89, p = 0,38), genere (χ2 = 0,21, p = 0,64), ruolo professionale (χ2 = 1,45, p = 0,48), punteggi PIPS di base (t = 0,62, p = 0,54) o assegn...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio osservazionale prospettico, che incorpora elementi quasi-sperimentali tramite allocazioni dipartimentali basate su cluster, fornisce prove che un sistema di apprendimento personalizzato alimentato dall'IA che integra più algoritmi di machine learning è associato a miglioramenti sostanziali nei risultati di addestramento degli strumenti in sala operatoria rispetto agli approcci pedagogici tradizionali. I risultati hanno implicazioni sia per la metodologia dell'intelligenza a...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori dichiarano di non avere interessi finanziari o non finanziari concorrenti legati a quest'opera.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori ringraziano il personale della sala operatoria e il team di formazione infermieristica del Sir Run Run Shaw Hospital per il loro supporto nell'implementazione del programma di formazione e nella raccolta dei dati. Questa ricerca è stata supportata dal Zhejiang Medical and Health Project (numero di finanziamento: 2025HY0440 e 2023KY781). L'ente finanziatore non aveva alcun ruolo nella progettazione dello studio, nella raccolta dati, nell'analisi dei dati, nell'interpretazione dei dati o nella stesura dei manoscritti.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Simulatore chirurgico a feedback aptico (Touch X)3D Systems (precedentemente Sensable)PHANToM Premium 3.0Dispositivo aptico a sei gradi di libertà; utilizzato come interfaccia primaria per la consegna di feedback di forza guidata dall'IA durante compiti simulati di manipolazione e sutura dei tessuti
Piattaforma Software di Simulazione (SimSurgery™ AI Suite)Personalizzato / Sviluppato internamenteN/ASoftware di addestramento proprietario guidato dall'IA che integra moduli di reti neurali convoluzionali (CNN) per la classificazione delle prestazioni in tempo reale e la generazione di feedback adattivo
Sensore di forza/coppiaAutomazione Industriale ATINano17 SI-12-0.12Misure applicate alle forze dello strumento (risoluzione: 0,003 N) durante esercizi di manipolazione e sutura dei tessuti; dati inseriti nell'algoritmo di classificazione AI
Sistema di tracciamento del movimentoNorthern Digital Inc. (NDI)Polaris Vega STTracciamento ottico delle traiettorie degli strumenti chirurgici; precisione volumetrica RMS di 0,12 mm; Utilizzato per la valutazione della precisione della navigazione strumentale
Set di strumenti laparoscopici (addestramento)Karl Storz SE & Co. KG26003 AA / 33310 DBImpugnatore laparoscopico standard da 5 mm e driver ad ago utilizzati sia in esercitazioni basate sull'IA che in quelle convenzionali
Fantasma Tessutale ad Alta Fedeltà (Modello di Tessuti Molli)Laboratori SynDaverModello chirurgico addominale (SKU: SYN-ABD)Sussurgato tessutale sintetico validato per sutura, dissezione ed esercizi di gestione dei tessuti; sostituito ogni 50 utilizzi secondo le indicazioni del produttore
GPU WorkstationNVIDIA / DellDell Precision 7920 con NVIDIA A6000 (48 GB VRAM)Hardware computazionale per l'esecuzione di inferenze AI in tempo reale (latenza di classificazione CNN < 15 ms); Server dedicato collegato al dispositivo haptic
Framework di Reti NeuraliOpen-source (Meta AI)PyTorch v2.1.0Framework di deep learning utilizzato per l'addestramento del modello, la validazione e l'inferenza in tempo reale dell'algoritmo di feedback adattivo
Software di Analisi StatisticaIBM Corp.IBM SPSS Statistics v29.0Utilizzato per modellazione a effetti misti, test t a campioni indipendenti e ANOVA a misure ripetute in tutte le analisi di esito primario e secondario
Software per la visualizzazione e la grafica dei datiGraphPad SoftwareGraphPad Prism v10.0Utilizzato per generare tutte le figure del manoscritto, inclusi barre di errore (SD e IC 95%), curve di ritenzione e grafici a barre raggruppate
Sistema di registrazione videoStryker Corp.Piattaforma AIM 4K 1688Acquisizione video intraoperatoria e in sessione di simulazione per una valutazione esperta post-hoc in cieca (punteggio OSATS)
Strumento di Valutazione Strutturata (OSATS)N/A — Strumento pubblicato validatoMartin et al., 1997 (Br J Surg)Valutazione Oggettiva e Strutturata delle Competenze Tecniche; Scala di valutazione globale a sette elementi (1– 5 per articolo) utilizzate per la valutazione da esperti in cieco di suture e maneggiazione dei tessuti
Software di randomizzazione e gestione dei datiOpen-sourceREDCap v13.7.2Acquisizione elettronica dei dati per l'allocazione dei partecipanti (dipartimentale basata su cluster), raccolta dati demografici e monitoraggio longitudinale dei punteggi di follow-up
Modulo di Feedback AudioPersonalizzato / Sviluppato internamenteN/AModulo software che fornisce segnali uditivi correttivi in tempo reale (avvisi codificati per tono) integrati nel sistema di feedback multimodale
Questionario Istituzionale (Sondaggio sulla Soddisfazione degli Studenti)Personalizzato / Sviluppato internamenteN/AScala Likert a 18 elementi (1– 5) questionario che valuta l'efficacia percepita della formazione, l'usabilità del sistema e la fiducia degli apprendenti; somministrata dopo l'addestramento e al follow-up a 24 settimane

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Bajpai, S., Lindeman, B. The trainee’s role in patient safety. Surgical Clinics of North America. 101 (1), 149-160 (2021).
  2. Weiner, L. M., et al. Antimicrobial-resistant pathogens associated with healthcare-associated infections: Summary of data reported to the national healthcare safety network at the Centers for Disease Control and Prevention, 2011–2014. Infection Control & Hospital Epidemiology. 37 (11), 1288-1301 (2016).
  3. Peterson, G., Bramhall, J. Patient safety training: National patient safety goals and cms hospital quality. MedEdPORTAL. , (2013).
  4. Ali, M., Wahab, I. B. A., Huri, H. Z., Yusoff, M. S. Personalised learning in higher education for health sciences: A scoping review protocol. Systematic Reviews. 13 (1), 93(2024).
  5. Hossain, I., Madani, A., Laplante, S. Machine learning perioperative applications in visceral surgery: A narrative review. Frontiers in Surgery. 11, 1493379(2024).
  6. Sweller, J., Van Merriënboer, J. J. G., Paas, F. Cognitive architecture and instructional design: 20 years later. Educational Psychology Review. 31 (2), 261-292 (2019).
  7. Laplante, S., Madani, A. in Artificial Intelligence in Clinical Practice. , 211-216 (2024).
  8. Shahrezaei, A., Sohani, M., Taherkhani, S., Zarghami, S. Y. The impact of surgical simulation and training technologies on general surgery education. BMC Medical Education. 24 (1), 1297(2024).
  9. Ericsson, K. A. Deliberate practice and the acquisition and maintenance of expert performance in medicine and related domains. Academic Medicine. 79, S70-S81 (2004).
  10. Gordon, M., et al. A scoping review of artificial intelligence in medical education: Beme guide no. 84. Medical Teacher. 46 (4), 446-470 (2024).
  11. Knopp, M. I., et al. Ai-enabled medical education: Threads of change, promising futures, and risky realities across four potential future worlds. JMIR Medical Education. 9, e50373(2023).
  12. Escobar-Castillejos, D., Barrera-Animas, A. Y., Noguez, J., Magana, A. J., Benes, B. Transforming surgical training with AI techniques for training, assessment, and evaluation: Scoping review. J Med Internet Res. 27, e58966(2025).
  13. Hla, D. A., Hindin, D. I. Generative AI & machine learning in surgical education. Current Problems in Surgery. 63, 101701(2025).
  14. Masters, K. Submitting artificial intelligence in health professions education papers to medical teachers. Medical Teacher. 46 (10), 1256-1257 (2024).
  15. Abahuje, E., Tuyishime, E., Alayande, B. T. Global surgical simulation education, current practices, and future directions. Surgery. 180, 109050(2025).
  16. Campbell, M. K., Piaggio, G., Elbourne, D. R., Altman, D. G. Consort 2010 statement: Extension to cluster randomised trials. BMJ. 345 (1), e5661-e5661 (2012).
  17. Garibaldi, B. T., Hollon, M. M., Woodworth, G. E., Winkel, A. F., Desai, S. V. Navigating the landscape of precision education: Insights from on-the-ground initiatives. Academic Medicine. 99 (1), S71-S76 (2023).
  18. Desai, S. V., et al. Precision education: The future of lifelong learning in medicine. Academic Medicine. 99 (1), S14-S20 (2024).
  19. Bekbolatova, M., Mayer, J., Ong, C. W., Toma, M. Transformative potential of AI in healthcare: Definitions, applications, and navigating the ethical landscape and public perspectives. Healthcare. 12 (2), 125(2024).
  20. Singh, G., Kumar, J. Advances in Healthcare Information Systems and Administration. ch015, 240-260 (2024).
  21. Schumacher, D. J., Santen, S. A., Pugh, C. M., Burk-Rafel, J. Foreword: The next era of assessment and precision education. Academic Medicine. 99 (Supplement_1), S1-S6 (2023).
  22. Xiaowen, Y., Jingjing, D., Biao, W., Shenzhong, Z., Yana, W. Design strategies for artificial intelligence-based future learning centers in medical universities. BMC Medical Education. 25 (1), (2025).
  23. Ahsan, Z. Integrating artificial intelligence into medical education: A narrative systematic review of current applications, challenges, and future directions. BMC Medical Education. 25 (1), (2025).
  24. Ali, M., Wahab, I. A., Huri, H. Z., Yusoff, M. S. Personalised learning in higher education for health sciences: A scoping review. BMC Medical Education. 25 (1), 969(2025).
  25. Vrdoljak, J., Boban, Z., Vilović, M., Kumrić, M., Božić, J. A review of large language models in medical education, clinical decision support, and healthcare administration. Healthcare. 13 (6), 603(2025).
  26. Bayly-Castaneda, K., Ramirez-Montoya, M. S., Morita-Alexander, A. Crafting personalized learning paths with AI for lifelong learning: A systematic literature review. Frontiers in Education. 9, 1424386(2024).
  27. Vp, V. The role of metafora in revolutionizing personalized learning through AI in higher education. SSRN Electronic Journal. , (2025).
  28. Varas, J., et al. Innovations in surgical training: Exploring the role of artificial intelligence and large language models (LLM). Rev Col Bras Cir. 50, e20233605(2023).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Artificial Intelligence TrainingPersonalized LearningOperating Room TrainingInstrument HandlingSimulation Based TrainingDeep Learning RecognitionReinforcement LearningCompetency PredictionPatient SafetySurgical Skill Retention

Related Articles