Research Article

El aprendizaje personalizado impulsado por inteligencia artificial mejora el entrenamiento con instrumentos en quirófano: un estudio observacional prospectivo

DOI:

10.3791/70487

April 17th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio observacional prospectivo demostró que un sistema de aprendizaje personalizado impulsado por inteligencia artificial mejoró significativamente la competencia instrumental a largo plazo en quirófano, redujo incidentes de seguridad y mejoró la eficiencia de la formación en comparación con la instrucción tradicional.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La formación tradicional de instrumentos en quirófano suele basarse en una enseñanza única para todos, produce una mala retención de habilidades a largo plazo y contribuye a errores quirúrgicos evitables. El presente estudio planteó la hipótesis de que un sistema de aprendizaje personalizado impulsado por inteligencia artificial (IA) podría mejorar la competencia técnica, la seguridad del paciente y la eficiencia de la formación adaptando la práctica a los perfiles individuales de los estudiantes. Se desarrolló un sistema de aprendizaje personalizado (APLS) impulsado por IA que combina fenotipado basado en datos, reconocimiento de instrumentos basado en aprendizaje profundo, predicción conjunta de trayectorias de competencias y aprendizaje por refuerzo para proporcionar retroalimentación multimodal adaptativa durante el entrenamiento basado en simulación. En un estudio observacional prospectivo con asignación departamental basada en clústeres (introduciendo elementos cuasi-experimentales) en un hospital terciario, 107 miembros del personal multidisciplinar de quirófano completaron el plan de estudios impulsado por IA o la formación estándar dirigida por un instructor. El resultado principal fue la retención de la competencia en el manejo de instrumentos a 12 meses, medida mediante la escala de competencia perioperatoria (PIPS); Los resultados secundarios incluyeron incidentes de seguridad en quirófano, tiempo de formación y coste por profesional competente. En comparación con la formación tradicional, el sistema personalizado se asoció con puntuaciones de competencia a 12 meses sustancialmente más altas (APLS 84,1 ± 9,2 frente a Control 58,9 ± 18,7, p < 0,001), menos eventos relacionados con la seguridad en la práctica clínica y casi la mitad del tiempo de formación, reduciendo los costes totales de formación en un 38,3%. El conjunto de IA también superó a sus componentes individuales de aprendizaje automático a la hora de predecir el rendimiento del alumno y seleccionar estrategias de retroalimentación. Estos hallazgos sugieren que integrar el descubrimiento no supervisado de fenotipos, la predicción supervisada y el aprendizaje por refuerzo en una plataforma unificada puede mejorar de manera significativa la formación instrumental en quirófano y puede ofrecer un marco escalable para el desarrollo de la fuerza laboral basado en datos en cuidados perioperatorios.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El entorno del quirófano representa uno de los entornos más complejos del sector sanitario, en el que la colaboración multidisciplinar eficaz impacta directamente en los resultados de seguridad del paciente y en la calidadquirúrgica 1,2. La formación insuficiente en competencia instrumental contribuye a aproximadamente 15.000 errores quirúrgicos prevenibles anuales solo en hospitales chinos, con fallos de comunicación y deficiencias técnicas que representan el 72% de los eventos adversosperioperatorios 3. Los enfoques tradicionales de formación se basan en metodologías estandarizadas que no tienen en cuenta las diferencias individuales de aprendizaje, las variaciones en el procesamiento cognitivo ni las trayectorias de desarrollo de competenciaspersonalizadas 4,5.

Desde un punto de vista teórico, varios marcos educativos iluminan por qué los enfoques personalizados pueden ser superiores a la instrucción estandarizada en dominios psicomotores complejos. La teoría de la cargacognitiva 6 sostiene que el diseño instruccional debe tener en cuenta la capacidad limitada de la memoria de trabajo, especialmente cuando los alumnos deben procesar simultáneamente información procedural, conceptual y perceptiva novedosa en entornos de alta fidelidad, como elquirófano 7. Al adaptar la dificultad del contenido y la modalidad de presentación a los perfiles cognitivos individuales, los sistemas personalizados pueden optimizar el equilibrio entre la carga cognitiva intrínseca y la superflua. El marco de la práctica deliberada sugiere además que la adquisición de habilidades se maximiza cuando la formación incorpora niveles de desafío individualizados, retroalimentación correctiva inmediata y repetición enfocada en debilidades identificadas, elementos difíciles de implementar de forma consistente en modelos tradicionales de aprendizaje pero que se operacionalizan de forma natural mediante adaptación algorítmica8. Además, la zona de desarrollo proximal proporciona una base teórica para el ajuste adaptativo de la dificultad, lo que sugiere que el aprendizaje es más efectivo cuando las tareas están calibradas para situarse justo más allá de la capacidad independiente actualdel aprendiz 9. Estas consideraciones teóricas apoyan colectivamente la hipótesis de que un sistema de IA capaz de ajustar dinámicamente los parámetros instruccionales según las características individuales del aprendiz debería superar a un entrenamiento estático y de talla única.

Los avances recientes en aprendizaje automático y análisis de rendimiento en tiempo real han ofrecido un potencial significativo para abordar los desafíoseducativos 6,7. Las aplicaciones contemporáneas de IA en la educación quirúrgica han mostrado potencial, con estudios que reportan mejoras sustanciales en la adquisición de habilidades cuando se implementan sistemas de retroalimentación impulsados por IA. Sin embargo, las plataformas de formación quirúrgica basadas en IA existentes, incluidos sistemas comerciales como Touch Surgery y plataformas similares revisadas en un estudioprevio, se han basado principalmente en arquitecturas de un solo algoritmo, típicamente redes neuronales aisladas o árboles de decisión, que proporcionan ensayos de procedimientos mediante guías visuales paso a paso sin retroalimentación adaptativa en tiempo real ni optimización individualizada de rutas de aprendizaje. Estudios previos no han integrado el procesamiento multimodal de fusión de sensores de flujos de datos heterogéneos (seguimiento ocular, captura de movimiento y monitorización fisiológica) con mecanismos de retroalimentación adaptativa que se ajusten dinámicamente a las trayectorias de aprendizaje individuales mediante aprendizajepor refuerzo 10,11. Además, los sistemas existentes no han combinado el descubrimiento no supervisado de fenotipos con métodos de predicción supervisados dentro de un marco educativounificado 12,13. Estas lagunas representan oportunidades perdidas, ya que la literatura teórica sobre aprendizaje personalizado sugiere firmemente que los sistemas adaptativos integrados y multicomponentes deberían ser más efectivos que los enfoques de un solo componente14.

Los marcos educativos actuales en entornos perioperatorios presentan varias limitaciones importantes 8,15. Los modelos tradicionales de aprendizaje proporcionan experiencias de aprendizaje inconsistentes, con una variabilidad significativa en la calidad del instructor, la estandarización por retroalimentación y la fiabilidad de la evaluación de competencias. Estos enfoques no acomodan estilos de aprendizaje diversos, no se adaptan a las tasas de progreso individuales y carecen de los análisis sofisticados necesarios para optimizar los resultadoseducativos 11,15. Para abordar estas necesidades no cubiertas, este estudio introduce el sistema de aprendizaje personalizado impulsado por IA (APLS), una intervención educativa integral que unifica cuatro componentes algorítmicamente distintos dentro de una única plataforma adaptativa diseñada para el entrenamiento multidisciplinar de instrumentos en quirófano. Hasta donde sabemos, el sistema es uno de los primeros en integrar empíricamente las siguientes capacidades en la literatura de educación quirúrgica: una arquitectura híbrida que combina agrupamiento no supervisado para el descubrimiento de fenotipos del aprendiz basado en datos con clasificación supervisada para asignación de fenotipos en tiempo real; una cadena de aprendizaje por transferencia que adapta una red neuronal convolucional preentrenada al reconocimiento visual de instrumentos quirúrgicos utilizando datos limitados específicos de dominio; un módulo de aprendizaje por refuerzo que refina iterativamente el tiempo y la modalidad de retroalimentación mediante la interacción con el aprendiz; y un marco de predicción en conjunto que sintetiza resultados de múltiples algoritmos heterogéneos para predecir trayectorias de competencia con mayor precisión que cualquier modelo constituyente por sí solo. Al evaluar el APLS frente a la formación estándar dirigida por un instructor mediante una comparación prospectiva de 12 meses de resultados de aprendizaje, indicadores de rendimiento clínico, eficiencia de la formación y coste-efectividad, este estudio busca determinar si una plataforma personalizada unificada impulsada por IA puede avanzar de manera significativa la educación con instrumentos perioperatorios más allá de la práctica pedagógica actual.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio se llevó a cabo de acuerdo con la Declaración de Helsinki y fue aprobado por el Comité de Ética del Hospital Sir Run Run Shaw, Facultad de Medicina de la Universidad de Zhejiang (Número de aprobación: 0480, aprobado el 10 de agosto de 2025). Todos los participantes proporcionaron un consentimiento informado por escrito antes de participar.

Diseño y entorno del estudio
Un estudio observacional prospectivo con asignación departamental basada en clústeres se llevó a cabo desde enero de 2024 hasta febrero de 2025 en el Hospital Sir Run Run Shaw, Facultad de Medicina de la Universidad de Zhejiang, Hangzhou, China. La estrategia de asignación basada en departamentos introduce elementos cuasi-experimentales en este diseño; Por tanto, las inferencias causales deben interpretarse con la debidaprecaución 16. El estudio empleó una comparación en grupos paralelos con la asignación basada en la asignación departamental para evitar el intercambio de información entre grupos. Se implementó una inscripción estratificada para garantizar características de referencia comparables. El hospital mantenía un laboratorio de simulación dedicado equipado con quirófanos estandarizados, instrumentos quirúrgicos, equipos de monitorización y capacidades de grabación de vídeo.

Selección de ejemplos y participantes
Los profesionales sanitarios fueron reclutados mediante muestreo aleatorio estratificado de todo el personal perioperatorio elegible (n = 342) en el Hospital Sir Run Run Shaw entre noviembre de 2023 y enero de 2024. Las variables de estratificación incluían el rol profesional (enfermeros, tecnólogos quirúrgicos y técnicos en anestesia), nivel de experiencia (<5, 5–10, 10–15 y >15 años), nivel educativo (títulos de asociado, grado y máster) y el departamento clínico (cirugía general, cirugía ortopédica, cirugía cardiovascular y otras especialidades). Se aplicaron números aleatorios generados por ordenador (software R, set.seed = 12345 para reproducibilidad) dentro de cada estrato utilizando la función de muestreo para asegurar un muestreo representativo en todas las categorías demográficas y profesionales. El tamaño de la muestra se calculó utilizando el software G*Power 3.1.9.7 basándose en datos preliminares del piloto (n = 30) con un tamaño de efecto anticipado d de Cohen = 0,60, nivel de significación bilateral α = 0,05 y potencia estadística deseada (1 − β) = 0,80, lo que indica un requisito mínimo de 90 participantes (45 por grupo). Para tener en cuenta la tasa prevista de abandono escolar del 15% (rotación) basada en datos históricos institucionales, el objetivo de inscripción se estableció en 104 participantes. La matrícula real alcanzó los 120 participantes, proporcionando un 87% de poder tras contabilizar el 11% final de la rotación.

Requisitos de inclusión
(1) empleo actual en el Hospital Sir Run Run Shaw en funciones perioperatorias; (2) mínimo 6 meses de experiencia en quirófano; (3) disponibilidad durante toda la duración de los 13 meses del estudio; (4) disposición a participar en todas las actividades de evaluación; y (5) alfabetización informática básica, definida como la capacidad de navegar por navegadores web y usar pulsaciones de teclado y ratón de forma independiente.

Criterios de exclusión incluidos
Permiso prolongado planificado durante el periodo de estudio, participación en otros programas de formación de instrumentos quirúrgicos en los 6 meses anteriores, discapacidad visual no corregible a visión 20/40 o superior, y matrícula actual en programas formales de grado en tecnología quirúrgica. Inicialmente se reclutaron un total de 120 participantes, de los cuales 107 completaron el protocolo completo del estudio (tasa de finalización del 89,2%). Las razones de la baja incluyeron cambios de empleo (n = 7), circunstancias personales (n = 4) y dificultades relacionadas con la tecnología (n = 2). El análisis de desgaste mediante regresión logística no mostró asociación significativa entre las características de retirada y de referencia como la edad (OR = 1,03, p = 0,52), el género (OR = 0,87, p = 0,85), el rol profesional (p = 0,73) o las puntuaciones iniciales de PIPS (OR = 1,01, p = 0,67), lo que indica un patrón de ausencia aleatoria confirmado por la prueba MCAR de Little (χ2 = 43,2, df = 38, p = 0,26).

Asignación en grupo
Para minimizar los efectos de contaminación inherentes a las intervenciones educativas, los participantes fueron asignados a grupos de intervención o control según la afiliación departamental. Los departamentos (n = 8) se emparejaron en pares según el volumen de casos quirúrgicos y el tamaño del personal, y luego se asignaron aleatoriamente a APLS o condiciones de control mediante aleatorización generada por ordenador (software R, semilla = 54321). Este enfoque basado en conglomerados se adoptó porque la aleatorización individual dentro de los departamentos supondría un riesgo considerable de contaminación cruzada a medida que los colegas comparten conocimientos y experiencias formativas. Se reconoce que la cultura departamental, la calidad del liderazgo, las prácticas educativas de referencia y la combinación de casos pueden influir de forma independiente en los resultados, representando posibles fuentes de confusión residual que no pueden abordarse completamente en un diseño aleatorizadono individualizado 16. El muestreo estratificado aseguró características de línea base comparables. Los evaluadores de resultados que realizaron evaluaciones PIPS quedaron cegados ante la asignación grupal mediante identificadores codificados de participantes. Los analistas estadísticos recibieron conjuntos de datos desidentificados con etiquetas de grupo enmascaradas hasta que se completaron los análisis primarios.

Arquitectura del sistema APLS e implementación técnica
El APLS comprende cuatro componentes computacionales integrados que operan en una plataforma en la nube (Table of Materials). El sistema fue desarrollado utilizando frameworks de aprendizaje profundo de código abierto y una interfaz web (véase Tabla de Materiales) con protocolos API RESTful (interfaz de programación de aplicaciones para transferencia de estado representativo, que permite comunicación estandarizada basada en HTTP entre el cliente front-end y los módulos de aprendizaje automático del lado del servidor), autenticación basada en JSON Web Token (JWT) (asegurando que solo los usuarios autorizados y los componentes del sistema puedan acceder a los datos del aprendiz y modelar los puntos finales). y cifrado TLS 1.3 a la capa de transporte (que asegura todos los datos en tránsito entre dispositivos clientes, el servidor de aplicaciones y la infraestructura de servicio de modelos basada en la nube) para la seguridad de los datos. En el Archivo Suplementario 1 se proporciona una descripción completa del entorno de software, incluyendo especificaciones de dependencias (requirements.txt), estructura de archivos de configuración y comandos de inicialización de la tubería de datos.

Configuración y calibración de hardware
Antes de cada sesión de entrenamiento, se realizaba la siguiente secuencia de calibración de hardware. Un dispositivo de seguimiento ocular (véase Tabla de Materiales) se posicionaba a 60–70 cm de los ojos del participante sobre un soporte ajustable en altura, y la calibración se ejecutaba usando el protocolo estándar de 9 puntos del fabricante con una precisión de ≤0,5° en ángulo visual. Una matriz de ocho cámaras (véase Tabla de Materiales) se dispuso en una configuración circular con un radio de 2,5 m desde el centro de la estación de entrenamiento, situado a alturas alternas entre 1,8 m y 2,4 m, y calibrado usando el procedimiento de varita del fabricante con un umbral de error residual de ≤0,3 mm. Los marcadores reflectantes (n = 16, diámetro = 12,7 mm) se colocaron en puntos anatómicos estandarizados en ambas manos y muñecas según el protocolo de colocación de marcadores descrito en el Archivo Suplementario 2. Se colocaron dispositivos de monitorización fisiológica según las instrucciones del fabricante y se verificaron la calidad de la señal antes del inicio de la sesión.

Componente 1: Sistema de clasificación de fenotipos del aprendiz
El sistema de clasificación emplea un enfoque híbrido en dos etapas que combina aprendizaje no supervisado y no supervisado. En la Etapa 1, el agrupamiento k-media se utiliza en los datos de evaluación de referencia para descubrir agrupaciones naturales de aprendices. Las características de entrada (n = 37) incluyen puntuaciones de dominio PIPS de referencia (4 características), puntuaciones de inventario de estilo de aprendizaje VARK (4 características), velocidad de procesamiento cognitivo de tareas de tiempo de reacción computarizadas (3 características), puntuaciones de confort tecnológico (1 característica), variables demográficas (3 características), capacidad de memoria de trabajo de pruebas de amplitud de dígitos (2 características), razonamiento espacial de tareas de rotación mental (1 característica), puntuaciones de referencia de habilidades motoras finas (3 características), Rasgos de personalidad de los cinco grandes (5 características) y métricas de rendimiento previas de registros institucionales (3 características). Especificaciones detalladas de preprocesamiento, procedimientos de optimización de hiperparámetros y clasificaciones de importancia de características se proporcionan en el Archivo Suplementario 1 (Sección S2). Los tres grupos resultantes se caracterizaron como rápidos (30,9%), promedio (49,1%) y aprendices lentos (20,0%). En la Fase 2, la clasificación supervisada se realiza utilizando máquinas de vectores de soporte entrenadas con etiquetas de clúster para permitir la clasificación en tiempo real de los nuevos aprendices. El espacio completo de búsqueda de hiperparámetros, los resultados de validación cruzada y las métricas de clasificación por clase se informan en el Archivo Suplementario 1 (Sección S2.3).

Componente 2: Integración multimodal de datos y sistema de fusión de sensores
La plataforma integra cinco flujos de datos heterogéneos: datos de seguimiento ocular, datos de captura de movimiento, monitorización fisiológica (variabilidad de la frecuencia cardíaca, respuesta galvánica cutánea y cortisol salival), análisis de rendimiento mediante análisis automatizado de vídeo y registro de interacciones. Las especificaciones detalladas de sensores, las canalizaciones de preprocesamiento, los procedimientos de extracción de características y la arquitectura de la red neuronal convolucional para la estimación del estado cognitivo se describen en el Archivo Suplementario 1 (Sección S3). El sistema de fusión produce representaciones de estados cognitivos que se actualizan cada 1 segundos y codifican atención integrada, ejecución motora, carga cognitiva y rendimiento de tareas.

Componente 3: Motor de análisis predictivo
El sistema de predicción en conjunto combina tres algoritmos complementarios: bosque aleatorio, máquina de aumento de gradiente (XGBoost) y una red neuronal profunda con capas de memoria a corto plazo largo (LSTM) que procesan incrustaciones de estados cognitivos como series temporales. La agregación de conjuntos utiliza votación suave ponderada con ponderaciones optimizadas mediante datos de validación. Las especificaciones algorítmicas completas, los valores de hiperparámetros, los procedimientos de entrenamiento y los diagnósticos de convergencia se proporcionan en el Archivo Suplementario 1 (Sección S4). Los conjuntos de datos de entrenamiento, validación, despliegue y evaluación estaban estrictamente separados; El desarrollo del modelo utilizó exclusivamente datos de un estudio piloto previo de 150 participantes (80% entrenamiento, 20% validación), y los participantes actuales constituyeron un conjunto de datos de despliegue completamente desplegado. El reentrenamiento progresivo durante el despliegue utilizó únicamente los datos de interacción de los 7 días anteriores y no incorporó datos de evaluación de resultados, evitando así la filtración de los resultados de la evaluación hacia los modelos de predicción.

Componente 4: Sistema de retroalimentación adaptativa basado en aprendizaje por refuerzo
El sistema de retroalimentación adaptativa emplea Q-learning, formulando la selección por retroalimentación como un proceso de decisión de Markov. El espacio de estados (25 dimensiones) codifica el estado cognitivo actual, el contexto temporal, los parámetros de la tarea y las características del aprendiz. El espacio de acciones comprende 25 acciones discretas que representan combinaciones de modalidad de retroalimentación, tiempo y especificidad. La función de recompensa incorpora mejora del rendimiento, evitación de sobrecarga cognitiva, mantenimiento del compromiso y latencia de corrección. La formulación matemática del espacio de estados, espacio de acciones, función de recompensa, parámetros de actualización Q-learning y criterios de convergencia se detalla en el Archivo Suplementario 1 (Sección S5).

Flujo de trabajo de las sesiones de entrenamiento
Cada sesión de formación APLS se desarrolla según la siguiente secuencia estandarizada. (1) El participante inicia sesión en la plataforma APLS utilizando las credenciales asignadas en la estación de trabajo de entrenamiento designada. (2) Se verificó la calibración por hardware (eye-tracker, captura de movimiento y sensores fisiológicos) con controles automáticos de calidad que confirmaron la integridad aceptable de la señal. (3) El sistema recupera la clasificación actual del fenotipo del aprendiz del participante y la trayectoria de competencia predicha para configurar los parámetros de la sesión. (4) Un módulo inicial de calentamiento (5 min) presenta una revisión del contenido de la sesión anterior, adaptada al patrón de retención del participante. (5) El módulo de entrenamiento central (40-50 min) presenta la identificación de instrumentos, el manejo y tareas procedimentales a niveles de dificultad determinados por el algoritmo adaptativo, con retroalimentación multimodal en tiempo real proporcionada según una política de Q-learning. (6) Se muestra un resumen de la sesión y un panel de control de desempeño, mostrando el progreso en relación con la trayectoria de aprendizaje personal del participante y sus hitos de competencia. (7) El participante completa una breve encuesta de satisfacción (2 min). (8) Los datos de sesión se suben automáticamente al servidor en la nube para la actualización del modelo.

Procedimientos del grupo de control
El grupo de control recibió formación tradicional en instrumentos de quirófano siguiendo protocolos institucionales estandarizados. La formación consistía en una sesión didáctica inicial de 8 horas en aula a cargo de educadores de enfermería senior en quirófano (OR), cubriendo categorías de instrumentos, nomenclatura, principios de manejo y técnica estéril; un manual de formación impreso (187 páginas) que contiene fotografías de instrumentos, especificaciones y descripciones organizadas por especialidad quirúrgica; dos talleres prácticos de 4 horas en laboratorios de simulación con conjuntos físicos de instrumentos bajo supervisión del instructor (ratio instructor-alumno 1:6); acceso al sistema de gestión del aprendizaje institucional que contiene materiales digitales de formación para revisión autodirigida; y sesiones trimestrales programadas de actualización (2 horas) revisando instrumentos comúnmente confundidos. El tiempo total de instrucción estructurada fue de 20 horas durante el periodo de estudio. No se incorporaron algoritmos adaptativos, vías personalizadas ni componentes mejorados por IA.

Medidas de resultado
El resultado principal fue la retención de conocimientos, evaluada a los 12 meses posteriores al entrenamiento utilizando la Escala de Competencia en Instrumentos Perioperatorios (PIPS) validada. El proceso completo de desarrollo de PIPS, que incluye la generación de ítems a partir de una revisión bibliográfica y grupos focales de expertos, la validación de contenido modificado de Delphi en tres rondas (índice de validez de contenido = 0,94), el análisis factorial exploratorio y confirmatorio, y la rúbrica completa de puntuación anclada en el comportamiento, está documentado en el Archivo Suplementario 3. El instrumento demostró fuertes propiedades psicométricas (α de Cronbach = 0,92, test re-test ICC = 0,91 cada 2 semanas). El PIPS consta de 24 ítems repartidos en cuatro áreas: identificación de instrumentos (6 ítems), competencia en manejo (6 ítems), protocolos de seguridad (6 ítems) y comunicación en equipo (6 ítems). Cada ítem utiliza una escala de Likert de cinco puntos (1 = novato a 5 = experto) con descriptores anclados en el comportamiento. La puntuación total oscila entre 24 y 120, con puntuaciones más altas indicando mayor destreza.

Las evaluaciones PIPS fueron realizadas por evaluadores capacitados (seis enfermeros quirúrgicos con >10 años de experiencia en quirófano que habían completado un programa estandarizado de 8 horas) al inicio, inmediatamente después de la intervención y en los seguimientos de 1, 3, 6 y 12 meses. Los evaluadores quedaron ciegos ante la tarea grupal mediante identificadores codificados de participantes y evaluaron grabaciones de vídeo editadas para eliminar cualquier elemento visible de interfaz o pantalla de retroalimentación específica de APLS. No se informó a los evaluadores sobre la modalidad de formación que habían recibido los participantes. La fiabilidad entre evaluadores se estableció mediante la codificación dual del 20% de las evaluaciones (n = 128), logrando un ICC > 0,85 en todos los dominios (puntuación total ICC = 0,89, IC 95%: 0,85-0,92).

Los resultados secundarios fueron los siguientes: (1) competencia práctica evaluada mediante la evaluación objetiva estructurada de habilidades técnicas (OSATS) adaptada para el manejo de instrumentos, que comprende seis estaciones estandarizadas (máximo 30 puntos), administrada por evaluadores expertos ciegos (ICC = 0,87) al inicio y a los 3, 6 y 12 meses. (2) La eficiencia del tiempo de formación se midió como el número total de horas para alcanzar el umbral de competencia (PIPS ≥ 75). (3) La rentabilidad se calcula como el coste por alumno competente, incorporando costes directos e indirectos, con costes normalizados a 2024 yuanes chinos utilizando datos contables institucionales. (4) La satisfacción del alumno se evaluó mediante un cuestionario de la escala Likert de 5 puntos (27 ítems, consistencia interna α = 0,91). (5) Métricas exploratorias de rendimiento clínico de los sistemas institucionales de informes de seguridad: informes de incidentes relacionados con instrumentos durante el periodo de 12 meses posterior a la formación, con tasas por cada 1.000 casos quirúrgicos ajustadas por la complejidad del caso. Los resultados de incidentes de seguridad se clasificaron como exploratorios porque el estudio no estaba capacitado para detectar diferencias en estos eventos de baja frecuencia.

Métodos de análisis estadístico
Todos los análisis estadísticos se realizaron usando la versión 4.3.0 de R con la interfaz RStudio y los siguientes paquetes: lme4 para modelos de efectos mixtos, emmeans ("medias marginales estimadas"; un paquete R para calcular medias de grupo ajustadas por modelos y realizar comparaciones post hoc por pares de modelos ajustados de efectos mixtos), psych para análisis psicométricos, effsize (un paquete R para calcular tamaños de efecto estandarizados, incluyendo la d de Cohen y la g de Hedges, con intervalos de confianza) para cálculos de tamaño de efecto, y ratones para imputación múltiple. El umbral de significancia se estableció a priori en α = 0,05 (de dos colas) para todas las pruebas de hipótesis.

Se aplicaron correcciones comparativas múltiples de la siguiente manera. Para el resultado principal (puntuación total PIPS a lo largo de los puntos de tiempo), se extrajo la inferencia de la interacción Group × Time dentro del modelo lineal de efectos mixtos utilizando grados de libertad de Kenward-Roger, que no requiere corrección separada para múltiples puntos de tiempo. Para las subescalas del dominio PIPS (cuatro comparaciones simultáneas), se aplicó la corrección de Bonferroni (ajustada α = 0,0125). Para los resultados secundarios (cuatro medidas: puntuación de eficiencia OR, incidentes de seguridad, puntuación de comunicación TEAM y frecuencia de errores), se aplicó el procedimiento de tasa de descubrimiento de errores de Benjamini-Hochberg (q = 0,05). Para las métricas de rendimiento de sistemas de IA (diez comparaciones internas), se aplicó la corrección de Bonferroni (ajustada α = 0,005). Todos los valores p reportados y las determinaciones de significancia hacen referencia explícita a la corrección aplicable.

Todos los resultados primarios y secundarios entre grupos se analizaron utilizando modelos lineales de efectos mixtos con efectos fijos para grupo, tiempo y interacción, e interceptos aleatorios tanto para participantes como para departamentos (para tener en cuenta la correlación intraclase resultante de la asignación basada en conglomerados). Se estimó que el coeficiente de correlación intraclase a nivel de departamento cuantificaría el grado de agrupamiento. Los patrones de datos faltantes se evaluaron utilizando la prueba MCAR de Little; se determinó que faltaban completamente al azar y se manejaron mediante imputación múltiple mediante emparejamiento predictivo de medias (m = 20 conjuntos de datos imputados, resultados agrupados según las reglas de Rubin). Análisis de sensibilidad con análisis completo de casos, números variables de imputación (m = 10, m = 50) y escenarios de peor y mejor caso evaluaron la robustez.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Características de los participantes
La muestra final incluyó a 107 participantes con excelente retención (Figura 1). El análisis de desgaste comparando a los completadores (n = 107) con los retirados (n = 13) no reveló diferencias significativas en las características iniciales: edad (t = 0,89, p = 0,38), género (χ2 = 0,21, p = 0,64), rol profesional (χ2 = 1,45, p = 0,48), puntuaciones PIPS de referencia (t = 0,62, ...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio observacional prospectivo, que incorpora elementos cuasi-experimentales mediante la asignación departamental basada en clústeres, aporta evidencia de que un sistema de aprendizaje personalizado impulsado por IA que integra múltiples algoritmos de aprendizaje automático está asociado a mejoras sustanciales en los resultados de entrenamiento de instrumentos en quirófano en comparación con los enfoques pedagógicos tradicionales. Los hallazgos tienen implicaciones tanto para la ...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores declaran que no tienen intereses financieros o no financieros en competencia relacionados con esta obra.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores agradecen al personal del quirófano y al equipo de educación de enfermería del Hospital Sir Run Run Shaw por su apoyo en la implementación del programa de formación y la recopilación de datos. Esta investigación fue financiada por el Zhejiang Medical and Health Project (número de subvención: 2025HY0440 y 2023KY781). El organismo financiador no tuvo ningún papel en el diseño del estudio, la recogida de datos, el análisis de datos, la interpretación de datos ni la redacción de manuscritos.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Simulador Quirúrgico de Realimentación Háptica (Touch X)3D Systems (anteriormente Sensable)PHANToM Premium 3.0Dispositivo háptico de seis grados de libertad; utilizado como interfaz principal para la entrega de retroalimentación de fuerza impulsada por IA durante tareas simuladas de manipulación y sutura de tejidos
Plataforma de Software de Simulación (SimSurgery™ AI Suite)Personalizada / Desarrollada internamenteN/ASoftware de entrenamiento propietario impulsado por IA que integra módulos de redes neuronales convolucionales (CNN) para clasificación de rendimiento en tiempo real y generación de retroalimentación adaptativa
Sensor de fuerza/parAutomatización Industrial de ATINano17 SI-12-0.12Se miden las fuerzas del instrumento aplicadas (resolución: 0,003 N) durante ejercicios de manipulación de tejidos y sutura; datos introducidos en el algoritmo de clasificación de IA
Sistema de seguimiento de movimientoNorthern Digital Inc. (NDI)Polaris Vega STSeguimiento óptico de trayectorias de instrumentos quirúrgicos; precisión volumétrica RMS de 0,12 mm; Utilizado para la evaluación de la precisión de la navegación por instrumentos
Conjunto de instrumentos laparoscópicos (Entrenamiento)Karl Storz SE & Co. KG26003 AA / 33310 DBAgarradora laparoscópica estándar de 5 mm y apresuradora de aguja usada tanto en brazos de entrenamiento controlados por IA como convencionales
Fantasma de Tejidos de Alta Fidelidad (Modelo de Tejidos Blandos)Laboratorios SynDaverModelo Abdominal Quirúrgico (SKU: SYN-ABD)Sustituto validado de tejido sintético para suturas, disección y ejercicios de manipulación de tejidos; se reemplaza cada 50 usos según las indicaciones del fabricante
Estación de trabajo GPUNVIDIA / DellDell Precision 7920 con NVIDIA A6000 (48 GB de VRAM)Hardware computacional para ejecutar inferencia de IA en tiempo real (latencia de clasificación CNN < 15 ms); servidor dedicado conectado al dispositivo háptico
Marco de Redes NeuronalesCódigo abierto (Meta AI)PyTorch v2.1.0Marco de aprendizaje profundo utilizado para el entrenamiento de modelos, validación e inferencia en tiempo real del algoritmo de retroalimentación adaptativa
Software de Análisis EstadísticoIBM Corp.IBM SPSS Statistics v29.0Utilizado para modelado de efectos mixtos, pruebas t de muestras independientes y ANOVA de medidas repetidas en todos los análisis de resultados primarios y secundarios
Software de visualización de datos y gráficosGraphPad SoftwareGraphPad Prism v10.0Utilizado para generar todas las cifras de manuscritos, incluyendo barras de error (SD e IC 95%), curvas de retención y gráficos de barras agrupados
Sistema de grabación de vídeoStryker Corp.Plataforma AIM 4K 1688Captura de vídeo intraoperatoria y en sesión de simulación para evaluación experta post-hoc a ciegas (puntuación OSATS)
Herramienta de Evaluación Estructurada (OSATS)N/A y mdash; Instrumento publicado validadoMartin et al., 1997 (Br J Surg)Evaluación Objetiva y Estructurada de Habilidades Técnicas; Escala global de puntuación de siete ítems (1– 5 por artículo) utilizado para evaluación experta a ciegas de suturas y manipulación de tejidos
Software de Aleatorización y Gestión de DatosCódigo abiertoREDCap v13.7.2Captura electrónica de datos para la asignación de participantes (departamental basada en clústeres), recogida de datos demográficos y seguimiento longitudinal de la puntuación
Módulo de Retroalimentación de AudioPersonalizada / Desarrollada internamenteN/AMódulo de software que proporciona señales auditivas correctivas en tiempo real (alertas codificadas por tono) integradas en el sistema multimodal de retroalimentación
Cuestionario institucional (Encuesta de Satisfacción del Alumno)Personalizada / Desarrollada internamenteN/AEscala de Likert de 18 ítems (1– 5) cuestionario que evalúe la eficacia percibida de la formación, la usabilidad del sistema y la confianza del alumno; administrado tras el entrenamiento y en el seguimiento a las 24 semanas

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Bajpai, S., Lindeman, B. The trainee’s role in patient safety. Surgical Clinics of North America. 101 (1), 149-160 (2021).
  2. Weiner, L. M., et al. Antimicrobial-resistant pathogens associated with healthcare-associated infections: Summary of data reported to the national healthcare safety network at the Centers for Disease Control and Prevention, 2011–2014. Infection Control & Hospital Epidemiology. 37 (11), 1288-1301 (2016).
  3. Peterson, G., Bramhall, J. Patient safety training: National patient safety goals and cms hospital quality. MedEdPORTAL. , (2013).
  4. Ali, M., Wahab, I. B. A., Huri, H. Z., Yusoff, M. S. Personalised learning in higher education for health sciences: A scoping review protocol. Systematic Reviews. 13 (1), 93(2024).
  5. Hossain, I., Madani, A., Laplante, S. Machine learning perioperative applications in visceral surgery: A narrative review. Frontiers in Surgery. 11, 1493379(2024).
  6. Sweller, J., Van Merriënboer, J. J. G., Paas, F. Cognitive architecture and instructional design: 20 years later. Educational Psychology Review. 31 (2), 261-292 (2019).
  7. Laplante, S., Madani, A. in Artificial Intelligence in Clinical Practice. , 211-216 (2024).
  8. Shahrezaei, A., Sohani, M., Taherkhani, S., Zarghami, S. Y. The impact of surgical simulation and training technologies on general surgery education. BMC Medical Education. 24 (1), 1297(2024).
  9. Ericsson, K. A. Deliberate practice and the acquisition and maintenance of expert performance in medicine and related domains. Academic Medicine. 79, S70-S81 (2004).
  10. Gordon, M., et al. A scoping review of artificial intelligence in medical education: Beme guide no. 84. Medical Teacher. 46 (4), 446-470 (2024).
  11. Knopp, M. I., et al. Ai-enabled medical education: Threads of change, promising futures, and risky realities across four potential future worlds. JMIR Medical Education. 9, e50373(2023).
  12. Escobar-Castillejos, D., Barrera-Animas, A. Y., Noguez, J., Magana, A. J., Benes, B. Transforming surgical training with AI techniques for training, assessment, and evaluation: Scoping review. J Med Internet Res. 27, e58966(2025).
  13. Hla, D. A., Hindin, D. I. Generative AI & machine learning in surgical education. Current Problems in Surgery. 63, 101701(2025).
  14. Masters, K. Submitting artificial intelligence in health professions education papers to medical teachers. Medical Teacher. 46 (10), 1256-1257 (2024).
  15. Abahuje, E., Tuyishime, E., Alayande, B. T. Global surgical simulation education, current practices, and future directions. Surgery. 180, 109050(2025).
  16. Campbell, M. K., Piaggio, G., Elbourne, D. R., Altman, D. G. Consort 2010 statement: Extension to cluster randomised trials. BMJ. 345 (1), e5661-e5661 (2012).
  17. Garibaldi, B. T., Hollon, M. M., Woodworth, G. E., Winkel, A. F., Desai, S. V. Navigating the landscape of precision education: Insights from on-the-ground initiatives. Academic Medicine. 99 (1), S71-S76 (2023).
  18. Desai, S. V., et al. Precision education: The future of lifelong learning in medicine. Academic Medicine. 99 (1), S14-S20 (2024).
  19. Bekbolatova, M., Mayer, J., Ong, C. W., Toma, M. Transformative potential of AI in healthcare: Definitions, applications, and navigating the ethical landscape and public perspectives. Healthcare. 12 (2), 125(2024).
  20. Singh, G., Kumar, J. Advances in Healthcare Information Systems and Administration. ch015, 240-260 (2024).
  21. Schumacher, D. J., Santen, S. A., Pugh, C. M., Burk-Rafel, J. Foreword: The next era of assessment and precision education. Academic Medicine. 99 (Supplement_1), S1-S6 (2023).
  22. Xiaowen, Y., Jingjing, D., Biao, W., Shenzhong, Z., Yana, W. Design strategies for artificial intelligence-based future learning centers in medical universities. BMC Medical Education. 25 (1), (2025).
  23. Ahsan, Z. Integrating artificial intelligence into medical education: A narrative systematic review of current applications, challenges, and future directions. BMC Medical Education. 25 (1), (2025).
  24. Ali, M., Wahab, I. A., Huri, H. Z., Yusoff, M. S. Personalised learning in higher education for health sciences: A scoping review. BMC Medical Education. 25 (1), 969(2025).
  25. Vrdoljak, J., Boban, Z., Vilović, M., Kumrić, M., Božić, J. A review of large language models in medical education, clinical decision support, and healthcare administration. Healthcare. 13 (6), 603(2025).
  26. Bayly-Castaneda, K., Ramirez-Montoya, M. S., Morita-Alexander, A. Crafting personalized learning paths with AI for lifelong learning: A systematic literature review. Frontiers in Education. 9, 1424386(2024).
  27. Vp, V. The role of metafora in revolutionizing personalized learning through AI in higher education. SSRN Electronic Journal. , (2025).
  28. Varas, J., et al. Innovations in surgical training: Exploring the role of artificial intelligence and large language models (LLM). Rev Col Bras Cir. 50, e20233605(2023).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Artificial Intelligence TrainingPersonalized LearningOperating Room TrainingInstrument HandlingSimulation Based TrainingDeep Learning RecognitionReinforcement LearningCompetency PredictionPatient SafetySurgical Skill Retention

Related Articles