$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudio se llevó a cabo de acuerdo con la Declaración de Helsinki y fue aprobado por el Comité de Ética del Hospital Sir Run Run Shaw, Facultad de Medicina de la Universidad de Zhejiang (Número de aprobación: 0480, aprobado el 10 de agosto de 2025). Todos los participantes proporcionaron un consentimiento informado por escrito antes de participar.
Diseño y entorno del estudio
Un estudio observacional prospectivo con asignación departamental basada en clústeres se llevó a cabo desde enero de 2024 hasta febrero de 2025 en el Hospital Sir Run Run Shaw, Facultad de Medicina de la Universidad de Zhejiang, Hangzhou, China. La estrategia de asignación basada en departamentos introduce elementos cuasi-experimentales en este diseño; Por tanto, las inferencias causales deben interpretarse con la debidaprecaución 16. El estudio empleó una comparación en grupos paralelos con la asignación basada en la asignación departamental para evitar el intercambio de información entre grupos. Se implementó una inscripción estratificada para garantizar características de referencia comparables. El hospital mantenía un laboratorio de simulación dedicado equipado con quirófanos estandarizados, instrumentos quirúrgicos, equipos de monitorización y capacidades de grabación de vídeo.
Selección de ejemplos y participantes
Los profesionales sanitarios fueron reclutados mediante muestreo aleatorio estratificado de todo el personal perioperatorio elegible (n = 342) en el Hospital Sir Run Run Shaw entre noviembre de 2023 y enero de 2024. Las variables de estratificación incluían el rol profesional (enfermeros, tecnólogos quirúrgicos y técnicos en anestesia), nivel de experiencia (<5, 5–10, 10–15 y >15 años), nivel educativo (títulos de asociado, grado y máster) y el departamento clínico (cirugía general, cirugía ortopédica, cirugía cardiovascular y otras especialidades). Se aplicaron números aleatorios generados por ordenador (software R, set.seed = 12345 para reproducibilidad) dentro de cada estrato utilizando la función de muestreo para asegurar un muestreo representativo en todas las categorías demográficas y profesionales. El tamaño de la muestra se calculó utilizando el software G*Power 3.1.9.7 basándose en datos preliminares del piloto (n = 30) con un tamaño de efecto anticipado d de Cohen = 0,60, nivel de significación bilateral α = 0,05 y potencia estadística deseada (1 − β) = 0,80, lo que indica un requisito mínimo de 90 participantes (45 por grupo). Para tener en cuenta la tasa prevista de abandono escolar del 15% (rotación) basada en datos históricos institucionales, el objetivo de inscripción se estableció en 104 participantes. La matrícula real alcanzó los 120 participantes, proporcionando un 87% de poder tras contabilizar el 11% final de la rotación.
Requisitos de inclusión
(1) empleo actual en el Hospital Sir Run Run Shaw en funciones perioperatorias; (2) mínimo 6 meses de experiencia en quirófano; (3) disponibilidad durante toda la duración de los 13 meses del estudio; (4) disposición a participar en todas las actividades de evaluación; y (5) alfabetización informática básica, definida como la capacidad de navegar por navegadores web y usar pulsaciones de teclado y ratón de forma independiente.
Criterios de exclusión incluidos
Permiso prolongado planificado durante el periodo de estudio, participación en otros programas de formación de instrumentos quirúrgicos en los 6 meses anteriores, discapacidad visual no corregible a visión 20/40 o superior, y matrícula actual en programas formales de grado en tecnología quirúrgica. Inicialmente se reclutaron un total de 120 participantes, de los cuales 107 completaron el protocolo completo del estudio (tasa de finalización del 89,2%). Las razones de la baja incluyeron cambios de empleo (n = 7), circunstancias personales (n = 4) y dificultades relacionadas con la tecnología (n = 2). El análisis de desgaste mediante regresión logística no mostró asociación significativa entre las características de retirada y de referencia como la edad (OR = 1,03, p = 0,52), el género (OR = 0,87, p = 0,85), el rol profesional (p = 0,73) o las puntuaciones iniciales de PIPS (OR = 1,01, p = 0,67), lo que indica un patrón de ausencia aleatoria confirmado por la prueba MCAR de Little (χ2 = 43,2, df = 38, p = 0,26).
Asignación en grupo
Para minimizar los efectos de contaminación inherentes a las intervenciones educativas, los participantes fueron asignados a grupos de intervención o control según la afiliación departamental. Los departamentos (n = 8) se emparejaron en pares según el volumen de casos quirúrgicos y el tamaño del personal, y luego se asignaron aleatoriamente a APLS o condiciones de control mediante aleatorización generada por ordenador (software R, semilla = 54321). Este enfoque basado en conglomerados se adoptó porque la aleatorización individual dentro de los departamentos supondría un riesgo considerable de contaminación cruzada a medida que los colegas comparten conocimientos y experiencias formativas. Se reconoce que la cultura departamental, la calidad del liderazgo, las prácticas educativas de referencia y la combinación de casos pueden influir de forma independiente en los resultados, representando posibles fuentes de confusión residual que no pueden abordarse completamente en un diseño aleatorizadono individualizado 16. El muestreo estratificado aseguró características de línea base comparables. Los evaluadores de resultados que realizaron evaluaciones PIPS quedaron cegados ante la asignación grupal mediante identificadores codificados de participantes. Los analistas estadísticos recibieron conjuntos de datos desidentificados con etiquetas de grupo enmascaradas hasta que se completaron los análisis primarios.
Arquitectura del sistema APLS e implementación técnica
El APLS comprende cuatro componentes computacionales integrados que operan en una plataforma en la nube (Table of Materials). El sistema fue desarrollado utilizando frameworks de aprendizaje profundo de código abierto y una interfaz web (véase Tabla de Materiales) con protocolos API RESTful (interfaz de programación de aplicaciones para transferencia de estado representativo, que permite comunicación estandarizada basada en HTTP entre el cliente front-end y los módulos de aprendizaje automático del lado del servidor), autenticación basada en JSON Web Token (JWT) (asegurando que solo los usuarios autorizados y los componentes del sistema puedan acceder a los datos del aprendiz y modelar los puntos finales). y cifrado TLS 1.3 a la capa de transporte (que asegura todos los datos en tránsito entre dispositivos clientes, el servidor de aplicaciones y la infraestructura de servicio de modelos basada en la nube) para la seguridad de los datos. En el Archivo Suplementario 1 se proporciona una descripción completa del entorno de software, incluyendo especificaciones de dependencias (requirements.txt), estructura de archivos de configuración y comandos de inicialización de la tubería de datos.
Configuración y calibración de hardware
Antes de cada sesión de entrenamiento, se realizaba la siguiente secuencia de calibración de hardware. Un dispositivo de seguimiento ocular (véase Tabla de Materiales) se posicionaba a 60–70 cm de los ojos del participante sobre un soporte ajustable en altura, y la calibración se ejecutaba usando el protocolo estándar de 9 puntos del fabricante con una precisión de ≤0,5° en ángulo visual. Una matriz de ocho cámaras (véase Tabla de Materiales) se dispuso en una configuración circular con un radio de 2,5 m desde el centro de la estación de entrenamiento, situado a alturas alternas entre 1,8 m y 2,4 m, y calibrado usando el procedimiento de varita del fabricante con un umbral de error residual de ≤0,3 mm. Los marcadores reflectantes (n = 16, diámetro = 12,7 mm) se colocaron en puntos anatómicos estandarizados en ambas manos y muñecas según el protocolo de colocación de marcadores descrito en el Archivo Suplementario 2. Se colocaron dispositivos de monitorización fisiológica según las instrucciones del fabricante y se verificaron la calidad de la señal antes del inicio de la sesión.
Componente 1: Sistema de clasificación de fenotipos del aprendiz
El sistema de clasificación emplea un enfoque híbrido en dos etapas que combina aprendizaje no supervisado y no supervisado. En la Etapa 1, el agrupamiento k-media se utiliza en los datos de evaluación de referencia para descubrir agrupaciones naturales de aprendices. Las características de entrada (n = 37) incluyen puntuaciones de dominio PIPS de referencia (4 características), puntuaciones de inventario de estilo de aprendizaje VARK (4 características), velocidad de procesamiento cognitivo de tareas de tiempo de reacción computarizadas (3 características), puntuaciones de confort tecnológico (1 característica), variables demográficas (3 características), capacidad de memoria de trabajo de pruebas de amplitud de dígitos (2 características), razonamiento espacial de tareas de rotación mental (1 característica), puntuaciones de referencia de habilidades motoras finas (3 características), Rasgos de personalidad de los cinco grandes (5 características) y métricas de rendimiento previas de registros institucionales (3 características). Especificaciones detalladas de preprocesamiento, procedimientos de optimización de hiperparámetros y clasificaciones de importancia de características se proporcionan en el Archivo Suplementario 1 (Sección S2). Los tres grupos resultantes se caracterizaron como rápidos (30,9%), promedio (49,1%) y aprendices lentos (20,0%). En la Fase 2, la clasificación supervisada se realiza utilizando máquinas de vectores de soporte entrenadas con etiquetas de clúster para permitir la clasificación en tiempo real de los nuevos aprendices. El espacio completo de búsqueda de hiperparámetros, los resultados de validación cruzada y las métricas de clasificación por clase se informan en el Archivo Suplementario 1 (Sección S2.3).
Componente 2: Integración multimodal de datos y sistema de fusión de sensores
La plataforma integra cinco flujos de datos heterogéneos: datos de seguimiento ocular, datos de captura de movimiento, monitorización fisiológica (variabilidad de la frecuencia cardíaca, respuesta galvánica cutánea y cortisol salival), análisis de rendimiento mediante análisis automatizado de vídeo y registro de interacciones. Las especificaciones detalladas de sensores, las canalizaciones de preprocesamiento, los procedimientos de extracción de características y la arquitectura de la red neuronal convolucional para la estimación del estado cognitivo se describen en el Archivo Suplementario 1 (Sección S3). El sistema de fusión produce representaciones de estados cognitivos que se actualizan cada 1 segundos y codifican atención integrada, ejecución motora, carga cognitiva y rendimiento de tareas.
Componente 3: Motor de análisis predictivo
El sistema de predicción en conjunto combina tres algoritmos complementarios: bosque aleatorio, máquina de aumento de gradiente (XGBoost) y una red neuronal profunda con capas de memoria a corto plazo largo (LSTM) que procesan incrustaciones de estados cognitivos como series temporales. La agregación de conjuntos utiliza votación suave ponderada con ponderaciones optimizadas mediante datos de validación. Las especificaciones algorítmicas completas, los valores de hiperparámetros, los procedimientos de entrenamiento y los diagnósticos de convergencia se proporcionan en el Archivo Suplementario 1 (Sección S4). Los conjuntos de datos de entrenamiento, validación, despliegue y evaluación estaban estrictamente separados; El desarrollo del modelo utilizó exclusivamente datos de un estudio piloto previo de 150 participantes (80% entrenamiento, 20% validación), y los participantes actuales constituyeron un conjunto de datos de despliegue completamente desplegado. El reentrenamiento progresivo durante el despliegue utilizó únicamente los datos de interacción de los 7 días anteriores y no incorporó datos de evaluación de resultados, evitando así la filtración de los resultados de la evaluación hacia los modelos de predicción.
Componente 4: Sistema de retroalimentación adaptativa basado en aprendizaje por refuerzo
El sistema de retroalimentación adaptativa emplea Q-learning, formulando la selección por retroalimentación como un proceso de decisión de Markov. El espacio de estados (25 dimensiones) codifica el estado cognitivo actual, el contexto temporal, los parámetros de la tarea y las características del aprendiz. El espacio de acciones comprende 25 acciones discretas que representan combinaciones de modalidad de retroalimentación, tiempo y especificidad. La función de recompensa incorpora mejora del rendimiento, evitación de sobrecarga cognitiva, mantenimiento del compromiso y latencia de corrección. La formulación matemática del espacio de estados, espacio de acciones, función de recompensa, parámetros de actualización Q-learning y criterios de convergencia se detalla en el Archivo Suplementario 1 (Sección S5).
Flujo de trabajo de las sesiones de entrenamiento
Cada sesión de formación APLS se desarrolla según la siguiente secuencia estandarizada. (1) El participante inicia sesión en la plataforma APLS utilizando las credenciales asignadas en la estación de trabajo de entrenamiento designada. (2) Se verificó la calibración por hardware (eye-tracker, captura de movimiento y sensores fisiológicos) con controles automáticos de calidad que confirmaron la integridad aceptable de la señal. (3) El sistema recupera la clasificación actual del fenotipo del aprendiz del participante y la trayectoria de competencia predicha para configurar los parámetros de la sesión. (4) Un módulo inicial de calentamiento (5 min) presenta una revisión del contenido de la sesión anterior, adaptada al patrón de retención del participante. (5) El módulo de entrenamiento central (40-50 min) presenta la identificación de instrumentos, el manejo y tareas procedimentales a niveles de dificultad determinados por el algoritmo adaptativo, con retroalimentación multimodal en tiempo real proporcionada según una política de Q-learning. (6) Se muestra un resumen de la sesión y un panel de control de desempeño, mostrando el progreso en relación con la trayectoria de aprendizaje personal del participante y sus hitos de competencia. (7) El participante completa una breve encuesta de satisfacción (2 min). (8) Los datos de sesión se suben automáticamente al servidor en la nube para la actualización del modelo.
Procedimientos del grupo de control
El grupo de control recibió formación tradicional en instrumentos de quirófano siguiendo protocolos institucionales estandarizados. La formación consistía en una sesión didáctica inicial de 8 horas en aula a cargo de educadores de enfermería senior en quirófano (OR), cubriendo categorías de instrumentos, nomenclatura, principios de manejo y técnica estéril; un manual de formación impreso (187 páginas) que contiene fotografías de instrumentos, especificaciones y descripciones organizadas por especialidad quirúrgica; dos talleres prácticos de 4 horas en laboratorios de simulación con conjuntos físicos de instrumentos bajo supervisión del instructor (ratio instructor-alumno 1:6); acceso al sistema de gestión del aprendizaje institucional que contiene materiales digitales de formación para revisión autodirigida; y sesiones trimestrales programadas de actualización (2 horas) revisando instrumentos comúnmente confundidos. El tiempo total de instrucción estructurada fue de 20 horas durante el periodo de estudio. No se incorporaron algoritmos adaptativos, vías personalizadas ni componentes mejorados por IA.
Medidas de resultado
El resultado principal fue la retención de conocimientos, evaluada a los 12 meses posteriores al entrenamiento utilizando la Escala de Competencia en Instrumentos Perioperatorios (PIPS) validada. El proceso completo de desarrollo de PIPS, que incluye la generación de ítems a partir de una revisión bibliográfica y grupos focales de expertos, la validación de contenido modificado de Delphi en tres rondas (índice de validez de contenido = 0,94), el análisis factorial exploratorio y confirmatorio, y la rúbrica completa de puntuación anclada en el comportamiento, está documentado en el Archivo Suplementario 3. El instrumento demostró fuertes propiedades psicométricas (α de Cronbach = 0,92, test re-test ICC = 0,91 cada 2 semanas). El PIPS consta de 24 ítems repartidos en cuatro áreas: identificación de instrumentos (6 ítems), competencia en manejo (6 ítems), protocolos de seguridad (6 ítems) y comunicación en equipo (6 ítems). Cada ítem utiliza una escala de Likert de cinco puntos (1 = novato a 5 = experto) con descriptores anclados en el comportamiento. La puntuación total oscila entre 24 y 120, con puntuaciones más altas indicando mayor destreza.
Las evaluaciones PIPS fueron realizadas por evaluadores capacitados (seis enfermeros quirúrgicos con >10 años de experiencia en quirófano que habían completado un programa estandarizado de 8 horas) al inicio, inmediatamente después de la intervención y en los seguimientos de 1, 3, 6 y 12 meses. Los evaluadores quedaron ciegos ante la tarea grupal mediante identificadores codificados de participantes y evaluaron grabaciones de vídeo editadas para eliminar cualquier elemento visible de interfaz o pantalla de retroalimentación específica de APLS. No se informó a los evaluadores sobre la modalidad de formación que habían recibido los participantes. La fiabilidad entre evaluadores se estableció mediante la codificación dual del 20% de las evaluaciones (n = 128), logrando un ICC > 0,85 en todos los dominios (puntuación total ICC = 0,89, IC 95%: 0,85-0,92).
Los resultados secundarios fueron los siguientes: (1) competencia práctica evaluada mediante la evaluación objetiva estructurada de habilidades técnicas (OSATS) adaptada para el manejo de instrumentos, que comprende seis estaciones estandarizadas (máximo 30 puntos), administrada por evaluadores expertos ciegos (ICC = 0,87) al inicio y a los 3, 6 y 12 meses. (2) La eficiencia del tiempo de formación se midió como el número total de horas para alcanzar el umbral de competencia (PIPS ≥ 75). (3) La rentabilidad se calcula como el coste por alumno competente, incorporando costes directos e indirectos, con costes normalizados a 2024 yuanes chinos utilizando datos contables institucionales. (4) La satisfacción del alumno se evaluó mediante un cuestionario de la escala Likert de 5 puntos (27 ítems, consistencia interna α = 0,91). (5) Métricas exploratorias de rendimiento clínico de los sistemas institucionales de informes de seguridad: informes de incidentes relacionados con instrumentos durante el periodo de 12 meses posterior a la formación, con tasas por cada 1.000 casos quirúrgicos ajustadas por la complejidad del caso. Los resultados de incidentes de seguridad se clasificaron como exploratorios porque el estudio no estaba capacitado para detectar diferencias en estos eventos de baja frecuencia.
Métodos de análisis estadístico
Todos los análisis estadísticos se realizaron usando la versión 4.3.0 de R con la interfaz RStudio y los siguientes paquetes: lme4 para modelos de efectos mixtos, emmeans ("medias marginales estimadas"; un paquete R para calcular medias de grupo ajustadas por modelos y realizar comparaciones post hoc por pares de modelos ajustados de efectos mixtos), psych para análisis psicométricos, effsize (un paquete R para calcular tamaños de efecto estandarizados, incluyendo la d de Cohen y la g de Hedges, con intervalos de confianza) para cálculos de tamaño de efecto, y ratones para imputación múltiple. El umbral de significancia se estableció a priori en α = 0,05 (de dos colas) para todas las pruebas de hipótesis.
Se aplicaron correcciones comparativas múltiples de la siguiente manera. Para el resultado principal (puntuación total PIPS a lo largo de los puntos de tiempo), se extrajo la inferencia de la interacción Group × Time dentro del modelo lineal de efectos mixtos utilizando grados de libertad de Kenward-Roger, que no requiere corrección separada para múltiples puntos de tiempo. Para las subescalas del dominio PIPS (cuatro comparaciones simultáneas), se aplicó la corrección de Bonferroni (ajustada α = 0,0125). Para los resultados secundarios (cuatro medidas: puntuación de eficiencia OR, incidentes de seguridad, puntuación de comunicación TEAM y frecuencia de errores), se aplicó el procedimiento de tasa de descubrimiento de errores de Benjamini-Hochberg (q = 0,05). Para las métricas de rendimiento de sistemas de IA (diez comparaciones internas), se aplicó la corrección de Bonferroni (ajustada α = 0,005). Todos los valores p reportados y las determinaciones de significancia hacen referencia explícita a la corrección aplicable.
Todos los resultados primarios y secundarios entre grupos se analizaron utilizando modelos lineales de efectos mixtos con efectos fijos para grupo, tiempo y interacción, e interceptos aleatorios tanto para participantes como para departamentos (para tener en cuenta la correlación intraclase resultante de la asignación basada en conglomerados). Se estimó que el coeficiente de correlación intraclase a nivel de departamento cuantificaría el grado de agrupamiento. Los patrones de datos faltantes se evaluaron utilizando la prueba MCAR de Little; se determinó que faltaban completamente al azar y se manejaron mediante imputación múltiple mediante emparejamiento predictivo de medias (m = 20 conjuntos de datos imputados, resultados agrupados según las reglas de Rubin). Análisis de sensibilidad con análisis completo de casos, números variables de imputación (m = 10, m = 50) y escenarios de peor y mejor caso evaluaron la robustez.