$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudio involucró a participantes humanos y fue revisado y aprobado por el Comité de Ética para la Protección de la Investigación Humana, Xianda College of Economics and Humanities, Shanghai International Studies University (Aprobación nº 2025XD1221). Todos los participantes firmaron formularios de consentimiento informado y completaron un entrenamiento previo al experimento de 30 minutos: los participantes de EG aprendieron a interpretar la retroalimentación visual del marco (cartas de radar, mapas de calor), mientras que los participantes de CG solo recibieron formación en operación de plataforma. Para asegurar la precisión en la recogida de datos, el preexperimento también incluyó la calibración de 5 minutos de los rastreadores oculares y sensores fisiológicos.
Objetivos del estudio y resumen del protocolo
El objetivo de este estudio fue crear un sistema de bucle cerrado y de extremo a extremo que integrara adquisición multimodal, extracción de características, fusión bayesiana y retroalimentación visual para evaluar las habilidades de ingeniería de manera interpretable. La Figura 1 muestra el diagrama de protocolos para la evaluación de habilidades de ingeniería en aplicaciones sanitarias basadas en modelado 3D asistido por inteligencia artificial.
Visión general del marco y lógica jerárquica
El marco de evaluación visual para habilidades de ingeniería en aplicaciones de modelado 3D asistido por IA propuesto en este estudio se basa en la lógica de lazo cerrado de "datos - extracción de características - fusión de evidencias - retroalimentación visual". Su objetivo principal es lograr la conversión de extremo a extremo de datos en bruto multimodales a resultados de evaluación de habilidadesinterpretables 22. Para garantizar la extracción fiable de características multimodales para evaluar habilidades de ingeniería, el marco captura simultáneamente señales de interacción, fisiología, mirada, gestos y voz con sincronización temporal a nivel de milisegundos. El marco adopta un diseño de arquitectura jerárquica, compuesto por cuatro capas principales: Capa Multimodal de Adquisición de Datos (L1), Capa de Extracción de Características de IA (L2), Motor de Fusión de Evidencia y Puntuación (L3) y Capa de Retroalimentación Visual (L4). Cada capa realiza interacción bidireccional mediante interfaces de datos estandarizadas, y se introduce simultáneamente un módulo de calibración de marco (L5) para asegurar la validez dinámica de los resultados de la evaluación. La Figura 2 muestra la cadena de datos de extremo a extremo, comenzando con la adquisición de datos multimodales (mirada, cinemática, fisiología, voz) mediante extracción de características basada en IA, puntuación bayesiana y retroalimentación visual y audiovisual en tiempo real. Las capas son interactivas, siendo la Capa 5 quien proporciona calibración continua. Esta arquitectura permite un procesamiento coordinado y una estimación validada de habilidades para los participantes mientras realizan tareas de modelado 3D en vivo.
Ecuación (1) Fórmula de actualización de confianza bayesiana:

Donde: P(θ) representa la probabilidad previa de nivel de habilidad θ (basado en datos históricos de evaluación); P(D∥θ) denota la probabilidad de observar datos de características multimodales D bajo nivel de habilidad θ; P(D) es la probabilidad marginal; P(D∥θ) es la probabilidad posterior del nivel de habilidad θ tras fusionar los datos D, es decir, la puntuación final de confianza. Este marco utilizaba un enfoque estructurado de Delphi yAHP 23 para ponderar los indicadores. Un panel de diez expertos en la materia (cirujanos ortopédicos, ingenieros biomédicos y modeladores médicos CAD experimentados) participó en tres rondas de Delphi evaluando la importancia de un indicador en una escala Likert de 9 puntos hasta que la puntuación experta alcanzó estabilidad (coeficiente de variación <0,15)24. Luego, utilizando las puntuaciones convergentes/distribuidas de los expertos, se construyó y confirmó una matriz de comparación por pares utilizando el criterio de consistencia AHP con una razón de consistencia (CR) < 0,1. Si el CR superaba 0,1, la matriz se reajustaba. Las proporciones de consistencia de los métodos AHP para las matrices de comparación par a par estuvieron entre 0,03 y 0,08, lo que indica una gran consistencia lógica interna a lo largo del enfoque jerárquico multinivel. El diseño de cada capa del framework se adhiere al principio de "modularización - extensibilidad". Por ejemplo, la Capa L1 puede ampliar la dimensión de recogida de datos fisiológicos añadiendo biosensores; La Capa L2 puede adaptarse a los requisitos de evaluación de habilidades de diferentes aplicaciones sanitarias reemplazando modelos preentrenados; La capa L4 admite dimensiones de visualización personalizadas basadas en los roles del usuario. Esto proporciona flexibilidad para aplicaciones posteriores en la formación en modelado 3D médico y en escenarios de certificación profesional de competencias.
Capa de adquisición de datos multimodal
Flujo de eventos de interacción 3D
Este módulo recopila datos operativos de los ingenieros de plataformas de modelado 3D asistidas por IA mediante complementos de software (16), cubriendo tanto eventos de operación discreta como datos de parámetros continuos. Los eventos discretos incluyen la selección de modelos, el ajuste de vértices y la invocación de herramientas de IA, mientras que los parámetros continuos implican modelado de velocidad, conteos de deshacer/rehacer y tasas de aceptación de sugerencias por IA. Cada evento se registra con una marca de tiempo de 13 dígitos y los valores correspondientes del sistema de coordenadas del modelo 3D (x, y, z). Por ejemplo, al ajustar la curvatura de un modelo ortopédico de implante, el complemento registra los tiempos de inicio y fin de la operación, ajusta las coordenadas de vértices y las variaciones de curvatura, formando así un registro de eventos estructurado (véase la Tabla 1 a la Tabla 3 para campos de datos). Estos datos se procesan posteriormente mediante algoritmos personalizados para calcular indicadores geométricos, de eficiencia y cognitivos específicos de cada dominio, permitiendo una caracterización detallada de comportamientos de modelado en aplicaciones relacionadas con la salud.
Señales de movimiento ocular y gestos
Los datos de movimientos oculares se obtienen utilizando un rastreador ocular de escritorio, centrado en los puntos de fijación y los parámetros de sacada en la interfaz de modelado 3D, que reflejan la distribución cognitiva de la atención del ingeniero.
Las señales gestuales son capturadas por una cámara de profundidad, que extrae 22 coordenadas clave de las articulaciones de las extremidades superiores para identificar gestos típicosde modelado 25. La cámara convierte datos de coordenadas gestuales 3D en secuencias vectoriales normalizadas para mitigar las diferencias individuales de tamaño corporal.
La sincronización de datos para este módulo se basa en el disparador unificado de hardware del marco (marca temporal de 10 Hz del software de modelado 3D), con el error de sincronización controlado en ±50 ms ( calculado mediante la Ecuación 3-2) para asegurar la correlación temporal entre los comportamientos ojo/gestos y las operaciones de modelado 26. La ecuación (2) presenta el cálculo del error de sincronización de datos:
(2)
Donde: Et = error de sincronización entre el tiempo de adquisición del dispositivo (tdispositivo) y la marca temporal del software (tsoftware); Dispositivo T = Tiempo real de adquisición del rastreador ocular/cámara de profundidad; t software = marca temporal de disparo del software de modelado 3D.
Datos fisiológicos y de voz
Los datos fisiológicos se recogen mediante sensores portátiles: un sensor de electromiografía (EMG) (frecuencia de muestreo de 1000 Hz) 27, acoplado al antebrazo del ingeniero para registrar la tensión muscular durante operaciones finas, reflejando la estabilidad operativa. Sensor de electrocardiografía (ECG) (frecuencia de muestreo de 250 Hz)28: Se lleva en el pecho para recoger indicadores de variabilidad de la frecuencia cardíaca (VFC), que caracterizan la carga cognitiva. Los datos de voz son capturados por un micrófono direccional (frecuencia de muestreo de 44,1 kHz), y comentarios verbales de los ingenieros de grabación durante el modelado para complementar el análisis del estado cognitivo. Todos los datos fisiológicos y de voz pasan por preprocesamiento antes de almacenarse en la base de datos multimodal con marca temporal. La Figura 3 ilustra la configuración del hardware experimental físico. Los datos de los sensores de los wearables EMG/ECG, el micrófono, el rastreador ocular y una cámara de profundidad están todos conectados a una estación de trabajo de modelado 3D. Antes de guardar los datos temporales en una base de datos multimodal, un módulo de sincronización ajusta todos los flujos (dentro de un margen de ±50 ms). Esta especificación de material implica una entrada fiable y temporalmente alineada en la cadena de extracción y puntuación de características.
Capa de extracción de características de IA
Indicadores geométricos de calidad
Este módulo extrae características cuantitativas que reflejan la precisión y racionalidad de los modelos 3D a partir del flujo de eventos de interacción 3D y del resultado final del modelo, sirviendo como base central para evaluar las habilidades de "precisión de modelado" de los ingenieros. Para evaluar la precisión estructural, la congruencia anatómica y la completitud del modelo 3D utilizando métricas basadas en desviación, topología y características basadas en plantillas, se diseñan tres indicadores clave, con métodos de cálculo y significados físicos detallados a continuación:
Tasa de desviación del modelo (MDR)
Esto mide la desviación geométrica entre el resultado modelado por el ingeniero y la plantilla estándar. La desviación se calcula comparando la distancia euclidiana de puntos clave entre los dos modelos. La fórmula se muestra en la Ecuación (3):
(3)
Donde: n = número de puntos clave predefinidos (fijados entre 50 y 100 según la complejidad del modelo); Pi,engineer = coordenadas 3D del punto de característica i en el modelo del ingeniero; Pi,estándar = coordenadas 3D del punto de rasgo i en la plantilla estándar; |⋅| = operador de distancia euclidiana.
Un MDR más bajo indica una mayor consistencia con el modelo estándar, con un umbral del ≤ 5% para modelos de aplicación sanitaria cualificados. Las competencias de modelado se evaluaron en función de la eficiencia temporal, los movimientos redundantes, la estabilidad de los gestos y los patrones de uso de las herramientas de IA propuestas durante escenarios operativos 3D en tiempo real.
Consistencia topológica (TC)
Esto evalúa si la estructura topológica del modelo 3D cumple con los requisitos de aplicación médica. El indicador se calcula contando el número de defectos topológicos (D) y el número total de elementos topológicos (T, suma de vértices, aristas y caras) en el modelo, como se muestra en la Ecuación (4):
(4)
Por ejemplo, si un modelo de articulación de rodilla contiene 2 aristas no varietadas (D = 2) y 1200 elementos topológicos totales (T = 1200), es un 99,83%. Se requiere un 98% de ≥ para los modelos médicos para evitar riesgos de fabricación.
Completitud de características (FC)
Esto evalúa si el ingeniero ha implementado completamente todas las características obligatorias del modelo de aplicación sanitaria. El indicador se determina comparando el número de características obligatorias completadas (Fcompletadas) con el número total de características obligatorias(total F) definidas en los requisitos de la tarea:
(5)
Indicadores de eficiencia conductual
Este módulo procesa flujos de eventos de interacción 3D y señales gestuales para extraer características que reflejen la eficiencia de las operaciones de modelado de los ingenieros, evaluando sus habilidades de "competencia operativa". Las demandas cognitivas asociadas con el modelado se midieron utilizando señales fisiológicas, de mirada y EMG sincronizadas. Estas métricas registran la distribución de la atención a lo largo del tiempo y las fluctuaciones de carga de trabajo durante el proceso de modelado.
Modelado de la eficiencia temporal (MTE)
Esto compara el tiempo real de modelado del ingeniero (Treal) con el tiempo medio de los expertos senior para la misma tarea (T experto), normalizado a una puntuación de 0 a 100:
(6)
Por ejemplo, si un ingeniero tarda 45 minutos en completar una tarea en la que los expertos trabajan de media 30 minutos, hay 100 - (45 - 30) x 50 = 75, lo que indica una eficiencia moderada.
Tasa de operación redundante (ROR)
Esto cuenta la proporción de operaciones innecesarias en el proceso de modelado. Se calcula como la proporción entre el recuento de operaciones redundantes (Oredundante) y el total de operaciones (O total):
(7)
Las operaciones redundantes son identificadas por el algoritmo de IA mediante la comparación de reglas y el análisis de consistencia de gestos.
Tasa de utilización de herramientas de IA (ATUR)
Esto mide la capacidad del ingeniero para aprovechar funciones asistidas por IA y mejorar la eficiencia. Se define como la proporción entre el recuento de invocaciones de herramientas IA (IAI) y el total de invocaciones de herramientas (Itotal):
(8)
Un ATUR más alto indica una mejor integración de herramientas de IA en el proceso de modelado, que es una habilidad clave para el modelado médico 3D moderno.
Suavidad de gestos (GS)
Esto evalúa la estabilidad de los movimientos de las extremidades superiores del ingeniero durante el modelado. El indicador se calcula mediante la desviación estándar de la velocidad de 22 articulaciones clave de las extremidades superiores (vj) a lo largo del tiempo:
(9)
Una desviación estándar menor (y por tanto una mayor GS) indica gestos más suaves, reflejando una mayor competencia operativa. Estos indicadores se extraen en tiempo real durante el proceso de modelado, con el algoritmo de IA actualizando los valores cada 5 minutos y almacenándolos en la base de datos de características para la fusión posterior.
Indicadores de carga cognitiva
Este módulo analiza señales de movimiento ocular y datos fisiológicos para cuantificar la carga cognitiva del ingeniero durante el modelado, evaluando sus habilidades de "adaptabilidad cognitiva". Los indicadores multimodales se ponderaron utilizando un enfoque Delphi-AHP y actualización bayesiana de evidencia para obtener puntuaciones probabilísticas de habilidades de ingeniería en tiempo real. Se desarrollan tres indicadores clave:
Dispersión de fijación (FD)
Esto refleja la distribución de la atención visual del ingeniero. Se calcula como la distancia euclidiana entre las coordenadas máxima y mínima del punto de fijación ( (xmáx,y máx) y (xmáx, ymin) ) en la interfaz de modelado 3D a lo largo de una ventana de 2 minutos:
(10)
Una FD mayor indica una atención dispersa, a menudo asociada a una alta carga cognitiva.
Variabilidad de la frecuencia cardíaca (VFC) - SDNN
La SDNN (Desviación Estándar de Intervalos Normales a Normales) se extrae de los datos del ECG para medir la fluctuación de la frecuencia cardíaca del ingeniero. Un SDNN más bajo indica una mayor actividad del nervio simpático, reflejando un aumento de la carga cognitiva. El algoritmo de IA primero filtra el ruido del ECG (mediante la transformada de ondas) y luego calcula SDNN usando la Ecuación (11):
(11)
Donde: N = número de latidos normales en una ventana de 5 minutos; RRk = intervalo de tiempo entre el k-ésimo y el (k + 1)-ésimo latido normal;
= intervalo medio RR en la ventana.
Electromiografía (EMG) - Cuadrático medio (RMS)
La RMS de las señales EMG del antebrazo refleja la tensión muscular: una RMS más alta indica un aumento de rigidez muscular debido al estrés cognitivo. La fórmula de cálculo es:
(12)
Donde: m = número de muestras de señal EMG en una ventana de 1 minuto, y EMG(t) = amplitud de la señal EMG en el tiempo t. Se ha creado un diagrama resumen para ayudar a la claridad conceptual y facilitar la replicación de la investigación. Ilustra la relación jerárquica entre los diez indicadores de evaluación y los tres principales constructos que sustentan el marco propuesto: calidad geométrica, eficiencia operativa y adaptabilidad cognitiva. Este diagrama muestra cómo las señales de entrada multimodales se convierten en indicadores medibles que posteriormente se fusionan mediante un enfoque bayesiano para crear una puntuación compuesta de habilidad en ingeniería. Esta visión general transmite una versión resumida de la lógica de evaluación y aumenta la transparencia metodológica de este estudio tanto a nivel formativo como para futuras direcciones educativas y regulatorias. La Figura 4 muestra la estructura jerárquica del marco de evaluación de habilidades de ingeniería sugerido, que organiza diez indicadores multimodales en tres constructos fundamentales: calidad geométrica, eficiencia operativa y flexibilidad cognitiva. Estos factores contribuyen al resultado global de la habilidad utilizada para evaluar el rendimiento del modelado 3D asistido por IA.
Motor de fusión y puntuación de evidencias
Asignación de pesos del indicador (Delphi + AHP)
Este módulo aborda el problema de la importancia diferenciada entre características multidimensionales combinando el método Delphi (consenso de expertos) y el Proceso de Jerarquía Analítica (AHP) para asignar pesos a los diez indicadores extraídos (tres indicadores geométricos de calidad, cuatro indicadores de eficiencia conductual y tres indicadores de carga cognitiva), y para representar estos complejos indicadores multimodales en formatos visuales e interpretables, como cartas de radar, mapas de calor y reproducciones anotadas para inferencias diagnósticas relevantes para la biomedicina.
Etapa de consenso de Delphi
Un panel de diez expertos evaluó la importancia de cada indicador utilizando una escala de 9 puntos (1 = "menos importante", 9 = "más importante") a lo largo de tres rondas de cuestionarios anónimos. Tras cada ronda, se proporcionó retroalimentación estadística —que comprende las puntuaciones medias y los coeficientes de variación (CV)— al panel para facilitar el ajuste de puntuación. La convergencia se definió como un CV ≤ 0,15 para cada indicador. Cabe destacar que el consenso para indicadores como la Tasa de Desviación del Modelo (MDR) y la Tasa de Utilización de Herramientas de IA (ATUR) se logró típicamente en la segunda ronda, atribuido a su relevancia clínica directa.
Para garantizar la robustez técnica, el protocolo estandarizó métodos de cálculo de indicadores de alineación multimodal de datos (tolerancia de sincronización ≤ 50 ms; reloj de disparo unificado a 30 Hz) y métodos de cálculo de indicadores. Por ejemplo, MDR se derivó de 50-100 puntos clave anatómicos, mientras que el umbral de Consistencia Topológica (TC) se estableció en >98% para elementos libres de defectos. Estos umbrales se justificaron frente a los estándares de tolerancia clínica, como una desviación < del 5% para hueso poroso y un error < 3° para los ángulos de bifurcación vascular. Además, la metodología incorporaba puntuación bayesiana con modelado de verosimilitud Gaussiano (usando rangos calibrados de σ para distintos niveles de habilidad) y utilizaba un extractor de características CNN-LSTM entrenado con un tamaño de lote de 32, una tasa de aprendizaje de 1 x 10-4 y 120 épocas.
Establecimiento de la jerarquía AHP
Se construye una jerarquía de tres niveles: Capa Objetivo (A): Evaluación integral de habilidades de ingeniería; Capa de Criterio (B): 3 indicadores de primer nivel (B1: Calidad Geométrica, B2: Eficiencia conductual, B3: Carga Cognitiva); Capa de indicadores (C): 10 indicadores de segundo nivel (C1: MDR, C2: TC, ..., C10: EMG RMS).
Comparación por pares y comprobación de consistencia
A partir de los resultados del consenso de Delphi, se construye una matriz de comparación por pares para la Capa Criterio y la Capa de Indicadores. Tomando como ejemplo la Capa Criterio, la matriz se define como:
(13)
Donde:un ij es la proporción de importancia de Bj respecto a Bj. El vector de peso de la Capa Criterio (WB = [wB1,w B2,w B3]) se calcula mediante el método del vector propio. Para evitar contradicciones lógicas, se comprueba la Razón de Consistencia (CR) usando la Ecuación (14):
(14)
Donde: (λmax = valor propio máximo de la matriz, = número de indicadores), y es el índice de consistencia aleatoria (para n = 3, RI = 0,58). El resultado es aceptable si el CR < 0,1.
A través de este proceso, se obtienen pesos típicos: (Calidad Geométrica), (Eficiencia Conductual), (Carga Cognitiva); el peso de MDR (C1) en la Capa Indicadora suele ser el mayor (~0,25), mientras que el RMS EMG (C10) es el más bajo (~0,05).
Actualización de confianza bayesiana
Este módulo fusiona los indicadores ponderados para generar la puntuación final de confianza en la habilidad, abordando la "incertidumbre de la evaluación de una sola característica" actualizando probabilidades previas con datos multimodales en tiempo real. El proceso se basa en la Ecuación (1) (fórmula bayesiana) y se implementa en dos pasos:
Paso 1: Inicialización de probabilidad previa (P(θ))
El nivel de habilidad se divide en 5 grados: (Novato), (Principiante), (Intermedio), (Avanzado), (Experto). La probabilidad previa se inicializa usando datos históricos: si el sistema ha evaluado 500 ingenieros y 100 se clasifican como θ3, entonces P(θ3) = 100/500 = 0,2. Para usuarios nuevos sin datos históricos, se adopta un prior uniforme (P(θi) = 0,2 para todo i).
Paso 2: Cálculo de probabilidad posterior (P(θ∥D))
Los datos de características multimodales son la suma ponderada de los 10 indicadores normalizados:
(15)
Donde: wCk es el peso del k-ésimo indicador (según la Sección 3.4.1), y lanorma Ck es el valor normalizado del k-ésimo indicador (rango [0,1]).
La probabilidad de verosimilitud se modela usando una distribución gaussiana, asumiendo que los datos de características de los ingenieros a nivel de habilidad siguen (media μi, varianza
). Estos parámetros se calibran utilizando 200 muestras etiquetadas.
Finalmente, la probabilidad posterior se calcula mediante la ecuación (3-1), y el grado de habilidad correspondiente al máximo es el resultado de la evaluación en tiempo real. Por ejemplo, si un ingeniero tiene D = 0,72, y (más alto que otras calificaciones), se clasifica como "Avanzado".
Para visualizar el proceso de actualización de confianza, la Figura 5 muestra cómo se actualizan probabilidades de habilidad iguales conocidas a una distribución posterior utilizando la inferencia bayesiana y señales en tiempo real como evidencia. Tras observar la tarea, el modelo se actualiza para reforzar la evidencia hacia el grado de habilidad con la mayor probabilidad posteriori. Las pruebas de validación indicaron una fuerte estabilidad de convergencia de las calificaciones de expertos, y las puntuaciones bayesianas se correlacionaron fuertemente con las de expertos, apoyando el uso confiable de la actualización bayesiana en el flujo de trabajo.
La salida de esta capa es una puntuación de habilidad completa (0-100, mapeada desde la probabilidad posterior máxima) y un intervalo de confianza, que se transmite a la Capa de Retroalimentación Visual para una presentación intuitiva.
Capa de retroalimentación visual
Carta de radar en tiempo real
Este módulo convierte los 10 indicadores normalizados y las 3 puntuaciones de criterio de tres niveles en un gráfico de radar, permitiendo una comparación intuitiva de las fortalezas y debilidades de las habilidades de los ingenieros. La carta de radar está diseñada con 7 ejes (3 para criterios de primer nivel: B1-B3; 4 para indicadores principales de segundo nivel: C1=MDR, C4=ATUR, C7=FD, C9=SDNN-seleccionados por su alto peso e interpretabilidad), con cada rango de eje normalizado a [0,100] (mapeado a partir de los valores normalizados [0,1 ] mediante las Ecuaciones 3-7). Para mejorar continuamente la precisión de las mediciones mediante anotaciones de expertos y actualizaciones de aprendizaje activo en el inicio del marco, se incorpora un contexto de modelado de salud y un creciente conocimiento.
Ecuación (16) Mapeo de valores indicadores para el gráfico de radar:
(16)
Dónde: Vradar = valor mostrado en el eje de la carta de radar; Norma Ck = valor normalizado del indicador k-ésimo (rango [0,1]).
El gráfico de radar se actualiza en tiempo real (cada 5 minutos) e incluye dos referencias de referencia: una línea de referencia estándar (línea discontinua,radar V = 80, que representa el umbral de nivel de habilidad "Avanzado") y una línea media experta (línea punteada, calculada a partir de los datos históricos de 50 ingenieros senior). La Figura 6 muestra el comportamiento del ingeniero en un conjunto compuesto de indicadores clave: calidad geométrica, carga cognitiva, eficiencia en el uso de herramientas y dispersión de fijaciones, en comparación con los referentes de expertos correspondientes. Como parte de la capa de retroalimentación, las puntuaciones reales, utilizando métricas fusionadas, se tradujeron en un perfil interpretable. Los estudios con usuarios indicaron su implementación exitosa para detectar rápidamente brechas de competencia, promoviendo al tiempo un cálculo estructurado y basado en datos para mejorar durante las tareas de modelado.
Mapa de calor temporal
Este módulo visualiza la tendencia dinámica de cambio de los indicadores de habilidades a lo largo de todo el proceso de modelado, ayudando a identificar periodos en los que los ingenieros enfrentan dificultades. El mapa de calor utiliza una cuadrícula 2D: el eje x representa intervalos de tiempo (segmentos de 10 minutos, sumando un total de 12 segmentos para una tarea de 2 horas), y el eje y representa 5 indicadores clave (C1=MDR, C4=ATUR, C6=GS, C7=FD, C9=SDNN). La intensidad de color de cada celda de la cuadrícula corresponde al valor normalizado del indicador, con una escala de color que va del azul (valor bajo, bajo rendimiento:norma Ck < 0,5) al rojo (valor alto, buen desempeño:norma Ck < 0,8), tal como se define en la Ecuación (17):
La ecuación (3-8) presenta el cálculo de la intensidad del color para el mapa de calor:
(17)
Donde: Icolor = valor de intensidad RGB de color (0-255, 0=azul, 255=rojo); min(Ck norm) y max(Ck norm) = valores mínimos y máximos normalizados del indicador en todos los intervalos de tiempo.
La Figura 7 ilustra los cambios resueltos en el tiempo en la carga cognitiva, la dispersión de fijaciones, la estabilidad de la mirada y las métricas de latencia de decisión en segmentos de 10 minutos. Ten en cuenta que las regiones resaltadas indican una alta demanda cognitiva o interrupciones en el flujo de trabajo. Esta visión temporal se genera directamente a partir de flujos multimodales coalescentes, apoyada por anotaciones de expertos, lo que ilumina su papel crítico en la interacción con la fatiga de modelado, los cambios de atención y las dificultades específicas de cada tarea.
Anotación de reproducción D
Este módulo superpone anotaciones de evaluación de habilidades sobre la reproducción de operaciones del modelo 3D, permitiendo un análisis paso a paso del comportamiento de modelado del ingeniero. La velocidad de reproducción es ajustable (0,5×-2× tiempo real) y se sincroniza con la marca de tiempo de datos multimodal. Se incrustan tres tipos de anotaciones: Anotaciones de error geométrico: Los wireframes rojos resaltan regiones del modelo donde MDR (C1) supera el 5% (umbral de calificación), con etiquetas de texto que muestran el valor de desviación. Anotaciones de advertencia de eficiencia: Aparecen signos de exclamación amarillos en la ubicación de las operaciones redundantes, con ventanas emergentes que muestran el tipo de operación. Anotaciones de carga cognitiva: Las barras de estado verde/rojas en la esquina indican carga cognitiva en tiempo real (basada en C9: SDNN y C10: EMG RMS), con rojo que significa "Alta carga" (SDNN < 50 ms) y verde que significa "Carga normal" (SDNN > 100 ms).
Calibración e iteración del marco
Interfaz de anotación experta
Este módulo proporciona una interfaz humana en el bucle para que expertos senior corrijan y etiqueten los resultados de la evaluación del marco, abordando la "deriva de la precisión de la evaluación" causada por los cambios en los escenarios de aplicación sanitaria. La interfaz está diseñada con tres funciones principales: corrección de resultados, reponderación de indicadores y almacenamiento de anotaciones.
Función de corrección de resultados
Los expertos revisan primero los resultados de la retroalimentación visual y la puntuación integral de habilidades del marco (0-100). Si la puntuación se desvía del juicio del experto, este puede ajustar manualmente la puntuación y registrar la razón. La magnitud de corrección se cuantifica mediante la Ecuación (18):
(18)
Donde: Scorregida = puntuación final corregida; Marco S = puntuación inicial producida por el marco; S experto = puntuación manual del experto; α = peso de corrección (fijado en 0,8 por defecto, asegurando que el juicio experto predomine manteniendo la racionalidad del marco).
Función de reponderación de indicadores
Para calibración específica de escenarios, los expertos pueden ajustar el peso de indicadores individuales mediante una barra deslizante (rango 0-0,5). La interfaz recalcula automáticamente la razón de consistencia (CR) tras un ajuste (usando las Ecuaciones 3-6) y alerta a los expertos si (distribución de pesos ilógica), asegurando que los pesos ajustados sigan siendo válidos matemáticamente.
Función de almacenamiento de anotaciones
Todas las puntuaciones corregidas, pesos ajustados y comentarios de expertos se almacenan en una base de datos anotada con marcas de tiempo y etiquetas de escenario. Esta base de datos sirve como datos de entrenamiento para el módulo de aprendizaje activo en línea posterior, con un esquema de datos típico mostrado en la Tabla 2.
Actualización sobre aprendizaje activo en línea
Este módulo utiliza los datos anotados para optimizar iterativamente los algoritmos centrales del framework (modelos de extracción de características de IA en L2 y motor de puntuación bayesiano en L3), permitiendo que el framework se adapte a nuevos escenarios de aplicación sanitaria sin un reentrenamiento completo. El proceso de actualización sigue una estrategia de consulta por comité (QBC), dividida en tres etapas:
Fase 1: Cálculo de la incertidumbre
Se despliegan tres "modelos de comités" paralelos (todos basados en la misma arquitectura que el modelo de extracción de características L2 pero entrenados con diferentes conjuntos de datos históricos):
Modelo A: Entrenado con datos de modelado ortopédico de implantes;
Modelo B: Entrenado con datos de reconstrucción de órganos;
Modelo C: Entrenado con datos de modelado de implantes dentales.
Para cada muestra no etiquetada (datos de modelado del ingeniero), los modelos del comité generan tres puntuaciones de habilidades predichas. La incertidumbre de la muestra se calcula mediante el coeficiente de variación (CV) de las tres puntuaciones:
(19)
Donde: SA, SB, SC = puntuaciones predichas por los tres modelos de comités; STD (⋅)= desviación estándar;
= promedio de las tres puntuaciones.
Un CV más alto indica un mayor desacuerdo entre los modelos de comité (mayor incertidumbre), lo que significa que la muestra es más valiosa para la anotación.
Etapa 2: Selección de muestras
El framework selecciona el 10% superior de las muestras con el CV más alto y las envía a la interfaz experta de anotación para su etiquetado. Esta estrategia de selección activa reduce el número de muestras que requieren anotación experta (en comparación con la selección aleatoria) en un 40-60%, mejorando la eficiencia de la calibración.
Fase 3: Reentrenamiento y actualización del modelo
Las muestras recién anotadas se utilizan para afinar finamente los algoritmos del marco:
Para modelos de extracción de características L2: El modelo se reentrena con una tasa de aprendizaje de 1e-5 (10% de la tasa inicial de entrenamiento) utilizando los datos de error geométrico anotados, actualizando solo las dos últimas capas para evitar sobreajustes.
Para el motor de puntuación bayesiano L3: Los parámetros de distribución gaussiana (
) para cada nivel de habilidad se actualizan usando los datos de puntuación anotados, con la fórmula de actualización mostrada en la Ecuación (20):
(20)
Donde:
= media actualizada del nivel de habilidad θi;
= media original antes de la actualización; S-θi = puntuación corregida media de muestras anotadas etiquetadas como θi; β = factor de olvido (establecido en 0,7, equilibrando datos históricos y nuevas anotaciones).
El marco actualizado se despliega en línea inmediatamente después de la reentrenamiento, con una comprobación de rendimiento antes del despliegue: si el error absoluto medio entre la nueva salida del framework y las anotaciones de expertos es ≤3 (reducido en ≥20% respecto a la versión anterior), la actualización queda confirmada; de lo contrario, el proceso de reentrenamiento se repite con muestras anotadas adicionales.
Este mecanismo iterativo de calibración garantiza que la precisión de evaluación del marco se mantenga por encima del 90% incluso a medida que evolucionan las tecnologías de modelado 3D en aplicaciones sanitarias, manteniendo la adaptabilidad a largo plazo.