$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
В этом исследовании участвовали люди, и оно было рассмотрено и одобрено Этическим комитетом по защите человеческих исследований, Колледж экономики и гуманитарных наук Сианда, Шанхайский университет международных исследований (Одобрение No 2025XD1221). Все участники подписывали формы информированного согласия и прошли 30-минутное обучение перед экспериментом: участники EG научились интерпретировать визуальную обратную связь фреймворка (радарные диаграммы, тепловые карты), а участники CG получили только обучение по работе с платформой. Для обеспечения точности сбора данных предэксперимент также включал 5-минутную калибровку глазных трекеров и физиологических датчиков.
Цели исследования и обзор протокола
Целью этого исследования было создание замкнутой, сквозной системы, интегрирующей мультимодальное получение, извлечение признаков, байесовское слияние и визуальную обратную связь для оценки инженерных навыков в интерпретируемой форме. На рисунке 1 показана диаграмма протокола для оценки инженерных навыков в медицинских приложениях на основе 3D-моделирования с помощью искусственного интеллекта.
Обзор фреймворка и иерархическая логика
Визуальная рамка оценки инженерных навыков в приложениях 3D-моделирования здоровья с помощью ИИ, предложенная в данном исследовании, построена на замкнутой логике «данные, управляемые данными — извлечение признаков — слияние доказательств — визуальная обратная связь». Её основная цель — достичь сквозного преобразования мультимодальных исходных данных в интерпретируемые результаты оценкинавыков 22. Для обеспечения надёжного извлечения мультимодальных признаков для оценки инженерных навыков фреймворк одновременно фиксирует взаимодействие, физиологические, взглядные, жестовые и голосовые сигналы с использованием временной синхронизации на уровне миллисекунд. Фреймворк использует иерархическую архитектуру, состоящую из четырёх основных слоёв: Мультимодальный слой сбора данных (L1), Слой извлечения признаков ИИ (L2), Механизм слияния и оценки доказательств (L3) и Слой визуальной обратной связи (L4). Каждый слой реализует двунаправленное взаимодействие через стандартизированные интерфейсы данных, и одновременно вводится модуль калибровки фреймворка (L5) для обеспечения динамической достоверности результатов оценки. Рисунок 2 показывает сквозной конвейер, начиная с мультимодальных данных (взгляд, кинематика, физиология, голос) через извлечение признаков с помощью ИИ, байесовскую оценку и визуальную и аудиовизуальную обратную связь в реальном времени. Слои интерактивны, при этом уровень 5 обеспечивает непрерывную калибровку. Эта архитектура позволяет координировать обработку и валидировать оценку навыков участниками при выполнении задач по 3D-моделированию в реальном времени.
Уравнение (1) Байесовская формула обновления доверия:

Где: P(θ) представляет собой априорную вероятность уровня навыка θ (на основе исторических данных оценки); P(D∥θ) обозначает вероятность наблюдения многомодальных признаков D при уровне навыков θ; P(D) — предельная вероятность; P(D∥θ) — это апостериорная вероятность уровня навыка θ после слияния данных D, то есть итоговый балл уверенности. Эта структура использовала структурированный подход Delphi иAHP 23 для взвешивания индикаторов. Панель из десяти экспертов (ортопедические хирурги, биомедицинские инженеры и опытные медицинские моделисты САПР) приняла участие в трёх раундах Delphi, оценивая важность индикатора по 9-балльной шкале Ликерта до достижения экспертных оценок стабильности (коэффициент вариации <0,15)24. Затем, используя сходящиеся/распределённые оценки экспертов, была построена попарная матрица сравнения, которая подтвердилась с использованием критерия согласованности AHP с коэффициентом согласованности (CR) < 0,1. Если CR превышала 0.1, матрица корректировалась заново. Коэффициенты согласованности методов AHP для парных сравнительных матриц составляли от 0,03 до 0,08, что свидетельствует о высокой внутренней логической согласованности во всём многоуровневом иерархическом подходе. Дизайн каждого слоя в фреймворке соответствует принципу «модуляризация — расширяемость». Например, слой L1 может расширить измерение физиологического сбора данных, добавляя биосенсоры; Уровень L2 может адаптироваться к требованиям оценки навыков в различных медицинских приложениях, заменяя заранее обученные модели; Уровень L4 поддерживает пользовательские размеры визуализации на основе пользовательских ролей. Это обеспечивает гибкость для последующих приложений в обучении медицинскому 3D-моделированию и в сценариях сертификации профессиональных навыков.
Мультимодальный слой сбора данных
Поток событий 3D-взаимодействия
Этот модуль собирает операционные данные инженеров с платформ 3D-моделирования с помощью ИИ через программные плагины (16), охватывая как дискретные операционные события, так и данные непрерывных параметров. Дискретные события включают выбор модели, корректировку вершин и вызов инструментов ИИ, а непрерывные параметры включают скорость моделирования, количество отмен/повторов и уровень принятия предложений ИИ. Каждое событие записывается с помощью 13-значной метки времени и соответствующих 3D-координат модели (x, y, z). Например, при корректировке кривизны модели ортопедического импланта плагин фиксирует время начала и окончания операции, скорректированные координаты вершин и вариации кривизны, образуя таким образом структурированный журнал событий (см. таблицу 1 по таблицу 3 для полей данных). Эти данные затем обрабатываются с помощью индивидуальных алгоритмов для расчёта специфических для области геометрических, когнитивных и когнитивных индикаторов, что позволяет детализировать моделирование поведения в медицинских приложениях.
Сигналы движения глаз и жесты
Данные о движении глаз собираются с помощью настольного трекера глаз, сосредоточенного на точках фиксации и параметрах саккад в интерфейсе 3D-моделирования, которые отражают когнитивное распределение внимания инженера.
Сигналы жестов фиксируются камерой глубины, которая извлекает 22 координаты ключевых суставов верхней конечности для идентификации типичных моделирующихжестов 25. Камера преобразует координаты 3D-жестов в нормализованные векторные последовательности, чтобы минимизировать различия в размерах отдельных тел.
Синхронизация данных для этого модуля основана на едином аппаратном триггере фреймворка (временная метка 10 Гц из 3D-моделирования), при этом ошибка синхронизации контролируется в пределах ±50 мс ( вычисляется по уравнению 3-2) для обеспечения временной корреляции между поведением глаз/жестов и моделированием 26. Уравнение (2) представляет собой расчет ошибки синхронизации данных:
(2)
Где: Et = ошибка синхронизации между временем приобретения устройства (t устройство) и временной меткой программного обеспечения (tsoftware); t device = фактическое время обнаружения трекера глаз/камеры глубины; tsoftware = триггерная метка времени из 3D-моделирования.
Физиологические и голосовые данные
Физиологические данные собираются с помощью носимых датчиков: датчика электромиографии (ЭМГ) (частота отбора проб 1000 Гц) 27, прикреплённый к предплечью инженера для фиксации мышечного напряжения во время мелких операций, отражая оперативную стабильность. Датчик электрокардиографии (ЭКГ) (частота пробы 250 Гц)28: Он носится на груди для сбора индикаторов вариабельности сердечного ритма (ВСР), которые характеризуют когнитивную нагрузку. Голосовые данные фиксируются направленным микрофоном (частота дискретизации 44,1 кГц),29, записывая вербальные комментарии инженеров во время моделирования для дополнения когнитивного анализа. Все физиологические и голосовые данные проходят предварительную обработку перед хранением в мультимодальной базе данных с временной меткой. Рисунок 3 иллюстрирует физическую экспериментальную аппаратную конфигурацию. Данные сенсоров с носимых устройств ЭМГ/ЭКГ, микрофона, трекера глаз и камеры глубины подключаются к рабочей станции для 3D-моделирования. Перед сохранением временных данных в мультимодальной базе данных синхронизационный модуль корректирует все потоки (в пределах ±50 мс). Эта спецификация материала означает надёжный, временно согласованный вход в конвейер извлечения объектов и оценки.
Слой извлечения признаков ИИ
Геометрические индикаторы качества
Этот модуль извлекает количественные характеристики, отражающие точность и рациональность 3D-моделей, из потока событий 3D-взаимодействия и итогового результата модели, служа основой для оценки навыков инженеров по «точности моделирования». Для оценки структурной точности, анатомической согласованности и полноты 3D-модели с использованием метрик отклонения, топологии и шаблонных признаков разрабатываются три ключевых индикатора, при этом ниже приведены методы расчёта и физические значения:
Коэффициент отклонения модели (MDR)
Это измеряет геометрическое отклонение между смоделированным результатом инженера и стандартным шаблоном. Отклонение рассчитывается путём сравнения евклидового расстояния ключевых точек между двумя моделями. Формула приведена в уравнении (3):
(3)
Где: n = количество заранее определённых ключевых точек признаков (установленных на 50-100 в зависимости от сложности модели); Pi,engineer = 3D-координаты i-й точки объекта в модели инженера; Pi,standard = 3D-координаты i-й точки признака в стандартном шаблоне; |⋅| = оператор евклидового расстояния.
Более низкий MDR указывает на более высокую согласованность со стандартной моделью, с порогом ≤ 5% для квалифицированных моделей медицинских приложений. Компетенции моделирования оценивались на основе эффективности времени, дублирования движений, стабильности жестов и моделей использования предлагаемых инструментов ИИ в режиме реального времени 3D-операционных сценариев.
Топологическая согласованность (TC)
Это оценивает, соответствует ли топологическая структура 3D-модели требованиям медицинского применения. Индикатор рассчитывается путём подсчёта числа топологических дефектов (D) и общего числа топологических элементов (T, суммы вершин, рёбер и граней) в модели, как показано в уравнении (4):
(4)
Например, если модель коленного сустава содержит 2 не-многообразных рёбра (D = 2) и 1200 топологических элементов (T = 1200), то это 99,83%. Для медицинских моделей требуется ≥ 98%, чтобы избежать производственных рисков.
Полнота функций (FC)
Это оценивает, полностью ли инженер реализовал все обязательные функции модели медицинских приложений. Индикатор определяется путём сравнения количества выполненных обязательных признаков (F, выполненного) с общим числом обязательных признаков (F всего), определённых в требованиях к задаче:
(5)
Индикаторы поведенческой эффективности
Этот модуль обрабатывает потоки событий 3D-взаимодействия и жестовые сигналы, чтобы выделить характеристики, отражающие эффективность моделирования инженеров, оценивая их навыки «операционной компетентности». Когнитивные требования, связанные с моделированием, измерялись с помощью синхронизированных физиологических, взглядовых и ЭМГ-сигналов. Эти метрики отслеживают распределение внимания по времени и колебаниям рабочей нагрузки в процессе моделирования.
Эффективность моделирования времени (MTE)
Это сравнивает фактическое время моделирования инженера (T фактические) со средним временем старших экспертов для выполнения той же задачи (T-эксперт), нормализированным до оценки 0-100:
(6)
Например, если инженеру требуется 45 минут на выполнение задачи, на которую эксперты в среднем занимают 30 минут, то это 100 - (45 - 30) x 50 = 75, что указывает на умеренную эффективность.
Резервная рабочая скорость (ROR)
Это учитывает долю ненужных операций в процессе моделирования. Он рассчитывается как отношение избыточного количества операций (Oизбыточного) к общему числу операций (Oвсего):
(7)
Избыточные операции определяются алгоритмом ИИ с помощью сопоставления правил и анализа согласованности жестов.
Уровень использования инструментов ИИ (ATUR)
Это измеряет способность инженера использовать функции с помощью ИИ для повышения эффективности. Оно определяется как отношение количества вызовов инструментов ИИ (IAI) к общему числу вызовов инструментов (Iвсего):
(8)
Более высокий ATUR указывает на лучшую интеграцию инструментов ИИ в процесс моделирования, что является ключевым навыком для современного медицинского 3D-моделирования.
Плавность жестов (GS)
Это оценивает стабильность движений верхних конечностей инженера во время моделирования. Индикатор рассчитывается по стандартному отклонению скорости 22 ключевых соединений верхней конечности (vj) со временем:
(9)
Более низкое стандартное отклонение (а значит, и большее GS) указывает на более плавные жесты, что отражает более высокую операционную компетентность. Эти индикаторы извлекаются в реальном времени в процессе моделирования, при этом алгоритм ИИ обновляет значения индикаторов каждые 5 минут и сохраняет их в базе данных признаков для последующего слияния.
Индикаторы когнитивной нагрузки
Этот модуль анализирует сигналы движения глаз и физиологические данные для количественной оценки когнитивной нагрузки инженера во время моделирования, оценивая их навыки «когнитивной адаптивности». Мультимодальные индикаторы взвешивались с использованием подхода Delphi-AHP и байесовского обновления данных для получения вероятностных оценок инженерных навыков в реальном времени. Разрабатываются три ключевых индикатора:
Фиксационная дисперсия (FD)
Это отражает распределение визуального внимания инженера. Оно вычисляется как евклидово расстояние между максимальной и минимальной координатами точки фиксации ( (xmax, ymax) и (xmin, ymin) ) в интерфейсе 3D-моделирования за 2-минутное окно:
(10)
Более крупная ФД указывает на рассеянное внимание, часто сопровождаемое высокой когнитивной нагрузкой.
Вариабельность сердечного ритма (HRV) — SDNN
SDNN (Standard Deviation of Normal-to-Normal интервалы) извлекается из данных ЭКГ для измерения колебаний частоты сердечных сокращений инженера. Более низкий SDNN указывает на более высокую активность симпатических нервов, что отражает повышенную когнитивную нагрузку. Алгоритм ИИ сначала фильтрует шум ЭКГ (с помощью вейвлет-преобразования), а затем вычисляет SDNN с помощью уравнения (11):
(11)
Где: N = количество нормальных сердечных ударов за 5-минутное окно; RRk = интервал времени между k-м и (k + 1)-м нормальным сердцебиением;
= средний интервал RR в окне.
Электромиография (ЭМГ) — средний квадрат корня (RMS)
RMS сигналов ЭМГ предплечья отражает мышечное напряжение: более высокий RMS указывает на повышенную скованность мышц из-за когнитивного стресса. Формула расчёта выглядит следующим образом:
(12)
Где: m = количество образцов сигнала ЭМГ в окне 1 минута, а EMG(t) = амплитуда сигнала ЭМГ в момент времени t. Была создана сводная диаграмма для повышения концептуальной ясности и облегчения воспроизведения исследований. Она иллюстрирует иерархическую связь между десятью индикаторами оценки и тремя основными конструкциями, лежащими в основе предлагаемой основы: геометрическим качеством, операционной эффективностью и когнитивной адаптивностью. Эта диаграмма показывает, как мультимодальные входные сигналы преобразуются в измеримые индикаторы, которые затем объединяются с помощью байесовского подхода для создания составного показателя инженерных навыков. Этот обзор представляет собой сжатую версию логики оценки и повышает методологическую прозрачность исследования как формативно, так и для будущего образовательного и регуляторного направления. На рисунке 4 показана иерархическая структура предполагаемой системы оценки инженерных навыков, которая объединяет десять мультимодальных индикаторов в три фундаментальных конструкта: геометрическое качество, операционную эффективность и когнитивную гибкость. Эти факторы влияют на общий результат навыков, используемый для оценки эффективности 3D-моделирования с помощью ИИ.
Двигатель слияния доказательств и подсчёта очков
Распределение веса индикатора (Delphi + AHP)
Этот модуль решает проблему дифференцированной важности многомерных признаков путём объединения метода Дельфи (консенсус экспертов) и Аналитического иерархического процесса (AHP) для присвоения весов десяти извлечённым индикаторам (три геометрических показателя качества, четыре показателя поведенческой эффективности и три индикатора когнитивной нагрузки), а также для представления этих сложных мультимодальных индикаторов в визуальном и интерпретируемом формате, такие как радарные диаграммы, тепловые карты и аннотированные воспроизведения для биомедицинских диагностических выводов.
Этап консенсуса Дельфи
Комиссия из десяти экспертов оценивала важность каждого индикатора по 9-балльной шкале (1 = «наименее важно», 9 = «наиболее важно») в трёх раундах анонимных опросов. После каждого раунда панели предоставлялась статистическая обратная связь — включающая средние оценки и коэффициенты вариации (CV) — для облегчения корректировки баллов. Сходимость определялась как CV ≤ 0,15 для каждого индикатора. В частности, консенсус по таким показателям, как Model Deviation Rate (MDR) и Rate Utilization Tool AI (ATUR), обычно достигался уже во втором раунде, что объясняется их прямой клинической значимостью.
Для обеспечения технической надёжности протокол стандартизировал мультимодальное выравнивание данных (допуск синхронизации ≤ 50 мс; унифицированный триггерный такт 30 Гц) и методы вычисления индикаторов. Например, MDR был выведен из 50-100 анатомических ключевых точек, а порог топологической согласованности (TC) был установлен на уровне >98% для элементов без дефектов. Эти пороги были оправданы клиническими стандартами толерантности, такими как отклонение < 5% для пористых костей и ошибка < 3° для углов бифуркации сосудов. Кроме того, методология включала байесовскую оценку с гауссовским моделированием правдоподобия (с использованием калиброванных σ диапазонов для различных уровней навыков) и использовала экстрактор признаков CNN-LSTM, обученный с размером партии 32, скоростью обучения 1 x 10-4 и 120 эпохами.
Создание иерархии AHP
Построена трёхуровневая иерархия: Целевой уровень (A): комплексная оценка инженерных навыков; Критерийный слой (B): 3 индикатора первого уровня (B1: геометрическое качество, B2: поведенческая эффективность, B3: когнитивная нагрузка); Индикаторный слой (C): 10 индикаторов второго уровня (C1: MDR, C2: TC, ..., C10: EMG RMS).
Парное сравнение и проверка согласованности
На основе результатов консенсуса Delphi построена попарная матрица сравнения для слоя критерия и слоя индикатора. Возьмём в качестве примера слой критериев, матрица определяется следующим образом:
(13)
Где:ij — это отношение важности Bj к Bj. Вектор веса слоя критерия (WB = [wB1,w B2,w B3]) рассчитывается методом собственного вектора. Чтобы избежать логических противоречий, коэффициент согласованности (CR) проверяется с помощью уравнения (14):
(14)
Где: ( λmax = максимальное собственное значение матрицы, = количество индикаторов), а — индекс случайной согласованности (для n = 3, RI = 0,58). Результат приемлем, если CR < 0.1.
В ходе этого процесса получаются типичные веса: (Геометрическое качество), (Поведенческая эффективность), (Когнитивная нагрузка); вес MDR (C1) в индикаторном слое обычно максимальный (~0,25), тогда как EMG RMS (C10) — самый низкий (~0,05).
Обновление байесовской уверенности
Этот модуль объединяет взвешенные индикаторы для получения итоговой оценки уверенности в навыках, решая «неопределённость оценки по одному признаку» путём обновления априорных вероятностей с использованием мультимодальных данных в реальном времени. Процесс основан на уравнении (1) (байесовской формуле) и реализуется в два шага:
Шаг 1: Инициализация с априорной вероятностью (P(θ))
Уровень навыков делится на 5 уровней: (Новичок), (Начинающий), (Средний), (Продвинутый), (Экспертный). Априорная вероятность инициализируется с использованием исторических данных: если система оценила 500 инженеров, и 100 классифицируются как θ3, то P(θ3) = 100/500 = 0,2. Для новых пользователей без исторических данных применяется унифицированный априор (P(θi) = 0,2 для всех i).
Шаг 2: Апостериорное вычисление вероятности (P(θ∥D))
Мультимодальные данные признаков представляют собой взвешенную сумму 10 нормализованных индикаторов :
(15)
Где: wCk — вес k-го индикатора (из раздела 3.4.1), а нормаCk — нормированное значение k-го индикатора (диапазона [0,1]).
Вероятность вероятности моделируется с помощью гауссовского распределения, при условии, что данные признаков инженеров на уровне навыков следуют (среднее μi, дисперсия
). Эти параметры калибруются с помощью 200 маркированных образцов.
Наконец, апостериорная вероятность вычисляется по уравнению (3-1), а уровень навыка, соответствующий максимуму, является результатом оценки в реальном времени. Например, если у инженера D = 0,72, и (выше, чем у других оценок), они классифицируются как «Продвинутые».
Чтобы визуализировать процесс обновления доверия, на рисунке 5 показано, как известные равные вероятности навыков обновляются в апостериорное распределение с использованием байесовских выводов и сигналов в реальном времени в качестве доказательств. После наблюдения за задачей модель обновляется, чтобы усилить доказательства в пользу уровня навыков с наибольшей апостериорной вероятностью. Валидационные тесты показали сильную сходимость оценок экспертных навыков, а байесовские оценки тесно коррелировали с экспертными оценками, что подтверждает надёжное использование байесовского обновления в рабочем процессе.
Результат этого слоя — это комплексный балл навыков (0-100, отображённый от максимальной апостериорной вероятности) и доверительный интервал, который передаётся в Visual Feedback Layer для интуитивно интуитивной презентации.
Визуальный слой обратной связи
Радарная карта в реальном времени
Этот модуль преобразует 10 нормализованных индикаторов и 3 трёхуровневых критерия в радарную диаграмму, что позволяет интуитивно сравнивать сильные и слабые стороны инженеров. Радарная карта разработана с 7 осями (3 для критериев первого уровня: B1-B3; 4 для основных индикаторов второго уровня: C1=MDR, C4=ATUR, C7=FD, C9=SDNN-выбранные за высокий вес и интерпретируемость), при этом диапазон каждого осей нормализован до [0,100] (отображается из нормализованных значений [0,1 ] с помощью уравнений 3-7). Для постоянного повышения точности измерений с помощью экспертных аннотаций и обновлений активного обучения с самого начала фреймворка внедряются контекст моделирования здоровья и расширяющееся понимание.
Уравнение (16) Картографирование значений индикаторов для радарной карты:
(16)
Где: Vрадар = значение, отображаемое на оси радарной карты; Норма Ck = нормированное значение k-го индикатора ([0,1] диапазона).
Радарная диаграмма обновляется в реальном времени (каждые 5 минут) и включает два эталонных ориентира: стандартную эталонную линию (пунктирная линия, Vрадар = 80, отражающая порог уровня навыков «Продвинутый») и среднюю линию эксперта (пунктирная линия, рассчитанная на основе исторических данных 50 старших инженеров). Рисунок 6 показывает поведение инженера по комплексу ключевых показателей: геометрическое качество, когнитивная нагрузка, эффективность использования инструментов и рассеяние фиксации по сравнению с соответствующими экспертными ориентирами. В рамках слоя обратной связи истинные баллы с использованием объединённых метрик переводились в интерпретируемый профиль. Пользовательские исследования показали успешную реализацию для быстрого выявления пробелов в компетенциях, а также для продвижения структурированного, основанного на данных расчетах для улучшения задач моделирования.
Временная тепловая карта
Этот модуль визуализирует динамическую тенденцию изменения индикаторов навыков на протяжении всего процесса моделирования, помогая выявить периоды, когда инженеры сталкиваются с трудностями. Тепловая карта использует двумерную сетку: ось x представляет временные интервалы (сегменты по 10 минут, всего 12 сегментов для задачи длительностью 2 часа), а ось y — 5 ключевых индикаторов (C1=MDR, C4=ATUR, C6=GS, C7=FD, C9=SDNN). Цветовая интенсивность каждой ячейки сетки соответствует нормированному значению индикатора, с цветовой шкалой от синего (низкое значение, плохая производительность: нормаCk < 0,5) до красного (высокое значение, хорошая производительность:норма Ck < 0,8), как определено в уравнении (17):
Уравнение (3-8) представляет расчёт интенсивности цвета для тепловой карты:
(17)
Где: Icolor = значение интенсивности цвета RGB (0-255, 0=синий, 255=красный); min(Ck norm) и max(Ck norm) = минимальные и максимальные нормированные значения индикатора за все временные интервалы.
Рисунок 7 иллюстрирует временно-разрешённые изменения когнитивной нагрузки, рассеивания фиксации, стабильности взгляда и метрик задержки принятия решений в 10-минутных сегментах. Обратите внимание, что выделенные области указывают на высокий когнитивный спрос или нарушения в рабочих процессах. Этот временной взгляд формируется непосредственно из коалесцентных мультимодальных потоков, поддерживаемых аннотациями экспертов, что освещает его ключевую роль в работе с усталостью моделирования, переключениями внимания и трудностями конкретных задач.
Аннотация воспроизведения D
Этот модуль накладывает аннотации оценки навыков на воспроизведение работы 3D-модели, позволяя пошагово анализировать поведение инженера при моделировании. Скорость воспроизведения регулируется (0,5×-2× в реальном времени) и синхронизируется с мультимодальной временной меткой. Встраиваются три типа аннотаций: Аннотации по геометрическим ошибкам: красные вайрфреймы выделяют области модели, где MDR (C1) превышает 5% (квалифицированный порог), с текстовыми метками, показывающими значение отклонения. Аннотации предупреждения об эффективности: Жёлтые восклицательные знаки появляются в местах избыточных операций, а всплывающие окна показывают тип операции. Аннотации когнитивной нагрузки: зелёные/красные полоски статуса в углу обозначают когнитивную нагрузку в реальном времени (на основе C9: SDNN и C10: EMG RMS), при этом красный означает «Высокая нагрузка» (SDNN < 50 мс), а зелёный — «Нормальная нагрузка» (SDNN > 100 мс).
Калибровка и итерация фреймворка
Интерфейс экспертных аннотаций
Этот модуль предоставляет интерфейс «человек в цикле» для старших экспертов, которые могут корректировать и маркировать результаты оценки фреймворка, устраняя «сдвиг точности оценки», вызванный изменениями в сценариях применения в здравоохранении. Интерфейс спроектирован с тремя основными функциями: коррекция результатов, перевзвешивание индикаторов и хранение аннотаций.
Функция коррекции результатов
Эксперты сначала проверяют результаты визуальной обратной связи и общий балл навыков фреймворка (0-100). Если оценка отличается от экспертного суждения, эксперт может вручную скорректировать его и записать причину. Величина коррекции измеряется с помощью уравнения (18):
(18)
Где: Sисправлено = итоговый скорректированный балл; S-фреймворк = начальный результат по фреймворку; S expert = ручной балл эксперта; α = вес коррекции (по умолчанию установлен на 0,8, обеспечивая доминирование экспертного суждения при сохранении рациональности рамок).
Функция перевзвешивания индикаторов
Для калибровки в зависимости от сценария специалисты могут регулировать вес отдельных индикаторов с помощью скользящей планки (диапазон 0-0,5). Интерфейс автоматически пересчитывает коэффициент согласованности (CR) после корректировки (с использованием уравнений 3-6) и предупреждает экспертов об этом (нелогичное распределение веса), обеспечивая математическую корректировку скорректированных весов.
Функция хранения аннотаций
Все скорректированные баллы, скорректированные веса и комментарии экспертов хранятся в аннотированной базе данных с временными метками и тегами сценариев. Эта база данных служит обучающими данными для последующего онлайн-модуля активного обучения, с типичной схемой данных, показанной в Таблице 2.
Обновление онлайн-активного обучения
Этот модуль использует аннотированные данные для итеративной оптимизации основных алгоритмов фреймворка (модели извлечения признаков ИИ в L2 и байесовский скоринговый движок в L3), что позволяет фреймворку адаптироваться к новым сценариям медицинских приложений без полного переобучения. Процесс обновления осуществляется по стратегии запросов по комитетам (QBC), разделённой на три этапа:
Этап 1: Расчет неопределённости
Развёртаются три параллельные «модели комитетов» (все основаны на той же архитектуре, что и модель извлечения признаков L2, но обучены на разных исторических наборах данных):
Модель A: обучена по данным моделирования ортопедических имплантатов;
Модель B: обучена на данных реконструкции органов;
Модель C: обучена по данным моделирования зубных имплантов.
Для каждой немаркированной выборки (данные инженерного моделирования) комитет моделирует три прогнозируемых показателя навыков. Неопределённость выборки рассчитывается с помощью коэффициента вариации (CV) трёх оценок:
(19)
Где: SA,SB,S C = баллы, предсказанные тремя моделями комитетов; std (⋅)= стандартное отклонение;
= среднее по трём очкам.
Более высокий CV указывает на большее несогласие между моделями комитета (большая неопределённость), что означает, что выборка более ценна для аннотации.
Этап 2: Выбор образцов
Фреймворк выбирает топ-10% образцов с самым высоким CV и отправляет их на интерфейс экспертных аннотаций для маркировки. Эта стратегия активного отбора сокращает количество выборок, требующих экспертной аннотации (по сравнению с случайным отбором), на 40–60%, повышая эффективность калибровки.
Этап 3: Переобучение и обновление модели
Новые аннотированные образцы используются для тонкой настройки алгоритмов фреймворка:
Для моделей экстракции признаков L2: модель переобучается с частотой обучения 1e-5 (10% от начальной скорости обучения) с использованием аннотированных геометрических ошибок, обновляя только последние два слоя для предотвращения перенагона.
Для байесовского система L3: параметры распределения Гаусса (
) для каждого уровня мастерства обновляются с помощью аннотированных данных баллов, при этом формула обновления показана в уравнении (20):
(20)
Где:
= обновлённое среднее значение уровня навыкаθ i;
= исходное среднее до обновления; S-θi = средний скорректированный балл аннотированных выборок, помеченных как θi; β = коэффициент забвения (установлен на 0,7, балансирующий исторические данные и новые аннотации).
Обновлённый фреймворк развёртывается онлайн сразу после переобучения с проверкой производительности перед развертыванием: если средняя абсолютная ошибка между новым результатом фреймворка и экспертными аннотациями составляет ≤3 (снижена на ≥20% по сравнению с предыдущей версией), обновление подтверждается; в противном случае процесс переобучения повторяется с добавлением дополнительных аннотированных образцов.
Этот итеративный механизм калибровки гарантирует, что точность оценки фреймворка превышает 90%, даже несмотря на развитие технологий 3D-моделирования в области здравоохранения, сохраняя долгосрочную адаптивность.