$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Это исследование было проведено в соответствии с Хельсинкской декларацией и одобрено Этическим комитетом больницы Sir Run Run Run Shaw Медицинской школы Чжэцзянского университета (номер одобрения: 0480, утверждён 10 августа 2025 года). Все участники предоставили письменное информированное согласие перед участием.
Дизайн и окружение исследования
Проспективное наблюдательное исследование с кластерным распределением отделений проводилось с января 2024 по февраль 2025 года в больнице Sir Run Run Shaw Медицинской школы Чжэцзянского университета, Ханчжоу, Китай. Стратегия распределения на основе отделов вводит квазиэкспериментальные элементы в этот дизайн; Соответственно, причинные выводы следует толковать с соответствующейосторожностью 16. В исследовании использовалось сравнение параллельных групп с распределением на основе распределения по отделам, чтобы предотвратить обмен информацией между группами. Была внедрена стратифицированная система зачисления для обеспечения сопоставимых базовых характеристик. Больница поддерживала специализированную симуляционную лабораторию, оснащённую стандартизированными операционными, хирургическими инструментами, мониторинговым оборудованием и возможностями видеозаписи.
Выбор образцов и участники
Медицинские работники были набраны путём стратифицированного случайного выбора из всех подходящих периоперационных сотрудников (n = 342) больницы Sir Run Run Shaw с ноября 2023 по январь 2024 года. Переменные стратификации включали профессиональную роль (медсёстры, хирургические технологи и анестезиологи), уровень опыта (<5, 5–10, 10–15 и >15 лет), уровень образования (степень младшего специалиста, бакалавриата и магистра) и клинический отдел (общая хирургия, ортопедическая хирургия, сердечно-сосудистая хирургия и другие специальности). Компьютерно сгенерированные случайные числа (программное обеспечение R, set.seed = 12345 для воспроизводимости) применялись в каждом слое с использованием функции выборки для обеспечения репрезентативной выборки во всех демографических и профессиональных категориях. Размер выборки был рассчитан с помощью программного обеспечения G*Power 3.1.9.7 на основе предварительных пилотных данных (n = 30) с предполагаемым размером эффекта Коэна d = 0.60, уровнем значимости для двухсторонников α = 0.05 и желаемой статистической мощностью (1 − β) = 0.80, что указывает на минимальное требование в 90 участников (45 на группу). Для учёта ожидаемого уровня отсева в 15% (отток) на основе исторических данных учреждения, целевая численность учащихся была установлена на уровне 104 участников. Фактическое количество учащихся достигло 120 человек, обеспечив 87% электроэнергии после учёта последних 11% утечки.
Требуются критерии включения
(1) текущая работа в больнице Sir Run Run Shaw в периоперационных ролях; (2) минимум 6 месяцев опыта работы в операционной; (3) доступность на протяжении всего 13-месячного периода обучения; (4) готовность участвовать во всех оценочных мероприятиях; и (5) базовой компьютерной грамотности, определяемой как способность самостоятельно ориентироваться в веб-браузерах и использовать клавиатуру и мышь.
Критерии исключения включали
Запланированный длительный отпуск в течение учебного периода, участие в других программах обучения хирургическим инструментам в течение предыдущих 6 месяцев, нарушение зрения, не подлежащее коррекции до зрения 20/40 и выше, а также текущее обучение в формальных программах по хирургической технологии. Первоначально было привлечено всего 120 участников, из которых 107 завершили полный протокол исследования (89,2%). Причины отказа включали смену работы (n = 7), личные обстоятельства (n = 4) и технологические трудности (n = 2). Анализ утраты с использованием логистической регрессии не выявил значимой связи между характеристиками отмены и исходным уровнем, включая возраст (OR = 1,03, p = 0,52), пол (OR = 0,87, p = 0,85), профессиональную роль (p = 0,73) или базовые баллы PIPS (OR = 1,01, p = 0,67), что указывает на случайное отсутствие закономерности, подтверждённую тестом MCAR Литтла (χ2 = 43,2, df = 38, p = 0,26).
Распределение группы
Чтобы минимизировать эффекты загрязнения, присущие образовательным вмешательствам, участников распределяли в интервенционные или контрольные группы на основе принадлежности к отделу. Отделения (n = 8) были распределены по парам на основе объёма хирургического случая и численности персонала, а затем случайным образом распределены по APLS или контрольным состояниям с помощью компьютерной рандомизации (программное обеспечение R, seed = 54321). Этот кластерный подход был принят потому, что индивидуальная рандомизация внутри отделов могла бы привести к значительному перекрёстному загрязнению, поскольку коллеги делятся знаниями и опытом обучения. Признается, что культура кафедры, качество лидерства, базовые образовательные практики и сочетание кейсов могут независимо влиять на результаты, представляя потенциальные источники остаточного замешательства, которые невозможно полностью устранить в неиндивидуализированном рандомизированномдизайне 16. Стратифицированная выборка обеспечивала сопоставимые базовые характеристики. Оценщики результатов, проводившие оценки PIPS, были заслеплены к распределению групп с помощью закодированных идентификаторов участников. Статистические аналитики получали неидентифицированные наборы данных с маскированными групповыми метками до завершения первичного анализа.
Архитектура и техническая реализация системы APLS
APLS состоит из четырёх интегрированных вычислительных компонентов, работающих на облачной платформе (Таблица материалов). Система была разработана с использованием открытых фреймворков глубокого обучения и веб-интерфейса (см. Таблицу материалов) с протоколами RESTful API (интерфейс передачи представленного состояния приложений, обеспечивающий стандартизированную HTTP-коммуникацию между фронтенд-клиентом и серверными модулями машинного обучения), аутентификацией на основе JSON Web Token (JWT) (обеспечивающий, что только авторизованные пользователи и компоненты системы могут получать доступ к данным учащихся и конечным точкам моделирования), и шифрование на транспортном уровне TLS 1.3 (защита всех данных, проходящих между клиентскими устройствами, сервером приложений и облачной инфраструктурой обслуживания моделей) для обеспечения безопасности данных. Полное описание программной среды, включая спецификации зависимостей (requirements.txt), структуру конфигурационного файла и команды инициализации конвейера данных, приведено в дополнительном файле 1.
Настройка и калибровка аппаратного обеспечения
Перед каждой тренировкой выполнялась следующая последовательность калибровки аппаратного обеспечения. Устройство для отслеживания взгляда (см. Таблицу материалов) располагалось в 60–70 см от глаз участника на регулируемом по высоте креплению, а калибровка проводилась по стандартному 9-точечному протоколу производителя с точностью ≤0,5° визуального угла. Восьмикамерный массив (см. Таблицу материалов) был расположен в круговой конфигурации радиусом 2,5 м от центра учебной станции, расположен на высотах от 1,8 м до 2,4 м и калиброван с использованием производственной процедуры с оставшейся ошибкой ≤0,3 мм. Отражающие маркеры (n = 16, диаметр = 12,7 мм) были прикреплены к стандартизированным анатомическим ориентирам на руках и запястьях согласно протоколу размещения маркеров, описанному в дополнительном файле 2. Физиологические приборы мониторинга устанавливались согласно инструкциям производителя и проверялись на качество сигнала перед началом сессии.
Компонент 1: Система классификации фенотипов учащихся
Система классификации использует двухэтапный гибридный подход, сочетающий обучение без надзора и под надзором. На первом этапе кластеризация k-средних используется на базовых данных оценки для выявления естественных групп учащихся. Входные характеристики (n = 37) включают базовые показатели PIPS (4 признаки), инвентарные показатели в стиле обучения VARK (4 характеристики), скорость когнитивной обработки при компьютеризированных задачах на время реакции (3 характеристики), показатели комфорта в технологиях (1 функция), демографические переменные (3 признаки), пропускную способность рабочей памяти из тестов на разъём цифр (2 признаки), пространственное мышление с помощью задач на умственное вращение (1 функция), базовые показатели мелкой моторики (3 признаки), Большая пятёрка личностных черт (5 особенностей) и предыдущие показатели эффективности из институциональных записей (3 черты). Подробные спецификации предварительной обработки, процедуры оптимизации гиперпараметров и рейтинги важности функций приведены в дополнительном файле 1 (раздел S2). Три полученных кластера были охарактеризованы как быстрые (30,9%), средние (49,1%) и медленно учащиеся (20,0%). На этапе 2 контролируемая классификация выполняется с использованием поддерживающих векторных машин, обученных на метках кластеров, чтобы обеспечить классификацию новых учащихся в реальном времени. Полное пространство поиска по гиперпараметрам, результаты кросс-валидации и метрики классификации по классам представлены в дополнительном файле 1 (раздел S2.3).
Компонент 2: Мультимодальная интеграция данных и система синтеза датчиков
Платформа интегрирует пять гетерогенных потоков данных: данные отслеживания глаз, данные захвата движения, физиологический мониторинг (вариабельность сердечного ритма, гальванический кожный ответ и кортизол слюны), аналитику работы с помощью автоматизированного видеоанализа и ведение регистрации взаимодействий. Подробные спецификации датчиков, конвейеры предварительной обработки, процедуры извлечения признаков и архитектура сверточной нейронной сети для оценки когнитивного состояния описаны в дополнительном файле 1 (раздел S3). Система слияния создаёт представления когнитивных состояний, которые обновляются каждые 1 секунды и кодируют интегрированное внимание, моторное исполнение, когнитивную нагрузку и выполнение задачи.
Компонент 3: Движок предиктивной аналитики
Система прогнозирования ансамбля сочетает три дополняющих друг друга алгоритма: случайный лес, машину градиентного бустинга (XGBoost) и глубокую нейронную сеть с узкими слоями краткосрочной памяти (LSTM), обрабатывающей вложения когнитивных состояний в виде временных рядов. Агрегация ансамблей использует взвешенное мягкое голосование с оптимизацией весов с использованием валидационных данных. Полные алгоритмические спецификации, значения гиперпараметров, процедуры обучения и диагностика сходимости приведены в дополнительном файле 1 (раздел S4). Наборы данных по обучению, валидации, развертыванию и оценке были строго разделены; Разработка модели использовала исключительно данные предыдущего пилотного исследования с участием 150 участников (80% обучения, 20% валидации), и текущие участники исследования составляли полностью хранящийся набор данных по внедрению. Постепенное переобучение во время развертывания использовало только данные о предыдущих 7-дневных взаимодействиях и не включало данные оценки результатов, что предотвращало утечку из результатов оценки в модели прогнозирования.
Компонент 4: Система адаптивной обратной связи на основе подкреплённого обучения
Система адаптивной обратной связи использует Q-обучение, формулируя выбор обратной связи как процесс принятия решения по Маркову. Пространство состояний (25-мерное) кодирует текущее когнитивное состояние, временной контекст, параметры задачи и характеристики обучающегося. Пространство действий состоит из 25 дискретных действий, представляющих собой сочетания модальности обратной связи, времени и специфичности. Функция вознаграждения включает улучшение производительности, избегание когнитивной перегрузки, поддержание вовлечённости и задержку коррекции. Математическая формулировка пространства состояний, пространства действий, функции вознаграждения, параметров обновления Q-обучения и критериев сходимости подробно изложена в дополнительном файле 1 (раздел S5).
Рабочий процесс обучающей сессии
Каждая сессия обучения APLS проходит по следующей стандартизированной последовательности. (1) Участник входит в платформу APLS, используя назначенные учетные данные на назначенной рабочей станции. (2) Была проверена аппаратная калибровка (трекер глаз, захват движения и физиологические датчики) с автоматическими проверками качества, подтверждающими приемлемую целостность сигнала. (3) Система получает текущую классификацию фенотипов учащегося и прогнозируемую траекторию компетенций участника для настройки параметров сессии. (4) Начальный разминочный модуль (5 мин) представляет обзор содержания предыдущей сессии, адаптированный к шаблону запоимления участника. (5) Основной обучающий модуль (40-50 мин) представляет задачи по идентификации приборов, обработке и процедуре на уровне сложности, определяемых адаптивным алгоритмом, с мультимодальной обратной связью в реальном времени согласно политике Q-обучения. (6) Отображаются сводка сессии и панель эффективности, показывающие прогресс относительно личной траектории обучения участника и его этапов компетентности. (7) Участник заполняет краткий опрос удовлетворенности (2 мин). (8) Данные сессии автоматически загружаются на облачный сервер для обновления модели.
Процедуры контрольной группы
Контрольная группа проходила традиционное обучение работе с инструментами в операционной по стандартизированным институциональным протоколам. Обучение включало начальную 8-часовую учебную сессию в классе старших преподавателей операционной (OR), охватывающую категории инструментов, номенклатуру, принципы обращения и стерильную технику; печатное учебное пособие (187 страниц), содержащее фотографии инструментов, спецификации и описания, организованные по хирургическим специальностям; два практических мастер-класса по 4 часа в симуляционных лабораториях с физическими приборами под руководством инструктора (соотношение инструктор-обучающийся 1:6); доступ к институциональной системе управления обучением, содержащей цифровые учебные материалы для самостоятельного рассмотрения; а также запланированные ежеквартальные повторные сессии (2 часа) с изучением часто путаемых инструментов. Общее структурированное время обучения составляло 20 часов в течение учебного периода. Не было внедрено никаких адаптивных алгоритмов, персонализированных путей или компонентов, усиленных ИИ.
Показатели исхода
Основным результатом стало удержание знаний, оцениваемое через 12 месяцев после обучения с использованием валидированной шкалы пероперационной инструментальной компетентности (PIPS). Полный процесс разработки PIPS, включая генерацию заданий на основе обзора литературы и экспертных фокус-групп, трёхраундовую модифицированную валидацию контента Delphi (индекс валидности контента = 0,94), исследовательский и подтверждающий факторный анализ, а также полную поведенчески обоснованную оценку оценки, задокументирован в дополнительном файле 3. Инструмент продемонстрировал сильные психометрические свойства (α Кронбаха = 0,92, тест-повторный тест ICC = 0,91 с интервалом в 2 недели). PIPS состоит из 24 пунктов по четырём направлениям: идентификация приборов (6 элементов), квалификация обращения (6 пунктов), протоколы безопасности (6 пунктов) и командная коммуникация (6 пунктов). Каждый элемент использует пятибалльную шкалу Ликерта (от 1 = от новичка до 5 = эксперта) с поведенчески ориентированными дескрипторами. Общий балл варьируется от 24 до 120, при этом более высокие баллы указывают на повышение уровня владения.
Оценки PIPS проводились обученными экспертами (шесть хирургических медсестёр с опытом >10 лет операционной, завершившие стандартизированную программу обучения 8 часов) на начальном этапе, сразу после вмешательства и на 1, 3, 6 и 12 месяцев наблюдения. Оценщики были заслеплены на распределение групп с помощью закодированных идентификаторов участников и оценивали видеозаписи, отредактированные с целью удаления видимых специфических для APLS элементов интерфейса или отображения обратной связи. Оценщики не были информированы о том, какую форму обучения проходили участники. Надёжность между оценщиками была установлена путём двойного кодирования 20% оценок (n = 128), что дало ICC > 0,85 по всем доменам (общий балл ICC = 0,89, 95% CI: 0,85-0,92).
Вторичные результаты были следующими: (1) практическая компетентность оценивалась с помощью объективной структурированной оценки технических навыков (OSATS), адаптированной для работы с приборами, включающей шесть стандартизированных станций (максимум 30 баллов), проводимых слепыми экспертными оценщиками (ICC = 0,87) на начальном этапе и через 3, 6 и 12 месяцев. (2) Эффективность времени обучения измерялась как общее количество часов для достижения порога компетентности (PIPS ≥ 75). (3) Эффективность затрат рассчитывается как стоимость на квалифицированного учащегося с учётом прямых и косвенных затрат, при этом затраты нормализуются до китайского юаня 2024 года с использованием институциональных бухгалтерских данных. (4) Удовлетворённость учащихся оценивалась с помощью 5-балльной анкеты по шкале Ликерта (27 пунктов, внутренняя согласованность α = 0,91). (5) Исследовательские показатели клинической эффективности из институциональных систем отчетности о безопасности: отчеты об инцидентах, связанных с инструментами, в течение 12-месячного периода после обучения, с коэффициентами на 1 000 хирургических случаев, скорректированными с учётом сложности случая. Результаты инцидентов с безопасностью классифицировались как исследовательские, поскольку исследование не было способно выявлять различия в этих низкочастотных событиях.
Методы статистического анализа
Все статистические анализы проводились с использованием версии R 4.3.0 с интерфейсом RStudio и следующими пакетами: lme4 для моделей смешанных эффектов, emmeans («оценённые предельные средние»; пакет R для вычисления групповых средних с учётом модели и проведения пост-хок парных сравнений Tukey, Bonferroni или Scheffé из моделей с подогнанными смешанными эффектами), psych для психометрического анализа, effsize (пакет R для вычисления стандартизированных размеров эффектов, включая d Коэна и g Хеджеса, с доверительными интервалами) для расчёта размера эффектов и мышей для множественной импутации. Порог значимости был априорно установлен на уровне α = 0,05 (двусторонний) для всех тестов гипотез.
Были применены многочисленные коррекции сравнения следующим образом. Для первичного результата (общий балл PIPS по временным точкам) вывод был сделан из взаимодействия группы × времени в рамках линейной модели смешанных эффектов с использованием степеней свободы Кенварда–Роджера, которая не требует отдельной коррекции для нескольких временных точек. Для подшкалав домена PIPS (четыре одновременных сравнения) была применена коррекция Бонферрони (скорректированная α = 0,0125). Для вторичных результатов (четыре показателя: показатель эффективности операционной работы, инциденты с безопасностью, балл связи TEAM и частота ошибок) применялась процедура частоты ложного обнаружения Бенджамини-Хохберга (q = 0,05). Для метрик производительности систем ИИ (десять внутренних сравнений) применялась коррекция Бонферрони (скорректированная α = 0,005). Все опубликованные p-значения и определения значимости явно ссылаются на соответствующую поправку.
Все первичные и вторичные межгрупповые результаты анализировались с использованием линейных моделей смешанных эффектов с фиксированными эффектами для группы, времени и их взаимодействия, а также случайными пересечениями как для участников, так и для отделов (чтобы учесть внутриклассовую корреляцию, возникающую в результате распределения по кластерам). Внутриклассовый коэффициент корреляции на уровне кафедры был оценён для количественной оценки степени кластеризации. Недостающие шаблоны данных оценивались с помощью теста MCAR Литтла; данные были признаны полностью отсутствующими случайным образом и обрабатывались с помощью множественной импутации с помощью предиктивного сопоставления среднего (m = 20 вчисленных наборов данных, объединённые результаты по правилам Рубина). Анализ чувствительности с полным анализом случаев, изменяющимися числами импутации (m = 10, m = 50) и худшим/лучшим сценарием оценивали устойчивость.