$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Наборы данных CaDIS и SICS-105, использованные в этом исследовании, доступны публично и изначально были собраны с предварительного одобрения институционального надзорного совета и информированного согласия, как указано в соответствующих публикациях. Это исследование включает только вторичный анализ полностью анонимизированных данных, поэтому дополнительное этическое одобрение или информированное согласие не требовалось.
Предлагаемая модель была разработана для прогнозирования осложнений после операции витрэктомии с использованием пространственно-временных паттернов из видео внутриоперационной микроскопии. Конвейер состоит из четырёх основных этапов: предварительной обработки, сегментации, извлечения признаков, оптимизации признаков и классификации, как показано на рисунке 1.
Внутриоперационная оценка риска послеоперационных осложнений является прогнозной целью исследования. Модель не может прогнозировать клинически подтвержденные послеоперационные события в определённое временное окно, поскольку наборы данных CaDIS и SICS-105 не содержат данных о долгосрочном последующем наблюдении. Вместо этого он использует интраоперационные хирургические паттерны для определения вероятности возможных проблем. Операционные определения «осложнения» в этом контексте включают нерегулярные фазовые переходы, аномальные взаимодействия инструмента и ткани, а также вариации хирургического рабочего процесса, связанные с большей хирургической сложностью. Для обеспечения интерпретируемости и надёжной оценки задача прогнозирования разработана как задача бинарной классификации, которая делит случаи на группы с низким и высоким риском. Вместо того чтобы служить прямой клинической диагностической системой, эта формулировка позволяет предлагаемой структуре служить инструментом поддержки внутриоперационных решений.
Описание набора данных:
Предлагаемая модель была оценена на двух наборах данных: наборе данных A (CaDIS, набор данных по катаракте для сегментации изображений) и наборе данных SICS-105 (Операция с малым разрезом на катаракте).
(i)CaDIS 31: Этот набор данных был разработан для задачи сегментации в видео операций катаракты. Это введено для дополнения общедоступного набора данных по вызовам CATARACT, и таким образом направлено на развитие схем DL для анализа хирургических видео. Набор данных состоит из 25 видеозаписей общей сложностью 4 670 аннотированных кадров, изображающих несколько стадий операции по удалению катаракты (дополнительный рисунок 1). Каждый кадр тщательно аннотируется, предоставляя метки на уровне пикселей, необходимые для обучения и оценки схемы сегментации. Она служит эталоном для оценки эффективности модели DL на хирургических видео.
(ii) Набор данных SICS-105 (операция по удалению малого разреза)32: Этот набор данных включает 105 записей, проведённых хирургами и аннотированных четырьмя офтальмологами в течение 6 месяцев в период 2023–2024 годов, охватывающих 20 фаз (Дополнительный рисунок 2). Общая продолжительность видео составляет 22 часа 39 минут, разрешение 1920 × 1080 пикселей (уменьшено до 960 × 540) и 30 кадров в секунду. Средняя продолжительность видео составляет 12 минут 57 секунд (σ=4:31 мин). Набор данных общедоступен в репозитории Zenodo по адресу: https://doi.org/10.5281/zenodo.13847781. Репрезентативные входные образцы показаны на дополнительном рисунке 1 и дополнительном рисунке 2. Хотя наборы данных CaDIS и SICS-105 изначально были разработаны для распознавания хирургических фаз и сегментации при операции с катарактой, информации о послеоперационных осложнениях витрэктомии ограничено. Чтобы компенсировать недостаток информации о постоперационных осложнениях после витректомии, мы предлагаем набор прокси-меток для информации о риске на основе внутриоперационных зрительных паттернов и событий в видеопоследовательности. Кадры и видеопоследовательности в наборах данных были аннотированы трехуровневой информацией о риске (низкий, умеренный, высокий) согласно набору эвристик, вдохновлённых клиническим пониманием, включая сложность взаимодействия инструмента и ткани, аномалии длительности хирургического вмешательства, окклюзию, нестабильность и аномальные движения. Предлагаемая формула не использует клинические результаты в качестве обозначения, а рассматривает их как прокси-метки для информации о рисках возможных послеоперационных осложнений.
Предварительная обработка с использованием подхода cGAN
Обычно необработанные кадры часто деградируют из-за вариаций освещения, размытия и зеркалярных артефактов. Для решения этой проблемы используется условная генеративная состязательная сеть (cGAN) для улучшения видео. Raw кадры — это оригинальные, необработанные кадры, извлекаемые непосредственно из видеозаписей внутриоперационной микроскопии, до какого-либо улучшения или нормализации. Эти кадры обычно содержат такие артефакты, как вариабельность освещения, размытие движения, зеркальные отражения и шум, возникающий от хирургических инструментов и движения камеры. Генератор восстанавливает чистые кадры, а дискриминатор обеспечивает визуальный реализм. Функция цели, интегрирующая потери реконструкции пикселей, состязательных и временных потерь согласованности, обеспечивая отсутствие артефактов и стабильность видео для дальнейшего анализа.
Деградированный кадр It на шаге времени t является входом генератора, а улучшенный кадр Yt = G(It) — его выходом. Обусловленный входом It, дискриминатор обучается различать генерируемый выход от чистой системы Y t. Цель обучения включает несколько функций потерь для обеспечения высокого качества реконструкции: (i) соперническое поражение для обеспечения реализма; (ii) потери по пикселям реконструкции (потеря L1) для поддержания точности интенсивности; (iii) перцептивная потеря для сохранения структурной согласованности с использованием глубоких представлений признаков; и (iv) потеря временной согласованности для обеспечения плавных переходов между последовательными кадрами и предотвращения мерцания артефактов.
Для обеспечения высокого качества ввода при извлечении признаков видеозаписи интраоперационной микроскопии изначально улучшаются с помощью cGAN. Каждый необработанный кадр It* считается деградированным наблюдением чистого кадра. Генератор G учится отображению G(It) = It для восстановления улучшенных кадров, тогда как дискриминатор D различает реальные и сгенерированные выборки. Обучающая цель интегрирует состязательную потерю Ladv, перцептивную потерю Lperc пиксельную реконструкционную потерюL1 и временную согласованностьL temp.. Эта модель подавляет размытие, зеркальные артефакты и шум, сохраняя при этом временную и структурную когерентность, обеспечивая стабильные видеопоследовательности без артефактов для дальнейшего анализа. Формулировка GAN выражена в уравнениях [1-6] Дополнительного файла 1.
Сегментация с использованием контурной адаптивной сегментации (CAS)
В этом случае сегментация выполняется с использованием модели сегментации с адаптивной контурной формой. Это определяет предварительные планы сегментирования изображений поражённой витрэктомии в микроскопических изображениях, тем самым снижая энергетическую функцию, как показано в уравнениях [7-12] в дополнительном файле 1. Низкая энергетическая ценность обеспечивает точные представления и локализованную оценку регионов, находящихся под угрозой. Это, в свою очередь, позволяет точно сегментировать поражённые области, что впоследствии облегчает выделение признаков в следующем участке.
Извлечение признаков с помощью динамического пространственно-временного GCN(dGCN)
После завершения этапа предварительной обработки следующим шагом является выделение дискриминационных пространственно-временных признаков. По этой причине используется графовая сверточная сеть (GCN), так как она эффективна для захвата структурированных зависимостей. Принятая модель состоит из слоёв GCN с нелинейными активациями, которые смягчают переподгонку и решают проблему нуля градиента с помощью механизма нормализации. Формулировка GCN основана на спектральной аппроксимации графов первого порядка, что делает её подходящей для крупномасштабных задач полусупервизированного обучения. Кроме того, линейное представление упрощает оптимизацию, обеспечивая эффективное обучение параметрам. Работа упрощённого GCN выражена в уравнениях [13–15] дополнительного файла 1. При применении GCN эффективно извлекает более высокоуровневые структурные представления из интраоперационных видеоданных. Впоследствии сохраняются только наиболее релевантные или подходящие признаки по механизму выбора с помощью оптимизации, который описан в следующем разделе.
Оптимизация признаков с помощью адаптивной оптимизации признаков на основе подсолнечника (ASFO)
Алгоритм адаптивной оптимизации подсолнечника (ASFO) — это усовершенствованная версия классического подхода оптимизации подсолнечника (SFOA). В предлагаемой модели этот биологически обусловленный процесс математически моделируется для устранения уточнения и выбора признаков в высокоразмерном наборе данных. В частности, этот подход направлен на повышение скорости сходимости, балансирование разведки и эксплуатации для сохранения разнообразия решений и смягчения преждевременной сходимости. Математическая формулировка ASFO изложена в уравнениях [16–21] Дополнительного файла 1. Эта схема ускоряет сходимость, когда решения становятся близки к оптимальным. Подробный алгоритм представлен в дополнительном файле 1. В предлагаемом конвейере ASFO используется для уточнения вектора признаков после термоядерного синтеза на основе трансформаторов. Выбранные признаки основаны на текстуре, цвете и интенсивности, морфологических и структурных, движении и времени, высокомерных и взвешенных по внимании регионов. Цель — минимизировать функцию потери релевантности признаков, тем самым выбирая и взвешивая признаки, повышающие точность классификации за счёт снижения избыточности.
Головка классификации на основе трансформатора с пространственно-временным пулом внимания
Модель на основе трансформаторов используется для фиксации временных зависимостей между хирургическими видеопоследовательностями. Модель конфигурирована с многоголовным самовниманием, позиционным кодированием и полностью связанными слоями для окончательного прогнозирования рисков. Оптимизация гиперпараметров выполняется с помощью ASFO. Интегрированный конвейер объединяет предварительную обработку, извлечение признаков, оптимизацию и классификацию на основе трансформаторов для точного прогнозирования хирургических рисков.