Методическая статья

Мультимодальная система глубокого обучения с несколькими инъекциями для точной диагностики околоушной железы

DOI:

10.3791/70231

8 мая 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этой статье представлена мультимодальная система глубокого обучения с несколькими кадрами для точной классификации опухолей околоушных желез с помощью магнитно-резонансной томографии.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Точное различие доброкачественных и злокачественных околоушных опухолей крайне важно для прогноза пациента. Однако из-за высокой гетерогенности околоушных опухолей и ограниченного доступа к данным визуализации предоперационная диагностика остаётся значительной проблемой. Для решения этой проблемы в данном исследовании предлагается мультимодальная фреймворк глубокого обучения, основанный на обучении с малой выборкой. Эта структура интегрирует многопоследовательность МРТ и включает многомасштабный механизм пространственного внимания для улучшения эффективности извлечения признаков и классификации в ситуациях с ограниченным количеством образцов. Модель была систематически оценена с использованием ретроспективно собранной когорты из 198 пациентов с гистопатологически подтверждёнными первичными опухолями околоушных желез (107 доброкачественных, 91 злокачественных), которые прошли полное предоперационное МРТ — включая T1-взвешенное, T2-взвешенное и диффузионно-взвешенное визуализацию — в нашем учреждении, без предварительного лечения околоушного поражения. На уровне пациентов когорта была разделена на обучающие (70%), валидационные (15%) и тестовые (15%) наборы с использованием стратифицированной случайной выборки для сохранения соотношения доброкачественных и злокачественных, обеспечивая взаимоисключающие подмножества и предотвращая утечку данных. Модель достигла площади под кривой (AUC) 0,9822. Это открытие подчеркивает способность системы различать доброкачественные и злокачественные опухоли. Кроме того, модель демонстрировала значительные преимущества в диагностической точности по сравнению с опытными радиологами, что подчёркивает её потенциальное применение для предоперационной доброкачественно-злокачественной дифференцировки и клинической поддержки принятия решений при околоушных опухоли.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Эпидемиологические данные показывают, что частота опухолей околоушных желез увеличивается. Околоушная железа, крупнейшая слюнная железа в организмечеловека, является одним из мест с высокой частотой опухолей головы и шеи. Хотя опухоли околоушных желез относительно редки, составляют примерно 5% опухолей головы и шеи, доброкачественных поражений значительно превосходит злокачественные и они составляют около 80% всех опухолей околоушных желез 2,3. Доброкачественные и злокачественные околоушные опухоли демонстрируют значительные различия в биологическом поведении, стратегиях лечения и прогнозе. Доброкачественные опухоли обычно растут медленно, демонстрируют экспансивный рост и редко метастазируют. Благоприятные результаты наступают после полной хирургической резекции. В отличие от этого, злокачественные опухоли демонстрируют характерные инвазивные паттерны роста и часто проникают в окружающие ткани, такие как лицевой нерв, кожа и кости. Они также способны к удалёным метастазам, что приводит к худшемупрогнозу 4,5.

Тем не менее, предоперационная дифференцировка доброкачественных и злокачественных околоушных опухолей остаётся клинической диагностической задачей. Из-за отсутствия специфических клинических проявлений первым симптомом большинства околоушных опухолей (независимо от злокачественной опухоли) является безболезненное образование, которое усложняет дифференцировку исключительно по признакам илисимптомам 6,7. Хотя такие симптомы, как боль или паралич лица, часто считаются потенциальными признаками злокачественности, они встречаются редко при ранних злокачественных поражениях. Напротив, некоторые доброкачественные опухоли с воспалительными реакциями могут проявлять схожие проявления. Предоперационная оценка околоушных опухолей в основном проводится с помощью визуализации, которые являются основным неинвазивным методом такого обследования. Однако следует отметить, что у каждого метода визуализации есть свои ограничения. Магнитно-резонансная томография (МРТ) считается оптимальным методом оценки околоушных опухолей благодаря исключительной разрешённости мягких тканей, при этом исследования демонстрируют максимальную точность 93% в различии доброкачественных от злокачественныхпоражений 8. Однако традиционные последовательности демонстрируют значительное пересечение характеристиксигнала 9. КТ в первую очередь используется для оценки вовлечённости костей; однако его чувствительность ниже, чем у МРТ, при различии доброкачественных от злокачественныхопухолей 10,11. УЗИ является жизнеспособным методом предварительной оценки поверхностных поражений; однако его эффективность зависит от профессионализмаоператора 12. ПЭТ-КТ характеризуется высокой метаболической чувствительностью; Однако высокая стоимость и уровень ложноположительных результатов ограничивают его использование при первичной диагностике, что делает его более подходящим для стадирования и наблюдения за злокачественными опухоли. В результате одиночные методы визуализации часто не позволяют поставить точную диагностику, и предоперационное различие доброкачественных и злокачественных поражений обычно зависит от всестороннего анализа мультимодальной информации.

В последние годы область искусственного интеллекта (ИИ), особенно подмножество технологий глубокого обучения (DL), представленных сверточными нейронными сетями (CNN), стала значительным фактором прогресса в диагностике опухолей. Это объясняется мощными возможностями извлечения и распознавания образов, которые эти технологии предоставляют. Модели глубокого обучения автоматически извлекают сложные многомасштабные признаки через многоуровневые нейронные сети, значительно снижая зависимость от ручного проектирования признаков и одновременно повышая диагностические показатели. Значительное количество исследований подтвердило их потенциал в мультимодальной медицинской визуализации. Гу Цзюнхуэй и др.13 разработали мультимодальную систему глубокого обучения, интегрирующую ультразвук молочной железы и МРТ, которая эффективно предсказывала реакцию на неоадъювантную химиотерапию, превосходя традиционные методы. Лу Г и др.14 достигли точного различия доброкачественных и злокачественных опухолей молочной железы, интегрируя ультразвук, маммографию и МРТ-изображения с трансферными стратегиями обучения, что дало AUC 0,947. Хорасан А и др.15 провели анализ слияния многопараметрической МРТ предстательной железы (mpMRI) с использованием 3D-CNN с архитектурами ResNet и Inception, достигнув точности примерно 91,3%. В области околоушной визуализации Чжан Г и др.16 создали модель глубокого обучения, интегрирующую ультразвук и клинические данные для доброкачественно-злокачественной дифференцировки; Hu X и Wang H.17 достигли точности классификации 92,3% (AUC=0,96) с использованием модели aResNet50 на основе КТ-изображений. Совокупные данные этих исследований указывают на значительные преимущества использования моделей глубокого обучения для анализа изображений околоушных и других солидных опухолей.

Однако традиционные методы глубокого обучения часто зависят от значительных наборов данных для достижения оптимальной производительности. Рак околоушных околоушных средств, как опухоль с низкой частотой, обладает сравнительно ограниченнымиданными 18. Кроме того, околоушные опухоли демонстрируют высокую гетерогенность визуализации, характеризующуюся сложными вариациями интенсивности сигнала, морфологической структуры и взаимосвязей с окружающей железистой тканью. Эти признаки охватывают различные пространственные масштабы — например, глобальную морфологию опухолей и определение границ, а также локальные характеристики, такие как внутренняя гетерогенность сигналов и инфильтративные паттерны, что затрудняет одномасштабные или простые методы извлечения признаков для полного отражания ключевых различий между доброкачественными и злокачественными поражениями. Кроме того, предыдущие исследования часто опирались на отдельные последовательности МРТ (например, только структурную или функциональную визуализацию), что ограничивает возможность получения полных представлений о характеристиках опухоли, как сообщалось в предыдущихисследованиях 19,20.

Для решения этих проблем мы предполагаем, что мультимодальное глубокое обучение с небольшой выборкой, объединяющее многопоследовательное МРТ и многомасштабный механизм пространственного внимания, может эффективно дифференцировать доброкачественные и злокачественные околоушные опухоли при ограниченных данных и превосходить традиционные методы и оценку радиологов. В частности, эта структура использует стратегиюобучения 21 с несколькими выстрелами для изучения дискриминационных признаков из ограниченного числа представительных доброкачественных и злокачественных случаев. Модель использует механизм пространственного внимания для фокусировки на ключевых областях поражения, что повышает точность различения доброкачественных от злокачественных околоушных оболочек. Модель была оценена на основе ретроспективно собранной когорты из 198 пациентов с патологически подтверждёнными опухолями околоушных желез в нашем учреждении. В этом исследовании интегрированы структурные (T1WI, T2WI) и функциональные (DWI) последовательности МРТ для поддержки морфологической и функциональной информации. Предлагаемая структура направлена на облегчение предоперационной дифференцировки доброкачественных и злокачественных околоушных опухолей.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Все данные пациентов, использованные в этом исследовании, были собраны исключительно в Людной больнице Уси и включали 198 патологически подтверждённых случаев околоушной оболочи. Это исследование было одобрено Институциональным контролёрским советом Народной больницы Уси (IRB No KY24068) и проводится в полном соответствии с институциональными стандартами и международными этическими стандартами. Все данные были полностью анонимизированы перед анализом.

Получение МРТ-изображений

Все последовательности МРТ (взвешенная по T1, взвешенная T2 и диффузионно-взвешенная визуализация) были получены на МРТ-сканере Тесла с частотой 3.0 (Siemens MAGNETOM Verio или Prisma) с использованием 16-канальной головки и шейной катушки. Параметры получения были следующими: T1-взвешенные изображения были получены с TR/TE = 500/15 мс, толщина среза = 3 мм, матрица = 256 × 256, поле зрения = 240 мм; T2-взвешенные изображения были получены с TR/TE = 4000/90 мс, толщина среза = 3 мм, матрица = 320 × 320, поле зрения = 240 мм; Диффузионно-взвешенные изображения были получены с TR/TE = 5000/80 мс, b-значения = 0 и 1000 с/мм 2, толщина среза = 3 мм, матрица = 128 × 128, поле зрения = 240 мм, при автоматической генерации отображаемых коэффициентов видимой диффузии. Все последовательности были получены в осевой плоскости без разрыва между срезами.

Дизайн исследования

В этом ретроспективном исследовании проанализировали предоперационные данные МРТ 198 пациентов с гистопатологически подтверждёнными первичными опухолями околоушных желез (107 доброкачественных и 91 злокачественных). Все пациенты прошли полные околоушные МРТ в нашем учреждении, включая взвешенное T1, T2-взвешенное визуализацию и диффузионно-взвешенные последовательности, без предварительного лечения околоушного поражения. Используйте образцы хирургической резекции или биопсию кора в качестве эталонного стандарта. Критерии включения включали гистопатологически подтверждённую первичную опухоль околоушной железы, предоперационную МРТ со всеми необходимыми последовательностями, доступными в нашем учреждении, а также отсутствие предыдущих операций, лучевой терапии, химиотерапии или абляции при поражении околоушной железы. Критерии исключения включали метастазные опухоли в околоушную железу, значительные артефакты движения или неполные последовательности, делавшие изображения недиагностическими, а также повторяющиеся опухоли после предыдущего лечения. Общая группа состояла из 118 мужчин (59,6%) и 80 девушек (40,4%) с возрастом от 26 до 89 лет (среднее ± SD 53,0 ± 12,8 года), а демографические характеристики, стратификационированные по типу опухоли, были следующими: доброкачественная группа (n=107) — 59 мужчин (55,1%) и 48 женщин (44,9%), возрастной диапазон 28–87 лет (средний ± SD 54,2 ± 12,1 года), и злокачественную группу (n=91) с 59 мужчинами (64,8%) и 32 женщинами (35,2%), возрастной диапазон 26–89 лет (средний ± SD 51,6 ± 13,4 года); Был использован стратифицированный случайный выборочный подход для разделения 198 пациентов на обучающие (70%, n=138), валидационные (15%, n=30) и тестовые (15%, n=30) при сохранении соотношения доброкачественных к злокачественным во всех подмножествах (валидационные и тестовые наборы содержали 16 доброкачественных и 14 злокачественных случаев), при этом разделение проводилось на уровне пациента, а не на срез или на изображение, обеспечивая взаимоисключающие обучающие наборы обучения, валидации и тестов без пересечения пациентов, чтобы предотвратить утечку данных и обеспечить беспристрастную оценку обобщённости моделей.

Предварительная обработка данных

В исследовании реализовывалась стандартизированная предобработка всех МРТ-изображений через четыре основных этапа: регистрация и повторная дискретизация, снятие шума, дополнение данных и нормализация. Для устранения различий в протоколах МРТ и позиционировании пациентов все объемы T1WI, T2WI и DWI сначала были жёстко зарегистрированы в последовательность T1WI в качестве эталонного пространства и повторно отобраны с изотропным разрешением 1мм 3 с использованием трилинейной интерполяции. Затем дешумизация выполнялась на всех зарегистрированных объёмах с помощью алгоритма Non-Local Means (NLM) 22, при автоматическом параметре сглаживания 0,8 раза от предполагаемого отклонения шума, окном поиска 21×21×21 вокселя и окном сходства 7×7×7 вокселей. Такой подход эффективно снижает случайный шум, сохраняя при этом важные конструктивные детали. Впоследствии, чтобы расширить эффективный размер обучающей выборки, улучшить обобщение модели и предотвратить переподгонку на ограниченном наборе данных, были применены различные стратегии дополнения данных, включая случайное вращение (±15°) и случайное масштабирование (0.9–1.1)23,24, применялись исключительно на лету к изображениям обучающих наборов в каждой обучающей эпохе, при этом все преобразования генерировались с использованием фиксированного случайного семена 42 для полной воспроизводимости; Наборы валидации и тестирования остались без дополнения для обеспечения объективной оценки модели. Наконец, чтобы устранить систематические колебания интенсивности сигнала между разными сканирующими устройствами и сессиями, нормализация Z-score применялась к каждому объёму путём вычитания среднего значения и деления на стандартное отклонение, после чего нормализованные значения пикселей линейно масштабировались до диапазона [0, 1], чтобы удовлетворить входные требования фреймворка глубокого обученияPyTorch 25.

Архитектура модели

В данном исследовании предлагается мультимодальная система глубокого обучения, основанная на обучении с небольшим количеством кадров, которая интегрирует дополняющую информацию из нескольких последовательностей МРТ (взвешенная T1, T2-взвешенная визуализация и диффузионно-взвешенная визуализация) и включает многомасштабный механизм пространственного внимания для улучшения представления признаков и классификации в условиях ограниченной выборки. Все объёмы МРТ фиксировались в осевой плоскости на том же сканере; До ввода они проходили жёсткую регистрацию для обеспечения пространственного выравнивания по последовательностям, качество выравнивания вручную проверялось старшим радиологом, а полные 3D-объёмы, сосредоточенные на околоушном поражении, были обрезаны до стандартизированной области интереса, повторно отобраны до изотропного разрешения и изменены до согласованных размеров. Объединяя парадигму обучения с несколькими выстрелами, модуль многомасштабного пространственного внимания и кроссмодальное слияние признаков через поканальную конкатенацию, фреймворк решает задачи, связанные с обобщением моделей в условиях дефицита данных, и позволяет надёжно изучать дискриминативные признаки из небольшого числа аннотированных выборок, при этом полная архитектура иллюстрируется на рисунке 1. Хотя набор данных включает 198 пациентов, метод с несколькими инъекциями применяется, поскольку околоушные опухоли демонстрируют высокую гетерогенность визуализации, а аннотированные объемные мультимодальные данные остаются относительно ограниченными относительно сложности задачи, что позволяет лучше моделировать реальные клинические сценарии с редкими маркированными примерами; для сравнения также был оценён традиционный подход с контролируемым обучением, а преимущества конфигурации с несколькими выстрелами продемонстрированы в абляционных исследованиях в разделе «Результаты». Магистральная сеть используетR3D-18 26 (3D вариант ResNet-18 с полными пространственно-временными свёртками), предварительно обученный на Kinetics-400, в качестве экстрактора признаков с общим весом для каждой последовательности МРТ; Во время адаптации используется прототипическая сетевая головка для классификации по нескольким выстрелам, при этом модуль многомасштабного пространственного внимания вставляется после сверточных стадий каждой модальности-специфической ветви, за которым следует кросс-модальное слияние и общий классификатор. Новизна предлагаемого многомасштабного механизма пространственного внимания заключается в использовании параллельных сверточных путей с размером ядра 1×1, 3×3 и 5×5, где каждый путь независимо генерирует карту пространственного внимания в разном рецептивном поле, которая затем нормализуется с помощью softmax и адаптивно слияется с входными признаками через взвешенное суммирование; Эта конструкция явно отражает характеристики поражения на различных пространственных масштабах — от мелких локальных деталей, таких как внутренняя гетерогенность сигналов, до более широких контекстуальных структур, таких как края опухолей и интерфейсы с окружающими тканями — и обеспечивает превосходную производительность по сравнению с традиционными модулями внимания. Стратегия тонкой настройки проходит в два этапа: изначально предварительно обученные слои основного фундамента R3D-18 замораживаются для сохранения общих пространственно-временных представлений, в то время как тренируются только модули внимания, слои слияния и прототипическая голова; затем последние два остаточных блока (слой 3 и слой 4) каждого магистрали размораживаются для обеспечения полной адаптации к специфическим для МРТ объёмным особенностям. Обучение проводилось с использованием оптимизатора Адама с начальной скоростью обучения 0,0001, уменьшенной в 0,1 раза каждые 20 эпох за счёт поэтапного затухания; модель прошла 100 эпох эпизодического обучения с размером партии 8 эпизодов (каждый из которых включает наборы поддержки и запросов), следуя стандартному протоколу с несколькими кадрами в двухсторонней конфигурации K-shot (при K=5 во время первичного мета-обучения и оценки); все эксперименты проводились на высокопроизводительном GPU с 24 ГБ памяти, а фиксированный случайный seed 42 применялся при разбиении данных, инициализации веса и увеличении данных для обеспечения полной воспроизводимости.

Парадигма задач обучения с малым кольцом для классификации опухолей околоушных желез

Учитывая ограниченную доступность высококачественных аннотированных данных по опухолям околоушных желез и высокую гетерогенность этих поражений, это исследование использует метрическую парадигму обучения с несколькими инъекциями, несмотря на то, что общий набор данных насчитывает 198 пациентов. Структура задач с множеством поддержки и множества запросов используется для моделирования процесса диагностического рассуждения в клинической практике, где обычно доступно лишь небольшое количество представительных примеров для редких или гетерогенных подтипов опухолей. Каждая обучающая задача определяется в N-way K-shot формате (N=2, что соответствует доброкачественной/злокачественной классификации), что позволяет модели изучать дискриминативные представления признаков на основе небольшого числа выборок. В частности, для каждой задачи поддерживающий набор включает K мультимодальных образцов (взвешенное изображение с T1, взвешенное по T2 и диффузионно-взвешенное изображение) для построения прототипов классов, в то время как набор запросов содержит образцы для классификации. Модель принимает решения по классификации на основе метрик расстояния, вычисляя сходство между признаками выборки запросов и прототипами классов в пространстве вложения. Этот механизм обучения примечателен своей способностью освобождать модель от зависимости от крупномасштабных аннотированных данных, делая её более пригодной для практических применений в клинических условиях с ограниченными данными. Для прямого сравнения также был оценён традиционный контролируемый подход к обучению с использованием полного учебного комплекса без эпизодического отбора из нескольких выстрелов, а преимущества конфигурации с несколькими выстрелами с точки зрения обобщения и стабильности при условиях ограниченной выборки количественно продемонстрированы в абляционных исследованиях, представленных в разделе «Результаты».

На этапе классификации в этом исследовании используется прототипическая сеть в качестве классификатора. Для каждой категории c в поддерживаемом наборе прототипный векторный p_c вычисляется как среднее значение вложенных образцов поддержки:

figure-protocol-1(1)

где f(·) обозначает функцию вложения (экстрактор особенностей), figure-protocol-2 — i-я вспомогательная выборка категории c, а K — количество кадров на класс.

Для данного выборки запроса x вероятность принадлежности к категории c рассчитывается с помощью функции softmax на отрицательных евклидовых расстояниях:

figure-protocol-3(2)

где d(·, ·) обозначает евклидово расстояние.

Архитектура, основанная на мультимодальном слиянии признаков

Для полного использования комплементарной ценности многопоследовательных МРТ-данных в этом исследовании была разработана трехветвневая сеть синтеза элементов, которая отдельно обрабатывает взвешенную T1-взвешенную визуализацию (T1WI), T2-взвешенную визуализацию (T2WI) и диффузионно-взвешенную (DWI) последовательности. Каждая последовательность сначала проходит извлечение признаков с использованием модели R3D-18 с общим весом, предварительно обученной на наборе данных Kinetics-400 с весами, полученными из официальной реализации PyTorch TorchVision; Во время адаптации применялась двухступенчатая стратегия тонкой настройки, при которой все слои предварительно обученного магистрали изначально оставались фиксированными для сохранения общих пространственно-временных представлений, в то время как обучались только многомасштабные модули пространственного внимания, слои кросс-модального слияния и прототипическая голова сети, после чего последние два остаточных блока (слой 3 и слой 4) каждого магистрали размораживались для сквозной адаптации к специфическим для МРТ объёмным особенностям, при этом ранние слои (слой 1 и 2) оставались замороженными во время тренировки. Эта сеть использует 3D-сверточные ядра, скользящие по пространственным и временным измерениям, чтобы эффективно захватывать объемную морфологию опухоли и пространственную контекстуальную информацию. При слиянии признаков используется кроссмодальная стратегия на основе конкатенации, при которой представления признаков с повышением внимания из трёх модальностей объединяются вдоль измерения канала, формируя комплексный мультимодальный вектор признаков. Этот подход к слиянию сохраняет уникальную информацию каждой модальности — анатомическую чёткость T1WI, чувствительность к составу тканей T2WI и функциональность клеточной плотности DWI — при этом достигая эффективной комплементарности диагностической информации, что значительно повышает богатство экспрессии признаков и дискриминативную силу.

Многомасштабный механизм пространственного внимания

Это исследование включает многомасштабный модуль пространственного внимания для фиксации характеристик поражения на различных пространственных масштабах. Как показано на рисунке 2, модуль использует параллельные сверточные пути с размерами ядра 1×1, 3×3 и 5×5. Каждый путь независимо генерирует пространственную карту внимания, которая нормализуется с помощью softmax и затем адаптивно объединяется с входными признаками посредством взвешенной суммы. Такой дизайн позволяет модели сосредоточиться на областях, наиболее релевантных для различия доброкачественных от злокачественных поражений, одновременно снижая влияние незначительных фоновых областей. Полученные карты внимания могут помочь выделить интересующие области на изображениях.

ДОСТУПНОСТЬ ДАННЫХ:

Репрезентативная подгруппа полностью анонимизированных мультимодальных последовательностей МРТ (T1WI, T2WI, DWI) из исследовательской когорты доступна в репозитории Zenodo по адресу: https://doi.org/10.5281/zenodo.17744149 (версия v1). Эти данные распространяются под лицензией Creative Commons Attribution 4.0 International (CC-BY 4.0) без ограничений на доступ. Полный анонимизированный набор данных пока не является публично доступным и будет опубликован в следующей версии репозитория после официальной публикации этой рукописи, при условии институционального и этического одобрения.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Обзор производительности модели

Для оценки диагностической эффективности модели использовался набор стандартных метрик, включая точность, точность, воспоминание и F1-балл. В двухсторонней конфигурации с 5 выстрелами мультимодальная модель обучения с несколькими дозами на основе R3D-18 получила следующие результаты на тестовом наборе для классификации опухолей околоушных желез: точность 96,88%, точность 97,50%, воспоминание 96,88% и результат F...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом исследовании мы выдвинули гипотезу, что мультимодальная система глубокого обучения с несколькими дозами, интегрирующая многопоследовательное МРТ (взвешенное по T1, T2 и диффузионно-взвешенное изображение) с многомасштабным механизмом пространственного внимания, способна точно различать доброкачественные и злокачественные опухоли околоушных желез при ограниченных условиях аннотированных данных и превосходить как традиционные методы глубокого обучения, так и опытных радиологов.

...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы не заявляют о конкурирующих финансовых или нефинансовых интересах.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Это исследование финансировалось Национальным фондом естественных наук Китая (No 82473200), ключевым медицинским исследовательским проектом Комиссии здравоохранения провинции Цзянсу (No K2023061) и проектом Комиссии по здравоохранению провинции Цзянсу по здоровью пожилых людей (KLM2023019) для YJH

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Grad-CAMhttps://github.com/jacobgil/pytorch-grad-cam
NumPy 1.25Разработчики NumPyhttps://numpy.org/
Панды 2.1Разработчики Pandashttps://pandas.pydata.org/
ПичармJetBrainshttps://www.jetbrains.com/zh-cn/pycharm/
Python 3.10Фонд программного обеспечения Pythonhttps://www.python.org/
PyTorch 2.1Meta Platforms, Inc.https://pytorch.org/
Scikit-Learn 1.3Разработчики Scikit-learnhttps://scikit-learn.org/
ШАПhttps://github.com/slundberg/shap
Магнитно-резонансная томография Siemens MAGNETOM Prisma 3.0TSiemens Healthineershttps://www.siemens-healthineers.cn/magnetic-resonance-imaging/3t-mri-scanner/magnetom-prisma

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Liu, X., Pan, Y., Zhang, X., Sha, Y., Wang, S., et al. A Deep Learning Model for Classification of Parotid Neoplasms Based on Multimodal Magnetic Resonance Image Sequences. Laryngoscope. 133 (2), 327-335 (2023).
  2. Moore, M. G., Yueh, B., Lin, D. T., Bradford, C. R., Smith, R. V., et al. Controversies in the Workup and Surgical Management of Parotid Neoplasms. Otolaryngol Head Neck Surg. 164 (1), 27-36 (2021).
  3. Gautam, S. K., Kumar, S., Singh, H. P., Singh, A. B., Chandra, M. Clinico-Pathological Profile of Parotid Gland Tumors at a Tertiary Care Center in North India. Natl J Maxillofac Surg. 14 (3), 438-443 (2023).
  4. Alshammari, A., Aljufairi, E., Alsayed, A. Oncocytic Mucoepidermoid Carcinoma of the Parotid Gland: Case Report. J Surg Case Rep. 2022 (4), rjac039(2022).
  5. Thielker, J., Grosheva, M., Ihrler, S., Wittig, A., Guntinas-Lichius, O. Contemporary Management of Benign and Malignant Parotid Tumors. Front Surg. 5, 39(2018).
  6. Davachi, B., Imanimoghaddam, M., Majidi, M. R., Sahebalam, A., Johari, M., et al. The Efficacy of Magnetic Resonance Imaging and Color Doppler Ultrasonography in Diagnosis of Salivary Gland Tumors. J Dent Res Dent Clin Dent Prospects. 8 (4), 246-250 (2014).
  7. Pedicelli, A., Trombatore, P., Bartolo, A., Camilli, A., Rossi, E. D., et al. Preoperative Direct Puncture Embolization of Castleman Disease of the Parotid Gland: A Case Report. Curr Oncol. 31 (4), 2047-2056 (2024).
  8. Paris, J., Facon, F., Pascal, T., Chrestian, M., Moulin, G., et al. Preoperative Diagnostic Values of Fine-Needle Cytology and MRI in Parotid Gland Tumors. Eur Arch Otorhinolaryngol. 262 (1), 27-31 (2005).
  9. Yologlu, Z., Aydin, H., Alp, N. A., Aribas, B. K., Kizilgoz, V., et al. Diffusion-Weighted Magnetic Resonance Imaging in the Diagnosis of Parotid Masses: Preliminary Results. Saudi Med J. 37 (12), 1412-1417 (2016).
  10. Stoia, S., et al. Cross-Sectional Imaging and Cytologic Investigations in the Preoperative Diagnosis of Parotid Gland Tumors: An Updated Literature Review. Bosn J Basic Med Sci. 21 (1), 19-32 (2021).
  11. Christe, A., Waldherr, C., Hallett, R., Zbaeren, P., Thoeny, H. MR Imaging of Parotid Tumors: Typical Lesion Characteristics Improve Discrimination Between Benign and Malignant Disease. Am J Neuroradiol. 32 (7), 1202-1207 (2011).
  12. Li, L., Zhao, Y., Luo, D., Yang, L., Hu, L., et al. Diagnostic Value of Single-Source Dual-Energy Spectral Computed Tomography in Differentiating Parotid Gland Tumors: Initial Results. Quant Imaging Med Surg. 8 (6), 588-596 (2018).
  13. Gu, J., Zhong, X., Fang, C., Lou, W., Fu, P., et al. Deep Learning of Multimodal Ultrasound: Stratifying the Response to Neoadjuvant Chemotherapy in Breast Cancer Before Treatment. Oncologist. 29 (2), e187-e197 (2024).
  14. Lu, G., Tian, R., Yang, W., Liu, R., Liu, D., et al. Deep Learning Radiomics Based on Multimodal Imaging for Distinguishing Benign and Malignant Breast Tumors. Front Med. 11, 1402967(2024).
  15. Horasan, A., Güneş, A. Advancing Prostate Cancer Diagnosis: A Deep Learning Approach for Enhanced Detection in MRI Images. Diagnostics. 14 (14), 1871(2024).
  16. Zhang, G., et al. A Deep Learning Model for the Differential Diagnosis of Benign and Malignant Salivary Gland Tumors Based on Ultrasound Imaging and Clinical Data. Quant Imaging Med Surg. 13 (5), 2989-3000 (2023).
  17. Hu, Z., Wang, B., Pan, X., Cao, D., Gao, A., et al. Using Deep Learning to Distinguish Malignant from Benign Parotid Tumors on Plain Computed Tomography Images. Front Oncol. 12, 919088(2022).
  18. Khodabakhshi, Z., et al. MRI-Based Radiomics for Predicting Histology in Malignant Salivary Gland Tumors: Methodology and Proof of Principle. Sci Rep. 14 (1), 9945(2024).
  19. Sreecharan, V., et al. Multiparametric MRI in Diagnosis of Parotid Gland Tumor: An Observational Study in 3-T MRI. Indian J Radiol Imaging. 35 (2), 402-410 (2024).
  20. Chang, Y. J., Huang, T. Y., Liu, Y. J., Chung, H. W., Juan, C. J. Classification of Parotid Gland Tumors by Using Multimodal MRI and Deep Learning. NMR Biomed. 34 (8), e4408(2021).
  21. Parnami, A., Lee, M. Learning from Few Examples: A Summary of Approaches to Few-Shot Learning. ArXiv. abs/2203.04291, (2022).
  22. Buades, A., Coll, B., Morel, J. M. A Non-Local Algorithm for Image Denoising. 2005 IEEE Computer Society Conference on Computer Vision and Pattern Recognition (CVPR'05), 2, 60-65 (2005).
  23. Maharana, K., Mondal, S., Nemade, B. A Review: Data Pre-Processing and Data Augmentation Techniques. Global Transitions Proceedings, 3, 91-99 (2022).
  24. Mumuni, A., Mumuni, F. Data augmentation: A comprehensive survey of modern approaches. Array. 16, 100258(2022).
  25. Au, R. C., Tan, W. C., Bourbeau, J., Hogg, J. C., Kirby, M. Impact of Image Pre-Processing Methods on Computed Tomography Radiomics Features in Chronic Obstructive Pulmonary Disease. Phys Med Biol. 66 (24), 245015(2021).
  26. Tran, D., Wang, H., Torresani, L., Ray, J., LeCun, Y., et al. A Closer Look at Spatiotemporal Convolutions for Action Recognition. 2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition, , 6450-6459 (2017).
  27. He, K., Zhang, X., Ren, S., Sun, J. Deep Residual Learning for Image Recognition. 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , 770-778 (2016).
  28. Huang, G., Liu, Z., Van Der Maaten, L., Weinberger, K. Q. Densely Connected Convolutional Networks. 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , 2261-2269 (2017).
  29. Xie, S., Girshick, R., Dollár, P., Tu, Z., He, K. Aggregated Residual Transformations for Deep Neural Networks. 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , 5987-5995 (2017).
  30. Snell, J., Swersky, K., Zemel, R. Prototypical Networks for Few-Shot Learning. NIPS'17: Proceedings of the 31st International Conference on Neural Information Processing System, , 4080-4090 (2017).
  31. Zhou, F., Wang, P., Zhang, L., Wei, W., Zhang, Y. Revisiting Prototypical Network for Cross-Domain Few-Shot Learning. 2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), , 20061-20070 (2023).
  32. Li, T., et al. Automated Diagnosis of Major Depressive Disorder With Multi-Modal MRIs Based on Contrastive Learning: A Few-Shot Study. IEEE Transactions on Neural Systems and Rehabilitation Engineering. 32, 1566-1576 (2024).
  33. Liu, Q., Tian, Y., Zhou, T., et al. A Few-Shot Disease Diagnosis Decision Making Model Based on Meta-Learning for General Practice. Artif Intell Med. 147, 102718(2024).
  34. Jiao, S., et al. Multi-Modal Contrastive Learning for Medical Image Classification with Limited Training Data. 2024 International Conference on Machine Learning and Applications (ICMLA), , 1083-1088 (2024).
  35. Ouahab, A., Ahmed, O. B. ProtoMed: Prototypical Networks with Auxiliary Regularization for Few-Shot Medical Image Classification. Image and Vision Computing. 154, 105337(2025).
  36. Wang, L., Uddin, I. I., Santosh, K. C. Expert-Guided Explainable Few-Shot Learning with Active Sample Selection for Medical Image Analysis. IEEE Journal of Biomedical and Health Informatics. , (2025).
  37. Hu, J., Shen, L., Sun, G. Squeeze-and-Excitation Networks. 2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition, , 7132-7141 (2018).
  38. Woo, S., Park, J., Lee, J. Y., Kweon, I. S. CBAM: Convolutional Block Attention Module. Computer Vision – ECCV 2018: 15th European Conference, Munich, Germany, September 8–14, 2018, Proceedings, Part VII, , 3-19 (2018).
  39. Wang, Q., et al. ECA-Net: Efficient Channel Attention for Deep Convolutional Neural Networks. 2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), , 11534-11542 (2020).
  40. Misra, D., et al. Rotate to Attend: Convolutional Triplet Attention Module. 2021 IEEE Winter Conference on Applications of Computer Vision (WACV), , 3138-3147 (2021).
  41. Selvaraju, R. R., Cogswell, M., Das, A., Vedantam, R., Parikh, D., et al. Grad-CAM: Visual Explanations from Deep Networks via Gradient-Based Localization. 2017 IEEE International Conference on Computer Vision (ICCV), , 618-626 (2017).
  42. Wang, S., Zhang, Y. Grad-CAM: Understanding AI Models. Computers, Materials & Continua. 76 (2), 1321-1324 (2023).
  43. Lundberg, S. M., Lee, S. I. A Unified Approach to Interpreting Model Predictions. NIPS'17: Proceedings of the 31st International Conference on Neural Information Processing Systems, , 4768-4777 (2017).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Похожие статьи