Методическая статья

Объяснимый метод трансферного обучения на основе ИИ для прогнозирования рака молочной железы

DOI:

10.3791/70011

22 июня 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Разработан объяснимый протокол трансферного обучения с использованием EfficientNet-B0 и Grad-CAM для классификации ультразвуковых изображений молочной железы на доброкачественные, злокачественные и нормальные категории, предоставляющий интерпретируемые диагностические тепловые карты, подходящие для клинических решений.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Идентификация рака груди с помощью ультразвуковых изображений требует высокой точности и прозрачности, чтобы помочь врачам принимать правильные решения. Данная работа демонстрирует систему глубокого обучения для классификации ультразвуковых изображений молочной железы на доброкачественные, злокачественные и нормальные изображения с использованием архитектуры EfficientNet-B0, тонко настроенной на базе данных Breast Ultrasound Identification (BUSI). Для снижения дисбаланса классов и стабилизации сети применяется дополнение данных, включая случайное горизонтальное переворачивание, вращение и дрожь цвета. Отображение активации классов с градиентным взвешением (Grad-CAM) используется для получения визуальных объяснений путем выявления интересующих областей, таких как края опухолей и узоры текстуры. Модель достигла средней точности 99%, что демонстрирует высокую эффективность в обнаружении поражений. Интеграция объяснимого ИИ (XAI) не только повышает диагностическую уверенность, но и сокращает разрыв между клинической практикой и ИИ. Результаты подтверждают потенциал сочетания высокоэффективных моделей глубокого обучения с методами интерпретируемости для разработки надёжных инструментов диагностики рака молочной железы, подходящих для реальной клинической практики.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Рак молочной железы — одно из самых значимых опасных для жизни заболеваний, поражающих женщин во всём мире. По данным Всемирной организации здравоохранения (ВОЗ), рак молочной железы способствует большинству смертей, связанных с раком, и ранняя диагностика имеет решающее значение для повышениявыживаемости 1. Ультразвуковая визуализация стала рутинной диагностической процедурой при раке молочной железы, поскольку она безопасна, недорога и позволяет получать изображения в реальном времени. В отличие от маммографии, ультразвук чрезвычайно эффективен для дифференцирования твёрдых образований и нароста, содержащих жидкость, и, следовательно, служит отличным диагностическим помощником при патологии молочной железы. Интерпретация ультразвуковых изображений крайне субъективна и зависит от высокого уровня экспертизы, что приводит к вариативности диагноза и возможной человеческой ошибке.

За последние несколько лет искусственный интеллект и глубокое обучение продемонстрировали огромные возможности автоматизации анализа медицинских изображений. Модели на основе глубокого обучения, особенно CNN, превосходят в сегментации объектов, обнаружении иклассификации 2. Однако внедрение ИИ в здравоохранении затрудняется «чёрным ящиком» этих моделей. Термин «чёрный ящик» относится к отсутствию прозрачности в том, как модель достигает конкретного вывода; Хотя входные и выходные данные известны, внутренняя логика и специфические функции, используемые для клинического прогноза, остаются скрытыми от пользователя.

Мотивация этой работы связана с острой потребностью в надёжных инструментах для ранней диагностики рака груди, который остаётся одной из ведущих причин женской смертности во всем мире. Хотя модели глубокого обучения очень эффективны, их недостаток интерпретации ограничивает интеграцию вклинические условия 3. Настоящая работа устраняет эти пробелы путём использования EfficientNet-B0 для высокопроизводительной классификации и интеграции методов объяснимого ИИ (XAI), таких как Grad-CAM, для предоставления визуальной информации о процессе принятия решений моделью. Балансируя между прозрачностью и точностью, это исследование направлено на создание надёжной системы ИИ, которая предоставляет качественную диагностическую поддержку клиницистам. Методы XAI раскрывают основное рассуждение прогнозов моделей, позволяя клиницистам проверять результаты и преодолевать разрыв между клинической практикой и автоматизированнымисистемами 4. В классификации ультразвукового исследования молочной железы эта интерпретируемость гарантирует, что диагнозы на основе ИИ являются точными и клинически обоснованными.

Несмотря на достижения в области глубокого обучения, классификация ультразвуковых изображений молочной железы не лишена трудностей, включая дисбаланс классов, когда меньшинственные классы, такие как злокачественные опухоли, недостаточно представлены, что приводит к предвзятыммоделям 5. Отсутствие интерпретируемости в моделях глубокого обучения затрудняет их применение в клинической практике, поскольку клиницистам требуется прозрачное принятие решений. Ограничения на набор данных, такие как ограниченный размер и разнообразие, ограничивают обобщимость моделей, в то время как сложные особенности изображения в ультразвуковом виде, такие как границы опухоли и текстура, трудноосвоить 6. Решения вышеупомянутых проблем требуют надёжной и интерпретируемой структуры, обеспечивающей высокую точность с чётким пониманием прогнозирования модели7.

Цель исследования — разработать рамки глубокого обучения, способной классифицировать изображения ультразвукового исследования молочной железы на доброкачественные, злокачественные и нормальные категории, одновременно улучшая обобщение за счёт целенаправленного увеличения для меньшинств. Фреймворк интегрирует отображение активации классов с градиентным взвешенным уровнем для визуальных объяснений прогнозов и оценки эффективности с использованием точности, точности, воспоминания и оценки F1, демонстрируя её пригодность как интерпретируемой системы поддержки клинических решений. В отличие от объяснимых ультразвуковых исследований рака молочной железы, проведённых ранее, где Grad-CAM в основном используется как пост-хоквизуализация 8, предлагаемая структура сочетает осознанную предобработку поражения и обучение с осознанностью в классе на этапе обучения. Маски с основной правдой из набора данных Breast ULTRASOUND Images (BUSI) накладываются на ультразвуковые изображения, чтобы подчеркнуть границы поражений и внутренние эхо-паттерны при извлечении признаков, а селективное дополнение применяется к диагностическим группам меньшинств для уменьшения дисбаланса в классах без изменения клинически значимых признаковвнешности 9. Это сочетание усиления поражений, основанного на поражении, трансферного обучения EfficientNet-B0 и объяснимости Grad-CAM — это сочетание, которое повышает диагностическую устойчивость и даёт интерпретации, соответствующие морфологии поражения, что подтверждает гипотезу, что анатомически направленное усиление и объяснимость поражений может сделать диагностику рака молочной железы с помощью ИИ надежной и заслуживающейдоверия 10.

Традиционная медицинская визуализация традиционно опиралась на традиционные методы обработки изображений, включая фильтрацию, сегментацию и морфологические операции для выявления видимых структур длядиагностики 11. Однако эти процессы обычно требовали ручной настройки и испытывали трудности с учётом присущей медицинским изображениям вариабельности и сложности. Например, интерпретация ультразвукового исследования молочной железы исторически зависела от субъективной экспертизы радиологов, где выявление злокачественных и доброкачественных поражений опиралось на визуальные изображения, склонные к ошибкам человека или неправильному толкованию.

Появление глубокого обучения стало катализатором трансформационной революции в медицинской визуализации, главным образом за счёт внедрения сверточных нейронных сетей (CNN)12. Среди них EfficientNet-B0 представляет собой значимую инновацию, использующую метод сложного масштабирования, который балансирует глубину, ширину и разрешение сети для достижения высокоэффективных и точных вычислений. В контексте ультразвуковой визуализации молочной железы модель использует последовательные сверточные слои для автоматического изучения иерархических признаков, эффективно исключая необходимость в субъективном ручном извлечении признаков и значительно повышая точность и надёжностьдиагностики 13. Несмотря на этот впечатляющий потенциал, глубокое обучение в области медицинской визуализации остаётся развивающейся областью с нерешёнными проблемами. Качество и доступность данных имеют первостепенное значение, поскольку модели глубокого обучения требуют огромных репозиториев аннотированных изображений для успешного обобщения. Кроме того, «чёрный» характер этих моделей создаёт значительные препятствия для клинической приемлемости; Этические опасения по поводу возможных искажений в обучающих данных также могут привести к искажённым или дискриминационным диагностическимпрогнозам 14. В результате эти исследования требуют строгих протоколов тестирования и валидации, чтобы обеспечить объективность и клиническую обоснованность моделей. Для устранения этих ограничений текущие достижения в области глубокого обучения сосредоточены на повышении интерпретируемости и устойчивости моделей. Методы, такие как картирование активации классов с градиентным взвешенным уровнем (Grad-CAM), применяемые в данном исследовании, позволяют визуализировать конкретные области изображения, влияющие на результаты модели, тем самым способствуя более глубокому пониманию поведения модели и поддержке клинического принятия решений. Кроме того, прорывы в федеративных образовательных рамках способствуют сотрудничеству, ориентированному на конфиденциальность между учреждениями, позволяя использовать разнородные данные без необходимости обмена необработаными наборами данных. Такие достижения постепенно обеспечивают более надёжные, интерпретируемые и беспристрастные приложения глубокого обучения в медицинской визуализации, в конечном итоге улучшая клинические критерии и уход за пациентами 15.

Значение интерпретируемых медицинских систем принятиярешений было подчеркнуто благодаря недавним достижениям в области объяснимого искусственного интеллекта. Интерпретируемые фреймворки Интерпретируемые фреймворки на основе слияния показали лучшую классификацию и прозрачность благодаря сочетанию нескольких представлений признаков и более одного механизмаобъяснения 17. Недавние исследования показали высокий потенциал использования моделей глубокого обучения в сочетании с методами XAI для повышения диагностической уверенности в диагностике рака груди и других медицинских задачах прогнозирования. Эти статьи поддерживают необходимость как высокого прогноза, так и интерпретируемого мышления у клиницистов, что соответствует цели текущего исследования по созданию эффективной и понятной системы ультразвуковойклассификации 18.

Таблица 1 представляет обзор литературы и существующие технологии.

ИзучениеЦельПримечание
Хумайра Африн и др. (2023)19Ознакомьтесь с приложениями глубокого обучения для ультразвуковой диагностики и прогноза образования груди.Классификация поражений показала наивысшие показатели, при этом исследования прогноза были меньше.
Гелан Аяна и др. (2022)20Ознакомьтесь с ультразвуковыми наноносителями для химиотерапии рака груди.Ультразвуково реагируемые наноносители улучшают доставку лекарств, но сталкиваются с физиологическими барьерами.
Валерио Ди Паола и др. (2022)21Анализировать методы визуализации для точного N-стадирования при раке молочной железы.МРТ и УЗД играют ключевую роль, но ложноположительные и отрицательные результаты влияют на точность диагностики.
Адьяша Саху и др. (2024)22Предложить ансамблевой классификатор глубокого обучения для обнаружения рака молочной железы.Достигнут высокий уровень точности с помощью AlexNet, ResNet и MobileNetV2 с LoG и высоким бустом.
Алиреза Резазаде и др. (2022)23Разработать объяснимый ML-конвейер для диагностики рака груди с помощью ультразвуковых изображений.Использует текстурные особенности и ансамбли дерева принятия решений для улучшения интерпретируемости предсказаний.
Асаф Раза и др. (2023)24Разработайте DeepBreastCancerNet для надёжного обнаружения рака молочной железы.Достигнут 99,63% точности при использовании 24-слоевой архитектуры с несколькими оптимизациями.
Киран Джабин и др. (2022)25Предложить фреймворк глубокого обучения с использованием DarkNet-53 и объединения функций.Достигнут 99,1% точности с помощью оптимизированных методов выбора признаков.
Гелан Аяна и др. (2022)26Разработка многоступенчатого трансферного обучения (MSTL) для ультразвуковой классификации рака молочной железы.Повышение точности с помощью обучения на основе медицинских изображений с помощью EfficientNetB2, InceptionV3 и ResNet50.
Сакшам Гупта и др. (2023)27Используйте модифицированный ResNet50 для ультразвуковой классификации рака груди.Достигнут 97,8% точности, сокращая время диагностики и улучшая раннее обнаружение.
Карл Краткевич и др. (2022)28Ознакомьтесь с современными методами визуализации, такими как ультразвуковая томография (UST) и фотоакустическая томография (PAT).UST и PAT улучшают выявление рака молочной железы с помощью количественной визуализации.

Таблица 1: Показывает литературу и обзор существующих технологий.

Предлагаемая модель основана на достижениях в области глубокого обучения в классификации ультразвуковых изображений молочной железы, что преодолевает основные задачи данного исследования, включая качество данных, интерпретируемость модели и эффективность вычислений. В отличие от старых методов, где используется ручное извлечение признаков, в данной работе авторы используют EfficientNet-B0 — новейшую архитектуру, которая объединяет глубину, ширину и разрешение в лучшую рабочую схему. Модель использует Grad-CAM для визуализации объяснения своего прогноза, что повышает её прозрачность и клиническую уверенность. Хотя современные решения, включая ансамблевые модели и трансферное обучение, стали высокоточными, их сложно легко интерпретировать или они могут требовать значительных вычислительных мощностей. Представленная работа устраняет эти пробелы, поскольку она является высокоточной (99) и интерпретируемой для обеспечения надёжности и жизнеспособности модели в практических аспектах клинического принятия решений. Предлагаемый подход, сосредоточенный на дисбалансе классов и практического применения, является новым стандартом диагностики рака молочной железы с помощью ИИ.

В статье используется общедоступный BUSI — ранее собранный набор анонимизированных клинических изображений. В этом исследовании не было прямых человеческих участников и животных, и, следовательно, не требовалось институциональное этическое одобрение (IRB/IACUC). Все операции соответствуют общим стандартам вторичного использования общедоступных медицинских данных визуализации.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Характеристики наборов данных

В исследовании использовался общедоступный набор данных Breast Ultrasound Images (BUSI), который предоставил хорошо задокументированный репозиторий для анализа и классификации ракамолочной железы 29. Этот набор данных оказался особенно уместным, поскольку включал обширную коллекцию ультразвуковых изображений, необходимых для создания и валидации моделей глубокого обучения для медицинской визуализации. Набор данных включал 780 ультразвуковых изображений, собранных у 600 женщин в возрасте от 25 до 75 лет, представляющих разнообразную группу для диагностики рака груди. Все изображения поддерживали среднее разрешение 500 x 500 пикселей и использовали формат PNG для сохранения высококачественных визуальных данных для анализа. Рисунок 1 иллюстрирует общий рабочий процесс предлагаемого фреймворка, включая предобработку, дополнение, извлечение признаков EfficientNet-B0, классификацию и интерпретацию Grad-CAM.

figure-protocol-1
Рисунок 1: Репрезентативные выборки из набора данных BUSI. (A) Доброкачественные, (B) злокачественные и (C) Нормальные изображения. Панели иллюстрируют морфологическое разнообразие, используемое для обучения. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

2. Экспериментальный рабочий процесс

Для обеспечения воспроизводимости расследование проводило процессуальный конвейер последовательно. Сначала система загружала ультразвуковые изображения BUSI и соответствующие маски для наземной точности и увеличивала их размер до 224×224 пикселей, затем нормализовала ImageNet. Во-вторых, фреймворк наложил на каждое изображение маску, чтобы подчеркнуть области поражения, а затем разделил набор данных на обучение (70%), валидацию (15%) и тестирование (15%) с использованием стратифицированной выборки. В-третьих, исследование применяло целенаправленное усиление, включающее горизонтальное переворачивание, вращение (±15°) и дрожь цвета, преимущественно к меньшинствам. В-четвёртых, исследователи доработали модель EfficientNet-B0, которая была предварительно обучена на ImageNet, заменив последний слой классификации на выходной слой из трёх классов. Процесс обучения использовал оптимизатор Адама (скорость обучения 0,00005), снижение скорости пошагового обучения (γ = 0,1 каждые 7 эпох), потерю перекрёстной энтропии, размер партии 8 и раннюю остановку с терпением 2. Наконец, Grad-CAM сгенерировал тепловые карты внимания с последнего сверточного слоя для визуализации диагностически значимых областей и поддержки клинической интерпретации. Таблица материалов содержит основные наборы данных, программные библиотеки и аппаратные конфигурации, необходимые для воспроизведения классификации и интерпретируемости ультразвуковой системы исследования.

Набор данных BUSI демонстрировал естественный классовый дисбаланс, что часто наблюдается в медицинских наборах данных. Распределение было благоприятно для доброкачественного класса, за которым следовали злокачественные и нормальные случаи. В частности, набор данных содержал 487 доброкачественных, 210 злокачественных и 133 нормальных изображений. Хотя дополнение данных увеличивало вариабельность обучения, оно не изменило основное количество выборок в каждом классе. Такое распределение отражало реальные клинические ситуации, где доброкачественные заболевания встречаются чаще, чем злокачественные опухоли. Хотя такой дисбаланс точно отражал распространённость аномалий молочной железы в клинических условиях, он создавал трудности для обучения глубокому обучению, так как мог привести к предвзятым прогнозам и неоптимальным результатам для меньшинств. В результате смягчение этого дисбаланса стало необходимым для формулирования эффективной и обобщаемой модели, которая эффективно работает во всех диагностических категориях. На рисунке 2 показаны репрезентативные ультразвуковые изображения из набора данных, иллюстрирующие примеры доброкачественных, злокачественных и нормальных образцов тканей молочной железы.

figure-protocol-2
Рисунок 2: Предложенный рабочий процесс модели. Последовательный конвейер от предобработки входных и маск-наложений до обучения EfficientNet-B0 и выхода Grad-CAM. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

3. Предварительная обработка данных

В исследовании были изменены размеры всех изображений до 224 x 224 пикселей, соответствуя стандартным входным размерам архитектуры EfficientNet-B0. Это изменение размера обеспечило согласованность наборов данных и снизило вычислительные требования, как определено в уравнении 1.

figure-protocol-3     

Фреймворк нормализовал значения пикселей, используя среднее и стандартное отклонение набора данных ImageNet ([0.485, 0.456, 0.406] для среднего и [0.229, 0.224, 0.225] для std). Эта нормализация масштабировала входные данные для повышения устойчивости обучения и скорости сходимости, рассчитанных согласно уравнению 2.

figure-protocol-4      

Для улучшения извлечения признаков и идентификации интересующих областей исследователи наложили оригинальные изображения на соответствующие маски с реальностью. Рисунок 3 иллюстрирует маски от поражения с основной точностью и наложенные на них ультразвуковые изображения, которые подчёркивали границы опухоли.

figure-protocol-5
Рисунок 3: Маска и наложенные изображения. (A) Оригинальное ультразвуковое исследование, (B) маска с правдой основой, и (C) результирующий наложение, подчёркивающее границы опухолей для пространственного внимания. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Это наложение выявляло критически важные области, такие как края опухолей и узоры текстуры, обеспечивая модели локализованный пространственный контекст для повышения точности классификации, как показано в уравнении 3.

figure-protocol-6      

В исследовании использовалась операция наложения маски исключительно при подготовке обучающих данных для дополнения знаний о границе поражений в процессе обучения признаков. В отличие от этого, этапы валидации и вывода использовали только оригинальные ультразвуковые изображения без масок, сохраняя традиционный конвейер классификации изображений. Поскольку бинарные маски сегментации в наборе данных BUSI представляли структуры, уже присущие ультразвуковым изображениям, они не вводили новые метки классов. Чтобы предотвратить утечку информации, расследование разделило наборы данных на обучающие, валидационные и тестовые наборы, обеспечивая отсутствие перекрывающихся пар изображений или масок между подмножествами. В результате наложение функционировало как ориентир пространственного внимания, который выделял анатомически значимые области без ущерба независимости оценочных данных.

4. Дополнение данных

В исследовании было внедрено целенаправленное дополнение данных для смягчения дисбаланса классов внутри учебного набора, с акцентом на злокачественные и нормальные меньшинственные классы. Фреймворк использовал широкий спектр трансформаций для искусственного увеличения вариабельности обучающих данных и повышения способности модели обобщать в различных условиях визуализации.

Во-первых, система выполняла горизонтальное флипирование с вероятностью 0,9 (90%), что позволяло модели распознавать признаки независимо от направления сканирования. Это преобразование следовало уравнению 4:

figure-protocol-7      

Во-вторых, в исследовании применялись случайные вращения в диапазоне ±15° для моделирования изменений углов сканирования и положения пациента. Этот процесс заставил модель изучать вращенно-инвариантные признаки, такие как края опухоли и узоры текстуры, как определено в уравнении 5:

figure-protocol-8      

В-третьих, исследователи использовали дрожь цвета для моделирования вариаций освещения, контраста и цветового баланса. Фреймворк регулировал яркость, контраст и насыщенность в 0,2 раза, а оттенок — на 0,1. Эти стохастические корректировки повысили устойчивость модели к изменениям внешнего вида, рассчитанных согласно уравнению 6:

figure-protocol-9      

Выбор этих конкретных диапазонов гиперпараметров (горизонтальный переворот 0,9, вращение +15, -15, яркость/контраст/насыщение 0,2, оттенок 0,1) был получен в результате эмпирической оценки устойчивости. Исследование показало, что эти параметры оптимизируют баланс между генерацией разнообразия и анатомическим реализмом, обеспечивая стабильную сходимость и стабильную точность валидации без индуцирования нереалистичных деформаций поражения.

5. Архитектура моделей

В исследовании использовалась EfficientNet-B0 — современная модель CNN, известная своей эффективностью, масштабируемостью и производительностью по сравнению с другими архитектурами классификации изображений. Эта модель использовала метод пропорционального масштабирования глубины, ширины и разрешения сети, что позволило добиться высокой точности с значительно меньшим числом параметров по сравнению со стандартными архитектурами, такими как ResNet и VGG. Такой подход к масштабированию позволил фреймворку обрабатывать изображения высокого разрешения, оставаясь при этом вычислительно эффективным, соответствуя специфическим потребностям медицинской визуализации. Рисунок 4 иллюстрирует архитектуру EfficientNet-B0, подчёркивая последовательность сверточных и MBConv-блоков, используемых для иерархического извлечения признаков.

figure-protocol-10
Рисунок 4: Архитектура EfficientNet-B0. Схема блоков MBConv и составных коэффициентов масштабирования, используемых для иерархического извлечения признаков. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Для модификации EfficientNet-B0 для задачи по классификации ультразвука молочной железы исследователи внесли специфические корректировки в структуру модели. Система заменила начальный слой классификации, предназначенный для 1000-классового набора данных ImageNet, на полностью связанный (плотный) слой, состоящий из 3 выходных нейронов. В ходе исследования все уровни предварительно обученной основы EfficientNet-B0 были обучаемы и оптимизированы совместно с новым классифицированным слоем, следуя полной стратегии тонкой настройки. В процессе обучения не применялось поэтапное замораживание или постепенное размораживание. Фреймворк проводил обучение с использованием оптимизатора Адама со скоростью обучения 0,00005 и планировщика скорости шага, который снижал скорость в 0,1 раза каждые 7 эпох. Эти нейроны соответствовали трём целевых классам в наборе данных BUSI: доброкачественный, нормальный и злокачественный. Модель использовала активацию SoftMax на выходном слое, преобразуя исходные баллы в вероятностные распределения, как рассчитано в уравнении 7. В таблице 2 приведено описание архитектуры модели.

figure-protocol-11      

Тип слояОписание
Входной слойПринимает изображения размером 224 x 224 x 3
Сверточные слоиВключает начальную свёртку и блоки MBConv для извлечения признаков.
Глобальное среднее пулированиеУменьшает пространственные размеры до одномерного вектора признаков.
Полностью связанный слойОтображает вектор признаков на 3 выходных нейрона (нормальный, доброкачественный, злокачественный).
Активация SoftMaxПреобразует логиты в вероятности для многоклассовой классификации.

Таблица 2: Описание архитектуры модели.

Параметры, использовавшиеся для обучения модели, включали оптимизатор Адама с начальной скоростью обучения 0,00005 и категориальную потерю кросс-энтропии (три класса), математически рассчитанные по уравнению 9. Для инициализации EfficientNet-B0 использовались предварительно обученные веса ImageNet, которые были полностью обучены, а все основные слои были обучены, без применения поэтапной заморозки. Первоначальный классификатор был заменён полностью связанным слоем и тремя выходными нейронами, а затем активацией SoftMax, которая представляла доброкачественные, злокачественные и нормальные классы. Изображения были уменьшены до 224 x 224 пикселей, затем нормализованы по среднему ImageNet и стандартным отклонением и загружались мини-партиями по 8 пикселей. Планировщик шаговой скорости обучения снижал скорость обучения на 0,1 в каждые 7 эпох. Потеря валидации использовалась для раннего прекращения с терпением на 2 эпохи, чтобы избежать переигрывания. Активации Grad-CAM были получены на основе последнего сверточного слоя путём вычисления градиентов, глобального среднего пулирования для получения весов каналов и увеличения карт активации до входного разрешения.

Для подтверждения этой стабильности тренировки повторялись на протяжении нескольких заездов с результатами валидации Matching. Мониторинг кривых потерь при обучении и валидации использовался для выявления переподгонки, а для финальной оценки применялся стратифицированный набор тестов с удержанием, не зависящий от обучения. Разница между производительностью валидации и тестом невелика, что свидетельствует о постоянной сходимости и воспроизводимости оптимизации. Уравнение 10 определяет пошаговый график скорости обучения. Уравнение 15 обозначает два последовательных увеличения потерь валидации, что указывает на возможное перенагон.

figure-protocol-12      

figure-protocol-13      

figure-protocol-14      

figure-protocol-15      

figure-protocol-16      

figure-protocol-17      

figure-protocol-18      

EfficientNet-B0 особенно гибок в задаче классификации УЗИ груди, поскольку архитектура включает несколько инновационных архитектурных аспектов, обеспечивающих эффективность и скорость архитектуры. Центральная часть — MBConv, которая объединяет глубинно разделяемые свёртки с модулями сжатия и возбуждения, обеспечивая меньшую вычислительную сложность без потери точности. Модель также поддерживает масштабирование соединений, которое равномерно масштабирует глубину, ширину и разрешение для достижения оптимальной производительности при всех видах ограничений ресурсов, а модель также является agile для задач, что математически выводится как следующее уравнение 8. Модель уже содержит веса, обученные на наборе данных ImageNet, поэтому её можно передавать для обучения, и в значительной степени модель не требует обучения на небольших медицинских наборах данных. Это сочетание высокоуровневых функций, а также индивидуальной обучающей среды, включающей изменения в финальный слой классификации, использование оптимизатора Адама, планировщика скорости обучения и раннего остановки, обеспечивает высокую точность модели, но при этом вычислительная эффективность. Это сочетание архитектурной изобретательности и подходов к обучению позволит модели эффективно обучаться на основе плохой медицинской визуализации и, следовательно, станет полезным инструментом для классификации ультразвука молочной железы.

Алгоритм 1: Классификация ультразвуковых изображений молочной железы с использованием EfficientNet-B0 и Grad-CAM

Вход: Изображения УЗИ молочной железы.
Выход: Классификация (нормальная, доброкачественная, злокачественная) и тепловые карты Grad-CAM.
1. Предварительная обработка изображений:
Увеличить размер до 224×224224×224.
Нормализуйте с помощью ImageNet mean и std.
Дополняйте переворачивание, вращение и дрожь цвета.
2. Инициализировать модель:
Load EfficientNet-B0 (предварительно обучено, исключает верхний слой).
Добавьте глобальное среднее пулирование и плотный слой (3 нейрона, SoftMax).
3. Модель поезда:
Оптимизатор: Адам (скорость обучения = 0.00005).
Потеря: перекрёстная энтропия.
Тренируйтесь 18 эпох с ранней остановкой (терпение = 2).
4. Визуализация Grad-CAM:
Вычислите градиенты целевого класса.
Генерируйте и накладайте тепловые карты на входные изображения.

Алгоритм обеспечивает рабочий процесс классификации ультразвуковых изображений молочной железы с помощью EfficientNet-B0 и Grad-CAM, включая предобработку, обучение и вывод модели, а также интерпретируемую тепловую карту для клинической валидации.

6. Grad-CAM как объяснимый ИИ

Мощный инструмент, использованный в исследовании, способен добавить интерпретируемость в модель глубокого обучения — отображение активации классов с градиентным взвешиванием. Рассматривая решение текущей острой потребности XAI в клинической визуализации, метод использует Grad-CAM, чтобы клиницисты могли интуитивно понимать процесс принятия решений по модели с помощью визуально объяснимых тепловых карт наиболее значимых областей изображения, используемого для прогнозирования модели. Такое сближение интерпретируемости будет критически важным для построения доверия к системам ИИ, особенно к системам с высокими ставками, такими как здравоохранение, где необходимы подотчётность и прозрачность. На рисунке 5 представлены тепловые карты Grad-CAM, выделяющие области изображения, наиболее влияющие на прогнозы модели для доброкачественных, злокачественных и нормальных случаев.

figure-protocol-19
Рисунок 5: Тепловые карты активации Grad-CAM. (A) Доброкачественные, (B) злокачественные и (C) нормальные случаи. Тёплые цвета (красный) означают высокое диагностическое влияние; Холодные цвета (синий) указывают на меньшее внимание. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Все изображения Grad-CAM отображаются вместе с входным изображением, которое было подано модели. На рисунке 5 показано исходное ультразвуковое изображение и изображение модели-вход, чтобы убедиться, что области близкого внимания напрямую связаны с обработанным входом, учитываемым в прогнозе. Для получения значимости по каналам используется Grad-CAM для вычисления градиентов предсказанного класса с использованием отображений признаков конечного сверточного слоя. Эти градиенты усредняются по всему миру для получения коэффициентов веса, а затем умножаются соответствующими картами признаков для получения тепловой карты локализации (уравнения 16 и 17). Тепловая карта затем увеличивается до входного разрешения и накладывается на изображение ультразвукового изображения, чтобы показать диагностически важные области (например, края опухоли, изменения текстуры и т.д.) на изображении. Эта визуализация даёт пространственное понимание областей, используемых для предсказания в модели. В данной статье измеряется интерпретируемость с помощью визуального анализа локализации внимания. В них не были включены количественные показатели локализации и оценка на основе клинициста, которые по-прежнему являются ценными путями для будущей валидации клинической значимости.

figure-protocol-20      

figure-protocol-21      

Grad-CAM даёт прогнозы о том, как модель работает визуально, выделяя участки изображения, способствовавшие прогнозу. Тепловые карты можно использовать для подтверждения того, что сеть концентрируется на клинически значимых структурах, включая края опухолей и акустические паттерны. При ложных тревогах визуализации помогают заметить внимание на нерелевантных областях, помогая в оценке и оптимизации модели. Такое соответствие между медицинскими признаками и вниманием модели повышает интерпретируемость диагностики с помощью ИИ. На рисунке 6 показана визуализация GradCAM.

figure-protocol-22
Рисунок 6: Визуализация GradCAM. Тепловая карта Grad-CAM, показывающая важные регионы (красный = высокий, синий = низкий) для классификации; Интенсивность цвета указывает на важность признаков. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Grad-CAM добавляется для повышения интерпретируемости модели EfficientNet-B0, выделяя области изображения, которые вносят максимальный вклад в выбор классификации. Полученные тепловые карты показывают клинически значимые структуры краёв опухолей и изменения текстуры, что облегчает чёткий анализ прогнозов модели. Высокая точность классификации и визуальная интерпретируемость делают предложенную структуру более надёжной в анализе ультразвуковых изображений молочной железы.

7. Статистический анализ

Модель оценивается на основе большого набора метрик, таких как точность, как мера точности положительных прогнозов; Вспомнить, как показатель эффективности модели при выявлении всех релевантных случаев; и оценка F1 — гармоническое среднее точности и запоминания, обеспечивающее сбалансированную меру общей производительности, математически рассчитанную согласно уравнениям 18–21.

figure-protocol-23      

figure-protocol-24      

figure-protocol-25      

figure-protocol-26      

Средняя абсолютная ошибка (MAE) количественно определяет среднюю абсолютную разницу между предсказаниями и истинными значениями, математически рассчитанную согласно уравнению 22.

figure-protocol-27      

Ошибка среднего квадрата корня (RMSE) измеряет среднее отклонение предсказаний от истинных значений, математически рассчитанное по уравнению 23.

figure-protocol-28      

Средняя абсолютная ошибка (MAE) количественно определяет среднюю абсолютную разницу между предсказаниями и истинными значениями, математически рассчитанную согласно уравнению 24.

figure-protocol-29      

Матрица путаницы используется для подробного разбивки истинных положительных, истинных отрицательных, ложноположительных и ложноотрицательных по классам, предоставляя дополнительную информацию о том, как модель классифицирует30. Эти показатели оценки в сочетании обеспечивают общую оценку ошибки модели, силы и обобщения на основе ненаблюдаемых данных, что делает их надёжным инструментом для классификации изображений УЗИ молочной железы. Наличие маски поражения в наборе данных BUSI означает, что в будущем можно будет применять количественные показатели локализации, например, пересечение над объединением, для объективной оценки точности объяснения. Стратифицированная валидация с удержанием была выбрана для сохранения независимости между подмножествами обучения и оценки, сохраняя распределение классов. Причиной отказа от перекрёстной валидации стало предотвращение повторяющегося воздействия валидационных образцов в процессе оптимизации, но в будущих исследованиях повторная или вложенная кросс-валидация будет использоваться для дальнейшего определения различий в производительности.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Стандартизация входных размеров до 24 x 224 пикселей и нормализация на основе ImageNet способствовали стабильному поведению обучения и плавной сходимости кривых потерь. Применение операции наложения маски на обучающих образцах значительно повысило видимость границ поражений по сравнению с исходными ультразвуковыми изображениями. Это наблюдение подтвердило гипотезу о том, что анатомически направленное улучшение улучшает разделение признаков. В то время как этап обучения использовал эти на...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Предлагаемая структура использует тонко настроенную архитектуру EfficientNet-B0, интегрированную с градиентно-взвешенным картированием активации классов (Gradient-CAM) для обеспечения высокопроизводительной, интерпретируемой системы для классификации ультразвука молочной железы. Это исследование продвигает научную область, преодолевая разрыв между «чёрным ящиком» моделей глубокого обучения и клинической прозрачностью, демонстрируя, что вычислительная эффективность не обязательно жертвова...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы заявляют, что у них нет конфликта интересов.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы хотели бы выразить искреннюю благодарность своим учреждениям и коллегам за постоянную поддержку и поддержку на протяжении всего этого исследования. Авторы также выражают признательность создателям BUSI Breast Ultrasound Dataset за предоставление общедоступного набора данных, позволивших провести это исследование. Эта работа была поддержана проектом поддержки исследователей Университета принцессы Нурахбинт Абдулрахман (PNURSP2026R432), Университетом принцессы Нуры бинт Абдулрахман, Эр-Рияд, Саудовская Аравия. Авторы выражают благодарность декану по исследованиям и аспирантуре Университета короля Халида за финансирование этой работы через Large Group Research по гранту RGP2/749/46.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Изображения ультразвукового исследования груди (набор данных BUSI)Н/Д780 изображений в формате PNG (487 доброкачественных, 210 злокачественных, 133 нормальных)
MatplotlibРазработчики MatplotlibН/ДВерсия 3.7.1
NumPyРазработчики NumPyН/ДВерсия 1.23.5
Графический процессор NVIDIA Tesla T4NVIDIAН/Д16 ГБ VRAM
OpenCVOpenCV.orgН/ДВерсия 4.7.0
Pillow (PIL)Python Imaging LibraryН/ДВерсия 9.4.0
PythonФонд программного обеспечения PythonН/ДВерсия 3.9.12
PyTorchMeta AIН/ДВерсия 2.0.1+cu117
Scikit-learnРазработчики Scikit-learnН/ДВерсия 1.2.2
SeabornРазработчики SeabornН/ДВерсия 0.12.2
Операционная система UbuntuCanonicalН/Д64-битная

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wilkinson, L., Gathani, T. Understanding breast cancer as a global health concern. Br J Radiol. 95 (1130), 20211033(2021).
  2. Ud din, N. M., Dar, R. A., Rasool, M., Assad, A. Breast cancer detection using deep learning: datasets, methods, and challenges ahead. Comput Biol Med. 149, 106073(2022).
  3. Jin, W., Li, X., Fatehi, M., Hamarneh, G. Guidelines and evaluation of clinical explainable AI in medical image analysis. Med Image Anal. 84, 102684(2023).
  4. Ghasemi, A., Hashtarkhani, S., Schwartz, D. L., Shaban-Nejad, A. Explainable artificial intelligence in breast cancer detection and risk prediction: a systematic scoping review. Cancer Innov. 3 (5), (2024).
  5. Sharafaddini, A. M., Esfahani, K. K., Mansouri, N. Deep learning approaches to detect breast cancer: a comprehensive review. Multimedia tools and applications. 84 (21), 24079-24190 (2025).
  6. Singh, V. K., et al. Breast tumor segmentation in ultrasound images using contextual-information-aware deep adversarial learning framework. Expert Systems with Applications. 162, 113870(2020).
  7. Wani, N. A., Kumar, R., Bedi, J. Harnessing fusion modeling for enhanced breast cancer classification through interpretable artificial intelligence and in-depth explanations. Engineering Applications of Artificial Intelligence. 136, 108939(2024).
  8. Kikani, K., Desai, M., Desai, B. Early Detection and Personalized Risk Assessment of Breast Cancer: An Integrative Review and Comparative Evaluation of AI Models Using Clinical and Imaging Data. Archives of Computational Methods in Engineering. , 1-29 (2025).
  9. Singh, R., Gupta, S., Yamsani, N., Manwal, M., Bansal, G. Automated Breast Cancer Classification using a Custom CNN Architecture on the BUSI Dataset. IEEE Xplore. , 1185-1190 (2025).
  10. Ali, A., et al. Exploring AI approaches for breast cancer detection and diagnosis: A review Article. Breast Cancer: Targets and Therapy. , 927-947 (2025).
  11. Sharafaddini, A. M., Esfahani, K. K., Mansouri, N. Deep learning approaches to detect breast cancer: a comprehensive review. Multimed Tools Appl. , (2024).
  12. Sienicki, K. Comment on the paper titled ‘The origin of quantum mechanical statistics: insights from research on human language’. Preprints. , (2024).
  13. Ahn, J. S., et al. Artificial intelligence in breast cancer diagnosis and personalized medicine. Journal of breast cancer. 26 (5), 405(2023).
  14. Qureshi, S. A., et al. Breast cancer detection using mammography: image processing to deep learning. IEEE Access. , (2024).
  15. Dihmani, H., Bousselham, A., Bouattane, O. A new computer-aided diagnosis system for breast cancer detection from thermograms using metaheuristic algorithms and explainable AI. Algorithms. 17 (10), 462(2024).
  16. Nakach, F. Z., Idri, A., Goceri, E. A comprehensive investigation of multimodal deep learning fusion strategies for breast cancer classification. Artif Intell Rev. 57 (12), 327(2024).
  17. Mondol, R. K. Deep learning based prognosis and explainability for breast cancer. , UNSW Sydney. Doctoral dissertation (2025).
  18. Ayana, G., Ryu, J., Choe, S. Ultrasound-responsive nanocarriers for breast cancer chemotherapy. Micromachines. 13 (9), 1508(2022).
  19. Afrin, H., Larson, N. B., Fatemi, M., Alizad, A. Deep Learning in Different Ultrasound Methods for Breast Cancer, from Diagnosis to Prognosis: Current Trends, Challenges, and an Analysis. Cancers. 15 (12), 3139(2023).
  20. Ayana, G., Ryu, J., Choe, S. Ultrasound-responsive nanocarriers for breast cancer chemotherapy. Micromachines. 13 (9), 1508(2022).
  21. Di Paola, V., et al. Beyond N staging in breast cancer: importance of MRI and ultrasound-based imaging. Cancers. 14 (17), 4270(2022).
  22. Sahu, A., Das, P. K., Meher, S. Efficient deep learning scheme for breast cancer detection using mammogram and ultrasound images. Biomed Signal Process Control. 87, 105377(2024).
  23. Rezazadeh, A., Jafarian, Y., Kord, A. Explainable ensemble machine learning for breast cancer diagnosis using ultrasound texture features. Forecasting. 4 (1), 262-274 (2022).
  24. Raza, A., et al. Deep Breast Cancer Net: a novel deep learning model for ultrasound breast cancer detection. Appl Sci. 13 (4), 2082(2023).
  25. Jabeen, K., et al. Breast cancer classification from ultrasound images using optimal deep learning feature fusion. Sensors. 22 (3), 807(2022).
  26. Ayana, G., Park, J., Jeong, J. W., Choe, S. Multistage transfer learning for ultrasound breast cancer image classification. Diagnostics. 12 (1), 135(2022).
  27. Gupta, S., Agrawal, S., Singh, S. K., Kumar, S. Transfer learning-based model for ultrasound breast cancer classification. Comput Vis Bio-Inspired Comput. , 511-523 (2023).
  28. Kratkiewicz, K., Pattyn, A., Alijabbari, N., Mehrmohammadi, M. Ultrasound and photoacoustic imaging of breast cancer: clinical systems and challenges. J Clin Med. 11 (5), 1165(2022).
  29. Al-Dhabyani, W., Gomaa, M., Khaled, H., Fahmy, A. Dataset of breast ultrasound images. Data Brief. 28, 104863(2020).
  30. R, M. T. Enhancing Diagnostic Accuracy in Breast Ultrasound Imaging through Deep Learning and Image Augmentation Techniques. IEEE ICERCS, , 1-6 (2024).
  31. Balasubramaniam, S., Velmurugan, Y., Jaganathan, D., Dhanasekaran, S. A Modified LeNet CNN for Breast Cancer Diagnosis in Ultrasound Images. Diagnostics. 13 (17), 2746(2023).
  32. Atrey, K., Singh, B. K., Bodhey, N. K. Multimodal classification of breast cancer using feature level fusion of mammogram and ultrasound images in machine learning paradigm. Multimedia Tools and Applications. 83 (7), 21347-21368 (2023).
  33. Vigil, N., et al. Dual-Intended Deep Learning Model for Breast Cancer Diagnosis in Ultrasound Imaging. Cancers. 14 (11), 2663(2022).
  34. Uysal, F., Köse, M. M. Classification of Breast Cancer Ultrasound Images with Deep Learning-Based Models. ASEC 2022, , 8(2022).
  35. Boulenger, A., et al. Deep learning-based system for automatic prediction of triple-negative breast cancer from ultrasound images. Medical & Biological Engineering & Computing. 61 (2), 567-578 (2022).
  36. Işık, G., Paçal, İ Few-shot classification of ultrasound breast cancer images using meta-learning algorithms. Neural Computing and Applications. 36 (20), 12047-12059 (2024).
  37. Liu, H., et al. Artificial Intelligence-Based Breast Cancer Diagnosis Using Ultrasound Images and Grid-Based Deep Feature Generator. International Journal of General Medicine. 15, 2271-2282 (2022).
  38. Zourhri, M., et al. Deep Learning Technique for Classification of Breast Cancer using Ultrasound Images. IEEE IRASET, , (2023).
  39. Taleghamar, H., Jalalifar, S. A., Czarnota, G. J., Sadeghi-Naini, A. Deep learning of quantitative ultrasound multi-parametric images at pre-treatment to predict breast cancer response to chemotherapy. Scientific Reports. 12 (1), (2022).
  40. Sharafaddini, A. M., Esfahani, K. K., Mansouri, N. Deep learning approaches to detect breast cancer: a comprehensive review. Multimed Tools Appl. , (2024).
  41. Al-Dhabyani, W., Gomaa, M., Khaled, H., Fahmy, A. Dataset of breast ultrasound images. Data Brief. 28, 104863(2020).
  42. Mondol, S. S., Hasan, M. K. Enhancing B-mode-based breast cancer diagnosis via cross-attention fusion of H-scan and Nakagami imaging with multi-CAM-QUS-Driven XAI. Physics in Medicine & Biology. 70 (17), 175011(2025).
  43. Shifa, N. Explainable breast cancer detection in mammograms using lightweight EfficientNet-B0 with Grad-CAM and LIME. , Qatar University. (2025).
  44. Haghighat, F., Nemati, Z., Rambodrad, A., Negareshifard, P., Jafari, E. Multimodal deep learning and data fusion in precision breast oncology: clinical Applications, fusion Strategies, and future directions. InfoScience Trends. 2 (10), 81-115 (2025).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Ultrasound ImagesDeep LearningEfficientNet B0Data AugmentationGrad CAMLesion DetectionClinical Diagnosis

Похожие статьи