$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
1. Характеристики наборов данных
В исследовании использовался общедоступный набор данных Breast Ultrasound Images (BUSI), который предоставил хорошо задокументированный репозиторий для анализа и классификации ракамолочной железы 29. Этот набор данных оказался особенно уместным, поскольку включал обширную коллекцию ультразвуковых изображений, необходимых для создания и валидации моделей глубокого обучения для медицинской визуализации. Набор данных включал 780 ультразвуковых изображений, собранных у 600 женщин в возрасте от 25 до 75 лет, представляющих разнообразную группу для диагностики рака груди. Все изображения поддерживали среднее разрешение 500 x 500 пикселей и использовали формат PNG для сохранения высококачественных визуальных данных для анализа. Рисунок 1 иллюстрирует общий рабочий процесс предлагаемого фреймворка, включая предобработку, дополнение, извлечение признаков EfficientNet-B0, классификацию и интерпретацию Grad-CAM.

Рисунок 1: Репрезентативные выборки из набора данных BUSI. (A) Доброкачественные, (B) злокачественные и (C) Нормальные изображения. Панели иллюстрируют морфологическое разнообразие, используемое для обучения. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
2. Экспериментальный рабочий процесс
Для обеспечения воспроизводимости расследование проводило процессуальный конвейер последовательно. Сначала система загружала ультразвуковые изображения BUSI и соответствующие маски для наземной точности и увеличивала их размер до 224×224 пикселей, затем нормализовала ImageNet. Во-вторых, фреймворк наложил на каждое изображение маску, чтобы подчеркнуть области поражения, а затем разделил набор данных на обучение (70%), валидацию (15%) и тестирование (15%) с использованием стратифицированной выборки. В-третьих, исследование применяло целенаправленное усиление, включающее горизонтальное переворачивание, вращение (±15°) и дрожь цвета, преимущественно к меньшинствам. В-четвёртых, исследователи доработали модель EfficientNet-B0, которая была предварительно обучена на ImageNet, заменив последний слой классификации на выходной слой из трёх классов. Процесс обучения использовал оптимизатор Адама (скорость обучения 0,00005), снижение скорости пошагового обучения (γ = 0,1 каждые 7 эпох), потерю перекрёстной энтропии, размер партии 8 и раннюю остановку с терпением 2. Наконец, Grad-CAM сгенерировал тепловые карты внимания с последнего сверточного слоя для визуализации диагностически значимых областей и поддержки клинической интерпретации. Таблица материалов содержит основные наборы данных, программные библиотеки и аппаратные конфигурации, необходимые для воспроизведения классификации и интерпретируемости ультразвуковой системы исследования.
Набор данных BUSI демонстрировал естественный классовый дисбаланс, что часто наблюдается в медицинских наборах данных. Распределение было благоприятно для доброкачественного класса, за которым следовали злокачественные и нормальные случаи. В частности, набор данных содержал 487 доброкачественных, 210 злокачественных и 133 нормальных изображений. Хотя дополнение данных увеличивало вариабельность обучения, оно не изменило основное количество выборок в каждом классе. Такое распределение отражало реальные клинические ситуации, где доброкачественные заболевания встречаются чаще, чем злокачественные опухоли. Хотя такой дисбаланс точно отражал распространённость аномалий молочной железы в клинических условиях, он создавал трудности для обучения глубокому обучению, так как мог привести к предвзятым прогнозам и неоптимальным результатам для меньшинств. В результате смягчение этого дисбаланса стало необходимым для формулирования эффективной и обобщаемой модели, которая эффективно работает во всех диагностических категориях. На рисунке 2 показаны репрезентативные ультразвуковые изображения из набора данных, иллюстрирующие примеры доброкачественных, злокачественных и нормальных образцов тканей молочной железы.

Рисунок 2: Предложенный рабочий процесс модели. Последовательный конвейер от предобработки входных и маск-наложений до обучения EfficientNet-B0 и выхода Grad-CAM. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
3. Предварительная обработка данных
В исследовании были изменены размеры всех изображений до 224 x 224 пикселей, соответствуя стандартным входным размерам архитектуры EfficientNet-B0. Это изменение размера обеспечило согласованность наборов данных и снизило вычислительные требования, как определено в уравнении 1.
Фреймворк нормализовал значения пикселей, используя среднее и стандартное отклонение набора данных ImageNet ([0.485, 0.456, 0.406] для среднего и [0.229, 0.224, 0.225] для std). Эта нормализация масштабировала входные данные для повышения устойчивости обучения и скорости сходимости, рассчитанных согласно уравнению 2.
Для улучшения извлечения признаков и идентификации интересующих областей исследователи наложили оригинальные изображения на соответствующие маски с реальностью. Рисунок 3 иллюстрирует маски от поражения с основной точностью и наложенные на них ультразвуковые изображения, которые подчёркивали границы опухоли.

Рисунок 3: Маска и наложенные изображения. (A) Оригинальное ультразвуковое исследование, (B) маска с правдой основой, и (C) результирующий наложение, подчёркивающее границы опухолей для пространственного внимания. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Это наложение выявляло критически важные области, такие как края опухолей и узоры текстуры, обеспечивая модели локализованный пространственный контекст для повышения точности классификации, как показано в уравнении 3.
В исследовании использовалась операция наложения маски исключительно при подготовке обучающих данных для дополнения знаний о границе поражений в процессе обучения признаков. В отличие от этого, этапы валидации и вывода использовали только оригинальные ультразвуковые изображения без масок, сохраняя традиционный конвейер классификации изображений. Поскольку бинарные маски сегментации в наборе данных BUSI представляли структуры, уже присущие ультразвуковым изображениям, они не вводили новые метки классов. Чтобы предотвратить утечку информации, расследование разделило наборы данных на обучающие, валидационные и тестовые наборы, обеспечивая отсутствие перекрывающихся пар изображений или масок между подмножествами. В результате наложение функционировало как ориентир пространственного внимания, который выделял анатомически значимые области без ущерба независимости оценочных данных.
4. Дополнение данных
В исследовании было внедрено целенаправленное дополнение данных для смягчения дисбаланса классов внутри учебного набора, с акцентом на злокачественные и нормальные меньшинственные классы. Фреймворк использовал широкий спектр трансформаций для искусственного увеличения вариабельности обучающих данных и повышения способности модели обобщать в различных условиях визуализации.
Во-первых, система выполняла горизонтальное флипирование с вероятностью 0,9 (90%), что позволяло модели распознавать признаки независимо от направления сканирования. Это преобразование следовало уравнению 4:
Во-вторых, в исследовании применялись случайные вращения в диапазоне ±15° для моделирования изменений углов сканирования и положения пациента. Этот процесс заставил модель изучать вращенно-инвариантные признаки, такие как края опухоли и узоры текстуры, как определено в уравнении 5:
В-третьих, исследователи использовали дрожь цвета для моделирования вариаций освещения, контраста и цветового баланса. Фреймворк регулировал яркость, контраст и насыщенность в 0,2 раза, а оттенок — на 0,1. Эти стохастические корректировки повысили устойчивость модели к изменениям внешнего вида, рассчитанных согласно уравнению 6:
Выбор этих конкретных диапазонов гиперпараметров (горизонтальный переворот 0,9, вращение +15, -15, яркость/контраст/насыщение 0,2, оттенок 0,1) был получен в результате эмпирической оценки устойчивости. Исследование показало, что эти параметры оптимизируют баланс между генерацией разнообразия и анатомическим реализмом, обеспечивая стабильную сходимость и стабильную точность валидации без индуцирования нереалистичных деформаций поражения.
5. Архитектура моделей
В исследовании использовалась EfficientNet-B0 — современная модель CNN, известная своей эффективностью, масштабируемостью и производительностью по сравнению с другими архитектурами классификации изображений. Эта модель использовала метод пропорционального масштабирования глубины, ширины и разрешения сети, что позволило добиться высокой точности с значительно меньшим числом параметров по сравнению со стандартными архитектурами, такими как ResNet и VGG. Такой подход к масштабированию позволил фреймворку обрабатывать изображения высокого разрешения, оставаясь при этом вычислительно эффективным, соответствуя специфическим потребностям медицинской визуализации. Рисунок 4 иллюстрирует архитектуру EfficientNet-B0, подчёркивая последовательность сверточных и MBConv-блоков, используемых для иерархического извлечения признаков.

Рисунок 4: Архитектура EfficientNet-B0. Схема блоков MBConv и составных коэффициентов масштабирования, используемых для иерархического извлечения признаков. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Для модификации EfficientNet-B0 для задачи по классификации ультразвука молочной железы исследователи внесли специфические корректировки в структуру модели. Система заменила начальный слой классификации, предназначенный для 1000-классового набора данных ImageNet, на полностью связанный (плотный) слой, состоящий из 3 выходных нейронов. В ходе исследования все уровни предварительно обученной основы EfficientNet-B0 были обучаемы и оптимизированы совместно с новым классифицированным слоем, следуя полной стратегии тонкой настройки. В процессе обучения не применялось поэтапное замораживание или постепенное размораживание. Фреймворк проводил обучение с использованием оптимизатора Адама со скоростью обучения 0,00005 и планировщика скорости шага, который снижал скорость в 0,1 раза каждые 7 эпох. Эти нейроны соответствовали трём целевых классам в наборе данных BUSI: доброкачественный, нормальный и злокачественный. Модель использовала активацию SoftMax на выходном слое, преобразуя исходные баллы в вероятностные распределения, как рассчитано в уравнении 7. В таблице 2 приведено описание архитектуры модели.
| Тип слоя | Описание |
| Входной слой | Принимает изображения размером 224 x 224 x 3 |
| Сверточные слои | Включает начальную свёртку и блоки MBConv для извлечения признаков. |
| Глобальное среднее пулирование | Уменьшает пространственные размеры до одномерного вектора признаков. |
| Полностью связанный слой | Отображает вектор признаков на 3 выходных нейрона (нормальный, доброкачественный, злокачественный). |
| Активация SoftMax | Преобразует логиты в вероятности для многоклассовой классификации. |
Таблица 2: Описание архитектуры модели.
Параметры, использовавшиеся для обучения модели, включали оптимизатор Адама с начальной скоростью обучения 0,00005 и категориальную потерю кросс-энтропии (три класса), математически рассчитанные по уравнению 9. Для инициализации EfficientNet-B0 использовались предварительно обученные веса ImageNet, которые были полностью обучены, а все основные слои были обучены, без применения поэтапной заморозки. Первоначальный классификатор был заменён полностью связанным слоем и тремя выходными нейронами, а затем активацией SoftMax, которая представляла доброкачественные, злокачественные и нормальные классы. Изображения были уменьшены до 224 x 224 пикселей, затем нормализованы по среднему ImageNet и стандартным отклонением и загружались мини-партиями по 8 пикселей. Планировщик шаговой скорости обучения снижал скорость обучения на 0,1 в каждые 7 эпох. Потеря валидации использовалась для раннего прекращения с терпением на 2 эпохи, чтобы избежать переигрывания. Активации Grad-CAM были получены на основе последнего сверточного слоя путём вычисления градиентов, глобального среднего пулирования для получения весов каналов и увеличения карт активации до входного разрешения.
Для подтверждения этой стабильности тренировки повторялись на протяжении нескольких заездов с результатами валидации Matching. Мониторинг кривых потерь при обучении и валидации использовался для выявления переподгонки, а для финальной оценки применялся стратифицированный набор тестов с удержанием, не зависящий от обучения. Разница между производительностью валидации и тестом невелика, что свидетельствует о постоянной сходимости и воспроизводимости оптимизации. Уравнение 10 определяет пошаговый график скорости обучения. Уравнение 15 обозначает два последовательных увеличения потерь валидации, что указывает на возможное перенагон.
EfficientNet-B0 особенно гибок в задаче классификации УЗИ груди, поскольку архитектура включает несколько инновационных архитектурных аспектов, обеспечивающих эффективность и скорость архитектуры. Центральная часть — MBConv, которая объединяет глубинно разделяемые свёртки с модулями сжатия и возбуждения, обеспечивая меньшую вычислительную сложность без потери точности. Модель также поддерживает масштабирование соединений, которое равномерно масштабирует глубину, ширину и разрешение для достижения оптимальной производительности при всех видах ограничений ресурсов, а модель также является agile для задач, что математически выводится как следующее уравнение 8. Модель уже содержит веса, обученные на наборе данных ImageNet, поэтому её можно передавать для обучения, и в значительной степени модель не требует обучения на небольших медицинских наборах данных. Это сочетание высокоуровневых функций, а также индивидуальной обучающей среды, включающей изменения в финальный слой классификации, использование оптимизатора Адама, планировщика скорости обучения и раннего остановки, обеспечивает высокую точность модели, но при этом вычислительная эффективность. Это сочетание архитектурной изобретательности и подходов к обучению позволит модели эффективно обучаться на основе плохой медицинской визуализации и, следовательно, станет полезным инструментом для классификации ультразвука молочной железы.
Алгоритм 1: Классификация ультразвуковых изображений молочной железы с использованием EfficientNet-B0 и Grad-CAM
Вход: Изображения УЗИ молочной железы.
Выход: Классификация (нормальная, доброкачественная, злокачественная) и тепловые карты Grad-CAM.
1. Предварительная обработка изображений:
Увеличить размер до 224×224224×224.
Нормализуйте с помощью ImageNet mean и std.
Дополняйте переворачивание, вращение и дрожь цвета.
2. Инициализировать модель:
Load EfficientNet-B0 (предварительно обучено, исключает верхний слой).
Добавьте глобальное среднее пулирование и плотный слой (3 нейрона, SoftMax).
3. Модель поезда:
Оптимизатор: Адам (скорость обучения = 0.00005).
Потеря: перекрёстная энтропия.
Тренируйтесь 18 эпох с ранней остановкой (терпение = 2).
4. Визуализация Grad-CAM:
Вычислите градиенты целевого класса.
Генерируйте и накладайте тепловые карты на входные изображения.
Алгоритм обеспечивает рабочий процесс классификации ультразвуковых изображений молочной железы с помощью EfficientNet-B0 и Grad-CAM, включая предобработку, обучение и вывод модели, а также интерпретируемую тепловую карту для клинической валидации.
6. Grad-CAM как объяснимый ИИ
Мощный инструмент, использованный в исследовании, способен добавить интерпретируемость в модель глубокого обучения — отображение активации классов с градиентным взвешиванием. Рассматривая решение текущей острой потребности XAI в клинической визуализации, метод использует Grad-CAM, чтобы клиницисты могли интуитивно понимать процесс принятия решений по модели с помощью визуально объяснимых тепловых карт наиболее значимых областей изображения, используемого для прогнозирования модели. Такое сближение интерпретируемости будет критически важным для построения доверия к системам ИИ, особенно к системам с высокими ставками, такими как здравоохранение, где необходимы подотчётность и прозрачность. На рисунке 5 представлены тепловые карты Grad-CAM, выделяющие области изображения, наиболее влияющие на прогнозы модели для доброкачественных, злокачественных и нормальных случаев.

Рисунок 5: Тепловые карты активации Grad-CAM. (A) Доброкачественные, (B) злокачественные и (C) нормальные случаи. Тёплые цвета (красный) означают высокое диагностическое влияние; Холодные цвета (синий) указывают на меньшее внимание. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Все изображения Grad-CAM отображаются вместе с входным изображением, которое было подано модели. На рисунке 5 показано исходное ультразвуковое изображение и изображение модели-вход, чтобы убедиться, что области близкого внимания напрямую связаны с обработанным входом, учитываемым в прогнозе. Для получения значимости по каналам используется Grad-CAM для вычисления градиентов предсказанного класса с использованием отображений признаков конечного сверточного слоя. Эти градиенты усредняются по всему миру для получения коэффициентов веса, а затем умножаются соответствующими картами признаков для получения тепловой карты локализации (уравнения 16 и 17). Тепловая карта затем увеличивается до входного разрешения и накладывается на изображение ультразвукового изображения, чтобы показать диагностически важные области (например, края опухоли, изменения текстуры и т.д.) на изображении. Эта визуализация даёт пространственное понимание областей, используемых для предсказания в модели. В данной статье измеряется интерпретируемость с помощью визуального анализа локализации внимания. В них не были включены количественные показатели локализации и оценка на основе клинициста, которые по-прежнему являются ценными путями для будущей валидации клинической значимости.
Grad-CAM даёт прогнозы о том, как модель работает визуально, выделяя участки изображения, способствовавшие прогнозу. Тепловые карты можно использовать для подтверждения того, что сеть концентрируется на клинически значимых структурах, включая края опухолей и акустические паттерны. При ложных тревогах визуализации помогают заметить внимание на нерелевантных областях, помогая в оценке и оптимизации модели. Такое соответствие между медицинскими признаками и вниманием модели повышает интерпретируемость диагностики с помощью ИИ. На рисунке 6 показана визуализация GradCAM.

Рисунок 6: Визуализация GradCAM. Тепловая карта Grad-CAM, показывающая важные регионы (красный = высокий, синий = низкий) для классификации; Интенсивность цвета указывает на важность признаков. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Grad-CAM добавляется для повышения интерпретируемости модели EfficientNet-B0, выделяя области изображения, которые вносят максимальный вклад в выбор классификации. Полученные тепловые карты показывают клинически значимые структуры краёв опухолей и изменения текстуры, что облегчает чёткий анализ прогнозов модели. Высокая точность классификации и визуальная интерпретируемость делают предложенную структуру более надёжной в анализе ультразвуковых изображений молочной железы.
7. Статистический анализ
Модель оценивается на основе большого набора метрик, таких как точность, как мера точности положительных прогнозов; Вспомнить, как показатель эффективности модели при выявлении всех релевантных случаев; и оценка F1 — гармоническое среднее точности и запоминания, обеспечивающее сбалансированную меру общей производительности, математически рассчитанную согласно уравнениям 18–21.
Средняя абсолютная ошибка (MAE) количественно определяет среднюю абсолютную разницу между предсказаниями и истинными значениями, математически рассчитанную согласно уравнению 22.
Ошибка среднего квадрата корня (RMSE) измеряет среднее отклонение предсказаний от истинных значений, математически рассчитанное по уравнению 23.
Средняя абсолютная ошибка (MAE) количественно определяет среднюю абсолютную разницу между предсказаниями и истинными значениями, математически рассчитанную согласно уравнению 24.
Матрица путаницы используется для подробного разбивки истинных положительных, истинных отрицательных, ложноположительных и ложноотрицательных по классам, предоставляя дополнительную информацию о том, как модель классифицирует30. Эти показатели оценки в сочетании обеспечивают общую оценку ошибки модели, силы и обобщения на основе ненаблюдаемых данных, что делает их надёжным инструментом для классификации изображений УЗИ молочной железы. Наличие маски поражения в наборе данных BUSI означает, что в будущем можно будет применять количественные показатели локализации, например, пересечение над объединением, для объективной оценки точности объяснения. Стратифицированная валидация с удержанием была выбрана для сохранения независимости между подмножествами обучения и оценки, сохраняя распределение классов. Причиной отказа от перекрёстной валидации стало предотвращение повторяющегося воздействия валидационных образцов в процессе оптимизации, но в будущих исследованиях повторная или вложенная кросс-валидация будет использоваться для дальнейшего определения различий в производительности.