$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
В этом исследовании не проводились прямые эксперименты на людях или животных. Вся работа проводилась с использованием общедоступного, анонимизированного LC25000 гистопатологических изображений, которые не содержали идентифицируемой информации о пациентах или прямом обращении с человеческими тканями. Одобрение Институционального контрольного совета (IRB) или Институционального комитета по уходу и использованию животных (IACUC) не требовалось. Все процедуры соответствовали этическим стандартам и соответствовали условиям использования набора данных для академических исследований. На рисунке 2 показаны шаги диаграммы рабочего процесса.

Рисунок 2: Рабочий процесс предлагаемого метода. Рабочий процесс включает предварительную обработку данных, дополнение, обучение моделей и оценку. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Описание набора данных
Для этого исследования был использован LC25000 набор данных. Он состоял из 25 000 гистопатологических изображений, все они были равномерно оформлены в формате JPEG с разрешением 768 × 768 пикселей. Набор данных основан на первоначальном наборе из 1250 оригинальных изображений, включая 250 изображений доброкачественной ткани лёгких, 250 аденокарцином лёгких, 250 плоскоклеточных карцином, 250 изображений доброкачественной ткани толстой кишки и 250 аденокарцином толстой кишки. Оставшиеся изображения были созданы путём расширения данных для расширения набора данных, обеспечивая разнообразную и обширную коллекцию для надёжного обучения и валидации моделей.
Изображения высокого разрешения позволяли детально изучать клеточные структуры, что было крайне важно для точной классификации рака. Дополнение данных было необходимо из-за ограниченного количества оригинальных изображений; Для синтетического увеличения размера и разнообразия наборов данных применялись такие методы, как вращения, флипы, зумы и сдвиги (Zoom) и сдвиг. Этот процесс сгенерировал дополнительно 23 750 синтетических изображений в сбалансированном порядке класса, в результате чего был получен окончательный набор из 25 000 изображений, каждый из которых содержал 5 000 изображений после дополнения.
Предварительная обработка данных
Исходные гистопатологические изображения в наборе данных имели разрешение 768 × 768 пикселей. Для обеспечения совместимости с архитектурой EfficientNetB7 и максимизации вычислительной эффективности каждое изображение было изменено с 768 × 768 до 224 × 224 пикселей. Этот процесс изменения размера представлял собой компромисс между сохранением основных гистологических признаков и уменьшением вычислительных затрат. Операция изменения размера была математически представлена, как показано в
Уравнение 1:
(1)
где X обозначал исходное изображение, Xresize — это изображение с измененным размером, а h и w — желаемой высотой и шириной соответственно. Все значения пикселей нормализовались в диапазоне от 0 до 1, что стабилизировало и ускорило обучение, обеспечивая равномерное распределение входов между изображениями. Эта нормализация была математически рассчитана, как показано в уравнении 2. Этот шаг был необходим для улучшения сближения моделей во время обучения.
(2)
Дополнение данных было использовано как критически важный метод для повышения надёжности и применимости моделей глубокого обучения, особенно в контексте медицинской визуализации с ограниченными и несбалансированными наборами данных. В этом исследовании были применены различные методы дополнения с использованием модуля ImageDataGenerator от TensorFlow для моделирования in vivo вариаций гистопатологических изображений. Эти методы включали случайные вращения до 20 градусов для имитации вариабельности ориентации тканей, горизонтальные и вертикальные сдвиги до 20% от размеров изображения для имитации вариабельности положения во время подготовки слайда и случайные зумы до 20% для отражения вариабельности уровней увеличения.
Кроме того, был выполнен горизонтальный флиппинг для введения зеркальных вариаций, что дополнительно обогатило обучающий набор данных. Для управления новыми синтезированными пикселями, сгенерированными в ходе этих преобразований, была принята стратегия заполнения ближайших соседей для обеспечения плавных переходов и сохранения целостности ключевых гистологических признаков. Двумерная матрица вращения, используемая для увеличения, представлена в уравнении 3, а уравнение 4 определяет функцию с инкрементальным изменением:
(3)
(4)
Эти методы дополнения компенсировали такие проблемы, как классовый дисбаланс, незначительные гистологические вариации и ограничения наборов данных, позволяя модели изучать инвариантные признаки и снижая риск переподгонки. Синтетически расширяя набор данных и включая контролируемую вариабельность, дополнение данных значительно повысило способность модели обобщать на новые, невидимые данные, тем самым создав более прочную и надёжную систему для клинического применения в диагностике рака лёгких и толстой кишки.
Архитектура модели
Модель была разработана на основе архитектуры EfficientNetB7 — современной сети глубокого обучения, известной своей производительностью, масштабируемостью и результативностью в задачах классификации изображений. EfficientNetB7 был построен с использованием серии блоков Mobile Inverted Bottleneck Convolution (MBConv), которые включали глубинно разделяемые свёртки. Такая структурная конструкция эффективно сжала модель, что привело к значительному сокращению количества параметров с минимальными потерями производительности. Такое новшество позволило модели достигать высокой точности при меньших вычислительных затратах, что делает её особенно удобной для вычислительных приложений, таких как анализ гистопатологических изображений. На рисунке 3 показана архитектура модели предварительно обученного EfficientNetB7.

Рисунок 3: Архитектура модели EfficientNetB7. На рисунке показана детальная структура модели EfficientNetB7, иллюстрирующе её основные слои и функциональные блоки, используемые для классификации изображений. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Модель принимала предварительно обработанные гистопатологические изображения, которые были изменены с исходных размеров 768 × 768 пикселей до 224 × 224 пикселей, чтобы соответствовать требованиям входа EfficientNetB7. Каждое изображение проходило через несколько процессов внутри сети, включая пакетную нормализацию, функции активации Swish и операции свёртки. Пакетная нормализация была рассчитана, как показано в уравнении 5. Функция активации Swish ввела нелинейность и позволила более быстрое и эффективное обучение по сравнению с традиционными функциями, такими как ReLU. Эти слои были разработаны для извлечения и улучшения иерархических признаков, позволяя модели постепенно обучаться от низкоуровневых до высокоуровневых паттернов по мере распространения изображений по сети.
(5)
Сверточная основа EfficientNetB7, предварительно обученная на наборе данных ImageNet, обеспечивала высоко обобщённый набор детекторов признаков, эффективных в широком спектре областей изображений. Предварительно обученная база сыграла ключевую роль в фиксации тонких, но информативных закономерностей в гистопатологических изображениях, которые часто характеризуются высокой внутриклассовой вариабельностью и мелкозернистыми чертами. Выход из сверточных слоёв передавался в глобальный средний пулинговый слой, который уменьшал пространственные измерения до одного вектора признаков для каждого изображения. Этот вектор, инкапсулирующий наиболее релевантные признаки, изученные сверточными слоями, затем был сжат в одномерный массив для совместимости с полностью связными слоями. Алгоритм усиленного обнаружения рака лёгких и толстой кишки представлен в дополнительном файле 1.
Последующая архитектура сети включала два плотных (полностью соединённых) слоя с 128 и 64 единицами соответственно. Оба слоя использовали функцию активации Rectified Linear Unit (ReLU) для добавления дополнительной нелинейности и тонкой настройки извлечённых признаков, что позволило модели распознавать более точные закономерности и отношения в данных. Последний слой модели представлял собой выходной слой SoftMax с пятью нейронами, каждый из которых представлял один из пяти классов в наборе данных. Функция SoftMax создавала вероятностное распределение между классами, отражающее прогноз модели для каждого входного изображения, как описано в уравнении 6:
(6)
Сочетание передовых сверточных методов, надёжной регуляризации и эффективных стратегий оптимизации привело к созданию модели глубокого обучения, хорошо подходящей для классификации медицинских изображений с высокими ставками. Модель достигла точности, масштабируемости и операционной эффективности, демонстрируя высокий потенциал клинического применения в диагностике рака лёгких и толстой кишки. В рамках этой системы регуляризация в основном осуществлялась за счёт продвинутого расширения данных и использования ранней остановки; На плотные слои не применялось явное выпадение или затухание веса.
Обучение и валидация
Конвейер валидации и предварительного обучения сверточной нейронной сети (CNN) для классификации LC25000 гистопатологических изображений был разработан для оптимизации производительности модели и обеспечения хорошей обобщённости. Конвейер начался с комплексной предварительной обработки, которая включала сокращение исходных 768 × 768-пиксельных изображений до 224 × 224 пикселей, чтобы соответствовать требованиям входа архитектуры EfficientNetB7. Интенсивность пикселей нормализовалась до диапазона [0, 1] для стабилизации и ускорения тренировки, а для добавления вариативности и снижения перенагонов применялись методы увеличения данных, включая случайные вращения, сдвиги, масштабирование и горизонтальные перевороты. Эти операции предварительной обработки обеспечивали изучение инвариантных признаков и эффективное обобщение для новых данных.
Модель EfficientNetB7, предварительно обученная на наборе данных ImageNet, использовалась в качестве основы, обеспечивая надёжный набор детекторов признаков, способный выявлять тонкие гистологические закономерности. Модель была впоследствии доработана двумя плотными слоями (128 и 64 единицы), активируемыми функцией Rectified Linear Unit (ReLU), а затем выходным слоем SoftMax для классификации по пяти классам. Эта архитектура была оптимизирована как для точности, так и для вычислительной эффективности, что делает её отлично подходящей для анализа медицинских изображений. Правило обновления оптимизатора Адама для θ показано в уравнении 7.
(7)
Обучение модели проводилось партиями по 128 изображений с использованием оптимизатора Адама, который адаптивно масштабировал скорость обучения для обеспечения эффективной сходимости. Был реализован ранний критерий остановки для мониторинга потерь валидации и остановки обучения при отсутствии улучшения, что предотвращало переподгонку и оптимизировало вычислительные ресурсы. В ходе обучения ключевые показатели производительности — включая точность, потери, точность и отзыв — отслеживались с помощью набора валидации, составляющего 20% данных. Этот набор предоставил критически важные данные о возможностях обобщения модели и снизил риск перенаправки с невидимыми данными.
Интеграция современных стратегий предварительной обработки, расширения данных и оптимизации привела к отличной точности и надёжности моделей, демонстрируя значительный потенциал клинического применения в выявлении рака лёгких и толстой кишки. Все эксперименты проводились на видеокарте NVIDIA Tesla P100 с 16 ГБ оперативной памяти и 64 ГБ системной оперативной памяти. Полный обучающий конвейер — включая предобработку, дополнение и оптимизацию модели — занял примерно три часа для завершения десяти эпох с размером партии 128. Эта вычислительная инфраструктура была выбрана для эффективного управления большим дополненным набором данных при сохранении разумных сроков обучения, подходящих для клинических исследований.
Для воспроизводимости все критические гиперпараметры были явно указаны. Модель была обучена с помощью оптимизатора Адама с постоянной скоростью обучения 0,001. Тренировки проводились максимум 10 эпох, с ранней остановкой на основе потери валидации и терпения трёх эпох для предотвращения переоснащения. Для обучающего и валидационного этапов использовался объём партии 128 экземпляров. Для обеспечения единообразных результатов случайный seed был установлен на 42 на всех этапах загрузки данных и обучения модели. Во время обучения не применялось график снижения скорости обучения.
Протокол сочетал систематическую предобработку, хорошо откалиброванные гиперпараметры, строгие схемы валидации и открытую вычислительную среду для повышения точности и воспроизводимости. Рабочий процесс, объединяя надёжную архитектуру глубокого обучения, эффективную оптимизацию и воспроизводимый экспериментальный проект, заложил прочную основу для классификации гистопатологических изображений. Помимо демонстрации высокой эффективности в выявлении рака легких и толстой кишки, протокол определил масштабируемую структуру, которую можно было бы расширить на аналогичные задачи биомедицинской визуализации в будущих исследованиях.
В ходе разработки модели были внесены различные практические корактировки для достижения надёжных и воспроизводимых результатов. Ранние остановки и расширенное дополнение данных использовались для устранения дисбаланса классов и перенастройки. Высокое использование памяти во время обучения было снижено за счёт изменения размера изображений до 224 × 224 пикселей и использования пакетного размера 128. При медленной сходимости скорость обучения эмпирически устанавливалась на 0,001. Ручная проверка структуры каталога изображений проводилась для предотвращения ошибок при загрузке данных, а случайные посевы исправлялись для обеспечения воспроизводимости. Эти стратегии могут служить практическим руководством для исследователей, сталкивающихся с аналогичными трудностями при обучении моделей глубокого обучения на больших гистопатологических наборах изображений.
Статистический анализ
Статистическое моделирование эффективности модели проводилось с использованием комплексного набора метрик для оценки точности, стабильности и обобщаемости. Ключевые показатели оценки включали точность, воспоминание, результат F1 и точность для количественной оценки эффективности классификации. Матрица путаницы использовалась для отчёта классовых метрик ошибок, рассчитанных согласно уравнениям 8-10:
(8)
(9)
(10)
Кроме того, для оценки точности предсказания оценивались такие показатели ошибки, как средняя квадратична ошибка (MSE), корневой средний квадрат ошибки (RMSE) и средняя абсолютная ошибка (MAE), рассчитанные с использованием уравнений 11-13:
(11)
(12)
(13)
Для оценки способности модели различать классы на различных порогах использовались кривая операционной характеристики приёмника (ROC) и площадь под кривой (AUC). AUC был рассчитан как показано в уравнении 14:
(14)
Эти статистические анализы предоставили тщательную оценку эффективности классификации модели, устойчивости и обобщения на невидимые данные.
Исследование абляции
Для дальнейшей оценки вклада каждого компонента в систему классификации было проведено абляционное исследование с выборочным исключением или изменением отдельных архитектурных элементов окончательной модели. В частности, были оценены две альтернативные экспериментальные конфигурации: одна конфигурация включала слои глобального среднего пула и плоскость, за которыми следовали два плотных слоя (соответственно 128 и 64 единицы); другая конфигурация отсутствовала как слой Flatten, так и плотный слой из 128 единиц, оставив только слой глобального среднего пулирования и один слой плотности на 64 единицы.
Полная архитектура, как показано в основных результатах, достигла точности валидации примерно 96%. Когда слой Flatten был исключён, и после глобального среднего пулирования использовались только плотные слои с плотностью 128 и 64 единицы, точность валидации снизилась до 81,6%. Наоборот, когда плотный слой в 128 единиц был исключён и слой Flatten сохранялся, точность валидации снижалась до 88%. Эти результаты показали необходимость включения как сверхплотного слоя, так и соответствующих архитектурных компонентов для достижения оптимальных характеристик классификации. Результаты абляционных экспериментов последовательно показывали, что сочетание глобального среднего пулирования, плоскости и двух полностью связанных слоёв позволяет более выразительно представлять признаки, что приводит к более надёжной и точной гистопатологической классификации изображений.