Сравнение с базовыми методами
Для оценки фреймворка RareCode в качестве базовых методов были выбраны несколько репрезентативных методов UAD, охватывающих методы на основе реконструкции (CAE32, VAE12, SAE33, MAE34, PatchSAE35), реконструкцию с дополненной памятью (MemAE36), дистилляцию знаний (STFPM37), генерацию синтетических аномалий (DRAEM38) и извлечение предварительно обученных признаков (PatchCore18). Выбор базовых методов был сосредоточен на подходах, которые могут быть обучены или применены при сопоставимых вычислительных затратах и предположениях о данных (доступ только к неразмеченным нормальным обучающим образцам), что гарантирует, что различия в производительности отражают методологический вклад, а не разницу в масштабе данных для предварительного обучения. Для обеспечения справедливого сравнения все методы оценивались с использованием одних и тех же 5-кратных разделений данных, конвейера предобработки, метрик оценки и вычислительной среды. Модели обучались в соответствии с одним и тем же протоколом UAD, используя только нормальные обучающие образцы, при этом гиперпараметры и пороги выбирались на валидационном наборе, а окончательная производительность оценивалась только на отдельном тестовом наборе. В Таблице 1 обобщены результаты 5-кратной кросс-валидации, а на Рисунке 5 представлены сравнения на многомерных лепестковых диаграммах.
Как показано в Таблице 1 и на Рисунке 5, RareCode обеспечивает высокую эффективность детектирования и статистическую стабильность на наборе данных CRC. С точки зрения AUC, RareCode (96,82 ± 0,23%) превосходит несколько базовых моделей, основанных на реконструкции, включая MemAE (94,97 ± 0,81%). Статистический анализ подтверждает, что RareCode превосходит все базовые модели на основе реконструкции (парные t-критерии, p < 0,05), при этом улучшение по сравнению с MemAE достигает статистической значимости (p < 0,01). RareCode демонстрирует низкую вариативность показателей (стандартное отклонение 0,23%), что указывает на стабильность при перекрестной проверке. Ограниченная эффективность DRAEM, основанного на синтетических аномалиях, вероятно, отражает тот факт, что простые стратегии наложения текстур не могут адекватно имитировать сложные патологические атипии.
Что касается специфичности, RareCode достигает 58.24 ± 5.99%, превосходя все сравниваемые методы в снижении частоты ложноположительных результатов. Это представляет собой улучшение примерно на 25 процентных пунктов по сравнению с базовым уровнем только реконструкции (NoCAR, 33.76%), что демонстрирует вклад механизма CAR в снижение количества ложноположительных срабатываний. Более низкая специфичность STFPM и PatchCore, которые полагаются на признаки, предобученные на естественных изображениях, может частично отражать разрыв в доменах между естественными и гистопатологическими изображениями. Примечательно, что STFPM и DRAEM демонстрируют высокую вариативность специфичности (±33.53% и ±7.09%), при этом специфичность для каждого фолда варьируется от почти нулевого до умеренного уровня, что вызывает опасения относительно надежности их применения.
Эффективность детектирования по классам
Анализ по классам проводился путем раздельного сравнения образцов с раком и воспалением с нормальными образцами (Таблица 2). RareCode продемонстрировал более высокую эффективность при детектировании рака (AUC = 99.44 ± 0.12%, полнота = 98.13 ± 0.29%, специфичность = 94.21 ± 2.22%), чем при детектировании воспаления (AUC = 94.30 ± 0.44%, полнота = 96.55 ± 0.78%, специфичность = 60.44 ± 4.34%). Эти результаты позволяют предположить, что RareCode может обеспечивать более выраженную дискриминацию злокачественных новообразований, чем воспалительных изменений, в то время как граница между воспалением и нормой, по-видимому, вносит существенный вклад в снижение общей специфичности.
Абляционное исследование
Для изучения вклада ключевых компонентов структуры RareCode были проведены абляционные эксперименты по оценке влияния механизма CAR и модуля MHC на эффективность детектирования. Результаты подробно представлены в Таблице 3. Как показано на Рисунке 6A, добавление CAR к базовой модели, использующей только реконструкцию, повысило AUC с 92,81% до 95,92%, а многомасштабное слияние кодовых книг (codebook fusion) привело к дальнейшему увеличению AUC до 96,82%. На Рисунке 6B видно, что CAR также повысил специфичность, увеличив ее с 33,76% в базовой модели NoCAR до 58,24% в полной модели FourScales. Эти результаты подтверждают взаимодополняющую значимость редкости активации кодовых книг и многомасштабного слияния.
Кроме того, было проведено исследование влияния сложности декодера (абляция) с использованием конфигурации FourScales. Как показано в Таблице 3, вариант с комплексным декодером, содержащим многомасштабные блоки глубинной свертки и модули внимания сверточного блока (CBAM), продемонстрировал более низкое значение AUC по сравнению с базовой моделью FourScales (95,17 ± 0,44% против 96,82 ± 0,23%). Этот результат говорит о том, что в рамках данной настройки RareCode на базе VQ-AE увеличение мощности декодера не привело к улучшению эффективности обнаружения аномалий и может снизить эффективность представления с ограниченным кодовым словарем.
Иерархический анализ пространственного отклика
Для изучения пространственных откликов, генерируемых RareCode, ошибки реконструкции на уровне патчей и карты редкости кодовой книги были агрегированы на уровне изображений и сравнены между нормальными и аномальными образцами. Для количественной оценки разделения откликов на уровне изображений использовались отношение энергии, d Коэна и AUC. Подробные результаты представлены в Таблице 4, на Рисунке 7 и Рисунке 8.
Результаты показывают, что показатели редкости кодовой книги на всех масштабах демонстрируют повышение отклика на аномальных образцах (отношение энергии > 1). Кодовые книги меньшей емкости (Codebook 64) обеспечивают более сильную дискриминацию на уровне локализации (AUC 78,79%), что согласуется с ожиданием того, что более высокие степени сжатия способствуют изучению более абстрактных прототипных паттернов, которые более чувствительны к отклонениям от архетипов нормальной ткани. Одна только ошибка реконструкции обеспечивает значительную способность к выявлению аномалий (AUC 93,31%), в то время как показатели CAR дают дополнительные сигналы из измерения семантической частоты.
Качественный анализ Рисунка 7 показал, что повышенный отклик в образцах рака совпадал с наличием неправильных и скученных желез, увеличением ядер, гиперхромией, псевдостратификацией и потерей полярности эпителия. В воспалительных образцах более сильный отклик наблюдался вокруг деформированных крипт и плотных инфильтратов воспалительных клеток. Кодовые книги меньшей емкости имели тенденцию к захвату более широких архитектурных отклонений, тогда как кодовые книги большей емкости давали более локализованные ответы на клеточном уровне. Эти результаты обеспечивают качественную морфологическую интерпретацию, но не являются валидацией на уровне пикселей.
Анализ параметров слияния
Вес слияния α балансирует вклад ошибки пространственной реконструкции и показателя CAR в итоговый показатель аномалий. Оптимальные значения α для каждого фолда были определены с помощью поиска по сетке (шаг 0.05) на валидационных наборах; результаты представлены в Таблице 5 и Рисунке 9. Оптимальные значения α в основном сосредоточены в диапазоне 0.85-0.95 при среднем значении 0.90 ± 0.05. При оптимальных конфигурациях модель достигает среднего значения AUC 96.82 ± 0.23% на тестовых наборах. Более высокие оптимальные веса (приблизительно 0.90) указывают на то, что показатели CAR вносят больший вклад в окончательное детектирование, чем ошибка реконструкции, в то время как ошибка реконструкции обеспечивает дополнительные локальные ограничения. По сравнению с настройкой α = 0 в анализе чувствительности (AUC = 93.29%), выбранная на этапе валидации настройка слияния улучшила AUC примерно на 3.53 процентных пункта.
Подводя итог, в данной работе представлен фреймворк RareCode для обучения без учителя при детектировании аномалий на гистопатологических изображениях, целью которого является смягчение проблемы тождественного отображения (identity-mapping), характерной для традиционных генеративных моделей. Механизм CAR снижает чрезмерную зависимость от ошибок реконструкции на уровне пикселей, в то время как модуль MHC обеспечивает иерархические представления признаков на различных уровнях детализации, что позволяет осуществлять взаимодополняющую дискриминацию аномалий на разных уровнях абстракции. Эксперименты на наборе данных CRC демонстрируют, что RareCode достигает значения AUC 96,82%, при этом анализ по классам показывает эффективное детектирование рака (AUC = 99,44%) и более сильную дискриминацию рака по сравнению с воспалением, что указывает на то, что перекрытие признаков воспаления и нормы остается основной проблемой. Исследования с абляционным анализом подтверждают, что интеграция дискретных семантических признаков VQ с многомасштабными морфологическими представлениями тканей повышает эффективность детектирования. Высокая полнота (recall = 98,40%) и умеренная специфичность (58,24%) RareCode указывают на его потенциал в качестве инструмента предварительного скрининга для приоритизации подозрительных гистопатологических изображений; однако его реальное влияние на рабочую нагрузку патологоанатомов потребует проспективной оценки рабочего процесса.
Доступность данных:
Набор данных гистопатологических изображений CRC, использованный в данном исследовании, был получен из больницы Шэньчжэня (Shenzhen People's Hospital) при наличии одобрения институционального комитета по этике (номер одобрения LL-KY-2025300-01). В связи с соблюдением конфиденциальности пациентов и политикой учреждения по обмену данными, набор данных не находится в открытом доступе. Доступ может быть предоставлен по обоснованному запросу к автору, ответственному за переписку, при условии одобрения институтом и заключения соглашений об использовании данных. Исходный код платформы RareCode доступен в открытом доступе по адресу https://github.com/XL-alg/RareCode.

Рисунок 1Общая архитектура и поток данных платформы RareCode. A 512 × 512 H&Гистопатологическое изображение, окрашенное гематоксилином и эозином, разделено на 32 неперекрывающихся × 32 и 64 × 64 патча в качестве входных данных с мелким и крупным масштабом. Две ветви кодируют патчи в латентные эмбеддинги, применяют дискретизацию с использованием многомасштабного иерархического кодового словаря (MHC) и реконструируют патчи для вычисления показателей ошибки реконструкции. Параллельно механизм редкости активации кодового словаря (CAR) оценивает семантическую редкость на основе профилей частоты активации кодового словаря, полученных при обучении на нормальных образцах. Затем нормализованные показатели реконструкции и CAR объединяются для генерации итогового показателя аномальности на уровне изображения, в то время как отклики на уровне патчей проецируются обратно на плоскость изображения для иерархической локализации. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 2: Механизм многомасштабного векторного квантования. (A) Вычисление расстояния между выходными признаками энкодера и векторами вложения книги кодов. (B) Выбор ближайшего соседа и взвешенное слияние по книгам кодов с емкостью 64, 128, 256 и 512. (C) Реконструкция из квантованных признаков с помощью транспонированного сверточного декодера. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 3: Механизм оценки CAR. На данном рисунке проиллюстрированы четыре этапа: Этап 1: статистика частоты активации вычисляется исключительно на нормальных обучающих выборках. Этап 2: тестовые образцы получают индексы активации и расстояния с помощью кодировщика и векторного квантования. Этап 3: показатели редкости и показатели расстояния вычисляются на основе профилей частоты обучающего набора. Этап 4: показатели из каждой шкалы кодовых книг объединяются с помощью обучаемых весов для получения итогового показателя CAR. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 4Состав набора данных по КРР и протокол эксперимента. (A–C) Репрезентативный H&Гистопатологические изображения нормальной ткани толстой кишки, колоректального рака и воспаления толстой кишки, окрашенные гематоксилином и эозином. (D) Протокол 5-кратной перекрестной проверки для UAD, в котором нормальные образцы использовались для обучения и валидации, а отдельные нормальные и аномальные образцы — для тестирования. Изображения были оцифрованы при 40-кратном увеличении и разделены на патчи размером 32 x 32 и 64 x 64 пикселя. Зеленый, светло-зеленый и оранжевый цвета обозначают обучающую, валидационную и тестовую выборки соответственно. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 5: Радарная диаграмма многометрического сравнения методов обнаружения аномалий. Радарная диаграмма, сравнивающая RareCode с базовыми методами по показателям AUC, средней точности (AP), F1-меры, точности (precision), полноты (recall) и точности при полноте 90% (P@R90). Все значения представляют собой среднюю производительность по результатам 5-кратной перекрестной проверки. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

Рисунок 6: Анализ инкрементального вклада компонентов исследования абляции. (A) Сравнение показателей AUC, демонстрирующее постепенное улучшение от базового варианта с использованием только реконструкции (NoCAR) до конфигураций с одним кодовым словарем и многомасштабных конфигураций. (B) Сравнение показателей специфичности, демонстрирующее влияние механизма CAR на снижение количества ложноположительных результатов. Все планки погрешностей представляют собой стандартное отклонение (SD) при 5-кратной перекрестной проверке. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 7: Тепловые карты иерархической локализации многомасштабного кодового словаря. Представлены репрезентативные примеры для образцов (A) нормы, (B) рака и (C) воспаления. Каждый ряд включает исходное изображение, наложение, карту ошибки реконструкции, карты показателей редкости из кодовых словарей разной емкости (64, 128, 256 и 512) и итоговую совмещенную карту локализации. Кодовые словари меньшей емкости выделяют крупнозернистые паттерны за счет более сильной компрессионной абстракции, в то время как кодовые словари большей емкости сохраняют более тонкие структурные детали. Области с высоким откликом качественно соответствуют гистопатологическим признакам рака или воспаления, однако они не были валидированы с помощью экспертных аннотаций на уровне пикселей. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 8: Гистограммы распределения различных типов показателей. На гистограммах представлено сравнение распределения показателей для нормальных и аномальных образцов для (A) ошибки реконструкции, (B) комбинированного показателя CAR, (C) Codebook 64, (D) Codebook 128, (E) Codebook 256 и (F) Codebook 512. Зеленые и красные гистограммы соответствуют нормальным и аномальным образцам соответственно. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

Рисунок 9: Анализ чувствительности параметра альфа. (A) AUC валидационного набора, использованный для выбора α. (B) AUC тестового набора при различных значениях α. Выбранные по валидационному набору значения α варьировались от 0.85 до 0.95 со средним значением 0.90 ± 0.05, что согласуется с Таблицей 5. Вариация AUC оставалась ниже 0.5% при изменении α в диапазоне [0.70, 1.00], что указывает на стабильную эффективность в широком диапазоне параметров. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
| Метод | AUC (%) | AP (%) | F1 (%) | Точность (%) | Полнота (%) | Специфичность (%) | P@R90 (%) |
| CAE | 90.37 ± 0.94 | 98.62 ± 0.18 | 95.34 ± 0.15 | 91.64 ± 0.40 | 99.35 ± 0.22 | 28.14 ± 3.88 | 95.66 ± 0.32 |
| SAE | 90.58 ± 0.94 | 98.66 ± 0.18 | 95.34 ± 0.15 | 91.67 ± 0.40 | 99.32 ± 0.24 | 28.46 ± 3.97 | 95.71 ± 0.30 |
| VAE | 93.60 ± 0.82 | 99.13 ± 0.12 | 95.86 ± 0.19 | 92.81 ± 0.49 | 99.12 ± 0.29 | 39.07 ± 4.70 | 96.94 ± 0.43 |
| MAE | 91.65 ± 2.75 | 98.76 ± 0.50 | 95.61 ± 0.60 | 92.87 ± 1.56 | 98.55 ± 0.55 | 39.74 ± 14.32 | 96.55 ± 0.97 |
| MemAE | 94.97 ± 0.81 | 99.35 ± 0.11 | 95.78 ± 0.33 | 92.82 ± 1.07 | 98.95 ± 0.60 | 39.15 ± 9.99 | 97.57 ± 0.33 |
| PatchSAE | 94.86 ± 0.36 | 99.34 ± 0.05 | 95.39 ± 0.13 | 92.32 ± 0.27 | 98.67 ± 0.12 | 34.91 ± 2.57 | 98.13 ± 0.24 |
| STFPM | 90.23 ± 3.05 | 98.70 ± 0.44 | 94.32 ± 0.21 | 91.90 ± 3.51 | 97.14 ± 3.38 | 29.82 ± 33.53 | 95.93 ± 1.96 |
| DRAEM | 76.34 ± 2.82 | 95.34 ± 0.90 | 94.19 ± 0.07 | 89.39 ± 0.65 | 99.56 ± 0.65 | 6.19 ± 7.09 | 92.69 ± 0.57 |
| PatchCore | 74.64 ± 1.82 | 94.76 ± 0.55 | 94.73 ± 0.05 | 90.52 ± 0.15 | 99.36 ± 0.12 | 17.49 ± 1.54 | 92.54 ± 0.15 |
| RareCode | 96.82 ± 0.23 | 99.59 ± 0.03 | 96.63 ± 0.15 | 94.93 ± 0.67 | 98.40 ± 0.48 | 58.24 ± 5.99 | 98.80 ± 0.10 |
Таблица 1: Результаты сравнения с базовыми методами (5-кратная перекрестная проверка). Эффективность обнаружения RareCode и девяти базовых методов UAD на наборе данных CRC. Метрики включают AUC, среднюю точность (AP), полноту, специфичность, F1-меру, точность при полноте 90% (P@R90) и точность. Все значения представляют собой среднее значение ± SD по результатам 5-кратной перекрестной проверки. Жирным шрифтом выделены лучшие показатели для каждой метрики.
| Категория | AUC (%) | AP (%) | F1 (%) | Полнота (%) | Специфичность (%) |
| Рак | 99.44 ± 0.12 | 99.86 ± 0.03 | 98.34 ± 0.17 | 98.13 ± 0.29 | 94.21 ± 2.22 |
| Воспаление | 94.30 ± 0.44 | 98.48 ± 0.12 | 93.44 ± 0.29 | 96.55 ± 0.78 | 60.44 ± 4.34 |
Таблица 2: Эффективность детектирования по классам для различных подтипов аномалий. Отдельная оценка эффективности детектирования RareCode для образцов с раком и воспалением по сравнению с нормальными образцами. Метрики по классам, включая AUC, AP, F1-score, полноту (recall) и специфичность, были рассчитаны с использованием оптимальных пороговых значений для каждого класса.
| Вариант | Конфигурация кодовой книги | CAR (химерный антигенный рецептор) | AUC (%) | АП (%) | F1 (%) | Специфичность (%) | P@R90 (%) |
| NoCAR |  |  | 92.81 ± 0.12 | 99.05 ± 0.02 | 95.30 ± 0.08 | 33.76 ± 3.82 | 96.72 ± 0.12 |
| Единый кодовый словарь | [256] |  | 95.92 ± 0.40 | 99.47 ± 0.05 | 96.25 ± 0.14 | 55.37 ± 6.51 | 98.31 ± 0.43 |
| Две шкалы | [128, 512] |  | 96.57 ± 0.27 | 99.56 ± 0.04 | 96.45 ± 0.12 | 57.75 ± 4.14 | 98.75 ± 0.12 |
| ThreeScales | [128, 256, 512] |  | 96.36 ± 0.37 | 99.53 ± 0.05 | 96.52 ± 0.17 | 57.99 ± 4.65 | 98.60 ± 0.23 |
| FourScales | [64, 128, 256, 512] |  | 96.82 ± 0.23 | 99.59 ± 0.03 | 96.63 ± 0.15 | 58.24 ± 5.99 | 98.80 ± 0.10 |
| FourScales + комплексный декодер | [64, 128, 256, 512] |  | 95.17 ± 0.44 | 99.39 ± 0.06 | 95.32 ± 0.20 | 53.83 ± 21.45 | 98.40 ± 0.37 |
Таблица 3: Результаты анализа вклада компонентов (абляционного исследования). Сравнение эффективности конфигураций RareCode при последовательном добавлении компонентов: базовый вариант только с реконструкцией (NoCAR), CAR с одним кодовым словарем (SingleCodebook) и многомасштабные конфигурации (TwoScales, ThreeScales, FourScales). Также включен дополнительный анализ влияния сложности декодера с использованием конфигурации FourScales. Метрики включают AUC, среднюю точность (AP), F1-меру, специфичность и точность при полноте 90% (P@R90).
| Тип оценки | Коэффициент энергии | d Коэна | AUC (%) |
| Ошибка реконструкции | 2.623 | 2.006 | 93.31 |
| Комбинированный CAR | 1.078 | 1.002 | 74.85 |
| Codebook 64 | 1.109 | 1.207 | 78.79 |
| Codebook 128 | 1.085 | 1.067 | 76.19 |
| Codebook 256 | 1.065 | 0.916 | 72.80 |
| Codebook 512 | 1.064 | 0.833 | 70.38 |
Таблица 4: Анализ ответов на уровне изображений, полученных на основе локализации. Среднеизображенческая ошибка реконструкции и ответы на редкость книги кодов сравнивались между нормальными и аномальными образцами с использованием отношения энергии, d-коэфициента Коэна и AUC.
| Складывание | Оптимальный α | Val AUC (%) | Тестовая AUC (%) |
| 1 | 0.95 | 96.22 | 96.91 |
| 2 | 0.9 | 96.38 | 96.39 |
| 3 | 0.85 | 96.71 | 96.82 |
| 4 | 0.85 | 96.22 | 96.93 |
| 5 | 0.95 | 96.72 | 97.05 |
| Среднее значение | 0.90 ± 0.05 | 96.45 ± 0.23 | 96.82 ± 0.23 |
Таблица 5: Оптимальные значения альфа по всем фолдам. Оптимальный вес слияния альфа, определенный с помощью сеточного поиска (шаг 0,05) на валидационных наборах для каждого фолда перекрестной проверки, со статистикой среднего значения и стандартного отклонения (SD).