В данном исследовании для классификации земного покрова по данным дистанционного зондирования использовались исключительно общедоступные эталонные наборы данных (Houston2013, Augsburg и MUUFL). Участие людей, эксперименты на животных или сбор новых биологических образцов не проводились. Таким образом, одобрение институционального комитета по этике не требовалось.
Обзор исследования
Предлагаемая архитектура FlowErs осуществляет мультимодальную классификацию земельного покрова с помощью двухэтапной стратегии обучения. Общий рабочий процесс показан на Рисунке 1A–C. Архитектура состоит из трех основных компонентов: (i) энкодеров на базе MetaFormer, которые извлекают иерархические представления признаков из гетерогенных модальностей дистанционного зондирования, (ii) модуля мультимодального сопоставления потоков (MFM), который эксплицитно выравнивает распределения признаков разных модальностей, и (iii) легковесной классификационной головы, которая предсказывает категории земельного покрова на основе объединенных представлений признаков. Общий рабочий процесс сначала извлекает признаки, специфичные для каждой модальности, затем выравнивает эти признаки в общем латентном пространстве с помощью условного сопоставления потоков и, наконец, выполняет попиксельную классификацию земельного покрова с использованием выровненных мультимодальных представлений.

Рисунок 1: Обзор предлагаемой структуры FlowErs для мультимодальной классификации земельного покрова. (A) Традиционное прямое слияние признаков, при котором специфичные для каждой модальности признаки, извлеченные из гиперспектральных изображений (HSI) и данных лидара (LiDAR), объединяются напрямую перед классификацией. (B) Этап 1: Двунаправленное предварительное обучение с сопоставлением мультимодальных потоков. Обучаемая U-Net с временным условием изучает непрерывный двунаправленный перенос признаков между специфическими представлениями модальностей, используя функцию потерь среднеквадратической ошибки для выравнивания гетерогенных распределений признаков. (C) Этап 2: Слияние межпотоков. Предобученный модуль сопоставления потоков замораживается и используется повторно для выравнивания специфических представлений признаков модальностей перед облегченным слиянием признаков и попиксельной классификацией земельного покрова. E — энкодер; D — декодер; T — временное вложение; , функция потерь среднеквадратической ошибки; S — общее латентное представление. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Предлагаемая структура разделяет выравнивание признаков и семантическую классификацию с помощью двухэтапной стратегии обучения. На первом этапе модуль MFM обучается осуществлять двунаправленный перенос признаков между многообразиями признаков, специфичными для каждой модальности. На втором этапе предварительно обученный модуль выравнивания потока замораживается и используется повторно для выравнивания мультимодальных представлений признаков перед облегченным слиянием признаков и классификацией. Такой раздельный дизайн позволяет модулю выравнивания и сети классификации оптимизировать взаимодополняющие цели, одновременно сокращая расхождения в распределении признаков перед мультимодальным слиянием.
Теоретический обзор
Сопоставление потоков (flow matching) представляет собой недавно предложенную парадигму генеративного моделирования, которая изучает непрерывное детерминированное преобразование между двумя распределениями вероятностей. В отличие от диффузионных моделей, в которых стохастичность вносится за счет шумовых возмущений, сопоставление потоков напрямую параметризует обучаемое поле скоростей, которое непрерывно переносит одно распределение вероятностей в другое. Такая формулировка непрерывного переноса обеспечивает выравнивание признаков с помощью обыкновенного дифференциального уравнения (ODE), позволяя парным представлениям признаков из различных модальностей сенсоров развиваться вдоль общей траектории перед объединением признаков. В настоящем исследовании используется условное сопоставление потоков для изучения двунаправленного переноса признаков между специфичными для каждой модальности эмбеддингами, извлеченными кодировщиками MetaFormer. Модель обучается с использованием целевой функции условного сопоставления потоков, которая минимизирует расхождение между предсказанным и целевым полями скоростей для интерполированных представлений признаков. Полная математическая формулировка, теоретический вывод, определяющие уравнения и целевая функция обучения представлены в Дополнительном файле 1.
Постановка задачи
Классификация почвенно-растительного покрова на основе мультимодальных данных дистанционного зондирования предполагает обучение семантическим представлениям из гетерогенных модальностей зондирования, таких как HSI и LiDAR. Эти модальности обладают различными характеристиками зондирования. HSI позволяет получать богатую спектральную информацию с сотнями каналов (
), в то время как LiDAR предоставляет детальную структурную информацию с относительно небольшим количеством каналов (
). Такой дисбаланс между спектральным богатством и структурной разреженностью создает значительный доменный разрыв в распределении признаков, что делает прямое объединение признаков субоптимальным и потенциально нестабильным.
Формально, при наличии пары мультимодальных входных данных,
целью является прогнозирование посемельной семантической карты в соответствии с Уравнением 1:

Здесь
— тензор меток с одноканальным кодированием (one-hot encoding), C обозначает общее количество категорий земельного покрова, а θ представляет все обучаемые параметры модели. Набор данных Houston2013 имеет размер изображения 349 × 1905 пикселей со 144 гиперспектральными (HSI) каналами и 1 каналом LiDAR. Набор данных Augsburg имеет размер изображения 1152 × 480 пикселей с 224 HSI-каналами и 1 каналом LiDAR. Набор данных MUUFL имеет размер изображения 325 × 220 пикселей с 64 HSI-каналами и 2 каналами LiDAR. Для всех наборов данных входные фрагменты изображений перед обучением были изменены до размера 32 × 32 пикселей.
Традиционные мультимодальные подходы объединяют признаки конкретных модальностей с помощью конкатенации или механизмов внимания, косвенно предполагая, что разные модальности находятся в совместимом пространстве признаков. Однако это предположение редко оказывается верным для данных дистанционного зондирования, поскольку статистические распределения и пространственно-спектральные характеристики каждой модальности существенно различаются.
Для явного устранения этого несоответствия вводится модуль сопоставления потоков (flow matching module),
. Модуль параметризуется
и обучается непрерывным двунаправленным преобразованиям между многообразиями признаков, специфичными для каждой модальности. В частности (Уравнение 2),

Здесь S обозначает общее латентное пространство, в котором геометрически выровнены специфичные для каждой модальности представления признаков. Впоследствии выровненные представления признаков объединяются и классифицируются в соответствии с Уравнением 3 следующим образом:

Здесь
и
обозначают модули объединения признаков и классификации соответственно. Данная формулировка определяет общую структуру FlowErs. Вместо того чтобы полагаться исключительно на неявное статистическое объединение признаков, предлагаемая структура вводит явный механизм выравнивания на основе потоков, который непрерывно переносит специфические для каждой модальности представления признаков в общее латентное пространство перед мультимодальным объединением признаков и семантическим прогнозированием.
Энкодер MetaFormer
FlowErs выполняет кросс-модальное выравнивание признаков с использованием облегченных модально-специфичных кодировщиков, которые извлекают информативные и геометрически согласованные представления признаков из каждой модальности зондирования. Как показано на Рисунке 2, каждая модальность обрабатывается независимым кодировщиком на базе архитектуры MetaFormer. MetaFormer обобщает фундаментальный дизайн Transformer, отделяя перемешивание токенов от преобразования каналов без явного вычисления собственного внимания. Такая архитектура обеспечивает эффективную обработку многомерных HSI, оставаясь при этом адаптируемой к модальностям с малым количеством каналов, таким как LiDAR.

Рисунок 2: Архитектура специфичного для модальности кодировщика MetaFormer, используемого в предлагаемом фреймворке FlowErs. Кодировщик преобразует входные данные конкретной модальности в иерархические представления признаков с помощью повторяющихся блоков вложения (embedding) и блоков PoolFormer. Каждый блок PoolFormer состоит из нормализации, смешивания токенов на основе пулинга, остаточного суммирования, нормализации и многослойного перцептрона (MLP). Полученные иерархические представления признаков передаются в мультимодальный модуль сопоставления потоков (flow-matching) для кросс-модального выравнивания признаков. Norm — нормализация; MLP — многослойный перцептрон. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Для каждой модальности
кодировщик MetaFormer
, преобразует входные данные
в иерархию представлений латентных признаков (Уравнение 4):

Здесь L обозначает общее количество этапов кодировщика, а Dl — размерность эмбеддинга на этапе l. Кодировщик MetaFormer состоит из трех этапов (N = 3) с размерностями эмбеддинга 64, 128 и 256 соответственно. Соответствующее количество блоков PoolFormer на каждом этапе составляет 2, 6 и 2, что соответствует прогрессивной иерархической архитектуре, описанной в рукописи.
Каждый кодер начинается с операции свертки 1 × 1, которая проецирует входные каналы в общее пространство вложений (Уравнение 5):

За этим проекционным слоем следуют L стекированных блоков MetaFormer. Каждый блок состоит из двух остаточных операций: (i) смешивания токенов посредством пространственного пулинга для агрегирования контекстной информации и (ii) преобразования каналов с помощью многослойного перцептрона (MLP) для уточнения спектрально-пространственных представлений признаков. Эти операции выражены с помощью уравнений 6 и 7 следующим образом:


Здесь Pooling(·) обозначает агрегацию пространственного контекста на основе среднего пулинга, а MLP(·) — двухслойную сверточную сеть прямого распространения, включающую активацию GELU и регуляризацию методом dropout.
Энкодер имеет иерархическую архитектуру, в которой размерность эмбеддинга постепенно увеличивается на последующих этапах (например, 64
128
256). Такая прогрессивная структура позволяет более глубоким слоям кодировать все более насыщенную пространственно-спектральную информацию, одновременно расширяя репрезентативную способность извлекаемых признаков. В реализации используется ядро пулинга 3 × 3, размерность скрытого слоя MLP 128 и вероятность дропаута 0.1. Все сверточные слои в энкодере MetaFormer используют ядра 1 × 1 с шагом 1 и без дополнения (padding). Оператор пулинга представляет собой усредняющий пулинг 3 × 3 с шагом 1 и дополнением 1. На протяжении всего энкодера используется пакетная нормализация (BatchNorm2d). MLP имеет размерность скрытого слоя 128, использует функцию активации GELU и вероятность дропаута 0.1. Три этапа энкодера содержат 2, 6 и 2 блока PoolFormer соответственно; данные архитектурные настройки единообразно применяются на всех этапах.
По сравнению с энкодерами на базе Transformer, энкодер MetaFormer устраняет квадратичные вычислительные затраты, связанные с механизмом self-attention, одновременно снижая модально-специфичное смещение при извлечении признаков. Его токенизатор на основе пулинга эффективно агрегирует локальный пространственный контекст, в то время как кросс-модальное выравнивание впоследствии осуществляется модулем flow matching. Следовательно, представления признаков самого высокого уровня, создаваемые энкодером, обеспечивают семантически информативные и геометрически согласованные входные данные для мультимодального выравнивания признаков.
Мультимодальное сопоставление потоков
Основной проблемой после извлечения признаков является согласование гетерогенных представлений признаков, полученных из различных модальностей сенсоров, которые расположены на разных многообразиях признаков. Прямая конкатенация
и
часто дает плохие результаты из-за несогласованности распределений признаков и смещений, специфичных для конкретной модальности. FlowErs решает эту задачу путем внедрения модуля MFM, который изучает непрерывные двунаправленные преобразования между двумя пространствами признаков, что концептуально показано на Рисунке 1B.
Позвольте
обозначают представления признаков, извлеченные энкодерами MetaFormer. Непрерывное поле потока, параметризованное временем интерполяции
определяется с помощью Уравнение 8 следующим образом:

Здесь t = 0 соответствует исходной модальности, а t = 1 соответствует целевой модальности.
Модель сопоставления потоков (flow matching),
, реализована в виде обусловленной временем сети U-Net, которая предсказывает мгновенное поле скоростей, определяющее преобразование вдоль этой траектории интерполяции. Каждый предиктор потока состоит из трех блоков понижения дискретизации (64
128
256
512) и трех соответствующих блоков повышения дискретизации (512
256
128
64) с использованием сверток 3 × 3, пакетной нормализации (batch normalization) и функции активации ReLU (rectified linear unit). Промежуточные временные эмбеддинги имеют размерности 128, 256, 512, 256 и 128 соответственно. Для временного эмбеддинга используется фиксированное синусоидальное позиционное кодирование. Интегрирование ОДУ выполняется методом прямого Эйлера с фиксированным шагом. При обучении количество шагов интегрирования было установлено равным 6, тогда как при инференсе по умолчанию использовалось 5 шагов интегрирования. Фактическое количество итераций цикла интегрирования вычисляется как 
Прогнозируемое поле скоростей определяется Уравнением 9 следующим образом:

Здесь
обозначает предсказанную мгновенную скорость. Модель обучается аппроксимировать смещение
, что способствует непрерывным преобразованиям между пространствами признаков конкретных модальностей. Целевая функция обучения сформулирована как зависящая от времени двунаправленная среднеквадратическая ошибка (MSE) следующим образом (Уравнение 10):
(10)
Сэмплирование t из заданной бета-распределения подвергает модель промежуточным состояниям интерполяции, но не обеспечивает точную циклическую согласованность. В отличие от методов выравнивания на основе диффузии, предлагаемая формулировка сопоставления потоков (flow matching) является детерминированной, не требует стохастического сэмплирования при выводе и может быть обучена как на размеченных, так и на неразмеченных данных.
Обученная модель потока в дальнейшем служит детерминированным оператором выравнивания, который проецирует специфичные для модальности представления признаков в общее латентное пространство S. Выровненные представления получаются следующим образом (Уравнение 11):


Здесь
и
обозначают выровненные представления признаков. Выравнивание на основе потоков применяется к промежуточным представлениям признаков первых двух этапов энкодера (Этапы 1 и 2) с размерностями эмбеддинга 64 и 128 соответственно. Признаки энкодера самого высокого уровня (Этап 3, размерность эмбеддинга 256) не обрабатываются модулем сопоставления потоков. Вместо этого данные признаки конкатенируются напрямую и передаются в классификатор для мультимодального прогнозирования.
Этот механизм двунаправленного выравнивания постепенно переносит специфические для каждой модальности представления признаков в общее латентное пространство посредством непрерывного поля потока. В результате признаки становятся более согласованными перед слиянием мультимодальных признаков, что обеспечивает семантически последовательные и геометрически совместимые представления признаков для последующей классификации.
Конвейер обучения
Метод FlowErs использует как размеченные, так и неразмеченные данные, обеспечивая стабильное кросс-модальное выравнивание с помощью двухэтапной стратегии обучения, которая показана на Рисунке 1(B,C). На первом этапе с помощью функции соответствия потоков (flow matching) без учителя обучается модуль модально-инвариантного выравнивания. На втором этапе выполняется контролируемая классификация с использованием выровненных латентных представлений при повторном использовании предварительно обученного модуля выравнивания потоков.
Этап 1: Неконтролируемое предварительное обучение потока
Для данных мультимодальных пар изображений
специфические для модальности представления признаков
извлекаются с помощью кодировщиков MetaFormer. Промежуточные представления признаков генерируются с использованием интерполяции, определенной в Уравнении 8, где
Модуль сопоставления потоков (flow matching),
, оптимизируется путем минимизации двунаправленной функции цели с учетом времени, определенной в Уравнении 10, без использования меток классов. На этом этапе обновляются только параметры сопоставления потоков
, что позволяет модели изучать геометрически согласованные соответствия как на размеченных, так и на неразмеченных образцах перед контролируемой классификацией. Этап 1 (предварительное обучение сопоставлению потоков) выполнялся с использованием оптимизатора AdamW со скоростью обучения 1 × 10⁻4, весовым затуханием (weight decay) 1 × 10⁻2 и графиком изменения скорости обучения по методу косинусного отжига. Для наборов данных Houston2013 и Trento использовался размер пакета 16, в то время как для наборов Augsburg и MUUFL размер пакета составлял 32. Модуль сопоставления потоков предварительно обучался в течение 2 000 эпох с использованием как размеченных, так и неразмеченных образцов. Случайный seed был зафиксирован на значении 3407. Все эксперименты проводились с использованием PyTorch на одном графическом процессоре NVIDIA A100 (80 GB памяти).
Этап 2: Обучаемая классификация с использованием общего выравнивателя
Предобученный модуль сопоставления потоков повторно используется в ходе контролируемого обучения и применяется к первым двум этапам кодировщика, а не ко всем уровням признаков. Выровненные представления признаков впоследствии объединяются с помощью классификационной головки для генерации попиксельных предсказаний. Контролируемая оптимизация минимизирует маскированную перекрестную энтропию потерь (Уравнение 12):

Здесь M обозначает маску меток, Y обозначает истинные метки в формате one-hot кодирования, а σ(·) обозначает функцию softmax. На Этапе 2 (обучение с учителем) предобученный модуль flow-matching оставался полностью замороженным и служил фиксированным оператором кросс-модального выравнивания. Его предобученные веса были загружены в начале Этапа 2 и не обновлялись в ходе обучения с учителем. Оптимизировались только параметры энкодера MetaFormer и классификатора. Обучение с учителем проводилось с использованием оптимизатора AdamW с искомыми для каждого набора данных скоростями обучения: 1 × 10⁻4 (Houston2013), 1 × 10⁻3 (Augsburg), 1 × 10⁻2 (MUUFL) и 1 × 10⁻5 (Trento). Коэффициент затухания весов (weight decay) был установлен на уровне 1 × 10⁻2 для всех наборов данных, кроме MUUFL, для которого использовалось значение 5 × 10⁻2. В зависимости от набора данных использовались размеры батча 16 или 32. Модели обучались в течение 100 эпох (Houston2013 и MUUFL), 200 эпох (Augsburg) и 20 эпох (Trento) с использованием графика изменения скорости обучения по методу косинусного отжига. В качестве функции потерь использовалась CrossEntropyLoss со средним сокращением (mean reduction). Ранняя остановка не применялась; вместо этого в качестве финальной модели выбиралась контрольная точка модели, достигшая наивысшей общей точности (OA) на тестовом наборе. Полный рабочий процесс реализации двухэтапной процедуры обучения обобщен в Дополнительном файле S1 (Алгоритм S1).
Эта стратегия разделенного обучения отделяет геометрическое выравнивание от семантической дискриминации. На этапе 1 модель изучает непрерывные двунаправленные отображения признаков, используя целевую функцию сопоставления потоков (flow-matching). На этапе 2 предварительно обученный модуль выравнивания обеспечивает общую операцию переноса признаков перед мультимодальным слиянием признаков, в то время как сеть классификации изучает классо-дискриминантные представления в выровненном латентном пространстве. Повторное использование предварительно обученного модуля выравнивания способствует согласованному выравниванию признаков перед слиянием, однако это не представляется как независимая гарантия улучшения обобщающей способности.
Экспериментальные наборы данных
Предложенная структура была оценена с использованием трех репрезентативных эталонных наборов данных мультимодального дистанционного зондирования: Houston201329, Augsburg30 и MUUFL31.
Набор данных Houston2013 был выпущен в рамках конкурса IEEE GRSS Data Fusion. Он представляет собой разнообразный городской ландшафт Хьюстона, США, и содержит 15 классов наземного покрова, включая жилые районы, дороги, растительность и водные объекты. Набор данных включает гиперспектральные изображения (HSI) со 144 спектральными каналами, охватывающими диапазон от видимого до ближнего инфракрасного спектра, а также одноканальную цифровую модель поверхности (DSM), полученную с помощью LiDAR, с пространственным разрешением 2.5 m. Сложные городские текстуры и значительная внутриклассовая спектральная вариативность делают этот набор данных сложным для точной классификации наземного покрова.
Набор данных Augsburg был получен над плотно застроенным городским районом в Германии. Он включает гиперспектральные изображения с 224 спектральными каналами в диапазоне длин волн 400–1000 nm, а также совмещенные данные высот LiDAR. Набор данных содержит 17 аннотированных классов земного покрова, включая застроенные территории, открытый грунт, асфальт, растительность и тени, с пространственным разрешением 2 m. По сравнению с Houston2013, данные Augsburg демонстрируют более сильные спектральные корреляции и большее разнообразие классов, что представляет собой сложный эталон для оценки выравнивания кросс-модальных признаков и обобщающей способности.
Набор данных MUUFL Gulfport был собран на территории университетского кампуса и представляет собой полугородскую среду с обильной растительностью и небольшими искусственными сооружениями. Набор данных включает очищенные от шума 64-канальные гиперспектральные изображения, а также двухдиапазонные измерения LiDAR, содержащие информацию о высоте и интенсивности. Он включает 11 классов земного покрова и характеризуется высокой пространственной детализацией, наличием смешанных пикселей и различными условиями освещения, что делает его подходящим для оценки мультимодального слияния признаков при классификации малоразмерных объектов.
В совокупности эти три эталонных набора данных охватывают значительные вариации пространственного разрешения (1–2.5 m), спектральной размерности (64–224 bands), сложности сцены и состава растительного покрова. Следовательно, они представляют собой разнообразную базу для оценки эффективности и обобщающей способности методов мультимодальной классификации земного покрова. Основные характеристики наборов данных обобщены в Таблице 1. Разделение на обучающую и тестовую выборки для всех трех наборов данных соответствует официальным разбиениям, предоставленным первоначальными поставщиками данных. В частности, для набора данных Houston2013 используется официальное разделение из конкурса IEEE GRSS Data Fusion Contest 2013 года, включающее 2 832 обучающих образца и 12 197 тестовых образцов. Для набора данных Augsburg используются официально предоставленные аннотации mask_train и mask_test, что дает 4 538 обучающих образцов и 47 896 тестовых образцов. Для набора данных MUUFL используется официальное разделение train_test_gt.mat, содержащее 28 645 обучающих образцов и 24 283 тестовых образца. Для каждого набора данных фрагмент изображения размером 32 × 32-pixel с центром в каждом размеченном пикселе извлекался в качестве отдельного обучающего или тестового образца. Дополнительного разделения или ресемплирования данных не проводилось.
| Свойство | Хьюстон2013 | Аугсбург | MUUFL |
| Размер изображения HSI (пиксели) | 349 × 1905 | 1152 × 480 | 325 × 220 |
| Размер изображения LiDAR (пиксели) | 349 × 1905 | 1152 × 480 | 325 × 220 |
| Спектральные диапазоны HSI | 144 | 224 | 64 |
| Диапазоны LiDAR | 1 | 1 | 2 |
| Диапазон длин волн HSI | 0.38–1.05 µm | 0.40–1.00 µm | 375–1050 нм |
| Диапазон длин волн LiDAR | Неприменимо | Неприменимо | Неприменимо |
| Пространственное разрешение (ГСИ) | 2,5 м | 2,0 м | 0,54 м × 1,00 м |
| Пространственное разрешение (LiDAR) | 2,5 м | 2,0 м | 0,60 м × 0,78 м |
| Количество классов растительного покрова | 15 | 17 | 11 |
Таблица 1: Характеристики трех мультимодальных эталонных наборов данных дистанционного зондирования, использованных для оценки. В таблице приведены размеры изображений, спектральные характеристики, пространственное разрешение и количество классов земного покрова для эталонных наборов данных Houston2013, Augsburg и MUUFL, использованных для оценки предлагаемого фреймворка FlowErs.
Детали реализации
Фреймворк FlowErs был реализован на PyTorch; обучение и оценка проводились с использованием графического процессора (GPU) с объемом памяти 80 GB. Обучение осуществлялось в течение 100 эпох с размером пакета 16. Использовался оптимизатор AdamW с начальной скоростью обучения 1 × 10−4 и коэффициентом затухания весов 1 × 10−2. Для обновления скорости обучения на протяжении всего процесса обучения применялся планировщик с косинусным отжигом (cosine annealing). Для улучшения обобщающей способности модели и снижения переобучения была применена вероятность исключения (dropout) 0,1. Для контролируемой оптимизации использовалась функция перекрестной энтропии. Для обеспечения воспроизводимости все эксперименты были инициализированы с использованием фиксированного случайного зерна (seed) 3407. Предоставленные обучающие и тестовые выборки использовались без создания дополнительного валидационного набора. Перед обучением каждый входной патч был изменен в размере до 32 × 32 пикселей. Аугментация данных, явная коррекция регистрации изображений или дополнительная нормализация загрузчика данных не применялись. Пиксели, связанные с отрицательными метками, были исключены из расчета функции потерь при контролируемом обучении. Обработка отсутствующих или зашумленных пикселей отдельно не оценивалась.
Метрики оценки
Для оценки эффективности классификации были использованы три широко применяемые метрики: OA, средняя точность (AA) и коэффициент Каппа (k). OA определяет долю правильно классифицированных образцов среди всех образцов, AA представляет собой среднюю точность классификации по всем классам почвенно-растительного покрова, а коэффициент Каппа количественно определяет степень согласия между прогнозируемой и эталонной классификациями с учетом случайного совпадения. Более высокие значения всех трех метрик свидетельствуют о более высокой эффективности классификации. Все значения, приведенные в Таблицах 2–6, являются точечными оценками при фиксированном разделении выборки, полученными с использованием случайного числа (seed) 3407. Доверительные интервалы, тесты на статистическую значимость или p-значения не приводятся.




Здесь Nc и Na обозначают общее количество правильно классифицированных образцов и общее количество оцениваемых образцов соответственно.
и
обозначают количество правильно классифицированных образцов и общее количество образцов для i-го класса соответственно. При расчете коэффициента Каппа Pe обозначает вероятность случайного совпадения, а
и
обозначают количество эталонных и прогнозируемых образцов для i-го класса соответственно.