$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Предлагаемая методология
В данном исследовании предлагается генеративная система на базе ИИ для выявления COVID-19 по сигналам кашля. Фреймворк интегрирует генеративные модели с дискриминативными классификаторами, при этом данные обучения и оценки строго разделяются. Рисунок 1 иллюстрирует подробную архитектуру предлагаемого фреймворка GAN–VAE–ADCNN, показывая поток от аудиопредобработки и извлечения признаков через обучение латентным представлениям с помощью вариационного автоэнкодера (VAE), синтетическую генерацию признаков с помощью генеративной состязательной сети (GAN) и окончательную классификацию с помощью глубоких сверточных нейронных сетей (DCNN) и DCNN на основе внимания (ADCNN). На рисунке видно, что генеративные компоненты используются только во время обучения, тогда как классификация выполняется с помощью дискриминативных моделей.

Рисунок 1: Обзор архитектуры GAN–VAE–ADCNN. Схема предлагаемого гибридного конвейера, где акустические особенности, полученные от кашля, кодируются с помощью VAE, дополняются генерацией синтетических образцов на основе GAN и классифицируются с использованием моделей DCNN и DCNN на основе внимания (ADCNN). Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Архитектура и реализация модели
Генеративные и дискриминативные модели, используемые в этом фреймворке, были реализованы с фиксированными и воспроизводимыми архитектурами. GAN состоит из генератора с тремя полностью соединёнными слоями (128, 256 и 512 единиц), использующими активацию ReLU, и дискриминатора с тремя полностью соединёнными слоями (512, 256 и 128 единиц), использующими активацию LeakyReLU, за которой следует сигмоидный выход.
Кодировщик VAE состоит из двух полностью связанных слоёв с 256 и 128 единицами, за которыми следует оценка латентного среднего и дисперсии с латентной размерностью 64. Декодер отражает эту структуру и обучается с использованием комбинации реконструкционных потерь и дивергенции Куллбака–Лейблера для изучения структурированного и вероятностного латентного пространства.
Классификатор DCNN включает четыре сверточных блока с ядрами 3x3 и соответственно 32, 64, 128 и 256 фильтрами. За каждым блоком следуют пакетная нормализация, активация ReLU и пулинг 2x2 максимум. ADCNN расширяет DCNN, внедряя механизм внимания по каналам после финального сверточного блока. Все модели оптимизировались с помощью оптимизатора Адама с скоростью обучения 0,0001 и размером партии 32. Как показано на рисунке 1, VAE и GAN работают только во время обучения, в то время как DCNN и ADCNN используются для классификации. Полная процедура обучения и оценки изложена в Алгоритме 1.
Алгоритм 1: Фреймворк обнаружения COVID-19 на основе GAN–VAE
Вводные данные: Предварительно обработанные аудиозаписи кашля
Результаты: Бинарная классификационная метка (положительный/отрицательный COVID-19)
Процедуры обучения и оценки следовали фиксированному, воспроизводимому процессу. Все аудиозаписи кашля были пересэмплированы до 16 кГц, подвергались снижению шума и нормализации амплитуды. Записи были разделены на сегменты фиксированной длины, из которых извлекались MFCC, хрома и спектральные особенности. Из каждого аудиосегмента было извлечено всего 40 Mel-Frequency Cepstral Cocopencial (MFCC). Кроме того, было вычислено 12 хрома-признаков. Полученное представление образует 52-мерный вектор признаков для каждого сегмента кашля. Для разделения данных на обучающие, валидационные и тестовые наборы проводились на уровне субъекта. VAE был обучен изучению вероятностных латентных представлений, и полученные латентные векторы использовались для обучения GAN генерации синтетических признаков. Обучающий набор данных дополнялся с помощью образцов, генерируемых GAN–VAE, в то время как синтетические данные были исключены из валидации и тестирования. Классификаторы DCNN и ADCNN были обучены на дополненных обучающих данных, а итоговая оценка проводилась на текущем тестовом наборе с использованием стандартных показателей производительности.
Настройка обучения, разделение данных и предотвращение утечек
Все эксперименты проводились с фиксированной, воспроизводимой тренировочной конфигурацией. Разделение данных проводилось на уровне субъекта перед сегментацией аудио, чтобы предотвратить утечку данных. Набор данных был разделён на обучающий, валидационный и тестовый наборы в соотношении 80:10:10, что гарантировало, что все сегменты одной записи были распределены в одно подмножество. Обучающий набор использовался для обучения моделей и генеративного дополнения данных, валидационный набор — для настройки гиперпараметров и ранней остановки, а тестовый набор — для окончательной оценки производительности. Синтетические образцы, созданные по фреймворку GAN–VAE, использовались исключительно во время обучения и строго исключались из валидации и тестирования для обеспечения справедливой оценки.
Модели тренировались максимум для 100 эпох, с ранней остановкой на основе потери валидации и терпения 10 эпох. Оптимизация проводилась с помощью оптимизатора Адама с скоростью обучения 0,0001 и размером пакета 32. Для классификации применялись бинарные потери перекрестной энтропии, а реконструкционные и состязательные потери — для обучения компонентов VAE и GAN соответственно. Этот унифицированный протокол обучения и оценки обеспечивает воспроизводимость, предотвращает утечку данных и строго разделяет этапы обучения и оценки.
Описание набора данных
Два общедоступных аудионабора данных по кашлю — COUGHVID и Virufy — использовались для балансирования масштабного акустического разнообразия с клинически ссылающимися метками, с чётко разделёнными ролями в обучении и оценке.
COUGHVID — это краудсорсинговая коллекция записей кашля с частичными экспертными аннотациями и метаданными, предоставленными самостоятельно. Для обеспечения качества данных было выбрано 428 записей с применением заранее заданных критериев контроля качества, включая минимальную продолжительность сигнала, достаточное соотношение сигнал/шум, удаление повреждённых или неоднозначных образцов, а также наличие идентифицируемых случаев кашля с метаданными симптомов. После предварительной обработки и сегментации эти записи получили 1 719 сегментов кашля, стандартизированных в формате WAV с частотой дискретизации 16 кГц. COUGHVID использовался для обучения как генеративных моделей, так и дискриминативных классификаторов.
Virufy состоит из записей кашля под наблюдением врача, помеченных как RT-PCR положительный или отрицательный на COVID-19. Все 16 доступных записей были включены, в результате чего после сегментации появилось 234 сегмента кашля, также стандартизированные до 16 кГц. Virufy использовался исключительно для внешней оценки кросс-наборов данных с целью оценки эффективности обобщения и не применялся для обучения, тонкой настройки или генеративного дополнения.
Таким образом, предлагаемую структуру следует интерпретировать как метод скрининга с подтверждением концепции, оцениваемый в контролируемых экспериментальных условиях, а не как клинически валидированную диагностическую систему.
Предварительная обработка и сегментация данных
Все записи были передискретированы до 16 кГц, преобразованы в моно и подвергались удалению тишины, снижению спектрального шума и нормализации амплитуды. Сегментация проводилась после разделения на уровне субъекта для предотвращения утечки данных. Каждая запись делилась на перекрывающиеся сегменты по 2–4 s, а низкоэнергетические или беззвучные сегменты отбрасывались.
Внешний протокол валидации
Внешняя валидация проводилась с помощью кросс-датасетовой оценки. Модели, обученные на COUGHVID, были оценены на Virufy для внешней валидации. Этот протокол оценивает обобщение между наборами данных, собранными при различных условиях, а не для перспективной клинической валидации. Рисунок 2 даёт обзор этого рабочего процесса на уровне протокола, иллюстрирует использование наборов данных, предварительную обработку, извлечение признаков, обучение классификаторов и сценарии оценки. В то время как рисунок 1 сосредоточен на внутренней архитектуре модели, рисунок 2 акцентирует внимание на экспериментальном проектировании и передаче данных на этапах обучения и тестирования.

Рисунок 2: Рабочий процесс предлагаемой системы скрининга кашля на COVID-19. Иллюстрация полного процесса обработки, включая предобработку, извлечение признаков (MFCC, хрома, спектральные признаки), обучение и дополнение представлений на основе GAN–VAE (только обучение), а также итоговую классификацию в рамках разделения на уровне субъекта и кросс-датасетовой оценки. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.