Исследовательская статья

Генеративная AI-структура для скрининга COVID-19 по аудиосигналам кашля

DOI:

10.3791/69874

10 марта 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данном исследовании предлагается генеративная структура на базе ИИ, интегрирующая GAN, VAE и глубокие сверточные сети, основанные на внимание, для обнаружения COVID-19 по аудиосигналам кашля, повышая устойчивость, баланс данных и обобщение межнаборов данных для масштабируемого, неинвазивного скрининга.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Аудиоанализ кашля предоставляет практический путь для разработки автоматизированных инструментов для поддержки скрининга заболеваний COVID-19. Несмотря на растущий интерес, многие существующие подходы остаются чувствительными к шуму, дисбалансу классов и вариабельности наборов данных, что ограничивает их воспроизводимость. В этой работе представлена структурированная методология обнаружения COVID-19 на основе генеративного искусственного интеллекта с использованием аудиозаписей кашля. Эксперименты проводятся с использованием двух общедоступных наборов данных — COUGHVID и Virufy, оба из которых содержат маркированные образцы кашля. Предлагаемый протокол состоит из последовательных этапов предварительной обработки, включая сегментацию кашля, снятие шума и нормализацию сигнала. Акустические характеристики затем фиксируются с помощью коэффициентов цепстральных частот Mel, хрома-дескрипторов и спектральных контрастных особенностей. Для улучшения преподавания представления и смягчения дисбаланса данных используется гибридная генеративная структура, интегрирующая вариационные автоэнкодеры и генеративные состязательные сети для синтеза выборок на уровне признаков. Далее классификация выполняется с использованием моделей глубоких сверточных нейронных сетей и DCNN на основе внимания. Оценка эффективности показывает, что внедрение генеративного дополнения стабильно улучшается по сравнению с негенеративными базовыми показателями, достигая максимальной точности классификации 97,2% и AUROC 0,953 по оценённым наборам данных. Эти результаты демонстрируют эффективность генеративного моделирования для улучшения обнаружения COVID-19 на основе кашля и создают воспроизводимый аналитический канал для будущих исследований в области мониторинга акустического здоровья.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Респираторная акустика всё чаще рассматривается как неинвазивный источник информации для оценки здоровья, особенно в контексте инфекционных и легочных заболеваний. Достижения в обработке сигналов и искусственном интеллекте (ИИ) позволили автоматизировать анализ кашля и дыхательных звуков, поддерживая их использование в качестве цифровых биомаркеров. Недавние исследования показывают, что дыхательные звуки, зафиксированные с помощью микрофонов, встроенных в смартфоны, носимые устройства или клинические сенсоры, могут быть эффективно проанализированы с помощью моделей глубокого обучения для обнаружения инфекцииCOVID-19 1,5. Эти достижения подчёркивают потенциал аудиоскрининга как быстрого, бесконтактного и масштабируемого дополнения к традиционным диагностическим процедурам. Коронавирусная болезнь 2019 года (COVID-19), вызванная вирусом SARS-CoV-2, в первую очередь поражает дыхательные пути и вызывает измеримые изменения в динамике воздушного потока, функции лёгких и поведении голосовых трактов. Хотя тестирование на обратную транскрипцию–полимеразную цепную реакцию (RT-ПЦР) остаётся эталоном для диагностики, его логистические ограничения и задержка времени выполнения ограничивают пригодность для масштабного или непрерывного скрининга, что стимулирует изучение альтернативных подходов на основе анализа респираторных звуков.

Всё больше публикаций изучают выявление COVID-19 с помощью искусственного интеллекта с помощью сигналов кашля, дыхания и речи. Как изложено в Таблице 1, предыдущие исследования изучали разнообразные наборы данных, акустические представления признаков (например, MFCC, STFT, признаки на основе спектрограммы) и парадигмы обучения — от классических моделей машинного обучения до глубоких сверточных, повторяющихся, ориентированных на внимание и трансформерных архитектур 8,9,10,11,12,13,14,15 ,16,17,18,19,20,21,22,23,24,25,26,27˒43,44,45. Несколько работ продемонстрировали перспективные результаты скрининга, используя краудсорсинговые и клинически собранные респираторные аудиозаписи. В отличие от этого, другие подчёркивали важность трансферного обучения, расширения данных и объяснимого ИИ для повышения надёжности и надёжности. Вместо повторения подробного обсуждения по исследованию, Таблица 1 предоставляет обобщённый сравнительный обзор этих репрезентативных подходов, что позволяет напрямую сравнивать наборы данных, методологии и опубликованные результаты.

Несмотря на эти достижения, ряд ограничений ограничивает устойчивость и практическую применимость существующих подходов. Респираторные аудиоданные часто собираются при гетерогенных условиях записи, что приводит к значительной вариативности между устройствами, акустическими средами и популяциямииспытуемых 2,3,4. Многие общедоступные наборы данных опираются на самосообщенный статус COVID-19, что вводит неопределённость в надёжностиэтикеток 7. Кроме того, выраженный дисбаланс классов и ограниченная доступность клинически валидированных образцов ограничивают возможности обобщения дискриминативных моделей, обученных исключительно на наблюдаемыхданных 4,5. Следовательно, производительность модели, отражаемая в контролируемых экспериментальных условиях, не всегда гарантирует надёжное внедрение в различных реальных сценариях.

В совокупности эти ограничения выявляют критический пробел в исследованиях: отсутствие единой структуры, которая одновременно решает дефицит данных, классовый дисбаланс и надёжное обобщение между гетерогенными наборами данных. Хотя генеративные модели, такие как Generative Adversarial Networks (GANs) и Variational Autoencoders (VAE), изучались для изучения латентных представлений и синтеза реалистичных биомедицинскихсигналов 6,7, существующие исследования обычно используют эти модели независимо и оценивают их в рамках единого набора данных. Кроме того, их интеграция с вниманительной сверточной архитектурой и оценкой в условиях межнабора данных остаётся недостаточно изученной.

Для устранения этого пробела в данном исследовании предлагается генеративная рамка с помощью ИИ для обнаружения COVID-19 по звукам кашля, которая интегрирует выделение акустических признаков с гибридной моделью GAN–VAE и глубокими сверточными нейросетями на основе внимания (DCNN). Генеративный компонент смягчает классовый дисбаланс и ограниченную доступность выборок за счёт обучения структурированному латентному представлению и синтетической генерации данных, в то время как дискриминативные модели повышают устойчивость классификации между гетерогенными наборами данных. В отличие от предыдущих работ, которые в основном опирались на валидацию внутри набора данных, предлагаемая структура оценивается с помощью кросс-датасет-тестирования на независимом наборе данных, что позволяет более строго оценивать результаты обобщения. Фреймворк предназначен как подход, ориентированный на скрининг, а не как отдельный диагностический инструмент, и её дизайн явно учитывает фиксацию вариативности и неопределённости меток для поддержки воспроизводимого и надёжного развертывания.

В этом контексте новые вклады настоящего исследования тройные. Во-первых, интегрирован единый гибридный генеративный фреймворк GAN–VAE с классификаторами DCNN на основе внимания для совместного устранения дисбаланса классов, ограниченной доступности данных и надёжного обучения представлению признаков в скрининге COVID-19 на основе кашля. Во-вторых, предлагаемый подход систематически оценивается с помощью кросс-датасетовой валидации, обеспечивая более реалистичную оценку обобщения модели по сравнению с традиционным тестированием внутри наборов данных. В-третьих, исследование представляет собой подробный анализ влияния генеративного усиления в гетерогенных условиях записи, что позиционирует структуру как воспроизводимый доказательство концепции масштабируемого, практического скрининга COVID-19.

Автор(ы) и годНаборы данных(ов)Используемые техники / особенностиМодель / КлассификаторТочность / МетрикиОграничения / Примечания
Имран и др., 20208Краудсорсинговый набор данных по кашлю (AI4COVID-19)MFCC, трансферное обучение, функции с учётом предметной областиИзбегающий риска мультиклассификатор (ансамбль DL + ML)Точность: 92,6%Зависит от качества кашля; Ограниченная клиническая валидация
Браун и др., 20209Краудсорсинговые респираторные звуки (>7 000 пользователей)Ручные аудиофункции, встроенные VGGishПоверхностные модели машинного обученияAUC > 80%Шум меток в краудсорсинговых данных
Лагуарта и др., 202010Набор данных MIT Open Voice (5 320 участников)MFCC, акустические биомаркерыCNN (ResNet50, трансферное обучение)Чувствительность: 98,5%, специфичность: 94,2%Требуется большой набор данных предварительного обучения
Quartieri и др., 202011Интервью по речи (5 предметов, до/после COVID)Интенсивность дыхания, F0, CPP, формантыСтатистический анализ размеров эффектадостичь AUC выше 80% по всем задачамОчень маленький размер выборки
Hassan и др., 202012Дыхательные звукиВременные особенности речиRNNКашель: 97%, дыхание: 98,2%, голос: 88,2%Отсутствие подробной статистики наборов данных
Khamparia и др., 201913ESC-10, ESC-50Особенности на основе изображений спектрограммыCNN, TDSNCNN: 77% (ESC-10), 49% (ESC-50); TDSN: 56% (ESC-10)Только звуки окружения; низкая производительность на сложных наборах данных
Айканат и др., 20171417 930 лёгких звуков от 1 630 испытуемых (электронный стетоскоп)Особенности MFCC, изображения спектрограммыSVM, CNNCNN/SVM: 86% (здоровые против патологических), 76%/75% (рале–ронхус–нормальный), 80%/80% (один тип), 62%/62% (все типы)Требуется специализированное оборудование; не специфические для болезни
Ponomarchuk и др., 202215Косвара, ВируфиMFCC, мел-спектрограмма, вейвлет-признакиCNN, RNN, ансамблевые моделиAUC: 0.93 (внутренний), 0.79 (внешний)Обобщение между наборами данных остаётся сложным
Фэн и др., 202116Косвара, ВируфиSTFT, MFCCSVM (RBF), CNNТочность 81,25% (AUC 0,79)Производительность, зависящая от набора данных
Ислам и др., 202217Клинические записи кашляСпектральные и временно-частотные особенностиГлубокие нейронные сетиТочность: 89,2%Ограниченный набор данных
Маншури,2022 18VirufyОсобенности спектрального анализаКлассические классификаторы машинного обученияТочность: 95,86%Экспериментальное исследование малого масштаба
Хуанг и др., 202019Звуки лёгких от 10 пациентов с COVID-19Анализ дыхательных звуков по времени-частотеКлинический экспертный анализКачественная валидацияНебольшой набор данных; нет модели машинного обучения
W. D. Puja и др., 202420Coswara, Virufy (наборы звуков кашля)STFT, Mel-спектрограмма, MFCC, энергия RMS, спектральная полоса пропускания, спектральный центроид, спектральный откат, ZCR; Глубокое извлечение признаков на основе CNN1D CNN (экстрактор особенностей) + Случайный лесТочность: 93%Производительность зависит от качества кашля; разработан для скрининга, а не для клинической диагностики; Вариабельность данных, собранных краудсорсингом
Чадага и др., 202321Аудиозаписи от кашля, собранные краудсорсингомМел-спектрограмма и временно-частотные акустические особенностиСверточная нейронная сеть (CNN)Точность: 84%, Точность: 85%, Отзыв: 84%, F1-результат: 84%Производительность ограничена дисбалансом данных, самооценочными метками, чувствительностью к условиям записи
Чадага и др., 202322Лёгкие и умеренные клинические маркеры COVID-19 и других респираторных заболеванийВыбор полнометражных фильмов (Пирсон, PSO); Ключевые маркеры: эозинофил, альбумин, T. билирубин, ALP, ALT, AST, HbA1c, TWBCНасыщенный ансамбль; 1-Й CNN, LSTM, DNN, остаточный MLPТочность: 89%За исключением тяжёлых случаев; альтернатива RT-PCR; Применённый объяснимый ИИ
Дар и др. 202423Набор данных по COVID-19Оптимизация SJHBO (Jaya+HBO+SO), множество спектральных признаковDeep Q Network (DQN)Точность: 95,11%, чувствительность: 95,06%, специфичность: 94,69%Высокая сложность; настройка улучшается с помощью гибридного оптимизатора
Цзин Цюянь и др. 202024Записи речи пациентов с COVID-19Акустические наборы функций; Анализ тяжести заболевания, качества сна, усталости, тревожностиПоддерживающие векторные машины (SVM)0,69 (тяжесть болезни)Ограничено аудиоматериалами; умеренной точности; размер набора данных не указан; Рассмотрено только четыре аспекта здоровья
Sharma, J., и др. 202025UrbanSound8K, ESC-10, ESC-50Многофункциональные каналы: MFCC, GFCC, CQT, Chromagram; Дополнение данных по путиГлубокий CNN с пространственно разделяемыми свертками и модулями вниманияUrbanSound8K: 97,52%, ESC-10: 94,75%, ESC-50: 87,45%Не тестировалось на небенчмарковых или реальных наборах данных; вычислительная сложность из-за более глубоких модулей CNN и внимания
Lella KK и др. 202126 Дыхательные звуки; COVID-19, астма, здоровье)дополнение данных; глубокие функции с использованием автоматического кодера (DDAE) вместо MFCC1D сверточная нейронная сеть (1D CNN)~90%Ограниченные детали набора данных; ~4% улучшение по сравнению с MFCC; обобщаемость, не проверенная
Orlandic и др., 202127COUGHVID (25k+ кашляет)MFCC, PSD, спектральные и временные особенностиXGBoostAUC 96,5%, Precision 95,5%Самосообщал о COVID; Экспертные метки на подмножестве
Чжан и др., 2023,43Опубликованные отчёты о случаях HLH после вакцинации против COVID-19 (базы данных литературы)Систематический обзор; агрегирование клинических признаков; Анализ молекулярного стыковкиНе применимо (клинический обзор)Описательная статистика; Клинические результатыАнализ редких событий; небольшая выборка; Опора на зарегистрированные случаи может привести к предвзятости в отчетности
Сюй и др., 2023,44Зарегистрированные случаи заболевания VKH, ассоциированной с вакциной, согласно литературеРетроспективный обзор дела; Клинический и визуализационный анализ признаковНе применимо (клиническое наблюдательное исследование)Ответ на лечение и результаты клинического восстановленияОграниченное количество дел; отсутствие контрольной группы; Причинно-следственная связь не может быть твердо установлена
Ху и др., 2025,45Данные материнских и дочерних компаний SRDI в Китае (база данных Qixinbao) на уровне материнских и дочерних компаний SRDI (база данных Qixinbao)анализ социальных сетей; метрики пространственных сетей; Анализ географических детекторовНе применимо (анализ сети и политики)Плотность сети, центральность, индексы диффузииПоперечное проектирование; равный вес фирм; Нет прямых показателей эффективности или клинических результатов

Таблица 1: Сводка существующих аудиоисследований обнаружения COVID-19. Сравнительный обзор предыдущих методов скрининга кашля и аудио, включая наборы данных, методы и отчётную эффективность. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Предлагаемая методология

В данном исследовании предлагается генеративная система на базе ИИ для выявления COVID-19 по сигналам кашля. Фреймворк интегрирует генеративные модели с дискриминативными классификаторами, при этом данные обучения и оценки строго разделяются. Рисунок 1 иллюстрирует подробную архитектуру предлагаемого фреймворка GAN–VAE–ADCNN, показывая поток от аудиопредобработки и извлечения признаков через обучение латентным представлениям с помощью вариационного автоэнкодера (VAE), синтетическую генерацию признаков с помощью генеративной состязательной сети (GAN) и окончательную классификацию с помощью глубоких сверточных нейронных сетей (DCNN) и DCNN на основе внимания (ADCNN). На рисунке видно, что генеративные компоненты используются только во время обучения, тогда как классификация выполняется с помощью дискриминативных моделей.

figure-protocol-1
Рисунок 1: Обзор архитектуры GAN–VAE–ADCNN. Схема предлагаемого гибридного конвейера, где акустические особенности, полученные от кашля, кодируются с помощью VAE, дополняются генерацией синтетических образцов на основе GAN и классифицируются с использованием моделей DCNN и DCNN на основе внимания (ADCNN). Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Архитектура и реализация модели

Генеративные и дискриминативные модели, используемые в этом фреймворке, были реализованы с фиксированными и воспроизводимыми архитектурами. GAN состоит из генератора с тремя полностью соединёнными слоями (128, 256 и 512 единиц), использующими активацию ReLU, и дискриминатора с тремя полностью соединёнными слоями (512, 256 и 128 единиц), использующими активацию LeakyReLU, за которой следует сигмоидный выход.

Кодировщик VAE состоит из двух полностью связанных слоёв с 256 и 128 единицами, за которыми следует оценка латентного среднего и дисперсии с латентной размерностью 64. Декодер отражает эту структуру и обучается с использованием комбинации реконструкционных потерь и дивергенции Куллбака–Лейблера для изучения структурированного и вероятностного латентного пространства.

Классификатор DCNN включает четыре сверточных блока с ядрами 3x3 и соответственно 32, 64, 128 и 256 фильтрами. За каждым блоком следуют пакетная нормализация, активация ReLU и пулинг 2x2 максимум. ADCNN расширяет DCNN, внедряя механизм внимания по каналам после финального сверточного блока. Все модели оптимизировались с помощью оптимизатора Адама с скоростью обучения 0,0001 и размером партии 32. Как показано на рисунке 1, VAE и GAN работают только во время обучения, в то время как DCNN и ADCNN используются для классификации. Полная процедура обучения и оценки изложена в Алгоритме 1.

Алгоритм 1: Фреймворк обнаружения COVID-19 на основе GAN–VAE

Вводные данные: Предварительно обработанные аудиозаписи кашля

Результаты: Бинарная классификационная метка (положительный/отрицательный COVID-19)

Процедуры обучения и оценки следовали фиксированному, воспроизводимому процессу. Все аудиозаписи кашля были пересэмплированы до 16 кГц, подвергались снижению шума и нормализации амплитуды. Записи были разделены на сегменты фиксированной длины, из которых извлекались MFCC, хрома и спектральные особенности. Из каждого аудиосегмента было извлечено всего 40 Mel-Frequency Cepstral Cocopencial (MFCC). Кроме того, было вычислено 12 хрома-признаков. Полученное представление образует 52-мерный вектор признаков для каждого сегмента кашля. Для разделения данных на обучающие, валидационные и тестовые наборы проводились на уровне субъекта. VAE был обучен изучению вероятностных латентных представлений, и полученные латентные векторы использовались для обучения GAN генерации синтетических признаков. Обучающий набор данных дополнялся с помощью образцов, генерируемых GAN–VAE, в то время как синтетические данные были исключены из валидации и тестирования. Классификаторы DCNN и ADCNN были обучены на дополненных обучающих данных, а итоговая оценка проводилась на текущем тестовом наборе с использованием стандартных показателей производительности.

Настройка обучения, разделение данных и предотвращение утечек

Все эксперименты проводились с фиксированной, воспроизводимой тренировочной конфигурацией. Разделение данных проводилось на уровне субъекта перед сегментацией аудио, чтобы предотвратить утечку данных. Набор данных был разделён на обучающий, валидационный и тестовый наборы в соотношении 80:10:10, что гарантировало, что все сегменты одной записи были распределены в одно подмножество. Обучающий набор использовался для обучения моделей и генеративного дополнения данных, валидационный набор — для настройки гиперпараметров и ранней остановки, а тестовый набор — для окончательной оценки производительности. Синтетические образцы, созданные по фреймворку GAN–VAE, использовались исключительно во время обучения и строго исключались из валидации и тестирования для обеспечения справедливой оценки.

Модели тренировались максимум для 100 эпох, с ранней остановкой на основе потери валидации и терпения 10 эпох. Оптимизация проводилась с помощью оптимизатора Адама с скоростью обучения 0,0001 и размером пакета 32. Для классификации применялись бинарные потери перекрестной энтропии, а реконструкционные и состязательные потери — для обучения компонентов VAE и GAN соответственно. Этот унифицированный протокол обучения и оценки обеспечивает воспроизводимость, предотвращает утечку данных и строго разделяет этапы обучения и оценки.

Описание набора данных

Два общедоступных аудионабора данных по кашлю — COUGHVID и Virufy — использовались для балансирования масштабного акустического разнообразия с клинически ссылающимися метками, с чётко разделёнными ролями в обучении и оценке.

COUGHVID — это краудсорсинговая коллекция записей кашля с частичными экспертными аннотациями и метаданными, предоставленными самостоятельно. Для обеспечения качества данных было выбрано 428 записей с применением заранее заданных критериев контроля качества, включая минимальную продолжительность сигнала, достаточное соотношение сигнал/шум, удаление повреждённых или неоднозначных образцов, а также наличие идентифицируемых случаев кашля с метаданными симптомов. После предварительной обработки и сегментации эти записи получили 1 719 сегментов кашля, стандартизированных в формате WAV с частотой дискретизации 16 кГц. COUGHVID использовался для обучения как генеративных моделей, так и дискриминативных классификаторов.

Virufy состоит из записей кашля под наблюдением врача, помеченных как RT-PCR положительный или отрицательный на COVID-19. Все 16 доступных записей были включены, в результате чего после сегментации появилось 234 сегмента кашля, также стандартизированные до 16 кГц. Virufy использовался исключительно для внешней оценки кросс-наборов данных с целью оценки эффективности обобщения и не применялся для обучения, тонкой настройки или генеративного дополнения.

Таким образом, предлагаемую структуру следует интерпретировать как метод скрининга с подтверждением концепции, оцениваемый в контролируемых экспериментальных условиях, а не как клинически валидированную диагностическую систему.

Предварительная обработка и сегментация данных

Все записи были передискретированы до 16 кГц, преобразованы в моно и подвергались удалению тишины, снижению спектрального шума и нормализации амплитуды. Сегментация проводилась после разделения на уровне субъекта для предотвращения утечки данных. Каждая запись делилась на перекрывающиеся сегменты по 2–4 s, а низкоэнергетические или беззвучные сегменты отбрасывались.

Внешний протокол валидации

Внешняя валидация проводилась с помощью кросс-датасетовой оценки. Модели, обученные на COUGHVID, были оценены на Virufy для внешней валидации. Этот протокол оценивает обобщение между наборами данных, собранными при различных условиях, а не для перспективной клинической валидации. Рисунок 2 даёт обзор этого рабочего процесса на уровне протокола, иллюстрирует использование наборов данных, предварительную обработку, извлечение признаков, обучение классификаторов и сценарии оценки. В то время как рисунок 1 сосредоточен на внутренней архитектуре модели, рисунок 2 акцентирует внимание на экспериментальном проектировании и передаче данных на этапах обучения и тестирования.

figure-protocol-2
Рисунок 2: Рабочий процесс предлагаемой системы скрининга кашля на COVID-19. Иллюстрация полного процесса обработки, включая предобработку, извлечение признаков (MFCC, хрома, спектральные признаки), обучение и дополнение представлений на основе GAN–VAE (только обучение), а также итоговую классификацию в рамках разделения на уровне субъекта и кросс-датасетовой оценки. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Состав наборов данных и анализ распределения классов

После предварительной обработки и сегментации наборы данных COUGHVID и Virufy показали значительные различия как в масштабе набора данных, так и в плотности сегментов. COUGHVID внесла вклад в 428 из 444 записей (96,4%) и 1 719 из 1 953 экстракционных сегментов кашля (88,0%), подтверждая его роль как основного набора данных для обучения моделей и генеративного усиления (с...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Результаты показывают, что предлагаемая генеративная структура на базе ИИ может обнаруживать COVID-19 по сигналам кашля в гетерогенных наборах данных. Как показано в таблицах 4 и 6, гибридная модель GAN–VAE показала наилучшие результаты — точность 97,2% и AUROC 0,953, а также высокую точность, отзыв, F1-балл и специфичность, что указывает на сбалансированную классификацию.

Производительность стабильно улучшалась при объединени...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Автор(ы) не сообщили о потенциальном конфликте интересов.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Мы выражаем искреннюю благодарность преподавателям и научным наставникам Школы компьютерных наук и инженерии за их ценное руководство, постоянную поддержку и конструктивную обратную связь при подготовке этой статьи.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Набор данных COUGHVIDи острые; Cole Polytechnique Fé DÉ rale de Lausanne (EPFL)Публичный релиз (2021)Краудсорсинговый аудионабор данных по кашлю с метаданными и частичными аннотациями врачей; Используется преимущественно для обучения и пополнения данных.
Набор инструментов CUDANVIDIA11.3Фреймворк ускорения GPU используется для ускорения обучения и вывода моделей.
LibROSAОткрытый исходный код0.9Библиотека аудиоанализа, используемая для ресэмплинга, сегментации, экстракции MFCC и вычисления спектральных признаков.
Операционная система LinuxКаноническийUbuntu 20.04 LTSОперационная система используется для всех экспериментов и обучения моделей.
MatplotlibОткрытый исходный код3.5Библиотека визуализации, используемая для построения графиков распределений наборов данных и результатов оценки.
NumPyОткрытый исходный код1.21Библиотека численных вычислений, используемая для обработки массивов и операций обработки сигналов.
Видеокарта NVIDIANVIDIAКласс Tesla / RTXГрафический процессор, используемый для обучения глубоких и генеративных моделей.
Язык программирования PythonФонд программного обеспечения Python3.8Основная среда программирования, используемая для предварительной обработки данных, извлечения признаков, разработки моделей и оценки.
PyTorchMeta (Facebook AI Research)1.12Фреймворк глубокого обучения, используемый для реализации моделей GAN, VAE, DCNN и ориентированных на внимание DCNN.
Scikit-learnОткрытый исходный код1Библиотека машинного обучения, используемая для разделения данных, взвешивания классов и вычисления метрик производительности.
SciPyОткрытый исходный код1.7Научная вычислительная библиотека, используемая для предварительной обработки аудио и преобразования сигналов.
Набор данных VirufyVirufyПубличный релиз (2021)Клинически собранные записи кашля с помощью RT-PCR– проверенные метки COVID-19; используется исключительно для внешней валидации и оценки межсетов данных.

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Aytekin, I., et al. COVID-19 detection from respiratory sounds with hierarchical spectrogram transformers. IEEE J. Biomed. Health Inform. 28 (3), 1273-1284 (2024).
  2. Walter, J. R., Lee, J. Y., Yu, L., et al. Use of artificial intelligence to develop predictive algorithms of cough and PCR-confirmed COVID-19 infections based on inputs from clinical-grade wearable sensors. Sci. Rep. 14, 8072(2024).
  3. Altae, A. A., Ehsani Rad, A., Mohebbi, K. Advanced COVID-19 detection using cough signals with space reconstruction and 3D deep convolutional neural networks. Sci. Rep. , (2025).
  4. Rao, S., Narayanaswamy, V., Esposito, M., Thiagarajan, J. J., Spanias, A. COVID-19 detection using cough sound analysis and deep learning algorithms. Intell. Decis. Technol. 15 (4), 655-665 (2021).
  5. Alkhodari, M., Khandoker, A. H. Detection of COVID-19 in smartphone-based breathing recordings: a pre-screening deep learning tool. PLoS One. 17 (1), e0262448(2022).
  6. Zhang, Y., et al. Research on a lung sound classification model based on a dual-channel CNN-LSTM algorithm. Biomed. Signal Process. Control. 94, 106257(2024).
  7. Askari Nasab, K., Mirzaei, J., Zali, A., Gholizadeh, S., Akhlaghdoust, M. Coronavirus diagnosis using cough sounds: artificial intelligence approaches. Front. Artif. Intell. 6, 1100112(2023).
  8. Imran, A., et al. AI4COVID-19: AI-enabled preliminary diagnosis for COVID-19 from cough samples via an app. Inform. Med. Unlocked. 20, 100378(2020).
  9. Brown, C., et al. Exploring automatic diagnosis of COVID-19 from crowdsourced respiratory sound data. Proc. KDD Health Day. , (2020).
  10. Laguarta, J., Hueto, F., Subirana, B. COVID-19 artificial intelligence diagnosis using only cough recordings. IEEE Open J. Eng. Med. Biol. 1, 275-281 (2020).
  11. Quartieri, T. F., Talker, T., Palmer, J. S. A framework for biomarkers of COVID-19 based on coordination of speech-production subsystems. IEEE Open J. Eng. Med. Biol. 1, 203-206 (2020).
  12. Hassan, A., Shahin, I., Alsabek, M. B. COVID-19 detection system using recurrent neural networks. Proc. CCCI. , 1-5 (2020).
  13. Khamparia, A., Gupta, D., Nguyen, N. G., et al. Sound classification using a convolutional neural network and a tensor deep stacking network. IEEE Access. 7, 7717-7727 (2019).
  14. Aykanat, M., Kilic, O., Kurt, B., et al. Classification of lung sounds using convolutional neural networks. J. Image Video Process. 65, (2017).
  15. Ponomarchuk, A., Burenko, I., Malkin, E., et al. Project Achoo: a practical model and application for COVID-19 detection from recordings of breath, voice, and cough. IEEE J. Sel. Top. Signal Process. 16 (2), 175-187 (2022).
  16. Feng, K., He, F., Steinmann, J., Demirkiran, I. Deep-learning based approach to identify COVID-19. Proc. SoutheastCon. , 1-4 (2021).
  17. Islam, R., Abdel-Raheem, E., Tarique, M. A study of using cough sounds and deep neural networks for the early detection of COVID-19. Biomed. Eng. Adv. 3, 100025(2022).
  18. Manshouri, N. M. Identifying COVID-19 by using spectral analysis of cough recordings: a distinctive classification study. Cogn. Neurodyn. 16 (1), 239-253 (2022).
  19. Huang, Y., et al. The respiratory sound features of COVID-19 patients fill gaps between clinical data and screening methods. medRxiv. , (2020).
  20. Puja, W. D., Sultana, S., Aowlad Hossain, A. B. M. COVID-19 detection from cough sound signal using random forest learning of deep spectral features. Proc. IEEE SPICSCON. , 1-4 (2024).
  21. Chadaga, K., Prabhu, S., Bhat, V., et al. COVID-19 diagnosis using clinical markers and multiple explainable artificial intelligence approaches: a case study from Ecuador. SLAS Technol. 28 (6), 393-410 (2023).
  22. Chadaga, K., Prabhu, S., Bhat, V., Sampathila, N., Umakanth, S., Chadaga, R. Artificial intelligence for diagnosis of mild-moderate COVID-19 using haematological markers. Ann. Med. 55 (1), 2233541(2023).
  23. Dar, J. A., Srivastava, K. K., Lone, S. A. Optimization-based deep learning for COVID-19 detection using respiratory sound signals. Cogn. Comput. 16 (4), 1927-1946 (2024).
  24. Qian, J., et al. An early study on intelligent analysis of speech under COVID-19: severity, sleep quality, fatigue, and anxiety. Proc. Interspeech. , (2020).
  25. Sharma, J., et al. Environment sound classification using multiple feature channels and an attention-based deep convolutional neural network. arXiv. , (2020).
  26. Lella, K. K., Pja, A. Automatic COVID-19 disease diagnosis using a 1D convolutional neural network and augmentation with human respiratory sound based on parameters: cough, breath, and voice. AIMS Public Health. 8 (2), 240-264 (2021).
  27. Orlandic, L., Teijeiro, T., Atienza, D. The COUGHVID crowdsourcing dataset, a corpus for the study of large-scale cough analysis algorithms. Sci. Data. 8, 156(2021).
  28. Lin, Y., et al. SympCoughNet: symptom-assisted audio-based COVID-19 detection. Front. Digit. Health. 7, 1551298(2025).
  29. Tena, A., Claria, F., Solsona, F. Automated detection of COVID-19 cough. Biomed. Signal Process. Control. 71, 103175(2022).
  30. Sharma, G., Umapathy, K., Krishnan, S. Audio texture analysis of COVID-19 cough, breath, and speech sounds. Biomed. Signal Process. Control. 76, 103703(2022).
  31. Hadjaidji, E., Korba, M. C. A., Khelil, K. COVID-19 detection from cough sounds using XGBoost and LSTM networks. Trait. Signal. 41 (2), 939-947 (2024).
  32. Despotovic, V., Ismael, M., Cornil, M., et al. Detection of COVID-19 from voice, cough, and breathing patterns: dataset and preliminary results. Comput. Biol. Med. 138, 104944(2021).
  33. Wang, W., Shang, Q., Lu, H. Automatic COVID-19 detection from cough sounds using multi-headed convolutional neural networks. Appl. Sci. 13, 6976(2023).
  34. Truong, T., Lenga, M., Serrurier, A., Mohammadi, S. Fused audio instance and representation for respiratory disease detection. arXiv. , (2023).
  35. Shati, A., Hassan, G. M., Datta, A. COVID-19 detection system: a comparative analysis of system performance based on acoustic features of cough audio signals. Proc. IEEE TrustCom. , 2706-2713 (2023).
  36. Pinkas, G., Karny, Y., Malachi, A., et al. SARS-CoV-2 detection from voice. IEEE Open J. Eng. Med. Biol. 1, 268-274 (2020).
  37. Hussain, S., et al. Cough2COVID-19 detection using an enhanced multi-layer ensemble deep learning framework and CoughFeatureRanker. Sci. Rep. 14, 25207(2024).
  38. Silva, L., Valadao, C., Lampier, L., et al. COVID-19 respiratory sound analysis and classification using audio textures. Front. Signal Process. 2, 986293(2022).
  39. Hamdi, S., Oussalah, M., Moussaoui, A., Saidi, M. Attention-based hybrid CNN-LSTM and spectral data augmentation for COVID-19 diagnosis from cough sound. J. Intell. Inf. Syst. 59 (2), 367-389 (2022).
  40. Banerjee, A., Nilhani, A. A residual network-based deep learning model for the detection of COVID-19 using cough sounds. Artificial Intelligence Strategies for Analyzing COVID-19 Pneumonia Lung Imaging. , IOP Publishing. (2022).
  41. Chowdhury, N. K., Kabir, M. A., Rahman, M. M., Islam, S. M. S. Machine learning for detecting COVID-19 from cough sounds: an ensemble-based MCDM method. Comput. Biol. Med. 145, 105405(2022).
  42. Chang, J., et al. UFRC: a unified framework for reliable COVID-19 detection on crowdsourced cough audio. arXiv. , (2022).
  43. Zhang, H. Q., et al. Analysis of reported cases of hemophagocytic lymphohistiocytosis after COVID-19 vaccination. Hum. Vaccin. Immunother. 19 (2), (2023).
  44. Xu, K., et al. Clinical features, diagnosis, and management of COVID-19 vaccine-associated Vogt-Koyanagi-Harada disease. Hum. Vaccin. Immunother. 19 (2), (2023).
  45. Hu, F., et al. Spatial networks of China's specialized, refined, distinctive, and innovative medical device firms based on parent-subsidiary contacts: implications for regional health policy. Front. Public Health. 13, 1676189(2025).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Cough Audio AnalysisCough Sound RecordingsMel Frequency CepstralVariational AutoencodersGenerative Adversarial NetworksDeep Convolutional NetworksAcoustic Health MonitoringSignal Denoising

Похожие статьи