本研究は、GANs、VAE、注意ベースのディープ畳み込みネットワークを統合し、咳の音声信号からCOVID-19を検出し、堅牢性、データバランス、データセット横断の一般化を向上させ、スケーラブルで非侵襲的なスクリーニングを実現する生成AIベースのフレームワークを提案します。
研究記事
本研究は、GANs、VAE、注意ベースのディープ畳み込みネットワークを統合し、咳の音声信号からCOVID-19を検出し、堅牢性、データバランス、データセット横断の一般化を向上させ、スケーラブルで非侵襲的なスクリーニングを実現する生成AIベースのフレームワークを提案します。
咳の音声分析は、COVID-19の疾患スクリーニングを支援する自動化ツールを開発するための実践的な道筋を提供します。関心が高まっているにもかかわらず、多くの既存の手法はノイズ、クラスの不均衡、データセットの変動性に敏感であり、再現性を制限しています。本研究は、咳の音記録を用いた構造化された生成型人工知能駆動のCOVID-19検出手法を提示します。実験は、公に公開されている2つのデータセット、COUGHVIDとVirufyを用いて行われ、いずれもラベル付き咳サンプルで構成されています。提案されたプロトコルは、咳のセグメンテーション、ノイズ除去、信号正規化を含む逐次的な前処理段階で構成されています。その後、音響特性はメル周波数セプストラル係数、クロマ記述子、スペクトルコントラストの特徴を通じて捉えられます。表現学習を改善しデータの不均衡を緩和するために、変分自動エンコーダと生成敵対ネットワークを統合したハイブリッド生成フレームワークを用いて特徴量サンプルを合成します。その後、深層畳み込みニューラルネットワークと注意ベースのDCNNモデルを用いて分類が行われます。パフォーマンス評価では、生成的拡張の導入は非生成的ベースラインに比べて一貫して向上し、評価対象データセット全体で分類精度のピーク97.2%、AUROCは0.953に達しています。これらの結果は、咳に基づくCOVID-19検出の強化にジェネレーティブモデリングが有効であることを示し、音響健康モニタリングにおける将来の研究のための再現可能な分析パイプラインを構築しています。
呼吸音響学は、特に感染症や肺疾患の文脈で、健康評価のための非侵襲的な情報源としてますます探求されています。信号処理や人工知能(AI)の進歩により、咳や呼吸音の自動解析が可能となり、デジタルバイオマーカーとしての利用が可能になりました。最近の研究では、スマートフォン、ウェアラブルデバイス、臨床センサーに埋め込まれたマイクで捉えられた呼吸音が、ディープラーニングモデルを用いて効果的に解析され、COVID-19感染を検出できることが示されています。これらの進展は、音声ベースのスクリーニングが従来の診断手法を迅速かつ非接触、かつ拡張可能な補完手段として可能であることを示しています。SARS-CoV-2ウイルスによって引き起こされるコロナウイルス病2019(COVID-19)は、主に呼吸器系に影響を及ぼし、気流の動態、肺機能、声道の挙動に測定可能な変化を引き起こします。逆転写ポリメラーゼ連鎖反応(RT-PCR)検査は診断の基準として依然として重要ですが、その物流上の制約や遅延した処理時間が大規模または連続スクリーニングの適性を制限しており、呼吸音響解析に基づく代替手法の模索が促されています。
咳、呼吸、発話信号を用いたAI駆動のCOVID-19検出に関する文献が増えています。表1にまとめられているように、これまでの研究では多様なデータセット、音響特徴表現(例:MFCC、STFT、スペクトログラムベースの特徴)、および古典的機械学習モデルから深層畳み込み、再帰、注意ベース、トランスフォーマーアーキテクチャに至る学習パラダイムが探求されています(8,9,10,11,12,13,14,15)。、16、17、18、19、20、21、22、23、24、25、26、27˒43、44、45.クラウドソースや臨床的に収集された呼吸音声を用いたスクリーニング性能が有望であることがいくつかの研究で示されています。一方で、転移学習、データ拡張、説明可能なAIが堅牢性と信頼性を高める重要性を強調している人もいます。詳細な研究ごとの議論を繰り返すのではなく、表1はこれらの代表的なアプローチの統合された比較概要を提供し、データセット、方法論、報告されたアウトカムの直接比較を可能にします。
これらの進歩にもかかわらず、既存の手法の堅牢性と実務適用性にはいくつかの制約があります。呼吸音声データセットはしばしば不均一な記録条件下で収集されるため、機器、音響環境、被験者集団間で大きなばらつきが生じます 2,3,4。多くの公開データセットは自己申告のCOVID-19状態に依存しており、ラベルの信頼性に不確実性が生じています。さらに、顕著なクラス不均衡と臨床的に検証されたサンプルの利用可能性の限界は、観察データのみを用いて訓練された識別モデルの一般化能力を制限しています4,5。したがって、管理された実験環境下で報告されたモデルのパフォーマンスは、多様な現実世界での信頼性の高い展開に一貫して結びつくとは限りません。
これらの制限を総合すると、データの希少性、階級の不均衡、そして異種なデータセット間の強固な一般化を同時に扱う統一された枠組みが欠如しているという重要な研究ギャップが浮き彫りになります。生成的敵対ネットワーク(GAN)や変分自動エンコーダー(VAE)などの生成モデルは、潜在的表現を学習し現実的な生体医学信号を合成するために探求されてきました。6,7 しかし、既存の研究ではこれらのモデルを単独で用い、単一のデータセット内で評価することが多いです。さらに、注意強化型畳み込みアーキテクチャとの統合やクロスデータセット条件下での評価も十分に調査されていません。
このギャップを埋めるため、本研究では咳音からのCOVID-19検出のための生成AI支援フレームワークを提案し、音声特徴抽出とハイブリッドなGAN–VAEモデルおよび注意ベースの深層畳み込みニューラルネットワーク(DCNN)を統合しています。生成要素は構造化された潜在表現学習と合成データ生成を通じてクラスの不均衡やサンプルの利用可能性の制限を緩和し、識別モデルは異種データセット間の分類の堅牢性を高めます。従来の研究が主にデータセット内検証に依存していたのに対し、提案されたフレームワークは独立したデータセット上でクロスデータセットテストを用いて評価されており、一般化性能のより厳密な評価が可能となっています。このフレームワークは単独の診断ツールではなくスクリーニング志向のアプローチを意図しており、その設計は変動性やラベルの不確実性の記録を明確に考慮して再現性と信頼性の高い展開を支援しています。
この文脈において、本研究の新しい貢献は三つあります。まず、統一されたGAN–VAEハイブリッド生成フレームワークが注意ベースのDCNN分類器と統合され、咳に基づくCOVID-19スクリーニングにおけるクラスの不均衡、限られたデータ利用性、堅牢な特徴表現学習に共同で対処します。次に、提案されたアプローチはクロスデータセット検証を用いて体系的に評価され、従来のデータセット内検定と比べてモデルの一般化をより現実的に評価できます。第三に、異種記録条件下での生成拡張の影響を詳細に分析し、このフレームワークを拡張可能で実用的なCOVID-19スクリーニングの再現可能な概念実証として位置づけています。
| 著者と年号 | データセット | 使用技術・特徴 | モデル/分類器 | 精度/指標 | 制限事項/注記 |
| Imranら、2020年8頁 | クラウドソースによる咳のデータセット(AI4COVID-19) | MFCC、転移学習、ドメイン認識機能 | リスク回避型マルチクラシファイア(DL + MLアンサンブル) | 命中率:92.6% | 咳の質によります。限定的な臨床検証 |
| ブラウンら、2020年9頁 | クラウドソースによる呼吸音(>7,000ユーザー) | 手作りのオーディオ機能、VGGishの埋め込み | 浅いMLモデル | AUC>80% | クラウドソースデータにおけるラベルノイズ |
| Laguartaら、2020年10頁 | MITオープンボイスデータセット(5,320人の被験者) | MFCC、音響バイオマーカー | CNN(ResNet50、転移学習) | 感度:98.5%、特異度:94.2% | 大規模な事前学習データセットが必要です |
| Quartieri ら、2020年11頁 | スピーチ面接(5科目、COVID前後) | 呼吸強度、F0、CPP、フォルマント | 統計効果サイズ分析 | すべてのタスクで80%以上のAUCを達成する | サンプル数は非常に小さい |
| Hassanら、2020年、12頁 | 呼吸音 | 時間的音声の特徴 | RNN | 咳:97%、呼気:98.2%、声:88.2% | 詳細なデータセット統計の欠如 |
| Khampariaら、2019年、13頁 | ESC-10、ESC-50 | スペクトログラム画像ベースの特徴 | CNN、TDSN | CNN:77%(ESC-10)、49%(ESC-50);TDSN:56%(ESC-10) | 環境音のみ;複雑なデータセットでの性能低下 |
| Aykanatら、2017年、14頁 | 1,630人の被験者から17,930の肺音(電子聴診器) | MFCCの特徴、スペクトログラム画像 | SVM、CNN | CNN/SVM:86%(健康型と病的型)、76%/75%(ローレ–ロンカス–正常)、80%/80%(単一型)、62%/62%(全型) | 特殊なハードウェアが必要です。病気特異的ではありません |
| Ponomarchuk ら、2022年15頁 | コスワラ、ヴィルフィ | MFCC、メルスペクトログラム、ウェーブレット特徴 | CNN、RNN、アンサンブルモデル | AUC:0.93(内部)、0.79(外部) | データセット間の一般化は依然として困難です |
| Feng ら、2021年16 | コスワラ、ヴィルフィ | STFT、MFCC | SVM(RBF)、CNN | 精度81.25%(AUC 0.79) | データセット依存性能 |
| Islam 他、2022年、17頁 | 臨床咳の記録 | スペクトルおよび時間-周波数の特徴 | ディープニューラルネットワーク | 正確率:89.2% | 限られたデータセット |
| マンショリ、2022年18日 | ヴィルフィ | スペクトル解析の特徴 | 古典的ML分類器 | 命中率:95.86% | 小規模実験研究 |
| Huang ら、2020年19 | 10人のCOVID-19患者からの肺音 | 時間・周波数呼吸音解析 | 臨床専門家による分析 | 定性的検証 | 小規模なデータセット;MLモデルは使いません |
| W. D. プジャら、2024年、20頁 | Coswara, Virufy(咳の音データセット) | STFT、メルスペクトログラム、MFCC、RMSエネルギー、スペクトル帯域幅、スペクトル重心、スペクトルロールオフ、ZCR;CNNベースのディープ特徴抽出 | 1次元CNN(特徴抽出器)+ランダムフォレスト | 正確率:93% | パフォーマンスは咳の質に依存します。臨床診断ではなくスクリーニングのために設計されています。クラウドソースによるデータ変動性 |
| Chadagaら、2023年、21頁 | クラウドソースによる咳の音声録音 | メル分光図と時間周波数の音響特徴 | 畳み込みニューラルネットワーク(CNN) | 正確度:84%、正確さ:85%、呼び戻し率:84%、F1スコア:84% | パフォーマンスはデータの不均衡、自己申告ラベル、記録条件への感受性によって制限されます |
| Chadagaら、2023年、22頁 | 軽度から中等度のCOVID-19およびその他の呼吸器疾患の臨床マーカー | フィーチャーセレクション(ピアソン、PSO);主要マーカー:好酸球、アルブミン、T. ビリルビン、ALP、ALT、AST、HbA1c、TWBC | 重ねた衣装;1D CNN、LSTM、DN、残留MLP | 正確率:89% | 重症例は除外;RT-PCRの代替手段;説明可能なAIの応用 |
| Darら 2024年23頁 | COVID-19データセット | SJHBO最適化(Jaya+HBO+SO)、多くのスペクトル特徴 | ディープQネットワーク(DQN) | 正確度:95.11%、感度:95.06%、特異度:94.69% | 高い複雑性;調整はハイブリッドオプティマイザーによって改善されます |
| ジン・クィアンら 202024 | COVID-19患者の音声録音 | 音響機能セット;病気の重症度、睡眠の質、疲労、不安の分析 | サポートベクターマシン(SVM) | 0.69(病気の重症度) | 音声機能に限定され、中程度の精度;データセットサイズは指定されていません;健康面は4つだけ考慮されます |
| シャルマ、J.ら、2020年、25頁 | アーバンサウンド8K、ESC-10、ESC-50 | マルチフィーチャーチャンネル:MFCC、GFCC、CQT、クロマグラム;ミックスアップデータ拡張 | 空間的に分離可能な畳み込みと注意モジュールを持つディープCNN | UrbanSound8K:97.52%、ESC-10:94.75%、ESC-50:87.45% | ベンチマーク外や実世界データセットでテストされていない場合;より深いCNNと注意加群による計算複雑さ |
| レラ KK ほか 202126 | 呼吸音;COVID-19、喘息、健康) | データ拡張;MFCCの代わりにData De-noising Auto Encoder(DDAE)を用いた深層機能 | 1次元畳み込みニューラルネットワーク(1次元CNN) | ~90% | データセットの詳細は限定的です。MFCCより~4%改善;一般化可能性は検証されていません |
| Orlandic ら、2021年、27頁 | 咳(25k+の咳) | MFCCs、PSD、スペクトルおよび時間の特徴 | XGBoost | AUC 96.5%、精密度95.5% | 自己申告のCOVID;サブセットの専門家ラベル |
| Zhang ら、2023年43頁 | COVID-19ワクチン接種後のHLHの公開症例報告(文献データベース) | システマティックレビュー;臨床特徴集約;分子ドッキング解析 | 該当しない(臨床レビュー) | 記述統計;臨床結果 | 稀事象分析;サンプル数は少なく、報告された事例に依存すると、報告バイアスが生じる可能性があります |
| Xuら、2023年44頁 | 文献からのワクチン関連VKH疾患の報告例 | 回顧的事例レビュー;臨床および画像特徴解析 | 該当しない(臨床観察研究) | 治療反応と臨床回復の結果 | 限られた症例数;対照群の欠如;因果関係は確固たるものではありません |
| Hu ら、2025年45頁 | 中国におけるSRDI医療機器企業の親会社データ(Qixinbaoデータベース) | ソーシャルネットワーク分析;空間ネットワークの指標、地理的検出器解析 | 該当しません(ネットワークおよびポリシー分析) | ネットワーク密度、中心性、拡散指数 | 断面設計;企業の均等な重み付け;直接的なパフォーマンスや臨床結果の指標はありません |
表1:既存のCOVID-19音声検出研究の要約。 過去の咳・音声スクリーニング手法の比較概要、データセット、方法、報告されたパフォーマンスを含む。 この表をダウンロードするには、こちらをクリックしてください。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
提案された方法論
本研究は、咳の信号からCOVID-19を検出するための生成AIベースのフレームワークを提案します。このフレームワークは生成モデルと判別分類器を統合し、トレーニングデータと評価データは厳格に分離されています。 図1 は提案されたGAN–VAE–ADCNNフレームワークの詳細なアーキテクチャを示しており、音声前処理と特徴抽出から変分自動エンコーダ(VAE)による潜在表現学習、生成的敵対ネットワーク(GAN)を用いた合成特徴生成、そして深層畳み込みニューラルネットワーク(DCNN)および注意ベースDCNN(ADCNN)を用いた最終分類の流れを示しています。図は生成コンポーネントが訓練中のみ使用され、分類は識別モデルを用いて行われていることを示しています。

図1:GAN–VAE–ADCNNアーキテクチャの概要。 咳由来の音響特徴をVAEで符号化し、GANベースの合成サンプル生成を経て拡張し、DCNNおよび注意ベースのDCNN(ADCNN)モデルを用いて分類する提案されたハイブリッドパイプラインの概説。 この図の拡大版はこちらをクリックしてご覧ください。
モデルアーキテクチャと実装
このフレームワークで用いられた生成モデルと判別モデルは、固定および再現可能なアーキテクチャで実装されました。GANは、ReLU活性化を用いた3層の完全接続層(128、256、512ユニット)を持つジェネレーターと、LeakyReLU活性化による3層の完全接続層(512、256、128ユニット)を持つ識別器と、その後シグモイド出力によるもので構成されています。
VAEエンコーダは、256および128ユニットの2つの完全連結層で構成され、その後に潜在平均および分散推定が64の潜在次元で行われます。デコーダはこの構造を反映し、再構成損失とカルバック–ライブラー発散の組み合わせを用いて、構造化かつ確率的な潜在空間を学習する訓練を行います。
DCNN分類器は、3×3カーネルを持つ4つのコンボリューションブロックと、それぞれ32、64、128、256のフィルターで構成されています。各ブロックの後にはバッチ正規化、ReLUの有効化、2x2の最大プーリングが続きます。ADCNNは、最終畳み込みブロック後にチャネルごとの注意メカニズムを組み込むことでDCNNを拡張します。すべてのモデルはAdam最適化器を用いて最適化され、学習率は0.0001、バッチサイズは32でした。 図1に示されているように、VAEとGANは訓練中のみ動作し、DCNNとADCNNは分類に使用されます。完全な訓練および評価手順はアルゴリズム1にまとめられています。
アルゴリズム1:GAN–VAEベースのCOVID-19検出フレームワーク
入力: 前処理済み咳の音声録音
出力: 二項分類ラベル(COVID-19陽性/陰性)
研修および評価手順は固定された再現可能なパイプラインに従って行われました。すべての咳の音声録音は16kHzにリサンプリングされ、ノイズリダクションをかけられ、振幅正規化されました。記録は固定長のセグメントに分割され、そこからMFCC、クロマ、スペクトルの特徴が抽出されました。各オーディオセグメントから合計40のメル周波数セプストラル係数(MFCC)が抽出されました。さらに、12のクロマ特徴も計算されました。その結果、各咳のセグメントに対して52次元の特徴ベクトルが形成されます。被験者レベル分割を行い、データを訓練、検証、テストセットに分割しました。VAEは確率的な潜在表現を学習するために訓練され、得られた潜在ベクトルは合成特徴生成のためのGANの訓練に用いられました。トレーニングデータセットはGAN–VAE生成サンプルを用いて拡張され、合成データは検証およびテストから除外されました。DCNNおよびADCNN分類器は拡張訓練データを基に訓練され、最終評価は標準的なパフォーマンス指標を用いて実施されたテストセットで行われました。
トレーニングセットアップ、データ分割、漏洩防止
すべての実験は固定され再現可能な訓練構成で実施されました。データ分割は、音声セグメンテーションの前に被験者レベルで行われ、データの漏洩を防ぎました。データセットはトレーニング、検証、テストセットに80:10:10の比率で分割され、同じ記録からのすべてのセグメントが単一のサブセットに割り当てられるようにしました。トレーニングセットはモデル学習と生成データ拡張に、検証セットはハイパーパラメータチューニングと早期停止に、テストセットは最終的な性能評価のために保留されました。GAN–VAEフレームワークで生成された合成サンプルは訓練中のみ使用され、公正な評価を確保するために検証および試験から厳格に除外されました。
モデルは最大100エポックで訓練され、検証損失と10エポックの耐性に基づく早期停止が行われました。最適化は学習率0.0001、バッチサイズ32でAdam optimizerを用いて実施されました。分類には二値クロスエントロピー損失を適用し、VAEおよびGANコンポーネントの学習にはそれぞれ再構築損失と対抗的損失が用いられました。この統合されたトレーニングおよび評価プロトコルにより、再現性が保証され、データの漏洩を防ぎ、トレーニングと評価の段階を厳格に分離しています。
データセットの説明
公開されている咳の音声データセットであるCOUGHVIDとVirufyは、大規模な音響多様性と臨床的に参照されたラベルのバランスを取るために用いられ、訓練と評価における役割が明確に分離されました。
COUGHVIDは、部分的な専門家による注釈と自己申告メタデータを備えた咳の録音をクラウドソースしたコレクションです。データの品質を確保するため、最小信号持続時間、十分な信号対雑音比、破損または曖昧なサンプルの除去、症状メタデータを含む識別可能な咳事象の有無など、あらかじめ定められた品質管理基準を適用して428件の録音を選定しました。前処理とセグメンテーションを経て、これらの録音は1,719の咳き込みセグメントを生み出し、16kHzのサンプリングレートでWAVフォーマットに標準化されました。COUGHVIDは生成モデルと判別分類器の両方の訓練に使用されました。
Virufyは、医師の監督下でCOVID-19のRT-PCR陽性または陰性とラベル付けされた咳の記録で構成されています。利用可能な16の録音すべてが含まれており、セグメンテーション後に234の咳き込みセグメントが収録され、これも16kHzに標準化されました。Virufyは外部クロスデータセット評価に専念され、一般化性能を評価するためにのみ使用され、トレーニング、ファインチューニング、生成的拡張には使用されませんでした。
したがって、提案された枠組みは臨床的に検証された診断システムとしてではなく、管理された実験条件下で評価された概念実証スクリーニングアプローチとして解釈されるべきです。
データ前処理とセグメンテーション
すべての録音は16kHzにリサンプリングされ、モノラルに変換され、サイレンス除去、スペクトルノイズリダクション、振幅正規化が施されました。データ漏洩を防ぐために被験者レベルの分割後にセグメンテーションが行われました。各録音は重なり合う2〜4sセグメントに分割され、低エネルギーまたは無音のセグメントは破棄されました。
外部検証プロトコル
外部検証はクロスデータセット評価を通じて実施されました。COUGHVIDで訓練されたモデルは外部検証のためにVirufyで評価されました。このプロトコルは、前向きな臨床検証ではなく、異なる条件下で収集されたデータセット間の一般化を評価するものです。 図2 はこのワークフローのプロトコルレベルの概要を示し、データセットの使用、前処理、特徴抽出、分類器の訓練、評価シナリオを示しています。 図1 が内部モデルアーキテクチャに焦点を当てているのに対し、 図2 は訓練および試験段階を通じた実験設計とデータフローを強調しています。

図2:提案されたCOVID-19咳スクリーニングフレームワークのワークフロー。 前処理、特徴抽出(MFCC、クロマ、スペクトル特徴)、GAN–VAEベースの表現学習と拡張(訓練のみ)、被験者レベル分割およびクロスデータセット評価による最終分類を含む完全な処理パイプラインの図。 この図の拡大版はこちらをクリックしてご覧ください。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
データセットの構成とクラス分布分析
前処理とセグメンテーションの結果、COUGHVIDおよびVirufyデータセットは、データセットの規模とセグメント密度の両方で大きな差を示しました。COUGHVIDは444件中428件(96.4%)、1,953件の咳セグメント中1,719件(88.0%)を寄与し、モデルトレーニングおよび生成的拡張の主要なデータセットとしての役割を果たしていることを確認しました(図3)。対照的に、Virufyは16件(3.6%)と234件の咳断片(12.0%)のみを提供し、外部クロスデータセット評価専用に予約されていました。特筆すべきは、より小さいサイズにもかかわらず、VirufyはCOUGHVIDと比較して1回の記録あたりの平均セグメント数が多く、記録構造や分割結果の違いを反映していることです(図3)。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
結果は、提案された生成AIベースのフレームワークが異種データセットの咳信号からCOVID-19を検出できることを示しています。 表4 および 表6に示されているように、GAN–VAEハイブリッドモデルは97.2%の精度とAUROC0.953という最高の性能を達成し、高精度、リコール率、F1スコア、特異性も高く、分類のバランスの取れた性能を示しています。
生成モデルと判別分類器を組み合わせると、パフォーマンスは一貫して向上しました。GAN–DCNNおよびVAE–ADCNNはそれぞれのベースラインモデルを上回っており、生成的拡張が特徴学習と一般化、特にクラス不均衡下および臨床検証データの限界を支持していることを示唆しています。MFCCの特徴は、データセット間で最も強力な個別識別性能を提供しました。クロマおよびスペクトルコントラストの特徴は個別では性能が低下しましたが、MFCCCと組み合わせることで異種記録条件下での堅牢性が向上しました。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者から利益相反の可能性は報告されていません。
本論文作成期間中、貴重な指導、継続的な支援、建設的なフィードバックをいただいたコンピュータサイエンス工学部の教員および研究指導者の皆様に心より感謝申し上げます。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| 咳ウイルスデータセット | & Eacute;コール・ポリテクニーク Fé可愛い;ローザンヌの街(EPFL) | 一般公開(2021年) | 自己申告メタデータと部分的な医師注釈を含むクラウドソース咳音声データセット;主にトレーニングやデータ拡張に使用されます。 |
| CUDAツールキット | NVIDIA | 11.3 | GPUアクセラレーションフレームワークは、モデルのトレーニングと推論を高速化するために使用されます。 |
| リブローサ | オープンソース | 0.9 | リサンプリング、セグメンテーション、MFCC抽出、スペクトル特徴計算に使用される音声解析ライブラリ。 |
| Linuxオペレーティングシステム | 正典 | Ubuntu 20.04 LTS | すべての実験およびモデルトレーニングに使用されるオペレーティングシステム。 |
| Matplotlib | オープンソース | 3.5 | データセット分布と評価結果のプロットに使用される可視化ライブラリ。 |
| NumPy | オープンソース | 1.21 | 配列操作および信号処理に使用される数値計算ライブラリ。 |
| NVIDIA GPU | NVIDIA | テスラ/RTXクラス | 深層モデルや生成モデルの訓練に使用されるグラフィックス処理装置。 |
| Pythonプログラミング言語 | Pythonソフトウェア財団 | 3.8 | データ前処理、特徴抽出、モデル開発、評価に使用されるコアプログラミング環境。 |
| パイトーチ | Meta(Facebook AIリサーチ) | 1.12 | GAN、VAE、DCNN、注意ベースのDCNNモデルを実装するために使用されたディープラーニングフレームワーク。 |
| Scikit-learn(シキット学習) | オープンソース | 1 | データ分割、クラス重み付け、パフォーマンスメトリクス計算に使用される機械学習ライブラリ。 |
| サイピー | オープンソース | 1.7 | 音声前処理および信号変換に使用される科学的計算ライブラリ。 |
| Virufyデータセット | ヴィルフィ | 一般公開(2021年) | RT-PCR&ndashを用いた臨床的に収集された咳の記録;検証済みのCOVID-19ラベル;外部検証およびデータセット間評価専用に使用されます。 |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト