このコンテンツを表示するには、JoVEへの購読が必要です。 または、無料トライアルをお申し込みください。

方法論記事

機械学習に基づく咳の緊張分類: 慢性閉塞性肺疾患および気道感染症の診断調査

1.1K 回視聴

DOI:

10.3791/68222

2025年9月19日

* These authors contributed equally

この記事について

サマリー

この研究は、音声信号処理技術と機械学習アルゴリズムの統合を利用して、慢性閉塞性肺疾患 (COPD) と診断された患者から咳音データを取得することにより、2 つの異なるカテゴリの自動分類を効果的に達成しました。

要約

この研究の目的は、音声信号分析と機械学習を使用して、慢性閉塞性肺疾患 (COPD) 患者と気道感染症 (RTI) 患者を区別するための非侵襲的方法を開発および評価することでした。固定パターンの音声信号は、25 人の COPD 患者と 25 人の RTI 患者 (対照群/比較群として機能) から収集されました。多次元音声特徴分析を実行して、2 つのグループを有意に区別する特徴を特定しました。統計的に有意な特徴が選択され、次元削減が行われました。次に、ロジスティック回帰 (LR) モデルとランダム フォレスト (RF) モデルをトレーニングし、COPD と RTI を区別する際の分類性能について評価しました。最初に 400 を超える音声機能が分析されました。18 の特徴は、COPD 患者と RTI 患者の間で非常に有意な差を示しました (P <; 0.05)。COPD 患者と RTI 患者を区別するタスクでは、LR モデルは 0.95 の曲線下面積 AUC を達成し、RF モデル (AUC = 0.76) を大幅に上回りました。この研究は、COPD と RTI を区別するための有望な非侵襲的ツールとして、音声分析と機械学習、特に LR モデルを使用することの実現可能性を実証しています。これは、呼吸器疾患の鑑別診断を必要とする臨床現場におけるこの音声ベースのアプローチの実用化とさらなる最適化の基盤を提供します。

概要

慢性閉塞性肺疾患 (COPD) と気道感染症は、世界規模で死亡率と罹患率に大きく寄与しています。COPD は、主に喫煙によって誘発される、気道と肺実質に影響を与える慢性炎症状態として定義されます。持続的な咳、呼吸困難、痰の産生の増加などの症状が特徴です1。世界保健機関は、2030 年までに COPD が世界第 3 位の死因にランクされ、多大な経済的負担を課すと予測しています 2,3。対照的に、気道感染症 (RTI) は世界の疾病負担の約 6% を占めており、虚血性心疾患、HIV 感染、がん、マラリア、下痢性疾患に関連する負担を上回っています4

2 つの疾患の臨床症状、特に一般的な症状である咳の症状には実質的な類似性があるため、効果的な治療にはこれらの疾患を早期かつ正確に区別することが不可欠です 5,6。従来の診断アプローチは、主に臨床症状の評価、肺機能検査、および臨床検査に依存しています7。COPD の従来の診断方法は症状の特定と評価に効果的ですが、臨床現場ではいくつかの制限があります。これらの制限には、不十分な診断精度、早期診断の能力の制限、疾患の不均一性の理解の不十分、および動的モニタリングの欠如が含まれます 8,9,10,11。COPD の従来の診断方法とは対照的に、音声診断テクノロジーは新たな補助ツールとして、特に早期発見、非侵襲的診断、動的モニタリングにおいて多くの利点をもたらします。

音声分析、特に咳音の自動分析の進歩により、迅速な診断アプリケーションの可能性が生まれています。研究によると、咳の音には肺疾患に関する広範な情報が含まれており、その音響的特徴は気道の健康状態の変化を反映しています12。最近、音声特徴分析のための機械学習ベースの技術がCOPDやその他の症状の診断に採用されており、注目すべき結果をもたらしています13,14,15。これらの方法論は、周波数、持続時間、振幅などの咳音から音声特徴を抽出し、それらをパターン認識のための機械学習アルゴリズムと統合することで、病気の効果的な分類を容易にします。

疾患診断における咳音分析の可能性を調査したいくつかの研究にもかかわらず、COPD 患者と RTI 患者を区別するには重大な課題が依然として残っています。この困難は、両方のグループの咳音の特性が重複していることが原因で発生し、個人差によってさらに悪化します。したがって、咳の音からより正確で区別可能な特徴を抽出する方法の開発は、この分野で依然として重要な問題です。

この研究では、COPD と診断された 25 人の患者と RTI の 25 人の患者の音声を録音することにより、咳音の自動分類方法を調査することを目的としています。音声特徴分析と機械学習アルゴリズムを統合することで、疾患鑑別の精度を高め、それによってCOPDとRTIの早期診断能力を向上させることを目指しています。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

プロトコル

北京中医薬大学倫理委員会とその第三付属病院は、この調査研究を承認しました。すべての参加者は、参加について書面によるインフォームドコンセントを提供しました。2024 年 7 月から 8 月にかけて、北京中医薬大学第三附属病院の呼吸器内科から 25 人の COPD 患者のコホートが募集されました。同時に、典型的な上部 RTI を持つ 25 人の患者からなる対照群も組み立てられました。

1. 参加者の選定

  1. 包含基準
    1. バックグラウンドノイズが少なく、アーティキュレーションがクリアなオーディオサンプルを選択します。
    2. COPD グループの COPD 診断が、肺の専門家によって設定された臨床ガイドラインによって義務付けられていることを確認してください。
      1. GOLD 2024 基準に従って、気管支拡張薬投与後の肺活量測定 (FEV1/FVC < 0.70) によって診断を確認します。
      2. 臨床的安定性の検証(4週間≥増悪なし)
    3. 比較グループが典型的な上部 RTI に苦しむ人々で構成されていることを確認してください。
      1. 呼吸器感染症診断・治療ガイドラインの診断基準を用いて診断します。
      2. 症状の発症時間を 72 時間≤してください。
      3. 慢性呼吸器疾患の病歴を除外します。
    4. 年齢を18〜85歳に制限します。
    5. すべての参加者が研究に参加するための書面によるインフォームドコンセントを提供するよう要求します。
  2. 除外基準
    1. 声帯障害や喉頭炎などの言語障害を経験している参加者は除外します。
    2. 言語機能や認知機能を損なう可能性のある神経学的状態の参加者を除外します。
    3. 重大な聴覚障害のある参加者を除外します。
    4. 研究プロトコルを遵守しなかった参加者、または十分な数の音声サンプルを提供しなかった参加者を除外します。
    5. インフォームドコンセントを提供できない参加者を除外します。

2. 研究デザイン

  1. 参加者を、外部騒音レベルを 30 dB 未満に維持した静かで隔離された標準的な臨床相談室 (4 m × 5 m の寸法) に移動します。自然で快適な姿勢で座ってもらい、リラックスした状態を保ちます。
  2. 身長、体重、年齢、その他の関連情報など、参加者の重要な詳細を細心の注意を払って文書化し、現在の健康状態を医師に確認します。
  3. 最初のデータ記録が完了したら、マイクの高さを適切な位置に調整し、マイクと参加者の唇の間に約20〜30cmの距離を確保します。
  4. プロ仕様のポータブルハンドヘルドマルチトラックレコーダーを使用して、サンプリングレートを均一に44.1kHzに設定してオーディオ録音を収集します。
    1. 毎日の記録セッションの前にデバイスのキャリブレーションを実行します。画面にCALと現在のレベル値が表示されるまで、ターゲットチャンネルのGAINノブを2秒間押し続けます。
    2. 画面に表示される入力レベルがテストトーンの公称値と正確に一致するまで、 GAIN ノブをゆっくりと回して、ゲインを目標値に調整します。≤±1dB以内の誤差範囲を確保します。
  5. サンプリングチームの指導の下、参加者の状態に応じて自然に咳をします。録音装置を使用して咳の音をキャプチャします。
  6. 音声を「」として録音します。WAV'ファイル形式。
  7. 異常な音声セグメントは、手動検証によって補完された音声アクティビティ検出 (VAD) を使用して削除されました。信号対雑音比 (SNR) しきい値 >20 dB を満たした録音が研究に含まれました。
    注: 完全な方法論は、GitHub リポジトリ (https://github.com/Liteng811/speech-feature-index-database-construction) で入手できます。

3. ボーカル機能リポジトリの開発

注: 音声特徴インジケーター データベースは、COPD と RTI の音声パターンの比較分析のための音響特性のコレクションです。方法論のアーキテクチャを 表 1 に詳しく示します。その構築のためのオープンソースのコードベースが実装されており、GitHub (https://github.com/Liteng811/speech-feature-index-database-construction) からアクセスできます。以下の手順では、コードのダウンロードと実行について詳しく説明します。

  1. MathWorks の公式 Web サイト (https://www.mathworks.com/) から MATLAB をコンピューターにインストールします。オペレーティング・システムに適したバージョンが選択されていることを確認します。MATLAB が正しくインストールされていることを確認するには、MATLAB ソフトウェアを起動し、コマンド ウィンドウに 「ver 」と入力します。正しくインストールされていれば、MATLAB のバージョン情報が表示されます。
  2. Git の公式 Web サイト (https://git-scm.com/) から Git をインストールします。インストールが成功したことを確認するには、コマンドライン(Windowsの場合はコマンドプロンプト、Mac/Linuxの場合はターミナル)に次のコマンドを入力します:git --version。Git が正常にインストールされている場合は、バージョン情報が表示されます。
  3. コードリポジトリの取得
    1. コマンドラインインターフェイスを使用して、git cloneコマンドを実行し、プロジェクトファイルをローカルマシンにダウンロードします。
      git clone https://github.com/Liteng811/voice-feature-index-database-construction.git
      注: この操作により、現在の作業ディレクトリに「voice-feature-index-database-construction」という名前の新しいディレクトリが作成され、すべてのプロジェクト ファイルが含まれます。
    2. ダウンロードしたフォルダーにアクセスし、次のコマンドを実行してその内容を管理します。
      cd voice-feature-index-database-constructionです。
  4. MATLAB 環境のセットアップ。
    1. MATLAB アプリケーションを起動します。
    2. プロジェクト フォルダーを MATLAB 検索パスに統合します。[ ホーム ] タブに移動し、[ パスの設定]、[ フォルダーの追加] の順にクリックします。複製された voice-feature-index-database-construction ディレクトリを選択し、変更を保存します。これにより、MATLAB は必要なすべてのスクリプトにアクセスできるようになります。
    3. MATLAB の [現在のフォルダー ] パネルで、メインの処理スクリプト (voiceH6_batch_3_stage_WAV_tt.m) をダブルクリックして開きます。
  5. データの準備。
    1. 解析には、 .wav または .pcm 形式の入力オーディオファイルが必要です。
    2. これらのオーディオファイルへのパスは、スクリプト内にハードコードされています。これらのパス変数を更新して、ローカルシステム上の正しい場所を指すようにします。
  6. スクリプトの実行。
    1. メイン スクリプト (voiceH6_batch_3_stage_WAV_tt.m) を開いた状態で、[ 実行] ボタンをクリックするか、スクリプト名を MATLAB コマンド ウィンドウに直接入力して処理を開始します : voiceH6_batch_3_stage_WAV_tt。
    2. スクリプトにはユーザーの操作が必要です。MATLAB は、適切なオーディオ ファイルまたはフォルダーを選択するようにユーザーに求めるグラフィカル インターフェイスを表示します。処理用に選択したオーディオ ファイルまたはフォルダーがプロンプトと一致していることを確認します。
    3. MATLAB でスクリプトを実行するときにグラフィカル インターフェイスがフリーズしたり表示されなかったりする問題が発生した場合は、MATLAB バージョンとの潜在的な互換性の問題を確認するか、オペレーティング システムのグラフィックス ドライバーが正しく機能していることを確認します。
  7. 結果を出力します。完了したら、スクリプトが特徴抽出結果を書き込む.txt出力ファイルを検索します。出力ファイルには、音声特徴認識結果などの情報が含まれます。

4. データ分析

注:声の特徴指標データベースの組み立てに続いて、統計分析が実施されました。分析アプローチを 表2に概説します。マンホイットニー U 検定を使用して、COPD グループと RTI グループ間の音声信号の特徴の違いを評価しました。

  1. マンホイットニーUのテスト。
    注:音声特徴インデックスライブラリを取得した後、SPSS 20.0を使用してデータに対してマンホイットニーU検定を実行しました。操作プロセスは次のとおりです。
    1. SPSS を開き、データ・ファイルをロードします。
    2. メニューバーから[2つの 独立サンプル>レガシーダイアログ>ノンパラメトリック検定>解析 ]を選択します。
    3. ポップアップダイアログボックスで、次の操作を行います。
      1. 検定変数リスト:比較する変数(観測変数)を選択します。
      2. グループ化変数: グループ化変数 (グループ化に使用される変数) を選択します。
      3. [ グループの定義 ] ボタンをクリックして、ポップアップ ウィンドウに 2 つのグループの識別子を入力します (たとえば、「グループ 1」と「グループ 2」としてグループ化されている場合は、1 と 2 を入力します)。
    4. [ テストタイプ]で、 マンホイットニーUテスト を部分的に選択します。
    5. OK」をクリックすると、SPSS が自動的に出力を生成します。
  2. 主成分分析(PCA)
    注:統計的に有意な特徴の特定に続いて、高度なデータ探索に主成分分析(PCA)を採用しました。この手法は、元の変数を重要な情報を保持し、データセットの解釈可能性を簡素化する複合コンポーネントのより小さなセットに凝縮することで、次元を減らします。PCA を実行する前に、スケール関連のバイアスを軽減するために、データは統計ソフトウェアによって自動的に標準化されました。手順は次のように実行されました。
    1. データが照合され、Excel または CSV 形式で保存され、SPSS 20.0 にインポートされていることを確認します。
    2. [ファイル] > [>データを開く] を選択し、開くファイルを選択します。
    3. データ内の欠損値と外れ値が処理され、変数が標準化されていることを確認します。
    4. SPSS での PCA 分析の場合は、「次元削減>係数>分析」をクリックします。
    5. ダイアログボックスで、PCA で使用されるすべての変数を [変数] フィールドに追加します。これらの変数は通常、連続データです。
    6. 抽出方法を設定します。
      1. ダイアログボックスで、[ 抽出 ]ボタンをクリックし、[ 主成分 ]法を選択します。デフォルトでは、SPSS はデータの分散を説明するのに十分な主成分を抽出します。
      2. 保持基準として 1 より大きい固有値を選択すると、固有値が 1 より大きい主成分のみが保持され、通常、分散の大部分が説明されます。
    7. 回転方法を選択し、[ 回転] をクリックして、 Varimax (直交回転)または Promax (斜め回転)のいずれかを選択します。ほとんどのアプリケーションでは、Varimax が一般的に使用される回転方法です。
    8. オプションで、 スクリープロット係数行列 をチェックして、主成分の砂利図と各主成分の係数行列を出力して、保持分散の判断に役立てることができます。
    9. すべてのオプションを設定したら、[ OK ] ボタンをクリックすると、SPSS が出力を生成します。
    10. 結果の解釈。
      1. 主成分負荷行列を解釈して、主成分と元の変数の間の関係を識別します。負荷値が高い変数は、変更への寄与度が大きくなることに注意してください。
      2. 「合計差異の説明」表を使用して差異を説明します。各主成分の固有値と分散比率を観察します。通常、ほとんどのデータ変動を説明するため、分散比率が大きい主成分を選択します。
      3. スクリープロットを使用して、保持主成分を決定します。プロット内の明確な変曲点を特定します。変曲点の左側に主成分を保持します。
      4. 主成分スコア: 主成分の各サンプルのスコアを取得する必要がある場合は、 変数として保存 をオンにすると、SPSS は主成分スコアを新しい変数としてデータセットに追加します。

5. ロジスティック回帰 (LR) モデルとランダム フォレスト (RF) モデルの構築

注:LRおよびRFモデルを構築するための具体的な方法論的フレームワークを表3に詳述します。一方、この研究のLRモデルとRFモデルはGitHub(https://github.com/Liteng811/The-distinction-between-COPD-and-respiratory-infections)にアップロードされています。以下では、主に GitHub からコードをダウンロードして実行する方法について説明します。RFモデルは、主要なプログラミング言語としてPython 3.12.3を使用して構築されました。

  1. プロジェクト コードベースを取得します。
    1. ターミナルまたはコマンドプロンプトを起動し、git cloneコマンドを実行してリポジトリをローカルにダウンロードします。
      git clone COPDと呼吸器感染症の区別.git COPDと呼吸器感染症の区別
      このコマンドは、すべてのリポジトリの内容を現在の作業ディレクトリに取得し、The-distinction-between-COPD-and-respiratory-infections というタイトルの新しいフォルダーを生成することに注意してください。
  2. プログラミング環境をセットアップします。
    1. 公式配布サイト(https://www.python.org/)からPythonをダウンロードしてインストールします。
    2. 次のコマンドを使用して、要件ファイルにリストされているすべての Python 依存関係をインストールします: pip install -r requirements.txt
    3. requirements.txt ファイルが使用できない場合は、次のコマンドを実行して、重要なライブラリを手動でインストールします。
      pip install numpy pandas scikit-learn matplotlib
    4. JetBrains の公式 Web サイト (https://www.jetbrains.com/pycharm/) から PyCharm 統合開発環境をインストールします。
  3. リポジトリの内容を調べます。
    1. リポジトリで、メインのスクリプトファイル(LR.py、RF.py)を見つけます。
    2. コード エディターまたは PyCharm を使用してこれらのファイルを開き、実装と構造の詳細を確認します。
  4. 入力データを準備します。
    1. 必要なデータセットが、コードで期待されている.xlsx形式で利用可能であり、実行前に適切に整理されていることを確認してください。
    2. コードには、ハードコードされたファイル パスが含まれています。これらのパスを更新してファイルの実際の場所を反映させ、コード内の既存のパス ( C:\Users\1\Desktop\pca-result.xlsx など) をシステム上の実際のファイル パスに効果的に置き換えます。
  5. コードを実行します。
    1. メインスクリプトを見つけたら、コマンドラインから実行します。たとえば、LR.py を実行するには、python LR.py を使用します。
      ターゲットスクリプトが RF.py の場合は、それに応じてファイル名を置き換えます。
    2. 実行する前に、ターミナルが正しい作業ディレクトリにあることを確認するか、スクリプトへのフルパスを指定します。例えば:
      python C:/path/to/your/repository/LR.py です。
    3. 操作中、スクリプトはデータセットをロードし、対応する機械学習モデル (LR または RF) をトレーニングし、精度、混同行列、ROC 曲線などのパフォーマンス指標を生成します。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結果

データ分析結果

この研究では、時間領域分析、周波数領域分析、メル周波数頭蓋係数 (MFCC) の抽出、TCM 診断による特徴指標の変更などの方法を使用して、400 を超える音声特徴指標の分離に成功しました。時間領域の分析は音声信号処理において重要な要素であり、信号時系列データを直接操作して、エネルギー、オーバーゼロレート、線形傾向とエンベロープ、自己相関研究、振幅変調などの信号特性を直感的に理解することに焦点を当てています 16,17,18,19,20.周波数領域解析は、フーリエ変換を介して時間領...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

ディスカッション

この研究では、音声信号分析と機械学習技術を通じて COPD を検出するための非侵襲的方法を調査します。これには、25 人の COPD 患者と 25 人の RTI 患者から音声データを収集することが含まれていました。モデルは、LR および RF アルゴリズムを使用して構築されました。どちらのモデルも、サンプル全体を正しく分類する上で同様の精度を示しましたが、AUC値の違いは、LRモデルが感度と特異度の優れたバランスを提供する可能性があることを示しています。後続のセクションでは、研究成果の詳細な調査を提供します。

この研究では、LR モデルはテスト セットで 90% の精度を達成し、RF モデルは 80% の精度を達成し、LR モデルは AUC 値 0.95 に相当し、RF モデルは AUC 値 0.76 に相当します。これは、LRモデルの固有の単純さにより、過学習に対する耐性が強化され、小さなデータシナリオでの堅牢性が向上し、正確な分類のために18の主要な特徴を効率的に利用できるためである可能性があります。逆に、RF...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

開示事項

著者らは、この研究の出版に関して利益相反はないと宣言しています。この研究の結果や解釈に影響を与える可能性のある営利団体からは、金銭的または非金銭的支援は受けていません。デザイン、データ収集、分析、原稿準備など、研究のすべての側面は、外部の影響とは無関係に実施されました。

謝辞

この研究は、中国国家自然科学基金青少年科学基金プロジェクト(プロジェクト承認番号:82104739)および河北省中医薬管理局の科学研究プログラム(プロジェクト番号:B2025032)の支援を受けました。著者らは、実験中に支援してくれたすべての教師と生徒に感謝したいと思います。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

材料

この記事で使用された材料の一覧
名前会社カタログ番号コメント
デジタルレコーダーズームH6ZOOMオーディオストア
GitHubギット2.47.1.2公式ウェブサイト
MatlabマスワークスR2024b公式ウェブサイト
パイチャームジェットブレインズ2024.1公式ウェブサイト
ニシキヘビニシキヘビ3.12公式ウェブサイト

参考文献

  1. Roth, M. Pathogenesis of COPD. Part III. Inflammation in COPD. Int J Tuberc Lung Dis. 12 (4), 375-380 (2008).
  2. Alsayari, A., Muhsinah, A. B., Almaghaslah, D., Annadurai, S., Wahab, S. Pharmacological efficacy of ginseng against respiratory tract infections. Molecules. 26 (13), 4095(2021).
  3. Iheanacho, I., Zhang, S., King, D., Rizzo, M., Ismaila, A. S. Economic burden of chronic obstructive pulmonary disease (COPD): A systematic literature review. Int J Chron Obstruct Pulmon Dis. 15, 439-460 (2020).
  4. Al Rajeh, A. M., et al. Acute upper respiratory tract infections admissions in England and Wales. Medicine (Baltimore). 102 (21), e33616(2023).
  5. Lieberman, D., et al. Pneumonic vs nonpneumonic acute exacerbations of COPD. Chest. 122 (4), 1264-1270 (2002).
  6. Hassan Naqvi, S. Z., Choudhry, M. A. Embedded system design for classification of COPD and pneumonia patients by lung sound analysis. Biomed Tech (Berl). 67 (3), 201-218 (2022).
  7. Rennard, S., et al. Introducing the COPD Foundation Guide for Diagnosis and Management of COPD, recommendations of the COPD Foundation. COPD. 10 (3), 378-389 (2013).
  8. Spyratos, D., et al. false diagnosis and treatment of COPD in a selected population in Northern Greece. Eur J Gen Pract. 27 (1), 97-102 (2021).
  9. Azleen, A., Wilkinson, T. Early COPD: current evidence for diagnosis and management. Ther Adv Respir Dis. 14, 1753466620942128(2020).
  10. Kostikas, K., et al. Clinical impact and healthcare resource utilization associated with early versus late COPD diagnosis in patients from UK CPRD database. Int J Chron Obstruct Pulmon Dis. 15, 1729-1738 (2020).
  11. Cosio, B. G., et al. Defining the asthma-COPD overlap syndrome in a COPD cohort. Chest. 149 (1), 45-52 (2016).
  12. Kilic, M., et al. GCLP: An automated asthma detection model based on global chaotic logistic pattern using cough sounds. Eng Appl Artif Intell. 127, 107184(2024).
  13. Idrisoglu, A., et al. COPDVD: Automated classification of chronic obstructive pulmonary disease on a new collected and evaluated voice dataset. Artif Intell Med. 156, 102953(2024).
  14. Karaarslan, O., Ergen, O., Belcastro, K. D. Respiratory sound-base disease classification and characterization with deep/machine learning techniques. Biomed Signal Process Control. 87, 105570(2024).
  15. Farrús, M., et al. Speech-based support system to supervise chronic obstructive pulmonary disease patient status. Appl Sci. 11 (17), 7999(2021).
  16. Akamatsu, N. Segmentation of speech utilizing the time-domain properties of speech signals. J Acoust Soc Am. 64, S179(1978).
  17. Joy, S., Upadhya, S. Speech analysis in time and frequency domain. Int J Eng Res Technol. 3 (1), 1-4 (2018).
  18. Do, H. D. Exploiting signal linear trend in the time domain to enhance speech feature. IEEE Access. 10, 117886-117899 (2022).
  19. Schroeder, R. M. New approach to time domain analysis and synthesis of speech. J Acoust Soc Am. 31 (6), 852-853 (1959).
  20. Garreth, P., Johnson, S. R., Green, G. G. R. Extracting amplitude modulations from speech in the time domain. Speech Commun. 53 (6), 903-913 (2011).
  21. Thomas, S., Ganapathy, S., Hermansky, H. Recognition of reverberant speech using frequency domain linear prediction. IEEE Signal Processing Letters. 15, 681-684 (2008).
  22. Malah, D. Efficient implementation of a frequency-domain technique for frequency scaling of speech signals. J Acoust Soc Am. 68 (S1), (1980).
  23. Képesi, M., Weruaga, L. Adaptive chirp-based time-frequency analysis of speech signals. Speech Commun. 48 (5), 474-492 (2006).
  24. Isangula, K. G., Haule, R. J. Leveraging AI and machine learning to develop and evaluate a contextualized user-friendly cough audio classifier for detecting respiratory diseases: Protocol for a diagnostic study in rural Tanzania. JMIR Res Protoc. 13, e54388(2024).
  25. Wang, Q., et al. Towards reliable respiratory disease diagnosis based on cough sounds and vision transformers. ArXiv. , (2024).
  26. Can machine learning be used to recognize and diagnose coughs. Bales, C., et al. 2020 International Conference on e-Health and Bioengineering (EHB), , (2020).
  27. Melek, N. Responding to challenge call of machine learning model development in diagnosing respiratory disease sounds. ArXiv. , (2021).

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

再版と許可

タグ

機械学習診断音声信号解析ロジスティック回帰モデルランダムフォレストモデル主成分分析音声特徴量抽出非侵襲的診断