本研究では、サウジアラビアのデータセットを用いた喘息検出のための複数の機械学習アルゴリズムを調査しています。喘息診断のために臨床データセットで機械学習を用いる最先端の手法と対照的に、提案された手法は診断精度が3.9%向上するなど、より良い性能を達成しています。
研究記事
本研究では、サウジアラビアのデータセットを用いた喘息検出のための複数の機械学習アルゴリズムを調査しています。喘息診断のために臨床データセットで機械学習を用いる最先端の手法と対照的に、提案された手法は診断精度が3.9%向上するなど、より良い性能を達成しています。
研究によると、喘息を含む慢性疾患の増加が確認されています。サウジアラビアの喘息患者数は、特にポストパンデミック時代における天候や生活様式の影響で懸念材料となっています。喘息を早期に検出し、病気を予防または早期治療を可能にする知的システムを構築することで感染を減らす解決策を求めています。本研究では、機械学習を活用して喘息の早期症状を追跡するツールを開発しています。機械学習を応用して喘息の発生を予測しようとする試みはこれまでにいくつかありました。それでも、特にサウジアラビアの文脈において、症状が現れる前段階での疾患の特定に焦点を当てることは比較的軽視されがちな分野です。本研究のデータセットはサウジアラビア・ダンマームのキングファハド大学病院から入手され、血液検査、ウイルス検査、生化学検査などの標準的な検査が含まれていました。データセットには17の有意属性が含まれており、328人の喘息患者に関する情報を含みます。そのうち165人が陽性、163人が陰性です。ここで適用される手法は、ランダムフォレスト(RF)、人工ニューラルネットワーク(ANN)、サポートベクターマシン(SVM)、ナイーブベイズ(NB)です。これらの方法はそれぞれの特徴に基づいて選ばれています。実験結果では、RF、SVM、ANNアプローチが94%の精度を得ており、これは最高精度であり、最先端の技術を3.9%向上させていることが明らかになりました。上記の精度を達成するために、17の可能な特徴のうち9つが用いられたことは注目に値します。RF、SVM、ANNは同じ精度を達成しているにもかかわらず、ANNの方が誤差コストが高いです。したがって、結果のパターンからRFとSVMが優れており、この問題には推奨されます。
広範な研究の結果、研究者たちは慢性疾患がますます一般的になっていることを観察しました。喘息は、呼吸困難や喘鳴が繰り返される慢性的な気道炎症性疾患です。喘息の有病率は世界的に異なり、子どもから大人まで1〜20%の範囲で、世界中で何百万人もの人々に影響を与えています。これらの大規模な変化は、各国の環境変動や、異なる評価ツールの使用、喘息の疫学的定義の違いに関連しています。喘息は他のよく知られた慢性疾患と比べて致死率が比較的低いです。しかし、報告によるとサウジアラビア王国の喘息パターンは3.4増加しています。
喘息は慢性的な炎症性疾患で、腔の狭さを引き起こします。航空ルートの狭窄は、体液の放出拡大や浮腫、上皮下線維症、平滑筋肥大による気管支の増厚によって引き起こされます。免疫細胞を含むさまざまな細胞タイプによって駆動される病態生理装置がこれらの状態を評価するために用いられています5.サウジアラビアでは厳しい気象条件と主に屋内での生活様式が強いため、喘息は最も広範囲に及ぶ慢性疾患の一つです。いくつかの調査で喘息の圧倒的な発生率が示されています。この病気は重大な問題となっており、早期対応システムが必要となり、事発数を減らし、早期に病気を予防・治癒するための早期治療が可能になるようにしています。
個人とは異なり、喘息は地域社会や家族に深い影響を与えます。制御されなければ、患者の生活に厳しい制限を課し、多くの日常生活の活動を妨げます。サウジアラビアでは、暑い大気、広範囲にわたる砂嵐、室内の空調・冷房システムの過剰使用などの厳しい天候条件が喘息の大きな要因となっています。サウジ胸部学会(STS)は呼吸器感染症に対する最良の薬を提供するために顕著な努力をしています7.しかし、感染率を下げるためには、特にパンデミック後(COVID-19)の状況では、喘息の予防診断が必要です。さらに、家族歴、喫煙、アレルギー性鼻炎がサウジ成人の喘息発症リスク要因として最も重要な要因であることが明らかになりました。研究の基盤となる他の要因を調査するために追加の研究が推奨されました。
本研究では、喘息診断に関する過去の研究を踏まえ、診断の正確性を高めることを目的としています。提案された手法には、ランダムフォレスト(RF)、人工ニューラルネットワーク(ANN)、サポートベクターマシン(SVM)、ナイーブベイズ(NB)が含まれ、これまでの研究で利用され、診断結果に著しい改善をもたらしています。例えば、研究者たちはANN、SVM、NBを研究8、9、10で用いています。本研究では、機械学習手法が喘息疾患の最小の兆候さえも早期段階(症状前段階)で検出する早期警戒システムとして研究されています。特にパンデミック後の時代における喘息疾患の有病率は、厳しい気象条件による屋内生活、空調ダクト、砂嵐などの要因として挙げられます。しかし、最近の過去に観察された重要な要因を調査した注目すべき研究は存在しません。この研究ギャップを埋めるために、本研究はサウジ成人における喘息の早期発見における機械学習の役割を調査することを目指しています。さらに、主な目的は最小限の特徴で可能な限り高い精度を達成することです。過去には喘息の有無を予測するために機械学習を活用しようとする明確な試みがありました。本研究は、東部州の公立病院から得られたサウジアラビアのデータセットを初めて活用し、早期診断(予防的診断)に焦点を当てることを目指しています。機械学習(ML)は、収集されたデータから知識を抽出する手法として認識されています11,12。これは、さまざまな機械学習手法を用いて、以前のインスタンスの学習過程から得られた予測精度を提供します。MLは、疾患存在の早期発見など、広範な医療分野における分析的・予測的問題に対処するための複数の手法、アルゴリズム、戦略を含みます13,14。
喘息疾患を予測するために、さまざまな手法を用いていくつかの研究が行われています。研究者たちは、動的および静的検査に基づく喘息分類のための人工ニューラルネットワーク(ANN)を開発しました。肺活体計、インパルスオシロメトリー(IOS)、聴診、アレルギー結果、症状に関する情報などの測定パラメータがANNに利用されます。定義された情報により、ANNは適切な喘息分類を提案できます。同様に、研究者たちは胸部疾患の診断における課題に対処するための研究を実施しました。サポートベクターマシン(SVM)および適応型SVM(ASVM)法が喘息などの胸部疾患の診断に用いられました。すべての胸部疾患において、ASVM法を用いて最良の分類精度が得られました。研究者たちは、胸部疾患診断(喘息疾患15を含む)に、1層および2層の隠れ層を持つ逆伝播アルゴリズム(BPA)を用いた多層NN(MLNN)、確率的 NN(PNN)、学習ベクター量子化(LVQ)、一般回帰NN(GRNN)など複数のニューラルネットワーク構造を用いました。さらに、人工免疫系(AIS)を用いた胸部疾患の診断を目的とした比較研究も実施しました。これらの研究は、それぞれ異なるデータセットを用いて胸部疾患の診断にさまざまな構造を導入しています。喘息に関しては、AISを用いて90.91%の総精度で最高の結果が得られました16。さらに、研究者たちは喘息診断の精度向上における深層ニューラル(DNN)の有効性を調査し、特にロジスティック回帰やSVMを用いたさまざまな機械学習アルゴリズムの予測性能を比較しました。この研究は、喘息症状モデルを用いた経験的検査が喘息9の正確な診断により効果的であることを示しました。別の研究では、SVMやNaïve Bayesなどの機械学習手法を用いて、遠隔モニタリングデータを活用して喘息悪化を予測する機械学習の大きな能力が示されました。実験10は、
それ以外にも、研究者たちはSVM、k-NN、適応ブースティング(AdaBoost)、極限勾配ブースティング(XGBoost)など、アルツハイマー病(AD)を予防的に診断するために複数の機械学習手法を用いています17。研究者たちは、NB、SVM、K-NN、ANNという4つの機械学習アプローチを調査し、糖尿病の予備診断も行いました。サウジアラビアのデータセットの上位3つの特徴は、平均精度68%という最も高いものを示しました。測定技術の性能は、正確さ、精度、リコール率、F1スコアに基づいて比較されました。ANNは77.5%の分類精度で最高の成績を収めました。同様に、同じ研究グループは、NB、SVM、K-NN、ANNの4つの分類手法を用いて慢性腎疾患を予防的に診断し、サウジアラビアのデータセットに適用しました。さらに、著者らはANN、SVM、RF、NBの4つの機械学習手法を用いて、甲状腺がんを原始的に診断する研究を実施しました。サウジアラビアのデータセットの14の特徴を活用し、著者らは平均精度95%という最高の平均精度を達成しました。測定技術の性能は、正確さ、精度、想起率、F1スコアを用いて比較されました。RFは90.91%という最高の分類精度を達成しました。研究者たちはまた、リウマチの予防診断において顕著な成果を得た2つの研究も実施しました。SVM、ロジスティック回帰(LR)、AdaBoostなどの機械学習技術が候補として選ばれ、投票アンサンブルの候補手法として採用されました。当初は1つのデータセットを使用し、もう1つはSMOTEを適用してバランスを取っていました。新しい投票アンサンブル手法は、2つの逐次特徴選択法で検証されました。すなわち、順方向選択と後方選択を用いて、各手法に対して最も高い指標を示す特徴空間の最良の部分集合を見つけ出します。元のデータの30の特徴と逐次順方向特徴選択技術を用い、得られたパーセンテージは有望で、精度、リコール率、精度はそれぞれ94.03%、96%、93.51%でした。同様に、医学および関連分野の他の知的手法も多くの研究で見られます 22,23,24,25,26。
本研究で提案されている手法は、類似の問題に対する優れた成果を持つRF、SVM、ANN、NBです。本研究では、実験を通じて得られた結果が明らかになりました。様々な最適化ステップと特徴選択を経て、提案された手法がターゲットデータセットを用いた喘息診断において有望であることが示されました。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このセクションでは、提案された喘息診断アプローチで調査された機械学習アルゴリズムについて説明します。提案された方法の選択の基準と理由は、包括的な文献レビューと複数の慢性疾患の予防的診断に関する長い歴史に基づいています 27,28,29,30,31。これらのアルゴリズムは有望な結果を生み出しました。本研究で使用されるすべての材料と工具は材料表に記載されています。
サポートベクターマシン(SVM)
SVMアルゴリズムはパターン認識と分類において最も成功したアルゴリズムの一つです。これは二値分類を用いており、訓練されたベクトルの集合を2つのクラスに分類します。これは教師あり学習アルゴリズムのファミリーに属し、望ましい出力は監督32の下で生成されます。機械学習の他の分類アルゴリズムと比較して、SVMは分類性能においてより良い結果を提供します。そのため、音声認識、顔認識、手書き認識など多くの応用で広く使用されています。さらに、SVMは病気予測や資源予測など様々な分野でも応用されています。さらに、ノイズや過学習に鈍感であるため、SVMは医療診断で典型的なアンバランスデータを扱うことができ、陽性のケースが陰性ケースより少ないという例です。
分類において、SVMは決定境界線を描くことで2つのクラスを分離し、1つ以上の特徴ベクトルを区別することでラベルを予測できます。決定境界は超平面と呼ばれ、各クラスの最も近いデータ点から最も遠いものです。これらのデータポイントは支持ベクトルと呼ばれます。 図1 は線形分離可能なデータにおけるいくつかの候補超平面を示しています。式1は超平面方程式を示し、式2と3は平面32の上下に位置する元を示している。
超平面方程式(1)
ここで、 w は重みを表すベクトル、 x は入力を表すベクトル、 b. は潜在的なバイアスを表します。
すべてのjに対して、
= +1(2)
すべての i に対して、
= -1 (3)

図1:2つの分離可能なクラスを持つ典型的なSVM。 この図は、2つの分離可能なクラスを持つ典型的なSVMを可視化しています。略語;SVM = サポートベクターマシン。 この図の拡大版はこちらをクリックしてご覧ください。
人工ニューラルネットワーク(ANN)
ANNは、人間の脳システムの機能を模倣するソフトコンピューティングにおける計算知能技術です。非常に多くの相互接続されたニューロンを持ちます。33。これは、サンプルデータセットから学習し、学習を通じて性能を向上させることができる教師あり機械学習アルゴリズムの一つであり、有用な出力を生み出します。33。ANNのアーキテクチャは、入力層、隠れ層、出力層という複数の層で構成されています。それぞれは連結したニューロンの集合によって形成されています。
外部からデータを受け取ったニューロンは処理を行い、その後、そのデータを入力層と呼ばれる別の層に送ります。入力層の目的はデータに対して複雑な処理を行うことではありません。入力値を複製して次のレイヤー33に送るだけです。出力層にはユーザープログラム向けにデータを生成するニューロンが含まれています。これら2つの層の間には、隠れ層が計算処理を行うためのオプション層として配置されています。隠れ層は中間層として機能し、入力ニューロンからの入力を受け取り、それらに対して数学的操作を行い、その結果を別の層33に渡します。 図2 はANNアーキテクチャを示しています。

図2:典型的なANN構造におけるフィードフォワードと逆伝搬。 この図は典型的なANN構造における逆伝播を伴うフィードフォワードネットワークを可視化しています。 略語;ANN = 人工ニューラルネットワーク。この図の拡大版はこちらをクリックしてご覧ください。
フィードフォワードNNは入力データを順方向に格納するアプローチです。逆方向では、複数の隠れ層を持つニューラルネットワークを用いて、逆伝播の過程でニューラルネットワークの重みが逆方向に更新されて勾配を得るために起こります。このプロセスの欠点は勾配が消失または爆発することです。活性化関数はANNの非線形特性を維持し、普遍的近似として入力データと出力データ間の詳細な関係を学習することを可能にします。 図3 は人工ニューラルネットワークの主な構造を示しています。また、すべてのニューロンの出力に適用される活性化関数、すなわちすべての入力重みの合計を示しています。バイアスはすべての重みの合計を保持し、ニューロン入力33に含まれます。

図3:ANNの典型的な単一パーセプトロンニューロン。 この図は典型的なANNの単一のパーセプトロンニューロンを示しています。略称:ANN = 人工ニューラルネットワーク。 この図の拡大版はこちらをクリックしてご覧ください。
ランダムフォレスト(RF)
RFは機械学習における主要な分類アルゴリズムの一つです。複数の個別の決定木がアンサンブルとして連携し、最終的な出力29を生成します。RFの成功する基本的なコンセプトは、多くの中程度に相関のない樹木(森林を形成)で構成され、委員会として機能することです。したがって、独立して動作するすべてのモデルよりも効率的になるでしょう。RFアルゴリズムは主に研究者グループによって開発されました。RFの仕組みをよりよく理解するためには、意思決定木35を理解することが不可欠です。これは離散問題と連続問題の両方、特に分類、検出、回帰の両方に同様に適用可能です。森林内の木が多いほど結果は精度に近づきますが、計算複雑さは36増加します( 図4に示されています)。

図4:ランダムフォレストの回路図。 この図は典型的なランダムフォレストの概説を示しています。 この図の拡大版はこちらをクリックしてご覧ください。
ナイーブ・ベイズ(NB)
ナイーブベイズ(NB)は、ベイズの定理を用いて対象を分類する分類アルゴリズムです。特に症状の診断において、多くの医療分野で非常に人気のある方法です。この方法では、オブジェクトは主独立性仮定を取っており、属性間の関係が互いに独立します。その単純な性質ゆえに、機械学習37における分類アルゴリズムの中でも最も単純なものの一つです。与えられたデータセットに基づいて、NBは特定の出力の確率を決定します。NBモデルは開発が簡単で、大量のデータを管理でき、高度で計算効率の低いアルゴリズムです。さらに、控えめな機能も提供し、数値的および名義的な知識を提供します。堅牢性と単純な学習解釈もNB分類器の潜在的な利点です。限られたデータ量に適用すると、比較的不正確な結果になります。これは膨大な記録に依存しており、他の技術に比べて精度が劣ると考えられています37。
統計解析
データセットの統計解析は、データセットのパターンを可視化し理解し、より良いデータ前処理やモデリングに役立ちます。この点に関して、以下の措置が実施されました。まず、人口統計的特徴が肯定的・否定的グループ、年齢や性別などで不均衡かどうかを調べるために、SPSSソフトウェア上で統計分析が行われます。次に、正規分布と分散の均一性が満たされた場合は独立標本t検定、またはMan-Whitney U検定を用いて定量データをまとめます。最後に、カテゴリカルデータはカイ二乗検定またはフィッシャーの正確検定38を用いてまとめられています。
実装
データセットの説明
本研究のデータセットは、機関審査委員会(IRB)の承認を得て、サウジアラビア・ダンマームのキングファハド大学病院から取得されました。これらのデータは患者を対象とした標準的な検査に基づいて収集されました。喘息は、血液検査、ウイルス検査、生化学検査など、患者の標準的な検査で診断されることが多いです。本研究では、患者および健康対照群(HC)を募集し、部門の医師の勧告に基づき病院で実施された標準的なトリアージおよび病理検査に基づいて臨床評価を行いました。臨床的含除基準は、検査結果に基づき医師によって定められました。その後、適格かつ検証済みのデータが研究のために提供されました。データセットには17の属性が含まれており、すべての喘息患者に利用可能なものです。データセットには合計328件の事例が含まれており、そのうち165件が喘息陽性、163件が喘息陰性でした。陽性・否定性の性別と年齢の分布は 表1に示されています。
| 事例 | 肯定的 | 否定 | |
| 男性 | 145 | 107 | 38 |
| 女性 | 183 | 57 | 126 |
| 合計 | 328 | 164 | 164 |
表1:データセットの性別分布。この表はデータセット内の性別分布を示しています。
表2は 両クラス間の年齢分布を示しています。
| 年齢層 | 年齢分布(クラス=1) | 年齢分布(クラス=0) |
| 1–10 | 0.059113 | 0 |
| 11–20 | 0.113301 | 0.060869 |
| 21–30 | 0.083743 | 0.177947 |
| 31–40 | 0.157632 | 0.164912 |
| 41–50 | 0.17734 | 0.164912 |
| 51–60 | 0.197044 | 0.099566 |
| 61–70 | 0.108374 | 0.047619 |
| 71–80 | 0.078817 | 0.025974 |
| 81–90 | 0.019704 | 0.012987 |
| 91–100 | 0.004926 | 0.012987 |
表2:データセットの年齢分布。 この表はデータセット内の年齢分布を示しています。
年齢(マン・ホイットニーU検定でp < 0.001)と性別(カイ二乗検定でp < 0.001)は、陽性群と陰性群の間でバランスが取れていませんでした。しかし、採用プロセスに偏りはありません。この不均衡な分布は、この患者コホートの独自の年齢分布を反映していると考えられています。対象条件には、疾患の有無に関する臨床的要因、性別、年齢、地域人口などの人口統計も考慮されます。さらに、データはインフォームドコンセントのもとで収集されました。年齢と性別は、以下に記載するように機能セットの潜在的な特徴として含まれています。しかし、明確な年齢や性別に基づく分析は本研究の範囲内ではなく、今後の研究として残されています。
データセットは数値として保存されます。「クラス」列には値0と1が含まれ、0は「正常患者」、1は「喘息患者」を表します。
この点で、以下の17の属性が用いられました。
クラス:(0 = 「正常」、1 = 「喘息患者」)
1. 年齢(AGE)
2. 性別(1 = 男性、0 = 女性):性別
3. 好塩基球(BASO)
4. 好酸球(EOS)
5. ヘマトクリット(HCT)
6. ヘモグロビン(HGB)
7. リンパ球(LYM)
8. 平均小血球ヘモグロビン(MCH)
9. 平均小球ヘモグロビン濃度(MCHC)
10. 平均微粒体積(MCV)
11. 単球(MONO)
12. 平均血小板体積(MPV)
13. 好中球機能(NEUT)
14. 血小板数(PLATELET_COUNT)
15. 赤血球数(赤血球)
16. 赤血球分布幅(RDW)
17. 白血球(WBC)
データセットの統計的特徴
より理解しやすいように、データセットの統計的解析は以下の表38に示されています。 表3は 、検討対象のデータセットの平均値、中央値、標準偏差、最大値、最小値を示しています。
| 平均 | 中央分離帯 | 標準偏差 | マックス | ミン | |
| 年齢 | 39.1 | 36 | 18.136 | 93 | 2 |
| 性別 | 0.442 | 0 | 0.4974 | 1 | 0 |
| バソ | 0.07 | 0.07 | 0.0701 | 0.72 | 0 |
| EOS | 0.231 | 0.229 | 0.2048 | 2 | 0 |
| HCT | 40.88 | 40.7 | 6.0313 | 56.5 | 3.4 |
| HGB | 13.67 | 13.45 | 4.3446 | 81.3 | 5.9 |
| リンプ | 2.595 | 2.33 | 2.1843 | 33.4 | 0.4 |
| MCH | 26.78 | 27 | 3.3177 | 34.5 | 2.6 |
| MCHC | 32.71 | 33 | 2.1017 | 43.1 | 15 |
| MCV | 81.15 | 82.8 | 9.4426 | 102 | 13 |
| モノ | 1.189 | 0.613 | 6.1198 | 95 | 0.2 |
| MPV | 9.217 | 9.217 | 1.7297 | 13.4 | 0 |
| ニュー | 4.23 | 4.23 | 2.3074 | 16 | 0.6 |
| PLATELET_COUNT | 279.7 | 272.5 | 85.473 | 685 | 0 |
| RBC | 5.677 | 5 | 11.615 | 215 | 2.1 |
| RDW | 14.72 | 13.4 | 15.769 | 296 | 0 |
| WBC | 6.777 | 6.505 | 3.5836 | 33.4 | 1.1 |
| クラス | 0.5 | 0.5 | 0.5008 | 1 | 0 |
表3:データセットの統計的特徴。 この表はデータの統計的特徴を示しています。
さらに、 表4は 各属性とクラス属性間で得られた相関係数を示しています。その値は0(相関が最小)から1(相関が最も小さい)の間に位置します。データセットの属性を説明するための予備的な統計解析として追加されます。MPV、性別、HGB、MCHC、年齢は最も重要な特徴の一つです。
| 属性のペア | 相関係数 |
| 年齢 | 0.212473 |
| 性別 | 0.423584 |
| バソ | -0.33242 |
| EOS | 0.048184 |
| HCT | -0.376843 |
| HGB | 0.275277 |
| リンプ | 0.055856 |
| MCH | 0.128111 |
| MCHC | 0.272635 |
| MCV | 0.013022 |
| モノ | 0.055476 |
| MPV | 0.564992 |
| ニュー | 0.031185 |
| PLATELET_COUNT | 0.095253 |
| RBC | 0.030787 |
| RDW | 0.025979 |
| WBC | 0.148842 |
| クラス | 1 |
表4:クラス属性との相関。 この表は属性(特徴)とクラス属性の相関を示しています。
実験装置
本研究では、Pythonプログラミング言語を用いて収集されたデータセットの前処理が行われています。人為的ミスにより、データ入力や選択時に特定の数値が欠落しています。補完技術はデータセットの欠損値を処理するために用いられています。これは、欠損値を属性の平均値に置き換えることで行われます。その単純さ、モデル互換性、そして標本平均値の保持性が医療専門家と議論されているためです。さらに、特徴選択は相関係数を用いて属性のランク付けを行います。相関値が高い特徴が、すべての特徴セットと並んで分析のために選ばれました。提案されたアプローチの実装、ハイパーパラメータチューニング、結果の取得にはPythonライブラリが活用されています。特徴選択と除去は属性選択法によって行われ、最も高い精度で特徴群を特定しました。さらに、Pythonは10折のクロス検証および直接分割比評価法を用いた精度評価に用いられ、これは与えられた式39,40で指定されています。最後に、すべての評価手法の出力平均を計算し、使用された評価方法を比較し、平均精度が最も高い方法を決定しました。さらに、SVM、ANN、RF、NBの最適パラメータを用いて混同行列も生成されました。次に、偽陽性(FP)、偽陰性(FN)、真陽性(TP)、真陰性(TN)比率を比較し、最良の方法41,42を比較する効率的な指標であるF1スコアを算出しました。
評価指標
提案されたアプローチの性能を評価するために、4つのよく知られた性能指標を考慮します。具体的には、正確さ、正確さ、リコール、そしてF1スコアです。分類の正確さが主要な指標であり、各インスタンスごとに正しく分類されたインスタンスの割合が計算されます。精度は期待されるTPポイントの総数です。リコールはTPの数が実際の陽性数より多いです。各クラスのF1スコアのパフォーマンス。出力の能力に応じて、以下の指標43、44、45が得られます。
真陽性(TP):正しく喘息と診断された結果。
偽陽性(FP):喘息と誤診された結果です。
真陰性(TN):正しい症例で喘息ではないと診断された結果。
偽陰性(FN):誤って喘息ではないと診断された結果。
(4)
(5)
(6)
最適化戦略
提案された各アプローチの最適パラメータを決定するために、グリッドサーチ技術が用いられました。グリッドサーチ法には特定のパラメータの可能な数値が配置されます。したがって、精度向上のために可能な限り最高の性能を発揮できます。
図5–7 は、4つの提案されたアプローチすべてにおけるグリッドサーチ技術の結果と、上位18の属性の助けを借りたデータセット上の実装手順を示しています。 図5 は、さまざまなパラメータ値で得られるSVMの精度を示しています。複数の種類の核に対応するコストとガンマの入力値は以下の通りです。
核の種類:線形、直線型、シグモイド型、多項式型。
ガンマ線:0.001および0.0001。
コスト:1、10、100、1000。

図5:異なるコストとガンマタイプを持つSVM。 この図は、異なるコストとガンマタイプを用いたSVMの挙動を示しています。略語;SVM = サポートベクターマシン。 この図の拡大版はこちらをクリックしてご覧ください。
RFの場合、 図6 に示された体系的な入力値は以下の通りです。
パラメータ名とそのそれぞれの値は以下の通りです。
特徴数:『オート』『スクーラート』。
最大深さ:1、3、5、7。
MINサンプルは2、3、4、5。
MINサンプル葉:2、3、4、5。

図6:異なる深さ値と最小試料葉を持つRF。 この図は、異なる深さと最小サンプルリーフ値を用いたRF挙動を示しています。略語;RF = ランダムフォレスト。 この図の拡大版はこちらをクリックしてご覧ください。
ANNの解析入力値は図7に示されています。
パラメータ名とその値は以下の通りです:
隠れ層サイズ:(50, 50, 50), (50, 100, 50), および (100,)
起動:『タン』と『レル』。
ソルバー:『sgd』と『adam』です。
アルファ:0.1、0.01、0.001、0.0001、0.5、0.005、0.0005、0.05。
学習速度:「一定」かつ「適応的」。

図7:異なるアルファ値と隠れ層サイズを持つ人工ネットワーク(ANN)。 この図は、異なるアルファ値と隠れた層サイズを持つANNの挙動を示しています。略語;ANN = 人工ニューラルネットワーク。 この図の拡大版はこちらをクリックしてご覧ください。
| 分類器 | パラメータ | 価値 |
| SVM | ガンマ | 0.0001 |
| カーネルタイプ | 『RBF』 | |
| コストC」 | 10 | |
| ランダム状態 | 42 | |
| RF | 最大深度 | 3 |
| Min サンプルの葉 | 2 | |
| 最小サンプル分割 | 2 | |
| ランダム状態 | 42 | |
| アン | 起動 | 「レル」 |
| アルファ | 0.001 | |
| 隠れ層の大きさ | (50,50,50) | |
| 学習率 | 「一定」 | |
| ソルバー | 「アダム」 | |
| ランダム状態 | 42 |
表5:提案された分類器の最適パラメータの要約。 この表は提案された分類器に対して得られた最適パラメータをまとめたものです。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
特徴選択の影響
本研究では、特徴選択に再帰的特徴除去に基づく相関係数法が用いられています。相関係数は、相関値に従って特徴を高いものから小さいものへと並べるために使用されます。再帰的特徴除去は、モデルに適した特徴を選択するのを助けるために用いられ、最も弱い特徴を段階的に除外し、最終的に1つだけが残ります。すべてのプロセスは、選ばれた4つの分類器を10倍のクロスバリデーションで実行し、最も高い精度を持つグループを見つけます。以下は消去法のプロセスです:
まず、NB、RF、SVM、ANNなどのアルゴリズムはN個の特徴量で構成されています。次に、すべての特徴の相関係数を計算し、上位のN/2の特徴を選びます。第三に、第二段階を繰り返し、単一の特徴が残るまで続けます。最後に、最も優れた機能セットを直接分割(Direct Partition)で選びます。さらに、性能の偏りのない測定を確保するため、クロスバリデーションプロセスでは各フォールドで特徴選択が行われました。これは、選択された特徴が...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
本研究ではSVM、ANN、RF、NBなど複数の機械学習アルゴリズムが用いられています。複数の実験を行い、ハイパーパラメータや特徴選択を微調整した結果、SVM、ANN、RFは94%という驚異的な診断精度を示し、NBは比較的低い83.33%であることが結論付けられました。結果は10折のクロス検証と最適化された特徴選択、そして最適な分割比率を用いて検証されました。与えられたデータに基づき、患者の17のパラメータが相関係数の順にランク付けされ、低MPVとGENDERが喘息と最も高い正の関連を持つことが示されました。一方で、HCTとBASOは強い負の関連を示し、全身炎症や呼吸圧下での細胞移動を示しました。他に一般的な免疫因子としては、末梢好酸球数が高いと病気の重症度を示すEOSがあります。
機械学習を用いた喘息診断に臨床データセットを用いる最先端の手法と対照的に、提案されたスキームは診断精度が3.9%向上するなど、より良いパフォーマンスを示しています。特に、16.17...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このデータセットは病院からIRB-2020-09-429のもとで入手されました。著者らは本研究に関して利益相反を報告できないと宣言しています。この研究は、以下の引用50とともにリサーチスクエアのリポジトリにプレプリントとして追加されています。
著者の寄稿:
コンセプト化はS.O.、M.I.B.A.、A.R.によって行われました。監督はS.O.、M.I.B.A.、J.A.によって行われました。原稿の執筆はS.S.A.、E.A.、Z.A.によって行われました。実施はS.A.A.、Y.A.、R.A.によって行われました。検証はJ.A.、M.A.、S.D.によって行われました。データキュレーションはA.B.、Y.A.、E.A.、Z.A.によって行われました。レビューと編集はA.R.、S.D.、A.B.によって行われました。プロジェクト管理はA.R.、S.D.、M.A.が担当し、資金調達はA.B.、S.D.、A.R.が担当しました。
著者らは、研究結果の検証において医療専門家の支援に感謝の意を表します。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
```html
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| Excel 365 | Microsoft | Excel 365 | csv形式で生データを保存するのに使用 |
| Laptop/Machine | Dell | XPS9320 | RAM 16GB, 12世代Intel(R) Core(TM) i7-1260P |
| Mlxtend 0.23.4 | Google colab Notebook | Mlxtend 0.23.4 | モデル構築トレーニングに使用 |
| Numpy 2.0.2 | Google colab Notebook | Numpy 2.0.2 | モデル構築トレーニングに使用 |
| Pandas 2.2.2 | Google colab Notebook | Pandas 2.2.2 | モデル構築トレーニングに使用 |
| Python 3.12.12 | Google colab Notebook | Python 3.12.12 | モデル構築トレーニングに使用 |
| Sklearn 1.6.1 | Google colab Notebook | Sklearn 1.6.1 | モデル構築トレーニングに使用 |
| SPSS | IBM, USA | バージョン 26.0 | 統計分析に使用 |
| XGbbost 3.1.2 | Google colab Notebook | XGbbost 3.1.2 | モデル構築トレーニングに使用 |
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト