XGBoost と LSTM を組み合わせた臨床データ駆動型モデルは、COPD の在宅リハビリテーションを強化し、データの精度と予測を向上させます。98% の精度と 42.5% の指標改善を達成し、従来の病院ベースの治療の限界に対処します。
このコンテンツを表示するには、JoVEへの購読が必要です。 または、無料トライアルをお申し込みください。
XGBoost と LSTM を組み合わせた臨床データ駆動型モデルは、COPD の在宅リハビリテーションを強化し、データの精度と予測を向上させます。98% の精度と 42.5% の指標改善を達成し、従来の病院ベースの治療の限界に対処します。
慢性閉塞性肺疾患(COPD)の従来の院内リハビリテーション治療には、資源不足、高コスト、交通不便などの問題があります。COPD のリハビリテーション治療の利便性を向上させるために、COPD の在宅リハビリテーション管理のための臨床データ駆動型のインテリジェント診断および治療モデルが提案されています。COPD の在宅リハビリテーションのためのインテリジェントな診断および治療モデルは、XGBoost アルゴリズムと長短期記憶ネットワークを組み合わせることによって最適化されています。結果は、XGBoost アルゴリズムが臨床構造化データの処理において最も高い精度を持っているのに対し、ランダム フォレスト (RF) アルゴリズムは臨床構造化データの処理において最も低い精度を持っていることを示しています。学習サンプルの量が 300 の場合、精度はそれぞれ 98% と 83% です。XGBoost アルゴリズムと長短期記憶ネットワークの統合を使用して監視指標を処理し、その結果、最高の改善率と最小の平均二乗誤差が得られます。サンプルサイズが 1000 の場合、モニタリング指標の改善率は 42.5%、平均二乗誤差は 0.041 です。この研究で提案された方法は、臨床データを効果的に処理し、データ処理の精度を向上させ、COPD の将来の変化を正確に予測できます。
COPD は、障害率と死亡率が高く、患者の生活水準に大きな影響を与える一般的な慢性疾患です。従来のリハビリテーション管理モデルには、COPD への対処における情報の遅れや時期尚早の介入などの問題があります。しかし、技術の進歩に伴い、エクストリーム グラデーション ブースティング (XGBoost) アルゴリズムなどのいくつかの新興テクノロジーは、COPD1 の管理に新たな可能性をもたらしました。XGBoost は、スポーツ医学を含むさまざまな健康モニタリングの状況にわたる適用性を実証していますが、この研究では特に、在宅リハビリテーション環境での COPD 管理にその強みを活用しています。臨床および遠隔モニタリング データを使用して、COPD 患者の予測精度と個別化されたケアを強化することに引き続き焦点が当てられています2。たとえば、心拍数や呼吸数などの生理学的指標を収集することで、この組み合わせは COPD 患者の管理に役立つだけでなく、健康管理に対する新たな視点とアプローチも提供します3。XGBoost は、効率的な勾配ブースティング (GB) デシジョン ツリー アルゴリズムです。XGBoost は、並列コンピューティングとキャッシュ技術を使用してトレーニングを高速化し、大規模なデータベースや複雑な特性の管理を処理できるようにします。また、様々な種類のデータセットの処理にも優れており、優れた汎化能力を発揮します4。長短期記憶 (LSTM) は、時系列データの処理と学習に一般的に使用される特別な RNN 構造です。LSTM は時間に敏感で、時系列データ内のパターンと特性を特定できるため、信号の処理や時系列の予測などの割り当てに役立ちます。疾患の正確な予測と個別化された介入を達成するために、臨床データのインテリジェントな診断および治療モードを COPD の在宅リハビリテーション管理に適用する方法が提案されています。この研究は、XGBoost と LSTM を革新的に組み合わせて、COPD 在宅リハビリテーションのインテリジェントな診断と治療モードを最適化します。この 2 つを組み合わせることで、正確な疾患予測を実現し、データに基づいた個別の介入計画を提供して、COPD 在宅リハビリテーション管理のインテリジェンス レベルを高めることができます。
提案されたモデルの有用性を保証するには、いくつかのパラメータと制約を考慮する必要があります。この方法では、信頼性の高いウェアラブル センサーや家庭用モニタリング デバイスから定期的に収集される構造化された臨床データ (肺機能データや血中酸素データなど) と遠隔モニタリング データ (心拍数、酸素飽和度、活動レベルなど) が必要になる場合があります。安定したトレーニングのためには、サンプルサイズを最低300サンプルにする必要があり、最適なパフォーマンスを得るには、1000以上のサンプルを使用することが望ましいです。また、特にLSTMトレーニングに関しては、十分な処理能力や、予測機能のためのクラウドベースの展開ソリューションの使用を必要とする計算ニーズもあります。
COPD は、流出制限、急性増悪、生活の質 (QoL) の障害を特徴とする進行性の不可逆的な呼吸器疾患です。それは、世界中の健康、福祉、医療システムの人々に大きな影響を与えます。したがって、COPD の早期予測とタイムリーな介入は、病理学的疾患の進行と入院を制限するために不可欠です5。機械学習 (ML) 技術は、高度なデータ駆動型モデリング アプローチを通じて、臨床的に関連するデータを使用して COPD の診断および予後経路を改善することが示されています。XGBoost は、不均衡なデータと臨床変数間の非線形相互作用に対して最も効果的で成功した ML モデルを生成することが引用されています6。XGBoost および Support Vector Machines (SVM) と電子鼻データによる優れた肺疾患分類精度が報告されています。また、不均衡な臨床データを使用して COPD のリスクを予測するために ML ベースの予測モデルが構築され、予測の信頼性を向上させるために XGBoost が推奨されました7。さらに、COPD分類タスクにおける他のMLモデルの中でもXGBoostの強力なパフォーマンスが検証されました。アンサンブル学習は、COPDの特定と分類、および肺がんの検出に複数の自己学習MLモデルを使用して効果的に使用されており、特に呼吸器診断データにおけるXGBoostの役割を参照しています8。要約すると、これらの先行調査は、トランスフォーマー LSTM 機能を使用して修正されたアプリケーションで XGBoost を使用して、COPD 在宅リハビリテーションを抱えて生きる人々のインテリジェントな診断および治療モデルを構築し、予測精度を高め、より個別化された医療とケアの提供を改善するための基礎を提供します9。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
この研究は、台州がん病院の倫理委員会によって審査され、承認されました。機関および国の倫理基準に従って、データ収集前にすべての参加者から書面によるインフォームドコンセントが得られました。使用する試薬とソフトウェアは、 材料表に記載されています。
1. ワークフローの概要
XGBoost を使用して構造化臨床データを処理するためのエンドツーエンドのワークフローを 図 1 に示し、特徴の取り込み、ツリー構築、残差更新、正則化、評価が含まれます。LSTMを使用したリモートモニタリングデータの前処理とシーケンスモデリングのワークフローを 図2に示し、10分間のリサンプリング、ギャップ処理、7日間の非重複ウィンドウ、ネットワークアーキテクチャ、および推論を網羅しています。
2. 患者の募集と人口統計
患者は、2023年3月から2024年1月にかけて台州がん病院の外来診療所と入院病棟から連続して募集されました。選択基準は、GOLD 基準 (FEV1/FVC < 70%) に従って確認された COPD 診断、登録時の安定した状態、および 40 歳から 80 歳までの年齢でした。除外基準には、肺がん、制御不能な心血管疾患、インフォームドコンセントを妨げる認知障害などの重度の併存疾患が含まれていました。合計214人の患者が登録されました(平均年齢63.7歳±8.9歳、男性68%、現在または元喫煙者54%)。
3. データ収集
臨床構造化データには、肺機能 (FEV1、FVC)、血中酸素飽和度 (SpO2)、入院期間、および疾患期間が含まれていました。肺機能とSpO2 は、パーセンテージ、入院日数、および疾患期間数(年)として記録されました。遠隔モニタリングデータは、病院のゴールドスタンダードに照らして検証された認定ウェアラブルオキシメーターとアクティビティトラッカーを使用して収集されました:パルスオキシメーターはMasimo Rad-97モニターでクロスチェックされ(90〜100%SpO2 範囲で平均絶対誤差1.8%)、心拍センサーは心電図検査に対して検証され(平均誤差2.3 bpm)、歩数計はトレッドミルプロトコルで校正されました。生データは、10分のサンプリング間隔でタイムスタンプ付きのCSVファイルとしてエクスポートされました。
4. サンプルサイズの正当化
XGBoost の 300 のトレーニング サンプルと LSTM の約 1000 の重複しない 7 日間シーケンスのしきい値は、実験と検出力/シミュレーション分析によってサポートされました。G*Power(バージョン3.1)を使用した事後検出力分析では、ロジスティック回帰でα = 0.05で、300サンプルが>80%の検出力を提供して中程度の効果サイズ(Cohenのf2 = 0.15)を検出したことが示されました。シミュレーションでは、多変量生理学的時系列でのLSTMの安定した収束には約1000のシーケンスが必要であることが示されました。経験的証拠を 表1に まとめ、 図3 と 図4に視覚化します。
5. データの前処理
空白、センチネル値、または NaN として識別される欠損エントリは、ターゲットの漏れを回避するために、各特徴のトレーニング セット平均を使用して代入されました。
(1)
ここで、 mj は特徴量 j の観測値の数です。同じ
が検証セットとテストセットに適用されました。スケール関連のバイアスを取り除くために、トレーニングのみのパラメーターを使用した Z スコア正規化で特徴量を標準化しました。
(2)
ここで、 μj と σj は、学習データから推定された特徴量 j の平均と標準偏差です。時系列信号 (SpO2、心拍数、歩数) の場合、ストリームは 10 分間のケイデンスに整列されました。30分までの短いギャップはフォワードフィルされ、長いギャップは3ポイント移動平均で平滑化されました。次に、1008のタイムステップを持つ7日間のスライディングウィンドウを適用して、漏れを防ぐために重複しない配列を形成しました( 図2を参照)。
6. モデルトレーニング
構造化された臨床データの場合、XGBoostは、バイナリロジスティック目標( 図1のワークフロー)の下で、学習率(0.01〜0.3)、最大深度(3〜10)、および推定器の数(100〜500)にわたってグリッド検索を介して調整されました。リモート監視データの場合、LSTM は、それぞれ 128 ユニットの 2 つの隠れ LSTM 層、Xavier 初期化、ドロップアウト率 0.5、およびシグモイド出力層で構成されていました。最適化では、TensorFlow に実装された学習率 0.001 の Adam を使用しました( 図 2 のパイプライン)。オーバーフィッティングはドロップアウトと早期停止 (忍耐力 = 10) によって軽減され、クラスの不均衡は SMOTE で対処されました。
7. 評価戦略
構造化データは、層別 10 倍の交差検証で評価されました。時系列データは、時間的順序を維持するためにウォークフォワード検証で評価されました。指標には、精度、精度、再現率、F 測定、ROC 曲線下面積 (AUC)、平均二乗誤差 (MSE) が含まれていました。モデル間の差は、Wilcoxon 符号付き順位検定 (両側) を使用して評価されました。数値には、不確実性を定量化するための 95% 信頼帯またはエラー バーが含まれています。これらの選択は、時系列リークのリスクと、レビュー担当者が要求する統計的有意性の必要性に直接対処します。
8. 臨床的関連性とパイロットテスト
ハイブリッドモデルは、監視対象患者の78%で臨床症状の6〜12時間前にSpO2 の低下を予測し、ベースラインと比較してMSEを42.5%減少させました。20人のCOPD患者を対象とした4週間のパイロットでは、毎週のモデルリスクスコアがレビューの85%で医師の評価と一致し、臨床統合の可能性を裏付けました。
9. ソフトウェアと環境
分析は、NVIDIA RTX 3080 GPU、CUDA 1.1.6、cuDNN 8.2 を搭載した Ubuntu 20.04 LTS 上の scikit-learn 1.2.2、XGBoost 1.7.5、TensorFlow 2.13、および PyTorch 1.13 を使用して Python 3.10.6 で実行されました。完全なバージョン管理とベンダーは、番号なしの 「材料表」にリストされています。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
サンプルサイズの安定性と最適な性能
安定性のしきい値を明示的に示すために、最初に表1を示し、次に図3と図4の学習曲線を示します。表 1 は、構造化データ上の XGBoost 分類器と多変量時系列での LSTM のトレーニング サイズの増加にわたる精度、AUC、および MSE の平均± SD を報告しています。図3に示すように、XGBoostのパフォーマンスは200サンプル未満で不安定でした(高い分散;AUC 0.82-0.89) ですが、≥300 で安定し、精度は一貫して >0.95、AUC >0.93 でした。図4は、LSTMの精度がシーケンス数とともに単調に向上し、≈1000シーケンス近くに収束し、精度が≈0.96に達し、MSEが0.048に近づ...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
主な調査結果の概要
COPD は、呼吸障害、可動性の低下、および再発性の急性増悪を通じて、臨床的および社会的負担を多大に課します10。説明可能な分析を備えた継続的な住宅監視を活用することで、早期発見と的を絞った介入を可能にすることで、この負担を軽減できます。この研究では、構造化された臨床変数用のXGBoostと多変量時系列シグナル用のLSTMを統合したハイブリッドワークフローは、≥300のトレーニングサンプルで安定性に達し、≈1000の重複しない7日間シーケンス付近で最適な収束を達成し、一貫して強力なパフォーマンスを達成しました(表1; 図3,4)。ハイブリッドモデルは、識別指標全体で古典的な比較器を上回りました(図5、図<...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者らは開示するものは何もない。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| CUDA | エヌビディア | 11.6 | GPUでの計算を高速化するために使用される並列コンピューティングプラットフォームとプログラミングモデル。 |
| cuDNN | エヌビディア | 8.2 | モデルのトレーニングパフォーマンスを最適化するためのディープニューラルネットワーク用のGPUアクセラレーションライブラリ。 |
| 心電図装置 | フィリップス | ページライターTC70 | ウェアラブルデバイスからの心拍数測定値を検証するために使用されます。 |
| GPU | エヌビディア | RTX 3080 | 大規模なデータセットでのモデルトレーニングを高速化するために使用される高性能GPU。 |
| LSTMモデル | - | - | 時系列データ処理に用いる長短期記憶ニューラルネットワーク |
| パルスオキシメータ | マシモ | ラジド-97 | 血中酸素飽和度 (SpO2) を測定し、ウェアラブル デバイスの精度を検証するために使用されます。 |
| ニシキヘビ | Pythonソフトウェア財団 | 3.10.6 | データ処理、モデルトレーニング、評価に使用されるプログラミング言語。 |
| テンソルフロー | ググる | 2.13 | LSTMモデルの学習とニューラルネットワーク計算の実行に使用されるソフトウェアライブラリ。 |
| ウェアラブルアクティビティトラッカー | フィットビット | チャージ5 | 歩数と身体活動レベルの追跡に使用されます。 |
| XGブースト | - | - | 勾配ブースティング(機械学習)に使用されるソフトウェアライブラリ。 |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。