$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
データソースと倫理声明
この回顧的研究は、PhysioNet上でホストされている公開された非識別化の集中治療EHRデータベースMIMIC-IV(バージョン3.1)のデータを用いました。このデータベースには、人口統計情報、バイタルサイン、検査結果、診断、処置、薬剤が含まれています。
MIMIC-IVへのアクセスには、資格取得済みの承認とPhysioNetのデータ使用契約およびトレーニング要件の遵守が必要です。調査員は必要な訓練を修了し、アクセス権(証明書番号:68351548)を授与されました。データベースが非識別化されているため、本研究は匿名化されたデータを分析し、患者との直接接触は含みませんでした。したがって、インフォームド・コンセントは必要ありませんでした。完全なステップバイステップの実行可能モデリングワークフローは 図1に示されています。

図1。糖尿病患者における骨粗鬆症(OP)リスク予測の全体モデリングワークフロー。 研究パイプラインの概略的表現、コホートの特定、データ抽出、特徴工学、マルチモデルベンチマーキング、検証性能に基づくモデル選択、最終モデルのSHAPベースの解釈可能性などが含まれます。 この図の拡大版はこちらをクリックしてご覧ください。
研究対象集団とデータ抽出
データは、データベース管理ツールを用いて、Medical Information Mart(MIMIC-IV)データベースから抽出されました。再現性を確保するため、テーブル名やコホート検索に用いるフィルタリングロジックを含む正確なSQLクエリが補 足ファイル1に記載されています。糖尿病と診断された成人患者(≥18歳)は、ICD-9コード(249,250)およびICD-10コード(E08–E13)を用いて識別されました。主要アウトカムOPは、ICD-9コード(733.x)およびICD-10コード(M80、M81、M82)を用いて定義されました。初期の適格な糖尿病コホート(n = 46,226)では、3,672件の陽性事象(OP患者)および42,554件の陰性事象(非OP患者)が確認されました。詳細な患者選択および離脱のフローチャートは 図2に示されています。

図2。患者選択およびコホート構築のフローチャート。 フローチャートはMIMIC-IV(v3.1)データベースからの段階的なコホート導出を示しています。成人糖尿病患者はICDコードを用いて特定され、その後、年齢および以下の患者は除外されました。lt;18年、重要なデータが欠落しているgt;30%か無効な記録。最終コホートはOP(ポジティブイベント)とノンOP(ネガティブイベント)に分けられました。クラス不均衡は、ランダムなアンダーサンプリングとSMOTEを用いて、層別化されたデータセット分割前に訓練データに適用しました。 この図の拡大版はこちらをクリックしてご覧ください。
特徴解析
複数のMLアルゴリズム間で公正なベンチマーキングと正確な再現性を確保するため、特徴選択、欠損値補完、連続特徴スケーリング、クラスバランシング、データセット分割といった同じ前処理ステップの順序が適用されました。変数名、単位、データソースを含む入力特徴の全リストは表 1に詳述されています。
| 特徴 | 合計 (n = 14,688) | トレーニングセット (n = 9,546) | 検証セット (n = 2,204) | テストセット (n = 2,938) | P値 |
| 性別 | | | | | 0.345 |
| 男性 | 6222 (42.36%) | 4045 (42.37%) | 935 (42.42%) | 1242 (42.27%) | |
| 女性 | 8466 (57.64%) | 5501 (57.63%) | 1269 (57.58%) | 1696 (57.73%) | |
| 年代 | 0.28(−0.40, 0.94) | 0.28(−0.43, 0.94) | 0.23(−0.46, 0.89) | 0.28(−0.39, 0.95) | 0.1655 |
| 赤血球 | −0.14(−0.79, 0.49) | −0.13(−0.79, 0.49) | −0.17(−0.83, 0.48) | −0.14(−0.76, 0.49) | 0.3641 |
| ヘマトクリット | −0.14(−0.81, 0.52) | −0.13(−0.80, 0.52) | −0.14(−0.87, 0.51) | −0.16(−0.81, 0.52) | 0.3709 |
| ヘモグロビン | −0.12(−0.79, 0.52) | −0.12(−0.79, 0.51) | −0.15(−0.86, 0.53) | −0.13(−0.78, 0.52) | 0.3616 |
| RDW | −0.16(−0.59, 0.45) | −0.17(−0.59, 0.46) | −0.14(−0.59, 0.45) | −0.17(−0.60, 0.42) | 0.5803 |
| リン酸塩 | −0.14(−0.60, 0.38) | −0.15(−0.61, 0.38) | −0.11(−0.57, 0.38) | −0.13(−0.56, 0.34) | 0.415 |
| MCV | 0.05(−0.50, 0.63) | 0.06(−0.50, 0.65) | 0.03(−0.49, 0.65) | 0.02(−0.50, 0.59) | 0.5408 |
| マグネシウム | −0.10(−0.52, 0.37) | −0.10(−0.52, 0.37) | −0.10(−0.52, 0.37) | −0.09(−0.50, 0.37) | 0.7797 |
| 白血球 | −0.16(−0.47, 0.21) | −0.16(−0.47, 0.20) | −0.15(−0.48, 0.25) | −0.16(−0.46, 0.20) | 0.6856 |
| アニオンギャップ | −0.12(−0.64, 0.45) | −0.13(−0.64, 0.45) | −0.07(−0.61, 0.48) | −0.13(−0.64, 0.45) | 0.1217 |
| クレアチニン | −0.30(−0.48, 0.01) | −0.30(−0.48, 0.01) | −0.30(−0.46, 0.01) | −0.30(−0.48, −0.00) | 0.3323 |
| MCH | 0.11(−0.48, 0.62) | 0.12(−0.48, 0.62) | 0.11(−0.47, 0.62) | 0.09(−0.48, 0.61) | 0.5195 |
| 血小板数 | −0.09(−0.61, 0.49) | −0.09(−0.61, 0.49) | −0.08(−0.62, 0.47) | −0.10(−0.62, 0.48) | 0.9709 |
| MCHC | −0.00(−0.59, 0.59) | −0.00(−0.60, 0.59) | −0.00(−0.57, 0.58) | 0.00(−0.57, 0.60) | 0.9263 |
| 塩化物 | 0.05(−0.54, 0.64) | 0.05(−0.52, 0.65) | 0.03(−0.59, 0.62) | 0.07(−0.52, 0.62) | 0.4675 |
| カリウム | −0.07(−0.67, 0.53) | −0.09(−0.67, 0.53) | −0.07(−0.67, 0.53) | −0.07(−0.62, 0.53) | 0.3071 |
| ナトリウム | 0.05(−0.56, 0.60) | 0.05(−0.55, 0.60) | −0.00(−0.60, 0.60) | 0.07(−0.57, 0.61) | 0.3492 |
| 尿素窒素 | −0.28(−0.60, 0.29) | −0.28(−0.60, 0.29) | −0.26(−0.59, 0.31) | −0.28(−0.59, 0.25) | 0.6826 |
| 総カルシウム | 0.02(−0.61, 0.59) | 0.02(−0.61, 0.59) | −0.01(−0.59, 0.56) | 0.01(−0.61, 0.60) | 0.8203 |
表1。研究コホートの基準特性および人工的特徴。カテゴリ変数はn(%)で表されます。連続変数は標準化された値の中央値(四分位範囲)として提示されます。適切な統計検定を用いて、訓練、検証、テストセット間の分布を比較するためにP値を計算しました。
繰り返し測定された連続変数は、ICU滞在期間の観察ウィンドウ全体内で算術平均を用いて集約し、患者ごとに単一の特徴ベクトルを算出しました。欠損率が30%を超える変数は除外しました。残りの数値変数については、K近傍法(KNN)アルゴリズム(n_neighbors = 5、重み=「一様」)を用いて欠損值を代帰しました。カテゴリ変数は最も頻繁なカテゴリを用いて帰帰り付け、その後二値写像で変換され、見えないカテゴリにはゼロのベクトルが割り当てられました。
連続変数はzスコアスケーリング式()を用いて標準化されました。分散ゼロの特徴はスケーリング前に明示的に除去されました。すべての前処理パラメータ(μおよびσ)は訓練セット上で厳密に推定され、検証セットおよびテストセットに一貫して適用されました。
深刻なクラスの不均衡(3,672人対42,554人)を考慮し、パフォーマンス推定値の過大化を避けるため、トレーニングデータにのみハイブリッドバランス戦略が適用されました。まず、ランダムアンダーサンプリングを用いて過半数の否定クラスを1:2(正:負)比率に落とし、7,344件の陰性サンプルを得ました。次に、合成少数派過量サンプリング技術(SMOTE)を正のクラスに適用し、最終的な1:1のバランス比(7,344対7,344)を達成しました8。
最後に、コホートは患者レベルでトレーニング(65%)、検証(15%)、テスト(20%)に分けられ、層別抽出を用いました。補完、バランス、分割のすべてのランダム過程を厳密に制御するために、グローバルランダムシード(random_state = 42)が強制されました。
モデルアーキテクチャ
糖尿病患者におけるOPリスクの最適な予測モデルを特定するため、大規模なベンチマーキングフレームワークを用いて、同一のデータ表現と評価プロトコルの下で70のMLアルゴリズムバリアントを比較しました。候補モデルファミリーには、正則化された線形分類器、サポートベクターマシン(SVM)、kNN、ツリーアンサンブル、勾配ブースティングアーキテクチャ、そして多層パーセプトロン9,10,11,12,13,14,15,16,17が含まれていました。
従来のグリッド探索を用いる代わりに、これら70のモデルバリアントに対する事前定義された堅牢な構成を評価することでハイパーパラメータ最適化が行われました。選択は検証セット上の受信機動作特性(ROC)曲線(AUC)下面積を最大化することに厳密に基づいていました。最終的に最も性能の良いモデルはn_estimators = 200に設定され、その他のパラメータは 材料表に記載されたソフトウェアパッケージのデフォルト設定のまま設定されました。評価指標(AUC)、精度、F1スコア、正確さ、想起率などの指標は、デフォルトの0.5確率閾値を用いて算出されました。
臨床的透明性を支持するため、TreeExplainer手法を用いて選択モデルにSHAPを適用しました。最終モデルの木構造構造を踏まえ、正確な木経路依存の期待値が背景構成として用いられました。