研究記事

動脈瘤性くも膜下出血後の遅延性脳虚血に対する臨床予測モデルの内部妥当性検証

26 回視聴

DOI:

10.3791/72237

2026年9月8日

この記事について

サマリー

この単一施設レトロスペクティブ研究では、動脈瘤性くも膜下出血後の遅延性脳虚血に関するロジスティック回帰モデルを開発し、内部妥当性を検証しました。680人の患者において、初期の臨床的、検査的、および画像上の6つの変数が予備的な予測能を示しました。臨床応用には、さらなる外部妥当性の検証が必要です。

要約

遅発性脳虚血(DCI)は、動脈瘤性くも膜下出血(aSAH)後の二次的な神経学的損傷の重要な原因である。本単施設レトロスペクティブ研究では、2022年7月から2024年12月の間に治療を受けたaSAHの成人患者680名のデータを用いて、DCIの予測モデルを構築し評価した。患者はアウトカムで層別化した8:2の分割により、544名のトレーニングコホートと136名のホールドアウト内部検証コホートに分けた。DCIはトレーニングコホートの175名、内部検証コホートの42名に発生した。予測因子の選択は、10分割交差検証を用いたLASSO(least absolute shrinkage and selection operator)回帰によりトレーニングコホートで行った。その結果、年齢、脳浮腫、低アルブミン血症、修正Fisherグレード、Hunt-Hessグレード、および世界脳神経外科学会(WFNS)グレードの6つの変数が保持された。ロジスティック回帰、extreme gradient boosting、light gradient boosting machine、サポートベクターマシン、およびk-nearest neighborモデルを比較した。内部検証コホートにおいて、ロジスティック回帰は0.832(95%信頼区間:0.758–0.906)のROC曲線下面積(AUC)を示した。キャリブレーションの傾き、切片、およびBrierスコアはそれぞれ0.98、0.02、0.168であったが、これらのキャリブレーション推定値の信頼区間は得られなかった。これらの知見は、単一のホールドアウト内部検証コホートにおける予備的な性能を示すものである。再現性の記録が不完全であること、モデルの切片が欠如していること、再サンプリングに基づく楽観度補正が行われていないこと、および外部検証が行われていないことから、現時点では患者レベルの確率計算および臨床への導入は困難である。

概要

aSAH後のDCIに対するいくつかの予測モデルが提案されているが、その多くはサンプルサイズの小ささ、不完全なキャリブレーション評価、モデル開発手順の報告不足、および外部妥当性検証の欠如によって制限されている。多くの研究は主に識別能に焦点を当てており、キャリブレーション、再現性、および臨床的影響の評価に関する報告は一貫性に欠けている。したがって、モデルの性能は透明性のある方法を用いて評価されるべきであり、妥当性検証が単一施設に限定されている場合は慎重に解釈する必要がある。

本研究は、日常的に利用可能な早期の臨床、検査、および画像変数を用いて、遅発性脳虚血(DCI)の予測モデルを構築し、内部評価することを目的とした。同一の選択予測因子のセットを用いて、5つのモデリング手法を比較した。意図した予測時点は、初回の入院、検査、および画像評価の後であり、かつDCIの主要なリスク期間の前である。これらのモデルは研究ベースのリスク推定のために構築されたものであり、DCIの診断、臨床的判断の代替、または独立した治療決定を目的としたものではない。臨床的に使用する前に、外部妥当性確認、再キャリブレーション、および臨床的影響の検討が必要である。

遅発性脳虚血(DCI)は、これらの二次的損傷の一つであり、クモ膜下出血(aSAH)後に発生する、臨床的に最も重要かつ予防可能な可能性のある病態の一つです。DCIは通常、発症から数日後(一般的に3~14日以内)に生じる合併症であり、新たな局所神経学的欠損、意識レベルの低下、および/またはその後の神経画像診断における脳梗塞の発現と関連しています。施設によって診断基準に多少の違いはあるものの、DCIは常に集中治療室での長期入院、多大な医療資源の消費、および不良な神経学的予後を伴います。報告されているDCIの発生率は通常30~40%であり、その有病率の高さと予後への重大な影響が強調されています。1,2,3,4,5,6注目すべき点として、DCIは単一の経路で進行するプロセスではありません。これまで大血管の脳血管攣縮に焦点が当てられてきましたが、蓄積されたエビデンスにより、早期脳損傷、皮質拡延性脱分極、神経炎症、微小血栓症、内皮機能不全、自己調節能の障害、および微小循環不全のすべてが虚血リスクの要因となっていることが示されています。このような多因子的な病態生理は、以下の説明に寄与しています。 血管痙攣を標的とした治療法ではなぜ遅延性脳虚血(DCI)に伴う梗塞を完全に予防できない可能性があるのか、また、通常の臨床現場においてハイリスク患者の特定が困難であるのはなぜか。

aSAH後のDCIのリスク層別化は優先事項である。なぜなら、高リスク患者を迅速に特定することで、より綿密なモニタリングが可能となり、予防策や救済処置を速やかに強化できる可能性があるからである7。臨床現場でのモニタリング計画には、より頻回な神経学的検査、経頭蓋ドップラー超音波検査、CT灌流画像などの高度なイメージング技術の使用、血行動態および血管内ボリュームの最適化、ニモジピン療法の厳格な遵守、ならびに水頭症、再出血、痙攣、感染症、代謝不全などの神経学的悪化の早期発見が含まれ得る。それにもかかわらず、臨床的な決定は、個々の症例に基づいたデータ駆動型のDCI発症確率推定よりも、包括的な重症度スケールや臨床医の経験に影響される傾向がある8,9,10。その理由の一つとして、文献においてリスク因子が不均一であることが示されており、患者因子、出血量、生理学的異常、および神経学的グレード分類スケールの相互作用が非線形かつ複雑である可能性が挙げられる。先行研究では、年齢、高血圧、ベースラインの神経学的状態、動脈瘤の特性、血液検査指標(血清ナトリウムおよびアルブミンなど)、出血量を反映する画像所見、ならびに周術期または治療に関連する因子を含む、DCIの潜在的な予測因子が検討されてきた。従来の回帰分析手法は有用であったが、予測因子間に相関がある場合や、予測因子とリスクとの関係が非線形である場合、あるいは変数間に相互作用がある場合には制約が生じる可能性がある11。同時に、DCIリスクを評価するために複数のツール(最も一般的なのはノモグラムである)が提案されてきた。ノモグラムは実行可能で視覚的に分かりやすいが、その多くは小規模なサンプルに基づいており、変数が少なく、過学習しているか、あるいは十分な検証がなされていない可能性がある。加えて、単一の施設で開発および検証されたモデルは、患者構成、画像の解釈、治療法、およびDCIの診断閾値の違いにより、他の施設に容易に適用できない可能性がある。

機械学習の手法は、厳格な線形性の仮定を必要とせず、臨床データのより多くの次元の探索や、より複雑な傾向の観察を可能にするため、従来の臨床予測モデルを補完することができます。近年、脳血管疾患の分野では、転帰や合併症の予測、および意思決定支援など、機械学習ベースの予測モデルの応用が増えています12,13,14。一般的に用いられる機械学習アルゴリズムには、Extreme Gradient Boosting (XGBoost) や Light Gradient Boosting Machine (LightGBM) などのアンサンブル決定木法、サポートベクターマシン (SVM) などのカーネルベースの分類器、およびk-nearest neighbors (KNN) などの距離ベースの分類器が含まれます。これらのモデルは、原理的に、従来のアプローチよりも非線形性 や相互作用をモデル化することが可能です15。しかし、機械学習モデルには、過学習のリスク、解釈性の低下、ならびに前処理、チューニング、キャリブレーション、評価、およびバリデーションへの対応の必要性といった実用上の懸念もあります。なお、幅広い臨床シナリオにおいて、特に予測因子の数が少なく、信号対雑音比が中程度である場合には、適切に指定されたロジスティック回帰が、より複雑なアルゴリズムと同等か、あるいはそれ以上に効果的に機能する場合があることは注目に値します。したがって、性能と臨床的適用性の両立を確認するためには、同様の予測因子と評価指標を用いたさまざまなアルゴリズムの比較分析が必要です16,17,18.

遅延性脳虚血に関する予測モデルはこれまでいくつか提案されてきましたが、その多くは、サンプルサイズの小ささ、キャリブレーション評価の限定性、アルゴリズム間の直接比較の欠如、および検証の不十分さといった重大な限界を抱えています。さらに、先行研究では識別能が重視される一方で、実社会への適用に不可欠なキャリブレーションや臨床的有用性の指標についての報告が不十分な場合が多く見られます。本研究では、比較的大規模なコホートを用いて予測モデルを開発し、LASSO(least absolute shrinkage and selection operator)回帰による体系的な予測因子の選択を実施し、統一されたモデリングフレームワーク内で複数の機械学習アルゴリズムを比較し、さらに識別能、キャリブレーション、および意思決定分析性能を包括的に評価することで、これらの課題に対処します。

aSAH後のDCIに関する予測モデルがいくつか提案されていますが、その多くは小規模なコホート、不十分なキャリブレーション評価、モデル開発に関する報告の不備、外部妥当性または時間的妥当性の欠如といった重要な限界を抱えています。さらに、多くの研究では識別能のみが報告されており、キャリブレーションや決定曲線分析が提示されることは少ない傾向にあります。本研究は外部妥当性の問題を解決するものではありません。その代わりに、日常的に利用可能な臨床変数、検査値、画像診断変数を用いた、単一施設での開発および内部妥当性検証研究を提供します。想定されるユースケースは、入院および初期の動脈瘤治療後、かつDCIの主要なリスク期間が始まる前の早期リスク層別化です。このモデルは、より厳密な神経学的モニタリング、血管画像による監視、生理学的異常の補正、および神経集中治療チームによる早期レビューが必要な患者を臨床医が特定するのに役立つ可能性があります。本モデルは、外部妥当性検証および臨床的影響の試験なしに、臨床判断に代わることや、DCIを診断すること、あるいは治療を導くことを目的としたものではありません。先行研究ではaSAH後のDCI予測のためにいくつかのモデルが提案されていますが、その多くはサンプルサイズの小ささ、キャリブレーション報告の不備、モデリング手法間の比較不足、または外部妥当性検証の欠如によって制限されてきました。本研究は、臨床的に検証された意思決定ツールを提供することを主張するものではありません。むしろ、単一施設のコホートから得られた、日常的に利用可能な早期の臨床、検査、画像変数を用いて予測モデルを開発し、内部妥当性を検証することを目的としています。想定されるユースケースは、入院および初期の動脈瘤治療後、DCIの主要なリスク期間前の早期リスク層別化です。この状況において、予測リスクが高い場合は、より綿密な神経学的評価、血管モニタリング、生理学的異常の補正、および神経集中治療による早期レビューを支持するものとなります。本モデルは、DCIを診断することや臨床医の判断に代わることを目的としたものではありません。

プロトコル

The study was approved by the Institutional Ethics Committee of Yulin First Hospital, Shaanxi Province, China. Because this was a retrospective analysis of routinely collected hospital data, and because all data were anonymized before analysis, the requirement for written informed consent was waived. The study was conducted in accordance with institutional data-protection requirements and the principles of the Declaration of Helsinki.

Data and Methods
Study Population and Design

This was a retrospective single-center cohort study conducted at Yulin First Hospital, Shaanxi Province, China. The hospital records of patients admitted with aSAH between July 2022 and December 2024 were screened. Eligible patients were adults aged 18 years or older with a diagnosis of aSAH confirmed by cranial and intracranial vascular imaging. Patients were required to have been admitted within 72 h after symptom onset and to have undergone aneurysm treatment during the index hospitalization.

Patients were excluded if they had traumatic subarachnoid hemorrhage, non-aneurysmal subarachnoid hemorrhage, severe pre-existing hematological disease, other major intracranial disease affecting outcome assessment, insufficient records for DCI evaluation, or in-hospital death before an adequate DCI assessment period. Excluding early in-hospital deaths may introduce survivorship bias because the most severe cases may be removed from analysis. Therefore, the findings should be interpreted as applying mainly to patients who survived long enough for DCI evaluation.

Data Collection 

Clinical, laboratory, imaging, and treatment-related variables were extracted from the electronic medical record using a predefined data-extraction form. The extracted variables included demographic factors, medical history, aneurysm features, early neurological grade, early imaging findings, laboratory results, treatment approach, and hospital complications. The intended prediction time point was after completion of the initial admission and perioperative assessment, but before the main DCI risk window.

Age, sex, body mass index, smoking status, alcohol use, hypertension, diabetes, aneurysm size, aneurysm location, modified Fisher grade, Hunt-Hess grade, World Federation of Neurological Surgeons grade, intraventricular hemorrhage, and rebleeding were taken from admission records and initial imaging. Laboratory variables, including hemoglobin, serum albumin, and serum sodium, were obtained from the earliest available blood test prior to the prediction time point. Cerebral edema was assessed using baseline or immediate post-treatment imaging available before DCI diagnosis. Variables recorded only after DCI onset were not used for model development to reduce information leakage.

Anemia was defined as hemoglobin <110 g/L in female patients and <120 g/L in male patients. Hypoalbuminemia was defined as serum albumin <35 g/L. Hyponatremia was defined as serum sodium <130 mmol/L.

Patients were managed according to the institutional aSAH care pathway. Standard management included early aneurysm securing, neurological observation, blood pressure control, fluid and electrolyte management, and surveillance for complications including hydrocephalus, rebleeding, seizure, infection, vasospasm, and DCI. Nimodipine was used unless contraindicated. Vasospasm monitoring was performed using neurological examination, vascular imaging, and transcranial Doppler ultrasonography when clinically indicated. Hydrocephalus was managed with cerebrospinal fluid diversion when required. Hemodynamic optimization and rescue therapy were applied according to the treating team’s assessment. Because treatment intensity and rescue-therapy details were not completely captured in the retrospective dataset, these factors could not be fully adjusted in the model and were considered a limitation.

Diagnosis of DCI 

DCI was defined as a new focal neurological impairment, a decrease in level of consciousness, or a new cerebral infarction on follow-up computed tomography or magnetic resonance imaging occurring during the expected DCI risk window and not explained by another cause. The DCI risk window was defined as days 3–14 after the hemorrhage ictus. Alternative explanations, including rebleeding, hydrocephalus, seizure, infection, metabolic disturbance, sedative effect, and procedure-related infarction, were reviewed before classifying an event as DCI.

Outcome adjudication was performed by two clinicians with experience in the management of aSAH, including one neurosurgeon and one neurologist/neurocritical care physician. The adjudicators reviewed clinical notes, neurological examinations, imaging reports, and follow-up imaging. They were blinded to the final model output during outcome assessment. Disagreements were resolved through consensus discussion with review of the relevant imaging and clinical timeline. Formal inter-rater agreement was not measured, and this limitation was added because DCI classification may involve clinical judgment.

Sample Size Calculation 

The sample size was estimated using the 10-events-per-variable (EPV) rule of thumb11. With 20 candidate predictor variables and an expected DCI incidence of approximately 35%, a minimum sample size of 20 × 10 / 0.35 ≈ 572 patients was required. Our final cohort of 680 patients exceeded this requirement. Although the events-per-variable (EPV) rule was applied as a general guideline, modern predictive modeling, particularly machine learning algorithms, may require more flexible sample-size considerations. The final cohort size was considered adequate to ensure model stability, minimize the risk of overfitting, and enable reliable estimation of model performance metrics.

Model development and validation 

Patients were allocated to a training cohort of 544 patients and a hold-out internal validation cohort of 136 patients using an outcome-stratified 8:2 split. Outcome stratification was used to maintain a similar proportion of DCI events in the two cohorts. DCI occurred in 175 of 544 patients in the training cohort and 42 of 136 patients in the internal-validation cohort. The 8:2 hold-out design was retained because it was the prespecified model-development strategy and provided a separate cohort for preliminary internal performance assessment.

Predictor selection was performed only in the training cohort using least absolute shrinkage and selection operator regression with 10-fold cross-validation. The selected penalty parameter was λ = 0.031. Six predictors were retained: age, cerebral edema, hypoalbuminemia, modified Fisher grade, Hunt-Hess grade, and World Federation of Neurological Surgeons grade.

Logistic regression, extreme gradient boosting, light gradient boosting machine, support vector machine, and k-nearest neighbor models were developed using the same set of selected predictors. All preprocessing, predictor selection, and model-development procedures were restricted to the training cohort. The internal-validation cohort was not used during predictor selection or model tuning and was evaluated only after model development.

The numerical random seed used for the original cohort allocation was not retained in the archived analysis records and could not be retrospectively verified. Bootstrap optimism correction and repeated k-fold internal validation were also not available. Therefore, the present analysis is described as a single hold-out internal validation rather than an optimism-corrected or repeated cross-validated performance assessment.

Machine-learning reproducibility

LASSO predictor selection used 10-fold cross-validation within the training cohort. Continuous predictors were standardized when required by the modeling algorithm, and categorical predictors were represented using predefined binary clinical categories. The validation cohort was not used for tuning or model selection.

The archived analysis materials did not retain the final tuning grids, selected hyperparameters, complete package versions, original random seed, or a confirmed class-imbalance procedure for XGBoost, LightGBM, SVM, and KNN. These settings were therefore not reconstructed or estimated. The machine-learning comparisons should consequently be interpreted as exploratory comparisons of algorithms rather than fully reproducible model-development experiments. Reproducibility information, both available and unavailable, should be summarized in Supplementary Table 1.

Bias Control & Sensitivity Analysis

Consecutive eligible patients were included to reduce selection bias. Standardized variable definitions and a structured data-extraction form were used to reduce information bias. Predictors were restricted to information available before the intended DCI prediction time point to reduce information leakage. Predictor selection, preprocessing, and model development were performed only in the training cohort.

Modified Fisher grade, Hunt-Hess grade, and WFNS grade represent related aspects of hemorrhage burden and neurological severity. Although all three variables were retained after LASSO selection, the numerical variance inflation factor values and the results from a sensitivity model excluding overlapping severity scales were not included in the archived analysis output. These analyses could not be reconstructed from the aggregate tables because patient-level correlations and fitted model outputs are required. Therefore, the individual coefficients of these severity measures were not interpreted as independent or causal effects. They were retained only as components of the prediction model selected in the training cohort.

Model Interpretability

Clinical applicability was believed to require model interpretability as a crucial element. In the most effective model, the effects of predictors were considered to assess the clinical plausibility and conformity with existing pathophysiological knowledge of delayed cerebral ischemia. This method enabled a clear assessment of model behavior and improved the potential for clinical translation.

Missing Data

Variable-level missingness was assessed during data preparation. However, the original pre-imputation missing counts and percentages for each candidate variable were not retained in the archived analysis records and could not be accurately reconstructed from the aggregate tables. Consequently, no assumption of complete data was made, and no unverified missingness percentages were reported.

A verified supplementary missing-data table should be generated directly from the original deidentified patient-level dataset. Supplementary Table 2 should report, for every candidate variable, the number and percentage of missing observations before data handling, the method used to address missingness, and the number of observations included in the final analysis. The inability to recover the original variable-specific missingness pattern was considered a limitation of the present report.

Statistical Analysis 

Predictor selection was performed in the training cohort using LASSO regression with 10-fold cross-validation. Discrimination was assessed using the area under the receiver operating characteristic curve with 95% confidence intervals. Calibration was described using calibration plots and point estimates of the calibration slope, calibration intercept, and Brier score. Bootstrap confidence intervals for calibration measures were not available.

Threshold-dependent classification measures were calculated from the available internal-validation confusion matrices. The exact numerical probability threshold used to generate the archived confusion matrices was not retained and could not be verified. Therefore, these measures were interpreted descriptively and were not used as the primary basis for model selection. Decision-curve analysis was also considered exploratory because the exact prespecified threshold range and patient-level net-benefit output were not retained. A two-sided P value below 0.05 was considered statistically significant.

結果

トレーニングコホートと内部検証コホートにおけるベースライン特性の比較

合計680名のaSAH患者を対象とした。トレーニングコホートには544名の患者が含まれ、そのうち175名にDCIが発現し、内部検証コホートには136名の患者が含まれ、そのうち42名にDCIが発現した。DCIの発現率は、トレーニングコホートで32.2%、内部検証コホートで30.9%であった。ベースライン特性を表1に示す。保存された一部の表項目に分母の不一致が含まれていたため、最終提出前に元の患者レベルのデータセットと照らして表を確認する必要がある。

変数トレーニングコホート (n = 544)内部検証コホート (n = 136)t/χ²/ZPSMD補正に関する注記
年齢, years62.88 ± 9.4163.25 ± 9.520.4090.6930.039
性別0.4290.5120.063
男性180 (33.09)41 (30.15)
女性364 (66.91)95 (69.85)
BMI, kg/m²23.46 ± 3.5623.61 ± 3.650.4370.6620.042
喫煙歴0.1180.7310.033
あり101 (18.57)27 (19.85)
なし443 (81.43)109 (80.15)
飲酒習慣0.4170.5180.062
あり118 (21.69)33 (24.26)
なし426 (78.31)103 (75.74)
高血圧の既往0.3480.5550.057
あり329 (60.48)86 (63.24)
なし215 (39.52)50 (36.76)
糖尿病の既往0.1160.7330.033検証群の「なし」の数を、合計が136になるよう補正した。
あり70 (12.87)19 (13.97)
なし474 (87.13)117 (86.03)
動脈瘤径, mm0.2130.6450.044
>10288 (52.94)75 (55.15)
≤10256 (47.06)61 (44.85)
動脈瘤の部位0.9800.3220.095
前方循環系448 (82.35)107 (78.68)
後方循環系96 (17.65)29 (21.32)
脳浮腫0.6120.4340.075
あり125 (22.98)27 (19.85)
なし419 (77.02)109 (80.15)
低ヘモグロビン血症0.6840.4080.079検証群の「なし」の数を、合計が136になるよう補正した。トレーニング群の数は表2と矛盾しているため、最終データセットで確認すること。
あり147 (27.02)32 (23.53)
なし397 (72.98)104 (76.47)
低アルブミン血症0.3670.5450.058
あり115 (21.14)32 (23.53)
なし429 (78.86)104 (76.47)
低ナトリウム血症0.1860.6660.041
あり331 (60.85)80 (58.82)
なし213 (39.15)56 (41.18)
修正Fisherグレード0.2490.6180.048
≥III259 (47.61)68 (50.00)
I–II285 (52.39)68 (50.00)
Hunt-Hessグレード0.1780.6730.040検証群の≥IIIの数を、合計が136になるよう53から63に補正した。最終データセットで確認すること。
≥III263 (48.35)63 (46.32)
I–II281 (51.65)73 (53.68)
WFNSグレード0.2490.6180.048
≥III277 (50.92)66 (48.53)
I–II267 (49.08)70 (51.47)
外科的アプローチ0.7170.3970.081
血管内治療449 (82.54)108 (79.41)
クリッピング術95 (17.46)28 (20.59)
手術時間, h2.78 ± 0.812.81 ± 0.790.3880.6980.037
脳室内出血0.3830.5360.059
あり134 (24.63)37 (27.21)
なし410 (75.37)99 (72.79)
再出血0.7840.3760.085
あり98 (18.01)29 (21.32)
なし446 (81.99)107 (78.68)

表1:トレーニングコホートおよび内部検証コホートのベースライン特性。連続変数は平均値 ± 標準偏差で、カテゴリー変数は n (%) で表示しています。P値および標準化平均差は、2つのコホートを比較したものです。 略語:BMI、ボディマス指数;SMD、標準化平均差。 こちらのリンクをクリックして、この表をダウンロードしてください。

トレーニングセットにおける非DCI群とDCI群のベースライン特性の比較 

トレーニングデータセットにおいて、遅延性脳虚血(DCI)は175例(32.17%)に認められ、369例(67.83%)ではDCIを発症しませんでした。内部検証コホートにおけるDCIの発生率も同等であり、アウトカムの有病率が安定していることが示されました。非DCI群とDCI群の比較分析により、いくつかの統計的に有意な差が明らかになりました(表2)。DCIを発症した患者は有意に高齢であり(P = 0.026)、年齢に関連した二次性虚血性損傷への感受性が示唆されました。特に脳浮腫などの早期脳損傷の放射線学的所見は、DCI患者において顕著に多く認められました(P = 0.001)。低アルブミン血症(P = 0.007)、低ナトリウム血症(P = 0.048)、および低ヘモグロビン値(P < 0.001)を含む臨床検査値の異常は、DCIの発生と有意に関連していました。神経学的重症度マーカーにおいて最も強い関連性が示されました。修正Fisher gradeの高値(≥III)はDCI患者で有意に多く(P < 0.001)、出血量と遅延性虚血性合併症との間に強力な関係があることが示されました。同様に、高いHunt–Hess gradeおよび世界脳神経外科医連盟(WFNS)gradeも、DCIの発症と強く関連していました(ともにP < 0.001)。対照的に、人口統計学的変数、ライフスタイル要因、動脈瘤の形態、手術アプローチ、および手術時間については、統計的に有意な差は認められませんでした。

変数非DCI群 (n = 369)DCI群(n = 175)翻訳するテキストを提供してください。χ²/Zp値訂正告知
年齢(歳)62.25 ± 9.5464.22 ± 9.752.2340.026
性別0.6380.424
オス118 (31.98)62 (35.43)
251 (68.02)113 (64.57)
BMI, kg/m²²23.43 ± 3.5623.52 ± 3.720.2710.786
喫煙歴0.3510.554
はい66 (17.89)35 (20.00)
いいえ303 (82.11)140 (80.00)
アルコール使用0.0460.837
はい81 (21.95)37 (21.14)
いいえ288 (78.05)138 (78.86)
高血圧の歴史2.9600.085
はい214 (57.99)115 (65.71)
いいえ155 (42.01)60 (34.29)
糖尿病の歴史0.4630.496
はい45 (12.20)25 (14.29)
いいえ324 (87.80)150 (85.71)
動脈瘤径 (mm)0.3800.538
>10192 (52.03)96 (54.86)
≤10177 (47.97)79 (45.14)
動脈瘤の部位3.6020.058
前方循環296 (80.22)152 (86.86)
後方循環73 (19.78)23 (13.14)
脳浮腫10.4100.001
はい70 (18.97)55 (31.43)
いいえ299 (81.03)120 (68.57)
低ヘモグロビン23.965<0.001合計が表1と異なります。最終データセットと照らし合わせて確認してください。
はい122 (33.06)82 (46.86)
いいえ247 (66.94)93 (53.14)
低アルブミン血症7.2830.007
はい66 (17.89)49 (28.00)
いいえ303 (82.11)126 (72.00)
低ナトリウム血症3.9140.048
はい214 (57.99)117 (66.86)
いいえ155 (42.01)58 (33.14)
修正Fisher分類58.679<0.001
III以上134 (36.31)125 (71.43)
I–II235 (63.69)50 (28.57)
ハント・ヘス分類39.909<0.001
≥III144 (39.02)119 (68.00)
I–II225 (60.98)56 (32.00)
WFNSグレード28.137<0.001
≥III159 (43.09)118 (67.43)
I–II210 (56.91)57 (32.57)
外科的アプローチ0.6910.406
血管内治療308 (83.47)141 (80.57)
クリッピング61 (16.53)34 (19.43)
手術時間(h)2.74 ± 0.822.85 ± 0.761.4960.135
脳室内出血0.1630.687
はい89 (24.12)45 (25.71)
いいえ280 (75.88)130 (74.29)
再出血1.1680.280
はい71 (19.24)27 (15.43)
いいえ298 (80.76)148 (84.57)

表2:トレーニングコホートにおける遅発性脳虚血(DCI)を発症した患者および発症しなかった患者のベースライン特性。連続変数は平均値 ± 標準偏差で、カテゴリー変数はn (%)で示されている。P値はDCIを発症した患者と発症しなかった患者を比較したものである。 略語:DCI:遅発性脳虚血、WFNS:世界神経外科学会連合。 こちらのリンクから本表をダウンロードしてください。

内部検証コホートにおけるアウトカム分布
内部検証コホート(n = 136)において、遅発性脳虚血(DCI)が42例(30.9%)に認められ、94例(69.1%)ではDCIを発症しなかった。アウトカムの有病率はトレーニングデータセットで観察された値と同等であり、データセット間でのイベント分布の安定性が裏付けられた。

特徴量選択 

トレーニングコホートにおいて、10分割交差検証を用いたLASSO回帰により予測因子の選択を行った。選択されたペナルティパラメータは λ = 0.031 であった。非ゼロの係数を保持した予測因子は、年齢、脳浮腫、低アルブミン血症、修正Fisherグレード、Hunt-Hessグレード、およびWFNSグレードの6つであった。選択されたすべての予測因子は、予定していた予測時点より前に利用可能であった。図 1A,B に、予測因子の選択に使用した係数の軌跡と交差検証曲線を示す。

figure-results-1
図1: 脳動脈瘤破裂によるくも膜下出血後の遅発性脳虚血におけるLASSOを用いた予測因子の選択。(A) log(λ)の値に応じた候補予測因子の係数の軌跡。各曲線は1つの候補予測因子を表し、上軸の数値は各ペナルティ値において保持された非ゼロ係数の数を示す。(B) 二項偏差の10分割交差検証曲線。点は平均交差検証偏差を示し、エラーバーは標準誤差を、垂直の点線は最小誤差および1標準誤差のペナルティ値を示す。最終的に選択されたペナルティパラメータはλ = 0.031であった。LASSO:least absolute shrinkage and selection operator、DCI:遅発性脳虚血。 ここをクリックして、この図の拡大版を表示してください。

モデルの開発と評価

5つのすべてのモデルは、選択された同じ6つの予測因子を用いて開発された。内部検証コホートにおいて、ロジスティック回帰のAUCは0.832(95% CI, 0.758–0.906)、SVMのAUCは0.811(95% CI, 0.729–0.893)、XGBoostのAUCは0.777(95% CI, 0.690–0.864)、LightGBMのAUCは0.755(95% CI, 0.672–0.838)、KNNのAUCは0.708(95% CI, 0.613–0.803)であった(表3)。

データセットモデルAUC95% CI正解率感度特異度F1スコア修正注記
トレーニングXGBoost0.9160.888–0.9440.8480.8530.8470.682
トレーニングLogistic regression0.8330.794–0.8720.8160.710.810.594
トレーニングLightGBM0.7510.707–0.7940.690.7810.6690.489
トレーニングSVM0.8070.762–0.8520.8090.7040.8330.583
トレーニングKNN0.9150.896–0.9350.7540.8780.6960.607KNNのAUCを、表の値と一致させるため図2の凡例から修正した。
検証XGBoost0.7770.690–0.8640.7550.6080.7940.507
検証Logistic regression0.8320.758–0.9060.8090.7140.8510.698分類指標を表6の混同行列から再計算した。
検証LightGBM0.7550.672–0.8380.6960.7990.6690.522
検証SVM0.8110.729–0.8930.7790.690.8190.659分類指標を表6の混同行列から再計算した。
検証KNN0.7080.613–0.8030.6470.7150.6290.456

表3:トレーニングコホートおよび内部検証コホートにおける予測モデルの識別能および分類能。AUC値は95%信頼区間とともに記載されている。正解率、感度、特異度、およびF1スコアは、事前に指定した分類閾値で算出された。 略語:AUC, 受信者動作特性曲線下面積;CI, 信頼区間;KNN, k近傍法;LightGBM, Light Gradient Boosting Machine;SVM, サポートベクターマシン;XGBoost, Extreme Gradient Boosting。アーカイブされた解析で使用された正確な確率閾値を検証できなかったため、閾値依存的な分類指標はモデル比較の主要な根拠として使用しなかった。こちらのリンクをクリックして、この表をダウンロードしてください。

信頼区間が重複しており、ロジスティック回帰は他のモデルよりも統計的に優れているとは解釈されませんでした。ロジスティック回帰は、安定した内部識別能を提供し、モデル構造が直接的に解釈可能であるため、主要なモデルとして採用されました。これらの結果は、単一のホールドアウト内部検証コホートにおける性能を示すものであり、楽観度補正済み、時間的、または外部的な検証を構成するものではありません (図 2A–D)。

figure-results-2
図2予測モデルの識別能、較正能、および決定曲線分析による性能評価。
(A) トレーニングコホートにおける受信者動作特性曲線。(B内部検証コホートにおける受信者動作特性曲線。曲線のラベルは、95%信頼区間を伴う受信者動作特性曲線下面積(AUC)を示している。C) 予測されたDCI確率と観察されたDCI確率を比較したキャリブレーション曲線。対角の点線は完全なキャリブレーションを示す。 (D閾値確率におけるネットベネフィットを示す決定曲線分析。水平の点線は「全員治療なし」戦略を、破線は「全員治療」戦略を表す。AUC:受信者動作特性曲線下面積、DCI:遅発性脳虚血、KNN:k近傍法、LightGBM:light gradient boosting machine、SVM:サポートベクターマシン、XGBoost:extreme gradient boosting。 この図の拡大版を表示するには、こちらをクリックしてください。

探索的決定曲線分析

正味の利益(net benefit)を探索的に評価するため、決定曲線分析を実施した。しかし、事前に設定した正確な閾値確率の範囲および患者レベルの正味の利益の出力結果が、保存された解析記録に残っていなかった。その結果、決定曲線の結果から臨床的有用性を立証することや、臨床的に適切な介入閾値を定義することはできない。

「全員治療」または「誰も治療しない」戦略に対する明らかな正味の利益の優位性は、本内部データセット内での予備的なパターンとしてのみ解釈されるべきです。このモデルが患者管理の決定に有用であると見なされるには、外部妥当性の検証、前向きな閾値選択、臨床的影響の評価、および正式な臨床インパクト研究が必要です(図 3)。

figure-results-3
図3内部検証コホートにおける、選択された予測モデルの決定曲線分析。 ロジスティック回帰、SVM、およびXGBoostモデルについて、閾値確率に対するネットベネフィットをプロットした。破線の「全治療(treat-all)」ラインはすべての患者をモニタリングする戦略を、点線の「非治療(treat-none)」ラインはどの患者もモニタリングしない戦略を表している。モデルのネットベネフィット曲線がこれら2つの参照戦略の両方を上回る閾値確率において、そのモデルは臨床的に有用であるとみなされる。SVM:サポートベクターマシン、XGBoost:極端な勾配ブースティング。 こちらの図の拡大版を表示するには、ここをクリックしてください。

多変数ロジスティック回帰モデル

最終的なロジスティック回帰モデルには、年齢、脳浮腫、低アルブミン血症、修正Fisherグレード、Hunt-Hessグレード、およびWFNSグレードが含まれた。回帰係数、オッズ比、95%信頼区間、およびP値は表4に示す。年齢の係数は0.038であり、脳浮腫、低アルブミン血症、修正Fisherグレード ≥ III、Hunt-Hessグレード ≥ III、およびWFNSグレード ≥ IIIの係数は、それぞれ0.842、0.615、1.274、0.933、および0.781であった。

予測因子β 係数オッズ比 (OR)95%信頼区間P解釈に関する注記
切片翻訳するテキストを入力してください。患者レベルのリスク算出に必要である。
年齢0.0381.0391.012–1.0670.004予測的な関連性のみであり、因果関係を示すものではない。
脳浮腫0.8422.3211.541–3.496<0.001DCI診断前に測定。
低アルブミン血症0.6151.851.206–2.8370.005予測時点より前に利用可能な最短のアルブミン値。
修正FisherグレードIII以上1.2743.5752.401–5.324<0.001重症度マーカー。共線性に注意して解釈すること。
Hunt-HessグレードIII以上0.9332.5421.674–3.861<0.001重症度マーカー。共線性に関する注意を払って解釈すること。
WFNSグレードIII以上0.7812.1841.447–3.298<0.001重症度マーカー。共線性に注意して解釈すること。

表4:遅延性脳虚血を予測するための最終多変量ロジスティック回帰モデル。LASSO選択後に保持された予測因子について、回帰係数、オッズ比、95%信頼区間、およびP値を示す。すべての予測因子は、予定される予測時点よりも前に評価された。略語:CI、信頼区間;DCI、遅延性脳虚血;OR、オッズ比;WFNS、世界神経外科学会。アーカイブされたモデル出力に数値的なロジスティック回帰切片が含まれていなかった。したがって、報告された係数を用いて個々の予測確率を算出することはできない。これらの係数は予測的な関連性を示すものであり、独立した因果効果として解釈すべきではない。こちらのリンクをクリックして、この表をダウンロードしてください。

これらの係数は、開発コホートにおける予測的な関連性を示すものである。修正Fisherグレード、Hunt-Hessグレード、およびWFNSグレードは、疾患重症度の重複する側面を表しており、数値的な共線性診断が行われていないため、これらを独立した因果効果として解釈すべきではない。これらの変数は、確認された独立したリスク因子としてではなく、予測モデルの構成要素として保持された。

校正性能

内部検証コホートにおける校正は、校正スロープ、校正インターセプト、およびブライア・スコアの点推定値を用いて要約した。ロジスティック回帰では、校正スロープが0.98、校正インターセプトが0.02、ブライア・スコアが0.168であった。対応する値は、SVMでは0.94、0.05、0.182、XGBoostでは0.88、0.09、0.201、LightGBMでは0.91、0.07、0.194、KNNでは0.92、0.06、0.190であった(表5)。

再サンプリングに必要な個々の予測確率がアーカイブされた解析出力に保持されていなかったため、これらの較正指標のブートストラップ信頼区間は算出できませんでした。したがって、較正結果は内部検証コホートにおける予備的な点推定値として提示されており、他の施設や患者集団における較正の根拠として解釈されるべきではありません(図 4)。

figure-results-4
図 4: 内部検証コホートにおけるロジスティック回帰モデルのキャリブレーション。実線は、遅延性脳虚血の予測確率と観察確率との関係を示している。対角の破線は完全なキャリブレーションを表し、2つの線が近いほどキャリブレーション性能が高いことを示す。DCI:遅延性脳虚血。こちらをクリックして、この図の拡大版を表示してください。

モデルキャリブレーション勾配キャリブレーション勾配 95% CIキャリブレーション切片キャリブレーション切片 95% CIブライアースコアブライアースコア 95% CI補正ノート
ロジスティック回帰0.98[ブートストラップ 95% CIを挿入]0.02[ブートストラップ 95% CIを挿入]0.168[ブートストラップ 95% CIを挿入]利用可能な場合は、最終解析からのブートストラップ CI を追加してください。
SVM0.94[ブートストラップ 95% CIを挿入]0.05[ブートストラップ 95% CIを挿入]0.182[ブートストラップ 95% CIを挿入]
XGBoost0.88[ブートストラップ 95% CIを挿入]0.09[ブートストラップ 95% CIを挿入]0.201[ブートストラップ 95% CIを挿入]
LightGBM0.91[ブートストラップ 95% CIを挿入]0.07[ブートストラップ 95% CIを挿入]0.194[ブートストラップ 95% CIを挿入]
KNN0.92[ブートストラップ 95% CIを挿入]0.06[ブートストラップ 95% CIを挿入]0.19[ブートストラップ 95% CIを挿入]

表 5: 内部検証コホートにおける予測モデルのキャリブレーション性能。キャリブレーション・スロープが 1.0、キャリブレーション・インターセプトが 0 の場合、理想的なキャリブレーションであることを示す。Brierスコアが低いほど、総合的な予測精度が高いことを示す。略語:KNN, k-nearest neighbor; LightGBM, light gradient boosting machine; SVM, support vector machine; XGBoost, extreme gradient boosting。キャリブレーション・スロープ、キャリブレーション・インターセプト、およびBrierスコアは点推定値として報告されている。ブートストラップ信頼区間は利用できなかった。これらの結果は、ホールドアウトされた内部検証コホート内における予備的なキャリブレーションのみを記述したものである。こちらのリンクから本表をダウンロードしてください。

混同行列から導出される指標。

ロジスティック回帰で得られた内部検証用の混同行列では、真陽性が30例、真陰性が80例、偽陽性が14例、偽陰性が12例であった。再計算された正解率は0.809、感度は0.714、特異度は0.851、陽性予測値は0.682、陰性予測値は0.870、F1スコアは0.698であった。

SVMでは、混同行列において真陽性が29件、真陰性が77件、偽陽性が17件、偽陰性が13件であった。再計算された精度は0.779、感度は0.690、特異度は0.819、陽性的中率は0.630、陰性的中率は0.856、F1スコアは0.659であった(表6)。

指標ロジスティック回帰サポートベクターマシン計算ノート
真陽性3029検証コホート
真陰性8077検証コホート
偽陽性1417検証コホート
偽陰性1213検証コホート
精度0.8090.779(TP + TN) / 全体
感度0.7140.69TP / (TP + FN)
特異性0.8510.819TN / (TN + FP)
陽性的中率0.6820.63TP / (TP + FP)
陰性予測値0.870.856TN / (TN + FN)
F1スコア0.6980.6592TP / (2TP + FP + FN)

表6:内部検証コホートにおけるロジスティック回帰およびSVMの混同行列に基づく性能指標。指標は保存された混同行列から算出されましたが、正確な閾値は保持されていません。表の脚注に正確な閾値を記載してください。略語:NPV、陰性的中率;PPV、陽性的中率;SVM、サポートベクターマシン。混同行列は内部検証コホートから取得されました。再計算したロジスティック回帰の正解率、感度、特異度、陽性的中率、陰性的中率、およびF1スコアは、それぞれ0.809、0.714、0.851、0.682、0.870、0.698でした。対応するSVMの値は、それぞれ0.779、0.690、0.819、0.630、0.856、0.659でした。元の解析で使用された正確な分類閾値は保持されていないため、最終提出前に確認する必要があります。こちらのリンクから本表をダウンロードしてください。

数値的な一貫性を確保するため、これらの値は同一の混同行列から直接再計算されました。しかしながら、元の分類解析で使用された正確な確率閾値は保持されていません。したがって、閾値に依存する指標は記述的に報告されており、元の解析コードから閾値が確認されるまで、モデル比較の主要な根拠として使用すべきではありません(表 7)。

サブグループAUC(ロジスティック回帰)
年齢 65歳以上0.821
年齢 <65歳0.836
修正Fisher分類グレードIII以上0.844
修正フィッシャー I–II0.801
クリッピング0.825
血管内治療0.835

表7:ロジスティック回帰モデルの探索的サブグループ識別解析。AUC値を年齢、修正Fisherグレード、および治療サブグループ別に報告している。これらの解析は探索的なものであり、モデルの汎用性の根拠として解釈されるべきではない。すべてのサブグループについて、サブグループのサンプルサイズ、DCIイベント数、および95%信頼区間を追記すること。
略語:AUC, 受信者動作特性曲線下面積;DCI, 遅延性脳虚血。こちらのリンクから本表をダウンロードしてください。

探索的サブグループ解析

アーカイブされたサブグループ解析の結果には、年齢、修正Fisherグレード、および治療アプローチ別のAUC点推定値が含まれていました。しかし、サブグループのサンプルサイズ、サブグループのDCIイベント数、95%信頼区間、および交互作用または不均一性の正式な検定結果は得られませんでした。したがって、サブグループに関する知見は不完全であり、探索的なものであるとみなされました。これらは、モデルの性能が患者サブグループ間で堅牢であるか、一貫しているか、または一般化可能であるかを主張するために使用されることはありませんでした。

リスク層別化能

保存されたリスク層別化の出力では、提案された低リスク、中リスク、および高リスクカテゴリーにおいて、それぞれ10.2%、33.6%、69.1%のDCI発現率が報告されました。しかし、対応するグループの分母、DCIイベント数、信頼区間、および確率カットオフに関する事前に規定された臨床的または統計的な正当性が得られませんでした。したがって、この解析は探索的であるとみなされ、検証済みのリスク分離や臨床的適用性を裏付ける根拠としては使用されませんでした(表8)。

リスクカテゴリー確率範囲観察されたDCI発生率
低リスク<0.2010.2%
中リスク0.20–0.5033.6%
高リスク>0.5069.1%

表8:内部検証コホートにおけるモデル由来のリスクカテゴリー別の遅発性脳虚血発生率。リスクカテゴリーは、最終的なロジスティック回帰モデルによる予測確率を用いて定義された。こちらのリンクからこの表をダウンロードしてください。

最終ロジスティック回帰モデル

アーカイブされた回帰分析の結果には、選択した6つの予測因子の係数は含まれていましたが、数値的なモデル切片は含まれていませんでした。個々の予測確率を算出するには切片が必要であるため、完全な患者レベルの予測式を報告することはできませんでした。したがって、不完全な方程式を想定値や再構成した値を用いて補完するのではなく、削除することとしました。

表4に示した係数は、適合モデル内における予測因子の関連性の方向および相対的な大きさを記述するために使用できますが、患者レベルのDCI確率の算出に使用してはいけません。完全な予測式は、元の適合モデルから切片を回収するか、または実際の患者レベルのデータセットを再分析して切片を再生成した後にのみ提供可能です。

Logit(DCI) = [切片] + 0.038 × 年齢 + 0.842 × 脳浮腫 + 0.615 × 低アルブミン血症 + 1.274 × 改訂Fisherグレード ≥III + 0.933 × Hunt-Hessグレード ≥III + 0.781 × 世界脳神経外科学会グレード ≥III。

DCIの予測確率は、次のように算出されました:

P(DCI) = 1 / [1 + exp(−Logit)]

バイナリ予測因子は、条件が存在する場合を1、存在しない場合を0としてコード化した。修正Fisherグレード≥III、Hunt-Hessグレード≥III、および世界脳神経外科学会(WFNS)グレード≥IIIについては、患者が閾値を満たした場合を1、それ以外を0としてコード化した。切片は患者レベルの確率計算に必要であるため、ここでは報告しない。本方程式は、外部妥当性の検証および再キャリブレーションが完了するまで、研究目的の解釈にのみ使用されるべきである。

修正Fisherグレード、Hunt-Hessグレード、および世界脳神経外科学会(WFNS)グレードはいずれも疾患の重症度を反映しており、臨床的な意味において部分的に重複している可能性があります。数値的な共線性の診断および、重複する重症度スケールを除外した完全な感度モデルが得られなかったため、本稿ではこれらの変数を独立した因果予測因子として解釈していません。これらは、トレーニングコホートで選択された予測モデルの構成要素としてのみ保持されています。この制限により、各重症度スケールの独立した寄与に対する信頼性が低下するため、今後の外部妥当性確認研究で対処されるべきです。

データの利用可能性:

完全な患者レベルの病院データセットは、機密性の高い臨床情報を含み、機関の倫理およびデータ保護要件に従うため、一般には公開されていません。方法論的に正当化された研究計画書、倫理承認の証明、および適切なデータ利用合意書の提出後、楡林市第一人民病院の機関倫理委員会によって、匿名化された分析データセットへのアクセスが検討される場合があります。共有されるデータセットからは、氏名、病院識別番号、正確な日付、連絡先情報、およびその他の直接的または間接的な識別子が除外されています。機関のポリシーで許可されている範囲内で、検証済みの変数辞書、分析スクリプト、モデル開発と再現性に関する情報を記載したSupplementary Table 1、および変数ごとの欠損値を報告したSupplementary Table 2を提供しています。デモンストレーション用または合成データセットは、元の臨床研究データとして提示されるものではありません。

補足表1:モデル開発における再現性の詳細および最終ハイパーパラメータ。この表では、XGBoost、LightGBM、SVM、KNNの乱数シード、ソフトウェアおよびパッケージのバージョン、前処理ステップ、欠損値補完手順、クロスバリデーション手法、チューニンググリッド、および最終ハイパーパラメータを報告します。こちらのリンクからファイルをダウンロードしてください。

補足表2:候補予測因子の欠損データの要約および処理戦略。各候補予測因子について、欠損値の数と割合、補完方法、および解析への採用可否を報告する。こちらのリンクからファイルをダウンロードしてください。

ディスカッション

本研究では、初期の臨床的、検査的、および画像的変数を用いて、aSAH後のDCIに関する予測モデルを開発し、内部的に検証した。予測因子の選別後、年齢、脳浮腫、低アルブミン血症、修正Fisherグレード、Hunt-Hessグレード、および世界脳神経外科連合(WFNS)グレードの6つの変数が維持された。評価したモデルの中で、ロジスティック回帰は安定した内部識別能と許容可能な較正能を示した。検証コホートがトレーニングコホートと同じ施設および期間から抽出されているため、本結果は予備的な内部検証のみとして解釈されるべきである。

選択された予測因子は、aSAHの文脈において臨床的に妥当である。修正Fisherグレードが高いことは出血量の多さを反映し、Hunt-HessおよびWFNSグレードは発症時の神経学的重症度を示す14,15。脳浮腫は早期脳損傷を表している可能性があり、高齢であることは生理学的予備能の低下を示唆している可能性がある。低アルブミン血症は、全身性疾患、炎症、栄養状態、または内皮の脆弱性を反映している可能性がある19,20。しかし、これらの関連性は予測のために特定されたものであり、因果関係として解釈されるべきではない。さらに、修正Fisher、Hunt-Hess、およびWFNSグレードは、疾患の重症度の関連する側面を測定している。VIF値および数値的な感度分析が利用できなかったため、各グレード尺度の独立した寄与を確定することはできなかった。

ホールドアウト内部検証コホートにおいて、より複雑な機械学習手法はロジスティック回帰に対して明確な優位性を示しませんでした。ロジスティック回帰が最高の検証AUCを示しましたが、信頼区間は他のモデルの信頼区間と重複していました。複雑なアルゴリズムは非線形パターンを捉える可能性がありますが、予測変数セットが小さく、データが単一施設からのものである場合に過学習を起こす可能性があります。したがって、解釈可能性と安定した内部識別能を持つことから、ロジスティック回帰を主モデルとして採用しました。それにもかかわらず、ハイパーパラメータやソフトウェアバージョンの記録が不完全であるため、機械学習の比較における再現性は制限されます。

本モデルには、確立された臨床的な役割はありません。推定リスクが高い場合に、理論的にはより綿密な神経学的観察や、より早期の専門医による受診を支持する可能性がありますが、モデルの切片が得られていないため、現時点では患者レベルの確率を算出することはできません。さらに、決定曲線のしきい値範囲、サブグループにおける性能、およびリスクカテゴリー別の結果についての記録が不完全でした。したがって、本モデルを単独の診断ツール、モニタリングルール、または治療決定の根拠として使用すべきではありません。実装を検討する前に、完全なモデルの再構築、外部妥当性の検証、再キャリブレーション、および前向きの臨床的影響評価が必要です。

本研究にはいくつかの限界がある。第一に、単一施設でのレトロスペクティブな研究であったため、一般化能に制限がある。第二に、モデルの性能評価に、アウトカムで層別化した単一の8:2ホールドアウト分割を用いた点である。ブートストラップ法による楽観度補正、反復k-fold検証、時間的検証、および外部検証は実施できなかった。第三に、元の乱数シード、最終的な機械学習のハイパーパラメータ、チューニンググリッド、クラス不均衡処理、およびソフトウェアパッケージの完全なバージョンが保持されていなかったため、計算上の再現性が制限される。第四に、数値的なロジスティック回帰の切片が得られなかったため、個々の予測確率を算出することができなかった。第五に、修正Fisherグレード、Hunt-Hessグレード、およびWFNSグレードは相互に関連する重症度指標であり、重複するスケールを除外したVIF診断および数値的な感度分析は実施できなかった。第六に、キャリブレーションの傾き、キャリブレーション切片、およびBrierスコアの信頼区間を算出しなかった。第七に、正確な分類しきい値およびDCAのしきい値範囲を確認することができなかった。第八に、サブグループ解析およびリスク層別化解析において、完全な分母、イベント数、信頼区間、および正式な交互作用検定が不足していた。第九に、変数ごとの元の欠損パターンが保持されていなかった。最後に、院内早期死亡例を除外したため、生存バイアスが導入された可能性がある。これらの限界から、本モデルは予備的なものと見なすべきであり、完全な再解析と独立した外部検証が行われるまでは、臨床的な意思決定に使用すべきではない。

本研究では、初期の臨床変数、検査値、および画像変数を用いて、aSAH後のDCIに関する予測モデルを開発し、評価した21。LASSO選択の結果、年齢、脳浮腫、低アルブミン血症、modified Fisher grade、Hunt-Hess grade、およびWFNS gradeの6つの予測因子が保持された22,23,24,25,26,27,28,29。ロジスティック回帰では、ホールドアウト内部検証コホートにおいてAUC 0.832 (95% CI) を達成し、解釈可能なモデル構造が得られた29,30。しかし、解析は単一の内部分割に依存しており、完全なリサンプリングに基づく検証、外部検証、および計算上の再現性に関する情報は得られていない。したがって、これらの知見は臨床的に検証済みの予測ツールとしてのエビデンスではなく、予備的なモデル開発結果として解釈されるべきである。

この単一施設レトロスペクティブ研究では、6つの早期臨床、検査、および画像変数を指標として、aSAH後のDCI予測モデルを開発し、評価した。ロジスティック回帰分析では、単一のホールドアウト内部検証コホートにおいて予備的な識別能が示され、解釈可能なモデル構造が得られた31,32,33,34。しかし、再現性に関する記録の不備、数値的な切片の欠如、リサンプリングに基づく検証の未実施、不完全な不確実性評価、および外部検証の欠如により、患者レベルでの確率計算および臨床利用は困難である。真正な患者レベルのデータセットを用いた再解析、モデル開発設定の完全な報告、および独立した多施設共同検証が必要である。

謝辞

著者らは、匿名化された臨床データの収集において、楡林市第一人民病院の診療録管理スタッフの支援を受けたことに感謝いたします。これらのスタッフは、研究計画の立案、結果の判定、統計モデルの作成、結果の解釈、原稿の作成、および最終原稿の承認に関与していないため、著者資格の基準を満たしていません。

材料

この記事で使用された材料の一覧
名前会社カタログ番号コメント
電子カルテシステムYulin First Hospital該当なし後方視的臨床データのソース。正確な商用プラットフォームはアーカイブ記録に保持されていない。
IBM SPSS StatisticsIBM CorporationVersion 25.0記述統計および推論統計解析。
K-近傍法の実装パッケージ/ソースは保持されていない利用不可探索的な機械学習モデル。正確なパッケージおよびバージョンは、元のコード環境から復元する必要がある。
LightGBMMicrosoft / オープンソースプロジェクトバージョン利用不可探索的な勾配ブースティングモデル。正確なパッケージバージョンおよびハイパーパラメータは保持されていない。
R統計ソフトR Foundation for Statistical ComputingVersion 4.3.2統計モデリングおよび内部性能評価。
サポートベクターマシン実装パッケージ/ソースは保持されていない利用不可探索的な機械学習モデル。正確なパッケージ、カーネル設定、およびバージョンは保持されていない。
XGBoostオープンソースプロジェクトバージョン利用不可探索的な勾配ブースティングモデル。正確なパッケージバージョンおよびハイパーパラメータは保持されていない。

参考文献

  1. Caylor MM, MacDonald RL. Pharmacological prevention of delayed cerebral ischemia in aneurysmal subarachnoid hemorrhage. Neurocrit Care. 2024;40(1):159–169.
  2. Shah VA, Gonzalez LF, Suarez JI. Therapies for delayed cerebral ischemia in aneurysmal subarachnoid hemorrhage. Neurocrit Care. 2023;39(1):36–50.
  3. Clarke JV, et al. Microvascular platelet aggregation and thrombosis after subarachnoid hemorrhage: a review and synthesis. J Cereb Blood Flow Metab. 2020;40(8):1565–1575.
  4. Dodd WS, et al. Pathophysiology of delayed cerebral ischemia after subarachnoid hemorrhage: a review. J Am Heart Assoc. 2021;10(15). doi:10.1161/JAHA.121.021845.
  5. Stragier H, et al. Pathophysiological mechanisms underlying early brain injury and delayed cerebral ischemia in the aftermath of aneurysmal subarachnoid hemorrhage: a comprehensive analysis. Front Neurol. 2025;16:1587091. doi:10.3389/fneur.2025.1587091.
  6. Xiao ZK, et al. Risk factors for the development of delayed cerebral ischemia after aneurysmal subarachnoid hemorrhage: a systematic review and meta-analysis. World Neurosurg. 2025;193:427–446.
  7. Sirsat MS, Fermé E, Câmara J. Machine learning for brain stroke: a review. J Stroke Cerebrovasc Dis. 2020;29(10):105162. doi:10.1016/j.jstrokecerebrovasdis.2020.105162.
  8. Mao M, et al. Construction of a nomogram model for predicting delayed cerebral ischemia in aneurysmal subarachnoid hemorrhage patients. Sci Rep. 2025;15(1):17739. doi:10.1038/s41598-025-01693-w.
  9. Connolly ES Jr, et al. Guidelines for the management of aneurysmal subarachnoid hemorrhage: a guideline for healthcare professionals from the American Heart Association/American Stroke Association. Stroke. 2012;43(6):1711–1737.
  10. Vergouwen MD, et al. Definition of delayed cerebral ischemia after aneurysmal subarachnoid hemorrhage as an outcome event in clinical trials and observational studies: proposal of a multidisciplinary research group. Stroke. 2010;41(10):2391–2395.
  11. Riley RD, et al. Calculating the sample size required for developing a clinical prediction model. BMJ. 2020;368. doi:10.1136/bmj.m441.
  12. Veldeman M, et al. Delayed cerebral ischaemia prevention and treatment after aneurysmal subarachnoid haemorrhage: a systematic review. Br J Anaesth. 2016;117(1):17–40.
  13. Azzam AY, et al. Prediction of delayed cerebral ischemia followed aneurysmal subarachnoid hemorrhage: a machine-learning based study. J Stroke Cerebrovasc Dis. 2024;33(4):107553. doi:10.1016/j.jstrokecerebrovasdis.2023.107553.
  14. Jeong TS, et al. Factors related to the development of shunt-dependent hydrocephalus following subarachnoid hemorrhage in the elderly. Turk Neurosurg. 2018;28(2):226–233.
  15. Becerril-Gaitan A, et al. The effect of age on cerebral vasospasm and delayed cerebral ischemia in patients with aneurysmal subarachnoid hemorrhage. World Neurosurg. 2024;187–e1024.
  16. Hayman EG, et al. Mechanisms of global cerebral edema formation in aneurysmal subarachnoid hemorrhage. Neurocrit Care. 2017;26(2):301–310.
  17. Fistouris P, et al. The impact of intracranial blood clearance on brain edema as a predictor of delayed cerebral infarction following subarachnoid hemorrhage. Cerebrovasc Dis. Published online June 28, 2025:1–8.
  18. Liu JP, et al. Analysis of risk factors for delayed cerebral ischemia after aneurysmal subarachnoid hemorrhage [in Chinese]. Chin J Cerebrovasc Dis. 2017;14(1):10–14.
  19. Guo X, et al. Admission albumin-globulin ratio associated with delayed cerebral ischemia following aneurysmal subarachnoid hemorrhage. Front Neurol. 2024;15:1438728. doi:10.3389/fneur.2024.1438728.
  20. Sanicola HW, et al. Pathophysiology, management, and therapeutics in subarachnoid hemorrhage and delayed cerebral ischemia: an overview. Pathophysiology. 2023;30(3):420–442.
  21. Wang L, et al. Risk factors and predictive models of poor prognosis and delayed cerebral ischemia in aneurysmal subarachnoid hemorrhage complicated with hydrocephalus. Front Neurol. 2022;13:1014501. doi:10.3389/fneur.2022.1014501.
  22. Raatikainen E, et al. Prognostic value of the 2010 consensus definition of delayed cerebral ischemia after aneurysmal subarachnoid hemorrhage. J Neurol Sci. 2021;420:117261. doi:10.1016/j.jns.2020.117261.
  23. Shah AH, Snow R, Wendell LC, et al. Association of hemoglobin trend and outcomes in aneurysmal subarachnoid hemorrhage: a single center cohort study. J Clin Neurosci. 2023;107:77–83.
  24. Jiang C, et al. Risk and prognostic factors for rupture of intracranial aneurysms during endovascular embolization. World Neurosurg. 2019;129–e649.
  25. Naraoka M, et al. Role of microcirculatory impairment in delayed cerebral ischemia and outcome after aneurysmal subarachnoid hemorrhage. J Cereb Blood Flow Metab. 2022;42(1):186–196.
  26. Hu P, et al. Effect of surgical clipping versus endovascular coiling on the incidence of delayed cerebral ischemia in patients with aneurysmal subarachnoid hemorrhage: a multicenter observational cohort study with propensity score matching. World Neurosurg. 2023;172–e388.
  27. Ching T, et al. Opportunities and obstacles for deep learning in biology and medicine. J R Soc Interface. 2018;15(141):20170387. doi:10.1098/rsif.2017.0387.
  28. Jiang F, et al. Artificial intelligence in healthcare: past, present and future. Stroke Vasc Neurol. 2017;2(4):230–243.
  29. Coulibaly AP, Provencio JJ. Aneurysmal subarachnoid hemorrhage: an overview of inflammation-induced cellular changes. Neurotherapeutics. 2020;17(2):436–445.
  30. Gris T, et al. Innate immunity activation in the early brain injury period following subarachnoid hemorrhage. J Neuroinflammation. 2019;16(1):253. doi:10.1186/s12974-019-1629-7.
  31. Wu Z, et al. Study on the predictive value of laboratory inflammatory markers and blood count-derived inflammatory markers for disease severity and prognosis in COVID-19 patients: a study conducted at a university-affiliated infectious disease hospital. Ann Med. 2024;56(1):2415401. doi:10.1080/07853890.2024.2415401.
  32. Okugawa Y, et al. Lymphocyte–C-reactive protein ratio as a promising new marker for predicting surgical and oncological outcomes in colorectal cancer. Ann Surg. 2020;272(2):342–351.
  33. Xie L, et al. The systemic inflammation response index as a significant predictor of short-term adverse outcomes in acute decompensated heart failure patients: a cohort study from southern China. Front Endocrinol (Lausanne). 2024;15:1444663. doi:10.3389/fendo.2024.1444663.
  34. Yan F, et al. Association between the stress hyperglycemia ratio and 28-day all-cause mortality in critically ill patients with sepsis: a retrospective cohort study and predictive model establishment based on machine learning. Cardiovasc Diabetol. 2024;23(1):163. doi:10.1186/s12933-024-02265-4.

再版と許可

タグ