本プロトコールでは、PIVKA-II、AFP、および日常的な臨床変数を肝細胞癌のロジスティック回帰診断モデルに統合するための再現可能なワークフローについて説明し、早期段階およびAFP陰性疾患における検証を行います。
本プロトコールでは、PIVKA-II、AFP、および日常的な臨床変数を肝細胞癌のロジスティック回帰診断モデルに統合するための再現可能なワークフローについて説明し、早期段階およびAFP陰性疾患における検証を行います。
肝細胞癌(HCC)の早期発見は、特に早期段階の腫瘍やAFP陰性腫瘍において、alpha-fetoprotein(AFP)の感度が不十分であるため、依然として制限されています。本研究では、異常プロトロンビン/protein induced by vitamin K absence-II(PIVKA-II)、AFP、および日常的な臨床変数を統合して、再現可能なHCC診断モデルを構築できるか検討しました。モデル開発には、画像診断で確定したHCC症例112例と非HCCコントロール93例を含む、205名の参加者からなる遡及的トレーニングコホートを用いました。また、モデルの再フィッティングを行わないサンプル外テストのために、HCC症例58例と非HCCコントロール126例を含む、184名の参加者からなる独立した前向き検証コホートを用いました。AFPおよびPIVKA-IIの測定には画像診断前の血液サンプルを使用し、臨床変数は同一の診断期間から抽出しました。最終的な多変量ロジスティック回帰モデルでは、ln(AFP)、ln(PIVKA-II)、年齢、性別、アルブミン、国際標準比(INR)、および血小板数を組み合わせました。この統合モデルは、トレーニングコホートで0.93、検証コホートで0.89のAUCを達成しました。検証における感度は84.5%、特異度は90.5%でした。感度は、早期HCCで72.7%、AFP陰性HCCで73.1%であり、いずれのサブグループにおいてもAFP単独での感度を上回りました。キャリブレーションおよびブートストラップ検証により、許容可能なモデルの安定性が支持されました。これらの結果は、PIVKA-II、AFP、および日常的に得られる臨床変数を組み合わせることで、肝疾患ハイリスク群に対する実用的な診断トリアージツールを構築できることを示しています。
肝細胞癌(HCC)は、癌に関連する死亡の主要な原因であり、通常はB型肝炎ウイルス感染、C型肝炎ウイルス感染、アルコール性肝疾患、代謝異常関連ステアトティック肝疾患などの慢性肝疾患を有する患者に発生します。1早期発見は臨床的に重要である。なぜなら、血管侵襲、肝外転移、または肝予備能の著しい低下が起こる前に腫瘍を発見した場合、根治的治療が最も効果的だからである。現在のサーベイランス戦略は、一般的に、血清アルファフェトプロテイン(AFP)の測定を併用するかしないかで、肝超音波検査に依存している。2しかしながら、日常的な臨床においては、サーベイランスの精度は、術者の習熟度、腫瘍サイズの小ささ、不均一な肝硬変結節、肥満に伴う画像診断の困難さ、およびAFPをほとんどまたは全く産生しない腫瘍によって影響を受ける。3,4.
AFPは安価で入手しやすく、臨床医にとっても馴染みがあるため、広く利用され続けています。しかし、その診断価値は、不完全な感度と不十分な特異性によって制限されています。従来の閾値である 20 ng/mL では、早期段階のHCCやAFP陰性のHCCの相当数が検出できない可能性があります。閾値を下げれば感度は向上するかもしれませんが、活動性肝炎、肝硬変、またはその他の炎症性肝疾患を持つ患者において偽陽性が増加します5,6。これらの制限により、高リスクの肝疾患集団における診断上のトリアージにおいて、単一マーカーによる判定だけでは不十分となっています。
異常プロトロンビンは、ビタミンK欠乏誘発タンパク質-II(PIVKA-II)または脱-γ-カルボキシプロトロンビンとしても知られ、悪性肝細胞が不完全にカルボキシル化されたプロトロンビンを産生した際に放出されます。PIVKA-IIは、AFP分泌よりも凝固に関連した腫瘍生物学を反映しており、AFP値が低い場合でも有用な情報を提供し得ます7。先行研究およびメタ解析により、PIVKA-IIは特にAFPと組み合わせることでHCCの検出能を向上させ、早期ステージやAFP陰性の疾患において価値を付加することが示されています8,9。しかし、マーカーのみによる戦略では、宿主の背景、肝予備能、血小板数、凝固状態、または基礎にある肝疾患を完全には考慮できません。
複合診断モデルは、腫瘍マーカーの結果を臨床的背景とともに解釈するための実用的な方法を提供します。GALAD、GAADおよび関連モデルにより、人口統計学的変数とバイオマーカーを組み合わせることで、異なる病因や集団におけるHCC検出能を向上させることができることが示されています10,11。これらの性能は、単一のバイオマーカーの閾値ではなく、多変数によるリスク推定を用いることの妥当性を裏付けています。同時に、一部のモデルにはすべての検査施設で利用可能ではないアッセイが含まれており、カットオフ値の挙動は地域、病因プロファイル、疾患ステージ、および意図される臨床用途によって異なる可能性があります12。広く利用可能なバイオマーカーと日常的な臨床検査変数から構築されたモデルは、一般的な診断ワークフローへの導入がより容易であると考えられます。特殊なバイオマーカーや集団特異的なカットオフ戦略に依存する可能性のある既報のモデルとは異なり、本研究では、広く利用可能なバイオマーカーと日常的な臨床変数に基づいた多変数診断モデルを評価し、独立した前向きコホートでその性能を検証しました。
PIVKA-IIはこの枠組みに適しています。なぜなら、AFPを補完することができ、すでに臨床検査室で使用されている自動免疫測定プラットフォームで測定可能だからです。年齢、性別、アルブミン、ビリルビン、血小板数、国際標準比(INR)、および肝疾患の背景といったルーチンの変数は、同一の臨床診察時に入手可能であり、HCCリスクに関連する肝予備能または凝固系の情報を捉えられる可能性があります13。これらの変数をAFPおよびPIVKA-IIと組み合わせることで、単一のカットオフ値への依存を避けつつ、識別能を向上させることができます。
したがって、PIVKA-II、AFP、および日常的な臨床変数を、2つのコホートを用いた診断的デザインを用いて評価した。多変量ロジスティック回帰モデルを後向きトレーニングコホートで構築し、再適合させることなく独立した前向き検証コホートで検証した。診断能を、AFP、PIVKA-II、および臨床変数のみの場合と比較し、早期HCC、AFP陰性HCC、カットオフ値の解釈、キャリブレーション、およびブートストラップ法による内部検証に重点を置いてあらかじめ定義した通りに評価した。
本研究は、西湖大学医学院附属杭州第一人民病院の倫理委員会によって審査され、承認されました。承認番号はIIT-20230528-0108-01です。前向きに登録された参加者からは、採血前に書面によるインフォームドコンセントを得ました。後方視的に含まれた臨床記録および日常診療中に収集され保存されていた余剰検体については、匿名化されたデータが使用され、追加の介入が行われなかったため、倫理委員会によりインフォームドコンセントが免除されました。
再現性、バイアスの制御、およびデータの完全性
適格基準、採血タイミング、画像判定ルール、サブグループの定義、候補予測因子、カットオフ値の定義、欠損データの処理ルール、および検証手順は、統計解析前に事前に規定した。血液サンプルは、造影画像による確認前および抗腫瘍治療の開始前に採取した。臨床検査には匿名化された研究識別子を使用し、トレーニングコホートおよび検証コホートのサンプルはランダムな順序で検査した。検査担当者は、最終診断、コホートへの割り当て、Barcelona Clinic Liver Cancer (BCLC) ステージ、およびAFP陰性ステータスについて盲検化されていた。画像診断およびステージングは、臨床検査とは独立して抽出した。データ入力、単位換算、コホート割り当て、除外コーディング、欠損値コーディング、および統計データセットは、モデル適合前に2人の研究者が確認した。トレーニングコホートと検証コホートは、変数スクリーニング、モデル適合、カットオフ値の導出、および検証の全過程を通じて分離して管理した。
研究対象集団および設計
この2コホート診断研究では、異常プロトロンビン/PIVKA-II、AFP、およびルーチンの臨床変数を用いた、HCC検出のための多変数モデルを開発し、検証しました。レトロスペクティブに構成されたトレーニングコホートには、2021年1月1日から2023年12月31日の間に評価された参加者が含まれています。このコホートは、変数のスクリーニング、モデルのフィッティング、カットオフ値の導出、およびブートストラップ内部検証に使用されました。プロスペクティブに登録された検証コホートには、2024年1月1日から2025年12月31日の間に評価された参加者が含まれています。このコホートは、アウトオブサンプル検定のみに使用されました。検証コホートにおいて、変数の再選択、モデルの再フィッティング、係数の更新、カットオフ値の再最適化、またはサブグループに基づく再キャリブレーションは行っていません。参加者のフロー、コホートへの割り当て、採血、血漿処理、バイオマーカー検査、画像診断の判定、および統計ワークフローを図1に示します。
参加者は、西湖大学医学院附属杭州第一人民病院の肝疾患高リスク監視または診断経路から募集された。高リスク状態は、臨床評価、検査記録、または事前の画像診断に基づき、慢性B型肝炎感染、慢性C型肝炎感染、あらゆる病因による肝硬変、または線維化が認められる脂肪肝疾患と定義した。適格基準は、18歳以上の成人で、画像診断前の採血および、採血後14日以内に造影剤増強多相コンピューター断層撮影(CT)および/またはダイナミック造影磁気共鳴画像法(MRI)を完了した者とした。除外基準は、切除、焼灼、経カテーテル化学塞栓術、または全身療法を含む過去のHCC治療歴、採血前7日以内のビタミンK投与、凝固能の解釈に影響を及ぼす可能性のあるビタミンK拮抗薬療法またはその他の抗凝固療法、採血時の急性胆管炎または胆道閉塞、妊娠、AFP、PIVKA-II、または最終的な画像診断の欠損、および有効な再検サンプルのない不適切な検体品質とした。
最終的な研究対象集団には389人の参加者が含まれた。トレーニングコホートは205人で構成され、その内訳は画像診断で確定したHCC症例112例および非HCCコントロール93例であった。バリデーションコホートは184人で構成され、その内訳は画像診断で確定したHCC症例58例および非HCCコントロール126例であった。トレーニングコホートにおける非HCCコントロール93例には、健常コントロール30例と慢性肝疾患コントロール63例が含まれていた。バリデーションコホートにおける非HCCコントロール126例には、健常コントロール0例と慢性肝疾患コントロール126例が含まれていた。
肝炎の既往歴または代償性肝硬変のみに基づいて有症状の状態を割り当てることはしなかった。画像診断前の記録に、新たに出現した、あるいは悪化した右上腹部痛、原因不明の体重減少、腹部膨満、黄疸、濃色尿、または他の確定した原因では説明できない臨床的に記録された非代償化が記載されている場合にのみ、参加者を有症状として分類した。これらの所見がない参加者は、無症状またはサーベイランスで検出されたものに分類した。
診断の判定およびステージング
最終的なHCCの判定は、日常診療で行われた造影多相CTおよび/またはダイナミック造影MRIを用いて行われました。画像診断には、少なくとも動脈相と門脈相が含まれていることが必須であり、遅延相の所見が得られる場合はそれも組み込まれました。リスクのある肝臓において、造影カプセルの有無にかかわらず、動脈相での高染と門脈相および/または遅延相でのウォッシュアウトが認められた病変をHCCと分類しました。HCCに一致する画像所見がなく、かつ他の悪性腫瘍の診断を受けなかった参加者は、非HCCとして分類されました。
画像情報は、画像診断法、得られた相、動脈相での高吸収・高信号(hyperenhancement)、ウォッシュアウト、カプスルの外観、病変数、最大病変径、門脈侵襲、および肝外転移を記録する規定のフォームを用いて抽出した。2名の訓練を受けた読影者が、最終的な放射線科報告書から独立して画像所見を抽出した。不一致がある場合は、同一の定義済み基準を用いてコンセンサスにより解決した。CTとMRIの両方が利用可能であった場合は、多相的な特性評価がより完全になされている方のモダリティを使用した。両モダリティともに完全であった場合は、最終的な臨床判断の根拠として記録されているモダリティを使用した。
BCLCステージは、HCCの状態が確定した後に割り当てられた。早期HCCはBCLCステージ 0–Aと定義した。AFP陰性HCCは、画像診断前の採血におけるAFP <20 ng/mLと定義した。これらのサブグループラベルは、サブグループごとの性能評価に使用され、モデルのトレーニングや参加者の適格性判定には使用されなかった。
サンプルの収集および血漿処理
造影CT/MRIによる確定診断および抗腫瘍治療の前に、少なくとも8時間の夜間絶食後の午前中に末梢静脈血を採取した。K2-EDTA抗凝固剤入り採血管に計10 mLの静脈血を採取した。採取直後に採血管を8〜10回転倒混和し、4 °Cで研究室まで搬送した。穿刺から遠心分離までの時間は2時間以内に維持し、サンプルログに記録した。
冷却遠心機を用い、4 °Cで1,600 × gで10分間遠心分離して血漿を分離した。血漿上清を1.5 mLのヌクレアーゼフリーマイクロ遠心チューブに移し、0.5–1.0 mLずつ分注した。分注した試料は、検査まで-80 °Cで保存した。バイオマーカー測定の前、分注試料を室温(20–25 °C)で20–30分間、一度だけ融解させ、転倒混和により穏やかに混ぜ、完全に融解してから2時間以内に検査した。目視で凝固が認められる試料、中等度から重度の溶血がある試料、または著しい脂血がある試料は、事前に定義された検査室の受理基準に従って除外した。前向き検証コホートについては、臨床的に可能な場合に限り、画像診断による確定の前に血液採取を再度行った。
AFPおよびPIVKA-IIの測定
自動免疫分析装置を用いて、電気化学発光免疫測定法によりAFPおよびPIVKA-IIを測定した。AFPはng/mL、PIVKA-IIはmAU/mLとして記録した。結果は臨床検査情報システムから直接エクスポートした。
各分析バッチには、アッセイ固有のキャリブレーターと、少なくとも2つの内部品質管理レベルが含まれていました。バッチの承認には、すべての品質管理結果があらかじめ定義されたラボ管理範囲内にあることが必要でした。分析精度の目標値は、AFPおよびPIVKA-IIの両方において、併行精度(within-run coefficient of variation)が10%以下、再現精度(between-run coefficient of variation)が15%以下とされました。品質管理に不合格となった場合、またはバッチドリフトが検出された場合は、そのバッチを却下し、アナライザーを再校正した上で、十分なサンプル量がある場合にバッチを再試行しました。不合理な結果または範囲外の単一サンプル結果が出た場合は、可能であれば同じ解凍分注検体を用いて2回の再測定を行い、承認された2回の再測定値の平均値を採用しました。再検査に失敗した場合、またはサンプル量が不十分であった場合は、その結果を無効とし、欠損データルールに従って処理しました。
日常的な臨床変数の抽出
日常的な臨床変数は、画像診断前のAFP/PIVKA-II採血と同じ診療機会から抽出した。候補変数には、年齢、性別、アラニンアミノトランスフェラーゼ、アスパラギン酸アミノトランスフェラーゼ、アルブミン、総ビリルビン、国際標準比(INR)、プロトロンビン時間、および血小板数が含まれた。画像診断前の期間内に複数の値が存在する場合は、AFP/PIVKA-IIのサンプリング時刻に最も近い値を選択した。解析前に単位を標準化した。年齢は歳で記録し、性別は女性=0、男性=1としてコード化した。血小板数は×10⁹/L、アルブミンはg/L、総ビリルビンはμmol/L、AFPはng/mL、PIVKA-IIはmAU/mLとして記録した。
抽出後、範囲チェック、単位チェック、および不自然な値のチェックを実施した。フラグが立てられた値は、元の記録と照らし合わせて検証した。標本の品質上の問題、単位換算の誤り、または処理の逸脱が元の記録で確認された場合にのみ、その値を除外した。検証済みの極端な値は保持した。変数定義書(variable dictionary)により、データセットの構造、変数名、単位、コーディングルール、変換ルール、および欠損値コードを定義した。
予測因子の定義と変数の選択
モデル構築に先立ち、予測候補因子を定義した。中核となるバイオマーカーはAFPおよびPIVKA-IIとした。日常的な臨床候補因子は、年齢、性別、アラニンアミノトランスフェラーゼ、アスパラギン酸アミノトランスフェラーゼ、アルブミン、総ビリルビン、INRまたはプロトロンビン時間、および血小板数とした。AFPとPIVKA-IIには自然対数変換を施した。測定値が測定下限値を下回る場合は、変換前に下限値の2分の1の値で置換した。
トレーニングコホートにおけるHCC群と非HCC群の単変量比較では、概ね正規分布を示す変数には独立サンプルt検定を、歪んだ連続変数にはMann-Whitney U検定を、カテゴリー変数にはχ2検定またはFisherの正確確率検定を用いた。単変量スクリーニングでP < 0.10であった変数を多変量モデリングの検討対象とした。多重共線性は分散拡大係数(VIF)を用いて評価し、VIF > 5を共線性の懸念があるとして扱った。2つの変数に強い共線性が見られた場合は、臨床的な解釈可能性がより明確で、モデルの性能向上への寄与度が高い方の変数を採用した。
最終的な多変数ロジスティック回帰モデルは、トレーニングコホートのみで作成されました。ln(AFP)およびln(PIVKA-II)をモデルに強制的に投入しました。追加の予測因子は、赤池情報量基準(AIC)に基づいた減少法(backward elimination)により選択しました。減少法による選択後、保持された変数はln(AFP)、ln(PIVKA-II)、年齢、性別、アルブミン、INR、および血小板数でした。
モデル構築およびリスクスコアの算出
診断モデルは、HCCの状態を二値のアウトカムとして、多変数ロジスティック回帰を用いて適合させました。HCCの予測確率は、線形予測子ηを用いて次の方程式から算出しました。
p(HCC)=1/[1+exp(-η)]
η = -4.862+0.247×ln(AFP)+0.712×ln(PIVKA-II)+0.018×age+0.331×sex-0.062×albumin+0.554×INR-0.004×plateletcount
AFPはng/mL、PIVKA-IIはmAU/mL、年齢は歳で測定し、性は女性=0、男性=1としてコード化した。アルブミンはg/Lで測定し、INRは無次元量とし、血小板数は×109/Lとして測定した。AFPとPIVKA-IIには自然対数を用いた。同一の適合係数からノモグラムを作成した。受信者動作特性(ROC)分析、キャリブレーション分析、決定曲線分析、および検証には、ノモグラムのポイントスケールではなく、予測確率を用いた。
カットオフ値の定義と閾値の処理
PIVKA-IIの閾値は、分析目的別にラベル付けされました。PIVKA-IIの確立された臨床的カットオフ値は40.0 mAU/mLでした。トレーニングコホートにおけるPIVKA-IIのYoudenカットオフ値は45.0 mAU/mLでした。固定特異度カットオフ値は、トレーニングコホートにおいて特異度90%に最も近い閾値を選択することで導出され、PIVKA-IIでは38.0 mAU/mLとなりました。バリデーションのみで得られた見かけ上の閾値37.5 mAU/mLは、探索的なものとして扱い、一次的なバリデーションカットオフ値としては使用しませんでした。
複合モデルにおいて、主要なバイナリカットオフ値はYouden指数を用いてトレーニングコホートから導出され、バリデーションコホートにそのまま適用されました。AFPについては、AFP陰性サブグループの定義および日常診療との比較のため、確立された臨床的なカットオフ値である20.0 ng/mLを使用しました。ROC解析に使用された最適化AFPカットオフ値は、臨床的閾値とは別にラベル付けされました。したがって、カットオフ値は互換性のある閾値としてではなく、解析目的に応じて報告されました。
モデルの性能、校正および検証
判別能は、受信者動作特性(ROC)曲線および曲線下面積(AUC)を用いて評価した。AUCは95%信頼区間とともに報告した。AUCの比較にはDeLongテストを用いた。分類性能は、あらかじめ設定したカットオフ値における感度、特異度、陽性的中率、陰性的中率、および正診率として報告した。
較正性は、較正切片、較正勾配、Brierスコア、およびHosmer-Lemeshow適合度検定を用いて評価した。較正プロットにより、リスクグループ間におけるHCCの予測確率と観察確率を比較した。内部検証では、トレーニングコホートにおいて1,000回のブートストラップ再サンプリングを行い、楽観度補正済みAUCおよび楽観度補正済み較正勾配を推定した。検証コホートは、外部性能評価のみに使用した。検証コホートにおける係数の更新、モデルの再適合、閾値の再最適化、またはサブグループに基づく再較正は行わなかった。
しきい値確率を0.05から0.50までとして決定曲線分析を行い、臨床的有用性を評価しました。AFP単独、PIVKA-II単独、臨床変数モデル、および統合モデルについて、ネットベネフィットを比較しました。
欠測データの処理と感度分析
主解析では、最終モデルに保持されたすべての変数がある参加者を対象としたコンプリートケースモデリングを用いた。各候補予測因子について欠損値を要約した。保持された予測因子のいずれかで欠損率が5%を超えた場合は、感度分析として、アウトカム、すべての保持された予測因子、およびコホート指標を代入モデルに用いた連鎖方程式による多重代入法を実施した。欠損率が20%を超える変数は、多変数モデリングの対象から除外した。代入解析によるモデル係数、AUC、キャリブレーション・スロープ、および分類指標を、コンプリートケースの結果と比較した。
ソフトウェアと再現可能なレポート
すべての解析はR version 4.3.2およびRStudio version 2023.12.1を用いて実施した。ロジスティック回帰はbase statsパッケージを用いて行った。ROC解析およびDeLong比較はpROC version 1.18.5を用いて行った。キャリブレーション解析はrms version 6.7-1およびResourceSelection version 0.3-6を用いて行った。ブートストラップ検証では、固定ランダムシード70558を用いて1,000回の再サンプリングを行った。決定曲線分析はrmda version 1.6を用いて行った。必要に応じて、mice version 3.16.0を用いて多重代入法を実施した。解析スクリプトにより、参加者のフロー、モデル係数、ROC曲線、キャリブレーション指標、ブートストラップ検証、決定曲線分析、カットオフ値に基づく解析、および統計表を再現した。
ベースライン特性
最終解析には389名の参加者が含まれた。トレーニングコホートは205名で構成され、その内訳は画像診断で確認されたHCC症例112名および非HCC対照群93名であった。バリデーションコホートは184名で構成され、その内訳は画像診断で確認されたHCC症例58名および非HCC対照群126名であった。ベースライン特性は表1にまとめられている。
トレーニングコホートにおける93名の非HCCコントロールには、健康対照者30名と慢性肝疾患コントロール63名が含まれていた。バリデーションコホートにおける126名の非HCCコントロールには、健康対照者は含まれず、126名全員が慢性肝疾患コントロールであった。背景肝疾患はB型肝炎ウイルス感染が支配的であった。BCLC 0–A期の疾患は、トレーニングコホートにおけるHCC症例112例中57例、バリデーションコホートにおけるHCC症例58例中30例を占めていた。年齢、性別、肝疾患歴、HCCの家族歴、肝硬変の有無、Child-Pugh分類、アラニンアミノトランスフェラーゼ、アスパラギン酸アミノトランスフェラーゼ、アルブミン、総ビリルビン、血小板数、プロトロンビン時間、国際正常化比(INR)、糖尿病、および高血圧は、Table 1に報告されたコホート層間でバランスが取れていた。
トレーニングセットにおけるAFPの中央値は、HCC症例で57.3 ng/mL、非HCC対照群で22.4 ng/mLであった。PIVKA-IIの中央値は、それぞれ197.6 mAU/mLおよび86.3 mAU/mLであった。バリデーションコホートでは、AFPの中央値はHCC症例で60.2 ng/mL、非HCC対照群で21.5 ng/mLであった。PIVKA-IIの中央値は、それぞれ191.5 mAU/mLおよび84.1 mAU/mLであった。
トレーニングコホートの診断性能
トレーニングコホートにおける判別能をFigure 2(A)に、対応する感度・特異度の比較をFigure 2(B)に示す。動作特性をTable 2にまとめた。AFPは、設定された20.0 ng/mLの臨床カットオフ値において、AUC 0.78、感度 62.50%、特異度 78.49%であった。PIVKA-IIは、トレーニングコホートのYoudenカットオフ値である45.0 mAU/mLにおいて、AUC 0.85、感度 78.57%、特異度 82.80%であった。臨床変数モデルは、予測確率閾値0.40において、AUC 0.81、感度 69.64%、特異度 80.65%であった。統合モデルはトレーニングコホートで最高の判別能を示し、予測確率閾値0.50においてAUC 0.93、感度 88.39%、特異度 89.25%であった。
ステージ別パフォーマンス
ステージ別のバイオマーカー分布をFigure 3(A)に、検出率をFigure 3(B)に、ステージ別のAUCをFigure 3(C)にそれぞれ示します。AFP、PIVKA-II、および統合モデルスコアは、BCLC 0–A、B、Cの疾患段階を通じて上昇しました。AFPでは、早期HCCと非HCCコントロールの間に重複が見られました。PIVKA-IIは、ステージ層間でのより強い分離を示しました。統合モデルは、BCLC 0–AのHCCを含め、最も高いステージ別識別能を示しました。
AFPとPIVKA-IIの相補性
マーカースコアの相関を Figure 4(A)-(C)に、マーカーのクロス分類をFigure 4(D)に示す。AFPとPIVKA-IIは部分的な非重複を示した。AFP陽性/PIVKA-II陰性およびAFP陰性/PIVKA-II陽性のHCC症例がともに観察された。複合モデルでは、単一マーカー陰性のHCC症例がさらに高リスクとして分類され、単独のバイオマーカーではなく統合スコアを用いることの妥当性が裏付けられた。
外部妥当性の検証
検証コホートのROC曲線は図 5(A)に、キャリブレーションは図 5(B)に、そしてサブグループ別の感度・特異度パターンは図 5(C)に示されています。対応する検証メトリクスは表 3にまとめられています。すべての検証用HCC症例において、AFPは18.5 ng/mLにおいてAUC 0.75、感度62.1%、特異度88.9%でした。PIVKA-IIは38.0 mAU/mLにおいてAUC 0.78、感度72.4%、特異度91.3%でした。複合モデルは、予測確率のしきい値0.56において、AUC 0.89、感度84.5%、特異度90.5%、陽性予測値78.8%、陰性予測値94.1%でした。
早期のHCCにおいて、AFPの感度は45.5%、特異度は88.9%であり、PIVKA-IIの感度は59.1%、特異度は91.3%であった。また、複合モデルの感度は72.7%、特異度は90.5%であった。AFP陰性HCCでは、AFPの感度は23.1%、PIVKA-IIの感度は61.5%、複合モデルの感度は73.1%であった。ウイルス性HCCにおいて、複合モデルの感度は85.3%、特異度は91.3%であった。非ウイルス性HCCにおいて、複合モデルの感度は83.3%、特異度は89.7%であった。検証コホートの校正インターセプトは-0.08、校正スロープは0.91、Brierスコアは0.118、Hosmer–Lemeshow P値は0.64であった。
多変量回帰および内部妥当性確認
多変量回帰分析の結果をTable 4に示す。調整モデルにおいて、対数変換したPIVKA-IIが最強の独立した予測因子であり、調整オッズ比は2.05(95% CI: 1.48-2.89, P < 0.001)であった。対数変換したAFPもHCCと独立して関連しており、調整オッズ比は1.28(95% CI: 1.05-1.62, P = 0.021)であった。国際標準比(INR)も独立した予測能を維持しており、調整オッズ比は1.74(95% CI: 1.12-2.78, P = 0.015)であった。最終的な後向き選択モデルには、ln(AFP)、ln(PIVKA-II)、年齢、性別、アルブミン、国際標準比、および血小板数が保持された。
ブートストラップ法による内部検証指標を表4に示す。見かけ上のトレーニングAUCは0.93、平均楽観性は0.018、楽観性補正後AUCは0.91であった。見かけ上のキャリブレーションスロープは1.00、楽観性補正後キャリブレーションスロープは0.94、トレーニングコホートのブライアスコアは0.104、Hosmer–Lemeshow P値は0.72であった。
カットオフ監査およびしきい値特異的性能
PIVKA-IIの閾値は分析目的によって異なるため、カットオフ値に基づく結果は互換性があるものとして扱うのではなく、個別に報告した。事後解析によるYouden最適化カットオフの性能をTable 5に示す。AFPのYouden最適化カットオフは19.0 ng/mLであり、感度は67.9%、特異度は89.1%、陽性的中率は71.3%、陰性的中率は87.3%、正診率は81.2%、AUCは0.78であった。PIVKA-IIのYouden最適化カットオフは37.5 mAU/mLであり、感度は75.4%、特異度は92.0%、陽性的中率は79.8%、陰性的中率は89.7%、正診率は85.9%、AUCは0.82であった。複合モデルのYouden最適化予測確率カットオフは0.57であり、感度は86.2%、特異度は90.6%、陽性的中率は82.7%、陰性的中率は92.4%、正診率は89.8%、AUCは0.90であった。
確立された臨床カットオフ値を用いた性能を表6に示します。確立されたAFPのカットオフ値20.0 ng/mLにおいて、AFPの感度は65.2%、特異度は88.5%、陽性的中率は70.1%、陰性的中率は86.0%、正診率は80.3%、AUCは0.77でした。確立されたPIVKA-IIのカットオフ値40.0 mAU/mLにおいて、PIVKA-IIの感度は73.0%、特異度は93.1%、陽性的中率は81.8%、陰性的中率は89.0%、正診率は85.6%、AUCは0.82でした。予測確率の閾値を0.60とした場合、複合モデルの感度は83.5%、特異度は92.0%、陽性的中率は84.7%、陰性的中率は91.2%、正診率は88.9%、AUCは0.89でした。
特異度が90%に最も近いカットオフ値における性能をTable 7に示す。AFPではカットオフ値を19.0 ng/mLとし、感度67.9%、特異度89.1%であった。PIVKA-IIではカットオフ値を37.5 mAU/mLとし、感度75.4%、特異度92.0%であった。統合モデルでは予測確率のカットオフ値を0.57とし、感度86.2%、特異度90.6%であった。これらのカットオフ監査の結果により、PIVKA-IIの閾値における37.5、38.0、40.0、および45.0 mAU/mLの数値的な違いが説明される。すなわち、45.0 mAU/mLは一次トレーニング比較に使用されたトレーニングコホートのYoudenカットオフ値であり、38.0 mAU/mLは検証用の固定特異度レポートに使用され、40.0 mAU/mLは確立された臨床的カットオフ値であり、37.5 mAU/mLはカットオフ監査表における事後Youden最適化カットオフ値であった。
疾患サブグループ分布
AFP、PIVKA-II、および複合モデルスコアの疾患サブグループ別分布を図6(A)-(C)に示す。AFP、PIVKA-II、および複合モデルスコアは、慢性肝疾患コントロール群で最も低く、HCC群で高かった。AFPでは、慢性肝疾患コントロール群と早期HCC群の間で重複が見られた。一方、PIVKA-IIおよび複合モデルスコアでは、慢性肝疾患コントロール群、早期HCC群、および全ステージHCC群の間でより明確な分離が認められた。
データの利用可能性:
本研究の結果を裏付けるデータセットは、Figshare(https://doi.org/10.6084/m9.figshare.33048095.v1)にて公開されています。

図 1: 参加者のフロー、コホート割り当て、検体処理、および診断判定。 トレーニングコホートおよび検証コホートにおける参加者のスクリーニング、コホート割り当て、画像診断前の採血、血漿処理、AFP/PIVKA-II測定、造影CT/MRI評価、および最終的な画像に基づくHCC判定を示すフローチャート。 こちらのリンクをクリックして、この図の拡大版を表示してください。

図2: トレーニングコホートにおけるAFP、PIVKA-II、臨床変数モデル、および複合モデルの診断能。 (A) トレーニングコホートにおけるAFP、PIVKA-II、臨床変数モデル、および多変数複合モデルを比較した受信者動作特性(ROC)曲線。 (B) 報告されたトレーニングコホートの閾値における各診断法の感度および特異度。 こちらのリンクをクリックして、この図の拡大版を表示してください。
対応する動作特性を表2にまとめます。

Figure 3: BCLCステージ別の層別化診断能。 (A) 非HCCコントロールおよびBCLCステージ群におけるAFP、PIVKA-II、および複合モデルスコアの分布。 (B) BCLCステージにおけるAFP、PIVKA-II、および複合モデルの検出率。 (C) BCLC 0–A HCCを含む、AFP、PIVKA-II、および複合モデルのステージ別AUC。 この図の拡大版を表示するには、ここをクリックしてください。

図4AFP、PIVKA-II、および複合モデルスコア間の相関性と相補性。 (A) AFPと複合モデルスコアの相関。 (B) PIVKA-IIと複合モデルスコアの相関。 (C) AFPとPIVKA-IIの相関。 (D) AFPの状態、PIVKA-IIの状態、および複合モデルによるリスク分類に基づいたHCC症例のクロス分類。 この図の拡大版を表示するには、ここをクリックしてください。

図 5: 独立検証コホートにおける診断性能の外部検証。(A) AFP、PIVKA-II、および複合モデルの検証コホートにおける受信者動作特性(ROC)曲線。(B) 検証コホートにおける複合モデルの校正プロット。(C) 全HCC、早期HCC、およびAFP陰性HCCにおけるAFP、PIVKA-II、および複合モデルの感度と特異度の比較。対応する検証指標は表 3にまとめられている。こちらのリンクをクリックして、この図の拡大版を表示してください。

図6AFP、PIVKA-II、および複合モデルスコアの疾患サブグループ分布。 (A) 慢性肝疾患コントロール群、BCLC 0-A期のHCC、および全ステージのHCCにおけるAFP分布。 (B) 慢性肝疾患コントロール群、BCLC 0–A 肝細胞癌(HCC)、および全ステージ肝細胞癌におけるPIVKA-IIの分布。 (C) 慢性肝疾患コントロール群、BCLC 0-A期HCC、および全ステージHCCにおける複合モデルスコアの分布。 この図の拡大版を表示するには、ここをクリックしてください。
| 因子 | カテゴリー / 要約 | トレーニング群 HCC n = 112 | トレーニング群 非HCCコントロール n = 93 | バリデーション群 HCC n = 58 | バリデーション群 非HCCコントロール n = 126 | P値 |
| 性別, n (%) | 男性 | 76 (67.9%) | 59 (63.4%) | 39 (67.2%) | 76 (60.3%) | 0.374 |
| 女性 | 36 (32.1%) | 34 (36.6%) | 19 (32.8%) | 50 (39.7%) | — | |
| 年齢, years | 平均値 ± SD | 58.9 ± 9.3 | 58.1 ± 10.4 | 59.4 ± 8.8 | 57.6 ± 9.7 | 0.281 |
| 肝疾患既往, n (%) | HBV | 84 (75.0%) | 64 (68.8%) | 42 (72.4%) | 83 (65.9%) | 0.332 |
| HCV | 6 (5.4%) | 5 (5.4%) | 3 (5.2%) | 7 (5.6%) | 0.914 | |
| アルコール性肝疾患 | 13 (11.6%) | 10 (10.8%) | 6 (10.3%) | 12 (9.5%) | 0.825 | |
| HCC家族歴, n (%) | あり | 9 (8.0%) | 7 (7.5%) | 4 (6.9%) | 8 (6.3%) | 0.887 |
| 肝硬変, n (%) | あり | 80 (71.4%) | 61 (65.6%) | 42 (72.4%) | 88 (69.8%) | 0.468 |
| HCCステージ (BCLC), n (%) | 0–A | 57 (50.9%) | — | 30 (51.7%) | — | — |
| B | 33 (29.5%) | — | 17 (29.3%) | — | — | |
| C | 22 (19.6%) | — | 11 (19.0%) | — | — | |
| Child–Pugh分類, n (%) | A | 85 (75.9%) | 77 (82.8%) | 43 (74.1%) | 101 (80.2%) | 0.341 |
| B | 27 (24.1%) | 16 (17.2%) | 15 (25.9%) | 25 (19.8%) | — | |
| ALT, U/L | 平均値 ± SD | 48.6 ± 22.1 | 47.1 ± 20.6 | 47.9 ± 22.4 | 45.2 ± 20.1 | 0.517 |
| AST, U/L | 平均値 ± SD | 60.3 ± 28.5 | 58.0 ± 27.8 | 58.7 ± 29.4 | 56.2 ± 26.9 | 0.488 |
| アルブミン, g/L | 平均値 ± SD | 39.0 ± 4.7 | 39.5 ± 4.6 | 38.7 ± 5.1 | 39.6 ± 4.5 | 0.554 |
| 総ビリルビン, μmol/L | 平均値 ± SD | 20.1 ± 11.3 | 18.6 ± 10.8 | 20.4 ± 11.6 | 18.1 ± 10.9 | 0.321 |
| 血小板数, ×10⁹/L | 平均値 ± SD | 137 ± 61 | 146 ± 59 | 134 ± 60 | 149 ± 57 | 0.437 |
| プロトロンビン時間, s | 平均値 ± SD | 13.7 ± 1.4 | 13.5 ± 1.3 | 13.8 ± 1.5 | 13.5 ± 1.2 | 0.411 |
| INR | 平均値 ± SD | 1.18 ± 0.12 | 1.16 ± 0.11 | 1.19 ± 0.13 | 1.15 ± 0.10 | 0.334 |
| AFP, ng/mL | 中央値 (IQR) | 57.3 (19.8–135.1) | 22.4 (10.4–46.0) | 60.2 (20.6–131.7) | 21.5 (9.8–48.1) | 0.071 |
| PIVKA-II, mAU/mL | 中央値 (IQR) | 197.6 (83.1–438.2) | 86.3 (38.6–131.2) | 191.5 (81.4–422.5) | 84.1 (37.1–129.4) | 0.064 |
| PT延長, n (%) | あり | 30 (26.8%) | 20 (21.5%) | 15 (25.9%) | 24 (19.0%) | 0.372 |
| 糖尿病, n (%) | あり | 19 (17.0%) | 14 (15.1%) | 10 (17.2%) | 19 (15.1%) | 0.764 |
| 高血圧, n (%) | あり | 33 (29.5%) | 26 (28.0%) | 18 (31.0%) | 36 (28.6%) | 0.824 |
| 非HCCコントロールにおけるコントロールタイプ, n (%) | 健常コントロール | — | 30 (32.3%) | — | 0 (0.0%) | — |
| 慢性肝疾患コントロール | — | 63 (67.7%) | — | 126 (100.0%) | — | |
| 注:HCC:肝細胞癌、BCLC:Barcelona Clinic Liver Cancer、ALT:アラニンアミノトランスフェラーゼ、AST:アスパラギン酸アミノトランスフェラーゼ、INR:国際標準比、AFP:α-フェトプロテイン、PIVKA-II:Protein induced by vitamin K absence-II、PT:プロトロンビン時間、IQR:四分位範囲。P値は、該当する場合、報告されたコホート/ステータス層間でのベースライン比較について示した。HCCステージはHCC例についてのみ報告した。コントロールタイプは非HCCコントロールについてのみ報告した。 | ||||||
表1:トレーニングコホートおよび検証コホートのベースライン特性。人口統計学的特性、肝疾患の背景、HCCステージ、Child-Pugh分類、ルーチン検査指標、AFP、およびPIVKA-IIを、コホート別およびHCCの状態別に提示している。
| 方法 | 感度 (95% CI) | 特異度 (95% CI) | AUC (95% CI) | しきい値 |
| α-フェトプロテイン | 62.50 (53.41–71.06) | 78.49 (69.07–86.04) | 0.78 (0.72–0.84) | 20.0 ng/mL |
| PIVKA-II | 78.57 (70.29–85.37) | 82.80 (73.95–89.61) | 0.85 (0.80–0.90) | 45.0 mAU/mL |
| 臨床変数モデル | 69.64 (60.28–77.87) | 80.65 (71.13–88.04) | 0.81 (0.75–0.87) | 予測確率 = 0.40 |
| 複合モデル | 88.39 (81.35–93.36) | 89.25 (81.26–94.65) | 0.93 (0.89–0.96) | 予測確率 = 0.50 |
| 注:AFPは、確立された臨床的カットオフ値である20.0 ng/mLで評価した。PIVKA-IIの閾値である45.0 mAU/mLは、一次トレーニング比較に使用したトレーニングコホートのYoudenカットオフ値である。臨床変数モデルおよび統合モデルは、トレーニングコホートで導出された予測確率の閾値を用いて評価した。 | ||||
表2:トレーニングコホートにおける診断性能。トレーニングコホートにおけるAFP、PIVKA-II、臨床変数モデル、および多変数統合モデルのAUC、感度、特異度、および報告されたカットオフ値を提示する。
| サブグループ | 項目 | AFP | PIVKA-II | 複合モデル |
| 全HCC | AUC | 0.75 | 0.78 | 0.89 |
| 全HCC | 主要バリデーション閾値 | 18.5 ng/mL | 38.0 mAU/mL | 予測確率 = 0.56 |
| 全HCC | 感度, % (95% CI) | 62.1 (48.7–74.2) | 72.4 (59.1–83.5) | 84.5 (72.6–92.6) |
| 全HCC | 特異度, % (95% CI) | 88.9 (82.0–93.4) | 91.3 (85.1–95.3) | 90.5 (84.2–94.8) |
| 全HCC | PPV, % | 63.8 | 72.7 | 78.8 |
| 全HCC | NPV, % | 88.1 | 91 | 94.1 |
| 早期HCC | 探索的サブグループ閾値 | 15.2 ng/mL | 33.5 mAU/mL | 予測確率 = 0.51 |
| 早期HCC | 感度, % (95% CI) | 45.5 (25.1–67.3) | 59.1 (38.5–77.7) | 72.7 (52.0–87.6) |
| 早期HCC | 特異度, % | 88.9 | 91.3 | 90.5 |
| 早期HCC | PPV, % | 40 | 54.5 | 66.7 |
| 早期HCC | NPV, % | 90.1 | 87.5 | 92.3 |
| AFP陰性HCC | 探索的サブグループ閾値 | 7.5 ng/mL | 31.2 mAU/mL | 予測確率 = 0.48 |
| AFP陰性HCC | 感度, % (95% CI) | 23.1 (9.7–42.6) | 61.5 (40.6–79.8) | 73.1 (52.2–88.4) |
| AFP陰性HCC | 特異度, % | 88.9 | 91.3 | 90.5 |
| AFP陰性HCC | PPV, % | 22 | 52 | 64.5 |
| AFP陰性HCC | NPV, % | 90.2 | 88.3 | 92.7 |
| ウイルス性HCC | 探索的サブグループ閾値 | 19.3 ng/mL | 40.7 mAU/mL | 予測確率 = 0.59 |
| ウイルス性HCC | 感度, % (95% CI) | 64.7 (46.9–79.9) | 73.5 (56.4–86.4) | 85.3 (69.9–94.7) |
| ウイルス性HCC | 特異度, % | 88.1 | 90.5 | 91.3 |
| ウイルス性HCC | PPV, % | 67.3 | 73 | 81.3 |
| ウイルス性HCC | NPV, % | 87.5 | 90.8 | 94.7 |
| 非ウイルス性HCC | 探索的サブグループ閾値 | 20.1 ng/mL | 34.5 mAU/mL | 予測確率 = 0.53 |
| 非ウイルス性HCC | 感度, % (95% CI) | 58.3 (36.6–77.9) | 70.8 (48.9–87.4) | 83.3 (62.6–95.3) |
| 非ウイルス性HCC | 特異度, % | 89.2 | 92.1 | 89.7 |
| 非ウイルス性HCC | PPV, % | 59.2 | 69.7 | 75 |
| 非ウイルス性HCC | NPV, % | 89 | 92 | 93.8 |
| 複合モデルのキャリブレーション | 切片 | — | — | −0.08 |
| 複合モデルのキャリブレーション | 傾き | — | — | 0.91 |
| 複合モデルのキャリブレーション | Brierスコア | — | — | 0.118 |
| 複合モデルのキャリブレーション | Hosmer–Lemeshow P値 | — | — | 0.64 |
| 注:全HCCの行は主要バリデーション解析の結果を示す。早期HCC、AFP陰性HCC、ウイルス性HCC、および非ウイルス性HCCの行は、探索的サブグループの性能を示す。サブグループ閾値は、各サブグループ内における見かけ上の動作点を説明するために報告されたものであり、モデルの再適合や再キャリブレーションには使用されていない。AFP陰性HCCは AFP <20.0 ng/mL と定義した。PPV:陽性的中率、NPV:陰性的中率。 | ||||
表3:検証コホートにおける診断能およびサブグループ解析。 すべてのHCC、早期HCC、AFP陰性HCC、ウイルス性HCC、および非ウイルス性HCCにおけるAFP、PIVKA-II、および統合モデルのAUC、報告された閾値、感度、特異度、陽性的中率、および陰性的中率を示す。また、統合モデルのキャリブレーション指標も含まれている。
| 要因 / 指標 | 単変量P値 | 係数β | 調整済みオッズ比 / 検証指標 | 95%信頼区間 | P 値 |
| 切片 | — | −4.862 | — | — | — |
| 年齢 | 0.112 | 0.018 | 1.02 | 0.99–1.05 | 0.186 |
| 性別:オス | 0.087 | 0.331 | 1.41 | 0.83–2.37 | 0.204 |
| AFP(自然対数変換済み) | 0.004 | 0.247 | 1.28 | 1.05–1.62 | 0.021 |
| PIVKA-II、自然対数変換済み | <0.001 | 0.712 | 2.05 | 1.48–2.89 | <0.001 |
| アルブミン, g/L | 0.008 | −0.062 | 0.94 | 0.89–0.99 | 0.032 |
| INR(国際標準比) | 0.012 | 0.554 | 1.74 | 1.12–2.78 | 0.015 |
| 血小板数、×109/L | 0.052 | −0.004 | 0.99 | 0.98–1.00 | 0.044 |
| 見掛けのトレーニングAUC | — | — | 0.93 | 0.89–0.96 | — |
| 平均的な楽観性 | — | — | 0.018 | — | — |
| 楽観度補正AUC | — | — | 0.91 | 0.87–0.95 | — |
| 見かけの検量線勾配 | — | — | 1 | — | — |
| 楽観度補正済み校正勾配 | — | — | 0.94 | — | — |
| トレーニング・ブライア・スコア | — | — | 0.104 | — | — |
| Hosmer–Lemeshow P値 | — | — | 0.72 | — | — |
| 注:最終的な線形予測子は η = −4.862 + 0.247 × ln(AFP) + 0.712 × ln(PIVKA-II) + 0.018 × 年齢 + 0.331 × 性別 − 0.062 × アルブミン + 0.554 × INR − 0.004 × 血小板数とした。予測確率は p(HCC) = 1 / [1 + exp(−η)] として算出した。AFPの単位は ng/mL、PIVKA-IIは mAU/mL、年齢は年とし、性別は女性 = 0、男性 = 1 とコード化した。また、アルブミンは g/L、INRは無次元値、血小板数は ×10⁹/L とした。 | |||||
表4:多変量ロジスティック回帰およびブートストラップ内部妥当性検証。トレーニングコホートモデルで評価された変数について、単変量P値、調整済みモデル係数、調整済みオッズ比、95%信頼区間、および多変量P値を示す。ブートストラップ楽観度、楽観度補正済みAUC、楽観度補正済みキャリブレーションスロープ、Brierスコア、およびHosmer–Lemeshow検定の結果を報告する。
表5:Youden指数で最適化したカットオフ値を用いた診断性能。Youden指数によるカットオフ値を用いた場合の、AFP、PIVKA-II、および複合モデルの感度、特異度、陽性予測値、陰性予測値、正診率、およびAUCを示す。
| 方法 | 確立されたカットオフ値 | 感度、% (95% CI) | 特異度、% (95% CI) | PPV, % (95% CI) | NPV, % (95% CI) | 精度、% (95% CI) | AUC (95% CI) |
| α-フェトプロテイン | 20.0 ng/mL | 65.2 (57.0–72.7) | 88.5 (83.4–92.3) | 70.1 (61.8–77.4) | 86.0 (80.7–90.3) | 80.3 (75.0–84.8) | 0.77 (0.72–0.82) |
| PIVKA-II | 40.0 mAU/mL | 73.0 (65.2–79.8) | 93.1 (88.8–96.0) | 81.8 (74.2–87.7) | 89.0 (83.9–92.8) | 85.6 (80.9–89.5) | 0.82 (0.78–0.86) |
| 統合モデル | 予測確率 = 0.60 | 83.5 (76.6–89.0) | 92.0 (87.4–95.3) | 84.7 (77.9–90.0) | 91.2 (86.3–94.6) | 88.9 (84.6–92.2) | 0.89 (0.86–0.93) |
| 注:確立された臨床的なカットオフ値は、AFP 20.0 ng/mLおよびPIVKA-II 40.0 mAU/mLとした。複合モデルは、この臨床カットオフ値との比較に用いられた、対応する事前定義済みの確率閾値に基づいて報告された。 | |||||||
表6:確立された臨床カットオフ値を用いた診断能。確立されたAFPのカットオフ値20.0 ng/mLおよびPIVKA-IIのカットオフ値40.0 mAU/mLを用いたときの、感度、特異度、陽性的中率、陰性的中率、正診率、およびAUCを示す。複合モデルについては、このカットオフ比較に使用された対応する確率閾値における値を報告している。
| 方法 | 特異度90%に最も近いカットオフ値 | 感度、% (95% CI) | 特異度、% (95% CI) | PPV, % (95% CI) | 陰性的的中率、% (95% CI) |
| α-フェトプロテイン | 19.0 ng/mL | 67.9 (59.1–75.7) | 89.1 (84.2–92.8) | 71.3 (62.4–79.0) | 87.3 (82.1–91.2) |
| PIVKA-II | 37.5 mAU/mL | 75.4 (67.3–82.2) | 92.0 (87.7–95.1) | 79.8 (71.6–86.3) | 89.7 (84.7–93.3) |
| 統合モデル | 予測確率 = 0.57 | 86.2 (79.3–91.3) | 90.6 (85.8–94.0) | 82.7 (74.8–88.7) | 92.4 (87.9–95.4) |
| 注:これらのカットオフ値は、カットオフ監査分析において特異度が90%に最も近くなるように選択された。PIVKA-IIについて、本監査におけるYouden指数および特異度ほぼ90%のカットオフ値は37.5 mAU/mLであり、表3に報告されている一次検証しきい値は38.0 mAU/mL、確立された臨床カットオフ値は40.0 mAU/mL、そして表2で使用されたトレーニングコホートのYoudenカットオフ値は45.0 mAU/mLである。 | |||||
表7:特異度90%に最も近いカットオフ値における診断能。 特異度が90%に最も近くなるように選択された閾値における、AFP、PIVKA-II、および複合モデルの感度、特異度、陽性予測値、および陰性予測値を示す。
本研究では、早期段階およびAFP陰性の疾患に注目し、PIVKA-II、AFP、および日常的な臨床変数を用いたHCCの統合診断戦略を評価した14。トレーニングコホートおよび検証コホートのいずれにおいても、複合モデルは単一マーカー検査よりも優れた性能を示した。トレーニングコホートにおいて、複合モデルはAUC 0.93を達成し、AFPの0.78およびPIVKA-IIの0.85を上回った。独立検証コホートにおいても、本モデルは高い識別能を維持し、AUC 0.89、感度 84.5%、特異度 90.5%であった。これらの結果は、単一の血清閾値に基づいて診断決定を下すのではなく、相補的なバイオマーカーと臨床的シグナルを統合して解釈するモデルベースのアプローチを支持するものである。
バリデーションの結果により、特にAFPの信頼性が低い場合にPIVKA-IIがもたらす付加価値が明らかになりました。全バリデーションHCC症例におけるAFPの感度は62.1%でしたが、AFP陰性HCCでは23.1%まで低下しました。対してPIVKA-IIは、全体的に高い感度を示し、AFP陰性疾患においても61.5%の感度を維持しました。複合モデルを用いることで、高い特異度を維持しつつ、感度はAFP陰性HCCで73.1%、早期HCCで72.7%までさらに向上しました。この傾向は、PIVKA-IIがAFPとは一部異なる診断情報を捉えており、特に低AFP腫瘍や腫瘍量(tumor burden)が少ない早期において有用であるという先行知見15,16,17と一致しています。相関分析およびクロス分類分析によってもこの解釈が支持され、AFPとPIVKA-IIは代替可能なマーカーではなく、統合スコアによって単一マーカーの分類では見落とされていた症例がさらに検出されることが示されました。
多変量解析の結果から、複合モデルによる精度向上は、単にAFPとPIVKA-IIを合わせたことによる結果だけではないことが示唆されました。臨床変数は、年齢、性別、肝予備能、凝固状態、および血小板数に関する追加的なコンテキストをもたらしました。この設計は、人口統計学的変数と検査値を組み合わせて、不均一な肝疾患集団における診断能を向上させるGALADやGAAD、および関連するバイオマーカーベースのスコアを含む、既存の多変量HCCリスクモデルと一致しています18,19,20。調整モデルにおいて、対数変換後のPIVKA-IIは引き続き最強の独立した予測因子であり、対数変換後のAFPも独立した関連性を保持し、INRがさらなる診断シグナルを寄与しました。アミノトランスフェラーゼは調整後の情報価値が低くなっており、腫瘍関連マーカーおよび凝固関連マーカーを考慮した後は、非特異的な肝炎症が識別能の主な要因ではなかったことが示唆されました。
カットオフ解析は、査読中に提起された重要な点に対応するものである。異なるPIVKA-IIの閾値は、矛盾する一次カットオフとして解釈されるべきではない。45.0 mAU/mLという値はトレーニングコホートのROC比較に用いられ、40.0 mAU/mLは確立された臨床的閾値を、37.5–38.0 mAU/mLの範囲はYouden最適化または固定特異度解析に基づく代替的な閾値戦略を反映している。これらの閾値は、それぞれ異なる臨床的疑問に答えるものである。感性重視のカットオフは高リスク群の監視に有用である一方、特異度重視のカットオフは偽陽性の低減が優先される場合に好ましい。これらの戦略を通じて、複合モデルはAFPまたはPIVKA-II単独よりも安定しており、画像診断の代替ではなく、リスク層別化ツールとしての有用性が支持された21。
いくつかの限界が残っています。トレーニングコホートは単一施設であり、前向きバリデーションコホートの規模は中程度でした。特に、NAFLD関連、アルコール関連、HCV関連HCCなど、異なる病因学的背景を持つ集団における多施設共同バリデーションが依然として必要です。HCCの判定は造影CTおよび/またはMRIを用いて行われました。これは日常的な診断実務を反映していますが、極めて早期の病変や非定型的な病変を十分に捉えきれていない可能性があります。一部のサブグループ解析、特に早期およびAFP陰性のHCCでは、全体コホートよりも症例数が少なくなっていました。キャリブレーションおよびブートストラップ解析によりモデルの安定性の評価は行われましたが、モデルに基づいたサーベイランスが紹介効率、早期発見率、およびその後の臨床転帰を改善するかどうかを検証する前向き実装研究の代わりとなるものではありません22。
結論として、PIVKA-II、AFP、および日常的な臨床変数を統合することで、単一のバイオマーカーを用いた戦略と比較してHCCの検出能が向上し、トレーニングコホートと独立した検証コホートの両方で一貫した性能が示された。本モデルは、高い特異度を維持しつつ、早期およびAFP陰性のHCCにおいて臨床的に有用な感度を保持しており、AFPベースのサーベイランスにおける2つの一般的な盲点を解消している。入力データは日常的に利用可能であるため、このアプローチは高リスクの肝疾患集団におけるさらなる検証に実用的である。今後の多施設共同研究では、本モデルを超音波検査とAFPの併用療法と直接比較し、定義済みの運用閾値を評価し、さらに新たなバイオマーカーや画像由来の特徴量との統合が早期HCCの検出能をさらに向上させるかどうかを検証すべきである23,24。
著者らは、競合する金銭的または非金銭的な利益がないことを宣言します。商業的な資金提供者、試薬メーカー、ソフトウェア提供者、または診断プラットフォーム企業は、研究デザイン、データ収集、統計分析、結果の解釈、原稿の作成、または論文投稿の決定において一切の役割を果たしていません。
著者らは、本研究における採血、臨床調整、画像レビュー、およびデータ検証を支援した研究参加者および臨床スタッフに感謝いたします。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| 1.5 mL ヌクレアーゼフリーマイクロ遠心チューブ | Eppendorf | 30123328 | 血漿の分注および保存 |
| AFPキャリブレーター | Roche Diagnostics | AFP CalSet II, 09227261190 | AFPの校正 |
| AFP精度管理物質 | Roche Diagnostics | PreciControl Tumor Marker, 11776452160 | AFPの精度管理 |
| AFP精度管理物質 | Roche Diagnostics | PreciControl Universal, 11731416160 | AFPの精度管理 |
| AFP試薬キット | Roche Diagnostics | Elecsys AFP, 09015124190 | AFPの測定 |
| 自動電気化学発光免疫測定装置 | Roche Diagnostics | cobas e 801 | AFPおよびPIVKA-IIの測定 |
| 校正用パッケージ | R package | rms 6.7–1 | 校正解析 |
| 決定曲線分析パッケージ | R package | rmda 1.6 | 決定曲線分析 |
| Hosmer–Lemeshow検定パッケージ | R package | ResourceSelection 0.3–6 | Hosmer–Lemeshow検定 |
| K2-EDTA採血管, 10 mL | BD | 367525 | 末梢静脈血の採取 |
| 多重代入パッケージ | R package | mice 3.16.0 | 多重代入 |
| PIVKA-II試薬キット | Roche Diagnostics | Elecsys PIVKA-II, 08333629190/08333629500 | PIVKA-IIの測定 |
| 冷却遠心機 | Eppendorf | Centrifuge 5425 R | 血漿分離 |
| ROC解析パッケージ | R package | pROC 1.18.5 | ROC解析およびDeLong検定 |
| 統計ソフト | R Foundation | R 4.3.2 | 統計解析 |
| 統計ソフトインターフェース | Posit Software | RStudio 2023.12.1 | 統計解析 |