연구 논문

간세포암의 조기 진단을 위한 이상 프로트롬빈(PIVKA-II), 알파-페토단백질 및 일반 임상 변수의 통합 분석

37 조회수

DOI:

10.3791/70558

2026년 8월 25일

이 논문에서

요약

본 프로토콜은 PIVKA-II, AFP 및 일상적인 임상 변수를 간세포암 진단을 위한 로지스틱 회귀 모델로 통합하는 재현 가능한 워크플로우를 설명하며, 초기 단계 및 AFP 음성 질환에서의 검증 내용을 포함합니다.

초록

간세포암(HCC)의 조기 진단은 특히 조기 단계 및 AFP 음성 종양에서 alpha-fetoprotein (AFP)의 불완전한 민감도로 인해 여전히 제한적입니다. 본 연구에서는 비정상적인 prothrombin/protein induced by vitamin K absence-II (PIVKA-II), AFP 및 통상적인 임상 변수들을 통합하여 재현 가능한 HCC 진단 모델을 구축할 수 있는지 평가하였습니다. 모델 개발을 위해 영상학적으로 확진된 HCC 환자 112명과 비-HCC 대조군 93명을 포함하여 총 205명의 참가자로 구성된 후향적 훈련 코호트를 사용하였습니다. 모델 재조정 없는 외부 검증을 위해 HCC 환자 58명과 비-HCC 대조군 126명을 포함하여 총 184명의 참가자로 구성된 독립적인 전향적 검증 코호트를 사용하였습니다. 영상 촬영 전 채혈한 혈액 샘플을 사용하여 AFP와 PIVKA-II를 측정하였으며, 동일한 진단 기간 내의 임상 변수들을 추출하였습니다. 최종 다변량 로지스틱 회귀 모델은 ln(AFP), ln(PIVKA-II), 연령, 성별, albumin, international normalized ratio 및 혈소판 수치를 결합하였습니다. 통합 모델은 훈련 코호트에서 0.93, 검증 코호트에서 0.89의 AUC를 달성하였습니다. 검증 결과, 민감도는 84.5%, 특이도는 90.5%였습니다. 조기 단계 HCC에서의 민감도는 72.7%, AFP 음성 HCC에서의 민감도는 73.1%로 유지되었으며, 두 하위 그룹 모두에서 AFP 단독 측정 시보다 높았습니다. 보정 및 부트스트랩 검증을 통해 수용 가능한 모델 안정성을 확인하였습니다. 이러한 결과는 PIVKA-II, AFP 및 통상적으로 이용 가능한 임상 변수들을 결합하여 고위험 간 질환 인구를 위한 실용적인 진단 선별 도구를 구축할 수 있음을 보여줍니다.

서론

간세포암(HCC)은 암 관련 사망의 주요 원인이며, 일반적으로 B형 간염 바이러스 감염, C형 간염 바이러스 감염, 알코올성 간질환 및 대사 기능 장애 관련 지방성 간질환을 포함한 만성 간질환 환자에게서 발생합니다1. 종양이 혈관 침범, 간 외 전이 또는 간 예비능의 현저한 저하가 나타나기 전에 발견되었을 때 완치 치료가 가장 효과적이므로 조기 발견이 임상적으로 중요합니다. 현재의 감시 전략은 일반적으로 혈청 알파-태아단백(AFP) 검사의 동반 여부와 관계없이 간 초음파 검사에 의존합니다2. 그러나 실제 임상에서는 검사자의 숙련도, 작은 종양 크기, 불균일한 간경변 결절, 비만으로 인한 영상 촬영의 어려움 및 AFP를 거의 또는 전혀 생성하지 않는 종양 등으로 인해 감시 성능이 영향을 받습니다3,4.

AFP는 비용이 저렴하고 접근성이 좋으며 임상의들에게 익숙하기 때문에 여전히 널리 사용되고 있습니다. 하지만 그 진단적 가치는 불완전한 민감도와 불완전한 특이도로 인해 제한적입니다. 일반적인 임계값인 20 ng/mL에서는 상당 비율의 초기 단계 및 AFP 음성 HCC를 놓칠 수 있습니다. 임계값을 낮추면 민감도는 향상될 수 있으나, 활성 간염, 간경변증 또는 기타 염증성 간 질환 환자에서 위양성 결과가 증가할 수 있습니다5,6. 이러한 한계로 인해 고위험 간 질환 인구 집단의 진단 분류에서 단일 마커 해석만으로는 불충분합니다.

비타민 K 결핍 유도 단백질-II(PIVKA-II) 또는 des-γ-carboxy prothrombin으로도 알려진 비정상 프로트롬빈은 악성 간세포가 불완전하게 카르복실화된 프로트롬빈을 생성할 때 방출됩니다. PIVKA-II는 AFP 분비보다는 응고 관련 종양 생물학을 반영하며, AFP 수치가 낮을 때도 유용한 정보를 제공할 수 있습니다7. 이전 연구와 메타 분석에 따르면 PIVKA-II는 특히 AFP와 병용했을 때 HCC 검출률을 향상시키며, 초기 단계 또는 AFP 음성 질환에서 가치를 더할 수 있음이 밝혀졌습니다8,9. 그러나 마커만을 이용한 전략은 숙주의 배경, 간 예비능, 혈소판 수, 응고 상태 또는 기저 간 질환을 충분히 반영하지 못합니다.

복합 진단 모델은 임상적 맥락과 함께 종양 표지자 결과를 해석하는 실용적인 방법을 제공합니다. GALAD, GAAD 및 관련 모델들은 인구통계학적 변수와 바이오마커를 결합하여 다양한 원인 및 인구 집단 전반에서 HCC 검출 능력을 향상시킬 수 있음을 보여주었습니다10,11. 이러한 성능은 개별 바이오마커 임계값보다는 다변량 위험 추정법의 사용을 뒷받침합니다. 동시에, 일부 모델에는 모든 실험실에서 이용 가능하지 않은 분석법이 포함되어 있으며, 컷오프 동작은 지역, 원인 프로파일, 질병 단계 및 의도된 임상적 용도에 따라 다를 수 있습니다12. 널리 이용 가능한 바이오마커와 일상적인 실험실 변수를 기반으로 구축된 모델은 일반적인 진단 워크플로우에 적용하기 더 쉬울 수 있습니다. 특수 바이오마커나 특정 인구 집단 전용 컷오프 전략에 의존할 수 있는 기존에 발표된 모델들과 달리, 본 연구에서는 널리 이용 가능한 바이오마커와 일상적인 임상 변수를 기반으로 한 다변량 진단 모델을 평가하고, 독립적인 전향적 코호트에서 그 성능을 검증하였습니다.

PIVKA-II는 AFP를 보완할 수 있으며 임상 검사실에서 이미 사용 중인 자동 면역 분석 플랫폼에서 측정이 가능하므로 이 프레임워크에 적합합니다. 연령, 성별, albumin, bilirubin, 혈소판 수, 국제 표준화 비율(INR) 및 간 질환 배경과 같은 일상적인 변수들은 동일한 임상 진료 시점에 확인 가능하며, HCC 위험과 관련된 간 예비능 또는 응고 관련 정보를 포착할 수 있습니다13. 이러한 변수들을 AFP 및 PIVKA-II와 결합하면 단일 컷오프 값에 대한 의존도를 피하면서 판별력을 향상시킬 수 있습니다.

따라서 이중 코호트 진단 설계를 사용하여 PIVKA-II, AFP 및 통상적인 임상 변수를 평가하였습니다. 회고적 훈련 코호트에서 다변량 로지스틱 회귀 모델을 개발하였으며, 이를 별도의 전향적 검증 코호트에서 재조정 없이 테스트하였습니다. 진단 성능은 AFP, PIVKA-II 및 임상 변수 단독 사용 시와 비교하였으며, 조기 HCC, AFP 음성 HCC, 컷오프 해석, 보정 및 부트스트랩 내부 검증에 중점을 두어 사전 정의된 분석을 수행하였습니다.

프로토콜

본 연구는 Westlake University 의과대학 부속 Hangzhou First People's Hospital 윤리위원회의 검토 및 승인을 받았습니다. 승인 번호는 IIT-20230528-0108-01입니다. 전향적으로 등록된 참여자들로부터는 혈액 채취 전 서면 동의서를 받았습니다. 후향적으로 포함된 임상 기록 및 일반 진료 중 수집되어 보관된 잔여 검체의 경우, 비식별화된 데이터를 사용하였고 추가적인 중재가 수행되지 않았으므로 윤리위원회에 의해 동의서 제출이 면제되었습니다.

재현성, 편향 제어 및 데이터 무결성

대상자 선정 기준, 혈액 샘플 채취 시점, 영상 판독 규칙, 하위 그룹 정의, 후보 예측 인자, 컷오프 정의, 결측 데이터 처리 규칙 및 검증 절차는 통계 분석 전에 미리 지정되었습니다. 혈액 샘플은 조영 증강 영상 확진 전 및 모든 항종양 치료 시작 전에 수집되었습니다. 실험실 검사에는 익명화된 연구 식별자를 사용하였으며, 훈련 및 검증 코호트의 샘플은 무작위 순서로 검사되었습니다. 실험실 인력은 최종 진단, 코호트 배정, Barcelona Clinic Liver Cancer (BCLC) 단계 및 AFP 음성 여부에 대해 눈가림 처리되었습니다. 영상 진단 및 병기 결정은 실험실 검사와 독립적으로 추출되었습니다. 모델 적합 전, 두 명의 연구자가 데이터 입력, 단위 변환, 코호트 배정, 제외 코딩, 결측값 코딩 및 통계 데이터셋을 확인하였습니다. 훈련 및 검증 코호트는 변수 스크리닝, 모델 적합, 컷오프 도출 및 검증 전 과정에서 서로 분리되어 유지되었습니다.

연구 대상 및 설계

본 이중 코호트 진단 연구에서는 PIVKA-II에 의해 유도된 비정상 프로트롬빈/단백질, AFP 및 일반 임상 변수를 이용한 HCC 검출용 다변량 모델을 개발하고 검증하였습니다. 후향적으로 구성된 훈련 코호트는 2021년 1월 1일부터 2023년 12월 31일 사이에 평가된 대상자를 포함하였습니다. 이 코호트는 변수 스크리닝, 모델 피팅, 컷오프 도출 및 부트스트랩 내부 검증에 사용되었습니다. 전향적으로 등록된 검증 코호트는 2024년 1월 1일부터 2025년 12월 31일 사이에 평가된 대상자를 포함하였습니다. 이 코호트는 표본 외 테스트 용도로만 사용되었습니다. 검증 코호트에서는 변수 재선택, 모델 재피팅, 계수 업데이트, 컷오프 재최적화 또는 서브그룹 기반 재교정이 수행되지 않았습니다. 대상자 흐름, 코호트 할당, 혈액 채취, 혈장 처리, 바이오마커 검사, 영상 판독 및 통계 워크플로우는 그림 1에 나타나 있습니다.

대상자는 Westlake University 의과대학 부속 Hangzhou First People's Hospital의 고위험 간질환 감시 또는 진단 경로를 통해 모집되었습니다. 고위험 상태는 임상 평가, 실험실 기록 또는 이전 영상 검사를 바탕으로 만성 B형 간염 감염, 만성 C형 간염 감염, 원인 불문의 간경변증 또는 섬유화가 확인된 지방간 질환으로 정의되었습니다. 선정 기준은 18세 이상의 성인으로, 채혈 후 14일 이내에 영상 촬영 전 혈액 샘플링과 조영 증강 다시기 컴퓨터 단층촬영(CT) 및/또는 동적 조영 증강 자기공명영상(MRI)을 완료한 자였습니다. 제외 기준은 절제술, 소작술, 경동맥 화학색전술 또는 전신 요법을 포함한 이전의 HCC 치료 이력, 샘플링 전 7일 이내의 비타민 K 투여, 응고 해석에 영향을 미칠 가능성이 있는 비타민 K 길항제 요법 또는 기타 항응고 요법, 샘플링 당시의 급성 담관염 또는 담도 폐쇄, 임신, AFP, PIVKA-II 또는 최종 영상 진단 결과의 누락, 그리고 유효한 재샘플이 없는 부적절한 검체 품질이었습니다.

최종 연구 대상 군은 389명의 참가자로 구성되었습니다. 훈련 코호트는 205명의 참가자로 구성되었으며, 여기에는 영상 진단으로 확인된 HCC 사례 112건과 non-HCC 대조군 93명이 포함되었습니다. 검증 코호트는 184명의 참가자로 구성되었으며, 영상 진단으로 확인된 HCC 사례 58건과 non-HCC 대조군 126명이 포함되었습니다. 훈련 코호트의 non-HCC 대조군 93명 중에는 건강한 대조군 30명과 만성 간질환 대조군 63명이 포함되었습니다. 검증 코호트의 non-HCC 대조군 126명 중에는 건강한 대조군은 없었으며, 126명 모두 만성 간질환 대조군이었습니다.

간염 병력이나 보상성 간경변증만으로는 증상 여부를 할당하지 않았습니다. 영상 검사 전 기록에 새로운 또는 악화된 우상복부 통증, 원인 불명의 체중 감소, 복부 팽만, 황달, 진한 소변, 또는 다른 확인된 원인으로 설명되지 않는 임상적으로 기록된 비보상성 상태가 문서화된 경우에만 참가자를 증상군으로 분류했습니다. 이러한 소견이 없는 참가자는 무증상군 또는 감시 검사 발견군으로 분류했습니다.

진단 판정과 병기 결정

최종 HCC 상태는 일상적인 진료 과정에서 수행된 조영 증강 다시기 CT 및/또는 동적 조영 증강 MRI를 사용하여 판정하였습니다. 영상 진단에는 최소한 동맥기(arterial phase)와 문맥기(portal venous phase)가 포함되어야 하며, 지연기(delayed-phase) 소견이 있는 경우 이를 함께 반영하였습니다. 위험군 간의 영상에서 동맥기 고조영 증강과 문맥기 및/또는 지연기 세척(washout) 소견이 나타나고, 조영 증강되는 캡슐의 유무와 관계없이 관찰될 때 해당 병변을 HCC로 분류하였습니다. HCC와 일치하는 영상 특징이 없고 다른 악성 진단이 없는 참가자는 non-HCC로 분류하였습니다.

영상 정보는 영상 촬영 방식, 획득한 위상, 동맥기 과강조, 씻김 현상, 피막 양상, 병변 수, 최대 병변 직경, 거대혈관 침범 및 간외 전이를 기록하는 미리 지정된 양식을 통해 추출되었습니다. 교육을 받은 두 명의 판독자가 최종 방사선 보고서에서 영상 특징을 독립적으로 추출하였습니다. 의견 불일치는 동일한 사전 정의 기준을 사용하여 합의를 통해 해결하였습니다. CT와 MRI가 모두 사용 가능한 경우, 다상 특성 분석이 가장 완전하게 이루어진 방식을 사용하였습니다. 두 방식 모두 완전한 경우에는 최종 임상 결정의 근거로 기록된 방식을 사용하였습니다.

HCC 상태가 확정된 후 BCLC 병기를 할당하였습니다. 초기 단계 HCC는 BCLC 병기 0–A로 정의하였습니다. AFP 음성 HCC는 영상 촬영 전 채혈 시 AFP <20 ng/mL로 정의하였습니다. 이러한 하위 그룹 라벨은 모델 훈련이나 참가자 적격성 판단이 아닌, 하위 그룹별 성능 평가를 위해 사용되었습니다.

시료 수집 및 혈장 처리

조영 증강 CT/MRI 확진 및 항종양 치료 전, 최소 8시간 동안 밤샘 금식 후 아침에 말초 정맥혈을 채취하였습니다. 총 10 mL의 정맥혈을 K2-EDTA 항응고제 혈액 채취 튜브에 채취하였습니다. 채취 직후 튜브를 8~10회 반전시킨 후 4 °C에서 실험실로 운송하였습니다. 정맥 천자부터 원심 분리까지의 간격은 2 h 이내로 유지하였으며, 이를 샘플 기록지에 기록하였습니다.

냉장 원심분리기를 사용하여 4 °C에서 1,600 × g로 10분 동안 원심분리하여 혈장을 분리하였습니다. 혈장 상층액을 1.5 mL 누클레아제-프리 미세원심분리 튜브로 옮긴 후 0.5–1.0 mL씩 분주하였습니다. 분주된 시료는 테스트 전까지 -80 °C에서 보관하였습니다. 바이오마커 측정 전, 분주된 시료 하나를 실온(20–25 °C)에서 20–30분 동안 한 번 해동하고, 도립 혼합법으로 가볍게 섞어 완전히 해동된 후 2시간 이내에 테스트하였습니다. 가시적인 응고, 중등도 또는 중증의 용혈, 혹은 현저한 지방혈증이 있는 샘플은 미리 정의된 실험실 수용 기준에 따라 제외하였습니다. 전향적 검증 코호트의 경우, 임상적으로 가능한 경우 영상 진단 확진 전에 혈액 채취를 반복하여 수행하였습니다.

AFP 및 PIVKA-II 측정

자동 면역 분석기를 이용한 전기화학발광 면역 분석법으로 AFP와 PIVKA-II를 측정하였습니다. AFP는 ng/mL로, PIVKA-II는 mAU/mL로 기록하였습니다. 결과는 실험실 정보 시스템에서 직접 추출하였습니다.

각 분석 배치에는 분석법 특이적 교정물과 최소 두 수준의 내부 품질 관리 물질이 포함되었습니다. 배치가 승인되려면 모든 품질 관리 결과가 사전에 정의된 실험실 제어 범위 내에 있어야 했습니다. 분석 정밀도 목표는 AFP와 PIVKA-II 모두에 대해 분석 내 변동계수(within-run coefficient of variation) ≤10% 및 분석 간 변동계수(between-run coefficient of variation) ≤15%로 설정되었습니다. 품질 관리에 실패하거나 배치 드리프트가 감지된 경우 해당 배치는 폐기되었으며, 분석기를 재교정한 후 충분한 검체량이 남아 있는 경우 배치를 반복 수행하였습니다. 신뢰할 수 없거나 범위를 벗어난 단일 검체 결과의 경우, 가능하면 동일한 해동 분주물에서 두 번의 반복 측정을 수행하였으며, 승인된 두 반복 측정값의 평균을 사용하였습니다. 반복 테스트에 실패하거나 검체량이 부족한 경우, 해당 결과는 무효로 표시하고 결측치 처리 규칙에 따라 처리하였습니다.

일상적인 임상 변수 추출

일반적인 임상 변수들은 영상 촬영 전 AFP/PIVKA-II 혈액 채취와 동일한 임상 진료 시점에서 추출되었습니다. 후보 변수에는 연령, 성별, alanine aminotransferase, aspartate aminotransferase, albumin, 총 빌리루빈, 국제 표준 비율(INR), 프로트롬빈 시간 및 혈소판 수치가 포함되었습니다. 영상 촬영 전 기간 내에 여러 값이 존재하는 경우, AFP/PIVKA-II 샘플링 시간과 가장 가까운 값을 선택하였습니다. 분석 전 단위 표준화를 수행하였습니다. 연령은 years로, 성별은 여성 = 0, 남성 = 1로 코딩하였으며, 혈소판 수치는 ×10⁹/L, albumin은 g/L, 총 빌리루빈은 μmol/L, AFP는 ng/mL, PIVKA-II는 mAU/mL로 기록하였습니다.

추출 후 범위 점검, 단위 점검 및 비정상 값 점검을 수행하였다. 플래그가 지정된 값들은 원본 기록과 대조하여 확인하였다. 원본 기록을 통해 검체 품질 문제, 단위 변환 오류 또는 처리 편차가 확인된 경우에만 해당 값을 제외하였다. 확인된 극단값은 그대로 유지하였다. 변수 사전에는 데이터셋 구조, 변수명, 단위, 코딩 규칙, 변환 규칙 및 결측값 코드가 정의되었다.

예측 변수 정의 및 변수 선택

모델 개발 전에 후보 예측 인자를 정의하였습니다. 핵심 바이오마커는 AFP와 PIVKA-II였습니다. 일반적인 임상 후보 인자는 연령, 성별, alanine aminotransferase, aspartate aminotransferase, albumin, 총 빌리루빈, INR 또는 프로트롬빈 시간, 그리고 혈소판 수치였습니다. AFP와 PIVKA-II는 자연로그 변환을 거쳤습니다. 분석 보고 한계치 미만의 값은 변환 전에 하한 보고 한계치의 절반 값으로 대체되었습니다.

훈련 코호트 내 HCC 환자군과 비-HCC 대조군 간의 단변량 비교를 위해, 대략적인 정규 분포를 보이는 변수에는 독립 표본 t-검정을, 왜도(skewness)가 있는 연속형 변수에는 Mann-Whitney U 검정을, 범주형 변수에는 χ2 검정 또는 Fisher의 정확 검정을 사용하였습니다. 단변량 스크리닝에서 P < 0.10인 변수들을 다변량 모델링 대상으로 고려하였습니다. 다중공선성은 분산팽창지수(VIF)를 사용하여 평가하였으며, VIF >5인 경우 공선성이 있는 것으로 간주하였습니다. 두 변수 사이에 강한 공선성이 나타날 경우, 임상적 해석력이 더 명확하고 모델 성능의 점진적 향상이 더 뛰어난 변수를 유지하였습니다.

최종 다변량 로지스틱 회귀 모델은 훈련 코호트에서만 개발되었습니다. ln(AFP)와 ln(PIVKA-II)는 모델에 강제로 포함되었습니다. 추가 예측 변수는 Akaike 정보 기준(AIC)에 기반한 후진 제거법을 통해 선택되었습니다. 후진 선택 후, 최종적으로 유지된 변수는 ln(AFP), ln(PIVKA-II), 연령, 성별, 알부민, INR 및 혈소판 수였습니다.

모델 개발 및 위험 점수 계산

HCC 상태를 이분형 결과 변수로 하여 다변량 로지스틱 회귀 분석을 통해 진단 모델을 적합시켰습니다. HCC의 예측 확률은 다음 방정식을 사용하여 선형 예측 인자 η로부터 계산되었습니다:

p(HCC)=1/[1+exp(-η)]

η = -4.862+0.247×ln(AFP)+0.712×ln(PIVKA-II)+0.018×age+0.331×sex-0.062×albumin+0.554×INR-0.004×plateletcount

AFP는 ng/mL, PIVKA-II는 mAU/mL, 연령은 세(years) 단위로 측정하였으며, 성별은 여성 = 0, 남성 = 1로 코딩하였고, 알부민은 g/L, INR은 단위 없음, 혈소판 수치는 ×109/L로 측정하였다. AFP와 PIVKA-II에는 자연로그를 사용하였다. 동일한 적합 계수를 이용하여 노모그램을 생성하였다. 수신자 조작 특성(ROC) 분석, 보정 분석, 결정 곡선 분석 및 검증에는 노모그램 점수 척도가 아닌 예측 확률을 사용하였다.

컷오프 정의 및 임계값 처리

PIVKA-II 임계값은 분석 목적에 따라 표시되었습니다. PIVKA-II의 확립된 임상 컷오프 값은 40.0 mAU/mL였습니다. 훈련 코호트의 Youden 컷오프 값은 45.0 mAU/mL였습니다. 고정 특이도 컷오프 값은 훈련 코호트에서 특이도 90%에 가장 가까운 임계값을 선택하여 도출되었으며, PIVKA-II의 경우 38.0 mAU/mL로 나타났습니다. 검증 전용 겉보기 임계값인 37.5 mAU/mL는 탐색적으로 처리되었으며, 기본 검증 컷오프로는 사용되지 않았습니다.

결합 모델의 경우, 기본 이진 컷오프는 Youden 지수를 사용하여 훈련 코호트에서 도출되었으며, 이를 검증 코호트에 그대로 적용하였습니다. AFP는 AFP 음성 하위 그룹 정의 및 일반 진료 비교를 위해 확립된 임상 컷오프인 20.0 ng/mL를 사용하였습니다. ROC 분석에 사용된 최적화된 AFP 컷오프는 임상 임계값과 별도로 표시하였습니다. 따라서 컷오프는 서로 대체 가능한 임계값으로 처리하지 않고 분석 목적별로 보고하였습니다.

모델 성능, 보정 및 검증

수신자 조작 특성 곡선과 곡선 아래 면적을 사용하여 판별력을 평가하였습니다. AUC는 95% 신뢰 구간과 함께 보고되었습니다. AUC 비교에는 DeLong 검정을 사용하였습니다. 분류 성능은 미리 지정된 컷오프 값에서의 민감도, 특이도, 양성 예측도, 음성 예측도 및 정확도로 보고되었습니다.

교정도는 교정 절편, 교정 기울기, Brier 점수 및 Hosmer–Lemeshow 적합도 검정을 통해 평가되었습니다. 교정 곡선을 이용하여 위험군별 HCC 예측 확률과 실제 관찰 확률을 비교하였습니다. 내부 검증은 훈련 코호트에서 1,000회의 부트스트랩 재표본 추출을 수행하여 낙관주의 교정 AUC 및 낙관주의 교정 교정 기울기를 추정하는 방식으로 진행되었습니다. 검증 코호트는 외부 성능 평가 목적으로만 사용되었습니다. 검증 코호트에서는 계수 업데이트, 모델 재적합, 임계값 재최적화 또는 하위 그룹 기반의 재교정을 수행하지 않았습니다.

0.05에서 0.50까지의 임계 확률에 걸쳐 결정 곡선 분석을 사용하여 임상적 유용성을 평가하였습니다. AFP 단독, PIVKA-II 단독, 임상 변수 모델 및 통합 모델에 대해 순 이익을 비교하였습니다.

결측치 처리 및 민감도 분석

주 분석에서는 최종 모델에 포함된 모든 변수가 유지된 대상자에 대해 완전 사례 모델링(complete-case modeling)을 사용하였다. 각 후보 예측 변수에 대해 결측값을 요약하였다. 유지된 예측 변수 중 결측률이 5%를 초과하는 경우, 결과 변수, 모든 유지된 예측 변수 및 코호트 지표를 보정 모델에 포함하여 연쇄 방정식에 의한 다중 대체법(multiple imputation by chained equations)을 민감도 분석으로 수행하였다. 결측률이 20%를 초과하는 변수는 다변량 모델링 대상에서 제외하였다. 대체 분석의 모델 계수, AUC, 보정 기울기 및 분류 지표를 완전 사례 결과와 비교하였다.

소프트웨어 및 재현 가능한 보고

모든 분석은 R version 4.3.2 및 RStudio version 2023.12.1을 사용하여 수행되었습니다. 로지스틱 회귀 분석은 base stats 패키지를 사용하여 수행하였습니다. ROC 분석 및 DeLong 비교는 pROC version 1.18.5를 사용하여 수행하였습니다. 보정 분석은 rms version 6.7-1 및 ResourceSelection version 0.3-6을 사용하여 수행하였습니다. 부트스트랩 검증은 70558의 고정된 랜덤 시드로 1,000회의 재표본 추출을 사용하였습니다. 결정 곡선 분석은 rmda version 1.6을 사용하여 수행하였습니다. 필요한 경우, 다중 대체법은 mice version 3.16.0을 사용하여 수행하였습니다. 분석 스크립트는 참여자 흐름, 모델 계수, ROC 곡선, 보정 지표, 부트스트랩 검증, 결정 곡선 분석, 컷오프 기반 분석 및 통계 표를 재현하였습니다.

결과

기초 특성

최종 분석에는 389명의 참가자가 포함되었습니다. 훈련 코호트는 205명의 참가자로 구성되었으며, 여기에는 영상으로 확인된 HCC 사례 12건과 비-HCC 대조군 93명이 포함되었습니다. 검증 코호트는 184명의 참가자로 구성되었으며, 여기에는 영상으로 확인된 HCC 사례 58건과 비-HCC 대조군 126명이 포함되었습니다. 기저 특성은 표 1에 요약되어 있습니다.

훈련 코호트에서 93명의 비-HCC 대조군은 30명의 건강한 대조군과 63명의 만성 간질환 대조군을 포함했습니다. 검증 코호트에서 126명의 비-HCC 대조군은 건강한 대조군은 없었으며 126명의 만성 간질환 대조군을 포함했습니다. B형 간염 바이러스 감염이 주요 기저 간질환이었습니다. BCLC 0–A 단계의 질환은 훈련 코호트의 HCC 사례 12건 중 57건, 검증 코호트의 HCC 사례 58건 중 30건을 차지했습니다. 연령, 성별, 간질환 병력, HCC 가족력, 간경변 상태, Child-Pugh 등급, alanine aminotransferase, aspartate aminotransferase, albumin, 총 빌리루빈, 혈소판 수, 프로토롬빈 시간, 국제 정규화 비율, 당뇨병 및 고혈압은 Table 1에 보고된 코호트 층간에 균형 있게 분포되었습니다.

훈련군 HCC 사례의 AFP 중앙값은 57.3 ng/mL였으며, 훈련군 비-HCC 대조군의 중앙값은 2.4 ng/mL였습니다. PIVKA-II 중앙값은 각각 197.6 mAU/mL와 86.3 mAU/mL였습니다. 검증 코호트에서 HCC 사례의 AFP 중앙값은 60.2 ng/mL였고, 비-HCC 대조군의 중앙값은 21.5 ng/mL였습니다. PIVKA-II 중앙값은 각각 191.5 mAU/mL와 84.1 mAU/mL였습니다.

훈련 코호트 진단 성능

훈련 코호트의 판별력은 그림 2(A)에 나타나 있으며, 이에 상응하는 민감도-특이도 비교는 그림 2(B)에 나타나 있습니다. 작동 특성은 표 2에 요약되어 있습니다. AFP는 설정된 20.0 ng/mL 임상 컷오프 값에서 AUC 0.78, 민감도 62.50%, 특이도 78.49%를 나타냈습니다. PIVKA-II는 훈련 코호트 유덴(Youden) 컷오프 값인 45.0 mAU/mL에서 AUC 0.85, 민감도 78.57%, 특이도 82.80%를 나타냈습니다. 임상 변수 모델은 예측 확률 임계값 0.40에서 AUC 0.81, 민감도 69.64%, 특이도 80.65%를 나타냈습니다. 결합 모델은 예측 확률 임계값 0.50에서 AUC 0.93, 민감도 88.39%, 특이도 89.25%로 가장 높은 훈련 코호트 판별력을 보였습니다.

단계별 층화 성능

단계별 층화 바이오마커 분포는 그림 3(A)에, 검출률은 그림 3(B)에, 단계별 AUC는 그림 3(C)에 나타나 있습니다. AFP, PIVKA-II 및 결합 모델 점수는 BCLC 0-A, B, C 질환 단계에 따라 증가했습니다. AFP는 초기 단계 HCC와 비-HCC 대조군 간에 중첩을 보였습니다. PIVKA-II는 단계별 층화에 따라 더 뚜렷한 구분 능력을 보였습니다. 결합 모델은 BCLC 0-A HCC를 포함하여 가장 높은 단계별 층화 판별력을 나타냈습니다.

AFP와 PIVKA-II의 상보성

마커 점수 상관관계는 그림 4(A)-(C)에 나타나 있으며, 마커 교차 분류는 그림 4(D)에 나타나 있다. AFP와 PIVKA-II는 부분적으로 중복되지 않는 양상을 보였다. AFP 양성/PIVKA-II 음성 및 AFP 음성/PIVKA-II 양성인 HCC 사례가 모두 관찰되었다. 통합 모델은 단일 마커 음성인 추가 HCC 사례들을 고위험군으로 분류하였으며, 이는 단일 바이오마커보다 통합 점수를 사용하는 것이 유효함을 뒷받침한다.

외부 검증

검증 코호트 ROC 곡선은 그림 5(A)에, 보정 곡선은 그림 5(B)에, 그리고 하위 그룹의 민감도-특이도 패턴은 그림 5(C)에 나타나 있습니다. 이에 해당하는 검증 지표는 표 3에 요약되어 있습니다. 모든 검증 HCC 사례에서 AFP는 18.5 ng/mL에서 AUC 0.75, 민감도 62.1%, 특이도 8.9%를 보였습니다. PIVKA-II는 38.0 mAU/mL에서 AUC 0.78, 민감도 72.4%, 특이도 91.3%를 기록했습니다. 결합 모델은 예측 확률 임계값 0.56에서 AUC 0.89, 민감도 84.5%, 특이도 90.5%, 양성 예측도 78.8%, 음성 예측도 94.1%를 나타냈습니다.

초기 단계 HCC에서 AFP의 민감도는 45.5%, 특이도는 8.9%였으며, PIVKA-II의 민감도는 59.1%, 특이도는 91.3%였고, 결합 모델의 민감도는 72.7%, 특이도는 90.5%였습니다. AFP 음성 HCC의 경우, AFP의 민감도는 23.1%, PIVKA-II의 민감도는 61.5%, 결합 모델의 민감도는 73.1%였습니다. 바이러스성 HCC에서 결합 모델의 민감도는 85.3%, 특이도는 91.3%였습니다. 비바이러스성 HCC에서 결합 모델의 민감도는 83.3%, 특이도는 89.7%였습니다. 검증 코호트의 보정 절편은 -0.08, 보정 기울기는 0.91, Brier score는 0.18, 그리고 Hosmer–Lemeshow P 값은 0.64였습니다.

다변량 회귀 분석 및 내부 검증

다변량 회귀 분석 결과는 표 4에 제시되어 있습니다. 보정 모델에서 로그 변환된 PIVKA-II는 보정 오즈비 2.05, 95% CI: 1.48-2.89, P < 0.01로 가장 강력한 독립적 예측 인자로 남았습니다. 로그 변환된 AFP 또한 보정 오즈비 1.28, 95% CI: 1.05-1.62, P = 0.021로 HCC와 독립적인 연관성을 보였습니다. 국제 표준 비율(International normalized ratio)은 보정 오즈비 1.74, 95% CI: 1.12-2.78, P = 0.015로 독립적인 예측 가치를 유지했습니다. 최종 후방 제거 모델에는 ln(AFP), ln(PIVKA-II), 연령, 성별, 알부민, 국제 표준 비율 및 혈소판 수치가 포함되었습니다.

부트스트랩 내부 검증 지표 또한 표 4에 보고되었다. 겉보기 훈련 AUC는 0.93이었고, 평균 낙관도는 0.018이었으며, 낙관도 보정 AUC는 0.91이었다. 겉보기 보정 기울기는 1.0이었고, 낙관도 보정 보정 기울기는 0.94였으며, 훈련 코호트 Brier 점수는 0.104, Hosmer–Lemeshow P 값은 0.72였다.

컷오프 감사 및 임계값별 성능

PIVKA-II 임계값은 분석 목적에 따라 달랐으므로, 컷오프 기반 결과는 서로 대체 가능한 것으로 처리하지 않고 별도로 보고하였다. 사후 Youden 최적화 컷오프 성능은 표 5에 제시되어 있다. AFP의 Youden 최적화 컷오프는 19.0 ng/mL였으며, 민감도는 67.9%, 특이도는 89.1%, 양성 예측도는 71.3%, 음성 예측도는 87.3%, 정확도는 81.2%, AUC는 0.78이었다. PIVKA-II의 Youden 최적화 컷오프는 37.5 mAU/mL였으며, 민감도는 75.4%, 특이도는 92.0%, 양성 예측도는 79.8%, 음성 예측도는 89.7%, 정확도는 85.9%, AUC는 0.82였다. 결합 모델의 Youden 최적화 예측 확률 컷오프는 0.57이었으며, 민감도는 86.2%, 특이도는 90.6%, 양성 예측도는 82.7%, 음성 예측도는 92.4%, 정확도는 89.8%, AUC는 0.90이었다.

기존의 임상 컷오프 값을 이용한 성능 결과는 표 6에 나타나 있습니다. AFP의 기존 컷오프 값인 20.0 ng/mL에서 AFP는 민감도 65.2%, 특이도 88.5%, 양성 예측도 70.1%, 음성 예측도 86.0%, 정확도 80.3% 및 AUC 0.7을 기록했습니다. PIVKA-II의 기존 컷오프 값인 40.0 mAU/mL에서 PIVKA-II는 민감도 73.0%, 특이도 93.1%, 양성 예측도 81.8%, 음성 예측도 89.0%, 정확도 85.6% 및 AUC 0.82를 기록했습니다. 예측 확률 임계값 0.60에서 결합 모델은 민감도 83.5%, 특이도 92.0%, 양성 예측도 84.7%, 음성 예측도 91.2%, 정확도 8.9% 및 AUC 0.89를 기록했습니다.

특이도가 90%에 가장 근접한 컷오프에서의 성능은 표 7에 나타나 있다. AFP는 19.0 ng/mL의 컷오프를 사용하였으며, 민감도는 67.9%, 특이도는 89.1%였다. PIVKA-II는 37.5 mAU/mL의 컷오프를 사용하였으며, 민감도는 75.4%, 특이도는 92.0%였다. 결합 모델은 0.57의 예측 확률 컷오프를 사용하였으며, 민감도는 86.2%, 특이도는 90.6%였다. 이러한 컷오프 감사 결과는 37.5, 38.0, 40.0 및 45.0 mAU/mL의 PIVKA-II 임계값 간의 수치적 차이를 설명해 준다. 45.0 mAU/mL는 1차 훈련 비교에 사용된 훈련 코호트의 Youden 컷오프였고, 38.0 mAU/mL는 고정 특이도 보고를 위한 검증에 사용되었으며, 40.0 mAU/mL는 기설정된 임상 컷오프였고, 37.5 mAU/mL는 컷오프 감사 표에서 사후 Youden 최적화된 컷오프였다.

질환 하위 그룹 분포

AFP, PIVKA-II 및 결합 모델 점수의 질환 하위 그룹별 분포가 그림 6(A)-(C)에 제시되어 있습니다. AFP, PIVKA-II 및 결합 모델 점수는 만성 간질환 대조군에서 가장 낮았으며, HCC 그룹에서 더 높게 나타났습니다. AFP는 만성 간질환 대조군과 초기 단계 HCC 간에 중첩되는 양상을 보였습니다. PIVKA-II와 결합 모델 점수는 만성 간질환 대조군, 초기 단계 HCC 및 모든 단계 HCC 전반에 걸쳐 더 명확한 구분을 보여주었습니다.

데이터 가용성:

이 연구의 결과를 뒷받침하는 데이터셋은 Figshare(https://doi.org/10.6084/m9.figshare.3048095.v1)에서 공개적으로 이용 가능합니다.

간질환 연구 흐름도; 진단, 혈장 처리, 면역 분석, CT/MRI 판독.
그림 1참가자 흐름, 코호트 배정, 시료 처리 및 진단 판정. 훈련 및 검증 코호트에서의 대상자 스크리닝, 코호트 할당, 영상 촬영 전 혈액 샘플링, 혈장 처리, AFP/PIVKA-II 측정, 조영 증강 CT/MRI 평가 및 최종 영상 기반 HCC 판정을 보여주는 흐름도. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

AFP, PIVKA-II, 임상적 지표, 그리고 이들의 조합에 대한 민감도, 특이도, AUC 값을 나타내는 ROC 곡선 및 막대 그래프.
그림 2AFP, PIVKA-II, 임상 변수 모델 및 통합 모델의 훈련 코호트 진단 성능 (A) 훈련 코호트에서 AFP, PIVKA-II, 임상 변수 모델 및 다변량 결합 모델을 비교한 수신자 작동 특성 곡선. (B) 보고된 훈련 코호트 임계값에서 각 진단 방법의 민감도 및 특이도. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

해당 작동 특성은 표 2에 요약되어 있습니다.

HCC 검출 분석; 도표; AFP, PIVKA-II, 복합 모델; 검출률, AUC 결과.
그림 3BCLC 단계별로 층화된 진단 성능. (A) 비-HCC 대조군 및 BCLC 단계별 그룹에 따른 AFP, PIVKA-II 및 결합 모델 점수의 분포. (B) BCLC 단계별 AFP, PIVKA-II 및 결합 모델의 검출률. (CBCLC 0-A HCC를 포함하여, AFP, PIVKA-II 및 결합 모델의 단계별 AUC. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

AFP 및 PIVKA-II 수치를 분석한 그래프, 스피어만 상관관계, 그리고 HCC 사례 분포도.
그림 4AFP, PIVKA-II 및 통합 모델 점수 간의 상관관계 및 상호 보완성. (A) AFP와 결합 모델 점수 간의 상관관계. (B) PIVKA-II와 복합 모델 점수 간의 상관관계. (C) AFP와 PIVKA-II 간의 상관관계. (D) AFP 상태, PIVKA-II 상태 및 통합 모델 위험 분류에 따른 HCC 사례의 교차 분류. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

HCC 모델 성능 분석을 위한 ROC, 보정 곡선, AFP 및 PIVKA-II 바 그래프.
그림 5독립 검증 코호트에서의 진단 성능에 대한 외부 검증. (A) AFP, PIVKA-II 및 통합 모델에 대한 검증 코호트 수신자 작동 특성 곡선. (B) 검증 코호트에서 결합 모델의 보정 곡선. (C모든 간세포암(HCC), 초기 간세포암 및 AFP 음성 간세포암에서 AFP, PIVKA-II 및 결합 모델의 비교 민감도와 특이도. 해당 검증 지표는 다음의 표에 요약되어 있다. 표 3. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

간질환 대 HCC 단계에서 AFP, PIVKA-II 수치 및 결합 모델 점수를 비교한 박스 플롯.
그림 6AFP, PIVKA-II 및 결합 모델 점수의 질환 하위 그룹별 분포. (A) 만성 간질환 대조군, BCLC 0–A 단계 HCC 및 모든 단계 HCC에서의 AFP 분포. (B) 만성 간 질환 대조군, BCLC 0–A HCC 및 모든 단계의 HCC 간 PIVKA-II 분포. (C) 만성 간질환 대조군, BCLC 0-A HCC 및 모든 단계의 HCC 간의 통합 모델 점수 분포. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

인자카테고리 / 요약HCC 훈련
n = 112 
비-HCC 대조군 훈련
n = 93
검증 HCC n = 58비-HCC 대조군 검증
 n = 126
P
성별, n (%)수컷76 (67.9%)59 (63.4%)39 (67.2%)76 (60.3%)0.374
여성36 (32.1%)34 (36.6%)19 (32.8%)50 (39.7%)
연령, 세평균 ± 표준편차58.9 ± 9.358.1 ± 10.459.4 ± 8.857.6 ± 9.70.281
간질환 병력, n (%)B형 간염 바이러스84 (75.0%)64 (68.8%)42 (72.4%)83 (65.9%)0.332
C형 간염 바이러스6 (5.4%)5 (5.4%)3 (5.2%)7 (5.6%)0.914
알코올성 간질환13 (11.6%)10 (10.8%)6 (10.3%)12 (9.5%)0.825
HCC 가족력, n (%)9 (8.0%)7 (7.5%)4 (6.9%)8 (6.3%)0.887
간경변증, n (%)번역할 원문 텍스트를 제공해 주시기 바랍니다. 제공해주시는 텍스트를 바탕으로 전문적인 학술 한국어로 번역하겠습니다.80 (71.4%)61 (65.6%)42 (72.4%)88 (69.8%)0.468
HCC 단계 (BCLC), n (%)0–A57 (50.9%)30 (51.7%)
B33 (29.5%)17 (29.3%)
C22 (19.6%)11 (19.0%)
Child-Pugh 등급, n (%)A85 (75.9%)77 (82.8%)43 (74.1%)101 (80.2%)0.341
B27 (24.1%)16 (17.2%)15 (25.9%)25 (19.8%)
ALT, U/L평균 ± 표준편차48.6 ± 22.147.1 ± 20.647.9 ± 22.445.2 ± 20.10.517
AST, U/L평균 ± 표준편차60.3 ± 28.558.0 ± 27.858.7 ± 29.456.2 ± 26.90.488
알부민, g/L평균 ± 표준편차39.0 ± 4.739.5 ± 4.638.7 ± 5.139.6 ± 4.50.554
총 빌리루빈, μmol/L평균 ± 표준편차20.1 ± 11.318.6 ± 10.820.4 ± 11.618.1 ± 10.90.321
혈소판 수, ×10⁹/L평균 ± 표준편차137 ± 61146 ± 59134 ± 60149 ± 570.437
프로트롬빈 시간, s평균 ± 표준편차13.7 ± 1.413.5 ± 1.313.8 ± 1.513.5 ± 1.20.411
INR (국제 표준화 비율)평균 ± 표준편차1.18 ± 0.121.16 ± 0.111.19 ± 0.131.15 ± 0.100.334
AFP, ng/mL중앙값 (사분위수 범위)57.3 (19.8–135.1)22.4 (10.4–46.0)60.2 (20.6–131.7)21.5 (9.8–48.1)0.071
PIVKA-II, mAU/mL중앙값 (사분위 범위)197.6 (83.1–438.2)86.3 (38.6–131.2)191.5 (81.4–422.5)84.1 (37.1–129.4)0.064
연장된 PT, n (%)30 (26.8%)20 (21.5%)15 (25.9%)24 (19.0%)0.372
당뇨병, n (%)19 (17.0%)14 (15.1%)10 (17.2%)19 (15.1%)0.764
고혈압, n (%)33 (29.5%)26 (28.0%)18 (31.0%)36 (28.6%)0.824
비-HCC 대조군 중 대조군 유형, n (%)건강한 대조군30 (32.3%)0 (0.0%)
만성 간질환 대조군63 (67.7%)126 (100.0%)
참고: HCC, 간세포암; BCLC, 바르셀로나 클리닉 간암 분류; ALT, 알라닌 아미노전달효소; AST, 아스파르테이트 아미노전달효소; INR, 국제 표준화 비율; AFP, 알파-태아단백; PIVKA-II, 비타민 K 결핍 유도 단백질-II; PT, 프로트롬빈 시간; IQR, 사분위수 범위. P 값은 해당되는 경우 보고된 코호트/상태 층별 기초선 비교에 대해 표시되었습니다. HCC 단계는 HCC 사례에 대해서만 보고되었습니다. 대조군 유형은 비-HCC 대조군에 대해서만 보고되었습니다.

표 1: 훈련 및 검증 코호트의 기초 특성. 인구통계학적 특성, 간질환 배경, HCC 단계, Child-Pugh 등급, 일반 실험실 지표, AFP 및 PIVKA-II를 코호트 및 HCC 상태별로 제시하였다.

방법민감도 (95% CI)특이도 (95% CI)AUC (95% CI)임계값
알파태아단백(AFP)62.50 (53.41–71.06)78.49 (69.07–86.04)0.78 (0.72–0.84)20.0 ng/mL
PIVKA-II78.57 (70.29–85.37)82.80 (73.95–89.61)0.85 (0.80–0.90)45.0 mAU/mL
임상 변수 모델69.64 (60.28–77.87)80.65 (71.13–88.04)0.81 (0.75–0.87)예측 확률 = 0.40
결합 모델88.39 (81.35–93.36)89.25 (81.26–94.65)0.93 (0.89–0.96)예측 확률 = 0.50
참고: AFP는 확립된 임상 컷오프 값인 20.0 ng/mL에서 평가되었습니다. PIVKA-II의 임계값인 45.0 mAU/mL는 1차 훈련 비교에 사용된 훈련 코호트의 Youden 컷오프였습니다. 임상 변수 모델 및 통합 모델은 훈련 코호트에서 도출된 예측 확률 임계값을 사용하여 평가되었습니다.

표 2: 훈련 코호트의 진단 성능. 훈련 코호트에 대한 AFP, PIVKA-II, 임상 변수 모델 및 다변량 결합 모델의 AUC, 민감도, 특이도 및 보고된 임계값이 제시되어 있다.

하위 그룹항목AFPPIVKA-II결합 모델
전체 HCCAUC0.750.780.89
전체 HCC1차 검증 임계값18.5 ng/mL38.0 mAU/mL예측 확률 = 0.56
전체 HCC민감도, % (95% CI)62.1 (48.7–74.2)72.4 (59.1–83.5)84.5 (72.6–92.6)
전체 HCC특이도, % (95% CI)8.9 (82.0–93.4)91.3 (85.1–95.3)90.5 (84.2–94.8)
전체 HCCPPV, %63.872.778.8
전체 HCCNPV, %8.19194.1
초기 단계 HCC탐색적 하위 그룹 임계값15.2 ng/mL3.5 mAU/mL예측 확률 = 0.51
초기 단계 HCC민감도, % (95% CI)45.5 (25.1–67.3)59.1 (38.5–7.7)72.7 (52.0–87.6)
초기 단계 HCC특이도, %8.991.390.5
초기 단계 HCCPPV, %4054.56.7
초기 단계 HCCNPV, %90.187.592.3
AFP 음성 HCC탐색적 하위 그룹 임계값7.5 ng/mL31.2 mAU/mL예측 확률 = 0.48
AFP 음성 HCC민감도, % (95% CI)23.1 (9.7–42.6)61.5 (40.6–79.8)73.1 (52.2–8.4)
AFP 음성 HCC특이도, %8.991.390.5
AFP 음성 HCCPPV, %25264.5
AFP 음성 HCCNPV, %90.28.392.7
바이러스성 HCC탐색적 하위 그룹 임계값19.3 ng/mL40.7 mAU/mL예측 확률 = 0.59
바이러스성 HCC민감도, % (95% CI)64.7 (46.9–79.9)73.5 (56.4–86.4)85.3 (69.9–94.7)
바이러스성 HCC특이도, %8.190.591.3
바이러스성 HCCPPV, %67.37381.3
바이러스성 HCCNPV, %87.590.894.7
비바이러스성 HCC탐색적 하위 그룹 임계값20.1 ng/mL34.5 mAU/mL예측 확률 = 0.53
비바이러스성 HCC민감도, % (95% CI)58.3 (36.6–7.9)70.8 (48.9–87.4)83.3 (62.6–95.3)
비바이러스성 HCC특이도, %89.292.189.7
비바이러스성 HCCPPV, %59.269.775
비바이러스성 HCCNPV, %899293.8
결합 모델 보정절편−0.08
결합 모델 보정기울기0.91
결합 모델 보정브라이어 점수(Brier score)0.18
결합 모델 보정Hosmer–Lemeshow P 값0.64
참고: 전체 HCC 행은 1차 검증 분석 결과를 나타냅니다. 초기 단계 HCC, AFP 음성 HCC, 바이러스성 HCC 및 비바이러스성 HCC 행은 탐색적 하위 그룹 성능을 나타냅니다. 하위 그룹 임계값은 각 하위 그룹 내의 겉보기 작동 지점을 설명하기 위해 보고되었으며, 모델 재적합 또는 재보정에 사용되지 않았습니다. AFP 음성 HCC는 AFP <20.0 ng/mL로 정의되었습니다. PPV, 양성 예측도; NPV, 음성 예측도.

표 3: 검증 코호트의 진단 성능 및 하위 그룹 분석. 모든 HCC, 초기 단계 HCC, AFP 음성 HCC, 바이러스성 HCC 및 비바이러스성 HCC에 대한 AFP, PIVKA-II 및 결합 모델의 AUC, 보고된 임계값, 민감도, 특이도, 양성 예측도 및 음성 예측도가 제시되어 있습니다. 결합 모델에 대한 보정 지표 또한 포함되어 있습니다.

요인 / 지표단변량 P 값계수 β보정 오즈비(Adjusted OR) / 검증 지표95% 신뢰구간P
절편−4.862
연령0.1120.0181.020.99–1.050.186
성별, 남성0.0870.3311.410.83–2.370.204
AFP, 자연로그 변환됨0.0040.2471.281.05–1.620.021
PIVKA-II, 자연로그 변환됨<0.0010.7122.051.48–2.89<0.001
알부민, g/L0.008−0.0620.940.89–0.990.032
INR (국제 표준화 비율)0.0120.5541.741.12–2.780.015
혈소판 수, ×109/L0.052−0.0040.990.98–1.000.044
겉보기 훈련 AUC0.930.89–0.96
평균 낙관주의0.018
낙관주의 보정 AUC0.910.87–0.95
겉보기 검정 곡선 기울기1
낙관주의 보정 검정 곡선 기울기0.94
훈련 브라이어 점수0.104
Hosmer–Lemeshow P 값0.72
참고: 최종 선형 예측자는 η = −4.862 + 0.247 × ln(AFP) + 0.712 × ln(PIVKA-II) + 0.018 × 연령 + 0.31 × 성별 − 0.062 × 알부민 + 0.54 × INR − 0.04 × 혈소판 수였다. 예측 확률은 p(HCC) = 1 / [1 + exp(−η)]로 계산되었다. AFP는 ng/mL, PIVKA-II는 mAU/mL, 연령은 세(year), 성별은 여성 = 0 및 남성 = 1로 코딩되었으며, 알부민은 g/L, INR은 단위 없는 값, 혈소판 수는 ×10⁹/L로 측정되었다.

표 4: 다변량 로지스틱 회귀 분석 및 부트스트랩 내부 검증. 훈련 코호트 모델에서 평가된 변수들에 대한 단변량 P 값, 보정된 모델 계수, 보정된 오즈비, 95% 신뢰 구간 및 다변량 P 값이 표시되어 있습니다. 부트스트랩 낙관도(optimism), 낙관도가 보정된 AUC, 낙관도가 보정된 보정 기울기(calibration slope), Brier 점수 및 Hosmer–Lemeshow 검정 결과가 보고되었습니다.

표 5: Youden 최적화 컷오프를 이용한 진단 성능. Youden 지수 컷오프를 사용한 AFP, PIVKA-II 및 통합 모델의 민감도, 특이도, 양성 예측도, 음성 예측도, 정확도 및 AUC를 나타낸다.

방법설정된 컷오프 값민감도, % (95% CI)특이도, % (95% CI)양성 예측도(PPV), % (95% 신뢰구간(CI))NPV, % (95% CI)정확도, % (95% CI)AUC (95% CI)
알파-태아단백(AFP)20.0 ng/mL65.2 (57.0–72.7)88.5 (83.4–92.3)70.1 (61.8–77.4)86.0 (80.7–90.3)80.3 (75.0–84.8)0.77 (0.72–0.82)
PIVKA-II40.0 mAU/mL73.0 (65.2–79.8)93.1 (88.8–96.0)81.8 (74.2–87.7)89.0 (83.9–92.8)85.6 (80.9–89.5)0.82 (0.78–0.86)
결합 모델예측 확률 = 0.6083.5 (76.6–89.0)92.0 (87.4–95.3)84.7 (77.9–90.0)91.2 (86.3–94.6)88.9 (84.6–92.2)0.89 (0.86–0.93)
참고: 확립된 임상 컷오프 수치는 AFP 20.0 ng/mL 및 PIVKA-II 40.0 mAU/mL였다. 결합 모델은 이 임상 컷오프 비교에 사용된 대응하는 사전 정의된 확률 임계값에서 보고되었다.

표 6: 기설정된 임상 컷오프 값을 이용한 진단 성능. 기설정된 AFP 컷오프 값 20.0 ng/mL 및 기설정된 PIVKA-II 컷오프 값 40.0 mAU/mL를 사용하여 민감도, 특이도, 양성 예측도, 음성 예측도, 정확도 및 AUC를 나타내었다. 결합 모델은 해당 컷오프 비교에 사용된 확률 임계값으로 보고되었다.

방법90% 특이도에 가장 근접한 컷오프 값민감도, % (95% CI)특이도, % (95% CI)양성 예측도(PPV), % (95% 신뢰구간(CI))NPV, % (95% CI)
알파태아단백(AFP)19.0 ng/mL67.9 (59.1–75.7)89.1 (84.2–92.8)71.3 (62.4–79.0)87.3 (82.1–91.2)
PIVKA-II37.5 mAU/mL75.4 (67.3–82.2)92.0 (87.7–95.1)79.8 (71.6–86.3)89.7 (84.7–93.3)
결합 모델예측 확률 = 0.5786.2 (79.3–91.3)90.6 (85.8–94.0)82.7 (74.8–88.7)92.4 (87.9–95.4)
참고: 이 컷오프 값들은 컷오프 감사 분석에서 특이도를 90%에 가장 가깝게 달성하기 위해 선택되었습니다. PIVKA-II의 경우, 37.5 mAU/mL는 이번 감사에서의 Youden 지수 및 90%에 근접한 특이도 컷오프이며, 38.0 mAU/mL는 표 3에 보고된 1차 검증 임계값이고, 40.0 mAU/mL는 확립된 임상 컷오프이며, 45.0 mAU/mL는 표 2에 사용된 훈련 코호트의 Youden 컷오프입니다.

표 7: 90% 특이도에 가장 가까운 컷오프에서의 진단 성능. 특이도가 90%에 가장 가깝게 도달하도록 선택된 임계값에서의 AFP, PIVKA-II 및 결합 모델의 민감도, 특이도, 양성 예측도 및 음성 예측도를 나타냅니다.

토론

본 연구는 초기 단계 및 AFP 음성 질환에 주목하여 PIVKA-II, AFP 및 일반적인 임상 변수를 이용한 HCC의 통합 진단 전략을 평가하였습니다14. 훈련 및 검증 코호트 전반에 걸쳐, 결합 모델이 단일 마커 검사보다 우수한 성능을 보였습니다. 훈련 코호트에서 결합 모델은 AUC 0.93을 달성했으며, 이는 AFP의 0.78 및 PIVKA-II의 0.85와 대비됩니다. 독립 검증 코호트에서 이 모델은 AUC 0.89, 민감도 84.5%, 특이도 90.5%로 강력한 판별력을 유지했습니다. 이러한 결과는 단일 혈청 임계값에 의존하여 진단 결정을 내리기보다, 상호 보완적인 바이오마커 및 임상 신호를 함께 해석하는 모델 기반 접근 방식의 타당성을 뒷받침합니다.

검증 결과는 특히 AFP의 신뢰도가 가장 낮은 경우에 PIVKA-II가 제공하는 추가적인 가치를 명확히 보여줍니다. 모든 검증 HCC 사례에서 AFP의 민감도는 62.1%였으며, AFP 음성 HCC에서는 23.1%로 떨어졌습니다. PIVKA-II는 전반적으로 더 높은 민감도를 보였으며, AFP 음성 질환에서도 61.5%의 민감도를 유지했습니다. 결합 모델은 높은 특이도를 유지하면서 AFP 음성 HCC에서는 민감도를 73.1%로, 초기 단계 HCC에서는 72.7%로 더욱 향상시켰습니다. 이러한 양상은 PIVKA-II가 특히 낮은 AFP 수치의 종양 및 초기 종양 부담 상태에서 AFP와는 부분적으로 구별되는 진단 정보를 포착한다는 이전의 증거들과 일치합니다15,16,17. 상관관계 및 교차 분류 분석 또한 이러한 해석을 뒷받침하며, AFP와 PIVKA-II가 서로 대체 가능한 마커가 아니며 통합 점수가 단일 마커 분류에서 누락된 추가 사례들을 찾아냈음을 보여주었습니다.

다변량 분석 결과는 결합 모델의 이득이 단순히 AFP와 PIVKA-II를 함께 추가한 결과만이 아님을 시사합니다. 임상 변수들은 연령, 성별, 간 예비능, 응고 상태 및 혈소판 수와 관련된 추가적인 맥락을 제공했습니다. 이러한 설계는 인구통계학적 변수와 실험실 변수를 결합하여 이질적인 간 질환 인구 집단 전체에서 진단 성능을 향상시키는 GALAD, GAAD 및 관련 바이오마커 기반 점수를 포함하여 기성 다변량 HCC 위험 모델과 일치합니다18,19,20. 보정 모델에서 로그 변환된 PIVKA-II는 가장 강력한 독립적 예측 인자로 남았고, 로그 변환된 AFP는 독립적인 연관성을 유지했으며, INR은 추가적인 진단 신호를 제공했습니다. 아미노전이효소(Aminotransferases)는 보정 후 정보 가치가 낮아졌는데, 이는 종양 관련 및 응고 관련 마커가 고려되었을 때 비특이적인 간 염증이 변별력의 주요 동인이 아니었음을 시사합니다.

컷오프 분석은 검토 과정에서 제기된 중요한 사항을 다룹니다. 서로 다른 PIVKA-II 임계값들을 상충되는 기본 컷오프로 해석해서는 안 됩니다. 45.0 mAU/mL 값은 훈련 코호트의 ROC 비교에 사용되었고, 40.0 mAU/mL는 기설정된 임상 임계값을 나타내며, 37.5–38.0 mAU/mL 범위는 Youden 최적화 또는 고정 특이도 분석에 기반한 대안적 임계값 전략을 반영한 것입니다. 이러한 임계값들은 서로 다른 임상적 질문에 답합니다. 민감도 중심의 컷오프는 고위험군 감시에 유용할 수 있는 반면, 특이도 중심의 컷오프는 위양성 감소가 우선순위일 때 선호될 수 있습니다. 이러한 전략 전반에 걸쳐, 결합 모델은 AFP나 PIVKA-II 단독 사용보다 더 안정적인 상태를 유지했으며, 이는 영상 기반 진단의 대체제가 아닌 위험 계층화 도구로서의 활용 가능성을 뒷받침합니다21.

몇 가지 한계점이 남아 있다. 훈련 코호트는 단일 센터에서 구성되었으며, 전향적 검증 코호트의 규모는 중간 정도였다. 특히 NAFLD 관련, 알코올 관련 및 HCV 관련 HCC를 포함하여 서로 다른 병인학적 배경을 가진 인구 집단에서의 다기관 검증이 여전히 필요하다. HCC 상태는 조영 증강 CT 및/또는 MRI를 사용하여 판정하였는데, 이는 일상적인 진단 관행을 반영하지만 매우 초기 단계이거나 비전형적인 병변은 과소평가될 가능성이 있다. 일부 하위 그룹 분석, 특히 조기 단계 및 AFP 음성 HCC의 경우 전체 코호트보다 포함된 사례 수가 적었다. 보정 및 부트스트랩 분석을 통해 모델의 안정성을 평가하였으나, 이는 모델 기반의 감시가 의뢰 효율성, 조기 발견율 및 최종적인 임상 결과를 개선하는지 테스트하는 전향적 구현 연구를 대체할 수는 없다22.

결론적으로, PIVKA-II, AFP 및 일상적인 임상 변수를 통합함으로써 단일 바이오마커 전략에 비해 HCC 검출 능력이 향상되었으며, 학습 코호트와 독립 검증 코호트 모두에서 일관된 성능을 보였습니다. 이 모델은 높은 특이도를 유지하면서 초기 단계 및 AFP 음성 HCC에서 임상적으로 유용한 민감도를 유지하여, AFP 기반 감시의 두 가지 일반적인 사각지대를 해결했습니다. 입력 데이터들을 일상적으로 사용할 수 있기 때문에, 이 접근법은 고위험 간질환 인구 집단을 대상으로 한 추가 테스트에 실용적입니다. 향후 다기관 연구에서는 이 모델을 초음파 및 AFP 조합과 직접 비교하고, 사전 정의된 작동 임계값을 평가하며, 새로운 바이오마커나 영상 유래 특성과의 통합이 초기 HCC 검출을 더욱 개선하는지 평가해야 합니다23,24.

공개 사항

저자들은 경쟁 관계에 있는 재정적 또는 비재정적 이해관계가 없음을 밝힙니다. 상업적 후원자, 시약 제조사, 소프트웨어 제공업체 또는 진단 플랫폼 회사는 연구 설계, 데이터 수집, 통계 분석, 결과 해석, 원고 작성 또는 논문 제출 결정 과정에서 어떠한 역할도 수행하지 않았습니다.

감사의 글

저자들은 본 연구의 혈액 수집, 임상 조정, 영상 검토 및 데이터 검증을 지원해주신 연구 참여자분들과 임상 의료진분들께 감사드립니다.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
1.5 mL nuclease-free microcentrifuge tubeEppendorf30123328혈장 분주 및 보관
AFP 교정물Roche DiagnosticsAFP CalSet II, 09227261190AFP 교정
AFP 품질관리 물질Roche DiagnosticsPreciControl Tumor Marker, 11776452160AFP 품질관리
AFP 품질관리 물질Roche DiagnosticsPreciControl Universal, 11731416160AFP 품질관리
AFP 시약 키트Roche DiagnosticsElecsys AFP, 09015124190AFP 측정
자동 전기화학발광 면역분석 분석기Roche Diagnosticscobas e 801AFP 및 PIVKA-II 측정
교정 패키지R packagerms 6.7–1교정 분석
결정 곡선 분석 패키지R packagermda 1.6결정 곡선 분석
Hosmer–Lemeshow 검정 패키지R packageResourceSelection 0.3–6Hosmer–Lemeshow 검정
K2-EDTA 혈액 채취관, 10 mLBD367525말초 정맥혈 채취
다중 대체 패키지R packagemice 3.16.0다중 대체
PIVKA-II 시약 키트Roche DiagnosticsElecsys PIVKA-II, 08333629190/08333629500PIVKA-II 측정
냉장 원심분리기EppendorfCentrifuge 5425 R혈장 분리
ROC 분석 패키지R packagepROC 1.18.5ROC 분석 및 DeLong 검정
통계 소프트웨어R FoundationR 4.3.2통계 분석
통계 소프트웨어 인터페이스Posit SoftwareRStudio 2023.12.1통계 분석

참고문헌

  1. Oh JH, Jun DW. The latest global burden of liver cancer: A past and present threat. Clin Mol Hepatol. 2023;29(2):355-357.
  2. Heimbach JK et al. AASLD guidelines for the treatment of hepatocellular carcinoma. Hepatology. 2018;67(1):358-380.
  3. Singal AG et al. Meta-analysis: Surveillance with ultrasound for early-stage hepatocellular carcinoma in patients with cirrhosis. Aliment Pharmacol Ther. 2009;30(1):37-47.
  4. Tzartzeva K et al. Surveillance imaging and alpha fetoprotein for early detection of hepatocellular carcinoma in patients with cirrhosis: A meta-analysis. Gastroenterology. 2018;154(6):1706-1718.e1.
  5. Parikh ND et al. Biomarkers for the early detection of hepatocellular carcinoma. Cancer Epidemiol Biomarkers Prev. 2020;29(12):2495-2503.
  6. Gopal P et al. Factors that affect accuracy of alpha-fetoprotein test in detection of hepatocellular carcinoma in patients with cirrhosis. Clin Gastroenterol Hepatol. 2014;12(5):870-877.
  7. Hanif H et al. Update on the applications and limitations of alpha-fetoprotein for hepatocellular carcinoma. World J Gastroenterol. 2022;28(2):216-229.
  8. Norman JS, Mehta N. The role of AFP-L3 and DCP biomarkers in the diagnosis and management of hepatocellular carcinoma. Curr Hepatol Rep. 2025;24(1):16.
  9. Suttichaimongkol T et al. PIVKA-II or AFP has better diagnostic properties for hepatocellular carcinoma diagnosis in high-risk patients. J Circ Biomark. 2023;12:12-16.
  10. Piratvisuth T et al. Development and clinical validation of a novel algorithmic score (GAAD) for detecting HCC in prospective cohort studies. Hepatol Commun. 2023;7(11):e0317.
  11. Jarrah M et al. Performance of GALAD, GAAD, and ASAP for early HCC detection in chronic liver disease: A systematic review and meta-analysis. Liver Cancer. 2026;15(2):285-299.
  12. Zhou JM, Wang T, Zhang KH. AFP-L3 for the diagnosis of early hepatocellular carcinoma: A meta-analysis. Medicine (Baltimore). 2021;100(43):e27673.
  13. Singal AG et al. AASLD practice guidance on prevention, diagnosis, and treatment of hepatocellular carcinoma. Hepatology. 2023;78(6):1922-1965.
  14. Best J et al. The GALAD scoring algorithm based on AFP, AFP-L3, and DCP significantly improves detection of BCLC early-stage hepatocellular carcinoma. Z Gastroenterol. 2016;54(12):1296-1305.
  15. Poté N et al. Performance of PIVKA-II for early hepatocellular carcinoma diagnosis and prediction of microvascular invasion. J Hepatol. 2015;62(4):848-854.
  16. Xu F et al. The diagnostic value of serum PIVKA-II alone or in combination with AFP in Chinese hepatocellular carcinoma patients. Dis Markers. 2021;2021:8868370.
  17. Liu M et al. Validation of the GALAD model and establishment of GAAP model for diagnosis of hepatocellular carcinoma in Chinese patients. J Hepatocell Carcinoma. 2020;7:219-232.
  18. Aralica M et al. GALAD, or des-gamma-carboxy prothrombin compared with alpha-foetoprotein for the diagnosis of hepatocellular carcinoma in people with chronic liver disease. Cochrane Database Syst Rev. 2024;12(12):CD015826.
  19. Zhang S et al. Evaluating the combined diagnostic power of alpha-fetoprotein and protein induced by vitamin K absence or antagonist-II for hepatocellular carcinoma. J Gastrointest Oncol. 2025;16(3):1157-1175.
  20. Pham TTT, Ho DT, Nguyen TB, Phan HT. Clinical performance of GAAD score, alpha-fetoprotein, and PIVKA-II in diagnosing hepatocellular carcinoma in the Vietnamese cohort. Discov Oncol. 2025;16:1813.
  21. Youden WJ. Index for rating diagnostic tests. Cancer. 1950;3(1):32-35.
  22. Tarao K et al. Real impact of tumor marker AFP and PIVKA-II in detecting very small hepatocellular carcinoma (≤2 cm, Barcelona stage 0): Assessment with a large number of cases. World J Hepatol. 2020;12(11):1046-1054.
  23. Kim DY et al. Utility of combining PIVKA-II and AFP in the surveillance and monitoring of hepatocellular carcinoma in the Asia-Pacific region. Clin Mol Hepatol. 2023;29(2):277-292.
  24. Kao SYZ et al. Cost-effectiveness of a precision hepatocellular carcinoma surveillance strategy in patients with cirrhosis. EClinicalMedicine. 2024;75:102755.

재인쇄 및 허가

태그

진단 모델로지스틱 회귀 분석혈액 바이오마커간 질환