Artículo de investigación

Integración de la protrombina anormal (PIVKA-II), la alfa-fetoproteína y variables clínicas rutinarias para la detección temprana del carcinoma hepatocelular

37 visualizaciones

DOI:

10.3791/70558

25 de agosto de 2026

En este artículo

Resumen

Este protocolo describe un flujo de trabajo reproducible para integrar PIVKA-II, AFP y variables clínicas de rutina en un modelo diagnóstico de regresión logística para el carcinoma hepatocelular, con validación en enfermedades en estadio temprano y negativas para AFP.

Resumen

La detección temprana del carcinoma hepatocelular (CHC) sigue estando limitada por la sensibilidad incompleta de la alfafetoproteína (AFP), especialmente en tumores en estadio inicial y en aquellos negativos para AFP. En este estudio se evaluó si la protrombina anormal/proteína inducida por la ausencia de vitamina K-II (PIVKA-II), la AFP y variables clínicas de rutina podían integrarse en un modelo diagnóstico reproducible para el CHC. Se utilizó una cohorte de entrenamiento retrospectiva de 205 participantes, que incluyó 112 casos de CHC confirmados mediante imágenes y 93 controles sin CHC, para el desarrollo del modelo. Una cohorte independiente de validación prospectiva de 184 participantes, que incluyó 58 casos de CHC y 126 controles sin CHC, se empleó para pruebas fuera de la muestra sin reajustar el modelo. Se utilizaron muestras sanguíneas previas a la obtención de imágenes para la medición de AFP y PIVKA-II, y se extrajeron variables clínicas del mismo período diagnóstico. El modelo final de regresión logística multivariable combinó ln(AFP), ln(PIVKA-II), edad, sexo, albúmina, ratio internacional normalizado y recuento de plaquetas. El modelo combinado alcanzó un AUC de 0,93 en la cohorte de entrenamiento y de 0,89 en la cohorte de validación. En la validación, la sensibilidad fue del 84,5 % y la especificidad del 90,5 %. La sensibilidad se mantuvo en el 72,7 % en CHC en estadio temprano y en el 73,1 % en CHC negativo para AFP, superando a la AFP sola en ambos subgrupos. La calibración y la validación mediante bootstrap respaldaron una estabilidad aceptable del modelo. Estos resultados muestran cómo la PIVKA-II, la AFP y las variables clínicas habitualmente disponibles pueden combinarse en una herramienta diagnóstica práctica de triaje para poblaciones con alto riesgo de enfermedad hepática.

Introducción

El carcinoma hepatocelular (CHC) es una causa principal de mortalidad relacionada con el cáncer y generalmente se desarrolla en pacientes con enfermedad hepática crónica, incluyendo infección por el virus de la hepatitis B, infección por el virus de la hepatitis C, enfermedad hepática relacionada con el alcohol y enfermedad hepática grasa asociada a disfunción metabólica1. La detección temprana es clínicamente importante porque el tratamiento curativo es más eficaz cuando los tumores se identifican antes de la invasión vascular, la diseminación extrahepática o el deterioro marcado de la reserva hepática. Las estrategias actuales de vigilancia se basan generalmente en ecografía hepática, con o sin alfafetoproteína sérica (AFP)2. Sin embargo, en la práctica habitual, el desempeño de la vigilancia se ve afectado por la dependencia del operador, el tamaño pequeño del tumor, los nódulos cirróticos heterogéneos, las dificultades de imagen relacionadas con la obesidad y los tumores que producen poca o ninguna AFP3,4.

El AFP sigue siendo ampliamente utilizado porque es económico, accesible y familiar para los clínicos. Su valor diagnóstico se ve limitado por una sensibilidad incompleta y una especificidad imperfecta. En el umbral convencional de 20 ng/mL, el AFP puede pasar por alto una proporción considerable de casos de HCC en estadio temprano y de HCC negativo para AFP. Umbrales más bajos podrían mejorar la sensibilidad, pero aumentarían los resultados falsos positivos en pacientes con hepatitis activa, cirrosis u otras afecciones inflamatorias hepáticas5,6. Estas limitaciones hacen que la interpretación de un solo marcador sea insuficiente para la triage diagnóstica en poblaciones con alto riesgo de enfermedad hepática.

La protrombina anormal, también conocida como proteína inducida por la ausencia de vitamina K-II (PIVKA-II) o protrombina des-γ-carboxilada, se libera cuando los hepatocitos malignos producen protrombina incompletamente carboxilada. PIVKA-II refleja la biología tumoral relacionada con la coagulación, más que la secreción de AFP, y puede seguir siendo informativo cuando los niveles de AFP son bajos7. Estudios previos y metaanálisis han demostrado que PIVKA-II mejora la detección del carcinoma hepatocelular (HCC), particularmente cuando se combina con AFP, y podría aportar valor en enfermedades en estadio temprano o negativas para AFP8,9. Sin embargo, las estrategias basadas únicamente en marcadores no consideran completamente el contexto del huésped, la reserva hepática, el recuento de plaquetas, el estado de coagulación o la enfermedad hepática subyacente.

Los modelos diagnósticos compuestos ofrecen una forma práctica de interpretar conjuntamente los resultados de marcadores tumorales con el contexto clínico. GALAD, GAAD y modelos relacionados han demostrado que se pueden combinar variables demográficas y biomarcadores para mejorar la detección del HCC en diferentes etiologías y poblaciones10,11. Su desempeño respalda el uso de la estimación de riesgo multivariable en lugar de umbrales aislados de biomarcadores. Al mismo tiempo, algunos modelos incluyen ensayos que no están disponibles en todos los laboratorios, y el comportamiento de los puntos de corte puede variar según las regiones, perfiles etiológicos, estadios de la enfermedad y el uso clínico previsto12. Un modelo basado en biomarcadores ampliamente disponibles y variables de laboratorio de rutina podría ser más fácil de implementar en flujos de trabajo diagnósticos habituales. A diferencia de modelos publicados previamente que podrían depender de biomarcadores especializados o estrategias de corte específicas de la población, el presente estudio evaluó un modelo diagnóstico multivariable basado en biomarcadores ampliamente disponibles y variables clínicas de rutina, y validó su desempeño en una cohorte prospectiva independiente.

PIVKA-II es adecuado para este marco porque complementa al AFP y puede medirse en plataformas automatizadas de inmunoensayo ya utilizadas en laboratorios clínicos. Variables de rutina como la edad, el sexo, la albúmina, la bilirrubina, el recuento de plaquetas, la relación internacional normalizada y el antecedente de enfermedad hepática están disponibles en la misma consulta clínica y podrían reflejar información relacionada con la reserva hepática o la coagulación relevante para el riesgo de CHC13. Combinar estas variables con el AFP y el PIVKA-II podría mejorar la capacidad de discriminación y evitar la dependencia de un único punto de corte.

Por lo tanto, se evaluaron PIVKA-II, AFP y variables clínicas de rutina mediante un diseño diagnóstico de doble cohorte. Se desarrolló un modelo de regresión logística multivariable en una cohorte de entrenamiento retrospectiva y se probó en una cohorte de validación prospectiva e independiente sin reajuste. El rendimiento diagnóstico se comparó con el de AFP, PIVKA-II y las variables clínicas por separado, prestando atención específica predefinida al carcinoma hepatocelular en estadio temprano, al carcinoma hepatocelular negativo para AFP, a la interpretación de los puntos de corte, a la calibración y a la validación interna mediante bootstrap.

Protocolo

Este estudio fue revisado y aprobado por el Comité de Ética del Hospital Popular Afiliado de Hangzhou, Escuela de Medicina de la Universidad Westlake. El número de aprobación fue IIT-20230528-0108-01. Se obtuvo el consentimiento informado por escrito de los participantes inscritos prospectivamente antes de la recolección de sangre. Para los registros clínicos incluidos de forma retrospectiva y las muestras residuales archivadas recolectadas durante la atención rutinaria, el comité de ética eximió el consentimiento informado porque se utilizaron datos desidentificados y no se realizó ninguna intervención adicional.

Reproducibilidad, control del sesgo e integridad de los datos

Los criterios de elegibilidad, los puntos temporales de muestreo sanguíneo, las reglas de adjudicación de imágenes, las definiciones de subgrupos, los predictores candidatos, las definiciones de puntos de corte, las reglas para datos faltantes y los procedimientos de validación se especificaron previamente antes del análisis estadístico. Las muestras de sangre se recolectaron antes de la confirmación mediante imágenes con contraste y antes de cualquier tratamiento antitumoral. Las pruebas de laboratorio utilizaron identificadores de estudio anónimos, y las muestras de los cohortes de entrenamiento y validación se analizaron en orden aleatorio. El personal de laboratorio permaneció enmascarado respecto al diagnóstico final, la asignación al cohorte, la etapa según la Clínica de Barcelona para el Cáncer de Hígado (BCLC) y el estado de negatividad para AFP. El diagnóstico y la estadificación por imágenes se realizaron de forma independiente respecto al análisis de laboratorio. Dos investigadores revisaron la entrada de datos, la conversión de unidades, la asignación al cohorte, el codificado de exclusiones, el codificado de valores faltantes y los conjuntos de datos estadísticos antes del ajuste del modelo. Los cohortes de entrenamiento y validación se mantuvieron separados durante todo el proceso de selección de variables, ajuste del modelo, derivación de puntos de corte y validación.

Población y diseño del estudio

Este estudio diagnóstico con dos cohortes desarrolló y validó un modelo multivariable para la detección del carcinoma hepatocelular utilizando la protrombina anormal/proteína inducida por PIVKA-II, AFP y variables clínicas habituales. La cohorte de entrenamiento, ensamblada de forma retrospectiva, incluyó participantes evaluados entre el 1 de enero de 2021 y el 31 de diciembre de 2023. Esta cohorte se utilizó para la selección de variables, ajuste del modelo, derivación de puntos de corte y validación interna mediante bootstrap. La cohorte de validación, inscrita de forma prospectiva, incluyó participantes evaluados entre el 1 de enero de 2024 y el 31 de diciembre de 2025. Esta cohorte se utilizó únicamente para pruebas con muestras externas. No se realizó ninguna nueva selección de variables, reajuste del modelo, actualización de coeficientes, reoptimización de puntos de corte ni recalibración basada en subgrupos en la cohorte de validación. El flujo de participantes, asignación a cohortes, muestreo sanguíneo, procesamiento del plasma, análisis de biomarcadores, evaluación de imágenes y flujo de trabajo estadístico se muestran en Figura 1.

Los participantes fueron reclutados de una vía de vigilancia o diagnóstico de enfermedad hepática de alto riesgo en el Hospital Popular Afiliado de Hangzhou número uno, Escuela de Medicina, Universidad Westlake. El estado de alto riesgo se definió como infección por hepatitis B crónica, infección por hepatitis C crónica, cirrosis de cualquier etiología, o enfermedad hepática grasa con fibrosis documentada según evaluación clínica, registros de laboratorio o estudios de imagen previos. Los participantes elegibles eran adultos de 18 años o más que completaron la extracción de sangre previa a la obtención de imágenes y una tomografía computarizada multiphasica con contraste (TC) y/o una resonancia magnética dinámica con contraste (RM) dentro de los 14 días posteriores a la recolección de sangre. Los criterios de exclusión incluían tratamiento previo de carcinoma hepatocelular (CHC), incluyendo resección, ablación, terapia arterial intravascular o terapia sistémica; administración de vitamina K dentro de los 7 días anteriores a la muestra; tratamiento con antagonistas de la vitamina K u otra terapia anticoagulante que pudiera afectar la interpretación de la coagulación; colangitis aguda u obstrucción biliar en el momento de la toma de muestra; embarazo; ausencia de AFP, PIVKA-II o diagnóstico final por imágenes; y calidad inaceptable de la muestra sin una repetición válida.

La población final del estudio incluyó a 389 participantes. La cohorte de entrenamiento incluyó a 205 participantes, compuesta por 112 casos de CHC confirmados mediante imágenes y 93 controles sin CHC. La cohorte de validación incluyó a 184 participantes, compuesta por 58 casos de CHC confirmados mediante imágenes y 126 controles sin CHC. En la cohorte de entrenamiento, los 93 controles sin CHC incluyeron 30 controles sanos y 63 controles con enfermedad hepática crónica. En la cohorte de validación, los 126 controles sin CHC incluyeron 0 controles sanos y 126 controles con enfermedad hepática crónica.

El estado sintomático no se asignó únicamente a partir de antecedentes de hepatitis o cirrosis compensada. Un participante se clasificó como sintomático solo cuando el registro previo a la imagenología documentaba dolor nuevo o empeorado en el cuadrante superior derecho, pérdida de peso inexplicable, distensión abdominal, ictericia, orina oscura o descompensación clínicamente documentada no explicada por otra causa confirmada. Los participantes sin estos hallazgos se clasificaron como asintomáticos o con detección mediante vigilancia.

Adjudicación diagnóstica y estadificación

El estado final de CHC se determinó mediante tomografía computarizada multiphasica con contraste y/o resonancia magnética dinámica con contraste realizadas en la atención habitual. Se requería que la imagen incluyera al menos una fase arterial y una fase venosa portal; los hallazgos de la fase de retardo se incorporaron cuando estaban disponibles. Una lesión se clasificó como CHC cuando, en un hígado de riesgo, la imagen mostraba hiperenhancement en la fase arterial con eliminación en la fase venosa portal y/o fase de retardo, con o sin cápsula realzada. Los participantes sin características por imágenes compatibles con CHC y sin otro diagnóstico maligno se clasificaron como no CHC.

La información de imágenes fue extraída mediante un formulario preespecificado que registraba la modalidad de imagen, las fases obtenidas, la hipercaptación en la fase arterial, el lavado, la apariencia de la cápsula, el número de lesiones, el diámetro máximo de la lesión, la invasión macrovascular y la diseminación extrahígada. Dos lectores capacitados extrajeron de forma independiente las características de las imágenes a partir de los informes radiológicos finales. Las discrepancias se resolvieron por consenso utilizando los mismos criterios predefinidos. Si estaban disponibles tanto la TC como la RM, se utilizó la modalidad con la caracterización multiphasica más completa. Si ambas modalidades eran completas, se utilizó la modalidad documentada como base para la decisión clínica final.

La etapa BCLC se asignó después de que se hubiera finalizado el estado de HCC. Se definió HCC en estadio temprano como etapa BCLC 0-A. Se definió HCC negativo para AFP como AFP <20 ng/mL en la extracción de sangre previa a la obtención de imágenes. Estas etiquetas de subgrupo se utilizaron para la evaluación del desempeño por subgrupos, no para el entrenamiento del modelo ni para la elegibilidad de los participantes.

Recolección de muestras y procesamiento del plasma

Se recogió sangre venosa periférica por la mañana tras un ayuno nocturno de al menos 8 h, antes de la confirmación mediante tomografía computarizada o resonancia magnética con contraste y antes de iniciar la terapia antitumoral. Se extrajeron un total de 10 mL de sangre venosa en tubos para recolección de sangre con anticoagulante K2-EDTA. Los tubos se invirtieron 8–10 veces inmediatamente después de la recolección y se transportaron al laboratorio a 4 °C. El intervalo entre la punción venosa y la centrifugación se mantuvo dentro de las 2 h y se registró en el registro de muestras.

El plasma se separó mediante centrifugación a 1.600 × g durante 10 min a 4 °C utilizando una centrifugadora refrigerada. El sobrenadante de plasma se transfirió a tubos microcentrífugos libres de nucleasas de 1,5 mL y se fraccionó en porciones de 0,5–1,0 mL. Los alícuotas se almacenaron a -80 °C hasta su análisis. Antes de la medición del biomarcador, un alícuota se descongeló una vez a temperatura ambiente, 20–25 °C, durante 20–30 min, se mezcló suavemente mediante inversión y se analizó dentro de las 2 h posteriores a la descongelación completa. Se rechazaron las muestras con coagulación visible, hemólisis moderada a severa o marcada lipemia, de acuerdo con los criterios predefinidos de aceptación en el laboratorio. Para la cohorte de validación prospectiva, se realizó una nueva extracción de sangre antes de la confirmación mediante imágenes, cuando era clínicamente factible.

Medición de AFP y PIVKA-II

Se midieron AFP y PIVKA-II mediante inmunoensayos electroquimioluminiscentes en un analizador inmunoanalítico automatizado. La AFP se registró en ng/mL y el PIVKA-II en mAU/mL. Los resultados se exportaron directamente desde el sistema de información de laboratorio.

Cada lote analítico incluyó calibradores específicos del ensayo y al menos dos niveles internos de control de calidad. Para la aceptación del lote, se requería que todos los resultados del control de calidad cayeran dentro del rango de control predeterminado por el laboratorio. Los objetivos de precisión analítica eran un coeficiente de variación dentro del mismo ensayo ≤10 % y un coeficiente de variación entre ensayos ≤15 % para AFP y PIVKA-II. Si el control de calidad fallaba o se detectaba una deriva del lote, este se rechazaba, el analizador se recalibraba y el lote se repetía si quedaba suficiente volumen de muestra. Para un resultado individual implausible o fuera de rango, se realizaban dos mediciones repetidas a partir del mismo alícuota descongelado cuando era posible, y se utilizaba la media de los dos valores repetidos aceptados. Si la repetición no era exitosa o el volumen de muestra era insuficiente, el resultado se marcaba como inválido y se manejaba según la regla para datos faltantes.

Extracción rutinaria de variables clínicas

Se extrajeron variables clínicas de rutina del mismo encuentro clínico que la extracción de sangre previa a la imagenología para AFP/PIVKA-II. Las variables candidatas incluyeron edad, sexo, alanina aminotransferasa, aspartato aminotransferasa, albúmina, bilirrubina total, ratio normalizado internacional (INR), tiempo de protrombina y recuento de plaquetas. Cuando había múltiples valores disponibles dentro del período previo a la imagenología, se seleccionó el valor más cercano al momento de la toma de muestra de AFP/PIVKA-II. Las unidades se estandarizaron antes del análisis. La edad se registró en años; el sexo se codificó como femenino = 0 y masculino = 1; el recuento de plaquetas se registró como ×10⁹/L; la albúmina se registró como g/L; la bilirrubina total se registró como μmol/L; la AFP se registró como ng/mL; y el PIVKA-II se registró como mAU/mL.

Se realizaron verificaciones de rango, verificaciones de unidades y verificaciones de valores inverosímiles tras la extracción. Los valores marcados se verificaron frente a los registros originales. Solo se excluyó un valor cuando el registro fuente confirmaba un problema de calidad de la muestra, un error de conversión de unidades o una desviación en el procesamiento. Se mantuvieron los valores extremos verificados. El diccionario de variables definió la estructura del conjunto de datos, los nombres de las variables, las unidades, las reglas de codificación, las reglas de transformación y los códigos de valores faltantes.

Definición del predictor y selección de variables

Los predictores candidatos se definieron antes del desarrollo del modelo. Los biomarcadores principales fueron AFP y PIVKA-II. Los candidatos clínicos de rutina fueron edad, sexo, alanina aminotransferasa, aspartato aminotransferasa, albúmina, bilirrubina total, INR o tiempo de protrombina y recuento de plaquetas. Los valores de AFP y PIVKA-II se transformaron mediante logaritmo natural. Los valores por debajo del límite de informe del ensayo se sustituyeron por la mitad del límite inferior de informe antes de la transformación.

Las comparaciones univariantes entre participantes con HCC y sin HCC en la cohorte de entrenamiento utilizaron pruebas t para muestras independientes para variables aproximadamente distribuidas de forma normal, pruebas U de Mann-Whitney para variables continuas asimétricas y pruebas χ2 o pruebas exactas de Fisher para variables categóricas. Se consideraron para el modelado multivariable las variables con P < 0,10 en el análisis univariante. La multicolinealidad se evaluó mediante el factor de inflación de la varianza (VIF), y un VIF >5 se consideró indicativo de una colinealidad preocupante. Cuando dos variables presentaban una fuerte colinealidad, se conservó la variable con una interpretación clínica más clara y un mejor rendimiento incremental del modelo.

El modelo final de regresión logística multivariable se desarrolló únicamente en la cohorte de entrenamiento. Se incluyeron forzosamente en el modelo ln(AFP) y ln(PIVKA-II). Los predictores adicionales se seleccionaron mediante eliminación hacia atrás guiada por el criterio de información de Akaike. Tras la selección hacia atrás, las variables conservadas fueron ln(AFP), ln(PIVKA-II), edad, sexo, albúmina, INR y recuento de plaquetas.

Desarrollo del modelo y cálculo del puntaje de riesgo

El modelo diagnóstico se ajustó mediante regresión logística multivariable con el estado de CHC como resultado binario. La probabilidad predicha de CHC se calculó a partir del predictor lineal η utilizando la siguiente ecuación:

p(HCC)=1/[1+exp(-η)]

η = -4.862+0.247×ln(AFP)+0.712×ln(PIVKA-II)+0.018×edad+0.331×sexo-0.062×albúmina+0.554×INR-0.004×recuentodeplaquetas

La AFP se midió en ng/mL, la PIVKA-II en mAU/mL, la edad en años, el sexo se codificó como femenino = 0 y masculino = 1, la albúmina se midió en g/L, el INR fue adimensional y el recuento de plaquetas se midió como ×109/L. Se utilizaron logaritmos naturales para AFP y PIVKA-II. Se generó un nomograma a partir de los mismos coeficientes ajustados. Para el análisis de la curva característica de operación del receptor (ROC), el análisis de calibración, el análisis de la curva de decisión y la validación, se utilizó la probabilidad predicha, no la escala de puntos del nomograma.

Definiciones de puntos de corte y manejo de umbrales

Los umbrales de PIVKA-II se etiquetaron según el propósito analítico. El umbral clínico establecido para PIVKA-II fue de 40,0 mAU/mL. El umbral de Youden en la cohorte de entrenamiento para PIVKA-II fue de 45,0 mAU/mL. El umbral de especificidad fija se obtuvo seleccionando el valor umbral más cercano al 90 % de especificidad en la cohorte de entrenamiento; esto resultó en 38,0 mAU/mL para PIVKA-II. Un umbral aparente utilizado únicamente en la validación de 37,5 mAU/mL se consideró exploratorio y no se usó como umbral principal de validación.

Para el modelo combinado, el punto de corte binario principal se derivó a partir de la cohorte de entrenamiento utilizando el índice de Youden y se aplicó sin cambios a la cohorte de validación. Se utilizó el punto de corte clínico establecido de 20,0 ng/mL para la definición del subgrupo negativo para AFP y para la comparación con la práctica habitual. Los puntos de corte optimizados de AFP utilizados en el análisis ROC se etiquetaron por separado del umbral clínico. Por lo tanto, los puntos de corte se informaron según el propósito analítico y no como umbrales intercambiables.

Rendimiento, calibración y validación del modelo

La discriminación se evaluó mediante curvas de característica operativa del receptor y el área bajo la curva. Las AUC se informaron con intervalos de confianza del 95 %. Las comparaciones de AUC utilizaron la prueba de DeLong. El rendimiento de la clasificación se reportó como sensibilidad, especificidad, valor predictivo positivo, valor predictivo negativo y exactitud en puntos de corte predeterminados.

La calibración se evaluó mediante el intercepto de calibración, la pendiente de calibración, la puntuación de Brier y la prueba de bondad de ajuste de Hosmer-Lemeshow. Los gráficos de calibración compararon las probabilidades predichas y observadas de HCC entre grupos de riesgo. La validación interna utilizó 1.000 muestras de reemplazo bootstrap en la cohorte de entrenamiento para estimar el AUC corregido por optimismo y la pendiente de calibración corregida por optimismo. La cohorte de validación se utilizó únicamente para la evaluación del desempeño externo. No se realizó actualización de coeficientes, reajuste del modelo, reoptimización de umbrales ni recalibración basada en subgrupos en la cohorte de validación.

Se evaluó la utilidad clínica mediante análisis de curvas de decisión en un rango de probabilidades umbral de 0,05 a 0,50. Se comparó el beneficio neto para AFP sola, PIVKA-II sola, el modelo basado en variables clínicas y el modelo combinado.

Manejo de datos faltantes y análisis de sensibilidad

El análisis principal utilizó un modelo de casos completos para los participantes con todas las variables incluidas en el modelo final. Se resumieron los valores ausentes para cada predictor candidato. Si la cantidad de datos faltantes superaba el 5 % para cualquier predictor incluido, se realizó una imputación múltiple mediante ecuaciones encadenadas como análisis de sensibilidad, utilizando el resultado, todos los predictores incluidos y el indicador de cohorte en el modelo de imputación. Las variables con más del 20 % de datos faltantes no fueron elegibles para el modelado multivariable. Los coeficientes del modelo, el AUC, la pendiente de calibración y las métricas de clasificación obtenidas del análisis con datos imputados se compararon con los resultados del análisis de casos completos.

Software y reporte reproducible

Todos los análisis se realizaron utilizando R versión 4.3.2 y RStudio versión 2023.12.1. La regresión logística se realizó utilizando el paquete base stats. El análisis ROC y las comparaciones de DeLong se realizaron utilizando pROC versión 1.18.5. El análisis de calibración se realizó utilizando rms versión 6.7-1 y ResourceSelection versión 0.3-6. La validación por bootstrap utilizó 1.000 remuestras con una semilla aleatoria fija de 70558. El análisis de curva de decisión se realizó utilizando rmda versión 1.6. La imputación múltiple, si era necesaria, se realizó utilizando mice versión 3.16.0. El script de análisis reprodujo el flujo de participantes, los coeficientes del modelo, las curvas ROC, las métricas de calibración, la validación por bootstrap, el análisis de curva de decisión, los análisis basados en puntos de corte y las tablas estadísticas.

Resultados

Características basales

El análisis final incluyó a 389 participantes. La cohorte de entrenamiento incluyó a 205 participantes, compuesta por 112 casos de CHC confirmados mediante imágenes y 93 controles sin CHC. La cohorte de validación incluyó a 184 participantes, compuesta por 58 casos de CHC confirmados mediante imágenes y 126 controles sin CHC. Las características basales se resumen en Tabla 1.

En la cohorte de entrenamiento, los 93 controles sin CHC incluyeron 30 controles sanos y 63 controles con enfermedad hepática crónica. En la cohorte de validación, los 126 controles sin CHC incluyeron 0 controles sanos y 126 controles con enfermedad hepática crónica. La infección por el virus de la hepatitis B fue la enfermedad hepática subyacente predominante. Los casos de enfermedad BCLC 0-A representaron 57 de los 112 casos de CHC en la cohorte de entrenamiento y 30 de los 58 casos de CHC en la cohorte de validación. La edad, el sexo, los antecedentes de enfermedad hepática, los antecedentes familiares de CHC, el estado de cirrosis, la clase Child-Pugh, la alanina aminotransferasa, la aspartato aminotransferasa, la albúmina, la bilirrubina total, el recuento de plaquetas, el tiempo de protrombina, la razón normalizada internacional, la diabetes y la hipertensión estuvieron equilibrados entre los estratos de cohortes informados en la Tabla 1.

La AFP mediana fue de 57,3 ng/mL en los casos de HCC del grupo de entrenamiento y de 22,4 ng/mL en los controles sin HCC del grupo de entrenamiento. La PIVKA-II mediana fue de 197,6 mAU/mL y 86,3 mAU/mL, respectivamente. En la cohorte de validación, la AFP mediana fue de 60,2 ng/mL en los casos de HCC y de 21,5 ng/mL en los controles sin HCC. La PIVKA-II mediana fue de 191,5 mAU/mL y 84,1 mAU/mL, respectivamente.

Rendimiento diagnóstico de la cohorte de entrenamiento

La discriminación en la cohorte de entrenamiento se muestra en la Figura 2(A), y la comparación correspondiente de sensibilidad y especificidad se muestra en la Figura 2(B). Las características operativas se resumen en la Tabla 2. La AFP presentó un AUC de 0,78, una sensibilidad del 62,50 % y una especificidad del 78,49 % en el umbral clínico establecido de 20,0 ng/mL. La PIVKA-II presentó un AUC de 0,85, una sensibilidad del 78,57 % y una especificidad del 82,80 % en el umbral de Youden de la cohorte de entrenamiento de 45,0 mAU/mL. El modelo de variables clínicas tuvo un AUC de 0,81, una sensibilidad del 69,64 % y una especificidad del 80,65 % en un umbral de probabilidad predicha de 0,40. El modelo combinado presentó la mayor discriminación en la cohorte de entrenamiento, con un AUC de 0,93, una sensibilidad del 88,39 % y una especificidad del 89,25 % en un umbral de probabilidad predicha de 0,50.

Rendimiento estratificado por etapa

Las distribuciones de biomarcadores estratificadas por etapa se muestran en la Figura 3(A), las tasas de detección en la Figura 3(B), y las AUC específicas por etapa en la Figura 3(C). La AFP, la PIVKA-II y el puntaje del modelo combinado aumentaron a través de las etapas BCLC 0–A, B y C de la enfermedad. La AFP mostró superposición entre el carcinoma hepatocelular en estadio temprano y los controles sin carcinoma hepatocelular. La PIVKA-II mostró una mejor separación entre los estratos por etapa. El modelo combinado produjo la mayor discriminación estratificada por etapa, incluyendo en el carcinoma hepatocelular BCLC 0–A.

Complementariedad entre AFP y PIVKA-II

Las correlaciones entre marcadores y puntajes se muestran en Figura 4(A)-(C), y la clasificación cruzada de marcadores se muestra en Figura 4(D). AFP y PIVKA-II mostraron una superposición parcial. Se observaron casos de CHC positivos para AFP/negativos para PIVKA-II y casos de CHC negativos para AFP/positivos para PIVKA-II. El modelo combinado clasificó como alto riesgo casos adicionales de CHC negativos para un solo marcador, lo que respalda el uso del puntaje integrado en lugar de cualquiera de los biomarcadores por separado.

Validación externa

Las curvas ROC de la cohorte de validación se muestran en la Figura 5(A), la calibración se muestra en la Figura 5(B), y los patrones de sensibilidad y especificidad por subgrupo se muestran en la Figura 5(C). Las métricas de validación correspondientes se resumen en la Tabla 3. En todos los casos de HCC validados, la AFP tuvo un AUC de 0,75, una sensibilidad del 62,1 % y una especificidad del 88,9 % a 18,5 ng/mL. La PIVKA-II tuvo un AUC de 0,78, una sensibilidad del 72,4 % y una especificidad del 91,3 % a 38,0 mAU/mL. El modelo combinado tuvo un AUC de 0,89, una sensibilidad del 84,5 %, una especificidad del 90,5 %, un valor predictivo positivo del 78,8 % y un valor predictivo negativo del 94,1 % a un umbral de probabilidad predicha de 0,56.

En la HCC en estadio temprano, la AFP tuvo una sensibilidad del 45,5 % y una especificidad del 88,9 %, la PIVKA-II tuvo una sensibilidad del 59,1 % y una especificidad del 91,3 %, y el modelo combinado tuvo una sensibilidad del 72,7 % y una especificidad del 90,5 %. En la HCC negativa para AFP, la sensibilidad de la AFP fue del 23,1 %, la sensibilidad de la PIVKA-II fue del 61,5 % y la sensibilidad del modelo combinado fue del 73,1 %. En la HCC viral, el modelo combinado tuvo una sensibilidad del 85,3 % y una especificidad del 91,3 %. En la HCC no viral, el modelo combinado tuvo una sensibilidad del 83,3 % y una especificidad del 89,7 %. La intersección de calibración de la cohorte de validación fue de -0,08, la pendiente de calibración fue de 0,91, la puntuación de Brier fue de 0,118 y el valor P de Hosmer-Lemeshow fue de 0,64.

Regresión multivariable y validación interna

Los resultados de la regresión multivariable se muestran en la Tabla 4. En el modelo ajustado, la PIVKA-II con transformación logarítmica siguió siendo el predictor independiente más fuerte, con una razón de momios ajustada de 2,05, IC del 95 %: 1,48-2,89, y P < 0,001. La AFP con transformación logarítmica también se asoció independientemente con el CHC, con una razón de momios ajustada de 1,28, IC del 95 %: 1,05-1,62, y P = 0,021. La razón internacional normalizada conservó un valor predictivo independiente, con una razón de momios ajustada de 1,74, IC del 95 %: 1,12-2,78, y P = 0,015. El modelo final con selección hacia atrás incluyó ln(AFP), ln(PIVKA-II), edad, sexo, albúmina, razón internacional normalizada y recuento de plaquetas.

Las métricas de validación interna mediante bootstrap también se informan en la Tabla 4. El AUC de entrenamiento aparente fue de 0,93, el promedio de optimismo fue de 0,018 y el AUC corregido por optimismo fue de 0,91. La pendiente de calibración aparente fue de 1,00, la pendiente de calibración corregida por optimismo fue de 0,94, el valor del índice de Brier en la cohorte de entrenamiento fue de 0,104 y el valor P de Hosmer-Lemeshow fue de 0,72.

Revisión del punto de corte y rendimiento específico del umbral

Dado que los umbrales de PIVKA-II variaban según el propósito analítico, los resultados basados en puntos de corte se informaron por separado en lugar de considerarse intercambiables. El rendimiento del punto de corte optimizado post hoc según Youden se muestra en Tabla 5. La AFP presentó un punto de corte optimizado según Youden de 19,0 ng/mL, con una sensibilidad del 67,9 %, especificidad del 89,1 %, valor predictivo positivo del 71,3 %, valor predictivo negativo del 87,3 %, exactitud del 81,2 % y un AUC de 0,78. PIVKA-II presentó un punto de corte optimizado según Youden de 37,5 mAU/mL, con una sensibilidad del 75,4 %, especificidad del 92,0 %, valor predictivo positivo del 79,8 %, valor predictivo negativo del 89,7 %, exactitud del 85,9 % y un AUC de 0,82. El modelo combinado presentó un punto de corte de probabilidad predicha optimizado según Youden de 0,57, con una sensibilidad del 86,2 %, especificidad del 90,6 %, valor predictivo positivo del 82,7 %, valor predictivo negativo del 92,4 %, exactitud del 89,8 % y un AUC de 0,90.

El rendimiento utilizando los puntos de corte clínicos establecidos se muestra en la Tabla 6. En el punto de corte establecido de AFP de 20,0 ng/mL, la AFP presentó una sensibilidad del 65,2 %, una especificidad del 88,5 %, un valor predictivo positivo del 70,1 %, un valor predictivo negativo del 86,0 %, una exactitud del 80,3 % y un AUC de 0,77. En el punto de corte establecido de PIVKA-II de 40,0 mAU/mL, PIVKA-II presentó una sensibilidad del 73,0 %, una especificidad del 93,1 %, un valor predictivo positivo del 81,8 %, un valor predictivo negativo del 89,0 %, una exactitud del 85,6 % y un AUC de 0,82. Con un umbral de probabilidad predicha de 0,60, el modelo combinado tuvo una sensibilidad del 83,5 %, una especificidad del 92,0 %, un valor predictivo positivo del 84,7 %, un valor predictivo negativo del 91,2 %, una exactitud del 88,9 % y un AUC de 0,89.

El rendimiento en el punto de corte más cercano al 90% de especificidad se muestra en Tabla 7. La AFP utilizó un punto de corte de 19,0 ng/mL, con una sensibilidad del 67,9% y una especificidad del 89,1%. La PIVKA-II utilizó un punto de corte de 37,5 mAU/mL, con una sensibilidad del 75,4% y una especificidad del 92,0%. El modelo combinado utilizó un punto de corte de probabilidad predicha de 0,57, con una sensibilidad del 86,2% y una especificidad del 90,6%. Estos resultados del análisis de puntos de corte explican las diferencias numéricas entre los umbrales de PIVKA-II de 37,5, 38,0, 40,0 y 45,0 mAU/mL: 45,0 mAU/mL fue el punto de corte de Youden en la cohorte de entrenamiento utilizado para la comparación principal de entrenamiento, 38,0 mAU/mL se utilizó para el informe de especificidad fija en la validación, 40,0 mAU/mL fue el punto de corte clínico establecido y 37,5 mAU/mL fue el punto de corte optimizado post hoc mediante Youden en la tabla de análisis de puntos de corte.

Distribuciones por subgrupos de enfermedad

Las distribuciones por subgrupos de enfermedad de AFP, PIVKA-II y el puntaje del modelo combinado se muestran en la Figura 6(A)-(C). Los valores de AFP, PIVKA-II y el puntaje del modelo combinado fueron más bajos en los controles con enfermedad hepática crónica y más altos en los grupos con HCC. La AFP mostró superposición entre los controles con enfermedad hepática crónica y el HCC en estadio temprano. PIVKA-II y el puntaje del modelo combinado mostraron una separación más clara entre los controles con enfermedad hepática crónica, el HCC en estadio temprano y el HCC en todos los estadios.

DISPONIBILIDAD DE LOS DATOS:

El conjunto de datos que respalda los hallazgos de este estudio está disponible públicamente en Figshare en https://doi.org/10.6084/m9.figshare.33048095.v1.

Diagrama de flujo del estudio de enfermedad hepática; diagnóstico, procesamiento de plasma, inmunoensayo, adjudicación por TC/IRM.
Figura 1: Flujo de participantes, asignación de cohortes, procesamiento de muestras y adjudicación diagnóstica. Diagrama de flujo que muestra la selección de participantes, asignación a cohortes, toma de muestras sanguíneas previa a la obtención de imágenes, procesamiento del plasma, medición de AFP/PIVKA-II, evaluación mediante TC/IRM con contraste y adjudicación final de CHC basada en imágenes en las cohortes de entrenamiento y validación. Haga clic aquí para ver una versión más grande de esta figura.

Curva ROC y gráfico de barras que muestran sensibilidad, especificidad y valores de AUC para AFP, PIVKA-II, variables clínicas y combinado.
Figura 2: Rendimiento diagnóstico en la cohorte de entrenamiento de AFP, PIVKA-II, el modelo basado en variables clínicas y el modelo combinado. (A) Curvas de característica operativa del receptor que comparan AFP, PIVKA-II, el modelo basado en variables clínicas y el modelo combinado multivariable en la cohorte de entrenamiento. (B) Sensibilidad y especificidad de cada método diagnóstico en el umbral reportado para la cohorte de entrenamiento. Haga clic aquí para ver una versión más grande de esta figura.

Las características operativas correspondientes se resumen en Tabla 2.

análisis de detección de CHC; gráficos; AFP, PIVKA-II, modelo combinado; tasas de detección, resultados de AUC.
Figura 3: Rendimiento diagnóstico estratificado por etapa a través de las etapas BCLC. (A) Distribuciones de AFP, PIVKA-II y el puntaje del modelo combinado en controles sin CHC y grupos por etapas BCLC. (B) Tasas de detección de AFP, PIVKA-II y el modelo combinado a través de las etapas BCLC. (C) AUC específicas por etapa para AFP, PIVKA-II y el modelo combinado, incluyendo HCC en etapa BCLC 0–A. Haga clic aquí para ver una versión ampliada de esta figura.

Gráficos que analizan los niveles de AFP y PIVKA-II, correlación de Spearman y distribución de casos de HCC.
Figura 4: Correlación y complementariedad entre AFP, PIVKA-II y la puntuación del modelo combinado. (A) Correlación entre AFP y la puntuación del modelo combinado. (B) Correlación entre PIVKA-II y la puntuación del modelo combinado. (C) Correlación entre AFP y PIVKA-II. (D) Clasificación cruzada de los casos de HCC según el estado de AFP, el estado de PIVKA-II y la clasificación de riesgo del modelo combinado. Haga clic aquí para ver una versión más grande de esta figura.

Curvas ROC, curvas de calibración, gráfico de barras para AFP, PIVKA-II en el análisis del rendimiento del modelo para HCC.
Figura 5: Validación externa del rendimiento diagnóstico en la cohorte de validación independiente. (A) Curvas de características operativas del receptor (ROC) para AFP, PIVKA-II y el modelo combinado en la cohorte de validación. (B) Gráfico de calibración del modelo combinado en la cohorte de validación. (C) Comparación de sensibilidad y especificidad de AFP, PIVKA-II y el modelo combinado en todos los casos de HCC, HCC en etapa temprana y HCC con AFP negativa. Las métricas de validación correspondientes se resumen en la Tabla 3. Haga clic aquí para ver una versión más grande de esta figura.

Gráfico de caja comparando los niveles de AFP, PIVKA-II y la puntuación del modelo combinado en enfermedad hepática frente a estadios de CHC.
Figura 6: Distribuciones por subgrupos de enfermedad de la AFP, PIVKA-II y la puntuación del modelo combinado. (A) Distribución de AFP entre controles con enfermedad hepática crónica, CHC BCLC 0–A y CHC de todos los estadios. (B) Distribución de PIVKA-II entre controles con enfermedad hepática crónica, CHC BCLC 0–A y CHC de todos los estadios. (C) Distribución de la puntuación del modelo combinado entre controles con enfermedad hepática crónica, CHC BCLC 0-A y CHC de todos los estadios. Haga clic aquí para ver una versión ampliada de esta figura.

FactorCategoría / ResumenEntrenamiento de HCC
n = 112 
Entrenamiento de controles sin HCC
n = 93
Validación HCC n = 58Controles de validación no HCC
 n = 126
P valor
Sexo, n (%)Masculino76 (67.9%)59 (63.4%)39 (67.2%)76 (60.3%)0.374
Femenino36 (32.1%)34 (36.6%)19 (32.8%)50 (39.7%)
Edad, añosMedia ± DE58.9 ± 9.358.1 ± 10.459.4 ± 8.857.6 ± 9.70.281
Antecedentes de enfermedad hepática, n (%)VHB84 (75.0%)64 (68.8%)42 (72.4%)83 (65.9%)0.332
VHC6 (5.4%)5 (5.4%)3 (5.2%)7 (5.6%)0.914
Enfermedad hepática alcohólica13 (11.6%)10 (10.8%)6 (10.3%)12 (9.5%)0.825
Antecedentes familiares de CHC, n (%)9 (8.0%)7 (7.5%)4 (6.9%)8 (6.3%)0.887
Cirrosis hepática, n (%)80 (71.4%)61 (65.6%)42 (72.4%)88 (69.8%)0.468
Estadio de CHC (BCLC), n (%)0–A57 (50.9%)30 (51.7%)
B33 (29.5%)17 (29.3%)
C22 (19.6%)11 (19.0%)
Clase Child–Pugh, n (%)A85 (75.9%)77 (82.8%)43 (74.1%)101 (80.2%)0.341
B27 (24.1%)16 (17.2%)15 (25.9%)25 (19.8%)
ALT, U/LMedia ± DE48.6 ± 22.147.1 ± 20.647.9 ± 22.445.2 ± 20.10.517
AST, U/LMedia ± DE60.3 ± 28.558.0 ± 27.858.7 ± 29.456.2 ± 26.90.488
Albúmina, g/LMedia ± DE39.0 ± 4.739.5 ± 4.638.7 ± 5.139.6 ± 4.50.554
bilirrubina total, μmol/LMedia ± DE20.1 ± 11.318.6 ± 10.820.4 ± 11.618.1 ± 10.90.321
Recuento de plaquetas, ×10⁹/LMedia ± DE137 ± 61146 ± 59134 ± 60149 ± 570.437
Tiempo de protrombina, sMedia ± DE13.7 ± 1.413.5 ± 1.313.8 ± 1.513.5 ± 1.20.411
INRMedia ± DE1.18 ± 0.121.16 ± 0.111.19 ± 0.131.15 ± 0.100.334
AFP, ng/mLMediana (RIC)57.3 (19.8–135.1)22.4 (10.4–46.0)60.2 (20.6–131.7)21.5 (9.8–48.1)0.071
PIVKA-II, mAU/mLMediana (RIC)197.6 (83.1–438.2)86.3 (38.6–131.2)191.5 (81.4–422.5)84.1 (37.1–129.4)0.064
TP prolongado, n (%)30 (26.8%)20 (21.5%)15 (25.9%)24 (19.0%)0.372
Diabetes, n (%)19 (17.0%)14 (15.1%)10 (17.2%)19 (15.1%)0.764
Hipertensión, n (%)33 (29.5%)26 (28.0%)18 (31.0%)36 (28.6%)0.824
Tipo de control entre los controles sin HCC, n (%)Controles sanos30 (32.3%)0 (0.0%)
Controles de enfermedad hepática crónica63 (67.7%)126 (100.0%)
Nota: HCC, carcinoma hepatocelular; BCLC, Clínica de Barcelona para el Cáncer de Hígado; ALT, alanina aminotransferasa; AST, aspartato aminotransferasa; INR, relación normalizada internacional; AFP, alfafetoproteína; PIVKA-II, proteína inducida por la ausencia de vitamina K-II; PT, tiempo de protrombina; IQR, rango intercuartílico. Los valores de P se muestran para las comparaciones basales entre las estratificaciones de cohorte/estado informadas, cuando corresponde. La etapa del HCC se informó únicamente para los casos de HCC. El tipo de control se informó únicamente para los controles sin HCC.

Tabla 1: Características basales de las cohortes de entrenamiento y validación. Se presentan las características demográficas, antecedentes de enfermedad hepática, estadio de HCC, clase Child-Pugh, índices de laboratorio de rutina, AFP y PIVKA-II según la cohorte y el estado de HCC.

MétodoSensibilidad (IC 95%)Especificidad (IC 95%)AUC (IC 95%)Umbral
AFP62.50 (53.41–71.06)78.49 (69.07–86.04)0.78 (0.72–0.84)20.0 ng/mL
PIVKA-II78.57 (70.29–85.37)82.80 (73.95–89.61)0.85 (0.80–0.90)45.0 mAU/mL
Modelo basado en variables clínicas69.64 (60.28–77.87)80.65 (71.13–88.04)0.81 (0.75–0.87)Probabilidad predicha = 0.40
Modelo combinado88.39 (81.35–93.36)89.25 (81.26–94.65)0.93 (0.89–0.96)Probabilidad predicha = 0.50
Nota: AFP se evaluó en el umbral clínico establecido de 20.0 ng/mL. El umbral de PIVKA-II de 45.0 mAU/mL fue el punto de corte de Youden del cohort de entrenamiento, utilizado para la comparación principal de entrenamiento. Los modelos basados en variables clínicas y el modelo combinado se evaluaron utilizando umbrales de probabilidad predicha derivados en el cohort de entrenamiento.

Tabla 2: Rendimiento diagnóstico en la cohorte de entrenamiento. Se muestran el AUC, sensibilidad, especificidad y los umbrales reportados para AFP, PIVKA-II, el modelo de variables clínicas y el modelo combinado multivariable en la cohorte de entrenamiento.

SubgrupoÍtemAFPPIVKA-IIModelo combinado
Todos los HCCAUC0.750.780.89
Todos los HCCUmbral de validación principal18.5 ng/mL38.0 mAU/mLProbabilidad predicha = 0.56
Todos los HCCSensibilidad, % (IC 95%)62.1 (48.7–74.2)72.4 (59.1–83.5)84.5 (72.6–92.6)
Todos los HCCEspecificidad, % (IC 95%)88.9 (82.0–93.4)91.3 (85.1–95.3)90.5 (84.2–94.8)
Todos los HCCVP+, %63.872.778.8
Todos los HCCVPN, %88.19194.1
HCC en estadio tempranoUmbral exploratorio del subgrupo15.2 ng/mL33.5 mAU/mLProbabilidad predicha = 0.51
HCC en estadio tempranoSensibilidad, % (IC 95%)45.5 (25.1–67.3)59.1 (38.5–77.7)72.7 (52.0–87.6)
HCC en estadio tempranoEspecificidad, %88.991.390.5
HCC en estadio tempranoVP+, %4054.566.7
HCC en estadio tempranoVPN, %90.187.592.3
HCC negativo para AFPUmbral exploratorio del subgrupo7.5 ng/mL31.2 mAU/mLProbabilidad predicha = 0.48
HCC negativo para AFPSensibilidad, % (IC 95%)23.1 (9.7–42.6)61.5 (40.6–79.8)73.1 (52.2–88.4)
HCC negativo para AFPEspecificidad, %88.991.390.5
HCC negativo para AFPVP+, %225264.5
HCC negativo para AFPVPN, %90.288.392.7
HCC viralUmbral exploratorio del subgrupo19.3 ng/mL40.7 mAU/mLProbabilidad predicha = 0.59
HCC viralSensibilidad, % (IC 95%)64.7 (46.9–79.9)73.5 (56.4–86.4)85.3 (69.9–94.7)
HCC viralEspecificidad, %88.190.591.3
HCC viralVP+, %67.37381.3
HCC viralVPN, %87.590.894.7
HCC no viralUmbral exploratorio del subgrupo20.1 ng/mL34.5 mAU/mLProbabilidad predicha = 0.53
HCC no viralSensibilidad, % (IC 95%)58.3 (36.6–77.9)70.8 (48.9–87.4)83.3 (62.6–95.3)
HCC no viralEspecificidad, %89.292.189.7
HCC no viralVP+, %59.269.775
HCC no viralVPN, %899293.8
Calibración del modelo combinadoIntercepto−0.08
Calibración del modelo combinadoPendiente0.91
Calibración del modelo combinadoPuntuación de Brier0.118
Calibración del modelo combinadoValor p de Hosmer–Lemeshow0.64
Nota: La fila de todos los HCC informa el análisis principal de validación. Las filas de HCC en estadio temprano, HCC negativo para AFP, HCC viral y HCC no viral informan el desempeño exploratorio del subgrupo. Los umbrales del subgrupo se informaron para describir puntos de funcionamiento aparentes dentro de cada subgrupo y no se utilizaron para reajustar ni recalcular el modelo. El HCC negativo para AFP se definió como AFP <20.0 ng/mL. VP+, valor predictivo positivo; VPN, valor predictivo negativo.

Tabla 3: Rendimiento diagnóstico en la cohorte de validación y análisis por subgrupos. Se muestran el AUC, los umbrales reportados, sensibilidad, especificidad, valor predictivo positivo y valor predictivo negativo para AFP, PIVKA-II y el modelo combinado en todos los casos de HCC, HCC en estadio temprano, HCC negativo para AFP, HCC viral y HCC no viral. También se incluyen las métricas de calibración para el modelo combinado.

Factor / métricaValor p univarianteCoeficiente βOR ajustada / métrica de validaciónIC del 95%P valor
Interceptar−4.862
Edad0.1120.0181.020.99–1.050.186
Sexo, masculino0.0870.3311.410.83–2.370.204
AFP, transformado mediante logaritmo natural0.0040.2471.281.05–1.620.021
PIVKA-II, transformado mediante logaritmo natural<0.0010.7122.051.48–2.89<0.001
Albúmina, g/L0.008−0.0620.940.89–0.990.032
INR0.0120.5541.741.12–2.780.015
Recuento de plaquetas, ×109/0.052−0.0040.990.98–1.000.044
AUC aparente de entrenamiento0.930.89–0.96
Optimismo medio0.018
AUC corregida por optimismo0.910.87–0.95
Pendiente aparente de calibración1
Pendiente de calibración corregida por optimismo0.94
Puntuación Brier de entrenamiento0.104
Valor p de Hosmer-Lemeshow0.72
Nota: El predictor lineal final fue η = −4,862 + 0,247 × ln(AFP) + 0,712 × ln(PIVKA-II) + 0,018 × edad + 0,331 × sexo − 0,062 × albúmina + 0,554 × INR − 0,004 × recuento de plaquetas. La probabilidad predicha se calculó como p(HCC) = 1 / [1 + exp(−η)]. El AFP se midió en ng/mL; el PIVKA-II en mAU/mL; la edad en años; el sexo se codificó como mujer = 0 y hombre = 1; la albúmina en g/L; el INR como un valor sin unidades; y el recuento de plaquetas en ×10⁹/L.

Tabla 4: Regresión logística multivariable y validación interna mediante bootstrap. Se muestran los valores p univariados, los coeficientes del modelo ajustado, las odds ratios ajustadas, los intervalos de confianza del 95 % y los valores p multivariables para las variables evaluadas en el modelo de la cohorte de entrenamiento. Se informan el optimismo mediante bootstrap, el área bajo la curva (AUC) corregida por optimismo, la pendiente de calibración corregida por optimismo, la puntuación de Brier y los resultados de la prueba de Hosmer-Lemeshow.

Tabla 5: Rendimiento diagnóstico utilizando puntos de corte optimizados según Youden. Se muestran la sensibilidad, especificidad, valor predictivo positivo, valor predictivo negativo, exactitud y el AUC para AFP, PIVKA-II y el modelo combinado utilizando los puntos de corte según el índice de Youden.

MétodoUmbral establecidoSensibilidad, % (IC 95 %)Especificidad, % (IC 95 %)PPV, % (IC 95 %)NPV, % (IC 95 %)Precisión, % (IC 95 %)AUC (IC 95 %)
AFP20.0 ng/mL65.2 (57.0–72.7)88.5 (83.4–92.3)70.1 (61.8–77.4)86.0 (80.7–90.3)80.3 (75.0–84.8)0.77 (0.72–0.82)
PIVKA-II40.0 mAU/mL73.0 (65.2–79.8)93.1 (88.8–96.0)81.8 (74.2–87.7)89.0 (83.9–92.8)85.6 (80.9–89.5)0.82 (0.78–0.86)
Modelo combinadoProbabilidad predicha = 0.6083.5 (76.6–89.0)92.0 (87.4–95.3)84.7 (77.9–90.0)91.2 (86.3–94.6)88.9 (84.6–92.2)0.89 (0.86–0.93)
Nota: Los umbrales clínicos establecidos fueron AFP 20.0 ng/mL y PIVKA-II 40.0 mAU/mL. El modelo combinado se informó en el umbral de probabilidad predefinido correspondiente utilizado para esta comparación con el umbral clínico.

Tabla 6: Rendimiento diagnóstico utilizando puntos de corte clínicos establecidos. Se muestran sensibilidad, especificidad, valor predictivo positivo, valor predictivo negativo, exactitud y área bajo la curva (AUC) utilizando el punto de corte establecido de AFP de 20,0 ng/mL y el punto de corte establecido de PIVKA-II de 40,0 mAU/mL. El modelo combinado se informa en el umbral de probabilidad correspondiente utilizado para esta comparación de puntos de corte.

MétodoUmbral más cercano al 90% de especificidadSensibilidad, % (IC 95%)Especificidad, % (IC 95%)VPP, % (IC 95%)VPN, % (IC 95%)
AFP19.0 ng/mL67.9 (59.1–75.7)89.1 (84.2–92.8)71.3 (62.4–79.0)87.3 (82.1–91.2)
PIVKA-II37.5 mAU/mL75.4 (67.3–82.2)92.0 (87.7–95.1)79.8 (71.6–86.3)89.7 (84.7–93.3)
Modelo combinadoProbabilidad predicha = 0.5786.2 (79.3–91.3)90.6 (85.8–94.0)82.7 (74.8–88.7)92.4 (87.9–95.4)
Nota: Estos umbrales se seleccionaron para alcanzar la especificidad más cercana al 90% en el análisis de auditoría de umbrales. Para PIVKA-II, 37.5 mAU/mL es el umbral de Youden y cercano al 90% de especificidad en esta auditoría, 38.0 mAU/mL es el umbral principal de validación reportado en la Tabla 3, 40.0 mAU/mL es el umbral clínico establecido, y 45.0 mAU/mL es el umbral de Youden del cohorte de entrenamiento utilizado en la Tabla 2.

Tabla 7: Rendimiento diagnóstico en el punto de corte más cercano al 90 % de especificidad. Se muestra la sensibilidad, especificidad, valor predictivo positivo y valor predictivo negativo para AFP, PIVKA-II y el modelo combinado en umbrales seleccionados para alcanzar una especificidad lo más cercana posible al 90 %.

Discusión

Este estudio evaluó una estrategia diagnóstica integrada para el carcinoma hepatocelular mediante el uso de PIVKA-II, AFP y variables clínicas de rutina, con especial atención a las enfermedades en estadio temprano y negativas para AFP14. En los grupos de entrenamiento y validación, el modelo combinado superó las pruebas con un solo marcador. En el grupo de entrenamiento, el modelo combinado alcanzó un AUC de 0,93, en comparación con 0,78 para AFP y 0,85 para PIVKA-II. En el grupo de validación independiente, el modelo mantuvo una fuerte capacidad de discriminación, con un AUC de 0,89, una sensibilidad del 84,5 % y una especificidad del 90,5 %. Estos resultados respaldan un enfoque basado en modelos en el que se interpretan conjuntamente señales complementarias de biomarcadores y datos clínicos, en lugar de basar las decisiones diagnósticas en un único umbral sérico.

Los hallazgos de validación aclaran el valor añadido de la PIVKA-II, especialmente en los casos donde la AFP es menos fiable. La sensibilidad de la AFP fue del 62,1 % en todos los casos de CHC de validación y descendió al 23,1 % en los casos de CHC negativos para AFP. La PIVKA-II mostró una sensibilidad general más alta y mantuvo una sensibilidad del 61,5 % en la enfermedad negativa para AFP. El modelo combinado mejoró aún más la sensibilidad hasta el 73,1 % en el CHC negativo para AFP y hasta el 72,7 % en el CHC en estadio temprano, manteniendo al mismo tiempo una especificidad elevada. Este patrón es coherente con evidencia previa que indica que la PIVKA-II capta información diagnóstica parcialmente distinta de la AFP, particularmente en tumores con bajos niveles de AFP y en la fase inicial de la carga tumoral15,16,17. Los análisis de correlación y de clasificación cruzada también respaldaron esta interpretación, mostrando que la AFP y la PIVKA-II no son marcadores intercambiables y que la puntuación integrada recuperó casos adicionales que pasaron desapercibidos con la clasificación basada en un solo marcador.

Los resultados multivariables sugieren que la mejora obtenida con el modelo combinado no fue solo el resultado de sumar AFP y PIVKA-II. Las variables clínicas aportaron información adicional relacionada con la edad, el sexo, la reserva hepática, el estado de coagulación y el recuento de plaquetas. Este diseño es coherente con los modelos multivariables establecidos de riesgo de carcinoma hepatocelular (HCC), incluyendo GALAD, GAAD y otras puntuaciones basadas en biomarcadores, que combinan variables demográficas y de laboratorio para mejorar el rendimiento diagnóstico en poblaciones heterogéneas con enfermedad hepática18,19,20. En el modelo ajustado, el PIVKA-II transformado logarítmicamente siguió siendo el predictor independiente más fuerte, la AFP transformada logarítmicamente mantuvo una asociación independiente y el INR aportó una señal diagnóstica adicional. Las aminotransferasas resultaron menos informativas tras el ajuste, lo que sugiere que la inflamación hepática inespecífica no fue el principal factor de discriminación una vez considerados los marcadores asociados al tumor y a la coagulación.

Los análisis de puntos de corte abordan un aspecto importante planteado durante la revisión. Los diferentes umbrales de PIVKA-II no deben interpretarse como puntos de corte primarios contradictorios. El valor de 45,0 mAU/mL se utilizó para la comparación de la curva ROC en la cohorte de entrenamiento, 40,0 mAU/mL representó el umbral clínico establecido, y el rango de 37,5 a 38,0 mAU/mL reflejó estrategias alternativas de umbral basadas en la optimización de Youden o en análisis de especificidad fija. Estos umbrales responden a diferentes preguntas clínicas: un punto de corte orientado a la sensibilidad puede ser útil para la vigilancia en personas de alto riesgo, mientras que un punto de corte orientado a la especificidad puede preferirse cuando la prioridad es reducir los falsos positivos. En todas estas estrategias, el modelo combinado resultó más estable que el AFP o el PIVKA-II por separado, lo que respalda su uso como herramienta de estratificación de riesgo y no como sustituto del diagnóstico basado en imágenes21.

Aún quedan varias limitaciones. La cohorte de entrenamiento fue monocéntrica, y la cohorte de validación prospectiva tuvo un tamaño moderado. Aún se necesita una validación multicéntrica, especialmente en poblaciones con antecedentes etiológicos diferentes, incluyendo HCC relacionado con NAFLD, relacionado con el alcohol y relacionado con VHC. El estado de HCC se determinó mediante tomografía computarizada con contraste y/o resonancia magnética, lo cual refleja la práctica diagnóstica habitual pero podría subrepresentar lesiones extremadamente tempranas o atípicas. Algunos análisis por subgrupos, particularmente HCC en estadio temprano y HCC negativo para AFP, incluyeron menos casos que la cohorte general. Los análisis de calibración y de arranque ayudaron a evaluar la estabilidad del modelo, pero no pueden sustituir estudios de implementación prospectivos que prueben si la vigilancia guiada por el modelo mejora la eficiencia de derivación, el rendimiento de detección temprana y los resultados clínicos posteriores22.

En conclusión, la integración de PIVKA-II, AFP y variables clínicas de rutina mejoró la detección del HCC en comparación con estrategias basadas en un solo biomarcador, con un rendimiento consistente tanto en la cohorte de entrenamiento como en la de validación independiente. El modelo mantuvo una sensibilidad clínicamente útil en HCC de etapa temprana y en HCC negativo para AFP, al tiempo que conservó una alta especificidad, abordando así dos limitaciones comunes de la vigilancia basada en AFP. Dado que las entradas son habitualmente disponibles, este enfoque es práctico para pruebas adicionales en poblaciones con enfermedad hepática de alto riesgo. Futuros estudios multicéntricos deberían comparar directamente el modelo con ultrasonido más AFP, evaluar umbrales operativos predefinidos y determinar si la integración con biomarcadores emergentes o características derivadas de imágenes mejora aún más la detección temprana del HCC23,24.

Divulgaciones

Los autores declaran que no existen intereses financieros ni no financieros en conflicto. Ningún patrocinador comercial, fabricante de reactivos, proveedor de software o empresa de plataformas diagnósticas tuvo participación en el diseño del estudio, la recolección de datos, el análisis estadístico, la interpretación de los resultados, la preparación del manuscrito ni en la decisión de enviar el trabajo para su publicación.

Agradecimientos

Los autores agradecen a los participantes del estudio y al personal clínico que apoyó la recolección de sangre, la coordinación clínica, la revisión de imágenes y la verificación de datos para este estudio.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Tubo microcentrífugo de 1,5 mL libre de nucleasasEppendorf30123328Aliquotación y almacenamiento de plasma
Calibrador de AFPRoche DiagnosticsAFP CalSet II, 09227261190Calibración de AFP
Material de control de calidad de AFPRoche DiagnosticsPreciControl Tumor Marker, 11776452160Control de calidad de AFP
Material de control de calidad de AFPRoche DiagnosticsPreciControl Universal, 11731416160Control de calidad de AFP
Kit de reactivo de AFPRoche DiagnosticsElecsys AFP, 09015124190Medición de AFP
Analizador automatizado de inmunoensayo por electroquimioluminiscenciaRoche Diagnosticscobas e 801Medición de AFP y PIVKA-II
Paquete de calibraciónPaquete Rrms 6.7–1Análisis de calibración
Paquete de análisis de curva de decisiónPaquete Rrmda 1.6Análisis de curva de decisión
Paquete de la prueba de Hosmer–LemeshowPaquete RResourceSelection 0.3–6Prueba de Hosmer–Lemeshow
Tubo para recolección de sangre K2-EDTA, 10 mLBD367525Recolección de sangre venosa periférica
Paquete de imputación múltiplePaquete Rmice 3.16.0Imputación múltiple
Kit de reactivo de PIVKA-IIRoche DiagnosticsElecsys PIVKA-II, 08333629190/08333629500Medición de PIVKA-II
Centrífuga refrigeradaEppendorfCentrifuge 5425 RSeparación de plasma
Paquete de análisis ROCPaquete RpROC 1.18.5Análisis ROC y prueba de DeLong
Software estadísticoR FoundationR 4.3.2Análisis estadístico
Interfaz de software estadísticoPosit SoftwareRStudio 2023.12.1Análisis estadístico

Referencias

  1. Oh JH, Jun DW. The latest global burden of liver cancer: A past and present threat. Clin Mol Hepatol. 2023;29(2):355-357.
  2. Heimbach JK et al. AASLD guidelines for the treatment of hepatocellular carcinoma. Hepatology. 2018;67(1):358-380.
  3. Singal AG et al. Meta-analysis: Surveillance with ultrasound for early-stage hepatocellular carcinoma in patients with cirrhosis. Aliment Pharmacol Ther. 2009;30(1):37-47.
  4. Tzartzeva K et al. Surveillance imaging and alpha fetoprotein for early detection of hepatocellular carcinoma in patients with cirrhosis: A meta-analysis. Gastroenterology. 2018;154(6):1706-1718.e1.
  5. Parikh ND et al. Biomarkers for the early detection of hepatocellular carcinoma. Cancer Epidemiol Biomarkers Prev. 2020;29(12):2495-2503.
  6. Gopal P et al. Factors that affect accuracy of alpha-fetoprotein test in detection of hepatocellular carcinoma in patients with cirrhosis. Clin Gastroenterol Hepatol. 2014;12(5):870-877.
  7. Hanif H et al. Update on the applications and limitations of alpha-fetoprotein for hepatocellular carcinoma. World J Gastroenterol. 2022;28(2):216-229.
  8. Norman JS, Mehta N. The role of AFP-L3 and DCP biomarkers in the diagnosis and management of hepatocellular carcinoma. Curr Hepatol Rep. 2025;24(1):16.
  9. Suttichaimongkol T et al. PIVKA-II or AFP has better diagnostic properties for hepatocellular carcinoma diagnosis in high-risk patients. J Circ Biomark. 2023;12:12-16.
  10. Piratvisuth T et al. Development and clinical validation of a novel algorithmic score (GAAD) for detecting HCC in prospective cohort studies. Hepatol Commun. 2023;7(11):e0317.
  11. Jarrah M et al. Performance of GALAD, GAAD, and ASAP for early HCC detection in chronic liver disease: A systematic review and meta-analysis. Liver Cancer. 2026;15(2):285-299.
  12. Zhou JM, Wang T, Zhang KH. AFP-L3 for the diagnosis of early hepatocellular carcinoma: A meta-analysis. Medicine (Baltimore). 2021;100(43):e27673.
  13. Singal AG et al. AASLD practice guidance on prevention, diagnosis, and treatment of hepatocellular carcinoma. Hepatology. 2023;78(6):1922-1965.
  14. Best J et al. The GALAD scoring algorithm based on AFP, AFP-L3, and DCP significantly improves detection of BCLC early-stage hepatocellular carcinoma. Z Gastroenterol. 2016;54(12):1296-1305.
  15. Poté N et al. Performance of PIVKA-II for early hepatocellular carcinoma diagnosis and prediction of microvascular invasion. J Hepatol. 2015;62(4):848-854.
  16. Xu F et al. The diagnostic value of serum PIVKA-II alone or in combination with AFP in Chinese hepatocellular carcinoma patients. Dis Markers. 2021;2021:8868370.
  17. Liu M et al. Validation of the GALAD model and establishment of GAAP model for diagnosis of hepatocellular carcinoma in Chinese patients. J Hepatocell Carcinoma. 2020;7:219-232.
  18. Aralica M et al. GALAD, or des-gamma-carboxy prothrombin compared with alpha-foetoprotein for the diagnosis of hepatocellular carcinoma in people with chronic liver disease. Cochrane Database Syst Rev. 2024;12(12):CD015826.
  19. Zhang S et al. Evaluating the combined diagnostic power of alpha-fetoprotein and protein induced by vitamin K absence or antagonist-II for hepatocellular carcinoma. J Gastrointest Oncol. 2025;16(3):1157-1175.
  20. Pham TTT, Ho DT, Nguyen TB, Phan HT. Clinical performance of GAAD score, alpha-fetoprotein, and PIVKA-II in diagnosing hepatocellular carcinoma in the Vietnamese cohort. Discov Oncol. 2025;16:1813.
  21. Youden WJ. Index for rating diagnostic tests. Cancer. 1950;3(1):32-35.
  22. Tarao K et al. Real impact of tumor marker AFP and PIVKA-II in detecting very small hepatocellular carcinoma (≤2 cm, Barcelona stage 0): Assessment with a large number of cases. World J Hepatol. 2020;12(11):1046-1054.
  23. Kim DY et al. Utility of combining PIVKA-II and AFP in the surveillance and monitoring of hepatocellular carcinoma in the Asia-Pacific region. Clin Mol Hepatol. 2023;29(2):277-292.
  24. Kao SYZ et al. Cost-effectiveness of a precision hepatocellular carcinoma surveillance strategy in patients with cirrhosis. EClinicalMedicine. 2024;75:102755.

Reimpresiones y permisos

Etiquetas

Modelo diagnósticoregresión logísticabiomarcadores sanguíneosenfermedad hepática