Artigo de investigação

Integração de Protrombina Anormal (PIVKA-II), Alfa-Fetoproteína e Variáveis Clínicas Rotineiras para a Detecção Precoce do Carcinoma Hepatocelular

37 visualizações

DOI:

10.3791/70558

25 de agosto de 2026

Neste artigo

Resumo

Este protocolo descreve um fluxo de trabalho reprodutível para integrar PIVKA-II, AFP e variáveis clínicas de rotina em um modelo diagnóstico de regressão logística para carcinoma hepatocelular, com validação em estágios iniciais e na doença negativa para AFP.

Resumo

A detecção precoce do carcinoma hepatocelular (CHC) permanece limitada pela sensibilidade incompleta da alfafetoproteína (AFP), especialmente em tumores em estágio inicial e em tumores negativos para AFP. Este estudo avaliou se a protrombina anormal/proteína induzida pela ausência de vitamina K-II (PIVKA-II), AFP e variáveis clínicas de rotina poderiam ser integradas em um modelo diagnóstico reprodutível para CHC. Uma coorte de treinamento retrospectiva de 205 participantes, incluindo 112 casos confirmados por imagem de CHC e 93 controles sem CHC, foi utilizada para o desenvolvimento do modelo. Uma coorte de validação prospectiva e independente de 184 participantes, incluindo 58 casos de CHC e 126 controles sem CHC, foi utilizada para testes fora da amostra, sem reajuste do modelo. Amostras sanguíneas pré-imagem foram utilizadas para medição de AFP e PIVKA-II, e as variáveis clínicas foram extraídas da mesma janela diagnóstica. O modelo final de regressão logística multivariável combinou ln(AFP), ln(PIVKA-II), idade, sexo, albumina, razão normalizada internacional e contagem de plaquetas. O modelo combinado alcançou uma AUC de 0,93 na coorte de treinamento e de 0,89 na coorte de validação. Na validação, a sensibilidade foi de 84,5% e a especificidade foi de 90,5%. A sensibilidade manteve-se em 72,7% nos casos de CHC em estágio inicial e em 73,1% nos casos de CHC negativos para AFP, superando a AFP isolada em ambos os subgrupos. A calibração e a validação por reamostragem (bootstrap) indicaram estabilidade aceitável do modelo. Esses resultados demonstram como PIVKA-II, AFP e variáveis clínicas rotineiramente disponíveis podem ser combinadas em uma ferramenta diagnóstica prática de triagem para populações com doenças hepáticas de alto risco.

Introdução

O carcinoma hepatocelular (CHC) é uma das principais causas de mortalidade relacionada ao câncer e geralmente surge em pacientes com doença hepática crônica, incluindo infecção pelo vírus da hepatite B, infecção pelo vírus da hepatite C, doença hepática relacionada ao álcool e doença hepática esteatótica associada à disfunção metabólica1. A detecção precoce é clinicamente importante porque o tratamento curativo é mais eficaz quando os tumores são identificados antes da invasão vascular, da disseminação extra-hepática ou da acentuada deterioração da reserva hepática. Atualmente, as estratégias de vigilância baseiam-se geralmente na ultrassonografia hepática, com ou sem alfafetoproteína sérica (AFP)2. Na prática clínica habitual, contudo, o desempenho da vigilância é afetado pela dependência do operador, tamanho pequeno dos tumores, nódulos cirróticos heterogêneos, dificuldade de imagem relacionada à obesidade e tumores que produzem pouca ou nenhuma AFP3,4.

A AFP continua amplamente utilizada porque é barata, acessível e familiar aos clínicos. Seu valor diagnóstico é limitado pela sensibilidade incompleta e especificidade imperfeita. No limiar convencional de 20 ng/mL, a AFP pode deixar de detectar uma proporção considerável de casos de HCC em estágio inicial e de HCC negativo para AFP. Limiares mais baixos podem melhorar a sensibilidade, mas aumentam os resultados falso-positivos em pacientes com hepatite ativa, cirrose ou outras condições inflamatórias hepáticas5,6. Essas limitações tornam a interpretação com base em um único marcador insuficiente para triagem diagnóstica em populações com alto risco de doenças hepáticas.

A protrombina anormal, também conhecida como proteína induzida pela ausência de vitamina K-II (PIVKA-II) ou protrombina des-γ-carboxilada, é liberada quando hepatócitos malignos produzem protrombina incompletamente carboxilada. A PIVKA-II reflete a biologia tumoral relacionada à coagulação, e não à secreção de AFP, e pode permanecer informativa quando os níveis de AFP são baixos7. Estudos anteriores e metanálises demonstraram que a PIVKA-II melhora a detecção do carcinoma hepatocelular (HCC), especialmente quando combinada com AFP, e pode agregar valor em estágios iniciais da doença ou nos casos negativos para AFP8,9. No entanto, estratégias baseadas apenas em marcadores não levam plenamente em consideração o contexto do hospedeiro, a reserva hepática, a contagem de plaquetas, o estado da coagulação ou a doença hepática subjacente.

Modelos diagnósticos compostos oferecem uma maneira prática de interpretar resultados de marcadores tumorais em conjunto com o contexto clínico. GALAD, GAAD e modelos relacionados demonstraram que variáveis demográficas e biomarcadores podem ser combinados para melhorar a detecção de CHC em diferentes etiologias e populações10,11. O desempenho desses modelos apoia o uso de estimativas de risco multivariáveis em vez de limiares isolados de biomarcadores. Ao mesmo tempo, alguns modelos incluem ensaios que não estão disponíveis em todos os laboratórios, e o comportamento dos pontos de corte pode variar entre regiões, perfis etiológicos, estágios da doença e usos clínicos pretendidos12. Um modelo construído a partir de biomarcadores amplamente disponíveis e variáveis laboratoriais de rotina pode ser mais fácil de implementar em fluxos de trabalho diagnósticos comuns. Diferentemente de modelos publicados anteriormente, que podem depender de biomarcadores especializados ou estratégias de pontos de corte específicas para determinadas populações, o presente estudo avaliou um modelo diagnóstico multivariável baseado em biomarcadores amplamente disponíveis e variáveis clínicas rotineiras e validou seu desempenho em uma coorte prospectiva independente.

A PIVKA-II é adequada a esta estrutura porque complementa a AFP e pode ser medida em plataformas automatizadas de imunoensaio já utilizadas em laboratórios clínicos. Variáveis de rotina, como idade, sexo, albumina, bilirrubina, contagem de plaquetas, razão normalizada internacional e histórico de doença hepática, estão disponíveis na mesma consulta clínica e podem captar informações relacionadas à reserva hepática ou à coagulação relevantes para o risco de CHC13. A combinação dessas variáveis com AFP e PIVKA-II pode melhorar a discriminação, evitando a dependência de um único ponto de corte.

PIVKA-II, AFP e variáveis clínicas de rotina foram, portanto, avaliadas utilizando um desenho diagnóstico com duas coortes. Um modelo de regressão logística multivariável foi desenvolvido em uma coorte de treinamento retrospectiva e testado em uma coorte de validação prospectiva independente, sem reajuste. O desempenho diagnóstico foi comparado com o de AFP, PIVKA-II e variáveis clínicas isoladamente, com atenção predefinida para HCC em estágio inicial, HCC negativo para AFP, interpretação de pontos de corte, calibração e validação interna por bootstrap.

Protocolo

Este estudo foi revisado e aprovado pelo Comitê de Ética do Hospital Municipal de Hangzhou, Afiliado à Escola de Medicina da Universidade Westlake. O número de aprovação foi IIT-20230528-0108-01. O consentimento informado por escrito foi obtido dos participantes recrutados prospectivamente antes da coleta de sangue. Para registros clínicos incluídos retrospectivamente e espécimes residuais arquivados coletados durante atendimento de rotina, o consentimento informado foi dispensado pelo comitê de ética, pois foram utilizados dados sem identificação e nenhuma intervenção adicional foi realizada.

Reprodutibilidade, controle de viés e integridade dos dados

Critérios de elegibilidade, pontos temporais de coleta de sangue, regras de adjudicação de imagens, definições de subgrupos, preditores candidatos, definições de pontos de corte, regras para dados ausentes e procedimentos de validação foram pré-especificados antes da análise estatística. As amostras de sangue foram coletadas antes da confirmação por imagem com contraste e antes de qualquer tratamento antitumoral. Os testes laboratoriais utilizaram identificadores de estudo anônimos, e as amostras dos grupos de treinamento e validação foram analisadas em ordem aleatória. O pessoal do laboratório estava cegado quanto ao diagnóstico final, à alocação no grupo, ao estágio do Barcelona Clinic Liver Cancer (BCLC) e ao status de negatividade para AFP. O diagnóstico e o estadiamento por imagem foram realizados independentemente dos testes laboratoriais. A entrada de dados, conversão de unidades, alocação nos grupos, codificação de exclusões, codificação de valores ausentes e conjuntos de dados estatísticos foram verificados por dois pesquisadores antes do ajuste do modelo. Os grupos de treinamento e validação foram mantidos separados durante toda a seleção de variáveis, ajuste do modelo, derivação dos pontos de corte e validação.

População e desenho do estudo

Este estudo diagnóstico com duas coortes desenvolveu e validou um modelo multivariável para detecção de CHC utilizando protrombina anormal/proteína induzida por PIVKA-II, AFP e variáveis clínicas de rotina. A coorte de treinamento, montada retrospectivamente, incluiu participantes avaliados entre 1º de janeiro de 2021 e 31 de dezembro de 2023. Essa coorte foi utilizada para seleção de variáveis, ajuste do modelo, derivação de ponto de corte e validação interna por bootstrap. A coorte de validação, recrutada prospectivamente, incluiu participantes avaliados entre 1º de janeiro de 2024 e 31 de dezembro de 2025. Essa coorte foi utilizada exclusivamente para testes com amostras externas. Nenhuma reseleção de variáveis, reajuste do modelo, atualização de coeficientes, reotimização de ponto de corte ou recálculo baseado em subgrupos foi realizada na coorte de validação. O fluxo de participantes, alocação nas coortes, coleta de sangue, processamento de plasma, testes de biomarcadores, interpretação de imagens e fluxo de análise estatística estão apresentados na Figura 1.

Os participantes foram recrutados a partir de uma via de vigilância ou diagnóstico de doenças hepáticas de alto risco no Hospital Popular N.º 1 Afiliado de Hangzhou, Escola de Medicina da Westlake University. O status de alto risco foi definido como infecção crônica pelo vírus da hepatite B, infecção crônica pelo vírus da hepatite C, cirrose de qualquer etiologia ou doença hepática gordurosa com fibrose documentada com base em avaliação clínica, registros laboratoriais ou exames de imagem anteriores. Os participantes elegíveis eram adultos com idade ≥18 anos que realizaram coleta sanguínea pré-imagem e tomografia computadorizada multiphasica com contraste (TC) e/ou ressonância magnética dinâmica com contraste (RNM) dentro de 14 dias após a coleta de sangue. Os critérios de exclusão incluíam tratamento prévio de carcinoma hepatocelular, incluindo ressecção, ablação, terapia transarterial ou terapia sistêmica; administração de vitamina K nos 7 dias anteriores à coleta; uso de antagonistas da vitamina K ou outra terapia anticoagulante que pudesse afetar a interpretação da coagulação; colangite aguda ou obstrução biliar no momento da coleta; gravidez; ausência de AFP, PIVKA-II ou diagnóstico final por imagem; e qualidade inaceitável da amostra sem uma nova amostra válida disponível.

A população final do estudo incluiu 389 participantes. A coorte de treinamento incluiu 205 participantes, compreendendo 112 casos de CHC confirmados por imagem e 93 controles sem CHC. A coorte de validação incluiu 184 participantes, compreendendo 58 casos de CHC confirmados por imagem e 126 controles sem CHC. Na coorte de treinamento, os 93 controles sem CHC incluíram 30 controles saudáveis e 63 controles com doença hepática crônica. Na coorte de validação, os 126 controles sem CHC incluíram 0 controles saudáveis e 126 controles com doença hepática crônica.

O status sintomático não foi atribuído com base apenas no histórico de hepatite ou cirrose compensada. Um participante foi classificado como sintomático somente quando o registro pré-imagem documentou dor nova ou agravada no quadrante superior direito, perda inexplicada de peso, distensão abdominal, icterícia, urina escura ou descompensação clinicamente documentada não explicada por outra causa confirmada. Participantes sem esses achados foram classificados como assintomáticos ou com detecção por vigilância.

Adjudicação diagnóstica e estadiamento

O status final de CHC foi determinado mediante tomografia computadorizada multiphasica com contraste e/ou ressonância magnética dinâmica com contraste realizadas no atendimento de rotina. Exigia-se que a imagem incluísse pelo menos uma fase arterial e uma fase venosa portal; os achados da fase tardia foram incorporados quando disponíveis. Uma lesão foi classificada como CHC quando a imagem em um fígado de risco mostrou hipercaptação na fase arterial com eliminação na fase venosa portal e/ou fase tardia, com ou sem cápsula realçada. Os participantes sem características de imagem compatíveis com CHC e sem outro diagnóstico maligno foram classificados como não CHC.

As informações de imagem foram extraídas com um formulário previamente especificado que registrava a modalidade de imagem, as fases obtidas, hipercaptação na fase arterial, washout, aparência da cápsula, número de lesões, diâmetro máximo da lesão, invasão macrovascular e disseminação extraparenquimatosa. Dois leitores treinados extraíram independentemente as características de imagem dos laudos radiológicos finais. Os desacordos foram resolvidos por consenso, utilizando os mesmos critérios pré-definidos. Quando tanto a TC quanto a RNM estavam disponíveis, a modalidade com a caracterização multiphasica mais completa foi utilizada. Se ambas as modalidades estavam completas, utilizou-se a modalidade documentada como base para a decisão clínica final.

O estadiamento BCLC foi atribuído após a confirmação do status do HCC. O HCC em estágio inicial foi definido como estadiamento BCLC 0–A. O HCC negativo para AFP foi definido como AFP <20 ng/mL na coleta sanguínea pré-imagem. Essas categorias de subgrupo foram utilizadas para avaliação do desempenho por subgrupo, não para o treinamento do modelo ou elegibilidade dos participantes.

Coleta de amostras e processamento do plasma

O sangue venoso periférico foi coletado pela manhã após jejum noturno de pelo menos 8 h, antes da confirmação por tomografia computadorizada ou ressonância magnética com contraste e antes da terapia antitumoral. Foram coletados 10 mL de sangue venoso em tubos de coleta sanguínea com anticoagulante K2-EDTA. Os tubos foram invertidos 8–10 vezes imediatamente após a coleta e transportados ao laboratório a 4 °C. O intervalo entre a punção venosa e a centrifugação foi mantido dentro de 2 h e registrado no log de amostras.

O plasma foi separado por centrifugação a 1.600 × g durante 10 min a 4 °C utilizando uma centrífuga refrigerada. O sobrenadante plasmático foi transferido para tubos microcentrífuga de 1,5 mL livres de nucleases e fracionado em alíquotas de 0,5–1,0 mL. As alíquotas foram armazenadas a -80 °C até o momento da análise. Antes da medição dos biomarcadores, uma alíquota foi descongelada uma única vez à temperatura ambiente, 20–25 °C, durante 20–30 min, misturada suavemente por inversão e analisada dentro de 2 h após o completo descongelamento. Amostras com coagulação visível, hemólise moderada a grave ou lipemia acentuada foram rejeitadas de acordo com critérios pré-definidos de aceitação laboratorial. Para a coorte de validação prospectiva, foi realizada coleta repetida de sangue antes da confirmação por imagem, quando clinicamente viável.

Medição de AFP e PIVKA-II

AFP e PIVKA-II foram medidos utilizando ensaios imunométricos por eletroquimioluminescência em um analisador imunológico automatizado. O AFP foi registrado em ng/mL e o PIVKA-II em mAU/mL. Os resultados foram exportados diretamente do sistema de informação laboratorial.

Cada lote analítico incluiu calibradores específicos para o ensaio e pelo menos dois níveis internos de controle de qualidade. A aceitação do lote exigia que todos os resultados do controle de qualidade estivessem dentro do intervalo de controle laboratorial predefinido. Os alvos de precisão analítica eram um coeficiente de variação dentro da corrida ≤10% e um coeficiente de variação entre corridas ≤15% para AFP e PIVKA-II. Se o controle de qualidade falhasse ou fosse detectado desvio do lote, o lote era rejeitado, o analisador era recalibrado e o lote era repetido quando restasse volume suficiente de amostra. Para um resultado individual implausível ou fora do intervalo, realizavam-se duas medições repetidas do mesmo alíquota descongelada, quando possível, e usava-se a média dos dois valores repetidos aceitos. Se a reanálise falhasse ou o volume da amostra fosse insuficiente, o resultado era marcado como inválido e tratado de acordo com a regra para dados ausentes.

Extração rotineira de variáveis clínicas

Variáveis clínicas de rotina foram extraídas do mesmo encontro clínico da coleta sanguínea pré-imagem de AFP/PIVKA-II. As variáveis candidatas incluíram idade, sexo, alanina aminotransferase, aspartato aminotransferase, albumina, bilirrubina total, razão normalizada internacional (INR), tempo de protrombina e contagem de plaquetas. Quando múltiplos valores estavam disponíveis dentro do período pré-imagem, o valor mais próximo ao momento da coleta de AFP/PIVKA-II foi selecionado. As unidades foram padronizadas antes da análise. A idade foi registrada em anos; o sexo foi codificado como feminino = 0 e masculino = 1; a contagem de plaquetas foi registrada como ×10⁹/L; a albumina foi registrada como g/L; a bilirrubina total foi registrada como μmol/L; a AFP foi registrada como ng/mL; e a PIVKA-II foi registrada como mAU/mL.

Foram realizados testes de faixa, testes de unidade e testes de valores implausíveis após a extração. Os valores sinalizados foram verificados em comparação com os registros de origem. Um valor foi excluído apenas quando o registro de origem confirmou um problema de qualidade da amostra, erro de conversão de unidade ou desvio no processamento. Valores extremos verificados foram mantidos. O dicionário de variáveis definiu a estrutura do conjunto de dados, nomes das variáveis, unidades, regras de codificação, regras de transformação e códigos para valores ausentes.

Definição do preditor e seleção de variáveis

Os preditores candidatos foram definidos antes do desenvolvimento do modelo. Os biomarcadores principais foram AFP e PIVKA-II. Os candidatos clínicos de rotina foram idade, sexo, alanina aminotransferase, aspartato aminotransferase, albumina, bilirrubina total, INR ou tempo de protrombina e contagem de plaquetas. AFP e PIVKA-II foram transformados pelo logaritmo natural. Valores abaixo do limite de detecção do ensaio foram substituídos pela metade do limite inferior de detecção antes da transformação.

As comparações univariadas entre participantes com HCC e sem HCC na coorte de treinamento utilizaram testes t para amostras independentes para variáveis aproximadamente normalmente distribuídas, testes Mann-Whitney U para variáveis contínuas assimétricas e testes χ² ou exatos de Fisher para variáveis categóricas. As variáveis com P < 0,10 na triagem univariada foram consideradas para modelagem multivariável. A multicolinearidade foi avaliada por meio do fator de inflação de variância (VIF), e VIF >5 foi considerado indicativo de colinearidade preocupante. Quando duas variáveis eram fortemente colineares, mantinha-se a variável com melhor interpretabilidade clínica e desempenho incremental do modelo.

O modelo final de regressão logística multivariável foi desenvolvido apenas na coorte de treinamento. ln(AFP) e ln(PIVKA-II) foram incluídos obrigatoriamente no modelo. Os preditores adicionais foram selecionados por eliminação progressiva orientada pelo critério de informação de Akaike. Após a seleção regressiva, as variáveis mantidas foram ln(AFP), ln(PIVKA-II), idade, sexo, albumina, INR e contagem de plaquetas.

Desenvolvimento do modelo e cálculo do escore de risco

O modelo diagnóstico foi ajustado utilizando regressão logística multivariável com o status de HCC como resultado binário. A probabilidade prevista de HCC foi calculada a partir do preditor linear η usando a seguinte equação:

p(HCC)=1/[1+exp(-η)]

η = -4,862+0,247×ln(AFP)+0,712×ln(PIVKA-II)+0,018×idade+0,331×sexo-0,062×albumina+0,554×INR-0,004×contagem_de_plaquetas

A AFP foi medida em ng/mL, a PIVKA-II em mAU/mL, a idade em anos, o sexo foi codificado como feminino = 0 e masculino = 1, a albumina foi medida em g/L, o INR era adimensional e a contagem de plaquetas foi medida em ×109/L. Foram utilizados logaritmos naturais para AFP e PIVKA-II. Um nomograma foi gerado a partir dos mesmos coeficientes ajustados. A probabilidade prevista, e não a escala de pontos do nomograma, foi utilizada para análise da curva característica de operação do receptor (ROC), análise de calibração, análise da curva de decisão e validação.

Definições de ponto de corte e tratamento de limiares

Os limiares da PIVKA-II foram rotulados de acordo com a finalidade analítica. O ponto de corte clínico estabelecido para a PIVKA-II foi de 40,0 mAU/mL. O ponto de corte de Youden da coorte de treinamento para a PIVKA-II foi de 45,0 mAU/mL. O ponto de corte de especificidade fixa foi determinado pela seleção do limiar mais próximo a 90% de especificidade na coorte de treinamento; isso resultou em 38,0 mAU/mL para a PIVKA-II. Um limiar aparente exclusivo para validação de 37,5 mAU/mL foi considerado exploratório e não foi utilizado como ponto de corte primário de validação.

Para o modelo combinado, o ponto de corte binário primário foi derivado da coorte de treinamento utilizando o índice de Youden e aplicado inalterado à coorte de validação. A AFP utilizou o ponto de corte clínico estabelecido de 20,0 ng/mL para a definição do subgrupo negativo para AFP e para comparação com a prática habitual. Os pontos de corte otimizados de AFP utilizados na análise ROC foram rotulados separadamente do limiar clínico. Assim, os pontos de corte foram relatados conforme a finalidade analítica, e não tratados como limiares intercambiáveis.

Desempenho, calibração e validação do modelo

A discriminação foi avaliada por meio de curvas de característica de operação do receptor e área sob a curva. As AUCs foram apresentadas com intervalos de confiança de 95%. As comparações das AUCs utilizaram o teste de DeLong. O desempenho da classificação foi relatado como sensibilidade, especificidade, valor preditivo positivo, valor preditio negativo e acurácia em pontos de corte pré-especificados.

A calibração foi avaliada por meio do intercepto de calibração, inclinação da calibração, pontuação de Brier e teste de bondade do ajuste de Hosmer–Lemeshow. Gráficos de calibração compararam as probabilidades previstas e observadas de CHC em diferentes grupos de risco. A validação interna utilizou 1.000 reamostragens por bootstrap na coorte de treinamento para estimar a AUC corrigida para otimismo e a inclinação da calibração corrigida para otimismo. A coorte de validação foi utilizada exclusivamente para avaliação externa de desempenho. Nenhuma atualização de coeficientes, refitting do modelo, reotimização de limiares ou recalibração baseada em subgrupos foi realizada na coorte de validação.

A utilidade clínica foi avaliada utilizando análise de curva de decisão em probabilidades limiares de 0,05 a 0,50. O benefício líquido foi comparado para AFP isolada, PIVKA-II isolada, o modelo baseado em variáveis clínicas e o modelo combinado.

Tratamento de dados ausentes e análise de sensibilidade

A análise primária utilizou modelagem com casos completos para participantes com todas as variáveis retidas no modelo final. Os valores ausentes foram resumidos para cada preditor candidato. Se a ausência excedesse 5% para qualquer preditor retido, foi realizada imputação múltipla por equações encadeadas como análise de sensibilidade, utilizando o desfecho, todos os preditores retidos e o indicador de coorte no modelo de imputação. Variáveis com ausência superior a 20% não eram elegíveis para modelagem multivariável. Os coeficientes do modelo, AUC, inclinação de calibração e métricas de classificação da análise com imputação foram comparados com os resultados obtidos com casos completos.

Software e relato reproduzível

Todas as análises foram realizadas utilizando o R versão 4.3.2 e o RStudio versão 2023.12.1. A regressão logística foi realizada utilizando o pacote base stats. A análise ROC e as comparações de DeLong foram realizadas utilizando o pROC versão 1.18.5. A análise de calibração foi realizada utilizando o rms versão 6.7-1 e o ResourceSelection versão 0.3-6. A validação por bootstrap utilizou 1.000 reamostragens com uma semente aleatória fixa de 70558. A análise da curva de decisão foi realizada utilizando o rmda versão 1.6. A imputação múltipla, se necessária, foi realizada utilizando o mice versão 3.16.0. O script de análise reproduziu o fluxo de participantes, os coeficientes do modelo, as curvas ROC, as métricas de calibração, a validação por bootstrap, a análise da curva de decisão, as análises baseadas em pontos de corte e as tabelas estatísticas.

Resultados

Características basais

A análise final incluiu 389 participantes. A coorte de treinamento incluiu 205 participantes, compreendendo 112 casos de CHC confirmados por imagem e 93 controles sem CHC. A coorte de validação incluiu 184 participantes, compreendendo 58 casos de CHC confirmados por imagem e 126 controles sem CHC. As características basais são resumidas na Tabela 1.

Na coorte de treinamento, os 93 controles sem CHC incluíram 30 controles saudáveis e 63 controles com doença hepática crônica. Na coorte de validação, os 126 controles sem CHC incluíram 0 controles saudáveis e 126 controles com doença hepática crônica. A infecção pelo vírus da hepatite B foi a doença hepática de base predominante. A doença BCLC 0–A representou 57 dos 112 casos de CHC na coorte de treinamento e 30 dos 58 casos de CHC na coorte de validação. Idade, sexo, histórico de doença hepática, histórico familiar de CHC, status de cirrose, classe Child-Pugh, alanina aminotransferase, aspartato aminotransferase, albumina, bilirrubina total, contagem de plaquetas, tempo de protrombina, razão normalizada internacional, diabetes e hipertensão foram equilibrados entre os estratos da coorte relatados na Tabela 1.

A AFP mediana foi de 57,3 ng/mL nos casos de HCC do grupo de treinamento e de 22,4 ng/mL nos controles não-HCC do grupo de treinamento. A PIVKA-II mediana foi de 197,6 mAU/mL e 86,3 mAU/mL, respectivamente. Na coorte de validação, a AFP mediana foi de 60,2 ng/mL nos casos de HCC e de 21,5 ng/mL nos controles não-HCC. A PIVKA-II mediana foi de 191,5 mAU/mL e 84,1 mAU/mL, respectivamente.

Desempenho diagnóstico da coorte de treinamento

A discriminação na coorte de treinamento é mostrada na Figura 2(A), e a comparação correspondente de sensibilidade e especificidade é apresentada na Figura 2(B). As características operacionais são resumidas na Tabela 2. A AFP apresentou uma AUC de 0,78, sensibilidade de 62,50% e especificidade de 78,49% no valor de corte clínico estabelecido de 20,0 ng/mL. A PIVKA-II apresentou uma AUC de 0,85, sensibilidade de 78,57% e especificidade de 82,80% no valor de corte de Youden da coorte de treinamento de 45,0 mAU/mL. O modelo com variáveis clínicas apresentou uma AUC de 0,81, sensibilidade de 69,64% e especificidade de 80,65% em um limiar de probabilidade predita de 0,40. O modelo combinado apresentou a maior discriminação na coorte de treinamento, com uma AUC de 0,93, sensibilidade de 88,39% e especificidade de 89,25% em um limiar de probabilidade predita de 0,50.

Desempenho estratificado por estágio

As distribuições de biomarcadores estratificadas por estágio são mostradas na Figura 3(A), as taxas de detecção na Figura 3(B) e as AUCs específicas por estágio na Figura 3(C). AFP, PIVKA-II e o escore do modelo combinado aumentaram ao longo dos estágios BCLC 0–A, B e C da doença. A AFP apresentou sobreposição entre o HCC em estágio inicial e os controles sem HCC. O PIVKA-II mostrou maior separação entre os estratos por estágio. O modelo combinado proporcionou a melhor discriminação estratificada por estágio, inclusive no HCC BCLC 0–A.

Complementaridade entre AFP e PIVKA-II

As correlações entre marcadores e escores são mostradas na Figura 4(A)-(C), e a classificação cruzada dos marcadores é apresentada na Figura 4(D). AFP e PIVKA-II mostraram parcial sobreposição. Foram observados casos de CHC positivos para AFP/negativos para PIVKA-II e casos de CHC negativos para AFP/positivos para PIVKA-II. O modelo combinado classificou casos adicionais de CHC negativos para um único marcador como alto risco, apoiando o uso do escore integrado em vez de qualquer biomarcador isoladamente.

Validação externa

As curvas ROC da coorte de validação são mostradas na Figura 5(A), a calibração é apresentada na Figura 5(B) e os padrões de sensibilidade e especificidade por subgrupo são exibidos na Figura 5(C). As métricas correspondentes de validação estão resumidas na Tabela 3. Em todos os casos de CHC validados, a AFP apresentou uma AUC de 0,75, sensibilidade de 62,1% e especificidade de 88,9% em 18,5 ng/mL. A PIVKA-II apresentou uma AUC de 0,78, sensibilidade de 72,4% e especificidade de 91,3% em 38,0 mAU/mL. O modelo combinado apresentou uma AUC de 0,89, sensibilidade de 84,5%, especificidade de 90,5%, valor preditivo positivo de 78,8% e valor preditivo negativo de 94,1% em um limiar de probabilidade predita de 0,56.

No HCC em estágio inicial, a AFP apresentou sensibilidade de 45,5% e especificidade de 88,9%, a PIVKA-II apresentou sensibilidade de 59,1% e especificidade de 91,3%, e o modelo combinado apresentou sensibilidade de 72,7% e especificidade de 90,5%. No HCC negativo para AFP, a sensibilidade da AFP foi de 23,1%, a sensibilidade da PIVKA-II foi de 61,5% e a sensibilidade do modelo combinado foi de 73,1%. No HCC viral, o modelo combinado apresentou sensibilidade de 85,3% e especificidade de 91,3%. No HCC não viral, o modelo combinado apresentou sensibilidade de 83,3% e especificidade de 89,7%. O intercepto de calibração na coorte de validação foi de -0,08, a inclinação da calibração foi de 0,91, o escore de Brier foi de 0,118 e o valor de P de Hosmer–Lemeshow foi de 0,64.

Regressão multivariável e validação interna

Os resultados da regressão multivariável são apresentados na Tabela 4. No modelo ajustado, a PIVKA-II com transformação logarítmica manteve-se como o preditor independente mais forte, com uma razão de chances ajustada de 2,05, IC 95%: 1,48-2,89 e P < 0,001. A AFP com transformação logarítmica também esteve independentemente associada ao CHC, com uma razão de chances ajustada de 1,28, IC 95%: 1,05-1,62 e P = 0,021. A razão de normalização internacional manteve valor preditivo independente, com uma razão de chances ajustada de 1,74, IC 95%: 1,12-2,78 e P = 0,015. O modelo final com seleção regressiva manteve ln(AFP), ln(PIVKA-II), idade, sexo, albumina, razão de normalização internacional e contagem de plaquetas.

As métricas de validação interna por bootstrap também são apresentadas na Tabela 4. A AUC de treinamento aparente foi de 0,93, o otimismo médio foi de 0,018 e a AUC corrigida para otimismo foi de 0,91. A inclinação de calibração aparente foi de 1,00, a inclinação de calibração corrigida para otimismo foi de 0,94, o escore de Brier na coorte de treinamento foi de 0,104 e o valor P de Hosmer–Lemeshow foi de 0,72.

Análise do ponto de corte e desempenho específico do limiar

Como os limiares da PIVKA-II variavam conforme o objetivo analítico, os resultados baseados em pontos de corte foram relatados separadamente, em vez de serem considerados intercambiáveis. O desempenho do ponto de corte otimizado por Youden em análise post hoc é apresentado na Tabela 5. A AFP apresentou um ponto de corte otimizado por Youden de 19,0 ng/mL, com sensibilidade de 67,9%, especificidade de 89,1%, valor preditivo positivo de 71,3%, valor preditivo negativo de 87,3%, acurácia de 81,2% e AUC de 0,78. A PIVKA-II apresentou um ponto de corte otimizado por Youden de 37,5 mAU/mL, com sensibilidade de 75,4%, especificidade de 92,0%, valor preditivo positivo de 79,8%, valor preditivo negativo de 89,7%, acurácia de 85,9% e AUC de 0,82. O modelo combinado apresentou um ponto de corte previsto otimizado por Youden de 0,57, com sensibilidade de 86,2%, especificidade de 90,6%, valor preditivo positivo de 82,7%, valor preditivo negativo de 92,4%, acurácia de 89,8% e AUC de 0,90.

O desempenho utilizando os pontos de corte clínicos estabelecidos é apresentado na Tabela 6. No ponto de corte estabelecido de AFP de 20,0 ng/mL, a AFP apresentou sensibilidade de 65,2%, especificidade de 88,5%, valor preditivo positivo de 70,1%, valor preditivo negativo de 86,0%, acurácia de 80,3% e AUC de 0,77. No ponto de corte estabelecido de PIVKA-II de 40,0 mAU/mL, o PIVKA-II apresentou sensibilidade de 73,0%, especificidade de 93,1%, valor preditivo positivo de 81,8%, valor preditivo negativo de 89,0%, acurácia de 85,6% e AUC de 0,82. Em um limiar de probabilidade predita de 0,60, o modelo combinado apresentou sensibilidade de 83,5%, especificidade de 92,0%, valor preditivo positivo de 84,7%, valor preditivo negativo de 91,2%, acurácia de 88,9% e AUC de 0,89.

O desempenho no ponto de corte mais próximo à especificidade de 90% é apresentado na Tabela 7. A AFP utilizou um ponto de corte de 19,0 ng/mL, com sensibilidade de 67,9% e especificidade de 89,1%. A PIVKA-II utilizou um ponto de corte de 37,5 mAU/mL, com sensibilidade de 75,4% e especificidade de 92,0%. O modelo combinado utilizou um ponto de corte de probabilidade prevista de 0,57, com sensibilidade de 86,2% e especificidade de 90,6%. Esses resultados da auditoria de pontos de corte explicam as diferenças numéricas entre os limiares de PIVKA-II de 37,5, 38,0, 40,0 e 45,0 mAU/mL: 45,0 mAU/mL foi o ponto de corte de Youden do conjunto de treinamento, utilizado para a comparação primária de treinamento; 38,0 mAU/mL foi utilizado para relatórios de especificidade fixa na validação; 40,0 mAU/mL foi o ponto de corte clínico estabelecido; e 37,5 mAU/mL foi o ponto de corte otimizado post hoc por Youden na tabela de auditoria de pontos de corte.

Distribuições por subgrupo de doença

As distribuições por subgrupo de doença de AFP, PIVKA-II e do escore do modelo combinado são apresentadas na Figura 6(A)-(C). AFP, PIVKA-II e o escore do modelo combinado foram mais baixos nos controles com doença hepática crônica e mais altos nos grupos com CHC. AFP apresentou sobreposição entre controles com doença hepática crônica e CHC em estágio inicial. PIVKA-II e o escore do modelo combinado mostraram uma separação mais clara entre controles com doença hepática crônica, CHC em estágio inicial e CHC em todos os estágios.

DISPONIBILIDADE DE DADOS:

O conjunto de dados que sustenta as descobertas deste estudo está disponibilizado publicamente no Figshare em https://doi.org/10.6084/m9.figshare.33048095.v1.

Fluxograma do estudo de doença hepática; diagnóstico, processamento de plasma, imunomedição, arbitragem por TC/RM.
Figura 1: Fluxo dos participantes, atribuição de coortes, processamento de amostras e arbitragem diagnóstica. Fluxograma mostrando triagem dos participantes, alocação em coortes, coleta de sangue antes da imagem, processamento de plasma, medição de AFP/PIVKA-II, avaliação por TC/RM com contraste e arbitragem final de CHC baseada em imagem nas coortes de treinamento e validação. Clique aqui para visualizar uma versão maior desta figura.

Curva ROC e gráfico de barras mostrando sensibilidade, especificidade e valores de AUC para AFP, PIVKA-II, modelo clínico e modelo combinado.
Figura 2: Desempenho diagnóstico no grupo de treinamento para AFP, PIVKA-II, modelo baseado em variáveis clínicas e modelo combinado. (A) Curvas da característica operacional do receptor comparando AFP, PIVKA-II, o modelo baseado em variáveis clínicas e o modelo combinado multivariável no grupo de treinamento. (B) Sensibilidade e especificidade de cada método diagnóstico no limiar informado para o grupo de treinamento. Clique aqui para visualizar uma versão maior desta figura.

As características operacionais correspondentes são resumidas na Tabela 2.

Análise de detecção de CHC; gráficos; AFP, PIVKA-II, modelo combinado; taxas de detecção, resultados de AUC.
Figura 3: Desempenho diagnóstico estratificado por estádio nos estádios BCLC. (A) Distribuições da AFP, PIVKA-II e do escore do modelo combinado entre controles sem CHC e grupos por estádio BCLC. (B) Taxas de detecção da AFP, PIVKA-II e do modelo combinado nos diferentes estádios BCLC. (C) AUCs específicos por estádio para AFP, PIVKA-II e o modelo combinado, incluindo CHC nos estádios BCLC 0–A. Clique aqui para visualizar uma versão maior desta figura.

Gráficos analisando os níveis de AFP e PIVKA-II, correlação de Spearman e gráfico de distribuição de casos de CHC.
Figura 4: Correlação e complementaridade entre AFP, PIVKA-II e o escore do modelo combinado. (A) Correlação entre AFP e o escore do modelo combinado. (B) Correlação entre PIVKA-II e o escore do modelo combinado. (C) Correlação entre AFP e PIVKA-II. (D) Classificação cruzada dos casos de CHC por status de AFP, status de PIVKA-II e classificação de risco do modelo combinado. Clique aqui para visualizar uma versão maior desta figura.

Curvas ROC, curvas de calibração, gráfico de barras para AFP, PIVKA-II na análise de desempenho do modelo de CHC.
Figura 5: Validação externa do desempenho diagnóstico na coorte de validação independente. (A) Curvas de característica operacional do receptor da coorte de validação para AFP, PIVKA-II e o modelo combinado. (B) Gráfico de calibração do modelo combinado na coorte de validação. (C) Sensibilidade e especificidade comparativas de AFP, PIVKA-II e do modelo combinado em todos os casos de CHC, CHC em estágio inicial e CHC com AFP negativo. As métricas correspondentes de validação são resumidas na Tabela 3. Clique aqui para visualizar uma versão maior desta figura.

Gráfico de caixa comparando os níveis de AFP, PIVKA-II e escore do modelo combinado em doenças hepáticas versus estágios de CHC.
Figura 6: Distribuições por subgrupo de doença de AFP, PIVKA-II e escore do modelo combinado. (A) Distribuição de AFP entre controles com doença hepática crônica, CHC BCLC 0–A e CHC em todos os estágios. (B) Distribuição de PIVKA-II entre controles com doença hepática crônica, CHC BCLC 0–A e CHC em todos os estágios. (C) Distribuição do escore do modelo combinado entre controles com doença hepática crônica, CHC BCLC 0–A e CHC em todos os estágios. Clique aqui para visualizar uma versão maior desta figura.

FatorCategoria / ResumoTreinamento em CCH
n = 112 
Treinamento de controles não-HCC
n = 93
Validação HCC n = 58Controles de validação não-HCC
 n = 126
P valor
Sexo, n (%)Masculino76 (67.9%)59 (63.4%)39 (67.2%)76 (60.3%)0.374
Feminino36 (32.1%)34 (36.6%)19 (32.8%)50 (39.7%)
Idade, anosMédia ± DP58.9 ± 9.358.1 ± 10.459.4 ± 8.857.6 ± 9.70.281
Histórico de doença hepática, n (%)HBV84 (75.0%)64 (68.8%)42 (72.4%)83 (65.9%)0.332
HCV6 (5.4%)5 (5.4%)3 (5.2%)7 (5.6%)0.914
Doença hepática alcoólica13 (11.6%)10 (10.8%)6 (10.3%)12 (9.5%)0.825
Histórico familiar de CHC, n (%)Sim9 (8.0%)7 (7.5%)4 (6.9%)8 (6.3%)0.887
Cirrose hepática, n (%)Sim80 (71.4%)61 (65.6%)42 (72.4%)88 (69.8%)0.468
Estágio do CHC (BCLC), n (%)0–A57 (50.9%)30 (51.7%)
B33 (29.5%)17 (29.3%)
C22 (19.6%)11 (19.0%)
Classe Child–Pugh, n (%)A85 (75.9%)77 (82.8%)43 (74.1%)101 (80.2%)0.341
B27 (24.1%)16 (17.2%)15 (25.9%)25 (19.8%)
ALT, U/LMédia ± DP48.6 ± 22.147.1 ± 20.647.9 ± 22.445.2 ± 20.10.517
AST, U/LMédia ± DP60.3 ± 28.558.0 ± 27.858.7 ± 29.456.2 ± 26.90.488
Albumina, g/LMédia ± DP39.0 ± 4.739.5 ± 4.638.7 ± 5.139.6 ± 4.50.554
bilirrubina total, μmol/LMédia ± DP20.1 ± 11.318.6 ± 10.820.4 ± 11.618.1 ± 10.90.321
Contagem de plaquetas, ×10⁹/LMédia ± DP137 ± 61146 ± 59134 ± 60149 ± 570.437
Tempo de protrombina, sMédia ± DP13.7 ± 1.413.5 ± 1.313.8 ± 1.513.5 ± 1.20.411
INRMédia ± DP1.18 ± 0.121.16 ± 0.111.19 ± 0.131.15 ± 0.100.334
AFP, ng/mLMediana (IIQ)57.3 (19.8–135.1)22.4 (10.4–46.0)60.2 (20.6–131.7)21.5 (9.8–48.1)0.071
PIVKA-II, mAU/mLMediana (IIQ)197.6 (83.1–438.2)86.3 (38.6–131.2)191.5 (81.4–422.5)84.1 (37.1–129.4)0.064
TP prolongado, n (%)Sim30 (26.8%)20 (21.5%)15 (25.9%)24 (19.0%)0.372
Diabetes, n (%)Sim19 (17.0%)14 (15.1%)10 (17.2%)19 (15.1%)0.764
Hipertensão, n (%)Sim33 (29.5%)26 (28.0%)18 (31.0%)36 (28.6%)0.824
Tipo de controle entre os controles não-HCC, n (%)Controles saudáveis30 (32.3%)0 (0.0%)
Controles de doença hepática crônica63 (67.7%)126 (100.0%)
Observação: HCC, carcinoma hepatocelular; BCLC, Barcelona Clinic Liver Cancer; ALT, alanina aminotransferase; AST, aspartato aminotransferase; INR, razão normalizada internacional; AFP, alfafetoproteína; PIVKA-II, proteína induzida pela ausência de vitamina K-II; PT, tempo de protrombina; IQR, intervalo interquartil. Os valores de P são apresentados para comparações basais entre os estratos da coorte/estado relatados, quando aplicável. O estágio do HCC foi informado apenas para os casos de HCC. O tipo de controle foi informado apenas para os controles sem HCC.

Tabela 1: Características basais das coortes de treinamento e validação. As características demográficas, antecedentes de doença hepática, estágio de CHC, classe Child-Pugh, índices laboratoriais de rotina, AFP e PIVKA-II são apresentados por coorte e status de CHC.

MétodoSensibilidade (IC 95%)Especificidade (IC 95%)AUC (IC 95%)Limiar
AFP62,50 (53,41–71,06)78,49 (69,07–86,04)0,78 (0,72–0,84)20,0 ng/mL
PIVKA-II78,57 (70,29–85,37)82,80 (73,95–89,61)0,85 (0,80–0,90)45,0 mAU/mL
Modelo baseado em variáveis clínicas69,64 (60,28–77,87)80,65 (71,13–88,04)0,81 (0,75–0,87)Probabilidade prevista = 0,40
Modelo combinado88,39 (81,35–93,36)89,25 (81,26–94,65)0,93 (0,89–0,96)Probabilidade prevista = 0,50
Nota: O AFP foi avaliado no ponto de corte clínico estabelecido de 20,0 ng/mL. O limiar de PIVKA-II de 45,0 mAU/mL foi o ponto de corte de Youden do coorte de treinamento, utilizado para a comparação primária de treinamento. Os modelos baseado em variáveis clínicas e combinado foram avaliados utilizando limiares de probabilidade prevista derivados do coorte de treinamento.

Tabela 2: Desempenho diagnóstico na coorte de treinamento. AUC, sensibilidade, especificidade e limiares relatados são apresentados para AFP, PIVKA-II, o modelo de variáveis clínicas e o modelo combinado multivariável na coorte de treinamento.

SubgrupoItemAFPPIVKA-IIModelo Combinado
Todos os HCCAUC0.750.780.89
Todos os HCCLimiar primário de validação18,5 ng/mL38,0 mAU/mLProbabilidade prevista = 0,56
Todos os HCCSensibilidade, % (IC 95%)62,1 (48,7–74,2)72,4 (59,1–83,5)84,5 (72,6–92,6)
Todos os HCCEspecificidade, % (IC 95%)88,9 (82,0–93,4)91,3 (85,1–95,3)90,5 (84,2–94,8)
Todos os HCCVP+ (%)63,872,778,8
Todos os HCCVP- (%)88,19194,1
HCC em estágio inicialLimiar exploratório do subgrupo15,2 ng/mL33,5 mAU/mLProbabilidade prevista = 0,51
HCC em estágio inicialSensibilidade, % (IC 95%)45,5 (25,1–67,3)59,1 (38,5–77,7)72,7 (52,0–87,6)
HCC em estágio inicialEspecificidade, %88,991,390,5
HCC em estágio inicialVP+ (%)4054,566,7
HCC em estágio inicialVP- (%)90,187,592,3
HCC negativo para AFPLimiar exploratório do subgrupo7,5 ng/mL31,2 mAU/mLProbabilidade prevista = 0,48
HCC negativo para AFPSensibilidade, % (IC 95%)23,1 (9,7–42,6)61,5 (40,6–79,8)73,1 (52,2–88,4)
HCC negativo para AFPEspecificidade, %88,991,390,5
HCC negativo para AFPVP+ (%)225264,5
HCC negativo para AFPVP- (%)90,288,392,7
HCC viralLimiar exploratório do subgrupo19,3 ng/mL40,7 mAU/mLProbabilidade prevista = 0,59
HCC viralSensibilidade, % (IC 95%)64,7 (46,9–79,9)73,5 (56,4–86,4)85,3 (69,9–94,7)
HCC viralEspecificidade, %88,190,591,3
HCC viralVP+ (%)67,37381,3
HCC viralVP- (%)87,590,894,7
HCC não viralLimiar exploratório do subgrupo20,1 ng/mL34,5 mAU/mLProbabilidade prevista = 0,53
HCC não viralSensibilidade, % (IC 95%)58,3 (36,6–77,9)70,8 (48,9–87,4)83,3 (62,6–95,3)
HCC não viralEspecificidade, %89,292,189,7
HCC não viralVP+ (%)59,269,775
HCC não viralVP- (%)899293,8
Calibração do modelo combinadoIntercepto−0,08
Calibração do modelo combinadoInclinação0,91
Calibração do modelo combinadoPontuação de Brier0,118
Calibração do modelo combinadoValor P de Hosmer–Lemeshow0,64
Nota: A linha de todos os HCC relata a análise primária de validação. As linhas de HCC em estágio inicial, HCC negativo para AFP, HCC viral e HCC não viral relatam o desempenho exploratório por subgrupo. Os limiares dos subgrupos foram informados para descrever pontos operacionais aparentes dentro de cada subgrupo e não foram utilizados para refitagem ou recalibração do modelo. HCC negativo para AFP foi definido como AFP <20,0 ng/mL. VP+, valor preditivo positivo; VP-, valor preditivo negativo.

Tabela 3: Desempenho diagnóstico na coorte de validação e análise de subgrupos. AUC, limiares informados, sensibilidade, especificidade, valor preditivo positivo e valor preditivo negativo são apresentados para AFP, PIVKA-II e o modelo combinado em todos os casos de HCC, HCC em estágio inicial, HCC negativo para AFP, HCC viral e HCC não viral. Métricas de calibração para o modelo combinado também são incluídas.

Fator / métricaValor P univariadoCoeficiente βOR ajustado / métrica de validaçãoIC 95%Valor P
Intercepto−4,862
Idade0,1120,0181,020,99–1,050,186
Sexo, masculino0,0870,3311,410,83–2,370,204
AFP, transformado pelo logaritmo natural0,0040,2471,281,05–1,620,021
PIVKA-II, transformado pelo logaritmo natural<0,0010,7122,051,48–2,89<0,001
Albumina, g/L0,008−0,0620,940,89–0,990,032
INR0,0120,5541,741,12–2,780,015
Contagem de plaquetas, ×109/L0,052−0,0040,990,98–1,000,044
AUC de treinamento aparente0,930,89–0,96
Optimismo médio0,018
AUC corrigido para optimismo0,910,87–0,95
Inclinação de calibração aparente1
Inclinação de calibração corrigida para optimismo0,94
Pontuação de Brier no treinamento0,104
Valor P de Hosmer–Lemeshow0,72
Nota: O preditor linear final foi η = −4,862 + 0,247 × ln(AFP) + 0,712 × ln(PIVKA-II) + 0,018 × idade + 0,331 × sexo − 0,062 × albumina + 0,554 × INR − 0,004 × contagem de plaquetas. A probabilidade prevista foi calculada como p(HCC) = 1 / [1 + exp(−η)]. O AFP foi medido em ng/mL; PIVKA-II em mAU/mL; idade em anos; sexo foi codificado como feminino = 0 e masculino = 1; albumina em g/L; INR como valor adimensional; e contagem de plaquetas em ×10⁹/L.

Tabela 4: Regressão logística multivariável e validação interna por reamostragem bootstrap. São apresentados os valores-P univariáveis, coeficientes do modelo ajustado, razões de chances ajustadas, intervalos de confiança de 95%, e valores-P multivariáveis para as variáveis avaliadas no modelo da coorte de treinamento. São relatados o otimismo por reamostragem bootstrap, a AUC corrigida para otimismo, a inclinação de calibração corrigida para otimismo, o escore de Brier e os resultados do teste de Hosmer–Lemeshow.

Tabela 5: Desempenho diagnóstico utilizando pontos de corte otimizados pelo índice de Youden. Sensibilidade, especificidade, valor preditivo positivo, valor preditivo negativo, acurácia e AUC são apresentados para AFP, PIVKA-II e o modelo combinado utilizando pontos de corte baseados no índice de Youden.

MétodoValor de corte estabelecidoSensibilidade, % (IC 95%)Especificidade, % (IC 95%)VPV, % (IC 95%)VVN, % (IC 95%)Exatidão, % (IC 95%)AUC (IC 95%)
AFP20,0 ng/mL65,2 (57,0–72,7)88,5 (83,4–92,3)70,1 (61,8–77,4)86,0 (80,7–90,3)80,3 (75,0–84,8)0,77 (0,72–0,82)
PIVKA-II40,0 mAU/mL73,0 (65,2–79,8)93,1 (88,8–96,0)81,8 (74,2–87,7)89,0 (83,9–92,8)85,6 (80,9–89,5)0,82 (0,78–0,86)
Modelo combinadoProbabilidade prevista = 0,6083,5 (76,6–89,0)92,0 (87,4–95,3)84,7 (77,9–90,0)91,2 (86,3–94,6)88,9 (84,6–92,2)0,89 (0,86–0,93)
Nota: Os valores de corte clínicos estabelecidos foram AFP 20,0 ng/mL e PIVKA-II 40,0 mAU/mL. O modelo combinado foi relatado no limiar de probabilidade predefinido correspondente utilizado para esta comparação com o valor de corte clínico.

Tabela 6: Desempenho diagnóstico utilizando pontos de corte clínicos estabelecidos. São apresentados sensibilidade, especificidade, valor preditivo positivo, valor preditivo negativo, acurácia e AUC utilizando o ponto de corte estabelecido para AFP de 20,0 ng/mL e o ponto de corte estabelecido para PIVKA-II de 40,0 mAU/mL. O modelo combinado é relatado no limiar de probabilidade correspondente utilizado para esta comparação de pontos de corte.

MétodoLimiar mais próximo da especificidade de 90%Sensibilidade, % (IC 95%)Especificidade, % (IC 95%)VPP, % (IC 95%)VNP, % (IC 95%)
AFP19,0 ng/mL67,9 (59,1–75,7)89,1 (84,2–92,8)71,3 (62,4–79,0)87,3 (82,1–91,2)
PIVKA-II37,5 mAU/mL75,4 (67,3–82,2)92,0 (87,7–95,1)79,8 (71,6–86,3)89,7 (84,7–93,3)
Modelo combinadoProbabilidade prevista = 0,5786,2 (79,3–91,3)90,6 (85,8–94,0)82,7 (74,8–88,7)92,4 (87,9–95,4)
Observação: Esses limiares foram selecionados para alcançar a especificidade mais próxima de 90% na análise de auditoria de limiares. Para o PIVKA-II, 37,5 mAU/mL é o limiar de Youden e próximo à especificidade de 90% nesta auditoria, 38,0 mAU/mL é o limiar primário de validação relatado na Tabela 3, 40,0 mAU/mL é o limiar clínico estabelecido e 45,0 mAU/mL é o limiar de Youden da coorte de treinamento utilizado na Tabela 2.

Tabela 7: Desempenho diagnóstico no ponto de corte mais próximo à especificidade de 90%. Sensibilidade, especificidade, valor preditivo positivo e valor preditivo negativo são apresentados para AFP, PIVKA-II e o modelo combinado em limiares selecionados para alcançar especificidade mais próxima a 90%.

Discussão

Este estudo avaliou uma estratégia diagnóstica integrada para carcinoma hepatocelular (CHC) utilizando PIVKA-II, AFP e variáveis clínicas de rotina, com foco em estágios iniciais e doenças negativas para AFP14. Nas coortes de treinamento e validação, o modelo combinado superou o teste com marcador único. Na coorte de treinamento, o modelo combinado alcançou uma AUC de 0,93, comparada a 0,78 para AFP e 0,85 para PIVKA-II. Na coorte de validação independente, o modelo manteve uma forte capacidade discriminatória, com uma AUC de 0,89, sensibilidade de 84,5% e especificidade de 90,5%. Esses resultados apoiam uma abordagem baseada em modelo, na qual sinais complementares de biomarcadores e dados clínicos são interpretados em conjunto, em vez de forçar decisões diagnósticas com base em um único limiar sérico.

Os achados da validação esclarecem o valor acrescentado do PIVKA-II, especialmente onde o AFP é menos confiável. A sensibilidade do AFP foi de 62,1% em todos os casos de CHC na validação e caiu para 23,1% no CHC negativo para AFP. O PIVKA-II apresentou sensibilidade geral mais alta e manteve sensibilidade de 61,5% na doença negativa para AFP. O modelo combinado melhorou ainda mais a sensibilidade para 73,1% no CHC negativo para AFP e 72,7% no CHC em estágio inicial, mantendo alta especificidade. Esse padrão é consistente com evidências anteriores de que o PIVKA-II capta informações diagnósticas parcialmente distintas das do AFP, particularmente em tumores com baixos níveis de AFP e baixa carga tumoral inicial15,16,17. As análises de correlação e de classificação cruzada também apoiaram essa interpretação, mostrando que o AFP e o PIVKA-II não são marcadores intercambiáveis e que o escore integrado recuperou casos adicionais não detectados pela classificação com marcador único.

Os resultados multivariáveis sugerem que o ganho obtido com o modelo combinado não foi apenas o resultado da adição conjunta de AFP e PIVKA-II. As variáveis clínicas contribuíram contexto adicional relacionado à idade, sexo, reserva hepática, estado de coagulação e contagem de plaquetas. Esse desenho é consistente com modelos de risco multivariáveis estabelecidos para carcinoma hepatocelular (HCC), incluindo GALAD, GAAD e escores relacionados baseados em biomarcadores, que combinam variáveis demográficas e laboratoriais para melhorar o desempenho diagnóstico em populações heterogêneas com doenças hepáticas18,19,20. No modelo ajustado, a PIVKA-II transformada pelo logaritmo permaneceu o preditor independente mais forte, a AFP transformada pelo logaritmo manteve uma associação independente, e a RNI contribuiu com sinal diagnóstico adicional. As aminotransferases foram menos informativas após o ajuste, sugerindo que a inflamação hepática inespecífica não foi o principal fator de discriminação uma vez considerados os marcadores associados ao tumor e à coagulação.

As análises de pontos de corte abordam um ponto importante levantado durante a revisão. Os diferentes limiares de PIVKA-II não devem ser interpretados como pontos de corte primários conflitantes. O valor de 45,0 mAU/mL foi utilizado para a comparação ROC na coorte de treinamento, 40,0 mAU/mL representou o limiar clínico estabelecido, e a faixa de 37,5–38,0 mAU/mL refletiu estratégias alternativas de limiar baseadas na otimização de Youden ou em análise de especificidade fixa. Esses limiares respondem a diferentes questões clínicas: um ponto de corte orientado à sensibilidade pode ser útil para vigilância em alto risco, enquanto um ponto de corte orientado à especificidade pode ser preferido quando a prioridade é reduzir os falsos positivos. Em todas essas estratégias, o modelo combinado manteve-se mais estável do que a AFP ou o PIVKA-II isoladamente, apoiando seu uso como ferramenta de estratificação de risco, e não como substituto do diagnóstico baseado em imagem21.

Várias limitações permanecem. A coorte de treinamento foi de centro único, e a coorte de validação prospectiva foi de tamanho moderado. Ainda é necessária uma validação multicêntrica, especialmente em populações com diferentes origens etiológicas, incluindo HCC relacionado à DHGNA, relacionado ao álcool e relacionado ao VHC. O diagnóstico de HCC foi determinado por meio de TC com contraste e/ou RM, o que reflete a prática diagnóstica habitual, mas pode subrepresentar lesões extremamente precoces ou atípicas. Algumas análises de subgrupos, particularmente HCC em estágio inicial e HCC negativo para AFP, incluíram menos casos do que a coorte geral. Análises de calibração e de reamostragem bootstrap ajudaram a avaliar a estabilidade do modelo, mas não podem substituir estudos de implementação prospectiva que testem se a vigilância orientada pelo modelo melhora a eficiência de encaminhamento, o rendimento de detecção precoce e os desfechos clínicos subsequentes22.

Em conclusão, a integração de PIVKA-II, AFP e variáveis clínicas de rotina melhorou a detecção de HCC em comparação com estratégias baseadas em biomarcadores únicos, com desempenho consistente tanto no grupo de treinamento quanto no de validação independente. O modelo manteve sensibilidade clinicamente útil nos casos de HCC em estágio inicial e nos casos negativos para AFP, ao mesmo tempo em que preservou alta especificidade, abordando dois pontos cegos comuns da vigilância baseada em AFP. Como as entradas são rotineiramente disponíveis, essa abordagem é prática para testes adicionais em populações com doenças hepáticas de alto risco. Estudos futuros multicêntricos devem comparar diretamente o modelo com ultrassonografia mais AFP, avaliar limiares operacionais pré-definidos e verificar se a integração com biomarcadores emergentes ou características derivadas de imagens melhora ainda mais a detecção precoce de HCC23,24.

Divulgações

Os autores declaram não haver interesses financeiros ou não financeiros conflitantes. Nenhum financiador comercial, fabricante de reagentes, fornecedor de software ou empresa de plataforma diagnóstica teve qualquer participação no desenho do estudo, na coleta de dados, na análise estatística, na interpretação dos resultados, na preparação do manuscrito ou na decisão de submeter o trabalho para publicação.

Agradecimentos

Os autores agradecem aos participantes do estudo e à equipe clínica que apoiou a coleta de sangue, coordenação clínica, revisão de imagens e verificação de dados para este estudo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Microtubo de 1,5 mL livre de nucleasesEppendorf30123328Aliquotagem e armazenamento de plasma
Calibrador de AFPRoche DiagnosticsAFP CalSet II, 09227261190Calibração de AFP
Material de controle de qualidade de AFPRoche DiagnosticsPreciControl Tumor Marker, 11776452160Controle de qualidade de AFP
Material de controle de qualidade de AFPRoche DiagnosticsPreciControl Universal, 11731416160Controle de qualidade de AFP
Kit de reagentes para AFPRoche DiagnosticsElecsys AFP, 09015124190Medição de AFP
Analisador automático de imunoensaio por eletroquimioluminescênciaRoche Diagnosticscobas e 801Medição de AFP e PIVKA-II
Pacote de calibraçãoPacote Rrms 6.7–1Análise de calibração
Pacote de análise de curva de decisãoPacote Rrmda 1.6Análise de curva de decisão
Pacote do teste de Hosmer–LemeshowPacote RResourceSelection 0.3–6Teste de Hosmer–Lemeshow
Tubo de coleta de sangue K2-EDTA, 10 mLBD367525Coleta de sangue venoso periférico
Pacote de imputação múltiplaPacote Rmice 3.16.0Imputação múltipla
Kit de reagentes para PIVKA-IIRoche DiagnosticsElecsys PIVKA-II, 08333629190/08333629500Medição de PIVKA-II
Centrífuga refrigeradaEppendorfCentrifuge 5425 RSeparação de plasma
Pacote de análise ROCPacote RpROC 1.18.5Análise ROC e teste de DeLong
Software estatísticoR FoundationR 4.3.2Análise estatística
Interface de software estatísticoPosit SoftwareRStudio 2023.12.1Análise estatística

Referências

  1. Oh JH, Jun DW. The latest global burden of liver cancer: A past and present threat. Clin Mol Hepatol. 2023;29(2):355-357.
  2. Heimbach JK et al. AASLD guidelines for the treatment of hepatocellular carcinoma. Hepatology. 2018;67(1):358-380.
  3. Singal AG et al. Meta-analysis: Surveillance with ultrasound for early-stage hepatocellular carcinoma in patients with cirrhosis. Aliment Pharmacol Ther. 2009;30(1):37-47.
  4. Tzartzeva K et al. Surveillance imaging and alpha fetoprotein for early detection of hepatocellular carcinoma in patients with cirrhosis: A meta-analysis. Gastroenterology. 2018;154(6):1706-1718.e1.
  5. Parikh ND et al. Biomarkers for the early detection of hepatocellular carcinoma. Cancer Epidemiol Biomarkers Prev. 2020;29(12):2495-2503.
  6. Gopal P et al. Factors that affect accuracy of alpha-fetoprotein test in detection of hepatocellular carcinoma in patients with cirrhosis. Clin Gastroenterol Hepatol. 2014;12(5):870-877.
  7. Hanif H et al. Update on the applications and limitations of alpha-fetoprotein for hepatocellular carcinoma. World J Gastroenterol. 2022;28(2):216-229.
  8. Norman JS, Mehta N. The role of AFP-L3 and DCP biomarkers in the diagnosis and management of hepatocellular carcinoma. Curr Hepatol Rep. 2025;24(1):16.
  9. Suttichaimongkol T et al. PIVKA-II or AFP has better diagnostic properties for hepatocellular carcinoma diagnosis in high-risk patients. J Circ Biomark. 2023;12:12-16.
  10. Piratvisuth T et al. Development and clinical validation of a novel algorithmic score (GAAD) for detecting HCC in prospective cohort studies. Hepatol Commun. 2023;7(11):e0317.
  11. Jarrah M et al. Performance of GALAD, GAAD, and ASAP for early HCC detection in chronic liver disease: A systematic review and meta-analysis. Liver Cancer. 2026;15(2):285-299.
  12. Zhou JM, Wang T, Zhang KH. AFP-L3 for the diagnosis of early hepatocellular carcinoma: A meta-analysis. Medicine (Baltimore). 2021;100(43):e27673.
  13. Singal AG et al. AASLD practice guidance on prevention, diagnosis, and treatment of hepatocellular carcinoma. Hepatology. 2023;78(6):1922-1965.
  14. Best J et al. The GALAD scoring algorithm based on AFP, AFP-L3, and DCP significantly improves detection of BCLC early-stage hepatocellular carcinoma. Z Gastroenterol. 2016;54(12):1296-1305.
  15. Poté N et al. Performance of PIVKA-II for early hepatocellular carcinoma diagnosis and prediction of microvascular invasion. J Hepatol. 2015;62(4):848-854.
  16. Xu F et al. The diagnostic value of serum PIVKA-II alone or in combination with AFP in Chinese hepatocellular carcinoma patients. Dis Markers. 2021;2021:8868370.
  17. Liu M et al. Validation of the GALAD model and establishment of GAAP model for diagnosis of hepatocellular carcinoma in Chinese patients. J Hepatocell Carcinoma. 2020;7:219-232.
  18. Aralica M et al. GALAD, or des-gamma-carboxy prothrombin compared with alpha-foetoprotein for the diagnosis of hepatocellular carcinoma in people with chronic liver disease. Cochrane Database Syst Rev. 2024;12(12):CD015826.
  19. Zhang S et al. Evaluating the combined diagnostic power of alpha-fetoprotein and protein induced by vitamin K absence or antagonist-II for hepatocellular carcinoma. J Gastrointest Oncol. 2025;16(3):1157-1175.
  20. Pham TTT, Ho DT, Nguyen TB, Phan HT. Clinical performance of GAAD score, alpha-fetoprotein, and PIVKA-II in diagnosing hepatocellular carcinoma in the Vietnamese cohort. Discov Oncol. 2025;16:1813.
  21. Youden WJ. Index for rating diagnostic tests. Cancer. 1950;3(1):32-35.
  22. Tarao K et al. Real impact of tumor marker AFP and PIVKA-II in detecting very small hepatocellular carcinoma (≤2 cm, Barcelona stage 0): Assessment with a large number of cases. World J Hepatol. 2020;12(11):1046-1054.
  23. Kim DY et al. Utility of combining PIVKA-II and AFP in the surveillance and monitoring of hepatocellular carcinoma in the Asia-Pacific region. Clin Mol Hepatol. 2023;29(2):277-292.
  24. Kao SYZ et al. Cost-effectiveness of a precision hepatocellular carcinoma surveillance strategy in patients with cirrhosis. EClinicalMedicine. 2024;75:102755.

Reimpressões e permissões

Etiquetas

Modelo DiagnósticoRegressão LogísticaBiomarcadores SanguíneosDoenças Hepáticas