Geração da resposta inicial
O modelo de linguagem de referência gerou respostas fluentes e contextualmente relevantes para perguntas de ambos os conjuntos de dados de referência. No entanto, um exame detalhado revelou afirmações não comprovadas e factualmente imprecisas em várias respostas. No conjunto de dados TruthfulQA, o sistema de referência apresentou uma taxa de alucinação de 28%, enquanto uma taxa de alucinação de 26% foi observada no conjunto de dados FEVER. Esses resultados confirmaram que a geração direta de linguagem, por si só, era insuficiente para aplicações que exigem alta confiabilidade factual e estabeleceram a condição de referência em relação à qual todos os procedimentos subsequentes de verificação foram comparados.
Extração de afirmações
O procedimento de extração de afirmações decomposou com sucesso as respostas geradas em unidades factuais independentemente verificáveis. As respostas do TruthfulQA continham em média 3,2 afirmações atômicas, enquanto as amostras do FEVER geralmente consistiam em uma única afirmação. O processo de decomposição isolou asserções factuais sem introduzir informações adicionais, permitindo que cada declaração fosse avaliada separadamente. Essa observação apoiou a hipótese de que a verificação em nível de afirmação oferece maior precisão do que avaliar respostas inteiras como uma única unidade.
Construção de referência independente
Foram geradas referências independentes para cada afirmação extraída, utilizando um processo de raciocínio separado, condicionado apenas à consulta original. As referências geradas forneceram descrições factuais concisas que eram suficientemente distintas das respostas originais para servir como fontes de verificação independentes. O processo de geração de referências foi isolado da resposta inicial para evitar condicionar diretamente a referência factual à saída anterior do modelo. Esse isolamento teve como objetivo reduzir o viés de confirmação potencial e fornecer uma base controlada para a verificação subsequente em nível de afirmação; o estudo não quantifica independentemente a extensão desse efeito. A geração bem-sucedida de referências independentes apoiou o princípio de design proposto de separar a recordação do conhecimento da geração da resposta.
Verificação da inferência de linguagem natural
A fase de verificação NLI classificou efetivamente pares de alegações e referências nas categorias de implicação, contradição e neutralidade. Alegações contraditórias receberam consistentemente pontuações negativas de verificação, enquanto alegações factualmente apoiadas receberam pontuações positivas. Classificações neutras foram atribuídas a alegações para as quais não havia evidência de apoio suficiente. Esse comportamento demonstrou que a inferência semântica poderia identificar de forma confiável declarações factuais não apoiadas e fornecer as evidências necessárias para correções direcionadas. Em comparação com uma estratégia simples de verificação de consistência, a verificação NLI reduziu a taxa de alucinação de 20% para 15%, indicando uma melhoria na capacidade de detecção.
Limiarização estatística adaptativa
A aplicação do limiar estatístico adaptativo aprimorou ainda mais o desempenho de verificação, ajustando dinamicamente os limites de decisão com base na distribuição das pontuações de confiança de cada resposta. A análise de sensibilidade do limiar demonstrou que o desempenho melhorou à medida que o parâmetro do limiar aumentou de 0,3 para 0,7. Em um valor de sensibilidade de 0,7, a estrutura alcançou uma acurácia de 0,87, reduzindo alucinações para 9% (Figura 2). Os resultados completos da análise de sensibilidade para os valores avaliados de k estão fornecidos em Tabela Suplementar 2. Aumentar o limiar além desse ponto resultou em ganhos apenas marginais na acurácia, enquanto aumentava a latência. Essas observações corroboram a hipótese de que limiares adaptativos são mais eficazes do que limites de decisão fixos para lidar com distribuições de confiança variáveis entre as respostas.
O limiar adaptativo também reflete a variabilidade dos escores de confiança dentro de cada resposta. Respostas com escores de verificação altamente consistentes produzem um desvio padrão menor, resultando em um limite de decisão mais seletivo. Em contraste, respostas que contêm afirmações com valores de confiança heterogêneos geram um desvio padrão maior, levando a uma região de aceitação mais ampla e reduzindo correções desnecessárias para afirmações incertas. Embora esse comportamento adaptativo não consiga eliminar todos os falsos positivos ou falsos negativos, ele permite que o limite de decisão responda às características de incerteza de cada resposta, em vez de aplicar um critério uniforme a todas as entradas.
Correção seletiva de alegações e montagem de resposta
Apenas as afirmações identificadas como contraditórias foram enviadas para correção, enquanto as afirmações comprovadas e neutras foram mantidas inalteradas. Essa estratégia seletiva de correção minimizou a regeneração desnecessária e preservou a estrutura original da resposta. Após a correção e a reconstrução da resposta, a taxa de alucinação em TruthfulQA diminuiu de 28% para 9%, representando uma redução relativa de 67,9%. Melhorias semelhantes foram observadas em FEVER, onde as alucinações diminuíram de 26% para 10%. As comparações de acurácia e de taxa de alucinação entre as configurações avaliadas são apresentadas nas Figuras 3 e 4, respectivamente.
Avaliação de desempenho
A avaliação comparativa mostrou que o framework proposto alcançou o desempenho geral mais alto entre todos os métodos testados. Em TruthfulQA, o framework obteve uma acurácia de 0,87 e um índice F1 de 0,85, superando tanto a verificação com limiar fixo quanto as abordagens baseadas em autoconsistência (Tabela 2, Figuras 3 e 4). Em FEVER, o framework alcançou uma acurácia de 0,89 e um índice F1 de 0,87 (Tabela 3, Figuras 3 e 4). A contribuição incremental dos componentes do framework é examinada por meio da análise de ablação apresentada na Tabela 4. Essas melhorias confirmaram que combinar verificação em nível de afirmação com tomada de decisão estatística adaptativa aumentou a confiabilidade factual em múltiplos conjuntos de dados. A acurácia na detecção de alucinações para SelfCheckGPT, FActScore e o framework proposto é comparada na Figura 5.
Análise de latência
O pipeline completo de verificação manteve baixa carga computacional. O tempo médio de resposta aumentou de 820 ms para o modelo de referência para 980 ms para o framework completo, representando apenas um aumento modesto no tempo de processamento (Tabela 5). A geração da resposta foi responsável pela maior parte da latência total, enquanto as etapas de verificação e correção contribuíram relativamente pouco com sobrecarga adicional. A divisão do tempo de processamento por etapa é fornecida na Tabela Suplementar 3. Em comparação com sistemas de verificação baseados em recuperação, que exigiam aproximadamente 1600 ms por consulta, o framework proposto alcançou latência substancialmente menor mantendo precisão factual comparável. Esses resultados apoiaram a hipótese de que a redução de alucinações pode ser alcançada sem sacrificar a usabilidade em tempo real.
Como a geração de respostas depende de um modelo de linguagem baseado na nuvem, as medições individuais de latência estão sujeitas a flutuações devido às condições da rede e ao agendamento no lado do servidor, e não a um tempo de execução determinístico. Portanto, foram realizadas medições repetidas para obter valores médios representativos, reduzindo a influência da variabilidade transitória na execução, ao mesmo tempo que se preservam comparações relativas entre os métodos avaliados. Os valores de latência são apresentados como tempos médios de execução ao longo de execuções experimentais repetidas. Os valores individuais de latência por execução não foram mantidos; assim, cálculos a posteriori de variância, intervalos de confiança ou outras medidas de variabilidade não foram possíveis. Consequentemente, os valores de latência e a comparação entre velocidade e precisão na Figura 6 são apresentados como estimativas pontuais, sem barras de erro.
Para concluir, os resultados demonstraram que a combinação da extração de afirmações, geração independente de referências, verificação por Inferência de Linguagem Natural, limiarização estatística adaptativa e correção seletiva aprimorou a confiabilidade factual das saídas de modelos linguísticos grandes. O framework reduziu a taxa de alucinação de 28% para 9% no TruthfulQA e de 26% para 10% no FEVER. Os resultados indicam que a verificação adaptativa em nível de afirmação melhorou as métricas de confiabilidade factual, limitando ao mesmo tempo o aumento adicional na latência de resposta nas condições avaliadas.
Disponibilidade de Dados
Os conjuntos de dados analisados neste estudo estão disponíveis publicamente por meio de suas respectivas fontes oficiais. O manuscrito fornece as informações sobre os conjuntos de dados, as configurações dos modelos e os detalhes metodológicos necessários para apoiar a replicação das análises descritas. Os dados processados para avaliação e os resultados suplementares gerados durante o estudo estão disponíveis nos Arquivos Suplementares.

Figura 1: Fluxo de trabalho do quadro adaptativo de verificação de alegações. Uma resposta inicial gerada por um modelo linguístico grande (LLM) é decomposta em alegações factuais, seguida por geração independente de referências, verificação baseada em inferência linguística natural (NLI), pontuação de confiança e limiar estatístico. As alegações que atendem ao critério de aceitação são mantidas, enquanto as alegações que atendem ao critério de correção passam por correção direcionada antes da montagem final da resposta. Clique aqui para visualizar uma versão maior desta figura.

Figura 2: Efeito do parâmetro de sensibilidade (k) na precisão da verificação. Precisão em TruthfulQA e FEVER em valores de k de 0,3, 0,5, 0,7 e 1,0. A precisão aumentou com k em ambos os conjuntos de dados, com k = 0,7 selecionado para a avaliação primária. Clique aqui para visualizar uma versão maior desta figura.

Figura 3: Comparação de precisão entre métodos de verificação. Precisão do modelo de linguagem de referência, verificação baseada em NLI e o framework de verificação adaptativa proposto nos conjuntos de dados TruthfulQA e FEVER. Clique aqui para visualizar uma versão maior desta figura.

Figura 4: Comparação da taxa de alucinação entre métodos de verificação. Taxas de alucinação para o modelo de linguagem de referência, verificação baseada em inferência natural e o framework proposto nos conjuntos TruthfulQA e FEVER. O framework proposto reduziu a taxa de 28% para 9% no TruthfulQA e de 26% para 10% no FEVER. Clique aqui para visualizar uma versão maior desta figura.

Figura 5: Precisão na detecção de alucinações entre diferentes métodos. Precisão de detecção do SelfCheckGPT, FActScore e do framework proposto em TruthfulQA e FEVER. Clique aqui para visualizar uma versão ampliada desta figura.

Figura 6: Compromisso entre tempo de resposta e precisão nos diferentes métodos de verificação. Relação entre latência de resposta e precisão para os métodos avaliados em TruthfulQA e FEVER, ilustrando o compromisso entre desempenho e latência associado à estrutura proposta e às abordagens comparadoras. Clique aqui para visualizar uma versão maior desta figura.
| Conjunto de dados | Amostras Utilizadas | Domínios | Comprimento Médio da Resposta (tokens) | Taxa de Alucinação do LLM de Referência |
| TruthfulQA | 817 | 38 (ciência, história, direito, etc.) | 42 | 28% |
| FEVER | 1.000 | Afirmações factuais gerais | 18 | 26% |
Tabela 1: Características dos conjuntos de dados de referência. Resumo dos conjuntos de dados TruthfulQA e FEVER utilizados para o desenvolvimento e avaliação do framework, incluindo números de amostras, precisão de referência, taxa de alucinação de referência e número médio de afirmações por amostra.
| Método | Precisão | Exatidão | Recuperação | Pontuação F1 | Porcentagem de Alucinação |
| LLM de Base (Inferência Única) | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| Verificação Baseada em NLI (Limiar Fixo) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| SelfCheckGPT | 0.76 | 0.755 | 0.725 | 0.74 | 22% |
| FActScore | 0.85 | 0.8425 | 0.8175 | 0.83 | 11% |
| Quadro Proposto (Limiar Estatístico) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
Tabela 2: Comparação de desempenho no TruthfulQA. Exatidão, precisão, revocação, pontuação F1 e taxa de alucinação para o modelo de linguagem de referência, SelfCheckGPT, FActScore, verificação NLI e o framework proposto.
| Método | Exatidão | Precisão | Recuperação | Pontuação F1 | Porcentagem de alucinação |
| SelfCheckGPT | 0.78 | — | — | — | — |
| FActScore | 0.87 | — | — | — | — |
| LLM de referência† | 0.74 | 0.73 | 0.71 | 0.72 | 26% |
| Verificação baseada em NLI (Limiar fixo) | 0.83 | 0.8225 | 0.7975 | 0.81 | 14% |
| Framework proposto (Limiar estatístico) | 0.89 | 0.8775 | 0.8625 | 0.87 | 10% |
Tabela 3: Comparação de desempenho no FEVER. Exatidão, precisão, revocação, pontuação F1 e taxa de alucinação para o modelo de linguagem de referência, SelfCheckGPT, FActScore, verificação NLI e o framework proposto.
| Configuração | Exatidão | Precisão | Recuperação | F1 (adicionado) | Taxa de Alucinação |
| Modelo de Linguagem de Base | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| Base + Verificação Secundária (Sem NLI) | 0.78 | 0.7725 | 0.7475 | 0.76* | 20% |
| Base + Verificação Baseada em NLI (Limiar Fixo) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| Base + Módulo Estatístico de Decisão (Completo) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
Tabela 4: Análise de ablação dos componentes do framework. Alterações na precisão, pontuação F1 e taxa de alucinação após a incorporação sequencial da validação secundária, verificação NLI e limiarização estatística adaptativa.
| Método | Tempo Médio de Resposta (ms) |
| LLM de Linha de Base (Geração Única) | 820 |
| Mecanismo de Autovalidação | 910 |
| Estrutura Estatística Proposta | 980 |
| Verificação com Recuperação Aprimorada (RAG) | 1600 |
Tabela 5: Latência de resposta entre os métodos de verificação. Tempo médio de resposta e latência adicional em relação ao LLM de referência para Autovalidação, o framework proposto e a verificação com reforço por recuperação.
Tabela Suplementar 1: Comparação de abordagens de verificação de alucinações. Comparação do framework proposto com métodos existentes em termos de recuperação externa, verificação em nível de afirmação, limiarização adaptativa e processamento com baixa latência.Clique aqui para baixar este arquivo.
Tabela Suplementar 2: Análise de sensibilidade do parâmetro limite (k). A acurácia, precisão, revocação, pontuação F1 e taxa de alucinação foram obtidas para valores do parâmetro limite de 0,3, 0,5, 0,7 e 1,0. Um valor de k = 0,7 foi utilizado para a avaliação principal.Clique aqui para baixar este arquivo.
Tabela Suplementar 3: Tempo de processamento nas diferentes etapas do pipeline de verificação. Tempo médio de execução e contribuição percentual da geração inicial da resposta, decomposição da alegação, geração de referência, inferência NLI e correção seletiva em relação ao tempo total de resposta.Clique aqui para baixar este arquivo.
Tabela Suplementar 4: Distribuição dos erros identificados durante a verificação. Número e porcentagem de falsos negativos, falsos positivos e erros de correção, juntamente com as categorias principais de alucinação associadas a cada tipo de erro.Clique aqui para baixar este arquivo.