Artigo de investigação

Verificação de Alegações Baseada em NLI Adaptativa com Modelagem de Decisão Estatística para a Redução de Alucinações de Baixa Latência em Grandes Modelos de Linguagem

0 vistas

DOI:

10.3791/72636

3 de setembro de 2026

Neste artigo

Resumo

Este estudo apresenta um framework leve para reduzir alucinações em modelos linguísticos grandes por meio da verificação em nível de afirmação e limiar estatístico adaptativo. Ao corrigir seletivamente afirmações não comprovadas usando Inferência de Linguagem Natural, a abordagem melhora a precisão factual mantendo baixa latência de resposta e eficiência prática de implantação.

Resumo

Modelos de linguagem grandes (LLMs) apresentam uma tendência crítica de gerar saídas linguisticamente fluentes, mas factualmente incorretas — um fenômeno denominado alucinação — que representa riscos sérios em aplicações que exigem alta precisão. As estratégias atuais de mitigação, incluindo geração aumentada por recuperação e amostragem de autoconsistência, introduzem latência substancial durante a inferência ou dependem de infraestrutura de conhecimento externo, limitando sua aplicabilidade em implantações em tempo real. Este artigo propõe um framework leve de verificação de afirmações em duas etapas, que decompõe as respostas do LLM em afirmações factuais atômicas e verifica independentemente cada afirmação extraída contra uma referência gerada separadamente por meio de um estímulo isolado de recordação factual. Embora o gerador e o verificador compartilhem o mesmo modelo de linguagem subjacente, a separação entre geração de resposta e recordação factual reduz a condicionante direta da resposta e mitiga o viés de confirmação durante a verificação, utilizando Inferência de Linguagem Natural (NLI) e aplicando um limiar estatístico adaptativo — definido como τ = µ + kσ sobre a distribuição dos escores de confiança do NLI — para corrigir seletivamente apenas as afirmações contraditórias. Diferentemente dos métodos anteriores baseados em NLI, que dependem de limites de decisão fixos, o framework proposto adapta dinamicamente seu limiar de verificação à distribuição de confiança de cada resposta, demonstrando desempenho consistente nos benchmarks avaliados, sem necessidade de retravar o modelo. Avaliado nos conjuntos TruthfulQA e FEVER, o framework reduziu a taxa de alucinação de 28% para 9% no TruthfulQA — uma redução relativa de 67,9% — ao adicionar apenas 160 ms de latência adicional em relação ao LLM de referência, superando o SelfCheckGPT e o FActScore em precisão na detecção de alucinações. Esses resultados indicam que o framework pode oferecer um equilíbrio favorável entre confiabilidade factual e latência de resposta nos benchmarks avaliados, embora seja necessária validação adicional em diferentes domínios e configurações de implantação.

Introdução

Modelos de Linguagem de Grande Porte (LLMs) surgiram como componentes fundamentais dos sistemas modernos de inteligência artificial, demonstrando capacidades notáveis em uma ampla gama de tarefas de linguagem natural, incluindo geração de texto, resposta a perguntas, sumarização e raciocínio complexo1. A capacidade deles de produzir respostas fluentes e contextualmente coerentes tem acelerado a adoção em áreas de alto impacto, como apoio à decisão clínica, análise jurídica, engenharia de software e tecnologia educacional2No entanto, uma limitação crítica e persistente compromete sua confiabilidade nesses contextos: a alucinação, na qual os modelos geram respostas fluentes do ponto de vista linguístico, mas factualmente incorretas, sem apoio em evidências ou inteiramente fabricadas³. Estudos empíricos relatam taxas de alucinação variando de 15% a mais de 40%, dependendo da tarefa e do modelo, com sistemas de última geração, como o GPT-4, apresentando inconsistências factuais mensuráveis em avaliações específicas de domínio.2,3. Esta limitação apresenta riscos sérios em aplicações que exigem alta precisão, nas quais saídas incorretas podem levar a informações errôneas, diagnósticos equivocados ou tomadas de decisão deficientes4. As alucinações decorrem fundamentalmente da natureza probabilística dos modelos de linguagem – os LLMs geram tokens prevendo continuidades estatisticamente prováveis de sequências de entrada, ao invés de recuperar ou raciocinar sobre conhecimentos factuais verificados5Como consequência, as saídas geradas podem conter afirmações aparentemente plausíveis, mas incorretas, introduzir asserções sem fundamento ou confundir conceitos semanticamente relacionados, mas factualmente distintos.6.

As estratégias de mitigação existentes abordam esse problema por meio de várias abordagens, cada uma com limitações significativas. A Geração Aumentada por Recuperação (Retrieval-Augmented Generation – RAG) reduz alucinações ao fundamentar as respostas em documentos recuperados externamente, mas introduz uma sobrecarga considerável de latência, exige acesso a bases de conhecimento mantidas e permanece vulnerável a falhas de recuperação em domínios especializados ou com poucos recursos7,8,9.

Embora o gerador de respostas e o gerador de referência sejam instanciados usando o mesmo modelo subjacente GPT-3.5 Turbo, eles operam sob objetivos de estímulo e contextos de execução diferentes. O gerador de respostas produz uma resposta irrestrita à consulta do usuário, enquanto o gerador de referência realiza uma tarefa isolada de recordação factual, sem acesso à resposta previamente gerada. Essa separação reduz os efeitos diretos de condicionamento da resposta e limita o viés de confirmação durante a verificação de afirmações. Assim, o framework trata a referência gerada como proceduralmente independente, e não como estatisticamente independente.

Pesquisas recentes também exploraram estratégias de decodificação leves para reduzir alucinações na geração de texto sem depender de recuperação externa ou verificação repetida. Uma abordagem representativa é a Decodificação por Contraste de Camadas (DoLA), que melhora a factualidade contrastando representações de camadas intermediárias e finais do transformador durante a decodificação. Diferentemente das estruturas de verificação pós-geração, esses métodos intervêm diretamente durante a geração de tokens e, portanto, otimizam uma etapa diferente do processo de geração de linguagem. Essas estratégias complementares demonstram que a mitigação de alucinações pode ser alcançada durante a decodificação ou por meio de verificação pós-geração, com cada abordagem oferecendo trade-offs distintos em termos de sobrecarga computacional, complexidade de implementação e confiabilidade factual.

Métodos de autoconsistência melhoram a confiabilidade factual ao amostrar múltiplas respostas e selecionar a saída mais frequente ou coerente, mas seu custo computacional aumenta linearmente com o número de amostras, tornando-os inadequados para implantações sensíveis à latência8. Abordagens de refinamento iterativo, que revisam repetidamente as saídas por meio de laços de autoavaliação, reduzem progressivamente as taxas de erro, mas ampliam significativamente o tempo de inferência a cada passagem adicional9. Métodos de verificação baseados em inferência natural (NLI) oferecem uma alternativa mais direcionada, ao avaliar a implicação semântica entre afirmações geradas e textos de referência, mas as implementações existentes dependem de limiares de decisão fixos que não conseguem se adaptar a diferentes distribuições de confiança, domínios ou comportamentos de modelos10,11. Em conjunto, essas abordagens ou impõem uma sobrecarga computacional inaceitável, ou dependem de infraestrutura externa, ou carecem da adaptabilidade necessária para implantação generalizada. Uma comparação das principais características dessas abordagens de verificação de alucinações é fornecida na Tabela Suplementar 1.

Este artigo propõe um framework leve de verificação de afirmações em duas etapas, projetado para reduzir alucinações nas saídas de LLMs, mantendo baixa latência de resposta. Na primeira etapa, o LLM gera uma resposta inicial, que é então decomposta em afirmações factuais atômicas. Na segunda etapa, cada afirmação é verificada por meio de Inferência de Linguagem Natural contra uma referência factual gerada separadamente por meio de um raciocínio isolado que não tem acesso à resposta original gerada, e um limiar de confiança derivado estatisticamente rege a decisão de aceitar ou corrigir em nível de afirmação. As principais contribuições deste trabalho são as seguintes: (1) Um pipeline de verificação em nível de afirmação em duas etapas que desacopla a geração de resposta da validação factual, permitindo uma avaliação independente e direcionada de cada afirmação atômica sem necessidade de recuperação externa ou regeneração completa da resposta; (2) Um mecanismo adaptativo de limiarização estatística baseado na distribuição dos escores de confiança de NLI (τ = µ + kσ), que determina dinamicamente os limites de aceitação e correção em vez de depender de regras de decisão fixas, melhorando a robustez em diferentes distribuições de confiança; (3) Uma estratégia de correção seletiva que restringe a regeneração apenas às afirmações classificadas como contraditórias, reduzindo substancialmente o custo computacional em comparação com abordagens de reamostragem completa ou refinamento iterativo; (4) Uma avaliação empírica em um benchmark focado em alucinações, demonstrando que o framework proposto reduz as taxas de alucinação de 28% para 9%, mantendo a latência de resposta dentro de limites práticos para implantação.

Protocolo

Este estudo não envolveu participantes humanos, animais, espécimes biológicos ou dados de pacientes. Portanto, a aprovação ética institucional e o consentimento informado não foram necessários.

Visão geral do desenho do estudo

Um framework de verificação em duas etapas foi implementado para melhorar a confiabilidade factual das saídas de modelos grandes de linguagem (LLM). O procedimento consistiu em geração de respostas, extração de afirmações, construção isolada de referências, verificação baseada em inferência de linguagem natural (NLI), tomada de decisão estatística adaptativa, correção seletiva e montagem final da resposta. O framework foi avaliado utilizando os conjuntos de dados de referência TruthfulQA e FEVER.

Fluxo de trabalho geral

Consulta do usuário → Geração da resposta inicial → Extração de afirmações → Geração independente de referências → Verificação por inferência natural (NLI) → Cálculo do limiar estatístico → Correção de afirmações → Resposta final verificada. O fluxo de trabalho geral do framework adaptativo de verificação de afirmações é ilustrado na Figura 1.

Preparação do conjunto de dados

O conjunto de dados TruthfulQA12, contendo 817 perguntas orientadas a fatos, foi baixado e preparado para avaliação. O conjunto de dados FEVER13 compreende 185.445 alegações anotadas rotuladas como Apoiadas, Refutadas ou Informação Insuficiente; na avaliação, foram utilizados os dados de desenvolvimento rotulados, com seus campos de alegação, evidência e rótulo de referência. Cada alegação foi avaliada com base em sua evidência fornecida, enquanto o rótulo original do FEVER foi mantido como resultado de referência para verificação. O conjunto de dados FEVER, que contém pares de alegações e evidências para verificação de fatos, foi obtido e pré-processado. As perguntas e alegações de entrada foram convertidas em um formato de texto padronizado. Entradas duplicadas e amostras incompletas foram removidas antes dos experimentos. O TruthfulQA foi dividido em subconjuntos de validação e teste. Aproximadamente 20% das amostras do TruthfulQA (164 perguntas) foram usadas para ajuste de limiar, enquanto as 653 perguntas restantes foram reservadas para avaliação de desempenho. Para o FEVER, as alegações fornecidas pelo benchmark foram usadas diretamente como unidades de verificação e não passaram pelo procedimento de geração de respostas e extração de alegações aplicado ao TruthfulQA. As características dos conjuntos de dados de benchmark utilizados para desenvolvimento e avaliação da estrutura são resumidas na Tabela 1.

Geração da resposta inicial

Cada consulta foi enviada ao modelo linguístico base. As respostas foram geradas usando amostragem por núcleo com uma temperatura de 0,7 e um top-p de 0,9. O comprimento máximo da saída foi limitado a 256 tokens. As respostas geradas foram armazenadas sem qualquer pós-processamento ou modificação manual. O texto gerado foi encaminhado diretamente para a etapa de extração de afirmações.

Extração de afirmações

Cada resposta gerada foi decomposta em declarações factuais independentemente verificáveis. Utilizou-se um prompt estruturado de decomposição para identificar afirmações atômicas. Declarações compostas foram separadas em unidades factuais mínimas. Opiniões subjetivas, expressões estilísticas e elementos conversacionais irrelevantes foram removidos. Cada afirmação extraída foi armazenada como uma unidade independente de verificação.

Exemplo:

Resposta original:

“Marie Curie foi uma física e química nascida na Polônia que realizou pesquisas pioneiras sobre radioatividade.”

Afirmações extraídas: (1) Marie Curie nasceu na Polônia; (2) Marie Curie era física e química; (3) Marie Curie realizou pesquisas sobre radioatividade.

Construção de referência isolada:

Para cada afirmação extraída, foi gerada uma referência factual independente. O modelo verificador recebeu apenas a consulta original do usuário. O acesso à resposta original gerada foi restrito para evitar viés de confirmação. Utilizou-se um estímulo de recordação factual para incentivar respostas concisas e baseadas em evidências. As referências geradas foram armazenadas para verificação subsequente.

Verificação da inferência de linguagem natural

Cada par afirmação-referência foi submetido a um modelo pré-treinado de inferência natural da linguagem (NLI). O modelo NLI classificou a relação como: Implicação, Neutro ou Contradição. Foram registradas as probabilidades de confiança para as três classes. Uma pontuação de verificação com sinal foi atribuída: valor positivo para implicação, zero para neutro, ou valor negativo para contradição. Todas as pontuações de verificação foram coletadas para o cálculo do limiar.

Cálculo adaptativo de limite estatístico

A confiança na verificação produzida pelo modelo NLI varia significativamente entre as respostas, pois diferentes consultas geram números distintos de afirmações, níveis de complexidade semântica e distribuições de confiança. Um limiar global fixo assume que todas as respostas seguem um perfil de confiança semelhante, o que raramente é observado na prática. Para acomodar essa variabilidade, o framework proposto estima o limite de decisão individualmente para cada resposta, utilizando a média e o desvio padrão de suas pontuações de verificação. A média reflete o nível geral de confiança da resposta, enquanto o desvio padrão captura a dispersão dos valores de confiança entre as afirmações extraídas. Essa formulação adaptativa permite que o critério de aceitação se ajuste à incerteza específica de cada resposta, em vez de depender de um único limiar para todas as entradas.

A média (µ) e o desvio padrão (σ) de todas as pontuações de verificação com sinal foram calculados.

O limiar de decisão adaptativo foi calculado como:

figure-protocol-1

em que τ representa o limiar adaptativo, µ denota a pontuação média de verificação, σ denota o desvio padrão e k representa o parâmetro de sensibilidade.

O parâmetro de sensibilidade foi inicializado em 0,7. As alegações classificadas como Implicação com escores maiores ou iguais a +τ foram aceitas. As alegações classificadas como Contradição com escores menores ou iguais a −τ foram marcadas para correção. As alegações com escores dentro do intervalo (−τ, +τ) foram mantidas como neutras.

Correção seletiva de reivindicações

Uma afirmação foi encaminhada para correção apenas quando o modelo NLI classificou o par afirmação-referência como Contradição, e sua pontuação de verificação com sinal correspondente atendeu ao critério adaptativo de limite si ≤ -τ. Assim, a decisão de correção foi determinada conjuntamente pelo rótulo da classe NLI e pelo limite estatístico específico da resposta. Afirmações classificadas como Implicação com si ≥ τ foram aceitas, enquanto aquelas que caíram no intervalo -τ < si < τ foram tratadas como neutras e mantidas sem correção. Esse critério combinado garantiu que a correção fosse aplicada apenas a afirmações que exibissem tanto contradição semântica quanto evidência negativa de verificação suficientemente forte.

Reconstrução da resposta

As reivindicações aceitas e corrigidas foram organizadas em sua sequência original. Os limites das frases foram restaurados para manter a legibilidade. Ajustes gramaticais menores foram aplicados quando necessário. A saída montada foi armazenada como a resposta final verificada.

Avaliação de desempenho

A estrutura foi avaliada utilizando quatro métricas: (1) Precisão: a proporção de respostas que permaneceram factualmente corretas após a verificação; (2) Pontuação F1: a média harmônica entre a precisão e a revocação na detecção de alucinações; (3) Latência da Resposta: o tempo total de processamento desde o envio da consulta até a geração da resposta verificada; (4) Taxa de Alucinação

figure-protocol-2

A latência foi relatada como o tempo médio de execução ao longo de medições repetidas. Como os valores individuais de latência por execução não foram mantidos, os desvios padrão e os intervalos de confiança não foram calculados.

Avaliação da correção específica do benchmark

Para o TruthfulQA, a resposta final verificada foi comparada com as referências de respostas validadas por humanos do benchmark e com listas de respostas incorretas. Uma resposta foi considerada correta quando suas afirmações factuais eram consistentes com as informações da resposta aceita e não continham conteúdo correspondente aos padrões identificados de respostas incorretas. Para o FEVER, cada alegação na saída final foi avaliada com base em sua evidência associada e na anotação original do FEVER; alegações Suportadas foram consideradas verificadas factualmente, enquanto alegações Refutadas foram contabilizadas como incorretas. Os casos de Informação Insuficiente foram mantidos como indeterminados, em vez de serem tratados como evidência factual positiva. As decisões resultantes em nível de alegação foram agregadas em cada benchmark para calcular a Acurácia e a Taxa de Alucinação informadas.

Ambiente experimental

O framework foi implementado usando Python 3.9. As operações de processamento de dados foram realizadas usando bibliotecas de análise numérica e tabular. O modelo NLI operou em modo de inferência sem ajuste fino adicional. Os experimentos foram executados em uma estação de trabalho equipada com um processador Intel Core i5, 16 GB de RAM e um sistema operacional de 64 bits. Todas as avaliações foram realizadas usando uma configuração de inferência de passagem única para garantir operação com baixa latência. Todos os experimentos foram conduzidos usando configurações idênticas de hardware e software para assegurar avaliação consistente entre conjuntos de dados e métodos de referência.

Resultado esperado

O protocolo foi projetado para gerar decisões de verificação em nível de afirmação, identificando afirmações potencialmente não comprovadas e encaminhando seletivamente as afirmações fortemente contradizidas para correção. A saída esperada é uma resposta verificada com inconsistências factuais reduzidas e sobrecarga de processamento adicional limitada, sujeita ao desempenho observado durante a avaliação experimental.

Resultados

Geração da resposta inicial

O modelo de linguagem de referência gerou respostas fluentes e contextualmente relevantes para perguntas de ambos os conjuntos de dados de referência. No entanto, um exame detalhado revelou afirmações não comprovadas e factualmente imprecisas em várias respostas. No conjunto de dados TruthfulQA, o sistema de referência apresentou uma taxa de alucinação de 28%, enquanto uma taxa de alucinação de 26% foi observada no conjunto de dados FEVER. Esses resultados confirmaram que a geração direta de linguagem, por si só, era insuficiente para aplicações que exigem alta confiabilidade factual e estabeleceram a condição de referência em relação à qual todos os procedimentos subsequentes de verificação foram comparados.

Extração de afirmações

O procedimento de extração de afirmações decomposou com sucesso as respostas geradas em unidades factuais independentemente verificáveis. As respostas do TruthfulQA continham em média 3,2 afirmações atômicas, enquanto as amostras do FEVER geralmente consistiam em uma única afirmação. O processo de decomposição isolou asserções factuais sem introduzir informações adicionais, permitindo que cada declaração fosse avaliada separadamente. Essa observação apoiou a hipótese de que a verificação em nível de afirmação oferece maior precisão do que avaliar respostas inteiras como uma única unidade.

Construção de referência independente

Foram geradas referências independentes para cada afirmação extraída, utilizando um processo de raciocínio separado, condicionado apenas à consulta original. As referências geradas forneceram descrições factuais concisas que eram suficientemente distintas das respostas originais para servir como fontes de verificação independentes. O processo de geração de referências foi isolado da resposta inicial para evitar condicionar diretamente a referência factual à saída anterior do modelo. Esse isolamento teve como objetivo reduzir o viés de confirmação potencial e fornecer uma base controlada para a verificação subsequente em nível de afirmação; o estudo não quantifica independentemente a extensão desse efeito. A geração bem-sucedida de referências independentes apoiou o princípio de design proposto de separar a recordação do conhecimento da geração da resposta.

Verificação da inferência de linguagem natural

A fase de verificação NLI classificou efetivamente pares de alegações e referências nas categorias de implicação, contradição e neutralidade. Alegações contraditórias receberam consistentemente pontuações negativas de verificação, enquanto alegações factualmente apoiadas receberam pontuações positivas. Classificações neutras foram atribuídas a alegações para as quais não havia evidência de apoio suficiente. Esse comportamento demonstrou que a inferência semântica poderia identificar de forma confiável declarações factuais não apoiadas e fornecer as evidências necessárias para correções direcionadas. Em comparação com uma estratégia simples de verificação de consistência, a verificação NLI reduziu a taxa de alucinação de 20% para 15%, indicando uma melhoria na capacidade de detecção.

Limiarização estatística adaptativa

A aplicação do limiar estatístico adaptativo aprimorou ainda mais o desempenho de verificação, ajustando dinamicamente os limites de decisão com base na distribuição das pontuações de confiança de cada resposta. A análise de sensibilidade do limiar demonstrou que o desempenho melhorou à medida que o parâmetro do limiar aumentou de 0,3 para 0,7. Em um valor de sensibilidade de 0,7, a estrutura alcançou uma acurácia de 0,87, reduzindo alucinações para 9% (Figura 2). Os resultados completos da análise de sensibilidade para os valores avaliados de k estão fornecidos em Tabela Suplementar 2. Aumentar o limiar além desse ponto resultou em ganhos apenas marginais na acurácia, enquanto aumentava a latência. Essas observações corroboram a hipótese de que limiares adaptativos são mais eficazes do que limites de decisão fixos para lidar com distribuições de confiança variáveis entre as respostas.

O limiar adaptativo também reflete a variabilidade dos escores de confiança dentro de cada resposta. Respostas com escores de verificação altamente consistentes produzem um desvio padrão menor, resultando em um limite de decisão mais seletivo. Em contraste, respostas que contêm afirmações com valores de confiança heterogêneos geram um desvio padrão maior, levando a uma região de aceitação mais ampla e reduzindo correções desnecessárias para afirmações incertas. Embora esse comportamento adaptativo não consiga eliminar todos os falsos positivos ou falsos negativos, ele permite que o limite de decisão responda às características de incerteza de cada resposta, em vez de aplicar um critério uniforme a todas as entradas.

Correção seletiva de alegações e montagem de resposta

Apenas as afirmações identificadas como contraditórias foram enviadas para correção, enquanto as afirmações comprovadas e neutras foram mantidas inalteradas. Essa estratégia seletiva de correção minimizou a regeneração desnecessária e preservou a estrutura original da resposta. Após a correção e a reconstrução da resposta, a taxa de alucinação em TruthfulQA diminuiu de 28% para 9%, representando uma redução relativa de 67,9%. Melhorias semelhantes foram observadas em FEVER, onde as alucinações diminuíram de 26% para 10%. As comparações de acurácia e de taxa de alucinação entre as configurações avaliadas são apresentadas nas Figuras 3 e 4, respectivamente.

Avaliação de desempenho

A avaliação comparativa mostrou que o framework proposto alcançou o desempenho geral mais alto entre todos os métodos testados. Em TruthfulQA, o framework obteve uma acurácia de 0,87 e um índice F1 de 0,85, superando tanto a verificação com limiar fixo quanto as abordagens baseadas em autoconsistência (Tabela 2, Figuras 3 e 4). Em FEVER, o framework alcançou uma acurácia de 0,89 e um índice F1 de 0,87 (Tabela 3, Figuras 3 e 4). A contribuição incremental dos componentes do framework é examinada por meio da análise de ablação apresentada na Tabela 4. Essas melhorias confirmaram que combinar verificação em nível de afirmação com tomada de decisão estatística adaptativa aumentou a confiabilidade factual em múltiplos conjuntos de dados. A acurácia na detecção de alucinações para SelfCheckGPT, FActScore e o framework proposto é comparada na Figura 5.

Análise de latência

O pipeline completo de verificação manteve baixa carga computacional. O tempo médio de resposta aumentou de 820 ms para o modelo de referência para 980 ms para o framework completo, representando apenas um aumento modesto no tempo de processamento (Tabela 5). A geração da resposta foi responsável pela maior parte da latência total, enquanto as etapas de verificação e correção contribuíram relativamente pouco com sobrecarga adicional. A divisão do tempo de processamento por etapa é fornecida na Tabela Suplementar 3. Em comparação com sistemas de verificação baseados em recuperação, que exigiam aproximadamente 1600 ms por consulta, o framework proposto alcançou latência substancialmente menor mantendo precisão factual comparável. Esses resultados apoiaram a hipótese de que a redução de alucinações pode ser alcançada sem sacrificar a usabilidade em tempo real.

Como a geração de respostas depende de um modelo de linguagem baseado na nuvem, as medições individuais de latência estão sujeitas a flutuações devido às condições da rede e ao agendamento no lado do servidor, e não a um tempo de execução determinístico. Portanto, foram realizadas medições repetidas para obter valores médios representativos, reduzindo a influência da variabilidade transitória na execução, ao mesmo tempo que se preservam comparações relativas entre os métodos avaliados. Os valores de latência são apresentados como tempos médios de execução ao longo de execuções experimentais repetidas. Os valores individuais de latência por execução não foram mantidos; assim, cálculos a posteriori de variância, intervalos de confiança ou outras medidas de variabilidade não foram possíveis. Consequentemente, os valores de latência e a comparação entre velocidade e precisão na Figura 6 são apresentados como estimativas pontuais, sem barras de erro.

Para concluir, os resultados demonstraram que a combinação da extração de afirmações, geração independente de referências, verificação por Inferência de Linguagem Natural, limiarização estatística adaptativa e correção seletiva aprimorou a confiabilidade factual das saídas de modelos linguísticos grandes. O framework reduziu a taxa de alucinação de 28% para 9% no TruthfulQA e de 26% para 10% no FEVER. Os resultados indicam que a verificação adaptativa em nível de afirmação melhorou as métricas de confiabilidade factual, limitando ao mesmo tempo o aumento adicional na latência de resposta nas condições avaliadas.

Disponibilidade de Dados

Os conjuntos de dados analisados neste estudo estão disponíveis publicamente por meio de suas respectivas fontes oficiais. O manuscrito fornece as informações sobre os conjuntos de dados, as configurações dos modelos e os detalhes metodológicos necessários para apoiar a replicação das análises descritas. Os dados processados para avaliação e os resultados suplementares gerados durante o estudo estão disponíveis nos Arquivos Suplementares.

figure-results-1
Figura 1: Fluxo de trabalho do quadro adaptativo de verificação de alegações. Uma resposta inicial gerada por um modelo linguístico grande (LLM) é decomposta em alegações factuais, seguida por geração independente de referências, verificação baseada em inferência linguística natural (NLI), pontuação de confiança e limiar estatístico. As alegações que atendem ao critério de aceitação são mantidas, enquanto as alegações que atendem ao critério de correção passam por correção direcionada antes da montagem final da resposta. Clique aqui para visualizar uma versão maior desta figura.

figure-results-2
Figura 2: Efeito do parâmetro de sensibilidade (k) na precisão da verificação. Precisão em TruthfulQA e FEVER em valores de k de 0,3, 0,5, 0,7 e 1,0. A precisão aumentou com k em ambos os conjuntos de dados, com k = 0,7 selecionado para a avaliação primária. Clique aqui para visualizar uma versão maior desta figura.

figure-results-3
Figura 3: Comparação de precisão entre métodos de verificação. Precisão do modelo de linguagem de referência, verificação baseada em NLI e o framework de verificação adaptativa proposto nos conjuntos de dados TruthfulQA e FEVER. Clique aqui para visualizar uma versão maior desta figura.

figure-results-4
Figura 4: Comparação da taxa de alucinação entre métodos de verificação. Taxas de alucinação para o modelo de linguagem de referência, verificação baseada em inferência natural e o framework proposto nos conjuntos TruthfulQA e FEVER. O framework proposto reduziu a taxa de 28% para 9% no TruthfulQA e de 26% para 10% no FEVER. Clique aqui para visualizar uma versão maior desta figura.

figure-results-5
Figura 5: Precisão na detecção de alucinações entre diferentes métodos. Precisão de detecção do SelfCheckGPT, FActScore e do framework proposto em TruthfulQA e FEVER. Clique aqui para visualizar uma versão ampliada desta figura.

figure-results-6
Figura 6: Compromisso entre tempo de resposta e precisão nos diferentes métodos de verificação. Relação entre latência de resposta e precisão para os métodos avaliados em TruthfulQA e FEVER, ilustrando o compromisso entre desempenho e latência associado à estrutura proposta e às abordagens comparadoras. Clique aqui para visualizar uma versão maior desta figura.

Conjunto de dadosAmostras UtilizadasDomíniosComprimento Médio da Resposta (tokens)Taxa de Alucinação do LLM de Referência
TruthfulQA81738 (ciência, história, direito, etc.)4228%
FEVER1.000Afirmações factuais gerais1826%

Tabela 1: Características dos conjuntos de dados de referência. Resumo dos conjuntos de dados TruthfulQA e FEVER utilizados para o desenvolvimento e avaliação do framework, incluindo números de amostras, precisão de referência, taxa de alucinação de referência e número médio de afirmações por amostra.

MétodoPrecisãoExatidãoRecuperaçãoPontuação F1Porcentagem de Alucinação
LLM de Base (Inferência Única)0.720.710.690.728%
Verificação Baseada em NLI (Limiar Fixo)0.820.8150.7850.815%
SelfCheckGPT0.760.7550.7250.7422%
FActScore0.850.84250.81750.8311%
Quadro Proposto (Limiar Estatístico)0.870.860.840.859%

Tabela 2: Comparação de desempenho no TruthfulQA. Exatidão, precisão, revocação, pontuação F1 e taxa de alucinação para o modelo de linguagem de referência, SelfCheckGPT, FActScore, verificação NLI e o framework proposto.

MétodoExatidãoPrecisãoRecuperaçãoPontuação F1Porcentagem de alucinação
SelfCheckGPT0.78
FActScore0.87
LLM de referência†0.740.730.710.7226%
Verificação baseada em NLI (Limiar fixo)0.830.82250.79750.8114%
Framework proposto (Limiar estatístico)0.890.87750.86250.8710%

Tabela 3: Comparação de desempenho no FEVER. Exatidão, precisão, revocação, pontuação F1 e taxa de alucinação para o modelo de linguagem de referência, SelfCheckGPT, FActScore, verificação NLI e o framework proposto.

ConfiguraçãoExatidãoPrecisãoRecuperaçãoF1 (adicionado)Taxa de Alucinação
Modelo de Linguagem de Base0.720.710.690.728%
Base + Verificação Secundária (Sem NLI)0.780.77250.74750.76*20%
Base + Verificação Baseada em NLI (Limiar Fixo)0.820.8150.7850.815%
Base + Módulo Estatístico de Decisão (Completo)0.870.860.840.859%

Tabela 4: Análise de ablação dos componentes do framework. Alterações na precisão, pontuação F1 e taxa de alucinação após a incorporação sequencial da validação secundária, verificação NLI e limiarização estatística adaptativa.

MétodoTempo Médio de Resposta (ms)
LLM de Linha de Base (Geração Única)820
Mecanismo de Autovalidação910
Estrutura Estatística Proposta980
Verificação com Recuperação Aprimorada (RAG)1600

Tabela 5: Latência de resposta entre os métodos de verificação. Tempo médio de resposta e latência adicional em relação ao LLM de referência para Autovalidação, o framework proposto e a verificação com reforço por recuperação.

Tabela Suplementar 1: Comparação de abordagens de verificação de alucinações. Comparação do framework proposto com métodos existentes em termos de recuperação externa, verificação em nível de afirmação, limiarização adaptativa e processamento com baixa latência.Clique aqui para baixar este arquivo.

Tabela Suplementar 2: Análise de sensibilidade do parâmetro limite (k). A acurácia, precisão, revocação, pontuação F1 e taxa de alucinação foram obtidas para valores do parâmetro limite de 0,3, 0,5, 0,7 e 1,0. Um valor de k = 0,7 foi utilizado para a avaliação principal.Clique aqui para baixar este arquivo.

Tabela Suplementar 3: Tempo de processamento nas diferentes etapas do pipeline de verificação. Tempo médio de execução e contribuição percentual da geração inicial da resposta, decomposição da alegação, geração de referência, inferência NLI e correção seletiva em relação ao tempo total de resposta.Clique aqui para baixar este arquivo.

Tabela Suplementar 4: Distribuição dos erros identificados durante a verificação. Número e porcentagem de falsos negativos, falsos positivos e erros de correção, juntamente com as categorias principais de alucinação associadas a cada tipo de erro.Clique aqui para baixar este arquivo.

Discussão

O framework proposto melhorou o desempenho na verificação factual, ao mesmo tempo que evitou amostragem repetida e recuperação externa. Em TruthfulQA, a taxa de alucinação diminuiu de 28% para o LLM de referência para 9% com o framework completo, enquanto a precisão aumentou de 0,72 para 0,87. Em FEVER, a taxa de alucinação caiu de 26% para 10%, com precisão aumentando de 0,74 para 0,89. Essas comparações devem ser interpretadas dentro das configurações experimentais e implementações utilizadas neste estudo, e não como evidência de superioridade universal em diferentes condições de implantação. O framework realiza verificação em nível de afirmação após a geração, utilizando uma referência factual isolada e correção seletiva, oferecendo um compromisso entre ancoragem em conhecimento externo, inferência repetida e verificação leve após a geração. Os geradores de resposta e de referência utilizam o mesmo modelo subjacente GPT-3.5 Turbo, mas operam com objetivos de prompt diferentes e em contextos de execução isolados. O gerador de referência recebe apenas a consulta original e não tem acesso à resposta previamente gerada. Assim, os dois processos de geração são independentes proceduralmente, e não estatisticamente, e podem manter vieses factuais correlacionados provenientes de seu modelo pré-treinado compartilhado.

Comparação com abordagens existentes

A linha de base NLI de limite fixo aplica um limite de confiança de 0,7 com base em trabalhos anteriores sobre verificação de factualidade baseada em NLI14. SelfCheckGPT15 representa uma abordagem de detecção de alucinações sem recursos externos, que gera múltiplas amostras estocásticas e utiliza NLI para identificar alegações inconsistentes. FActScore16 decompõe respostas geradas em fatos atômicos e os verifica em relação a referências recuperadas de uma fonte de conhecimento baseada na Wikipedia. Em contraste, o quadro proposto realiza verificação em nível de alegação sem a necessidade de geração repetida da resposta completa ou recuperação externa.

DoLA é uma abordagem complementar leve que melhora a geração de fatos ao contrastar as probabilidades dos tokens derivadas de diferentes camadas do transformador durante a inferência. Uma comparação experimental direta não foi incluída porque o DoLA modifica o processo de geração de tokens, enquanto o framework proposto realiza verificação em nível de afirmação após a geração e correção seletiva. A implementação do DoLA exigiria acesso às representações internas das camadas do transformador, que não são disponibilizadas pela API do GPT-3.5 Turbo utilizada neste estudo. A ausência de recuperação externa reduz a dependência de recuperação e os requisitos de processamento associados, mas também limita a verificação ao conhecimento disponível nos modelos subjacentes. Consequentemente, fabricações completas ou afirmações especializadas fora da cobertura de conhecimento do verificador permanecem difíceis de corrigir.

Limiarização estatística adaptativa e correção seletiva

O limiar adaptativo é derivado da distribuição empírica de pontuação de confiança e controla o compromisso entre a sensibilidade na detecção de alucinações e a precisão na correção. A análise de sensibilidade avaliou os valores de 0,3, 0,5, 0,7 e 1,0 em um conjunto de validação separado do TruthfulQA. Um valor de k = 0,7 proporcionou o compromisso mais equilibrado entre redução de alucinações e eficiência computacional para os benchmarks avaliados.

O limiar ideal pode variar entre domínios de aplicação, pois a distribuição dos escores de confiança da NLI depende da natureza do conteúdo gerado. Para aplicação em um novo domínio, um conjunto de validação que reflita a aplicação alvo pode, portanto, ser utilizado para avaliar valores candidatos e selecionar um valor que equilibre desempenho na verificação factual, taxa de correção e latência de processamento. Como a otimização do limiar envolve um único parâmetro escalar, em vez de retrinar os modelos, a adaptação não exige a modificação dos modelos subjacentes.

A correção seletiva restringe a regeneração a afirmações classificadas como Contradição e que satisfazem o critério de limiar estatístico. Isso evita o processamento repetido de afirmações que não atendem ao critério de correção e distingue a estrutura das abordagens de reamostragem de resposta completa e refinamento iterativo.

Compromisso entre latência e desempenho

O framework proposto alcançou um tempo médio de resposta de 980 ms, comparado a 820 ms para o modelo de linguagem de referência e 1600 ms para a verificação aumentada por recuperação. A análise por etapas mostrou que a geração inicial da resposta representou 83,7% da latência total, enquanto a inferência NLI contribuiu com 3,9% e a correção seletiva contribuiu com menos de 1% em média. Os valores de latência são relatados como tempos médios de execução em execuções experimentais repetidas. Os valores individuais de latência por execução não foram mantidos; portanto, não foi possível o cálculo posterior de variância, intervalos de confiança ou outras medidas de variabilidade. Assim, os valores de latência e a comparação velocidade-precisão são apresentados como estimativas pontuais sem barras de erro. Os valores de latência relatados refletem o ambiente experimental utilizado neste estudo e podem variar sob diferentes condições de implantação, especialmente quando são utilizadas APIs de modelos de linguagem baseadas em nuvem. A latência de rede, a carga do servidor e a disponibilidade do serviço podem influenciar independentemente os tempos absolutos de resposta, independentemente do framework de verificação proposto.

Análise de erro

As alegações incorretamente processadas no conjunto de testes TruthfulQA foram categorizadas como falsos negativos, falsos positivos ou erros de correção. A distribuição e as principais categorias desses erros são resumidas na Tabela Suplementar 4. Os falsos negativos representaram 52,6% de todos os erros e estiveram principalmente associados a alucinações temporais e substituições factuais sutis. Erros temporais podem passar despercebidos quando o verificador compartilha o limite de treinamento do modelo base, enquanto substituições factuais sutis podem receber pontuações de NLI na faixa Neutra em vez de Contradição.

Falsos positivos representaram 35,9% dos erros e ocorreram principalmente em relação a fatos incomuns, altamente específicos ou recentemente estabelecidos, fora da cobertura de conhecimento de alta confiança do modelo verificador. Esses casos produziram pontuações fracas de inferência lógica natural (NLI), apesar das afirmações serem factualmente corretas. Erros de correção representaram 11,5% de todos os erros e ocorreram quando fabricações completas foram identificadas, mas o processo de correção gerou uma nova afirmação imprecisa devido à cobertura insuficiente de conhecimento do verificador.

Essas descobertas indicam que os erros residuais decorrem tanto da discriminação NLI quanto da cobertura do conhecimento do verificador, particularmente para imprecisões temporais, substituições factuais sutis, fatos incomuns e fabricações completas.

Análise estatística

A taxa de alucinação diminuiu de 15% com a verificação NLI de limite fixo para 9% com o framework estatístico proposto, enquanto o framework completo reduziu a taxa de 28% para a linha de base para 9% no TruthfulQA. Essas diferenças são relatadas como mudanças descritivas no desempenho, e nenhuma significância estatística formal é alegada, pois a avaliação atual não inclui os resultados de testes estatísticos e estimativas de tamanho do efeito necessários para sustentar tal inferência17,18.

Limitações

O desempenho de verificação do framework é limitado pela capacidade do modelo NLI subjacente. O DeBERTa-v3-large pode ter dificuldades com comparações numéricas finas, raciocínio temporal e alegações que exigem inferência multi-etapa ao longo de múltiplos fatos. As limitações do modelo NLI também foram associadas a falsos negativos envolvendo substituições factuais sutis, e fraquezas sistemáticas no modelo NLI podem se propagar para as decisões de verificação.

Os geradores de resposta e de referência utilizam o mesmo modelo subjacente GPT-3.5 Turbo. Embora diferentes objetivos de prompt e contextos de execução isolados proporcionem independência procedural, os dois processos não são estatisticamente independentes e podem manter vieses factuais correlacionados provenientes de seu modelo pré-treinado compartilhado.

O acoplamento entre avaliador e verificador representa uma limitação adicional. A avaliação final de alucinação utiliza o mesmo modelo de NLI que verifica as afirmações dentro do pipeline proposto. Isso pode introduzir concordância entre o verificador e o avaliador e influenciar a melhoria medida. Os resultados relatados devem, portanto, ser interpretados como desempenho sob o procedimento de avaliação baseado em NLI definido, e não como evidência totalmente independente de redução de alucinação. Uma avaliação humana independente ou um modelo de avaliação desenvolvido separadamente forneceria uma validação mais robusta.

A fase de decomposição de afirmações foi avaliada unicamente quanto à sua contribuição para a verificação de ponta a ponta e não foi analisada independentemente com base em limites de afirmações anotados por humanos. Consequentemente, o estudo não fornece uma estimativa quantitativa separada da precisão da decomposição ou da propagação individual de seus erros para a verificação subsequente.

A avaliação foi limitada ao TruthfulQA e ao FEVER e ao conteúdo em língua inglesa. Portanto, o desempenho observado não estabelece generalização para domínios especializados, configurações multilíngues ou geração de texto longo. O valor ótimo de k também pode variar entre domínios de aplicação, pois as distribuições de pontuações de confiança na NLI dependem da natureza do conteúdo gerado. Assim, é necessária uma calibração específica para cada domínio e uma avaliação mais ampla antes de estender os achados para além das condições avaliadas neste estudo.

Por fim, as medições de latência são específicas para a configuração experimental e podem variar entre ambientes de execução. Como as medições individuais por execução não foram mantidas, a variabilidade e os intervalos de confiança não puderam ser estimados a posteriori. A avaliação futura deve preservar as medições individuais e incluir uma caracterização estatística mais ampla da latência entre ambientes de execução.

Trabalhos futuros

Estudos futuros devem abordar as principais limitações identificadas no presente arcabouço. É necessária uma calibração de limiar com conhecimento de domínio, pois o valor fixo (k = 0,7) selecionado usando o TruthfulQA pode não ser ideal para domínios especializados com distribuições diferentes de escores de confiança na inferência natural de linguagem (NLI). Dados de validação específicos do domínio poderiam ser utilizados para calibrar o limiar e, quando necessário, aplicar penalidades assimétricas para erros de falso negativo e falso positivo19.

A decomposição aprimorada de alegações deve incluir avaliação independente utilizando limites de alegações anotados por humanos para quantificar completude, correção e propagação de erros em etapas subsequentes. Modelos de decomposição com ajuste fino e medidas de confiança na decomposição poderiam reduzir ainda mais os erros decorrentes de alegações mal segmentadas. Avaliações comparativas futuras também deveriam incluir abordagens leves baseadas em decodificação, como a DoLA, dentro de um protocolo experimental unificado.

A recuperação leve com aumento pode ajudar a resolver fabricações completas, o que ainda é difícil quando o verificador não possui conhecimento factual suficiente. Um recurso de recuperação direcionado para afirmações contraditórias com baixa confiança poderia fornecer apoio factual externo sem exigir recuperação para cada afirmação20.

Uma extensão multilíngue também é necessária porque a avaliação atual está limitada a benchmarks em língua inglesa3. Estudos futuros devem avaliar modelos multilíngues de NLI e prompts específicos do idioma para decomposição e correção de alegações em benchmarks multilíngues de alucinação.

Conclusão

Este estudo apresentou um framework de verificação de afirmações em duas etapas, combinando a decomposição de afirmações atômicas, a geração separada de referências factuais com prompts distintos, verificação NLI, limiarização estatística adaptativa e correção seletiva. Em TruthfulQA, o framework reduziu a taxa de alucinação de 28% para 9%, aumentando a latência média em 160 ms em relação ao LLM de referência. Em FEVER, a taxa de alucinação diminuiu de 26% para 10%.

O framework proposto alcançou desempenho competitivo na verificação factual sem amostragem repetida de respostas completas ou recuperação externa. O limiar adaptativo e a correção seletiva contribuíram para o desempenho observado, ao mesmo tempo que limitaram a sobrecarga adicional de processamento. No entanto, os resultados estão restritos aos benchmarks avaliados e às condições experimentais, permanecendo sujeitos à dependência do modelo de inferência natural (NLI), ao acoplamento entre avaliador e verificador, à incerteza na decomposição de alegações, à calibração de limiares específica por domínio e à variabilidade de latência. Assim sendo, é necessário um processo de avaliação mais amplo, independente, específico por domínio e multilíngue antes de estender os resultados a contextos mais amplos de implantação.

Divulgações

Os autores não têm conflitos de interesse a declarar.

Agradecimentos

Os autores gostariam de expressar sua sincera gratidão à sua instituição pelo fornecimento do ambiente acadêmico e dos recursos computacionais necessários para realizar esta pesquisa. Os autores também agradecem aos desenvolvedores e mantenedores dos conjuntos de dados de referência de acesso público utilizados neste estudo, que permitiram uma avaliação abrangente do framework proposto. Aprecia-se a colaboração de colegas e revisores pelo feedback construtivo, que ajudou a melhorar a qualidade e a clareza deste trabalho. Os autores agradecem ainda à comunidade de pesquisa de código aberto pelo fornecimento das bibliotecas e ferramentas de software que facilitaram a experimentação, a análise de dados e a visualização dos resultados. Seus esforços contínuos têm avançado significativamente a pesquisa em processamento de linguagem natural e inteligência artificial confiável. Os autores declaram que nenhum apoio financeiro externo ou financiamento foi recebido para esta pesquisa.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Conjunto de dados de referência FEVERTarefa Compartilhada FEVER (Thorne et al.)https://fever.ai/dataset/fever.htmlConjunto de dados público de pares alegação-evidência para verificação de fatos, usado para avaliação
GPT-3.5 Turbo (grande modelo linguístico B10+2:12:12OpenAIModel ID: gpt-3.5-turbo; https://developers.openai.com/api/docs/models/gpt-3.5-turboUtilizado tanto como gerador de respostas quanto como gerador de referência independente, acessado por meio da API OpenAI
NumPyDesenvolvedores do NumPy (código aberto)https://numpy.org/Biblioteca de computação numérica usada para cálculos estatísticos, incluindo média e desvio padrão dos escores de verificação NLI
Openai (biblioteca cliente Python)OpenAIhttps://github.com/openai/openai-pythonBiblioteca cliente Python usada para enviar prompts e recuperar conclusões do GPT-3.5 Turbo
pandasEquipe de Desenvolvimento do pandas (código aberto)https://pandas.pydata.org/Biblioteca de análise de dados tabulares usada para pré-processamento do conjunto de dados e manipulação dos resultados
Modelo de classificação pré-treinado de Inferência de Linguagem Natural (NLI)Model Hub da Hugging Face (modelo baseado na arquitetura DeBERTa-v3-large da Microsoft)MoritzLaurer/DeBERTa-v3-large-mnli-fever-anli-ling-wanliUtilizado em modo de inferência, sem ajuste fino, para classificar cada par alegação-referência como implicação, neutralidade ou contradição
PythonPython Software FoundationVersão 3.9; https://www.python.org/downloads/release/python-390/Linguagem de programação principal usada para implementar o framework de verificação
SciPyDesenvolvedores do SciPy (código aberto)https://scipy.org/Biblioteca de computação científica usada para apoiar a análise estatística dos resultados experimentais
Transformers (biblioteca Hugging Face Transformers)Hugging Facehttps://github.com/huggingface/transformersBiblioteca Python usada para carregar e executar o modelo NLI pré-treinado
Conjunto de dados de referência TruthfulQAOriginalmente publicado por Lin, Hilton e Evanshttps://github.com/sylinrl/TruthfulQAConjunto de dados de referência público com 817 perguntas orientadas a fatos, usado para ajuste de limiar e avaliação
Computador workstationNão especificado no manuscrito (por favor, confirme fabricante/modelo)Processador Intel Core i5; 16 GB de RAM; sistema operacional de 64 bitsHardware utilizado para executar todos os experimentos em configurações idênticas
Observação: Todos os URLs listados acima foram verificados e confirmados ativos na data desta tabela. 

Referências

  1. Dai Z, et al. Promptagator: Few-shot dense retrieval from 8 examples [conference presentation]. Presented at: The Eleventh International Conference on Learning Representations; 2022. [https://iclr.cc/virtual/2023/poster/10937]
  2. Achiam J, et al. GPT-4 technical report. arXiv. 2023;arXiv:2303.08774. [https://arxiv.org/abs/2303.08774]
  3. Ji Z, et al. Survey of hallucination in natural language generation. ACM Comput Surv. 2023;55(12):1-38.
  4. Bender EM, McMillan-Major A, Shmitchell S, Gebru T. On the dangers of stochastic parrots: Can language models be too big? [conference presentation]. Presented at: 2021 ACM Conference on Fairness, Accountability, and Transparency; 2021. [https://dl.acm.org/doi/10.1145/3442188.3445922]
  5. Devlin J, et al. BERT: Pre-training of deep bidirectional transformers for language understanding [conference presentation]. Presented at: 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; 2019. [https://arxiv.org/abs/1810.04805]
  6. Maynez J, Narayan S, Bohnet B, McDonald R. On faithfulness and factuality in abstractive summarization [conference presentation]. Presented at: 58th Annual Meeting of the Association for Computational Linguistics; 2020. [https://arxiv.org/abs/2005.00661]
  7. Brown T, et al. Language models are few-shot learners. Adv Neural Inf Process Syst. 2020;33:1877-901.
  8. Guu K, et al. Retrieval augmented language model pre-training [conference presentation]. Presented at: International Conference on Machine Learning; 2020. [https://arxiv.org/abs/2002.08909]
  9. Izacard G, Grave E. Leveraging passage retrieval with generative models for open domain question answering [conference presentation]. Presented at: 16th Conference of the European Chapter of the Association for Computational Linguistics; 2021. [https://arxiv.org/abs/2007.01282]
  10. Bowman SR, Angeli G, Potts C, Manning CD. A large annotated corpus for learning natural language inference [conference presentation]. Presented at: 2015 Conference on Empirical Methods in Natural Language Processing; 2015. [https://arxiv.org/abs/1508.05326]
  11. Platt J. Probabilistic outputs for support vector machines and comparisons to regularized likelihood methods. Adv Large Margin Classif. 1999;10(3):61-74.
  12. Lin S, Hilton J, Evans O. Truthfulqa: Measuring how models mimic human falsehoods. InProceedings of the 60th annual meeting of the association for computational linguistics (volume 1: long papers) 2022 May (pp. 3214-3252).
  13. Thorne J, Vlachos A, Christodoulopoulos C, Mittal A. FEVER: A large-scale dataset for fact extraction and verification [conference presentation]. Presented at: 2018 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; 2018. [https://aclanthology.org/N18-1074/]
  14. Williams A, Nangia N, Bowman SR. A broad-coverage challenge corpus for sentence understanding through inference. arXiv. 2017;arXiv:1704.05426.
  15. Manakul P, Liusie A, Gales M. SelfCheckGPT: Zero-resource black-box hallucination detection for generative large language models [conference presentation]. Presented at: 2023 Conference on Empirical Methods in Natural Language Processing; 2023.
  16. Min S, et al. FActScore: Fine-grained atomic evaluation of factual precision in long-form text generation. arXiv. 2023;arXiv:2305.14251.
  17. Cohen J. Statistical power analysis for the behavioral sciences. Routledge; New York; 2013.
  18. Kadavath S, et al. Language models (mostly) know what they know. arXiv. 2022;arXiv:2207.05221.
  19. Hendrycks D, et al. Aligning AI with shared human values. arXiv. 2020;arXiv:2008.02275.
  20. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-74.

Reimpressões e permissões

Etiquetas

Infer ncia de Linguagem NaturalRecupera o FactualLimiar AdaptativoVerifica o de Baixa Lat nciaBenchmark TruthfulQASelfCheckGPT
Vídeo em breve