Research Article

Ajuste fino de grandes modelos de linguagem usando o Índice de Alucinação de Entidades para Resumo de Texto

DOI:

10.3791/68962

January 9th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Propomos uma abordagem de ajuste fino baseada em aprendizado por reforço para grandes modelos de linguagem que utiliza o Índice de Alucinação Enti (EHI) como sinal de recompensa para reduzir alucinações em nível de entidade na sumarização de texto. Experimentos com transcrições de reuniões mostram que esse método melhora a fidelidade e a precisão das entidades.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Avanços recentes em grandes modelos de linguagem (LLMs) levaram a melhorias notáveis na qualidade da sumarização abstrata. No entanto, alucinações – especialmente alucinações em nível de entidade, onde entidades inexistentes ou incorretas são introduzidas – continua sendo um desafio crítico. Neste trabalho, propomos uma estrutura de ajuste fino orientada por recompensas para modelos de sumarização usando o Índice de Alucinação de Entidades (EHI) como métrica orientadora. A metodologia aqui começa com a geração de resumos iniciais a partir de modelos pré-treinados como Flan-T5, DistilBART e Mistral (ou outro LLM popular) em conjuntos de dados estruturados de transcrições, XSUM. Calculamos o EHI extraindo entidades nomeadas tanto de resumos gerados quanto de referências gold, avaliando a precisão e penalizando entidades fabricadas. O processo de ajuste fino é guiado pelo aprendizado por reforço, onde o EHI serve como sinal de recompensa. Adotamos um mecanismo de atualização no estilo REINFORCE para otimizar o modelo de sumarização visando maximizar a fidelidade das entidades. Experimentos demonstram que modelos ajustados com EHI alcançam taxas de alucinação mais baixas sem comprometer a informação. Além disso, mostramos que modelos guiados por EHI generalizam melhor em tarefas de sumarização fora do domínio, sugerindo maior robustez. A abordagem aqui oferece uma direção prática para melhorar a factualidade na sumarização, enfatizando o papel crítico da representação precisa das entidades.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Modelos de sumarização abstrata, impulsionados por grandes modelos de linguagem (LLMs), alcançaram resultados impressionantes em diversos domínios. No entanto, um desafio persistente permanece a alucinação, onde resumos gerados incluem informações incorretas ou fabricadas que não têm base na entradade origem 1,2. Em aplicações de alto risco, como resumo de reuniões, relatórios médicos ou documentação financeira, alucinações, especialmente envolvendo entidades nomeadas, podem minar significativamente a confiabilidade e autilidade 3.

Pesquisadoresde pesquisa realizaram uma avaliação humana em grande escala e descobriram que os sumimizadores frequentemente produzem alucinações — conteúdo que não é apoiado pelo documento de origem — e que essas alucinações estão correlacionadas com repetição eincoerência 1. Outro estudo mostrou que modelos com maior abstração tendem a ser menos fiéis; O estudo deles relatou que resultados com mais abstração apresentavam menor precisão factual e mais frasesinfiéis 2. O benchmark FRANK relatou que cerca de 30% dos resumos contêm inconsistências factuais, e outro estudo popular observou taxas de erro semelhantes, argumentando que altos níveis de alucinação tornam os resumos praticamente inúteis 1,2. Alucinações podem ser categorizadas como intrínsecas (contradizendo a fonte) ou extrínsecas (não verificáveis pela fonte). Um tutorial sobre alucinações em sumarização abstrativa explica que alucinações intrínsecas ocorrem quando o conteúdo gerado contradiz a entrada (por exemplo, reportando erroneamente uma vacina aprovada como sendo rejeitada), enquanto alucinações extrínsecas adicionam fatos não verificáveis, como alegar ensaios clínicos para uma vacina que não sãomencionados 4. Também relatou que sumimizadores de última geração produzem conteúdo alucinado em cerca de 25% de seus resultados quando avaliados com ROUGE, BLEU e METEOR, e alerta que alucinações podem ser prejudiciais em áreas como saúde, direito ou cibersegurança.

Métricas tradicionais de n-gramas (ROUGE5, BLEU, METEOR) se correlacionam mal com os julgamentos humanos sobre a factualidade, levando ao desenvolvimento de métricas baseadas e livres dereferências 6. Métricas baseadas em QA, como FEQA e QuestEval, avaliam resumos perguntando se pares pergunta-resposta derivados do resumo podem ser respondidos usando o texto fonte. A FEQA correlaciona-se mais fortemente com os julgamentos humanos e mostra que resumos mais abstratos tendem a ser menos fiéis, enquanto o QuestEval melhora substancialmente a correlação com os julgamentos humanos em consistência, coerência, fluência e relevância. O QAFactEval refina essa abordagem selecionando respostas por frases nominais e gerando perguntas antes de respondê-las; essa estratégia melhora a correlação com as avaliações humanas no benchmark SummaC. Métricas de extração de informação (IE) representam o conhecimento como tuplas sujeito-relação-objeto, mas são vulneráveis a erros no processo de extração. Métricas de inferência em linguagem natural (NLI) — como FactCC e SummaC — classificam frases resumidas como implicadas ou contraditas pela fonte4. O FactCC utiliza dados pouco supervisionados para treinar um classificador que detecta consistência factual e destaca abrangênciasinconsistentes 2. O SummaC aplica modelos NLI com a granularidade apropriada e fornece estimativas fortes de factualidade, mas o benchmark FRANK observa que essas métricas ainda tratam a factualidade como binária e carecem de uma estruturaunificada 1,7,8. Dimensões de avaliação humana propostas pelos pesquisadores são amplamente adotadas9. Outro estudo de avaliação enfatiza que a consistência é a dimensão mais objetiva porque simplesmente verifica se o resumo é incluído pela fonte; ela aponta que até 92% dos resumos XSum contêm erros defidelidade 9,10. No entanto, a avaliação humana é demorada e cara, portanto métricas automáticas são essenciais para uma avaliaçãoescalável 8. Métricas atuais frequentemente agregam alucinações intrínsecas e extrínsecas em uma única pontuação, dificultando o diagnósticode erro 4.

Como o treinamento de máxima verosimilhança não otimiza diretamente a qualidade do resumo, o aprendizado por reforço (RL) tem sido aplicado para melhorar a relevância e a factualidade. Pasunuru e Bansal introduziram uma estrutura RL multi-recompensa que combina saliência (ROUGE) e recompensas de implicação, demonstrando desempenhode última geração 11. RL foi aplicado para sumarização extrativa usando o algoritmo REFORCE; seu modelo maximiza as pontuações ROUGE e produz resumos mais informativos do que as abordagens baseadas em classificadores, como mostrado pelas avaliações humanas de perguntase respostas 12. Modelos multitarefa incorporam ainda geração de perguntas e geração de implicações para garantir cobertura ecoerência 12. Uma pesquisa abrangente de 2024 sobre sumarização abstrativa destaca a consistência factual como um desafio fundamental e defende que o RL incentive uma resumidão verdadeira. A pesquisa sugere recompensar resumos factualmente consistentes e incorporar fontes externas de conhecimento e controle de atributos para aumentar a precisão13. O RL a partir do feedback humano (RLHF) amplia essa ideia treinando um modelo de recompensa com base nas preferências humanas e ajustando o sumizador para maximizar essa recompensaaprendida 9. O aprendizado por reforço a partir do feedback humano (RLHF) ganhou força para alinhar resultados de modelos com qualidades desejadas, como factualidade eutilidade 4,14. Embora RL e RLHF multi-recompensa alinhem os modelos com as noções humanas de fidelidade, eles dependem de métricas grosseiras como ROUGE ou factualidade binária. Em contraste, o trabalho detalhado aqui propõe usar um índice de alucinação em nível de entidade detalhado como recompensa, o que é empírico e computacionalmente menos custoso sem feedback humano.

Apesar de inúmeros critérios, várias limitações persistem. Métricas N-gramas ignoram a correção semântica, métricas baseadas em QA e IE propagam erros de modelos de geração e extração de perguntas, e métricas NLI reduzem a factualidade a decisões binárias de implicação 1,4,6. No trabalho de pesquisa, foi enfatizado que métricas baseadas em modelos existentes têm dificuldade em identificar alucinações com uma granularidade fina porque operam no nível da frase ou documento e não conseguem isolar entidades específicas causandoerros 4. As avaliações humanas continuam sendo o padrão ouro, mas são caras esubjetivas 15. Além disso, métricas existentes não distinguem entre alucinações intrínsecas e extrínsecas nem capturam o foco excessivo e subfoco dasrelações 1. Grandes modelos de linguagem podem alucinar porque preveem texto com base em verosimilhança estatística, e não em verificação factual. Modelos geram resultados confiantes, porém incorretos, devido a limitações nos dados de treinamento, geração probabilística e falta de verificação de fatos, além de excesso de confiança e vieses que podem levá-los a afirmar informações falsas com alta certeza; O guia defende geração aumentada por recuperação e modelos de memória de longo prazo para terra em dadosexternos 15. No entanto, essas técnicas focam em tarefas baseadas em recuperação; A sumarização ainda exige métricas que identifiquem e penalizem entidades alucinadas. Trabalhos anteriores reconheceram a importância da avaliação em nível de entidade para a factualidade. Métricas como FEQA e QuestEval tentam avaliar a consistência factual usando técnicas de respostaa perguntas 16,17. No entanto, esses métodos frequentemente exigem resumos de referência ou sistemas externos de QA, limitando a escalabilidade. Nosso trabalho se baseia nessa linha empregando o Índice de Alucinação de Entidades (EHI), uma métrica empírica leve que foca especificamente na fidelidade de entidades nomeadas, categorizando as entidades em cinco tipos de fatores de alucinação, conforme mostrado na Figura 1.

Evidências indicam que alucinações são generalizadas, métricas de avaliação são imperfeitas e técnicas de RL carecem de recompensas detalhadas. Estudos em humanos mostram que modelos de sumarização alucinam em uma fração significativa dos casos, frequentemente trocando de entidades ou fabricando detalhes9. Métricas existentes enfatizam a sobreposição de n-gramas ou tratam a factualidade como binária, e os métodos atuais de RL otimizam sinais ROUGE ou factualidade grosseira. Existe uma lacuna para métricas em nível de entidade que medem quando um resumo menciona entidades que não estão presentes na fonte (alucinação negativa), omite entidades-chave (alucinação de foco perdido) e outros cenários. O método proposto de ajuste fino sobre o Índice de Alucinação da Entidade (EHI) preenche essa lacuna ao quantificar alucinações no nível da entidade e fornecer uma recompensa estruturada para o aprendizado por reforço. Ao integrar EHI ao RLHF, buscamos ajustar modelos de linguagem grandes para minimizar alucinações em nível de entidade e produzir resumos que sejam fluentes e fiéis aos fatos.

Neste trabalho, propomos uma abordagem inovadora de ajuste fino que utiliza o Índice de Alucinações da Entidade (EHI) como um sinal de recompensa para reduzir alucinações no nível da entidade. O EHI quantifica a correção e o fundamento das entidades comparando as entidades extraídas das saídas do modelo com as presentes no documento de entrada, permitindo uma redução da dependência dasreferências 18. O método descrito aqui tendece o modelo para produzir mais resumos fiéis à entidade sem exigir anotações de factualidade humana.

Em resumo, modelos de recompensa conscientes da factualidade foram usados para ajustarfinamente 19,20. Diferentemente de abordagens anteriores que dependem de recompensas factuales grosseiras ou conjuntos de dados rotulados por humanos, propomos o ajuste fino usando o EHI como um sinal direto e automático de recompensa, promovendo assim uma sumarização baseada em entidades sem supervisão adicional. As contribuições inovadoras deste estudo são as seguintes: (i) o estudo introduz uma estrutura de ajuste fino guiada por EHI que melhora a fidelidade das entidades na sumarização abstrata, (ii) o estudo apresenta um pipeline escalável de aprendizado por reforço que não depende de conjuntos de dados factuales rotulados por humanos, (iii) o estudo demonstra melhorias empíricas nas pontuações EHI em conjuntos de dados de transcrições de reuniões, conjunto de dados de notícias XSUM e realiza análises qualitativas para destacar reduções nas alucinações, (iv) o estudo compartilha uma implementação reprodutível baseada em Colab para facilitar pesquisas adicionais sobre a sumarização consciente daalucinação 21.

Este estudo avalia a hipótese de que otimizar modelos de linguagem com recompensas focadas em entidades detalhadas, como o EHI, oferece um caminho eficaz para aumentar a fidelidade e a confiabilidade em tarefas de sumarização com computação mínima. A abordagem contribui para o crescente campo de ajuste fino eficiente em parâmetros para fidelidade na sumarização ao: (i) demonstrar eficácia tanto em arquiteturas codificador-decodificador (DistilBART, FlanT5) quanto em arquiteturas apenas decodificador (Mistral), (ii) fornecer uma estrutura que pode ser adaptada a diferentes tipos de modelos, domínios e escalas, e (iii) oferecer eficiência computacional em comparação com o retreinamento completo.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O objetivo deste estudo é afinar um modelo de linguagem (LM) para gerar resumos com alucinações de entidade reduzida. Alucinações ocorrem quando um modelo "produz com confiança resultados incorretos ou irrelevantes" porque gera texto baseado em probabilidade estatística, e não em verificação factual. Isso é alcançado projetando uma função de recompensa baseada no Índice de Alucinação da Entidade (EHI) e aplicando aprendizado por reforço para maximizá-la.

Formulação do problema
Dado um documento de entrada Xi, o objetivo é gerar um resumo Yi de modo que as entidades mencionadas em Yi estejam fundamentadas em Xi. O treinamento tradicional de máxima verosimilhança não otimiza explicitamente a consistência factual. Esses métodos de treinamento não penalizam a inclusão de entidades fabricadas. Portanto, é introduzida uma estratégia de ajuste fino orientada por recompensa, onde a recompensa é proporcional à fidelidade da entidade, medida usando EHI.

Conjunto de dados e método
São usados dois corpora: primeiro, um conjunto de dados de transcrição de diálogos com transcrições de reuniões em múltiplos turnos e resumos abstratos ouro, e segundo, o benchmark de resumo de notíciasXSUM 22,23. Cada conjunto de dados foi limpo, achatado e dividido em 80% de treinamento, 10% de validação e 10% de partições de teste. Os diálogos são ricos em linguagem informal e pronomes, enquanto o XSUM contém artigos de notícias concisos; A combinação nos permite avaliar tanto a generalização dentro quanto fora do domínio.

A extração de entidades é realizada tanto em documentos fonte quanto em resumos para calcular o Índice de Alucinações de Entidades (EHI). Durante o ajuste fino, este estudo utiliza exclusivamente a divisão de treinamento, enquanto as pontuações EHI de validação são monitoradas para selecionar o melhor ponto de verificação. As avaliações finais são reportadas no conjunto de teste que está em aberto, que permanece zero-shot antes e depois do ajuste fino dos modelos.

Em resumo, primeiramente, as transcrições são organizadas em um formato achatado e dividem os dados. O modelo pré-treinado gera resumos de linha base. Em segundo lugar, o EHI é calculado usando NER baseado em transformador e os cinco fatores de alucinação. Durante o ajuste fino, o modelo é atualizado com a recompensa EHI via adaptadores LoRa. Por fim, os resumos são gerados usando o modelo ajustado e avaliados usando EHI, Entidade F1 e outras métricas (Figura 2). Todos os experimentos são reproduzíveis através do código fornecido e dos arquivos de configuração. A Figura 3 mostra o fluxo de processo passo a passo para preparação de conjuntos de dados, sumarização de linha de base, cálculo de EHI, ajuste fino e avaliação.

Resumo da linha de base
Três LLMs pré-treinados são escolhidos, e suas sumarizações básicas são capturadas: Flan-T5, Mistral (Nous-Hermes-2-Mistral-7B-DPO) e DistilBART 24,25,26. Cada modelo era executado em modo zero-shot para produzir um resumo inicial (Yi) para cada documento de entrada (xi). A busca por feixe com largura de feixe de 4 e penalidade de comprimento de 1,0 foi usada para incentivar resumos fluentes, porém concisos. Esses resumos de base serviram para estimar a prevalência de alucinações e forneceram pontos de partida para ajustes finos.

Extração de entidades e computação EHI
Calcular com precisão o Índice de Alucinação da Entidade (EHI) requer um NER robusto. Inicialmente, o Spacy foi usado para operações da NER. Entende-se que modelos NER baseados em transformadores são mais precisos, mas Spacy foi a escolha inicial pelos seguintes motivos: (1) Modelos NER baseados em transformadores provaram alucinar mais do que Spacy. (2) O espaçamento sendo estatístico traz eficiência computacional em termos de custo de implementação e tempo de execução. (3) Também nos ajuda a provar que o EHI é robusto na redução de alucinações mesmo com um modelo NER mais fraco. No entanto, dado que os experimentos são feitos com conjuntos de dados estabelecidos e o modelo en_core_web_sm do spaCy é frágil nas transcriçõescoloquiais 13. O espaçamento é substituído por um modelo NER baseado em transformador (dslim/bert-base-NER), que é um modelo BERT ajustado com base no conjunto de dados CoNLL-2003. Sistemas NER baseados em BERT demonstraram superar modelos spaCy em tarefas específicas de domínio — por exemplo, um modelo Aviation-BERT-NER atingiu um F1 de 94,78% ao identificar 17 entidades, comparado a 93,73% para o spaCy NER, que reconheceusete entidades 27. O modelo NER do BERT foi configurado via Hugging Face Transformers28 e realizou correspondência insensível a maiúsculas minúsculas. Para capturar pronomes e variações na forma superficial, esse método aplicava ainda regras simples que mapeiam "Sr. Smith" e "Smith" para a mesma forma canônica; no entanto, a resolução total de copreferência ainda é trabalho futuro. A análise comparativa dos modelos NER em uma amostra de 200 registros do conjunto de dados XSUM pode ser inferida a partir da Tabela 1.

O Índice de Alucinação da Entidade (EHI) é calculado como:

figure-protocol-1

onde PH, EF, OF, NH, LF representam pontuações correspondentes a Alucinação Positiva (HP), Fator de Extratividade (FE), Alucinação Negativa (NH), Entidades Excessivamente Focadas (OF) e Foco Perdido (LF), respectivamente, para o artigo i.

Detalhes dos fatores de alucinação:

Alucinação Positiva (HP): Medidas de entidades recém-introduzidas que são factualmente corretas e benéficas.

Fator de Extração (FE): Mede as entidades extraídas corretamente do documento de entrada no resumo.

Alucinação Negativa (NH): Captura entidades alucinadas que estão incorretas ou não fundamentadas na entrada.

Focado demais (OF): Penaliza resumos que focam excessivamente em um subconjunto restrito de entidades, faltando diversidade.

Foco Perdido (LF): Penaliza resumos que omitem entidades importantes presentes na entrada.

O cálculo dos fatores acima é detalhado na Figura 4 com um cálculo de exemplo para fins ilustrativos. Considerando um exemplo de Entidades de Documento de Entrada (I):"John"," "IA"," conferência" Entidades de Resumo de Referência (R):"John"," "IA" Entidades de Resumo Geradas (G):"John"," "IA"," tecnologia". Valores mais altos de EHI indicam melhor fidelidade à entidade, recompensando resumos que são tanto extrativos quanto positivamente alucinados (introduzindo entidades úteis, porém fiéis), enquanto penalizam entidades20 sem fundamento, excessivas ou ausentes. Esses fatores foram normalizados pelo número total de entidades detectadas para produzir uma pontuação EHI entre 0 e 1. A validação EHI foi monitorada durante o treinamento para selecionar o melhor ponto de verificação. PH e EF recompensam novas entidades benéficas e a extração correta, enquanto OF, NH e LF penalizam repetição, fabricação e omissão. Uma pontuação perfeita de 1,0 significa que todas as entidades no resumo estão fundamentadas ou alucinavas benéficas, enquanto uma pontuação 0 indica que nenhuma entidade nomeada no resumo aparece na fonte.

Procedimento de ajuste fino com RL
A configuração detalhada dos hiperparâmetros para ajuste fino é fornecida separadamente nas Tabelas 2, Tabela 3 e Tabela 4, que mostram tipos de otimizadores, taxas de aprendizado, tamanhos de lote, especificações de hardware e outros detalhes de configuração para Mistral-7B, DistilBart e Flan-T5, respectivamente. O objetivo aqui é ajustar os parâmetros do modelo θ maximizando a recompensa esperada do Índice de Alucinação de Entidade (EHI) em resumos gerados. Formalmente, para um documento de entrada Xi, um resumo gerado Yi e parâmetros do modelo θ , o objetivo esperado de recompensa é definido como:

figure-protocol-2(2)

onde EHI (y, x) denota o Índice de Alucinação da Entidade calculado entre o resumo gerado Yi e a entrada Xi.

Seguindo o algoritmoREINFORCE 25, o gradiente desse objetivo é estimado como:

figure-protocol-3(3)

Na prática, resumos foram amostrados dos modelos, seus correspondentes EHI foram calculados e atualizações do gradiente de políticas foram aplicadas para incentivar resultados de maior recompensa. Para possibilitar ajustes finos eficientes em parametros, este estudo utilizou Adaptação de Baixo Nível (LoRA). Apenas os adaptadores LoRA foram atualizados, enquanto os pesos do modelo base permaneceram congelados. O ajuste fino foi realizado em uma GPU A100 com baixa taxa de aprendizado (por exemplo, 5 × 10-6), tamanho de lote de 4 e acumulação de gradiente em 8 passos com o otimizadorAdam 29. Resumos eram regenerados a cada 500 atualizações para atualizar as estimativas de recompensa, e o treinamento continuava até que o EHI de validação convergisse. A linha base do REINFORCE foi definida para a média contínua das recompensas recentes para reduzir a variância. Além do EHI, Entidade F12, as pontuações ROUGE-1/2/L foram registradas para monitorar a qualidade geral. Os resumos são regenerados periodicamente para refletir melhorias do modelo durante o ajuste fino.

Métricas de avaliação
Os resultados foram avaliados usando métricas de Informatividade como Rouge-1, Rouge-25. Métrica de fluência como a RougeLCS 5. Métrica de sobreposição de entidades Entidade F1, e métricas de alucinação como EHI, FactCC e QAGS 2,6,18,30. O FactCC utiliza um classificador treinado com dados sintéticos de contradição para rotular frases como implicadas ou contraditas pela fonte. O factCC dá duas pontuações; as partituras foram capturadas onde o rótulo é VÁLIDO. Por outro lado, o QAGS utiliza um método de perguntas e respostas que roda em um LLM. O modelo leve T5 pequeno foi usado para gerar perguntas no texto31. Roberta_base_Squad2 era usado para gerar respostas sobre o textode saída 32. Esses modelos foram escolhidos por seu custo conveniente de computação para execução.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os experimentos aqui focam em evidências quantitativas sobre o impacto que o ajuste fino guiado por EHI tem na redução de alucinações em nível de entidade em múltiplas arquiteturas de modelos e conjuntos de dados. Os resultados demonstram melhorias consistentes nas métricas de alucinação, mantendo a consistência factual e preservando a capacidade de responder perguntas e respostas.

Desempenho do conjunto de dados
Desempenho do conj...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Métricas baseadas em QA (por exemplo, FEQA/QuestEval/QAFactEval) e métricas baseadas em NLI (por exemplo, FactCC/SummaC) exigem componentes auxiliares de QA/implicação e frequentemente fornecem julgamentos em nível de sentença. Em contraste, EHI é uma pontuação leve, sem referência, em nível de entidade, que (i) tem como alvo direto o modo primário de falha que observamos — alucinação de entidades; (ii) é independente do modelo e rápido para calcular; e (iii) serve como uma recompensa de...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores não têm nada a revelar.

Materials

```html

List of materials used in this article
NameCompanyCatalog NumberComments
Colab NVIDIA A100 GPUNVIDIAN/AGoogle Colaboratory Pro
DistilBART (Encoder–Decoder)Hugging Facehttps://huggingface.co/sshleifer/distilbart-cnn-12-6
dslim/bert-base-NERHugging Face (dslim)https://huggingface.co/dslim/bert-base-NERFine-tuned BERT base para NER em inglês
Evaluation Models  QAGS (QA-based)Salesforce ResearchN/AClassificador de factualidade
Evaluation Models (Factuality) FactCCGoogle ResearchN/AClassificador de factualidade
Flan-T5 (Encoder–Decoder)Googlehttps://huggingface.co/docs/transformers/main/en/model_doc/flan-t5modelo de linguagem grande, open-source, texto para texto
Hugging Face TransformersHugging Face, Inc.https://huggingface.co/docs/transformers/indexCarregamento e ajuste fino de modelos
Nous-Hermes-2-Mistral-7B-DPOMistralhttps://huggingface.co/NousResearch/Nous-Hermes-2-Mistral-7B-DPOModelo de linguagem com 7 bilhões de parâmetros
Programming Language
Python 3.10 (Colab runtime)
Python Software FoundationVersão 3.10Implementação principal
StreamlitOpen Source https://streamlit.io/Classificador de factualidade
XLSUM datasetBUEThttps://github.com/csebuetnlp/xl-sum
XSUM datasetUniversity of Edinburghhttps://github.com/EdinburghNLP/XSum
```

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Maynez, J., Narayan, S., Bohnet, B., McDonald, R. On faithfulness and factuality in abstractive summarization. Proc Annu Meet Assoc Comput Linguist. 2020, 173-173 (2020).
  2. FEQA: A question answering evaluation framework for faithfulness assessment in abstractive summarization. Durmus, E., He, H., Diab, M. Proc Conf Empir Methods Nat Lang Process, , 454-454 (2020).
  3. A short summary of automatic summarization. NLG Blog. , Andong. https://andongluis.github.io/nlg-blog/Summarization-post/ (2018).
  4. Understanding factuality in abstractive summarization. Pagnoni, A., Padmakumar, V., May, J. Proc Conf North Am Chapter Assoc Comput Linguist Hum Lang Technol, 2021, 4812-4829 (2021).
  5. Lin, C. Y. ROUGE: A package for automatic evaluation of summaries. Workshop Text Summarization Branches Out. 2004, 74-81 (2004).
  6. Evaluating the factual consistency of abstractive text summarization. Kryściński, W., McCann, B., Xiong, C., Socher, R. Proc Conf Empir Methods Nat Lang Process, 2020, 750-750 (2020).
  7. Goyal, T., Durmus, E., Cardie, C. Fact checking summarization with self supervised and few shot learning. Proc Annu Meet Assoc Comput Linguist. 2022, 564-579 (2022).
  8. QuestEval: Summarization asks for fact-based evaluation. Scialom, T., Dray, P. A., Lamprier, S., Piwowarski, B., Staiano, J., Wang, A., Gallinari, P. Proc Conf Empir Methods Nat Lang Process, 2021, 6594-6604 (2021).
  9. Mukesh, K. Hallucinations in abstractive summarization. Medium. , https://medium.com/@mukesh.kr/hallucinations-in-abstractive-summarization-b5904bc1c5c5 (2023).
  10. Factual error correction for abstractive summarization models. Cao, M., Dong, Y., Wu, J., Cheung, J. C. K. Proc Conf Empir Methods Nat Lang Process, 2020, 6251-6258 (2020).
  11. Yan, E. Evaluation & hallucination detection for abstractive summaries. , https://eugeneyan.com/writing/abstractive-summarization-evaluation/ (2021).
  12. Uekawa, A. Evaluation metrics for summarization. , https://dev.to/akuer/evaluation-metrics-for-summarization-1d7f (2023).
  13. Honnibal, M., Montani, I. spaCy 2: Natural language understanding with Bloom embeddings convolutional neural networks and incremental parsing. Zenodo. , (2017).
  14. Reinforcement learning from human feedback: Aligning large language models. , At https://neptune.ai/blog/reinforcement-learning-from-human-feedback (2023).
  15. Shakil, H., Farooq, A., Kalita, J. Abstractive text summarization: State of the art, challenges, and improvements. Neurocomputing. 603, 128255-128255 (2024).
  16. AI, Z. Reducing LLM hallucinations: A developer's guide. GetZep. , https://www.getzep.com/ai-agents/reducing-llm-hallucinations/ (2025).
  17. Ouyang, L., et al. Training language models to follow instructions with human feedback. Adv Neural Inf Process Syst. 2022, 27730-27744 (2022).
  18. Entity hallucination index in abstractive summarization-A metric. Praveenkumar, K., Balbantaray, R. C., Vittala, K. P. Proc Int Conf Commun Circuits Syst, 2023, 1-5 (2023).
  19. Multi-reward reinforced summarization with saliency and entailment. Pasunuru, R., Bansal, M. Proc Conf North Am Chapter Assoc Comput Linguist Hum Lang Technol, 2018, 646-653 (2018).
  20. Williams, R. J. Simple statistical gradient-following algorithms for connectionist reinforcement learning. Mach Learn. 8 (3-4), 229-256 (1992).
  21. Katwe NLP. EHI_XLSUM_XSUM_Finetuning. , GitHub. https://github.com/katweNLP/EHI_XLSUM_XSUM_Finetuning (2025).
  22. ELITR minuting corpus: A novel dataset for automatic minuting from multi-party meetings in English and Czech. Nedoluzhko, A., Singh, M., Hledíková, M., Ghosal, T., Bojar, O. Proc Int Conf Lang Resour Eval (LREC), 2022, 2623-2632 (2022).
  23. Don't give me the details, just the summary! Topic aware convolutional neural networks for extreme summarization. Narayan, S., Cohen, S. B., Lapata, M. Proc Conf Empir Methods Nat Lang Process, 2018, 1797-1807 (2018).
  24. Lewis, M., et al. Denoising sequence to sequence pre training for natural language generation, translation, and comprehension. Proc Annu Meet Assoc Comput Linguist. 2020, 7871-7880 (2020).
  25. Chung, H. W., et al. Scaling instruction fine-tuned language models. J Mach Learn Res. 25 (1), 1-53 (2024).
  26. Jiang, A. Q., et al. Mistral 7B. arXiv. , (2023).
  27. Chandra, C., Ojima, Y., Bendarkar, M. V., Mavris, D. N. Aviation BERT NER: Named entity recognition for aviation safety reports. Aerospace. 11 (11), 890-890 (2024).
  28. Lim, D. S. bert-base-NER. , https://huggingface.co/dslim/bert-base-NER (2021).
  29. Adam: A method for stochastic optimization. Kingma, D. P., Ba, J. Int Conf Learn Represent, , (2015).
  30. QAGS: Evaluating question answering and generation for summarization. Wang, A., Cho, K. Proc Conf Empir Methods Nat Lang Process, 2020, 390-402 (2020).
  31. Patil, S. valhalla/t5-small-qg-hl. , https://huggingface.co/valhalla/t5-small-qg-hl (2020).
  32. deepset/roberta-base-squad2. , Deepset GmbH. https://huggingface.co/deepset/roberta-base-squad2 (2020).
  33. Factually consistent summarization via reinforcement learning with textual entailment feedback. Roit, P., et al. Proc Annu Meet Assoc Comput Linguist, 2023, 8027-8044 (2023).
  34. Hallucination diversity aware active learning for text summarization. Xia, Y., et al. Proc Conf North Am Chapter Assoc Comput Linguist Hum Lang Technol, 2024, 3885-3900 (2024).
  35. Wei, Z., et al. TruthRL: Incentivizing truthful large language models via reinforcement learning. arXiv. , (2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Large Language ModelsEntity HallucinationText SummarizationEntity Hallucination IndexAbstractive SummarizationReinforcement LearningNamed Entity ExtractionModel Fine TuningSummarization RobustnessFactuality Improvement

Related Articles