Research Article

Dostrajanie dużych modeli językowych za pomocą indeksu urojeń entytytów do sumaryzacji tekstu

DOI:

10.3791/68962

January 9th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Proponujemy podejście do dostrajania modeli językowych opartych na uczeniu się przez wzmacnianie, które wykorzystuje Enti Hallucination Index (EHI) jako sygnał nagrody w celu zmniejszenia halucynacji na poziomie encji w podsumowaniu tekstu. Eksperymenty na transkrypcjach spotkań pokazują, że ta metoda poprawia wierność i dokładność encji.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ostatnie osiągnięcia w dużych modelach językowych (LLMs) doprowadziły do znacznej poprawy jakości abstrakcyjnego sumaryzowania. Jednak hallucynacja – szczególnie hallucynacja na poziomie encji, gdzie wprowadzane są nieistniejące lub nieprawidłowe encje – pozostaje krytycznym wyzwaniem. W niniejszej pracy proponujemy ramy do dostrajania modeli sumaryzacyjnych opartych na wskaźniku nagród, wykorzystując wskaźnik hallucynacji encji (EHI) jako wskaźnik kierujący. Metodologia rozpoczyna się od generowania początkowych streszczeń z wstępnie przetrenowanych modeli takich jak Flan-T5, DistilBART i Mistral (lub innych popularnych LLM) na strukturalnych zbiorach danych transkrypcji, XSUM. Obliczamy EHI przez wyodrębnianie nazwanych encji zarówno z wygenerowanych streszczeń, jak i z referencyjnych streszczeń, oceniając precyzję i karząc sfałszowane encje. Proces dostrajania jest kierowany przez uczenie wzmacniające, gdzie EHI służy jako sygnał nagród. Stosujemy mechanizm aktualizacji w stylu REINFORCE w celu zoptymalizowania modelu sumaryzacji pod kątem maksymalizacji wiarygodności encji. Eksperymenty wykazują, że modele dostrojone z wykorzystaniem EHI osiągają niższe współczynniki hallucynacji bez kompromisu dla ich pouczającej treści. Ponadto pokazujemy, że modele kierowane przez EHI lepiej generalizują się w zadaniach sumaryzacyjnych poza domeną, sugerując zwiększoną odporność. Zaproponowane podejście oferuje praktyczny kierunek poprawy faktyczności w sumaryzacji, podkreślając krytyczną rolę dokładnego przedstawiania encji.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Modele sumaryzacyjne abstrakcyjne, zasilane dużymi modelami językowymi (LLMs), osiągnęły imponujące wyniki w różnych dziedzinach. Jednakże nadal istnieje trwałe wyzwanie polegające na halucynacjach, gdzie wygenerowane podsumowania zawierają niepoprawne lub fabrykowane informacje, które nie są zakorzenione w źródłowym wejściu1,2. W zastosowaniach o wysokich stajkach, takich jak podsumowanie spotkań, raportowanie medyczne czy dokumentacja finansowa, halucynacje, szczególnie te zawierające nazwane jednostki, mogą znacząco podważyć wiarygodność i użyteczność3.

Badanie przeprowadzone przez badaczy na dużą skalę wykazało, że summarizery często generują halucynacje – treść, która nie jest wspierana przez dokument źródłowy – i że te halucynacje koreluje się z powtórzeniami i niekoherencją1. Inne badanie wykazało, że modele o wyższym stopniu abstrakcyjności mają tendencję do mniejszej wierności; ich badanie doniosło, że wyniki zawierające więcej abstrakcji miały niższą dokładność faktualną i więcej niewiernych zdań2. Benchmark FRANK doniósł, że około 30% podsumowań zawierało niezgody faktualne, a inne popularne badanie zwróciło uwagę na podobne współczynniki błędów, twierdząc, że wysoki poziom halucynacji sprawia, że podsumowania są praktycznie bezużyteczne1,2. Halucynacje można sklasyfikować jako wewnętrzne (sprzeczne ze źródłem) lub zewnętrzne (nieweryfikowalne ze źródła). Tutorial na temat halucynacji w abstrakcyjnym podsumowywaniu wyjaśnia, że halucynacje wewnętrzne występują, gdy wygenerowana treść jest sprzeczna z wejściem (np. niewłaściwe zgłoszenie zatwierdzonej szczepionki jako odrzucone), podczas gdy halucynacje zewnętrzne dodają nieweryfikowalne fakty, takie jak twierdzenie o przeprowadzaniu badań klinicznych dla szczepionki, które nie zostały wspomniane4. Badanie doniosło również, że najlepsze summarizery generują halucynującą treść w około 25% ich wyników, gdy są oceniane za pomocą ROUGE, BLEU i METEOR, i ostrzega, że halucynacje mogą być szkodliwe w dziedzinach takich jak zdrowie, prawo czy bezpieczeństwo cybernetyczne.

Tradycyjne metryki n-gramowe (ROUGE5, BLEU, METEOR) słabo korelują z ludzkimi ocenakami faktualności, co skłoniło do opracowania metryk opartych na referencji i nieopartych na referencji6. Metryki oparte na QA, takie jak FEQA i QuestEval, oceniają podsumowania poprzez pytanie, czy pary pytanie-odpowiedz pochodzące z podsumowania mogą być odpowiedziane przy użyciu tekstu źródłowego. FEQA koreluje silniej z ocenakami ludzkimi i pokazuje, że bardziej abstrakcyjne podsumowania mają tendencję do mniejszej wierności, podczas gdy QuestEval znacząco poprawia korelacje z ocenakami ludzkimi w zakresie spójności, koherencji, płynności i istotności. QAFactEval udoskonalił to podejście poprzez wybieranie odpowiedzi w postaci fraz nominalnych i generowanie pytań przed ich odpowiedzią; ta strategia poprawia korelacje z ocenami ludzkimi w benchmarku SummaC. Metryki ekstrakcji informacji (IE) reprezentują wiedzę jako trójki podmiot-relacja-obiekt, ale są podatne na błędy w procesie ekstrakcji. Metryki wnioskowania naturalnego języka (NLI) – takie jak FactCC i SummaC – klasyfikują zdania podsumowania jako zawarte lub sprzeczne ze źródłem4. FactCC używa słabo nadzorowanych danych do trenowania klasyfikatora, który wykrywa spójność faktualną i podświetla niespójne fragmenty2. SummaC stosuje modele NLI na odpowiedniej granicy i daje silne oszacowania faktualności, ale benchmark FRANK zauważa, że te metryki nadal traktują faktualność jako binarną i brakuje im ujednoliconej ramy1,7,8. Proponowane przez badaczy wymiary oceny ludzkiej – płynność, koherencja, istotność i spójność – są szeroko stosowane9. Inne badanie oceny podkreśla, że spójność jest najbardziej obiektywnym wymiarem, ponieważ po prostu sprawdza, czy podsumowanie jest zawarte w źródle; wskazuje, że aż do 92% podsumowań XSum zawiera błędy wierności9,10. Jednakże ocena ludzka jest czasochłonna i kosztowna, więc automatyczne metryki są niezbędne dla skalowalnej oceny8. Obecne metryki często łączą halucynacje wewnętrzne i zewnętrzne w pojedynczy wynik, utrudniając diagnozowanie błędów4.

Ponieważ trening o maksymalnym prawdopodobieństwie nie optymalizuje bezpośrednio jakości podsumowania, uczenie wzmacniające (RL) zostało zastosowane, aby poprawić istotność i faktualność. Pasunuru i Bansal wprowadzili wielowyznaniowe otoczenie RL, które łączy nagrody z saliency (ROUGE) i wyników z zakresu wyników, i wykazało najlepszą wydajność11. RL zostało zastosowane do podsumowywania ek

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Celem niniejszej pracy jest dostrojenie modelu językowego (LM) w celu generowania podsumowań z zmniejszoną halucynacją encji. Halucynacje występują, gdy model "z pewnością produkuje niewłaściwe lub nieistotne wyniki", ponieważ generuje tekst zgodnie ze statystyczną prawdopodobieństwem, a nie weryfikacją faktyczną. Osiąga się to poprzez zaprojektowanie funkcji nagrody opartej na indeksie halucynacji encji (EHI) i zastosowanie uczenia wzmacniającego w celu jej zmaksymalizowania.

Sformułowanie problemu
Mając dokument wejściowy Xi, celem jest wygenerowanie podsumowania Yi takiego, że encje wymienione w Yi są zakorzenione w Xi. Tradycyjne trenowanie o maksymalnym prawdopodobieństwie nie optymalizuje bezpośrednio spójności faktycznej. Te metody trenowania nie karzą za dołączenie wymyślonych encji. Dlatego wprowadzona zostaje strategia dostojenia napędzana nagrodami, gdzie nagroda jest proporcjonalna do wierności encji, mierzonej za pomocą EHI.

Zestaw danych i metoda
Wykorzystano dwa korpusy: po pierwsze, zbiór transkrypcji dialogów z wielowypowiedziowych transkrypcji spotkań i abstrakcyjnych podsumowań referencyjnych, a po drugie, benchmark sumaryzacji wiadomości XSUM22,23. Każdy zbiór został oczyszczony, spłaszczony i podzielony na 80% na trening, 10% na walidację i 10% na test. Dialogi są bogate w język potoczny i zaimki, podczas gdy XSUM zawiera zwięzłe artykuły informacyjne; kombinacja pozwala nam na ewaluację zarówno generalizacji w obrębie domeny, jak i poza nią.

Wyciąganie encji jest przeprowadzane zarówno na źródłowych dokumentach, jak i podsumowaniach w celu obliczenia Indeksu Halucynacji Encji (EHI). Podczas dostojenia, niniejsza praca wyłącznie wykorzystuje podzbiór treningowy, podczas gdy wskaźniki EHI na walidacji są monitorowane, aby wybrać najlepszy checkpoint. Ostateczne ewaluacje są raportowane na wyłączonym zbiorze testowym, który pozostaje zero-shot przed i po dostrojeniu modeli.

Podsumowując, po pierwsze, transkrypcje są organizowanie w spłaszczony format i dzielone na dane. Przetrenowany model generuje podsumowania bazowe. Po drugie, EHI jest obliczany za pomocą opartego na transformatorach NER i pięciu czynników halucynacji. Podczas dostojenia, model jest aktualizowany za pomocą nagrody EHI przez adaptery LoRa. Wreszcie, podsumowania są generowane za pomocą dostrojonego modelu i oceniane za pomocą EHI, Encja F1 i innych wskaźników (Rysunek 2). Wszystkie eksperymenty są powtarzalne dzięki dostarczonym kodom i plikom konfiguracyjnym. Rysunek 3 przedstawia stopniowy przepływ procesu przygotowania zbioru danych, bazowego sumaryzowania, obliczania EHI, dostojenia i ewaluacje.

Podsumowanie bazowe
Wybrane zostały trzy przetrenowanie LLM, a ich bazowe sumaryzowanie zostało uchwycone: Flan-T5, Mistral (Nous-Hermes-2-Mistral-7B-DPO) i DistilBART24,25,26. Każdy model był uruchamiany w trybie zero-shot, aby wygenerować początkowe podsumowanie (Yi) dla każdego dokumentu wejściowego (xi). Wyszukiwanie wiązkowe z szerokością wiązki równą 4 i karą długości równą 1.0 zostało zastosowane, aby zachęcić do płynnych, ale zwięzłych podsumowań. Te bazowe podsumowania służyły do oszacowania częstości występowania halucynacji i dostarczyły punktów wyjściowych do dostojenia.

Wyciąganie encji i obliczanie EHI
Dokładne obliczenie Indeksu Halucynacji Encji (EHI) wymaga solidnego NER. Początkowo, do operacji NER używano Spacy. Rozumie się, że modele NER oparte na transformatorach są bardziej dokładne, ale Spacy był początkowym wyborem z następujących powodów: (1) Modele NER oparte na transformatorach udowodniły, że halucynują bardziej niż Spacy. (2) Spacy będąc statystycznym wprowadza efektywność obliczeniową pod względem kosztów implementacji i czasu wykonania. (3) Pomaga nam również udowodnić, że EHI jest odporny na zmniejszenie halucynacji nawet z słabszym modelem NER. Jednak, biorąc pod uwagę fakt, że eksperymenty są przeprowadzane na uznanych zbiorach danych i spaCy's en_core_web_sm model jest kruchy na potocznych transkrypcjach13. Spacy jest zastępowany transformatorowym modelem NER (dslim/bert-base-NER), który jest modelem BERT dostrojonym na zbiorze danych CoNLL-2003. Systemy NER oparte na BERT zostały wykazane jako lepsze od modeli spaCy w zadaniach specyficznych dla domeny - na przykład, model Aviation-BERT-NER osiągnął F1 równe 94,78% identyfikując 17 encji w porównaniu z 93,73% dla spaCy NER, który rozpoznał siedem encji27. Model NER BERT został skonfigurowany za pomocą Hugging Face Transformers28 i wykonywał dopasowanie niezależne od wielkości liter. Aby uchwycić zaimki i wariacje powierzchniowe, ta metoda dodatkowo zastosowała proste zasady, które mapują "Pan Smith" i "Smith" do tej samej kanonicznej formy; jednak peł

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Eksperymenty tutaj koncentrują się na ilościowych dowodach wpływu, jaki EHI-guided fine-tuning ma na zmniejszenie halucynacji na poziomie jednostek w wielu architekturach modeli i zbiorach danych. Wyniki pokazują spójne poprawy w metrykach halucynacji, zachowując spójność faktograficzną i zachowując zdolności odpowiedzi na pytania.

Wyniki działania zestawu danych
Wyniki działania zestawu danych rozmów:
Tabela 5 przedstawia wyniki r...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Mierniki oparte na pytaniach (np. FEQA/QuestEval/QAFactEval) i mierniki oparte na NIJ (np. FactCC/SummaC) wymagają dodatkowych komponentów QA/entailment i często dostarczają ocen na poziomie zdania. W przeciwieństwie do tego, EHI jest lekkim, niezależnym od referencji, wskaźnikiem na poziomie encji, który (i) bezpośrednio atakuje główny tryb awarii, który obserwujemy -- halucynacje encji; (ii) jest niezależny od modelu i szybki do obliczenia; oraz (iii) służy jako gęsta nagroda dla dostrajania RL. Empirycznie, EHI uzupeł...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają nic do ujawnienia.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Colab NVIDIA A100 GPUNVIDIAN/AGoogle Colaboratory Pro
DistilBART (Encoder–Decoder)Hugging Facehttps://huggingface.co/sshleifer/distilbart-cnn-12-6
dslim/bert-base-NERHugging Face (dslim)https://huggingface.co/dslim/bert-base-NERFine-tuned BERT base for English NER
Evaluation Models  QAGS (QA-based)Salesforce ResearchN/AKlasyfikator faktów
Evaluation Models (Factuality) FactCCGoogle ResearchN/AKlasyfikator faktów
Flan-T5 (Encoder–Decoder)Googlehttps://huggingface.co/docs/transformers/main/en/model_doc/flan-t5open-source, text-to-text, large language model
Hugging Face TransformersHugging Face, Inc.https://huggingface.co/docs/transformers/indexŁadowanie modelu & dostrajanie
Nous-Hermes-2-Mistral-7B-DPOMistralhttps://huggingface.co/NousResearch/Nous-Hermes-2-Mistral-7B-DPOModel językowy 7 miliardów parametrów
Język programowania
Python 3.10 (środowisko uruchomieniowe Colab)
Python Software FoundationWersja 3.10Implementacja rdzeniowa
StreamlitOpen Source https://streamlit.io/Klasyfikator faktów
Zestaw danych XLSUMBUEThttps://github.com/csebuetnlp/xl-sum
Zestaw danych XSUMUniversity of Edinburghhttps://github.com/EdinburghNLP/XSum

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Maynez, J., Narayan, S., Bohnet, B., McDonald, R. On faithfulness and factuality in abstractive summarization. Proc Annu Meet Assoc Comput Linguist. 2020, 173-173 (2020).
  2. FEQA: A question answering evaluation framework for faithfulness assessment in abstractive summarization. Durmus, E., He, H., Diab, M. Proc Conf Empir Methods Nat Lang Process, , 454-454 (2020).
  3. A short summary of automatic summarization. NLG Blog. , Andong. https://andongluis.github.io/nlg-blog/Summarization-post/ (2018).
  4. Understanding factuality in abstractive summarization. Pagnoni, A., Padmakumar, V., May, J. Proc Conf North Am Chapter Assoc Comput Linguist Hum Lang Technol, 2021, 4812-4829 (2021).
  5. Lin, C. Y. ROUGE: A package for automatic evaluation of summaries. Workshop Text Summarization Branches Out. 2004, 74-81 (2004).
  6. Evaluating the factual consistency of abstractive text summarization. Kryściński, W., McCann, B., Xiong, C., Socher, R. Proc Conf Empir Methods Nat Lang Process, 2020, 750-750 (2020).
  7. Goyal, T., Durmus, E., Cardie, C. Fact checking summarization with self supervised and few shot learning. Proc Annu Meet Assoc Comput Linguist. 2022, 564-579 (2022).
  8. QuestEval: Summarization asks for fact-based evaluation. Scialom, T., Dray, P. A., Lamprier, S., Piwowarski, B., Staiano, J., Wang, A., Gallinari, P. Proc Conf Empir Methods Nat Lang Process, 2021, 6594-6604 (2021).
  9. Mukesh, K. Hallucinations in abstractive summarization. Medium. , https://medium.com/@mukesh.kr/hallucinations-in-abstractive-summarization-b5904bc1c5c5 (2023).
  10. Factual error correction for abstractive summarization models. Cao, M., Dong, Y., Wu, J., Cheung, J. C. K. Proc Conf Empir Methods Nat Lang Process, 2020, 6251-6258 (2020).
  11. Yan, E. Evaluation & hallucination detection for abstractive summaries. , https://eugeneyan.com/writing/abstractive-summarization-evaluation/ (2021).
  12. Uekawa, A. Evaluation metrics for summarization. , https://dev.to/akuer/evaluation-metrics-for-summarization-1d7f (2023).
  13. Honnibal, M., Montani, I. spaCy 2: Natural language understanding with Bloom embeddings convolutional neural networks and incremental parsing. Zenodo. , (2017).
  14. Reinforcement learning from human feedback: Aligning large language models. , At https://neptune.ai/blog/reinforcement-learning-from-human-feedback (2023).
  15. Shakil, H., Farooq, A., Kalita, J. Abstractive text summarization: State of the art, challenges, and improvements. Neurocomputing. 603, 128255-128255 (2024).
  16. AI, Z. Reducing LLM hallucinations: A developer's guide. GetZep. , https://www.getzep.com/ai-agents/reducing-llm-hallucinations/ (2025).
  17. Ouyang, L., et al. Training language models to follow instructions with human feedback. Adv Neural Inf Process Syst. 2022, 27730-27744 (2022).
  18. Entity hallucination index in abstractive summarization-A metric. Praveenkumar, K., Balbantaray, R. C., Vittala, K. P. Proc Int Conf Commun Circuits Syst, 2023, 1-5 (2023).
  19. Multi-reward reinforced summarization with saliency and entailment. Pasunuru, R., Bansal, M. Proc Conf North Am Chapter Assoc Comput Linguist Hum Lang Technol, 2018, 646-653 (2018).
  20. Williams, R. J. Simple statistical gradient-following algorithms for connectionist reinforcement learning. Mach Learn. 8 (3-4), 229-256 (1992).
  21. Katwe NLP. EHI_XLSUM_XSUM_Finetuning. , GitHub. https://github.com/katweNLP/EHI_XLSUM_XSUM_Finetuning (2025).
  22. ELITR minuting corpus: A novel dataset for automatic minuting from multi-party meetings in English and Czech. Nedoluzhko, A., Singh, M., Hledíková, M., Ghosal, T., Bojar, O. Proc Int Conf Lang Resour Eval (LREC), 2022, 2623-2632 (2022).
  23. Don't give me the details, just the summary! Topic aware convolutional neural networks for extreme summarization. Narayan, S., Cohen, S. B., Lapata, M. Proc Conf Empir Methods Nat Lang Process, 2018, 1797-1807 (2018).
  24. Lewis, M., et al. Denoising sequence to sequence pre training for natural language generation, translation, and comprehension. Proc Annu Meet Assoc Comput Linguist. 2020, 7871-7880 (2020).
  25. Chung, H. W., et al. Scaling instruction fine-tuned language models. J Mach Learn Res. 25 (1), 1-53 (2024).
  26. Jiang, A. Q., et al. Mistral 7B. arXiv. , (2023).
  27. Chandra, C., Ojima, Y., Bendarkar, M. V., Mavris, D. N. Aviation BERT NER: Named entity recognition for aviation safety reports. Aerospace. 11 (11), 890-890 (2024).
  28. Lim, D. S. bert-base-NER. , https://huggingface.co/dslim/bert-base-NER (2021).
  29. Adam: A method for stochastic optimization. Kingma, D. P., Ba, J. Int Conf Learn Represent, , (2015).
  30. QAGS: Evaluating question answering and generation for summarization. Wang, A., Cho, K. Proc Conf Empir Methods Nat Lang Process, 2020, 390-402 (2020).
  31. Patil, S. valhalla/t5-small-qg-hl. , https://huggingface.co/valhalla/t5-small-qg-hl (2020).
  32. deepset/roberta-base-squad2. , Deepset GmbH. https://huggingface.co/deepset/roberta-base-squad2 (2020).
  33. Factually consistent summarization via reinforcement learning with textual entailment feedback. Roit, P., et al. Proc Annu Meet Assoc Comput Linguist, 2023, 8027-8044 (2023).
  34. Hallucination diversity aware active learning for text summarization. Xia, Y., et al. Proc Conf North Am Chapter Assoc Comput Linguist Hum Lang Technol, 2024, 3885-3900 (2024).
  35. Wei, Z., et al. TruthRL: Incentivizing truthful large language models via reinforcement learning. arXiv. , (2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Large Language ModelsEntity HallucinationText SummarizationEntity Hallucination IndexAbstractive SummarizationReinforcement LearningNamed Entity ExtractionModel Fine TuningSummarization RobustnessFactuality Improvement

Related Articles