Research Article

Grote taalmodellen fijn afstellen met behulp van de Entity Hallucination Index voor tekstsamenvatting

DOI:

10.3791/68962

January 9th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wij stellen een op versterking leren gebaseerde fine-tuningbenadering voor grote taalmodellen voor, waarbij de Enti Hallucinatieindex (EHI) wordt gebruikt als beloningssignaal om hallucinaties op entiteitsniveau in tekstsamenvattingen te verminderen. Experimenten met afstudeertranscripties tonen aan dat deze methode de trouw en nauwkeurigheid van entiteiten verbetert.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Recente ontwikkelingen in grote taalmodellen (LLM's) hebben geleid tot aanzienlijke verbeteringen in de kwaliteit van abstracte samenvattingen. Hallucinatie - vooral hallucinaties op entiteitsniveau waarbij niet-bestaande of onjuiste entiteiten worden geïntroduceerd - blijft echter een cruciale uitdaging. In dit werk stellen we een beloningsgedreven fine-tuning kader voor samenvattingsmodellen voor, waarbij de Entity Hallucination Index (EHI) als leidende maatstaf wordt gebruikt. De methodologie begint hier met het genereren van initiële samenvattingen uit vooraf getrainde modellen zoals Flan-T5, DistilBART en Mistral (of een andere populaire LLM) op gestructureerde transcriptdatasets, XSUM. We berekenen EHI door benoemde entiteiten te extraheren uit zowel gegenereerde samenvattingen als goudreferenties, nauwkeurigheid te evalueren en gefabriceerde entiteiten te straffen. Het fine-tuningproces wordt geleid door reinforcement learning, waarbij EHI dient als beloningssignaal. We hanteren een REINFORCE-achtige updatemechanisme om het samenvattingsmodel te optimaliseren met het doel van maximale entiteitstrouw. Experimenten tonen aan dat modellen die fijn zijn afgestemd op EHI lagere hallucinatiepercentages bereiken zonder de informatieve kwaliteit te verliezen. Bovendien laten we zien dat EHI-geleide modellen beter generaliseren bij out-of-domain samenvattingstaken, wat wijst op een verbeterde robuustheid. De aanpak biedt hier een praktische richting om de feitelijkheid in samenvattingen te verbeteren, waarbij de cruciale rol van nauwkeurige entiteitsrepresentatie wordt benadrukt.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Abstracte samenvattingsmodellen, aangedreven door grote taalmodellen (LLM's), hebben indrukwekkende resultaten behaald in diverse domeinen. Toch blijft er een aanhoudende uitdaging hallucinaties bestaan, waarbij gegenereerde samenvattingen onjuiste of gefabriceerde informatie bevatten die niet gebaseerd is op de broninvoer 1,2. In toepassingen met hoge inzet zoals samenvatting, medische rapportage of financiële documentatie kunnen hallucinaties, vooral bij genoemde entiteiten, de betrouwbaarheiden het nut aanzienlijk ondermijnen.

Onderzoekersvoerden een grootschalige menselijke evaluatie uit en ontdekten dat samenvatters vaak hallucinaties veroorzaken – inhoud die niet wordt ondersteund door het brondocument – en dat deze hallucinaties correeren met herhaling en incoherentie1. Een andere studie toonde aan dat modellen met een hogere abstractie minder getrouw zijn; Hun studie rapporteerde dat uitkomsten met meer abstractie een lagere feitelijke nauwkeurigheid en meer ontrouwe zinnenhadden 2. De FRANK-benchmark rapporteerde dat ongeveer 30% van de samenvattingen feitelijke inconsistenties bevat, en een andere populaire studie noteerde vergelijkbare foutpercentages, met het argument dat hoge hallucinatiesniveaus samenvattingen vrijwel nutteloos maken 1,2. Hallucinaties kunnen worden gecategoriseerd als intrinsiek (in tegenstelling tot de bron) of extrinsiek (niet verifieerbaar vanuit de bron). Een tutorial over hallucinaties in abstracte samenvatting legt uit dat intrinsieke hallucinaties optreden wanneer gegenereerde inhoud de input tegenspreekt (bijvoorbeeld het verkeerd rapporteren van een goedgekeurd vaccin als afgewezen), terwijl extrinsieke hallucinaties onverifieerbare feiten toevoegen, zoals het claimen van klinische proeven voor een vaccin die niet genoemd zijn4. Ook werd gemeld dat state-of-the-art samenvatters in ongeveer 25% van hun output hallucinatiecontent produceren wanneer ze worden geëvalueerd met ROUGE, BLEU en METEOR, en waarschuwt dat hallucinaties gevaarlijk kunnen zijn op gebieden zoals gezondheid, recht of cybersecurity.

Traditionele n-gram metrieken (ROUGE5, BLEU, METEOR) correleren slecht met menselijke oordelen over feitelijkheid, wat heeft geleid tot de ontwikkeling van referentiegebaseerde en referentievrije metrieken6. QA-gebaseerde metrics zoals FEQA en QuestEval evalueren samenvattingen door te vragen of vraag-antwoordparen die uit de samenvatting zijn afgeleid, kunnen worden beantwoord met behulp van de brontekst. FEQA correleert sterker met menselijke oordelen en toont aan dat meer abstracte samenvattingen minder getrouw zijn, terwijl QuestEval de correlatie met menselijke oordelen aanzienlijk verbetert op het gebied van consistentie, samenhang, vloeiendheid en relevantie. QAFactEval verfijnt deze aanpak door zelfstandige naamwoordfrasen te selecteren en vragen te genereren voordat ze beantwoorden; deze strategie verbetert de correlatie met menselijke beoordelingen op de SummaC-benchmark. Informatie-extractie (IE) metrics vertegenwoordigen kennis als subject-relatie-object-tuples, maar ze zijn kwetsbaar voor fouten in het extractieproces. Natuurlijke taalinferentie (NLI) metrics – zoals FactCC en SummaC – classificeren samenvattende zinnen als geconstrueerd of tegengesproken door de bron4. FactCC gebruikt zwak gecontroleerde data om een classifier te trainen die feitelijke consistentie detecteert en inconsistente overspanningen2 markeert. SummaC past NLI-modellen toe op de juiste granulariteit en levert sterke feitelijkheidsschattingen, maar de FRANK-benchmark merkt op dat deze metrics feitelijkheid nog steeds als binair behandelen en geen uniform kader 1,7,8 hebben. Menselijke evaluatiedimensies voorgesteld door onderzoekers vloeiendheid, samenhang, relevantie en consistentie worden breed toegepast9. Een andere evaluatiestudie benadrukt dat consistentie de meest objectieve dimensie is, omdat het simpelweg controleert of de samenvatting door de bron wordt geïntroduceerd; het wijst erop dat tot 92% van de XSum-samenvattingen geloofsfouten 9,10 bevatten. Menselijke evaluatie is echter tijdrovend en duur, dus automatische metrics zijn essentieel voor schaalbare evaluatie8. Huidige metrics voegen vaak intrinsieke en extrinsieke hallucinaties samen tot één score, waardoor foutdiagnose4 wordt belemmerd.

Omdat maximum-likelihood-training niet direct optimaliseert voor samenvattingskwaliteit, is reinforcement learning (RL) toegepast om relevantie en feitelijkheid te verbeteren. Pasunuru en Bansal introduceerden een multi-beloning RL-raamwerk dat saliency (ROUGE) en entailment rewards combineert en een state-of-the-art prestatieaantoonde 11. RL werd toegepast voor extractieve samenvattingen met behulp van het REINFORCE-algoritme; hun model maximaliseert ROUGE-scores en levert informatievere samenvattingen op dan classifier-gebaseerde benaderingen, zoals blijkt uit Human Question-Answering Evaluations12. Multitaskmodellen integreren verder vraag- en entailment-generatie om dekking en samenhang te waarborgen12. Een uitgebreide enquête uit 2024 over abstracte samenvattingen benadrukt feitelijke consistentie als fundamentele uitdaging en pleit voor het aanmoedigen van waarheidsgetrouwe samenvattingen in het echte leven. De enquête stelt voor om feitelijk consistente samenvattingen te belonen en externe kennisbronnen en attributencontrole te integreren om de nauwkeurigheid te verbeteren13. RL uit menselijke feedback (RLHF) breidt dit idee uit door een beloningsmodel te trainen op basis van menselijke voorkeuren en de samenvatter te verfijnen om deze geleerde beloning te maximaliseren9. Reinforcement learning op basis van menselijke feedback (RLHF) heeft aan populariteit gewonnen voor het afstemmen van modeluitkomsten op gewenste kwaliteiten, zoals feitelijkheid en nut 4,14. Hoewel multi-beloning RL en RLHF modellen afstemmen op menselijke opvattingen van trouw, zijn ze afhankelijk van grove maatstaven zoals ROUGE of binaire feitelijkheid. Daarentegen stelt het hier beschreven werk voor om een fijnmazige hallucinatie-index op entiteitsniveau als beloning te gebruiken, wat empirisch en computationeel goedkoper is zonder menselijke feedback.

Ondanks talrijke maatstaven blijven er verschillende beperkingen bestaan. N-gram metrics negeren semantische correctheid, QA- en IE-gebaseerde metrics verspreiden fouten uit vraaggeneratie- en extractiemodellen, en NLI-metrics reduceren factualiteit tot binaire enfoltiebeslissingen 1,4,6. In het onderzoek werd benadrukt dat bestaande modelgebaseerde metrics moeite hebben om hallucinaties op een fijne granulariteit te identificeren omdat ze op zins- of documentniveau werken en specifieke entiteiten die fouten veroorzaken niet kunnen isoleren4. Menselijke evaluaties blijven de gouden standaard, maar zijn kostbaar en subjectief15. Bovendien maken bestaande metrieken geen onderscheid tussen intrinsieke en extrinsieke hallucinaties en vangen ze de over- en onderfocus van relatiesniet op. Grote taalmodellen kunnen hallucineren omdat ze tekst voorspellen op basis van statistische waarschijnlijkheid in plaats van feitelijke verificatie. Modellen genereren zelfverzekerde maar onjuiste output door beperkingen in trainingsdata, probabilistische generatie en gebrek aan factchecking, en overmoedigheid en biases kunnen ertoe leiden dat ze met hoge zekerheid valse informatie vermelden; De gids pleit voor retrieval-augmented generatie en langetermijngeheugen-to-ground-modellen in externe data15. Deze technieken richten zich echter op retrieval-gebaseerde taken; Samenvatting vereist nog steeds metrics die gehallucineerde entiteiten identificeren en straffen. Eerder werk heeft het belang van beoordeling op entiteitsniveau voor feitelijkheid erkend. Meetmethoden zoals FEQA en QuestEval proberen feitelijke consistentie te beoordelen met behulp van antwoordtechnieken16,17. Deze methoden vereisen echter vaak referentiesamenvattingen of externe QA-systemen, wat de schaalbaarheid beperkt. Ons werk bouwt voort op deze lijn door gebruik te maken van de Entity Hallucination Index (EHI), een lichtgewicht empirische metriek die zich specifiek richt op de trouw aan benoemde entiteiten door de entiteiten in vijf typen hallucinatiefactoren te categoriseren zoals weergegeven in Figuur 1.

Bewijs wijst erop dat hallucinaties wijdverspreid zijn, evaluatiemetrics onvolmaakt zijn en RL-technieken geen fijne beloningen bieden. Menselijke studies tonen aan dat samenvattingsmodellen in een aanzienlijk deel van de gevallen hallucineren, waarbij vaak entiteiten worden verwisseld of details worden gefabriceerd9. Bestaande metrics benadrukken ofwel n-gram overlap of behandelen feitelijkheid als binair, en huidige RL-methoden optimaliseren ROUGE- of grove factualiteitssignalen. Er is een tekort in entiteitsniveau-metrics die meten wanneer een samenvatting entiteiten noemt die niet aanwezig zijn in de bron (negatieve hallucinatie), sleutelentiteiten weglaat (verloren focus hallucinatie) en andere scenario's. De voorgestelde fine-tuningmethode over de Entity Hallucination Index (EHI) vult deze kloof door hallucinaties op entiteitsniveau te kwantificeren en een gestructureerde beloning te bieden voor reinforcement learning. Door EHI te integreren in RLHF streven we ernaar grote taalmodellen te verfijnen om hallucinaties op entiteitsniveau te minimaliseren en samenvattingen te produceren die zowel vloeiend als feitelijk trouw zijn.

In dit werk stellen we een nieuwe fijne afstemmingsbenadering voor die gebruikmaakt van de Entity Hallucination Index (EHI) als beloningssignaal om hallucinaties op entiteitsniveau te verminderen. EHI kwantificeert de correctheid en gronding van entiteiten door geëxtraheerde entiteiten uit modeluitvoer te vergelijken met die in het invoerdocument, waardoor de afhankelijkheid van referenties18 verminderd kan worden. De hier beschreven methode bevooroordeelt het model om meer entiteitsgetrouwe samenvattingen te produceren zonder menselijke feitelijkheidsannotaties te vereisen.

Samenvattend zijn feitelijkheidsbewuste beloningsmodellen gebruikt voor het fijn afstemmenvan 19,20. In tegenstelling tot eerdere benaderingen die vertrouwen op grove feitelijkheidsbeloningen of door mensen gelabelde datasets, stellen wij voor om EHI te verfijnen als direct, automatisch beloningssignaal, zodat samenvatting op basis van de entiteit wordt bevorderd zonder extra supervisie. De nieuwe bijdragen van deze studie zijn als volgt: (i) de studie introduceert een door EHI geleid fine-tuning kader dat de getrouwheid van entiteiten in abstracte samenvattingen verbetert, (ii) de studie presenteert een schaalbare reinforcement learning-pijplijn die niet afhankelijk is van door mensen gelabelde factualiteitsdatasets, (iii) de studie toont empirische verbeteringen in EHI-scores over het bijeenkomen van transcriptdatasets, XSUM-nieuwsdataset en voert kwalitatieve analyses uit om verminderingen in hallucinaties te benadrukken, (iv) de studie deelt een reproduceerbare, op Colab gebaseerde implementatie om verder onderzoek naar hallucinaties-bewuste samenvatting te faciliteren21.

Deze studie beoordeelt de hypothese dat het optimaliseren van taalmodellen met fijnmazige, entiteitgerichte beloningen zoals EHI een effectieve route biedt om trouw en betrouwbaarheid in samenvattingstaken met minimale rekenkracht te verbeteren. De aanpak draagt bij aan het groeiende vakgebied van parameter-efficiënte fine-tuning voor trouw in samenvatting door: (i) effectiviteit aan te tonen over zowel encoder-decoder (DistilBART, FlanT5) als decoder-only (Mistral) architecturen, (ii) een kader te bieden dat kan worden aangepast aan verschillende modeltypen, domeinen en schalen, en (iii) rekenefficiëntie te bieden ten opzichte van volledige hertraining.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Het doel van deze studie is om een taalmodel (LM) te verfijnen om samenvattingen te genereren met hallucinaties van verminderde entiteiten. Hallucinaties ontstaan wanneer een model "vol vertrouwen onjuiste of irrelevante output produceert" omdat het tekst genereert op basis van statistische likelihood in plaats van feitelijke verificatie. Dit wordt bereikt door een beloningsfunctie te ontwerpen op basis van de Entity Hallucination Index (EHI) en reinforcement learning toe te passen om deze te maximaliseren.

Probleemformulering
Gegeven een invoerdocument Xi is het doel om een samenvatting Yi te genereren zodat entiteiten die in Yi worden genoemd gegrond zijn in Xi. Traditionele maximum likelihood-training optimaliseert feitelijke consistentie niet expliciet. Deze trainingsmethoden bestraffen de opname van gefabriceerde entiteiten niet. Daarom wordt een beloningsgedreven fine-tuningstrategie geïntroduceerd waarbij de beloning evenredig is aan de trouw van de entiteit, gemeten met behulp van EHI.

Dataset en methode
Twee corpora worden gebruikt: ten eerste een dialoogtranscriptiedataset met meerdaagse vergaderingstranscripties en abstracte goudsamenvattingen, en ten tweede de XSUM-nieuwssamenvattingsbenchmark22,23. Elke dataset werd opgeschoond, afgevlakt en opgesplitst in 80% train-, 10% validatie- en 10% testpartities. De dialogen zijn rijk aan informele taal en voornaamwoorden, terwijl XSUM beknopte nieuwsartikelen bevat; De combinatie stelt ons in staat zowel in-domein als buiten het domein generalisatie te evalueren.

Entiteitsextractie wordt uitgevoerd op zowel brondocumenten als samenvattingen voor het berekenen van de Entity Hallucination Index (EHI). Tijdens de fine-tuning maakt deze studie uitsluitend gebruik van de training split, terwijl validatie-EHI-scores worden gemonitord om het beste checkpoint te selecteren. De eindevaluaties worden gerapporteerd op de vastgehouden testset, die voor en na het fijnafstellen van de modellen nul schot.

Samenvattend worden transcripties eerst georganiseerd in een afgevlakt formaat en worden de gegevens opgesplitst. Het vooraf getrainde model genereert basissamenvattingen. Ten tweede wordt EHI berekend met behulp van transformator-gebaseerde NER en de vijf hallucinatiefactoren. Tijdens het fijnafstellen wordt het model bijgewerkt met de EHI-beloning via LoRa-adapters. Tot slot worden samenvattingen gegenereerd met het fijn afgestemde model en geëvalueerd met behulp van EHI, Entity F1 en andere metrics (Figuur 2). Alle experimenten zijn reproduceerbaar via de meegeleverde code en configuratiebestanden. Figuur 3 toont de stapsgewijze processtroom voor datasetvoorbereiding, basissamenvatting, EHI computation, fine-tuning en evaluatie.

Samenvatting van de basis
Drie vooraf getrainde LLM's worden gekozen en hun basissamenvattingen worden vastgelegd: Flan-T5, Mistral (Nous-Hermes-2-Mistral-7B-DPO) en DistilBART 24,25,26. Elk model werd in zero-shot modus uitgevoerd om een initiële samenvatting (Yi) te produceren voor elk invoerdocument(xi). Beamsearch met een bundelbreedte van 4 en een lengtestraf van 1,0 werd gebruikt om vloeiende maar beknopte samenvattingen te bevorderen. Deze basissamenvattingen dienden om de prevalentie van hallucinaties te schatten en boden startpunten voor fijnafstemming.

Entiteitsextractie en EHI-berekening
Het nauwkeurig berekenen van de Entity Hallucination Index (EHI) vereist een robuuste NER. Aanvankelijk werd Spacy gebruikt voor NER-operaties. Het is bekend dat transformer-gebaseerde NER-modellen nauwkeuriger zijn, maar Spacy was de eerste keuze om de volgende redenen: (1) Transformer-gebaseerde NER-modellen zelf hebben bewezen te hallucineren dan Spacy. (2) Spacy als statistisch gezien zorgt voor rekenkundige efficiëntie in termen van implementatiekosten en uitvoeringstijd. (3) Het helpt ons ook te bewijzen dat EHI robuust is in het verminderen van hallucinaties, zelfs met een zwakker NER-model. Echter, gezien het feit dat de experimenten worden uitgevoerd op gevestigde datasets en het en_core_web_sm-model van spaCy broos is op informele transcripties13. Spacy wordt vervangen door een transformer-gebaseerd NER-model (dslim/bert-base-NER), een BERT-model dat is afgestemd op de CoNLL-2003 dataset. BERT-gebaseerde NER-systemen zijn aangetoond beter te presteren dan spaCy-modellen op domeinspecifieke taken – bijvoorbeeld, een Aviation-BERT-NER-model bereikte een F1 van 94,78% terwijl het 17 entiteiten identificeerde, vergeleken met 93,73% voor spaCy NER die zeven entiteiten erkende27. Het BERT NER-model werd geconfigureerd via Hugging Face Transformers28 en voerde hoofdletter-ongevoelige matching uit. Om voornaamwoorden en variaties in oppervlaktevormen vast te leggen, paste deze methode bovendien eenvoudige regels toe die "Mr. Smith" en "Smith" aan dezelfde canonieke vorm koppelen; volledige coreferentie-resolutie blijft echter toekomstig werk. De vergelijkende analyse van de NER-modellen op een steekproef van 200 records uit de XSUM-dataset kan worden afgeleid uit Tabel 1.

De Entity Hallucination Index (EHI) wordt als volgt berekend:

figure-protocol-1

waarbij PH, EF, OF, NH, LF scores vertegenwoordigen die respectievelijk overeenkomen met Positieve Hallucinatie (PH), Extractiviteitsfactor (EF), Negatieve Hallucinatie (NH), Overfocused Entities (OF) en Lost Focus (LF), voor artikel i.

Details van hallucinaties factoren:

Positieve Hallucinatie (PH): Metingen van nieuw geïntroduceerde entiteiten die feitelijk correct en voordelig zijn.

Extractiviteitsfactor (EF): Meet entiteiten die nauwkeurig uit het invoerdocument zijn gehaald in de samenvatting.

Negatieve hallucinatie (NH): Vangt gehallucineerde entiteiten die onjuist zijn of niet gegrond zijn in de input.

Overgefocust (OF): Straft samenvattingen die te veel focussen op een smalle subset van entiteiten, waardoor diversiteit ontbreekt.

Verloren Focus (LF): Straft samenvattingen die belangrijke entiteiten in de invoer weglaten.

De berekening van bovenstaande factoren is beschreven in Figuur 4 met een voorbeeldberekening ter illustratie. Beschouwen we een voorbeeld van Input Document Entities (I): "John", "AI", conferentie" Reference Summary Entities (R): "John", "AI" Generated Summary Entities (G): "John", AI", technologie. Hogere waarden van EHI duiden op betere entiteitstrouw, waarbij samenvattingen worden belonen die zowel extractief als positief gehallucineerd zijn (waarbij nuttige maar trouwe entiteiten worden geïntroduceerd), terwijl ongegronde, overmatige of ontbrekende entiteit20 worden bestraft. Deze factoren werden genormaliseerd door het totale aantal gedetecteerde entiteiten om een EHI-score tussen 0 en 1 te produceren. EHI-validatie werd tijdens de training gemonitord om het beste checkpoint te selecteren. PH en EF belonen gunstige nieuwe entiteiten en correcte extractie, terwijl OF, NH en LF herhaling, fabricage en weglating bestraffen. Een perfecte score van 1,0 betekent dat alle entiteiten in de samenvatting gegrond zijn of gunstig gehallucineerd zijn, terwijl een score van 0 aangeeft dat er geen genoemde entiteit in de samenvatting in de bron voorkomt.

Finafstellingsprocedure met RL
De gedetailleerde hyperparameterconfiguratie voor fijnafstemming wordt apart weergegeven in Tabel 2, Tabel 3 en Tabel 4, die de typen optimizers, leersnelheden, batchgroottes, hardwarespecificaties en andere configuratiedetails voor respectievelijk Mistral-7B, DistilBart en Flan-T5 weergeven. Het doel hier is om de modelparameters θ te verfijnen door de verwachte beloning van de Entity Hallucination Index (EHI) te maximaliseren over gegenereerde samenvattingen. Formeel wordt voor een invoerdocument Xi, een gegenereerde samenvatting Yi en modelparameters θ het verwachte beloningsdoel gedefinieerd als:

figure-protocol-2(2)

waarbij EHI (y, x) de Entity Hallucination Index aanduidt die wordt berekend tussen de gegenereerde samenvatting Yi en de invoer Xi.

Volgens het REINFORCE-algoritme25 wordt de gradiënt van dit doel geschat als:

figure-protocol-3(3)

In de praktijk werden samenvattingen uit de modellen gesampled, werden hun bijbehorende EHI-scores berekend en werden beleidsgradiëntupdates toegepast om hogere beloningsresultaten te stimuleren. Om parameter-efficiënte fine-tuning mogelijk te maken, gebruikte deze studie Low-Rank Adaptation (LoRA). Alleen LoRA-adapters werden bijgewerkt terwijl het gewicht van het basismodel bevroren bleef. Fin-tuning werd uitgevoerd op een A100 GPU met een kleine leersnelheid (bijv. 5 × 10-6), batchgrootte van 4 en gradiëntaccumulatie over 8 stappen met Adamoptimizer 29. Samenvattingen werden elke 500 updates opnieuw gegenereerd om beloningsschattingen te verversen, en de training ging door totdat validatie-EHI convergeerde. De REINFORCE-basislijn werd ingesteld op het lopende gemiddelde van recente beloningen om de variatie te verminderen. Naast EHI werden Entity F12, ROUGE-1/2/L scores geregistreerd om de algemene kwaliteit te monitoren. Samenvattingen worden periodiek opnieuw gegenereerd om modelverbeteringen tijdens het fijn afstellen weer te geven.

Evaluatiemetrieken
De output werden geëvalueerd met behulp van informatieheidsmetrics zoals Rouge-1, Rouge-2,5. Vloeiendheidsmetriek zoals Rouge LCS5. Entiteitsoverlap meetmaatstaf Entiteit F1, en hallucinatiemetrieken zoals EHI, FactCC en QAGS 2,6,18,30. FactCC gebruikt een classifier die is getraind op synthetische contradictiegegevens om zinnen te labelen als impliceerd of tegengesproken door de bron. De factCC geeft twee scores; de scores werden vastgelegd waar het label GELDIG is. QAGS daarentegen gebruikt een vraag-en-antwoordmethode die op een LLM draait. Lichtmodel T5 small werd gebruikt voor het genereren van vragen op de tekst31. Roberta_base_Squad2 werd gebruikt om antwoorden te genereren over de uitvoertekst32. Deze modellen werden gekozen vanwege hun handige berekeningskosten voor uitvoering.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De experimenten hier richten zich op kwantitatief bewijs voor de impact die door EHI geleide fine-tuning heeft op het verminderen van hallucinaties op entiteitsniveau over meerdere modelarchitecturen en datasets. De resultaten tonen consistente verbeteringen in hallucinatiemetrieken aan, terwijl feitelijke consistentie behouden blijft en de mogelijkheid om vragen te beantwoorden behouden blijft.

Datasetprestaties
Prestaties van dia...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

QA-gebaseerde metrics (bijv. FEQA/QuestEval/QAFactEval) en NLI-gebaseerde metrics (bijv. FactCC/SummaC) vereisen aanvullende QA/entailment-componenten en bieden vaak strafniveau-oordelen. Daarentegen is EHI een lichtgewicht, referentievrije, entiteitsniveau score die (i) direct de primaire faalmodus die we waarnemen – entiteitshallucinatie – richt. (ii) model-agnostisch en snel te berekenen is; en (iii) dient als een dichte beloning voor RL fine-tuning. Empirisch vult EHI QA/NLI-metrieke...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs hebben niets te onthullen.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Colab NVIDIA A100 GPUNVIDIAN/AGoogle Colaboratory Pro
DistilBART (Encoder–Decoder)Hugging Facehttps://huggingface.co/sshleifer/distilbart-cnn-12-6
dslim/bert-base-NERHugging Face (dslim)https://huggingface.co/dslim/bert-base-NERFine-tuned BERT base voor Engelse NER
Evaluatiemodellen  QAGS (QA-gebaseerd)Salesforce ResearchN/AFactualiteitsclassificator
Evaluatiemodellen (Factualiteit) FactCCGoogle ResearchN/AFactualiteitsclassificator
Flan-T5 (Encoder–Decoder)Googlehttps://huggingface.co/docs/transformers/main/en/model_doc/flan-t5open-source, tekst-naar-tekst, groot taalmodel
Hugging Face TransformersHugging Face, Inc.https://huggingface.co/docs/transformers/indexModel laden & fijnafstemming
Nous-Hermes-2-Mistral-7B-DPOMistralhttps://huggingface.co/NousResearch/Nous-Hermes-2-Mistral-7B-DPO7 miljard parameter taalmodel
Programmeertaal
Python 3.10 (Colab runtime)
Python Software FoundationVersie 3.10Kernimplementatie
StreamlitOpen Source https://streamlit.io/Factualiteitsclassificator
XLSUM datasetBUEThttps://github.com/csebuetnlp/xl-sum
XSUM datasetUniversity of Edinburghhttps://github.com/EdinburghNLP/XSum

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Maynez, J., Narayan, S., Bohnet, B., McDonald, R. On faithfulness and factuality in abstractive summarization. Proc Annu Meet Assoc Comput Linguist. 2020, 173-173 (2020).
  2. FEQA: A question answering evaluation framework for faithfulness assessment in abstractive summarization. Durmus, E., He, H., Diab, M. Proc Conf Empir Methods Nat Lang Process, , 454-454 (2020).
  3. A short summary of automatic summarization. NLG Blog. , Andong. https://andongluis.github.io/nlg-blog/Summarization-post/ (2018).
  4. Understanding factuality in abstractive summarization. Pagnoni, A., Padmakumar, V., May, J. Proc Conf North Am Chapter Assoc Comput Linguist Hum Lang Technol, 2021, 4812-4829 (2021).
  5. Lin, C. Y. ROUGE: A package for automatic evaluation of summaries. Workshop Text Summarization Branches Out. 2004, 74-81 (2004).
  6. Evaluating the factual consistency of abstractive text summarization. Kryściński, W., McCann, B., Xiong, C., Socher, R. Proc Conf Empir Methods Nat Lang Process, 2020, 750-750 (2020).
  7. Goyal, T., Durmus, E., Cardie, C. Fact checking summarization with self supervised and few shot learning. Proc Annu Meet Assoc Comput Linguist. 2022, 564-579 (2022).
  8. QuestEval: Summarization asks for fact-based evaluation. Scialom, T., Dray, P. A., Lamprier, S., Piwowarski, B., Staiano, J., Wang, A., Gallinari, P. Proc Conf Empir Methods Nat Lang Process, 2021, 6594-6604 (2021).
  9. Mukesh, K. Hallucinations in abstractive summarization. Medium. , https://medium.com/@mukesh.kr/hallucinations-in-abstractive-summarization-b5904bc1c5c5 (2023).
  10. Factual error correction for abstractive summarization models. Cao, M., Dong, Y., Wu, J., Cheung, J. C. K. Proc Conf Empir Methods Nat Lang Process, 2020, 6251-6258 (2020).
  11. Yan, E. Evaluation & hallucination detection for abstractive summaries. , https://eugeneyan.com/writing/abstractive-summarization-evaluation/ (2021).
  12. Uekawa, A. Evaluation metrics for summarization. , https://dev.to/akuer/evaluation-metrics-for-summarization-1d7f (2023).
  13. Honnibal, M., Montani, I. spaCy 2: Natural language understanding with Bloom embeddings convolutional neural networks and incremental parsing. Zenodo. , (2017).
  14. Reinforcement learning from human feedback: Aligning large language models. , At https://neptune.ai/blog/reinforcement-learning-from-human-feedback (2023).
  15. Shakil, H., Farooq, A., Kalita, J. Abstractive text summarization: State of the art, challenges, and improvements. Neurocomputing. 603, 128255-128255 (2024).
  16. AI, Z. Reducing LLM hallucinations: A developer's guide. GetZep. , https://www.getzep.com/ai-agents/reducing-llm-hallucinations/ (2025).
  17. Ouyang, L., et al. Training language models to follow instructions with human feedback. Adv Neural Inf Process Syst. 2022, 27730-27744 (2022).
  18. Entity hallucination index in abstractive summarization-A metric. Praveenkumar, K., Balbantaray, R. C., Vittala, K. P. Proc Int Conf Commun Circuits Syst, 2023, 1-5 (2023).
  19. Multi-reward reinforced summarization with saliency and entailment. Pasunuru, R., Bansal, M. Proc Conf North Am Chapter Assoc Comput Linguist Hum Lang Technol, 2018, 646-653 (2018).
  20. Williams, R. J. Simple statistical gradient-following algorithms for connectionist reinforcement learning. Mach Learn. 8 (3-4), 229-256 (1992).
  21. Katwe NLP. EHI_XLSUM_XSUM_Finetuning. , GitHub. https://github.com/katweNLP/EHI_XLSUM_XSUM_Finetuning (2025).
  22. ELITR minuting corpus: A novel dataset for automatic minuting from multi-party meetings in English and Czech. Nedoluzhko, A., Singh, M., Hledíková, M., Ghosal, T., Bojar, O. Proc Int Conf Lang Resour Eval (LREC), 2022, 2623-2632 (2022).
  23. Don't give me the details, just the summary! Topic aware convolutional neural networks for extreme summarization. Narayan, S., Cohen, S. B., Lapata, M. Proc Conf Empir Methods Nat Lang Process, 2018, 1797-1807 (2018).
  24. Lewis, M., et al. Denoising sequence to sequence pre training for natural language generation, translation, and comprehension. Proc Annu Meet Assoc Comput Linguist. 2020, 7871-7880 (2020).
  25. Chung, H. W., et al. Scaling instruction fine-tuned language models. J Mach Learn Res. 25 (1), 1-53 (2024).
  26. Jiang, A. Q., et al. Mistral 7B. arXiv. , (2023).
  27. Chandra, C., Ojima, Y., Bendarkar, M. V., Mavris, D. N. Aviation BERT NER: Named entity recognition for aviation safety reports. Aerospace. 11 (11), 890-890 (2024).
  28. Lim, D. S. bert-base-NER. , https://huggingface.co/dslim/bert-base-NER (2021).
  29. Adam: A method for stochastic optimization. Kingma, D. P., Ba, J. Int Conf Learn Represent, , (2015).
  30. QAGS: Evaluating question answering and generation for summarization. Wang, A., Cho, K. Proc Conf Empir Methods Nat Lang Process, 2020, 390-402 (2020).
  31. Patil, S. valhalla/t5-small-qg-hl. , https://huggingface.co/valhalla/t5-small-qg-hl (2020).
  32. deepset/roberta-base-squad2. , Deepset GmbH. https://huggingface.co/deepset/roberta-base-squad2 (2020).
  33. Factually consistent summarization via reinforcement learning with textual entailment feedback. Roit, P., et al. Proc Annu Meet Assoc Comput Linguist, 2023, 8027-8044 (2023).
  34. Hallucination diversity aware active learning for text summarization. Xia, Y., et al. Proc Conf North Am Chapter Assoc Comput Linguist Hum Lang Technol, 2024, 3885-3900 (2024).
  35. Wei, Z., et al. TruthRL: Incentivizing truthful large language models via reinforcement learning. arXiv. , (2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Large Language ModelsEntity HallucinationText SummarizationEntity Hallucination IndexAbstractive SummarizationReinforcement LearningNamed Entity ExtractionModel Fine TuningSummarization RobustnessFactuality Improvement

Related Articles