Research Article

Affining di grandi modelli linguistici utilizzando l'Entity Hallucination Index per la sintesi del testo

DOI:

10.3791/68962

January 9th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Proponiamo un approccio di affining basato sull'apprendimento per rinforzo per grandi modelli linguistici che utilizza l'Enti Hallucination Index (EHI) come segnale di ricompensa per ridurre le allucinazioni a livello di entità nella sintesi testuali. Esperimenti sulle trascrizioni degli incontri mostrano che questo metodo migliora la fedeltà e l'accuratezza delle entità.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

I recenti progressi nei grandi modelli linguistici (LLM) hanno portato a notevoli miglioramenti nella qualità della sintesi astratta. Tuttavia, l'allucinazione – soprattutto quelle a livello di entità, in cui vengono introdotte entità inesistenti o errate – rimane una sfida cruciale. In questo lavoro, proponiamo un quadro di fine-tuning guidato dalla ricompensa per modelli di riassunto utilizzando l'Entity Hallucination Index (EHI) come metrica guida. La metodologia qui inizia con la generazione di riassunti iniziali a partire da modelli pre-addestrati come Flan-T5, DistilBART e Mistral (o altri MLM popolari) su dataset di trascrizioni strutturate, XSUM. Calcoliamo l'EHI estraendo entità nominate sia da riassunti generati che da riferimenti gold, valutando la precisione e penalizzando le entità fabbricate. Il processo di fine-tuning è guidato dall'apprendimento per rinforzo, dove l'EHI funge da segnale di ricompensa. Adottiamo un meccanismo di aggiornamento in stile REINFORCE per ottimizzare il modello di sintesi al fine di massimizzare la fedeltà delle entità. Gli esperimenti dimostrano che i modelli affinati con EHI raggiungono tassi di allucinazione più bassi senza compromettere l'informatività. Inoltre, mostriamo che i modelli guidati da EHI generalizzano meglio su compiti di sintesi fuori dominio, suggerendo una maggiore robustezza. L'approccio qui offre una direzione pratica per migliorare la fattualità nella sintesi, sottolineando il ruolo cruciale della rappresentazione accurata delle entità.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

I modelli di riassunto astrattivi, alimentati da grandi modelli linguistici (LLM), hanno ottenuto risultati impressionanti in vari ambiti. Tuttavia, una sfida persistente rimane l'allucinazione, dove i riassunti generati includono informazioni errate o fabbricate non fondate sull'inputsorgente 1,2. In applicazioni ad alto rischio come la riassunta degli incontri, la reportistica medica o la documentazione finanziaria, le allucinazioni, in particolare che coinvolgono entità nominate, possono compromettere significativamente l'affidabilità el'utilità 3.

Glie-ricercatori hanno condotto una valutazione umana su larga scala e hanno scoperto che i riassumenti producono frequentemente allucinazioni — contenuti non supportati dal documento di origine — e che queste allucinazioni sono correlate con ripetizione e incoerenza1. Un altro studio ha mostrato che i modelli con maggiore astratta tendono a essere meno fedeli; Il loro studio ha riportato che i risultati con maggiore astrazione avevano una minore accuratezza fattuale e più frasiinfedeli. Il benchmark FRANK ha riportato che circa il 30% dei riassunti contiene incoerenze fattuali, e un altro studio popolare ha rilevato tassi di errore simili, sostenendo che alti livelli di allucinazione rendono i riassunti praticamente inutili 1,2. Le allucinazioni possono essere categorizzate come intrinseche (in contraddizione con la fonte) o estrinseche (non verificabili dalla fonte). Un tutorial sulle allucinazioni in sintesi astratte spiega che le allucinazioni intrinseche si verificano quando il contenuto generato contraddice l'input (ad esempio, segnalando erroneamente un vaccino approvato come rifiutato), mentre le allucinazioni estrinseche aggiungono fatti non verificabili, come affermare studi clinici per un vaccino che non sonomenzionati 4. Ha inoltre riportato che i riassuntatori all'avanguardia producono contenuti allucinati in circa il 25% dei loro output quando valutati con ROUGE, BLEU e METEOR, e avverte che le allucinazioni possono essere dannose in ambiti come la salute, il diritto o la cybersicurezza.

Le metriche tradizionali a n-grammi (ROUGE5, BLEU, METEOR) sono scarsamente correlate con i giudizi umani sulla fattualità, portando allo sviluppo di metriche basate e senza riferimento6. Metriche basate su QA come FEQA e QuestEval valutano i riassunti chiedendo se le coppie domanda-risposta derivate dal riassunto possano essere risposte utilizzando il testo sorgente. La FEQA è più fortemente correlata ai giudizi umani e mostra che i riassunti più astratti tendono a essere meno fedeli, mentre QuestEval migliora sostanzialmente la correlazione con i giudizi umani in termini di coerenza, coerenza, fluidità e rilevanza. QAFactEval affina questo approccio selezionando le risposte per le frasi nominali e generando domande prima di rispondere; questa strategia migliora la correlazione con le valutazioni umane sul benchmark SummaC. Le metriche di estrazione dell'informazione (IE) rappresentano la conoscenza come tuple oggetto-relazione-oggetto, ma sono vulnerabili a errori nel processo di estrazione. Le metriche di inferenza del linguaggio naturale (NLI) — come FactCC e SummaC — classificano le frasi riassuntive come implicate o contraddette dalla fonte4. FactCC utilizza dati debolmente supervisionati per addestrare un classificatore che rileva la coerenza fattuale e evidenzia intervalliincoerenti 2. SummaC applica i modelli NLI con la granularità appropriata e fornisce forti stime di fattualità, ma il benchmark FRANK osserva che queste metriche trattano ancora la fattualità come binaria e mancano di un quadro unificato 1,7,8. Le dimensioni della valutazione umana proposte dai ricercatori sono ampiamente adottate9. Un altro studio di valutazione sottolinea che la coerenza è la dimensione più oggettiva perché semplicemente verifica se il riassunto è coinvolto dalla fonte; sottolinea che fino al 92% dei riassunti XSum contiene errori difedeltà 9,10. Tuttavia, la valutazione umana richiede tempo e è costosa, quindi le metriche automatiche sono essenziali per una valutazionescalabile 8. Le metriche attuali spesso aggregano allucinazioni intrinseche ed estrinseche in un unico punteggio, ostacolando la diagnosi dierrore 4.

Poiché l'addestramento al massimo verosimillianza non ottimizza direttamente la qualità sommaria, è stato applicato il reinforcement learning (RL) per migliorare rilevanza e fattualità. Pasunuru e Bansal hanno introdotto un framework RL multi-ricompensa che combina saliency (ROUGE) e ricompense di conseguenza, dimostrando prestazioniall'avanguardia 11. RL è stato applicato per la sintesi estrattive utilizzando l'algoritmo REFORCE; il loro modello massimizza i punteggi ROUGE e produce riassunti più informativi rispetto agli approcci basati su classificatori, come dimostrato dalle valutazioni umane con domandee risposte 12. I modelli multi-tasking incorporano ulteriormente la generazione di domande e di implicazioni per garantire copertura ecoerenza 12. Un sondaggio completo del 2024 sulla sintesi astratta evidenzia la coerenza fattuale come sfida fondamentale e sostiene che il RL incoraggi una sintesi veritiere. Il sondaggio suggerisce di premiare riassunti fattualmente coerenti e di incorporare fonti di conoscenza esterne e controllo degli attributi per aumentarel'accuratezza 13. RL dal feedback umano (RLHF) estende questa idea addestrando un modello di ricompensa sulle preferenze umane e perfezionando il riassunto per massimizzare questa ricompensaappresa 9. L'apprendimento per rinforzo dal feedback umano (RLHF) ha guadagnato popolarità per allineare i risultati del modello con qualità desiderate, come fattualità e utilità 4,14. Mentre RL e RLHF multi-ricompensa allineano i modelli alle nozioni umane di fedeltà, si basano su metriche grossolane come ROUGE o fattualità binaria. Al contrario, il lavoro qui descritto propone di utilizzare come ricompensa un indice di allucinazione a livello di entità a grana fine, che è empirico e computazionalmente meno costoso senza feedback umano.

Nonostante numerosi indicatori, persistono diverse limitazioni. Le metriche N-grammatiche ignorano la correttezza semantica, le metriche basate su QA e IE propagano errori provenienti dai modelli di generazione ed estrazione delle domande, e le metriche NLI riducono la fattualità a decisioni binarie di implicazione 1,4,6. Nel lavoro di ricerca, è stato sottolineato che le metriche esistenti basate su modelli faticano a identificare allucinazioni con una granularità sottile perché operano a livello di frase o documento e non possono isolare entità specifiche che causanoerrori 4. Le valutazioni umane rimangono lo standard d'oro ma sono costose esoggettive 15. Inoltre, le metriche esistenti non distinguono tra allucinazioni intrinseche ed estrinseche né catturano l'eccesso e il sottofocus dellerelazioni 1. I grandi modelli linguistici possono avere allucinazioni perché prevedono il testo basandosi sulla probabilità statistica piuttosto che sulla verifica fattuale. I modelli generano output sicuri ma errati a causa di limitazioni nei dati di addestramento, generazione probabilistica e mancanza di fact-checking, e l'eccessiva fiducia e i bias possono portarli a dichiarare informazioni false con alta certezza; La guida sostiene la generazione aumentata al recupero e la memoria a lungo termine per modelli di terra nei datiesterni 15. Tuttavia, queste tecniche si concentrano su compiti basati sul recupero; La riassuntiva richiede ancora metriche che identifichino e penalizzino le entità allucinate. Lavori precedenti hanno riconosciuto l'importanza della valutazione a livello di entità per la fattualità. Metriche come FEQA e QuestEval cercano di valutare la coerenza fattuale utilizzando tecniche di risposta alledomande 16,17. Tuttavia, questi metodi spesso richiedono riassunti di riferimento o sistemi QA esterni, limitando la scalabilità. Il nostro lavoro si basa su questa linea utilizzando l'Entity Hallucination Index (EHI), una metrica empirica leggera che si concentra specificamente sulla fedeltà delle entità nominate, categorizzando le entità in cinque tipi di fattori allucinazioni come mostrato nella Figura 1.

Le evidenze indicano che le allucinazioni sono pervasive, le metriche di valutazione sono imperfette e le tecniche RL mancano di ricompense dettagliate. Gli studi sull'uomo mostrano che i modelli di sintesi allucinano in una frazione significativa dei casi, spesso scambiando entità o fabbricando dettagli9. Le metriche esistenti enfatizzano la sovrapposizione di n-grammi o trattano la fattualità come binaria, mentre i metodi RL attuali ottimizzano i segnali ROUGE o di fattualità grossolana. Esiste una lacuna per le metriche a livello di entità che misurano quando un riassunto menziona entità non presenti nella fonte (allucinazione negativa), omette entità chiave (allucinazione di perdita di concentrazione) e altri scenari. Il metodo proposto di fine-tuning sull'Entity Hallucination Index (EHI) colma questa lacuna quantificando le allucinazioni a livello di entità e fornendo una ricompensa strutturata per l'apprendimento per rinforzo. Integrando l'EHI in RLHF, puntiamo a perfezionare i grandi modelli linguistici per minimizzare le allucinazioni a livello di entità e produrre riassunti che siano sia fluenti che fedeli ai fatti.

In questo lavoro, proponiamo un approccio innovativo di fine-tuning che sfrutta l'Entity Hallucination Index (EHI) come segnale di ricompensa per ridurre le allucinazioni a livello di entità. L'EHI quantifica la correttezza e il grounding delle entità confrontando le entità estratte dagli output del modello con quelle presenti nel documento di input, consentendo una riduzione della dipendenza dai riferimenti18. Il metodo qui descritto orienta il modello verso la produzione di più riassunti fedeli all'entità senza richiedere annotazioni di fattualità umana.

In sintesi, modelli di ricompensa consapevoli della fattualità sono stati utilizzati per la messa a punto19,20. A differenza degli approcci precedenti che si basano su ricompense fattuali grossolane o dataset etichettati dall'uomo, proponiamo un affining usando l'EHI come segnale diretto e automatico di ricompensa, promuovendo così una sintesi basate sull'entità senza supervisione aggiuntiva. I contributi innovativi di questo studio sono i seguenti: (i) lo studio introduce un framework di fine-tuning guidato da EHI che migliora la fedeltà delle entità nella sintesi astratta, (ii) lo studio presenta una pipeline scalabile di apprendimento per rinforzo che non dipende da dataset fattuali etichettati dall'uomo, (iii) lo studio dimostra miglioramenti empirici nei punteggi EHI tra i dataset di trascrizioni degli incontri, dataset di notizie XSUM e conduce analisi qualitative per evidenziare riduzioni delle allucinazioni, (iv) lo studio condivide un'implementazione riproducibile basata su Colab per facilitare ulteriori ricerche sulla sintesi consapevolidelle allucinazioni 21.

Questo studio valuta l'ipotesi che ottimizzare modelli linguistici con ricompense a grana fine focalizzate sull'entità come l'EHI offra un percorso efficace per migliorare fedeltà e affidabilità nei compiti di riassunto con un calcolo minimo. L'approccio contribuisce al campo in crescita della fine-tuning efficiente parametrica per la fedeltà nella sintesi attraversando: (i) dimostrando l'efficacia sia tra le architetture encoder-decoder (DistilBART, FlanT5) che solo decodificatore (Mistral), (ii) fornendo un quadro adattabile a diversi tipi di modelli, domini e scale, e (iii) offrendo efficienza computazionale rispetto al completo retraining.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L'obiettivo di questo studio è perfezionare un modello linguistico (LM) per generare riassunti con allucinazioni di entità ridotte. Le allucinazioni si verificano quando un modello "produce con sicurezza output errati o irrilevanti" perché genera testo basandosi sulla probabilità statistica piuttosto che sulla verifica fattuale. Questo si ottiene progettando una funzione ricompensa basata sull'Entity Hallucination Index (EHI) e applicando l'apprendimento per rinforzo per massimizzarla.

Formulazione del problema
Dato un documento di input Xi, l'obiettivo è generare un riassunto Yi tale che le entità menzionate in Yi siano fondate su Xi. L'addestramento tradizionale di massima verosimiglianza non ottimizza esplicitamente la coerenza fattuale. Questi metodi di addestramento non penalizzano l'inclusione di entità fabbricate. Pertanto, viene introdotta una strategia di fine-tuning basata sulla ricompensa, in cui la ricompensa è proporzionale alla fedeltà dell'entità, misurata tramite EHI.

Set dati e metodo
Vengono utilizzati due corpora: innanzitutto, un dataset di trascrizione dialogata con trascrizioni di riunioni su più turni e riassunti astratti, e in secondo luogo, il benchmark di riassunta XSUM news22,23. Ogni dataset è stato pulito, appiattito e suddiviso in partizioni all'80% train, 10% validazione e 10% test. I dialoghi sono ricchi di linguaggio informale e pronomi, mentre XSUM contiene articoli di notizie concisi; La combinazione ci permette di valutare sia la generalizzazione in-domain che out-of-domain.

L'estrazione di entità viene effettuata sia su documenti sorgente che su riassunti per calcolare l'Entity Hallucination Index (EHI). Durante la fine-tuning, questo studio utilizza esclusivamente la divisione dell'allenamento, mentre i punteggi EHI di validazione vengono monitorati per selezionare il checkpoint migliore. Le valutazioni finali vengono riportate sul set di test in pausa, che rimane zero-shot prima e dopo la messa a punto fine dei modelli.

In sintesi, innanzitutto, le trascrizioni sono organizzate in un formato appiattito e suddividono i dati. Il modello pre-addestrato genera riassunti di base. In secondo luogo, l'EHI viene calcolata utilizzando NER basato su trasformatori e i cinque fattori di allucinazione. Durante la messa a punto, il modello viene aggiornato con la ricompensa EHI tramite adattatori LoRa. Infine, i riassunti vengono generati utilizzando il modello fine-tuned e valutati utilizzando EHI, Entità F1 e altre metriche (Figura 2). Tutti gli esperimenti sono riproducibili tramite il codice fornito e i file di configurazione. La Figura 3 mostra il flusso di processo a passo per la preparazione del dataset, la sintesi di base, il calcolo EHI, la messa a punto fine e la valutazione.

Riassunto di base
Vengono scelti tre LLM pre-addestrati e vengono catturate le loro riassunti di base: Flan-T5, Mistral (Nous-Hermes-2-Mistral-7B-DPO) e DistilBART 24,25,26. Ogni modello veniva eseguito in modalità zero-shot per produrre un riassunto iniziale (Yi) per ogni documento di input (xi). La ricerca del fascio con larghezza del fascio di 4 e una penalità di lunghezza di 1,0 è stata utilizzata per incoraggiare riassunti fluidi ma concisi. Questi riassunti di base servivano a stimare la prevalenza delle allucinazioni e fornivano punti di partenza per la messa a punto.

Estrazione di entità e calcolo EHI
Calcolare accuratamente l'Entity Hallucination Index (EHI) richiede un NER robusto. Inizialmente, Spacy fu utilizzato per le operazioni NER. Si comprende che i modelli NER basati su trasformatori siano più accurati, ma Spacy fu la scelta iniziale per i seguenti motivi: (1) I modelli NER basati su trasformatori hanno dimostrato di allucinare rispetto a Spacy. (2) Lo spaziamento, essendo statistico, porta efficienza computazionale in termini di costi di implementazione e tempi di esecuzione. (3) Ci aiuta anche a dimostrare che l'EHI è robusto nel ridurre le allucinazioni anche con un modello NER più debole. Tuttavia, dato che gli esperimenti sono condotti su dataset consolidati e il modello en_core_web_sm di spaCy è fragile sulle trascrizionicolloquiali 13. Lo spaziato viene sostituito con un modello NER basato su trasformatori (dslim/bert-base-NER), che è un modello BERT fine-tuned sul dataset CoNLL-2003. I sistemi NER basati su BERT hanno dimostrato di superare i modelli spaCy su compiti specifici per dominio; ad esempio, un modello Aviation-BERT-NER ha raggiunto un F1 del 94,78% identificando 17 entità, rispetto al 93,73% per spaCy NER che ha riconosciutosette entità 27. Il modello NER BERT era configurato tramite Hugging Face Transformers28 ed eseguiva il matching insensibile alla maiuscola. Per catturare pronomi e variazioni superficiali, questo metodo applicava inoltre regole semplici che mappano "Mr. Smith" e "Smith" alla stessa forma canonica; tuttavia, la risoluzione completa per coreferenza rimane un lavoro futuro. L'analisi comparativa dei modelli NER su un campione di 200 record dal dataset XSUM può essere dedotta dalla Tabella 1.

L'Indice di Allucinazione dell'Entità (EHI) è calcolato come:

figure-protocol-1

dove PH, EF, OF, NH, LF rappresentano punteggi corrispondenti rispettivamente a Allucinazione Positiva (PH), Fattore di Estrazione (EF), Allucinazione Negativa (NH), Entità Iperfocalizzate (OF) e Focus Perso (LF), rispettivamente per l'articolo i.

Dettagli sui fattori allucinatorii:

Allucinazione positiva (HP): Misure di entità appena introdotte che sono corrette e utili.

Fattore di estrazione (EF): Misura le entità estratte accuratamente dal documento di input nel sommario.

Allucinazione negativa (NH): Cattura entità allucinate che sono errate o non fondate sull'input.

Troppo concentrato (OF): Penalizza riassunti che si concentrano eccessivamente su un sottoinsieme ristretto di entità, mancando la diversità.

Focus perso (LF): Penalizza i riassunti che omettono entità importanti presenti nell'input.

Il calcolo dei fattori sopra descritti è dettagliato nella Figura 4 con un esempio di calcolo a scopo illustrativo. Considerando un esempio di Entità del Documento di Input (I):"John"," AI"," conferenza" Reference Summary Entities (R):"John"," "IA" Generate Summary Entities (G):"John"," AI"," tecnologia". Valori più alti di EHI indicano una migliore fedeltà delle entità, premiando riassunti sia estrattivi che positivamente allucinati (introducendo entità utili ma fedeli), mentre penalizzano entità20 non radicate, eccessive o mancanti. Questi fattori sono stati normalizzati dal numero totale di entità rilevate per produrre un punteggio EHI compreso tra 0 e 1. La validazione EHI è stata monitorata durante l'addestramento per selezionare il miglior checkpoint. PH ed EF premiano nuove entità beneficie e la corretta estrazione, mentre OF, NH e LF penalizzano ripetizione, fabbricazione e omissione. Un punteggio perfetto di 1.0 significa che tutte le entità nel riassunto sono radicate o allucinate beneficamente, mentre un punteggio di 0 indica che nessuna entità nominata nel riassunto appare nella fonte.

Procedura di messa a punto fine con RL
La configurazione dettagliata degli iperparametri per la fine-tuning è fornita separatamente nelle Tabelle 2, Tabella 3 e Tabella 4, che rappresentano tipi di ottimizzatori, tassi di apprendimento, dimensioni dei lotti, specifiche hardware e altri dettagli di configurazione rispettivamente per Mistral-7B, DistilBart e Flan-T5. L'obiettivo qui è perfezionare i parametri del modello θ massimizzando la ricompensa attesa dell'Entity Hallucination Index (EHI) tra i sommari generati. Formalmente, per un documento di input Xi, un riassunto generato Yi e i parametri del modello θ , l'obiettivo di ricompensa attesa è definito come:

figure-protocol-2(2)

dove EHI (y, x) indica l'Indice di Allucinazione dell'Entità calcolato tra il riassunto generato Yi e l'input Xi.

Seguendo l'algoritmoREINFORCE 25, il gradiente di questo obiettivo è stimato come:

figure-protocol-3(3)

In pratica, sono stati campionati riassunti dai modelli, calcolati i corrispondenti punteggi EHI e applicati aggiornamenti del gradiente delle policy per incoraggiare output a ricompensa più elevata. Per consentire una messa a punto fine efficiente rispetto ai parametri, questo studio ha utilizzato l'Adattamento a Basso Rango (LoRA). Solo gli adattatori LoRA sono stati aggiornati mentre i pesi del modello base sono rimasti bloccati. La messa a punto fine è stata effettuata su una GPU A100 con un basso tasso di apprendimento (ad esempio, 5 × 10-6), una dimensione di lotto di 4 e accumulo di gradiente su 8 passaggi con l'ottimizzatoreAdam 29. I riassunti venivano rigenerati ogni 500 aggiornamenti per aggiornare le stime delle ricompense, e la formazione è proseguita fino alla convergenza dell'EHI di validazione. La base REINFORCE è stata impostata sulla media mobile delle ricompense recenti per ridurre la varianza. Oltre a EHI, Entità F12, i punteggi ROUGE-1/2/L venivano registrati per monitorare la qualità generale. I riassunti vengono rigenerati periodicamente per riflettere i miglioramenti del modello durante la fine tuning.

Metriche di valutazione
I risultati sono stati valutati utilizzando metriche di Informatività come Rouge-1,Rouge-2 5. Metrica di fluenza come RougeLCS 5. Metrica di sovrapposizione di entità Entità F1 e metriche di allucinazione come EHI, FactCC e QAGS 2,6,18,30. FactCC utilizza un classificatore addestrato su dati di contraddizione sintetica per etichettare le frasi come implicate o contraddette dalla fonte. Il FactCC dà due punteggi; le partiture sono state catturate dove l'etichetta è VALIDA. D'altra parte, QAGS utilizza un metodo di domande e risposte che funziona su un LLM. Il modello leggero T5 piccolo veniva utilizzato per generare domande sul testo31. Roberta_base_Squad2 veniva utilizzato per generare risposte sul testodi output 32. Questi modelli furono scelti per il loro conveniente costo di calcolo per l'esecuzione.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli esperimenti qui si concentrano su evidenze quantitative dell'impatto che il fine-tuning guidato da EHI ha nella riduzione delle allucinazioni a livello di entità tra più architetture di modelli e dataset. I risultati dimostrano miglioramenti costanti nelle metriche delle allucinazioni, mantenendo al contempo la coerenza fattuale e preservando la capacità di rispondere a domande.

Prestazioni del dataset
Prestazioni del dataset d...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le metriche basate su QA (ad esempio, FEQA/QuestEval/QAFactEval) e quelle basate su NLI (ad esempio, FactCC/SummaC) richiedono componenti ausiliarie di QA/implicamento e spesso forniscono giudizi a livello di frase. Al contrario, l'EHI è un punteggio leggero, privo di riferimenti, a livello di entità, che (i) prende direttamente di mira la modalità di fallimento primaria che osserviamo — allucinazioni di entità; (ii) è agnostico rispetto al modello e veloce da calcolare; e (iii) serve co...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori non hanno nulla da rivelare.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Colab NVIDIA A100 GPUNVIDIAN/AGoogle Colaboratory Pro
DistilBART (Encoder–Decoder)Hugging Facehttps://huggingface.co/sshleifer/distilbart-cnn-12-6
dslim/bert-base-NERHugging Face (dslim)https://huggingface.co/dslim/bert-base-NERFine-tuned BERT base per NER inglese
Evaluation Models  QAGS (QA-based)Salesforce ResearchN/AClassificatore di fattualità
Evaluation Models (Factuality) FactCCGoogle ResearchN/AClassificatore di fattualità
Flan-T5 (Encoder–Decoder)Googlehttps://huggingface.co/docs/transformers/main/en/model_doc/flan-t5modello linguistico open-source, testo-testo, di grandi dimensioni
Hugging Face TransformersHugging Face, Inc.https://huggingface.co/docs/transformers/indexCaricamento e perfezionamento dei modelli
Nous-Hermes-2-Mistral-7B-DPOMistralhttps://huggingface.co/NousResearch/Nous-Hermes-2-Mistral-7B-DPOModello linguistico a 7 miliardi di parametri
Lingua di programmazione
Python 3.10 (Colab runtime)
Python Software FoundationVersione 3.10Implementazione di base
StreamlitOpen Source https://streamlit.io/Classificatore di fattualità
XLSUM datasetBUEThttps://github.com/csebuetnlp/xl-sum
XSUM datasetUniversity of Edinburghhttps://github.com/EdinburghNLP/XSum

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Maynez, J., Narayan, S., Bohnet, B., McDonald, R. On faithfulness and factuality in abstractive summarization. Proc Annu Meet Assoc Comput Linguist. 2020, 173-173 (2020).
  2. FEQA: A question answering evaluation framework for faithfulness assessment in abstractive summarization. Durmus, E., He, H., Diab, M. Proc Conf Empir Methods Nat Lang Process, , 454-454 (2020).
  3. A short summary of automatic summarization. NLG Blog. , Andong. https://andongluis.github.io/nlg-blog/Summarization-post/ (2018).
  4. Understanding factuality in abstractive summarization. Pagnoni, A., Padmakumar, V., May, J. Proc Conf North Am Chapter Assoc Comput Linguist Hum Lang Technol, 2021, 4812-4829 (2021).
  5. Lin, C. Y. ROUGE: A package for automatic evaluation of summaries. Workshop Text Summarization Branches Out. 2004, 74-81 (2004).
  6. Evaluating the factual consistency of abstractive text summarization. Kryściński, W., McCann, B., Xiong, C., Socher, R. Proc Conf Empir Methods Nat Lang Process, 2020, 750-750 (2020).
  7. Goyal, T., Durmus, E., Cardie, C. Fact checking summarization with self supervised and few shot learning. Proc Annu Meet Assoc Comput Linguist. 2022, 564-579 (2022).
  8. QuestEval: Summarization asks for fact-based evaluation. Scialom, T., Dray, P. A., Lamprier, S., Piwowarski, B., Staiano, J., Wang, A., Gallinari, P. Proc Conf Empir Methods Nat Lang Process, 2021, 6594-6604 (2021).
  9. Mukesh, K. Hallucinations in abstractive summarization. Medium. , https://medium.com/@mukesh.kr/hallucinations-in-abstractive-summarization-b5904bc1c5c5 (2023).
  10. Factual error correction for abstractive summarization models. Cao, M., Dong, Y., Wu, J., Cheung, J. C. K. Proc Conf Empir Methods Nat Lang Process, 2020, 6251-6258 (2020).
  11. Yan, E. Evaluation & hallucination detection for abstractive summaries. , https://eugeneyan.com/writing/abstractive-summarization-evaluation/ (2021).
  12. Uekawa, A. Evaluation metrics for summarization. , https://dev.to/akuer/evaluation-metrics-for-summarization-1d7f (2023).
  13. Honnibal, M., Montani, I. spaCy 2: Natural language understanding with Bloom embeddings convolutional neural networks and incremental parsing. Zenodo. , (2017).
  14. Reinforcement learning from human feedback: Aligning large language models. , At https://neptune.ai/blog/reinforcement-learning-from-human-feedback (2023).
  15. Shakil, H., Farooq, A., Kalita, J. Abstractive text summarization: State of the art, challenges, and improvements. Neurocomputing. 603, 128255-128255 (2024).
  16. AI, Z. Reducing LLM hallucinations: A developer's guide. GetZep. , https://www.getzep.com/ai-agents/reducing-llm-hallucinations/ (2025).
  17. Ouyang, L., et al. Training language models to follow instructions with human feedback. Adv Neural Inf Process Syst. 2022, 27730-27744 (2022).
  18. Entity hallucination index in abstractive summarization-A metric. Praveenkumar, K., Balbantaray, R. C., Vittala, K. P. Proc Int Conf Commun Circuits Syst, 2023, 1-5 (2023).
  19. Multi-reward reinforced summarization with saliency and entailment. Pasunuru, R., Bansal, M. Proc Conf North Am Chapter Assoc Comput Linguist Hum Lang Technol, 2018, 646-653 (2018).
  20. Williams, R. J. Simple statistical gradient-following algorithms for connectionist reinforcement learning. Mach Learn. 8 (3-4), 229-256 (1992).
  21. Katwe NLP. EHI_XLSUM_XSUM_Finetuning. , GitHub. https://github.com/katweNLP/EHI_XLSUM_XSUM_Finetuning (2025).
  22. ELITR minuting corpus: A novel dataset for automatic minuting from multi-party meetings in English and Czech. Nedoluzhko, A., Singh, M., Hledíková, M., Ghosal, T., Bojar, O. Proc Int Conf Lang Resour Eval (LREC), 2022, 2623-2632 (2022).
  23. Don't give me the details, just the summary! Topic aware convolutional neural networks for extreme summarization. Narayan, S., Cohen, S. B., Lapata, M. Proc Conf Empir Methods Nat Lang Process, 2018, 1797-1807 (2018).
  24. Lewis, M., et al. Denoising sequence to sequence pre training for natural language generation, translation, and comprehension. Proc Annu Meet Assoc Comput Linguist. 2020, 7871-7880 (2020).
  25. Chung, H. W., et al. Scaling instruction fine-tuned language models. J Mach Learn Res. 25 (1), 1-53 (2024).
  26. Jiang, A. Q., et al. Mistral 7B. arXiv. , (2023).
  27. Chandra, C., Ojima, Y., Bendarkar, M. V., Mavris, D. N. Aviation BERT NER: Named entity recognition for aviation safety reports. Aerospace. 11 (11), 890-890 (2024).
  28. Lim, D. S. bert-base-NER. , https://huggingface.co/dslim/bert-base-NER (2021).
  29. Adam: A method for stochastic optimization. Kingma, D. P., Ba, J. Int Conf Learn Represent, , (2015).
  30. QAGS: Evaluating question answering and generation for summarization. Wang, A., Cho, K. Proc Conf Empir Methods Nat Lang Process, 2020, 390-402 (2020).
  31. Patil, S. valhalla/t5-small-qg-hl. , https://huggingface.co/valhalla/t5-small-qg-hl (2020).
  32. deepset/roberta-base-squad2. , Deepset GmbH. https://huggingface.co/deepset/roberta-base-squad2 (2020).
  33. Factually consistent summarization via reinforcement learning with textual entailment feedback. Roit, P., et al. Proc Annu Meet Assoc Comput Linguist, 2023, 8027-8044 (2023).
  34. Hallucination diversity aware active learning for text summarization. Xia, Y., et al. Proc Conf North Am Chapter Assoc Comput Linguist Hum Lang Technol, 2024, 3885-3900 (2024).
  35. Wei, Z., et al. TruthRL: Incentivizing truthful large language models via reinforcement learning. arXiv. , (2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Large Language ModelsEntity HallucinationText SummarizationEntity Hallucination IndexAbstractive SummarizationReinforcement LearningNamed Entity ExtractionModel Fine TuningSummarization RobustnessFactuality Improvement

Related Articles