$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
L'obiettivo di questo studio è perfezionare un modello linguistico (LM) per generare riassunti con allucinazioni di entità ridotte. Le allucinazioni si verificano quando un modello "produce con sicurezza output errati o irrilevanti" perché genera testo basandosi sulla probabilità statistica piuttosto che sulla verifica fattuale. Questo si ottiene progettando una funzione ricompensa basata sull'Entity Hallucination Index (EHI) e applicando l'apprendimento per rinforzo per massimizzarla.
Formulazione del problema
Dato un documento di input Xi, l'obiettivo è generare un riassunto Yi tale che le entità menzionate in Yi siano fondate su Xi. L'addestramento tradizionale di massima verosimiglianza non ottimizza esplicitamente la coerenza fattuale. Questi metodi di addestramento non penalizzano l'inclusione di entità fabbricate. Pertanto, viene introdotta una strategia di fine-tuning basata sulla ricompensa, in cui la ricompensa è proporzionale alla fedeltà dell'entità, misurata tramite EHI.
Set dati e metodo
Vengono utilizzati due corpora: innanzitutto, un dataset di trascrizione dialogata con trascrizioni di riunioni su più turni e riassunti astratti, e in secondo luogo, il benchmark di riassunta XSUM news22,23. Ogni dataset è stato pulito, appiattito e suddiviso in partizioni all'80% train, 10% validazione e 10% test. I dialoghi sono ricchi di linguaggio informale e pronomi, mentre XSUM contiene articoli di notizie concisi; La combinazione ci permette di valutare sia la generalizzazione in-domain che out-of-domain.
L'estrazione di entità viene effettuata sia su documenti sorgente che su riassunti per calcolare l'Entity Hallucination Index (EHI). Durante la fine-tuning, questo studio utilizza esclusivamente la divisione dell'allenamento, mentre i punteggi EHI di validazione vengono monitorati per selezionare il checkpoint migliore. Le valutazioni finali vengono riportate sul set di test in pausa, che rimane zero-shot prima e dopo la messa a punto fine dei modelli.
In sintesi, innanzitutto, le trascrizioni sono organizzate in un formato appiattito e suddividono i dati. Il modello pre-addestrato genera riassunti di base. In secondo luogo, l'EHI viene calcolata utilizzando NER basato su trasformatori e i cinque fattori di allucinazione. Durante la messa a punto, il modello viene aggiornato con la ricompensa EHI tramite adattatori LoRa. Infine, i riassunti vengono generati utilizzando il modello fine-tuned e valutati utilizzando EHI, Entità F1 e altre metriche (Figura 2). Tutti gli esperimenti sono riproducibili tramite il codice fornito e i file di configurazione. La Figura 3 mostra il flusso di processo a passo per la preparazione del dataset, la sintesi di base, il calcolo EHI, la messa a punto fine e la valutazione.
Riassunto di base
Vengono scelti tre LLM pre-addestrati e vengono catturate le loro riassunti di base: Flan-T5, Mistral (Nous-Hermes-2-Mistral-7B-DPO) e DistilBART 24,25,26. Ogni modello veniva eseguito in modalità zero-shot per produrre un riassunto iniziale (Yi) per ogni documento di input (xi). La ricerca del fascio con larghezza del fascio di 4 e una penalità di lunghezza di 1,0 è stata utilizzata per incoraggiare riassunti fluidi ma concisi. Questi riassunti di base servivano a stimare la prevalenza delle allucinazioni e fornivano punti di partenza per la messa a punto.
Estrazione di entità e calcolo EHI
Calcolare accuratamente l'Entity Hallucination Index (EHI) richiede un NER robusto. Inizialmente, Spacy fu utilizzato per le operazioni NER. Si comprende che i modelli NER basati su trasformatori siano più accurati, ma Spacy fu la scelta iniziale per i seguenti motivi: (1) I modelli NER basati su trasformatori hanno dimostrato di allucinare rispetto a Spacy. (2) Lo spaziamento, essendo statistico, porta efficienza computazionale in termini di costi di implementazione e tempi di esecuzione. (3) Ci aiuta anche a dimostrare che l'EHI è robusto nel ridurre le allucinazioni anche con un modello NER più debole. Tuttavia, dato che gli esperimenti sono condotti su dataset consolidati e il modello en_core_web_sm di spaCy è fragile sulle trascrizionicolloquiali 13. Lo spaziato viene sostituito con un modello NER basato su trasformatori (dslim/bert-base-NER), che è un modello BERT fine-tuned sul dataset CoNLL-2003. I sistemi NER basati su BERT hanno dimostrato di superare i modelli spaCy su compiti specifici per dominio; ad esempio, un modello Aviation-BERT-NER ha raggiunto un F1 del 94,78% identificando 17 entità, rispetto al 93,73% per spaCy NER che ha riconosciutosette entità 27. Il modello NER BERT era configurato tramite Hugging Face Transformers28 ed eseguiva il matching insensibile alla maiuscola. Per catturare pronomi e variazioni superficiali, questo metodo applicava inoltre regole semplici che mappano "Mr. Smith" e "Smith" alla stessa forma canonica; tuttavia, la risoluzione completa per coreferenza rimane un lavoro futuro. L'analisi comparativa dei modelli NER su un campione di 200 record dal dataset XSUM può essere dedotta dalla Tabella 1.
L'Indice di Allucinazione dell'Entità (EHI) è calcolato come:

dove PH, EF, OF, NH, LF rappresentano punteggi corrispondenti rispettivamente a Allucinazione Positiva (PH), Fattore di Estrazione (EF), Allucinazione Negativa (NH), Entità Iperfocalizzate (OF) e Focus Perso (LF), rispettivamente per l'articolo i.
Dettagli sui fattori allucinatorii:
Allucinazione positiva (HP): Misure di entità appena introdotte che sono corrette e utili.
Fattore di estrazione (EF): Misura le entità estratte accuratamente dal documento di input nel sommario.
Allucinazione negativa (NH): Cattura entità allucinate che sono errate o non fondate sull'input.
Troppo concentrato (OF): Penalizza riassunti che si concentrano eccessivamente su un sottoinsieme ristretto di entità, mancando la diversità.
Focus perso (LF): Penalizza i riassunti che omettono entità importanti presenti nell'input.
Il calcolo dei fattori sopra descritti è dettagliato nella Figura 4 con un esempio di calcolo a scopo illustrativo. Considerando un esempio di Entità del Documento di Input (I):"John"," AI"," conferenza" Reference Summary Entities (R):"John"," "IA" Generate Summary Entities (G):"John"," AI"," tecnologia". Valori più alti di EHI indicano una migliore fedeltà delle entità, premiando riassunti sia estrattivi che positivamente allucinati (introducendo entità utili ma fedeli), mentre penalizzano entità20 non radicate, eccessive o mancanti. Questi fattori sono stati normalizzati dal numero totale di entità rilevate per produrre un punteggio EHI compreso tra 0 e 1. La validazione EHI è stata monitorata durante l'addestramento per selezionare il miglior checkpoint. PH ed EF premiano nuove entità beneficie e la corretta estrazione, mentre OF, NH e LF penalizzano ripetizione, fabbricazione e omissione. Un punteggio perfetto di 1.0 significa che tutte le entità nel riassunto sono radicate o allucinate beneficamente, mentre un punteggio di 0 indica che nessuna entità nominata nel riassunto appare nella fonte.
Procedura di messa a punto fine con RL
La configurazione dettagliata degli iperparametri per la fine-tuning è fornita separatamente nelle Tabelle 2, Tabella 3 e Tabella 4, che rappresentano tipi di ottimizzatori, tassi di apprendimento, dimensioni dei lotti, specifiche hardware e altri dettagli di configurazione rispettivamente per Mistral-7B, DistilBart e Flan-T5. L'obiettivo qui è perfezionare i parametri del modello θ massimizzando la ricompensa attesa dell'Entity Hallucination Index (EHI) tra i sommari generati. Formalmente, per un documento di input Xi, un riassunto generato Yi e i parametri del modello θ , l'obiettivo di ricompensa attesa è definito come:
(2)
dove EHI (y, x) indica l'Indice di Allucinazione dell'Entità calcolato tra il riassunto generato Yi e l'input Xi.
Seguendo l'algoritmoREINFORCE 25, il gradiente di questo obiettivo è stimato come:
(3)
In pratica, sono stati campionati riassunti dai modelli, calcolati i corrispondenti punteggi EHI e applicati aggiornamenti del gradiente delle policy per incoraggiare output a ricompensa più elevata. Per consentire una messa a punto fine efficiente rispetto ai parametri, questo studio ha utilizzato l'Adattamento a Basso Rango (LoRA). Solo gli adattatori LoRA sono stati aggiornati mentre i pesi del modello base sono rimasti bloccati. La messa a punto fine è stata effettuata su una GPU A100 con un basso tasso di apprendimento (ad esempio, 5 × 10-6), una dimensione di lotto di 4 e accumulo di gradiente su 8 passaggi con l'ottimizzatoreAdam 29. I riassunti venivano rigenerati ogni 500 aggiornamenti per aggiornare le stime delle ricompense, e la formazione è proseguita fino alla convergenza dell'EHI di validazione. La base REINFORCE è stata impostata sulla media mobile delle ricompense recenti per ridurre la varianza. Oltre a EHI, Entità F12, i punteggi ROUGE-1/2/L venivano registrati per monitorare la qualità generale. I riassunti vengono rigenerati periodicamente per riflettere i miglioramenti del modello durante la fine tuning.
Metriche di valutazione
I risultati sono stati valutati utilizzando metriche di Informatività come Rouge-1,Rouge-2 5. Metrica di fluenza come RougeLCS 5. Metrica di sovrapposizione di entità Entità F1 e metriche di allucinazione come EHI, FactCC e QAGS 2,6,18,30. FactCC utilizza un classificatore addestrato su dati di contraddizione sintetica per etichettare le frasi come implicate o contraddette dalla fonte. Il FactCC dà due punteggi; le partiture sono state catturate dove l'etichetta è VALIDA. D'altra parte, QAGS utilizza un metodo di domande e risposte che funziona su un LLM. Il modello leggero T5 piccolo veniva utilizzato per generare domande sul testo31. Roberta_base_Squad2 veniva utilizzato per generare risposte sul testodi output 32. Questi modelli furono scelti per il loro conveniente costo di calcolo per l'esecuzione.