Generazione della risposta iniziale
Il modello linguistico di base ha generato risposte fluide e contestualmente pertinenti per domande provenienti da entrambi i dataset di riferimento. Tuttavia, un'analisi dettagliata ha rivelato affermazioni infondate e inaccurare dal punto di vista fattuale in diverse risposte. Nel dataset TruthfulQA, il sistema di base ha mostrato un tasso di allucinazione del 28%, mentre è stato osservato un tasso di allucinazione del 26% nel dataset FEVER. Questi risultati hanno confermato che la generazione diretta del linguaggio da sola era insufficiente per applicazioni che richiedono un'elevata affidabilità fattuale, stabilendo così la condizione di base rispetto alla quale sono state confrontate tutte le successive procedure di verifica.
Estrazione delle affermazioni
La procedura di estrazione delle affermazioni ha decomposto con successo le risposte generate in unità fattuali indipendenti e verificabili. Le risposte provenienti da TruthfulQA contenevano in media 3,2 affermazioni atomiche, mentre i campioni di FEVER consistevano generalmente di una singola affermazione. Il processo di decomposizione ha isolato le asserzioni fattuali senza introdurre informazioni aggiuntive, consentendo di valutare ogni singola affermazione separatamente. Questa osservazione ha sostenuto l'ipotesi secondo cui la verifica a livello di singola affermazione offre una maggiore precisione rispetto alla valutazione dell'intera risposta come un'unica unità.
Costruzione di riferimenti indipendenti
Sono state generate referenze indipendenti per ogni affermazione estratta, utilizzando un processo di ragionamento separato condizionato esclusivamente sulla query originale. Le referenze generate hanno fornito descrizioni fattuali concise sufficientemente distinte dalle risposte originali da poter fungere da fonti di verifica indipendenti. Il processo di generazione delle referenze è stato isolato dalla risposta iniziale per evitare di condizionare direttamente il riferimento fattuale sull'output precedente del modello. Questa separazione aveva lo scopo di ridurre il potenziale bias di conferma e di fornire una base controllata per la successiva verifica a livello di singola affermazione; lo studio non quantifica in modo indipendente l'entità di questo effetto. La generazione con successo di referenze indipendenti ha sostenuto il principio di progettazione proposto, basato sulla separazione tra richiamo della conoscenza e generazione della risposta.
Verifica dell'inferenza del linguaggio naturale
La fase di verifica NLI ha classificato efficacemente le coppie affermazione-riferimento nelle categorie di implicazione, contraddizione e neutralità. Le affermazioni contraddette hanno ricevuto costantemente punteggi di verifica negativi, mentre le affermazioni supportate da evidenze fattuali hanno ottenuto punteggi positivi. Le classificazioni neutre sono state assegnate alle affermazioni per le quali non era disponibile un'evidenza di supporto sufficiente. Questo comportamento ha dimostrato che l'inferenza semantica può identificare in modo affidabile affermazioni fattuali non supportate e fornire le evidenze necessarie per una correzione mirata. Rispetto a una semplice strategia di controllo della coerenza, la verifica NLI ha ridotto il tasso di allucinazioni dal 20% al 15%, indicando una maggiore capacità di rilevamento.
Soglia statistica adattiva
L'applicazione del thresholding statistico adattivo ha ulteriormente migliorato le prestazioni di verifica regolando dinamicamente i confini decisionali in base alla distribuzione dei punteggi di confidenza di ogni risposta. L'analisi della sensibilità della soglia ha dimostrato che le prestazioni sono migliorate all'aumentare del parametro di soglia da 0,3 a 0,7. Con un valore di sensibilità pari a 0,7, il framework ha raggiunto un'accuratezza di 0,87 riducendo al contempo le allucinazioni al 9% (Figura 2). I risultati completi dell'analisi di sensibilità per i valori valutati di k sono riportati nel Tabella Supplementare 2. Un ulteriore aumento della soglia oltre questo punto ha prodotto soltanto lievi miglioramenti dell'accuratezza, aumentando al contempo la latenza. Queste osservazioni confermano l'ipotesi secondo cui le soglie adattive risultano più efficaci delle soglie decisionali fisse nel gestire distribuzioni di confidenza variabili tra le diverse risposte.
La soglia adattiva riflette anche la variabilità dei punteggi di confidenza all'interno di ogni risposta. Le risposte con punteggi di verifica altamente coerenti producono una deviazione standard più piccola, determinando un confine decisionale più selettivo. Al contrario, le risposte contenenti affermazioni con valori di confidenza eterogenei presentano una deviazione standard maggiore, portando a una regione di accettazione più ampia e riducendo correzioni non necessarie per affermazioni incerte. Sebbene questo comportamento adattivo non possa eliminare ogni falso positivo o falso negativo, consente al confine decisionale di adattarsi alle caratteristiche di incertezza di ciascuna risposta, invece di applicare un criterio uniforme a tutti gli input.
Correzione selettiva delle richieste e assemblaggio della risposta
Sono state inviate per correzione solo le affermazioni identificate come contraddittorie, mentre quelle supportate e neutre sono state mantenute invariate. Questa strategia selettiva di correzione ha minimizzato la rigenerazione non necessaria e ha preservato la struttura originale della risposta. Dopo la correzione e la ricostruzione della risposta, il tasso di allucinazioni su TruthfulQA è diminuito dal 28% al 9%, con una riduzione relativa del 67,9%. Miglioramenti simili sono stati osservati su FEVER, dove le allucinazioni sono diminuite dal 26% al 10%. I confronti relativi ad accuratezza e tasso di allucinazioni tra le configurazioni valutate sono presentati nelle Figure 3 e 4, rispettivamente.
Valutazione delle prestazioni
La valutazione comparativa ha mostrato che il framework proposto ha ottenuto le prestazioni complessive più elevate tra tutti i metodi testati. Su TruthfulQA, il framework ha raggiunto un'accuratezza di 0,87 e un punteggio F1 di 0,85, superando sia la verifica con soglia fissa sia gli approcci basati sulla coerenza interna (Tabella 2, Figure 3 e 4). Su FEVER, il framework ha ottenuto un'accuratezza di 0,89 e un punteggio F1 di 0,87 (Tabella 3, Figure 3 e 4). Il contributo incrementale dei componenti del framework è stato esaminato tramite l'analisi di ablazione presentata nella Tabella 4. Questi miglioramenti hanno confermato che la combinazione della verifica a livello di affermazione con un processo decisionale statistico adattivo aumenta l'affidabilità fattuale su più dataset. L'accuratezza nel rilevamento delle allucinazioni per SelfCheckGPT, FActScore e il framework proposto è confrontata nella Figura 5.
Analisi della latenza
La pipeline completa di verifica ha mantenuto un basso carico computazionale. Il tempo medio di risposta è aumentato da 820 ms per il modello di base a 980 ms per il framework completo, rappresentando un incremento modesto nel tempo di elaborazione (Tabella 5). La generazione della risposta ha costituito la maggior parte della latenza totale, mentre le fasi di verifica e correzione hanno aggiunto un sovraccarico relativamente ridotto. La suddivisione del tempo di elaborazione per fase è riportata nella Tabella Supplementare 3. Rispetto ai sistemi di verifica basati sul recupero, che richiedevano circa 1600 ms per ogni query, il framework proposto ha ottenuto una latenza notevolmente inferiore pur mantenendo un'accuratezza fattuale comparabile. Questi risultati supportano l'ipotesi che la riduzione delle allucinazioni possa essere raggiunta senza compromettere l'usabilità in tempo reale.
Poiché la generazione della risposta si basa su un modello linguistico basato sul cloud, le singole misurazioni della latenza sono soggette a fluttuazioni dovute alle condizioni di rete e alla pianificazione lato server, piuttosto che a un tempo di esecuzione deterministico. Per questo motivo, sono state effettuate misurazioni ripetute al fine di ottenere valori medi rappresentativi, riducendo l'influenza della variabilità transitoria dell'esecuzione pur mantenendo confronti relativi tra i metodi valutati. I valori di latenza sono riportati come tempi medi di esecuzione calcolati su ripetute esecuzioni sperimentali. I singoli valori di latenza per ciascuna esecuzione non sono stati conservati; pertanto, non è stato possibile effettuare calcoli a posteriori di varianza, intervalli di confidenza o altre misure di variabilità. Di conseguenza, i valori di latenza e il confronto velocità-accuratezza in Figura 6 sono presentati come stime puntuali senza barre di errore.
In conclusione, i risultati hanno dimostrato che la combinazione di estrazione delle affermazioni, generazione indipendente di riferimenti, verifica tramite inferenza del linguaggio naturale, sogliatura statistica adattiva e correzione selettiva ha migliorato l'affidabilità fattuale degli output dei modelli linguistici di grandi dimensioni. Il framework ha ridotto il tasso di allucinazioni dal 28% al 9% su TruthfulQA e dal 26% al 10% su FEVER. I risultati indicano che la verifica adattiva a livello di affermazione ha migliorato le metriche di affidabilità fattuale limitando al contempo l'ulteriore latenza di risposta nelle condizioni valutate.
Disponibilità dei dati
I set di dati analizzati in questo studio sono disponibili pubblicamente attraverso le rispettive fonti ufficiali. Il manoscritto fornisce le informazioni sui set di dati, le configurazioni del modello e i dettagli metodologici necessari per supportare la riproduzione delle analisi descritte. I dati elaborati per la valutazione e i risultati supplementari generati durante lo studio sono forniti nei File Supplementari.

Figura 1: Flusso di lavoro del framework adattivo di verifica delle affermazioni. Una risposta iniziale generata da un modello linguistico di grandi dimensioni (LLM) viene scomposta in affermazioni fattuali, seguita da generazione indipendente di riferimenti, verifica basata su inferenza linguistica naturale (NLI), attribuzione di un punteggio di confidenza e sogliatura statistica. Le affermazioni che soddisfano il criterio di accettazione vengono mantenute, mentre quelle che soddisfano il criterio di correzione subiscono una correzione mirata prima dell'assemblaggio della risposta finale. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 2: Effetto del parametro di sensibilità (k) sull'accuratezza della verifica. Accuratezza su TruthfulQA e FEVER per valori di k pari a 0,3, 0,5, 0,7 e 1,0. L'accuratezza è aumentata con k su entrambi i dataset, con k = 0,7 selezionato per la valutazione principale. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 3: Confronto dell'accuratezza tra i diversi metodi di verifica. Accuratezza del modello linguistico di base, della verifica basata su NLI e del framework di verifica adattiva proposto su TruthfulQA e FEVER. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 4: Confronto del tasso di allucinazioni tra diversi metodi di verifica. Tassi di allucinazione per il modello LLM di base, la verifica basata su NLI e il framework proposto su TruthfulQA e FEVER. Il framework proposto ha ridotto il tasso dal 28% al 9% su TruthfulQA e dal 26% al 10% su FEVER. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 5: Accuratezza del rilevamento delle allucinazioni tra diversi metodi. Accuratezza di rilevamento di SelfCheckGPT, FActScore e del framework proposto su TruthfulQA e FEVER. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 6: Compromesso tra tempo di risposta e accuratezza nei diversi metodi di verifica. Relazione tra latenza di risposta e accuratezza per i metodi valutati su TruthfulQA e FEVER, che illustra il compromesso prestazioni-latenza associato al framework proposto e agli approcci comparativi. Cliccare qui per visualizzare una versione ingrandita di questa figura.
| Dataset | Campioni utilizzati | Domini | Lunghezza media della risposta (token) | Tasso di allucinazione del modello linguistico di base |
| TruthfulQA | 817 | 38 (scienze, storia, diritto, ecc.) | 42 | 28% |
| FEVER | 1.000 | Affermazioni fattuali generali | 18 | 26% |
Tabella 1: Caratteristiche del dataset di riferimento. Riepilogo dei dataset TruthfulQA e FEVER utilizzati per lo sviluppo e la valutazione del framework, inclusi il numero di campioni, l'accuratezza di base, la percentuale di allucinazioni di base e il numero medio di affermazioni per campione.
| Metodo | Accuratezza | Precisione | Richiamo | Punteggio F1 | Percentuale di allucinazioni |
| LLM di base (inferenza singola) | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| Verifica basata su NLI (soglia fissa) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| SelfCheckGPT | 0.76 | 0.755 | 0.725 | 0.74 | 22% |
| FActScore | 0.85 | 0.8425 | 0.8175 | 0.83 | 11% |
| Framework proposto (soglia statistica) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
Tabella 2: Confronto delle prestazioni su TruthfulQA. Accuratezza, precisione, richiamo, punteggio F1 e tasso di allucinazione per il modello linguistico di base, SelfCheckGPT, FActScore, verifica NLI e il framework proposto.
| Metodo | Accuratezza | Precisione | Recupero | Punteggio F1 | Percentuale di allucinazioni |
| SelfCheckGPT | 0.78 | — | — | — | — |
| FActScore | 0.87 | — | — | — | — |
| LLM di base† | 0.74 | 0.73 | 0.71 | 0.72 | 26% |
| Verifica basata su NLI (Soglia fissa) | 0.83 | 0.8225 | 0.7975 | 0.81 | 14% |
| Framework proposto (Soglia statistica) | 0.89 | 0.8775 | 0.8625 | 0.87 | 10% |
Tabella 3: Confronto delle prestazioni su FEVER. Accuratezza, precisione, richiamo, punteggio F1 e tasso di allucinazione per il modello linguistico di base, SelfCheckGPT, FActScore, verifica NLI e il framework proposto.
| Configurazione | Accuratezza | Precisione | Recupero | F1 (aggiunto) | Tasso di allucinazione |
| Modello linguistico di base | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| Base + controllo secondario (senza NLI) | 0.78 | 0.7725 | 0.7475 | 0.76* | 20% |
| Base + verifica basata su NLI (soglia fissa) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| Base + modulo decisionale statistico (completo) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
Tabella 4: Analisi di ablazione dei componenti del framework. Variazioni nell'accuratezza, nel punteggio F1 e nel tasso di allucinazione in seguito all'integrazione sequenziale della validazione secondaria, della verifica NLI e della soglia statistica adattiva.
| Metodo | Tempo Medio di Risposta (ms) |
| LLM di Base (Generazione Singola) | 820 |
| Meccanismo di Auto-Validazione | 910 |
| Framework Statistico Proposto | 980 |
| Verifica con Recupero Aumentato (RAG) | 1600 |
Tabella 5: Latenza di risposta tra i diversi metodi di verifica. Tempo medio di risposta e latenza aggiuntiva rispetto al modello linguistico di base per la Self-Validation, il framework proposto e la verifica basata sul recupero.
Tabella supplementare 1: Confronto tra approcci di verifica delle allucinazioni. Confronto tra il framework proposto e i metodi esistenti in termini di recupero esterno, verifica a livello di affermazione, soglia adattiva ed elaborazione efficiente in termini di latenza.Cliccare qui per scaricare il file.
Tabella supplementare 2: Analisi di sensibilità del parametro soglia (k). Accuratezza, precisione, richiamo, punteggio F1 e tasso di allucinazione sono stati ottenuti per valori del parametro soglia di 0,3, 0,5, 0,7 e 1,0. Un valore di k = 0,7 è stato utilizzato per la valutazione principale.Cliccare qui per scaricare il file.
Tabella supplementare 3: Tempo di elaborazione nelle diverse fasi della pipeline di verifica. Tempo medio di esecuzione e contributo percentuale della generazione della risposta iniziale, della decomposizione dell'affermazione, della generazione dei riferimenti, dell'inferenza NLI e della correzione selettiva rispetto al tempo totale di risposta.Cliccare qui per scaricare il file.
Tabella supplementare 4: Distribuzione degli errori identificati durante la verifica. Numero e percentuale di falsi negativi, falsi positivi ed errori di correzione, insieme alle principali categorie di allucinazione associate a ciascun tipo di errore.Cliccare qui per scaricare il file.