Erzeugung der anfänglichen Antwort
Das Basismodell erzeugte flüssige und kontextuell relevante Antworten auf Fragen aus beiden Benchmark-Datensätzen. Bei genauerer Untersuchung zeigten sich jedoch mehrere Antworten mit unbegründeten und faktisch unrichtigen Aussagen. Auf dem TruthfulQA-Datensatz wies das Basissystem eine Halluzinationsrate von 28 % auf, während auf dem FEVER-Datensatz eine Halluzinationsrate von 26 % beobachtet wurde. Diese Ergebnisse bestätigten, dass die reine Sprachgenerierung allein für Anwendungen mit hohen Anforderungen an die Faktentreue unzureichend ist, und definierten die Ausgangsbedingung, mit der alle nachfolgenden Verifizierungsverfahren verglichen wurden.
Extraktion von Behauptungen
Das Verfahren zur Extraktion von Aussagen hat generierte Antworten erfolgreich in unabhängig überprüfbare Fakteinheiten zerlegt. Die Antworten aus TruthfulQA enthielten durchschnittlich 3,2 atomare Aussagen, während FEVER-Stichproben im Allgemeinen aus einer einzigen Aussage bestanden. Der Zerlegungsprozess isolierte faktische Behauptungen, ohne zusätzliche Informationen einzuführen, wodurch jede Aussage einzeln bewertet werden konnte. Diese Beobachtung stützte die Hypothese, dass die Überprüfung auf Ebene einzelner Aussagen eine höhere Präzision bietet als die Bewertung ganzer Antworten als eine einzige Einheit.
Aufbau unabhängiger Referenzen
Für jede extrahierte Behauptung wurden unabhängige Referenzen mithilfe eines separaten Schlussfolgerungsprozesses erzeugt, der ausschließlich auf der ursprünglichen Abfrage basierte. Die generierten Referenzen enthielten präzise, sachliche Beschreibungen, die sich ausreichend von den ursprünglichen Antworten unterschieden, um als unabhängige Verifizierungsquellen zu dienen. Der Referenzgenerierungsprozess war vom ursprünglichen Antwortprozess getrennt, um zu verhindern, dass die sachliche Referenz direkt von der zuvor vom Modell erzeugten Ausgabe abhängt. Diese Trennung sollte potenzielle Bestätigungsfehler verringern und eine kontrollierte Grundlage für die anschließende Überprüfung auf Ebene der einzelnen Behauptungen bieten; die Studie quantifiziert jedoch nicht unabhängig das Ausmaß dieses Effekts. Die erfolgreiche Erzeugung unabhängiger Referenzen untermauerte das vorgeschlagene Gestaltungsprinzip, das Wissenabrufen von der Antwortgenerierung zu trennen.
Überprüfung der natürlichen Sprachschlussfolgerung
Die NLI-Verifizierungsstufe klassifizierte Behauptungs-Referenz-Paare effektiv in die Kategorien Entailment, Widerspruch und neutral. Widersprochene Behauptungen erhielten durchgängig negative Verifizierungsscores, während faktisch gestützte Behauptungen positive Scores erhielten. Neutrale Klassifizierungen wurden Behauptungen zugewiesen, für die unzureichende unterstützende Belege vorlagen. Dieses Verhalten zeigte, dass semantische Inferenz zuverlässig nicht gestützte faktische Aussagen identifizieren konnte und die erforderlichen Belege für gezielte Korrekturen lieferte. Im Vergleich zu einer einfachen Konsistenzprüfung reduzierte die NLI-Verifizierung die Halluzinationsrate von 20 % auf 15 %, was auf eine verbesserte Erkennungsfähigkeit hindeutet.
Adaptives statistisches Schwellenwertverfahren
Die Anwendung einer adaptiven statistischen Schwellenwertbestimmung verbesserte die Verifizierungsleistung weiter, indem die Entscheidungsgrenzen dynamisch an die Konfidenzscore-Verteilung jeder Antwort angepasst wurden. Die Sensitivitätsanalyse des Schwellenwerts zeigte, dass die Leistung zunahm, als der Schwellenparameter von 0,3 auf 0,7 erhöht wurde. Bei einem Sensitivitätswert von 0,7 erreichte das Framework eine Genauigkeit von 0,87 und reduzierte Halluzinationen auf 9 % (Abbildung 2). Die vollständigen Ergebnisse der Sensitivitätsanalyse für die evaluierten Werte von k sind in Zusatztabelle 2 enthalten. Eine Erhöhung des Schwellenwerts über diesen Punkt hinaus führte nur zu geringfügigen Verbesserungen der Genauigkeit, während die Latenz zunahm. Diese Beobachtungen stützten die Hypothese, dass adaptive Schwellenwerte effektiver sind als feste Entscheidungsgrenzen, um unterschiedliche Konfidenzverteilungen über verschiedene Antworten hinweg zu bewältigen.
Die adaptive Schwelle spiegelt auch die Variabilität der Konfidenzwerte innerhalb jeder Antwort wider. Antworten mit sehr konsistenten Verifizierungswerten weisen eine geringere Standardabweichung auf, was zu einer selektiveren Entscheidungsgrenze führt. Im Gegensatz dazu ergeben Antworten, die Behauptungen mit heterogenen Konfidenzwerten enthalten, eine größere Standardabweichung, was zu einem weiteren Akzeptanzbereich führt und unnötige Korrekturen bei unsicheren Behauptungen verringert. Obwohl dieses adaptive Verhalten nicht jeden falsch-positiven oder falsch-negativen Fall ausschließen kann, ermöglicht es der Entscheidungsgrenze, auf die Unsicherheitseigenschaften jeder einzelnen Antwort zu reagieren, anstatt ein einheitliches Kriterium auf alle Eingaben anzuwenden.
Auswahlkorrektur und Antwortzusammenstellung
Nur als widersprüchlich identifizierte Behauptungen wurden zur Korrektur eingereicht, während unterstützte und neutrale Behauptungen unverändert beibehalten wurden. Diese selektive Korrekturstrategie minimierte unnötige Neugenerierung und bewahrte die ursprüngliche Struktur der Antwort. Nach der Korrektur und Rekonstruktion der Antwort sank die Halluzinationsrate bei TruthfulQA von 28 % auf 9 %, was einer relativen Reduktion von 67,9 % entspricht. Ähnliche Verbesserungen wurden bei FEVER beobachtet, wo Halluzinationen von 26 % auf 10 % zurückgingen. Genauigkeits- und Halluzinationsratenvergleiche zwischen den evaluierten Konfigurationen sind in Abbildung 3 und 4 dargestellt.
Leistungsbeurteilung
Die vergleichende Bewertung zeigte, dass der vorgeschlagene Ansatz unter allen getesteten Methoden die höchste Gesamtleistung erzielte. Bei TruthfulQA erreichte der Ansatz eine Genauigkeit von 0,87 und einen F1-Wert von 0,85 und übertraf damit sowohl die Verifizierung mit festem Schwellenwert als auch ansätze, die auf Selbstkonsistenz basieren (Tabelle 2, Abbildungen 3 und 4). Bei FEVER erreichte der Ansatz eine Genauigkeit von 0,89 und einen F1-Wert von 0,87 (Tabelle 3, Abbildungen 3 und 4). Der zusätzliche Beitrag der einzelnen Komponenten des Ansatzes wird durch die Ablationsanalyse in Tabelle 4 untersucht. Diese Verbesserungen bestätigten, dass die Kombination der Behauptungsebene-Verifizierung mit adaptiver statistischer Entscheidungsfindung die faktische Zuverlässigkeit über mehrere Datensätze hinweg verbesserte. Die Genauigkeit bei der Halluzinationsdetektion für SelfCheckGPT, FActScore und den vorgeschlagenen Ansatz wird in Abbildung 5 verglichen.
Latenzanalyse
Die vollständige Verifizierungspipeline wies einen geringen Rechenaufwand auf. Die durchschnittliche Antwortzeit stieg von 820 ms beim Basismodell auf 980 ms beim vollständigen Framework, was nur eine geringfügige Zunahme der Verarbeitungszeit darstellt (Tabelle 5). Die Antwortgenerierung verursachte den größten Teil der gesamten Latenz, während die Verifizierungs- und Korrekturphasen nur einen relativ geringen zusätzlichen Aufwand verursachten. Die Aufschlüsselung der Verarbeitungszeit auf Phasenebene ist in der ergänzenden Tabelle 3 dargestellt. Im Vergleich zu abrufbasierten Verifizierungssystemen, die etwa 1600 ms pro Abfrage benötigten, erreichte das vorgeschlagene Framework deutlich geringere Latenzzeiten, während eine vergleichbare faktische Genauigkeit beibehalten wurde. Diese Ergebnisse stützten die Hypothese, dass eine Reduzierung von Halluzinationen erzielt werden kann, ohne die Echtzeitnutzbarkeit einzuschränken.
Da die Antwortgenerierung auf einem cloudbasierten Sprachmodell beruht, unterliegen individuelle Latenzmessungen Schwankungen aufgrund von Netzwerkbedingungen und serverseitiger Planung, anstatt einer deterministischen Ausführungszeit. Daher wurden wiederholte Messungen verwendet, um repräsentative Durchschnittswerte zu erhalten, wodurch der Einfluss vorübergehender Ausführungsvariabilität verringert wurde, während relative Vergleiche zwischen den evaluierten Methoden erhalten blieben. Die Latenzwerte werden als mittlere Ausführungszeiten über wiederholte experimentelle Durchläufe angegeben. Individuelle Latenzwerte pro Durchlauf wurden nicht gespeichert; daher war eine nachträgliche Berechnung von Varianz, Konfidenzintervallen oder anderen Variabilitätsmaßen nicht möglich. Entsprechend werden die Latenzwerte und der Geschwindigkeits-Genauigkeits-Vergleich in Abbildung 6 als Punktschätzungen ohne Fehlerbalken dargestellt.
Zusammenfassend zeigten die Ergebnisse, dass die Kombination von Behauptungsextraktion, unabhängiger Referenzerstellung, Verifizierung durch natürliche Sprachinferenz, adaptiver statistischer Schwellenwertbestimmung und selektiver Korrektur die faktische Zuverlässigkeit der Ausgaben großer Sprachmodelle verbesserte. Der Ansatz verringerte die Halluzinationsrate von 28 % auf 9 % bei TruthfulQA und von 26 % auf 10 % bei FEVER. Die Ergebnisse deuten darauf hin, dass die adaptive Verifizierung auf Ebene einzelner Behauptungen die Metriken zur faktischen Zuverlässigkeit verbesserte, während die zusätzliche Antwortverzögerung unter den untersuchten Bedingungen begrenzt blieb.
Datenverfügbarkeit
Die in dieser Studie analysierten Datensätze sind öffentlich über ihre jeweiligen offiziellen Quellen zugänglich. Die Publikation enthält die erforderlichen Informationen zu den Datensätzen, Modellkonfigurationen und methodischen Details, um die beschriebenen Analysen nachvollziehen zu können. Verarbeitete Evaluationsdaten und ergänzende Ergebnisse, die während der Studie generiert wurden, sind in den Zusatzdateien enthalten.

Abbildung 1: Ablauf des adaptiven Anspruchsüberprüfungs-Frameworks. Eine anfängliche, von einem LLM generierte Antwort wird in faktische Aussagen zerlegt, gefolgt von unabhängiger Referenzerstellung, NLI-basierter Verifizierung, Konfidenzbewertung und statistischer Schwellenwertbestimmung. Aussagen, die das Akzeptanzkriterium erfüllen, werden beibehalten, während Aussagen, die das Korrekturkriterium erfüllen, vor der endgültigen Antwortzusammenstellung gezielt korrigiert werden. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 2: Einfluss des Empfindlichkeitsparameters (k) auf die Verifizierungsgenauigkeit. Genauigkeit bei TruthfulQA und FEVER für k-Werte von 0,3, 0,5, 0,7 und 1,0. Die Genauigkeit stieg bei beiden Datensätzen mit steigendem k-Wert, wobei k = 0,7 für die primäre Bewertung ausgewählt wurde. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Abbildung 3: Vergleich der Genauigkeit verschiedener Verifizierungsmethoden. Genauigkeit des Baseline-LLM, der NLI-basierten Verifizierung und des vorgeschlagenen adaptiven Verifizierungsframeworks bei TruthfulQA und FEVER. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 4: Vergleich der Halluzinationsraten über verschiedene Verifizierungsmethoden hinweg. Die Halluzinationsraten für das Baseline-LLM, die NLI-basierte Verifizierung und den vorgeschlagenen Ansatz bei TruthfulQA und FEVER. Der vorgeschlagene Ansatz verringerte die Rate bei TruthfulQA von 28 % auf 9 % und bei FEVER von 26 % auf 10 %. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 5: Genauigkeit der Halluzinationsdetektion bei verschiedenen Methoden. Detektionsgenauigkeit von SelfCheckGPT, FActScore und des vorgeschlagenen Frameworks auf den Datensätzen TruthfulQA und FEVER. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 6: Kompromiss zwischen Reaktionszeit und Genauigkeit bei verschiedenen Verifizierungsmethoden. Beziehung zwischen Reaktionsverzögerung und Genauigkeit der bewerteten Methoden bei TruthfulQA und FEVER, die den Leistungs- und Latenzkompromiss des vorgeschlagenen Frameworks und vergleichender Ansätze veranschaulicht. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.
| Datensatz | Verwendete Stichproben | Dominänen | Durchschnittliche Antwortlänge (Token) | Basis-Halluzinationsrate des Sprachmodells |
| TruthfulQA | 817 | 38 (Naturwissenschaften, Geschichte, Rechtswesen usw.) | 42 | 28% |
| FEVER | 1.000 | Allgemeine faktische Behauptungen | 18 | 26% |
Tabelle 1: Merkmale der Benchmark-Datensätze. Zusammenfassung der TruthfulQA- und FEVER-Datensätze, die für die Entwicklung und Bewertung des Frameworks verwendet wurden, einschließlich Stichprobenanzahlen, Basisgenauigkeit, Basis-Halluzinationsrate und durchschnittlicher Aussagen pro Stichprobe.
| Methode | Genauigkeit | Präzision | Recall | F1-Score | Halluzinationsrate % |
| Basis-LLM (Einzelinferenz) | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| NLI-basierte Verifizierung (fester Schwellenwert) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| SelfCheckGPT | 0.76 | 0.755 | 0.725 | 0.74 | 22% |
| FActScore | 0.85 | 0.8425 | 0.8175 | 0.83 | 11% |
| Vorgeschlagenes Framework (statistischer Schwellenwert) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
Tabelle 2: Leistungsvergleich bei TruthfulQA. Genauigkeit, Präzision, Sensitivität, F1-Score und Halluzinationsrate für das Baseline-LLM, SelfCheckGPT, FActScore, NLI-Verifizierung und das vorgeschlagene Framework.
| Methode | Genauigkeit | Präzision | Recall | F1-Score | Halluzinationsrate % |
| SelfCheckGPT | 0.78 | — | — | — | — |
| FActScore | 0.87 | — | — | — | — |
| Basis-LLM† | 0.74 | 0.73 | 0.71 | 0.72 | 26% |
| NLI-basierte Verifizierung (fester Schwellenwert) | 0.83 | 0.8225 | 0.7975 | 0.81 | 14% |
| Vorgeschlagenes Framework (statistischer Schwellenwert) | 0.89 | 0.8775 | 0.8625 | 0.87 | 10% |
Tabelle 3: Leistungsvergleich beim FEVER-Datensatz. Genauigkeit, Präzision, Sensitivität, F1-Score und Halluzinationsrate für das Baseline-LLM, SelfCheckGPT, FActScore, NLI-Verifizierung und das vorgeschlagene Framework.
| Konfiguration | Genauigkeit | Präzision | Recall | F1 (hinzugefügt) | Halluzinationsrate |
| Basis-Sprachmodell | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| Basis + Sekundärprüfung (ohne NLI) | 0.78 | 0.7725 | 0.7475 | 0.76* | 20% |
| Basis + NLI-basierte Verifizierung (fester Schwellenwert) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| Basis + Statistisches Entscheidungsmodul (vollständig) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
Tabelle 4: Ablationsanalyse der Framework-Komponenten. Änderungen der Genauigkeit, des F1-Scores und der Halluzinationsrate nach schrittweiser Integration der sekundären Validierung, der NLI-Verifizierung und der adaptiven statistischen Schwellenwertbestimmung.
| Methode | Mittlere Reaktionszeit (ms) |
| Basis-LLM (Einzelne Generierung) | 820 |
| Selbstvalidierungsmechanismus | 910 |
| Vorgeschlagener statistischer Rahmen | 980 |
| Retrieval-erweiterte Verifizierung (RAG) | 1600 |
Tabelle 5: Reaktionslatenz bei verschiedenen Verifizierungsmethoden. Mittlere Reaktionszeit und zusätzliche Latenz im Vergleich zum Baseline-LLM für die Selbstvalidierung, das vorgeschlagene Framework und die abrufbasierte Verifizierung.
Ergänzungstabelle 1: Vergleich von Ansätzen zur Halluzinationsüberprüfung. Vergleich des vorgeschlagenen Frameworks mit bestehenden Methoden hinsichtlich externer Abrufung, Überprüfung auf Aussageebene, adaptiver Schwellenwertbestimmung und latenzarmen Verarbeitung.Bitte klicken Sie hier, um diese Datei herunterzuladen.
Zusatz-Tabelle 2: Sensitivitätsanalyse des Schwellenparameter (k). Genauigkeit, Präzision, Sensitivität, F1-Score und Halluzinationsrate wurden bei Schwellenparameterwerten von 0,3, 0,5, 0,7 und 1,0 ermittelt. Für die primäre Bewertung wurde ein Wert von k = 0,7 verwendet.Bitte klicken Sie hier, um diese Datei herunterzuladen.
Zusatz-Tabelle 3: Verarbeitungszeit über die Stufen der Verifizierungspipeline. Mittlere Ausführungszeit und prozentualer Anteil der initialen Antwortgenerierung, der Zerlegung der Behauptung, der Referenzgenerierung, der NLI-Inferenz und der selektiven Korrektur an der Gesamtantwortzeit.Bitte klicken Sie hier, um diese Datei herunterzuladen.
Zusatz-Tabelle 4: Verteilung der während der Verifikation identifizierten Fehler. Anzahl und Prozentsatz von falsch-negativen, falsch-positiven Ergebnissen sowie Korrekturfehlern zusammen mit den primären Halluzinationskategorien, die mit jedem Fehlertyp assoziiert sind.Bitte klicken Sie hier, um diese Datei herunterzuladen.