9. Januar 2026
Wir schlagen einen auf Reinforcement Learning basierenden Feinabstimmungsansatz für große Sprachmodelle vor, der den Enti Hallucination Index (EHI) als Belohnungssignal nutzt, um Halluzinationen auf Entitätsebene in Textzusammenfassungen zu reduzieren. Experimente mit Protokollen zeigen, dass diese Methode die Treue und Genauigkeit der Entitäten verbessert.
Diese Studie verwendet den Entity Hallucination Index als Belohnungssignal, um falsche Entitätengenerierung in KI-zusammengefassten Texten zu reduzieren. Die aktuellen Metriken sind zweigrob: Dieses Protokoll verwendet feinkörnige Entitätsbelohnungen, um die Faktualität ohne menschliche Etiketten zu verbessern. Zu Beginn verwenden Sie zwei Hauptkorpora, darunter einen Dialogtranskriptionsdatensatz mit mehrfachen Sitzungsprotokollen und den XSum News Zusammenfassungsbenchmark.
Reinigen Sie jeden Datensatz, flachen Sie die Daten ab und teilen Sie sie in 80%-Trainings-, 10%-Validierungs- und 10%-Testsätze. Führen Sie Tokenisierung und Entitätsextraktion mit einem transformatorbasierten NER-Modell D Slim/BERT-basiertem NER durch, um eine robuste Erdung sicherzustellen. Erstelle initiale Zusammenfassungen im Zero-Shot-Modus mittels Strahlsuche mit einer Breite von vier, um die Basisprävalenz von Halluzinationen zu schätzen.
Berechnen Sie den Entitätshalluzinationsindex als referenzfreie Entitätsmetrik, die Entitäten in fünf Faktoren einteilt, um die Treue zu quantifizieren. Belohne Extraktivität und positive Halluzinationen und bestrafe negative Halluzinationen, überfokussierte Entitäten und verlorene Konzentration. Definieren Sie die Belohnungsfunktion als proportional zur Treue der Entität und maximieren Sie die erwartete EHI-Belohnung über die generierten Zusammenfassungen.
Wenden Sie einen verstärkten Style-Update-Mechanismus an, um Modellparameter zu optimieren und die Entitätentreue zu maximieren. Verwenden Sie Low-Rank-Adaption, um parametereffiziente Feinabstimmung zu ermöglichen, und aktualisieren Sie nur die LoRA-Adapter, während die Basismodellgewichte eingefroren bleiben. Dann werden Richtliniengradienten-Updates angewendet, um höhere Belohnungsausgaben zu fördern, und Zusammenfassungen für jeweils 500 Updates neu generiert, um die Belohnungsschätzungen aufzufrischen.
Schließlich erstellen Sie endgültige Zusammenfassungen mit den fein abgestimmten Modellen und vergleichen Sie sie mit den Basisergebnissen. Bewerten Sie Modelle hinsichtlich Informativität mit Rouge eins, Rouge zwei und Rouge L, Flüssigkeit und faktischer Konsistenz mit Fact CC und CAGs. FEHI-Abstimmung reduzierte Halluzinationen und verbesserte die Faktualität zwischen Modellen und Datensätzen mit nach rechts gerichteten EHI-Verschiebungen sowie Fakten-CC-Verteilungen, die eine erhöhte Entitätstreue und faktische Konsistenz bestätigten, während die CAGS-Werte weitgehend unverändert blieben.
Die schädlichen Halluzinationstypen negativ, Überfokus und verlorener Konzentration wurden in Mistral nach dem Feinabstimmung reduziert, während sich der Extraktivitätsfaktor fast verdoppelte. Die Korrelationsanalyse zeigte, dass EHI und CAGS eine schwache Korrelation zwischen Mistral und Distillbart hatten, während Flan-T5 eine stärkere positive Korrelation zeigte. Forscher können die Treue- und Halluzinationsraten auf Entitätsebene in Zusammenfassungen mit dem automatisierten EHI Belohnungssignal messen.
Die größte Herausforderung ist die NER-Genauigkeit, da Extraktionsfehler während des Trainings zu falschen Belohnungsberechnungen führen können. Zukünftige Studien können Ko-Referenz-Auflösung und Informationsbelohnungen integrieren, um Treue mit Zusammenfassungsberichterstattung besser auszubalancieren.
Sehen Sie sich das vollständige Transkript an und erhalten Sie Zugang zu Tausenden wissenschaftlicher Videos
Dieser Artikel stellt einen neuartigen, belohnungsbasierten Feinabstimmungsansatz für große Sprachmodelle (LLMs) vor, der darauf abzielt, faktenbezogene Halluzinationen auf Ebene von Entitäten bei der abstraktiven Zusammenfassung zu reduzieren. Indem der Entitäten-Halluzinations-Index (EHI) als Leitmetrik verwendet wird, verbessert der Ansatz die faktische Genauigkeit der erzeugten Zusammenfassungen, ohne dabei Informationsgehalt oder Verallgemeinerbarkeit einzubüßen.
Halluzinationen auf Ebene von Entitäten bei der Zusammenfassung durch große Sprachmodelle (LLM) stellen ein erhebliches Risiko für die Datenintegrität und Entscheidungsfindung in der Biopharma-Forschung dar&D. Der Entity Hallucination Index (EHI)-basierte Feinabstimmungsansatz begegnet dieser Herausforderung direkt und ermöglicht eine zuverlässigere Extraktion faktischer Erkenntnisse aus wissenschaftlichen und operativen Textquellen. Eine verbesserte Faktizität bei der automatisierten Zusammenfassung trägt zu einer höheren Vorhersagesicherheit bei und verringert das Risiko in wissensbasierten Verarbeitungspipelines.
Der EHI-gesteuerte Feinabstimmungsrahmen integriert sich in die Informatikschicht von Entdeckungs-, Screening- und translationsmedizinischen Forschungspipelines und unterstützt eine robuste Entitätsextraktion und -zusammenfassung.