$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
L’objectif de cette étude est d’affiner un modèle de langage (LM) afin de générer des résumés avec des hallucinations réduites à l’entité. Les hallucinations surviennent lorsqu’un modèle « produit avec assurance des résultats incorrects ou non pertinents » parce qu’il génère du texte selon la probabilité statistique plutôt que la vérification factuelle. Cela est réalisé en concevant une fonction de récompense basée sur l’Indice d’Hallucination de l’Entité (EHI) et en appliquant l’apprentissage par renforcement pour la maximiser.
Formulation du problème
Étant donné un document d’entrée Xi, l’objectif est de générer un résumé Yi de sorte que les entités mentionnées dans Yi soient fondées sur Xi. L’entraînement traditionnel à la plus grande vraisemblance n’optimise pas explicitement la cohérence factuelle. Ces méthodes de formation ne pénalisent pas l’inclusion d’entités fabriquées. Par conséquent, une stratégie d’ajustement fin axée sur la récompense est introduite lorsque la récompense est proportionnelle à la fidélité de l’entité, mesurée à l’aide de l’EHI.
Ensemble de données et méthode
Deux corpus sont utilisés : premièrement, un ensemble de données de transcription de dialogues comprenant des transcriptions de réunions à plusieurs tours et des résumés abstraits en or, et ensuite, le benchmark de résumé XSUM News22,23. Chaque jeu de données a été nettoyé, aplati et divisé en partitions de 80 % train, 10 % de validation et 10 % de partitions test. Les dialogues sont riches en langage informel et en pronoms, tandis que XSUM contient des articles de presse concis ; Cette combinaison nous permet d’évaluer à la fois la généralisation dans le domaine et hors domaine.
L’extraction d’entités est effectuée à la fois sur les documents sources et les résumés pour calculer l’Entity Hallucination Index (EHI). Lors de l’ajustement fin, cette étude utilise exclusivement la répartition de l’entraînement, tandis que les scores EHI de validation sont surveillés pour sélectionner le meilleur point de contrôle. Les évaluations finales sont rapportées sur l’ensemble de test tendu, qui reste zéro tir avant et après l’ajustement fin des modèles.
En résumé, premièrement, les transcriptions sont organisées dans un format aplati et divisent les données. Le modèle pré-entraîné génère des résumés de base. Deuxièmement, l’IHE est calculée à l’aide du NER basé sur un transformateur et des cinq facteurs d’hallucination. Lors de l’ajustement fin, le modèle est mis à jour avec la récompense EHI via des adaptateurs LoRa. Enfin, les résumés sont générés à l’aide du modèle affiné et évalués à l’aide de l’EHI, de l’Entité F1 et d’autres métriques (Figure 2). Toutes les expériences sont reproductibles via le code et les fichiers de configuration fournis. La figure 3 montre le processus étape par étapes pour la préparation des ensembles de données, la synthèse de base, le calcul EHI, l’ajustement fin et l’évaluation.
Résumé de la base
Trois LLM pré-entraînés sont choisis, et leurs résumés de base sont capturés : Flan-T5, Mistral (Nous-Hermes-2-Mistral-7B-DPO) et DistilBART 24,25,26. Chaque modèle était exécuté en mode zéro prise pour produire un résumé initial (Yi) pour chaque document d’entrée (xi). La recherche de faisceau avec une largeur de faisceau de 4 et une pénalité de longueur de 1,0 a été utilisée pour encourager des résumés fluides mais concis. Ces résumés de base servaient à estimer la prévalence des hallucinations et fournissaient des points de départ pour l’ajustement fin.
Extraction d’entités et calcul EHI
Calculer précisément l’Indice d’Hallucination de l’Entité (EHI) nécessite un NER robuste. Initialement, Spacy était utilisé pour les opérations de la NER. Il est entendu que les modèles NER basés sur transformateurs sont plus précis, mais Spacy a été le choix initial pour les raisons suivantes : (1) Les modèles NER basés sur transformateurs ont eux-mêmes prouvé qu’ils hallucinent plus que Spacy. (2) L’espacement étant statistique apporte une efficacité computationnelle en termes de coûts d’implémentation et de temps d’exécution. (3) Il nous aide également à prouver que l’IHE est robuste pour réduire les hallucinations même avec un modèle NER plus faible. Cependant, étant donné que les expériences sont réalisées sur des ensembles de données établis et que le modèle en_core_web_sm de spaCy est fragile sur les transcriptionsfamilières 13. L’espacement est remplacé par un modèle NER basé sur un transformateur (dslim/bert-base-NER), qui est un modèle BERT affiné sur le jeu de données CoNLL-2003. Les systèmes NER basés sur BERT ont démontré qu’ils surpassent les modèles spaCy sur des tâches spécifiques à un domaine — par exemple, un modèle Aviation-BERT-NER a atteint un F1 de 94,78 % en identifiant 17 entités, contre 93,73 % pour spaCy NER qui a reconnusept entités 27. Le modèle NER BERT était configuré via Hugging FaceTransformers 28 et effectuait un appariement insensible aux majuscules. Pour capturer les pronoms et les variations de la forme de surface, cette méthode appliquait en outre des règles simples qui associent « Mr. Smith » et « Smith » à la même forme canonique ; cependant, la résolution complète de coréférence reste un travail à venir. L’analyse comparative des modèles NER sur un échantillon de 200 enregistrements issus du jeu de données XSUM peut être déduite du tableau 1.
L’Indice d’Hallucination de l’Entité (ISE) est calculé comme suit :

où PH, EF, OF, NH, LF représentent respectivement des scores correspondant à Hallucination Positive (HP), Facteur d’Extraction (FE), Hallucination négative (NH), Entités surfocalisées (OF) et Perte de concentration (LF), respectivement, pour l’article i.
Détails des facteurs d’hallucination :
Hallucination positive (HP) : Des mesures des entités nouvellement introduites qui sont factuellement correctes et bénéfiques.
Facteur d’extraction (FE) : Mesure les entités extraites avec précision du document d’entrée dans le résumé.
Hallucination négative (NH) : Capture des entités hallucinées qui sont incorrectes ou non ancrées dans l’entrée.
Trop ciblé (OF) : Penalise des résumés qui se concentrent excessivement sur un sous-ensemble restreint d’entités, sans diversité.
Focus perdu (LF) : Pénalise les résumés qui omettent les entités importantes présentes dans l’entrée.
Le calcul des facteurs ci-dessus est détaillé à la Figure 4 , avec un exemple de calcul à titre illustratif. En considérant un exemple d’entités de document d’entrée (I) : « John », « IA », « conférence » Entités de résumé de référence (R) : « John », « IA » Entités de résumé générées (G) : « John », « IA », « technologie ». Des valeurs plus élevées d’IHE indiquent une meilleure fidélité aux entités, récompensant les résumés à la fois extractifs et positivement hallucinés (introduisant des entités utiles mais fidèles), tout en pénalisant l’entité20 non fondée, excessive ou manquante. Ces facteurs ont été normalisés par le nombre total d’entités détectées pour produire un score EHI compris entre 0 et 1. La validation EHI a été surveillée pendant la formation pour sélectionner le meilleur point de contrôle. PH et EF récompensent les nouvelles entités bénéfiques et l’extraction correcte, tandis que OF, NH et LF pénalisent la répétition, la fabrication et l’omission. Un score parfait de 1,0 signifie que toutes les entités du résumé sont ancrées ou bénéfiquement hallucinées, tandis qu’un score de 0 indique qu’aucune entité nommée dans le résumé n’apparaît dans la source.
Procédure d’ajustement fin avec RL
La configuration détaillée des hyperparamètres pour l’ajustement fin est fournie séparément dans les Tables 2, 3 et 4, qui illustrent les types d’optimiseurs, les taux d’apprentissage, les tailles de lot, les spécifications matérielles et d’autres détails de configuration pour Mistral-7B, DistilBart et Flan-T5, respectivement. L’objectif ici est d’affiner les paramètres du modèle θ en maximisant la récompense attendue de l’Indice d’Hallucination Entité (EHI) à travers les résumés générés. Formellement, pour un document d’entrée Xi, un résumé généré Yi et des paramètres du modèle θ , l’objectif de récompense attendu est défini comme suit :
(2)
où EHI (y, x) désigne l’Indice d’Hallucination de l’Entité calculé entre le résumé généré Yi et l’entrée Xi.
En suivant l’algorithmeREINFORCE 25, le gradient de cet objectif est estimé comme suit :
(3)
En pratique, des résumés ont été échantillonnés à partir des modèles, leurs scores EHI correspondants ont été calculés, et des mises à jour du gradient de politique ont été appliquées pour encourager des résultats à plus haute récompense. Pour permettre un ajustement fin à efficacité paramétrique, cette étude a utilisé l’adaptation de rang bas (LoRA). Seuls les adaptateurs LoRA ont été mis à jour tandis que les poids du modèle de base sont restés gelés. L’ajustement fin a été effectué sur un GPU A100 avec un faible taux d’apprentissage (par exemple, 5 × 10-6), une taille de lot de 4 et une accumulation de gradient sur 8 étapes avec l’optimiseurAdam 29. Les résumés étaient régénérés toutes les 500 mises à jour pour rafraîchir les estimations de récompense, et la formation se poursuivait jusqu’à la convergence de validation de l’EHI. La base REINFORCE a été fixée à la moyenne courante des récompenses récentes pour réduire la variance. En plus de l’EHI, de l’Entité F12, les scores ROUGE-1/2/L ont été enregistrés pour surveiller la qualité générale. Les résumés sont régénérés périodiquement pour refléter les améliorations du modèle lors de l’ajustement fin.
Indicateurs d’évaluation
Les résultats ont été évalués à l’aide de métriques d’Informativité telles que Rouge-1, Rouge-25. Une métrique de fluidité comme la RougeLCS 5. Métrique de chevauchement d’entités Entité F1, et métriques d’hallucination comme EHI, FactCC et QAGS 2,6,18,30. FactCC utilise un classificateur entraîné sur des données de contradiction synthétique pour étiqueter les phrases comme impliquées ou contredites par la source. Le FactCC donne deux scores ; les partitions ont été capturées là où l’étiquette est VALIDE. En revanche, QAGS utilise une méthode questions-réponses qui fonctionne sur un LLM. Le modèle léger T5 small était utilisé pour générer des questions sur le texte31. Roberta_base_Squad2 était utilisé pour générer des réponses sur le textede sortie 32. Ces modèles ont été choisis pour leur coût de calcul pratique pour l’exécution.