Génération de la réponse initiale
Le modèle de langage de base a produit des réponses fluides et contextuellement pertinentes aux questions des deux jeux de données de référence. Toutefois, un examen détaillé a révélé des affirmations non étayées et factuellement inexactes dans plusieurs réponses. Sur le jeu de données TruthfulQA, le système de base a présenté un taux d’hallucination de 28 %, tandis qu’un taux d’hallucination de 26 % a été observé sur le jeu de données FEVER. Ces résultats ont confirmé que la génération directe de langage seule était insuffisante pour des applications exigeant une grande fiabilité factuelle, et ont établi la condition de base par rapport à laquelle toutes les procédures de vérification ultérieures ont été comparées.
Extraction des allégations
La procédure d'extraction des affirmations a correctement décomposé les réponses générées en unités factuelles indépendamment vérifiables. Les réponses provenant de TruthfulQA contenaient en moyenne 3,2 affirmations atomiques, tandis que les échantillons de FEVER se composaient généralement d'une seule affirmation. Le processus de décomposition a isolé les assertions factuelles sans introduire d'informations supplémentaires, permettant ainsi d'évaluer chaque énoncé séparément. Cette observation soutient l'hypothèse selon laquelle la vérification au niveau des affirmations offre une précision supérieure à celle de l'évaluation de l'ensemble des réponses comme une seule unité.
Construction de références indépendantes
Des références indépendantes ont été générées pour chaque affirmation extraite à l’aide d’un processus de raisonnement distinct, conditionné uniquement sur la requête initiale. Les références générées fournissaient des descriptions factuelles concises, suffisamment différentes des réponses initiales pour servir de sources de vérification indépendantes. Le processus de génération des références a été isolé de la réponse initiale afin d’éviter de conditionner directement la référence factuelle sur la sortie précédente du modèle. Cette séparation visait à réduire les biais de confirmation potentiels et à offrir une base contrôlée pour la vérification ultérieure au niveau des affirmations ; l’étude ne quantifie pas indépendamment l’ampleur de cet effet. La génération réussie de références indépendantes appuie le principe de conception proposé, qui consiste à séparer la récupération des connaissances de la génération des réponses.
Vérification de l'inférence en langage naturel
L'étape de vérification NLI a permis de classer efficacement les paires affirmation-référence en catégories d'inférence, de contradiction et de neutralité. Les affirmations contradictoires ont systématiquement obtenu des scores de vérification négatifs, tandis que les affirmations étayées factuellement ont reçu des scores positifs. Les classifications neutres ont été attribuées aux affirmations pour lesquelles aucune preuve suffisante n'était disponible. Ce comportement a démontré que l'inférence sémantique pouvait identifier de façon fiable les énoncés factuels non étayés et fournir les preuves nécessaires à une correction ciblée. Par rapport à une stratégie simple de vérification de cohérence, la vérification NLI a réduit le taux d'hallucination de 20 % à 15 %, indiquant une capacité de détection améliorée.
Seuillage statistique adaptatif
L'application d'un seuillage statistique adaptatif a encore amélioré les performances de vérification en ajustant dynamiquement les frontières de décision en fonction de la distribution des scores de confiance de chaque réponse. Une analyse de sensibilité du seuil a montré que les performances s'amélioraient lorsque le paramètre de seuil augmentait de 0,3 à 0,7. Pour une valeur de sensibilité de 0,7, le cadre atteignait une précision de 0,87 tout en réduisant les hallucinations à 9 % (Figure 2). Les résultats complets de l'analyse de sensibilité pour les valeurs évaluées de k sont fournis dans le Tableau supplémentaire 2. Augmenter davantage le seuil au-delà de ce point n'apportait que des gains minimes en précision tout en augmentant la latence. Ces observations confirmaient l'hypothèse selon laquelle les seuils adaptatifs sont plus efficaces que des frontières de décision fixes pour gérer les distributions variables de confiance entre les réponses.
Le seuil adaptatif reflète également la variabilité des scores de confiance au sein de chaque réponse. Les réponses présentant des scores de vérification très cohérents produisent un écart type plus faible, ce qui conduit à une frontière de décision plus sélective. En revanche, les réponses contenant des affirmations ayant des valeurs de confiance hétérogènes entraînent un écart type plus élevé, aboutissant à une zone d'acceptation plus large et réduisant ainsi les corrections inutiles pour les affirmations incertaines. Bien que ce comportement adaptatif ne puisse pas éliminer chaque faux positif ou chaque faux négatif, il permet à la frontière de décision de s'ajuster aux caractéristiques d'incertitude de chaque réponse, plutôt que d'appliquer un critère uniforme à toutes les entrées.
Correction sélective des revendications et assemblage de la réponse
Seules les affirmations identifiées comme contradictoires ont été soumises à correction, tandis que les affirmations étayées et neutres ont été conservées sans modification. Cette stratégie de correction sélective a permis de minimiser la régénération inutile et de préserver la structure originale de la réponse. Après correction et reconstruction de la réponse, le taux d'hallucination sur TruthfulQA est passé de 28 % à 9 %, représentant une réduction relative de 67,9 %. Des améliorations similaires ont été observées sur FEVER, où les hallucinations sont passées de 26 % à 10 %. Les comparaisons de précision et de taux d'hallucination entre les configurations évaluées sont présentées respectivement dans les Figures 3 et 4.
Évaluation des performances
L'évaluation comparative a montré que le cadre proposé atteignait la performance globale la plus élevée parmi toutes les méthodes testées. Sur TruthfulQA, le cadre a atteint une exactitude de 0,87 et un score F1 de 0,85, surpassant à la fois la vérification à seuil fixe et les approches fondées sur l'auto-cohérence (Tableau 2, Figures 3 et 4). Sur FEVER, le cadre a atteint une exactitude de 0,89 et un score F1 de 0,87 (Tableau 3, Figures 3 et 4). La contribution progressive des composants du cadre est examinée à travers l'analyse d'ablation présentée dans le Tableau 4. Ces améliorations ont confirmé que la combinaison de la vérification au niveau des affirmations avec une prise de décision statistique adaptative améliorait la fiabilité factuelle sur plusieurs ensembles de données. L'exactitude de détection des hallucinations pour SelfCheckGPT, FActScore et le cadre proposé est comparée dans la Figure 5.
Analyse de la latence
Le pipeline complet de vérification a maintenu une surcharge informatique faible. Le temps de réponse moyen est passé de 820 ms pour le modèle de base à 980 ms pour l'ensemble du cadre, ce qui représente une augmentation modeste du temps de traitement (Tableau 5). La génération de la réponse a représenté la majeure partie de la latence totale, tandis que les étapes de vérification et de correction ont ajouté relativement peu de surcharge supplémentaire. La répartition du temps de traitement par étape est fournie dans le Tableau supplémentaire 3. Par rapport aux systèmes de vérification basés sur la récupération, qui nécessitaient environ 1600 ms par requête, le cadre proposé a permis une latence nettement plus faible tout en conservant une précision factuelle comparable. Ces résultats appuient l'hypothèse selon laquelle la réduction des hallucinations peut être obtenue sans nuire à l'utilisabilité en temps réel.
Étant donné que la génération de réponses repose sur un modèle linguistique basé sur le cloud, les mesures individuelles de latence sont sujettes à des fluctuations dues aux conditions du réseau et à l'ordonnancement côté serveur, plutôt qu'à un temps d'exécution déterministe. Des mesures répétées ont donc été utilisées afin d'obtenir des valeurs moyennes représentatives, réduisant ainsi l'influence de la variabilité transitoire de l'exécution tout en préservant les comparaisons relatives entre les méthodes évaluées. Les valeurs de latence sont indiquées comme des temps moyens d'exécution obtenus sur plusieurs répétitions expérimentales. Les valeurs individuelles de latence par exécution n'ont pas été conservées ; par conséquent, aucun calcul a posteriori de variance, d'intervalles de confiance ou d'autres mesures de variabilité n'a été possible. Ainsi, les valeurs de latence et la comparaison vitesse-précision dans la Figure 6 sont présentées sous forme d'estimations ponctuelles sans barres d'erreur.
En conclusion, les résultats ont démontré que la combinaison de l'extraction d'assertions, de la génération indépendante de références, de la vérification par inférence en langage naturel, du seuillage statistique adaptatif et de la correction sélective améliore la fiabilité factuelle des sorties des grands modèles linguistiques. Le cadre proposé a réduit le taux d'hallucination de 28 % à 9 % sur TruthfulQA et de 26 % à 10 % sur FEVER. Les résultats indiquent que la vérification adaptative au niveau des assertions améliore les métriques de fiabilité factuelle tout en limitant la latence supplémentaire de réponse dans les conditions évaluées.
Disponibilité des données
Les jeux de données analysés dans cette étude sont accessibles publiquement par l'intermédiaire de leurs sources officielles respectives. L'article fournit les informations sur les jeux de données, les configurations des modèles et les détails méthodologiques nécessaires pour permettre la reproduction des analyses décrites. Les données d'évaluation traitées et les résultats supplémentaires générés au cours de l'étude sont fournis dans les fichiers supplémentaires.

Figure 1 : Flux de travail du cadre adaptatif de vérification des affirmations. Une réponse initiale générée par un modèle linguistique de grande taille (LLM) est décomposée en affirmations factuelles, suivie par une génération indépendante de références, une vérification fondée sur l'inférence linguistique naturelle (NLI), une attribution de score de confiance et un seuil statistique. Les affirmations satisfaisant au critère d'acceptation sont conservées, tandis que celles satisfaisant au critère de correction subissent une correction ciblée avant l'assemblage final de la réponse. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 2: Effet du paramètre de sensibilité (k) sur la précision de la vérification. Précision sur TruthfulQA et FEVER pour des valeurs de k de 0,3, 0,5, 0,7 et 1,0. La précision augmente avec k sur les deux jeux de données, avec k = 0,7 sélectionné pour l'évaluation primaire. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 3 : Comparaison de la précision entre différentes méthodes de vérification. Précision du modèle linguistique de base, de la vérification fondée sur l'inférence linguistique naturelle (NLI) et du cadre de vérification adaptative proposé sur les jeux de données TruthfulQA et FEVER. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 4 : Comparaison des taux d'hallucination selon les méthodes de vérification. Taux d'hallucination pour le modèle LLM de base, la vérification fondée sur la NLI et le cadre proposé sur TruthfulQA et FEVER. Le cadre proposé réduit le taux de 28 % à 9 % sur TruthfulQA et de 26 % à 10 % sur FEVER. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 5 : Précision de la détection des hallucinations selon les différentes méthodes. Précision de détection de SelfCheckGPT, de FActScore et du cadre proposé sur TruthfulQA et FEVER. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 6 : Compromis entre temps de réponse et précision selon les méthodes de vérification. Relation entre la latence de réponse et la précision pour les méthodes évaluées sur TruthfulQA et FEVER, illustrant le compromis performance–latence associé au cadre proposé et aux approches comparatives. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
| Jeu de données | Échantillons utilisés | Domaines | Longueur moyenne de la réponse (tokens) | Taux de hallucination du LLM de référence |
| TruthfulQA | 817 | 38 (sciences, histoire, droit, etc.) | 42 | 28% |
| FEVER | 1 000 | Assertions factuelles générales | 18 | 26% |
Tableau 1 : Caractéristiques des ensembles de données de référence. Résumé des ensembles de données TruthfulQA et FEVER utilisés pour le développement et l'évaluation du cadre, incluant le nombre d'échantillons, la précision de base, le taux de hallucination de base et le nombre moyen d'affirmations par échantillon.
| Méthode | Exactitude | Précision | Rappel | Score F1 | Pourcentage d'hallucinations |
| Modèle de base (inférence unique) | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| Vérification basée sur la NLI (seuil fixe) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| SelfCheckGPT | 0.76 | 0.755 | 0.725 | 0.74 | 22% |
| FActScore | 0.85 | 0.8425 | 0.8175 | 0.83 | 11% |
| Cadre proposé (seuil statistique) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
Tableau 2 : Comparaison des performances sur TruthfulQA. Précision, exactitude, rappel, score F1 et taux d’hallucinations pour le modèle LLM de référence, SelfCheckGPT, FActScore, la vérification NLI et le cadre proposé.
| Méthode | Précision | Exactitude | Rappel | Score F1 | Proportion d'hallucinations |
| SelfCheckGPT | 0.78 | — | — | — | — |
| FActScore | 0.87 | — | — | — | — |
| Modèle de base LLM† | 0.74 | 0.73 | 0.71 | 0.72 | 26% |
| Vérification basée sur l'inférence naturelle (seuil fixe) | 0.83 | 0.8225 | 0.7975 | 0.81 | 14% |
| Cadre proposé (seuil statistique) | 0.89 | 0.8775 | 0.8625 | 0.87 | 10% |
Tableau 3 : Comparaison des performances sur FEVER. Précision, exactitude, rappel, score F1 et taux d'hallucination pour le modèle de langage de base, SelfCheckGPT, FActScore, la vérification NLI et le cadre proposé.
| Configuration | Précision | Exactitude | Rappel | F1 (ajouté) | Taux d'hallucination |
| Modèle linguistique de base | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| Base + Vérification secondaire (sans NLI) | 0.78 | 0.7725 | 0.7475 | 0.76* | 20% |
| Base + Vérification basée sur NLI (seuil fixe) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| Base + Module décisionnel statistique (complet) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
Tableau 4 : Analyse d'ablation des composants du cadre méthodologique. Variations du taux de précision, du score F1 et du taux d'hallucination suite à l'intégration séquentielle de la validation secondaire, de la vérification par inférence naturelle (NLI) et du seuil statistique adaptatif.
| Méthode | Temps de réponse moyen (ms) |
| LLM de référence (génération unique) | 820 |
| Mécanisme d'auto-validation | 910 |
| Cadre statistique proposé | 980 |
| Vérification augmentée par récupération (RAG) | 1600 |
Tableau 5 : Latence de réponse selon les méthodes de vérification. Temps moyen de réponse et latence supplémentaire par rapport au modèle linguistique de base pour l'auto-validation, le cadre proposé et la vérification augmentée par récupération.
Tableau supplémentaire 1 : Comparaison des approches de vérification des hallucinations. Comparaison du cadre proposé avec les méthodes existantes en termes de récupération externe, de vérification au niveau des affirmations, de seuil adaptatif et de traitement efficace en matière de latence.Veuillez cliquer ici pour télécharger ce fichier.
Tableau supplémentaire 2 : Analyse de sensibilité du paramètre seuil (k). La précision, la justesse, le rappel, le score F1 et le taux d'hallucination ont été obtenus pour des valeurs du paramètre seuil de 0,3, 0,5, 0,7 et 1,0. Une valeur de k = 0,7 a été utilisée pour l'évaluation principale.Veuillez cliquer ici pour télécharger ce fichier.
Tableau supplémentaire 3 : Temps de traitement aux différentes étapes du pipeline de vérification. Temps d'exécution moyen et contribution en pourcentage de la génération initiale de la réponse, de la décomposition de l'affirmation, de la génération de références, de l'inférence NLI et de la correction sélective au temps total de réponse.Veuillez cliquer ici pour télécharger ce fichier.
Tableau supplémentaire 4 : Répartition des erreurs identifiées lors de la vérification. Nombre et pourcentage d'erreurs de faux négatifs, de faux positifs et d'erreurs de correction, ainsi que les catégories principales d'hallucinations associées à chaque type d'erreur.Veuillez cliquer ici pour télécharger ce fichier.