Génération de la réponse initiale
Le modèle linguistique de base a produit des réponses fluides et contextuellement pertinentes aux questions des deux ensembles de données de référence. Toutefois, un examen détaillé a révélé des affirmations non étayées et factuellement inexactes dans plusieurs réponses. Sur l'ensemble de données TruthfulQA, le système de base a présenté un taux d'hallucination de 28 %, tandis qu'un taux d'hallucination de 26 % a été observé sur l'ensemble de données FEVER. Ces résultats ont confirmé que la génération linguistique directe seule était insuffisante pour des applications exigeant une grande fiabilité factuelle, et ont établi la condition de base par rapport à laquelle toutes les procédures de vérification ultérieures ont été comparées.
Extraction des affirmations
La procédure d'extraction des affirmations a correctement décomposé les réponses générées en unités factuelles vérifiables indépendamment. Les réponses provenant de TruthfulQA contenaient en moyenne 3,2 affirmations atomiques, tandis que les échantillons de FEVER se composaient généralement d'une seule affirmation. Le processus de décomposition a isolé les assertions factuelles sans introduire d'informations supplémentaires, permettant ainsi d'évaluer chaque énoncé séparément. Cette observation soutient l'hypothèse selon laquelle la vérification au niveau des affirmations offre une précision supérieure à celle de l'évaluation de l'ensemble des réponses comme une seule unité.
Construction d'une référence indépendante
Des références indépendantes ont été générées pour chaque affirmation extraite à l’aide d’un processus de raisonnement distinct, conditionné uniquement sur la requête initiale. Les références générées fournissaient des descriptions factuelles concises, suffisamment différentes des réponses initiales pour servir de sources de vérification indépendantes. Le processus de génération des références a été isolé de la réponse initiale afin d’éviter de conditionner directement la référence factuelle sur la sortie précédente du modèle. Cette séparation visait à réduire les biais de confirmation potentiels et à offrir une base contrôlée pour la vérification ultérieure au niveau des affirmations ; l’étude ne quantifie pas indépendamment l’ampleur de cet effet. La génération réussie de références indépendantes appuie le principe de conception proposé, qui consiste à séparer la récupération des connaissances de la génération des réponses.
Vérification de l'inférence en langage naturel
L'étape de vérification NLI a permis de classer efficacement les paires affirmation-référence en catégories d'inférence, de contradiction et de neutralité. Les affirmations contradictoires ont systématiquement obtenu des scores de vérification négatifs, tandis que les affirmations factuellement étayées ont reçu des scores positifs. Les classifications neutres ont été attribuées aux affirmations pour lesquelles aucune preuve suffisante n'était disponible. Ce comportement a démontré que l'inférence sémantique pouvait identifier de manière fiable les énoncés factuels non étayés et fournir les éléments probants nécessaires à une correction ciblée. Par rapport à une stratégie simple de vérification de cohérence, la vérification NLI a réduit le taux d'hallucinations de 20 % à 15 %, indiquant une capacité améliorée de détection.
Seuillage statistique adaptatif
L'application d'un seuillage statistique adaptatif a encore amélioré les performances de vérification en ajustant dynamiquement les frontières de décision en fonction de la distribution des scores de confiance de chaque réponse. L'analyse de sensibilité du seuil a montré que les performances s'amélioraient lorsque le paramètre de seuil augmentait de 0,3 à 0,7. Pour une valeur de sensibilité de 0,7, le cadre atteignait une exactitude de 0,87 tout en réduisant les hallucinations à 9 % (Figure 2). Les résultats complets de l'analyse de sensibilité pour les valeurs évaluées de k sont fournis dans le Tableau supplémentaire 2. Une augmentation du seuil au-delà de ce point n'apportait que des gains minimes en termes d'exactitude tout en augmentant la latence. Ces observations confirmaient l'hypothèse selon laquelle des seuils adaptatifs sont plus efficaces que des frontières de décision fixes pour gérer les distributions variables de confiance entre les réponses.
Le seuil adaptatif reflète également la variabilité des scores de confiance au sein de chaque réponse. Les réponses présentant des scores de vérification très cohérents produisent un écart type plus faible, ce qui conduit à une frontière de décision plus sélective. En revanche, les réponses contenant des affirmations ayant des valeurs de confiance hétérogènes entraînent un écart type plus élevé, aboutissant à une zone d'acceptation plus large et réduisant ainsi les corrections inutiles pour les affirmations incertaines. Bien que ce comportement adaptatif ne puisse éliminer chaque faux positif ou faux négatif, il permet à la frontière de décision de s'ajuster aux caractéristiques d'incertitude de chaque réponse, plutôt que d'appliquer un critère uniforme à toutes les entrées.
Correction sélective des revendications et assemblage de la réponse
Seules les affirmations identifiées comme contradictoires ont été soumises à une correction, tandis que les affirmations corroborées et neutres ont été conservées inchangées. Cette stratégie de correction sélective a minimisé la régénération inutile et préservé la structure originale de la réponse. Après correction et reconstruction de la réponse, le taux d'hallucinations sur TruthfulQA est passé de 28 % à 9 %, représentant une réduction relative de 67,9 %. Des améliorations similaires ont été observées sur FEVER, où les hallucinations sont passées de 26 % à 10 %. Les comparaisons de précision et de taux d'hallucinations entre les configurations évaluées sont présentées respectivement dans les Figures 3 et 4.
Évaluation des performances
L'évaluation comparative a montré que le cadre proposé atteignait la performance globale la plus élevée parmi toutes les méthodes testées. Sur TruthfulQA, le cadre a atteint une exactitude de 0,87 et un score F1 de 0,85, surpassant à la fois la vérification à seuil fixe et les approches fondées sur l'auto-cohérence (Tableau 2, Figures 3 et 4). Sur FEVER, le cadre a atteint une exactitude de 0,89 et un score F1 de 0,87 (Tableau 3, Figures 3 et 4). La contribution progressive des composants du cadre est examinée au moyen de l'analyse d'ablation présentée dans le Tableau 4. Ces améliorations ont confirmé que la combinaison de la vérification au niveau des affirmations avec une prise de décision statistique adaptative améliorait la fiabilité factuelle sur plusieurs ensembles de données. La précision de détection des hallucinations pour SelfCheckGPT, FActScore et le cadre proposé est comparée dans la Figure 5.
Analyse de la latence
Le pipeline complet de vérification a maintenu une surcharge de calcul faible. Le temps de réponse moyen est passé de 820 ms pour le modèle de référence à 980 ms pour l'ensemble du cadre, ce qui représente une augmentation modeste du temps de traitement (Tableau 5). La génération de la réponse a représenté la majeure partie de la latence totale, tandis que les étapes de vérification et de correction ont ajouté relativement peu de surcharge supplémentaire. La répartition du temps de traitement par étape est fournie dans le Tableau supplémentaire 3. Par rapport aux systèmes de vérification basés sur la récupération, qui nécessitaient environ 1600 ms par requête, le cadre proposé a permis une latence nettement plus faible tout en conservant une exactitude factuelle comparable. Ces résultats confirment l'hypothèse selon laquelle la réduction des hallucinations peut être obtenue sans compromettre l'usabilité en temps réel.
Étant donné que la génération de réponses repose sur un modèle de langage basé sur le cloud, les mesures individuelles de latence sont sujettes à des fluctuations dues aux conditions du réseau et à l'ordonnancement côté serveur, plutôt qu'à un temps d'exécution déterministe. Des mesures répétées ont donc été utilisées afin d'obtenir des valeurs moyennes représentatives, réduisant ainsi l'influence de la variabilité transitoire de l'exécution tout en préservant les comparaisons relatives entre les méthodes évaluées. Les valeurs de latence sont indiquées comme des temps moyens d'exécution sur plusieurs répétitions des expériences. Les valeurs individuelles de latence par exécution n'ont pas été conservées ; par conséquent, aucun calcul a posteriori de variance, d'intervalles de confiance ou d'autres mesures de variabilité n'a été possible. En conséquence, les valeurs de latence et la comparaison vitesse-précision dans la Figure 6 sont présentées sous forme d'estimations ponctuelles sans barres d'erreur.
En conclusion, les résultats ont démontré que la combinaison de l'extraction d'affirmations, de la génération indépendante de références, de la vérification par inférence en langage naturel, du seuillage statistique adaptatif et de la correction sélective améliorait la fiabilité factuelle des sorties des grands modèles linguistiques. Le cadre proposé a réduit le taux d'hallucinations de 28 % à 9 % sur TruthfulQA et de 26 % à 10 % sur FEVER. Les résultats indiquent qu'une vérification adaptative au niveau des affirmations améliore les métriques de fiabilité factuelle tout en limitant l'augmentation de la latence de réponse dans les conditions évaluées.
Disponibilité des données
Les jeux de données analysés dans cette étude sont accessibles publiquement via leurs sources officielles respectives. Le manuscrit fournit les informations sur les jeux de données, les configurations des modèles et les détails méthodologiques nécessaires pour permettre la réplication des analyses décrites. Les données d'évaluation traitées et les résultats supplémentaires générés au cours de l'étude sont fournis dans les fichiers supplémentaires.

Figure 1 : Flux de travail du cadre adaptatif de vérification des affirmations. Une réponse initiale générée par un LLM est décomposée en affirmations factuelles, puis fait l'objet d'une génération indépendante de références, d'une vérification fondée sur l'inférence naturelle (NIL), d'une attribution de niveau de confiance et d'un seuil statistique. Les affirmations satisfaisant au critère d'acceptation sont conservées, tandis que celles répondant au critère de correction subissent une correction ciblée avant l'assemblage final de la réponse. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 2: Effet du paramètre de sensibilité (k) sur la précision de la vérification. Précision sur TruthfulQA et FEVER pour des valeurs de k de 0,3, 0,5, 0,7 et 1,0. La précision augmente avec k sur les deux jeux de données, avec k = 0,7 sélectionné pour l'évaluation primaire. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 3 : Comparaison de la précision entre les méthodes de vérification. Précision du modèle de langage de base, de la vérification fondée sur le NLI et du cadre de vérification adaptative proposé sur TruthfulQA et FEVER. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 4 : Comparaison des taux d'hallucination selon différentes méthodes de vérification. Taux d'hallucination pour le modèle de langage de base, la vérification fondée sur la NLI et le cadre proposé, appliqués à TruthfulQA et FEVER. Le cadre proposé a réduit le taux de 28 % à 9 % sur TruthfulQA et de 26 % à 10 % sur FEVER. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 5 : Précision de la détection des hallucinations selon les différentes méthodes. Précision de détection de SelfCheckGPT, de FActScore et du cadre proposé sur les ensembles de données TruthfulQA et FEVER. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 6 : Compromis entre le temps de réponse et la précision selon les méthodes de vérification. Relation entre la latence de réponse et la précision pour les méthodes évaluées sur TruthfulQA et FEVER, illustrant le compromis performance–latence associé au cadre proposé et aux approches comparatives. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
| Jeu de données | Échantillons utilisés | Domaines | Longueur moyenne de la réponse (tokens) | Taux de hallucination du LLM de référence |
| TruthfulQA | 817 | 38 (sciences, histoire, droit, etc.) | 42 | 28% |
| FEVER | 1 000 | Affirmations factuelles générales | 18 | 26% |
Tableau 1 : Caractéristiques des ensembles de données de référence. Résumé des ensembles de données TruthfulQA et FEVER utilisés pour le développement et l'évaluation du cadre, incluant le nombre d'échantillons, la précision de base, le taux de hallucination de base et le nombre moyen d'affirmations par échantillon.
| Méthode | Exactitude | Précision | Rappel | Score F1 | Pourcentage d'hallucinations |
| Modèle de langage de base (inférence unique) | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| Vérification basée sur la NLI (seuil fixe) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| SelfCheckGPT | 0.76 | 0.755 | 0.725 | 0.74 | 22% |
| FActScore | 0.85 | 0.8425 | 0.8175 | 0.83 | 11% |
| Cadre proposé (seuil statistique) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
Tableau 2 : Comparaison des performances sur TruthfulQA. Exactitude, précision, rappel, score F1 et taux d’hallucinations pour le modèle de langage de base, SelfCheckGPT, FActScore, la vérification NLI et le cadre proposé.
| Méthode | Exactitude | Précision | Rappel | Score F1 | Pourcentage d'hallucinations |
| SelfCheckGPT | 0.78 | — | — | — | — |
| FActScore | 0.87 | — | — | — | — |
| Modèle de base LLM† | 0.74 | 0.73 | 0.71 | 0.72 | 26% |
| Vérification basée sur NLI (seuil fixe) | 0.83 | 0.8225 | 0.7975 | 0.81 | 14% |
| Cadre proposé (seuil statistique) | 0.89 | 0.8775 | 0.8625 | 0.87 | 10% |
Tableau 3 : Comparaison des performances sur FEVER. Exactitude, précision, rappel, score F1 et taux d'hallucinations pour le modèle LLM de référence, SelfCheckGPT, FActScore, la vérification NLI et le cadre proposé.
| Configuration | Précision | Exactitude | Rappel | F1 (ajouté) | Taux d'hallucination |
| Modèle linguistique de base | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| Base + Vérification secondaire (sans NLI) | 0.78 | 0.7725 | 0.7475 | 0.76* | 20% |
| Base + Vérification basée sur NLI (seuil fixe) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| Base + Module de décision statistique (complet) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
Tableau 4 : Analyse d'ablation des composants du cadre. Évolutions de la précision, du score F1 et du taux d'hallucination suite à l'intégration séquentielle de la validation secondaire, de la vérification NLI et du seuil statistique adaptatif.
| Méthode | Temps de réponse moyen (ms) |
| LLM de base (génération unique) | 820 |
| Mécanisme d'auto-validation | 910 |
| Cadre statistique proposé | 980 |
| Vérification assistée par récupération (RAG) | 1600 |
Tableau 5 : Latence de réponse selon les méthodes de vérification. Temps de réponse moyen et latence supplémentaire par rapport au modèle de langage de base pour l'auto-validation, le cadre proposé et la vérification augmentée par récupération.
Tableau supplémentaire 1 : Comparaison des approches de vérification des hallucinations. Comparaison du cadre proposé avec les méthodes existantes en termes de récupération externe, de vérification au niveau des affirmations, de seuil adaptatif et de traitement efficace en termes de latence.Veuillez cliquer ici pour télécharger ce fichier.
Tableau supplémentaire 2 : Analyse de sensibilité du paramètre seuil (k). La précision, l'exactitude, le rappel, le score F1 et le taux d'hallucination ont été obtenus pour des valeurs du paramètre seuil de 0,3, 0,5, 0,7 et 1,0. Une valeur de k = 0,7 a été utilisée pour l'évaluation principale.Veuillez cliquer ici pour télécharger ce fichier.
Tableau supplémentaire 3 : Temps de traitement aux différentes étapes du pipeline de vérification. Temps d'exécution moyen et contribution en pourcentage de la génération initiale de la réponse, de la décomposition de l'affirmation, de la génération de références, de l'inférence NLI et de la correction sélective au temps total de réponse.Veuillez cliquer ici pour télécharger ce fichier.
Tableau supplémentaire 4 : Répartition des erreurs identifiées lors de la vérification. Nombre et pourcentage d'erreurs de faux négatifs, de faux positifs et d'erreurs de correction, ainsi que les catégories principales d'hallucinations associées à chaque type d'erreur.Veuillez cliquer ici pour télécharger ce fichier.