Generowanie wstępnej odpowiedzi
Bazowy model językowy generował płynne i kontekstowo dopasowane odpowiedzi na pytania z obu zbiorów danych benchmarkowych. Jednak szczegółowa analiza ujawniła niepoparte dowodami i niezgodne z faktami stwierdzenia w kilku odpowiedziach. W zbiorze danych TruthfulQA system bazowy wykazał wskaźnik halucynacji na poziomie 28%, natomiast w zbiorze danych FEVER zaobserwowano wskaźnik halucynacji wynoszący 26%. Wyniki te potwierdziły, że bezpośrednie generowanie tekstu jest niewystarczające w zastosowaniach wymagających wysokiej wiarygodności faktograficznej i ustanowiły warunki bazowe, z którymi porównywano wszystkie kolejne procedury weryfikacyjne.
Ekstrakcja twierdzeń
Procedura ekstrakcji twierdzeń pomyślnie rozbiła wygenerowane odpowiedzi na niezależnie weryfikowalne jednostki faktyczne. Odpowiedzi z TruthfulQA zawierały średnio 3,2 twierdzenia atomowych, podczas gdy próbki z FEVER zazwyczaj składały się z pojedynczego twierdzenia. Proces dekompozycji wyizolował stwierdzenia faktyczne bez wprowadzania dodatkowych informacji, co pozwoliło na oddzielną ocenę każdego z nich. Obserwacja ta potwierdziła hipotezę, że weryfikacja na poziomie twierdzeń zapewnia większą precyzję niż ocenianie całych odpowiedzi jako jednej jednostki.
Niezależna konstrukcja referencyjna
Dla każdego wyodrębnionego twierdzenia wygenerowano niezależne odniesienia, stosując oddzielny proces rozumowania uwarunkowany wyłącznie oryginalnym zapytaniem. Wygenerowane odniesienia zawierały zwięzłe opisy faktów, które były na tyle odrębne od pierwotnych odpowiedzi, aby mogły służyć jako niezależne źródła weryfikacji. Proces generowania odniesień został odizolowany od początkowej odpowiedzi, aby uniknąć bezpośredniego uwarunkowania faktograficznego odniesienia wcześniejszym wynikiem modelu. Separacja ta miała na celu ograniczenie potencjalnego błędu potwierdzenia i zapewnienie kontrolowanej podstawy do późniejszej weryfikacji na poziomie poszczególnych twierdzeń; badanie nie określa niezależnie zakresu tego efektu. Pomyślne wygenerowanie niezależnych odniesień potwierdziło zaproponowaną zasadę projektową, polegającą na oddzieleniu przywoływania wiedzy od generowania odpowiedzi.
Weryfikacja wnioskowania w języku naturalnym
Etap weryfikacji NLI skutecznie zaklasyfikował pary twierdzenie-referencja do kategorii wynikania, sprzeczności oraz neutralności. Twierdzenia sprzeczne konsekwentnie otrzymywały negatywne wyniki weryfikacji, podczas gdy twierdzenia poparte faktami otrzymywały wyniki pozytywne. Klasyfikacje neutralne przypisywano twierdzeniom, dla których dostępne były niewystarczające dowody wspierające. Takie zachowanie wykazało, że wnioskowanie semantyczne może wiarygodnie identyfikować niepoparte dowodami stwierdzenia faktyczne i dostarczyło dowodów niezbędnych do ukierunkowanej korekty. W porównaniu ze zwykłą strategią sprawdzania spójności, weryfikacja NLI obniżyła wskaźnik halucynacji z 20% do 15%, co wskazuje na poprawę zdolności detekcji.
Adaptacyjne progowanie statystyczne
Zastosowanie adaptacyjnego progowania statystycznego dodatkowo poprawiło wydajność weryfikacji poprzez dynamiczne dostosowywanie granic decyzyjnych w oparciu o rozkład wyników pewności każdej odpowiedzi. Analiza czułości progu wykazała, że wydajność wzrosła wraz ze zwiększeniem parametru progu z 0,3 do 0,7. Przy wartości czułości 0,7 system osiągnął dokładność na poziomie 0,87, jednocześnie redukując liczbę halucynacji do 9% (Rysunek 2). Pełne wyniki analizy czułości dla ocenianych wartości k znajdują się w Tabeli uzupełniającej 2. Zwiększenie progu powyżej tej wartości przyniosło jedynie niewielkie zyski w dokładności, zwiększając jednocześnie opóźnienie. Obserwacje te potwierdziły hipotezę, że progi adaptacyjne są bardziej skuteczne niż stałe granice decyzyjne w obsłudze zmiennych rozkładów pewności w różnych odpowiedziach.
Adaptacyjny próg odzwierciedla również zmienność wyników pewności w obrębie każdej odpowiedzi. Odpowiedzi z wysoce spójnymi wynikami weryfikacji generują mniejsze odchylenie standardowe, co prowadzi do bardziej selektywnej granicy decyzyjnej. W przeciwieństwie do nich, odpowiedzi zawierające twierdzenia o niejednorodnych wartościach pewności dają większe odchylenie standardowe, co skutkuje szerszym obszarem akceptacji i redukcją niepotrzebnych korekt dla niepewnych twierdzeń. Choć takie adaptacyjne zachowanie nie może wyeliminować każdego wyniku fałszywie dodatniego lub fałszywie ujemnego, pozwala ono granicy decyzyjnej reagować na charakterystykę niepewności każdej odpowiedzi, zamiast stosować jednolity kryterium dla wszystkich danych wejściowych.
Selektywna korekta roszczeń i opracowywanie odpowiedzi
Do korekty przekazano jedynie twierdzenia zidentyfikowane jako sprzeczne, natomiast twierdzenia potwierdzone i neutralne pozostawiono bez zmian. Ta selektywna strategia korekty zminimalizowała niepotrzebną regenerację i zachowała oryginalną strukturę odpowiedzi. Po korekcie i rekonstrukcji odpowiedzi wskaźnik halucynacji w zestawie TruthfulQA spadł z 28% do 9%, co stanowi względną redukcję o 67,9%. Podobną poprawę zaobserwowano w zestawie FEVER, gdzie halucynacje zmniejszyły się z 26% do 10%. Porównania dokładności i wskaźnika halucynacji dla ocenianych konfiguracji przedstawiono odpowiednio na Rysunkach 3 i 4.
Ocena wydajności
Ocena porównawcza wykazała, że zaproponowany system osiągnął najwyższą ogólną wydajność spośród wszystkich testowanych metod. W zbiorze TruthfulQA system uzyskał dokładność na poziomie 0,87 oraz wynik F1 wynoszący 0,85, przewyższając zarówno weryfikację z ustalonym progiem, jak i podejścia oparte na samospójności (Tabela 2, Ryciny 3 i 4). W zbiorze FEVER system osiągnął dokładność 0,89 oraz wynik F1 równy 0,87 (Tabela 3, Ryciny 3 i 4). Przyrostowy wkład poszczególnych komponentów systemu zbadzano w analizie ablacyjnej przedstawionej w Tabeli 4. Udoskonaleń tych potwierdzono, że połączenie weryfikacji na poziomie twierdzeń z adaptacyjnym statystycznym podejmowaniem decyzji zwiększyło rzetelność faktograficzną w wielu zbiorach danych. Dokładność wykrywania halucynacji dla SelfCheckGPT, FActScore oraz zaproponowanego systemu porównano na Rycini 5.
Analiza czasu utajenia
Kompletny potok weryfikacji charakteryzował się niskim obciążeniem obliczeniowym. Średni czas odpowiedzi wzrósł z 820 ms dla modelu bazowego do 980 ms dla pełnego frameworka, co stanowi niewielki wzrost czasu przetwarzania (Tabela 5). Generowanie odpowiedzi odpowiadało za większość całkowitego opóźnienia, podczas gdy etapy weryfikacji i korekty wnosiły stosunkowo niewielkie dodatkowe obciążenie. Szczegółowy podział czasu przetwarzania na poszczególnych etapach znajduje się w Tabeli uzupełniającej 3. W porównaniu z systemami weryfikacji opartymi na wyszukiwaniu, które wymagały około 1600 ms na zapytanie, proponowany framework osiągnął znacznie niższe opóźnienie, zachowując porównywalną dokładność faktograficzną. Wyniki te potwierdziły hipotezę, że redukcję halucynacji można osiągnąć bez poświęcania użyteczności w czasie rzeczywistym.
Ponieważ generowanie odpowiedzi opiera się na modelu językowym w chmurze, poszczególne pomiary opóźnień podlegają wahaniom wynikającym z warunków sieciowych i harmonogramowania po stronie serwera, a nie deterministycznemu czasowi wykonania. W związku z tym zastosowano pomiary powtórzone w celu uzyskania reprezentatywnych wartości średnich, co pozwoliło ograniczyć wpływ przejściowej zmienności wykonania przy zachowaniu możliwości porównań relatywnych między ocenianymi metodami. Wartości opóźnień przedstawiono jako średnie czasy wykonania z powtórzonych serii eksperymentalnych. Poszczególne wartości opóźnień dla każdej serii nie zostały zachowane, w związku z czym obliczenie wariancji, przedziałów ufności lub innych miar zmienności post hoc nie było możliwe. Odpowiednio, wartości opóźnień oraz porównanie szybkości i dokładności na Rysunku 6 są przedstawione jako estymacje punktowe bez słupków błędu.
Podsumowując, wyniki wykazały, że połączenie ekstrakcji twierdzeń, niezależnego generowania referencji, weryfikacji za pomocą wnioskowania w języku naturalnym (Natural Language Inference), adaptacyjnego progowania statystycznego oraz selektywnej korekty poprawiło wiarygodność faktyczną wyników generowanych przez duże modele językowe. Zastosowana struktura zredukowała poziom halucynacji z 28% do 9% w zestawie TruthfulQA oraz z 26% do 10% w zestawie FEVER. Wyniki wskazują, że adaptacyjna weryfikacja na poziomie poszczególnych twierdzeń poprawiła wskaźniki wiarygodności faktycznej, ograniczając jednocześnie dodatkowe opóźnienie w generowaniu odpowiedzi w ocenianych warunkach
Dostępność danych
Zbiory danych analizowane w niniejszym badaniu są ogólnodostępne poprzez ich odpowiednie oficjalne źródła. Rękopis zawiera informacje o zbiorach danych, konfiguracjach modeli oraz szczegóły metodologiczne niezbędne do replikacji opisanych analiz. Przetworzone dane ewaluacyjne i wyniki uzupełniające wygenerowane podczas badania znajdują się w Plikach Uzupełniających.

Rycina 1: Przepływ pracy w adaptacyjnym systemie weryfikacji twierdzeń. Początkowa odpowiedź wygenerowana przez LLM jest rozkładana na twierdzenia faktyczne, po czym następuje niezależne generowanie referencji, weryfikacja oparta na NLI, punktacja pewności oraz statystyczna analiza progowa. Twierdzenia spełniające kryterium akceptacji są zachowywane, natomiast twierdzenia spełniające kryterium korekty podlegają ukierunkowanej poprawie przed końcowym złożeniem odpowiedzi. Kliknij tutaj, aby zobaczyć powiększoną wersję tej ryciny.

Rysunek 2: Wpływ parametru czułości (k) na dokładność weryfikacji. Dokładność dla TruthfulQA i FEVER przy wartościach k wynoszących 0.3, 0.5, 0.7 i 1.0. Dokładność wzrastała wraz ze wzrostem k w obu zbiorach danych, przy czym do głównej ewaluacji wybrano k = 0.7. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rysunek 3: Porównanie dokładności różnych metod weryfikacji. Dokładność bazowego modelu LLM, weryfikacji opartej na NLI oraz proponowanego adaptacyjnego systemu weryfikacji w zbiorach TruthfulQA i FEVER. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rysunek 4: Porównanie wskaźników halucynacji w zależności od metod weryfikacji. Wskaźniki halucynacji dla bazowego modelu LLM, weryfikacji opartej na NLI oraz proponowanej architektury w zbiorach TruthfulQA i FEVER. Proponowana architektura zredukowała wskaźnik z 28% do 9% w TruthfulQA oraz z 26% do 10% w FEVER. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rycina 5: Dokładność wykrywania halucynacji w różnych metodach. Dokładność wykrywania dla SelfCheckGPT, FActScore oraz proponowanej architektury na zbiorach TruthfulQA i FEVER. Proszę kliknąć tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rysunek 6Kompromis między czasem odpowiedzi a dokładnością w różnych metodach weryfikacji. Zależność między latencją odpowiedzi a dokładnością dla ocenianych metod w zbiorach TruthfulQA i FEVER, ilustrująca kompromis między wydajnością a latencją w przypadku proponowanego frameworku oraz podejść porównawczych. Kliknij tutaj, aby wyświetlić powiększoną wersję tej figury.
| Zbiór danych | Wykorzystane próbki | Dziedziny | Średnia długość odpowiedzi (tokeny) | Bazowy wskaźnik halucynacji LLM |
| TruthfulQA | 817 | 38 (nauka, historia, prawo itd.) | 42 | 28% |
| GORĄCZKA | 1,000 | Ogólne twierdzenia faktyczne | 18 | 26% |
Tabela 1: Charakterystyka zestawu danych referencyjnych. Podsumowanie zbiorów danych TruthfulQA i FEVER wykorzystanych do opracowania i oceny frameworka, zawierające liczbę próbek, dokładność bazową, bazowy wskaźnik halucynacji oraz średnią liczbę twierdzeń na próbkę.
| Metoda | Dokładność | Precyzja | Czułość | Wskaźnik F1 | % halucynacji |
| Bazowy model LLM (pojedyncza inferencja) | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| Weryfikacja w oparciu o NLI (stały próg) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| SelfCheckGPT | 0.76 | 0.755 | 0.725 | 0.74 | 22% |
| FActScore | 0.85 | 0.8425 | 0.8175 | 0.83 | 11% |
| Proponowany model (próg statystyczny) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
Tabela 2: Porównanie wydajności w zbiorze TruthfulQA. Dokładność (accuracy), precyzja (precision), pełność (recall), wynik F1 oraz wskaźnik halucynacji dla bazowego modelu LLM, SelfCheckGPT, FActScore, weryfikacji NLI oraz proponowanego modelu.
| Metoda | Dokładność | Precyzja | Czułość | Wskaźnik F1 | % halucynacji |
| SelfCheckGPT | 0.78 | — | — | — | — |
| FActScore | 0.87 | — | — | — | — |
| Bazowy model LLM† | 0.74 | 0.73 | 0.71 | 0.72 | 26% |
| Weryfikacja w oparciu o NLI (stały próg) | 0.83 | 0.8225 | 0.7975 | 0.81 | 14% |
| Proponowane ramy (próg statystyczny) | 0.89 | 0.8775 | 0.8625 | 0.87 | 10% |
Tabela 3: Porównanie wydajności w zbiorze FEVER. Dokładność, precyzja, pełność, wynik F1 oraz wskaźnik halucynacji dla bazowego modelu LLM, SelfCheckGPT, FActScore, weryfikacji NLI oraz proponowanego frameworku.
| Konfiguracja | Dokładność | Precyzja | Czułość | F1 (dodano) | Współczynnik halucynacji |
| Bazowy model językowy | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| Poziom podstawowy + kontrola wtórna (bez NLI) | 0.78 | 0.7725 | 0.7475 | 0.76* | 20% |
| Baseline + weryfikacja oparta na NLI (stały próg) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| Baseline + Moduł Decyzji Statystycznej (Pełny) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
Tabela 4: Analiza ablacyjna komponentów strukturalnych. Zmiany dokładności, wyniku F1 oraz wskaźnika halucynacji po sekwencyjnym wprowadzeniu wtórnej walidacji, weryfikacji NLI oraz adaptacyjnego progowania statystycznego.
| Metoda | Średni czas reakcji (ms) |
| Podstawowy model LLM (pojedyncze generowanie) | 820 |
| Mechanizm samowalidacji | 910 |
| Proponowane ramy statystyczne | 980 |
| Weryfikacja z wzmocnieniem wyszukiwania (RAG) | 1600 |
Tabela 5: Opóźnienie odpowiedzi w zależności od metody weryfikacji. Średni czas odpowiedzi oraz dodatkowe opóźnienie w stosunku do bazowego modelu LLM dla Self-Validation (proponowanego frameworka) oraz weryfikacji z rozszerzoną możliwością wyszukiwania (retrieval-augmented verification).
Tabela uzupełniająca 1: Porównanie podejść do weryfikacji halucynacji. Porównanie proponowanego frameworka z istniejącymi metodami pod kątem zewnętrznego wyszukiwania informacji, weryfikacji na poziomie twierdzeń, adaptacyjnego progowania oraz przetwarzania z niskimi opóźnieniami.Kliknij tutaj, aby pobrać ten plik.
Tabela uzupełniająca 2: Analiza czułości parametru progowego (k). Dokładność, precyzja, pełność, wynik F1 oraz wskaźnik halucynacji uzyskano dla wartości parametru progowego wynoszących 0.3, 0.5, 0.7 i 1.0. Do głównej oceny wykorzystano wartość k = 0.7.Prosimy kliknąć tutaj, aby pobrać ten plik.
Tabela uzupełniająca 3: Czas przetwarzania w poszczególnych etapach potoku weryfikacyjnego. Średni czas wykonania i procentowy udział początkowego generowania odpowiedzi, dekompozycji twierdzeń, generowania referencji, wnioskowania NLI oraz selektywnej korekty w całkowitym czasie odpowiedzi.Kliknij tutaj, aby pobrać ten plik.
Tabela uzupełniająca 4: Rozkład błędów zidentyfikowanych podczas weryfikacji. Liczba i procent fałszywie ujemnych, fałszywie dodatnich oraz błędów korekty, wraz z głównymi kategoriami halucynacji powiązanymi z każdym typem błędu.Proszę kliknąć tutaj, aby pobrać ten plik.