İlk yanıt oluşturma
Temel dil modeli, her iki kıyaslama veri setindeki sorular için akıcı ve bağlamsal olarak ilgili yanıtlar üretmiştir. Ancak, ayrıntılı bir inceleme, çeşitli yanıtlarda desteklenmeyen ve olgusal olarak yanlış ifadeler olduğunu ortaya çıkarmıştır. TruthfulQA veri setinde temel sistem %28'lik bir halüsinasyon oranı sergilerken, FEVER veri setinde %26'lık bir halüsinasyon oranı gözlemlenmiştir. Bu bulgular, yalnızca doğrudan dil üretiminin yüksek olgusal güvenilirlik gerektiren uygulamalar için yetersiz olduğunu doğrulamış ve sonraki tüm doğrulama prosedürlerinin karşılaştırıldığı temel durumu belirlemiştir.
İddia çıkarımı
İddia çıkarma prosedürü, oluşturulan yanıtları başarıyla bağımsız olarak doğrulanabilir olgusal birimlere ayrıştırmıştır. TruthfulQA'dan gelen yanıtlar ortalama 3,2 atomik iddia içerirken, FEVER örnekleri genellikle tek bir iddiadan oluşmuştur. Ayrıştırma işlemi, ek bilgi eklemeden olgusal iddiaları izole ederek her bir ifadenin ayrı ayrı değerlendirilmesine olanak sağlamıştır. Bu gözlem, iddia düzeyindeki doğrulamanın, yanıtların tamamını tek bir birim olarak değerlendirmekten daha yüksek hassasiyet sağladığı hipotezini desteklemiştir.
Bağımsız referans oluşturma
Çıkarılan her bir iddia için, yalnızca orijinal sorguya dayalı ayrı bir akıl yürütme süreci kullanılarak bağımsız referanslar oluşturulmuştur. Oluşturulan referanslar, bağımsız doğrulama kaynakları olarak hizmet edebilecek düzeyde, orijinal yanıtlardan yeterince farklı ve özlü olgusal açıklamalar sağlamıştır. Referans oluşturma süreci, olgusal referansın modelin önceki çıktısına doğrudan dayanmasını önlemek amacıyla ilk yanıttan izole edilmiştir. Bu ayrım, potansiyel onaylama yanlılığını azaltmayı ve sonraki iddia düzeyindeki doğrulama için kontrollü bir temel sağlamayı amaçlamıştır; çalışma, bu etkinin derecesini bağımsız olarak nicelleştirmemiştir. Bağımsız referansların başarılı bir şekilde oluşturulması, bilgi hatırlamanın yanıt oluşturmadan ayrılmasına yönelik önerilen tasarım ilkesini desteklemiştir.
Doğal dil çıkarımı doğrulaması
NLI doğrulama aşaması, iddia-referans çiftlerini gerektirme, çelişki ve nötr kategorilerine etkili bir şekilde sınıflandırmıştır. Çelişen iddialar tutarlı bir şekilde negatif doğrulama puanları alırken, olgusal olarak desteklenen iddialar pozitif puanlar almıştır. Yeterli destekleyici kanıtın bulunmadığı iddialara nötr sınıflandırmalar atanmıştır. Bu davranış, anlamsal çıkarımın desteklenmeyen olgusal ifadeleri güvenilir bir şekilde tanımlayabildiğini kanıtlamış ve hedeflenmiş düzeltme için gereken kanıtı sağlamıştır. Basit bir tutarlılık kontrol stratejisiyle karşılaştırıldığında, NLI doğrulaması halüsinasyon oranını %20'den %15'e düşürerek tespit yeteneğinin arttığını göstermiştir.
Adaptif istatistiksel eşikleme
Adaptif istatistiksel eşikleme uygulaması, her bir yanıtın güven puanı dağılımına göre karar sınırlarını dinamik olarak ayarlayarak doğrulama performansını daha da artırmıştır. Eşik hassasiyet analizi, eşik parametresi 0.3'ten 0.7'ye yükseldikçe performansın arttığını göstermiştir. 0.7 hassasiyet değerinde, çerçeve %9'a düşürülen halüsinasyonlar ile 0.87 doğruluk oranına ulaşmıştır (Şekil 2). Değerlendirilen k değerleri için eksiksiz hassasiyet analizi sonuçları Ek Tablo 2'de sunulmuştur. Eşiğin bu noktanın üzerine çıkarılması, gecikme süresini artırırken doğrulukta yalnızca küçük kazanımlar sağlamıştır. Bu gözlemler, yanıtlar arasındaki değişken güven dağılımlarını yönetmede adaptif eşiklerin, sabit karar sınırlarından daha etkili olduğu hipotezini desteklemiştir.
Adaptif eşik, aynı zamanda her bir yanıt içerisindeki güven skorlarının değişkenliğini de yansıtır. Oldukça tutarlı doğrulama skorlarına sahip yanıtlar daha küçük bir standart sapma oluşturarak daha seçici bir karar sınırı ile sonuçlanır. Buna karşın, heterojen güven değerlerine sahip iddialar içeren yanıtlar daha büyük bir standart sapma oluşturarak daha geniş bir kabul bölgesi sağlar ve belirsiz iddialar için gereksiz düzeltmeleri azaltır. Bu adaptif davranış her bir yanlış pozitifi veya yanlış negatifi tamamen ortadan kaldıramasa da, karar sınırının tüm girdilere tek tip bir kriter uygulamak yerine, her bir yanıtın belirsizlik özelliklerine göre tepki vermesini sağlar.
Seçici istem düzeltme ve yanıt birleştirme
Sadece çelişkili olarak tanımlanan iddialar düzeltme için gönderilmiş, desteklenen ve nötr iddialar ise değiştirilmeden tutulmuştur. Bu seçici düzeltme stratejisi, gereksiz yeniden üretimi en aza indirmiş ve yanıtın orijinal yapısını korumuştur. Düzeltme ve yanıt yeniden yapılandırmasının ardından, TruthfulQA üzerindeki halüsinasyon oranı %28'den %9'a düşerek %67,9'luk göreceli bir azalma göstermiştir. Benzer iyileşmeler, halüsinasyonların %26'dan %10'a düştüğü FEVER üzerinde de gözlemlenmiştir. Değerlendirilen konfigürasyonlar arasındaki doğruluk ve halüsinasyon oranı karşılaştırmaları sırasıyla Şekil 3 ve 4'te sunulmuştur.
Performans değerlendirmesi
Karşılaştırmalı değerlendirme, önerilen çerçevenin test edilen tüm yöntemler arasında en yüksek genel performansı sergilediğini göstermiştir. TruthfulQA üzerinde çerçeve, hem sabit eşikli doğrulama hem de öz-tutarlılığa dayalı yaklaşımlardan daha iyi bir performans sergileyerek 0,87 doğruluk ve 0,85 F1 puanı elde etmiştir (Tablo 2, Şekil 3 ve 4). FEVER üzerinde ise çerçeve, 0,89 doğruluk ve 0,87 F1 puanı elde etmiştir (Tablo 3, Şekil 3 ve 4). Çerçeve bileşenlerinin artımlı katkısı, Tablo 4'te sunulan ablasyon analizi aracılığıyla incelenmiştir. Bu iyileştirmeler, iddia düzeyindeki doğrulamanın adaptif istatistiksel karar verme ile birleştirilmesinin, birden fazla veri seti genelinde olgusal güvenilirliği artırdığını doğrulamıştır. SelfCheckGPT, FActScore ve önerilen çerçeve için halüsinasyon tespit doğruluğu Şekil 5'te karşılaştırılmıştır.
Latans analizi
Eksiksiz doğrulama hattı düşük hesaplama maliyetini korumuştur. Ortalama yanıt süresi, temel model için 820 ms'den tam çerçeve için 980 ms'ye yükselmiş olup bu durum, işlem süresinde yalnızca mütevazı bir artışa tekabül etmektedir (Tablo 5). Toplam gecikmenin büyük bir kısmını yanıt oluşturma oluştururken, doğrulama ve düzeltme aşamaları nispeten az ek maliyet getirmiştir. Aşama düzeyindeki işlem süresi dökümü Ek Tablo 3'te sunulmuştur. Sorgu başına yaklaşık 1600 ms gerektiren geri çağırma tabanlı doğrulama sistemleri ile karşılaştırıldığında, önerilen çerçeve benzer olgusal doğruluğu korurken önemli ölçüde daha düşük gecikme süresi elde etmiştir. Bu bulgular, halüsinasyonların azaltılmasının gerçek zamanlı kullanılabilirlikten ödün vermeden sağlanabileceği hipotezini desteklemiştir.
Yanıt üretimi bulut tabanlı bir dil modeline dayandığı için, bireysel gecikme ölçümleri deterministik bir yürütme süresinden ziyade ağ koşulları ve sunucu tarafındaki zamanlamadan kaynaklanan dalgalanmalara tabidir. Bu nedenle, değerlendirilen yöntemler arasındaki göreceli karşılaştırmaları korurken geçici yürütme değişkenliğinin etkisini azaltmak amacıyla, temsili ortalama değerler elde etmek için tekrarlanan ölçümler kullanılmıştır. Gecikme değerleri, tekrarlanan deneysel çalışmalar boyunca ortalama yürütme süreleri olarak rapor edilmiştir. Çalışma başına düşen bireysel gecikme değerleri saklanmamıştır; bu nedenle varyansın, güven aralıklarının veya diğer değişkenlik ölçütlerinin post hoc hesaplaması mümkün olmamıştır. Buna uygun olarak, gecikme değerleri ve Şekil 6'daki hız-doğruluk karşılaştırması, hata çubukları olmadan nokta tahminleri şeklinde sunulmuştur.
Sonuç olarak, iddia çıkarımı, bağımsız referans üretimi, Doğal Dil Çıkarımı doğrulaması, adaptif istatistiksel eşikleme ve seçici düzeltmenin birleştirilmesinin, büyük dil modeli çıktılarının olgusal güvenilirliğini artırdığı gösterilmiştir. Söz konusu çerçeve, halüsinasyon oranını TruthfulQA'da %28'den %9'a, FEVER'da ise %26'dan %10'a düşürmüştür. Sonuçlar, adaptif iddia düzeyinde doğrulamanın, değerlendirilen koşullar altında ek yanıt gecikmesini sınırlarken olgusal güvenilirlik metriklerini iyileştirdiğini göstermektedir
Veri Kullanılabilirliği
Bu çalışmada analiz edilen veri setlerine, ilgili resmi kaynakları üzerinden kamuya açık olarak erişilebilir. Makale; açıklanan analizlerin tekrarlanmasını desteklemek için gerekli olan veri seti bilgilerini, model konfigürasyonlarını ve metodolojik ayrıntıları sunmaktadır. Çalışma sırasında oluşturulan işlenmiş değerlendirme verileri ve ek sonuçlar, Ek Dosyalar bölümünde sunulmuştur.

Şekil 1: Adaptif iddia doğrulama çerçevesinin iş akışı. İlk LLM tarafından üretilen yanıt olgusal iddialara ayrıştırılır, ardından bağımsız referans üretimi, NLI tabanlı doğrulama, güven puanlaması ve istatistiksel eşikleme işlemleri gerçekleştirilir. Kabul kriterini karşılayan iddialar korunurken, düzeltme kriterini karşılayan iddialar, nihai yanıt montajından önce hedeflenmiş düzeltme işlemine tabi tutulur. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayınız.

Şekil 2: Hassasiyet parametresinin (k) doğrulama doğruluğu üzerindeki etkisi. TruthfulQA ve FEVER üzerindeki doğruluk oranları 0.3, 0.5, 0.7 ve 1.0 k değerlerinde gösterilmiştir. Doğruluk, her iki veri setinde de k ile birlikte artmış olup, birincil değerlendirme için k = 0.7 seçilmiştir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 3: Doğrulama yöntemleri genelinde doğruluk karşılaştırması. Baseline LLM, NLI tabanlı doğrulama ve önerilen adaptif doğrulama çerçevesinin TruthfulQA ve FEVER üzerindeki doğruluğu. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 4: Doğrulama yöntemleri arasında halüsinasyon oranı karşılaştırması. Baseline LLM, NLI tabanlı doğrulama ve önerilen çerçevenin TruthfulQA ve FEVER üzerindeki halüsinasyon oranları. Önerilen çerçeve, oranı TruthfulQA'da %28'den %9'a, FEVER'da ise %26'dan %10'a düşürmüştür. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 5: Yöntemler arasında halüsinasyon tespit doğruluğu. TruthfulQA ve FEVER üzerinde SelfCheckGPT, FActScore ve önerilen çerçevenin tespit doğruluğu. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 6: Doğrulama yöntemleri genelinde yanıt süresi ve doğruluk arasındaki denge. TruthfulQA ve FEVER üzerinde değerlendirilen yöntemler için yanıt gecikmesi ile doğruluk arasındaki ilişki; önerilen çerçeve ve karşılaştırıcı yaklaşımlarla ilişkili performans–gecikme dengesini göstermektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
| Veri Seti | Kullanılan Örnekler | Alanlar | Ort. Yanıt Uzunluğu (token) | Temel LLM Halüsinasyon Oranı |
| TruthfulQA | 817 | 38 (bilim, tarih, hukuk, vb.) | 42 | 28% |
| ATEŞ | 1,000 | Genel olgusal iddialar | 18 | 26% |
Tablo 1: Kıyaslama veri seti özellikleri. Çerçeve geliştirme ve değerlendirme için kullanılan TruthfulQA ve FEVER veri setlerinin; örnek sayıları, temel doğruluk, temel halüsinasyon oranı ve örnek başına ortalama iddia sayılarını içeren özeti.
| Yöntem | Doğruluk (Accuracy) | Kesinlik (Precision) | Duyarlılık (Recall) | F1 Skoru | Halüsinasyon % |
| Temel LLM (Tekli Çıkarım) | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| NLI Tabanlı Doğrulama (Sabit Eşik) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| SelfCheckGPT | 0.76 | 0.755 | 0.725 | 0.74 | 22% |
| FActScore | 0.85 | 0.8425 | 0.8175 | 0.83 | 11% |
| Önerilen Çerçeve (İstatistiksel Eşik) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
Tablo 2: TruthfulQA üzerindeki performans karşılaştırması. Temel LLM, SelfCheckGPT, FActScore, NLI doğrulaması ve önerilen çerçeve için doğruluk, kesinlik, duyarlılık, F1 skoru ve halüsinasyon oranı.
| Yöntem | Doğruluk | Hassasiyet | Duyarlılık | F1 Skoru | Halüsinasyon % |
| SelfCheckGPT | 0.78 | — | — | — | — |
| FActScore | 0.87 | — | — | — | — |
| Baseline LLM† | 0.74 | 0.73 | 0.71 | 0.72 | 26% |
| NLI Tabanlı Doğrulama (Sabit Eşik) | 0.83 | 0.8225 | 0.7975 | 0.81 | 14% |
| Önerilen Çerçeve (İstatistiksel Eşik) | 0.89 | 0.8775 | 0.8625 | 0.87 | 10% |
Tablo 3: FEVER üzerindeki performans karşılaştırması. Temel LLM, SelfCheckGPT, FActScore, NLI doğrulaması ve önerilen çerçeve için doğruluk, kesinlik, duyarlılık, F1 skoru ve halüsinasyon oranı.
| Konfigürasyon | Doğruluk | Hassasiyet | Geri Çağırma | F1 (eklenen) | Halüsinasyon Oranı |
| Temel Dil Modeli | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| Temel Hat + İkincil Kontrol (NLI Olmadan) | 0.78 | 0.7725 | 0.7475 | 0.76* | 20% |
| Temel Hat + NLI Tabanlı Doğrulama (Sabit Eşik) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| Baz Çizgisi + İstatistiksel Karar Modülü (Tam) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
Tablo 4: Çerçeve bileşenlerinin ablasyon analizi. İkincil doğrulama, NLI doğrulaması ve adaptif istatistiksel eşiklemenin ardışık olarak eklenmesinin ardından doğruluk, F1 skoru ve halüsinasyon oranındaki değişimler.
| Yöntem | Ortalama Tepki Süresi (ms) |
| Temel LLM (Tekli Üretim) | 820 |
| Kendi Kendini Doğrulama Mekanizması | 910 |
| Önerilen İstatistiksel Çerçeve | 980 |
| Erişimle Artırılmış Doğrulama (RAG) | 1600 |
Tablo 5: Doğrulama yöntemleri genelindeki yanıt gecikmesi. Kendi Kendine Doğrulama (Self-Validation), önerilen çerçeve ve geri çağırma destekli doğrulama için ortalama yanıt süresi ve temel LLM'ye göre ek gecikme.
Ek Tablo 1: Halüsinasyon doğrulama yaklaşımlarının karşılaştırılması. Önerilen çerçevenin; harici veri geri çağırma, iddia düzeyinde doğrulama, adaptif eşikleme ve gecikme verimli işlemleme açısından mevcut yöntemlerle karşılaştırılması.Bu dosyayı indirmek için lütfen buraya tıklayın.
Ek Tablo 2: Eşik parametresinin (k) duyarlılık analizi. Doğruluk, kesinlik, geri çağırma, F1 skoru ve halüsinasyon oranı; 0,3, 0,5, 0,7 ve 1,0 eşik parametre değerlerinde elde edilmiştir. Birincil değerlendirme için k = 0,7 değeri kullanılmıştır.Lütfen bu dosyayı indirmek için buraya tıklayın.
Ek Tablo 3: Doğrulama hattının aşamaları boyunca işlem süresi. İlk yanıt oluşturma, iddia ayrıştırma, referans oluşturma, NLI çıkarımı ve seçici düzeltmenin toplam yanıt süresine ortalama yürütme süresi ve yüzde katkısı.Lütfen bu dosyayı indirmek için buraya tıklayın.
Ek Tablo 4: Doğrulama sırasında tespit edilen hataların dağılımı. Yalancı negatiflerin, yalancı pozitiflerin ve düzeltme hatalarının sayısı ve yüzdesi ile her bir hata türüyle ilişkili birincil halüsinasyon kategorileri.Lütfen bu dosyayı indirmek için buraya tıklayın.