$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Celem niniejszej pracy jest dostrojenie modelu językowego (LM) w celu generowania podsumowań z zmniejszoną halucynacją encji. Halucynacje występują, gdy model "z pewnością produkuje niewłaściwe lub nieistotne wyniki", ponieważ generuje tekst zgodnie ze statystyczną prawdopodobieństwem, a nie weryfikacją faktyczną. Osiąga się to poprzez zaprojektowanie funkcji nagrody opartej na indeksie halucynacji encji (EHI) i zastosowanie uczenia wzmacniającego w celu jej zmaksymalizowania.
Sformułowanie problemu
Mając dokument wejściowy Xi, celem jest wygenerowanie podsumowania Yi takiego, że encje wymienione w Yi są zakorzenione w Xi. Tradycyjne trenowanie o maksymalnym prawdopodobieństwie nie optymalizuje bezpośrednio spójności faktycznej. Te metody trenowania nie karzą za dołączenie wymyślonych encji. Dlatego wprowadzona zostaje strategia dostojenia napędzana nagrodami, gdzie nagroda jest proporcjonalna do wierności encji, mierzonej za pomocą EHI.
Zestaw danych i metoda
Wykorzystano dwa korpusy: po pierwsze, zbiór transkrypcji dialogów z wielowypowiedziowych transkrypcji spotkań i abstrakcyjnych podsumowań referencyjnych, a po drugie, benchmark sumaryzacji wiadomości XSUM22,23. Każdy zbiór został oczyszczony, spłaszczony i podzielony na 80% na trening, 10% na walidację i 10% na test. Dialogi są bogate w język potoczny i zaimki, podczas gdy XSUM zawiera zwięzłe artykuły informacyjne; kombinacja pozwala nam na ewaluację zarówno generalizacji w obrębie domeny, jak i poza nią.
Wyciąganie encji jest przeprowadzane zarówno na źródłowych dokumentach, jak i podsumowaniach w celu obliczenia Indeksu Halucynacji Encji (EHI). Podczas dostojenia, niniejsza praca wyłącznie wykorzystuje podzbiór treningowy, podczas gdy wskaźniki EHI na walidacji są monitorowane, aby wybrać najlepszy checkpoint. Ostateczne ewaluacje są raportowane na wyłączonym zbiorze testowym, który pozostaje zero-shot przed i po dostrojeniu modeli.
Podsumowując, po pierwsze, transkrypcje są organizowanie w spłaszczony format i dzielone na dane. Przetrenowany model generuje podsumowania bazowe. Po drugie, EHI jest obliczany za pomocą opartego na transformatorach NER i pięciu czynników halucynacji. Podczas dostojenia, model jest aktualizowany za pomocą nagrody EHI przez adaptery LoRa. Wreszcie, podsumowania są generowane za pomocą dostrojonego modelu i oceniane za pomocą EHI, Encja F1 i innych wskaźników (Rysunek 2). Wszystkie eksperymenty są powtarzalne dzięki dostarczonym kodom i plikom konfiguracyjnym. Rysunek 3 przedstawia stopniowy przepływ procesu przygotowania zbioru danych, bazowego sumaryzowania, obliczania EHI, dostojenia i ewaluacje.
Podsumowanie bazowe
Wybrane zostały trzy przetrenowanie LLM, a ich bazowe sumaryzowanie zostało uchwycone: Flan-T5, Mistral (Nous-Hermes-2-Mistral-7B-DPO) i DistilBART24,25,26. Każdy model był uruchamiany w trybie zero-shot, aby wygenerować początkowe podsumowanie (Yi) dla każdego dokumentu wejściowego (xi). Wyszukiwanie wiązkowe z szerokością wiązki równą 4 i karą długości równą 1.0 zostało zastosowane, aby zachęcić do płynnych, ale zwięzłych podsumowań. Te bazowe podsumowania służyły do oszacowania częstości występowania halucynacji i dostarczyły punktów wyjściowych do dostojenia.
Wyciąganie encji i obliczanie EHI
Dokładne obliczenie Indeksu Halucynacji Encji (EHI) wymaga solidnego NER. Początkowo, do operacji NER używano Spacy. Rozumie się, że modele NER oparte na transformatorach są bardziej dokładne, ale Spacy był początkowym wyborem z następujących powodów: (1) Modele NER oparte na transformatorach udowodniły, że halucynują bardziej niż Spacy. (2) Spacy będąc statystycznym wprowadza efektywność obliczeniową pod względem kosztów implementacji i czasu wykonania. (3) Pomaga nam również udowodnić, że EHI jest odporny na zmniejszenie halucynacji nawet z słabszym modelem NER. Jednak, biorąc pod uwagę fakt, że eksperymenty są przeprowadzane na uznanych zbiorach danych i spaCy's en_core_web_sm model jest kruchy na potocznych transkrypcjach13. Spacy jest zastępowany transformatorowym modelem NER (dslim/bert-base-NER), który jest modelem BERT dostrojonym na zbiorze danych CoNLL-2003. Systemy NER oparte na BERT zostały wykazane jako lepsze od modeli spaCy w zadaniach specyficznych dla domeny - na przykład, model Aviation-BERT-NER osiągnął F1 równe 94,78% identyfikując 17 encji w porównaniu z 93,73% dla spaCy NER, który rozpoznał siedem encji27. Model NER BERT został skonfigurowany za pomocą Hugging Face Transformers28 i wykonywał dopasowanie niezależne od wielkości liter. Aby uchwycić zaimki i wariacje powierzchniowe, ta metoda dodatkowo zastosowała proste zasady, które mapują "Pan Smith" i "Smith" do tej samej kanonicznej formy; jednak peł