Artykuł badawczy

System odpowiadania na pytania semantyczne w zamkniętej dziedzinie jako przypadek zastosowania modeli opartych na transformatorach

DOI:

10.3791/69424

14 listopada 2025

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Badanie to projektuje adaptacyjny system uczenia się do wydobywania wiedzy z tekstu w celu odpowiadania na pytania, porównując modele Google-, DistilBERT, RoBERTa i TF-IDF, wykorzystując podobieństwo sinusoidalne, w zakresie opóźnień i uogólnień semantycznych. Google-działa najlepiej, choć system pozostaje wrażliwy na błędy ortograficzne, co podkreśla potrzebę silnego wstępnego przetwarzania do praktycznego zastosowania.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aby wydobyć wiedzę z plików tekstowych i odpowiadać na pytania użytkowników poprzez znalezienie odpowiednich informacji w kontekście, zaprojektowano adaptacyjny system nauczania, taki jak System Odpowiadania na Pytania (QAS). To podejście zachęca do dalszych badań nad systemami bezpośrednich odpowiedzi oraz wykorzystaniem testów na dużą skalę w zadaniach odpowiadania na pytania (QA). Aby to ułatwić, stosuje się semantyczny zbiór danych QA (SCD-QA), obejmujący zarówno pytania faktoidowe, jak i niefactoidowe, w połączeniu z wcześniej wytrenowanymi modelami transformatorów. W tym badaniu mierzona jest i porównywana zdolność do wnioskowania pomiędzy trzema wcześniej wytrenowanymi modelami transformatorów, takimi jak Google-, DistilBERT i RoBERTa, na zbiorze danych SQuAD, a klasycznym modelem TF-IDF opartym na słowach kluczowych o podobieństwie cosinusowym. Wyniki pokazują, że Google-radzi sobie najlepiej, ze średnim wynikiem Exact Match (EM) 90,0 i średnim opóźnieniem 1,27 s. System dobrze radzi sobie także z pytaniami z synonimami, co świadczy o silnym rozumieniu znaczenia. Jednak nie radzi sobie dobrze w pytaniach z błędami ortograficznymi, co wskazuje, że jest wrażliwy na błędy ortograficzne i wymaga lepszej wczesnej obróbki podczas użycia.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Przetwarzanie języka naturalnego (NLP) to poddziedzina sztucznej inteligencji (AI), w której można konstruować QAS, pozwalając systemom komputerowym automatycznie generować odpowiedzi na pytania1. NLP koncentruje się przede wszystkim na rozumieniu i interpretacji języka pisanego w sposób naśladujący procesy poznawcze ludzkiego mózgu2. Zaangażowanie się w te zadania ustanawia NLP jako kluczową technikę w budowaniu systemu zdolnego generować reakcje podobne do człowieka.

QAS, który odpowiada na pytania użytkownika, jest jednym z przykładów zastosowania NLP3. QAS to obszar badawczy, który obejmuje badania z różnych dziedzin o wspólnych problemach, takich jak wyszukiwanie informacji (IR), ekstrakcja informacji (IE) oraz NLP. Obecnie współczesne wyszukiwarki wykonują głównie zadania wyszukiwania dokumentów4. Innymi słowy, gdy są dostępne konkretne słowa kluczowe, wyszukiwarki te wyłącznie dostarczają listę istotnych dokumentów uszeregowanych według trafności i zawierających określone słowa kluczowe. Nie dają precyzyjnej odpowiedzi. Celem QAS jest pomoc osobom w znalezieniu precyzyjnych odpowiedzi na konkretne pytania w ograniczonych obszarach tematycznych5. Grupowanie QAS można przeprowadzić na podstawie następujących kategorii przedstawionych na Rysunku 16. Zarówno factoid, jak i non-factoid QAS działają w języku naturalnym (NL) i są zaprojektowane tak, aby odpowiadać na pytania zadawane w NL. System wykorzystuje techniki NLP, aby dostarczać odpowiedzi na podstawie dostępnego korpusu7.

Rysunek 1
Rysunek 1: Kategoryzacja systemów QA. Rysunek ilustruje mapę myśli głównych komponentów systemu QA. W centrum znajduje się System QA, który obsługuje różne typy pytań, w tym factoidy, nie-factoidy, hybrydy, wizualizacje, konwersacyjne oraz pytania wielokrotnego wyboru. Prosimy kliknąć tutaj, aby zobaczyć większą wersję tego rysunku.

Niniejsze badanie przedstawia system Semantic Closed-Domain Question Answering (SCD-QA) do odpowiadania użytkownikom w Nowej Jalandzie na temat polityk i procedur rekrutacji na doktorat. System wykorzystuje zasady i regulacje doktoranckie PDF8 jako podstawowy kontekst oraz implementuje model dwukierunkowego enkodera z transformatorów ()9 jako główne ramy generowania odpowiedzi. Celem jest zaprojektowanie semantycznie konwersacyjnego QAS opartego na FAQ, który dostarcza dokładnych odpowiedzi na najczęściej zadawane pytania, ułatwiając nowo przyjętym studentom szybkie znalezienie niezbędnych informacji.

Aby osiągnąć ten cel, zastosowano trzy szeroko znane modele oparte na transformatorach: Google-9, DistilBERT10,11 oraz RoBERTa12,13, wszystkie wytrenowane na Stanford Question Answering Dataset (SQuAD)14. Ich wydajność oceniano za pomocą dwóch kluczowych parametrów: dopasowywania semantycznego, mierzonego metodą Dokładnego Dopasowania (EM)14, oraz Latencji modelu15, analizowanej przez średnie czasy reakcji. Dodatkowo do przechowywania osadzeń semantycznych używano bazy danych wektorowych (VD)16,17, ułatwiając wyszukiwanie najbardziej semantycznie istotnego kontekstu dla pytania użytkownika na podstawie wyników podobieństwa semantycznego.

Przegląd literatury

Modele oparte na transformatorach całkowicie zrewolucjonizowały dziedzinę NLP, przynosząc znaczące ulepszenia w QAS. Wprowadzenie9 mocno podkreśliło architekturę transformatorów jako kluczowy element w rozwoju solidnego i precyzyjnego systemu QAS. W tej sekcji przedstawiono kompleksowy przegląd ostatnich ulepszeń modeli opartych na transformerach oraz osadzeń semantycznych, ze szczególnym uwzględnieniem ich znaczenia dla QA Semantic Conversational Dialogue (SeCD). Przeprowadza się analizę porównawczą, aby uzasadnić integrację tych modeli w tej pracy, podkreślając ich skuteczność w przynoszeniu istotnych wniosków w tej dziedzinie.

Architektury oparte na transformerach, takie jak, DistilBERT i RoBERTa, wykorzystują metodologię samouwagi do uchwycenia złożonych relacji kontekstowych w tekście, co czyni je idealnymi do zadań wymagających znaczącego zrozumienia semantycznego, takich jak QAS. Modele te, wraz ze specjalistycznymi transformatorami zdań, generują semantyczne osadzenia, które umożliwiają szybkie i precyzyjne wyszukiwanie kontekstu poprzez wektorowe wyszukiwania podobieństwa w SeCD QA. Najnowsze badania koncentrują się na ulepszaniu tych modeli i technik osadzania w celu zwiększenia przepustowości, skalowalności i efektywności, zwłaszcza w zastosowaniach specyficznych dla zadań, takich jak SCD-QA.

Sengupta i in.18wprowadzili kreatywne podejście do wzmocnienia systemu Multiple Choice QAS (MCQAS) dla pytań naukowych poprzez precyzyjne dostrojenie modeli. W ich ramach najpierw oceniono rozproszone podobieństwo semantyczne między parami pytanie-odpowiedź, a następnie wprowadzili te wyniki podobieństwa wraz z oryginalnymi cechami do warstwy klasyfikacyjnej. To połączone podejście uzyskało wynik F1 na poziomie 90,2% w zbiorze danych SciQ, podkreślając skuteczność w specyficznych zadaniach QAS, które wymagają zniuansowanego zrozumienia i precyzyjnej klasyfikacji.

Cichecki i in.19 porównali ChatGPT oraz dopracowane modele dla systemów wsparcia inteligentnego projektowania i odkryli, że dopracowane modele przewyższają ogólnego przeznaczenia duże modele językowe (LLM), takie jak ChatGPT, w zadaniach specyficznych dla danej dziedziny, osiągając wynik F1 na poziomie 88,5% na specjalnie zaprojektowanym zbiorze danych. Badanie pokazuje znaczenie precyzyjnego dostrojenia specyficznego dla dziedziny dla poprawy wydajności modeli w specjalistycznych zastosowaniach.

Guo i in.20 analizowali efektywność strategii precyzyjnego dopracowywania zadań dla QAS przy ograniczonych budżetach adnotacji. Ich badania wykazały, że podwójne dopracowywanie – początkowo na ogólnym zbiorze QA, takim jak SQuAD, a następnie na specyficznym dla zadania zbiorze danych – przynosi znaczący 15% postęp w wyniku F1 na zbiorach takich jak COVID-QA. To odkrycie podkreśla kluczową rolę sekwencyjnego dostrajania w poprawie wydajności QAS SeCD.

Pudasaini i Shakya21 analizowali zastosowanie dopracowanych modeli dla QA w pracach badawczych biomedycznych, raportując wyniki EM i F1 odpowiednio 83,89% i 89,67%, na niestandardowym zestawie danych QA biomedycznego pochodzącego z PubMed. Wykorzystując transfer learning z PubMedBERT, ich technika pokazała wyraźną zdolność do przetwarzania złożonych zapytań biomedycznych, podkreślając potencjał precyzyjnego dostrojenia zadaniowego w tej dziedzinie.

Baek i in.22 zaproponowali ramy promptingowe Knowledge-Augmented Language Model Prompting dla zero shot Knowledge Graph (KG) QA. To podejście wykorzystuje podobieństwa semantyczne do wydobycia istotnych faktów z KG i włącza je do pytania wejściowego. W rezultacie uzyskał wynik F1 na poziomie około 85% na zbiorach danych KG-QA. Praca ilustruje potencjał łączenia KG i modeli transformatorów, podkreślając korzyści płynące z powiększania wiedzy w poprawie wydajności QA.

Hu i in.23 opisali QAS zaprojektowany dla domeny rejestracji gospodarstw domowych, wykorzystujący KG wraz z modelami opartymi na (RoBERTa-BiLSTM-MultiHeadAttention) do klasyfikacji intencji i analizy semantycznej. Poprzez uproszczenie pytań do encji pojedynczych zdarzeń i relacji intencji, osiągnięto wysoką dokładność w zapytaniach o dane strukturalne. Ponadto skalowalność metodologii na inne dziedziny podkreśla jej potencjał szerokiego zastosowania w QAS opartym na KG.

Luo i in.24 wprowadzili schemat oparty na dla QA bazy wiedzy (KB), integrując model przycinania wieloziarnistego (MGPM) z uwzględnieniem relacji. Ich podejście osiąga znaczącą dokładność: 94,4% na SimpleQuestions, 68,6% na WebQuestionsSP oraz 63,7% na WebQuestions. Wyniki te pokazują skuteczność w wykorzystaniu podobieństwa semantycznego w zapytaniach dotyczących danych strukturalnych. Ogólnie rzecz biorąc, badanie podkreśla potencjał modeli opartych na transformatorach dla KB-QA, szczególnie w sytuacjach, gdzie istotna jest dokładna identyfikacja entystów i relacji.

Wu i in.25 zaprojektowali ramy generowania uzupełnione wyszukiwaniem dla kontroli jakości w zarządzaniu budową, ze szczególnym naciskiem na zapytania dotyczące bezpieczeństwa i zgodności. Integrując semantyki oparte na z modelem generatywnego transformatora oraz specyficznym dla zadania KG, ich podejście osiągnęło wynik F1 na poziomie 88,7% na zbiorze QA związanym z budownictwem. Badanie to pokazuje potencjał łączenia zrozumienia semantycznego z wyszukiwaniem opartym na KG, aby poprawić dokładność na specyficznym dla zadań danych QA dla zarządzania budową.

Peng i in.26 systematycznie oceniali LLM, w tym modele oparte na i GPT, pod kątem medycznej kontroli jakości. Łącząc kontekstowe zrozumienie z generatywnymi zdolnościami GPT, wykorzystali generowanie rozszerzone wyszukiwaniem oraz precyzyjne dostrojenie specyficzne dla dziedziny, aby osiągnąć wynik F1 na poziomie 86,2% na podstawie danych z PubMed i notatek klinicznych. Niniejsze badanie podkreśla potencjał modeli zespołowych do poprawy dokładności wnioskowania w opiece zdrowotnej, gdzie zarówno kontekst, jak i precyzyjne generowanie są kluczowe.

Gardazi i in.27przeanalizowali zastosowanie w zadaniach NLP, takich jak QA, analiza sentymentu oraz rozpoznawanie nazwanych podmiotów (NER). Ich analiza wykazała, że dopracowane modele osiągają wyniki F1 na poziomie 85%-92% na specyficznych dla zadań zbiorach QA, takich jak SQuAD. Pokazuje to, że niezawodnie generuje efektywne kontekstowe osadzenia i dodaje KG, co czyni go dobrze przystosowanym do SECD QAS.

Modele oparte na transformatorach stały się decydującym wyborem dla SECD QAS ze względu na ich unikalną zdolność do przechwytywania przetwarzania kontekstowo wrażliwego, efektywnego skalowania i dostosowywania się do zadań specyficznych dla danej dziedziny. Tabela 1 ilustruje tę decydujący przewagę, porównując modele oparte na transformatorach z alternatywnymi metodami analizowanymi w tym badaniu 18,20,22,23,24,25.

PodejścieKluczowe cechyZaletyOgraniczeniaMetryki wydajności (SQuAD)Przydatność w przypadku użycia
Modele oparte na transformatorach (, RoBERTa, DistilBERT)Dwukierunkowe modelowanie kontekstowe, samouwaga, precyzyjne dostrojenie danych specyficznych dla dziedziny 16, 17, 19, 24, 25Wysoka dokładność, solidne zrozumienie semanticzne, skalowalne dzięki bazom wektorowym 18, 20, 22, 24, 25Wyższy koszt obliczeniowy, wymaga wcześniejszego szkolenia 17, 18EM: 80–90%, F1: 85–93% 16, 17, 19, 24, 25Idealne dla systemów Closed Domain (CD) - QA, FAQ oraz wyszukiwania semantycznego 16, 17, 19, 20, 22, 24, 25
Tradycyjne systemy oparte na regułachRęcznie tworzone zasady, dopasowywanie słów kluczowych 16Niskie koszty obliczeniowe, prosta implementacja 16Ograniczona skalowalność, słaba obsługa złożonych zapytań 16, 18EM: 50–60%, F1: 55–65% 16Podstawy QAS z danymi strukturalnymi 16
Rekurencyjne sieci neuronowe (RNN)Przetwarzanie sekwencyjne, architektury LSTM/GRU 19Umiarkowana wydajność dla zadań sekwencyjnych 19Trudności z długodystansowymi zależnościami, wolniejsze wnioskowanie 19, 9EM: 65–75%, F1: 70–80% 19Ogólne zadania NLP, mniej skuteczne dla CD-QA 19, 9
Systemy wyszukiwania oparte na słowach kluczowychTF-IDF, BM25 algorytmy 18, 22Szybkie odzyskiwanie, niskie zużycie zasobów 18, 22Ograniczone do dopasowania na poziomie powierzchownym, słabe zrozumienie semantyczne 18, 22EM: 40–50%, F1: 45–55% 18, 22Pobieranie dokumentów, nieodpowiednie do precyzyjnego QAS 18, 22
Konwolucyjne sieci neuronowe (CNN)Lokalna ekstrakcja cech, warstwy splotowe 25Efektywne dla klasyfikacji tekstów krótkich, szybkie wnioskowanie 25Ograniczone zrozumienie kontekstu, mniej skuteczne dla złożonych QAS 25EM: 60–70%, F1: 65–75% 25Klasyfikacja tekstowa, nieidealna dla CD-QA 25
Sieci neuronowe grafowe (GNN)Modelowanie oparte na grafach, rozumowanie relacyjne 20Skuteczne dla rozumowania wieloprzeskokowego, uchwyca relacje dokumentów 20Wysoka złożoność obliczeniowa, wymaga danych strukturalnych 20EM: 70–80%, F1: 75–85% 20QAS wieloskokowy, mniej odpowiedni dla CD-QA 20 w pojedynczym kontekście
Systemy oparte na grafach wiedzyStrukturalna reprezentacja wiedzy, łączenie encji 21Strong do zapytań dotyczących danych strukturalnych, wykorzystuje zewnętrzną wiedzę 21Wymaga gotowych grafów wiedzy, ograniczonych do znanych jednostek 21EM: 65–75%, F1: 70–80% 21QAS specyficzny dla domeny z danymi strukturalnymi 21
Modele z dodatkiem uwagiWzmocnione mechanizmy uwagi, przetwarzanie skoncentrowane na kontekście, 24Lepsza koncentracja na odpowiednich fragmentach tekstu, wysoka dokładność 24Wyższe koszty obliczeniowe, złożona implementacja 24EM: 85–90%, F1: 88–92% 24Złożone CD-QA, pytania nie-factoidalne 24
Modele work-of-wordsReprezentacja oparta na częstotliwości słów 22Proste, obliczeniowo lekkie 22Słabe zrozumienie semantyczne, nieskuteczne dla złożonych zapytań 22,25EM: 35–45%, F1: 40–50% 22Podstawowe wyszukiwanie tekstu, nieodpowiednie dla QAS 22, 25
Hybrydowe modele neuronalne (CNN+RNN)Łączy przetwarzanie lokalne i sekwencyjne 25Równoważy zrozumienie lokalne i kontekstowe 25Umiarkowana złożoność, trudności z długimi kontekstami 25EM: 68–78%, F1: 72–82% 25Ogólne zadania NLP, umiarkowane dopasowanie do CD-QA 25
Statystyczne modele językoweSkojarzenia słowne probabilistyczne 18Szybkie do prostych zapytań, niskie zużycie zasobów 18Ograniczone zrozumienie kontekstu, słaba skalowalność 18EM: 45–55%, F1: 50–60% 18Podstawowy QAS, nieodpowiedni dla skomplikowanych CD-QA 18

Tabela 1: Porównanie modeli opartych na transformatorach z innymi podejściami do QAS. Tabela przedstawia porównanie różnych podejść do systemów QA, w tym modeli opartych na transformatorach, systemów regułowych, RNN i innych. Podsumowuje ich główne cechy, mocne i słabe strony, wydajność w SQuAD oraz zadania, do których są najlepiej przygotowane, takie jak CD-QA, wyszukiwanie semanticzne i klasyfikacja tekstu.

Głównym celem tych badań jest zwiększenie dostępu studentów do informacji instytucjonalnych poprzez opracowanie wydajnych, skalowalnych i precyzyjnych systemów SCD-QA w NLP. W szczególności to badanie potwierdzające stosuje i waliduje wcześniej wytrenowane modele oparte na transformatorach w ramach polityki rekrutacji na doktora. Celem jest wykazanie ich skuteczności i praktycznej wykonalności poprzez uwzględnienie dopasowywania semantycznego, oceny opóźnień modelu oraz semantycznego wyszukiwania sterowanego przez choroby weneryjne. Takie podejście oferuje dogłębną analizę umożliwiającą dostarczanie precyzyjnych, specyficznych dla danej dziedziny odpowiedzi w skoncentrowanym kontekście instytucjonalnym. Rysunek 2 ilustruje holistyczne ramy architektoniczne systemu.

Rysunek 2
Rysunek 2: Ogólny schemat systemu SCD-QA.Rysunek ilustruje schemat przepływowy systemu QA wykorzystującego duże modele językowe (LLM). Zaczyna się od pliku kontekstowego i pytania użytkownika, które są obsługiwane przez trzy modele: Google-, DistilBERT i RoBERTa oraz jeden model oparty na słowach kluczowych: TF-IDF. System ocenia wydajność każdego modelu za pomocą listy kontrolnej, a następnie wybiera najlepszy na podstawie wyników. Kliknij tutaj, aby zobaczyć większą wersję tej liczby.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Kompleksowe podstawy teoretyczne

Komponent QAS: Ramy QAS składają się z trzech segmentów, jak pokazano na Rysunku 3: i) Moduł przetwarzania pytań (QPM), ii) Moduł przetwarzania dokumentów (DPM) oraz iii) Moduł ekstrakcji i formułowania odpowiedzi (AEFM). System otrzymuje pytania dzielące się na dwie główne kategorie: Factoid i Non-Factoid. Pytania factoidalne zazwyczaj używają pytań takich jak co, gdzie, kiedy lub kto, podczas gdy pytania nie-factoidalne używają słów typu how i why.

DPM: Z dostępnej listy użytkownik może wybrać konkretny fragment. Następnie każdy token w fragmencie jest oznaczany tagiem części mowy (POS). Aby wyodrębnić czasowniki, zidentyfikować wszystkie tokeny oznaczone jako czasowniki. Połącz te czasowniki z listą niekonwencjonalnych czasowników i zastosuj logikę dla czasowników regularnych. Stwórz strukturę danych (tablicę) zawierającą wyodrębnione czasowniki, ich czasy oraz formy -ing.

QPM: System otrzymuje dane wejściowe w formie pytania od użytkownika. Tekst jest tokenizowany za pomocą klasy StringTokenizer, a powstałe tokeny są przechowywane w osobnej strukturze danych. Ta struktura danych jest następnie zwracana do dalszego wykorzystania w programie.

AEFM: Pierwszym krokiem jest zidentyfikowanie czasownika w danym pytaniu. Niedawno zidentyfikowany czasownik jest teraz dopasowany do tokenów wygenerowanych podczas etapu przetwarzania dokumentów. Wybrany przypadek dla konkretnego typu pytania faktycznego (takiego jak co lub kiedy) jest wykorzystywany do wyodrębnienia i skonstruowania odpowiedzi w bardziej precyzyjny sposób.

Przed wyborem rodzaju pytania użytkownik jest najpierw proszony o wybranie wybranego fragmentu. QPM odpowiada za przetwarzanie pytań użytkownika i przekazywanie go do AEFM. AEFM wykorzystuje wyodrębnienia uzyskane z DPM oraz przetworzone dokumenty zawierające oznaczony format oryginalnego dokumentu wejściowego. Moduł przekaże wymagane algorytmy modułowi formułującemu, aby uzyskać pożądaną odpowiedź.

Rysunek 3
Rysunek 3: Komponenty QAS. Rysunek ilustruje czteroetapowy proces systemu QA: Pytanie, Przetwarzanie pytań, Przetwarzanie odpowiedzi oraz Odpowiedź. W procesie przetwarzania pytań system klasyfikuje pytanie. W procesie przetwarzania odpowiedzi znajduje i przegląda dokumenty oraz fragmenty, aby uzyskać odpowiedź. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

Model: Aby odkryć powiązania między słowami w tekście, metoda wykorzystuje transformator. W transformatorze są dwa mechanizmy – enkoder i dekoder28, ale do potrzebny jest tylko enkoder. stosuje dwukierunkowe podejście i systematycznie skanuje tekst wejściowy, aby nauczyć się znaczenia słów w ich kontekście. Koder przyjmuje jako wejście serię tokenów, które zostały wektoryzowane. Wektory są następnie wprowadzane do sieci neuronowej, która generuje serię wektorów odbijających dane wejściowe. Wektor wyjściowy słowa zmienia się w zależności od zdania, w którym się pojawia. Wektor słowa może się różnić w zależności od kontekstu, w którym się pojawia; na przykład "like" w "He likes to play cricket" ma inny wektor niż "like" w "His face turned red like a pomid." Podejście zaczyna się od fazy przetwarzania tekstu, zanim przejdzie do fazy budowania modelu. Kroki, które podejmuje przy przetwarzaniu tekstu, są omówione w następnej sekcji28.

Przetwarzanie tekstu: Model reprezentuje tekst wejściowy zgodnie z określonym zestawem zasad. Dodatkowo ten czynnik przyczynia się do poprawy wydajności modelu. Osadzenie wejściowe w składa się z amalgamatu trzech odrębnych typów osadzeń28.

Osadzenia pozycji (PE): Aby nauczyć się informacji o kolejności w osadzeniach, stosuje się PE. PE służą do przywrócenia informacji o kolejności, która została utracona w transformatorach. opracowuje odrębne PE specjalnie dla każdego punktu sekwencji wejściowej. posiada zdolność przekazywania informacji pozycyjnej słów w zdaniu za pomocą PE. Pozwala to-owi skutecznie przechwytywać i reprezentować sekwencję lub kolejność słów.

Osadzenia zdań (SE): Dodatkowo, aby pomóc modelu rozróżnić pierwsze i drugie zdanie, uczy się osadzenia unikalnego dla każdego z nich. Jest również zdolny do przyjmowania zdań parowych jako danych wejściowych do aktywności takich jak QA.

Osadzenia tokenów (TE): TE są nauczane dla każdego tokena w słowniku tokenów WordPiece. Słownictwo tokenów WordPiece składa się z jednostek podwyrazowych pochodzących ze słów znajdujących się w korpusie. Jako przykład ilustracyjny, ten zbiór słownictwa obejmie wszystkie możliwe podsłowa terminu Question, w tym Questio, Questi i inne.

Reprezentacja wejściowa tokena jest budowana przez sumowanie jego osadzeń na poziomach segmentu i pozycji. Z tego powodu jest to rozbudowane podejście osadzania, które dostarcza modelu ogromnej ilości informacji. Rysunek 49przedstawia osadzenia modelu.

Rysunek 4
Rysunek 4: Osadzenia. Rysunek pokazuje, jak powstają osadzenia wejściowe dla modelu transformatora. Zaczyna się od sekwencji wejściowej: [CLS] [MASK] niebo jest pochmurne [WRZEŚNIE], będzie padać [WRZEŚNIE]. Każdy token w sekwencji otrzymuje własne osadzenie, takie jak Ethe lub E[MASK]. Następnie dla każdego zdania dodaje się osadzenia zdań, takie jak EA dla pierwszego i EB dla drugiego. Uwzględnione są również osadzenia pozycyjne, oznaczone E0 do E9, aby wskazać pozycję każdego tokena. Wszystkie te elementy są łączone, tworząc ostateczne osadzenia wejściowe. Ta figura została zmodyfikowana z9. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

Projektowanie QAS z użyciem: Dla celów ilustracyjnych przeanalizuj to pytanie w połączeniu z akapitem zaczerpniętym z wpisu Wikipedii o Football League28.

Pytanie: Gdzie powstała Football League?

Przejście: W 1888 roku w Anglii powstała Football League, stając się pierwszą z wielu profesjonalnych rozgrywek piłkarskich. W XX wieku kilka różnych rodzajów piłki nożnej rozwinęło się, stając się jednymi z najpopularniejszych sportów drużynowych na świecie.

Odpowiedź: Anglia

Model wykorzystuje wyciąganie tokenów zarówno z pytania, jak i kontekstu, łącząc je następnie w jednolite wejście. Jak już wspomniano, proces rozpoczyna się od użycia tokena [CLS], który służy jako wskaźnik rozpoczęcia zdania. Dodatkowo stosuje się separator [SEP], który wyraźnie oddziela pytanie od fragmentu. Oprócz tokena [SEP], zawiera SE, aby rozróżnić pytanie od fragmentu28 zawierającego odpowiedź. używa dwóch SE, jednego poświęconego temu pytaniu, drugiego fragmentowi, aby wyraźnie je rozróżnić. Następnie osadzenia są łączone z jedną gorącą reprezentacją28 tokenów, aby odróżnić pytanie od fragmentu. Proces ten zilustrowany jest na rysunku 5.

Rysunek 5
Rysunek 5: Reprezentacja wejściowa. Rysunek ilustruje, jak generowane są osadzenia wejściowe dla QAS opartego na. Zaczyna się od tokena [CLS], potem pytanie: Ilu? [SEP], oraz fragment large is, każdy z osadzeniami zdań (A dla pytania, B dla fragmentu). Tokeny, zdania i pozycyjne osadzenia są łączone, aby uzyskać ostateczne wejście. Proszę kliknąć tutaj, aby zobaczyć większą wersję tego rysunku.

Następnie połączona osadzona reprezentacja28 pytania i kontekstu jest wykorzystywana jako wejście w modelu. Ostatnia ukryta warstwa jest modyfikowana tak, aby wykorzystywać SoftMax do generowania rozkładów prawdopodobieństwa. Rozkłady te określają indeksy początkowe i końcowe podciągu w zdaniu tekstowym wejściowym, które reprezentuje odpowiedź, jak pokazano na Rysunku 6, dla wizualnej reprezentacji.

Rysunek 6
Rysunek 6: Workflow przetwarzania dla QA.Rysunek pokazuje, jak model działa w QA. Przedstawia sekwencję wejściową, która zawiera pytanie, oznaczone tokenem klasyfikacji [CLS] na początku i tokenem separatora [SEP] na końcu, po którym następuje kontekst, oddzielony kolejnym [SEP]. Tokeny w tej sekwencji są zamieniane w osadzenia. Model następnie przewiduje pozycję początkową i końcową odpowiedzi w fragmencie. Proszę kliknąć tutaj, aby zobaczyć większą wersję tego rysunku.

Baza wektorowa (VD): VD17,18 to specjalistyczny system do efektywnego przechowywania, zarządzania, indeksowania i zapytań wysokowymiarowych reprezentacji wektorowych danych. Wektory są często generowane z modeli głębokiego uczenia i zawierają informacje semantyczne lub kontekstowe dotyczące danych. Każdy wymiar wektora reprezentuje konkretną cechę. Osadzenia to numeryczne reprezentacje obiektów takich jak tekst, obrazy, filmy i dźwięk. Te osadzenia są wykorzystywane w różnych zastosowaniach, w tym w uczeniu maszynowym (ML), NLP, systemach rekomendacji, widzeniu komputerowym oraz IR. VD ułatwiają skuteczne wyszukiwania podobieństw i zapytania semantyczne, grupując podobne obiekty blisko siebie w przestrzeni wektorowej. Facebook AI Similarity Search (FAISS)29 to znana choroba weneryczna użyta w tym badaniu do identyfikacji najbardziej istotnego kontekstu dla zapytań użytkowników. Tabela 2 przedstawia główne cechy choroby wenerycznych oraz ich zastosowania.

CechaOpis
Dane wysokowymiaroweObsługuje dane o setkach lub tysiącach wymiarów.
Przybliżony najbliższy sąsiad (ANN)Umożliwia szybkie wyszukiwanie podobieństw poprzez przybliżanie odległości.
SkalowalnośćObsługuje duże zbiory danych z miliardami wektorów.
IntegracjaCzęsto integruje się z frameworkami i narzędziami AI/ML, co pozwala na płynne przepływy pracy.
Zapytania w czasie rzeczywistymZapewnia wektorowe wyszukiwania o niskim opóźnieniu dla aplikacji interaktywnych.

Tabela 2: Główne cechy choroby wenerycznej. Tabela podkreśla ważne cechy choroby wenerycznej. Obejmują one obsługę danych o wysokich wymiarach, szybkie wyszukiwanie podobieństw za pomocą algorytmów ANN, skalowanie do dużych zbiorów danych, współpracę z narzędziami AI i ML oraz wsparcie szybkich, w czasie rzeczywistym zapytań do interaktywnego użytku.

Metryki oceny wyników: System SCD-QA został oceniony na podstawie dwóch głównych wskaźników: wyniku EM14 oraz latencji modelu15. Wynik EM, standardowy wskaźnik w badaniach QA, ocenia dokładność przewidywania poprzez pomiar odsetka przewidywanych odpowiedzi, które dokładnie odpowiadają rzeczywistości. Dla zestawu N pytań wynik EM jest formalnie określony w równaniu 1 w następujący sposób:

Równanie 1gdzie Równanie 2 (1)

Ta metryka przypisuje wynik 1 za dokładne dopasowanie do odpowiedzi referencyjnej oraz 0 za każdą różnicę.

Metryka opóźnienia określa całkowity czas przetwarzania potrzebny przez system do wygenerowania odpowiedzi na pojedyncze zapytanie. Ta metryka jest obliczana jako średni upływ czasu wszystkich zapytań, zgodnie z Równaniem 2:

Równanie 3 (2)

gdzie Tzaczynai, a Tkończyi to znaczniki czasowe oznaczające odpowiednio początek i koniec przetwarzania i-tego zapytania. Opóźnienia są raportowane w s i rejestrują responsywność systemu, obejmując wszystkie etapy od przetwarzania danych wejściowych po generowanie odpowiedzi.

Metoda

Aby wdrożyć SCD-QA, w niniejszym artykule uwzględniono następujące badania testowe.

Zbiór danych SCD-QA: Proponowany zestaw danych30 jest wprowadzany do implementacji systemu SCD-QA. Ten zbiór danych pochodzi z korpusu tekstów zawierającego zasady doktoranckie na rok20228, dotyczące wytycznych dla studentów z NIT Arunachal Pradesh, Indie. Aby ustanowić system SCD-QA, konieczne jest wygenerowanie pliku JSON, który zawiera wszystkie istotne informacje w precyzyjnym formacie. Zbiór danych jest generowany z korpusu tekstowego za pomocą narzędzia Haystack annotation tool (wersja 2.18.1)31, otwartoźródłowego frameworka. To narzędzie ułatwia tworzenie zbioru danych SCD-QA w stylu SQuAD14. Kroki tworzenia anotowanego zbioru danych typu SQuAD z pliku PDF przedstawiono na Rysunku 7, a struktura naszego zbioru danych w stylu SQuAD została zilustrowana na Rysunku 8.

Rysunek 7
Rysunek 7: Kroki tworzenia annotowanego zbioru danych z pliku PDF.Rysunek ilustruje stopniowy przepływ pracy przy tworzeniu anotowanego zbioru danych w stylu SQuAD przy użyciu narzędzi Haystack. Opisuje proces od wyodrębniania tekstu z PDF-ów, czyszczenia i dzielenia na fragmenty, ręcznego adnotowania par pytanie-odpowiedź, przechowywania adnotacji w formacie JSON SQuAD, aż po eksport zbioru danych do treningu modelu. Proszę kliknąć tutaj, aby zobaczyć większą wersję tego rysunku.

Rysunek 8
Rysunek 8: Struktura factoid dataset QA. Rysunek przedstawia strukturę danych JSON, która reprezentuje paragraf i parę QA ze zbioru danych. Zawiera sekcję akapitów, która zawiera zestaw pytań i odpowiedzi. Jedno z pytań brzmi: Jaki jest minimalny wymagany punkt, aby dostać się na studia doktoranckie z nauk ścisłych? Każde pytanie ma identyfikator i zestaw odpowiedzi. Odpowiedź zawiera identyfikator dokumentu, identyfikator pytania, tekst 60% punktów, pozycję początkową odpowiedzi oraz nieokreśloną kategorię odpowiedzi. Flaga is_impossible jest ustawiona na false. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figury.

Zbiór danych jest ustrukturyzowany jako lista słowników, gdzie każdy słownik zawiera kluczowe pola takie jak dane, akapity, pytanie, answer_id, document_id, question_id, tekst, answer_start, answer_end, is_impossible oraz kontekst.

dane: Zawiera ogólne informacje o odpowiedziach na pytania.
akapity: Określony kontekst, wraz z pytaniami i odpowiedziami.
pytanie: Konkretne pytanie.
answer_id: Unikalny numer identyfikacyjny dla każdego tekstu odpowiedzi.
document_id: Unikalny numer identyfikacyjny dla każdego kontekstu.
question_id: Unikalny numer identyfikacyjny dla każdego pytania.
tekst: Tekst odpowiedzi.
answer_start: Miejsce początkowe poprawnej odpowiedzi w kontekście.
answer_end: Lokalizacja poprawnej odpowiedzi na zakończenie odpowiedzi w kontekście.
is_impossible: Pokazuje, czy odpowiedź na zadane pytanie jest dostępna w danym kontekście, czy nie.
kontekst: Korpus tekstowy, z którego można znaleźć odpowiedź.
Wszystkie 80 pytań w proponowanym zbiorze danych ma format pytań factoid i non-factoid. Przykłady niektórych typów pytań w ramach przedstawiono w Tabeli 3.

Pytania
Kim jest PS?
Jaki jest rozmiar czcionki w nowoczesnym dokumencie?
Ile dni jest urlop macierzyński?

Tabela 3: Przykładowe pytanie z zestawu danych. Tabela przedstawia przykłady dwóch typów pytań: pierwszy i drugi to pytania faktoidalne, natomiast trzeci to pytanie nie-factoid.

FAISS: FAISS (wersja faiss_cpu-1.9.0)29,32, opracowany przez Facebook AI Research (FAIR), to otwartoźródłowa biblioteka, która ułatwia efektywne wyszukiwanie podobieństw i klasteryzację gęstych wektorów. Jest specjalnie zaprojektowany do efektywnego zarządzania dużymi, wysokowymiarowymi danymi. System ten umożliwia szybkie i skalowalne wyszukiwania ANN w zbiorach danych składających się z milionów lub miliardów wektorów. Jest szeroko wykorzystywany w aplikacjach związanych z osadzeniami, w tym w NLP, systemach rekomendacji oraz wyszukiwaniu obrazów lub wideo. FAISS oferuje wiele metod indeksowania, w tym Flat (brute force), Inverted File (IVF), hierarchicznie nawigowalne małe światowe grafy (HNSW) oraz kwantyzację produktu (PQ). Metody te pozwalają użytkownikom optymalizować wydajność wyszukiwania zgodnie z rozmiarem danych, wymiarowością i specyfikacjami sprzętowymi. W tym badaniu zastosowano indeksowanie płaskie, które wykonuje przeszukiwanie brute-force z wykorzystością odległości L2 (euklidesowej) do identyfikacji najbliższych sąsiadów. Skalowalność systemu obsługuje zarówno implementacje CPU, jak i GPU, umożliwiając wysokowydajne obliczenia na rozległych zbiorach danych. Dodatkowo zapewnia elastyczność w optymalizacji równowagi między szybkością a dokładnością w zależności od wymagań konkretnych zastosowań. FAISS jest często stosowany w NLP do oceny podobieństwa semantycznego w osadzeniach, takich jak czy Word2Vec. FAISS jest wykorzystywany w QAS do przechowywania i zarządzania reprezentacjami wektorowymi dokumentów lub zdań. Wykonuje przybliżone wyszukiwania ANN33, aby uzyskać najbardziej istotny kontekst dla pytań użytkowników, wzbogacając wyszukiwanie semantyczne o osadzenia z modeli transformatorów, takich jak. FAISS jest podstawowym narzędziem w procesach pracy AI i ML ze względu na swoją wszechstronność.

Model-large-uncased-whole-word-masking-finetuned-SQuAD: Niniejsze prace wykorzystują wstępnie wytrenowany model językowy znany jako-large-uncased-whole-word-masking finetuned-squad9 do opracowania factoid QAS z wykorzystaniem zaproponowanego w badaniu zbioru danych. Model przeszedł wstępne szkolenie na BookCorpus, zbiorze danych 11 038 niepublikowanych książek9, a także na angielskiej Wikipedii, z wyjątkiem list, tabel i nagłówków. Model jest bez przepustek, co oznacza, że nie rozróżnia słów english od English. Model jest wstępnie wytrenowanym modelem transformatora, który został wytrenowany na znacznej ilości danych z języka angielskiego przy użyciu podejścia samonadzorowanego. Model był wstępnie trenowany wyłącznie na surowych tekstach, bez żadnych ludzkich adnotacji. Pozwala to na wykorzystanie dużej ilości publicznie dostępnych danych. Proces wstępnego treningu polega na automatycznym generowaniu wejść i etykiet z dostarczonych tekstów. Model został wytrenowany z dwoma konkretnymi celami:9:

MLM: Proces polega na losowym maskowaniu 15% słów w zdaniu wejściowym. Model następnie przetwarza całe zamaskowane zdanie i przewiduje zamaskowane słowa. To podejście różni się od konwencjonalnych sieci rekurencyjnych neuronowych (RNN), które zazwyczaj przetwarzają słowa sekwencyjnie, oraz od modeli autoregresywnych, takich jak GPT, które wykorzystują wewnętrzne maskowanie przyszłych tokenów. Funkcjonalność ta pozwala modelowi uzyskać dwukierunkową reprezentację zdania.

NSP: W fazie wstępnego treningu model łączy dwa ukryte zdania jako dane wejściowe. W niektórych przypadkach te zdania są sąsiadujące w oryginalnym tekście, co wskazuje na bezpośredni związek. W innych przypadkach nie są, co oznacza, że nie ma oryginalnej bliskości ani kontekstu łączącego je. Kolejny krok polega na przewidywaniu przez model, czy oba zdania są logicznie spójne.

Obecny model charakteryzuje się następującą konfiguracją: architektura modelu składa się z 24 warstw, o ukrytym wymiarze 1024. Wykorzystuje 16 głowic uwagi i łącznie 336 milionów parametrów9.

WordPiece służy do tokenizacji tekstów o rozmiarze słownictwa 30 000 słów w etapach wstępnego przetwarzania. Wejścia modelu wyglądałyby wtedy tak: [CLS] Zdanie A [SEP] Zdanie B [SEP]. Jedynym wymogiem jest, aby łączna długość zdań była krótsza niż 512 tokenów9. Konkretny model wstępnie wytrenowany daje następujący wynik: uzyskany wynik F1 to 93,15%, natomiast dokładny wynik meczu to 86,91%9%.

Model Distilbert/distilbert-base-cased-distilled-squad: Model DistilBERT10 to bardziej kompaktowa, szybsza i wydajna odmiana modelu9 , opracowana tak, aby zachować większość semantycznych zdolności do rozumienia, jednocześnie będąc mniej wymagającym zasobów i bardziej odpowiednim do praktycznych zastosowań o ograniczonych możliwościach obliczeniowych. Wersja distilbert-base-cased-distilled-squad została dopracowana na SQuAD14 pod kątem zadań QA. Model wykorzystuje architekturę transformatora, w tym zmniejszony rozmiar o 66 milionów parametrów w porównaniu do 110 milionów, zachowując jednocześnie 97% skuteczności w rozumieniu języka. DistilBERT osiąga to metodą znaną jako destylacja wiedzy, która przekazuje informacje z większego modelu do bardziej zwartego modelu DistilBERT. Dzięki mniejszym rozmiarom może szybciej wnioskować informacje i zużywać mniej pamięci, co czyni go idealnym dla aplikacji o ograniczonych zasobach, takich jak urządzenia mobilne czy edge. Model, starannie dopracowany na zbiorze danych SQuAD 1.1, wykazuje wyjątkową biegłość w zadaniach QA ekstrakcyjnych, gdzie celem jest zlokalizowanie fragmentu tekstu z określonego kontekstu, który odpowiada na pytanie. DistilBERT osiąga około 85% wyniku w F1 na liście wyników SQuAD i zachowuje znaczną część jego zdolności językowych, mimo zmniejszonego rozmiaru. Model ten jest wyjątkowo wydajnym rozwiązaniem dla zadań QA na poziomie produkcyjnym, optymalizując zarówno wydajność, jak i efektywność obliczeniową.

Deepset/roberta-base-squad2: Model12,13 deepset/roberta-base-squad2 to dopracowana wersja architektury RoBERTa. Jest specjalnie zaprojektowany dla zbioru danych SQuAD14 2.0, który zawiera zarówno pytania odpowiedzialne, jak i nieodpowiedzialne. Ten ulepszony framework RoBERTa eliminuje9 zadań NSP w. Wykorzystuje także dynamiczne maskowanie podczas treningu, aby zwiększyć efektywność i wydajność w zadaniach związanych ze zrozumieniem języka językowego. Model ma 125 milionów parametrów i wykorzystuje dwukierunkowy transformator. Pozwala to na pozyskiwanie informacji kontekstowych z obu stron i doskonalenie radzi sobie w zadaniach QA ekstrakcyjnych.

Dostrojenie w SQuAD 2.0 pozwala modelowi zidentyfikować poprawny zakres odpowiedzi w danym kontekście oraz rozpoznać, gdy nie ma odpowiedzi. Wykorzystuje tokenizator Byte Pair Encoding (BPE), który obsługuje tokenizację podsłów i zachowuje czułość na wielka litera. To poprawia jego zdolność do przetwarzania rzadkich i złożonych słów. Model radzi sobie dobrze, osiągając około 85%-90% F1 oraz 80%-85% EM. Jego zdolność do wykrywania nieodpowiedzialnych pytań oraz skuteczne wdrożenie czynią go cennym w obsłudze klienta, wyszukiwaniu wiedzy oraz wirtualnych asystentach.

Najskuteczniejszym sposobem na wdrożenie modeli dostrojonych przez SQuAD do QA jest wykorzystanie pipeline34 Hugging Face Transformers. Ten framework usprawnia tokenizację, formatowanie wejściowe, ładowanie modeli oraz postprodukcję wyników. Modele te są powszechnie uznawane za skuteczność w ekstrakcji QA, gdzie odpowiedzią jest fragment tekstu bezpośrednio pobrany z danego kontekstu. Aby wyznaczyć implementację, następująca procedura opisuje kroki uruchamiania modeli.

Wkład i konfiguracja: Proces ten wymaga czterech głównych danych wejściowych i parametrów konfiguracji: nazwy modelu, określonej jako identyfikator ciągu z Hugging Face Hub (na przykład google-/-large-large-large-cased-whole-word-masking-finetuned-squad, distilbert/distilbert-base-cased-distilled-squad lub deepset/roberta-base-squad2); pytanie (Q), podany jako ciąg zawierający zapytanie; oraz kontekst (C), ciąg reprezentujący odpowiedni tekst lub fragment. Głównym narzędziem używanym jest funkcja potoku wysokiego poziomu z biblioteki Hugging Face transformers (wersja 4.57.0) w Pythonie (wersja 3.12.12).

Proces: Wykonanie (Pipeline Hugging Face): Proces składa się z sześciu podstawowych etapów i wykorzystuje pipeline Hugging Face do rozwiązania złożoności zadania QA:

Biblioteka instalacyjna: Zacznij od zainstalowania wymaganej biblioteki z transformatorami instalacji poleceń. Ta instalacja umożliwia dostęp do modeli oraz uproszczonej funkcjonalności potoków.

Import Pipeline: Import funkcji potoku używając: z transformatorów importuj potok.

Inicjalizacja potoku QA: Zainicjalizuj potok QA używając qa_pipeline = pipeline ("question-answering", model=""). To polecenie pobiera model i tokenizer, przygotowując je do wnioskowania.

Zdefiniuj input: Pytanie o ustaw = ... a kontekst = ... do przygotowania danych modelu.

Wnioskowanie o biegu: Przekaż pytanie i kontekst do potoku z wynikiem = qa_pipeline(pytanie=pytanie, kontekst=kontekst). Model przetwarza dane wejściowe i dostarcza odpowiedzi.

Odpowiedź z fragmentu: Pobierz ciąg odpowiedzi ze słownika wyjściowego używając: answer = result['answer'].

Wyjście: Proces generuje kilka parametrów wyjściowych w następującej kolejności: Odpowiedź (wyodrębniony fragment tekstu z kontekstu, przedstawiony jako ciąg znaków), Score (wartość zmiennoprzecinkowa kwantyfikująca pewność modelu w jego przewidywaniu) oraz indeksy Start i End (liczby całkowite określające pozycje znaków w zakresie odpowiedzi w kontekście).

Transformery zdań/all-MiniLM-L6-v2: Wersja35 w całości MiniLM-L6-v2 to pretrenowany transformator zdań z biblioteki Sentence-Transformers (wersja 5.1.1)36. Jest zoptymalizowany pod kątem efektywnego i precyzyjnego osadzania tekstu. Opracowany na frameworku Microsoft MiniLM, zawiera sześć warstw transformerów oraz 384-wymiarowe osadzenia. Ten projekt równoważy wydajność z biegłością obliczeniową, co czyni go odpowiednim do zastosowań w czasie rzeczywistym. Model został wytrenowany na ponad miliardzie par frazowych z zestawów danych takich jak SNLI, MultiNLI, benchmarki STS oraz dane z indeksowania internetowego. W rezultacie wykazuje biegłość w zadaniach związanych z podobieństwem semanticznym, grupowaniem oraz wyszukiwaniem. Dzięki niewielkiemu rozmiarowi (~22MB) i zwiększonej wydajności wnioskowania, all-MiniLM-L6-v2 upraszcza aplikacje takie jak wyszukiwanie semanticzne, wykrywanie duplikacji czy kategoryzacja tekstu. Mimo że jest lekki, zapewnia dużą dokładność w testach takich jak STS-B i SICK-R, co czyni go skutecznym wyborem zarówno w scenariuszach skalowalnych, jak i ograniczonych zasobów. Sposób generowania osadzenia za pomocą Sentence-Transformer przedstawiono na Rysunku 9 poniżej.

Rysunek 9
Rysunek 9: Krok procesu osadzania z wykorzystaniem modelu transformatora zdań. Rysunek ilustruje sposób generowania osadzeń tekstowych z wykorzystaniem frameworka transformers zdań. Opisuje on proces od importu bibliotek i załadowania wstępnie wytrenowanego modelu po przygotowanie danych tekstowych, generowanie osadzeń, konwersję ich na tablice NumPy oraz przechowywanie do zadań kolejnych, takich jak indeksowanie czy wyszukiwanie podobieństw. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

Proponowany algorytm: Niniejsze badanie przedstawia sugerowaną metodologię w Algorytmie 1 do opracowania systemu SCD-QA opartego na SeCD, zdolnego do odpowiadania zarówno na pytania faktograficzne, jak i nie-factoidalne zadawane przez użytkowników.

ALGORYTM 1: Algorytm proponowanego systemu SCD-QA opartego na SeCD
Input: Zestaw surowego pliku kontekstowego (C) oraz zapytanie użytkownika (Q).
Wyjście: Wybrany optymalny LLM oparty na transformatorze (M') oraz odpowiedź generowana przez M'.
Wstępne przetwarzanie kontekstów: Oznacz surowy zestaw kontekstowy C, aby stworzyć strukturalny zbiór danych w formacieD SQuAD .
DSQuAD = fannonowaty (C)
Generuj osadzenia kontekstu: Użyj Sentence-Transformer fembed , aby przekonwertować każdy kontekst c Równanie 100 DSQuAD w osadzenie ec.
Równanie 15
Przechowywanie osadzeń: Przechowywanie Ec w wektorowej bazie V dla efektywnego wyszukiwania podobieństw.
Równanie 18
Generuj osadzenie zapytań: Przekształc zapytanie użytkownika Q w osadzającee q , używając tego samego transformatora zdań.
Równanie 20
Wyszukiwanie kontekstu: Pobierz najbardziej istotne osadzenie kontekstu Równanie 21 z bazy V na podstawie podobieństwa do eq.
Równanie 22
gdzie sim(eq,e c) jest funkcją podobieństwa.
Przekazanie kontekstu do LLM: Włóż odzyskany kontekst Równanie 21 do 3 LLM opartych na transformatorach: Google-(M1), DistilBERT (M2), RoBERTa (M3) oraz tradycyjny model: TF-IDF+Cosine Similarity (M4)
Równanie 28
Ocena modelu: Porównaj odpowiedzi {R1,R 2,R 3,R 4} za pomocą funkcji oceny fevaluacji, która ocenia każdą odpowiedź.
Równanie 31
Wybierz najlepszy model: Zidentyfikuj model M' z najwyższą oceną S'
Równanie 33
Wygeneruj końcowy wynik: Użyj M' do wygenerowania ostatecznej odpowiedzi R na podstawieRównanie 36
Równanie 37
Koniec

Proponowany proces algorytmiczny przedstawia systematyczne podejście (rysunek 10) do wyboru idealnego modelu LLM opartego na transformatorze, aby odpowiadać na pytania użytkowników. Obejmuje wstępne przetwarzanie, wyszukiwanie kontekstu oparte na osadzaniu oraz ocenę wielomodelową, aby zapewnić wysoką jakość i kontekstowo istotne odpowiedzi. Poniżej wyjaśniono krok po kroku proces dla jasności:

Przygotowanie i wstępne przetwarzanie danych: Pierwsza faza obejmuje przetwarzanie surowych danych tekstowych-

Input: Surowe pliki tekstowe8 są adaptowane do systemu.

Narzędzie do adnotacji31: Dane wejściowe są przekształcane w ustrukturyzowany zbiór danych w formacie SQuAD14 . Ten etap polega na tworzeniu par QA. Organizuje także istotne dane tekstowe w dobrze zdefiniowane bloki kontekstowe.

Wyjście: Zbiór danych jest już gotowy do tworzenia osadzeń.

Generowanie osadzenia kontekstu: Aby umożliwić efektywne i skalowalne pobieranie kontekstu, do zestawu danych z adnotacjami stosuje się wytrenowany model Sentence-Transformer35,36. Ten transformator przekształca tekst w wysokowymiarowe osadzenia, które oddają znaczenie semantyczne. Osadzenia są przechowywane w VD, FAISS29,32, aby umożliwić szybkie wyszukiwania oparte na podobieństwach.

Przetwarzanie zapytań użytkownika: Gdy użytkownik wysyła pytanie, pytanie jest przetwarzane przez ten sam Transformator Zdań35,36. Generuje to odpowiadające osadzenie w tej samej przestrzeni wektorowej29,32 co osadzenia kontekstowe. Taki projekt zapewnia, że zapytanie może być dopasowane do odpowiednich wpisów kontekstowych.

Wyszukiwanie kontekstu za pomocą podobieństwa wektorowego: Korzystając z metryki podobieństwa (np. podobieństwa cosinusowego), system porównuje zapytanie z zapisanymi osadzeniami kontekstowymi. System wybiera najbardziej istotny kontekst na podstawie najwyższego wyniku podobieństwa. Zapewnia to, że do modeli dalszych przekazywany jest tylko istotny kontekst. Proces ten zmniejsza narzut obliczeniowy i zwiększa jego przydatność.

Ocena modelu na wielu LLM: Wybrany kontekst jest oceniany przez trzy LLM oparte na transformatorach: Google-28, DistilBERT10 oraz RoBERTa12. Jest również oceniany przez tradycyjny oparty na słowach kluczowych TF-IDF37 z modelem podobieństwa kosinusowego. Każdy model przetwarza kontekst i generuje odpowiedź na pytanie użytkownika.

Ocena porównawcza: Odpowiedzi z czterech modeli LLM są oceniane na podstawie dwóch kluczowych wskaźników. Po pierwsze, dopasowywanie semantyczne jest oceniane przez EM14. Po drugie, latencja modelu jest analizowana przez średnią reakcję czasów15.

Wybór modelu i końcowy wynik: Najlepiej działający model jest wybierany jako odpowiedni LLM dla pytania użytkownika. Ostateczna odpowiedź wybranego modelu jest rozpatrywana. Zapewnia to równowagę między efektywnością obliczeniową a jakością odpowiedzi.

Rysunek 10
Rysunek 10: Przepływ pracy systemu SCD-QA z wykorzystaniem modeli opartych na transformatorach.Rysunek pokazuje, jak działa system SCD-QA. Najpierw surowy plik kontekstowy jest przetwarzany przez narzędzie adnotacji, aby utworzyć zbiór danych w formacie SQuAD. Następnie transformator zdań generuje osadzenia, które są przechowywane w wektorowej bazie FAISS. Gdy użytkownik zadaje pytanie, system tworzy dla niego osadzenie i wybiera najbardziej istotny kontekst. Porównuje trzy modele oparte na transformatorach – Google-, DistilBERT i RoBERTa – oraz jeden tradycyjny wskaźnik podobieństwa kosinusowego TFIDF + cosinus – i wykorzystuje najlepiej działający model do uzyskania odpowiedzi. Proszę kliknąć tutaj, aby zobaczyć większą wersję tego wykresu.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Implementacja systemu SCD-QA wykorzystywała cztery LLM oraz zestaw danych składający się z 80 pytań factoid i non-factoid. Przetwarzanie odbywało się w Google Colab, wykorzystując karty graficzne NVIDIA Tesla T4 (wersja sterownika: 550.54.15, wersja CUDA: 12.4) z 12,7GB pamięci RAM systemowej, 15GB RAM GPU oraz 112,6GB miejsca na dysku. Wydajność modelu oceniano za pomocą dwóch metryk: EM14 dla dopasowywania semantycznego oraz latencję modelu15

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejsze badanie wprowadza system SCD-QA, który wykorzystuje modele językowe oparte na transformatorach do dostarczania precyzyjnych, kontekstowych odpowiedzi na podstawie ustrukturyzowanych dokumentów instytucjonalnych. Przepływ pracy systemu składa się z: (1) wstępnego przetwarzania danych; (2) generowanie osadzenia przy użyciu nowoczesnego transformatora zdań, all-MiniLM-L6-v2; (3) wyszukiwanie oparte na podobieństwach poprzez FAISS; oraz (4) kompleksową ocenę modelu. Pipeline został przetestowany na zbiorze danych S...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają nic do ujawnienia.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy serdecznie dziękują oddanej kadrze naukowej i administracji NIT Arunachal Pradesh za niezachwiane wsparcie i wskazówki podczas całego tego badania. Dodatkowo jesteśmy głęboko wdzięczni twórcom i współtwórcom otwartych narzędzi NLP oraz pretrenowanych modeli, których praca umożliwiła realizację tych badań. Podczas przygotowywania tego rękopisu autorzy użyli Grammarly Proofreader, aby zwiększyć przejrzystość. Autorzy biorą pełną odpowiedzialność za dokładność i integralność treści.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
całkowicie MiniLM-L6-v2MicrosoftWersja 5.1.1Model transformatora zdań wstępnie wytrenowany do generowania osadzeń o wysokich wymiarach. Konwertuje tekst na osadzenia w celu wyszukiwania kontekstu.
Narzędzie do adnotacjiStógWersja 2.18.1Platforma do strukturyzowania surowego tekstu w formacie SQuAD. Przygotowuje zbiór danych, tworząc pary QA i bloki kontekstowe.
DistilBERT ModelPrzytulająca się twarzNIELekki LLM oparty na transformatorach z mniejszymi wymaganiami obliczeniowymi. Oceniony pod kątem porównania, oferuje niższe opóźnienia, ale mniejszą dokładność.
FAISS VDFacebookfaiss_cpu-1.9.0Skalowalny system vok do wyszukiwania opartego na podobieństwach. Przechowuje i pobiera wysokowymiarowe osadzenia dla efektywnego dopasowania zapytań.
Google-BERT ModelGoogleNIEPretrenowany LLM oparty na transformerach z dwukierunkowym modelowaniem kontekstu. Podstawowy model generowania dokładnych odpowiedzi na zapytania faktoidalne i niefactoidowe.
Karty graficzne NVIDIA Tesla T4NVIDIAWersja sterownika: 550.54.15
Wersja CUDA: 12.4
GPU z 15 GB pamięci RAM GPU do wnioskowania modeli. Zapewnia moc obliczeniową do przetwarzania i oceny LLM.
PytonPython Software Foundationwersja 3.12.12Python jest wiodącym językiem programowania w dziedzinie przetwarzania języka naturalnego (NLP) ze względu na swoją prostą składnię, rozbudowane biblioteki oraz silne wsparcie społeczności. Obsługuje szeroki zakres zadań NLP, w tym podstawowe wstępne przetwarzanie tekstu oraz złożone implementacje uczenia maszynowego.
RoBERTa ModelDeepsetNIEZoptymalizowany LLM oparty na transformatorze z ulepszonymi strategiami treningowymi. Oceniane pod kątem porównania, równoważą dokładność i opóźnienia.
Zbiór danych SCD-QA jako SQuAD  FormatNIEWersja 2.0Standaryzowany format dla par pytań-odpowiedź. Zbiór danych Structures dla kompatybilności z modelami transformatorów.

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Pirtoaca, G. S., Rebedea, T., Ruseti, S. Improving retrieval-based question answering with deep inference models. Int Joint Conf Neural Network. , 1-8 (2019).
  2. NLP-QA framework based on LSTM-RNN. Zhang, X., Chen, M. H., Qin, Y. Int Conf Data Sci Business Anal, , 307-311 (2018).
  3. Natural language processing based new approach to design factoid question answering system. Machhirke, V. S., Soni, A. Second Int Conf Inventive Res Computing Appl, , 276-281 (2020).
  4. Biancofiore, G. M., Deldjoo, Y., Di Noia, T., Di Sciascio, E., Narducci, F. Interactive question answering systems: literature review. ACM Comput Surv. 1 (1), Article 1(2024).
  5. Singh, S., Das, N., Michael, R., Tanwar, P. The question answering system using NLP and AI. Int J Sci Eng Res. 7 (12), 2229-5518 (2016).
  6. Pandya, H. A., Bhatt, B. S. Question answering survey: Directions, challenges, datasets, evaluation matrices. arXiv. , (2021).
  7. Khvalchik, M. A., Kulkarni, K. Open-domain non-factoid question answering. , Springer International Publishing. Cham. (2017).
  8. NIT Arunachal Pradesh PhD rules and regulations year. , National Institute of Technology Arunachal Pradesh. https://www.nitap.ac.in/storage/pdf/140508582e7c89a8b2295595085e3abe-%2003-37-28F%20IN%20AL.pdf (2022).
  9. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. BERT: Pre-training of deep bidirectional transformers for language understanding. Proc NAACL-HLT. , 4171-4186 (2019).
  10. Sanh, V., Debut, L., Chaumond, J., Wolf, T. DistilBERT, a distilled version of BERT: Smaller, faster, cheaper and lighter. arXiv. , (2019).
  11. DistilBERT HuggingFace. , https://huggingface.co/distilbert/distilbert-base-cased-distilled-squad (2023).
  12. Liu, Y., et al. A robustly optimized BERT pretraining approach. arXiv. , (2019).
  13. RoBERTa base squad2. Deepset. , https://huggingface.co/deepset/roberta-base-squad2 (2023).
  14. SQuAD: 100,000+ questions for machine comprehension of text. Rajpurkar, P., Zhang, J., Lopyrev, K., Liang, P. Proc 2016 Conf Empirical Meth Natural Language Proc, , 2383-2392 (2016).
  15. Attention is all you need. Vaswani, A., et al. 31st Conf Neural Informat Proc Syst, , 1-11 (2017).
  16. Malkov, Y. A., Yashunin, D. A. Efficient and robust approximate nearest neighbor search using hierarchical navigable small world graphs. IEEE Trans Pattern Anal Mach Intell. 42 (4), 824-836 (2018).
  17. Similarity search in high dimensions via hashing. Gionis, A., Indyk, P., Motwani, R. Proc 25th VLDB Conf, , 518-529 (1999).
  18. HIJLI_JU at SemEval-2024 task 7: Enhancing quantitative question answering using fine-tuned BERT models. Sengupta, P., Sarkar, S., Das, D. Proc 18th Int Workshop Semantic Evaluat, , 279-284 (2024).
  19. Kocoń, J., et al. ChatGPT: Jack of all trades, master of none. Inf Fusion. 99, 101861(2023).
  20. Fine-tuning strategies for domain specific question answering under low annotation budget constraints. Guo, K., Diefenbach, D., Gourru, A., Gravier, C. IEEE 35th Int Conf Tools with Artificial Intell, , 166-171 (2023).
  21. Question answering on biomedical research papers using transfer learning on BERT-base models. Pudasaini, S., Shakya, S. 7th Int Conf I-SMAC (IoT in Social, Mobile, Analytics and Cloud), , 496-501 (2023).
  22. Knowledge-augmented language model prompting for zero-shot knowledge graph question answering. Baek, J., Aji, A. F., Saffari, A. Proc 1st Workshop Natural Language Reasoning Struct Explanat, , 78-106 (2023).
  23. Hu, S., Zhang, H., Zhang, W. Domain knowledge graph question answering based on semantic analysis and data augmentation. Appl Sci. 13 (15), (2023).
  24. A BERT-based approach for knowledge base question answering. Luo, D., Su, J., Yu, S. Int Joint Conf Neural Networks, , 1-8 (2020).
  25. Wu, C., et al. Retrieval augmented generation-driven information retrieval and question answering in construction management. Adv Eng Inform. 65, 103158(2025).
  26. Peng, C., et al. A study of generative large language model for medical research and healthcare. NPJ Digit Med. 6 (1), 210(2023).
  27. Gardazi, N. M., et al. applications in natural language processing: a review. Artif Intell Rev. 58 (6), 1-49 (2025).
  28. Sabharwal, N., Agrawal, A. Hands-on question answering systems with BERT: applications in neural networks and natural language processing. , Apress Berkeley. CA. (2021).
  29. FAISS documentation. , https://faiss.ai/ (2025).
  30. Bhattacharya, D. SCD-QA dataset. Zenodo. , (2025).
  31. Annotation tool. , https://docs.haystack.deepset.ai/docs/annotation (2025).
  32. Johnson, J., Douze, M., Jégou, H. Billion-scale similarity search with GPUs. IEEE Transac Big Data. 7 (3), 535-547 (2021).
  33. Sun, P., Guo, R., Kumar, S. Automating nearest neighbor search configuration with constrained optimization. arXiv. , (2023).
  34. BERT. , Hugging Face. https://huggingface.co/docs/transformers/model_doc/bert (2025).
  35. MiniLM: Deep self-attention distillation for task-agnostic compression of pre-trained transformers. Wang, W., et al. Proc 34th Int Conf Neural Informat Process Syst, , 5776-5788 (2020).
  36. Sentence transformer documentation. , https://www.sbert.net/ (2025).
  37. Cosine similarity to determine similarity measure: study case in online essay assessment. Lahitani, A. R., Permanasari, A. E., Setiawan, N. A. 4th Int Conf Cyber IT Service Manag, , 1-6 (2016).
  38. A comparative analysis of transformer models in zero-shot text classification. Kyritsis, K., Liapis, C. M., Spatiotis, N., Perikos, I., Paraskevas, M. 15th Int Conf Informat Intelligence Syst Applicat, , 1-4 (2024).
  39. Howard, J., Ruder, S. Universal language model fine-tuning for text classification. Proc 56th Ann Meeting Associat Computat Linguistics. , 328-339 (2018).
  40. Asai, A., Hashimoto, K., Hajishirzi, H., Socher, R., Xiong, C. Learning to retrieve reasoning paths over Wikipedia graph for question answering. arXiv. , (2019).
  41. Lewis, P., et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. arXiv. , (2021).
  42. Leveraging passage retrieval with generative models for open domain question answering. Izacard, G., Grave, E. Proc Conf Eur Chapter Associat Computat Linguistics, , 874-880 (2021).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Modele transformeraQA w domenie zamkni tejzbi r danych SQuADpytania faktoidalnepytania niefaktoidalnemodel TF IDFpodobie stwo cosinusowedopasowywanie synonim w

Powiązane artykuły