Forschungsartikel

Semantisches Frage-Antwort-System mit geschlossener Domäne als Anwendungsfall von transformatorbasierten BERT-Modellen

DOI:

10.3791/69424

14. November 2025

In diesem Artikel

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Diese Studie entwirft ein adaptives Lernsystem zur Extraktion von Wissen aus Text, um Fragen zu beantworten, indem das Google-BERT-, DistilBERT-, RoBERTa- und TF-IDF-Modell unter Verwendung von Kosinusähnlichkeit auf Latenz und semantische Generalisierung verglichen wird. Google-BERT schneidet am besten ab, obwohl das System anfällig für Rechtschreibfehler bleibt, was die Notwendigkeit einer starken Vorverarbeitung für die praktische Anwendung unterstreicht.

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Um Wissen aus Textdateien zu extrahieren und die Fragen der Nutzer zu beantworten, indem die richtigen Informationen im Kontext gefunden werden, ist ein adaptives Lernsystem, wie z. B. ein Frage-Antwort-System (QAS), für diesen Zweck konzipiert. Dieser Schwerpunkt fördert weitere Studien zu Direct-Answer-Systemen und der Verwendung groß angelegter Tests für Frage-Antwort-Aufgaben (QA). Um dies zu erleichtern, wird ein Semantic Closed-domain QA (SCD-QA)-Datensatz verwendet, der sowohl faktoide als auch nicht-faktoide Fragen umfasst, in Verbindung mit vortrainierten Transformermodellen. In dieser Studie wird die Fähigkeit, Schlussfolgerungen zu ziehen, gemessen und verglichen zwischen drei vortrainierten Transformatormodellen, wie Google-BERT, DistilBERT und RoBERTa, auf dem SQuAD-Datensatz und einem klassischen schlüsselwortbasierten TF-IDF-Modell mit Kosinusähnlichkeit. Die Ergebnisse zeigen, dass Google-BERT mit einem mittleren EM-Wert (Exact Match) von 90,0 und einer mittleren Latenz von 1,27 s am besten abschneidet. Das System schneidet auch bei Fragen mit Synonymen gut ab und zeigt ein ausgeprägtes Verständnis der Bedeutung. Bei Fragen mit Rechtschreibfehlern schneidet sie jedoch unzureichend ab, was darauf hindeutet, dass sie empfindlich auf Rechtschreibfehler reagiert und eine bessere frühzeitige Verarbeitung erfordert.

Einleitung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Natural Language Processing (NLP) ist ein Teilbereich der Künstlichen Intelligenz (KI), in dem QAS erstellt werden kann, das es Computersystemen ermöglicht, automatisch Antworten auf Fragenzu generieren 1. NLP konzentriert sich in erster Linie auf das Verstehen und Interpretieren von geschriebener Sprache in einer Weise, die die kognitiven Prozesse des menschlichen Gehirns nachahmt2. Die Beschäftigung mit diesen Aufgaben etabliert NLP als eine entscheidende Technik bei der Konstruktion eines Systems, das in der Lage ist, menschenähnliche Reaktionen zu erzeugen.

QAS, das auf die Fragen des Benutzers antwortet, ist ein Beispiel für die Verwendung von NLP3. QAS ist ein Untersuchungsbereich, der Forschungsergebnisse aus verschiedenen Bereichen mit gemeinsamen Fragestellungen umfasst, wie z. B. Information Retrieval (IR), Information Extraction (IE) und NLP. Gegenwärtig führen moderne Suchmaschinen in erster Linie Aufgaben zum Abrufen von Dokumentendurch 4. Mit anderen Worten, wenn diese Suchmaschinen mit bestimmten Schlüsselwörtern versehen sind, liefern sie ausschließlich eine Liste relevanter Dokumente, die nach Relevanz geordnet sind und die angegebenen Schlüsselwörter enthalten. Sie geben keine genaue Antwort. Der Zweck der Qualitätssicherung besteht darin, Einzelpersonen dabei zu helfen, genaue Antworten auf bestimmte Fragen innerhalb begrenzter Themenbereichezu finden 5. Die Gruppierung von QAS kann auf der Grundlage der folgenden Kategorien erfolgen, die in Abbildung 16 dargestellt sind. Sowohl das faktoide als auch das nicht-faktoide QAS arbeiten mit natürlicher Sprache (NL) und sind so konzipiert, dass sie auf Fragen antworten, die in NL gestellt werden. Das System verwendet NLP-Techniken, um Antworten auf der Grundlage des verfügbaren Korpus7 zu geben.

Abbildung 1
Abbildung 1: Kategorisierung von QA-Systemen. Die Abbildung zeigt eine Mindmap der primären Komponenten eines QA-Systems. Im Mittelpunkt steht das QA-System, das verschiedene Arten von Fragen behandelt, darunter Faktoide, Nicht-Faktoide, Hybride, visuelle Fragen, Gesprächsfragen und Multiple-Choice-Fragen. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

In dieser Studie wird ein Semantic Closed-Domain Question Answering (SCD-QA) System vorgestellt, mit dem Benutzer in NL über Zulassungsrichtlinien und -verfahren für Doktoranden informiert werden können. Das System verwendet die Ph.D. Rules and Regulations PDF8 als Kernkontext und implementiert das transformatorbasierte Modell der bidirectional Encoder Representations from Transformers (BERT)9 als Hauptrahmen für die Generierung von Antworten. Ziel ist es, ein semantisch dialogorientiertes, FAQ-basiertes QAS zu entwerfen, das genaue Antworten auf häufig gestellte Fragen liefert und es neu zugelassenen Studenten erleichtert, schnell die wesentlichen Informationen zu finden, die sie benötigen.

Um dieses Ziel zu erreichen, wurden drei weithin bekannte transformatorbasierte BERT-Modelle verwendet: Google-BERT9, DistilBERT10,11 und RoBERTa12,13, die alle auf dem Stanford Question Answering Dataset (SQuAD)14 trainiert wurden. Ihre Leistung wurde anhand von zwei kritischen Parametern bewertet: dem semantischen Matching, gemessen mit Exact Match (EM)14, und der Modelllatenz15, analysiert anhand der mittleren Reaktionszeiten. Zusätzlich wurde eine Vektordatenbank (VD)16,17 verwendet, um semantische Einbettungen zu speichern, die das Abrufen des semantisch relevantesten Kontexts für eine Benutzerfrage auf der Grundlage semantischer Ähnlichkeitswerte erleichtern.

Literaturrecherche

Transformatorbasierte Modelle haben den Bereich des NLP überarbeitet und zu erheblichen Verbesserungen in der Qualitätssicherung geführt. Mit der Einführung von BERT9 wurden Transformatorenarchitekturen als wesentliche Komponente bei der Entwicklung einer robusten und präzisen Qualitätssicherung in den Vordergrund gerückt. In diesem Abschnitt wird ein umfassender Überblick über die jüngsten Verbesserungen bei transformerbasierten Modellen und semantischen Einbettungen gegeben, wobei der Schwerpunkt auf ihrer Relevanz für die QA des Semantic Conversational Dialogue (SeCD) liegt. Eine vergleichende Analyse wird durchgeführt, um die Integration dieser Modelle in diese Arbeit zu rechtfertigen und ihre Eignung zu betonen, aussagekräftige Erkenntnisse in diesem Bereich zu gewinnen.

Transformer-basierte Architekturen wie BERT, DistilBERT und RoBERTa verwenden die Selbstaufmerksamkeitsmethodik, um komplexe kontextuelle Beziehungen in Texten zu erfassen, was sie ideal für Aufgaben macht, die ein erhebliches semantisches Verständnis erfordern, wie z. B. QAS. Diese Modelle, zusammen mit spezialisierten Satztransformern, generieren semantische Einbettungen und ermöglichen so einen schnellen und präzisen Kontextabruf durch vektorbasierte Ähnlichkeitssuchen in SeCD QA. Jüngste Forschungsarbeiten konzentrieren sich auf die Verbesserung dieser Modelle und die Einbettung von Techniken, um den Durchsatz, die Skalierbarkeit und die Effizienz zu steigern, insbesondere für aufgabenspezifische Anwendungen wie SCD-QA.

Sengupta et al.18 stellten einen kreativen Ansatz vor, um die Multiple-Choice-Qualitätssicherung (MCQAS) für wissenschaftsbasierte Fragestellungen durch die Feinabstimmung von BERT-Modellen zu verbessern. In ihrem Framework bewerteten sie zunächst die verteilte semantische Ähnlichkeit zwischen den Frage-Antwort-Paaren und speisten diese Ähnlichkeitswerte dann zusammen mit den ursprünglichen Merkmalen in eine Klassifikationsschicht ein. Dieser kombinierte Ansatz erreichte einen F1-Score von 90,2 % im SciQ-Datensatz, was die Wirksamkeit von BERT bei aufgabenspezifischen QASs unterstreicht, die ein nuanciertes Verständnis und eine präzise Klassifizierung erfordern.

Cichecki et al.19 verglichen ChatGPT und fein abgestimmte BERT-Modelle für intelligente Design-Support-Systeme und stellten fest, dass fein abgestimmte BERT-Modelle Allzweck-Large Language Models (LLMs) wie ChatGPT bei domänenspezifischen Aufgaben übertreffen und einen F1-Score von 88,5 % bei einem individuell gestalteten Datensatz erreichen. Die Studie zeigt, wie wichtig domänenspezifisches Feintuning für die Verbesserung der Modellleistung in spezialisierten Anwendungen ist.

Guo et al.20 untersuchten die Effizienz aufgabenspezifischer Feinabstimmungsstrategien für QASs unter begrenzten Annotationsbudgets. Ihre Arbeit zeigte, dass ein doppelter Feinabstimmungsansatz – zunächst auf einem allgemeinen QA-Datensatz wie SQuAD, gefolgt von einer Feinabstimmung auf einem aufgabenspezifischen Datensatz – eine signifikante Verbesserung des F1-Scores um 15 % bei Datensätzen wie COVID-QA erzielt. Dieses Ergebnis unterstreicht die entscheidende Rolle der sequenziellen Feinabstimmung bei der Verbesserung der Leistung von SeCD-QASs.

Pudasaini und Shakya21 untersuchten die Anwendung fein abgestimmter BERT-Modelle für die Qualitätssicherung in biomedizinischen Forschungsarbeiten und berichteten EM- und F1-Werte von 83,89 % bzw. 89,67 % auf einem benutzerdefinierten biomedizinischen QA-Datensatz, der von PubMed stammte. Durch die Nutzung von Transfer Learning mit PubMedBERT verdeutlichte ihre Technik eine bemerkenswerte Fähigkeit, komplexe biomedizinische Anfragen zu verarbeiten, was das Potenzial einer aufgabenspezifischen Feinabstimmung in diesem Bereich unterstreicht.

Baek et al.22 schlugen das Knowledge-Augmented Language Model Prompting Framework für die Zero-Shot Knowledge Graph (KG) QA vor. Dieser Ansatz nutzt semantische Ähnlichkeiten, um relevante Fakten aus einem KG abzurufen und in die Eingabefrage einzubeziehen. Als Ergebnis erreichte es einen F1-Score von etwa 85 % bei KG-QA-Datensätzen. Die Arbeit veranschaulicht das Potenzial der Kombination von KGs und Transformatormodellen und hebt die Vorteile der Wissenserweiterung bei der Verbesserung der QS-Leistung hervor.

Hu et al.23 beschrieben ein QAS, das für den Bereich der Haushaltsregistrierung konzipiert wurde und ein KG neben BERT-basierten Modellen (RoBERTa-BiLSTM-MultiHeadAttention) für die Klassifizierung von Absichten und die semantische Analyse nutzt. Durch die Vereinfachung der Fragen in Einzelereignisentitäten und Intentionsbeziehungen wurde eine hohe Genauigkeit bei der Abfrage strukturierter Daten erreicht. Darüber hinaus unterstreicht die Skalierbarkeit der Methodik auf andere Domänen ihr Potenzial für eine breite Anwendbarkeit in KG-basierter Qualitätssicherung.

Luo et al.24 führten ein BERT-basiertes Schema für die QA in der Wissensdatenbank (KB) ein, das ein Multi-Granularity Pruning Model (MGPM) mit beziehungsbewusster Aufmerksamkeit integriert. Ihr Ansatz erreicht signifikante Genauigkeiten von 94,4 % bei SimpleQuestions, 68,6 % bei WebQuestionsSP und 63,7 % bei WebQuestions. Diese Ergebnisse zeigen die Effektivität von BERT bei der Nutzung semantischer Ähnlichkeit für Abfragen strukturierter Daten. Insgesamt unterstreicht diese Studie das Potenzial transformatorbasierter Modelle für die KB-QA, insbesondere in Szenarien, in denen eine exakte Entitäts- und Beziehungsidentifikation wichtig ist.

Wu et al.25 entwarfen ein Retrieval-Augmented-Generation-Framework für die Qualitätssicherung im Baumanagement mit besonderem Fokus auf Sicherheits- und Compliance-Abfragen. Durch die Integration von BERT-basierten semantischen Einbettungen mit einem generativen Transformatormodell und einem aufgabenspezifischen KG erreichte ihr Ansatz einen F1-Score von 88,7 % auf einem konstruktionsbezogenen QA-Datensatz. Diese Studie zeigt das Potenzial der Kombination von semantischem Verständnis mit KG-basiertem Retrieval, um die Genauigkeit eines aufgabenspezifischen QS-Datensatzes für das Baumanagement zu verbessern.

Peng et al.26 evaluierten systematisch LLMs, einschließlich BERT- und GPT-basierter Modelle, für die medizinische Qualitätssicherung. Durch die Kombination des kontextuellen Verständnisses von BERT und der generativen Fähigkeiten von GPT nutzten sie Retrieval-Augmented Generation und domänenspezifische Feinabstimmung, um einen F1-Score von 86,2 % auf einem Datensatz aus PubMed und klinischen Notizen zu erreichen. Diese Studie unterstreicht das Potenzial von Ensemble-Modellen zur Verbesserung der Inferenzgenauigkeit im Gesundheitswesen, wo sowohl der Kontext als auch die präzise Generierung entscheidend sind.

Gardazi et al.27 überprüften die Verwendung von BERT in NLP-Aufgaben wie QA, Stimmungsanalyse und Named Entity Recognition (NER). Ihre Analyse zeigte, dass fein abgestimmte BERT-Modelle F1-Werte von 85 % bis 92 % auf aufgabenspezifischen QA-Datensätzen wie SQuAD erreichen. Dies zeigt, dass BERT zuverlässig effektive kontextuelle Einbettungen erzeugt und KGs hinzufügt, wodurch es sich gut für SeCD QAS eignet.

Transformatorenbasierte Modelle sind aufgrund ihrer einzigartigen Fähigkeit, kontextsensitive Verarbeitung zu erfassen, effizient zu skalieren und an domänenspezifische Aufgaben anzupassen, zur entscheidenden Wahl für SeCD-QASs geworden. Tabelle 1 veranschaulicht diesen entscheidenden Vorteil durch den Vergleich von transformatorbasierten Modellen mit alternativen Methoden, die in dieser Studie untersucht wurden: 18,20,22,23,24,25.

AnnähernHauptmerkmaleVorteileBegrenzungenLeistungskennzahlen (SQuAD)Eignung für Anwendungsfälle
Transformatorbasierte Modelle (BERT, RoBERTa, DistilBERT)Bidirektionale Kontextmodellierung, Selbstaufmerksamkeit, Feinabstimmung auf domänenspezifischen Daten 16, 17, 19, 24, 25Hohe Genauigkeit, robustes semantisches Verständnis, skalierbar mit Vektordatenbanken 18, 20, 22, 24, 25Höherer Rechenaufwand, erfordert Vortraining 17, 18EM: 80–90%, F1: 85–93% 16, 17, 19, 24, 25Ideal für Closed Domain (CD) -QA, FAQ-Systeme und semantische Suche 16, 17, 19, 20, 22, 24, 25
Traditionelle regelbasierte SystemeHandgefertigte Regeln, Keyword-Matching 16Geringer Rechenaufwand, einfache Implementierung 16Eingeschränkte Skalierbarkeit, schlechte Handhabung komplexer Abfragen 16, 18EM: 50–60 %, F1: 55–65 % 16Grundlegende QAS mit strukturierten Daten 16
Rekurrente neuronale Netze (RNNs)Sequentielle Verarbeitung, LSTM/GRU-Architekturen 19Mäßige Leistung für sequenzielle Aufgaben 19Probleme mit langreichweitigen Abhängigkeiten, langsamere Inferenz 19, 9EM: 65–75 %, F1: 70–80 % 19Allgemeine NLP-Aufgaben, weniger effektiv für CD-QA 19, 9
Schlüsselwortbasierte Retrieval-SystemeTF-IDF, BM25 Algorithmen 18, 22Schneller Abruf, geringer Ressourcenverbrauch 18, 22Beschränkt auf oberflächliches Matching, schlechtes semantisches Verständnis 18, 22EM: 40–50 %, F1: 45–55 % 18, 22Dokumentenabruf, nicht geeignet für präzise QAS 18, 22
Convolutional Neural Networks (CNNs)Lokale Merkmalsextraktion, Faltungsschichten 25Effizient für die Klassifizierung von Kurztexten, schnelle Inferenz 25Begrenztes kontextuelles Verständnis, weniger effektiv für komplexe QAS 25EM: 60–70 %, F1: 65–75 % 25Textklassifizierung, nicht ideal für CD-QA 25
Neuronale Netze (GNNs)Graphenbasierte Modellierung, relationales Denken 20Effektiv für Multi-Hop-Argumentation, erfasst Dokumentbeziehungen 20Hohe Rechenkomplexität, erfordert strukturierte Daten 20EM: 70–80 %, F1: 75–85 % 20Multi-Hop-QAS, weniger geeignet für Single-Context-CD-QA 20
Knowledge Graph-basierte SystemeStrukturierte Wissensrepräsentation, Entitätsverknüpfung 21Stark für Abfragen strukturierter Daten, nutzt externes Wissen 21Erfordert vorgefertigte Knowledge Graphen, die auf bekannte Entitäten beschränkt sind 21EM: 65–75 %, F1: 70–80 % 21Domänenspezifisches QAS mit strukturierten Daten 21
Attention-Augmented ModelleVerbesserte Aufmerksamkeitsmechanismen, kontextfokussierte Verarbeitung 24Verbesserte Fokussierung auf relevante Textsegmente, hohe Genauigkeit 24Höherer Rechenaufwand, komplexe Implementierung 24EM: 85–90 %, F1: 88–92 % 24Komplexe CD-QA, nicht-faktoide Fragen 24
Bag-of-Words-ModelleAuf der Worthäufigkeit basierende Darstellung 22Einfach, rechentechnisch leicht 22Schlechtes semantisches Verständnis, ineffektiv für komplexe Abfragen 22, 25EM: 35–45 %, F1: 40–50 % 22Einfaches Abrufen von Texten, nicht geeignet für QAS 22, 25
Hybride neuronale Modelle (CNN+RNN)Kombiniert lokale und sequenzielle Verarbeitung 25Ausgewogenheit zwischen lokalem und kontextuellem Verständnis 25Moderate Komplexität, Probleme mit langen Kontexten 25EM: 68–78 %, F1: 72–82 % 25Allgemeine NLP-Aufgaben, mäßig geeignet für CD-QA 25
Statistische SprachmodelleProbabilistische Wortassoziationen 18Schnell für einfache Abfragen, geringer Ressourcenverbrauch 18Begrenztes Kontextverständnis, schlechte Skalierbarkeit 18EM: 45–55 %, F1: 50–60 % 18Basis-QAS, nicht geeignet für komplexe CD-QA 18

Tabelle 1: Vergleich von transformatorbasierten Modellen mit anderen Ansätzen für die Qualitätssicherung. Die Tabelle bietet einen direkten Vergleich verschiedener QA-Systemansätze, einschließlich transformatorbasierter Modelle, regelbasierter Systeme, RNNs und anderer. Es fasst ihre Hauptmerkmale, Stärken, Schwächen, Leistung bei SQuAD und die Aufgaben zusammen, für die sie am besten geeignet sind, wie z. B. CD-QA, semantische Suche und Textklassifizierung.

Das Hauptziel dieser Forschung ist es, den Zugang der Studierenden zu institutionellen Informationen durch die Entwicklung effizienter, skalierbarer und präziser SCD-QA-Systeme im NLP zu verbessern. Insbesondere wendet diese Bestätigungsstudie vortrainierte transformatorbasierte Modelle im Bereich der Zulassungsrichtlinien für Doktoranden an und validiert sie. Ziel ist es, ihre Wirksamkeit und praktische Machbarkeit durch die Einbeziehung von semantischem Matching, Modelllatenzbewertung und VD-gesteuertem semantischen Retrieval zu demonstrieren. Dieser Ansatz bietet eine eingehende Analyse, um genaue, domänenspezifische Antworten in einem fokussierten institutionellen Kontext zu liefern. Abbildung 2 veranschaulicht den ganzheitlichen Architekturrahmen des Systems.

Abbildung 2
Abbildung 2: Gesamtschema des SCD-QA-Systems. Die Abbildung zeigt ein Flussdiagramm eines QA-Systems, das Large Language Models (LLMs) verwendet. Es beginnt mit einer Kontextdatei und der Frage eines Benutzers, die von drei Modellen verarbeitet werden: Google-BERT, DistilBERT und RoBERTa, und einem schlüsselwortbasierten Modell: TF-IDF. Das System bewertet die Leistung jedes Modells anhand einer Checkliste und wählt dann auf der Grundlage der Ergebnisse das beste Modell aus. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Umfassende theoretische Grundlagen

QAS-Komponente: Das QAS-Framework besteht aus drei Segmenten, wie in Abbildung 3 dargestellt: i) Frageverarbeitungsmodul (QPM), ii) Dokumentenverarbeitungsmodul (DPM) und iii) Antwortextraktions- und Formulierungsmodul (AEFM). Das System erhält Fragen, die in zwei Hauptkategorien fallen: Faktoid und Nicht-Faktoid. Faktoide Fragen verwenden in der Regel Fragewörter wie was, wo, wann oder wer, während nicht-faktoide Fragen Wörter wie "wie" und "warum" verwenden.

DPM: Aus der bereitgestellten Liste kann der Benutzer eine bestimmte Passage auswählen. Als Nächstes wird jedes Token in der Passage mit einem Part-of-Speech-Tagger (POS) markiert. Um Verben zu extrahieren, identifizieren Sie alle Token, die als Verben gekennzeichnet sind. Kombinieren Sie diese Verben mit einer Liste unkonventioneller Verben und wenden Sie Logik auf regelmäßige Verben an. Erstellen Sie eine Datenstruktur (Array), die die extrahierten Verben, ihre Zeitformen und ihre -ing-Formen enthält.

QPM: Das System erhält Input in Form einer Frage vom Benutzer. Der Text wird mithilfe der StringTokenizer-Klasse tokenisiert, und die resultierenden Token werden in einer separaten Datenstruktur gespeichert. Diese Datenstruktur wird dann zur weiteren Verwendung innerhalb des Programms zurückgegeben.

AEFM: Der erste Schritt besteht darin, das Verb in der gegebenen Frage zu identifizieren. Das Verb, das kürzlich identifiziert wurde, wird nun mit den Token abgeglichen, die während der Dokumentverarbeitungsphase generiert wurden. Der gewählte Fall für eine bestimmte Art von Sachfrage (z. B. was oder wann) wird verwendet, um die Antwort präziser zu extrahieren und zu konstruieren.

Vor der Wahl der Art der Befragung wird der Benutzer zunächst aufgefordert, die Passage seiner Wahl auszuwählen. Das QPM ist für die Bearbeitung der Frage des Nutzers und die Weiterleitung an die AEFM verantwortlich. Das AEFM verwendet die Extraktionen, die aus dem DPM abgerufen wurden, und die verarbeiteten Dokumente, die das Tagged-Format des ursprünglichen Eingabedokuments enthalten. Das Modul übergibt die erforderlichen Algorithmen an das Formulierungsmodul, um die gewünschte Antwort zu erhalten.

Abbildung 3
Abbildung 3: Komponenten der Qualitätssicherung. Die Abbildung veranschaulicht den vierstufigen Prozess eines QA-Systems: Frage, Frageverarbeitung, Antwortverarbeitung und Antwort. In der Fragebearbeitung klassifiziert das System die Frage. In der Antwortverarbeitung werden Dokumente und Passagen gesucht und überprüft, um die Antwort zu erstellen. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

BERT-Modell: Um die Assoziationen zwischen Wörtern in einem Text zu ermitteln, verwendet die BERT-Methode einen Transformator. Es gibt zwei Mechanismen in einem Transformator - einen Encoder und einen Decoder28, aber nur der Encoder wird für BERT benötigt. BERT verfolgt einen wechselseitigen Ansatz und scannt den Eingabetext systematisch, um sich selbst die Bedeutung von Wörtern in ihrem Kontext beizubringen. Der Encoder verwendet als Eingabe eine Reihe von Token, die vektorisiert wurden. Die Vektoren werden dann in das neuronale Netz eingespeist, das eine Reihe von Vektoren erzeugt, die die Eingabe widerspiegeln. Der Ausgabevektor eines Wortes ändert sich je nach dem Satz, in dem es vorkommt. Der Vektor eines Wortes kann je nach Kontext, in dem es erscheint, variieren. Zum Beispiel hat "like" in "Er spielt gerne Cricket" einen anderen Vektor als "like" in "Sein Gesicht wurde rot wie eine Tomate". Der Ansatz beginnt mit einer Phase der Textverarbeitung, bevor es in die Phase der Modellerstellung übergeht. Die Schritte, die BERT zum Verarbeiten von Text ausführt, werden im nächsten Abschnitt28 erläutert.

Textverarbeitung: Das BERT-Modell stellt den Eingabetext in Übereinstimmung mit einem vorgeschriebenen Satz von Prinzipien dar. Darüber hinaus trägt dieser Faktor zur verbesserten Leistung des Modells bei. Die Eingabeeinbettung in BERT besteht aus einem Amalgam aus drei verschiedenen Arten von Einbettungen28.

Positionseinbettungen (PEs): Um die auftragsbezogenen Informationen in den Einbettungen zu lernen, werden PEs verwendet. PEs werden verwendet, um Informationen über die Ordnung wiederherzustellen, die in Transformatoren verloren gegangen sind. BERT entwickelt spezifische PEs speziell für jeden Punkt in der Eingabesequenz. BERT besitzt die Fähigkeit, die Positionsinformationen von Wörtern innerhalb eines Satzes durch die Verwendung von PEs zu vermitteln. Auf diese Weise kann BERT die Reihenfolge oder Reihenfolge von Wörtern effektiv erfassen und darstellen.

Satzeinbettungen (SEs): Um das Modell bei der Unterscheidung zwischen dem ersten und dem zweiten Satz zu unterstützen, lernt BERT zusätzlich eine Einbettung, die für jeden von ihnen einzigartig ist. Es ist auch in der Lage, gepaarte Sätze als Eingaben für Aktivitäten wie QA zu akzeptieren.

Token-Embeddings (TEs): TEs werden für jedes Token im WordPiece-Token-Vokabular unterrichtet. Das WordPiece-Token-Vokabular besteht aus Unterworteinheiten, die von Wörtern abgeleitet sind, die im Korpus gefunden wurden. Zur Veranschaulichung wird diese Vokabelsammlung alle denkbaren Unterwörter des Begriffs Frage umfassen, einschließlich Questio, Questi und so weiter.

Die Eingabedarstellung eines Tokens wird erstellt, indem seine Einbettungen auf Segment- und Positionsebene addiert werden. Aus diesem Grund handelt es sich um einen umfangreichen Einbettungsansatz, der dem Modell eine Fülle von Informationen zur Verfügung stellt. Abbildung 49 zeigt die Einbettungen des BERT-Modells.

Abbildung 4
Abbildung 4: BERT-Einbettungen. Die Abbildung zeigt, wie Eingabeeinbettungen für ein Transformatormodell erstellt werden. Es beginnt mit einer Eingabesequenz: [CLS] der [MASK] Himmel ist bewölkt [SEP], es wird regnen [SEP]. Jedes Token in der Sequenz erhält eine eigene Einbettung, z. B. Ethe oder E[MASK]. Dann werden für jeden Satz Satzeinbettungen hinzugefügt, z. B. EA für den ersten und EB für den zweiten. Positionseinbettungen, die mit E0 bisE 9 beschriftet sind, sind ebenfalls enthalten, um die Position jedes Tokens anzuzeigen. All dies wird kombiniert, um die endgültigen Eingabeeinbettungen zu bilden. Diese Zahl wurde von9 geändert. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

QAS-Entwurf mit BERT: Untersuchen Sie diese Frage zur Veranschaulichung in Verbindung mit einem Absatz aus einem Wikipedia-Eintrag über die Football League28.

Frage: Wo wurde die Football League gegründet?

Passage: 1888 wurde in England die Football League gegründet und war der erste von vielen professionellen Fußballwettbewerben. Im Laufe des 20. Jahrhunderts entwickelten sich einige der verschiedenen Arten des Fußballs zu einigen der beliebtesten Mannschaftssportarten der Welt.

Antwort: England

Das BERT-Modell nutzt die Token-Extraktion sowohl aus der Frage als auch aus dem Kontext und kombiniert sie anschließend zu einer einheitlichen Eingabe. Wie bereits erwähnt, beginnt der Prozess mit der Verwendung eines [CLS]-Tokens, der als Indikator für den Beginn eines Satzes dient. Zusätzlich wird ein [SEP]-Trennzeichen verwendet, um die Frage und die Passage eindeutig zu trennen. Zusätzlich zum [SEP]-Token enthält BERT SEs, um zwischen der Frage und der Passage28 , die die Antwort enthält, zu unterscheiden. BERT verwendet zwei SEs, eines für die Frage und eines für die Passage, um eine klare Unterscheidung zwischen ihnen zu treffen. Die Einbettungen werden anschließend mit einer One-Hot-Darstellung28 von Token kombiniert, um zwischen der Frage und der Passage zu unterscheiden. Dieser Prozess ist in Abbildung 5 dargestellt.

Abbildung 5
Abbildung 5: Darstellung der BERT-Eingabe. Die Abbildung zeigt, wie Eingabeeinbettungen für ein BERT-basiertes QAS generiert werden. Es beginnt mit dem Token [CLS], dann die Frage Wie viele? [SEP], und die Passage BERT groß ist, jeweils mit ihren Satzeinbettungen (A für die Frage, B für die Passage). Token-, Satz- und Positionseinbettungen werden kombiniert, um die endgültige Eingabe vorzunehmen. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

Anschließend wird die kombinierte eingebettete Darstellung28 der Frage und des Kontexts als Eingabe in das BERT-Modell verwendet. Die letzte verborgene Schicht von BERT wird so modifiziert, dass SoftMax zur Generierung von Wahrscheinlichkeitsverteilungen verwendet wird. Diese Verteilungen bestimmen die Start- und Endindizes einer Teilzeichenfolge innerhalb des Eingabetextsatzes, der eine Antwort darstellt, wie in Abbildung 6 für eine visuelle Darstellung dargestellt.

Abbildung 6
Abbildung 6: Workflow für die BERT-Verarbeitung für die Qualitätssicherung. Die Abbildung zeigt, wie das BERT-Modell für die Qualitätssicherung funktioniert. Es stellt eine Eingabesequenz dar, die eine Frage enthält, die durch ein Klassifizierungstoken [CLS] am Anfang und ein [SEP]-Trennzeichen am Ende gekennzeichnet ist, gefolgt von einem Kontext, der durch einen anderen [SEP] getrennt ist. Die Token in dieser Sequenz werden in Einbettungen umgewandelt. Das Modell sagt dann die Start- und Endposition der Antwort innerhalb der Passage voraus. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

Vektor-Datenbank (VD): Ein VD17,18 ist ein spezialisiertes System zum effizienten Speichern, Verwalten, Indizieren und Abfragen von hochdimensionalen Vektordarstellungen von Daten. Vektoren werden häufig aus Deep-Learning-Modellen generiert und kapseln semantische oder kontextuelle Informationen über die Daten. Jede Dimension eines Vektors repräsentiert ein bestimmtes Merkmal. Einbettungen sind numerische Darstellungen von Objekten wie Text, Bildern, Videos und Audiodateien. Diese Einbettungen werden in verschiedenen Anwendungen verwendet, darunter maschinelles Lernen (ML), NLP, Empfehlungssysteme, Computer Vision und IR. VDs erleichtern effektive Ähnlichkeitssuchen und semantische Abfragen, indem sie ähnliche Objekte nahe beieinander im Vektorraum gruppieren. Facebook AI Similarity Search (FAISS)29 ist ein prominenter VD, der in dieser Studie verwendet wird, um den relevantesten Kontext für Nutzeranfragen zu identifizieren. Tabelle 2 skizziert die Hauptmerkmale von VDs und ihre Anwendungsfälle.

MerkmalBeschreibung
Hochdimensionale DatenVerarbeitet Daten mit Hunderten oder Tausenden von Dimensionen.
Ungefährer nächster Nachbar (KNN)Ermöglicht schnelle Ähnlichkeitssuchen durch Annäherung an Entfernungen.
SkalierbarkeitUnterstützt große Datensätze mit Milliarden von Vektoren.
IntegrationLässt sich häufig in KI/ML-Frameworks und -Tools integrieren, um nahtlose Arbeitsabläufe zu ermöglichen.
Echtzeit-AbfragenBietet Vektorsuchen mit geringer Latenz für interaktive Anwendungen.

Tabelle 2: Hauptmerkmale von VD. Die Tabelle hebt wichtige Funktionen von VD hervor. Dazu gehören der Umgang mit hochdimensionalen Daten, das Ausführen schneller Ähnlichkeitssuchen mit ANN-Algorithmen, das Skalieren auf große Datensätze, das Arbeiten mit KI- und ML-Tools und die Unterstützung schneller Echtzeitabfragen für die interaktive Nutzung.

Metriken zur Leistungsbewertung: Das SCD-QA-System wurde anhand von zwei primären Metriken bewertet: EM-Score14 und Modelllatenz15. Der EM-Score, eine Standardmetrik in QA-Studien, bewertet die Vorhersagegenauigkeit, indem er den Anteil der vorhergesagten Antworten misst, die genau mit der Grundwahrheit übereinstimmen. Für eine Reihe von N Fragen wird die EM-Punktzahl in Gleichung 1 formal wie folgt definiert:

Gleichung 1wobei Gleichung 2 (1)

Diese Metrik weist eine Punktzahl von 1 für eine exakte Übereinstimmung mit der Referenzantwort und 0 für jede Differenz zu.

Die Metrik "Latenz" quantifiziert die gesamte Verarbeitungszeit, die das System benötigt, um eine Antwort auf eine einzelne Abfrage zu generieren. Diese Metrik wird als mittlere verstrichene Zeit über alle Abfragen hinweg berechnet, wie in Gleichung 2 dargestellt:

Gleichung 3 (2)

Dabei sind Tstarti und Tendi die Zeitstempel, die den Beginn bzw. das Ende der Verarbeitung der i-ten Abfrage markieren. Die Latenz wird in s angegeben und erfasst die Reaktionsfähigkeit des Systems, die alle Phasen von der Eingabeverarbeitung bis zur Antwortgenerierung umfasst.

Methode

Um die SCD-QA zu implementieren, sind die folgenden Teststudien in diese Arbeit eingeflossen.

SCD-QA-Datensatz: Ein vorgeschlagener Datensatz30 wird für die Implementierung des SCD-QA-Systems eingeführt. Dieser Datensatz stammt aus einem Textkorpus mit Ph.D.-Regeln für 20228 für studentische Richtlinien des NIT Arunachal Pradesh, Indien. Um das SCD-QA-System einzurichten, ist es notwendig, eine JSON-Datei zu generieren, die alle relevanten Informationen in einem präzisen Format enthält. Der Datensatz wird mit dem Open-Source-Framework Haystack annotation tool (Version 2.18.1)31 aus dem Textkorpus generiert. Dieses Werkzeug erleichtert die Erstellung des SCD-QA-Datensatzes im Stil des SQuAD14. Die Schritte zum Erstellen eines mit Anmerkungen versehenen Datasets vom Typ SQuAD aus der PDF-Datei sind in Abbildung 7 dargestellt, und die Struktur unseres Datasets im SQuAD-Stil ist in Abbildung 8 dargestellt.

Abbildung 7
Abbildung 7: Schritte zum Erstellen eines kommentierten Datensatzes aus einer PDF-Datei. Die Abbildung zeigt einen schrittweisen Arbeitsablauf für die Erstellung eines annotierten Datensatzes im SQuAD-Stil mit den Haystack-Werkzeugen. Es beschreibt den Prozess vom Extrahieren von Text aus PDFs, dem Bereinigen und Aufteilen in Passagen, dem manuellen Annotieren von Frage-Antwort-Paaren, dem Speichern der Anmerkungen im SQuAD-JSON-Format und schließlich dem Exportieren des Datensatzes für das Modelltraining. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

Abbildung 8
Abbildung 8: Struktur des QA-Datensatzes von Faktoiden. Die Abbildung zeigt eine JSON-Datenstruktur, die einen Absatz und ein QA-Paar aus einem Datensatz darstellt. Es hat einen Absatzabschnitt, der eine Reihe von Fragen und Antworten enthält. Eine Frage lautet: Was ist die Mindestpunktzahl, die erforderlich ist, um die Zulassung zum Ph.D. Science zu erhalten? Jede Frage hat eine ID und ein Array von Antworten. Die Antwort enthält eine Dokument-ID, eine Frage-ID, den Text mit 60 %-Punkten, die Startposition der Antwort und eine nicht angegebene Antwortkategorie. Das Flag is_impossible ist auf false festgelegt. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

Das Dataset ist als Liste von Wörterbüchern strukturiert, wobei jedes Wörterbuch Schlüsselfelder wie Daten, Absätze, Frage, answer_id, document_id, question_id, Text, answer_start, answer_end, is_impossible und Kontext enthält.

data: Es enthält die gesamten Informationen zu Fragen und Antworten.
paragraphs: Ein bestimmter Kontext, zusammen mit seinen Fragen und Antworten.
Frage: Eine bestimmte Frage.
answer_id: Eine eindeutige Identifikationsnummer für jeden Antworttext.
document_id: Eine eindeutige Identifikationsnummer für jeden Kontext.
question_id: Eine eindeutige Identifikationsnummer für jede Frage.
text: Der Antworttext.
answer_start: Der Startpunkt der richtigen Antwort im Kontext.
answer_end: Die Endstelle der richtigen Antwort im Kontext.
is_impossible: Sie gibt an, ob die Antwort auf die gestellte Frage im Kontext verfügbar ist oder nicht.
context: Der Textkorpus, aus dem eine Antwort gefunden werden kann.
Alle 80 Fragen im vorgeschlagenen Datensatz folgen dem Faktoid- und Nicht-Faktoid-Frageformat. Beispiele für einige Arten von formulierten Fragen sind in Tabelle 3 dargestellt.

Fragen
Wer ist PS?
Wie groß ist die Schriftgröße des State-of-the-Art-Dokuments?
Wie viele Tage hat der Mutterschaftsurlaub?

Tabelle 3: Beispielfrage aus dem Datensatz. Die Tabelle zeigt Beispiele für zwei Arten von Fragen: Die erste und zweite sind faktoide Fragen, während die dritte eine nicht-faktoide Frage ist.

FAISS: FAISS (Version faiss_cpu-1.9.0)29,32, entwickelt von Facebook AI Research (FAIR), ist eine Open-Source-Bibliothek, die eine effiziente Ähnlichkeitssuche und Clustering von dichten Vektoren ermöglicht. Es wurde speziell für die effektive Verwaltung großer, hochdimensionaler Daten entwickelt. Dieses System ermöglicht eine schnelle und skalierbare KNN-Suche in Datensätzen, die Millionen oder Milliarden von Vektoren umfassen. Es wird häufig in Anwendungen im Zusammenhang mit Einbettungen eingesetzt, einschließlich NLP, Empfehlungssystemen und Bild- oder Videoabruf. FAISS bietet mehrere Indizierungsmethoden, darunter Flat (Brute Force), Inverted File (IVF), Hierarchical Navigable Small World Graphs (HNSW) und Product Quantization (PQ). Diese Methoden ermöglichen es Benutzern, die Suchleistung entsprechend der Datengröße, Dimensionalität und Hardwarespezifikationen zu optimieren. In dieser Studie wird die flache Indizierung verwendet, die eine Brute-Force-Suche unter Verwendung der L2-Distanz (euklidisch) durchführt, um die nächsten Nachbarn zu identifizieren. Die Skalierbarkeit des Systems unterstützt sowohl CPU- als auch GPU-Implementierungen und ermöglicht so leistungsstarke Berechnungen über umfangreiche Datensätze hinweg. Darüber hinaus bietet es Flexibilität, um das Gleichgewicht zwischen Geschwindigkeit und Genauigkeit basierend auf spezifischen Anwendungsanforderungen zu optimieren. FAISS wird häufig im NLP verwendet, um die semantische Ähnlichkeit in Einbettungen wie BERT oder Word2Vec zu bewerten. FAISS wird in QAS verwendet, um Vektordarstellungen von Dokumenten oder Sätzen zu speichern und zu verwalten. Es führt approximative ANN-Suchen33 durch, um den relevantesten Kontext für Benutzerfragen abzurufen, und verbessert die semantische Suche mit Einbettungen aus Transformatormodellen, wie z. B. BERT. FAISS ist aufgrund seiner Vielseitigkeit ein grundlegendes Werkzeug in KI- und ML-Workflows.

BERT-large-uncased-whole-word-masking-finetuned- SQuAD-Modell: Die vorliegende Arbeit verwendet ein vortrainiertes Sprachmodell, bekannt als BERT-large-uncased-whole-word-masking finetuned-squad9 , um ein faktoides QAS unter Verwendung des in der Studie vorgeschlagenen Datensatzes zu entwickeln. Das BERT-Modell wurde einem Vortraining mit BookCorpus, einem Datensatz von 11.038 unveröffentlichten Büchern9, sowie der englischen Wikipedia unterzogen, mit Ausnahme von Listen, Tabellen und Überschriften. Das fragliche Modell ist ohne Fall, was bedeutet, dass es nicht zwischen den Wörtern Englisch und Englisch unterscheidet. Bei dem Modell handelt es sich um ein vortrainiertes Transformer-Modell, das mit einer beträchtlichen Menge englischer Daten unter Verwendung eines selbstüberwachten Ansatzes trainiert wurde. Das Modell wurde ausschließlich auf Rohtexten ohne menschliche Anmerkungen vortrainiert. Dies ermöglicht es, eine große Menge öffentlich zugänglicher Daten zu nutzen. Der Vortrainingsprozess umfasst die automatische Generierung von Eingaben und Beschriftungen aus den bereitgestellten Texten. Das Modell wurde mit zwei spezifischen Zielen trainiert9:

MLM: Bei diesem Prozess werden 15 %9 der Wörter im Eingabesatz nach dem Zufallsprinzip maskiert. Das Modell verarbeitet dann den gesamten maskierten Satz und sagt die maskierten Wörter voraus. Dieser Ansatz unterscheidet sich von herkömmlichen rekurrenten neuronalen Netzen (RNNs), die Wörter in der Regel sequenziell verarbeiten, und von autoregressiven Modellen wie GPT, die eine interne Maskierung zukünftiger Token verwenden. Die Funktionalität ermöglicht es dem Modell, eine bidirektionale Darstellung des Satzes zu erhalten.

NSP: In der Vortrainingsphase kombiniert das Modell zwei getarnte Sätze als Eingaben. In einigen Fällen stehen diese Sätze im Originaltext nebeneinander, was auf einen direkten Zusammenhang hinweist. In anderen Fällen sind sie es nicht, was bedeutet, dass es keine ursprüngliche Nähe oder keinen Kontext gibt, der sie verbindet. Im nächsten Schritt sagt das Modell voraus, ob die beiden Sätze logisch kohärent sind.

Das vorliegende Modell zeichnet sich durch die nachträgliche Konfiguration aus: Die Modellarchitektur besteht aus 24 Schichten, mit einer versteckten Dimension von 1024. Es verwendet 16 Aufmerksamkeitsköpfe und verfügt über insgesamt 336 Millionen Parameter9.

WordPiece wird verwendet, um die Texte mit einem Wortschatz von 30.000 Wörtern in den Vorverarbeitungsschritten zu tokenisieren. Die Eingaben des Modells würden dann wie folgt aussehen: [CLS] Satz A [SEP] Satz B [SEP]. Die einzige Voraussetzung ist, dass die Gesamtlänge der kombinierten Sätze weniger als 512 Token9 beträgt. Das spezifische, vortrainierte Modell liefert die anschließende Ausgabe: Die erreichte F1-Punktzahl beträgt 93,15 %, während die Punktzahl für die genaue Übereinstimmung 86,91 % beträgt9.

Distilbert/distilbert-base-cased-distilled-squad-Modell: Das DistilBERT10-Modell ist eine kompaktere, schnellere und effizientere Variante des BERT 9-Modells, das entwickelt wurde, um den Großteil der semantischen Verständnisfähigkeit von BERT beizubehalten, während es weniger ressourcenintensiv und besser für praktische Anwendungen mit begrenzter Rechenkapazität geeignet ist. Die Version distilbert-base-cased-distilled-squad wurde auf dem SQuAD14 für QA-Aufgaben fein abgestimmt. Das Modell nutzt die Transformatorarchitektur, einschließlich einer verringerten Größe von 66 Millionen Parametern im Gegensatz zu den 110 Millionen von BERT, während 97 % der Wirksamkeit von BERT beim Sprachverständnis beibehalten werden. DistilBERT erreicht dies mit einer Methode, die als Wissensdestillation bekannt ist und Informationen aus dem größeren BERT-Modell an das kompaktere DistilBERT-Modell überträgt. Aufgrund seiner geringeren Größe kann es Informationen schneller ableiten und verbraucht weniger Speicher, was es perfekt für Anwendungen mit begrenzten Ressourcen wie Mobil- oder Edge-Geräte macht. Das Modell, das sorgfältig auf den SQuAD 1.1-Datensatz abgestimmt wurde, zeigt außergewöhnliche Fähigkeiten in extraktiven QA-Aufgaben, bei denen das Ziel darin besteht, ein Textsegment aus einem bestimmten Kontext zu lokalisieren, das eine Frage beantwortet. DistilBERT erreicht etwa 85 % der F1-Punktzahl von BERT auf der SQuAD-Bestenliste und behält trotz seiner reduzierten Größe einen erheblichen Teil der sprachlichen Kapazität von BERT bei. Dieses Modell ist eine außergewöhnlich effiziente Lösung für QA-Aufgaben auf Produktionsebene, die sowohl die Leistung als auch die Recheneffizienz optimiert.

Deepset/roberta-base-squad2: Das deepset/roberta-base-squad2 Modell12,13 ist eine fein abgestimmte Variante der RoBERTa-Architektur. Es wurde speziell für das SQuAD14 2.0-Dataset entwickelt, das sowohl beantwortete als auch unbeantwortbare Fragen enthält. Dieses verbesserte RoBERTa-Framework eliminiert die9 NSP-Jobs von BERT. Es verwendet auch dynamische Maskierung während des Trainings, um die Effizienz und Leistung bei NL-Verständnisaufgaben zu steigern. Das Modell hat 125 Millionen Parameter und verwendet einen bidirektionalen Transformator. Dies ermöglicht es ihm, Kontextinformationen aus beiden Richtungen zu erfassen und sich bei extraktiven QA-Aufgaben auszuzeichnen.

Die Feinabstimmung von SQuAD 2.0 ermöglicht es dem Modell, die richtige Antwortspanne innerhalb eines gegebenen Kontexts zu identifizieren und zu erkennen, wenn es keine Antwort gibt. Es verwendet einen Byte Pair Encoding (BPE)-Tokenizer, der die Tokenisierung von Unterwörtern verarbeitet und die Groß- und Kleinschreibung beibehält. Dies verbessert seine Fähigkeit, ungewöhnliche und komplexe Wörter zu verarbeiten. Das Modell schneidet gut ab und erreicht etwa 85 % bis 90 % F1 und 80 % bis 85 % EM. Seine Fähigkeit, unbeantwortbare Fragen zu erkennen, und sein effektiver Einsatz machen es wertvoll für den Kundenservice, das Abrufen von Wissen und virtuelle Assistenten.

Der effektivste Weg, SQuAD-fein abgestimmte BERT-Modelle für die Qualitätssicherung einzusetzen, ist die Verwendung der Hugging Face Transformers-Pipeline34. Dieses Framework optimiert die Tokenisierung, die Eingabeformatierung, das Laden von Modellen und die Nachbearbeitung der Ausgabe. Diese Modelle sind weithin für ihre Wirksamkeit in der extraktiven Qualitätssicherung anerkannt, bei der die Antwort eine Textspanne ist, die direkt aus dem gegebenen Kontext abgerufen wird. Um die Implementierung zu unterstützen, werden im folgenden Verfahren die Schritte zum Ausführen von BERT-Modellen beschrieben.

Eingabe und Einrichtung: Für diesen Vorgang sind vier Haupteingaben und Setup-Parameter erforderlich: der Modellname, der als Zeichenfolgenbezeichner aus dem Hugging Face Hub angegeben wird (z. B. google-bert/bert-large-uncased-whole-word-masking-finetuned-squad, distilbert/distilbert-base-cased-distilled-squad oder deepset/roberta-base-squad2); die Frage (Q), die als Zeichenfolge bereitgestellt wird, die die Abfrage enthält; und der Kontext (C), eine Zeichenfolge, die den relevanten Text oder die relevante Passage darstellt. Das primär verwendete Werkzeug ist die High-Level-Pipeline-Funktion aus der Hugging Face-Transformatorenbibliothek (Version 4.57.0) in Python (Version 3.12.12).

Ablauf: Ausführung (Hugging Face Pipeline): Der Prozess besteht aus sechs Hauptschritten und verwendet die Hugging Face-Pipeline, um die Komplexität der QA-Aufgabe zu bewältigen:

Bibliothek installieren: Beginnen Sie mit der Installation der erforderlichen Bibliothek mit dem Befehl pip install transformers. Diese Installation ermöglicht den Zugriff auf die Modelle und die optimierte Pipeline-Funktionalität.

Import-Pipeline: Importieren Sie die Rohrleitungsfunktion mit: aus Transformatoren importieren Sie die Rohrleitung.

QA-Pipeline initialisieren: Initialisieren Sie die QA-Pipeline mit qa_pipeline = pipeline("question-answering", model=""). Mit diesem Befehl werden das Modell und der Tokenizer heruntergeladen, sodass sie für die Inferenz bereit sind.

Eingabe definieren: Frage setzen = ... und Kontext = ... , um die Daten des Modells vorzubereiten.

Inferenz ausführen: Übergeben Sie die Frage und den Kontext an die Pipeline mit result = qa_pipeline(question=question, context=context). Das Modell verarbeitet die Eingabe und gibt eine Antwort.

Antwort ausziehen: Rufen Sie die Antwortzeichenfolge aus dem Ausgabewörterbuch mit folgendem Befehl ab: answer = result['answer'].

Ausgabe: Der Prozess erzeugt mehrere Ausgabeparameter in der folgenden Reihenfolge: Antwort (die extrahierte Textspanne aus dem Kontext, die als Zeichenfolge dargestellt wird), Bewertung (ein Gleitkommawert, der die Zuverlässigkeit des Modells in seine Vorhersage quantifiziert) und Start- und Endindizes (Ganzzahlen, die die Zeichenpositionen der Antwortspanne innerhalb des Kontexts angeben).

Satz-Transformatoren/all-MiniLM-L6-v2: Der all-MiniLM-L6-v235 ist ein vortrainierter Satztransformator aus der Sentence-Transformers-Bibliothek (Version 5.1.1)36. Es ist für eine effiziente und präzise Texteinbettung optimiert. Es wurde auf dem MiniLM-Framework von Microsoft entwickelt und umfasst sechs Transformatorschichten und 384-dimensionale Einbettungen. Dieses Design bietet ein ausgewogenes Verhältnis zwischen Leistung und Rechenleistung und eignet sich daher für Echtzeitanwendungen. Das Modell wurde mit über einer Milliarde Phrasenpaaren aus Datensätzen wie SNLI, MultiNLI, STS-Benchmarks und Web-Crawling-Daten trainiert. Als Ergebnis demonstriert es seine Kompetenz in semantischer Ähnlichkeit, Gruppierung und suchbezogenen Aufgaben. Aufgrund seiner geringen Größe (~22 MB) und der verbesserten Inferenzleistung vereinfacht das all-MiniLM-L6-v2 Anwendungen wie semantische Suche, Duplikaterkennung und Textkategorisierung. Obwohl es leichtgewichtig ist, bietet es eine hohe Genauigkeit bei Benchmarks wie STS-B und SICK-R, was es zu einer effektiven Wahl sowohl für skalierbare Szenarien als auch für Szenarien mit begrenzten Ressourcen macht. Der Arbeitsablauf zum Generieren der Einbettung mit Sentence-Transformer ist in Abbildung 9 unten dargestellt.

Abbildung 9
Abbildung 9: Schritt des Einbettungsprozesses unter Verwendung des Satztransformatormodells. Die Abbildung veranschaulicht den Workflow zum Generieren von Texteinbettungen mit dem Framework für Satztransformatoren. Es beschreibt den Prozess vom Importieren von Bibliotheken und dem Laden eines vortrainierten Modells bis hin zur Aufbereitung von Textdaten, dem Generieren von Einbettungen, dem Konvertieren in NumPy-Arrays und dem Speichern für nachgelagerte Aufgaben wie Indizierung oder Ähnlichkeitssuche. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

Vorgeschlagener Algorithmus: Diese Studie skizziert eine in Algorithmus 1 vorgeschlagene Methodik für die Entwicklung des SeCD-basierten SCD-QA-Systems, das in der Lage ist, sowohl faktoide als auch nicht-faktoide Fragen zu beantworten, die von Benutzern gestellt werden.

ALGORITHMUS 1: Algorithmus des vorgeschlagenen SeCD-basierten SCD-QA-Systems
Eingabe: Satz der unformatierten Kontextdatei (C) und der Abfrage des Benutzers (Q).
Ausgang: Die ausgewählte optimale transformatorbasierte LLM (M') und die von M' erzeugte Antwort.
Vorverarbeitungskontexte: Kommentieren Sie den rohen Kontextsatz C, um einen strukturierten Datensatz im DSQuAD-Format zu erstellen.
DSQuAD = fannonat (C)
Kontexteinbettungen generieren: Verwenden Sie einen Satz-Transformerf embed, um jeden Kontext c Gleichung 100 DSQuAD in eine Einbettung ec umzuwandeln.
Gleichung 15
Einbettungen speichern: Speichern Sie Ec in einer Vektordatenbank V für eine effiziente Ähnlichkeitssuche.
Gleichung 18
Abfrageeinbettung generieren: Transformieren Sie die Abfrage Q des Benutzers in eine Einbettung eq mit demselben Satztransformator.
Gleichung 20
Context Retrieval: Ruft die relevanteste Kontexteinbettung Gleichung 21 aus der Datenbank V basierend auf der Ähnlichkeit zu eq ab.
Gleichung 22
wobei sim(eq,e c) die Ähnlichkeitsfunktion ist.
Übergeben Sie den Kontext an LLMs: Geben Sie den abgerufenen Kontext Gleichung 21 in 3 transformatorbasierte LLMs ein: Google-BERT (M1), DistilBERT (M2), RoBERTa (M3) und ein traditionelles Modell: TF-IDF+Cosine Similarity (M4)
Gleichung 28
Modellauswertung: Vergleichen Sie die Antworten {R1,R 2,R 3,R 4} mit einer Auswertungsfunktion feval, die jede Antwort bewertet.
Gleichung 31
Wählen Sie das beste Modell aus: Identifizieren Sie das Modell M' mit der höchsten Bewertungsnote S'
Gleichung 33
Endgültige Ausgabe generieren: Verwenden Sie M', um die endgültige Antwort R basierend aufGleichung 36
Gleichung 37
Ende

Der vorgeschlagene Algorithmusprozess skizziert einen systematischen Ansatz (Abbildung 10) für die Auswahl eines idealen transformatorbasierten LLM, um Benutzerfragen zu beantworten. Es umfasst Vorverarbeitung, Embedding-basiertes Kontextabrufen und Multi-Model-Assessment, um qualitativ hochwertige und kontextuell relevante Antworten zu garantieren. Im Folgenden wird der Schritt-für-Schritt-Prozess zur Verdeutlichung erklärt:

Datenaufbereitung und -vorverarbeitung: Die erste Phase umfasst die Verarbeitung von textuellen Rohdaten.

Eingabe: Die Rohtextdateien8 werden in das System adaptiert.

Annotation Tool31: Die Eingabe wird in einen strukturierten Datensatz im SQuAD14-Format transformiert. In diesem Schritt werden QA-Paare erstellt. Außerdem werden relevante Textdaten in klar definierten Kontextblöcken organisiert.

Ausgabe: Das Dataset ist nun bereit, Einbettungen zu erstellen.

Generierung von Kontexteinbettungen: Um einen effizienten und skalierbaren Kontextabruf zu ermöglichen, wird ein trainiertes Satz-Transformer-Modell35,36 auf den annotierten Datensatz angewendet. Dieser Transformator wandelt Text in hochdimensionale Einbettungen um, die semantische Bedeutung erfassen. Die Einbettungen werden in VD, FAISS29,32 gespeichert, um eine schnelle ähnlichkeitsbasierte Suche zu ermöglichen.

Verarbeitung von Benutzeranfragen: Wenn ein Benutzer eine Frage einreicht, wird die Frage von demselben Satzwandler35,36 verarbeitet. Dadurch wird eine entsprechende Einbettung in denselben Vektorraum29, 32 erzeugt wie die Kontexteinbettungen. Dieses Design stellt sicher, dass die Abfrage mit relevanten Kontexteinträgen abgeglichen werden kann.

Kontextabfrage mit Vektorähnlichkeit: Anhand einer Ähnlichkeitsmetrik (z. B. Kosinusähnlichkeit) vergleicht das System die Abfrageeinbettung mit gespeicherten Kontexteinbettungen. Das System wählt den relevantesten Kontext basierend auf dem höchsten Ähnlichkeitswert aus. Dadurch wird sichergestellt, dass nur relevanter Kontext an Downstreammodelle übergeben wird. Der Prozess reduziert den Rechenaufwand und verbessert die Relevanz.

Modellauswertung über mehrere LLMs hinweg: Der ausgewählte Kontext wird von drei transformatorbasierten LLMs ausgewertet: Google-BERT28, DistilBERT10 und RoBERTa12. Es wird auch durch ein traditionelles schlüsselwortbasiertes TF-IDF37 mit einem Kosinus-Ähnlichkeitsmodell bewertet. Jedes Modell verarbeitet den Kontext und generiert eine Antwort auf die Frage des Benutzers.

Vergleichende Bewertung: Die Antworten aus den vier LLM-Modellen werden anhand von zwei Schlüsselmetriken bewertet. Zunächst wird das semantische Matching mit EM14 bewertet. Zweitens wird die Modelllatenz anhand der mittleren Reaktionszeiten15 analysiert.

Modellauswahl und endgültige Ausgabe: Das Modell mit der besten Leistung wird als geeignetes LLM für die Frage des Benutzers ausgewählt. Die endgültige Antwort des ausgewählten Modells wird berücksichtigt. Dies gewährleistet ein Gleichgewicht zwischen Recheneffizienz und Antwortqualität.

Abbildung 10
Abbildung 10: Arbeitsablauf des SCD-QA-Systems unter Verwendung transformatorbasierter Modelle. Die Abbildung zeigt, wie das SCD-QA-System funktioniert. Zunächst wird eine unformatierte Kontextdatei von einem Annotationswerkzeug verarbeitet, um ein Dataset im SQuAD-Format zu erstellen. Ein Satztransformator erzeugt dann Einbettungen, die in einer FAISS-Vektordatenbank gespeichert werden. Wenn ein Benutzer eine Frage stellt, erstellt das System eine Einbettung für diese und wählt den relevantesten Kontext aus. Es vergleicht drei transformatorbasierte Modelle – Google-BERT, DistilBERT und RoBERTa – und einen traditionellen TFIDF + Kosinus-Ähnlichkeitswert – und verwendet das leistungsstärkste Modell, um die Antwort zu liefern. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bei der Implementierung des SCD-QA-Systems wurden vier LLMs und ein Datensatz mit 80 faktoiden und nicht-faktoiden Fragen verwendet. Die Verarbeitung erfolgte in Google Colab unter Verwendung von NVIDIA Tesla T4-GPUs (Treiberversion: 550.54.15, CUDA-Version: 12.4) mit 12,7 GB System-RAM, 15 GB GPU-RAM und 112,6 GB Festplattenspeicher. Die Modellleistung wurde anhand von zwei Metriken bewertet: EM14 für semantisches Matching und Modelllatenz15

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

In dieser Studie wird das SCD-QA-System vorgestellt, das transformatorbasierte Sprachmodelle nutzt, um präzise, kontextbezogene Antworten auf strukturierte institutionelle Dokumente zu liefern. Der Workflow des Systems besteht aus: (1) Datenvorverarbeitung; (2) Einbettungsgenerierung mit dem hochmodernen Satztransformator all-MiniLM-L6-v2; (3) ähnlichkeitsbasierter Abruf durch FAISS; und (4) eine umfassende Modellbewertung. Die Pipeline wurde anhand des SCD-QA-Datensatzes getestet, der 8...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren haben nichts offenzulegen.

Danksagungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren danken der engagierten Fakultät und Verwaltung des NIT Arunachal Pradesh für ihre unerschütterliche Unterstützung und Anleitung während dieser Studie. Darüber hinaus sind wir den Entwicklern und Mitwirkenden von Open-Source-NLP-Tools und vortrainierten Modellen zutiefst dankbar, deren Arbeit diese Forschung ermöglicht hat. Während der Vorbereitung dieses Manuskripts verwendeten die Autoren den Grammarly Proofreader, um die Übersichtlichkeit zu verbessern. Die Autoren übernehmen die volle Verantwortung für die Richtigkeit und Integrität der Inhalte.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
all-MiniLM-L6-v2MicrosoftVersion 5.1.1Vortrainiertes Satztransformatormodell zur Erzeugung hochdimensionaler Einbettungen. Wandelt Text in Embeddings um für den Kontextabruf.
AnnotationswerkzeugHeuhaufenVersion 2.18.1Plattform zur Strukturierung von Rohtexten im SQuAD-Format. Bereitet einen Datensatz vor, indem QA-Paare und Kontextblöcke erstellt werden.
DistilBERT-ModellUmarmungsgesichtNALeichtes, transformatorbasiertes LLM mit reduzierten Rechenanforderungen. Zum Vergleich bewertet, bietet es eine geringere Latenz, aber eine geringere Genauigkeit.
FAISS VDFacebookfaiss_cpu-1.9.0Skalierbarer VD für ähnlichkeitsbasierte Suchanfragen. Speichert und ruft hochdimensionale Einbettungen für effiziente Abfrageanpassung ab.
Google-BERT-ModellGoogelnNAVortrainiertes, transformatorbasiertes LLM mit bidirektionaler Kontextmodellierung. Primärmodell zur Erstellung genauer Antworten auf Fakten- und Nicht-Faktenanfragen.
NVIDIA Tesla T4 GPUsNVIDIATreiberversion: 550.54.15
CUDA-Version: 12.4
GPUs mit 15 GB GPU-RAM zur Modellinferenz. Bietet Rechenleistung für die Verarbeitung und Auswertung von LLMs.
PythonPython Software FoundationVersion 3.12.12Python ist eine führende Programmiersprache im Bereich der Natural Language Processing (NLP) aufgrund seiner einfachen Syntax, umfassenden Bibliotheken und starker Community-Unterstützung. Es unterstützt eine breite Palette von NLP-Aufgaben, darunter grundlegende Textvorverarbeitung und komplexe Implementierungen des maschinellen Lernens.
RoBERTa-ModellDeepsetNAOptimiertes transformatorbasiertes LLM mit verbesserten Trainingsstrategien. Zum Vergleich bewertet, balanciert Genauigkeit und Latenz aus.
SCD-QA-Datensatz als SQuAD  FormatNAVersion 2.0Standardisiertes Format für Frage-Antwort-Paare. Strukturdatensatz zur Kompatibilität mit Transformatormodellen.

Referenzen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Pirtoaca, G. S., Rebedea, T., Ruseti, S. Improving retrieval-based question answering with deep inference models. Int Joint Conf Neural Network. , 1-8 (2019).
  2. NLP-QA framework based on LSTM-RNN. Zhang, X., Chen, M. H., Qin, Y. Int Conf Data Sci Business Anal, , 307-311 (2018).
  3. Natural language processing based new approach to design factoid question answering system. Machhirke, V. S., Soni, A. Second Int Conf Inventive Res Computing Appl, , 276-281 (2020).
  4. Biancofiore, G. M., Deldjoo, Y., Di Noia, T., Di Sciascio, E., Narducci, F. Interactive question answering systems: literature review. ACM Comput Surv. 1 (1), Article 1(2024).
  5. Singh, S., Das, N., Michael, R., Tanwar, P. The question answering system using NLP and AI. Int J Sci Eng Res. 7 (12), 2229-5518 (2016).
  6. Pandya, H. A., Bhatt, B. S. Question answering survey: Directions, challenges, datasets, evaluation matrices. arXiv. , (2021).
  7. Khvalchik, M. A., Kulkarni, K. Open-domain non-factoid question answering. , Springer International Publishing. Cham. (2017).
  8. NIT Arunachal Pradesh PhD rules and regulations year. , National Institute of Technology Arunachal Pradesh. https://www.nitap.ac.in/storage/pdf/140508582e7c89a8b2295595085e3abe-%2003-37-28F%20IN%20AL.pdf (2022).
  9. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. BERT: Pre-training of deep bidirectional transformers for language understanding. Proc NAACL-HLT. , 4171-4186 (2019).
  10. Sanh, V., Debut, L., Chaumond, J., Wolf, T. DistilBERT, a distilled version of BERT: Smaller, faster, cheaper and lighter. arXiv. , (2019).
  11. DistilBERT HuggingFace. , https://huggingface.co/distilbert/distilbert-base-cased-distilled-squad (2023).
  12. Liu, Y., et al. A robustly optimized BERT pretraining approach. arXiv. , (2019).
  13. RoBERTa base squad2. Deepset. , https://huggingface.co/deepset/roberta-base-squad2 (2023).
  14. SQuAD: 100,000+ questions for machine comprehension of text. Rajpurkar, P., Zhang, J., Lopyrev, K., Liang, P. Proc 2016 Conf Empirical Meth Natural Language Proc, , 2383-2392 (2016).
  15. Attention is all you need. Vaswani, A., et al. 31st Conf Neural Informat Proc Syst, , 1-11 (2017).
  16. Malkov, Y. A., Yashunin, D. A. Efficient and robust approximate nearest neighbor search using hierarchical navigable small world graphs. IEEE Trans Pattern Anal Mach Intell. 42 (4), 824-836 (2018).
  17. Similarity search in high dimensions via hashing. Gionis, A., Indyk, P., Motwani, R. Proc 25th VLDB Conf, , 518-529 (1999).
  18. HIJLI_JU at SemEval-2024 task 7: Enhancing quantitative question answering using fine-tuned BERT models. Sengupta, P., Sarkar, S., Das, D. Proc 18th Int Workshop Semantic Evaluat, , 279-284 (2024).
  19. Kocoń, J., et al. ChatGPT: Jack of all trades, master of none. Inf Fusion. 99, 101861(2023).
  20. Fine-tuning strategies for domain specific question answering under low annotation budget constraints. Guo, K., Diefenbach, D., Gourru, A., Gravier, C. IEEE 35th Int Conf Tools with Artificial Intell, , 166-171 (2023).
  21. Question answering on biomedical research papers using transfer learning on BERT-base models. Pudasaini, S., Shakya, S. 7th Int Conf I-SMAC (IoT in Social, Mobile, Analytics and Cloud), , 496-501 (2023).
  22. Knowledge-augmented language model prompting for zero-shot knowledge graph question answering. Baek, J., Aji, A. F., Saffari, A. Proc 1st Workshop Natural Language Reasoning Struct Explanat, , 78-106 (2023).
  23. Hu, S., Zhang, H., Zhang, W. Domain knowledge graph question answering based on semantic analysis and data augmentation. Appl Sci. 13 (15), (2023).
  24. A BERT-based approach for knowledge base question answering. Luo, D., Su, J., Yu, S. Int Joint Conf Neural Networks, , 1-8 (2020).
  25. Wu, C., et al. Retrieval augmented generation-driven information retrieval and question answering in construction management. Adv Eng Inform. 65, 103158(2025).
  26. Peng, C., et al. A study of generative large language model for medical research and healthcare. NPJ Digit Med. 6 (1), 210(2023).
  27. Gardazi, N. M., et al. applications in natural language processing: a review. Artif Intell Rev. 58 (6), 1-49 (2025).
  28. Sabharwal, N., Agrawal, A. Hands-on question answering systems with BERT: applications in neural networks and natural language processing. , Apress Berkeley. CA. (2021).
  29. FAISS documentation. , https://faiss.ai/ (2025).
  30. Bhattacharya, D. SCD-QA dataset. Zenodo. , (2025).
  31. Annotation tool. , https://docs.haystack.deepset.ai/docs/annotation (2025).
  32. Johnson, J., Douze, M., Jégou, H. Billion-scale similarity search with GPUs. IEEE Transac Big Data. 7 (3), 535-547 (2021).
  33. Sun, P., Guo, R., Kumar, S. Automating nearest neighbor search configuration with constrained optimization. arXiv. , (2023).
  34. BERT. , Hugging Face. https://huggingface.co/docs/transformers/model_doc/bert (2025).
  35. MiniLM: Deep self-attention distillation for task-agnostic compression of pre-trained transformers. Wang, W., et al. Proc 34th Int Conf Neural Informat Process Syst, , 5776-5788 (2020).
  36. Sentence transformer documentation. , https://www.sbert.net/ (2025).
  37. Cosine similarity to determine similarity measure: study case in online essay assessment. Lahitani, A. R., Permanasari, A. E., Setiawan, N. A. 4th Int Conf Cyber IT Service Manag, , 1-6 (2016).
  38. A comparative analysis of transformer models in zero-shot text classification. Kyritsis, K., Liapis, C. M., Spatiotis, N., Perikos, I., Paraskevas, M. 15th Int Conf Informat Intelligence Syst Applicat, , 1-4 (2024).
  39. Howard, J., Ruder, S. Universal language model fine-tuning for text classification. Proc 56th Ann Meeting Associat Computat Linguistics. , 328-339 (2018).
  40. Asai, A., Hashimoto, K., Hajishirzi, H., Socher, R., Xiong, C. Learning to retrieve reasoning paths over Wikipedia graph for question answering. arXiv. , (2019).
  41. Lewis, P., et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. arXiv. , (2021).
  42. Leveraging passage retrieval with generative models for open domain question answering. Izacard, G., Grave, E. Proc Conf Eur Chapter Associat Computat Linguistics, , 874-880 (2021).

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Nachdrucke und Genehmigungen

Genehmigung beantragen, um den Text oder die Abbildungen dieses JoVE-Artikels zu verwenden

Genehmigung beantragen

Schlagwörter

Transformer ModelleClosed Domain QASQuAD DatensatzFaktoid FragenNicht Faktoid FragenTF IDF ModellKosinus hnlichkeitSynonym Matching

Verwandte Artikel