研究記事

TransformerベースのBERTモデルのユースケースとしてのクローズドドメインセマンティック質問応答システム

DOI:

10.3791/69424

2025年11月14日

この記事について

サマリー

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究では、テキストから知識を抽出して質問に答えるための適応学習システムを設計し、コサイン類似性を用いて、待ち時間と意味論的一般化について、Google-BERT、DistilBERT、RoBERTa、TF-IDFモデルを比較します。Google-BERT は最高のパフォーマンスを発揮しますが、システムは依然としてスペルミスに敏感であり、実際のアプリケーションには強力な前処理の必要性が強調されています。

要約

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

テキストファイルから知識を抽出し、コンテキストで適切な情報を見つけてユーザーの質問に答えるために、質問応答システム(QAS)などの適応学習システムがこの目的のために設計されています。この焦点は、直接回答システムと質問応答 (QA) タスクのための大規模なテストの使用に関するさらなる研究を奨励します。これを容易にするために、ファクトと非ファクトの両方の質問を含むセマンティッククローズドドメインQA(SCD-QA)データセットが、事前トレーニングされたトランスフォーマーモデルと組み合わせて採用されます。この研究では、SQuAD データセット上の Google-BERT、DistilBERT、RoBERTa などの 3 つの事前トレーニング済みトランスフォーマー モデルと、コサイン類似性を持つ古典的なキーワードベースの TF-IDF モデルの間で推論を行う能力が測定され、比較されます。結果によると、Google-BERT は平均完全一致 (EM) スコアが 90.0、平均遅延は 1.27 秒で、最高のパフォーマンスを発揮します。このシステムは同義語を含む質問でも優れたパフォーマンスを発揮し、意味を深く理解していることを示しています。しかし、スペルミスのある質問ではパフォーマンスが不十分であり、スペルミスに敏感であり、使用時により良い早期処理が必要であることを示しています。

概要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

自然言語処理 (NLP) は、QAS を構築できる人工知能 (AI) のサブドメインであり、コンピューター システムが質問に対する回答を自動的に生成できるようにします1。NLPは主に、人間の脳の認知プロセスをエミュレートする方法で書き言葉の理解と解釈に焦点を当てています2。これらのタスクに従事することで、NLP は人間のような応答を生成できるシステムを構築する上で極めて重要な技術として確立されます。

ユーザーの質問に答えるQASは、NLPがどのように使用されているかの一例です3。QASは、情報検索(IR)、情報抽出(IE)、NLPなど、共通の課題を持つさまざまな分野の研究を組み込んだ研究分野です。現在、現代の検索エンジンは主にドキュメント検索タスクを実行します4。言い換えれば、特定のキーワードが提供されると、これらの検索エンジンは、関連性に基づいてランク付けされ、指定されたキーワードを含む関連ドキュメントのリストのみを生成します。彼らは正確な答えを提供しません。QAS の目的は、限られた主題領域内で特定の質問に対する正確な回答を個人が見つけられるように支援することです5.QAS のグループ化は、 図 16 に概説されている次のカテゴリに基づいて実行できます。ファクトイドQASと非ファクトイドQASはどちらも自然言語(NL)を使用して動作し、NLで提起された質問に応答するように設計されています。このシステムは、NLP 技術を利用して、利用可能なコーパス7 に基づいて回答を提供します。

図1
図1:QAシステムの分類。 この図は、QA システムの主要なコンポーネントのマインド マップを示しています。その中心にあるのはQAシステムで、ファクトイド、非ファクト、ハイブリッド、ビジュアル、会話、多肢選択式など、さまざまなタイプの質問を処理します。この図の拡大版を表示するには、ここをクリックしてください。

この研究では、博士号の入学ポリシーと手順についてオランダのユーザーに応答するためのセマンティッククローズドドメイン質問応答(SCD-QA)システムを提示します。このシステムは、博士号の規則と規制 PDF8 をコア コンテキストとして使用し、応答を生成するための主要なフレームワークとして、トランスフォーマーベースの Transformers からの双方向エンコーダー表現 (BERT)9 モデルを実装します。目標は、一般的な質問に対する正確な回答を提供する意味的に会話型の FAQ ベースの QAS を設計し、新しく入学した学生が必要な重要な情報をすばやく見つけやすくすることです。

この目標を達成するために、広く知られている3つのトランスフォーマーベースのBERTモデル、Google-BERT9、DistilBERT 10,11、およびRoBERTa 12,13が使用され、すべてスタンフォード質問応答データセット(SQuAD)14でトレーニングされました。それらのパフォーマンスは、完全一致 (EM)14 によって測定されるセマンティック マッチングと、平均反応時間によって分析されるモデル レイテンシ15 の 2 つの重要なパラメーターを使用して評価されました。さらに、ベクトルデータベース(VD)16,17を使用してセマンティック埋め込みを保存し、セマンティック類似性スコアに基づいてユーザの質問に対して最も意味的に関連するコンテキストの検索を容易にした。

文献レビュー

トランスフォーマーベースのモデルはNLPの分野を全面的に見直し、QASに大幅な改善をもたらしました。BERT9 の導入により、堅牢で正確な QAS を開発する上で不可欠なコンポーネントとしてトランスフォーマー アーキテクチャがしっかりと強調されました。このセクションでは、Transformerベースのモデルとセマンティック埋め込みの最近の改善を、セマンティック会話型対話(SeCD)QAとの関連性に焦点を当てて、包括的にレビューします。この研究におけるこれらのモデルの統合を正当化するために比較分析が実行され、現場で有意義な洞察を促進するための実行可能性が強調されます。

BERT、DistilBERT、RoBERTa などの Transformer ベースのアーキテクチャは、セルフアテンション手法を使用してテキスト内の複雑なコンテキスト関係をキャプチャするため、QAS などの重要な意味理解が必要なタスクに最適です。これらのモデルは、特殊な文トランスフォーマーとともにセマンティック埋め込みを生成し、SeCD QAでのベクトルベースの類似性検索を通じて迅速かつ正確なコンテキスト検索を可能にするのに役立ちます。最近の研究は、特に SCD-QA などのタスク固有の用途において、スループット、スケーラビリティ、効率を向上させるためのこれらのモデルと埋め込み技術の改善に焦点を当てています。

Sengupta ら 18 は、BERT モデルを微調整することで、科学に基づく質問の多肢選択式 QAS (MCQAS) を強化する創造的なアプローチを導入しました。彼らのフレームワークでは、まず質問と回答のペア間の分散された意味的類似性を評価し、次にこれらの類似性スコアを元の特徴とともに分類層に入力しました。この組み合わせたアプローチにより、SciQ データセットで 90.2% の F1 スコアが達成され、微妙な理解と正確な分類が必要なタスク固有の QAS における BERT の有効性が強調されました。

Cicheckiら19 は、ChatGPTとスマート設計支援システム向けに微調整されたBERTモデルを比較したところ、微調整されたBERTモデルは、ドメイン固有のタスクにおいてChatGPTのような汎用大規模言語モデル(LLM)よりも優れており、カスタム設計のデータセットで88.5%のF1スコアを達成していることを発見しました。この研究は、特殊なアプリケーションにおけるモデルのパフォーマンスを向上させるためのドメイン固有の微調整の重要性を示しています。

Guo et al.20 は、限られたアノテーション予算の下での QAS のタスク固有の微調整戦略の効率を調べました。彼らの研究により、最初はSQuADなどの一般的なQAデータセットで、その後タスク固有のデータセットで微調整するという二重の微調整アプローチにより、COVID-QAなどのデータセットでF1スコアが15%大幅に向上することが明らかになりました。この発見は、SeCD QAS のパフォーマンスを向上させる上でのシーケンシャル微調整の重要な役割を浮き彫りにしています。

Pudasaini と Shakya21 は、生物医学研究論文における QA のための微調整された BERT モデルの適用を検討し、PubMed から提供されたカスタム生物医学 QA データセットで、EM スコアと F1 スコアがそれぞれ 83.89% と 89.67% であると報告しました。PubMedBERT で転移学習を活用することで、彼らの技術は複雑な生物医学クエリを処理する注目すべき能力を示し、この分野におけるタスク固有の微調整の可能性を強調しました。

Baekら22 は、ゼロショットナレッジグラフ(KG)QAのための知識拡張言語モデルプロンプトフレームワークを提案しました。このアプローチでは、意味的類似性を使用して KG から関連する事実を取得し、それらを入力質問に組み込みます。その結果、KG-QAデータセットで約85%のF1スコアを達成しました。この研究は、KG とトランスフォーマー モデルを組み合わせる可能性を示し、QA パフォーマンスの向上における知識拡張の利点を強調しています。

Hu et al.23 は、インテント分類とセマンティック分析のために BERT ベースのモデル (RoBERTa-BiLSTM-MultiHeadAttention) と並行して KG を活用して、戸籍ドメイン用に設計された QAS について説明しました。質問を単一イベントエンティティと意図関係に単純化することで、構造化データのクエリで高い精度を実現しました。さらに、この方法論の他の領域への拡張性は、KG ベースの QAS における幅広い適用可能性を強調しています。

Luo ら 24 は、ナレッジ ベース (KB) QA 用の BERT ベースのスキーマを導入し、マルチグラニュラリティ プルーニング モデル (MGPM) とリレーションを意識した注意を統合しました。彼らのアプローチは、SimpleQuestionsで94.4%、WebQuestionsSPで68.6%、WebQuestionsで63.7%という大幅な精度を達成しています。これらの結果は、構造化データクエリのセマンティック類似性を活用するBERTの有効性を示しています。全体として、この研究は、特に正確なエンティティと関係の識別が重要なシナリオにおいて、KB-QA のためのトランスフォーマーベースのモデルの可能性を強調しています。

Wu et al.25 は、安全性とコンプライアンスのクエリに特に焦点を当てて、建設管理における QA のための検索拡張生成フレームワークを設計しました。BERTベースのセマンティック埋め込みをジェネレーティブトランスフォーマーモデルおよびタスク固有のKGと統合することにより、彼らのアプローチは、構築関連のQAデータセットで88.7%のF1スコアを達成しました。この研究は、意味理解とKGベースの検索を組み合わせて、建設管理のためのタスク固有のQAデータセットの精度を向上させる可能性を実証しています。

Peng et al.26 は、医療 QA のために BERT や GPT ベースのモデルを含む LLM を体系的に評価しました。BERTのコンテキスト理解とGPTの生成能力を組み合わせることで、検索拡張生成とドメイン固有の微調整を使用して、PubMedと臨床ノートのデータセットで86.2%のF1スコアを達成しました。この研究は、コンテキストと正確な生成の両方が重要な医療における推論精度を向上させるアンサンブル モデルの可能性を強調しています。

Gardaziら27 は、QA、感情分析、名前付きエンティティ認識(NER)などのNLPタスクでのBERTの使用をレビューしました。彼らの分析では、微調整されたBERTモデルがSQuADなどのタスク固有のQAデータセットで85%〜92%のF1スコアを達成することが示されました。これは、BERTが効果的なコンテキスト埋め込みを確実に生成し、KGを追加するため、SeCD QASに適していることを示しています。

Transformer ベースのモデルは、コンテキスト依存の処理をキャプチャし、効率的に拡張し、ドメイン固有のタスクに適応する独自の機能により、SeCD QAS の決定的な選択肢となっています。表1は、トランスフォーマーベースのモデルをこの研究で検討した代替方法と比較することにより、この決定的な利点を示しています18,20,22,23,24,25。

接近主な特徴利点制限パフォーマンス・メトリック (SQuAD)ユースケースの適合性
トランスフォーマーベースのモデル(BERT、RoBERTa、DistilBERT)双方向コンテキストモデリング、セルフアテンション、ドメイン固有データに対する微調整 16, 17, 19, 24, 25高精度、堅牢な意味理解、ベクトルデータベース1820222425で拡張可能計算コストが高く、事前トレーニングが必要 17, 18EM: 80–90%、F1: 85–93% 1617192425クローズドドメイン(CD)に最適-QA、FAQシステム、セマンティック検索 16171920222425
従来のルールベースのシステム手作りのルール、キーワードマッチング 16低い計算コスト、簡単な実装 16スケーラビリティの制限、複雑なクエリの処理が不十分 1618EM: 50–60%、F1: 55–65% 16構造化データを使用した基本的なQAS 16
リカレントニューラルネットワーク(RNN)シーケンシャル処理、LSTM/GRUアーキテクチャ 19シーケンシャル・タスクの中程度のパフォーマンス 19長距離依存関係との闘い、推論の遅さ 19, 9EM:65–75%、F1:70–80% 19一般的なNLPタスク、CD-QAでは効果が低い 199
キーワードベースの検索システムTF-IDF、BM25アルゴリズム 1822高速検索、低リソース使用量 18, 22表面レベルのマッチングに限定され、意味理解が不十分 18, 22EM: 40–50%、F1: 45–55% 18, 22正確なQASには適していないドキュメント検索 1822
畳み込みニューラルネットワーク(CNN)局所特徴抽出、畳み込み層 25短いテキストの分類に効率的で、迅速な推論 25文脈の理解が限られており、複雑なQAS 25では効果が低くなりますEM: 60–70%、F1: 65–75% 25テキスト分類、CD-QA 25には適していません
グラフニューラルネットワーク(GNN)グラフベースのモデリング、関係推論 20マルチホップ推論に効果的で、ドキュメントの関係をキャプチャします 20計算の複雑さが高く、構造化データが必要 20EM:70–80%、F1:75–85% 20マルチホップQAS、シングルコンテキストCD-QA 20にはあまり適していません
ナレッジグラフベースのシステム構造化された知識表現、エンティティリンク 21構造化データのクエリに強力で、外部の知識を活用 21既知のエンティティに限定された事前構築されたナレッジ グラフが必要 21EM:65〜75%、F1:70〜80% 21構造化データを使用したドメイン固有のQAS 21
注意拡張モデル注意メカニズムの強化、コンテキストに焦点を当てた処理 24関連するテキストセグメントへの焦点の向上、高精度 24計算コストが高く、実装が複雑 24EM: 85–90%、F1: 88–92% 24複雑なCD-QA、非事実の質問 24
Bag-of-Words モデル単語の頻度ベースの表現 22シンプルで計算軽量 22意味理解が不十分で、複雑なクエリには効果がない 22, 25EM: 35–45%、F1: 40–50% 22基本的なテキスト検索、QAS 2225 には適していません
ハイブリッドニューラルモデル(CNN+RNN)ローカル処理と順次処理の組み合わせ 25ローカル理解と文脈理解のバランスをとる 25中程度の複雑さ、長い文脈に苦労する 25EM: 68–78%、F1: 72–82% 25一般的なNLPタスク、CD-QA 25に適度
統計言語モデル確率論的単語の連想 18単純なクエリで高速、リソース使用量が少ない 18コンテキスト理解が限られており、スケーラビリティが低い 18EM: 45–55%、F1: 50–60% 18基本的なQAS、複雑なCD-QAには適していません 18

表1:トランスフォーマーベースのモデルとQASの他のアプローチとの比較。 この表は、トランスフォーマーベースのモデル、ルールベースのシステム、RNN などを含む、さまざまな QA システムアプローチを並べて比較したものです。主な機能、長所、短所、SQuAD 上のパフォーマンス、および CD-QA、セマンティック検索、テキスト分類など、最適なタスクをまとめています。

この研究の主な目的は、NLP で効率的でスケーラブルかつ正確な SCD-QA システムを開発することにより、学生の機関情報へのアクセスを強化することです。具体的には、この確認研究は、博士号の領域内で事前トレーニングされたトランスフォーマーベースのモデルを適用および検証します。目的は、セマンティック マッチング、モデル遅延評価、VD 駆動のセマンティック検索を組み込むことで、その有効性と実用的な実現可能性を実証することです。このアプローチは、焦点を絞った制度的文脈で正確でドメイン固有の回答を提供するための詳細な分析を提供します。 図 2 は、システムの全体的なアーキテクチャ フレームワークを示しています。

図2
図2:SCD-QAシステムの全体的なスキーマ。この図は、大規模言語モデル(LLM)を活用したQAシステムのフローチャートを示しています。これは、コンテキスト ファイルとユーザーの質問から始まり、Google-BERT、DistilBERT、RoBERTa の 3 つのモデルと、1 つのキーワードベースのモデル TF-IDF によって処理されます。チェックリストを使用して各モデルのパフォーマンスを評価し、その結果に基づいて最適なモデルを選択します。この図の拡大版を表示するには、ここをクリックしてください。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

プロトコル

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

包括的な理論的根拠

QASコンポーネント: QAS フレームワークは、 図 3 に示すように、i) 質問処理モジュール (QPM)、ii) 文書処理モジュール (DPM)、iii) 回答抽出および定式化モジュール (AEFM) の 3 つのセグメントで構成されています。このシステムは、ファクトと非ファクトの2つの主要なカテゴリに分類される質問を受け取ります。ファクトイドの質問では通常、何を、どこで、いつ、誰が行うなどの疑問詞を使用しますが、非ファクトの質問では、どのように、なぜなどの単語を使用します。

DPM: 表示されたリストから、ユーザーは特定のパッセージを選択できます。次に、文章内の各トークンは、品詞 (POS) タガーを使用してタグ付けされます。動詞を抽出するには、動詞としてタグ付けされたすべてのトークンを識別します。これらの動詞を型破りな動詞のリストと組み合わせ、通常の動詞にロジックを適用します。抽出された動詞、その時制、およびそれらの -ing 形式を含むデータ構造 (配列) を作成します。

QPM: システムは、ユーザーから質問の形式で入力を受け取ります。テキストは StringTokenizer クラスを使用してトークン化され、結果のトークンは別のデータ構造に格納されます。このデータ構造は、プログラム内でさらに利用するために返されます。

AEFM: 最初のステップは、与えられた質問の動詞を特定することです。最近識別された動詞が、ドキュメント処理段階で生成されたトークンと照合されるようになりました。特定のタイプの事実に基づく質問(何を、いつなど)に対して選択したケースを使用して、より正確な方法で回答を抽出して構築します。

質問の種類を選択する前に、ユーザーはまず、選択した箇所を選択するように求められます。QPM は、ユーザーの質問を処理し、AEFM に転送する責任があります。AEFM は、DPM から取得した抽出と、元の入力ドキュメントのタグ付き形式を含む処理されたドキュメントを利用します。モジュールは、必要なアルゴリズムを定式化モジュールに渡して、目的の答えを取得します。

図3
図3:QASのコンポーネント。 この図は、QA システムの 4 つのステップ (質問、質問処理、回答処理、回答) を示しています。質問処理では、質問が分類されます。回答処理では、ドキュメントとパッセージを検索してレビューし、回答を作成します。この図の拡大版を表示するには、ここをクリックしてください。

BERTモデル: テキスト内の単語間の関連性を検出するために、BERT メソッドはトランスフォーマーを使用します。トランスにはエンコーダーとデコーダー28 の 2 つのメカニズムがありますが、BERT に必要なのはエンコーダーだけです。BERT は双方向のアプローチを採用し、入力テキストを体系的にスキャンして、文脈における単語の意味を自分自身に学習します。エンコーダーは、ベクトル化された一連のトークンを入力として受け取ります。次に、ベクトルはニューラル ネットワークに供給され、入力を反映する一連のベクトルが生成されます。単語の出力ベクトルは、その単語が出現する文に応じて変化します。単語のベクトルは、それが現れる文脈によって異なる場合があります。たとえば、「彼はクリケットをするのが好きです」の「like」は、「His face turned red like a tomato」の「like」とは異なるベクトルを持っています。このアプローチは、モデル構築フェーズに進む前に、テキスト処理のフェーズから始まります。BERT がテキストを処理するために実行する手順については、次のセクション28 で説明します。

テキスト処理: BERT モデルは、規定の一連の原則に従って入力テキストを表します。さらに、この要因はモデルのパフォーマンスの向上に貢献します。BERTにおける入力埋め込みは、3つの異なるタイプの埋め込み28の融合からなる。

位置埋め込み (PE): 埋め込みの注文関連情報を学習するために、PE が使用されます。PE は、トランスフォーマーで失われた順序に関する情報を復元するために使用されます。BERT は、入力シーケンス内の各ポイントに特化した個別の PE を開発します。BERTは、PEを利用して文内の単語の位置情報を伝える機能を持っています。これにより、BERT は単語の順序または順序を効果的にキャプチャして表現できるようになります。

文埋め込み (SE): さらに、モデルが 1 番目と 2 番目の文を区別するのを支援するために、BERT はそれぞれに固有の埋め込みを学習します。また、QA などのアクティビティの入力としてペアの文を受け入れることもできます。

トークン埋め込み (TE): TE は、WordPiece トークン語彙のトークンごとに教えられます。WordPieceトークンボキャブラリーは、コーパス内で見つかった単語から派生したサブワードユニットで構成されます。例示的な例として、この語彙コレクションには、Questio、Questi などを含む、Question という用語の考えられるすべてのサブワードが含まれます。

トークンの入力表現は、セグメント レベルと位置レベルで埋め込みを合計することによって構築されます。このため、モデルに豊富な情報を提供する広範な埋め込みアプローチです。 図49 は、BERTモデルの埋め込みを示しています。

図4
図4:BERT埋め込み。 この図は、トランスフォーマー・モデルの入力埋め込みがどのように作成されるかを示しています。入力シーケンスで始まります: [CLS] [MASK] 空は曇りです [SEP] 雨が降ります [SEP]。シーケンス内の各トークンは、Ethe や E[MASK] などの独自の埋め込みを受け取ります。次に、文ごとに文の埋め込みが追加されます (たとえば、最初の文には EA、2 番目の文には EB)。E0 から E9 というラベルの付いた位置埋め込みも含まれており、各トークンの位置を示します。これらすべてが組み合わされて、最終的な入力埋め込みが形成されます。この数値は9から修正された。この図の拡大版を表示するには、ここをクリックしてください。

BERTを使用したQAS設計: 説明のために、フットボールリーグ28に関するウィキペディアのエントリから抜粋した段落と併せて、この質問を検討してください。

質問:フットボールリーグはどこで設立されましたか?

パッセージ: 1888 年、フットボール リーグがイギリスで設立され、多くのプロ フットボール大会の最初の大会となりました。20世紀には、さまざまな種類のサッカーのいくつかが成長し、世界で最も人気のあるチームスポーツの一部になりました。

回答:イギリス

BERT モデルは、質問とコンテキストの両方からトークン抽出を利用し、それらを統合された入力に結合します。前述したように、このプロセスは、文の開始の指標として機能する [CLS] トークンの使用から始まります。さらに、[SEP] 区切り文字を使用して、質問と文章を明確に分離します。[SEP]トークンに加えて、BERTは、質問と回答を含むパッセージ28 を区別するためのSEを組み込んでいます。BERTは、質問専用とパッセージ専用の2つのSEを使用して、それらを明確に区別します。埋め込みは、その後、質問とパッセージを区別するために、トークンのワンホット表現28 と組み合わされます。このプロセスを 図 5 に示します。

図5
図5:BERT入力表現。 この図は、BERT ベースの QAS に対して入力埋め込みがどのように生成されるかを示しています。トークン [CLS] から始まり、次に「いくつ?」という質問が出ます。[SEP]、およびパッセージBERT largeは、それぞれに文の埋め込みがあります(Aは質問、Bはパッセージ)。トークン、文、および位置の埋め込みが組み合わされて、最終的な入力が作成されます。この図の拡大版を表示するには、ここをクリックしてください。

続いて、質問とコンテキストの組み合わされた埋め込み表現28 が、BERTモデルにおける入力として利用される。BERTの最後の隠れ層は、SoftMaxを使用して確率分布を生成するように変更されます。これらの分布は、入力テキスト文内の部分文字列の開始インデックスと終了インデックスを決定し、 図 6 に示すように、視覚的表現の回答を表します。

図6
図6:QAのBERT処理ワークフロー。この図は、BERT モデルが QA でどのように機能するかを示しています。これは、先頭に分類トークン [CLS] でマークされ、最後に [SEP] 区切り記号トークンでマークされた質問、その後に別の [SEP] で区切られたコンテキストを含む入力シーケンスが表示されます。このシーケンスのトークンは埋め込みに変換されます。次に、モデルはパッセージ内の回答の開始位置と終了位置を予測します。この図の拡大版を表示するには、ここをクリックしてください。

ベクトルデータベース(VD):VD17,18 は、データの高次元ベクトル表現を効率的に保存、管理、インデックス作成、およびクエリするための特殊なシステムです。ベクトルは多くの場合、ディープラーニングモデルから生成され、データに関するセマンティックまたはコンテキスト情報をカプセル化します。ベクトルの各次元は、特定の特徴を表します。埋め込みは、テキスト、画像、ビデオ、オーディオなどのオブジェクトを数値で表現したものです。これらの埋め込みは、機械学習 (ML)、NLP、レコメンデーション システム、コンピューター ビジョン、IR など、さまざまなアプリケーションで使用されます。VD は、ベクトル空間内で類似したオブジェクトを近接してグループ化することで、効果的な類似性検索とセマンティック クエリを容易にします。Facebook AI 類似性検索 (FAISS)29 は、ユーザーのクエリに最も関連性の高いコンテキストを特定するためにこの調査で使用される著名な VD です。表2は、VDの主な特徴とその使用例を示しています。

特徴形容
高次元データ数百または数千のディメンションを持つデータを処理します。
おおよその最近傍 (ANN)距離を近似することにより、高速な類似性検索を可能にします。
スケーラビリティ数十億のベクトルを持つ大規模なデータセットをサポートします。
統合多くの場合、シームレスなワークフローのために AI/ML フレームワークやツールと統合されます。
リアルタイムクエリ対話型アプリケーションに低遅延のベクトル検索を提供します。

表2:VDの主な特徴。 この表は、VD の重要な機能を示しています。これには、高次元データの処理、ANN アルゴリズムを使用した高速類似性検索の実行、大規模なデータセットへのスケーリング、AI および ML ツールの操作、対話型使用のための迅速なリアルタイム クエリのサポートが含まれます。

パフォーマンス評価指標: SCD-QA システムは、EM スコア14 とモデル レイテンシー15 の 2 つの主要な指標を使用して評価されました。QA研究の標準指標であるEMスコアは、グラウンドトゥルースと正確に一致する予測回答の割合を測定することにより、予測精度を評価します。N の質問のセットの場合、EM スコアは式 1 で次のように正式に定義されます。

式1ここで、 式2 (1)

このメトリックは、参照回答と完全に一致する場合はスコア 1、差がある場合は 0 のスコアを割り当てます。

レイテンシ・メトリックは、システムが個々のクエリーに対する応答を生成するのに必要な合計処理時間を定量化します。このメトリックは、式 2 に示すように、すべてのクエリの平均経過時間として計算されます。

式3 (2)

ここで、TstartiTendi は、それぞれ i番目のクエリの処理の開始と終了を示すタイムスタンプです。レイテンシーは秒単位で報告され、入力処理から回答生成までのすべての段階を網羅するシステムの応答性を捉えます。

方式

SCD-QAを実装するために、この論文には次のテスト研究が組み込まれています。

SCD-QAデータセット: SCD-QAシステムの実装のために提案されたデータセット30 が導入される。このデータセットは、インドのNITアルナーチャルプラデーシュ州の学生ガイドラインのための2022年8月の博士号ルールを含むテキストコーパスから導き出されています。SCD-QA システムを確立するには、すべての関連情報を正確な形式で網羅する JSON ファイルを生成する必要があります。データセットは、オープンソースのフレームワークであるHaystackアノテーションツール(バージョン2.18.1)31を使用して、テキストコーパスから生成されます。このツールを使用すると、SQuAD14 のスタイルで SCD-QA データセットを簡単に作成できます。PDFファイルからSQuADタイプの注釈付きデータセットを作成する手順を 図7に示し、SQuADスタイルのデータセットの構造を 図8に示します。

図7
図 7: PDF ファイルから注釈付きデータセットを作成する手順。この図は、Haystack ツールを使用して SQuAD スタイルの注釈付きデータセットを作成するための段階的なワークフローを示しています。PDFからのテキストの抽出、クリーニングとパッセージへの分割、質問と回答のペアへの手動注釈付け、SQuAD JSON形式での注釈の保存、そして最後にモデルトレーニング用のデータセットのエクスポートまでのプロセスの概要を説明します。この図の拡大版を表示するには、ここをクリックしてください。

図8
図8:ファクトイドQAデータセットの構造。 この図は、データセットの段落と QA ペアを表す JSON データ構造を示しています。一連の質問と回答を含む段落セクションがあります。1つの質問は、博士号への入学に必要な最低点数は何ですか?各質問には ID と回答の配列があります。回答には、ドキュメント ID、質問 ID、テキストの 60% マーク、回答の開始位置、および未指定の回答カテゴリが含まれます。is_impossible フラグは false に設定されています。この図の拡大版を表示するには、ここをクリックしてください。

データセットは辞書のリストとして構成されており、各辞書には、データ、段落、質問、answer_id、document_id、question_id、テキスト、answer_start、answer_end、is_impossible、コンテキストなどの主要なフィールドが含まれています。

data: 質問応答の全体的な情報が含まれています。
段落: 特定のコンテキストとその質問と回答。
質問: 特定の質問です。
answer_id: 各回答テキストの一意の識別番号。
document_id: 各コンテキストの一意の識別番号。
question_id: 各質問の一意の識別番号。
text: 回答テキスト。
answer_start: コンテキスト内の正解の回答開始位置。
answer_end: コンテキスト内の正解の回答終了位置。
is_impossible: 質問に対する回答がコンテキストで利用できるかどうかを示します。
context: 答えを見つけることができるテキストコーパス。
提案されたデータセットの 80 の質問はすべて、ファクトイドおよび非ファクトの質問形式に従っています。いくつかのタイプのフレーム化された質問のサンプルを 表 3 に示します。

PSとは誰ですか?
最先端のドキュメントのフォント サイズはどれくらいですか?
産休は何日ですか?

表3:データセットからのサンプル質問。 この表は、2種類の質問の例を示しています:1番目と2番目はファクトイドの質問で、3番目は非ファクトの質問です。

FAISS: FAISS (バージョン faiss_cpu-1.9.0)29,32 は、Facebook AI Research (FAIR) によって開発されたオープンソース ライブラリであり、高密度ベクトルの効率的な類似性検索とクラスタリングを容易にします。大規模で高次元のデータを効果的に管理するために特別に設計されています。このシステムは、数百万または数十億のベクトルで構成されるデータセット内での迅速かつスケーラブルなANN検索を容易にします。NLP、レコメンデーション システム、画像やビデオの検索など、埋め込みに関連するアプリケーションで広く利用されています。FAISS は、フラット (ブルート フォース)、反転ファイル (IVF)、階層ナビゲーション可能なスモール ワールド グラフ (HNSW)、積量子化 (PQ) など、複数のインデックス作成方法を提供します。これらの方法により、ユーザーはデータ サイズ、次元、ハードウェア仕様に従って検索パフォーマンスを最適化できます。この研究では、L2 (ユークリッド) 距離を使用してブルート フォース検索を実行し、最近傍を特定するフラット インデックスが使用されます。このシステムのスケーラビリティは CPU と GPU の両方の実装をサポートし、広範なデータセットにわたる高性能計算を可能にします。さらに、特定のアプリケーション要件に基づいて速度と精度のバランスを最適化する柔軟性を提供します。FAISS は、BERT や Word2Vec などの埋め込みの意味的類似性を評価するために NLP で頻繁に使用されます。FAISS は、ドキュメントまたは文章のベクトル表現を保存および管理するために QAS で利用されます。近似ANN検索33を実行して、ユーザーの質問に最も関連性の高いコンテキストを取得し、BERTなどのトランスフォーマーモデルからの埋め込みでセマンティック検索を強化します。FAISS は、その多用途性により、AI および ML ワークフローの基本的なツールです。

BERT-large-cased-whole-word-masking-finetuned- SQuAD モデル: 本研究では、BERT-large-uncased-whole-word-masking finetuned-squad9 として知られる事前トレーニング済み言語モデルを利用して、研究で提案されたデータセットを使用してファクトイド QAS を開発します。BERTモデルは、リスト、表、見出しを除き、11,038冊の未発表の本9のデータセットであるBookCorpusと英語版ウィキペディアで事前トレーニングを受けました。問題のモデルは大文字と小文字が取られていないため、英語と英語という単語を区別していません。このモデルは、自己教師ありアプローチを使用して大量の英語データでトレーニングされた事前トレーニング済みのトランスフォーマー モデルです。このモデルは、人間の注釈を一切使用せずに、生のテキストのみで事前トレーニングされました。これにより、公開されている大量のデータを活用できます。事前トレーニング プロセスには、提供されたテキストから入力とラベルを自動的に生成することが含まれます。モデルは、2つの特定の目的9でトレーニングされました。

MLM: このプロセスでは、入力文内の単語の 15%9 をランダムにマスクします。次に、モデルはマスクされた文全体を処理し、マスクされた単語を予測します。このアプローチは、通常、単語を順番に処理する従来のリカレント ニューラル ネットワーク (RNN) や、将来のトークンの内部マスキングを採用する GPT などの自己回帰モデルとは異なります。この機能により、モデルは文の双方向表現を取得できます。

NSP: 事前トレーニング フェーズでは、モデルは 2 つの偽装された文を入力として組み合わせます。場合によっては、これらの文章が原文に隣接しており、直接的な関係を示しています。また、そうでない場合もあり、つまり、それらをリンクする元の近接性やコンテキストがないことを意味します。次のステップでは、モデルが 2 つの文が論理的に一貫しているかどうかを予測します。

現在のモデルは、モデルアーキテクチャが24層で構成され、隠れ寸法が1024であるという後続の構成が特徴です。16 個のアテンション ヘッドを使用し、合計 3 億 3,600 万のパラメータ9 があります。

WordPiece は、前処理ステップで 30,000 ワードの語彙サイズのテキストをトークン化するために使用されます。モデルの入力は、[CLS] 文 A [SEP] 文 B [SEP] のようになります。唯一の要件は、結合された文の全長が 512 トークン9 未満であることです。特定の事前トレーニング済みモデルは、達成されたF1スコアが93.15%であるのに対し、正確な一致スコアは86.91%9であるという、後続の出力を生成します。

Distilbert/distilbert-base-cased-distilled-squad モデル: DistilBERT10 モデルは、BERT9 モデルのよりコンパクトで迅速かつ効率的なバリアントであり、BERT の意味理解能力の大部分を維持するために開発されましたが、リソースの集約度が低く、計算能力が制限された実際のアプリケーションに適しています。バージョンdistilbert-base-cased-distilled-squadは、QAタスクのためにSQuAD14 で微調整されています。このモデルは、言語理解における BERT の有効性の 97% を維持しながら、BERT の 1 億 1,000 万とは対照的に、サイズを 6,600 万に縮小するトランスフォーマー アーキテクチャを利用しています。DistilBERTは、より大きなBERTモデルからよりコンパクトなDistilBERTモデルに情報を伝達する知識蒸留と呼ばれる方法を使用してこれに到達します。サイズが小さいため、情報をより迅速に推測でき、使用するメモリが少なく、モバイルやエッジデバイスなどのリソースに制約のあるアプリケーションに最適です。SQuAD 1.1データセットで慎重に微調整されたこのモデルは、抽出QAタスクにおいて並外れた熟練度を示しており、その目的は、質問に答える特定のコンテキストからテキストのセグメントを見つけることです。DistilBERTは、SQuADリーダーボードでBERTのF1スコアの約85%を達成し、サイズが小さくなっているにもかかわらず、BERTの言語能力のかなりの部分を維持しています。このモデルは、本番レベルのQAジョブにとって非常に効率的なソリューションであり、パフォーマンスと計算効率の両方を最適化します。

ディープセット/roberta-base-squad2:deepset/roberta-base-squad2 モデル12,13 は、RoBERTa アーキテクチャの微調整されたバリアントです。これは、回答された質問と回答できない質問の両方を含む SQuAD14 2.0 データセット用に特別に設計されています。この改良されたRoBERTaフレームワークにより、BERTの9つのNSPジョブが排除されます。また、トレーニング中に動的マスキングを使用して、NL 理解タスクの効率とパフォーマンスを向上させます。このモデルには 1 億 2,500 万のパラメータがあり、双方向トランスを使用します。これにより、双方向からコンテキスト情報を取得し、抽出的なQAタスクに優れています。

SQuAD 2.0 で微調整を行うことで、モデルは特定のコンテキスト内で正しい応答範囲を識別し、答えがない場合を認識できます。サブワードのトークン化を処理し、大文字と小文字を区別するバイトペアエンコーディング(BPE)トークナイザーを使用します。これにより、一般的で複雑な単語を処理する能力が向上します。このモデルは良好なパフォーマンスを発揮し、およそ 85%-90% の F1 と 80%-85% の EM を達成しています。答えのない質問を見つける機能と効果的な展開により、顧客サービス、知識検索、仮想アシスタントにとって価値があります。

SQuAD で微調整された BERT モデルを QA 用にデプロイする最も効果的な方法は、Hugging Face Transformers パイプライン34 を使用することです。このフレームワークは、トークン化、入力フォーマット、モデルの読み込み、出力後処理を合理化します。これらのモデルは、特定のコンテキストから直接取得されたテキスト スパンが回答である抽出 QA での有効性が広く認識されています。実装をガイドするために、次の手順では、BERT モデルを実行する手順の概要を示します。

入力とセットアップ: このプロセスには、4つの主要な入力とセットアップパラメータが必要です。Hugging Face Hubの文字列識別子として指定されたモデル名(たとえば、google-bert/bert-large-uncased-whole-word-masking-finetuned-squad、distilbert/distilbert-base-cased-distilled-squad、またはdeepset/roberta-base-squad2)。質問 (Q) は、クエリを含む文字列として提供されます。コンテキスト (C) は、関連するテキストまたはパッセージを表す文字列です。使用される主なツールは、Python (バージョン 3.12.12) の Hugging Face トランスフォーマー ライブラリ (バージョン 4.57.0) の高レベルのパイプライン関数です。

プロセス: 実行 (Hugging Face パイプライン): このプロセスは 6 つの主要なステップで構成され、Qa タスクの複雑さに対処するために Hugging Face パイプラインを採用しています。

ライブラリのインストール: まず、 コマンドpip install transformersを使用して必要なライブラリをインストールします。このインストールにより、モデルと合理化されたパイプライン機能にアクセスできるようになります。

パイプラインのインポート: パイプライン関数は、トランスフォーマーからパイプラインをインポートします。

QAパイプラインを初期化します。qa_pipeline = pipeline("question-answering", model="") を使用して QA パイプラインを初期化します。このコマンドは、モデルとトークナイザーをダウンロードし、推論の準備を整えます。

入力の定義: 質問設定=...そしてコンテキスト= ...をクリックして、モデルのデータを準備します。

推論の実行: 質問とコンテキストを result = qa_pipeline(question=question, context=context) でパイプラインに渡します。モデルは入力を処理し、回答を提供します。

回答を抽出する: answer = result['answer'] を使用して出力辞書から回答文字列を取得します。

アウトプット: このプロセスでは、Answer (コンテキストから抽出されたテキスト スパンを文字列として表示)、Score (予測に対するモデルの信頼度を定量化する浮動小数点値)、および Start インデックスと End インデックス (コンテキスト内の回答スパンの文字位置を指定する整数) の順序で、いくつかの出力パラメーターが生成されます。

センテンストランスフォーマー/all-MiniLM-L6-v2: all-MiniLM-L6-v235 は、Sentence-Transformers ライブラリ (バージョン 5.1.1)36 の事前トレーニング済みセンテンス トランスフォーマーです。効率的で正確なテキスト埋め込みに最適化されています。Microsoft の MiniLM フレームワークで開発され、6 つのトランスフォーマー層と 384 次元の埋め込みが含まれています。この設計はパフォーマンスと計算能力のバランスが取れており、リアルタイム アプリケーションに適しています。このモデルは、SNLI、MultiNLI、STSベンチマーク、Webクロールデータなどのデータセットから10億を超えるフレーズペアでトレーニングされました。その結果、意味的類似性、グループ化、検索関連のタスクに習熟していることが実証されます。オール MiniLM-L6-v2 は、サイズが小さく (~22MB) 推論性能が向上しているため、セマンティック検索、重複検出、テキスト分類などのアプリケーションを簡素化します。軽量ですが、STS-BやSICK-Rなどのベンチマークで高い精度を実現するため、スケーラブルなシナリオとリソースが限られているシナリオの両方に効果的な選択肢となります。Sentence-Transformerを使用して埋め込みを生成するワークフローを、以下の 図9 に示します。

図9
図9:センテンストランスフォーマーモデルを使用した埋め込みプロセスのステップ。 この図は、センテンス・トランスフォーマー・フレームワークを使用してテキスト埋め込みを生成するためのワークフローを示しています。ライブラリのインポートと事前トレーニング済みモデルのロードから、テキスト データの準備、埋め込みの生成、NumPy 配列への変換、インデックス作成や類似性検索などのダウンストリーム タスクへの保存までのプロセスの概要を説明します。この図の拡大版を表示するには、ここをクリックしてください。

提案されたアルゴリズム: この研究では、ユーザーからのファクトイドと非ファクトの両方の質問に対処できる、SeCD ベースの SCD-QA システムの開発のためにアルゴリズム 1 で提案された方法論の概要を説明します。

アルゴリズム1:提案されたSeCDベースのSCD-QAシステムのアルゴリズム
入力: 生のコンテキスト ファイル (C) とユーザーのクエリ (Q) のセット。
出力: 選択した最適なトランスフォーマーベースの LLM (M') と、 M' によって生成された応答。
コンテキストの前処理: 生のコンテキスト セット C に注釈を付けて、DSQuAD 形式の構造化データセットを作成します。
DSQuAD = fアノネート (C)
コンテキスト埋め込みの生成: Sentence-Transformer fembed を使用して、各コンテキスト c 式100 DSQuAD を埋め込み ec に変換します。
式15
埋め込みの保存: 効率的な類似性検索のために、Ec をベクトル データベース V に格納します。
式18
クエリ埋め込みの生成: 同じ文トランスフォーマーを使用して、ユーザーのクエリ Q を埋め込み eq に変換します。
式20
コンテキスト検索: eq との類似性に基づいて、データベース V から最も関連性の高いコンテキスト埋め込み式21を取得します。
式22
ここで、 sim(eq,e c)は類似性関数です。
LLMへのコンテキストの受け渡し:取得したコンテキスト式21 を3つのトランスフォーマーベースのLLMにフィードします:Google-BERT(M1)、DistilBERT(M2)、RoBERTa(M3)、および従来のモデル:TF-IDF+Cosine Similarity(M4)
式28
モデル評価: 各応答をスコアリングする評価関数 feval を使用して、応答 {R1,R 2,R 3,R 4} を比較します。
式31
最適なモデルの選択: 評価スコアが最も高いモデル M' を特定します。
式33
最終出力の生成: M' を使用して、に基づいて最終応答 R を生成します。式36
式37
終わり

提案されたアルゴリズムプロセスは、ユーザーの質問に対処するために理想的なトランスフォーマーベースのLLMを選択するための体系的なアプローチ(図10)を概説しています。前処理、埋め込みベースのコンテキスト検索、マルチモデル評価が組み込まれており、高品質でコンテキストに関連した回答が保証されます。以下に、わかりやすくするために段階的なプロセスについて説明します。

データの準備と前処理: 最初のフェーズでは、生のテキスト データの処理が含まれます。

入力:生のテキストファイル8 は、システムに適合されます。

注釈ツール31: 入力は SQuAD14 形式の構造化データセットに変換されます。このステップでは、QA ペアの作成を行います。また、関連するテキスト データを明確に定義されたコンテキスト ブロックに整理します。

出力: これで、データセットで埋め込みを作成する準備が整いました。

コンテキスト埋め込みの生成: 効率的でスケーラブルなコンテキスト検索を可能にするために、トレーニングされた Sentence-Transformer35,36 モデルが注釈付きデータセットに適用されます。このトランスフォーマーは、テキストを意味的な意味を捉える高次元埋め込みに変換します。埋め込みはVD、FAISS29,32に保存され、類似性ベースの高速検索を可能にします。

ユーザ問合せ処理: ユーザが質問を送信すると、その質問は同じセンテンストランスフォーマ35,36によって処理される。これにより、コンテキスト埋め込みと同じベクトル空間29,32に対応する埋め込みが生成される。この設計により、クエリを関連するコンテキスト エントリと照合できます。

ベクトル類似性を使用したコンテキスト検索: 類似性メトリック (コサイン類似性など) を使用して、システムはクエリの埋め込みと保存されたコンテキストの埋め込みを比較します。システムは、最も高い類似性スコアに基づいて、最も関連性の高いコンテキストを選択します。これにより、関連するコンテキストのみが下流モデルに渡されます。このプロセスにより、計算オーバーヘッドが削減され、関連性が向上します。

複数のLLMにわたるモデル評価:選択したコンテキストは、Google-BERT28、DistilBERT10RoBERTa 12の3つのトランスフォーマーベースのLLMによって評価されます。また、コサイン類似モデルを備えた従来のキーワードベースのTF-IDF37 によっても評価されます。各モデルはコンテキストを処理し、ユーザーの質問に対する応答を生成します。

比較評価: 4 つの LLM モデルからの応答は、2 つの主要な指標を使用して評価されます。まず、セマンティック マッチングは EM14 によって評価されます。次に、モデルのレイテンシーは、平均反応時間15によって分析されます。

モデルの選択と最終出力: 最もパフォーマンスの高いモデルが、ユーザーの質問に適した LLM として選択されます。選択したモデルからの最終応答が考慮されます。これにより、計算効率と応答品質のバランスが確保されます。

図10
図10:トランスフォーマーベースのモデルを使用したSCD-QAシステムのワークフロー。この図は、SCD-QAシステムの仕組みを示しています。まず、生のコンテキスト ファイルをアノテーション ツールによって処理して、SQuAD 形式のデータセットを作成します。次に、センテンストランスフォーマーが埋め込みを生成し、FAISSベクトルデータベースに格納します。ユーザーが質問すると、システムはその質問の埋め込みを作成し、最も関連性の高いコンテキストを選択します。3つのトランスフォーマーベースのモデル(Google-BERT、DistilBERT、RoBERTa)と、従来のTFIDF+コサイン類似性スコアの1つを比較し、最もパフォーマンスの高いモデルを使用して答えを提供します。この図の拡大版を表示するには、ここをクリックしてください。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

SCD-QAシステムの実装では、4つのLLMと、80のファクトイドおよび非ファクトイドの質問のデータセットを使用しました。処理は、NVIDIA Tesla T4 GPU(ドライバーバージョン:550.54.15、CUDAバージョン:12.4)と12.7GBのシステムRAM、15GBのGPU RAM、112.6GBのディスク容量を使用して、Google Colabで実行されました。モデルのパフォーマンスは、セマンティックマッチングのEM14 と反応時間のモデルレイテンシー15 の2つの指標を使用して評価されました。

SCD-QAデータセット

SCD-QAデータセットは、Haystackアノテーションツール(...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

ディスカッション

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

この研究では、トランスフォーマーベースの言語モデルを活用して、構造化された機関文書から正確でコンテキストを認識した応答を提供する SCD-QA システムを導入します。システムのワークフローは、(1)データの前処理で構成されています。(2)最先端のセンテンストランスフォーマーであるall-MiniLM-L6-v2を使用した埋め込み生成。(3) FAISS による類似性ベースの検索。(4)包括的なモデル評価。パイプラインは、機関の政策文書から抽出された 80 の慎重に注釈が付けられ、回答可能なファクトイドおよび非ファクトイドの質問を含む SCD-QA データセットでテストされました。

調査した 3 つのトランスフォーマー モデルのうち、Google-BERT は平均 EM スコア 90.00 で優れたパフォーマンスを示しましたが、これは他のモデルと比較して応答遅延が高くなるという代償を払っていました。従来のキーワードベースの TF-IDF 検索は、計算効率は高いものの精度が著しく劣っており、トランスフォーマー モデルに...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

開示事項

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者らは開示するものは何もない。

謝辞

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者らは、この研究全体を通じて揺るぎない支援と指導をしてくれた NIT アルナーチャル プラデーシュ州の献身的な教員と管理者に感謝します。さらに、この研究を可能にしてくれたオープンソースのNLPツールと事前トレーニング済みモデルの開発者と貢献者に深く感謝しています。この原稿の準備中、著者は明瞭さを高めるために Grammarly Proofreader を使用しました。著者は、コンテンツの正確性と完全性について全責任を負います。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

材料

この記事で使用された材料の一覧
名前会社カタログ番号コメント
全ミニLM-L6-v2マイクロソフトバージョン5.1.1高次元埋め込みを生成する事前学習済み文変換モデル。テキストを埋め込みに変換し、コンテキスト検索を行います。
注釈ツール干し草の山バージョン 2.18.1生のテキストをSQuAD形式に構成するためのプラットフォーム。QAペアやコンテキストブロックを作成してデータセットを準備します。
DistilBERTモデルハグフェイスNA計算要件を抑えた軽量トランスベースのLLM。比較のために評価すると、レイテンシは低いものの精度は劣ります。
FAISS VDフェイスブックfaiss_cpu-1.9.0類似度に基づく検索のためのスケーラブルVD。効率的なクエリマッチングのために高次元埋め込みを保存・取得します。
Google-BERTモデルググるNA双方向コンテキストモデリングを備えた事前学習型トランスフォーマーベースのLLM。事実に関するクエリおよび非事実に関するクエリに対して正確な回答を生成する主要なモデル。
NVIDIA テスラ T4 GPUNVIDIAドライバーバージョン:550.54.15
CUDA バージョン:12.4
モデル推論用に15GBのGPU搭載RAMを搭載するGPUです。LLMの処理および評価のための計算能力を提供します。
ニシキヘビPythonソフトウェア財団バージョン 3.12.12Pythonは、その直快な構文、包括的なライブラリ、そして強力なコミュニティサポートにより、自然言語処理(NLP)分野でリーディングするプログラミング言語です。基本的なテキスト前処理や複雑な機械学習実装を含む幅広いNLPタスクをサポートしています。
RoBERTaモデルディープセットNA強化されたトレーニング戦略を備えた最適化されたトランスフォーマーベースのLLM。比較のために評価され、精度と遅延のバランスが取れます。
SCD-QAデータセットはSQuAD として使われます。形式NAバージョン2.0質問と回答のペアの標準化されたフォーマット。トランスフォーマーモデルとの互換性のための構造データセット。

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Pirtoaca, G. S., Rebedea, T., Ruseti, S. Improving retrieval-based question answering with deep inference models. Int Joint Conf Neural Network. , 1-8 (2019).
  2. NLP-QA framework based on LSTM-RNN. Zhang, X., Chen, M. H., Qin, Y. Int Conf Data Sci Business Anal, , 307-311 (2018).
  3. Natural language processing based new approach to design factoid question answering system. Machhirke, V. S., Soni, A. Second Int Conf Inventive Res Computing Appl, , 276-281 (2020).
  4. Biancofiore, G. M., Deldjoo, Y., Di Noia, T., Di Sciascio, E., Narducci, F. Interactive question answering systems: literature review. ACM Comput Surv. 1 (1), Article 1(2024).
  5. Singh, S., Das, N., Michael, R., Tanwar, P. The question answering system using NLP and AI. Int J Sci Eng Res. 7 (12), 2229-5518 (2016).
  6. Pandya, H. A., Bhatt, B. S. Question answering survey: Directions, challenges, datasets, evaluation matrices. arXiv. , (2021).
  7. Khvalchik, M. A., Kulkarni, K. Open-domain non-factoid question answering. , Springer International Publishing. Cham. (2017).
  8. NIT Arunachal Pradesh PhD rules and regulations year. , National Institute of Technology Arunachal Pradesh. https://www.nitap.ac.in/storage/pdf/140508582e7c89a8b2295595085e3abe-%2003-37-28F%20IN%20AL.pdf (2022).
  9. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. BERT: Pre-training of deep bidirectional transformers for language understanding. Proc NAACL-HLT. , 4171-4186 (2019).
  10. Sanh, V., Debut, L., Chaumond, J., Wolf, T. DistilBERT, a distilled version of BERT: Smaller, faster, cheaper and lighter. arXiv. , (2019).
  11. DistilBERT HuggingFace. , https://huggingface.co/distilbert/distilbert-base-cased-distilled-squad (2023).
  12. Liu, Y., et al. A robustly optimized BERT pretraining approach. arXiv. , (2019).
  13. RoBERTa base squad2. Deepset. , https://huggingface.co/deepset/roberta-base-squad2 (2023).
  14. SQuAD: 100,000+ questions for machine comprehension of text. Rajpurkar, P., Zhang, J., Lopyrev, K., Liang, P. Proc 2016 Conf Empirical Meth Natural Language Proc, , 2383-2392 (2016).
  15. Attention is all you need. Vaswani, A., et al. 31st Conf Neural Informat Proc Syst, , 1-11 (2017).
  16. Malkov, Y. A., Yashunin, D. A. Efficient and robust approximate nearest neighbor search using hierarchical navigable small world graphs. IEEE Trans Pattern Anal Mach Intell. 42 (4), 824-836 (2018).
  17. Similarity search in high dimensions via hashing. Gionis, A., Indyk, P., Motwani, R. Proc 25th VLDB Conf, , 518-529 (1999).
  18. HIJLI_JU at SemEval-2024 task 7: Enhancing quantitative question answering using fine-tuned BERT models. Sengupta, P., Sarkar, S., Das, D. Proc 18th Int Workshop Semantic Evaluat, , 279-284 (2024).
  19. Kocoń, J., et al. ChatGPT: Jack of all trades, master of none. Inf Fusion. 99, 101861(2023).
  20. Fine-tuning strategies for domain specific question answering under low annotation budget constraints. Guo, K., Diefenbach, D., Gourru, A., Gravier, C. IEEE 35th Int Conf Tools with Artificial Intell, , 166-171 (2023).
  21. Question answering on biomedical research papers using transfer learning on BERT-base models. Pudasaini, S., Shakya, S. 7th Int Conf I-SMAC (IoT in Social, Mobile, Analytics and Cloud), , 496-501 (2023).
  22. Knowledge-augmented language model prompting for zero-shot knowledge graph question answering. Baek, J., Aji, A. F., Saffari, A. Proc 1st Workshop Natural Language Reasoning Struct Explanat, , 78-106 (2023).
  23. Hu, S., Zhang, H., Zhang, W. Domain knowledge graph question answering based on semantic analysis and data augmentation. Appl Sci. 13 (15), (2023).
  24. A BERT-based approach for knowledge base question answering. Luo, D., Su, J., Yu, S. Int Joint Conf Neural Networks, , 1-8 (2020).
  25. Wu, C., et al. Retrieval augmented generation-driven information retrieval and question answering in construction management. Adv Eng Inform. 65, 103158(2025).
  26. Peng, C., et al. A study of generative large language model for medical research and healthcare. NPJ Digit Med. 6 (1), 210(2023).
  27. Gardazi, N. M., et al. applications in natural language processing: a review. Artif Intell Rev. 58 (6), 1-49 (2025).
  28. Sabharwal, N., Agrawal, A. Hands-on question answering systems with BERT: applications in neural networks and natural language processing. , Apress Berkeley. CA. (2021).
  29. FAISS documentation. , https://faiss.ai/ (2025).
  30. Bhattacharya, D. SCD-QA dataset. Zenodo. , (2025).
  31. Annotation tool. , https://docs.haystack.deepset.ai/docs/annotation (2025).
  32. Johnson, J., Douze, M., Jégou, H. Billion-scale similarity search with GPUs. IEEE Transac Big Data. 7 (3), 535-547 (2021).
  33. Sun, P., Guo, R., Kumar, S. Automating nearest neighbor search configuration with constrained optimization. arXiv. , (2023).
  34. BERT. , Hugging Face. https://huggingface.co/docs/transformers/model_doc/bert (2025).
  35. MiniLM: Deep self-attention distillation for task-agnostic compression of pre-trained transformers. Wang, W., et al. Proc 34th Int Conf Neural Informat Process Syst, , 5776-5788 (2020).
  36. Sentence transformer documentation. , https://www.sbert.net/ (2025).
  37. Cosine similarity to determine similarity measure: study case in online essay assessment. Lahitani, A. R., Permanasari, A. E., Setiawan, N. A. 4th Int Conf Cyber IT Service Manag, , 1-6 (2016).
  38. A comparative analysis of transformer models in zero-shot text classification. Kyritsis, K., Liapis, C. M., Spatiotis, N., Perikos, I., Paraskevas, M. 15th Int Conf Informat Intelligence Syst Applicat, , 1-4 (2024).
  39. Howard, J., Ruder, S. Universal language model fine-tuning for text classification. Proc 56th Ann Meeting Associat Computat Linguistics. , 328-339 (2018).
  40. Asai, A., Hashimoto, K., Hajishirzi, H., Socher, R., Xiong, C. Learning to retrieve reasoning paths over Wikipedia graph for question answering. arXiv. , (2019).
  41. Lewis, P., et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. arXiv. , (2021).
  42. Leveraging passage retrieval with generative models for open domain question answering. Izacard, G., Grave, E. Proc Conf Eur Chapter Associat Computat Linguistics, , 874-880 (2021).

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

再版と許可

このJoVE記事のテキストまたは図の再利用許可をリクエスト

許可をリクエスト

タグ

QA SQuAD TF IDF

関連記事