Method Article

ベクトル埋め込みによる大規模言語モデルの拡張によるドメイン固有の応答性の向上

DOI:

10.3791/66796

December 6th, 2024

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

このプロトコルでは、ベクトル埋め込みメカニズムを通じて、査読済みのドメイン固有の科学論文による拡張により、Foundation Large Language Modelの応答品質が向上します。さらに、大規模な言語モデル間でのパフォーマンス比較を支援するコードが提供されています。

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

大規模言語モデル (LLM) は、ユーザー クエリに関連する情報を生成するための一般的なリソースとして登場しました。このようなモデルは、テキストデータの広範で静的なコーパスを利用した、リソースを大量に消費するトレーニングプロセスを通じて作成されます。この静的な性質により、急速に変化する知識、専有情報、機密データを含むドメインでの採用には制限があります。この研究では、最新の査読済み科学原稿を組み込むための埋め込みベースのアプローチを使用して、基礎モデルとして知られる汎用LLMをドメイン固有の情報で拡張する方法を概説します。これは、Llama-Index などのオープンソース ツールや Llama-2 などの公開モデルを通じて実現され、透明性、ユーザーのプライバシーと制御、および再現性を最大化します。科学論文はユースケースの例として使用されていますが、このアプローチは任意のテキストデータソースに拡張できます。さらに、この機能強化後のモデルのパフォーマンスを評価する方法についても説明します。 これらの方法により、トレーニングコーパス内の情報の包括性に関係なく、高度に専門化されたドメイン向けのLLMシステムを迅速に開発できます。

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

OpenAIのChatGPTやMeta AIのLlamaなどの大規模言語モデル(LLM)は、ユーザープロンプトに関連するテキストを生成するためのリソースとして急速に普及しています。もともとは、シーケンス内の次の語彙項目を予測するために機能していましたが、これらのモデルは、コンテキストを理解し、臨床情報をエンコードし、さまざまなタスク1234で高いパフォーマンスを発揮するように進化しました。言語モデルは、そのような機能や現在の人気レベルよりも数十年前のものですが5、近年のディープラーニングとコンピューティング機能の進歩により、Webベースのテクノロジーやアプリケーションプログラムインターフェース(API)6を通じて、事前に学習された高品質の商用LLMが広く利用できるようになりました。ただし、この形式で LLM を消費することには、いくつかの注目すべき制限があります。

課題1:静的トレーニングコーパス
LLMは、膨大なテキストデータ(たとえば、Llama 27の場合は2兆トークン)で訓練されますが、静的なテキストデータ本体です。そのため、急速な発展を遂げている分野や文献が変化している分野に対して、的確な回答を出すことが課題となっています。この静的なアプローチでは、LLMは最新のデータに追いつくために頻繁な再トレーニングが必要になりますが、これは実用的でもスケーラブルでもありません。さらに、学習データに存在しない情報に基づく応答を必要とするプロンプトは、有用なテキスト生成を妨げたり、幻覚8を引き起こしたりする可能性がある。幻覚または事実の捏造の事例は、特に情報の正確性が重要な環境において、LLMの信頼性について重大な懸念を引き起こす9。

課題2:ドメイン特異性の欠如
事前学習済みモデルは、多くの場合、一般的な使用のために作成されますが、ユーザーは特定のドメインでのパフォーマンスに特に最適化されたモデルを必要とする場合があります。さらに、de novo モデルのトレーニングや大幅な微調整の実行に必要な計算リソースとデータは、多くのユーザーにとって非常に困難です。

課題3:プライバシーの欠如
機密データや専有情報を含むアプリケーションを追求しているユーザーは、データの保存方法や利用方法に関する情報が不足しているため、特定のLLMサービスを使用したくない、または使用できない場合があります。

課題4:安定性が保証されていない
独自のLLMを持つサービスは、利用可能なモデルを変更したり、動作をいつでも変更したりする可能性があるため、これらのサービスに依存するアプリケーションの実装では安定性が懸念事項となります。

Retrieval-augmented generation(RAG)は、特にモデルのトレーニングコーパス10,11の外部の情報に関連するクエリで、LLMのパフォーマンスを向上させるために開発された技術である。これらのシステムは、ユーザークエリへの応答を生成する際に考慮すべきコンテキスト情報を組み込むことにより、LLMを強化します。最近のさまざまな研究が、RAGシステムのアプリケーションとその潜在的な利点について説明しています12,13,14。

この研究で概説した方法の目標は、そのようなシステムの構築を実証し、研究者がドメイン固有の拡張LLMを迅速に実験するためのフレームワークを提供することです。この方法は、外部のテキストベースのデータソースでLLMを拡張しようとしているユーザーに適用できます。具体的には、このプロトコルの包括的な目的は、言語モデリングドメインでの大きな技術的専門知識を必要とせずに、さまざまな実用的なLLMおよびRAG実験に拡張可能なステップバイステップのコードを提供することです。ただし、このアプローチを変更せずに適用するにはPythonの実用的な知識が必要です。ソリューションのユーザー制御、透明性、移植性、および手頃な価格を最大化するために、オープンソースの公開ツールが利用されています。提案されたシステムは、前述の問題を次のように対処します。

解決策 1 と 2: 静的な学習コーパスとドメイン特異性の欠如
提供される方法論は、RAGアプローチを活用し、埋め込みを利用して、元のトレーニングデータに含まれていないドメイン固有の情報を提供します。大まかに言うと、埋め込みモデルは、テキストやその他のデータをベクトルまたは数値の 1 次元配列としての表現に変換します。この手法は、テキストに含まれるセマンティック情報を密度の高い数値形式に変換するため、有益です。ユーザークエリを同じ埋め込み空間に投影することにより、さまざまなアルゴリズムを使用して、ユーザークエリとテキストドキュメントのセクションとの間の距離15、したがって、近似的な意味的類似性を計算することができる。したがって、個別のセクションに分割されたドキュメントからこのようなベクトルのデータベースを作成すると、ユーザークエリに最も関連性の高いテキストを大量に検索することが容易になります(図1)。このアプローチは、任意のテキストドキュメントに拡張できます。LLMを補強するために、オンライン検索機能などの他のアプローチが実装され始めていますが、このアプローチにより、ユーザーは自分のユースケースに対して十分に高品質と見なされるソースを選択できます。

解決策 2: プライバシーの欠如
この実装では、ホスティングに安全なクラウド環境が使用され、ユーザープロンプト、生成された応答、またはその他のデータがこのエコシステムを離れることはありませんでした。ただし、すべてのコードはプラットフォームに依存しない方法で記述されているため、別のクラウドプロバイダーまたはローカルハードウェアを置き換えることができます。

解決策 3: 安定性が保証されていない
このアプローチでは、オープンソースライブラリを利用し、公開されているウェイトでLLMを強化することに重点を置いており、必要に応じて、より高度な透明性、安定性、バージョン管理を可能にします。

私たちが提案するシステムの完全な概略図を 図2に示し、このシステムまたは類似のシステムを複製するための詳細な手順をプロトコルのセクションで概説しています。微調整や拡張によってモデルの動作を変更する際の追加の考慮事項は、パフォーマンスの評価です。言語生成モデルでは、従来の機械学習メトリクスの多くが適用できないため、これは独自の課題となります。さまざまな手法が存在するが16、この研究では、専門家が作成した多肢選択問題(MCQ)を使用して精度を評価し、拡張前と拡張後のパフォーマンスを比較し、一般的な代替LLMと比較した。

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

このホワイトペーパーで示したユースケースでは、ベクトルストアは、Chicago Consensus Working Group17から公開されたガイドラインを使用して生成されました。この専門家グループは、腹膜がんの管理に関するガイドラインを策定するために設立されました。対象領域は、研究者の臨床専門知識の領域内にあるため、選択されました。一連の論文は、CancerやAnnals of Surgical Oncologyなどのオンラインジャーナルリポジトリからアクセスできました。北京人工知能学院(BAAI、https://www.baai.ac.cn/english.html)によって作成されたコンパクトな(33.4Mパラメータ)埋め込みモデルであるbge-small-enを使用して、ソースドキュメントから埋め込みを生成しました。その結果得られたデータベースは、Llama 2とOpen-AI基盤モデル7の補強に利用されました。読者の便宜のために、コードはGitHub(https://github.com/AnaiLab/AugmentedLLM)を通じて利用可能になっています。再現性を確保するために、提供されている要件リストで使用されているのと同じバージョンのライブラリと、同じバージョンの Python を使用することをお勧めします。次の方法で使用されるツールのインストールまたはドキュメントの詳細については、Python(https://www.python.org)、git(https://git-scm.com)、Llama-Index(https://llamaindex.ai)、およびChroma(https://trychroma.com)のプロバイダーの公式Webサイトを参照してください。

1. 前提条件: コードを確認し、必要なライブラリをインストールする

  1. git、python、pip がインストールされていることを確認します。
    1. ターミナルで、次のコマンドを実行してインストールを確認します。
      git --version
      python3 --version
      pip3 --version
  2. コードとインストールの要件を確認してください。
    1. ターミナルで、次のコマンドを実行します。
      git clone https://github.com/AnaiLab/AugmentedLLM.git
      cd ./AugmentedLLM/

      pip3 install -r requirements.txt

2. Llama-Indexによるベクトルデータベースの作成

  1. RTF ファイル形式を変換します (ファイルが RTF 形式の場合にのみ必要です)。
    1. config.py 次のコマンドを入力して、次のコードのファイル パスを変換する RTF 記事の場所とプレーン テキスト ファイルの書き込み先の場所に置き換えます。ファイルを保存します。
      rtf_file_dir = './articles_rtf/'
      converted_file_dir = './articles_converted/'
    2. ターミナルの同じディレクトリで、次のコマンドを実行して、プレーンテキストバージョンのRTFファイルを生成するコードを実行します。
      python3 ./convert_rtf.py
  2. ベクターデータベースを作成して保存します。
    1. config.py ファイルを編集し、次の変数の値を、LLM を拡張するドキュメントを含むフォルダーのファイルパスに置き換えます。ファイルを保存します。
      article_dir = './articles/'
    2. ターミナルの同じディレクトリで、次のコマンドを使用してコードを実行し、データベースを作成して永続化します。データベースが vector_db フォルダに保存されていることを確認します。
      python3 ./build_index.py

3. セクション2で生成したベクトルデータベースによるラマモデルの拡張

  1. カスタム LLM をローカルでインスタンス化する (オプション)
    注: この手順の実行は、デフォルトの Llama-2-7B 以外のモデルを使用する場合にのみ必要です。デフォルトモデルを使用する場合は、手順3.2に進みます。
    1. (カスタム LLM を使用)拡張する LLM を指定するには、run_augmented_llm.py を編集し、コンストラクタで llama-index LLM オブジェクトを次のコード行の None ではなく llm パラメータとして渡します。
      augmentedLLM = AugmentedLLM(vector_store, llm=なし)
  2. クエリ拡張 LLM
    1. ターミナルで次のコマンドを実行します。
      python3 ./run_augmented_llm.py
    2. ユーザークエリを実行して、一連の原稿のデータによって補強された応答を取得します(図3 および 図4)。終了したら、 CTRL + C を押して終了します。

4. 代替LLMのプログラムによる比較

  1. MCQ を作成します。
    1. 例の形式に注意しながら、ファイル questions.py を編集します。同様の形式で質問を追加します。ファイルを保存します。
  2. GPT-3.5、GPT-4、OpenChat、またはその他のコンパレータモデルにAPI経由で接続します。
    1. config.py ファイルを編集し、いずれかのプロバイダーのモデルに対するベンチマークを目的としている場合は、OpenAIまたはHuggingfaceのAPIキーを追加します。ファイルを保存します。
      huggingface_key = ''
      openai_key = ''
    2. compare_llms.pyファイルを編集し、比較するモデルのコメントを解除 (その行の '# ' 文字を削除する) して、テストするモデルのセットを選択します。
      注: 一部のコンパレータでは、ステップ 4.2.1 で設定した API キーが必要です。さらに、必要に応じて output_dir パラメーターを編集して、LLM 出力の格納場所を変更します。それ以外の場合は、デフォルトが使用されます。
      output_dir = './llm_responses/'
    3. ターミナルで、次のコマンドでコードを実行します。実行後、手順4.2.2で指定したフォルダ内のモデル応答を採点またはその他のレビュー用に表示します。
      python3 ./compare_llms.py
  3. (オプション)MCQの回答の自動採点を試します。このコード例では、LMQL ライブラリを使用して、LLM 出力を想定される形式に制限します。
    1. ファイルautomated_comparison.pyを開き、手順4.2.2と同様に、含めるモデルのコメントを解除したり、output_dir変数を編集したり、カスタマイズしたりします。モデル出力は、引き続き同様の方法で保存されることに注意してください。ファイルを保存します。
    2. ステップ 4.3.1 のコードを実行するには、ターミナルで次のコマンドを実行します。
      python3 ./automated_comparison.py

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

シカゴ・コンセンサス・ワーキング・グループの管理ガイドラインからの22の出版物のセットは、ベースのLlama-7bモデル17を補強するために使用された。ドキュメントは、Llama-Index ツールを使用してベクトル インデックスに変換され、Llama-2-7b-CCWG-Embedded が生成されました。GPT-3.5やGPT-4などの人気のあるOpenAIモデルも同様の方法で拡張され、GPT-XX-CCWG-Embedモデルが作成されました。さまざまな腹膜表面悪性腫瘍の管理に関連する知識を評価するために、合計20問の多肢選択問題(MCQ)が開発された。MCQは、専門医認定の外科腫瘍医によって作成され、外科腫瘍学フェローに期待される知識レベルでテストされました。Llama-2-7b-CCWG-Embedは、拡張OpenAIモデルと同様に、基本モデル( 表1を参照)よりも大幅に優れたパフォーマンスを発揮しました。これは、ベースラインと比較して拡張によってモデルのパフォーマンスが向上したため、この方法の肯定的な結果と見なされます。

figure-results-1
図1:学術論文からベクトルデータベースを生成するための概略図。この図の拡大版を見るには、ここをクリックしてください。

figure-results-2
図2:拡張LLMの全体的なシステム図。この図の拡大版を表示するには、ここをクリックしてください。

figure-results-3
図3:Linuxターミナルで実行されている拡張Llama-2モデル。 この図の拡大版を表示するには、ここをクリックしてください。

figure-results-4
図 4: 拡張 Llama-2 モデルからのクエリ結果。この図の拡大版を表示するには、ここをクリックしてください。

LLMのスコア(正解率)
ラマ-2-7b-チャット-hf65%
ラマ-2-7B-CCWG-埋め込み75%
オープンチャット-3.5-01061865%
ミストラル-7B-v0.11970%
GPT-3.5の75%
GPT-3.5-CCWG-埋め込み85%
GPT-4の85%
GPT-4-CCWG-埋め込み90%

表1:腹膜悪性腫瘍の管理に関連する20の質問のセットに対するさまざまなLLMのスコア(正解率)。

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ここで提供される方法は、de novoトレーニングや広範な微調整を必要とせずに、LLMのドメイン特異的アプリケーションの研究を促進することを目的としています。LLMが重要な研究関心領域になりつつあるため、知識ベースを増強し、応答の精度を向上させるためのアプローチはますます重要になります18,19,20,21。提供された結果で示されているように、概説されているプロトコルは、拡張なしの同じLLMと比較して、ドメイン固有の質問に対するパフォーマンスを向上させ、OpenAI GPTモデルなどのより複雑なモデルのパフォーマンスに近づきます。LLMは応答を生成するために膨大な計算リソースを必要とする可能性があるため22,23、より単純なモデルを拡張することで、リソースに制約のあるユースケースでの実装への道が提供される可能性があります。さらに、RAGシステムは、OpenAIが提供するような複雑性の高いモデルを拡張する際にもメリットをもたらしました。提示された結果は腹膜がん管理に特有のものであるが、データソースのドメインとスケールの両方が異なるRAGシステムに関する最近の研究が作成されており、そのようなシステムの広範な適用性を示している21,24,25,26。ただし、応答の品質は拡張に使用されるテキストデータと密接に関連しているため、ユーザーは特定のドメインと目的のアプリケーションに最適なソースを慎重に検討することが重要です。この考慮事項は、LLM関連の研究で特に注目されてきたヘルスケアなどの領域では特に重要です。診断27,28、臨床試験マッチング29,30、およびその他の多数のアプリケーションでのLLMの使用が検討されており、未知のトレーニングコーパスに依存するのではなく、検証された信頼できるテキストリソースが必要です。

パフォーマンスは、腹膜がんとその臨床管理の専門家によって書かれたMCQの正解率によって測定されました。回答は、人間によるレビューによって正解または不正解に分類されました。ただし、研究者の反復的なタスクを最小限に抑えるために、LLM間のパフォーマンスのより自動化された比較にアプローチし始めるための基本的なコードが提供されています。

このプロトコルの主な利点は、さまざまなLLMにプログラムでアクセスするためのコードが提供されていることです。以前は、必要な技術的能力を持たないMCQのパフォーマンスを評価するために、Webベースのインターフェースを介した反復的な手動テストに依存していた可能性があります。提供されているコードは、いくつかの一般的なLLMとインターフェースするための基本的なクラスと、コードの実行方法の例を提供します。これらのツールを提供する目標は、より多くの研究者がさまざまなLLM全体でプロンプトへの応答を評価するワークフローの自動化に移行できるようにし、比較研究を実施する能力を向上させることです。

さらに、概説された方法は、柔軟性と拡張性を強調するように設計されています。コードはそのまま使用できますが、さまざまなLLMの使用や、拡張や比較のためのモデルの埋め込みなど、必要に応じて特定のユースケースに合わせてさらに調整することを意図して記述されています。LLM の状況が急速に進化するにつれて、この拡張性は、さまざまなドメインのユーザーのさまざまなニーズを満たすためにますます重要になります。さらに、Llama-Index ライブラリは、デモされた方法では利用されていない多数の機能を提供し、同様のシステムを作成する際にユーザーに追加のオプションを提供できます。これらは、Llama-Index の公式ドキュメントに記載されています。

また、読者は、自分のユースケースに最適な評価方法を慎重に検討する必要があります。MCQは、その容易に定量化できる性質31,32のためにLLM比較で人気を博していますが、それらを生成システムの包括的なパフォーマンスメトリックと見なす際には注意が必要です。最近の文献では、定性的アプローチ、ヒューマンレビュー、Stanford Holistic Evaluation of Language Models(HELM)33、Bilingual Evaluation Understudy(BLEU)、General Language Understanding Evaluation(GLUE)、ROUGE、perplexity、F1スコア343536373839などの標準的な自然言語処理メトリクスなど、さまざまな評価が実施されています。

ここで示すように、これらの方法には制限があります。たとえば、インターフェースはいくつかの主要なLLMプロバイダーに実装されましたが、この分野の急速に進化する性質とユースケースの多様性を考えると、この実装は包括的ではない可能性があります。ただし、このコードは、前に説明したように、これを念頭に置いて設計されています。さらに、自動採点に移行するための基本的なコードが提供されましたが、HELMやBLEUなどの回答の採点に代替ツールを使用するために拡張する余地があります。さらに、言語モデルクエリ言語(LMQL)など、事前定義された文法に従って出力を制約するツールの追加使用を使用して、この作業を拡張し、比較LLM研究の自動化を促進することができます。さらに、潜在的なユースケースが多岐にわたることを考えると、パフォーマンスのトレードオフを特徴付けるためには、RAGシステムが一般的な領域外のパフォーマンスに及ぼす影響についてさらに研究する必要があります。最後に、LLM応答の信頼性と評価を改善するための追加の方法を継続的に調査する必要があります。

技術的な理由から、Python 3.10以降が必要であることに注意してください。シェルプロンプトは、bash、zsh、またはその他のUNIXライクな端末用に記述されています。コマンドは、テキストの後にリターンキーを入力するだけで実行できます(プロトコルでは「コマンドの実行」と呼ばれます)。プロトコルの各ステップで、ユーザーは実行中のファイル内のコードを調べて、ワークフローの背後にあるメカニズムをより包括的に理解したい場合があります。

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者は、宣言する利益相反を持っていません。

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

この作業は、いくつかのオープンソースライブラリ、特に llama-index (https://www.llamaindex.ai/)、ChromaDB (https://www.trychroma.com/)、LMQL (https://lmql.ai/) によって促進されました。

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
pip3 バージョン 22.0.2 
Python バージョン 3.10.12

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Singhal, K., et al. Large language models encode clinical knowledge. Nature. 620 (7972), 172-180 (2023).
  2. Gilson, A., et al. How does ChatGPT perform on the United States medical licensing examination? The implications of large language models for medical education and knowledge assessment. JMIR Med Educ. 9 (1), e45312(2023).
  3. Guerra, G. A., et al. GPT-4 artificial intelligence model outperforms ChatGPT, medical students, and neurosurgery residents on neurosurgery written board-like questions. World Neurosurg. 179, e160-e165 (2023).
  4. Terwiesch, C. Would Chat GPT3 get a Wharton MBA? A prediction based on its performance in the Operations Management course. , https://mackinstitute.wharton.upenn.edu/wp-content/uploads/2023/01/Christian-Terwiesch-Chat-GTP.pdf (2023).
  5. Weizenbaum, J. ELIZA-a computer program for the study of natural language communication between man and machine. Communications of the ACM. 9 (1), 36-45 (1966).
  6. Wu, T., et al. A brief overview of ChatGPT: The history, status quo and potential future development. IEEE/CAA Journal of Automatica Sinica. 10 (5), 1122-1136 (2023).
  7. Touvron, H., et al. Llama 2: Open foundation and fine-tuned chat models. arXiv [cs.CL]. , http://arxiv.org/abs/2307.09288 (2023).
  8. Huang, L., et al. A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions. arXiv [cs.CL]. , http://arxiv.org/abs/2311.05232 (2023).
  9. Thirunavukarasu, A. J., et al. Large language models in medicine. Nature Med. 29 (8), 1930-1940 (2023).
  10. Lewis, P., et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. arXiv [cs.CL]. , http://arxiv.org/abs/2005.11401 (2020).
  11. Li, J., Yuan, Y., Zhang, Z. Enhancing LLM factual accuracy with RAG to counter hallucinations: A case study on domain-specific queries in private knowledge-bases. arXiv [cs.CL]. , http://arxiv.org/abs/2403.10446 (2024).
  12. Zhang, P., Xiao, S., Liu, Z., Dou, Z., Nie, J. -Y. Retrieve anything to augment large language models. arXiv [cs.IR]. , http://arxiv.org/abs/2310.07554 (2023).
  13. Ling, C., et al. Domain specialization as the key to make large language models disruptive: A comprehensive survey. arXiv [cs.CL]. , http://arxiv.org/abs/2305.18703 (2023).
  14. Ram, O., et al. In-Context retrieval-augmented language models. Trans Assoc Comput Linguist. 11, 1316-1331 (2023).
  15. Cormode, G. Sequence distance embeddings. , The University of Warwick. https://wrap.warwick.ac.uk/61310/7/WRAP_THESIS_Cormode_2003.pdf (2003).
  16. Guo, Z., et al. Evaluating large language models: A comprehensive survey. arXiv [cs.CL]. , http://arxiv.org/abs/2310.19736 (2023).
  17. Chicago Consensus Working Group. The Chicago Consensus Guidelines for peritoneal surface malignancies: Introduction. Cancer. 126 (11), 2510-2512 (2020).
  18. Wang, G., et al. OpenChat: Advancing open-source language models with mixed-quality data. arXiv [cs.CL]. , http://arxiv.org/abs/2309.11235 (2023).
  19. Jiang, A. Q., et al. Mistral 7B. arXiv [cs.CL]. , http://arxiv.org/abs/2310.06825 (2023).
  20. Megahed, F. M., et al. AI and the future of work in statistical quality control: Insights from a first attempt to augmenting ChatGPT with an SQC knowledge base (ChatSQC). arXiv [cs.HC]. , http://arxiv.org/abs/2308.13550 (2023).
  21. Wang, Y., Ma, X., Chen, W. Augmenting black-box LLMs with medical textbooks for clinical question answering. arXiv [cs.CL]. , http://arxiv.org/abs/2309.02233 (2023).
  22. Dodge, J., et al. Measuring the carbon intensity of AI in cloud instances. FACCT 2022. , (2022).
  23. Samsi, S., et al. From words to watts: Benchmarking the energy costs of large language model inference. arXiv [cs.CL]. , http://arxiv.org/abs/2310.03003 (2023).
  24. Khene, Z. -E., Bigot, P., Mathieu, R., Rouprêt, M., Bensalah, K. Development of a personalized chat model based on the European association of urology oncology guidelines: Harnessing the power of generative artificial intelligence in clinical practice. Eur Urol Oncol. 7 (1), 160-162 (2024).
  25. Kresevic, S., et al. Optimization of hepatological clinical guidelines interpretation by large language models: a retrieval augmented generation-based framework. NPJ Digit Med. 7 (1), 102(2024).
  26. Ge, J., et al. Development of a liver disease-specific large language model chat interface using retrieval augmented generation. medRxiv. , (2023).
  27. Rule-augmented artificial intelligence-empowered systems for medical diagnosis using large language models. Panagoulias, D. P., et al. 2023 IEEE 35th International Conference on Tools with Artificial Intelligence (ICTAI), , 70-77 (2023).
  28. Panagoulias, D. P., et al. Augmenting large language models with rules for enhanced domain-specific interactions: The case of medical diagnosis. Electronics. 13 (2), 320(2024).
  29. Jin, Q., et al. Matching patients to clinical trials with large language models. arXiv [cs.CL]. , http://arxiv.org/abs/2307.15051 (2023).
  30. Gupta, S. K., et al. PRISM: Patient records interpretation for semantic clinical trial matching using large language models. arXiv [cs.CL]. , http://arxiv.org/abs/2404.15549 (2024).
  31. Hendrycks, D., et al. Measuring massive multitask language understanding. arXiv [cs.CY]. , http://arxiv.org/abs/2009.03300 (2020).
  32. Lin, S., Hilton, J., Evans, O. TruthfulQA: Measuring how models mimic human falsehoods. arXiv [cs.CL]. , http://arxiv.org/abs/2109.07958 (2021).
  33. Bommasani, R., Liang, P., Lee, T. Holistic evaluation of language models. Ann N Y Acad Sci. 1525 (1), 140-146 (2023).
  34. Banerjee, D., Singh, P., Avadhanam, A., Srivastava, S. Benchmarking LLM powered Chatbots: Methods and Metrics. arXiv [cs.CL]. , http://arxiv.org/abs/2308.04624 (2023).
  35. Papineni, K., Roukos, S., Ward, T., Zhu, W. -J. Bleu. Proceedings of the 40th Annual Meeting on Association for Computational Linguistics - ACL '02. , (2001).
  36. Wang, A., Singh, A., Michael, J., Hill, F., Levy, O., Bowman, S. R. Glue: A multi-task benchmark and analysis platform for natural language understanding. , http://arxiv.org/abs/1804.07461 (2019).
  37. Johnson, D., et al. Assessing the accuracy and reliability of AI-generated medical responses: An evaluation of the chat-GPT model. Res Sq. , (2023).
  38. Lin, C. -Y. ROUGE: A package for automatic evaluation of summaries. Text Summarization Branches Out. , 74-81 (2004).
  39. Chen, S., et al. Evaluating the ChatGPT family of models for biomedical reasoning and classification. J Am Med Inform Assoc. 31 (4), 940-948 (2024).

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Large Language ModelsVector EmbeddingsDomain Specific AugmentationLlama IndexScientific ManuscriptsModel BenchmarkingOpen Source ToolsVector DatabaseModel EvaluationFoundation Models

Related Articles