我々は、エンティ幻覚指数(EHI)を報酬シグナルとして用い、テキスト要約におけるエンティティレベルの幻覚を減らす強化学習ベースの微調整アプローチを大規模言語モデルに提案します。会議の書き起こしに関する実験では、この手法がエンティティの忠実性と正確性を向上させることが示されています。
Research Article
我々は、エンティ幻覚指数(EHI)を報酬シグナルとして用い、テキスト要約におけるエンティティレベルの幻覚を減らす強化学習ベースの微調整アプローチを大規模言語モデルに提案します。会議の書き起こしに関する実験では、この手法がエンティティの忠実性と正確性を向上させることが示されています。
大規模言語モデル(LLM)の最近の進歩により、抽象化要約の品質が顕著に向上しています。しかし、幻覚、特に存在しない、あるいは誤った存在が登場する存在レベルの幻覚は、依然として重大な課題です。本研究では、エンティティ幻覚指数(EHI)を指標として用いる報酬駆動型の要約モデルのファインチューニングフレームワークを提案します。ここでの手法は、Flan-T5、DistilBART、Mistral(または他の一般的なLLM)などの事前学習モデルから、構造化トランスクリプトデータセットXSUM上で初期要約を生成することから始まります。私たちは、生成された要約とゴールド参照の両方から名前付きのエンティティを抽出し、精度を評価し、捏造されたエンティティにペナルティを課すことでEHIを計算します。微調整のプロセスは強化学習によって導かれ、EHIは報酬信号として機能します。REINFORCEスタイルの更新メカニズムを採用し、エンティティ忠実性を最大化するために要約モデルを最適化します。実験により、EHIで微調整されたモデルは情報提供を損なうことなく幻覚率を低くすることが示されています。さらに、EHIガイドモデルはドメイン外の要約タスクでよりよく一般化できることを示し、堅牢性の向上を示唆しています。ここでのアプローチは、要約における事実性の向上に向けた実践的な方向性を示し、正確な実体表現の重要な役割を強調しています。
大規模言語モデル(LLM)を活用した抽象的要約モデルは、さまざまな分野で印象的な成果を上げています。しかし、持続的な課題として幻覚があり、生成された要約には元の入力に根拠のない誤った情報や捏造情報が含まれていることがある。会議の要約、医療報告、財務文書などの重要な用途において、特に名前のある主体に関わる幻覚は信頼性や有効性を著しく損なう可能性があります。
R検索者は大規模な人間評価を行い、要約者がしばしば幻覚を生み出し、その内容は元の文書で裏付けられていないことを発見し、これらの幻覚は反復や一貫性の欠如と相関していること1。別の研究では、抽象度の高いモデルほど忠実度が低い傾向があることが示されました。彼らの研究は、抽象度が高い出力は事実の正確さが低く、文の不忠実さも多いと報告しています。FRANKベンチマークは、約30%の要約に事実の矛盾が含まれていると報告しており、別の人気研究では同様の誤り率が指摘され、高い幻覚レベルが要約を事実上役に立たなくなると主張しています。幻覚は内在的(原因と矛盾する)と外在的(源から検証できない)に分類されます。抽象的要約における幻覚に関するチュートリアルでは、内在的幻覚は生成されたコンテンツが入力と矛盾する場合(例:承認されたワクチンが拒否されたと誤って報告する場合)に起こり、外発的幻覚はワクチンの臨床試験を主張するなど検証不可能な事実を加えることを指します。また、最先端のサマライザーは、ROUGE、BLEU、METEORと組み合わせた際に約25%の成果物で幻覚的な内容を生成し、健康、法律、サイバーセキュリティなどの分野で幻覚が有害になる可能性があると警告しています。
従来のn-gram指標(ROUGE5、BLEU、METEOR)は人間の事実判断と相関が乏しく、参照ベースおよび参照なし指標の開発が促されました。FEQAやQuestEvalなどのQAベースの指標は、要約から導き出された質問と回答の組み合わせがソーステキストで回答できるかどうかを問うことで要約を評価します。FEQAは人間の判断とより強く相関し、抽象的な要約ほど忠実度が低い傾向があることを示しますが、QuestEvalは一貫性、一貫性、流暢さ、関連性の面で人間の判断との相関を大幅に改善します。QAFactEvalは、名詞句の回答を選択し、答える前に質問を生成することでこの手法を洗練させています。この戦略は、SummaCベンチマークにおける人間の評価との相関性を向上させます。情報抽出(IE)メトリクスは知識を主語-関係-目的のタプルとして表現しますが、抽出過程で誤りが生じやすいです。FactCCやSummaCなどの自然言語推論(NLI)指標は、要約文をソース4に含意または矛盾するものとして分類します。FactCCは、弱い教師ありデータを使って、事実の一貫性を検出し、矛盾したスパンをハイライトする分類器を訓練します。2.SummaCは適切な粒度でNLIモデルを適用し、強い事実性推定値を得ますが、FRANKベンチマークではこれらの指標は依然として事実性を二項法として扱い、統一されたフレームワーク1,7,8を欠いていると指摘しています。研究者が提案する人間の評価次元である流暢さ、一貫性、関連性、一貫性は広く採用されています。別の評価研究では、整合性が最も客観的な次元であると強調しています。なぜなら、それは単に要約が情報源によって含意されているかどうかを確認するからです。XSumのサマリーの最大92%に忠実度の誤りが含まれていることを指摘しています 9,10。しかし、人間の評価は時間とコストがかかるため、自動指標はスケーラブルな評価に不可欠です。現在の指標では、内在的および外在的幻覚を単一のスコアにまとめることが多いため、誤差診断を妨げています。
最尤訓練は要約の質を直接最適化しないため、関連性と事実性を向上させるために強化学習(RL)が適用されています。PasunuruとBansalは、顕著性(ROUGE)と含意報酬を組み合わせたマルチ報酬RLフレームワークを導入し、最先端のパフォーマンスを示しました。RLはREINFORCEアルゴリズムを用いた抽出的要約に適用されました。彼らのモデルはROUGEスコアを最大化し、分類器ベースのアプローチよりも多くの情報量豊富な要約を生み出します。これは人間の質問回答評価で示されています12。マルチタスクモデルはさらに、問題生成と含意生成を組み込み、カバレッジと一貫性を確保する12.2024年の抽象的要約に関する包括的な調査では、事実の一貫性が根本的な課題であることが強調され、RLは真実の要約を促進することを推奨しています。調査は、事実に基づき一貫した要旨を評価し、外部の知識源や属性管理を取り入れて精度を高めることを提案しています13。人間フィードバックからの強化学習(RLHF)は、人間の好みに基づいて報酬モデルを訓練し、学習報酬を最大化するために要約器を微調整することでこの考えを拡張しています。9。人間のフィードバックからの強化学習(RLHF)は、モデルの出力を事実性や有用性などの望ましい特性に合わせるために注目を集めています4,14。マルチリワード強化学習(RL)やRLHFはモデルを人間の忠実度の概念に適合させますが、ROUGEや二項の事実性のような粗い指標に依存しています。これに対し、ここで詳述する研究は、報酬として細かい単位のエンティティレベルの幻覚指数を用いることを提案しており、これは経験的で計算コストも低いため人間のフィードバックが不要です。
多くの指標があるにもかかわらず、いくつかの制約が依然として存在します。Nグラムメトリクスは意味論的正確性を無視し、QAベースやIEベースのメトリクスは質問生成や抽出モデルからの誤りを伝播させ、NLIメトリクスは事実性を二項の含意決定に減らします。研究では、既存のモデルベースの指標が文や文書レベルで動作し、誤りを引き起こす特定の対象を特定できないため、細かい精度で幻覚を特定するのに苦労していることが強調されました。人間による評価は依然としてゴールドスタンダードですが、費用がかかり主観的です。さらに、既存の指標では内在的幻覚と外在的幻覚を区別せず、関係の過剰・過少の焦点を捉えていません。大規模言語モデルは、事実検証ではなく統計的尤度に基づいてテキストを予測するため、幻覚を起こすことがあります。モデルは、訓練データの制限、確率生成、事実確認の欠如、過信やバイアスにより、高い確実性で誤った情報を述べることがありますが、ガイドは外部データにおける回想拡張生成と長期記憶の基礎モデルを推奨しています。しかし、これらの手法は検索ベースのタスクに焦点を当てています。要約には、幻覚を持つ存在を特定し罰則を科す指標が必要です。過去の研究では、事実性のためのエンティティレベル評価の重要性が認識されています。FEQAやQuestEvalのような指標は、質問回答技術を用いて事実の一貫性を評価しようとしています。しかし、これらの手法はしばしば参照要約や外部QAシステムを必要とし、スケーラビリティを制限します。私たちの研究は、図1に示すように、5種類の幻覚因子に分類し、名前のある実体への忠実さに焦点を当てた軽量な実証指標であるEntity Hallucination Index(EHI)を用いています。
証拠は、幻覚が蔓延しており、評価指標が不完全で、強化学習技術には細かい報酬が欠けていることを示しています。人間の研究では、要約モデルがかなりの割合で幻覚を起こし、しばしばエンティティを入れ替えたり詳細を捏造したりすることが示されています。既存の指標はnグラムの重複を強調したり、事実性を二項法として扱ったりしており、現在の強化学習手法はROUGEや粗い事実性信号を最適化しています。要約がソースに存在しないエンティティを言及している場合(ネガティブな幻覚)、重要な実体を省略している場合(焦点喪失の幻覚)、その他のシナリオを測るエンティティレベルの指標にはギャップがあります。提案されたエンティティ幻覚指数(EHI)に関するファインチューニング手法は、エンティティレベルで幻覚を定量化し、強化学習に対して構造化された報酬を提供することでこのギャップを埋めています。EHIをRLHFに統合することで、大規模言語モデルを微調整し、エンティティレベルの幻覚を最小限に抑え、流暢かつ事実に忠実な要約を作成することを目指しています。
本研究では、エンティティ幻覚指数(EHI)を報酬シグナルとして活用し、エンティティレベルでの幻覚を減らす新しい微調整手法を提案します。EHIは、モデル出力から抽出されたエンティティと入力文書内のエンティティを比較することで、エンティティの正確性と根拠性を定量化し、参照18への依存度を低減します。ここで説明する方法は、人間の事実性注釈を必要とせずに、よりエンティティに忠実な要約を生成するモデルに偏っています。
まとめると、事実認識型報酬モデルがファクチューニングに用いられています。従来の手法が粗い事実報酬や人間ラベル付きデータセットに依存するのに対し、EHIを直接的かつ自動的な報酬シグナルとして用いるファインチューニングを提案し、追加の監督なしにエンティティに基づく要約を促進します。本研究の新しい貢献は以下の通りです:(i) 抽象的要約におけるエンティティ忠実性を向上させるEHIガイド付きファインチューニングフレームワークを導入すること、(ii) 人間ラベル付き事実性データセットに依存しないスケーラブルな強化学習パイプラインを提示すること、(iii) 会議トランスクリプトデータセット、XSUMニュースデータセットにおけるEHIスコアの実証的改善を示し、幻覚の減少を強調するための質的分析を行うこと。 (iv) 本研究は、幻覚認識型要約のさらなる研究を促進するために再現可能なColabベースの実装を共有しています。
本研究は、EHIのような細かなエンティティに焦点を当てた報酬を用いて言語モデルを最適化することが、最小限の計算で要約タスクの忠実さと信頼性を高める効果的な道筋を提供するという仮説を評価します。このアプローチは、(i) エンコーダ-デコーダ(DistilBART、FlanT5)およびデコーダのみ(Mistral)アーキテクチャの両方で有効性を示すこと、(ii) 異なるモデルタイプ、ドメイン、スケールに適応可能なフレームワークを提供すること、(iii) 完全な再学習と比較して計算効率を提供することで、要約の忠実さを追求するパラメータ効率の分野の拡大に貢献しています。
Access restricted. Please log in or start a trial to view this content.
本研究の目的は、言語モデル(LM)を微調整し、エンティティの幻覚を低減した要約を生成することです。幻覚は、モデルが事実検証ではなく統計的尤度に基づいてテキストを生成するため、「誤ったまたは無関係な出力を自信を持って生成する」場合に発生します。これはエンティティ幻覚指数(EHI)に基づく報酬関数を設計し、強化学習を適用して最大化することで達成されます。
問題の定式化
入力文書X i が与えられると、Yi に記載されたエンティティが Xi に根ざしているような要約Y i を生成することが目標です。従来の最尤度トレーニングは、事実の一貫性を明示的に最適化するものではありません。これらの訓練方法は、捏造されたエンティティの挿入を罰則にしません。したがって、報酬をEHIを用いてエンティティの忠実度に比例する報酬主導の微調整戦略が導入されます。
データセットと方法
2つのコーパスが使用されます。第一に、複数ターン会議の書き起こしと抽象的なゴールドサマリーの対話文字起こしデータセット、そして第二にXSUMニュース要約ベンチマーク22,23です。各データセットはクレンジ、フラット化、80%がトレーニング、10%が検証、10%がテストに分割されました。対話は非公式な言語や代名詞に富んでいるのに対し、XSUMは簡潔なニュース記事を含みます。この組み合わせにより、ドメイン内およびドメイン外の一般化の両方を評価することができます。
エンティティ抽出は、エンティティ幻覚指数(EHI)を計算するためのソース文書と要約の両方で行われます。ファインチューニングでは、本研究はトレーニングスプリットのみを使用し、検証EHIスコアを監視して最適なチェックポイントを選定します。最終評価は、モデルの微調整前後にゼロショットのままのホールドアウトテストセットで報告されます。
まとめると、まず、トランスクリプトはフラットな形式に整理され、データを分割しています。事前学習済みモデルはベースラインの要約を生成します。次に、EHIはトランスを用いたNERと5つの幻覚因子を用いて計算されます。微調整時には、LoRaアダプターを通じてEHI報酬がモデルに更新されます。最後に、ファインチューニングされたモデルを用いて要約を作成し、EHI、エンティティF1、その他の指標を用いて評価します(図2)。すべての実験は提供されたコードと設定ファイルを通じて再現可能です。 図3 は、データセット準備、ベースライン要約、EHI計算、微調整、評価の段階的なプロセスフローを示しています。
ベースライン要約
3つの事前学習済みLLMが選ばれ、そのベースライン概要が取得されます:Flan-T5、Mistral(Nous-Hermes-2-Mistral-7B-DPO)、およびDistilBART 24,25,26です。各モデルはゼロショットモードで実行され、各入力文書(xi)に対して初期要約(Yi)を生成しました。ビーム幅4、長さペナルティ1.0のビームサーチが用いられ、流暢でありながら簡潔な要約を促しました。これらの基準要約は幻覚の有病率を推定し、微調整の出発点を提供しました。
エンティティ抽出とEHI計算
エンティティ幻覚指数(EHI)を正確に計算するには堅牢なNERが必要です。当初、スペーシーはNERの運用に使用されていました。トランスフォーマーベースのNERモデルの方が正確であることは理解されていますが、以下のような理由でSpacyが最初に選ばれました。(1) トランスフォーマーベースのNERモデル自体が、Spacyよりも幻覚を起こすことが証明されています。(2) スペーシーは統計的であるため、実装コストと実行時間の面で計算効率が向上します。(3) また、EHIが弱いNERモデルでも幻覚を減らすのに堅牢であることを証明するのに役立つ。しかし、実験が確立されたデータセット上で行われ、spaceCyのen_core_web_smモデルは口語的な転写本13に対して脆弱であることを考えると、Spacyは、CoNLL-2003データセット上で微調整されたBERTモデルであるトランス変換器ベースのNERモデル(dslim/bert-base-NER)に置き換えられています。BERTベースのNERシステムはドメイン固有のタスクでspaCyモデルを上回る性能を示しており、例えば、航空のBERT-NERモデルは17エンティティを識別した際に94.78%のF1を記録し、spaCy NERは7エンティティ27を認識した93.73%を上回っています。BERT NERモデルはHugging FaceTransformers 28 で構成され、大文字に応じたマッチングが行われました。代名詞や表層形の変異を捉えるために、この方法は「Mr. Smith」と「Smith」を同じ標準形に対応させる単純なルールを適用しました。しかし、完全な共参照解決は今後の研究に残っています。XSUMデータセットから200件の記録サンプルを用いたNERモデルの比較分析は、 表1から推測できます。
エンティティ幻覚指数(EHI)は次のように計算されます:

ここで、PH、EF、OF、NH、LF は、それぞれ第i記事における正の幻覚(PH)、抽出係数(EF)、負の幻覚(NH)、過剰焦点の実体(OF)、および焦点喪失(LF)に対応するスコアを表します。
幻覚因子の詳細:
陽性幻覚(PH): 事実に正確かつ有益な新たに導入された機関の指標。
採掘係数(EF): 入力文書から正確に抽出されたエンティティを要約に反映します。
ネガティブ・ハルーシネーション(NH): 誤った、または入力に根拠のない幻覚的な存在を捉えます。
オーバーフォーカス(OF): 狭い単位に過度に焦点を当て、多様性を見落とす要約を罰します。
フォーカス喪失(LF): 重要な要素を省略した要約にはペナルティを課します。
上記の因子の計算は 図4 に詳細に示されており、例示用の計算も含まれています。入力文書エンティティ(I)の例を考えると:「John"," AI"," conference" 参照サマリーエンティティ(R):" John"," AI" 生成サマリーエンティティ(G):" John"," AI"," technology"。EHIの値が高いほどエンティティへの忠実度が向上し、抽出的かつ肯定的に幻覚的な要約(有用だが忠実なエンティティの導入)を報いる一方で、根拠のない、過剰、欠損するエンティティ20を罰します。これらの要因は検出されたエンティティの総数で正規化され、EHIスコアは0から1の間で算出されました。EHIの検証は訓練中に監視され、最適なチェックポイントを選定しました。PHとEFは有益な新しい存在と正しい抽出を報酬とする一方で、OF、NH、LFは繰り返し、捏造、省略を罰します。満点1.0は、要約内のすべての実体が根拠があるか有益な幻覚を持っていることを意味し、0点の場合は要約内の名前のある実体がソースに現れていないことを示します。
強化学習でのファインチューニング手順
微調整のための詳細なハイパーパラメータ構成は、表2、表3、表4に別途示されており、それぞれMistral-7B、DistilBart、Flan-T5の最適化タイプ、学習率、バッチサイズ、ハードウェア仕様、その他の構成詳細が示されています。ここでの目的は、生成された要約ごとに期待されるエンティティ幻覚指数(EHI)報酬を最大化することでモデルパラメータθを微調整することです。形式的には、入力文書X i、生成された要約 Yi、モデルパラメータ θ に対して、期待報酬目標は次のように定義されます。
(2)
ここでEHI(y, x)は生成された要約Yi と入力Xiの間で計算されたエンティティ幻覚指数を表します。
REINFORCEアルゴリズム25に従い、この目的の勾配は次のように推定されます:
(3)
実際には、モデルから要約をサンプリングし、対応するEHIスコアを計算し、政策の勾配更新を適用して報酬の高い成果を促しました。パラメータ効率の良い微調整を可能にするために、本研究では低ランク適応(LoRA)が用いられました。更新されたのはLoRAアダプターのみで、ベースモデルの重量は凍結されたままでした。A100 GPU上で、学習率が小さい(例:5 × 10-6)、バッチサイズ4、8ステップにわたる勾配蓄積でAdamOptimizer 29でファインチューニングが行われました。報酬推定値を更新するために500回の更新ごとに要約が再生成され、検証EHIが収束するまでトレーニングが継続されました。REINFORCEのベースラインは、分散を減らすために最近の報酬のランニング平均値に設定されました。EHIに加え、エンティティF12、ROUGE-1/2/Lスコアも記録され、全体的な品質の監視が行われました。要約はファインチューニング中のモデル改善を反映するために定期的に再生成されます。
評価指標
出力はRouge-1、Rouge-25などの情報性指標を用いて評価されました。ルージュLCSのような流暢度指標5。エンティティオーバーラップ指標のエンティティF1、幻覚指標であるEHI、FactCC、QAGS2、6、18、30です。FactCCは合成矛盾データで訓練された分類器を用いて、文をソースによって含意または矛盾するものとしてラベル付けします。factCCは2つのスコアを与えています。スコアはラベルが有効である場合に記録されました。一方、QAGSはLLM上で動作する質問と回答方式を採用しています。ライトモデルT5スモールはテキスト31の質問生成に使用されました。Roberta_base_Squad2は出力テキスト32に対して回答を生成するために使われました。これらのモデルは、実行に便利な計算コストが選択されました。
Access restricted. Please log in or start a trial to view this content.
ここでの実験は、EHIガイド付きファインチューニングが複数のモデルアーキテクチャやデータセットにおける実体レベルの幻覚を減らす効果について、定量的な証拠に焦点を当てています。結果は、事実の一貫性を維持し、質問回答能力を維持しつつ、幻覚指標の一貫した改善を示しています。
データセットのパフォーマンス
ダイアログデータセットのパフォーマンス:
表5は 、マルチターン対話データセットにおける幻覚減少の結果を示しています。EHIガイド付きファインチューニングにより、MistralおよびDistilBART両モデルで大幅な改善が実現しました。
MistralはEHIスコアが0.346から0.546に57.8%の相対改善を達成し、DistilBARTは61.5%の相対改善を示し、0.317から0.512に上昇しました。両モデルとも事実の一貫性向上が一貫して...
Access restricted. Please log in or start a trial to view this content.
QAベースの指標(例:FEQA/QuestEval/QAFactEval)やNLIベースの指標(例:FactCC/SummaC)は補助的なQAや含意の要素を必要とし、しばしば文レベルの判断を提供します。対照的に、EHIは軽量で参照なしのエンティティレベルのスコアであり、(i)私たちが観察する主要な故障モードであるエンティティ幻覚を直接ターゲットにしています。(ii) モデルに依存しず、計算が速い;(iii)は強化学習の微調整に対する高密度報酬として機能します。実証的には、EHIはQA/NLI指標を補完し、どの主体が事実誤りを引き起こしているかを特定し、重いQAや巻き込みパイプラインを導入することなく的確な改善を可能にします。
強化学習フレームワークは、エンティティ幻覚指数(EHI)を濃い報酬シグナルとして用いることで、エンティティの忠実さを直接最適化します。この指標は、生成された要約における名前のある存在、正確性、根拠を定量化し、幻覚をタイプと重症度で分類します。ファ...
Access restricted. Please log in or start a trial to view this content.
著者たちは何も明かすことはありません。
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| Colab NVIDIA A100 GPU | NVIDIA | N/A | Google Colaboratory Pro |
| DistilBART (Encoder–Decoder) | Hugging Face | https://huggingface.co/sshleifer/distilbart-cnn-12-6 | |
| dslim/bert-base-NER | Hugging Face (dslim) | https://huggingface.co/dslim/bert-base-NER | 英語のNER用に微調整されたBERTベース |
| Evaluation Models QAGS (QA-based) | Salesforce Research | N/A | 事実性の分類器 |
| Evaluation Models (Factuality) FactCC | Google Research | N/A | 事実性の分類器 |
| Flan-T5 (Encoder–Decoder) | https://huggingface.co/docs/transformers/main/en/model_doc/flan-t5 | オープンソースのテキスト対テキストの言語モデル | |
| Hugging Face Transformers | Hugging Face, Inc. | https://huggingface.co/docs/transformers/index | モデルの読み込みと微調整 |
| Nous-Hermes-2-Mistral-7B-DPO | Mistral | https://huggingface.co/NousResearch/Nous-Hermes-2-Mistral-7B-DPO | 70億パラメータの言語モデル |
| Programming Language Python 3.10 (Colab runtime) | Python Software Foundation | Version 3.10 | コア実装 |
| Streamlit | Open Source | https://streamlit.io/ | 事実性の分類器 |
| XLSUM dataset | BUET | https://github.com/csebuetnlp/xl-sum | |
| XSUM dataset | University of Edinburgh | https://github.com/EdinburghNLP/XSum |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission