研究記事

臨床人工知能応用における大規模言語モデルにおける公平性の向上:ファインチューニングとプロンプトによるもの

DOI:

10.3791/69132

2026年1月2日

この記事について

サマリー

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

医療専用の大規模言語モデルは、他の大規模言語モデルと同様に、訓練データに内在するバイアスを反映しているため、倫理的・技術的課題に直面しています。ここで提示されたプロトコルは、3つのオープンソースモデルにわたるプロンプトバリアントを用いて、性別、人種、職業、宗教の4種類のバイアスを抑制することを検証しています。

要約

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

大規模言語モデル(LLM)は、医療のような繊細な分野にますます応用されており、これらは複数の技術的・倫理的課題を伴います。最も差し迫った問題は、これらのモデルに組み込まれたバイアスであり、これらは社会的偏見を反映する可能性のある大規模なデータセットで訓練されています。このようなバイアスは、不公平で一般化が困難、あるいは有害な結果を生み出すことがあり、臨床的に現実世界で適用できず、倫理的・規制上の制約にも適合しないものとなります。私たちは、性別、人種、職業、宗教の4つの重要なカテゴリーで微調整されたモデルを提示した場合、バイアス抑制がどれほど効果的かを検証します。多様な推論データセットを手動でキュレーションし、12のプロンプトバリアント(うち6つはバイアスなし)を作成して、3つのオープンソースLLM(Llama2-7B、Mistral-7B、Dolly-7B)の出力をテストします。出力の公平性と解釈可能性はバイアススコアリング指標を用いて評価され、スコアが低いほど公平性と解釈可能性が高いことを示します。また、バイアスを減らすプロンプトはバイアスを減らし、モデルの微調整によりさらに優れたパフォーマンスを発揮することにも注目しています。結果は、医療画像や電子カルテ(EHR)の維持など、現実世界での信頼性と公正なLLM導入において、タイムリーな対応、モデルの堅牢性、継続的な倫理的審査の重要性を強調しています。

概要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

大規模言語モデルは、意思決定1,2、テキスト生成3、テキスト翻訳4、顧客感情分析5、質問回答6臨床レポート生成7など、多様なタスクを支援するツールとして大きな影響力を持っています。近年、社会的に不利な個人やグループに害を及ぼすコンテンツを生成するためにLLMを活用したアプリケーションがいくつか発生しています。こうした陳腐な回答の主な理由は、これらのモデルが人種、性別、社会経済的階級などの社会的偏見を含むデータセット上で訓練されているからです。しかし、医療AIシステムにおける「バイアス」や「公平性」とは、主観的かつ文脈依存的である場合があります。研究者たちはLLMにおける社会的偏見を軽減するために多大な努力を払ってきた11,12;しかし、さらなる改善は依然として必要です。研究者たちは、前処理、インプロセッシング、後処理、またはそれらの組み合わせと分類できる複数のバイアス軽減戦略を、多様な応用範囲にわたって提案しています。この分類は、緩和措置が取られた段階に基づいています。このプロトコルは、6つのLLMバリアントにおける社会的バイアスに取り組み、軽減するための3つの戦略を組み合わせ、ジェンダー、職業、人種、宗教の4つの社会的バイアス次元にわたるバイアス削減を調査します。まず、データ拡張技術を用いて推論データセットを開発し、LLMが推論を生成できるようにします。次に、12種類のプロンプトがLLMからステレオタイプ的な反応を引き出すために設計されています。第三に、Llama-2-7B13、Mistral-7B14、Dolly-7B15は、性別、人種、職業、宗教の4つの社会カテゴリーにわたる偏りのない文を含むデータセットでファインチューニングされ、Llama-2-7B、Mistral-7BDolly-7Bのファインチューンを行いますそれぞれ、最後に、ファインチューニングされたLLMが公正な回答を出す効果を調査することで推論が導かれます。

私たちは以下の研究課題を策定し、本論文でそれらに取り組みました。各定式化された研究課題(RQ)に対して、帰無仮説(H0)と代替仮説(H1)が構成されました。

RQ1:推論データセットと基本的なプロンプト技術は、LLMにおける社会的偏見の評価に効果的ですか?帰無仮説(H01):推論データセットから導出されるバイアススコアは、基本的なプロンプトと組み合わせたところ、LLMのベースラインバイアススコアと統計的に区別がつきません。代替仮説(H11):基本プロンプトを用いた推論データセットのバイアススコアは、LLMのベースラインバイアススコアと統計的に有意に異なります。仮説を検証するために、NeutralSetというデータセットを作成し、StereoSet16 を修正し、各LLMを基本的なプロンプティング技術で評価して、非ステレオタイプな応答を生み出せるかどうかを評価しました。私たちの設定には6つの基本的なプロンプトが含まれています――スタンダード(LLMに推論を指示するゼロショットプロンプト)、思考の連鎖(CoTはLLMに段階的に考えさせて推論を行うよう設計)、System1(LLMが迅速に考えながら答えられるように促すプロンプト)、System2(LLMにゆっくりと思慮深く考えさせるプロンプト)、ヒューマンペルソナ1(HP1はLLMが意思決定を迅速に行う人間のアイデンティティを採用するように設計されています)、 そしてヒューマンペルソナ2(HP2はLLMがゆっくりと思慮深く考えながら回答する人間のアイデンティティを採用するように設計されています)。

RQ2: バイアス除去プロンプティング技術は、LLMにおける社会的偏見を明らかにし軽減するのに効果的ですか?帰無仮説(H0₂):デバイアスプロンプト技術はLLMにおける社会的バイアスを明らかにし軽減する効果がありません。代替仮説(H12):デバイアスプロンプト技術を用いると測定されたバイアススコアが大幅に低下します。基本プロンプトのバイアス除去バリアントが、社会的差別のない公正なテキスト生成を実現するために、3つのオープンソースLLMに与える影響を調査します。

RQ3:LLMを微調整することで社会的な偏見をさらに軽減できるのでしょうか?帰無仮説(H03):LLMの微調整は、プロンプティング技術だけで得られる社会的バイアスをさらに減らしません。代替仮説(H13):LLMの微調整は、プロンプト技術だけで得られる社会的偏見の軽減を超えてさらに軽減します。この問いに答えるために、データセット17 を修正し、その上にLLMを微調整して、ファインチューニングがステレオタイプ回答を減らす効果をさらに評価します。

図1 は、プロンプト変動とLLMのファインチューニングが性別中立的な予測結果に与える影響を示しています。私たちの研究の新規性は、手動データセットのキュレーション、複数のバイアス除去プロンプト戦略、そして単一のプロトコルでの微調整を統合し、医療画像や電子カルテのメンテナンスなどの繊細な実世界応用に関連する社会的バイアスの特定と緩和のためにLLMを分析することにあります。LLMにおけるバイアスに関する文献を4つの視点に分けました:バイアスと認知的関連に関するデータセット、バイアス検出および評価フレームワーク;バイアス緩和のアプローチ;そして専門分野におけるバイアス。

研究者たちは、LLMにおけるバイアス評価や意味的関連分析を可能にするためのデータセットを継続的に生成しています。例えば、認知心理学や言語学において、自由連想は常に概念的知識の組織化において重要な役割を果たします。同じ関連性をLLMの潜在分布でシミュレートし、AbramskiらはLLM World of Words(LWOW)というデータセットを構築しました。LWOW英語自由連想規範データセットは、3つのLLM(Mistral-7B14、Llama-3.1-8B19、Claude-3-5-haiku-latest20)からの数百万件の応答で構成されています。これは、人間の英語の自由連合規範の最大のデータセットであるSmall World of Words(SWOW)21に触発されており、心理学的および言語学的な様々な研究で広く用いられています。さらに、LWOWは、それぞれが単語を表すノードで構成され、ネットワーク内でより近い意味的に類似した単語に対応するノードからなる認知ネットワークを構築するのに役立ちます。これにより、人工認知ネットワーク内の単語間の距離を主要な指標として推定することで、LLMの出力におけるバイアスを評価するのに役立ちます。独自LLMを使う際の大きな障害の一つは、その内部構造にアクセスできないことです。これらのモデルではバイアス対策に大きな努力がなされていますが、アライメントデータセットは依然として乏しいです。この懸念に対処するため、L.M.M.22のL22ではLLMにおける性別バイアスを軽減するためにGenderAlignというデータセットが提案されています。UnStereoEval23は、職業や感情におけるステレオタイプな性別バイアスを調査するベンチマークデータセットとして提案されています。彼らの発見は、28種類の異なるLLMで公平性が低いことを明らかにしています。BartlとLeavy24は、ステレオタイプな言及を含む文を中立的な同等語に置き換え、3つの言語モデル(GPT-225、PHI-1.526、RoBERTa27)を微調整したデータセット「Tiny Heap」を開発しました。彼らの調査結果では、モデルの性別ステレオタイプ傾向が有意に減少していることが観察されています。

LLMにおけるバイアスを特定し軽減するために、いくつかの多層フレームワークが提案されています。Razaらの28では、データセット作成、モデル開発、バイアス軽減、評価の4層からなるフレームワーク「NBIAS」が提案されています。フレームワーク内のデータセットは、医療、ソーシャルメディア、雇用ポータルなど多様なドメインから構築されています。彼らは、基準(BERT29)を公平性で1%から8%上回るパフォーマンスを発揮することで、モデルの有効性を示しています。別の枠組みであるGenderCARE30では、LLMSにおけるジェンダーバイアスを緩和する戦略が提案されています。彼らの広範な実験的セットアップにより、12の異なるLLMで平均35%の性別バイアスを効果的に減らしました。フレームワークであるBiasAlet31は、LLMによって生成されたオープンテキストの社会的偏見を自動的に検出します。いくつかの制約があります。第一に、LLMのオープンテキスト生成におけるバイアスを評価するベンチマークが存在しないため、統合データセット上で行われていること、第二に、古いデータセットSBIC32に基づいて構築されているため、暗黙的バイアスとデータセット自体のバイアスの関連性を区別しにくいことです。人間生成データのバイアスが、それに基づいて訓練されたモデルに導入されることがあります。このようなモデルの使用は、その成果が不利な立場にあるグループに悪影響を及ぼす可能性があるため、重要な仕事では議論の的となっています。これに対処するために、BiasBuster33というフレームワークがLLMにおける認知バイアスを検出、評価、軽減するために設計されました。これに関連して、別の研究34では、System 2のプロンプトを通じて公平で論理的かつ批判的なテキストを生成するインタラクティブなフレームワークを提案しています(LLMが思慮深くゆっくり考えられるように設計されており、自己洗練され含意的なプロンプトを補完します)。しかし、このフレームワークはLLMの潜在空間内のタスクに限定されています。Dongらは、10のオープンソースLLMにおけるジェンダーバイアスを軽減・評価するために間接プロービングを活用するフレームワークを開発しました 。彼らの探究手法では、直接的なステレオタイプ的な言及を活用せずに、間接的な性別バイアスを明らかにしています。

Linら36は、クローズドエンド(GPT-3.5-turbo、GPT-437)およびオープンエンドモデル(Llama-2-7B13、Mistral-7B14、Vicuna29)におけるLLMによるテキスト生成における政治的バイアスを調査しています。モデル生成のテキストが左寄りか右寄りのメディア偏りを誘発しているかを明らかにしました。さらに、モデルを微調整し、テキスト生成時にバイアスを減らしたプロンプトを追加することで緩和策を考案しました。バイアス軽減手法を適用すると、モデルは中立的なテキストを生成する傾向があります。左派や右派のメディアはそれに影響を与えません。これに関連して、Rajら17は心理学における接触仮説に基づく社会的接触脱偏見(Social Contact Debiasing、SCD)を提案しており、これは異なる社会集団のイデオロギーを理解するプロンプト生成を含み、3つのオープンソースLLMのテキスト生成における偏見を減らす方法を含んでいます。これと並行して、Kamruzzaman とKim 38 は、System 1およびSystem 2の思考連鎖プロンプトを活用し、5つのLLM(GPT-3.5、GPT-437、Llama-2-7B13、Mistral-7B14、Gemini-1.039)で12次元にわたるバイアス軽減を図る社会的バイアス除去技術を提案しました。ここで、System 1のプロンプトはLLMに迅速な応答を促すものであり、System 2のプロンプトはより思慮深く意図的な回答へと導くことを目的としています。プロンプト工学を用いてLLMのバイアスを緩和する様々な研究が行われましたが、プロンプトの変動がLLMの出力に与える影響について調査した研究はほとんどありません。この問題に対処するため、Hidaらは12のオープンソースLLMの出力がプロンプトの変動に対する感度を調査し、タスクパフォーマンスやバイアスのトレードオフへの影響を分析しました。彼らの発見は、バイアス除去の結果がプロンプトに敏感であることを示しています。モデルの出力にバイアスが少なくなると、タスクの性能が低下します。Kambojら41は、T5モデルの文脈化埋め込みにおけるジェンダーバイアスを緩和するための後処理アプローチを提案しています(Text-To-Text-Transfer-Transformerモデル42)。Obaら43は、LLMにバイアス生成を抑制するためのプロンプトとして手動作成されたテキスト前文を提供しています。

何十年も医療における診断ミスの原因となってきた認知バイアスは、臨床意思決定において大規模言語モデル(LLM)に刷り込まれ、増幅されるリスクがあります。このリスクに対抗するため、Mahajanらはこれらの技術を導入するための緩和戦略は3つのテーマに焦点を当てるべきだと提案しています。 第一に自己反省(出力の反復的再評価)、第二に文脈的推論(患者の全病歴とエビデンスに基づくガイドラインを取り入れた)、そして最後に透明な推論の痕跡(監査用に提供される推論プロセスの説明)です。LLMはその広範な能力により、現在ではプログラミングコードの生成にも広く使われています。したがって、生成されたコードにおける社会的偏見の悪影響を調査する際の研究者にとって重要な関心事となっています。もしそのようなバイアスが検出された場合、対応する緩和手法を考案する必要があります。同じ方向で、Huangらは社会的バイアスの評価と軽減手法を提案し 、広く使われている5つのLLMで検証しました。近年、LLMアーキテクチャの進歩と、人間らしい応答を生成する能力が大きく進歩しています。LLMが意思決定において人間の代理として機能できるかどうかは未解決のままであり、さらなる研究が必要です。この方向性にあたり、Tjuatjaらによって、LLMがアンケートで人間に似た回答を提供できるかどうかを調査するためのフレームワーク とデータセットがキュレーションされています。

これらの進展にもかかわらず、3つの研究のギャップが依然として存在します。第一に、これまでの研究は狭いタイプのバイアス(例:ジェンダーや政治)や特定の領域(例:特定のテーマ)に焦点を当てる傾向があります。第二に、プロンプト工学は広く普及していますが、体系的なプロンプトの変動がLLMの出力に与える影響を検証した研究はほとんどありません。第三に、限られた研究は、医療などの重要分野に関連するオープンソースLLMのリソース制約によるファインチューニングの難関におけるバイアス除去に取り組んでいます。これらのギャップを埋めるために、計算制約の下での微調整やバイアス指標に対するモデル決定の堅牢性を評価するための、さまざまなモデルアーキテクチャ間でのステレオタイプバイアスを測定できる単一のバイアス軽減・評価プロトコルを提示します。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

プロトコル

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

すべての実験はGoogle Colabプラットフォーム(A100、40GB RAM)上で実施されています。実験を行うために、Hugging FaceからLlama2-7B、Mistral-7B、Dolly-7BのAPIキー(モデルカード)を取得しました。

このプロトコルは三つの部分に分かれています。まず、LLMにおける社会的バイアスを評価するための基盤となるデータセットを構築します。次に、KamruzzamanとKimの 研究に沿った12種類の異なるプロンプトバリアントを設計し、LLMによって生成される推論における社会的バイアスの存在を調査します。次に、人種、宗教、性別、職業に関連する偏りのない文のデータセットでLLMをファインチューニングし、同じプロンプトで再度探査してファインチューニングが生成された推論に与える影響を調査します。提案された枠組みは 図2に示されています。

データセットのキュレーション
このフレームワークは2つのデータセットを使用します。1つは推論導出に使われ、もう1つはLLMのファインチューニングに適用されます。本研究はStereoSet16 を修正し、推論生成の基盤となる新しいデータセットNeutralSetを構築します。LLMはStereoSetを用いて、人種、宗教、性別、職業の4つのバイアスタイプで予測を行いました。StereoSetは、文内データセットと文中データセットの2つのサブデータセットで構成されています。NeutralSetのインスタンスは 表1に示されています。カラムコンテキストの文をLLMにクエリとして与え、BLANK欄のカラムの中のアンチステレオタイプ、ステレオタイプ、またはニュートラルの単語を埋めるよう依頼します。LLMのバイアスの度合いは、選ぶ選択肢から判断できます。NeutralSetにニュートラルカラムが含まれていることが、StereoSetと区別されます。新しいデータセットに追加する目的は、LLM推論を行う際にステレオタイプオプションを選択する可能性を減らすことです。単語はアルゴリズム1(補足ファイル1)で示された手順に従って中立列に追加されます。ここでV、s 、Vas はそれぞれステレオタイプ語と反ステレオタイプ語のベクトルです。辞書から、ベクトルがVnに最も近い単語が選ばれ、ステレオタイプとアンチステレオタイプ語のベクトルの間に文脈的に位置し、その単語を選択した行の中立列に追加します。 表2は NeutralSetの作成プロセスを要約しています。次に、データセット17を修正してLLMを微調整します。改訂されたデータセットには25,020のインスタンスが含まれており、それぞれが社会的に偏りのない回答とクエリの組み合わせで構成されており、モデルの訓練に使用されています。クエリは4つの社会的偏見すべてに対応するよう設計されています。

LLMの提示
LLMにおける社会的バイアスを検証し、入力指示として一連のプロンプトを提供しましょう。まず、12種類のプロンプトを作成します。基本的なプロンプト6種類と、対応する偏りのないバリアント6種類です。すべてのプロンプト技術の内容は 表3に記載されています。本研究のプロンプトは、周期的かつ形式化されたプロセスの形成、実施、振り返り、修正を経て、試行錯誤と洗練を経て一連のプロンプトが完成しました。これにより、ベースライン、CoT、ヒューマンペルソナプロンプトなど多様なプロンプトタイプをカバーできるようになりました。プロンプト設計やスコアリングは、外部の専門家(例:臨床医、社会的・公平性の専門家)によって検証されませんでした。 表4は 異なるプロンプトタイプをまとめ、その推論スタイル、バイアス軽減機能、適切な選択の指針となるユースケースを示しています。本論文におけるLLMの評価は、過去のランやセッションをまたいで保持しません。最終モデルで明確にしておくべきことは、各プロンプトは個別に実行されるべきであり、会話履歴がプロンプト間で引き継がれないことです。このレイアウトにより、過去の回答がその後の出力に影響を与えないようにしました。ファインチューニング段階では、パラメータ効率的遷移学習(PEFT47)および量子化低ランク適応(QLoRA48)に記載されているように、トレーニングデータセットに基づくモデルパラメータのみを修正してください。以下のようにプロンプトを作成します:

標準的なプロンプト: これはゼロショットプロンプト技術で、LLMに最小限の情報で推論を指示します。プロンプトは「与えられた選択肢の中から最も適切な単語をBLANKに挿入してください。」です。これは6つのLLMすべてにおける社会的バイアスの定量化と評価の基準として用いられます。

CoTのプロンプト: プロンプトには「一歩一歩考えて、空白を埋めて。提供された選択肢の中からBLANKに最適なものを選んでください...」このプロンプト技法では、LLMは認知プロセスを活用し、答えを出す前に段階的に考えることが奨励されます。

System1およびSystem2のプロンプト: 「あなたは質問に迅速に応答します...」というフレーズを含めることで、System1のプロンプトはLLMが迅速かつ直感的な応答を提供するよう導きます。これはSystem1における人間の認知の動作に似ています。一方で、System2のプロンプトは「あなたは質問に徹底的かつ意図的に応答します」というフレーズを加えることで、LLMからより思慮深く詳細かつ分析的かつ意図的な応答を引き出すよう設計されています。あなたの回答は「指示の中で」思慮深く信頼できます。

HP1とHP2のプロンプト: プロンプトはこう始まります:「質問に素早く答える人のアイデンティティを採用し、そのアイデンティティの性質に厳密に従って空白を埋めてください...".HP1プロンプト技術では、LLMは迅速に応答する人間のアイデンティティを採用するよう指示されました。この設定の目的は、System1の認知プロセスにおいてLLMが人間の姿を模倣することです。対照的に、HP2のプロンプトでは、LLMは人間のようなアイデンティティを採用し、質問に答える前に思慮深く意図的に考えることで、より正確な結果を得ようとしています。HP2のプロンプトは「質問に思慮深く意図的に答え、そのアイデンティティの性質に厳密に従いながら空欄を埋める人のアイデンティティを採用しなさい...」というフレーズから始まります。これらのプロンプトを含める主な目的は、LLMが人間の認知を完全に模倣できるかどうかを評価することです。

デバイアスバリアント: デバイアスバリアントは、LLMに中立的に決定を下すよう指示する文を加えることで構成されます。

LLMの評価
6つのLLMを評価する:1) Llama-2-7B13(Huggingfaceのmeta-llama/Llama-2-7b-chat-hfチェックポイントを使用);2) Mistral-7B14、Huggingfaceのmistralai/Mistral-7B-Instruct-v0.3チェックポイント使用;3) Dolly-7B15(Huggingfaceのdatabricks/dolly-v2-7bチェックポイント使用);4) Llama2-7Bファインチューン(Llama-2-7Bのファインチューニング型);5) ミストラル7Bファインチューンド、ミストラル7Bのファインチューン型;6) ドリー7Bファインチューン、ドリー7Bのファインチューニング型。

すべての実験は、40GB以上のメモリを持つA100のような高速GPUで行ってください。LLMの微調整には、データセットをトレーニング、検証、テストセットに分割し、標準的な70%:10%:20%の分割で行います。モデルの完全な再学習を避けるため、本研究ではPEFT47 構成を用いて微調整を行い、モデルのパラメータの多くを凍結し、タスク固有のパラメータはごくわずかに追加します。計算資源が限られている場合は、QLoRA48 で4ビット精度でLLMをロードします。これにより、モデルのパフォーマンスを低下させることなく、より速い微調整が可能になります。

LLMにおけるステレオタイプバイアスを評価するには、バイアススコア を指標として用いてください。式1に示されているように、バイアススコア は特定のプロンプトに対するステレオタイプ応答とLLMからの有効な応答総数の比率として計算されます。

figure-protocol-1(1)

ここで Ns、Nas 、Nn はそれぞれステレオタイプ、反ステレオタイプ、中立的な回答の数を表します。バイアススコアが低いほど、モデルの出力がステレオタイプ的でないことを示します。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

式1で定義されたバイアススコアを用いて、私たちは研究課題に体系的に答え、4つの社会的側面にわたるLLMにおける社会的バイアスを評価します。観察された統計的に有意なバイアススコアの減少は、高リスクタスクにおけるLLMのバイアス削減に関する提案されたプロトコルの実証的検証を提供します。NeutralSet、すなわちキュレーションされた推論データセットの有効性を評価するために、StereoSetとNeutralSetの両方の3つのバニラLLMすべてをベースライン標準プロンプトでクエリし、平均バイアススコアを算出します。 図3に示すように、NeutralSetのバイアススコアはStereoSetに比べて7.8ポイント減少しています。研究の第二の質問に答えるために、3つのバニラLLMすべてに6つの基本的なプロンプト手法を用いて問い合わせ、 図4に示す平均バイアススコアを計算します。調査結果は、HP2プロンプトが最も優れたパフォーマンスを示し、基準基準のスタンダー...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

ディスカッション

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究では、Llama2-7B13、Mistral-7B14、Dolly-7B15を活用した、LLMにおける社会的バイアスを減らすスケーラブルなプロトコルを提案します。このアプローチは、HP2プロンプトエンジニアリング、プロンプト修正のバイアス除去、ターゲットを絞ったファインチューニングを組み合わせ、ジェンダー、人種、職業、宗教という4つの主要な社会的次元において、LLM生成出力のバイアスを継続的に削減するためのプロトコルを開発します。基本プロンプトと偏りのないプロンプトを用いたバニラモデルを評価すると、多くの偏向なしプロンプト手法が基本的なプロンプトよりも著しく優れていることがわかります。 表6に示されているように、HP2+Debiasが最も有意な改善を示しました(平均差=8.13、p = 0.001)、次いでSystem2+Debias(平均差=6.13、p = 0.001)、System1...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

開示事項

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者たちは何も明かすことはありません。

材料

この記事で使用された材料の一覧
名前会社カタログ番号コメント
Google Colabグーグルhttps://colab.research.google.com/実験の実行に使用され、nbsp;
メンデレーデスクトップメンデレーhttps://www.mendeley.com/引用や参考文献の管理に使用されます。

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. STRUX: An LLM for decision-making with structured explanations. Lu, Y., Hu, Y., Foroosh, H., Jin, W., Liu, F. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  2. Eigner, E., Händler, T. Determinants of LLM-assisted decision-making. arXiv. , (2024).
  3. Wu, Y. Large Language Model and Text Generation. Natural Language Processing in Biomedicine: A Practical Guide. , Springer. Cham. (2024).
  4. Wang, L., et al. Benchmarking and improving long-text translation with large language models. Find Assoc Comput Linguist: ACL. 2024, 7175-7187 (2024).
  5. Ghatora, P. S., Hosseini, S. E., Pervez, S., Iqbal, M. J., Shaukat, N. Sentiment analysis of product reviews using machine learning and pre-trained LLM. Big Data Cogn Comput. 8 (12), 199(2024).
  6. Arefeen, M. A., Debnath, B., Chakradhar, S. LeanContext: Cost-efficient domain-specific question answering using LLMs. Nat Lang Process J. 7, 100065(2024).
  7. Ye, Y., Sarkar, S., Bhaskar, A., Tomlinson, B., Monteiro, O. Using ChatGPT in a clinical setting: A case report. MedComm Future Med. 2 (2), e51(2023).
  8. How are LLMs mitigating stereotyping harms? Learning from search engine studies. Leidinger, A., Rogers, R. Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society, 7, 839-854 (2024).
  9. Gender bias and stereotypes in large language models. Kotek, H., Dockum, R., Sun, D. Proceedings of the ACM Collective Intelligence Conference, 2023, 12-24 (2023).
  10. Uncovering stereotypes in large language models: A task complexity-based approach. Shrawgi, H., Rath, P., Singhal, T., Dandapat, S. Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics, 1, 1841-1857 (2024).
  11. Kwak, D. -H., Holtkamp, P., Kim, S. S. Measuring and controlling social desirability bias: Applications in information systems research. J Assoc Inf Syst. 20 (4), 317-345 (2019).
  12. Self-debiasing large language models: Zero-shot recognition and reduction of stereotypes. Gallegos, I. O., et al. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  13. Touvron, H., et al. Llama 2: Open foundation and finetuned chat models. arXiv. , (2023).
  14. Jiang, A. Q., et al. Mistral 7B. arXiv. , (2023).
  15. Conover, M., et al. Free Dolly: Introducing the world's first truly open instruction-tuned LLM. , databricks.com/blog/2023/04/12/dolly-first-open-commercially-viable-instruction-tuned-llm (2023).
  16. Nadeem, M., Bethke, A., Reddy, S. StereoSet: Measuring stereotypical bias in pretrained language models. arXiv. , (2020).
  17. Breaking bias, building bridges: Evaluation and mitigation of social biases in LLMs via contact hypothesis. Raj, C., Mukherjee, A., Caliskan, A., Anastasopoulos, A., Zhu, Z. Proceedings of the Seventh AAAI/ACM Conference on AI, Ethics, and Society, 2024, 1180-1189 (2024).
  18. Abramski, K., Improta, R., Rossetti, G., Stella, M. The "LLM world of words" English free association norms generated by large language models. Sci Data. 12 (1), 1-16 (2025).
  19. Lhama Team, Meta AI. The Llama 3 herd of models. arXiv. , (2024).
  20. Claude Haiku 3.5. , Anthropic. At anthropic.com/claude/haiku (2025).
  21. De Deyne, S., Navarro, D. J., Perfors, A., Brysbaert, M., Storms, G. The "small world of words" English word association norms for over 12,000 cue words. Behav Res Methods. 51 (3), 987-1006 (2019).
  22. GenderAlign: An alignment dataset for mitigating gender bias in large language models. Zhang, T., et al. Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics, , (2025).
  23. Are models biased on text without gender-related language. Belém, C. G., Seshadri, P., Razeghi, Y., Singh, S. The Twelfth International Conference on Learning Representations (ICLR), , openreview.net/forum?id=w1JanwReU6 (2024).
  24. From showgirls to performers: Finetuning with gender-inclusive language for bias reduction in LLMs. Bartl, M., Leavy, S. Proceedings of the 5th Workshop on Gender Bias in Natural Language Processing (GeBNLP), 5, 280-294 (2024).
  25. Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., Sutskever, I. Language models are unsupervised multitask learners. OpenAI Blog. 1 (8), 9(2019).
  26. Li, Y., Bubeck, S., Eldan, R., Giorno, A. D., Gunasekar, S., Lee, Y. T. Textbooks are all you need II: Phi-1.5 technical report. arXiv. , (2023).
  27. Liu, Y., et al. A robustly optimized BERT pretraining approach. arXiv. , (2019).
  28. Raza, S., Garg, M., John, D., Raza, S., Ding, C. Nbias: A natural language processing framework for BIAS identification in text. Expert Syst Appl. 237 (PB), 121542(2024).
  29. Vicuna: An open-source chatbot impressing GPT-4 with 90%* ChatGPT quality. , Available from: lmsys.org/blog/2023-03-30-vicuna/ (2025).
  30. GenderCARE: A comprehensive framework for assessing and reducing gender bias in large language models. Tang, K., et al. CCS '24: Proceedings of the 2024 on ACM SIGSAC Conference on Computer and Communications Security, 2024, 1196-1210 (2024).
  31. BiasAlert: A plug-and-play tool for social bias detection in LLMs. Fan, Z., Chen, R., Xu, R., Liu, Z. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, 2024, 14778-14790 (2024).
  32. Social bias frames: Reasoning about social and power implications of language. Sap, M., Gabriel, S., Qin, L., Jurafsky, D., Smith, N. A., Choi, Y. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, 58, 5477-5490 (2020).
  33. Echterhoff, J., Liu, Y., Alessa, A., McAuley, J., He, Z. Cognitive bias in decision-making with LLMs. Findings of the Association for Computational Linguistics: EMNLP 2024. 2024, 12640-12653 (2024).
  34. Furniturewala, S., et al. Thinking fair and slow: On the efficacy of structured prompts for debiasing language models. arXiv. , (2024).
  35. Dong, X., Wang, Y., Yu, P. S., Caverlee, J. Disclosure and mitigation of gender bias in LLMs. arXiv. , (2024).
  36. Investigating bias in LLM-based bias detection: Disparities between LLMs and human perception. Lin, L., Wang, L., Guo, J., Wong, K. 31st International Conference on Computational Linguistics, 31, 10634-10649 (2025).
  37. OpenAI. GPT-4 technical report. arXiv. , (2023).
  38. Kamruzzaman, M., Kim, G. L. Prompting techniques for reducing social bias in LLMs through system 1 and system 2 cognitive processes. Proceedings of Recent Advances in Natural Language Processing. 2024, 511-520 (2024).
  39. Gemini Team. Gemini: A family of highly capable multimodal models. arxiv. , (2023).
  40. Hida, R., Kaneko, M., Okazaki, N. Social bias evaluation for large language models requires prompt variations. Find Assoc Comput Linguist: EMNLP 2025. , 14507-14530 (2025).
  41. Measuring and mitigating gender bias in contextualized word embeddings. Kamboj, P., Kumar, S., Goyal, V. Proc IEEE Int Conf Blockchain Distrib Syst Secur, , (2023).
  42. Raffel, C., et al. Exploring the limits of transfer learning with a unified text-to-text transformer. J Mach Learn Res. 21, 1-67 (2023).
  43. In-contextual gender bias suppression for large language models. Oba, D., Kaneko, M., Bollegala, D. EACL 2024 - 18th Conference of the European Chapter of the Association for Computational Linguistics, Findings of EACL 2024, 2024, 1722-1742 (2024).
  44. Mahajan, A., Obermeyer, Z., Daneshjou, R., Lester, J., Powell, D. Cognitive bias in clinical large language models. npj Digit Med. 8 (1), 1-4 (2025).
  45. Huang, D., Bu, Q., Zhang, J., Xie, X., Chen, J., Cui, H. Bias testing and mitigation in LLM-based code generation. ACM Trans Softw Eng Methodol. , (2025).
  46. Tjuatja, L., Chen, V., Wu, S. T., Talwalkar, A., Neubig, G. Do LLMs exhibit human-like response biases? A case study in survey design. arXiv. , (2024).
  47. Houlsby, N., et al. Parameter-efficient transfer learning for NLP. arXiv. , (2019).
  48. Dettmers, T., Pagnoni, A., Holtzman, A., Zettlemoyer, L. QLoRA: Efficient finetuning of quantized LLMs. arXiv. , (2023).
  49. Xiao, H., Xiang, Z., Wang, D., Devadas, S. A Theory to instruct differentially-private learning via clipping bias reduction. IEEE Symposium on Security and Privacy (SP). , (2023).
  50. Kamboj, P., Kumar, S., Goyal, V. Mitigating Social Bias in Generative AI: A comprehensive review. KSII Trans Internet Inf Syst. 19 (10), 3372-3394 (2025).

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

再版と許可

このJoVE記事のテキストまたは図の再利用許可をリクエスト

許可をリクエスト

タグ

動画は近日公開

関連記事