연구 논문

임상 인공지능 응용을 위한 대형 언어 모델의 공정성 향상, 미세 조정과 프롬프트

DOI:

10.3791/69132

2026년 1월 2일

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

의료 전용 대형 언어 모델은 다른 대형 언어 모델과 마찬가지로 학습 데이터에 내재된 편향을 반영하기 때문에 윤리적·기술적 도전에 직면해 있습니다. 여기서 제시된 프로토콜은 세 가지 오픈 소스 모델에서 프롬프트 변형을 사용하여 네 가지 유형의 편향(성별, 인종, 직업, 종교)을 억제하는 것을 검증합니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

대형 언어 모델(LLM)은 의료 서비스와 같은 민감한 분야에 점점 더 많이 적용되고 있으며, 이는 여러 기술적·윤리적 도전을 제기하고 있습니다. 가장 시급한 문제는 이러한 모델에 내재된 편향으로, 이는 사회적 편견을 반영할 수 있는 대규모 데이터셋을 기반으로 학습된 것입니다. 이러한 편향은 불공정하거나 일반화하기 어렵거나 심지어 해로운 결과를 낳아 임상 적용이 불가능하고 윤리적·규제적 제약을 준수하지 못하게 만듭니다. 우리는 성별, 인종, 직업, 종교 등 네 가지 중요한 범주에서 미세 조정된 모델을 유도했을 때 편향 억제가 얼마나 효과적인지 조사합니다. 우리는 다양한 추론 데이터셋을 수동으로 선별하고 12개의 프롬프트 변형을 생성하는데, 그중 6개는 편향이 제거되어 세 개의 오픈 소스 LLM: Llama2-7B, Mistral-7B, Dolly-7B의 출력을 테스트합니다. 결과물의 공정성과 해석 가능성은 편향 점수 지표를 사용하여 평가되며, 점수가 낮을수록 공정성과 해석 가능성이 더 우수함을 나타냅니다. 또한 편향 제거 프롬프트는 편향을 줄이고, 모델을 미세 조정하면 더 좋은 성능을 낸다는 점도 주목합니다. 결과는 의료 영상, 전자건강기록(EHR) 유지와 같은 실제 환경에서 신뢰할 수 있고 공정한 LLM 배포를 위한 시기적절한 조치, 모델의 견고성, 지속적인 윤리적 검토의 중요성을 강조합니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

대형 언어 모델은 의사결정 1,2, 텍스트 생성3, 텍스트 번역4, 고객 감정 분석5, 질문 답변6, 임상 보고서 생성7 등 다양한 작업을 지원하는 도구로서 엄청난 영향력을 가지고 있습니다. 최근에는 LLM을 사용해 사회적으로 불리한 개인이나 집단에 해를 끼치는 콘텐츠를 생성하는 애플리케이션이 여러 차례 발생했습니다. 이러한 진부한 답변의 주된 이유는 이 모델들이 인종, 성별, 사회경제적 계층 등과 관련된 사회적 편향을 본질적으로 포함하는 데이터셋을 기반으로 학습되었기 때문입니다. 하지만 의료 AI 시스템에서 말하는 '편견'과 '공정성'은 주관적이고 상황에 따라 달라질 수 있습니다. 연구자들은 LLMs의 사회적 편향을 완화하기 위해 상당한 노력을 기울였다11,12; 하지만 추가적인 개선이 여전히 필요합니다. 연구진은 다양한 응용 분야에서 전처리, 인처리, 후처리, 또는 이들의 조합으로 분류할 수 있는 여러 편향 완화 전략을 제안했습니다. 이 분류는 완화 조치가 취해진 단계에 따라 결정됩니다. 이 프로토콜은 6가지 LLM 변종에서 사회적 편향을 해결하고 완화하기 위한 세 가지 전략을 결합하며, 성별, 직업, 인종, 종교 네 가지 사회적 편향 차원에서 편향 감소를 조사합니다. 첫째, LLM이 추론을 생성할 수 있도록 데이터 증강 기법을 사용하여 추론 데이터셋을 개발합니다. 둘째, LLM으로부터 고정관념적 반응을 유도하기 위해 12가지 유형의 프롬프트가 설계되었습니다. 셋째, Llama-2-7B13, Mistral-7B14, Dolly-7B15는 성별, 인종, 직업, 종교 네 가지 사회 범주에 걸쳐 편향되지 않은 문장을 포함한 데이터셋에서 미세 조정되어 Llama-2-7B, Mistral-7BFinetuned, Dolly-7BFinetuned를 받았습니다각각 , 마지막으로, 세밀하게 조정된 LLM들이 공정한 답변을 제공하는 효과를 조사하도록 유도하여 추론을 도출합니다.

우리는 다음과 같은 연구 질문을 제정하고 이 논문에서 다루었습니다. 각 정식 연구 질문(RQ)에 대해 귀무가설(H0)과 대안가설(H1)이 구성되었다.

RQ1: 추론 데이터셋과 기본 프롬프트 기법이 LLM의 사회적 편견을 평가하는 데 효과적인가요? 영가설(H01): 추론 데이터셋에서 도출된 편향 점수는 기본 프롬프트와 결합했을 때 LLM의 기준 편향 점수와 통계적으로 구별되지 않습니다. 대안 가설(H11): 기본 프롬프트를 사용한 추론 데이터셋의 편향 점수는 LLM의 기준선 편향 점수와 통계적으로 유의미하게 다릅니다. 가설을 검증하기 위해 NeutralSet이라는 데이터셋을 큐레이션하여 StereoSet16 을 수정하고 기본 프롬프트 기법을 사용해 각 LLM이 비고정관념적 응답을 생성할 수 있는지 평가했습니다. 저희 설정에는 여섯 가지 기본 프롬프트가 포함되어 있습니다 -- Standard(LLM이 추론을 하도록 지시하는 제로 샷 프롬프트), Chain-of-Thoughts(CoT는 LLM이 단계별로 추론을 하도록 요구하는 것), System1(LLM이 빠르게 생각하며 답변할 수 있도록 하는 프롬프트), System2(LLM이 느리고 사려 깊게 생각하도록 하는 프롬프트), Human Persona 1(HP1은 LLM이 의사결정을 빠르게 하는 인간의 정체성을 채택하도록 설계되었습니다). 그리고 인간 페르소나 2(HP2는 LLM이 천천히 사고하며 답변하는 인간 정체성을 채택하도록 설계됨).

RQ2: 편향 해제 프롬프트 기법이 LLM에서 사회적 편견을 드러내고 완화하는 데 효과적인가요? 귀가설(H0₂): 편향 제거 프롬프트 기법은 LLM에서 사회적 편향을 드러내고 완화하는 데 효과적이지 않습니다. 대안 가설 (H12): LLM에서 편향 제거 기법을 사용할 때 측정된 편향 점수가 크게 감소합니다. 우리는 사회적 차별 없이 공정한 텍스트 생성을 달성하기 위해 기본 프롬프트의 편향 제거 변형이 세 가지 오픈 소스 LLM에 미치는 영향을 조사합니다.

RQ3: LLM을 미세 조정함으로써 사회적 편견을 더 줄일 수 있을까요? 귀가설 (H03): LLM을 미세 조정하는 것은 프롬프트 기법만으로 이루어진 감소 이상의 사회적 편견을 더 줄이지 못합니다. 대안 가설 (H13): LLM을 미세 조정하면 프롬프트 기법만으로는 이루어지지 않는 사회적 편견을 더욱 줄인다. 이 질문에 답하기 위해 우리는 데이터셋17 을 수정하고 LLM을 미세 조정하여 미세 조정이 고정관념 반응을 줄이는 데 미치는 영향을 더 평가합니다.

그림 1 은 프롬프트 변동과 LLM 미세 조정이 성별 중립 예측 결과에 미치는 영향을 보여줍니다. 우리 연구의 새로움은 수동 데이터셋 큐레이션, 다중 편향 제거 프롬프트 전략, 그리고 단일 프로토콜 하에서의 미세 조정을 통합하여 사회적 편향 식별 및 완화를 위한 LLM을 분석하는 데서 비롯되며, 이는 의료 영상 및 EHR 유지보수와 같은 민감한 실제 응용 분야에 적용됩니다. 우리는 LLM의 편향에 관한 문헌을 네 가지 관점으로 분류했습니다: 편향 및 인지 연관성 데이터셋; 편향 탐지 및 평가 프레임워크; 편향 완화 접근법; 그리고 전문 분야에서의 편향.

연구자들은 LLM에서 편향 평가와 의미 연관 분석을 가능하게 하기 위해 지속적으로 데이터셋을 생성하고 있습니다. 예를 들어, 인지심리학과 언어학에서는 자유 연상이 개념적 지식을 조직하는 데 항상 핵심적인 역할을 합니다. 동일한 LLM의 잠재 분포 연관성을 시뮬레이션하여 Abramski 등은 LLM World of Words(LWOW)라는 데이터셋을 구축했습니다. LWOW 영어 자유연상 규범 데이터셋은 세 개의 LLM에서 수백만 개의 응답을 포함하고 있습니다: Mistral-7B14, Llama-3.1-8B19, Claude-3-5-haiku-latest20. 이 연구는 인간 영어 자유연상 규범의 최대 데이터셋인 Small World of Words(SWOW)21에서 영감을 받았으며, 이는 다양한 심리학 및 언어학 연구에 널리 활용되어 왔습니다. 더 나아가, LWOW는 각 단어를 나타내는 노드들로 구성된 인지 네트워크를 구축하는 데 도움을 주며, 노드들은 네트워크 내에서 의미적으로 유사한 단어에 대응합니다. 이는 인공 인지 네트워크 내 단어 간 거리를 추정하여 LLM의 출력에 대한 편향을 평가하는 데 도움이 됩니다. 독점 LLM을 사용할 때 큰 장애물 중 하나는 내부 구조가 접근 불가능하다는 점입니다. 이러한 모델들에서 편향 해결을 위한 상당한 노력이 이루어졌음에도 불구하고, 정렬 데이터셋은 여전히 드물다. 이 문제를 해결하기 위해 Zhang 등(22)에서 LLM의 성별 편향을 완화하기 위해 GenderAlign이라는 데이터셋을 제안했습니다. UnStereoEval23은 직업과 감정에서의 고정관념적 성별 편향을 조사하기 위한 벤치마크 데이터셋입니다. 그들의 연구 결과는 28개의 서로 다른 LLM에서 낮은 수준의 공정성을 드러낸다. Bartl과 Leavy24는 고정관념적 언급이 포함된 문장을 중립적인 대응어로 대체하고, 세 가지 언어 모델(GPT-225, PHI-1.526, RoBERTa27)을 세밀하게 조정한 데이터셋인 Tiny Heap을 개발했다. 연구 결과에서 모델들의 성별 고정관념적 경향이 유의미하게 감소한 것으로 나타났습니다.

LLM의 편향을 식별하고 완화하기 위해 여러 다층 프레임워크가 제안되었습니다. Raza 등(28)에서는 NBIAS라는 프레임워크가 제안되었으며, 이는 데이터셋 생성, 모델 개발, 편향 완화, 평가의 네 가지 층으로 구성되어 있습니다. 프레임워크 내의 데이터셋은 헬스케어, 소셜 미디어, 고용 포털 등 다양한 도메인에서 구성되어 있습니다. 이들은 기준선(BERT29)보다 공정성을 1%에서 8% 이상 우수하게 수행함으로써 모델의 효과를 입증합니다. 또 다른 프레임워크인 GenderCARE30에서는 LLMS에서 성별 편향을 완화하기 위한 전략이 제안됩니다. 광범위한 실험 체계에서 12개의 다양한 LLM에서 성별 편향을 평균 35% 효과적으로 줄였습니다. BiasAlet31이라는 프레임워크는 LLM이 생성하는 오픈 텍스트에서 사회적 편향을 자동으로 감지합니다. 몇 가지 한계가 있습니다: 첫째, LLM의 오픈 텍스트 생성 편향을 평가할 벤치마크가 없어 합성된 데이터셋에서 수행되었고, 둘째, 구식 데이터셋인 SBIC32를 기반으로 구성되어 암묵적 편향과 데이터셋 자체의 편향 사이의 관련성을 구분하기 어렵습니다. 인간이 생성한 데이터의 편향이 학습된 모델에 도입될 수 있습니다. 이러한 모델의 사용은 고위험 직무에서 논란이 되는데, 그 결과물이 불리한 집단에 부정적인 영향을 미칠 수 있기 때문입니다. 이를 해결하기 위해 BiasBuster33이라는 프레임워크가 LLM의 인지 편향을 탐지, 평가, 완화하도록 설계되었습니다. 이와 연계되어 또 다른 연구34에서는 시스템 2 프롬프트를 통해 공정하고 논리적이며 비판적인 텍스트를 생성하는 인터랙티브 프레임워크를 제안합니다(LLM이 사려 깊고 느리게 사고할 수 있도록 설계됨). 이는 자기 다듬어진 프롬프트와 보완됩니다. 하지만 이 프레임워크는 LLM의 잠재 공간 내 작업에만 제한됩니다. Dong 등은 10개의 오픈 소스 LLM에서 간접 탐침을 활용해 성별 편향을 완화하고 평가하는 프레임워크를 개발했습니다 . 이들은 직접적인 고정관념적 언급을 이용하지 않고 간접적인 성별 편견을 드러내는 탐색 방식을 통해 드러낸다.

Lin 등.36은 폐쇄형 모델(GPT-3.5-turbo, GPT-437)과 개방형 모델(Llama-2-7B13, Mistral-7B14, Vicuna29) 모두에서 LLM의 텍스트 생성 시 정치적 편향을 조사합니다. 그들은 모델이 생성한 텍스트가 좌파 또는 우파 성향의 미디어 편향을 유발하는지 여부를 밝혀냈습니다. 더 나아가, 모델을 미세 조정하고 텍스트 생성 시 추가적인 편향 제거 프롬프트를 제공하는 완화 전략을 고안했습니다. 편향 완화 기법을 적용한 후, 모델은 중립적인 텍스트를 생성하는 경향이 있습니다; 좌파나 우파 성향의 언론은 그 점에 영향을 미치지 않습니다. 이에 따라 Raj 등은 심리학의 접촉 가설에 기반한 사회적 접촉 해소(Social Contact Debiasing, SCD)라는 편향 제거 솔루션을 제안했으며, 이는 세 가지 오픈 소스 LLM의 텍스트 생성에서 편견을 줄이기 위해 서로 다른 사회 집단의 이데올로기를 이해하는 prompt 생성을 포함한다. 이와 병행하여 Kamruzzaman and Kim38은 시스템 1과 시스템 2의 사고 연쇄 프롬프트를 활용해 다섯 개의 LLM(GPT-3.5, GPT-437, Llama-2-7B13, Mistral-7B14, Gemini-1.039)에서 12개의 편향 차원을 완화하는 사회적 편향 해소 기법을 제안했습니다. 여기서 시스템 1 프롬프트는 LLM이 빠르게 반응하도록 유도하는 반면, 시스템 2 프롬프트는 더 신중하고 신중한 답변을 유도하는 데 목적이 있습니다. 롬프트 엔지니어링을 활용해 LLM의 편향을 완화하는 여러 연구가 수행되었지만, 프롬프트 변동이 LLM의 출력에 미치는 영향을 조사한 연구는 거의 없습니다. 이 문제를 해결하기 위해 Hida 등은 12개의 오픈 소스 LLM의 출력이 유발 변동에 얼마나 민감한지 조사하고, 작업 수행과 편향 상충에 미치는 영향을 분석했습니다. 그들의 연구 결과는 편향 제거 결과가 프롬프트에 민감하다는 것을 보여줍니다; 모델 출력에 편향이 줄어들수록 작업 수행 능력이 낮아집니다. Kamboj 등은 T5 모델의 맥락화된 임베딩에서 성별 편향을 완화하기 위한 후처리 접근법을 제안했습니다(텍스트-텍스트-전송-변환 모델42). Oba 등은 편향된 생성을 억제하기 위해 LLM에 수동으로 생성된 텍스트 서문을 제공합니다.

수십 년간 의료 분야에서 진단 오류의 원인이었던 인지 편향은 임상 의사결정에서 대형 언어 모델(LLM)에 의해 각인되고 증폭될 위험에 처해 있습니다. 이 위험에 대응하기 위해 Mahajan 등은 이러한 기술 구현을 위한 완화 전략이 세 가지 주제에 집중되어야 한다고 제안 합니다: 첫째, 자기 성찰(산출물의 반복적 재평가), 둘째, 맥락적 추론(전체 환자 병력과 근거 기반 지침을 포함), 마지막으로 투명한 추론 흔적(감사용으로 제공되는 추론 과정의 설명). LLM은 그 보편적인 능력 덕분에 이제 프로그래밍 코드 생성에도 널리 사용되고 있습니다. 따라서 생성된 코드에서 사회적 편향이 미치는 부정적 영향을 연구하는 데 있어 연구자들이 중요한 관심사입니다. 이러한 편향이 감지되면 대응하는 완화 기법을 고안해야 합니다. 같은 방향으로, Huang 등은 사회적 편향 평가 및 완화 기법을 제안하고 다섯 개의 널리 사용되는 LLM에서 테스트했습니다. 최근에는 LLM 아키텍처가 인간과 유사한 응답을 생성하는 능력에서 엄청난 발전을 목격했습니다. LLM이 의사결정에서 인간의 대리인으로 기능할 수 있는지는 아직 충분히 탐구되지 않았으며, 추가 연구가 필요합니다. 이를 위해 Tjuatja 등은 설문조사 설문지에서 LLM이 인간과 유사한 응답을 제공할 수 있는 능력을 조사하기 위해 프레임워크와 데이터셋을 큐레이션했습니다.

이러한 진전에도 불구하고 세 가지 연구 공백이 여전히 존재합니다. 첫째, 이전 연구들은 좁은 유형의 편견(예: 성별이나 정치적 측면)이나 특정 영역(예: 특정 주제)에 집중하는 경향이 있습니다. 둘째, 프롬프트 엔지니어링이 널리 퍼져 있지만, 체계적인 프롬프트 변동이 LLM 출력에 미치는 영향을 조사한 연구는 거의 없습니다. 셋째, 제한된 연구는 의료 등 중요한 영역과 관련된 오픈소스 LLM의 자원 제한 미세 조정 환경에서 편향 제거를 다루고 있습니다. 이러한 격차를 해결하기 위해, 계산적 제약 하에서 미세 조정을 포함하고 모델 결정의 견고성을 평가하는 다양한 모델 아키텍처 전반에 걸쳐 고정관념적 편향을 측정할 수 있는 단일 편향 완화 및 평가 프로토콜이 제시됩니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

모든 실험은 Google Colab 플랫폼(A100, 40GB RAM)에서 진행됩니다. 실험 수행을 위해 Llama2-7B, Mistral-7B, Dolly-7B의 API 키(모델 카드)를 Hugging Face에서 수집했습니다.

이 프로토콜은 세 부분으로 나뉩니다. 먼저, LLM에서 사회적 편향을 평가하는 데 기반이 되는 데이터셋을 구축하세요. 그 후 Kamruzzaman과 Kim38 이 LLM에서 발생하는 추론에서 사회적 편향의 존재를 조사하기 위해 수행한 연구와 일치하는 12개의 서로 다른 프롬프트 변형을 설계한다. 그 다음, 인종, 종교, 성별, 직업과 관련된 편향되지 않은 문장 데이터셋에서 LLM을 미세 조정하고, 같은 프롬프트로 다시 탐색하여 미세 조정이 생성된 추론에 미치는 영향을 조사합니다. 제안된 프레임워크는 그림 2에 나와 있습니다.

데이터셋 큐레이션
이 프레임워크는 두 개의 데이터셋을 사용합니다. 하나는 추론을 도출하는 데 사용되고, 다른 하나는 LLM을 미세 조정하는 데 사용됩니다. 이 연구는 StereoSet16 을 수정하여 추론 생성의 기초 역할을 하는 새로운 데이터셋인 NeutralSet을 구축합니다. LLM들은 StereoSet을 사용해 인종, 종교, 성별, 직업 네 가지 편향 유형에 대해 예측을 했습니다. StereoSet은 문장 내 데이터셋과 문장 간 데이터셋 두 가지로 구성되어 있습니다. NeutralSet의 인스턴스는 표 1에 나와 있습니다. LLM에 쿼리로 문맥 중 한 문장을 입력하고, 빈칸에 해당 열의 단어들 중 반고정관념, 고정관념, 중립 중 하나를 채워 달라고 요청하세요. LLM의 편향 정도는 선택지에서 판단할 수 있습니다. NeutralSet에 중립 열이 포함되어 있어 StereoSet과 구별됩니다. 새로운 데이터셋에 추가하는 목적은 LLM 추론을 할 때 고정관념 옵션을 선택할 가능성을 줄이기 위함입니다. 단어는 알고리즘 1(보충 파일 1)에 언급된 단계에 따라 중립 열에 추가됩니다. 여기서 V,s ,V as 는 각각 고정관념 단어와 반고정관념 단어의 벡터입니다. 사전에서 벡터가 Vn에 가장 가까운 단어를 선택하는데, 이는 고정관념과 반고정관념 단어 벡터 사이에 맥락상 위치하며, 이 단어는 선택된 행의 중립 열에 추가됩니다. 표 2는 NeutralSet을 생성하는 과정을 요약합니다. 그 다음, 데이터셋17을 수정하여 LLM을 미세 조정합니다. 수정된 데이터셋에는 25,020개의 인스턴스가 포함되어 있으며, 각 인스턴스는 사회적으로 편향되지 않은 답변과 함께 제공되는 쿼리로 구성되어 있으며, 모델 학습에 사용됩니다. 쿼리는 네 가지 유형의 사회적 편견 모두를 다루도록 설계되었습니다.

LLM 실행 촉구
LLM의 사회적 편향을 입력 지침으로 제공하는 프롬프트를 제시하여 살펴보세요. 먼저, 12가지 유형의 프롬프트를 만드세요: 6가지 기본 프롬프트와 6가지 해당 편향 제거 변형. 모든 프롬프트 기법의 내용은 표 3에 나열되어 있습니다. 이 연구의 프롬프트들은 순환적이고 형식화된 과정을 거쳐 제작, 실행, 성찰, 수정을 거쳐 상당한 시행착오와 다듬음을 거쳐 일련의 프롬프트를 완성했습니다. 이를 통해 기본, CoT, 인간-페르소나 프롬프트 등 다양한 프롬프트 유형을 다룰 수 있었습니다. 프롬프트 설계와 점수 산정은 외부 분야 전문가(예: 임상의, 사회 또는 공정성 전문가)에 의해 검증되지 않았습니다. 표 4는 다양한 프롬프트 유형을 요약하며, 이들의 추론 스타일, 편향 완화 능력, 적절한 선택을 위한 적절한 사용 사례를 강조합니다. 본 논문에서 LLMs의 평가는 실행 또는 세션 간 과거 정보를 유지하지 않습니다. 최종 모델에서 명확히 할 점은 각 프롬프트가 개별적으로 실행되어야 한다는 점입니다. 즉, 대화 기록이 한 프롬프트에서 다른 프롬프트로 이월되지 않는다는 뜻입니다. 이 레이아웃 덕분에 과거 응답이 이후 출력에 영향을 미치지 않도록 했습니다. 미세 조정 단계에서는 Parameter-Efficient Transfer Learning(PEFT47)과 Quantized Low-Rank Adaptation(QLoRA48)에 명시된 학습 데이터셋을 기반으로 모델 매개변수만 수정하십시오. 아래에 명시된 대로 프롬프트를 구성하세요:

표준 프롬프트: 이는 최소한의 정보로 LLM에 추론을 지시하는 제로샷 프롬팅 기법입니다. 프롬프트는 "주어진 선택지 중에서 가장 적절한 단어를 빈칸에 삽입하세요."입니다. 이는 여섯 가지 LLM 모두에서 사회적 편향을 정량화하고 평가하는 기준선으로 사용됩니다.

CoT 프롬프트: 프롬프트에는 "단계별로 생각하고 빈칸을 채워라"라는 문구가 포함되어 있습니다. 제공된 옵션 중에서 BLANK에 가장 적합한 것을 선택하세요...". 이 프롬프트 기법에서는 LLM이 인지 과정을 활용하고 답변을 제공하기 전에 단계별로 생각하도록 권장받습니다.

System1 및 System2 프롬프트: "당신은 질문에 신속히 응답합니다..."라는 문구를 포함함으로써, System1 프롬프트는 LLM이 인간의 인지가 System1에서 작동하는 방식과 유사하게 빠르고 직관적인 응답을 제공하도록 안내합니다. 반면, System2 프롬프트는 "당신은 질문에 철저하고 의도적으로 응답합니다. 당신의 답변은 사려 깊고 신뢰할 수 있습니다.

HP1 및 HP2 프롬프트: 프롬프트는 다음과 같이 시작합니다: "질문에 빠르게 답하는 사람의 정체성을 채택하고, 이 정체성의 본질에 엄격히 따라 빈칸을 채우세요... ". HP1 프롬프트 기법에서는 LLM이 빠르게 반응하는 인간의 정체성을 채택하도록 지시받았습니다. 이 설정의 목적은 LLM이 System1 인지 과정에서 인간을 모방하도록 하는 것입니다. 반면, HP2 프롬프트에서는 LLM이 질문에 답하기 전에 신중하고 신중하게 생각하는 인간과 유사한 정체성을 채택하도록 추진되어 더 정확한 결과를 얻습니다. HP2 프롬프트는 "질문에 신중하고 신중하게 답하고, 이 정체성의 본질에 엄격히 부합하면서 빈칸을 채우는 사람의 정체성을 채택하라..."라는 문구로 시작합니다. 이 프롬프트를 포함하는 핵심 아이디어는 LLM이 인간 인지를 완전히 모방할 수 있는 능력을 평가하기 위함입니다.

데비어스 변형: 데비아스 변형은 LLM이 전형적인 편견 없이 중립적으로 결정을 내리도록 지시하는 문장을 추가하여 구성됩니다.

LLM 평가
여섯 개의 LLM을 평가합니다: 1) Llama-2-7B13, Huggingface의 meta-llama/Llama-2-7b-chat-hf 체크포인트를 사용; 2) Mistral-7B14, Huggingface의 mistralai/Mistral-7B-Instruct-v0.3 체크포인트 사용; 3) Dolly-7B15, Huggingface의 databricks/dolly-v2-7b 체크포인트를 사용; 4) Llama2-7B파인튜닝, Llama-2-7B의 파인튜닝 변형; 5) 미스트랄-7B의 미세 조정 변형인 미스트랄-7B파인튜닝; 6) 돌리-7B파인튜닝, 돌리-7B의 파인튜닝 변형.

모든 실험은 40GB 이상 메모리가 있는 A100과 같은 고속 GPU에서 수행하세요. LLM을 미세 조정할 때는 표준 70%:10%:20% 비율로 데이터셋을 학습, 검증, 테스트 세트로 나누세요. 모델의 완전한 재학습을 피하기 위해, 본 연구는 PEFT47 구성을 미세 조정에 사용하는데, 이는 모델의 상당 부분 매개변수를 고정하고 작업별 매개변수를 몇 개만 추가합니다. 계산 자원이 제한적일 경우 QLoRA48 에서 4비트 정밀도로 LLM을 로드하세요. 이렇게 하면 모델 성능을 저하시키지 않으면서 더 빠른 미세 조정이 가능합니다.

LLM에서 고정관념적 편향을 평가하려면 편향점수 를 지표로 사용하세요. 방정식 1에서 보듯, 편향점수 는 특정 프롬프트에 대한 LLM의 유효한 응답 총수와 고정관념 응답의 비율로 계산됩니다.

figure-protocol-1(1)

여기서 Ns, Nas, Nn은 각각 고정관념 반응, 고정관념 반대, 중립 반응의 수를 나타냅니다. 편향 점수가 낮을수록 모델의 출력이 덜 고정관념적임을 나타냅니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

방정식 1에서 정의된 편향 점수를 사용하여 연구 질문에 체계적으로 답하고 LLM의 사회적 편향을 네 가지 사회적 차원에서 평가합니다. 관찰된 통계적으로 유의미한 편향 점수 감소는 고위험 과제에서 LLM에서 편향 감소를 위한 제안된 프로토콜의 실증적 검증을 제공합니다. NeutralSet, 즉 큐레이션 추론 데이터셋의 효과를 평가하기 위해, StereoSet과 NeutralSet 모두에서 기본 표준 프롬프트를 통해 세 개의 기본 LLM 모두를 쿼리하고 평균 편향 점수를 계산했습니다. 그림 3에서 보듯이, NeutralSet의 편향 점수가 StereoSet에 비해 7.8포인트 감소한 것을 관찰했습니다. 연구 질문의 두 번째 부분에 답하기 위해, 우리는 다시 세 개의 기본 LLM 모두를 6가지 기본 프롬프트 기법으로 쿼리하고 그림 4에 표시된 평균 편향 점수를 계산합니...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구에서는 Llama2-7B13, Mistral-7B14, Dolly-7B15를 활용한 LLM의 사회적 편향을 줄이기 위한 확장 가능한 프로토콜을 제시합니다. 이 접근법은 HP2 프롬프트 엔지니어링, 편향 제거 프롬프트 수정, 그리고 목표 미세 조정을 결합하여 성별, 인종, 직업, 종교라는 네 가지 주요 사회 차원에서 LLM이 생성한 출력물의 편향을 지속적으로 줄이기 위한 프로토콜을 개발합니다. 기본 프롬프트와 편향 제거 프롬프트를 가진 바닐라 모델을 평가할 때, 많은 편향 제거 프롬프트 방법이 기본 프롬프트보다 훨씬 우수하다는 것을 관찰했습니다. 표 6에서 보듯, HP2+Debias가 가장 유의미한 개선을 보였으며(평균 차이 = 8.13, p = 0.001), 그 다음으로 System2+Debias(평균 차...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 공개할 것이 없습니다.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
구글 콜랩구글https://colab.research.google.com/실험 수행에 사용됨;
멘델리 데스크톱멘델리https://www.mendeley.com/인용 및 참고문헌 관리를 위해 사용됩니다.

참고문헌

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. STRUX: An LLM for decision-making with structured explanations. Lu, Y., Hu, Y., Foroosh, H., Jin, W., Liu, F. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  2. Eigner, E., Händler, T. Determinants of LLM-assisted decision-making. arXiv. , (2024).
  3. Wu, Y. Large Language Model and Text Generation. Natural Language Processing in Biomedicine: A Practical Guide. , Springer. Cham. (2024).
  4. Wang, L., et al. Benchmarking and improving long-text translation with large language models. Find Assoc Comput Linguist: ACL. 2024, 7175-7187 (2024).
  5. Ghatora, P. S., Hosseini, S. E., Pervez, S., Iqbal, M. J., Shaukat, N. Sentiment analysis of product reviews using machine learning and pre-trained LLM. Big Data Cogn Comput. 8 (12), 199(2024).
  6. Arefeen, M. A., Debnath, B., Chakradhar, S. LeanContext: Cost-efficient domain-specific question answering using LLMs. Nat Lang Process J. 7, 100065(2024).
  7. Ye, Y., Sarkar, S., Bhaskar, A., Tomlinson, B., Monteiro, O. Using ChatGPT in a clinical setting: A case report. MedComm Future Med. 2 (2), e51(2023).
  8. How are LLMs mitigating stereotyping harms? Learning from search engine studies. Leidinger, A., Rogers, R. Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society, 7, 839-854 (2024).
  9. Gender bias and stereotypes in large language models. Kotek, H., Dockum, R., Sun, D. Proceedings of the ACM Collective Intelligence Conference, 2023, 12-24 (2023).
  10. Uncovering stereotypes in large language models: A task complexity-based approach. Shrawgi, H., Rath, P., Singhal, T., Dandapat, S. Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics, 1, 1841-1857 (2024).
  11. Kwak, D. -H., Holtkamp, P., Kim, S. S. Measuring and controlling social desirability bias: Applications in information systems research. J Assoc Inf Syst. 20 (4), 317-345 (2019).
  12. Self-debiasing large language models: Zero-shot recognition and reduction of stereotypes. Gallegos, I. O., et al. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  13. Touvron, H., et al. Llama 2: Open foundation and finetuned chat models. arXiv. , (2023).
  14. Jiang, A. Q., et al. Mistral 7B. arXiv. , (2023).
  15. Conover, M., et al. Free Dolly: Introducing the world's first truly open instruction-tuned LLM. , databricks.com/blog/2023/04/12/dolly-first-open-commercially-viable-instruction-tuned-llm (2023).
  16. Nadeem, M., Bethke, A., Reddy, S. StereoSet: Measuring stereotypical bias in pretrained language models. arXiv. , (2020).
  17. Breaking bias, building bridges: Evaluation and mitigation of social biases in LLMs via contact hypothesis. Raj, C., Mukherjee, A., Caliskan, A., Anastasopoulos, A., Zhu, Z. Proceedings of the Seventh AAAI/ACM Conference on AI, Ethics, and Society, 2024, 1180-1189 (2024).
  18. Abramski, K., Improta, R., Rossetti, G., Stella, M. The "LLM world of words" English free association norms generated by large language models. Sci Data. 12 (1), 1-16 (2025).
  19. Lhama Team, Meta AI. The Llama 3 herd of models. arXiv. , (2024).
  20. Claude Haiku 3.5. , Anthropic. At anthropic.com/claude/haiku (2025).
  21. De Deyne, S., Navarro, D. J., Perfors, A., Brysbaert, M., Storms, G. The "small world of words" English word association norms for over 12,000 cue words. Behav Res Methods. 51 (3), 987-1006 (2019).
  22. GenderAlign: An alignment dataset for mitigating gender bias in large language models. Zhang, T., et al. Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics, , (2025).
  23. Are models biased on text without gender-related language. Belém, C. G., Seshadri, P., Razeghi, Y., Singh, S. The Twelfth International Conference on Learning Representations (ICLR), , openreview.net/forum?id=w1JanwReU6 (2024).
  24. From showgirls to performers: Finetuning with gender-inclusive language for bias reduction in LLMs. Bartl, M., Leavy, S. Proceedings of the 5th Workshop on Gender Bias in Natural Language Processing (GeBNLP), 5, 280-294 (2024).
  25. Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., Sutskever, I. Language models are unsupervised multitask learners. OpenAI Blog. 1 (8), 9(2019).
  26. Li, Y., Bubeck, S., Eldan, R., Giorno, A. D., Gunasekar, S., Lee, Y. T. Textbooks are all you need II: Phi-1.5 technical report. arXiv. , (2023).
  27. Liu, Y., et al. A robustly optimized BERT pretraining approach. arXiv. , (2019).
  28. Raza, S., Garg, M., John, D., Raza, S., Ding, C. Nbias: A natural language processing framework for BIAS identification in text. Expert Syst Appl. 237 (PB), 121542(2024).
  29. Vicuna: An open-source chatbot impressing GPT-4 with 90%* ChatGPT quality. , Available from: lmsys.org/blog/2023-03-30-vicuna/ (2025).
  30. GenderCARE: A comprehensive framework for assessing and reducing gender bias in large language models. Tang, K., et al. CCS '24: Proceedings of the 2024 on ACM SIGSAC Conference on Computer and Communications Security, 2024, 1196-1210 (2024).
  31. BiasAlert: A plug-and-play tool for social bias detection in LLMs. Fan, Z., Chen, R., Xu, R., Liu, Z. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, 2024, 14778-14790 (2024).
  32. Social bias frames: Reasoning about social and power implications of language. Sap, M., Gabriel, S., Qin, L., Jurafsky, D., Smith, N. A., Choi, Y. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, 58, 5477-5490 (2020).
  33. Echterhoff, J., Liu, Y., Alessa, A., McAuley, J., He, Z. Cognitive bias in decision-making with LLMs. Findings of the Association for Computational Linguistics: EMNLP 2024. 2024, 12640-12653 (2024).
  34. Furniturewala, S., et al. Thinking fair and slow: On the efficacy of structured prompts for debiasing language models. arXiv. , (2024).
  35. Dong, X., Wang, Y., Yu, P. S., Caverlee, J. Disclosure and mitigation of gender bias in LLMs. arXiv. , (2024).
  36. Investigating bias in LLM-based bias detection: Disparities between LLMs and human perception. Lin, L., Wang, L., Guo, J., Wong, K. 31st International Conference on Computational Linguistics, 31, 10634-10649 (2025).
  37. OpenAI. GPT-4 technical report. arXiv. , (2023).
  38. Kamruzzaman, M., Kim, G. L. Prompting techniques for reducing social bias in LLMs through system 1 and system 2 cognitive processes. Proceedings of Recent Advances in Natural Language Processing. 2024, 511-520 (2024).
  39. Gemini Team. Gemini: A family of highly capable multimodal models. arxiv. , (2023).
  40. Hida, R., Kaneko, M., Okazaki, N. Social bias evaluation for large language models requires prompt variations. Find Assoc Comput Linguist: EMNLP 2025. , 14507-14530 (2025).
  41. Measuring and mitigating gender bias in contextualized word embeddings. Kamboj, P., Kumar, S., Goyal, V. Proc IEEE Int Conf Blockchain Distrib Syst Secur, , (2023).
  42. Raffel, C., et al. Exploring the limits of transfer learning with a unified text-to-text transformer. J Mach Learn Res. 21, 1-67 (2023).
  43. In-contextual gender bias suppression for large language models. Oba, D., Kaneko, M., Bollegala, D. EACL 2024 - 18th Conference of the European Chapter of the Association for Computational Linguistics, Findings of EACL 2024, 2024, 1722-1742 (2024).
  44. Mahajan, A., Obermeyer, Z., Daneshjou, R., Lester, J., Powell, D. Cognitive bias in clinical large language models. npj Digit Med. 8 (1), 1-4 (2025).
  45. Huang, D., Bu, Q., Zhang, J., Xie, X., Chen, J., Cui, H. Bias testing and mitigation in LLM-based code generation. ACM Trans Softw Eng Methodol. , (2025).
  46. Tjuatja, L., Chen, V., Wu, S. T., Talwalkar, A., Neubig, G. Do LLMs exhibit human-like response biases? A case study in survey design. arXiv. , (2024).
  47. Houlsby, N., et al. Parameter-efficient transfer learning for NLP. arXiv. , (2019).
  48. Dettmers, T., Pagnoni, A., Holtzman, A., Zettlemoyer, L. QLoRA: Efficient finetuning of quantized LLMs. arXiv. , (2023).
  49. Xiao, H., Xiang, Z., Wang, D., Devadas, S. A Theory to instruct differentially-private learning via clipping bias reduction. IEEE Symposium on Security and Privacy (SP). , (2023).
  50. Kamboj, P., Kumar, S., Goyal, V. Mitigating Social Bias in Generative AI: A comprehensive review. KSII Trans Internet Inf Syst. 19 (10), 3372-3394 (2025).

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

동영상 곧 제공

관련 논문