이 콘텐츠를 보려면 JoVE 구독이 필요합니다. 로그인하거나 오늘 무료 평가판을 시작하세요.

연구 논문

임상 인공지능 응용을 위한 대형 언어 모델의 공정성 향상, 미세 조정과 프롬프트

470 조회수

DOI:

10.3791/69132

2026년 1월 2일

이 논문에서

요약

의료 전용 대형 언어 모델은 다른 대형 언어 모델과 마찬가지로 학습 데이터에 내재된 편향을 반영하기 때문에 윤리적·기술적 도전에 직면해 있습니다. 여기서 제시된 프로토콜은 세 가지 오픈 소스 모델에서 프롬프트 변형을 사용하여 네 가지 유형의 편향(성별, 인종, 직업, 종교)을 억제하는 것을 검증합니다.

초록

대형 언어 모델(LLM)은 의료 서비스와 같은 민감한 분야에 점점 더 많이 적용되고 있으며, 이는 여러 기술적·윤리적 도전을 제기하고 있습니다. 가장 시급한 문제는 이러한 모델에 내재된 편향으로, 이는 사회적 편견을 반영할 수 있는 대규모 데이터셋을 기반으로 학습된 것입니다. 이러한 편향은 불공정하거나 일반화하기 어렵거나 심지어 해로운 결과를 낳아 임상 적용이 불가능하고 윤리적·규제적 제약을 준수하지 못하게 만듭니다. 우리는 성별, 인종, 직업, 종교 등 네 가지 중요한 범주에서 미세 조정된 모델을 유도했을 때 편향 억제가 얼마나 효과적인지 조사합니다. 우리는 다양한 추론 데이터셋을 수동으로 선별하고 12개의 프롬프트 변형을 생성하는데, 그중 6개는 편향이 제거되어 세 개의 오픈 소스 LLM: Llama2-7B, Mistral-7B, Dolly-7B의 출력을 테스트합니다. 결과물의 공정성과 해석 가능성은 편향 점수 지표를 사용하여 평가되며, 점수가 낮을수록 공정성과 해석 가능성이 더 우수함을 나타냅니다. 또한 편향 제거 프롬프트는 편향을 줄이고, 모델을 미세 조정하면 더 좋은 성능을 낸다는 점도 주목합니다. 결과는 의료 영상, 전자건강기록(EHR) 유지와 같은 실제 환경에서 신뢰할 수 있고 공정한 LLM 배포를 위한 시기적절한 조치, 모델의 견고성, 지속적인 윤리적 검토의 중요성을 강조합니다.

서론

대형 언어 모델은 의사결정 1,2, 텍스트 생성3, 텍스트 번역4, 고객 감정 분석5, 질문 답변6, 임상 보고서 생성7 등 다양한 작업을 지원하는 도구로서 엄청난 영향력을 가지고 있습니다. 최근에는 LLM을 사용해 사회적으로 불리한 개인이나 집단에 해를 끼치는 콘텐츠를 생성하는 애플리케이션이 여러 차례 발생했습니다. 이러한 진부한 답변의 주된 이유는 이 모델들이 인종, 성별, 사회경제적 계층 등과 관련된 사회적 편향을 본질적으로 포함하는 데이터셋을 기반으로 학습되었기 때문입니다. 하지만 의료 AI 시스템에서 말하는 '편견'과 '공정성'은 주관적이고 상황에 따라 달라질 수 있습니다. 연구자들은 LLMs의 사회적 편향을 완화하기 위해 상당한 노력을 기울였....

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

모든 실험은 Google Colab 플랫폼(A100, 40GB RAM)에서 진행됩니다. 실험 수행을 위해 Llama2-7B, Mistral-7B, Dolly-7B의 API 키(모델 카드)를 Hugging Face에서 수집했습니다.

이 프로토콜은 세 부분으로 나뉩니다. 먼저, LLM에서 사회적 편향을 평가하는 데 기반이 되는 데이터셋을 구축하세요. 그 후 Kamruzzaman과 Kim38 이 LLM에서 발생하는 추론에서 사회적 편향의 존재를 조사하기 위해 수행한 연구와 일치하는 12개의 서로 다른 프롬프트 변형을 설계한다. 그 다음, 인종, 종교, 성별, 직업과 관련된 편향되지 않은 문장 데이터셋에서 LLM을 미세 조정하고, 같은 프롬프트로 다시 탐색하여 미세 조정이 생성된 추론에 미치는 영향을 조사합니다. 제안된 프레임워크는 그림 2에 나와 있습니다.

데이터셋 큐레이션
이 프레임워크는 두 개의 데이터셋을 사용합니다. 하나는 추론을 도출하는 데 사용되고, 다른 하나는 LLM을 미세 조정하는 데 사용됩니다.....

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

방정식 1에서 정의된 편향 점수를 사용하여 연구 질문에 체계적으로 답하고 LLM의 사회적 편향을 네 가지 사회적 차원에서 평가합니다. 관찰된 통계적으로 유의미한 편향 점수 감소는 고위험 과제에서 LLM에서 편향 감소를 위한 제안된 프로토콜의 실증적 검증을 제공합니다. NeutralSet, 즉 큐레이션 추론 데이터셋의 효과를 평가하기 위해, StereoSet과 NeutralSet 모두에서 기본 표준 프롬프트를 통해 세 개의 기본 LLM 모두를 쿼리하고 평균 편향 점수를 계산했습니다. 그림 3에서 보듯이, NeutralSet의 편향 점수가 StereoSet에 비해 7.8포인트 감소한 것을 관찰했습니다. 연구 질문의 두 번째 부분에 답하기 위해, 우리는 다시 세 개의 기본 LLM 모두를 6가지 기본 프롬프트 기법으로 쿼리하고 그림 4에 표시된 평균 편향 점수를 계산합니.......

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

이 연구에서는 Llama2-7B13, Mistral-7B14, Dolly-7B15를 활용한 LLM의 사회적 편향을 줄이기 위한 확장 가능한 프로토콜을 제시합니다. 이 접근법은 HP2 프롬프트 엔지니어링, 편향 제거 프롬프트 수정, 그리고 목표 미세 조정을 결합하여 성별, 인종, 직업, 종교라는 네 가지 주요 사회 차원에서 LLM이 생성한 출력물의 편향을 지속적으로 줄이기 위한 프로토콜을 개발합니다. 기본 프롬프트와 편향 제거 프롬프트를 가진 바닐라 모델을 평가할 때, 많은 편향 제거 프롬프트 방법이 기본 프롬프트보다 훨씬 우수하다는 것을 관찰했습니다. 표 6에서 보듯, HP2+Debias가 가장 유의미한 개선을 보였으며(평균 차이 = 8.13, p = 0.001), 그 다음으로 System2+Debias(평균 차.......

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

저자들은 공개할 것이 없습니다.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
구글 콜랩구글https://colab.research.google.com/실험 수행에 사용됨;
멘델리 데스크톱멘델리https://www.mendeley.com/인용 및 참고문헌 관리를 위해 사용됩니다.

참고문헌

  1. STRUX: An LLM for decision-making with structured explanations. Lu, Y., Hu, Y., Foroosh, H., Jin, W., Liu, F. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  2. Eigner, E., Händler, T. Determinants of LLM-assisted decision-making. arXiv. , (2024).
  3. Wu, Y. Large Language Model and Text Generation.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

태그

동영상 곧 제공