우리는 Enti 환각 지수(EHI)를 보상 신호로 사용하여 텍스트 요약에서 개체 수준의 환각을 줄이고자 하는 강화 학습 기반의 미세 조정 방식을 제안합니다. 회의 기록에 대한 실험은 이 방법이 엔터티의 충실성과 정확성을 향상시키는 것으로 나타났습니다.
Research Article
우리는 Enti 환각 지수(EHI)를 보상 신호로 사용하여 텍스트 요약에서 개체 수준의 환각을 줄이고자 하는 강화 학습 기반의 미세 조정 방식을 제안합니다. 회의 기록에 대한 실험은 이 방법이 엔터티의 충실성과 정확성을 향상시키는 것으로 나타났습니다.
최근 대형 언어 모델(LLM)의 발전은 추상화 요약의 품질이 눈에 띄게 향상되었습니다. 하지만 환각, 특히 존재하지 않거나 잘못된 존재가 등장하는 존재 수준 환각은 여전히 중요한 도전 과제로 남아 있습니다. 본 연구에서는 엔터티 환각 지수(EHI)를 기준 지표로 사용하여 요약 모델에 대한 보상 중심 미세 조정 프레임워크를 제안합니다. 이 방법론은 Flan-T5, DistilBART, Mistral(또는 다른 인기 LLM)과 같은 사전 학습 모델에서 구조화된 전사 데이터셋인 XSUM에서 초기 요약을 생성하는 것부터 시작합니다. 우리는 생성된 요약과 골드 참조 모두에서 이름 있는 엔티티를 추출하고, 정밀도를 평가하며, 조작된 엔터티에 페널티를 적용하여 EHI를 계산합니다. 미세 조정 과정은 강화 학습에 의해 안내되며, EHI는 보상 신호 역할을 합니다. 우리는 요약 모델을 최적화하기 위해 REINFORCE 스타일의 업데이트 메커니즘을 채택하여 엔터티 충실성을 극대화합니다. 실험 결과 EHI로 미세 조정된 모델이 정보 제공을 해치지 않으면서도 환각률을 낮출 수 있음이 입증되었습니다. 더 나아가, EHI 유도 모델이 도메인 외 요약 작업에서 더 잘 일반화되어 견고성이 향상되었음을 시사합니다. 이 접근법은 요약에서 사실성을 향상시키기 위한 실질적인 방향을 제시하며, 정확한 엔터티 표현의 중요한 역할을 강조합니다.
대형 언어 모델(LLM)을 기반으로 한 추상화 요약 모델은 다양한 분야에서 인상적인 성과를 거두었습니다. 그러나 지속적인 도전 과제는 환각으로, 생성된 요약에 출처 입력과 근거가 없는 부정확하거나 조작된 정보가 포함되어 있는 경우입니다 1,2. 회의 요약, 의료 보고, 재무 문서와 같은 고위험 응용 분야에서는 특히 명명된 주체와 관련된 환각이 신뢰성과 효용성을 크게 훼손할 수 있습니다.
R연구자들은 대규모 인간 평가를 실시한 결과, 요약자들이 자주 환각을 발생시키며, 이는 출처 문서에 근거하지 않는 내용이며, 이러한 환각이 반복과 일관성 상관성과 연관이 있음을 발견했다. 또 다른 연구에서는 추상성이 높은 모델이 덜 충실한 경향이 있음을 보여주었으며; 그들의 연구는 추상화가 더 많은 결과물이 사실 정확성이 낮고 문장에 더 부적절한 경우가 많다고 보고했다2. FRANK 벤치마크는 약 30%의 요약이 사실과 모순되는 부분을 포함한다고 보고했으며, 또 다른 인기 연구에서는 유사한 오류율이 나타나 높은 환각 수준이 요약을 사실상 무의미하게 만든다고 주장했습니다 1,2. 환각은 내재적(출처와 모순되는 것)과 외재(출처에서 검증할 수 없는 환각)로 분류할 수 있습니다. 추상적 요약에서 환각에 관한 튜토리얼에서는 내재적 환각은 생성된 콘텐츠가 입력과 모순될 때 발생하며(예: 승인된 백신이 거부되었다고 잘못 보고하는 경우), 외재적 환각은 언급되지 않은 백신의 임상 시험을 주장하는 등 검증 불가능한 사실을 추가한다고 설명합니다. 또한 최첨단 요약기가 ROUGE, BLEU, METEOR와 함께 평가했을 때 약 25%의 결과물에서 환각 콘텐츠를 생성한다고 보고했으며, 환각이 건강, 법률, 사이버 보안 등 분야에서 해로울 수 있음을 경고합니다.
전통적인 n-그램 지표(ROUGE5, BLEU, METEOR)는 인간의 사실성 판단과 상관관계가 떨어져 참조 기반 및 무참조 지표의 개발을 촉진했습니다6. FEQA와 QuestEval과 같은 QA 기반 지표는 요약에서 도출된 질문-답변 쌍이 원본 텍스트를 사용해 답변할 수 있는지 여부를 평가합니다. FEQA는 인간의 판단과 더 강한 상관관계를 보이며, 더 추상적인 요약은 덜 충실한 경향이 있는 반면, QuestEval은 일관성, 일관성, 유창성, 관련성 측면에서 인간 판단과의 상관관계를 크게 향상시킵니다. QAFactEval은 명사구의 답변을 선택하고 질문을 생성하여 답변 전에 질문을 생성함으로써 이 접근법을 다듬습니다; 이 전략은 SummaC 벤치마크에서 인간 평가와의 상관관계를 향상시킵니다. 정보 추출(IE) 메트릭은 지식을 주어-관계-목적어 튜플로 나타내지만, 추출 과정에서 오류에 취약합니다. FactCC와 SummaC와 같은 자연어 추론(NLI) 지표는 요약 문장을 출처에 의해 내반되거나 모순되는 것으로 분류합니다. FactCC는 약한 감독 데이터를 사용하여 사실 일관성을 감지하고 일관성 없는 구간을 강조하는 분류기를 학습합니다2. SummaC는 적절한 세분화로 NLI 모델을 적용하여 강력한 사실성 추정치를 제공하지만, FRANK 벤치마크는 이러한 지표들이 여전히 사실성을 이분법으로 취급하며 통합 프레임워크 1,7,8이 없다고 지적합니다. 연구자들이 제안한 인간 평가 차원인 유창성, 일관성, 관련성 및 일관성은널리 채택되었습니다. 9. 또 다른 평가 연구는 일관성이 가장 객관적인 차원임을 강조하는데, 이는 요약이 출처에 의해 내포되었는지 여부를 단순히 확인하는 것이기 때문이다; 최대 92%의 XSum 요약에 충실성 오류가 포함되어 있음을 지적합니다 9,10. 하지만 인간 평가는 시간과 비용이 많이 들기 때문에, 확장가능한 평가를 위해서는 자동 지표가 필수적입니다. 현재 지표는 내재적 환각과 외적 환각을 하나의 점수로 집계하여 오류 진단에 방해가됩니다.
최대우도 훈련이 요약 품질을 직접 최적화하지 않기 때문에, 관련성과 사실성을 높이기 위해 강화 학습(RL)이 적용되었습니다. Pasunuru와 Bansal은 주목성(ROUGE)과 함의 보상을 결합한 다중 보상 강화학습(RL) 프레임워크를 도입하고최첨단 성능을 입증했습니다. RL은 REINFORCE 알고리즘을 이용한 추출적 요약에 적용되었으며; 이 모델들은 ROUGE 점수를 극대화하며, 분류기 기반 접근법보다 더 유익한 요약을 제공합니다. 이는 인간 질문 응답 평가에서 나타났습니다. 멀티태스킹 모델은 질문 생성과 내포 생성을 추가로 포함하여 커버리지와 일관성을 보장합니다. 2024년 추상 요약에 관한 종합 설문조사는 사실의 일관성을 근본적인 도전 과제로 강조하며, 진실된 요약을 장려하기 위해 강화학습(RL)을 권장합니다. 설문조사는 사실에 근거한 요약을 보상하고 외부 지식 출처 및 속성 통제를 통합하여 정확성을 높일 것을 제안합니다13. 인간 피드백(RLHF)을 통한 강화학습(RLHF)은 인간의 선호에 기반한 보상 모델을 훈련시키고, 학습된 보상을 극대화하기 위해 요약기를 미세 조정함으로써 이 아이디어를 확장합니다.9. 인간 피드백을 통한 강화 학습(RLHF)은 모델 출력을 사실성, 도움성 등 원하는 특성과 일치시키는 데 큰 주목을 받고 있습니다 4,14. 다중 보상 강화 및 재생 후보(RLHF)는 인간의 충실도 개념과 모델을 일치시키지만, ROUGE나 이진 사실성 같은 거친 지표에 의존합니다. 반면, 여기서 자세히 설명한 연구는 미세한 개체 수준 환각 지수를 보상으로 사용하는 것을 제안하는데, 이는 경험적이고 인간의 피드백 없이도 계산 비용이 적게 듭니다.
수많은 지표에도 불구하고 여러 한계점이 여전히 존재합니다. N-그램 메트릭은 의미론적 정확성을 무시하고, QA 기반 및 IE 기반 메트릭은 질문 생성 및 추출 모델에서 오류를 전파시키며, NLI 메트릭은 사실성을 이진 내포 결정(1,4,6)으로 줄입니다. 연구에서는 기존의 모델 기반 지표가 문장이나 문서 수준에서 작동하여 오류를 일으키는 특정 개체를 분리하지 못해 환각을 세밀하게 식별하는 데 어려움을 겪는다는 점이 강조되었습니다. 인간 평가는 여전히 골드 스탠다드이지만 비용이 많이 들고 주관적입니다15. 더욱이 기존 지표들은 내재적 환각과 외적 환각을 구분하지 못하며, 관계의 과잉 초점과 과잉 초점을 포착하지 못한다. 대형 언어 모델은 사실 검증이 아닌 통계적 가능성에 기반해 텍스트를 예측하기 때문에 환각을 일으킬 수 있습니다. 모델은 학습 데이터의 한계, 확률적 생성, 사실 확인 부족, 과도한 자신감과 편향으로 인해 자신감 있으나 잘못된 결과를 생성하며, 높은 확률로 거짓 정보를 진술할 수 있습니다; 가이드는 외부 데이터에서 기지 모델에 대한 회상 증강 생성과 장기 기억을 권장합니다15. 하지만 이러한 기법들은 검색 기반 작업에 중점을 둡니다; 요약은 여전히 환각에 빠진 존재를 식별하고 처벌하는 지표를 필요로 합니다. 이전 연구들은 사실성을 위한 기업 수준 평가의 중요성을 인식했습니다. FEQA와 QuestEval과 같은 지표는 질문 답변 기법을 사용해 사실의 일관성을 평가하려고 시도합니다16,17. 하지만 이러한 방법들은 종종 참고 요약이나 외부 QA 시스템이 필요하여 확장성이 제한됩니다. 우리의 연구는 이 흐름을 바탕으로 Entity Hallucination Index(EHI)라는 가벼운 실증 지표를 사용하여 이름 붙여진 개체의 충실성도를 다섯 가지 환각 요인 유형으로 분류함으로써 이를 기반으로 합니다.
증거는 환각이 만연하며, 평가 지표가 완벽하지 않고, 강화학습 기법에는 세밀한 보상이 부족하다는 것을 보여줍니다. 인간 연구에 따르면 요약 모델은 상당수의 경우에 환각을 경험하며, 종종 개체를 바꾸거나 세부 정보를 조작하는 경우가 많습니다. 기존 지표들은 n그램 중복을 강조하거나 사실성을 이분법으로 취급하며, 현재의 강화학습 기법은 ROUGE 또는 거친 사실성 신호를 최적화합니다. 요약에서 출처에 없는 개체를 언급하는 경우(부정적 환각), 주요 개체를 누락하는 경우(집중력 상실 환각) 등 다양한 상황을 측정하는 엔터티 수준의 지표에는 공백이 있습니다. 제안된 엔터티 환각 지수(EHI)에 대한 미세 조정 방법은 엔터티 수준에서 환각을 정량화하고 강화 학습에 대한 구조화된 보상을 제공함으로써 이 공백을 메운다. EHI를 RLHF에 통합함으로써, 우리는 대규모 언어 모델을 미세 조정하여 엔터티 수준의 환각을 최소화하고, 유창하면서도 사실에 충실한 요약을 만드는 것을 목표로 합니다.
본 연구에서는 엔터티 환각 지수(EHI)를 보상 신호로 활용하여 개체 차원에서 환각을 줄이는 새로운 미세 조정 방식을 제안합니다. EHI는 모델 출력에서 추출한 엔터티와 입력 문서에 포함된 엔터티를 비교하여 엔터티의 정확성과 기반성을 정량화하여, 참조18에 대한 의존도를 줄입니다. 여기서 설명한 방법은 인간의 사실성 주석 없이 더 실체에 충실한 요약을 생성하도록 모델에 편향시킵니다.
요약하자면, 사실성 인식 보상 모델은 미세 조정에 사용되었습니다19,20. 이전 접근법이 거친 사실성 보상이나 인간 라벨링 데이터셋에 의존하는 것과 달리, 우리는 EHI를 직접적이고 자동적인 보상 신호로 활용한 미세 조정을 제안하여, 추가 감독 없이 엔터티 기반의 요약을 촉진할 수 있습니다. 이 연구의 새로운 기여는 다음과 같습니다: (i) 추상적 요약에서 엔터티 충실성을 향상시키는 EHI 유도 미세 조정 프레임워크를 도입하고, (ii) 인간이 지정한 사실성 데이터셋에 의존하지 않는 확장 가능한 강화 학습 파이프라인을 제시하며, (iii) 회의 기록 데이터셋, XSUM 뉴스 데이터셋 전반에 걸쳐 EHI 점수의 실증적 향상을 입증하고 환각 감소를 강조하기 위한 질적 분석을 수행함, (iv) 이 연구는 환각 인식 요약에 대한 추가 연구를 촉진하기 위해 재현 가능한 Colab 기반 구현을 공유합니다21.
본 연구는 EHI와 같은 세분화된 엔터티 중심 보상을 통해 언어 모델을 최적화하는 것이 최소한의 계산으로 요약 작업에서 충실성과 신뢰성을 향상시키는 효과적인 경로를 제공한다는 가설을 평가합니다. 이 접근법은 요약의 충실성을 위한 매개변수 효율적인 미세 조정 분야가 성장하는 데 기여합니다: (i) 인코더-디코더(DistilBART, FlanT5)와 디코더 단독(Mistral) 아키텍처 모두에서 효과성을 입증하고, (ii) 다양한 모델 유형, 도메인, 스케일에 적응할 수 있는 프레임워크를 제공하며, (iii) 완전한 재학습에 비해 계산 효율성을 제공합니다.
Access restricted. Please log in or start a trial to view this content.
본 연구의 목적은 언어 모델(LM)을 미세 조정하여 엔터티 환각을 줄인 요약을 생성하는 것입니다. 환각은 모델이 사실 검증이 아닌 통계적 가능도에 따라 텍스트를 생성하기 때문에 "자신 있게 부정확하거나 관련 없는 출력을 내놓는" 경우에 발생합니다. 이는 엔터티 환각 지수(EHI)를 기반으로 한 보상 함수를 설계하고 이를 극대화하기 위해 강화 학습을 적용함으로써 달성됩니다.
문제 구성
입력 문서X i가 주어지면, 목표는 요약 Yi 를 생성하여 Yi 에 언급된 엔터티가 Xi에 근거하게 하는 것입니다. 전통적인 최대우도 훈련은 사실의 일관성을 명시적으로 최적화하지 않습니다. 이러한 교육 방법은 조작된 개체의 포함을 처벌하지 않습니다. 따라서 보상이 엔터티 충실도에 비례하는 보상 기반 미세 조정 전략이 도입되며, 이는 EHI를 사용해 측정됩니다.
데이터 세트와 방법
두 가지 말뭉치가 사용된다: 첫째는 다중 턴 회의 기록과 추상화된 골드 요약을 담은 대화 전사 데이터셋이고, 둘째는 XSUM 뉴스 요약 벤치마크22,23이다. 각 데이터셋은 정제, 평탄화, 80% 학습, 10% 검증, 10% 테스트 파티션으로 나뉘었습니다. 대화는 비공식적인 언어와 대명사가 풍부한 반면, XSUM은 간결한 뉴스 기사를 담고 있습니다; 이 조합은 도메인 내와 도메인 외 일반화 모두를 평가할 수 있게 합니다.
엔터티 추출은 엔터티 환각 지수(EHI)를 계산하기 위해 소스 문서와 요약 모두에서 수행됩니다. 미세 조정 과정에서는 이 연구가 훈련 분할만을 활용하고, 검증 EHI 점수를 모니터링하여 최적의 체크포인트를 선정합니다. 최종 평가는 모델 미세 조정 전후로 제로 샷 상태로 유지되는 보류 테스트 세트에 대해 보고됩니다.
요약하자면, 첫째로 성적표는 평면화된 형식으로 정리되어 데이터를 분할합니다. 사전 학습된 모델은 기준선 요약을 생성합니다. 둘째, EHI는 트랜스포머 기반 NER과 다섯 가지 환각 인자를 사용하여 계산됩니다. 미세 조정 과정에서 모델은 LoRa 어댑터를 통해 EHI 보상으로 업데이트됩니다. 마지막으로, 미세 조정된 모델을 사용하여 요약을 생성하고 EHI, 엔터티 F1 및 기타 지표를 사용하여 평가합니다(그림 2). 모든 실험은 제공된 코드와 설정 파일을 통해 재현 가능합니다. 그림 3 은 데이터셋 준비, 기준선 요약, EHI 계산, 미세 조정 및 평가를 위한 단계별 프로세스 흐름을 보여줍니다.
기초 요약
세 개의 사전 학습된 LLM이 선택되어 기본 요약을 캡처합니다: Flan-T5, Mistral (Nous-Hermes-2-Mistral-7B-DPO), 그리고 DistilBART24, 25, 26. 각 모델은 제로 샷 모드로 실행되어 각 입력 문서(xi)에 대해 초기 요약(Yi)을 생성했습니다. 빔 폭 4, 길이 페널티 1.0의 빔 탐색이 유창하면서도 간결한 요약을 장려하는 데 사용되었습니다. 이 기초 요약은 환각 유병률을 추정하고 미세 조정의 출발점을 제공했습니다.
엔터티 추출과 EHI 계산
Entity Hallucination Index(EHI)를 정확히 계산하려면 강력한 NER이 필요합니다. 초기에는 스페이시가 NER 작전에 사용되었습니다. 트랜스포머 기반 NER 모델이 더 정확하다는 것은 알려져 있지만, 스페이시가 최초 선택된 이유는 다음과 같습니다: (1) 트랜스포머 기반 NER 모델 자체가 스페이시보다 환각을 일으키는 것으로 입증되었습니다. (2) 스페이스가 통계적이라는 점은 구현 비용과 실행 시간 측면에서 계산 효율성을 가져옵니다. (3) 또한 EHI가 약한 NER 모델에서도 환각을 줄이는 데 견고함을 입증하는 데 도움을 줍니다. 하지만 실험이 이미 확립된 데이터셋에서 이루어졌고, spaCy의 en_core_web_sm 모델은 구어체 전사본에 대해 취약하기 어렵다는 점을 고려할 때,13. Spacy는 CoNLL-2003 데이터셋에서 미세 조정된 트랜스포머 기반 NER 모델(dslim/bert-base-NER)으로 대체되었습니다. BERT 기반 NER 시스템은 도메인별 작업에서 spaCy 모델보다 우수한 성능을 보인 것으로 나타났습니다. 예를 들어, 항공-BERT-NER 모델은 17개의 엔티티를 식별할 때 94.78%의 F1을 기록한 반면, spaCy NER은 7개의 엔티티27을 인식한 93.73%를 기록했습니다. BERT NER 모델은 Hugging Face Transformers28 을 통해 구성되었으며, 대소문자 비구별 매칭을 수행했습니다. 대명사와 표면형 변형을 포착하기 위해 이 방법은 추가로 "Mr. Smith"와 "Smith"를 동일한 정형형으로 대응시키는 간단한 규칙을 적용했다; 하지만 완전한 공관참조 해상도는 앞으로 진행될 예정입니다. XSUM 데이터셋에서 200개 레코드 샘플에 대한 NER 모델의 비교 분석은 표 1에서 추론할 수 있습니다.
엔터티 환각 지수(EHI)는 다음과 같이 계산됩니다:

여기서 PH, EF, OF, NH, LF는 각각 1조에서 양성 환각(PH), 추출 인수(EF), 부정적 환각(NH), 과집중 개체(OF), 집중력 상실(LF)에 해당하는 점수를 나타냅니다.
환각 요인의 세부 사항:
긍정적 환각(PH): 사실에 근거하고 유익한 신규 기관의 측정 지표들.
추출 계수(EF): 입력 문서에서 요약으로 정확히 추출한 엔티티를 측정합니다.
부정적 환각(NH): 입력에 근거하지 않거나 잘못되었거나 환각에 빠진 존재들을 포착합니다.
과잉 집중(OF): 좁은 개체 집합에 지나치게 집중하는 요약은 다양성을 놓치는 데 페널티를 줍니다.
집중력 상실 (LF): 입력에 중요한 요소들이 빠진 요약은 벌점을 줍니다.
위 인자들의 계산은 그림 4 에 자세히 설명되어 있으며, 예시를 위한 샘플 계산도 포함되어 있습니다. 입력 문서 엔터티 (I)의 예를 고려하면, "John"," AI"," conference" 참조 요약 엔터티 (R):" John"," AI" 생성된 요약 엔터티 (G):" John"," AI",technology". EHI 값이 높을수록 더 높은 엔티티 충실성을 나타내며, 추출적이거나 긍정적으로 환각적인 요약(유용하지만 충실한 엔티티를 도입)하는 것은 보상하고, 근거가 없거나 과도하거나 누락된 엔티티20은 벌점합니다. 이 요인들은 검출된 엔터티의 총 수에 따라 정규화되어 0에서 1 사이의 EHI 점수를 산출했습니다. 교육 과정에서 EHI 검증을 모니터링하여 최적의 체크포인트를 선정했습니다. PH와 EF는 유익한 새로운 개체와 올바른 추출을 보상하는 반면, OF, NH, LF는 반복, 조작, 누락을 벌합니다. 만점 1.0은 요약 내 모든 존재가 현실적이거나 유익한 환각을 경험했음을 의미하며, 0점은 요약 내 이름이 명명된 대상이 출처에 나타나지 않음을 의미합니다.
RL을 이용한 미세 조정 절차
미세 조정을 위한 상세한 하이퍼파라미터 구성은 각각 Mistral-7B, DistilBart, Flan-T5의 옵티마이저 유형, 학습률, 배치 크기, 하드웨어 사양 및 기타 구성 세부사항을 나타내는 표 2, 표 3, 표 4에 별도로 제공되어 있습니다. 여기서 목표는 생성된 요약에서 기대되는 엔터티 환각 지수(EHI) 보상을 최대화하여 모델 매개변수 θ 를 미세 조정하는 것입니다. 형식적으로, 입력 문서X i, 생성된 요약 Yi, 그리고 모델 매개변수 θ 에 대해 기대 보상 목표는 다음과 같이 정의됩니다:
(2)
여기서 EHI (y, x)는 생성된 요약Y i 와 입력 Xi 사이에서 계산된 엔터티 환각 지수를 나타냅니다.
REINFORCE 알고리즘25에 따라 이 목표물의 기울기는 다음과 같이 추정됩니다:
(3)
실제로는 모델에서 요약을 샘플링하고, 이에 대응하는 EHI 점수를 계산했으며, 정책 구배 업데이트를 적용해 보상 증가를 유도했습니다. 매개변수 효율적인 미세 조정을 가능하게 하기 위해 본 연구는 저랭크 적응(LoRA)을 사용했습니다. 기본 모델 무게는 고정된 상태였고, LoRA 어댑터만 업데이트되었습니다. 미세 조정은 A100 GPU에서 학습률이 작은(예: 5 × 10-6), 배치 크기 4, 8단계에 걸친 경배 누적을 Adam optimizer29로 수행했습니다. 요약은 500회 업데이트마다 재생성되어 보상 추정치를 갱신했으며, 검증 EHI가 수렴할 때까지 교육이 계속되었습니다. REINFORCE 기준선은 분산을 줄이기 위해 최근 보상의 평균 기준으로 설정되었습니다. EHI, EntityF1 2, ROUGE-1/2/L 점수 외에도 전반적인 품질을 모니터링하기 위해 기록되었습니다. 요약은 미세 조정 과정에서 모델 개선을 반영하기 위해 주기적으로 재생성됩니다.
평가 지표
출력물은 Rouge-1, Rouge-25와 같은 정보성 지표를 사용하여 평가되었습니다. 루즈 LCS5 같은 유창성 지표. 엔터티 오버랩 지표인 엔티티 F1과 환각 지표인 EHI, FactCC, QAGS2, 6, 18, 30. FactCC는 합성 모순 데이터를 기반으로 학습된 분류기를 사용하여 문장을 출처에 의해 내반되거나 모순되는 문장으로 라벨링합니다. factCC는 두 가지 점수를 줍니다; 점수는 라벨이 유효한 경우 기록되었습니다. 반면, QAGS는 LLM에서 실행되는 질문-답변 방식을 사용합니다. 라이트 모델 T5 스몰이 텍스트31에 대한 질문 생성에 사용되었습니다. Roberta_base_Squad2 출력 텍스트32에 대한 답변 생성에 사용되었습니다. 이 모델들은 실행을 위한 편리한 계산 비용 때문에 선택되었습니다.
Access restricted. Please log in or start a trial to view this content.
여기서의 실험들은 EHI 유도 미세 조정이 여러 모델 아키텍처와 데이터셋에서 엔터티 수준의 환각을 줄이는 데 미치는 정량적 증거에 초점을 맞추고 있습니다. 결과는 사실의 일관성을 유지하고 질문 답변 능력을 유지하면서 환각 지표의 지속적인 개선을 보여줍니다.
데이터셋 성능
대화 데이터셋 성능:
표 5는 다중 대화 데이터셋에서 환각 감소 결과를 제시합니다. EHI 유도 미세 조정은 Mistral과 DistilBART 모델 모두에서 상당한 개선을 이루었습니다:
Mistral은 EHI 점수에서 0.346에서 0.546으로 57.8%의 상대적 개선을 보였고, DistilBART는 0.317에서 0.512로 61.5%의 상대적 향상을 보였습니다. 두 모델 모두 일관된 사실 일관...
Access restricted. Please log in or start a trial to view this content.
QA 기반 지표(예: FEQA/QuestEval/QAFactEval)와 NLI 기반 지표(예: FactCC/SummaC)는 보조 QA/함의 구성 요소를 요구하며 종종 문장 수준의 판단을 제공합니다. 반면, EHI는 가볍고 참조가 없는 개체 수준 점수로, (i) 우리가 관찰하는 주요 실패 모드인 개체 환각을 직접 표적으로 합니다; (ii) 모델은 구애받지 않고 계산이 빠르다; (iii) RL 미세 조정에 대한 밀집된 보상 역할을 합니다. 경험적으로 EHI는 사실성 오류를 유발하는 주체를 정확히 찾아내어 QA/NLI 지표를 보완하여, 무거운 QA나 함의 파이프라인을 추가하지 않고도 목표 지향적인 개선을 가능하게 합니다.
강화 학습 프레임워크는 엔터티 환각 지수(EHI)를 조밀한 보상 신호로 사용하여 개체 충실도를 직접 최적화합니다18. 이 지표는 생성된 요약에서 이름이 붙은 개체의...
Access restricted. Please log in or start a trial to view this content.
저자들은 공개할 것이 없습니다.
```html
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| Colab NVIDIA A100 GPU | NVIDIA | N/A | Google Colaboratory Pro |
| DistilBART (Encoder–Decoder) | Hugging Face | https://huggingface.co/sshleifer/distilbart-cnn-12-6 | |
| dslim/bert-base-NER | Hugging Face (dslim) | https://huggingface.co/dslim/bert-base-NER | 영어 NER에 미세 조정된 BERT 기본 |
| Evaluation Models QAGS (QA-based) | Salesforce Research | N/A | 사실 분류기 |
| Evaluation Models (Factuality) FactCC | Google Research | N/A | 사실 분류기 |
| Flan-T5 (Encoder–Decoder) | https://huggingface.co/docs/transformers/main/en/model_doc/flan-t5 | 오픈 소스, 텍스트-텍스트, 대규모 언어 모델 | |
| Hugging Face Transformers | Hugging Face, Inc. | https://huggingface.co/docs/transformers/index | 모델 로딩 & 미세 조정 |
| Nous-Hermes-2-Mistral-7B-DPO | Mistral | https://huggingface.co/NousResearch/Nous-Hermes-2-Mistral-7B-DPO | 70억 파라미터 언어 모델 |
| Programming Language Python 3.10 (Colab runtime) | Python Software Foundation | 버전 3.10 | 코어 구현 |
| Streamlit | 오픈 소스 | https://streamlit.io/ | 사실 분류기 |
| XLSUM 데이터셋 | BUET | https://github.com/csebuetnlp/xl-sum | |
| XSUM 데이터셋 | 에딘버러 대학교 | https://github.com/EdinburghNLP/XSum |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission