연구 논문

대규모 언어 모델의 저지연 환각 감소를 위한 통계적 결정 모델링 기반 적응형 NLI 주도 주장 검증

0 조회수

DOI:

10.3791/72636

2026년 9월 3일

이 논문에서

요약

본 연구는 주장 수준의 검증과 적응형 통계 임계값 설정을 통해 대규모 언어 모델의 환각 현상을 줄이는 경량 프레임워크를 제시합니다. 자연어 추론(Natural Language Inference)을 사용하여 근거가 없는 주장을 선택적으로 수정함으로써, 본 접근 방식은 낮은 응답 지연 시간과 실질적인 배포 효율성을 유지하는 동시에 사실적 정확도를 향상시킵니다.

초록

대규모 언어 모델(LLM)은 사실 관계는 틀렸으나 언어적으로는 유창한 출력을 생성하는 결정적인 경향, 즉 환각(hallucination)이라 불리는 현상을 보이며, 이는 정밀도가 중요한 응용 분야에서 심각한 위험을 초래합니다. 검색 증강 생성(RAG) 및 자기 일관성 샘플링(self-consistency sampling)을 포함한 기존의 완화 전략들은 상당한 추론 지연 시간을 유발하거나 외부 지식 인프라에 의존하므로, 실시간 배포 시 적용 가능성이 제한적입니다. 본 논문은 LLM의 응답을 원자적 사실 주장(atomic factual claims)으로 분해하고, 격리된 사실 회상 프롬프트를 통해 생성된 별도의 참조 문헌과 추출된 각 주장을 독립적으로 검증하는 경량 2단계 주장 검증 프레임워크를 제안합니다. 생성기와 검증기가 동일한 기본 언어 모델을 공유함에도 불구하고, 응답 생성과 사실 회상을 분리함으로써 응답에 대한 직접적인 조건화를 줄이고 자연어 추론(Natural Language Inference, NLI) 과정에서의 확증 편향을 완화하며, NLI 신뢰도 점수 분포에 대해 τ = µ + kσ로 정의되는 적응형 통계 임계값을 적용하여 모순된 주장만을 선택적으로 수정합니다. 고정된 결정 경계에 의존하는 기존의 NLI 기반 방식과 달리, 제안된 프레임워크는 각 응답의 신뢰도 분포에 따라 검증 임계값을 동적으로 조정하며, 모델 재학습 없이도 평가된 벤치마크 전반에서 일관된 성능을 보여줍니다. TruthfulQA와 FEVER에서 평가한 결과, 이 프레임워크는 TruthfulQA의 환각률을 28%에서 9%로 낮추어 67.9%의 상대적 감소를 달성했으며, 기본 LLM 대비 추가 지연 시간은 160 ms에 불과했고 환각 탐지 정확도 면에서 SelfCheckGPT와 FActScore보다 우수한 성능을 보였습니다. 이러한 결과는 본 프레임워크가 평가된 벤치마크에서 사실적 신뢰성과 응답 지연 시간 사이의 유리한 균형을 제공할 수 있음을 나타내며, 향후 다양한 도메인 및 배포 환경에 걸친 추가 검증이 필요합니다.

서론

대규모 언어 모델(LLM)은 현대 인공지능 시스템의 핵심 구성 요소로 부상하며 텍스트 생성, 질의응답, 요약 및 복잡한 추론을 포함한 광범위한 자연어 처리 작업 전반에서 탁월한 능력을 입증해 왔습니다1. 유창하고 문맥적으로 일관된 응답을 생성하는 능력 덕분에 임상 의사결정 지원, 법률 분석, 소프트웨어 공학 및 교육 기술과 같이 영향력이 큰 분야에서 도입이 가속화되었습니다2. 그러나 이러한 환경에서 신뢰성을 저해하는 심각하고 지속적인 한계점이 있는데, 바로 모델이 언어적으로는 유창하지만 사실적으로는 틀렸거나 근거가 없으며 완전히 조작된 응답을 생성하는 환각(hallucination) 현상입니다 3. 실증적 연구에 따르면 작업과 모델에 따라 환각 발생률은 15%에서 40% 이상까지 보고되고 있으며, GPT-4와 같은 최첨단 시스템조차 도메인별 평가에서 측정 가능한 수준의 사실적 불일치를 보였습니다2,3. 이러한 한계는 잘못된 출력이 오정보, 오진 또는 결함이 있는 의사결정으로 이어질 수 있는 정밀도가 중요한 애플리케이션에서 심각한 위험을 초래합니다4. 환각은 근본적으로 언어 모델링의 확률적 특성에서 비롯됩니다. LLM은 검증된 사실적 지식을 검색하거나 추론하기보다 입력 시퀀스의 통계적으로 가능성이 높은 연속 토큰을 예측하여 생성하기 때문입니다5. 결과적으로 생성된 출력물에는 그럴듯하게 들리지만 부정확한 주장이 포함되거나, 근거 없는 단언이 도입되거나, 의미적으로는 관련이 있으나 사실적으로는 구별되는 개념들이 혼동되어 나타날 수 있습니다6.

기존의 완화 전략은 여러 패러다임을 통해 이 문제를 해결하고 있으나, 각각 뚜렷한 한계가 있습니다. 검색 증강 생성(Retrieval-Augmented Generation, RAG)은 외부에서 검색된 문서에 기반하여 응답을 생성함으로써 환각 현상을 줄이지만, 상당한 지연 시간 오버헤드를 유발하고 유지 관리되는 지식 베이스에 대한 접근이 필요하며, 전문 분야나 저자원 도메인에서의 검색 실패에 취약하다는 단점이 있습니다7,8,9.

응답 생성기와 참조 생성기는 모두 동일한 기반 GPT-3.5 Turbo 모델을 사용하여 인스턴스화되었지만, 서로 다른 프롬프트 목표와 실행 컨텍스트 하에서 작동합니다. 응답 생성기는 사용자 쿼리에 대해 제약 없는 답변을 생성하는 반면, 참조 생성기는 이전에 생성된 응답에 접근하지 않고 독립적인 사실 회상 작업을 수행합니다. 이러한 분리는 응답에 의한 직접적인 조건화 효과를 줄이고 주장 검증 과정에서의 확증 편향을 제한합니다. 따라서 이 프레임워크는 생성된 참조를 통계적 독립이 아닌 절차적 독립 상태로 취급합니다.

최근 연구에서는 외부 검색이나 반복적인 검증에 의존하지 않고 텍스트 생성 시 환각 현상을 줄이기 위한 경량 디코딩 전략이 탐구되었습니다. 대표적인 접근 방식 중 하나인 Decoding by Contrasting Layers (DoLA)는 디코딩 과정에서 트랜스포머의 중간 레이어와 최종 레이어의 표현을 대조함으로써 사실성을 향상시킵니다. 생성 후 검증 프레임워크와 달리, 이러한 방법은 토큰 생성 중에 직접 개입하므로 언어 생성 프로세스의 서로 다른 단계를 최적화합니다. 이러한 상호 보완적인 전략들은 환각 완화가 디코딩 중 또는 생성 후 검증을 통해 모두 달성될 수 있음을 보여주며, 각 접근 방식은 계산 오버헤드, 구현 복잡성 및 사실적 신뢰도 측면에서 서로 다른 트레이드오프를 제공합니다.

자기 일관성(Self-consistency) 방법은 여러 응답을 샘플링하고 가장 빈번하거나 일관된 출력을 선택함으로써 사실적 신뢰성을 향상시키지만, 계산 비용이 샘플 수에 따라 선형적으로 증가하여 지연 시간에 민감한 배포 환경에는 부적합합니다8. 자기 피드백 루프를 통해 출력을 반복적으로 수정하는 반복적 정제(Iterative refinement) 접근 방식은 오류율을 점진적으로 낮추지만, 패스가 추가될 때마다 추론 시간이 상당히 늘어납니다9. NLI 기반 검증 방법은 생성된 주장과 참조 텍스트 간의 의미론적 함의(semantic entailment)를 평가함으로써 더 정교한 대안을 제공하지만, 기존 구현 방식은 고정된 결정 임계값에 의존하므로 다양한 신뢰도 분포, 도메인 또는 모델 동작에 따라 적응하지 못한다는 단점이 있습니다10,11. 종합적으로, 이러한 접근 방식들은 수용 불가능한 수준의 계산 오버헤드를 발생시키거나, 외부 인프라에 의존하거나, 일반화된 배포에 필요한 적응성이 부족합니다. 이러한 환각 검증 접근 방식들의 주요 특성에 대한 비교는 보충 표 1(Supplementary Table 1)에 제공됩니다.

본 논문은 응답 지연 시간을 낮게 유지하면서 거대언어모델(LLM) 출력의 환각 현상을 줄이기 위해 설계된 경량의 2단계 주장 검증 프레임워크를 제안합니다. 첫 번째 단계에서는 LLM이 초기 응답을 생성하고, 이를 원자적 사실 주장들로 분해합니다. 두 번째 단계에서는 원본 생성 응답에 접근하지 않는 독립적인 추론 과정을 통해 별도로 생성된 사실 참조 자료를 바탕으로 자연어 추론(NLI)을 이용하여 각 주장을 검증하며, 통계적으로 도출된 신뢰도 임계값을 통해 주장 수준에서의 수용 또는 수정 여부를 결정합니다. 본 연구의 주요 기여도는 다음과 같습니다: (1) 응답 생성과 사실 검증을 분리하여 외부 검색이나 전체 응답의 재생성 없이도 각 원자적 주장에 대해 독립적이고 표적화된 평가를 가능하게 하는 2단계 주장 수준 검증 파이프라인을 구축하였습니다. (2) NLI 신뢰도 점수의 분포(τ = µ + kσ)에 기반하여 고정된 결정 규칙 대신 수용 및 수정 경계를 동적으로 결정하는 적응형 통계적 임계값 메커니즘을 도입하여, 다양한 신뢰도 분포에 걸쳐 강건성을 향상시켰습니다. (3) 모순으로 분류된 주장만 선택적으로 재생성하도록 제한하는 수정 전략을 통해, 전체 응답 리샘플링이나 반복적 정제 방식에 비해 연산 오버헤드를 크게 줄였습니다. (4) 환각 중심의 벤치마크에 대한 실증적 평가를 통해, 제안된 프레임워크가 응답 지연 시간을 실제 배포 가능한 범위 내로 유지하면서 환각률을 28%에서 9%로 낮추었음을 입증하였습니다.

프로토콜

본 연구는 인간 참여자, 동물, 생물학적 표본 또는 환자 데이터를 포함하지 않았습니다. 따라서 기관의 윤리적 승인 및 고지된 동의가 필요하지 않았습니다.

연구 설계 개요

대규모 언어 모델(LLM) 출력의 사실적 신뢰성을 향상시키기 위해 2단계 검증 프레임워크가 구현되었습니다. 이 절차는 응답 생성, 주장 추출, 독립적 참조 구축, 자연어 추론(NLI) 기반 검증, 적응형 통계적 의사결정, 선택적 수정 및 최종 응답 조립으로 구성되었습니다. 해당 프레임워크는 TruthfulQA 및 FEVER 벤치마크 데이터셋을 사용하여 평가되었습니다.

전체 워크플로우

사용자 질의 → 초기 응답 생성 → 주장 추출 → 독립적 참조 생성 → NLI 검증 → 통계적 임계값 계산 → 주장 수정 → 최종 검증 응답. 적응형 주장 검증 프레임워크의 전체 워크플로우가 그림 1에 도식화되어 있습니다.

데이터셋 준비

817개의 사실 중심 질문이 포함된 TruthfulQA 데이터셋12을 다운로드하여 평가를 위해 준비하였다. FEVER 데이터셋13은 Supported, Refuted, 또는 Not Enough Information으로 라벨링된 185,445개의 주석 처리된 주장으로 구성되며, 평가는 주장, 근거 및 정답 라벨 필드가 포함된 라벨링된 개발 데이터를 사용하여 수행되었다. 각 주장은 제공된 근거를 바탕으로 평가되었으며, 검증을 위한 참조 결과로는 원래의 FEVER 라벨을 유지하였다. 사실 검증 주장-근거 쌍이 포함된 FEVER 데이터셋을 확보하고 전처리하였다. 입력 질문과 주장은 표준화된 텍스트 형식으로 변환되었다. 실험 전 중복 항목과 불완전한 샘플을 제거하였다. TruthfulQA는 검증 및 테스트 하위 집합으로 나누었다. TruthfulQA 샘플의 약 20%(164개 질문)는 임계값 튜닝에 사용되었으며, 나머지 653개 질문은 성능 평가를 위해 남겨두었다. FEVER의 경우, 벤치마크에서 제공된 주장을 검증 단위로 직접 사용하였으며, TruthfulQA에 적용된 응답 생성 및 주장 추출 과정은 거치지 않았다. 프레임워크 개발 및 평가에 사용된 벤치마크 데이터셋의 특성은 Table 1에 요약되어 있다.

초기 반응 생성

각 쿼리는 기본 언어 모델로 제출되었습니다. 응답은 온도 0.7 및 top-p 0.9의 뉴클리어스 샘플링(nucleus sampling)을 사용하여 생성되었습니다. 최대 출력 길이는 256 토큰으로 제한되었습니다. 생성된 응답은 사후 처리나 수동 수정 없이 저장되었습니다. 생성된 텍스트는 주장 추출 단계로 직접 전달되었습니다.

주장 추출

생성된 각 응답은 독립적으로 검증 가능한 사실적 진술로 분해되었습니다. 원자적 주장을 식별하기 위해 구조화된 분해 프롬프트가 사용되었습니다. 복합 진술은 최소한의 사실 단위로 분리되었습니다. 주관적인 의견, 문체적 표현 및 대화형 채움말은 제거되었습니다. 추출된 각 주장은 독립적인 검증 단위로 저장되었습니다.

예시:

원문 응답:

"마리 퀴리는 방사능에 관한 선구적인 연구를 수행한 폴란드 태생의 물리학자이자 화학자였습니다."

추출된 주장: (1) 마리 퀴리는 폴란드 태생이다; (2) 마리 퀴리는 물리학자이자 화학자였다; (3) 마리 퀴리는 방사능 연구를 수행했다.

분리된 참조 구조 구축:

추출된 모든 주장에 대해 독립적인 사실 참조 데이터가 생성되었습니다. 검증 모델에는 원래의 사용자 쿼리만 제공되었습니다. 확증 편향을 방지하기 위해 이전에 생성된 응답에 대한 접근은 제한되었습니다. 간결하고 증거 기반의 응답을 유도하기 위해 사실 회상 프롬프트가 사용되었습니다. 생성된 참조 데이터는 이후 검증을 위해 저장되었습니다.

자연어 추론 검증

각 주장-참조 쌍을 사전 학습된 NLI 모델에 제출하였습니다. NLI 모델은 해당 관계를 함의(Entailment), 중립(Neutral) 또는 모순(Contradiction)으로 분류하였습니다. 세 가지 클래스 모두에 대한 신뢰 확률을 기록하였습니다. 이후 부호가 지정된 검증 점수를 부여하였습니다: 함의인 경우 양수, 중립인 경우 0, 모순인 경우 음수 값을 할당하였습니다. 임계값 계산을 위해 모든 검증 점수를 수집하였습니다.

적응형 통계 임계값 계산

NLI 모델이 생성하는 검증 신뢰도는 응답마다 상당히 다르게 나타나는데, 이는 쿼리에 따라 생성되는 주장의 수, 의미론적 복잡성 수준 및 신뢰도 분포가 서로 다르기 때문입니다. 고정된 전역 임계값을 사용하는 방식은 모든 응답이 유사한 신뢰도 프로필을 따른다고 가정하지만, 이는 실제로는 거의 관찰되지 않습니다. 이러한 변동성을 수용하기 위해, 제안된 프레임워크는 각 응답의 검증 점수 평균과 표준 편차를 사용하여 결정 경계를 개별적으로 추정합니다. 평균은 응답의 전반적인 신뢰 수준을 반영하며, 표준 편차는 추출된 주장들 사이의 신뢰도 값 분산도를 나타냅니다. 이러한 적응형 공식화를 통해 모든 입력에 대해 단일 임계값에 의존하는 대신, 응답별 불확실성에 따라 수용 기준을 조정할 수 있습니다.

모든 서명된 검증 점수의 평균(µ)과 표준 편차(σ)를 산출하였습니다.

적응형 결정 임계값은 다음과 같이 계산되었습니다:

figure-protocol-1

여기서 τ는 적응형 임계값을, µ는 평균 검증 점수를, σ는 표준 편차를, 그리고 k는 민감도 매개변수를 나타냅니다.

민감도 매개변수는 0.7로 초기화되었습니다. 점수가 +τ 이상이며 함의(Entailment)로 분류된 주장은 수용되었습니다. 점수가 −τ 이하이며 모순(Contradiction)으로 분류된 주장은 수정 대상으로 표시되었습니다. 점수가 (−τ, +τ) 범위 내에 있는 주장은 중립으로 유지되었습니다.

선택적 청구항 보정

NLI 모델이 주장-참조 쌍을 모순(Contradiction)으로 분류하고, 그에 해당하는 부호付き 검증 점수가 적응형 임계값 기준인 si ≤ -τ를 충족하는 경우에만 수정을 위해 주장이 전달되었습니다. 따라서 수정 결정은 NLI 클래스 레이블과 응답별 통계적 임계값에 의해 공동으로 결정되었습니다. si ≥ τ인 함의(Entailment)로 분류된 주장은 수용되었으며, -τ < si < τ 범위에 해당하는 주장은 중립으로 처리되어 수정 없이 유지되었습니다. 이러한 결합 기준을 통해 의미론적 모순과 충분히 강력한 부정적 검증 증거가 모두 나타나는 주장에 대해서만 수정이 적용되도록 보장하였습니다.

응답 재구성

수락 및 수정된 청구 항목들을 원래의 순서대로 배열하였습니다. 가독성을 유지하기 위해 문장 경계를 복원하였습니다. 필요한 경우 사소한 문법적 조정을 적용하였습니다. 조립된 결과물을 최종 검증된 응답으로 저장하였습니다.

성능 평가

해당 프레임워크는 네 가지 지표를 사용하여 평가되었습니다: (1) 정확도(Accuracy): 검증 후에도 사실적으로 정확하게 유지된 응답의 비율; (2) F1 점수(F1 Score): 환각 탐지 정밀도와 재현율의 조화 평균; (3) 응답 지연 시간(Response Latency): 쿼리 제출부터 검증된 응답 생성까지의 총 처리 시간; (4) 환각률(Hallucination Rate)

figure-protocol-2

지연 시간은 반복 측정된 실행 시간의 평균값으로 보고되었습니다. 각 실행당 개별 지연 시간 값이 보존되지 않았으므로, 표준 편차와 신뢰 구간은 계산되지 않았습니다.

벤치마크별 정확성 평가

TruthfulQA의 경우, 최종 검증된 응답을 벤치마크의 인간 검증 답변 참조 및 오답 목록과 비교하였습니다. 응답의 사실적 주장이 인정된 답변 정보와 일치하고, 식별된 오답 패턴에 해당하는 내용이 포함되지 않았을 때 정답으로 처리하였습니다. FEVER의 경우, 최종 출력의 각 주장을 관련 근거 및 원래의 FEVER 주석과 대조하여 평가하였습니다. 'Supported' 주장은 사실적으로 검증된 것으로 처리하였고, 'Refuted' 주장은 오답으로 처리하였습니다. 'Not Enough Information' 사례는 긍정적인 사실적 근거로 처리하지 않고 결정 불능 상태로 유지하였습니다. 이렇게 도출된 주장 수준의 판정 결과들을 각 벤치마크 전체에 걸쳐 집계하여 보고된 정확도(Accuracy)와 환각률(Hallucination Rate)을 계산하였습니다.

실험 환경

해당 프레임워크는 Python 3.9를 사용하여 구현되었습니다. 데이터 처리 작업은 수치 및 표 분석 라이브러리를 사용하여 수행되었습니다. NLI 모델은 추가적인 미세 조정 없이 추론 모드로 작동하였습니다. 실험은 Intel Core i5 프로세서, 16 GB RAM 및 64비트 운영 체제가 장착된 워크스테이션에서 실행되었습니다. 모든 평가는 저지연 작동을 보장하기 위해 단일 패스 추론 설정으로 수행되었습니다. 모든 실험은 데이터셋과 베이스라인 방법 전반에 걸쳐 일관된 평가를 보장하기 위해 동일한 하드웨어 및 소프트웨어 구성으로 진행되었습니다.

예상 결과

본 프로토콜은 잠재적으로 근거가 부족한 주장을 식별하고, 강하게 반박되는 주장을 선택적으로 수정 요청함으로써 주장 수준의 검증 결정을 내리도록 설계되었습니다. 기대되는 결과물은 실험적 평가 중에 관찰된 성능에 따라, 사실적 불일치가 감소하고 추가 처리 오버헤드가 제한된 검증된 응답입니다.

결과

초기 반응 생성

기준 언어 모델은 두 벤치마크 데이터셋의 질문에 대해 유창하고 문맥적으로 적절한 답변을 생성했습니다. 그러나 세부 분석 결과, 여러 답변에서 근거가 없거나 사실과 다른 진술이 발견되었습니다. TruthfulQA 데이터셋에서 기준 시스템의 환각률은 28%였으며, FEVER 데이터셋에서는 26%의 환각률이 관찰되었습니다. 이러한 결과는 직접적인 언어 생성만으로는 높은 사실적 신뢰성이 요구되는 응용 분야에 불충분하다는 것을 확인시켜 주었으며, 이후 모든 검증 절차를 비교하기 위한 기준 조건을 설정하는 근거가 되었습니다.

주장 추출

주장 추출 절차를 통해 생성된 응답을 독립적으로 검증 가능한 사실 단위로 성공적으로 분해하였습니다. TruthfulQA의 응답에는 평균 3.2개의 원자적 주장이 포함되어 있었으며, FEVER 샘플은 일반적으로 단일 주장으로 구성되었습니다. 분해 과정에서 추가 정보의 유입 없이 사실적 주장을 분리함으로써 각 진술을 개별적으로 평가할 수 있었습니다. 이러한 관찰 결과는 주장 수준의 검증이 응답 전체를 단일 단위로 평가하는 것보다 더 높은 정밀도를 제공한다는 가설을 뒷받침하였습니다.

독립적 참조 구축

추출된 각 주장(claim)에 대해 원래의 쿼리만을 조건으로 하는 별도의 추론 과정을 통해 독립적인 참조 문헌을 생성했습니다. 생성된 참조 문헌은 원래의 응답과 충분히 구별되는 간결한 사실적 설명을 제공하여 독립적인 검증 소스로 활용되었습니다. 참조 문헌 생성 과정은 모델의 이전 출력값에 사실적 참조가 직접적으로 영향을 받는 것을 방지하기 위해 초기 응답 과정으로부터 격리되었습니다. 이러한 분리는 잠재적인 확증 편향을 줄이고 이후의 주장 수준 검증을 위한 통제된 기반을 제공하기 위한 것이었으나, 본 연구에서 이 효과의 정도를 독립적으로 정량화하지는 않았습니다. 독립적인 참조 문헌의 성공적인 생성은 지식 회상과 응답 생성을 분리한다는 제안된 설계 원칙을 뒷받침했습니다.

자연어 추론 검증

NLI 검증 단계는 주장-참조 쌍을 함의, 모순 및 중립 범주로 효과적으로 분류하였습니다. 모순된 주장은 일관되게 부정적인 검증 점수를 받은 반면, 사실적으로 뒷받침되는 주장은 긍정적인 점수를 받았습니다. 중립 분류는 뒷받침하는 근거가 불충분한 주장에 할당되었습니다. 이러한 결과는 의미론적 추론이 뒷받침되지 않는 사실적 진술을 신뢰성 있게 식별할 수 있음을 입증하였으며, 표적 수정을 위해 필요한 근거를 제공하였습니다. 단순 일치성 확인 전략과 비교했을 때, NLI 검증은 환각률을 20%에서 15%로 감소시켜 탐지 능력이 향상되었음을 나타냈습니다.

적응형 통계적 임계값 설정

적응형 통계 임계값 설정(adaptive statistical thresholding)을 적용하여 각 응답의 신뢰도 점수 분포에 따라 결정 경계를 동적으로 조정함으로써 검증 성능을 더욱 향상시켰습니다. 임계값 민감도 분석 결과, 임계값 파라미터가 0.3에서 0.7로 증가함에 따라 성능이 개선되는 것으로 나타났습니다. 민감도 값이 0.7일 때, 본 프레임워크는 0.87의 정확도를 달성하는 동시에 환각 현상을 9%까지 줄였습니다(그림 2). 평가된 k 값에 대한 전체 민감도 분석 결과는 보충 표 2에 제공되어 있습니다. 임계값을 이 지점 이상으로 높였을 때는 정확도의 이득은 미미한 반면 지연 시간은 증가했습니다. 이러한 관찰 결과는 응답별로 다양한 신뢰도 분포를 처리하는 데 있어 적응형 임계값이 고정된 결정 경계보다 더 효과적이라는 가설을 뒷받침합니다.

적응형 임계값은 각 응답 내 신뢰도 점수의 변동성 또한 반영합니다. 검증 점수가 매우 일관된 응답은 표준 편차가 작게 나타나며, 이는 더 선택적인 결정 경계를 형성합니다. 반대로, 신뢰도 값이 이질적인 주장들을 포함하는 응답은 표준 편차가 더 크게 나타나며, 이는 더 넓은 수용 영역으로 이어져 불확실한 주장에 대한 불필요한 수정을 줄여줍니다. 이러한 적응형 동작이 모든 위양성 또는 위음성을 제거할 수는 없지만, 모든 입력에 동일한 기준을 적용하는 대신 각 응답의 불확실성 특성에 따라 결정 경계가 대응할 수 있게 합니다.

선택적 청구항 보정 및 답변서 작성

모순된 것으로 식별된 주장만이 수정을 위해 제출되었으며, 지지되거나 중립적인 주장은 변경 없이 유지되었습니다. 이러한 선택적 수정 전략은 불필요한 재생성을 최소화하고 응답의 원래 구조를 보존했습니다. 수정 및 응답 재구성 후, TruthfulQA의 환각률은 28%에서 9%로 감소하여 67.9%의 상대적 감소를 나타냈습니다. FEVER에서도 유사한 개선이 관찰되었으며, 환각률이 26%에서 10%로 감소했습니다. 평가된 설정 간의 정확도 및 환각률 비교는 각각 그림 3 및 4에 제시되어 있습니다.

성능 평가

비교 평가 결과, 제안된 프레임워크가 테스트된 모든 방법 중 가장 높은 종합 성능을 달성한 것으로 나타났다. TruthfulQA에서 해당 프레임워크는 정확도 0.87 및 F1 스코어 0.85를 기록하여, 고정 임계값 검증 및 자기 일관성 기반 접근 방식보다 우수한 성능을 보였다(표 2, 그림 3 및 4). FEVER에서는 정확도 0.89 및 F1 스코어 0.87을 달성했다(표 3, 그림 3 및 4). 프레임워크 구성 요소의 증분 기여도는 표 4에 제시된 어블레이션 분석을 통해 검토되었다. 이러한 개선 사항은 주장 수준의 검증과 적응형 통계적 의사결정을 결합함으로써 여러 데이터셋에 걸쳐 사실적 신뢰성이 향상되었음을 확인시켜 주었다. SelfCheckGPT, FActScore 및 제안된 프레임워크의 환각 탐지 정확도는 그림 5에서 비교하였다.

잠복기 분석

전체 검증 파이프라인은 낮은 계산 오버헤드를 유지했습니다. 평균 응답 시간은 베이스라인 모델의 820 ms에서 전체 프레임워크의 980 ms로 증가했으며, 이는 처리 시간의 완만한 증가만을 나타냅니다(표 5). 응답 생성 과정이 전체 지연 시간의 대부분을 차지했으며, 검증 및 수정 단계에서 추가되는 오버헤드는 상대적으로 적었습니다. 단계별 처리 시간 분석 내용은 부록 표 3에 제공되어 있습니다. 쿼리당 약 1600 ms가 소요되는 검색 기반 검증 시스템과 비교했을 때, 제안된 프레임워크는 유사한 사실 정확도를 유지하면서 훨씬 낮은 지연 시간을 달성했습니다. 이러한 결과는 실시간 사용성을 희생하지 않고도 환각 현상을 감소시킬 수 있다는 가설을 뒷받침합니다.

응답 생성은 클라우드 기반 언어 모델에 의존하므로, 개별 지연 시간 측정값은 결정론적인 실행 시간이 아니라 네트워크 상태 및 서버 측 스케줄링으로 인해 변동될 수 있습니다. 따라서 대표 평균값을 얻기 위해 반복 측정을 수행하였으며, 이를 통해 평가된 방법들 간의 상대적 비교는 유지하면서 일시적인 실행 변동성의 영향을 줄였습니다. 지연 시간 값은 반복된 실험 실행 전반의 평균 실행 시간으로 보고되었습니다. 실행당 개별 지연 시간 값은 보관되지 않았으며, 따라서 분산, 신뢰 구간 또는 기타 변동성 지표의 사후 계산은 불가능했습니다. 이에 따라 그림 6의 지연 시간 값과 속도-정확도 비교는 오차 막대 없는 점 추정치로 제시되었습니다.

결론적으로, 주장 추출, 독립적 참조 생성, 자연어 추론(Natural Language Inference) 검증, 적응형 통계적 임계값 설정 및 선택적 교정을 결합한 결과, 대규모 언어 모델 출력의 사실적 신뢰성이 향상됨이 입증되었습니다. 이 프레임워크를 통해 TruthfulQA의 환각률은 28%에서 9%로, FEVER의 환각률은 26%에서 10%로 감소했습니다. 이러한 결과는 적응형 주장 수준 검증이 평가 조건 하에서 추가적인 응답 지연 시간을 제한하는 동시에 사실적 신뢰성 지표를 개선했음을 나타냅니다.

데이터 가용성

본 연구에서 분석된 데이터셋은 각각의 공식 소스를 통해 공개적으로 이용 가능합니다. 본 원고는 기술된 분석의 재현을 지원하는 데 필요한 데이터셋 정보, 모델 구성 및 방법론적 세부 사항을 제공합니다. 연구 과정에서 생성된 처리된 평가 데이터와 추가 결과는 보충 파일(Supplementary Files)에 제공됩니다.

figure-results-1
그림 1: 적응형 주장 검증 프레임워크의 워크플로우. 초기 LLM 생성 응답을 사실적 주장으로 분해한 후, 독립적인 참조 생성, NLI 기반 검증, 신뢰도 점수 산출 및 통계적 임계값 적용을 수행합니다. 수락 기준을 충족하는 주장은 유지되며, 수정 기준을 충족하는 주장은 최종 응답 조립 전 표적 수정 과정을 거칩니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

figure-results-2
그림 2: 민감도 파라미터 (k)가 검증 정확도에 미치는 영향. k 값이 0.3, 0.5, 0.7, 1.0일 때 TruthfulQA 및 FEVER의 정확도. 두 데이터셋 모두에서 k 값이 증가함에 따라 정확도가 향상되었으며, 기본 평가를 위해 k = 0.7을 선택하였다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

figure-results-3
그림 3: 검증 방법별 정확도 비교. TruthfulQA 및 FEVER 데이터셋에 대한 베이스라인 LLM, NLI 기반 검증 및 제안된 적응형 검증 프레임워크의 정확도. 여기를 클릭하여 이 그림의 확대 버전을 확인하십시오.

figure-results-4
그림 4: 검증 방법에 따른 환각률 비교. TruthfulQA 및 FEVER 데이터셋에 대한 베이스라인 LLM, NLI 기반 검증 및 제안된 프레임워크의 환각률이다. 제안된 프레임워크는 TruthfulQA에서 환각률을 28%에서 9%로, FEVER에서 26%에서 10%로 감소시켰다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

figure-results-5
그림 5: 방법론별 환각 탐지 정확도. TruthfulQA 및 FEVER 데이터셋에 대한 SelfCheckGPT, FActScore 및 제안된 프레임워크의 탐지 정확도. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

figure-results-6
그림 6: 검증 방법별 응답 시간과 정확도의 트레이드오프. TruthfulQA 및 FEVER에서 평가된 방법들의 응답 지연 시간과 정확도 간의 관계이며, 제안된 프레임워크와 비교 방법들에서 나타나는 성능-지연 시간 트레이드오프를 보여준다. 여기를 클릭하여 이 그림의 더 큰 버전을 확인하십시오.

데이터셋사용된 샘플 수영역평균 응답 길이 (토큰)기준 LLM 환각률
TruthfulQA81738 (과학, 역사, 법률 등)4228%
FEVER1,000일반 사실 주장1826%

표 1: 벤치마크 데이터셋 특성. 프레임워크 개발 및 평가에 사용된 TruthfulQA 및 FEVER 데이터셋의 요약으로, 샘플 수, 베이스라인 정확도, 베이스라인 환각률 및 샘플당 평균 주장 수가 포함되어 있습니다.

방법정확도정밀도재현율F1 스코어환각률 (%)
기준 LLM (단일 추론)0.720.710.690.728%
NLI 기반 검증 (고정 임계값)0.820.8150.7850.815%
SelfCheckGPT0.760.7550.7250.7422%
FActScore0.850.84250.81750.8311%
제안된 프레임워크 (통계적 임계값)0.870.860.840.859%

표 2: TruthfulQA에서의 성능 비교. 기준 LLM, SelfCheckGPT, FActScore, NLI 검증 및 제안된 프레임워크의 정확도, 정밀도, 재현율, F1 스코어 및 환각률.

방법정확도정밀도재현율F1 점수환각률 (%)
SelfCheckGPT0.78
FActScore0.87
Baseline LLM†0.740.730.710.7226%
NLI 기반 검증 (고정 임계값)0.830.82250.79750.8114%
제안된 프레임워크 (통계적 임계값)0.890.87750.86250.8710%

표 3: FEVER에서의 성능 비교. 기준 LLM, SelfCheckGPT, FActScore, NLI 검증 및 제안된 프레임워크의 정확도, 정밀도, 재현율, F1 점수 및 환각률.

구성정확도정밀도재현율F1 (추가됨)환각률
기준 언어 모델0.720.710.690.728%
기준선 + 2차 확인 (NLI 제외)0.780.77250.74750.76*20%
베이스라인 + NLI 기반 검증 (고정 임계값)0.820.8150.7850.815%
기준선 + 통계적 결정 모듈 (전체)0.870.860.840.859%

표 4: 프레임워크 구성 요소의 어블레이션 분석. 이차 검증, NLI 검증 및 적응형 통계 임계값 설정을 순차적으로 통합함에 따른 정확도, F1 점수 및 환각률의 변화.

방법평균 반응 시간 (ms)
기준 LLM (단일 생성)820
자기 검증 메커니즘910
제안된 통계적 프레임워크980
검색 증강 검증 (RAG)1600

표 5: 검증 방법별 응답 지연 시간. 자가 검증(Self-Validation), 제안된 프레임워크, 그리고 검색 증강 검증(retrieval-augmented verification)에 대한 평균 응답 시간 및 베이스라인 LLM 대비 추가 지연 시간.

보충 표 1: 환각 검증 접근 방식의 비교. 외부 검색, 주장 수준 검증, 적응형 임계값 설정 및 지연 시간 효율적 처리 측면에서 제안된 프레임워크와 기존 방법들의 비교.이 파일을 다운로드하려면 여기를 클릭하십시오.

보충 표 2: 임계값 파라미터 (k)의 민감도 분석. 임계값 파라미터 값이 0.3, 0.5, 0.7, 1.0일 때의 정확도(accuracy), 정밀도(precision), 재현율(recall), F1 스코어 및 환각률(hallucination rate)을 산출하였습니다. 기본 평가에는 k = 0.7 값이 사용되었습니다.이 파일을 다운로드하려면 여기를 클릭하십시오.

보충 표 3: 검증 파이프라인 단계별 처리 시간. 초기 응답 생성, 주장 분해, 참조 생성, NLI 추론 및 선택적 수정이 전체 응답 시간에 기여하는 평균 실행 시간 및 백분율 비중.이 파일을 다운로드하려면 여기를 클릭하십시오.

보충 표 4: 검증 과정에서 확인된 오류의 분포. 위음성, 위양성 및 수정 오류의 수와 백분율, 그리고 각 오류 유형과 관련된 주요 환각 범주.이 파일을 다운로드하려면 여기를 클릭하십시오.

토론

제안된 프레임워크는 반복적인 샘플링과 외부 검색을 피하면서도 사실 검증 성능을 향상시켰습니다. TruthfulQA의 경우, 환각률(hallucination rate)이 베이스라인 LLM의 28%에서 전체 프레임워크 적용 시 9%로 감소했으며, 정확도는 0.72에서 0.87로 증가했습니다. FEVER에서는 환각률이 26%에서 10%로 감소했고, 정확도는 0.74에서 0.89로 증가했습니다. 이러한 비교 결과는 모든 배포 조건에서의 보편적 우위의 증거라기보다, 본 연구에서 사용된 실험 설정 및 구현 범위 내에서 해석되어야 합니다. 이 프레임워크는 격리된 사실 참조물(factual reference)과 선택적 수정을 통해 생성 후 주장 단위(claim-level) 검증을 수행하며, 이는 외부 지식 접지(grounding), 반복 추론, 그리고 경량화된 생성 후 검증 사이의 절충안을 제공합니다. 응답 생성기와 참조 생성기는 동일한 기본 GPT-3.5 Turbo 모델을 사용하지만, 서로 다른 프롬프팅 목적과 격리된 실행 컨텍스트 하에서 작동합니다. 참조 생성기는 오직 원래의 쿼리만 전달받으며 이전에 생성된 응답에는 접근하지 않습니다. 따라서 두 생성 프로세스는 통계적 독립성이 아닌 절차적 독립성을 가지며, 공유된 사전 학습 모델에서 기인한 상관관계가 있는 사실적 편향을 유지할 수 있습니다.

기존 방식과의 비교

고정 임계값 NLI 베이스라인은 NLI 기반 사실성 검증에 관한 이전 연구14를 바탕으로 0.7의 신뢰도 임계값을 적용합니다. SelfCheckGPT15는 여러 개의 확률적 샘플을 생성하고 NLI를 사용하여 일치하지 않는 주장을 식별하는 제로 리소스 환각 탐지 방법입니다. FActScore16는 생성된 응답을 원자적 사실로 분해하고 Wikipedia 기반 지식 소스에서 검색된 참조 자료와 대조하여 검증합니다. 이와 대조적으로, 제안된 프레임워크는 전체 응답의 반복적인 생성이나 외부 검색 없이 주장 단위의 검증을 수행합니다.

DoLA는 추론 과정에서 서로 다른 트랜스포머 층에서 도출된 토큰 확률을 대조함으로써 사실적 생성을 향상시키는 보완적인 경량 접근 방식입니다. DoLA는 토큰 생성 프로세스를 수정하는 반면, 제안된 프레임워크는 생성 후 주장 수준의 검증 및 선택적 수정을 수행하므로 직접적인 실험적 비교는 포함되지 않았습니다. DoLA를 구현하려면 내부 트랜스포머 층 표현에 대한 접근이 필요하지만, 본 연구에서 사용된 GPT-3.5 Turbo API에서는 이를 제공하지 않습니다. 외부 검색의 부재는 검색 의존도와 관련 처리 요구 사항을 줄여주지만, 검증 범위를 기반 모델이 보유한 지식으로 제한하게 됩니다. 결과적으로 완전한 허구 또는 검증자의 지식 범위를 벗어난 전문적인 주장은 수정하기 어려운 상태로 남게 됩니다.

적응형 통계적 임계값 설정 및 선택적 보정

적응형 임계값은 경험적 신뢰도 점수 분포에서 도출되며, 환각 탐지 재현율과 수정 정밀도 사이의 절충 관계를 제어합니다. 민감도 분석을 통해 별도로 분리된 TruthfulQA 검증 데이터 세트에서 0.3, 0.5, 0.7, 1.0의 값을 평가하였습니다. 평가된 벤치마크에서 k = 0.7 값이 환각 감소와 계산 효율성 사이에서 가장 균형 잡힌 절충안을 제공하였습니다.

생성된 콘텐츠의 특성에 따라 NLI 신뢰도 점수의 분포가 달라지기 때문에, 최적의 임계값은 응용 도메인마다 다를 수 있습니다. 따라서 새로운 도메인에 적용할 때는 대상 응용 분야를 반영하는 검증 세트를 사용하여 후보 값들을 평가하고, 사실 검증 성능, 수정률 및 처리 지연 시간 사이의 균형을 맞추는 값을 선택할 수 있습니다. 임계값 최적화는 모델을 재학습시키는 것이 아니라 단일 스칼라 매개변수를 조정하는 작업이므로, 적응 과정에서 기본 모델을 수정할 필요가 없습니다.

선택적 교정은 재생성 범위를 모순(Contradiction)으로 분류되고 통계적 임계값 기준을 충족하는 주장으로 제한합니다. 이를 통해 교정 기준을 충족하지 않는 주장에 대한 반복적인 처리를 방지하며, 전체 응답 재샘플링 및 반복적 정교화 방식과 본 프레임워크를 차별화합니다.

지연 시간과 성능의 트레이드오프

제안된 프레임워크는 기준 LLM의 820 ms, 검색 증강 검증의 1600 ms와 비교하여 980 ms의 평균 응답 시간을 달성했습니다. 단계별 분석 결과, 초기 응답 생성은 전체 지연 시간의 83.7%를 차지했으며, NLI 추론은 3.9%, 선택적 수정은 평균 1% 미만을 차지한 것으로 나타났습니다. 지연 시간 값은 반복적인 실험 실행 전반의 평균 실행 시간으로 보고되었습니다. 개별 실행당 지연 시간 값은 보관되지 않았으므로, 분산, 신뢰 구간 또는 기타 변동성 측정치의 사후 계산은 불가능했습니다. 따라서 지연 시간 값과 속도-정확도 비교는 오차 막대 없이 점 추정치로 제시되었습니다. 보고된 지연 시간 값은 본 연구에 사용된 실험 환경을 반영하며, 배포 조건, 특히 클라우드 기반 언어 모델 API를 사용하는 경우에 따라 달라질 수 있습니다. 네트워크 지연, 서버 부하 및 서비스 가용성은 제안된 검증 프레임워크와 관계없이 절대적인 응답 시간에 독립적으로 영향을 미칠 수 있습니다.

오차 분석

TruthfulQA 테스트 세트에서 잘못 처리된 주장들은 위음성(false negatives), 위양성(false positives) 또는 수정 오류(correction errors)로 분류되었습니다. 이러한 오류들의 분포와 주요 범주는 부록 표 4에 요약되어 있습니다. 위음성은 전체 오류의 52.6%를 차지했으며, 주로 시간적 환각(temporal hallucinations) 및 미묘한 사실 대체(subtle factual substitutions)와 관련이 있었습니다. 검증자가 기본 모델의 학습 컷오프 시점을 공유할 때 시간적 오류를 놓칠 수 있으며, 미묘한 사실 대체는 모순(Contradiction) 대신 중립(Neutral) 범위의 NLI 점수를 받을 수 있습니다.

위양성은 오류의 35.9%를 차지했으며, 주로 검증 모델의 높은 신뢰도 지식 범위 밖의 드물거나 매우 특수하거나 최근에 확립된 사실에서 발생했습니다. 이러한 사례들은 주장이 사실적으로 정확함에도 불구하고 낮은 NLI 함의 점수를 생성했습니다. 수정 오류는 전체 오류의 11.5%를 차지했으며, 완전한 조작이 식별되었으나 검증기의 지식 범위 부족으로 인해 수정 과정에서 또 다른 부정확한 진술이 생성되었을 때 발생했습니다.

이러한 결과는 잔차 오차가 NLI 판별과 검증자의 지식 커버리지 모두에서 발생하며, 특히 시간적 부정확성, 미묘한 사실 대체, 흔치 않은 사실, 그리고 완전한 허구의 경우에 그러하다는 것을 나타냅니다.

통계 분석

환각률은 고정 임계값 NLI 검증 시 15%에서 제안된 통계적 프레임워크를 사용했을 때 9%로 감소했으며, 전체 프레임워크를 적용한 결과 TruthfulQA에서 베이스라인의 28%였던 비율이 9%로 감소했습니다. 이러한 차이는 기술적인 성능 변화로 보고되었으며, 현재의 평가는 그러한 추론을 뒷받침하는 데 필요한 통계적 검정 결과와 효과 크기 추정치를 포함하고 있지 않으므로 공식적인 통계적 유의성은 주장되지 않았습니다17,18.

한계점

본 프레임워크의 검증 성능은 기반이 되는 NLI 모델의 역량에 의해 제한됩니다. DeBERTa-v3-large는 세밀한 수치 비교, 시간적 추론, 그리고 여러 사실에 걸친 다단계 추론(multi-hop inference)이 필요한 주장을 처리하는 데 어려움이 있을 수 있습니다. 또한 NLI 모델의 한계는 미세한 사실 관계 대체와 관련된 위음성(false negatives) 결과와 연관되었으며, NLI 모델의 체계적인 약점이 검증 결정으로 전이될 수 있습니다.

응답 생성기와 참조 생성기는 동일한 기본 GPT-3.5 Turbo 모델을 사용합니다. 서로 다른 프롬프팅 목적과 격리된 실행 컨텍스트를 통해 절차적 독립성이 제공되지만, 두 프로세스는 통계적으로 독립적이지 않으며 공유된 사전 학습 모델로부터 상관관계가 있는 사실적 편향을 유지할 수 있습니다.

평가자-검증자 결합(Evaluator–verifier coupling)은 또 다른 제한 사항입니다. 최종 환각 평가에는 제안된 파이프라인 내에서 주장을 검증하는 것과 동일한 NLI 모델이 사용됩니다. 이는 검증자와 평가자 사이의 일치성을 유도하여 측정된 개선 결과에 영향을 미칠 수 있습니다. 따라서 보고된 결과는 환각 감소에 대한 완전히 독립적인 증거라기보다, 정의된 NLI 기반 평가 절차 하에서의 성능으로 해석되어야 합니다. 독립적인 인간 평가나 별도로 개발된 평가 모델을 통해 더 강력한 검증을 제공할 수 있을 것입니다.

주장 분해 단계는 엔드투엔드 검증에 대한 기여도만을 대상으로 평가되었으며, 사람이 주석을 단 주장 경계와 독립적으로 비교 평가되지 않았습니다. 결과적으로, 본 연구는 분해 정확도에 대한 별도의 정량적 추정치나 이것이 후속 검증 단계로 전달되는 개별적인 오류 전파에 대한 수치를 제공하지 않습니다.

평가는 TruthfulQA와 FEVER 및 영어 콘텐츠로 제한되었습니다. 따라서 관찰된 성능이 전문 분야, 다국어 설정 또는 장문 생성으로의 일반화를 입증하는 것은 아닙니다. NLI 신뢰도 점수 분포는 생성된 콘텐츠의 특성에 따라 달라지므로, k의 최적값 또한 응용 분야에 따라 다를 수 있습니다. 그러므로 본 연구에서 평가한 조건 이외의 범위로 결과를 확장하기 전에는 도메인별 캘리브레이션과 더 광범위한 평가가 필요합니다.

마지막으로, 지연 시간 측정값은 실험 구성에 따라 구체적으로 달라지며 실행 환경마다 차이가 있을 수 있습니다. 각 실행당 개별 지연 시간 측정값을 보관하지 않았기 때문에, 사후적으로 변동성과 신뢰 구간을 추정할 수 없었습니다. 향후 평가에서는 개별 측정값을 보관하고, 다양한 실행 환경에 걸친 지연 시간에 대해 더 광범위한 통계적 특성 분석을 포함해야 합니다.

향후 연구

향후 연구에서는 현재 프레임워크에서 확인된 주요 한계점들을 다루어야 합니다. TruthfulQA를 사용하여 선택한 고정값 (k = 0.7)은 NLI 신뢰도 점수 분포가 다른 전문 분야에서는 최적이 아닐 수 있으므로, 도메인 인식 임계값 보정이 필요합니다. 임계값을 보정하기 위해 도메인별 검증 데이터를 사용할 수 있으며, 필요한 경우 위음성과 위양성 오류에 대해 비대칭 페널티를 적용할 수 있습니다19.

개선된 주장 분해(claim decomposition)에는 완전성, 정확성 및 다운스트림 오류 전파를 정량화하기 위해 사람이 주석을 단 주장 경계를 사용하여 독립적인 평가를 수행하는 과정이 포함되어야 합니다. 미세 조정된 분해 모델과 분해 신뢰도 측정 지표를 활용하면 부적절하게 분할된 주장으로 인해 발생하는 오류를 더욱 줄일 수 있습니다. 향후의 비교 평가에는 통합된 실험 프로토콜 하에 DoLA와 같은 경량 디코딩 기반 접근 방식도 포함되어야 합니다.

경량 검색 증강은 검증자가 충분한 사실적 지식을 갖추지 못했을 때 여전히 해결하기 어려운 완전한 허위 정보 문제를 해결하는 데 도움이 될 수 있습니다. 신뢰도가 낮은 모순된 주장에 대해 표적 검색 폴백(targeted retrieval fallback)을 적용하면, 모든 주장에 대해 검색을 수행할 필요 없이 외부의 사실적 근거를 제공할 수 있습니다20.

현재의 평가는 영어 벤치마크로 제한되어 있기 때문에 다국어 확장이 또한 필요합니다3. 향후 연구에서는 다국어 환각 벤치마크를 통해 다국어 NLI 모델과 언어별 주장 분해 및 수정 프롬프트를 평가해야 합니다.

결론

본 연구에서는 원자적 주장 분해, 개별 프롬프트를 통한 사실 참조 생성, NLI 검증, 적응형 통계적 임계값 설정 및 선택적 수정을 결합한 2단계 주장 검증 프레임워크를 제시하였습니다. TruthfulQA 데이터셋에서 이 프레임워크는 기준 LLM 대비 평균 지연 시간이 160 ms 증가했으나, 환각률을 28%에서 9%로 낮추었습니다. FEVER 데이터셋에서는 환각률이 26%에서 10%로 감소하였습니다.

제안된 프레임워크는 반복적인 전체 응답 샘플링이나 외부 검색 없이도 사실 검증에서 경쟁력 있는 성능을 달성했습니다. 적응형 임계값 설정과 선택적 수정은 추가적인 처리 오버헤드를 제한하는 동시에 관찰된 성능 향상에 기여했습니다. 하지만, 본 연구 결과는 평가된 벤치마크와 실험 조건으로 제한되며, NLI 모델 의존성, 평가자-검증자 결합, 주장 분해의 불확실성, 도메인별 임계값 보정 및 지연 시간 가변성의 영향을 받습니다. 따라서 해당 결과를 더 넓은 배포 환경으로 확장하기 전에는 더 광범위하고 독립적인 도메인별 및 다국어 평가가 필요합니다.

공개 사항

저자들은 선언할 이해상충 사항이 없습니다.

감사의 글

저자들은 본 연구를 수행하는 데 필요한 학술적 환경과 컴퓨팅 자원을 제공해 준 소속 기관에 진심으로 감사를 표합니다. 또한, 본 연구에서 제안한 프레임워크의 포괄적인 평가를 가능하게 한 공개 벤치마크 데이터셋의 개발자 및 관리자들에게 감사를 표합니다. 본 작업의 품질과 명확성을 높이는 데 도움이 된 건설적인 피드백을 제공해 준 동료들과 리뷰어들에게도 감사를 전합니다. 더불어 실험, 데이터 분석 및 결과 시각화를 용이하게 한 소프트웨어 라이브러리와 도구를 제공해 준 오픈 소스 연구 커뮤니티에 감사를 표합니다. 이들의 지속적인 노력은 자연어 처리 및 신뢰할 수 있는 인공지능 연구를 크게 발전시켰습니다. 저자들은 본 연구를 위해 외부의 재정적 지원이나 연구비를 지원받지 않았음을 밝힙니다.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
FEVER 벤치마크 데이터셋FEVER Shared Task (Thorne et al.)https://fever.ai/dataset/fever.html평가에 사용된 주장-근거 쌍의 공개 팩트 검증 데이터셋
GPT-3.5 Turbo (대규모 언어 모델)OpenAIModel ID: gpt-3.5-turbo; https://developers.openai.com/api/docs/models/gpt-3.5-turboOpenAI API를 통해 액세스하여 응답 생성기와 독립 참조 생성기로 모두 사용됨
NumPyNumPy Developers (오픈 소스)https://numpy.org/NLI 검증 점수의 평균 및 표준 편차를 포함한 통계 계산에 사용된 수치 계산 라이브러리
Openai (Python API 클라이언트 라이브러리)OpenAIhttps://github.com/openai/openai-pythonGPT-3.5 Turbo에 프롬프트를 제출하고 완성된 응답을 검색하는 데 사용된 Python 클라이언트 라이브러리
pandaspandas Development Team (오픈 소스)https://pandas.pydata.org/데이터셋 전처리 및 결과 처리에 사용된 표 형식 데이터 분석 라이브러리
사전 학습된 자연어 추론 (NLI) 분류 모델Hugging Face 모델 허브 (Microsoft의 DeBERTa-v3-large 아키텍처 기반 모델)MoritzLaurer/DeBERTa-v3-large-mnli-fever-anli-ling-wanli미세 조정 없이 추론 모드로 사용되어 각 주장-참조 쌍을 함의, 중립 또는 모순으로 분류함
PythonPython Software FoundationVersion 3.9; https://www.python.org/downloads/release/python-390/검증 프레임워크 구현에 사용된 핵심 프로그래밍 언어
SciPySciPy Developers (오픈 소스)https://scipy.org/실험 결과의 통계 분석을 지원하는 데 사용된 과학 계산 라이브러리
Transformers (Hugging Face Transformers 라이브러리)Hugging Facehttps://github.com/huggingface/transformers사전 학습된 NLI 모델을 로드하고 실행하는 데 사용된 Python 라이브러리
TruthfulQA 벤치마크 데이터셋Lin, Hilton 및 Evans가 최초 출시https://github.com/sylinrl/TruthfulQA임계값 튜닝 및 평가에 사용된 817개의 사실 중심 질문으로 구성된 공개 벤치마크
워크스테이션 컴퓨터원고에 명시되지 않음 (제조사/모델 확인 필요)Intel Core i5 프로세서; 16 GB RAM; 64-bit 운영 체제동일한 구성 하에 모든 실험을 수행하는 데 사용된 하드웨어
참고: 위에 나열된 모든 URL은 본 표 작성일 기준으로 활성 상태임을 확인하였습니다. 

참고문헌

  1. Dai Z, et al. Promptagator: Few-shot dense retrieval from 8 examples [conference presentation]. Presented at: The Eleventh International Conference on Learning Representations; 2022. [https://iclr.cc/virtual/2023/poster/10937]
  2. Achiam J, et al. GPT-4 technical report. arXiv. 2023;arXiv:2303.08774. [https://arxiv.org/abs/2303.08774]
  3. Ji Z, et al. Survey of hallucination in natural language generation. ACM Comput Surv. 2023;55(12):1-38.
  4. Bender EM, McMillan-Major A, Shmitchell S, Gebru T. On the dangers of stochastic parrots: Can language models be too big? [conference presentation]. Presented at: 2021 ACM Conference on Fairness, Accountability, and Transparency; 2021. [https://dl.acm.org/doi/10.1145/3442188.3445922]
  5. Devlin J, et al. BERT: Pre-training of deep bidirectional transformers for language understanding [conference presentation]. Presented at: 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; 2019. [https://arxiv.org/abs/1810.04805]
  6. Maynez J, Narayan S, Bohnet B, McDonald R. On faithfulness and factuality in abstractive summarization [conference presentation]. Presented at: 58th Annual Meeting of the Association for Computational Linguistics; 2020. [https://arxiv.org/abs/2005.00661]
  7. Brown T, et al. Language models are few-shot learners. Adv Neural Inf Process Syst. 2020;33:1877-901.
  8. Guu K, et al. Retrieval augmented language model pre-training [conference presentation]. Presented at: International Conference on Machine Learning; 2020. [https://arxiv.org/abs/2002.08909]
  9. Izacard G, Grave E. Leveraging passage retrieval with generative models for open domain question answering [conference presentation]. Presented at: 16th Conference of the European Chapter of the Association for Computational Linguistics; 2021. [https://arxiv.org/abs/2007.01282]
  10. Bowman SR, Angeli G, Potts C, Manning CD. A large annotated corpus for learning natural language inference [conference presentation]. Presented at: 2015 Conference on Empirical Methods in Natural Language Processing; 2015. [https://arxiv.org/abs/1508.05326]
  11. Platt J. Probabilistic outputs for support vector machines and comparisons to regularized likelihood methods. Adv Large Margin Classif. 1999;10(3):61-74.
  12. Lin S, Hilton J, Evans O. Truthfulqa: Measuring how models mimic human falsehoods. InProceedings of the 60th annual meeting of the association for computational linguistics (volume 1: long papers) 2022 May (pp. 3214-3252).
  13. Thorne J, Vlachos A, Christodoulopoulos C, Mittal A. FEVER: A large-scale dataset for fact extraction and verification [conference presentation]. Presented at: 2018 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; 2018. [https://aclanthology.org/N18-1074/]
  14. Williams A, Nangia N, Bowman SR. A broad-coverage challenge corpus for sentence understanding through inference. arXiv. 2017;arXiv:1704.05426.
  15. Manakul P, Liusie A, Gales M. SelfCheckGPT: Zero-resource black-box hallucination detection for generative large language models [conference presentation]. Presented at: 2023 Conference on Empirical Methods in Natural Language Processing; 2023.
  16. Min S, et al. FActScore: Fine-grained atomic evaluation of factual precision in long-form text generation. arXiv. 2023;arXiv:2305.14251.
  17. Cohen J. Statistical power analysis for the behavioral sciences. Routledge; New York; 2013.
  18. Kadavath S, et al. Language models (mostly) know what they know. arXiv. 2022;arXiv:2207.05221.
  19. Hendrycks D, et al. Aligning AI with shared human values. arXiv. 2020;arXiv:2008.02275.
  20. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-74.

재인쇄 및 허가

태그

TruthfulQASelfCheckGPT
동영상 곧 제공