연구 논문

Transformer 기반 BERT 모델의 사용 사례로서의 폐쇄 도메인 의미론적 질문 답변 시스템

DOI:

10.3791/69424

2025년 11월 14일

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

본 연구는 텍스트에서 지식을 추출하여 질문에 답하기 위한 적응형 학습 시스템을 설계하고, 코사인 유사성을 사용하여 Google-BERT, DistilBERT, RoBERTa 및 TF-IDF 모델을 대기 시간 및 의미론적 일반화에 대해 비교합니다. Google-BERT는 최고의 성능을 발휘하지만 시스템은 여전히 철자 오류에 민감하므로 실제 적용을 위해서는 강력한 전처리가 필요합니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

텍스트 파일에서 지식을 추출하고 문맥에서 올바른 정보를 찾아 사용자의 질문에 답하기 위해 QAS(Question Answering System)와 같은 적응형 학습 시스템이 이를 위해 설계되었습니다. 이러한 초점은 직접 답변 시스템에 대한 추가 연구와 질문 답변(QA) 작업을 위한 대규모 테스트 사용을 장려합니다. 이를 용이하게 하기 위해 사실 질문과 비사실 질문을 모두 포함하는 의미론적 폐쇄 도메인 QA(SCD-QA) 데이터 세트가 사전 훈련된 트랜스포머 모델과 함께 사용됩니다. 본 연구에서는 SQuAD 데이터 세트에서 Google-BERT, DistilBERT, RoBERTa와 같은 사전 훈련된 세 가지 트랜스포머 모델과 코사인 유사성을 가진 고전적인 키워드 기반 TF-IDF 모델 간에 추론 능력을 측정하고 비교합니다. 결과는 Google-BERT가 평균 EM(Exact Match) 점수가 90.0이고 평균 대기 시간이 1.27초로 가장 좋은 성능을 발휘하는 것으로 나타났습니다. 이 시스템은 또한 동의어가 있는 질문에서도 잘 수행되어 의미에 대한 깊은 이해를 보여줍니다. 그러나 철자 오류가 있는 질문에서는 제대로 작동하지 않아 철자 오류에 민감하고 사용 시 더 나은 초기 처리가 필요함을 나타냅니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

자연어 처리(NLP)는 QAS를 구성할 수 있는 인공 지능(AI)의 하위 도메인으로, 컴퓨터 시스템이 질문에 대한 답변을 자동으로 생성할 수 있도록 합니다1. NLP는 주로 인간 두뇌의 인지 과정을 모방하는 방식으로 서면 언어의 이해와 해석에 중점을 둡니다2. 이러한 작업에 참여하면 NLP가 인간과 유사한 반응을 생성할 수 있는 시스템을 구축하는 중추적인 기술로 자리매김하게 됩니다.

사용자의 질문에 응답하는 QAS는 NLP가 어떻게 사용되는지 보여주는 한 가지 예입니다3. QAS는 정보 검색(IR), 정보 추출(IE) 및 NLP와 같은 공통 문제가 있는 다양한 영역의 연구를 통합하는 연구 영역입니다. 현재 현대 검색 엔진은 주로 문서 검색 작업을 수행합니다4. 즉, 특정 키워드가 제공되면 이러한 검색 엔진은 관련성을 기준으로 순위가 매겨지고 지정된 키워드를 포함하는 관련 문서 목록만 생성합니다. 그들은 정확한 답을 제공하지 않습니다. QAS의 목적은 개인이 제한된 주제 영역 내에서 특정 질문에 대한 정확한 답변을 찾을 수 있도록 돕는 것입니다5. QAS의 그룹화는 그림 16에 설명된 다음 범주를 기반으로 수행할 수 있습니다. 팩토이드 QAS와 비팩토이드 QAS는 모두 자연어(NL)를 사용하여 작동하며 NL에서 제기된 질문에 응답하도록 설계되었습니다. 이 시스템은 NLP 기술을 활용하여 사용 가능한 말단7을 기반으로 답변을 제공합니다.

그림 1
그림 1: QA 시스템의 분류. 이 그림은 QA 시스템의 주요 구성 요소에 대한 마인드 맵을 보여줍니다. 그 중심에는 사실, 비사실, 하이브리드, 시각 자료, 대화식, 객관식 질문 등 다양한 유형의 질문을 처리하는 QA 시스템이 있습니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

이 연구는 박사 입학 정책 및 절차. 이 시스템은 박사 규칙 및 규정 PDF8 을 핵심 컨텍스트로 사용하고 응답 생성을 위한 주요 프레임워크로 트랜스포머 기반 BERT(Bidirectional Encoder Representations from Transformers)9 모델을 구현합니다. 목표는 일반적인 질문에 대한 정확한 답변을 제공하는 의미론적 대화형 FAQ 기반 QAS를 설계하여 새로 입학한 학생들이 필요한 필수 정보를 더 쉽게 빠르게 찾을 수 있도록 하는 것입니다.

이 목표를 달성하기 위해 널리 알려진 세 가지 트랜스포머 기반 BERT 모델인 Google-BERT9, DistilBERT10,11 및 RoBERTa12,13이 사용되었으며, 모두 SQuAD(Stanford Question Answering Dataset)14에서 훈련되었습니다. 그들의 성능은 두 가지 중요한 매개변수, 즉 EM(Exact Match)14로 측정된 의미 일치와 평균 반응 시간으로 분석된 모델 대기 시간15를 사용하여 평가되었습니다. 또한, 벡터 데이터베이스(VD)16,17를 사용하여 의미론적 임베딩을 저장하여 의미론적 유사성 점수를 기반으로 사용자의 질문에 대해 가장 의미론적으로 관련된 컨텍스트를 검색할 수 있도록 했습니다.

문헌 검토

트랜스포머 기반 모델은 NLP 분야를 점검하여 QAS를 크게 개선했습니다. BERT9 의 도입은 강력하고 정밀한 QAS를 개발하는 데 필수적인 구성 요소로서 변압기 아키텍처를 확고히 강조했습니다. 이 섹션에서는 SeCD(Semantic Conversational Dialogue) QA와의 관련성에 중점을 두고 트랜스포머 기반 모델 및 의미론적 임베딩의 최근 개선 사항에 대한 포괄적인 검토를 제시합니다. 이 작업에 이러한 모델의 통합을 정당화하기 위해 비교 분석이 수행되고 현장에서 의미 있는 통찰력을 도출할 수 있는 실행 가능성을 강조합니다.

BERT, DistilBERT 및 RoBERTa와 같은 트랜스포머 기반 아키텍처는 자체 주의 방법론을 사용하여 텍스트의 복잡한 문맥 관계를 캡처하므로 QAS와 같이 중요한 의미론적 이해가 필요한 작업에 이상적입니다. 이러한 모델은 특수 문장 변환기와 함께 의미론적 임베딩을 생성하고 SeCD QA의 벡터 기반 유사성 검색을 통해 신속하고 정확한 문맥 검색을 가능하게 합니다. 최근 연구는 특히 SCD-QA와 같은 작업별 용도에 대해 처리량, 확장성 및 효율성을 높이기 위해 이러한 모델과 임베딩 기술을 개선하는 데 중점을 두고 있습니다.

Sengupta et al.18 은 BERT 모델을 미세 조정하여 과학 기반 질문에 대한 객관식 QAS(MCQAS)를 향상시키는 창의적인 접근 방식을 도입했습니다. 그들의 프레임워크에서 그들은 먼저 질문-답변 쌍 간의 분산된 의미론적 유사성을 평가한 다음 이러한 유사성 점수를 원래 특징과 함께 분류 계층에 공급했습니다. 이 결합된 접근 방식은 SciQ 데이터 세트에서 90.2%의 F1 점수를 달성하여 미묘한 이해와 정확한 분류가 필요한 작업별 QAS에서 BERT의 효율성을 강조했습니다.

Cichecki 등19 는 스마트 설계 지원 시스템을 위해 ChatGPT와 미세 조정된 BERT 모델을 비교한 결과, 미세 조정된 BERT 모델이 도메인별 작업에서 ChatGPT와 같은 범용 LLM(대규모 언어 모델)보다 우수하여 맞춤형 데이터 세트에서 88.5%의 F1 점수를 달성한다는 사실을 발견했습니다. 이 연구는 특수 애플리케이션에서 모델 성능을 개선하기 위한 도메인별 미세 조정의 중요성을 보여줍니다.

Guo et al.20 은 제한된 주석 예산에서 QAS에 대한 작업별 미세 조정 전략의 효율성을 조사했습니다. 그들의 연구에 따르면 처음에는 SQuAD와 같은 일반 QA 데이터 세트에 대한 이중 미세 조정 접근 방식에 이어 작업별 데이터 세트에 대한 미세 조정이 COVID-QA와 같은 데이터 세트에서 F1 점수에서 15% 크게 향상된다는 사실이 밝혀졌습니다. 이 발견은 SeCD QAS의 성능을 향상시키는 데 있어 순차적 미세 조정의 중요한 역할을 강조합니다.

Pudasaini와 Shakya21 은 PubMed에서 가져온 맞춤형 생물의학 QA 데이터 세트에서 각각 83.89%와 89.67%의 EM 및 F1 점수를 보고한 생물의학 연구 논문에서 QA를 위한 미세 조정된 BERT 모델의 적용을 조사했습니다. PubMedBERT를 통한 전이 학습을 활용함으로써 그들의 기술은 복잡한 생물의학 쿼리를 처리하는 주목할만한 능력을 보여주며 이 분야에서 작업별 미세 조정의 잠재력을 강조했습니다.

Baek et al.22 는 제로샷 지식 그래프(KG) QA를 위한 지식 증강 언어 모델 프롬프트 프레임워크를 제안했습니다. 이 접근 방식은 의미론적 유사성을 사용하여 KG에서 관련 사실을 검색하고 이를 입력 질문에 통합합니다. 그 결과 KG-QA 데이터 세트에서 약 85%의 F1 점수를 달성했습니다. 이 작업은 KG와 트랜스포머 모델을 결합할 수 있는 잠재력을 보여주며, QA 성과 향상에 있어 지식 증강의 이점을 강조합니다.

Hu et al.23 은 의도 분류 및 의미 분석을 위해 BERT 기반 모델(RoBERTa-BiLSTM-MultiHeadAttention)과 함께 KG를 활용하여 호적 도메인용으로 설계된 QAS를 설명했습니다. 질문을 단일 이벤트 엔터티와 의도 관계로 단순화함으로써 구조화된 데이터 쿼리에서 높은 정확도를 달성했습니다. 또한, 다른 영역에 대한 방법론의 확장성은 KG 기반 QAS에 광범위한 적용 가능성을 강조합니다.

Luo et al.24 는 지식 기반(KB) QA를 위한 BERT 기반 스키마를 도입하여 MGPM(Multi-Granularity Pruning Model)과 관계 인식 주의를 통합했습니다. 그들의 접근 방식은 SimpleQuestions에서 94.4%, WebQuestionsSP에서 68.6%, WebQuestions에서 63.7%의 상당한 정확도를 달성합니다. 이러한 결과는 구조화된 데이터 쿼리에 대한 의미론적 유사성을 활용하는 BERT의 효과를 보여줍니다. 전반적으로 이 연구는 특히 정확한 엔터티 및 관계 식별이 중요한 시나리오에서 KB-QA를 위한 트랜스포머 기반 모델의 잠재력을 강조합니다.

Wu et al.25 는 안전 및 규정 준수 쿼리에 특히 중점을 두고 건설 관리의 QA를 위한 검색 증강 생성 프레임워크를 설계했습니다. BERT 기반 의미론적 임베딩을 생성형 트랜스포머 모델 및 작업별 KG와 통합함으로써 그들의 접근 방식은 건설 관련 QA 데이터 세트에서 88.7%의 F1 점수를 달성했습니다. 이 연구는 의미론적 이해와 KG 기반 검색을 결합하여 건설 관리를 위한 작업별 QA 데이터 세트의 정확도를 향상시킬 수 있는 잠재력을 보여줍니다.

Peng et al.26 은 의료 QA를 위해 BERT 및 GPT 기반 모델을 포함한 LLM을 체계적으로 평가했습니다. BERT의 상황별 이해와 GPT의 생성 능력을 결합하여 검색 증강 생성 및 도메인별 미세 조정을 사용하여 PubMed 및 임상 노트의 데이터 세트에서 86.2%의 F1 점수를 달성했습니다. 이 연구는 컨텍스트와 정확한 생성이 모두 중요한 의료 분야에서 추론 정확도를 향상시킬 수 있는 앙상블 모델의 잠재력을 강조합니다.

Gardazi et al.27 은 QA, 감정 분석 및 NER(Named Entity Recognition)와 같은 NLP 작업에서 BERT의 사용을 검토했습니다. 그들의 분석에 따르면 미세 조정된 BERT 모델은 SQuAD와 같은 작업별 QA 데이터 세트에서 85%-92%의 F1 점수를 달성하는 것으로 나타났습니다. 이는 BERT가 효과적인 컨텍스트 임베딩을 안정적으로 생성하고 KG를 추가하여 SeCD QAS에 적합하다는 것을 보여줍니다.

트랜스포머 기반 모델은 상황에 맞는 처리를 캡처하고, 효율적으로 확장하고, 도메인별 작업에 적응할 수 있는 고유한 능력으로 인해 SeCD QAS의 결정적인 선택이 되었습니다. 표 1은 변압기 기반 모델을 본 연구에서 조사한 대체 방법과 비교함으로써 이러한 결정적인 이점을 보여줍니다 18,20,22,23,24,25.

접근주요 특징들장점제한성능 지표(SQuAD)사용 사례 적합성
트랜스포머 기반 모델(BERT, RoBERTa, DistilBERT)양방향 컨텍스트 모델링, 자체 주의, 도메인별 데이터에 대한 미세 조정 16, 17, 19, 24, 25높은 정확도, 강력한 의미론적 이해, 벡터 데이터베이스 18, 20, 22, 24, 25로 확장 가능계산 비용이 높으며 사전 훈련이 필요합니다 17, 18EM: 80–90%, F1: 85–93% 16, 17, 19, 24, 25폐쇄 도메인(CD) -QA, FAQ 시스템 및 시맨틱 검색에 적합 16, 17, 19, 20, 22, 24, 25
전통적인 규칙 기반 시스템수작업 규칙, 키워드 일치 16낮은 계산 비용, 간단한 구현 16제한된 확장성, 복잡한 쿼리 처리 부실 16, 18EM: 50–60%, F1: 55–65% 16구조화된 데이터를 사용한 기본 QAS 16
순환 신경망(RNN)순차 처리, LSTM/GRU 아키텍처 19순차적 작업에 대한 중간 성능 19장거리 종속성으로 인한 어려움, 느린 추론 19, 9EM: 65–75%, F1: 70–80% 19CD-QA 19, 9에 덜 효과적인 일반 NLP 작업
키워드 기반 검색 시스템TF-IDF, BM25 알고리즘 18, 22빠른 검색, 낮은 리소스 사용량 18, 22표면 수준 일치로 제한됨, 의미론적 이해 부족 18, 22EM: 40–50%, F1: 45–55% 18, 22정확한 QAS 18, 22에 적합하지 않은 문서 검색.
컨볼루션 신경망(CNN)로컬 특징 추출, 컨볼루션 레이어 25짧은 텍스트 분류에 효율적, 빠른 추론 25제한된 문맥 이해, 복잡한 QAS 25에 덜 효과적EM: 60–70%, F1: 65–75% 25CD-QA 25에 적합하지 않은 텍스트 분류
그래프 신경망(GNN)그래프 기반 모델링, 관계형 추론 20다중 홉 추론에 효과적이며 문서 관계 캡처 20높은 계산 복잡성, 구조화된 데이터 필요 20EM: 70–80%, F1: 75–85% 20다중 홉 QAS, 단일 컨텍스트 CD-QA 20에는 적합하지 않음
지식 그래프 기반 시스템구조화된 지식 표현, 엔터티 연결 21구조화된 데이터 쿼리에 강력하고 외부 지식 활용 21사전 구축된 지식 그래프가 필요하며 알려진 엔터티로 제한됨 21EM: 65–75%, F1: 70–80% 21구조화된 데이터를 사용한 도메인별 QAS 21
주의 증강 모델향상된 주의 메커니즘, 상황 중심 처리 24관련 텍스트 세그먼트에 대한 초점 향상, 높은 정확도 24높은 계산 비용, 복잡한 구현 24EM: 85–90%, F1: 88–92% 24복잡한 CD-QA, 비사실 질문 24
Bag-of-Words 모델단어 빈도 기반 표현 22단순하고 계산적으로 가벼운 22의미 체계 이해가 부족하여 복잡한 쿼리에 비효율적입니다. 22, 25EM: 35–45%, F1: 40–50% 22기본 텍스트 검색, QAS 22, 25에 적합하지 않음
하이브리드 신경 모델(CNN+RNN)로컬 및 순차 처리 결합 25지역적 이해와 상황적 이해의 균형 25적당한 복잡성, 긴 문맥에 어려움을 겪음 25EM: 68–78%, F1: 72–82% 25일반 NLP 작업, CD-QA 25에 적합
통계 언어 모델확률적 단어 연관성 18간단한 쿼리에 빠름, 낮은 리소스 사용량 18제한된 컨텍스트 이해, 열악한 확장성 18EM: 45–55%, F1: 50–60% 18복잡한 CD-QA 18에 적합하지 않은 기본 QAS

표 1: QAS에 대한 다른 접근 방식과 트랜스포머 기반 모델의 비교. 이 표는 트랜스포머 기반 모델, 규칙 기반 시스템, RNN 등을 포함한 다양한 QA 시스템 접근 방식을 나란히 비교한 것입니다. 주요 기능, 강점, 약점, SQuAD에서의 성능 및 CD-QA, 의미 체계 검색 및 텍스트 분류와 같이 가장 적합한 작업을 요약합니다.

이 연구의 주요 목적은 NLP에서 효율적이고 확장 가능하며 정확한 SCD-QA 시스템을 개발하여 기관 정보에 대한 학생들의 접근성을 향상시키는 것입니다. 특히, 이 확증적 연구는 박사 학위 영역 내에서 사전 훈련된 트랜스포머 기반 모델을 적용하고 검증합니다. 목표는 의미 매칭, 모델 대기 시간 평가 및 VD 기반 의미 검색을 통합하여 효능과 실제 타당성을 입증하는 것입니다. 이 접근 방식은 집중된 제도적 맥락에서 정확한 도메인별 답변을 제공하기 위한 심층 분석을 제공합니다. 그림 2 는 시스템의 전체적인 아키텍처 프레임워크를 보여줍니다.

그림 2
그림 2: SCD-QA 시스템의 전체 스키마. 이 그림은 대규모 언어 모델(LLM)을 활용하는 QA 시스템의 순서도를 보여줍니다. 컨텍스트 파일과 사용자의 질문으로 시작하며, Google-BERT, DistilBERT 및 RoBERTa의 세 가지 모델과 하나의 키워드 기반 모델인 TF-IDF로 처리됩니다. 시스템은 체크리스트를 사용하여 각 모델의 성능을 평가한 다음 결과에 따라 최상의 모델을 선택합니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

포괄적인 이론적 기초

QAS 구성 요소: QAS 프레임워크는 그림 3과 같이 i) 질문 처리 모듈(QPM), ii) 문서 처리 모듈(DPM), iii) 답변 추출 및 공식화 모듈(AEFM)의 세 부분으로 구성됩니다. 시스템은 Factoid와 Non-Factoid의 두 가지 주요 범주에 속하는 질문을 받습니다. 팩토이드 질문은 일반적으로 무엇을, 어디서, 언제, 누가와 같은 의문어를 사용하는 반면, 팩토이드가 아닌 질문은 어떻게, 왜 같은 단어를 사용합니다.

DPM: 제공된 목록에서 사용자는 특정 구절을 선택할 수 있습니다. 다음으로, 구절의 각 토큰은 품사(POS) 태거를 사용하여 태그가 지정됩니다. 동사를 추출하려면 동사로 태그가 지정된 모든 토큰을 식별합니다. 이 동사를 틀에 얽매이지 않는 동사 목록과 결합하고 일반 동사에 논리를 적용하세요. 추출된 동사, 시제 및 -ing 형식을 포함하는 데이터 구조(배열)를 만듭니다.

QPM: 시스템은 사용자로부터 질문 형식으로 입력을 받습니다. 텍스트는 StringTokenizer 클래스를 사용하여 토큰화되고 결과 토큰은 별도의 데이터 구조에 저장됩니다. 그런 다음 이 데이터 구조는 프로그램 내에서 추가 활용을 위해 반환됩니다.

AEFM: 첫 번째 단계는 주어진 질문에서 동사를 식별하는 것입니다. 최근에 식별된 동사는 이제 문서 처리 단계에서 생성된 토큰과 일치합니다. 특정 유형의 사실적 질문(예: 무엇 또는 언제)에 대해 선택한 사례를 활용하여 보다 정확한 방식으로 답변을 추출하고 구성합니다.

질문의 종류를 선택하기 전에 먼저 사용자는 원하는 구절을 선택하라는 메시지를 받습니다. QPM은 사용자의 질문을 처리하고 AEFM에 전달하는 역할을 합니다. AEFM은 DPM에서 얻은 추출 및 원본 입력 문서의 태그가 지정된 형식이 포함된 처리된 문서를 활용합니다. 모듈은 원하는 답변을 얻기 위해 필요한 알고리즘을 공식화 모듈에 전달합니다.

그림 3
그림 3: QAS의 구성 요소. 이 그림은 QA 시스템의 4단계 프로세스인 질문, 질문 처리, 답변 처리 및 답변을 보여줍니다. 질문 처리에서 시스템은 질문을 분류합니다. 답변 처리에서는 문서와 구절을 찾아 검토하여 답변을 생성합니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

BERT 모델: 텍스트에서 단어 간의 연관성을 발견하기 위해 BERT 방법은 변환기를 사용합니다. 트랜스포머에는 인코더와 디코더(28)의 두 가지 메커니즘이 있지만 BERT에는 인코더만 필요합니다. BERT는 양방향 접근 방식을 취하고 입력 텍스트를 체계적으로 스캔하여 문맥에서 단어의 의미를 스스로 학습합니다. 인코더는 벡터화된 일련의 토큰을 입력으로 사용합니다. 그런 다음 벡터는 신경망에 공급되어 입력을 반영하는 일련의 벡터를 생성합니다. 단어의 출력 벡터는 단어가 나타나는 문장에 따라 변경됩니다. 단어의 벡터는 단어가 나타나는 문맥에 따라 달라질 수 있습니다. 예를 들어, "He likes to play cricket"의 "like"는 "His face turned red like a tomato"의 "like"와 다른 벡터를 가지고 있습니다. 이 접근 방식은 모델 구축 단계로 이동하기 전에 텍스트 처리 단계로 시작합니다. BERT가 텍스트를 처리하기 위해 수행하는 단계는 다음 섹션28에서 설명합니다.

텍스트 처리: BERT 모델은 규정된 원칙 집합에 따라 입력 텍스트를 나타냅니다. 또한 이 요소는 모델의 성능 향상에 기여합니다. BERT에서의 입력 임베딩은 세 가지 유형의 임베딩(28)의 혼합으로 구성된다.

위치 임베딩(PE): 임베딩에서 주문 관련 정보를 학습하기 위해 PE가 사용됩니다. PE는 변압기에서 손실된 순서에 대한 정보를 복원하는 데 사용됩니다. BERT는 입력 시퀀스의 각 지점에 대해 특별히 고유한 PE를 개발합니다. BERT는 PE를 활용하여 문장 내 단어의 위치 정보를 전달하는 기능을 보유하고 있습니다. 이를 통해 BERT는 단어의 순서나 순서를 효과적으로 캡처하고 표현할 수 있습니다.

문장 임베딩(SE): 또한 모델이 첫 번째 문장과 두 번째 문장을 구별하는 데 도움을 주기 위해 BERT는 각 문장에 고유한 임베딩을 학습합니다. 또한 QA와 같은 활동에 대한 입력으로 쌍을 이루는 문장을 수락할 수 있습니다.

토큰 임베딩(TE): TE는 WordPiece 토큰 어휘의 각 토큰에 대해 학습됩니다. WordPiece 토큰 어휘는 말뭉치 내에서 발견된 단어에서 파생된 하위 단어 단위로 구성됩니다. 예시적인 예로, 이 어휘 모음에는 Questio, Questi 등을 포함하여 Question이라는 용어의 상상할 수 있는 모든 하위 단어가 포함됩니다.

토큰의 입력 표현은 세그먼트 및 위치 수준에서 임베딩을 함께 추가하여 구축됩니다. 이 때문에 모델에 풍부한 정보를 제공하는 광범위한 임베딩 접근 방식입니다. 그림 49 는 BERT 모델의 임베딩을 보여줍니다.

그림 4
그림 4: BERT 임베딩. 이 그림은 변환기 모델에 대한 입력 임베딩이 작성되는 방법을 보여줍니다. 입력 시퀀스로 시작됩니다: [CLS] [MASK] 하늘은 흐리고 [SEP] 비가 올 것입니다 [SEP]. 시퀀스의 각 토큰은 Ethe 또는 E[MASK]와 같은 자체 임베딩을 받습니다. 그런 다음 첫 번째 문장에는 EA, 두 번째 문장에는 EB와 같이 각 문장에 문장 임베딩이 추가됩니다. E0 내지 E9로 표시된 위치 임베딩도 각 토큰의 위치를 나타내기 위해 포함됩니다. 이 모든 것이 결합되어 최종 입력 임베딩을 형성합니다. 이 수치는9에서 수정되었습니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

BERT를 사용한 QAS 설계: 설명을 위해 Football League28에 대한 Wikipedia 항목에서 추출한 단락과 함께 이 질문을 검토하십시오.

질문: 풋볼 리그는 어디에서 설립되었나요?

통로: 1888년 영국에서 풋볼 리그가 창설되어 많은 프로 축구 대회 중 첫 번째 대회가 되었습니다. 20세기에는 다양한 종류의 축구가 세계에서 가장 인기 있는 팀 스포츠로 성장했습니다.

답: 영국

BERT 모델은 질문과 컨텍스트 모두에서 토큰 추출을 활용한 후 이를 통합 입력으로 결합합니다. 앞서 언급했듯이 프로세스는 문장 시작을 나타내는 지표 역할을 하는 [CLS] 토큰을 사용하는 것으로 시작됩니다. 또한 질문과 구절을 명확하게 구분하기 위해 [SEP] 구분 기호가 사용됩니다. [SEP] 토큰 외에도 BERT는 질문과 답변을 포함하는 구절(28 )을 구별하기 위해 SE를 통합합니다. BERT는 두 개의 SE(하나는 질문 전용이고 다른 하나는 구절 전용)를 사용하여 이들 사이를 명확하게 구분합니다. 임베딩은 질문과 구절을 구별하기 위해 토큰의 원핫 표현(28 )과 결합된다. 이 프로세스는 그림 5에 나와 있습니다.

그림 5
그림 5: BERT 입력 표현. 이 그림은 BERT 기반 QAS에 대한 입력 임베딩이 생성되는 방법을 보여줍니다. 토큰 [CLS]로 시작하여 몇 개? [SEP], 구절 BERT large는 각각 문장 임베딩이 있습니다(질문의 경우 A, 구절의 경우 B). 토큰, 문장 및 위치 임베딩이 결합되어 최종 입력을 만듭니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

이어서, 질문과 컨텍스트의 결합된 임베디드 표현(28 )은 BERT 모델에서 입력으로 활용된다. BERT의 마지막 은닉 계층은 SoftMax를 사용하여 확률 분포를 생성하도록 수정됩니다. 이러한 분포는 그림 6에 표시된 대로 시각적 표현에 대한 답변을 나타내는 입력 텍스트 문장 내 하위 문자열의 시작 및 끝 인덱스를 결정합니다.

그림 6
그림 6: QA를 위한 BERT 처리 워크플로. 이 그림은 BERT 모델이 QA에서 작동하는 방식을 보여줍니다. 시작 부분에 분류 토큰[CLS]로 표시되고 끝에 [SEP] 구분 기호 토큰으로 표시된 질문과 다른 [SEP]로 구분된 컨텍스트가 포함된 입력 시퀀스를 제공합니다. 이 시퀀스의 토큰은 임베딩으로 변환됩니다. 그런 다음 모델은 구절 내에서 답변의 시작 및 끝 위치를 예측합니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

벡터 데이터베이스(VD): VD17,18은 데이터의 고차원 벡터 표현을 효율적으로 저장, 관리, 인덱싱 및 쿼리하기 위한 특수 시스템입니다. 벡터는 종종 딥 러닝 모델에서 생성되며 데이터에 대한 의미론적 또는 컨텍스트 정보를 캡슐화합니다. 벡터의 각 차원은 특정 특징을 나타냅니다. 임베딩은 텍스트, 이미지, 비디오 및 오디오와 같은 개체의 숫자 표현입니다. 이러한 임베딩은 기계 학습(ML), NLP, 추천 시스템, 컴퓨터 비전, IR 등 다양한 애플리케이션에서 사용됩니다. VD는 벡터 공간에서 유사한 개체를 서로 가깝게 그룹화하여 효과적인 유사성 검색 및 의미론적 쿼리를 용이하게 합니다. 페이스북 AI 유사성 검색(FAISS)29는 사용자 쿼리에 가장 관련성이 높은 컨텍스트를 식별하기 위해 이 연구에서 사용된 저명한 VD입니다. 표 2 는 VD의 주요 특성과 사용 사례를 간략하게 설명합니다.

특징묘사
고차원 데이터수백 또는 수천 개의 차원이 있는 데이터를 처리합니다.
근략적인 최근접 이웃(ANN)거리를 근사화하여 빠른 유사성 검색을 가능하게 합니다.
확장성수십억 개의 벡터가 있는 대규모 데이터 세트를 지원합니다.
통합원활한 워크플로를 위해 AI/ML 프레임워크 및 도구와 통합되는 경우가 많습니다.
실시간 쿼리대화형 응용 프로그램에 대한 대기 시간이 짧은 벡터 검색을 제공합니다.

표 2: VD의 주요 특성. 이 표는 VD의 중요한 기능을 강조합니다. 여기에는 고차원 데이터 처리, ANN 알고리즘을 사용한 빠른 유사성 검색 실행, 대규모 데이터 세트로 확장, AI 및 ML 도구 작업, 대화형 사용을 위한 빠른 실시간 쿼리 지원이 포함됩니다.

성능 평가 지표: SCD-QA 시스템은 EM 점수14 및 모델 대기 시간15의 두 가지 기본 지표를 사용하여 평가되었습니다. QA 연구의 표준 지표인 EM 점수는 실측 실측과 정확히 일치하는 예측 답변의 비율을 측정하여 예측 정확도를 평가합니다. N개의 질문 세트에 대해 EM 점수는 공식적으로 방정식 1에서 다음과 같이 정의됩니다.

방정식 1여기서 방정식 2 (1)

이 지표는 참조 답변과의 정확히 일치에 대해 1점, 차이에 대해 0점을 할당합니다.

지연 시간 지표는 시스템이 개별 쿼리에 대한 응답을 생성하는 데 필요한 총 처리 시간을 정량화합니다. 이 메트릭은 방정식 2에 표시된 대로 모든 쿼리의 평균 경과 시간으로 계산됩니다.

방정식 3 (2)

여기서 TstartiTendi 는 각각 i번째 쿼리 처리의 시작과 끝을 표시하는 타임 스탬프입니다. 대기 시간은 s 단위로 보고되며 입력 처리에서 답변 생성에 이르기까지 모든 단계를 포괄하는 시스템의 응답성을 캡처합니다.

메서드

SCD-QA를 구현하기 위해 이 백서에는 다음과 같은 테스트 연구가 통합되어 있습니다.

SCD-QA 데이터 세트: SCD-QA 시스템의 구현을 위해 제안된 데이터 세트(30 )가 도입된다. 이 데이터 세트는 인도 NIT 아루나찰프라데시의 학생 지침에 대한 2022년8년 박사 규칙이 포함된 텍스트 말뭉치에서 파생되었습니다. SCD-QA 시스템을 구축하려면 모든 관련 정보를 정확한 형식으로 포함하는 JSON 파일을 생성해야 합니다. 데이터 세트는 오픈 소스 프레임워크인 Haystack 주석 도구(버전 2.18.1)31을 사용하여 텍스트 말뭉치에서 생성됩니다. 이 도구를 사용하면 SQuAD14 스타일로 SCD-QA 데이터 세트를 쉽게 생성할 수 있습니다. PDF 파일에서 SQuAD 유형의 주석이 달린 데이터 세트를 만드는 단계는 그림 7에 나와 있으며, SQuAD 스타일의 데이터 세트 구조는 그림 8에 나와 있습니다.

그림 7
그림 7: PDF 파일에서 주석이 달린 데이터 세트를 만드는 단계. 이 그림은 Haystack 도구를 사용하여 SQuAD 스타일 주석이 달린 데이터 세트를 생성하기 위한 단계별 워크플로를 보여줍니다. PDF에서 텍스트를 추출하고, 구절로 정리 및 분할하고, 질문-답변 쌍에 수동으로 주석을 달고, 주석을 SQuAD JSON 형식으로 저장하고, 마지막으로 모델 훈련을 위해 데이터 세트를 내보내는 과정을 간략하게 설명합니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 8
그림 8: 팩토이드 QA 데이터 세트의 구조. 이 그림은 데이터 세트의 단락과 QA 쌍을 나타내는 JSON 데이터 구조를 표시합니다. 일련의 질문과 답변이 포함된 단락 섹션이 있습니다. 한 가지 질문은 박사 학위에 입학하는 데 필요한 최소 점수는 얼마입니까? 각 질문에는 ID와 답변 배열이 있습니다. 답변에는 문서 ID, 질문 ID, 텍스트 60% 표시, 답변의 시작 위치 및 지정되지 않은 답변 범주가 포함됩니다. is_impossible 플래그는 false로 설정됩니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

데이터 세트는 사전 목록으로 구성되어 있으며, 각 사전에는 데이터, 단락, 질문, answer_id, document_id, question_id, 텍스트, answer_start, answer_end, is_impossible 및 컨텍스트와 같은 주요 필드가 포함되어 있습니다.

data: 전체 질문 답변 정보를 포함합니다.
단락: 질문과 답변과 함께 특정 컨텍스트입니다.
질문: 특정 질문입니다.
answer_id: 각 답변 텍스트의 고유 식별 번호입니다.
document_id: 각 컨텍스트에 대한 고유 식별 번호입니다.
question_id: 각 질문의 고유 식별 번호입니다.
text: 답변 텍스트입니다.
answer_start: 문맥에서 정답의 답 시작 위치입니다.
answer_end: 문맥에서 정답의 답 끝 위치입니다.
is_impossible: 질문에 대한 답변이 해당 문맥에서 사용 가능한지 여부를 알려줍니다.
context: 답을 찾을 수 있는 텍스트 말뭉치입니다.
제안된 데이터 세트의 80개 질문은 모두 사실 및 비사실 질문 형식을 따릅니다. 일부 유형의 프레임 질문의 샘플은 표 3에 나와 있습니다.

질문
PS는 누구인가?
최첨단 문서의 글꼴 크기는 얼마입니까?
출산 휴가는 며칠입니까?

표 3: 데이터 세트의 샘플 질문. 이 표는 두 가지 유형의 질문의 예를 보여줍니다: 첫 번째와 두 번째는 사실 질문이고 세 번째는 비사실 질문입니다.

FAISS: FAISS(버전 faiss_cpu-1.9.0)29,32는 Facebook AI Research(FAIR)에서 개발한 오픈 소스 라이브러리로, 조밀한 벡터의 효율적인 유사성 검색 및 클러스터링을 용이하게 합니다. 대규모의 고차원 데이터를 효과적으로 관리하도록 특별히 설계되었습니다. 이 시스템은 수백만 또는 수십억 개의 벡터로 구성된 데이터 세트 내에서 빠르고 확장 가능한 ANN 검색을 용이하게 합니다. NLP, 추천 시스템, 이미지 또는 비디오 검색을 포함하여 임베딩과 관련된 애플리케이션에 널리 활용됩니다. FAISS는 Flat(무차별 대입), IVF(Inverted File), HNSW(Hierarchical Navigable Small World graphs) 및 PQ(Product quantization)를 포함한 다양한 인덱싱 방법을 제공합니다. 이러한 방법을 통해 사용자는 데이터 크기, 차원 및 하드웨어 사양에 따라 검색 성능을 최적화할 수 있습니다. 이 연구에서는 L2(유클리드) 거리를 사용하여 무차별 대입 검색을 수행하여 가장 가까운 이웃을 식별하는 플랫 인덱싱이 사용됩니다. 시스템의 확장성은 CPU 및 GPU 구현을 모두 지원하므로 광범위한 데이터 세트에서 고성능 계산이 가능합니다. 또한 특정 애플리케이션 요구 사항에 따라 속도와 정확성 간의 균형을 최적화할 수 있는 유연성을 제공합니다. FAISS는 BERT 또는 Word2Vec과 같은 임베딩의 의미론적 유사성을 평가하기 위해 NLP에서 자주 사용됩니다. FAISS는 QAS에서 문서나 문장의 벡터 표현을 저장하고 관리하는 데 활용됩니다. 사용자 질문에 대해 가장 관련성이 높은 컨텍스트를 검색하기 위해 대략적인 ANN 검색(33)을 수행하고, BERT와 같은 트랜스포머 모델로부터의 임베딩으로 의미론적 검색을 향상시킵니다. FAISS는 다양성으로 인해 AI 및 ML 워크플로의 기본 도구입니다.

BERT-large-uncased-whole-word-masking-finetuned- SQuAD 모델: 본 작업은 BERT-large-uncased-whole-word-masking finetuned-squad9 로 알려진 사전 훈련된 언어 모델을 활용하여 연구에서 제안된 데이터 세트를 사용하여 사실상 QAS를 개발합니다. BERT 모델은 목록, 표 및 제목을 제외하고 11,038권의 미출판 책9 데이터 세트와 영어 위키백과에서 사전 훈련을 거쳤습니다. 문제의 모델은 케이스가 없으므로 영어와 영어라는 단어를 구분하지 않습니다. 이 모델은 자체 지도 접근 방식을 사용하여 상당한 양의 영어 데이터에 대해 훈련된 사전 훈련된 트랜스포머 모델입니다. 이 모델은 사람의 주석 없이 원시 텍스트에 대해서만 사전 훈련되었습니다. 이를 통해 공개적으로 액세스할 수 있는 많은 양의 데이터를 활용할 수 있습니다. 사전 훈련 프로세스에는 제공된 텍스트에서 입력과 레이블을 자동으로 생성하는 작업이 포함됩니다. 모델은 두 가지 특정 목표9로 훈련되었습니다.

MLM: 이 프로세스에는 입력 문장에 있는 단어의 15%9 를 무작위로 마스킹하는 작업이 포함됩니다. 그런 다음 모델은 마스킹된 전체 문장을 처리하고 마스킹된 단어를 예측합니다. 이 접근 방식은 일반적으로 단어를 순차적으로 처리하는 기존의 순환 신경망(RNN)과 미래 토큰의 내부 마스킹을 사용하는 GPT와 같은 자동 회귀 모델과 다릅니다. 이 기능을 통해 모델은 문장의 양방향 표현을 획득할 수 있습니다.

NSP: 사전 학습 단계에서 모델은 두 개의 위장된 문장을 입력으로 결합합니다. 어떤 경우에는 이러한 문장이 원문에 인접하여 직접적인 관계를 나타냅니다. 다른 경우에는 그렇지 않으며, 이는 이를 연결하는 원래의 근접성이나 맥락이 없음을 의미합니다. 다음 단계에는 두 문장이 논리적으로 일관성이 있는지 여부를 예측하는 모델이 포함됩니다.

현재 모델은 후속 구성이 특징입니다: 모델 아키텍처는 숨겨진 차원이 1024인 24개의 레이어로 구성됩니다. 16개의 어텐션 헤드를 사용하며 총 3억 3,600만 개의 매개변수가 있습니다9.

WordPiece는 전처리 단계에서 30,000단어 어휘 크기의 텍스트를 토큰화하는 데 사용됩니다. 그러면 모델의 입력은 [CLS] 문장 A [SEP] 문장 B [SEP]와 같습니다. 유일한 요구 사항은 결합된 문장의 총 길이가 512 토큰9 미만이어야 한다는 것입니다. 특정 사전 훈련된 모델은 후속 출력을 산출합니다: 달성된 F1 점수는 93.15%인 반면 정확한 일치 점수는 86.91%9입니다.

Distilbert/distilbert-base-cased-distilled-squad 모델: DistilBERT10 모델은 BERT9 모델의 보다 작고 빠르며 효율적인 변형으로, BERT의 의미론적 이해 능력의 대부분을 유지하면서 리소스 집약적이지 않고 계산 용량이 제한된 실제 애플리케이션에 더 적합합니다. 버전 distilbert-base-cased-distilled-squad는 QA 작업을 위해 SQuAD14 에서 미세 조정되었습니다. 이 모델은 언어 이해에서 BERT의 효율성의 97%를 유지하면서 BERT의 1억 1천만 매개변수에 비해 6,600만 개의 매개변수 크기를 줄이는 트랜스포머 아키텍처를 활용합니다. DistilBERT는 더 큰 BERT 모델에서 더 컴팩트한 DistilBERT 모델로 정보를 전달하는 Knowledge Distillation이라는 방법을 사용하여 이에 도달합니다. 크기가 작기 때문에 정보를 더 빠르게 추론하고 메모리를 덜 사용할 수 있으므로 모바일 또는 에지 장치와 같이 리소스가 제한된 애플리케이션에 적합합니다. SQuAD 1.1 데이터 세트에서 세심하게 미세 조정된 이 모델은 추출 QA 작업에 탁월한 숙련도를 보여주며, 이는 질문에 답하는 지정된 컨텍스트에서 텍스트 세그먼트를 찾는 것이 목표입니다. DistilBERT는 SQuAD 리더보드에서 BERT F1 점수의 약 85%를 달성하고 규모가 줄어들었음에도 불구하고 BERT 언어 능력의 상당 부분을 유지합니다. 이 모델은 운영 수준 QA 작업을 위한 매우 효율적인 솔루션으로, 성능과 계산 효율성을 모두 최적화합니다.

딥셋/roberta-base-squad2: deepset/roberta-base-squad2 모델12,13은 RoBERTa 아키텍처의 미세 조정된 변형입니다. 이 데이터 세트는 답변된 질문과 답변할 수 없는 질문을 모두 포함하는 SQuAD14 2.0 데이터 세트용으로 특별히 설계되었습니다. 이 개선된 RoBERTa 프레임워크는 BERT의9개 NSP 작업을 제거합니다. 또한 훈련 중에 동적 마스킹을 사용하여 NL 이해 작업의 효율성과 성능을 향상시킵니다. 이 모델에는 1억 2,500만 개의 매개변수가 있으며 양방향 변압기를 사용합니다. 이를 통해 양방향에서 컨텍스트 정보를 획득하고 추출 QA 작업에 탁월합니다.

SQuAD 2.0에서 미세 조정을 통해 모델은 주어진 컨텍스트 내에서 올바른 응답 범위를 식별하고 응답이 없을 때 인식할 수 있습니다. 하위 단어 토큰화를 처리하고 대소문자 구분을 유지하는 BPE(Byte Pair Encoding) 토크나이저를 사용합니다. 이는 흔하지 않고 복잡한 단어를 처리하는 능력을 향상시킵니다. 이 모델은 약 85%-90% F1 및 80%-85% EM을 달성하여 잘 작동합니다. 답할 수 없는 질문을 찾아내는 능력과 효과적인 배포는 고객 서비스, 지식 검색 및 가상 비서에 유용합니다.

QA를 위해 SQuAD 미세 조정된 BERT 모델을 배포하는 가장 효과적인 방법은 Hugging Face Transformers 파이프라인34를 사용하는 것입니다. 이 프레임워크는 토큰화, 입력 형식, 모델 로딩 및 출력 후처리를 간소화합니다. 이러한 모델은 주어진 컨텍스트에서 직접 검색된 텍스트 범위가 답인 추출 QA에서 효과로 널리 알려져 있습니다. 구현을 안내하기 위해 다음 절차에서는 BERT 모델을 실행하는 단계를 간략하게 설명합니다.

입력 및 설정: 이 프로세스에는 네 가지 주요 입력 및 설정 매개변수가 필요합니다. Hugging Face Hub에서 문자열 식별자로 지정된 모델 이름(예: google-bert/bert-large-uncased-whole-word-masking-finetuned-squad, distilbert/distilbert-base-cased-distilled-squad 또는 deepset/roberta-base-squad2); 질문(Q)은 쿼리를 포함하는 문자열로 제공됩니다. 컨텍스트(C)는 관련 텍스트 또는 구절을 나타내는 문자열입니다. 사용되는 기본 도구는 Python(버전 3.12.12)의 Hugging Face 변환기 라이브러리(버전 4.57.0)의 고급 파이프라인 함수입니다.

프로세스: 실행(Hugging Face 파이프라인): 이 프로세스는 6가지 기본 단계로 구성되며 Hugging Face 파이프라인을 사용하여 QA 작업의 복잡성을 해결합니다.

라이브러리 설치: pip install transformers 명령을 사용하여 필요한 라이브러리를 설치하여 시작합니다. 이 설치를 통해 모델 및 간소화된 파이프라인 기능에 액세스할 수 있습니다.

파이프라인 가져오기: 다음을 사용하여 파이프라인 함수를 가져옵니다. 트랜스포머에서 파이프라인을 가져옵니다.

QA 파이프라인 초기화: qa_pipeline = pipeline("question-answering", model="") 을 사용하여 QA 파이프라인을 초기화합니다. 이 명령은 모델과 토크나이저를 다운로드하여 추론할 수 있도록 합니다.

입력 정의: 설정 질문 = ... 그리고 문맥 = ... 을 클릭하여 모델의 데이터를 준비합니다.

론 실행: 질문과 컨텍스트를 result = qa_pipeline(question=question, context=context)를 사용하여 파이프라인에 전달합니다. 모델은 입력을 처리하고 답변을 제공합니다.

답변 추출: 다음을 사용하여 출력 사전에서 answer 문자열을 가져옵니다: answer = result['answer'] .

출력: 이 프로세스는 Answer(컨텍스트에서 추출된 텍스트 범위, 문자열로 표시됨), Score(예측에 대한 모델의 신뢰도를 정량화하는 부동 소수점 값), Start 및 End 인덱스(컨텍스트 내에서 답변 범위의 문자 위치를 지정하는 정수)의 순서로 여러 출력 매개변수를 생성합니다.

문장 변환기/all-MiniLM-L6-v2: all-MiniLM-L6-v235 는 Sentence-Transformers 라이브러리(버전 5.1.1)36의 사전 훈련된 문장 변환기입니다. 효율적이고 정확한 텍스트 임베딩에 최적화되어 있습니다. Microsoft의 MiniLM 프레임워크를 기반으로 개발되었으며 6개의 트랜스포머 레이어와 384차원 임베딩이 포함되어 있습니다. 이 설계는 성능과 계산 능력의 균형을 유지하여 실시간 애플리케이션에 적합합니다. 이 모델은 SNLI, MultiNLI, STS 벤치마크 및 웹 크롤링 데이터와 같은 데이터 세트에서 10억 개 이상의 구문 쌍에 대해 훈련되었습니다. 결과적으로 의미론적 유사성, 그룹화 및 검색 관련 작업에 대한 숙련도를 보여줍니다. 작은 크기(~22MB)와 향상된 추론 성능으로 인해 all-MiniLM-L6-v2는 의미 체계 검색, 중복 감지 및 텍스트 분류와 같은 애플리케이션을 단순화합니다. 가볍지만 STS-B 및 SICK-R과 같은 벤치마크에서 강력한 정확도를 제공하므로 확장 가능한 시나리오와 제한된 리소스 시나리오 모두에 효과적인 선택입니다. Sentence-Transformer를 사용하여 임베딩을 생성하는 워크플로는 아래 그림 9 에 나와 있습니다.

그림 9
그림 9: 문장 변환기 모델을 사용한 임베딩 프로세스의 단계. 이 그림은 문장 변환기 프레임워크를 사용하여 텍스트 임베딩을 생성하는 워크플로를 보여줍니다. 라이브러리 가져오기 및 사전 훈련된 모델 로드부터 텍스트 데이터 준비, 임베딩 생성, NumPy 배열로 변환, 인덱싱 또는 유사성 검색과 같은 다운스트림 작업을 위한 저장에 이르기까지 프로세스를 간략하게 설명합니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

제안된 알고리즘: 이 연구는 사용자가 묻는 사실 및 비사실 질문을 모두 해결할 수 있는 SeCD 기반 SCD-QA 시스템 개발을 위해 알고리즘 1에서 제안된 방법론을 간략하게 설명합니다.

알고리즘 1: 제안된 SeCD 기반 SCD-QA 시스템의 알고리즘
입력: 원시 컨텍스트 파일(C) 및 사용자 쿼리(Q) 집합입니다.
출력: 선택된 최적의 트랜스포머 기반 LLM(M')과 M'에 의해 생성된 응답.
컨텍스트 전처리: 원시 컨텍스트 세트 C에 주석을 달아 DSQuAD 형식으로 구조화된 데이터 세트를 생성합니다.
DSQuAD = f아노네이트(C)
컨텍스트 임베딩 생성: Sentence-Transformer fembed 를 사용하여 각 컨텍스트 c 방정식 100 DSQuAD 를 임베딩 ec로 변환합니다.
식15
임베딩 저장: 효율적인 유사성 검색을 위해 Ec 를 벡터 데이터베이스 V 에 저장합니다.
방정식 18
쿼리 임베딩 생성: 동일한 문장 변환기를 사용하여 사용자의 쿼리 Q를 임베딩 eq 로 변환합니다.
방정식 20
컨텍스트 검색: eq와의 유사성을 기반으로 데이터베이스 V에서 가장 관련성이 높은 컨텍스트 임베딩 방정식 21 을 검색합니다.
식: 22
여기서 sim(eq,e c)은 유사성 함수입니다.
LLM에 컨텍스트 전달: 검색된 컨텍스트 방정식 21 를 3개의 트랜스포머 기반 LLM에 공급합니다: Google-BERT(M1), DistilBERT(M2), RoBERTa(M3) 및 기존 모델: TF-IDF+Cosine Similarity(M4)
식: 28
모델 평가: 각 응답에 점수를 매기는 평가 함수 feval을 사용하여 응답 {R1,R 2,R 3,R 4}을 비교합니다.
방정식 31
최상의 모델 선택: 평가 점수가 가장 높은 모델 M' 식별 S'
방정식 33
최종 출력 생성: M'을 사용하여 다음을 기반으로 최종 응답 R을 생성합니다.방정식 36
방정식 37

제안된 알고리즘 프로세스는 사용자 질문을 해결하기 위해 이상적인 트랜스포머 기반 LLM을 선택하기 위한 체계적인 접근 방식(그림 10)을 간략하게 설명합니다. 전처리, 임베딩 기반 컨텍스트 검색 및 다중 모델 평가를 통합하여 고품질의 문맥 관련 답변을 보장합니다. 아래에서는 명확성을 위해 단계별 프로세스가 설명되어 있습니다.

데이터 준비 및 전처리: 첫 번째 단계에는 원시 텍스트 데이터 처리가 포함됩니다.

입력: 원시 텍스트 파일(8 )이 시스템에 적응된다.

주석 도구31: 입력은 SQuAD14 형식의 구조화된 데이터 세트로 변환됩니다. 이 단계에는 QA 쌍 생성이 포함됩니다. 또한 관련 텍스트 데이터를 잘 정의된 컨텍스트 블록으로 구성합니다.

출력: 이제 데이터 세트가 임베딩을 생성할 준비가 되었습니다.

컨텍스트 임베딩 생성: 효율적이고 확장 가능한 컨텍스트 검색을 가능하게 하기 위해 훈련된 Sentence-Transformer35,36 모델이 주석이 달린 데이터 세트에 적용됩니다. 이 변환기는 텍스트를 의미론적 의미를 포착하는 고차원 임베딩으로 변환합니다. 임베딩은 VD, FAISS29,32에 저장되어 빠른 유사성 기반 검색이 가능합니다.

사용자 질의 처리: 사용자가 질문을 제출할 때, 질문은 동일한 문장 변환기(35,36)에 의해 처리된다. 이것은 컨텍스트 임베딩과 동일한 벡터 공간(29,32)에 상응하는 임베딩을 생성한다. 이 디자인은 쿼리가 관련 컨텍스트 항목과 일치할 수 있도록 합니다.

벡터 유사성을 사용한 컨텍스트 검색: 유사성 메트릭(예: 코사인 유사성)을 사용하여 시스템은 쿼리 임베딩과 저장된 컨텍스트 임베딩을 비교합니다. 시스템은 가장 높은 유사성 점수를 기반으로 가장 관련성이 높은 컨텍스트를 선택합니다. 이렇게 하면 관련 컨텍스트만 다운스트림 모델에 전달됩니다. 이 프로세스는 계산 오버헤드를 줄이고 관련성을 향상시킵니다.

여러 LLM에 걸친 모델 평가: 선택한 컨텍스트는 Google-BERT28, DistilBERT10 및 RoBERTa12의 세 가지 트랜스포머 기반 LLM에 의해 평가됩니다. 또한 코사인 유사성 모델을 사용하여 전통적인 키워드 기반 TF-IDF37 에 의해 평가됩니다. 각 모델은 컨텍스트를 처리하고 사용자의 질문에 대한 응답을 생성합니다.

비교 평가: 4개의 LLM 모델의 응답은 두 가지 주요 지표를 사용하여 평가됩니다. 첫째, 의미 일치는 EM14에 의해 평가됩니다. 둘째, 모델 대기 시간은 평균 반응 시간15로 분석됩니다.

모델 선택 및 최종 출력: 가장 성능이 좋은 모델이 사용자의 질문에 적합한 LLM으로 선택됩니다. 선택한 모형의 최종 응답이 고려됩니다. 이는 계산 효율성과 응답 품질 간의 균형을 보장합니다.

그림 10
그림 10: 변압기 기반 모델을 사용하는 SCD-QA 시스템의 워크플로. 그림은 SCD-QA 시스템의 작동 방식을 보여줍니다. 먼저 원시 컨텍스트 파일을 주석 도구에 의해 처리하여 SQuAD 형식의 데이터 세트를 생성합니다. 그런 다음 문장 변환기는 FAISS 벡터 데이터베이스에 저장되는 임베딩을 생성합니다. 사용자가 질문을 하면 시스템은 해당 질문에 대한 임베딩을 만들고 가장 관련성이 높은 컨텍스트를 선택합니다. Google-BERT, DistilBERT 및 RoBERTa의 세 가지 트랜스포머 기반 모델과 하나의 기존 TFIDF + 코사인 유사성 점수를 비교하고 가장 성능이 좋은 모델을 사용하여 답을 제공합니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

SCD-QA 시스템 구현은 4개의 LLM과 80개의 팩토이드 및 비팩토이드 질문으로 구성된 데이터 세트를 사용했습니다. 처리는 12.7GB 시스템 RAM, 15GB GPU RAM 및 112.6GB 디스크 공간을 갖춘 NVIDIA Tesla T4 GPU(드라이버 버전: 550.54.15, CUDA 버전: 12.4)를 사용하여 Google Colab에서 수행되었습니다. 모델 성능은 의미론적 일치를 위한 EM14 와 반응 시간에 대한 모델 대기 시간15 의 두 가지 지표를 사용하여 평가되었습니다.

SCD-QA 데이터 세트

SCD-QA 데이터 세트는...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구는 트랜스포머 기반 언어 모델을 활용하여 구조화된 기관 문서에서 정확하고 맥락을 인식하는 응답을 제공하는 SCD-QA 시스템을 소개합니다. 시스템의 워크플로는 (1) 데이터 전처리로 구성됩니다. (2) 최첨단 문장 변환기인 all-MiniLM-L6-v2를 이용한 임베딩 생성; (3) FAISS를 통한 유사성 기반 검색; (4) 포괄적인 모델 평가. 파이프라인은 기관 정책 문서에서 가져온 80개의 신중하게 주석이 달린 답변 가능한 사실 및 비사실 질문이 포함된 SCD-QA 데이터 세트에서 테스트되었습니다.

조사된 세 가지 트랜스포머 모델 중 Google-BERT는 평균 EM 점수가 90.00으로 우수한 성능을 보였지만 이는 다른 모델에 비해 응답 대기 시간이 더 높은 대가를 치르게 되었습니다. 기존의 키워드 기반 TF-IDF 검색은 계산 효율적이지만 정확도가 현저히 떨어지는 것으로 나타나 트랜스포머 모델이 제공하는...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자는 공개할 것이 없습니다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자는 이 연구 전반에 걸쳐 변함없는 지원과 지도를 해준 NIT Arunachal Pradesh의 헌신적인 교수진과 행정부에 감사를 표합니다. 또한 이 연구를 가능하게 해준 오픈 소스 NLP 도구 및 사전 훈련된 모델의 개발자와 기여자들에게 깊은 감사를 드립니다. 이 원고를 준비하는 동안 저자는 명확성을 높이기 위해 Grammarly Proofreader를 사용했습니다. 저자는 콘텐츠의 정확성과 무결성에 대해 전적인 책임을 집니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
올-미니LM-L6-v2마이크로소프트버전 5.1.1고차원 임베딩 생성을 위한 사전 학습된 문장 변환기 모델. 텍스트를 임베딩으로 변환하여 문맥 검색을 지원합니다.
주석 도구건초 더미버전 2.18.1원시 텍스트를 SQuAD 형식으로 구조화하는 플랫폼입니다. QA 쌍과 컨텍스트 블록을 생성하여 데이터셋을 준비합니다.
DistilBERT 모델포옹하는 얼굴NA계산 요구량이 줄어든 경량 트랜스포머 기반 LLM. 비교 평가를 통해 지연 시간은 낮지만 정확도는 떨어집니다.
FAISS VD페이스북faiss_cpu-1.9.0유사성 기반 검색을 위한 확장 가능한 VD. 효율적인 쿼리 매칭을 위해 고차원 임베딩을 저장하고 검색합니다.
구글-BERT 모델구글NA양방향 컨텍스트 모델링을 갖춘 사전 학습된 트랜스포머 기반 LLM입니다. 팩토이드 및 비팩토이드 쿼리에 대한 정확한 응답을 생성하는 주요 모델입니다.
NVIDIA 테슬라 T4 GPU엔비디아드라이버 버전: 550.54.15
CUDA 버전: 12.4
모델 추론을 위해 15GB GPU RAM을 사용하는 GPU입니다. LLM을 처리하고 평가하는 데 연산 능력을 제공합니다.
파이썬파이썬 소프트웨어 재단버전 3.12.12파이썬은 직관적인 문법, 포괄적인 라이브러리, 강력한 커뮤니티 지원 덕분에 자연어 처리(NLP) 분야에서 선도적인 프로그래밍 언어입니다. 기본적인 텍스트 전처리와 복잡한 머신러닝 구현을 포함한 다양한 NLP 작업을 지원합니다.
로버타 모델딥셋NA향상된 학습 전략을 갖춘 최적화된 트랜스포머 기반 LLM입니다. 비교를 위해 평가되며, 정확도와 지연 시간을 균형 있게 조정합니다.
SCD-QA 데이터셋은 SQuAD 로 구성되었습니다; 판NA버전 2.0질문-답변 쌍을 위한 표준화된 형식. 트랜스포머 모델과의 호환성을 위한 구조 데이터셋.

참고문헌

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Pirtoaca, G. S., Rebedea, T., Ruseti, S. Improving retrieval-based question answering with deep inference models. Int Joint Conf Neural Network. , 1-8 (2019).
  2. NLP-QA framework based on LSTM-RNN. Zhang, X., Chen, M. H., Qin, Y. Int Conf Data Sci Business Anal, , 307-311 (2018).
  3. Natural language processing based new approach to design factoid question answering system. Machhirke, V. S., Soni, A. Second Int Conf Inventive Res Computing Appl, , 276-281 (2020).
  4. Biancofiore, G. M., Deldjoo, Y., Di Noia, T., Di Sciascio, E., Narducci, F. Interactive question answering systems: literature review. ACM Comput Surv. 1 (1), Article 1(2024).
  5. Singh, S., Das, N., Michael, R., Tanwar, P. The question answering system using NLP and AI. Int J Sci Eng Res. 7 (12), 2229-5518 (2016).
  6. Pandya, H. A., Bhatt, B. S. Question answering survey: Directions, challenges, datasets, evaluation matrices. arXiv. , (2021).
  7. Khvalchik, M. A., Kulkarni, K. Open-domain non-factoid question answering. , Springer International Publishing. Cham. (2017).
  8. NIT Arunachal Pradesh PhD rules and regulations year. , National Institute of Technology Arunachal Pradesh. https://www.nitap.ac.in/storage/pdf/140508582e7c89a8b2295595085e3abe-%2003-37-28F%20IN%20AL.pdf (2022).
  9. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. BERT: Pre-training of deep bidirectional transformers for language understanding. Proc NAACL-HLT. , 4171-4186 (2019).
  10. Sanh, V., Debut, L., Chaumond, J., Wolf, T. DistilBERT, a distilled version of BERT: Smaller, faster, cheaper and lighter. arXiv. , (2019).
  11. DistilBERT HuggingFace. , https://huggingface.co/distilbert/distilbert-base-cased-distilled-squad (2023).
  12. Liu, Y., et al. A robustly optimized BERT pretraining approach. arXiv. , (2019).
  13. RoBERTa base squad2. Deepset. , https://huggingface.co/deepset/roberta-base-squad2 (2023).
  14. SQuAD: 100,000+ questions for machine comprehension of text. Rajpurkar, P., Zhang, J., Lopyrev, K., Liang, P. Proc 2016 Conf Empirical Meth Natural Language Proc, , 2383-2392 (2016).
  15. Attention is all you need. Vaswani, A., et al. 31st Conf Neural Informat Proc Syst, , 1-11 (2017).
  16. Malkov, Y. A., Yashunin, D. A. Efficient and robust approximate nearest neighbor search using hierarchical navigable small world graphs. IEEE Trans Pattern Anal Mach Intell. 42 (4), 824-836 (2018).
  17. Similarity search in high dimensions via hashing. Gionis, A., Indyk, P., Motwani, R. Proc 25th VLDB Conf, , 518-529 (1999).
  18. HIJLI_JU at SemEval-2024 task 7: Enhancing quantitative question answering using fine-tuned BERT models. Sengupta, P., Sarkar, S., Das, D. Proc 18th Int Workshop Semantic Evaluat, , 279-284 (2024).
  19. Kocoń, J., et al. ChatGPT: Jack of all trades, master of none. Inf Fusion. 99, 101861(2023).
  20. Fine-tuning strategies for domain specific question answering under low annotation budget constraints. Guo, K., Diefenbach, D., Gourru, A., Gravier, C. IEEE 35th Int Conf Tools with Artificial Intell, , 166-171 (2023).
  21. Question answering on biomedical research papers using transfer learning on BERT-base models. Pudasaini, S., Shakya, S. 7th Int Conf I-SMAC (IoT in Social, Mobile, Analytics and Cloud), , 496-501 (2023).
  22. Knowledge-augmented language model prompting for zero-shot knowledge graph question answering. Baek, J., Aji, A. F., Saffari, A. Proc 1st Workshop Natural Language Reasoning Struct Explanat, , 78-106 (2023).
  23. Hu, S., Zhang, H., Zhang, W. Domain knowledge graph question answering based on semantic analysis and data augmentation. Appl Sci. 13 (15), (2023).
  24. A BERT-based approach for knowledge base question answering. Luo, D., Su, J., Yu, S. Int Joint Conf Neural Networks, , 1-8 (2020).
  25. Wu, C., et al. Retrieval augmented generation-driven information retrieval and question answering in construction management. Adv Eng Inform. 65, 103158(2025).
  26. Peng, C., et al. A study of generative large language model for medical research and healthcare. NPJ Digit Med. 6 (1), 210(2023).
  27. Gardazi, N. M., et al. applications in natural language processing: a review. Artif Intell Rev. 58 (6), 1-49 (2025).
  28. Sabharwal, N., Agrawal, A. Hands-on question answering systems with BERT: applications in neural networks and natural language processing. , Apress Berkeley. CA. (2021).
  29. FAISS documentation. , https://faiss.ai/ (2025).
  30. Bhattacharya, D. SCD-QA dataset. Zenodo. , (2025).
  31. Annotation tool. , https://docs.haystack.deepset.ai/docs/annotation (2025).
  32. Johnson, J., Douze, M., Jégou, H. Billion-scale similarity search with GPUs. IEEE Transac Big Data. 7 (3), 535-547 (2021).
  33. Sun, P., Guo, R., Kumar, S. Automating nearest neighbor search configuration with constrained optimization. arXiv. , (2023).
  34. BERT. , Hugging Face. https://huggingface.co/docs/transformers/model_doc/bert (2025).
  35. MiniLM: Deep self-attention distillation for task-agnostic compression of pre-trained transformers. Wang, W., et al. Proc 34th Int Conf Neural Informat Process Syst, , 5776-5788 (2020).
  36. Sentence transformer documentation. , https://www.sbert.net/ (2025).
  37. Cosine similarity to determine similarity measure: study case in online essay assessment. Lahitani, A. R., Permanasari, A. E., Setiawan, N. A. 4th Int Conf Cyber IT Service Manag, , 1-6 (2016).
  38. A comparative analysis of transformer models in zero-shot text classification. Kyritsis, K., Liapis, C. M., Spatiotis, N., Perikos, I., Paraskevas, M. 15th Int Conf Informat Intelligence Syst Applicat, , 1-4 (2024).
  39. Howard, J., Ruder, S. Universal language model fine-tuning for text classification. Proc 56th Ann Meeting Associat Computat Linguistics. , 328-339 (2018).
  40. Asai, A., Hashimoto, K., Hajishirzi, H., Socher, R., Xiong, C. Learning to retrieve reasoning paths over Wikipedia graph for question answering. arXiv. , (2019).
  41. Lewis, P., et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. arXiv. , (2021).
  42. Leveraging passage retrieval with generative models for open domain question answering. Izacard, G., Grave, E. Proc Conf Eur Chapter Associat Computat Linguistics, , 874-880 (2021).

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

SQuADTF IDF

관련 논문