본 연구는 영어 텍스트 분류를 개선하기 위해 메타 증류와 메타 학습을 결합한 경량 그래프 신경망을 제안합니다. 저데이터 및 교차 도메인 환경에서 일반화를 강화하면서 계산 비용을 줄이고 높은 성능을 유지합니다.
연구 논문
본 연구는 영어 텍스트 분류를 개선하기 위해 메타 증류와 메타 학습을 결합한 경량 그래프 신경망을 제안합니다. 저데이터 및 교차 도메인 환경에서 일반화를 강화하면서 계산 비용을 줄이고 높은 성능을 유지합니다.
세계화와 정보기술의 발전으로 영어 텍스트 데이터가 급증했으며, 효율적인 분류가 시급히 필요합니다. 소표본 및 교차 영역 시나리오에서 영어 텍스트 분류의 일반화 능력을 향상시키고 경량 모델을 달성하기 위해, 본 연구는 복합계 이론과 딥러닝을 결합하여 텍스트 샘플의 분포 특성을 완전히 고려하는 그래프 신경망 모델을 구축합니다. 2단계 메타 증류 기법과 메타 학습 전략을 결합하여 교사 모델의 매개변수를 동적으로 조정하고 전체 지식 이전 과정을 최적화합니다. 실험 결과는 제안된 모델의 소수 샷 및 교차 도메인 텍스트 분류 작업에서의 분류 성능이 전통적인 그래프 신경망 및 기타 주류 비교 모델보다 현저히 우수함을 보여줍니다. 경량화 측면에서 2단계 메타 증류 메커니즘으로 생성된 SM은 다중 주제 텍스트 분류 데이터셋에서 매우 높은 수준의 성능 유지를 유지하면서 계산 시간을 크게 줄입니다. 또한 이 방법은 긴 텍스트 처리 시나리오에서 높은 효율과 안정적인 분류 성능을 유지할 수 있으며, 전통적인 증류 방법 및 문헌에서 보고된 다른 방법들에 비해 계산 효율성에서 명확한 이점을 제공합니다. 제안된 방법은 저표본 및 교차 도메인 응용 시나리오에서 영어 텍스트의 분류 성능을 효과적으로 향상시키는 동시에 계산 비용을 크게 줄여, 자원이 제한된 환경에서 영어 텍스트 분류를 위한 실현 가능하고 효율적인 기술적 해결책을 제공합니다.
세계화의 가속화와 정보기술의 발전은 소셜 미디어, 학술 연구, 비즈니스 커뮤니케이션 등 다양한 분야에서 영어 텍스트 데이터의 폭발적인 성장을 이끌었습니다. 정보 검색, 감정 분석, 콘텐츠 관리 및 기타 기능을 위해 이러한 텍스트를 효율적으로 분류하는 것은 자연어 처리에서 중요한 과제가 되었습니다. 영어 텍스트 분류(ETC)의 목표는 텍스트의 의미 내용을 기준으로 미리 정의된 범주로 분류하는 것입니다. 그러나 자연어의 복잡성, 즉 모호성, 문맥 의존성, 표현의 다양성은 텍스트분류 과제에 많은 도전을 제기합니다. 현재 딥러닝(DL) 기술의 발전은 텍스트 분류에 새로운 기회를 창출하고 있습니다. Transformers의 양방향 인코더 표현(BERT)과 그 변형으로 표현된 사전 학습된 언어 모델은 대규모 말뭉치에서 사전 학습을 통해 풍부한 맥락적 의미 정보를 학습할 수 있어 텍스트 분류3의 성능을 크게 향상시킵니다. 그러나 현재 ETC 방법들은 여전히 두 가지 주요 한계에 직면해 있습니다: 첫째, 단일 모델이나 특징의 최적화에 중점을 두는 경우가 많고, 언어의 역동성과 출현적 행동 같은 복잡한 시스템으로서의 내재적 특성을 무시하여 저데이터 또는 교차 도메인 시나리오에서 일반화가 불충분합니다; 둘째, 사전 학습 모델의 강력한 성능에도 불구하고, 높은 계산 비용과 큰 매개변수 수는 자원이 제한된 환경에서의 실용적 배포를 심각하게 방해합니다 4,5. 이러한 문제를 해결하기 위해 본 연구는 복잡계 이론(CST)과 2단계 메타 증류 메커니즘(TSMDM)을 통합한 경량 텍스트 분류 프레임워크를 제안합니다.
본 연구의 맥락에서 CST는 자연어를 역동적인 진화, 의미론적 출현, 그리고 어휘 노드 영향의 이질적 분포를 가진 전형적인 복합 시스템으로 보는 이론적 틀을 의미합니다. 이 알고리즘은 의미 전파에서 핵심 어휘의 지배적 역할과 지역 어휘 특징에서 전체 의미론의 출현 법칙을 시뮬레이션하는 데 적용되어, 모델의 텍스트 의미론에 대한 깊은 이해와 소샷 및 교차 도메인 데이터 시나리오에 대한 적응성을 향상시킵니다. 이 기술의 핵심 기여는 다음과 같습니다: 이론적으로 우리가 아는 한, CST는 텍스트 분류 작업에 체계적으로 도입되어 언어 시스템의 동적 진화와 의미론적 출현을 시뮬레이션하여 모델의 깊은 이해와 소수 샷 및 교차 도메인 데이터에 대한 적응력을 향상시킵니다. 방법론적으로는 샘플 분포 특성을 포함하는 그래프 신경망(GNN)이 설계됩니다. 결합된 혁신적인 TSMDM은 본질적으로 표준 지식 추출과는 다릅니다. 표준 지식 추출은 고정 매개변수 교사 모델(TM)에서 경량 학생 모델(SM)으로의 일방향 지식 이전을 실현합니다. 본 연구의 메타 증류는 증류를 기반으로 한 메타 학습 전략을 통합하며, SM의 학습 피드백에 따라 TM의 매개변수를 동적으로 조정할 수 있습니다. 2단계 설계는 또한 TM과 SM 간 과도한 복잡성 격차로 인한 정보 손실을 완화하기 위해 교육 보조 모델을 중간 완충층으로 설정하여, 높은 정확도를 유지하면서 모델 경량화를 크게 달성하여 자원이 제한된 상황에서 효율적인 분류 솔루션을 제공합니다.
ETC 분야에서 연구자들은 다양한 기능과 모델 아키텍처를 통합하여 다양한 시나리오에서 기술적 도전을 해결하기 위한 다양한 솔루션을 광범위한 탐구와 제안했습니다. R. Zhang 등은 현재 DL 방법을 사용하여 ETC에서 장거리 맥락 구조 정보를 충분히 포착하지 못하는 문제를 해결하기 위해 다국어 사전 학습 다기능 융합 모델(MP-MFFM)을 설계했습니다. 이 방법은 다국어 BERT, BiLSTM, 텍스트 CNN을 결합하여 깊은 의미론적, 전역적, 국소적 구조 정보를 추출하고 융합했습니다. 이 방법은 세 가지 데이터셋에서 정확도, 민감도, 정밀도를 향상시켜 효과를 입증했습니다. C. Madhu 등은 소셜 네트워크 내 비구조화 및 저주석 데이터의 텍스트 분류 요구와 방언 차이가 국제 영어 분류에 미치는 영향을 해결하기 위해 방언 특징 기반 퍼지 그래프 학습 프레임워크(DF-FGLF)를 채택했습니다. 그들은 의미론적 및 방언 차이 학습 기능을 결합하여 최적화된 퍼지 그래프를 구성했습니다. 주석이 달린 표본이 10개뿐일 때, 방언 인식 및 텍스트 분류의 F1 값은 93%와 80%를 넘어 유사 방법보다 우수하고 실용적인 분류에 적합했다. B. Shannaq 등은 영어와 아랍어 데이터셋을 사용하여 n그램 길이가 다양한 문자 체계에서 텍스트 분류에 미치는 영향과 언어 특징이 최적의 n그램 길이에 미치는 영향을 조사하는 실험을 수행했습니다. 영어 2그램의 성능은 가장 우수했으며(정확도 0.482, 기억 0.489, F1 값 =0.472), 아랍어 6그램이 최고(F1 값 약 0.85)였습니다. 언어 형태와 통사적 특징은 n-gram 모델의 성능에 큰 영향을 미쳤습니다. N. S. Lagutina 등은 문자, 어휘, 문장 구조의 서지 측정 특징을 기반으로 한 텍스트 벡터를 사용하여 학생 학습 평가를 위한 영어 단문 자동 분류를 달성했으며, SVM과 같은 표준 머신러닝 분류기를 결합했습니다. 유럽 공통 언어 참조 체계(Common European Framework of Reference for Languages) 코퍼스에서 SVM의 F1 값은 67%였고, best-BERT 모델(bert-base-cased)의 F1 값은 69%였습니다. 오류는 주로 인접 수준에서 발생했으며, 분류 품질은 코퍼스9에 따라 달라졌습니다.
지식 정류는 모델 경량 조정을 달성하고, 소규모 표본 시나리오에서 모델 성능을 향상시키며, 계산 비용을 줄이는 효과적인 수단으로서 관련 연구에서도 상당한 진전을 이루었습니다. 이전 연구들은 지식 정류를 활용해 주요 자연어 처리 과제를 해결하는 방법을 탐구해왔으며, 여기에는 저라벨 조건에서 소형 매개변수 모델의 성능 향상, 다국어 텍스트 분류 작업 최적화, 하이브리드 압축 전략을 통한 대규모 사전 학습 모델의 압축, 하드웨어에 적응하면서 대형 및 소형 언어 모델 간 성능 격차를 좁히기 위한 효과적인 문장 표현 추출 등이 포함됩니다 제약조건 10, 11, 12, 13. 이러한 발전에도 불구하고, 기존의 지식 정제 접근법은 ETC에 있어 여전히 치명적인 한계를 가지고 있습니다: 지식 이전 과정을 위한 동적 최적화 메커니즘이 부족하고, 복잡한 TM과 경량 SM 간 증류 시 심각한 정보 손실이 발생하며, 텍스트 데이터의 고유한 분포 특성과 효과적으로 통합되지 못합니다. 이러한 단점은 소수 샷 및 교차 도메인 시나리오에서 일반화 성능이 최적이 되지 않게 만듭니다. 이러한 방법으로 얻은 경량 모델은 자원이 제한된 환경에서 분류 효율성과 계산 효율성의 균형을 맞추는 데 어려움을 겪는 경우가 많습니다. 이것이 바로 이 논문에서 연구가 해결하고자 하는 핵심 격차입니다.
이 연구는 다음 연구 가설을 검증합니다: 첫째, CST를 ETC에 통합하면 자연어 시스템의 동적 진화와 의미론적 출현 특성을 효과적으로 시뮬레이션할 수 있습니다. 이러한 이론적 통합은 언어의 복잡한 시스템 특성을 무시하는 전통적인 텍스트 분류 모델에 비해 소수 샷 및 교차 도메인 시나리오에서 모델의 일반화 능력을 크게 향상시킬 수 있습니다. 둘째, 텍스트 샘플 분포 특성을 명시적으로 고려하여 설계된 GNN 모델은 인스턴스 수준 관계 모델링에만 집중하는 전통적인 GNN의 한계를 보완하고, 영어 텍스트에서 전역 및 국소 의미 정보를 더 깊이 탐굴할 수 있습니다. 셋째, TSMDM은 메타러닝 전략과 티칭 어시스턴트 모델과 결합하여 복잡한 TM에서 경량 SM으로의 효율적이고 저손실 지식 전달을 달성할 수 있습니다. 이로 인해 모델의 계산 비용과 매개변수 규모를 크게 줄이면서도 높은 분류 성능을 유지할 수 있습니다. 또한, 이 메커니즘에서 파생된 경량 모델은 복잡한 의미 구조가 있는 긴 텍스트 처리 시나리오에서도 안정적이고 효율적인 분류 성능을 유지할 수 있습니다.
요약하자면, 관련 연구들은 다기능 융합, 방언 특징 학습, n-그램 최적화, 스타일 지표 특징을 통해 텍스트 분류 성능을 향상시켰으며, 지식 정류를 통해 모델 경량화도 달성했습니다. 그러나 기존 방법들은 장거리 정보 수집, 소표본 일반화, 복잡하고 단순한 모델의 적응에 여전히 한계가 있습니다. ETC 모델의 계산 비용을 줄이면서도 정확성을 보장하기 위해, 본 연구는 CST와 TSMDM을 결합하여 모델의 일반화 능력과 계산 효율성을 높이는 경량 모델을 구축합니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
소규모 샘플과 교차 도메인 시나리오에서 ETC의 일반화 능력을 향상시키고 경량 모델을 구현하기 위해, 본 연구는 CST와 TSMDM을 통합한 텍스트 분류 프레임워크를 제안합니다. 이 프레임워크의 전체 과정은 그림 1에 나타난다.

그림 1: CST와 TSMDM을 통합한 4단계 경량 영어 텍스트 분류 프레임워크의 시각화. 작업 흐름은 네 단계로 구성됩니다. 1단계는 입력된 영어 텍스트에서 BERT 기반의 동적 임베딩을 사용하여 텍스트 표현을 수행합니다. 2단계는 텍스트 그래프를 구성하고 인스턴스 및 분포 수준 관계를 계산함으로써 그래프 신경망 모델링을 적용합니다. 3단계는 노드 중심성 재구성과 다단계 프로토타입 생성 프레임워크를 통해 의미론적 출현을 모델링하여 최종 범주 프로토타입을 얻습니다. 4단계는 2단계 원소 증류를 수행하며, 교사 모델을 훈련시키고 지식을 메타 증류를 통해 전달하여 최종 학생 모델을 만듭니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
첫째, 텍스트 표현과 동적 임베딩 단계에서 BERT 모델은 입력 텍스트를 동적으로 임베딩하고 맥락적 의미 정보를 포착하는 데 사용됩니다. 두 번째 단계는 분포 인식 GNN 모델링으로, 샘플의 분포 특성을 고려하고, GNN 모델을 구성하며, 인스턴스 수준과 분포 수준에서 이중 정보 상호작용을 통해 특징 표현을 향상시킵니다. 세 번째 단계는 하이브리드 시스템 이론에 따른 의미론적 출현 모델링으로, 노드 중심성 재구성과 3단계 프로토타입 생성 메커니즘을 도입하여 언어 시스템의 역동성과 출현을 시뮬레이션합니다. 마지막으로 4단계에서는 2단계 메타 증류 경량 작업이 수행됩니다. 지식 추출 과정은 보조 모델과 메타러닝 전략을 통해 최적화되어 효율적인 모델 압축과 가속을 달성합니다.
분포 특성과 CST를 기반으로 한 ETC 모델
모델 아키텍처 개요
제안된 텍스트 분류 모델은 먼저 사전 학습된 BERT를 사용하여 입력 텍스트의 동적 맥락 인코딩을 수행하며, 의미적으로 풍부한 단어 임베딩과 전역 표현을 생성합니다. 다음으로, 이러한 특징들로부터 인스턴스 그래프와 분포 그래프가 구성됩니다: 인스턴스 그래프는 쌍별 표본 유사도를 포착하고, 분포 그래프는 전체 데이터 분포를 모델링합니다; 두 그래프 간의 반복적인 정보 교환은 개별 특징과 전역 구조의 시너지 향상을 가능하게 합니다. 이후 CST가 통합되어 그래프 네트워크를 깊이 보강합니다. 노드 중심성 재구성은 PageRank를 사용하여 어휘적 영향력을 정량화하며, 언어 네트워크에서 핵심 요소의 지배적 역할을 시뮬레이션합니다. 이 방법은 복잡한 네트워크 토폴로지에서 노드의 전역적 영향력을 측정하는 널리 검증된 방법이며, 언어 시스템 내 핵심 어휘 노드의 비대칭 의미 분포를 포착하는 데 적합합니다. 3단계 "미시-중간-거시" 프로토타입 생성 프레임워크는 지역 의미론에서 전체론적 범주 표현으로의 출현 과정을 모방합니다. 마지막으로, 향상된 특징 표현은 분류기에 입력되어 최종 클래스 확률을 산출합니다.
분포 인식 GNN과의 기능 상호작용
ETC의 일반화 능력을 최적화하고, 텍스트와 샘플 분포 특징(SDF) 간의 복잡한 의미적 관계를 효과적으로 포착하기 위해, 본 연구는 분포 특징과 CST를 기반으로 한 ETC 모델을 구축합니다. GNN과 동적 텍스트 임베딩과 같은 메커니즘을 통합하여 텍스트 내 글로벌 및 로컬 정보를 심층 마이닝합니다. GNN은 그래프 구조화 데이터 처리를 위해 특별히 설계된 DL 모델입니다. 핵심 원칙은 메시지 전달 메커니즘(그래프 내 각 노드가 인접 노드의 특징 정보를 집계하는 방식)을 사용하고, 이를 자신의 상태와 결합하는 것입니다. 여러 차례의 반복적 업데이트를 거치면서, 위상 구조를 포함하는 고차원 표현을 점차 학습합니다. 이 과정을 통해 노드는 로컬 이웃과 심지어 전역 그래프의 구조와 특징 의존성을 포착할 수 있습니다. 장거리 의존성과 전역 관계를 모델링하는 데 있어 전통적인 서열 모델의 한계를 극복하기 위해, 본 연구는 GNN을 활용해 샘플 간의 복잡한 의미적 연관성과 구조적 관계를 포착합니다. GNN이 개별 샘플 간의 직접 상관 정보에 집중하기 때문에, 표본집합 14, 15, 16의 전체 분포 특성을 무시합니다. 따라서 본 연구는 SDF를 고려하는 GNN 모델을 제안합니다. 이 모델은 동적 텍스트 임베딩을 위한 BERT를 도입하고, 샘플의 특징 차이를 계산하기 위한 프로토타입 네트워크와 결합합니다. BERT는 Transformer 아키텍처를 기반으로 한 사전 학습된 언어 모델입니다. 핵심 원리는 양방향 인코더를 통해 문맥 내 각 단어의 의미 정보를 동시에 캡처하고, "마스크 언어 모델"과 "다음 문장 예측"이라는 두 가지 작업을 사용하여 대규모 말뭉치에서 사전 학습하는 것입니다. 마스크 언어 모델에서는 입력 내 일부 단어가 무작위로 마스크되어 있으며, 모델은 맥락에 따라 원래 단어를 예측해야 합니다. 다음 예측은 두 문장이 연속적인지 여부를 결정합니다. 사전 학습 후 BERT는 미세 조정을 통해 다양한 자연어 처리 작업에 빠르게 적응할 수 있으며, 성능을 크게 향상시키고 이후 그래프 구조 구성을 위한 고품질 특징 표현을 제공합니다. 이 연구에서 구축된 ETC 모델의 구체적 구조는 그림 2에 나타났다.

그림 2: 샘플 분포 특성을 고려한 CST 통합 영어 텍스트 분류 모델의 아키텍처 설계. 그림은 복합계 이론(CST)과 통합된 영어 텍스트 분류 모델의 아키텍처 설계와 텍스트 샘플 분포 특성을 반영한 모습을 보여줍니다. 이 아키텍처는 BERT 기반의 동적 문맥 임베딩, 분포 인식 그래프 신경망(GNN), CST 향상 메커니즘을 융합하며, 다중 모듈 협업 모델링을 통해 영어 텍스트의 전역 및 국소 의미 정보를 심층적으로 마이닝합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
이 모델에서는 일반 데이터셋의 경우, 영어 텍스트 입력이 BERT 모델에 토큰 시퀀스를 생성하여 토큰 생성을 수행합니다. 수열 구성 방법은 식(1)에 나와 있습니다.
[CLS], 1,2,... an, [SEP] (1)
식(1)에서 [CLS]는 서열 시작 지점에 위치한 분류 마커입니다. BERT는 학습 과정에서 [CLS]에 대해 고정된 위치 숨겨진 상태를 생성합니다. 이 상태는 전체 텍스트의 전역 의미 표현에 직접 사용됩니다. 1,2,... n은 텍스트 내 단어나 하위 단어를 나타냅니다. [SEP]는 문장 끝을 표시하는 구분자입니다. Bert가 위 시퀀스를 처리한 후, 각 토큰의 특징이 얻어져 모델에 구조화된 맥락 정보를 제공합니다. 엔티티를 포함하는 특수 데이터셋의 경우, 전통적인 서열 구성 방법을 사용하면 엔터티가 포함하는 위치 정보가 사라집니다. 따라서 본 연구는 식(2)에 제시된 방법을 사용하여 이 수열을 구성한다.
(2)
식(2)에서 [E1], [/E1], [E2], [/E2]는 두 개체의 시작과 종료 위치를 결정하는 토큰입니다. 마찬가지로, 버트 처리 후 이 토큰들의 출력 특징은 해당 엔티티의 의미 정보를 담아 엔티티 위치라는 중요한 정보를 더 잘 활용할 수 있습니다. 이후 본 연구는 SDF를 고려한 GNN 모델을 사용하여 샘플의 분포와 인스턴스 특성을 강화합니다. 모델의 구조는 그림 3에 나와 있습니다.

그림 3: 분포 인식 그래프 신경망 모델의 이중 그래프 특징 상호작용 아키텍처. 그림은 영어 텍스트 분류를 위한 분포 인식 GNN 모델의 이중 그래프 특징 상호작용 아키텍처를 제시합니다. 이 아키텍처는 인스턴스 수준 유사도 인코딩을 위한 점 그래프와 분포 수준 유사도 인코딩을 위한 분포 그래프를 구축하며, 두 그래프 간의 반복적인 정보 상호작용을 통해 특징 향상을 달성하여 인스턴스 특징과 분포 특징의 교차 수준 정보 순환을 완성합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
이 모델은 2단계 상호작용 메커니즘을 통해 기능 향상을 달성합니다. 첫째, 데이터 샘플의 인스턴스 수준 연관에서 분포 특징을 분석하고, 그 후 분포 수준에서 정보 교환을 통해 인스턴스 특성을 동적으로 최적화합니다. 인스턴스와 분포 수준을 반복적으로 강화함으로써 궁극적으로 분류 작업을 완성합니다. 구체적으로, 이 모델은 점 그래프와 분포 그래프를 사용하여 정보 교환을 구현합니다. 포인트 맵은 텍스트 샘플 특징 벡터(BERT의 마지막 두 레이어에 의해 업데이트됨)를 노드로 사용하고, 샘플 특징 차이를 정량화하여 전용 인코딩 네트워크(하나의 시그모이드 레이어 + 두 개의 합성곱 배치 정규화 레이어)를 통해 엣지 가중치를 계산하며, 최소-최대 정규화를 사용해 [0,1 구간까지 정규화합니다. 에지 임계값 조정에는 0.2의 경험적 유사도 임계값이 설정되며, 이 임계값보다 낮은 가중치를 가진 간선은 약한 인스턴스 수준의 상관관계를 제거하기 위해 가지치기를 합니다. 분포 그래프는 융합된 텍스트 분포 특징을 노드로 삼으며, 분포 특징 벡터의 코사인 유사성을 기반으로 엣지 가중치를 계산하고 L2 정규화를 통해 정규화하여 메트릭 일관성을 보장합니다. 0.15의 엣지 임계값을 채택하고, 이 값보다 낮은 가중치를 가진 엣지는 제거하고, 나머지 유효한 엣지 가중치는 다층 퍼셉트론에 의해 추가로 매핑 및 표준화되어 분포 수준의 연관성의 분별성을 향상시킵니다. 이 연구는 l층 반복을 위한 점 그래프
를 정의하는데, 노드
는 샘플 특징을, 엣지는
인스턴스 수준의 유사성을 인코딩합니다. 분포 맵
, 노드
는 샘플 특징을 나타내며, 엣지는
분포 수준의 유사성을 인코딩합니다. l번째부터 l+1번째 바퀴를 예로 들면, 인스턴스 수준 관계 계산은 특징 차이를 통해 점 유사성을 계산하며, 이는 식(3)에서 나타난다.
(3)
식(3)
에서 는
포인트 그래프의 l번째 및 1번째 반복 동안 노드 i와 j 사이의 엣지 가중치로, 샘플 특징의 유사성을 반영합니다.
노드 특징 차이를 엣지 가중치 스케일로 변환하는 데 사용되는 인코딩 네트워크로, 1층의 시그모이드와 2층의 합성곱 배치 정규화 함수로 구성됩니다. 와
가 l-1번째 반복일 때
, 노드 i와 j의 고유벡터는 마지막 두 계층에서 Bert에 의해 갱신됩니다. 그 후 분포 특성은 인스턴스 관계를 기반으로 계산되며, 이는 식(4)에 나타난다.
(4)
식(4
)에서 는 l층 분포 그래프에서 노드 i의 고유벡터이다. MLP1은 활성화 함수와 완전 연결 계층으로 구성된 다층 퍼셉트론으로, 연결된 복합 특징들을 새로운 분포 특징으로 매핑합니다. 그 후 분포 특성을 기반으로 분포 관계를 계산하고, 인스턴스 특징은 분포 관계를 바탕으로 계산하여 교차 수준 정보 루프를 완성합니다.
복잡 시스템 향상 메커니즘
일반화 능력을 더욱 향상시키기 위해 본 연구에서는 위 모델에 CST를 적용합니다. 복잡한 시스템의 역동적 진화는 노드 영향의 이질적 분포로 나타납니다. 언어 체계에서 의미 전파에서 핵심 어휘의 지배적 역할을 시뮬레이션하기 위해, 본 연구는 정보 전파 메커니즘을 재구성하기 위해 노드 중심성 지수를 도입한다. 각 시나리오 과제에 대해 구성된 점 그래프 Hp 는 PageRank 알고리즘을 사용하여 노드 C(hi)의 중심성을 정량화하는데, 이는 식(5)17에 나타난 바와 같다.
(5)
식(5)에서 α는 감쇠 계수이며, α = 0.85이다. N(hi)는 인접한 노드들의 집합을 나타내고, L(hj)는 노드 차수이다. 식(5)은 시뮬레이션된 언어 네트워크에서 어휘 영향의 연쇄 전파 과정을 대체하여 핵심 어휘(동사나 주제어)가 더 높은 중심성을 갖게 합니다. 그 후 노드 중심성을 엣지 가중치와 결합하여 노드 간 정보 전파 강도를 동적으로 조정합니다. 결합 함수 λij는 식(6)에 나타난다.
(6)
식(6)에서 σ는 시그모이드 활성화 함수이고, WT 는 학습 가능한 가중 벡터이며, b는 편향 항을 의미합니다. 중심성과 엣지 가중치의 결합은 지역적 관계와 전역 중요도를 동적으로 균형 있게 조정하여, 작업의 동적 변화에 대한 모델의 적응력을 향상시킵니다. CST의 등장은 영어에서 지역 어휘의 합을 초과하는 전체 의미론으로나타납니다. ETC에서 이 특징을 활용하기 위해, 본 연구는 그림 4에 나타난 것처럼 미시적 특징에서 거시 범주로의 출현 과정을 시뮬레이션하는 3단계 프로토타입 생성 프레임워크를 설계합니다.

그림 4: 언어 의미론적 출현을 위한 미시-중간-거시 3단계 프로토타입 생성 프레임워크의 단계별 구축. 그림은 영어 텍스트 분류에서 언어적 의미론적 출현을 시뮬레이션하기 위한 마이크로-메소-매크로 3단계 프로토타입 생성 프레임워크의 단계별 구축을 보여줍니다. 이 프레임워크는 K-평균을 이용한 미시 하위 클래스 클러스터링, 분포 유사성 가중치에 기반한 중세 하위 클래스 프로토타입 융합, 그리고 주의 메커니즘을 통한 거시 비선형 적분을 통해 계층적 텍스트 범주 표현을 구축하며, 언어 시스템에서 "전체가 부분의 합보다 크다"는 새로운 특성을 시뮬레이션합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
위 과정은 미시에서 거시로 텍스트 범주 표현을 단계별로 구성하여 모델의 일반화 능력을 향상시킵니다. 미시적 수준에서는 각 텍스트 범주의 샘플 임베딩 표현을 클러스터링하여 K 하위 클래스가 생성됩니다. K-평균은 범주 내 샘플을 하위 그룹으로 나누는 데 사용되며, 각 하위 그룹의 중심점 위치는 하위 클래스 프로토타입19로 계산됩니다. 중간경적 수준에서는 각 하위 클래스 프로토타입의 분포 유사도를 계산하고, 유사도 행렬을 생성한 후, 유사도 가중치를 기반으로 하위 클래스 프로토타입을 재조립하여 하위 클래스 간 상관관계를 정량화합니다. 하위 클래스 유사성 가중치 w_j 의 계산은 식(7)에서 나타난다.
(7)
식(7)
에는 두 하위 클래스
간 분포 차이를 측정하는 젠슨 섀넌 발산이 있습니다. 마지막으로, 서브클래스 프로토타입에 가중치를 부여하고 융합하여 클래스 분포 표현
집합을 얻습니다. 거시 수준에서는 각 하위 클래스의 중요도 가중치를 주의 메커니즘을 통해 학습하고, 비선형 변환을 도입하여 출현 과정을 시뮬레이션하여 최종 클래스 프로토타입 c 최종 결과를 낳는다. 이는 식(8)에서 보여준다 .
(8)
식(8)에서 α k는 k-클래스의 주의 가중치를 의미한다. U는 비선형 변환 가중치 행렬을 나타낸다. 탄(·)은 비선형 표현을 향상시키고 복잡한 시스템의 특징인 부분 합보다 큰 전체를 시뮬레이션하는 데 사용됩니다. 각 수준은 하위 클래스 구조를 통해 범주 내 다양성을 포착하고, 노이즈가 많은 하위 클래스의 영향을 줄이기 위해 분포 유사성을 가중치하며, 주의 메커니즘을 통해 모델의 일반화 능력을 향상시키기 위해 구별적 특징에 동적으로 집중합니다. CST는 주로 두 가지 메커니즘을 통해 GNN과 통합됩니다. 첫 번째는 노드 중심성을 도입하여 정보 전파 과정을 재구성하고 언어 체계 내 어휘 영향의 이질적 분포를 시뮬레이션하는 것입니다. 노드 중심성은 PageRank 알고리즘을 통해 정량화되고 엣지 가중치와 동적으로 결합되어 핵심 어휘가 의미 전파에서 우위를 점하고 모델이 작업의 동적 변화에 적응할 수 있도록 합니다. 둘째는 마이크로 하위 클래스 클러스터링부터 거시 범주 프로토타입 융합에 이르기까지 3단계 프로토타입 생성 프레임워크를 설계하여 언어 시스템 내에서 "전체가 부분의 합보다 크다"는 새로운 특징을 시뮬레이션하는 것입니다. 이 프레임워크는 분포 유사성 가중치와 주의 메커니즘을 통해 국소 특징에서 전역 의미론으로의 계층적 통합을 달성합니다.
요약하자면, 구축된 ETC 모델의 핵심 혁신은 CST의 아이디어를 GNN 프레임워크에 깊이 통합한 데 있습니다. 노드 중심성을 통해 정보 전파 메커니즘을 재구성함으로써, 이 모델은 언어 시스템 내 핵심 요소의 주도적 역할을 시뮬레이션하고 작업 역학에 대한 적응성을 향상시킵니다. 3단계 프로토타입 생성 프레임워크를 통해 모델은 국소적 특징에서 전역 의미론으로의 출현 과정을 실현하여, 범주 내 다양성과 구별적 특징을 포착하는 능력을 향상시킵니다. 이 방법은 인스턴스 수준 관계에만 의존하는 전통적인 GNN의 한계를 피할 수 있습니다. 분포 수준의 상호작용과 복잡한 시스템 특성을 통해 소샷 및 교차 도메인 시나리오에서 모델의 일반화 능력을 향상시키는 새로운 해결책을 제공합니다.
CST의 출현적 특성은 3단계 프로토타입 생성 프레임워크에 해당합니다. 언어 체계에서 "전체가 부분의 합보다 크다"는 원리는 지역 단어 의미에서 전체 텍스트 범주로의 의미적 도약으로 나타납니다. 본 연구는 "마이크로-메소-매크로" 3단계 프로토타입 생성 메커니즘을 통해 이 과정을 시뮬레이션합니다: 미시적 수준에서는 샘플 임베딩을 클러스터링하여 하위 클래스 프로토타입을 형성하고; 중도 수준에서는 이러한 프로토타입들이 분포 유사성에 따라 가중치를 부여하고 융합됩니다; 거시 수준에서는 최종 범주 프로토타입이 주의 메커니즘을 통해 비선형적으로 합성됩니다. 예를 들어, 감정 분류에서는 "실망", "느리다", "비싼" 같은 여러 부정적인 단어들이 비선형적으로 섞여 강한 전반적 감정인 "부정적 평가"로 나타납니다. CST의 노드 중심성과 이질성은 노드 중심성 재구성 기반 정보 전파 메커니즘과 일치합니다. 언어 네트워크 내에서 단어의 영향력은 고르게 분포되어 있으며, 핵심 단어들(예: 동사, 주제 용어)이 의미 전파에서 지배적인 역할을 합니다. 본 연구는 PageRank 알고리즘을 사용하여 노드 중심성을 정량화하고, 이를 엣지 가중치와 동적으로 결합하여 노드 간 정보 확산의 강도를 조정합니다. 예를 들어, 뉴스 분류에서 "선거"라는 용어는 정치 텍스트에서 매우 중심적인 위치를 차지하며, "vote"와 "campaign"과 같은 인접 노드들이 정보 집계 시 더 높은 비중을 얻게 하여 해당 주제의 의미 표현을 강화합니다. CST의 역동적이고 적응적인 특성은 분포 인식 GNN과 메타 증류 내의 교육 실험 메커니즘에 해당합니다. 언어 시스템은 맥락과 작업 요구사항에 따라 동적으로 진화합니다. 모델은 분포 인식 GNN을 통해 데이터셋의 전체 분포 변화를 포착합니다. 동시에 TSMDM에는 메타러닝에 기반한 교육적 실험 메커니즘이 도입되어 TM이 SM의 피드백을 기반으로 매개변수를 동적으로 조정할 수 있습니다. 예를 들어, 교차 도메인 감정 분석에서는 모델이 대상 도메인의 데이터 분포를 기반으로 특징 가중치를 빠르게 적응시키고, 메타 증류 중 TM의 매개변수를 정제하여 새로운 도메인에 대한 적응 효율성을 향상시킬 수 있습니다.
TSMDM 기반의 LTC 모델
2단계 메타 증류 파이프라인
자원이 제한된 환경에서 높은 계산 비용과 배포 어려움이라는 문제를 해결하기 위해, TSMDM 기반의 경량 텍스트 분류 모델을 제안합니다. 이 메타 증류 방법은 두 단계로 나누어 엄격한 순차적 순서로 증류 과정을 수행합니다. 두 번째 단계는 첫 번째 단계의 교육이 완료되고 수렴된 후에만 시작됩니다: 1) 교사에서 조교(TA) 지식 압축 단계, 2) 메타 학습 매개변수 적응과 통합된 TA에서 학생으로의 경량 증류 단계입니다. 이 접근법은 복잡한 TM에서 경량 SM으로의 효율적인 지식 이전을 2단계 증류를 통해 달성하며, 메타러닝 메커니즘을 도입해 과정에서 지식 이전 전략을 동적으로 최적화합니다(21,22). 전체 파이프라인은 그림 5에 나와 있습니다.

그림 5: 2단계 메타 증류 메커니즘을 가진 경량 텍스트 분류 모델의 파이프라인 설계. 그림은 2단계 메타 증류 메커니즘(TSMDM)을 가진 경량 텍스트 분류 모델의 파이프라인을 설계합니다. 이 파이프라인은 교사 모델(고복잡도 지식 소스), 조교 모델(중간 복잡도 버퍼 계층), 학생 모델(경량 목표 모델)으로 구성되며, 교사-조교 지식 압축과 조교-학생 간-학생 경량 추출이라는 두 단계의 순차적 단계를 통해 효율적인 지식 이전을 구현합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
이 방법은 TM, TA 모델, SM 세 가지 역할을 포함하며, 증류 과정은 교사-조교 증류와 TA-학생 증류 두 단계로 나뉩니다. 첫 번째 교사-TA 지식 압축 단계에서는, TM에서 얻은 지식을 먼저 중간 복잡도 TA 모델로 압축하여 직접 증류에서 발생하는 과도한 용량 격차로 인한 정보 손실을 완화합니다. 지식 소스인 TM은 출력 분류 확률과 중간 계층 특징을 모두 TA 모델로 전송합니다. TA 모델은 분류 손실과 특징정렬 손실을 통합한 결합 손실 함수를 사용해 교사의 출력과 특징 표현을 정렬하여 학습합니다. TA 모델의 수렴 시점에 시작되는 두 번째 TA-학생 경량 증류 단계에서는 TA 모델에서 최종 경량 SM으로 지식을 더욱 증류합니다. 이 단계는 이중 감독(분류 로그이트와 중간 특징)을 활용하며, 메타 학습 메커니즘을 포함합니다: TM은 보조 과제에 대해 "교육 실험"을 수행하여 학생의 학습 상태를 평가하고, 자체 매개변수를 동적으로 조정하여 보다 적응적이고 목표 지향적인 지침을 제공합니다. SM은 TA 모델에 비해 출력 차이와 특징 거리를 최소화함으로써 학습을 완료하여, 분류 성능을 최대한 유지하면서 상당한 매개변수 감소를 달성합니다22.
교수 실험을 통한 메타 학습
전통적인 지식 증류 방법에서는 훈련된 TM이 손실 계산에 참여하여 SM을 안내합니다. 그러나 고정 매개변수 TM은 SM의 실제 학습 상태를 평가하기 어렵고, SM 매개변수 업데이트에 대한 가이드의 구체적 기여도를 정량화할 수 없습니다23,24. 따라서 본 연구는 메타 학습 아이디어를 증류 과정에 도입하여 TM이 SM의 학습 피드백에 따라 자체 매개변수를 조정할 수 있도록 합니다. 증류 과정은 그림 6에 표시되어 있습니다.

그림 6: 메타 증류의 반복적 매개변수 최적화 과정과 교육 실험 메커니즘을 결합한 과정. 그림은 메타 증류의 반복적 매개변수 최적화 과정과 영어 텍스트 분류 모델 경량화를 위한 교육 실험 메커니즘을 결합한 과정을 보여줍니다. 이 과정은 학생 모델에서 임시 내적 학습자를 생성하고, 내적 학습자의 시뮬레이션된 훈련 수행을 통해 교수 효과 손실을 정량화하며, 교사 모델이 손실의 역전파를 통해 자체 매개변수를 조정할 수 있도록 하여 이후 지식 이전 전략을 최적화합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
TM은 자체 훈련 단계에서 기존 분류 작업을 통해 매개변수를 최적화하여, 원래 성능을 반영하는 기본 분류 손실 LT를 생성합니다. 훈련을 완료한 후, SM S 는 내부 학습자 S1의 임시 복사본을 생성하기 위해 복제됩니다. TM은 S1에 대해 교육 실험을 수행하며, 이 시뮬레이션 훈련에서 S1 이 보인 종합 성능 오차는 손실 LQ로 정량화된다. 이 신호는 TM에 대한 피드백으로 사용되어 교수의 효과를 평가합니다. LQ의 역전파를 통해 TM은 자신의 매개변수를 적극적으로 조정하고 지식 전달 방식을 최적화합니다. 메타 학습 최적화를 완료한 후, TM은 원래 SM S에 대해 형식적 지식 정제를 수행하고, 모델 손실 LS를 피드백으로 사용하여 TM에 효과 평가를 가르칩니다. ETC 모델의 경량화를 달성하기 위해, 본 연구는 그림 7에 나타난 대로 SDF GNN 모델을 TM으로 교육 실험 과정에 통합하는 것을 고려할 것입니다.

그림 7: 메타 증류에서 교사 모델 최적화를 위한 교수 실험 메커니즘의 매개변수 업데이트 흐름. 그림은 메타 증류 과정에서 교사 모델 최적화를 위한 교수 실험 메커니즘의 매개변수 업데이트 흐름을 보여줍니다. 플로우는 먼저 평균 제곱 오차 손실 함수를 이용해 내면의 학습자 예측과 교사 모델 예측 간의 소프트 손실을 계산하고, 소프트 손실과 하드 라벨 오차를 결합해 총 훈련 손실을 만들며, 가중 총 오차의 역전파를 통해 교사 모델의 매개변수를 업데이트하여 교수의 효과를 향상시킵니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
지식 증류 훈련을 완료한 후, SM은 먼저 TM의 예측 결과와 실제 라벨 간의 차이를 계산합니다. 이후 MSE 손실 함수를 사용하여 SM 예측(내부 학습자 S1)과 TM 예측 사이의 거리를 측정합니다. 이 거리 값은 소프트 손실25로 사용됩니다. 최종 훈련 목표는 하드 라벨 오류와 소프트 손실의 가중치 조합으로 구성됩니다. 가중 총 오차를 역전파함으로써 TM의 매개변수가 업데이트되어 TM의 교수 효과를 향상시킵니다. 내부 학습자 S1 의 매개변수 계산은 식(9)에 나타난다.
(9)
식(9)
에서 와
는 내부 학습자 매개변수이며, T γ TM 매개변수에 영향을 받는 초기 매개변수이다. λ(학습률, λ = 0.005)는 메타 증류26 중 내부 학습자(즉, SM의 복사본)의 매개변수 업데이트 단계 크기를 제어합니다. 식(9)은 역전파를 통해 손실 구배를 계산하며, λ는 내부 학습자의 매개변수를 업데이트합니다. 이 메커니즘은 SM의 학습 특성을 반영하여 TM들이 피드백을 받고 교수 전략을 조정할 수 있게 하여 이후 지식 정제의 효과를 높입니다. 메타 학습에서 손실 LS 계산은 식(10)에 나타난다.
(10)
식(10)에서 B는 메타학습 샘플 시퀀스입니다.
손실 설계 및 보조 모델을 통한 지식 이전 최적화
지식 증류의 효과를 더욱 높이기 위해, 본 연구는 분류 손실과 특징 손실을 계산하여 전체 손실을 구합니다. 그중 특징 손실은 TM의 얕고 전류 있는 특징 출력을 사용하여 SM을 안내하는 소급적 메커니즘을 채택하는데, 이는 식(11)에 표현됨).
(11)
식(11)에서 I는 특징층 인덱스의 집합이다. D는 두 특징 표현 간의 차이를 계산하기 위해 사용되는 거리 함수입니다. 그리고 TM과 SM에서 객관적 표현 함수로, i번째와 j번째 층의 특징 출력
과
을 주의 행렬로 변환합니다.
분류 손실은 SM 출력과 진짜 라벨 간의 교차 엔트로피 손실, 그리고 두 모델 출력 간의 MSE를 결합하여 소프트 손실27,28로 표현합니다. 궁극적으로 두 가지 가중치를 매겨 전체 손실을 얻어, 관리자가 TM으로부터 더 나은 안내를 받을 수 있도록 돕습니다. 지식 추출 과정 중 성능 손실을 최소화하기 위해, 본 연구는 그림 8에 나타난 대로 조교 모델을 두 모델 사이에 배치합니다.

그림 8: 교육 보조 모델을 중간 완충층으로 하는 2단계 지식 증류 처리 흐름. 그림은 교육 보조 모델을 중간 완충층으로 사용하는 2단계 지식 증류 처리 과정을 보여줍니다. 1단계는 특징 손실과 분류 손실을 융합하여 총 증류 손실을 구성하고, 교사 모델의 지식을 학습시키며; 두 번째 단계는 동일한 손실 융합 전략을 채택하여 조교 모델의 지식을 학생 모델에 증류하여, 교사와 학생 모델 간 과도한 복잡성 격차로 인한 정보 손실을 줄입니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
메타 증류 단계를 완료한 후, TA 모델과 TM은 전통적인 지식 증류를 거칩니다. 이 과정에서 두 피처를 동시에 추출하고 해당 손실 La 가 계산됩니다. 이후 이 특징 손실은 모델의 분류 손실 LM1 과 융합되어 1단계에서 증류 손실 함수
를 형성하는데, 이는 식(12)에 나타난 바와 같다.
(12)
식(12)에서 β는 전체 손실에서 특징 손실과 분류 손실의 비율을 제어하는 데 사용되는 무게 계수이다. 는 교수 보조 모델과 TM에서 객관적 표현 함수로, i번째와 j번째 층의 특징 출력
과
를 주의 행렬로 변환합니다.
zT 와 zM 은 TM과 보조 모델의 출력입니다. 조교 모델에서 SM으로의 증류 과정은 위의 과정과 동일하며, 여러 차례 반복을 거쳐 지식 전달을 완성하기 위해 SM의 손실을 최소화합니다.
결론적으로, 제안된 TSMDM의 핵심 기여는 메타러닝 메커니즘을 통한 지식 이전 과정을 최적화하는 데 있습니다. 전통적인 증류와 비교할 때, 이 방법의 핵심 장점은 동적 교육 능력에 있습니다: TM은 SM의 실시간 피드백을 기반으로 교육 실험 메커니즘을 통해 자체 매개변수를 조정할 수 있어 보다 목표 높은 지침을 제공합니다. 한편, 조교 모델은 완충층으로 도입되어 TM과 SM 간의 복잡성 격차를 효과적으로 메우고 지식 전달에서의 정보 손실을 줄입니다. 이 "메타러닝 최적화 교수 전략"과 "전이 난이도 감소를 위한 2단계 버퍼링"의 협력 설계는 최종 SM이 복잡한 TM에서 추출한 핵심 지식을 최대한 유지하면서도 상당한 경량 조정을 달성할 수 있게 합니다.
데이터 이용 가능성
현재 연구 중에 생성되거나 분석된 데이터셋은 보충 파일 1에 제공되어 있습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
실험 설정 및 데이터셋:
제안된 모델의 소표본 교차 도메인 분류 작업에서의 성능과 경량 효율성을 포괄적으로 평가하기 위해, FewRel(소표본 관계 분류), ARSC(교차 도메인 감정 분석), Reuters-21578(다주제 뉴스 분류), ArXiv(장기 학술 초록) 네 가지 데이터셋에서 실험이 수행되었습니다. FewRel은 위키피디아에서 가져온 널리 사용되는 소표본 관계 분류 데이터셋으로, 100개의 의미 관계 범주(예: "비즈니스/회사 창업자", "위치/국가-자도")를 포함하고 있으며, 각 범주마다 700개의 고품질 문장이 포함되어 있습니다. ARSC는 실제 세계 교차 도메인 시나리오에서 모델의 성능을 평가하며, 23개의 아마존 제품 카테고리(예: "책", "DVD", "주방 가전제품")에 대한 사용자 리뷰를 포함해 69개의 이진 감정 분석 과제(긍정/부정)를 구성합니다. Reuters-21578은 고전적인 다중 카테고리 뉴스 문...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
소샷 및 교차 도메인 시나리오에서 ETC의 일반화 능력을 향상시키고 계산 비용을 줄이기 위해, 본 연구는 CST와 TSMDM을 통합한 경량 텍스트 분류 프레임워크를 제안합니다. CST를 TSMDM 프레임워크와 통합함으로써 기존 ETC 방법의 핵심 한계(부실한 소샷/교차 도메인 일반화, 높은 계산 비용)를 해결하여, 언어 시스템 역학과 새롭게 등장하는 의미론적 특성을 모델 설계에 주입하고, 경량 압축을 위한 효율적인 지식 전달을 가능하게 합니다. 이러한 설계 시너지는 자원이 제한된 환경에서 기존 방법보다 모델이 우수한 성능을 내는 핵심입니다.
이론적으로 CST의 텍스트 분류 도입은 전통적인 모델의 국소 의미론이나 정적 분포에 의존하는 것을 넘어서, 언어를 역동적이고 출현적인 특성을 가진 복잡한 시스템으로 이해하기 위한 새로운 계산 모델링 관점을 제공합니다31. 방법론적으로, 제안...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자들은 공개할 것이 없습니다.
저자들은 인정할 것이 없다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
```html
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| 중앙 처리 장치 (CPU) | 상용 하드웨어 공급업체 (인텔, 델, 레노버) | 인텔 i5-7300HQ | 하드웨어 사양 |
| 그래픽 처리 장치 (GPU) | 상용 하드웨어 공급업체 (엔비디아, 에이서) | 엔비디아 GeForce RTX 3060, 12 GB VRAM | 하드웨어 사양 |
| 임의 접근 메모리 (RAM) | 상용 하드웨어 공급업체 | 16 GB DDR4 | 하드웨어 사양 |
| 고체 상태 드라이브 (SSD) | 상용 하드웨어 공급업체 | 1 TB NVMe SSD | 하드웨어 사양 |
| 운영 체제 | 마이크로소프트 공식 웹사이트 | 윈도우 10 (64비트) | 시스템 소프트웨어 |
| 파이썬 | 파이썬 공식 웹사이트 (python.org) | 파이썬 3.8 | 프로그래밍 언어 |
| 파이토치 | 파이토치 공식 웹사이트 (pytorch.org) | 파이토치 1.11.0 | 딥러닝 프레임워크 & 핵심 라이브러리 |
| CUDA | 엔비디아 공식 웹사이트 | CUDA 11.3 | 딥러닝 프레임워크 & 핵심 라이브러리 |
| 허깅페이스 트랜스포머 | 허깅페이스 허브 (huggingface.co) | 안정 버전 (파이썬 3.8/파이토치 1.11.0에 맞춤) | 딥러닝 프레임워크 & 핵심 라이브러리 |
| 넘파이 | PyPI (pypi.org) | 안정 버전 (파이썬 3.8에 맞춤) | 데이터 처리 & 통계 라이브러리 |
| 판다스 | PyPI (pypi.org) | 안정 버전 (파이썬 3.8에 맞춤) | 데이터 처리 & 통계 라이브러리 |
| 스키키트-러닝 | PyPI (pypi.org) | 안정 버전 (파이썬 3.8에 맞춤) | 데이터 처리 & 통계 라이브러리 |
| 사이파이 | PyPI (pypi.org) | 안정 버전 (파이썬 3.8에 맞춤) | 데이터 처리 & 통계 라이브러리 |
| 매트플롯립 | PyPI (pypi.org) | 안정 버전 (파이썬 3.8에 맞춤) | 시각화 라이브러리 |
| 아담W | 파이토치 내장 | 파이토치 1.11.0에 통합됨 | 최적화기 |
| BERT | 허깅페이스 허브 (huggingface.co) | BERT-base (bert-base-cased) | 사전 학습된 모델 |
| FewRel | FewRel 공식 저장소 (GitHub) / 위키백과 | 100개의 의미 관계 카테고리, 카테고리 당 700문장; 훈련/검증/테스트 분할 (5:2:3) | 데이터셋 |
| ARSC | 공개 교차 도메인 감성 분석 데이터셋 (GitHub/ACL Anthology) | 23개 아마존 제품 카테고리, 69개의 2진 감성 분석 태스크; 훈련/검증/테스트 분할 (4:2:3) | 데이터셋 |
| Reuters-21578 | UCI 머신 러닝 저장소 / 로이터 공식 아카이브 | 21,578개 뉴스 기사, 90개의 주제별 카테고리; ModApte 분할 방법 | 데이터셋 |
| 아르키브 | 아르키브 공개 API (arxiv.org) | 컴퓨터 과학 논문 요약; 훈련/검증/테스트 분할 (7:2:1) | 데이터셋 |
| 토크나이저 | 허깅페이스 허브 (huggingface.co) | BERT-base-cased 토크나이저 | 기타 필수 도구 |
| 깃 | 깃 공식 웹사이트 (git-scm.com) | 최신 안정 버전 | 기타 필수 도구 |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청