Method Article

디지털 기업에서 지식 검색을 위한 트랜스포머(BERT)의 양방향 인코더 표현과 그래프 신경망(GNN)을 결합한 AI 워크플로우

DOI:

10.3791/70045

April 28th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 프로토콜은 BERT를 엔터티 및 관계 추출을 위해 미세 조정하고, 온톨로지 정렬을 위해 그래프 신경망을 활용하며, 비정형 데이터로부터 기업 지식 그래프를 구축하고, 의미론적 검색 성능과 의사결정 지원 효율성을 체계적으로 평가하는 재현 가능한 AI 기반 워크플로우를 제시합니다.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

대량의 비구조화된 조직 데이터는 기업 지식 관리(KM) 시스템이 정확하고 맥락적으로 적합한 정보를 추출하기 어렵게 만들어, 비효율적인 지식 공유와 의사결정 지연으로 이어질 수 있습니다. 이 연구는 이러한 한계를 극복하기 위한 통합 인공지능 기반 프레임워크를 제안합니다. 이 도구는 온톨로지 정렬과 의미론적 추론을 위한 그래프 신경망(GNN)과 도메인 특화 엔터티 및 관계 추출을 위한 정제된 양방향 인코더 표현(BERT)을 결합합니다. 체계적인 데이터 수집, 기업용 텍스트 말뭉치 전처리, BERT를 세밀하게 조정하여 엔터티와 관계를 식별하고, 추출한 삼중 함수를 구조화된 지식 그래프로 변환하며, 이기종적인 지식 소스 간 의미적 일관성을 보장하기 위한 GNN 기반 온톨로지 정렬이 방법론적 파이프라인을 구성합니다. 실제 기업 시나리오에서 시스템 효율성을 평가하기 위해, 이 프레임워크는 검색 정밀도, 온톨로지 정렬 올바름, 의사결정 지연 등 작업 지향적 평가 지표도 통합합니다. 기본 방법과 비교했을 때, 두 산업 응용 분야에서 실험적 검증은 의사결정 지연이 35% 감소하고 지식 검색 정밀도가 21% 향상된 것으로 나타났습니다.

더불어, 사용자 피드백에 따르면 KM 인터페이스는 의미 검색과 맥락 태깅 기능을 통해 사용자 만족도를 높였다고 합니다. 제안된 아키텍처는 그래프 기반 추론과 정렬을 딥러닝 기반 정보 추출과 체계적으로 융합하여 비정형 기업 데이터에서 재현 가능한 지식 그래프 구축을 용이하게 합니다. 연구 결과는 조직화된 지식 표현이 조직 절차와 일치할 때 전략적 및 운영 KM 결과가 모두 향상됨을 보여줍니다. 종합적으로 제안된 방법은 검색 정확도를 높이고, 의사결정 워크플로우 반응 속도를 높이며, 기업용 KM 시스템에 실용적이고 확장 가능한 옵션을 제공합니다.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

효과적인 KM은 데이터 저장소가 분리되어 있고, 조직 플랫폼이 다양하며, 비구조화된 문서에 분산된 지식 때문에 디지털 전환 프로그램에서 도입하기 어려울 수 있습니다. 기업 지식을 체계적으로 추출, 구조화, 정렬 및 운영화하는 재현 가능하고 기술적으로 구현 가능한 프레임워크는 많은 연구에서 제안되지 않았으며, 이전 연구들은 조직 및 부문별 관점에서 AI 도입과 디지털 전환을 다룬 바있습니다. 1, 2, 3. 현재의 방법들은 주로 관리적 또는 전략적 결과에 초점을 맞추지만, 대규모 배포를 위한 충분한 아키텍처 세부사항을 제공하지 못합니다.

기존의 관리 정보 시스템(MIS)과 기업 자원 관리(ERP) 시스템은 주로 구조화된 데이터를 처리하고 트랜잭션 보고를 촉진하지만, 비구조화된 텍스트를 처리하거나 문맥 인식 의미 추론을 수행할 수는 없습니다. 반면, 복잡한 텍스트 코퍼라 4,5에서 나오는 문맥적 엔터티와 RE는 BERT와 같은 트랜스포머 기반 모델 덕분에 가능해집니다. 마찬가지로, GNN은 다양한 분야에서 관계 추론, 그래프 표현 학습, 온톨로지 정렬에 매우 뛰어난 능력을 입증했습니다 6,7,8. 이러한 발전에도 불구하고, 현재 연구에서는 이러한 모델들을 통합된 비즈니스 KM 파이프라인에 통합하기보다는 개별적으로 사용하는 경우가 많습니다.

빅데이터 분석, 클라우드 컴퓨팅, 산업용 사물인터넷, 첨단 머신러닝은 제조, 의료, 전문 서비스, 거버넌스 등 산업에서 디지털 전환을 가속화한 최근 기술 발전의 예입니다. 동시에 국제 정책 프레임워크는 AI의 책임 있는 적용에 강한 중점을 두고 있으며,디지털 시스템에서 윤리적 정렬, 책임성, 투명성을 강조합니다. 그럼에도 불구하고, 기존 KM 시스템에서 윤리적 해석 가능성과 기술적 견고성이 단일 아키텍처에 결합되는 경우는 드뭅니다.

예를 들어, 환경, 사회, 지배구조(ESG) 보고서에서는 AI 기반 의사결정이 인간의 결정을 요구하는 복잡한 도덕적 문제를 무시할 수 있습니다. 전문 결정16 을 활용한 데이터 평가 능력 감소는 지식에 과도하게 의존함으로써 발생할 수 있습니다. 역사적으로 경제적 지식과 내담자 상호작용에 기반해 온 PA의 상담 기능은 자동화로 인해 궁극적으로 축소될 수있습니다. 이는 직업을 발전시키기 위한 도구들이 의도치 않게 중요한 인간 능력을 저해할 수 있어 혼란을 초래할 수 있습니다.

최첨단 디지털 기술과 도덕적 상업적 성과에 대한 향상된 불안감이 결합된 자연스러운 결합은산업 발전의 획기적인 단계인 산업 6.0을 상징합니다. 이 단계는 인더스트리 4.0과 인더스트리 5.0을 기반으로 하며, 기술 성장의 다음 단계입니다. 발명이 인간의 적성을 대체하는 것이 아니라 발전시키는 시대를 시각화함으로써, Industry 6.0은 이러한 생각을 확장합니다. 이 계획은 기계화에 대한 도덕적 우려를 담론하면서도 인간과 로봇 간의 협력, 누적 효율성20을 지지한다. 직원 DL의 비즈니스 요소는 회사 내 동료들과의 상호작용이 개인의 디지털 기술 역량과 이해도를 자주 형성하기 때문에 중요합니다. 이 전략은 노동자와 신기술이 협력하여 다양한 업무와 운영을 기업에서 수행할 수 있도록 하는 방법을 명확히 하려는 연구들과 일치하고자 합니다21,22. 더 큰 소비자 기반에 노출될 수 있기 때문에, DL은 소규모 기업의 생존에 매우 중요한 것으로 여겨집니다23. 전통적인 회사 구조에 비해 중소기업의 경영진은 기술 발전을 활용하여 더 효율적이고 적은 물리적 자산으로 회사를 운영할 수 있습니다24,25.

온라인 광고 역량의 개발은 실질적으로 비즈니스 성과를 향상시키며, 기술 발전과 기업 목표와의 연계와 같은 기술 자원에 의존합니다. 그러나 기업의 전자적 집중과 고객 환경의 기술 혁신은 이러한 영향의 완화 역할을 합니다27. 기업은 디지털 기술을 비즈니스, 제품, 제공 및 계획에 깊이 통합함으로써 IT 발전과 동기화를 통해 온라인 판촉 역량을 더 효과적으로 개발할 수 있습니다.

AI 기술 준비금의 두 가지 메커니즘은 빅데이터 플랫폼 조직, 추가 및 발전에 사용할 수 있는 자본 지출(capex)과, 조직 내 AI 및 빅데이터 도구 라이선스 승인에 사용되는 운영 비용(운영 비용), 그리고 직원을 위한 AI 관련 교육입니다28. Lee의 AI 자산 활동에 관한29번째 조사에 따르면, AI 도입의 이점은 다른 기술에도 참여하고 내부 연구개발 전략을 따르는 기업에 더 크다고 합니다. 또한, 외부 기관에서 고용할지, 내부 AI인력을 고용할지 결정하는 것이 중요합니다. 이 교육 분야에서 인사의 위치는 현재 연구의 주요 초점이며, 결과는 사내 AI 지식을 가진 기업들이 경쟁사보다 우위를 점하기 위해 인재 개발에 투자한다는 것을 보여줍니다31,32.

33곳에서 GNN과의 단백질 상호작용이 예측되었고, LLMs로 예측이 검증되었습니다. 이 접근법은 매우 정확했고 해석 가능한 설명을 제공했습니다. BERT와 같은 첨단 머신러닝 및 딥러닝 기법은 위기 상황에서 대규모 소셜 미디어 데이터를 연구하는 데 사용되었습니다. RNN, CNN, GCN은 방대한 양의 데이터를 처리하고 분류하는 데 도움을 주며,종양 검출에 적용될 수 있습니다. 36, 37, 38, 39의 저자들은 사회적 그래프와 지식 그래프를 GNN 기반 모델에 통합하여 추천자 시스템을 보완하는 새로운 접근법을 제시합니다.

이전 연구들은 AI와 빅데이터 분석이 전문 환경에서 변혁적 힘으로 인정받고 있음에도 불구하고, 트랜스포머 기반 의미 추출과 그래프 기반 추론이 어떻게 체계적으로 통합되어 운영 및 전략적 KM 기능을 개선할 수 있는지에 대해 철저히 조사하지 않았습니다. 특히, (i) 비구조화된 기업 텍스트를 의미적으로 정렬된 지식 그래프로 변환하고, (ii) 먼 출처 간 온톨로지 수준의 일관성을 보장하며, (iii) 기업 의사결정 지원의 영향을 통계적으로 평가하는 확립된 프레임워크가 부족합니다.

이 격차를 해소하기 위해, 본 연구는 전통적인 ERP/MIS 기반 및 키워드 기반 KM 시스템과 비교할 때, 도메인 적응형 트랜스포머 기반 정보 추출과 GNN 기반 온톨로지 정렬 및 추론을 결합하면 의미론적 검색 정확도가 크게 향상되고 기업 의사결정 지연 시간을 줄일 것으로 예측합니다. 이 연구에서는 실행 가능한 AI-빅데이터 분석 기반 KM 프레임워크를 제안합니다. 다음과 같은 작업을 수행할 수 있습니다: 세밀하게 조정된 트랜스포머 모델을 이용한 도메인 특화 엔터티 및 관계 추출; 추출한 삼중형을 통한 지식 그래프 구성; GNN 기반 온톨로지 정렬 및 관계 추론; 그리고 검색 정밀도, 정렬 정확도, 의사결정 지연 지표를 이용한 작업 지향 평가가 포함됩니다.

제안된 접근법의 새로움은 이중 계층 KM 정렬에 있으며, 이는 조직의 민첩성과 혁신 역량을 향상시키는 구조화된 지식 통합을 통해 전략적 KM을 동시에 지원한다는 점입니다; 그리고 향상된 의사결정 지원, 프로세스 최적화, 맥락 검색 기능을 통한 운영 KM입니다. 이 논문은 이전의 개념적 또는 단일 모델 연구와 달리, 두 개의 실제 기업 시스템에 걸쳐 구현된 종단 간 경험적으로 입증된 아키텍처를 제시합니다. 실험 결과는 의사결정 지연이 35% 감소하고 검색 정확도가 21% 증가함을 보였습니다. 또한, AI 기반 출력을 의미적으로 조직된 지식 표현과 연결함으로써 해석 가능성을 높이고 투명하고 책임 있는 의사결정을 촉진합니다. 본 연구는 트랜스포머 기반 컨텍스트 인코딩과 그래프 기반 의미 추론을 체계적으로 융합하여 산업 6.0 원칙에 부합하는 고급 디지털 전환 환경에서 기업 지식 그래프 구축과 지능형 KM을 위한 확장 가능하고 반복 가능한 패러다임을 창출합니다.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

윤리적 선언

이 연구는 데이터 수집 전에 말레이시아 국립대학교(UKM) 기관심사위원회(IRB)의 검토 및 승인을 받았습니다(승인 ID: UKM/FEP/2025/AI-047; 승인일: 2025년 3월 12일). 승인된 프로토콜은 인간 참가자를 대상으로 한 구조화 설문조사 및 반구조화 인터뷰 시행을 포함했습니다. 모든 참가자는 연구 목적, 자발적 참여성, 언제든 불이익 없이 철회할 권리에 대해 안내받았으며, 포함 전에 서면 동의를 받았습니다. 참가자의 익명성과 기밀성이 엄격히 유지되었으며, 분석이나 출판에 개인 식별 정보는 포함되지 않았고, 모든 데이터는 기관 윤리 기준과 인간-피험자 연구를 위한 관련 국제 지침에 따라 학술 연구 목적으로만 안전하게 저장 및 사용되었습니다.

제안된 BERT–GNN KM 프레임워크의 전체 아키텍처

초기에는 내부 문서, 고객 상호작용, 소셜 미디어 콘텐츠 등 비정형 텍스트를 처리하기 위해 미세 조정된 트랜스포머 인코더가 사용되었습니다. BERT–GNN 기반 KM 워크플로우의 전체 시스템 아키텍처는 그림 1에 나와 있습니다. 이 연구에 사용된 기업 데이터는 구조화된 설문 파일, 인터뷰 기록, 내부 기업 보고서, 공개된 사례 연구 문서 등 디지털 문서 형식으로 수집되었습니다. 모든 문서는 분석을 위해 통합된 말뭉치로 통합되었다. 텍스트 콘텐츠는 이 소스에서 추출되어 무관한 메타데이터, 중복 항목, 서식 오류를 제거하기 위해 정리되었습니다. 정리된 말뭉치는 문장으로 분할되어 토큰화되어, 파서를 이용한 텍스트 추출, 노이즈 제거, 문장 분할, Word 조각 토큰 생성 등 후속 자연어 처리를 준비했습니다. 이 처리된 텍스트 데이터셋은 12개의 레이어, 12개의 주의 헤드와 768개의 숨겨진 단위를 가진 세밀 조정된 엔터티 및 관계 추출 모델의 입력 자료로 사용되었습니다. 추출된 데이터는 지식 그래프로 조직되어 기업 도메인 온톨로지 매핑 전반에 걸친 구조적이고 상호 연결된 지식을 제공했습니다. GNN은 코사인 유사성과 추론을 사용하여 지식 도메인 간 의미 관계를 정확히 포착하고 논리적으로 추론하기 위해 적용되었으며, 임계값 0.85의 문자열 유사도를 통해 중복 제거를 통해 중복 관계를 제거했습니다. 처리된 지식은 의사결정 계층에서 활용되어 효율적인 데이터 분석과 데이터 기반 의사결정을 촉진했습니다. 이 아키텍처는 단편화된 데이터를 지능적이고 맥락 인식 있는 정보 자산으로 전환했습니다. 이 프레임워크는 비즈니스 케이스 시뮬레이션을 통해 검증되었고, Naive Bayes(NB), Support Vector Machine(SVM), Random Forest(RF), TF-IDF, LDA, BERT 전용, BERT with KG와 같은 기존 KM 시스템과 비교하여 70:15:15의 데이터셋과 42개의 고정 시를 사용하여 검색 정확도, 의사결정 지연, 지식 유용성의 성능 향상을 평가했습니다.

figure-protocol-1
그림 1. BERT-GNN 기반 KM 워크플로우의 전체 시스템 아키텍처. 전체 AI–BDA–GNN 시스템 아키텍처는 다중 소스 데이터 수집, 전처리, 의미 추출을 위한 미세 조정된 BERT, KG 집단, GNN 기반 온톨로지 정렬/추론, 의사결정 계층을 보여줍니다. 화살표는 데이터 흐름을 나타내며, 온라인 학습을 위한 선택적 피드백 루프도 포함됩니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

데이터 수집

본 연구에 사용된 데이터셋은 대표성과 외부 타당성을 지원하기 위해 여러 출처에서 수집되었습니다. IT, 제조, 의료, 교육 분야의 실무자들과의 구조화된 설문조사 및 반구조화 인터뷰를 통한 1차 데이터 수집에는 루마니아 금융감사회의소 인증 회원들이 포함되었습니다. 2차 데이터에는 익명화된 내부 기업 문서, 연례 보고서, 공개된 디지털 전환 사례 연구가 포함되었습니다. 데이터 수집은 명확히 정의된 연구 기간 내에 이루어졌으며, 모든 기록은 기밀성 보호와 준수를 위해 기관의 윤리 인가를 이유로 익명화되었습니다.

참여 선정 기준: 방법론적 엄격성과 대표성을 보장하기 위해, 명확하게 정의된 포함 및 제외 기준을 바탕으로 참가자를 선정하였습니다. 디지털 전환, KM, 인공지능, 빅데이터 분석, 기업 정보 시스템 이니셔티브에 적극적으로 참여하는 것 외에도, 자격을 갖춘 참가자는 IT, 제조, 의료, 교육, 회계 또는 관련 기업 환경에서 최소 3년의 전문 경력을 보유해야 했습니다. 데이터 수집 기간 동안 인증된 전문가는 반드시 유효한 인증 상태를 유지해야 했습니다(예: 루마니아 금융감사위원회 회원). 설문조사와 인터뷰 자료를 정확히 이해하고 IRB 공식 프로토콜에 따라 충분한 정보를 얻기 위해, 참가자들은 루마니아어 또는 영어 중 한 가지에 능숙함을 입증해야 했습니다. 관련 경력 3년 미만, 비활성 전문 신분(해당되는 경우), 기업 수준의 지식 또는 의사결정 과정에 직접 관여하지 않았던 사람, 설문 응답 불완전(20% 이상 누락), 또는 데이터 품질 검증에 실패한 사람은 모두 제외되었습니다. 또한, KM 기법과 충분히 상세하지 않거나 관련성이 부족한 인터뷰 녹취록은 분석에 포함되지 않았습니다. 이 기준에 따라 유능하고 부문을 대표하며 분석적으로 타당한 참가자 샘플이 보장되었습니다.

루마니아 재무감사회의소(CAFR) 인증 회원들이 데이터 수집의 주요 대상 집단이었습니다. CAFR 내부 커뮤니케이션 채널을 통해 온라인 설문조사가 개발 및 배포되어 목표 지향적 배포와 높은 응답률을 지원했습니다. 대표 표본을 구성하기 위해 CAFR 병력을 검토하고 연구 관련 특징을 바탕으로 250명의 등록 참가자를 선정하였습니다.

설문 도구 구조: 연구는 조직 민첩성 및 운영 효율성(5문항), 전략적 의사결정 지원 및 혁신 역량(5문항), 지식 공유에 대한 빅데이터 분석의 영향(5문항), KM에서의 AI 도입(5문항), 사용자 인식 효과 및 시스템 사용성(4문항)의 5개 구성 영역에 걸쳐 24개의 문항으로 구성된 구조화된 설문지를 사용했습니다. 각 항목을 평가할 때 1은 '강하게 반대', 5는 '매우 동의한다'를 나타내는 5점 리커트 척도가 사용되었습니다. 이 도구는 기업용 AI 구현에 맞게 맥락화되었으며, 이전에 검증된 KM 및 디지털 전환 규모에서 수정되었습니다. 세 명의 학자와 두 명의 비즈니스 전문가가 내용의 타당성을 확인하기 위해 전문가 검토를 실시했습니다. 언어 개선, 명확성 측정, 신뢰성 측정을 위해 20명의 실무자를 대상으로 파일럿 연구가 수행되었으며; 모든 성분은 크론바흐 알파 값이 0.80 이상으로 강렬한 내부 일관성을 보였다. 설문 결과를 보완하기 위해 반구조화 인터뷰도 수행되었습니다. 면접 가이드에서는 다섯 가지 주제가 다뤄졌습니다: 디지털 전환 경험, 기업 지식 흐름의 어려움, 의사결정에서의 AI 및 빅데이터 통합, 의미적 일치의 장애물, 그리고 윤리적 거버넌스 문제. 모든 인터뷰는 사전 동의 하에 진행되었으며, 약 45분에서 60분 동안 진행되었고, 녹음된 후 질적 분석을 위해 전사되었습니다.

디지털 전환 조직에서 KM을 위한 제안된 BERT-GNN 프레임워크의 성능을 평가하기 위해, 다양한 산업의 다양한 출처에서 수집된 크고 다양한 데이터셋이 준비되었습니다. 이 데이터셋은 지식 흐름과 조직 변화에 관한 역동적인 인식을 나타내기 위해 정량적 측면뿐만 아니라 정성적인 측면도 포함합니다. 구조화된 데이터는 인공지능(AI)과 빅데이터 분석(BDA)이 지식 공유, 혁신, 비즈니스 민첩성에 미치는 영향을 측정하기 위한 리커트 척도(범위 1–5) 문항으로 구성된 온라인 설문지를 통해 250명 이상의 전문가로부터 수집되었습니다. 동시에 30명의 도메인 전문가를 대상으로 한 반구조화 인터뷰를 통해 비구조화 데이터가 수집되어 12만 단어 이상의 전사록을 제공했습니다. 기업 규모의 도입 패턴을 맥락 속에 놓기 위해 회사 연례 보고서와 디지털 전략 문서 등 추가로 반구조화된 자료가 수집되었습니다. 또한, IT, 제조, 의료, 교육 산업에서 온 15건의 상세한 사례 연구가 추가되어 실질적인 변혁 맥락을 제공했습니다. 내부 지식 기반 문서(약 200MB)는 개인정보 보호를 위해 익명화되었으며, 운영 지식 자산의 묘사를 강화하기 위해 포함되었습니다. 이 다중 출처 데이터셋은 딥러닝 모델에 대한 강력한 학습 및 평가 파이프라인을 가능하게 하며, KM의 전략적 및 운영 측면을 모두 포착합니다. 표 1은 평가에 사용된 모집단 표본을 보여줍니다.

구성 요소유형출처크기/부피
전문 설문 응답구조화250+ 전문가들의 온라인 설문조사~10,000 레코드
인터뷰 대본비구조화30명의 전문가가 진행한 반구조화된 인터뷰~120,000단어
회사 보고서반구조화연례 보고서 및 디지털 전략 문서50+ 문서
사례 연구혼합산업별 디지털 전환 사용 사례15건의 상세 사건
지식 기반 콘텐츠비구조화조직 내부 문서 (익명 처리)~200 MB

데이터 전처리 및 BERT 미세 조정

원시 기업 문서 데이터는 큐레이션된 목록에서 접근되어 문장 분할, 토큰화, 정지어 제거, 정규화 등을 통해 토큰 생성자의 요구사항을 충족하도록 전처리되었습니다. 사전 학습된 모델은 특정 작업에 맞게 미세 조정되었고, 이름 붙여진 엔터티 인식(NER) 및 관계 추출(RE) 작업을 수행하도록 미세 조정되었습니다. 이 모델은 특정 에포크 카운트에 대해 Adam 최적화기로 사전 처리된 코퍼스 데이터를 미세 조정했습니다. 마지막으로, 문맥화된 단어 임베딩(R768)은 식별된 개체와 그 관계로부터 도출되었습니다. 정규화된 엔터티는 동의어와 같은 다양한 엔터티를 정규화된 형태로 변환하는 온톨로지 기반 정규화 기법에 의해 생성되었습니다. 각 뚜렷한 정규화된 엔터티는 노드였고, 엔터티들 간의 관계는 지식 그래프 표현에서 엣지(edge)라고 불렸습니다. 모델이 생성한 정규화된 엔터티 임베딩이 그래프 신경망의 초기 노드 특징을 형성했습니다. 다음 단계에서는 그래프 신경망이 엣지 손상을 통해 얻은 음성 샘플링을 통한 감독 연결 예측 방법으로 훈련되었습니다. 훈련에서는 여러 에포크에 걸쳐 교차 엔트로피 손실이 발생합니다. 학습된 프레임워크는 지식 검색 정밀도, 의사결정 지연, 사용자 만족도(Satisfaction Rate)를 평가 지표로 사용하여 평가되었습니다.

RE와 NER의 교육 라벨을 생성하기 위해 하이브리드 주석 기법이 사용되었습니다. 두 명의 독립적인 주제 전문가가 사전 정해진 온톨로지 스키마를 사용해 내부 보고서, 고객 상호작용 기록, 정책 문서 등 도메인별 기업 문서에 수동으로 주석을 달았으며, 이 스키마는 조직, 프로세스, 기술, 역할, KPI 등 엔티티 카테고리와 관계 유형(지원, depends_on, 개선 등)을 식별했습니다. 관계 방향성과 엔터티 경계 탐지의 통일성을 보장하기 위해 포괄적인 주석 가이드라인이 만들어졌습니다. 데이터셋의 20%는 신뢰성 평가를 위해 이중 주석이 달렸습니다. Cohen's Kappa는 주석자 간 일치를 테스트하는 데 사용되었으며, 결과는 강한 일치를 보였다(엔터티 라벨링은 κ = 0.87, 관계 추출은 κ = 0.82). 약한 감독을 사용해 규칙 기반 및 온톨로지 제약 패턴 매칭을 사용해 수동 주석 데이터셋을 확장하고, 신뢰도 기반 필터링을 통해 노이즈를 줄였습니다. 완전한 재현성을 보장하기 위해 모든 주석 절차, 온톨로지 정의, 데이터셋 분할, 무작위 시드가 기록되었습니다.

정확도 효율성은 문서 수준에서 측정되었고, 지연 시간은 종단 간 쿼리 응답 시간을 기반으로 추정되었으며, 사용자는 리커트 척도 설문지를 사용해 만족했습니다. 각 단계가 끝날 때마다 다음 프로토콜 체크포인트가 설정되었습니다. (i) BERT 출력 체크포인트 - 샘플 엔티티 및 관계 트리플 추출; (ii) 온톨로지 라벨이 포함된 구성된 부분 그래프의 KG 체크포인트 샘플; (iii) GNN 체크포인트 - 온톨로지 예측 샘플과 추론된 링크; 그리고 (iv) 검색 체크포인트 - 관련성 라벨이 있는 검색된 지식 항목 샘플.

제안된 프로토콜은 다음과 같은 구조를 갖고 있습니다: 명확하게 정의된 중간 출력을 가진 결정론적 다단계 파이프라인으로, 완전한 재현성을 보장합니다. 1단계, 원시 구조화, 반구조화, 비정형 기업 데이터 수집 및 전처리 후, 정제된 텍스트 코퍼라와 정규화된 수치 특징 행렬이 생성됩니다. 2단계: 지식 추출을 위해 세밀하게 조정된 BERT 모델을 적용하여 부서, 프로세스, 문서, KPI와 같은 명확한 엔터티의 형태로 명시적 출력을 제공합니다; (ii) 주어-술어-목적어 삼중으로 표현된 개체 간의 의미 관계. 3단계에서는 이 트리플이 초기 지식 그래프로 변환되며, 노드는 엔터티이고 관계는 타입이 지정된 간선으로, 미리 정의된 온톨로지 스키마에 정렬됩니다. 4단계에서는 이 그래프에 그래프 신경망을 적용하여 온톨로지 정렬과 추론을 수행함으로써 노드 임베딩이 개선되고, 관계 추론이 이루어지며, 온톨로지 라벨이 정렬됩니다. 5단계는 의미 검색, 의사결정 지원, 성과 평가에 필요한 최종 지식 그래프와 추론 결과를 제공합니다.

엔터티 리스트, 관계 삼중, 온톨로지 정렬 그래프, 추론된 링크 등 모든 중간 산출물은 이 프로토콜의 모든 단계에서 명시적으로 생성되어 연구를 독립적으로 재현할 수 있도록 상기할 필요가 없습니다.

데이터셋은 실험 결과의 재현성을 보장하기 위해 고정된 70:15:15 비율에 따라 훈련 세트, 검증 세트, 테스트 세트로 나뉩니다. 토큰화, 소문자 작성, 스톱워드 제거, 512 토큰 단축 등이 모두 BERT의 텍스트 준비 측면에서 이루어집니다. 반면, Z-점수 정규화는 구조적 특징을 정규화하는 데 사용됩니다. 또한, 학습률이 2e-5, 배치 크기가 16, 에포크 수가 5인 딥러닝 프레임워크 라이브러리와 Adam 최적화기를 사용하여 BERT 모델은 미세 조정됩니다. 예측된 추출된 개체와 관계는 지식 그래프 구축을 위한 표준 형식으로 저장됩니다. 또한, 지식 그래프 노드 임베딩(R768)은 온톨로지 정렬과 추론을 위한 GNN의 입력으로 사용됩니다.

BERT-GNN 인터페이스 및 데이터 흐름

제안된 프레임워크 내에서 트랜스포머 인코더는 기업용 텍스트 말뭉치에서 NER 작업과 RE 작업, 두 가지 NLP 작업을 수행하도록 미세 조정됩니다. 마지막으로, 모델 출력에는 맥락화된 토큰 임베딩(R768), 엔터티 분류 라벨, 주어-술어-목적어 관계 트리플렛이 포함됩니다. 정규화된 엔터티는 사전 정의된 엔터프라이즈 온톨로지를 구축하여 사용되며, 여기서 엔터티의 텍스트 변형과 동의어가 엔티티 식별자에 매핑됩니다. 각 고유한 정규화된 엔터티는 구성된 지식 그래프 내에서 새로운 엔터티 노드를 할당받습니다. 산업 말뭉치 크기에 따라 평가된 기업 시나리오에서 생성된 지식 그래프는 18,000에서 25,000개의 엔티티 노드와 42,000에서 60,000개의 타입 관계형 엣지를 포함합니다. Person, Department, Process, Product, Organization, Document 등은 그래프에서 볼 수 있는 노드 유형 중 일부에 불과합니다. 다른 엣지 유형으로는 works_for, 매니지먼트, belongs_to, 프로듀서, approved_by, related_to 등이 있습니다. 각 노드에는 미리 정해진 기업 온톨로지에서 파생된 별도의 온톨로지 기반 식별자가 부여됩니다. 결과적으로 이기종 그래프는 정규화된 관계를 나타내는 타입 간선과 의미 있는 임베딩 특성을 가진 타입 노드를 갖게 됩니다. 그 후 GNN은 관계 추론과 온톨로지 정렬을 위해 노드 임베딩을 받습니다. 무엇보다도, GNN은 생성된 그래프에서 BERT 인코더로 역전파되는 구배 없이 작동하여 모듈화된 학습을 보장하고 그래프 추론과 의미 추출 구성 요소의 분리를 유지합니다.

BERT는 이 연구에서 맥락 언어 모델링과 의미적 특징 추출에 사용되었습니다. 모델은 특정 분류 목표에 맞춘 라벨링 데이터를 사용해 미세 조정하여 새로운 텍스트 입력에 맞는 올바른 카테고리 라벨을 효율적으로 예측할 수 있습니다. BERT는 양방향이기 때문에 각 단어의 앞뒤 맥락을 모두 고려하여 텍스트 내 관계를 보다 포괄적으로 이해할 수 있게 합니다. BERT 기반 모델의 인코더는 12개의 트랜스포머 블록으로 구성되며, 각 블록은 12개의 자기 주의 헤드와 768의 숨겨진 크기를 포함합니다. 처리 전에 입력 텍스트는 선택된 토큰화 방식에 따라 토큰으로 나뉘며, 이는 단어나 하위 단어를 나타낼 수 있습니다. BERT를 이용해 도출된 서열 표현은 보충 파일 1에 설명되어 있습니다. 모델 매개변수는 올바른 라벨의 로그 확률을 최소화하여 최적화됩니다 (그림 2).

figure-protocol-2
그림 2. 의미적 특징 추출에 사용되는 BERT 모델의 상세한 작업 과정. 입출력 차원과 KG 인구에 대한 맥락적 임베딩의 역할을 보여줍니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

GNN을 이용한 지식 그래프 구축

지식 그래프의 스키마는 그래프를 구성하기 전에 미리 정의되어 있습니다. 이는 의미적 일관성을 제공합니다. 온톨로지는 엔터티와 관계 유형 모두에 대해 유한한 수의 타입과 도메인 범위 제약 조건에 대해 미리 정의되어 있어 추론에 도움이 됩니다. 이 스키마는 BERT 모델에서 수집한 삼중형을 그래프에 채우는 것과 GNN을 통과하는 관계 인식 메시지에 적용할 수 있습니다.

이 틀 내에서 지식 그래프(KG)는 기업 지식의 구조화된 표현으로서 부서, 문서, 프로세스 등 개체와 이들 간의 의미 관계를 모델링합니다. KG의 수학적 유도는 보충 파일 1에 추가됩니다. 이러한 KG 구성과 GNN 기반 추론의 통합은 기업 KM 프레임워크 내에서 온톨로지 정렬, 관계 추론, 의미론적 검색의 향상을 가능하게 합니다.

지식 그래프(KG)는 이질적인 그래프 G로 표현되며, 그 구조는 존재론 O로 표현된다. KG는 술어 추론의 주장으로 표현되는 사실들의 집합으로 볼 수도 있다. 이 기본 원칙들은 다음과 같은설명을 가집니다. 그래프 G는 다양하며, V는 객체 또는 노드의 집합(둘 다 서로 교환 가능)을 나타내고 figure-protocol-3 관계의 집합을 나타냅니다. 트리플렛(figure-protocol-4)은 각각 객체 v와 1figure-protocol-5, 그리고 그 연관figure-protocol-6성을 각각 특징짓는 데 사용할 수 있다. GNN을 이용한 KG 구성의 수학적 유도는 보충 파일 1에 설명되어 있습니다.

BERT-GNN 기반 온톨로지 정렬 및 추론

알고리즘 1은 GNN 기반 온톨로지 정렬과 추론을 보여줍니다. 이 과정은 미리 추출된 임베딩과 고품질의 조정된 BERT 버전을 통해 생성된 임베딩을 사용하여 노드 기능을 초기화하는 것으로 시작되며, 이는 비구조화된 텍스트에서 각 엔터티의 의미적 의미를 추출합니다. 노드(엔터티)와 간선(관계)으로 구성된 지식 그래프는 인접 행렬(A)과 특징 행렬(X)의 사용으로 표현됩니다.

규칙 집합은 두 개 이상의 GNN 계층을 통해 진행됩니다. 각 계층에서 노드의 표현은 인접 노드의 데이터를 연결성에 따라 가중치를 부여하여 최신 상태로 유지됩니다(즉, 인접성 행렬 사용). 이는 노드 임베딩을 훈련 가능한 가중치 행렬을 통해 확장하고, ReLU을 포함한 비선형 활성화 특성을 통해 전달하는 메시지 전달 방법으로 수학적으로 공식화됩니다. 정규화 단계(예: 층 정규화나 GCN 방정식과 같은 디플로마 행렬 사용)는 층 전체에 대한 안정적인 지식을 확보합니다.

이 과정을 미리 정의된 층 T에 대해 반복한 후, 모델은 각 이웃과 그 형태 및 의미 능력을 인코딩하는 최종 노드 임베딩 Z 집합을 생성합니다. 이 임베딩은 소프트 맥스 분류 계층을 통해 보완되어, 기업 내 엔티티 정렬(예: "부서", "제품", "프로젝트")이나 의미 역할 등 정렬된 온톨로지 라벨을 예측합니다.

알고리즘 1: BERT GNN 기반 온톨로지 정렬 및 추론

GNN 기반 온톨로지 정렬 및 추론 과정은 노드로 표현된 엔티티와 그 관계가 엣지로 표현된 구성된 지식 그래프 위에서 작동했습니다. 초기 노드 표현은 BERT 기반 의미 임베딩에서 파생되어 특징 행렬로 조직되었습니다. 인접 행렬은 그래프의 연결 구조를 나타내며, 미리 정의된 GNN 계층 수를 적용하여 노드 표현을 정제했습니다. 각 계층에 대해 모델은 그래프 구조를 기반으로 인접 노드들의 정보를 집계하여 모든 노드를 업데이트했습니다. 식(1)에서의 이 집계는 이웃 노드 표현에 훈련 가능한 가중치 행렬을 곱하고, 바이어스 항을 추가하며, 비선형 활성화 함수를 적용하는 과정을 포함합니다.

figure-protocol-7(1)

각 계층 업데이트 후에는 정규화가 적용되어 훈련을 안정화하고 임베딩 척도의 일관성을 확보했습니다. 모든 계층이 처리되면 최종 노드 임베딩이 얻어졌습니다. 이 임베딩들은 softmax 함수를 가진 분류 계층을 통과하여 정렬된 온톨로지 라벨이나 엔티티 클래스를 예측했습니다. 이 절차는 최종 정제된 노드 임베딩과 예측된 온톨로지 정렬 라벨을 출력으로 생성했습니다.

제안된 방법은 여러 출처에서 엔터티의 의미론적 정렬을 가능하게 하며, 새로운 관계를 추론하고 이전에 라벨링되지 않은 노드를 분류함으로써 지식 그래프에 대한 추론을 지원합니다.

figure-protocol-8
그림 3. GNN을 이용한 온톨로지 정렬과 의미론적 추론. 이웃 메시지 전달 및 임베딩 업데이트 단계를 보여줍니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

집계된 특징들은 관계별 가중치 행렬과 비선형 활성화 함수(예: ReLU)를 사용하여 변환되어, BERT에서 파생된 의미적 특징과 그래프의 구조 정보를 통합한 업데이트된 노드 임베딩을 생성합니다. 이 임베딩들은 소프트맥스 분류 계층으로 전달되어 엔터티 라벨이나 정렬된 온톨로지 클래스를 예측합니다. 이 확립된 프로세스는 GNN을 기술 그래프 추론에 매우 효과적으로 만들며, 법인 명의성 해소, 추론, 의미 유형 지원 작업을 지원하며, 결국 더 스마트하고 AI 기반 통계 제어 구조에 기여합니다(표 2).

구성 요소설명
프레임워크/툴킷Python 3.9, PyTorch 2.0.1, Hugging Face Transformers 4.34, DGL 1.1 (딥 그래프 라이브러리)
하드웨어NVIDIA Tesla V100 GPU (16GB), 128GB RAM, Ubuntu 20.04
전처리 파이프라인토큰화(BERT의 단어 조각), 정지 단어 제거, 엔터티 인식(SpaCy), 수치 특징에 대한 z-점수 정규화가 있습니다
데이터셋 출처전문 설문조사(250+ 응답), 인터뷰 대본(~120,000단어), 회사 보고서(50+), 사례 연구(15), 내부 문서(200MB)
데이터 분할70% 교육, 15% 검증, 15% 테스트
텍스트 인코더 모델BERT 베이스(케이스 없음), 12층, 768 숨겨진 크기, 12개의 어텐션 헤드
버트 파인튜닝4 에포크, 배치 크기 = 32, 학습률 = 2e-5, Adam 최적화기, 최대 순열 길이 = 512
그래프 구성삼중항 기반 지식 추출(주어, 술어, 목적어)
그래프 유형다중 관계 간선을 가진 이기종 그래프(BERT 출력의 엔터티)
GNN 아키텍처2층 이기종 그래프 신경망 (메시지 전달 모델)
GNN 하이퍼 파라미터숨겨진 차원 = 128, 활성화 = ReLU, 옵티마이저 = 아담, 학습률 = 0.001
디코더 유형링크 예측을 위한 점적 점수를 가진 Dist. Mult
손실 함수삼중항 분류를 위한 이진 교차엔트로피

마지막으로, 프로토콜은 다음과 같은 결과물을 생성하며 마무리됩니다: 온톨로지에 정렬된 기업 지식 그래프, BERT 및 GNN 모델, 정보 검색 및 추론 결과, 그리고 KRP, OAA, DML, USR 보고서. 이들은 최종 출력물을 재현 가능한 형태로 제공합니다. GNN 훈련 중 네거티브 샘플링의 경우, 유효한 트리플렛은 온톨로지에서 정의된 타입 제약 조건에 따라 엔티티 교체를 통해 손상됩니다. 결과적으로 생성된 온톨로지 정렬은 일관성을 검증하고 도메인 전문가가 수동으로 검토하여 추출된 개체와 정규 온톨로지 클래스 간의 의미적 일관성을 보장합니다.

평가 기준

의사결정 지연은 사용자 쿼리가 제출된 후 시스템이 실행 가능한 응답을 제공하는 데 걸리는 총 시간을 측정한 것입니다. i 를 사용자 쿼리, figure-protocol-9 를 쿼리 제출 시점, figure-protocol-10 를 시스템이 최종 의사결정 출력을 제공하는 시점이라고 하자. 의사결정 지연(DML)은 다음과 같이 주어집니다:

figure-protocol-11(2)

여기서 는 평가된 쿼리의 총 수입니다. 이 지표는 제안된 프레임워크의 전체 응답 시간을 측정하며, 지식 검색부터 응답 생성까지 측정합니다. 이 지표의 낮은 수치는 시스템 응답 시간이 더 빨라지기 때문에 이상적이며, 이는 시간에 민감한 기업 의사결정 애플리케이션에 매우 중요합니다.

지식 커버리지 비율은 주어진 쿼리에 대해 시스템이 모든 관련 지식 항목을 검색할 수 있는 능력의 비율입니다. 쿼리 q에 관련된 모든 지식 항목의 집합을 , 시스템이 실제로 검색한 지식 항목의 집합을 라고 하자. 지식 커버리지 비율(KCR)은 다음과 같이 정의됩니다:

figure-protocol-12(3)

이 공식은 검색되는 지식 항목의 완전성을 계산합니다. 이는 전통적인 정보 검색 시스템에서 사용되는 회상 측정과 동등합니다.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

데이터 전처리 및 BERT 미세 조정

제안된 장치는 비구조화된 이해 추출을 위한 최적의 BERT 버전과 이해 그래프 프레임워크 내에서 온톨로지 정렬 및 추론을 위한 그래프 신경망(GNN)을 통합합니다. 실험 환경은 NER과 RE 작업에서 BERT 측면의 전체 성능을 비교하는 것이었으며, GNN 요소는 구축된 학습 그래프 위의 링크 예측과 노드 클래스에서 분석되었습니다.

NER 과제와 RE 과제의 F1 점수는 표 3에 보고되어 있습니다. 데이터 유출을 방지하기 위해, 모든 수치는 보류된 테스트 분열에서의 성능에만 해당되며, 이는 70:15:15 파티션을 사용해 훈련 및 검증 데이터와 엄격히 나누어졌습니다. 보유된 테스트 세트에서 제안된 BERT–GNN 아키텍처가 RE와 NER 작업에서 가장 우수한 성능을 보였습니...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

본 연구는 BERT를 이용한 맥락적 의미 추출과 GNN을 통한 관계 추론 및 온톨로지 정렬을 통합한 통합 기업 KM 프레임워크를 제시합니다. 이별적인 비즈니스 데이터 소스 간 엔터티 링크, 문서 간 추론, 일관된 지식 표현을 가능하게 하기 위해, 주요 기여는 단일 파이프라인 내에서 구조화된 온톨로지 인지 추론과 딥 컨텍스트 언어 모델링의 통합입니다 3,4. 확장성과 모호성이 문제인 규칙 기반 시스템, 평탄한 출력을 내는 트랜스포머 전용 모델, 사전 구조화된 데이터에 의존하는 그래프 전용 기법 등 현재 방법의 한계를 해결함으로써 제안된 프레임워크는 과학을 향상시킵니다. 이 접근법은 BERT 기반 추출과 GNN 추론 5,6을 융합하여 일관된 온톨로지 정렬, 조직화된...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 이해 상충이 없습니다

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 말레이시아 국립대학교 경제경영학부(말레이시아 방기, 말레이시아)와 경영대학부의 지원에 깊이 감사드립니다.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
BERT-Base (비케이스) 사전 학습 모델구글 AI해당 없음트랜스포머 기반 사전 학습 언어 모델 (bert-base-uncased 변형)
딥 그래프 라이브러리 (DGL)AWS 랩스리드: SCR_017054그래프 신경망 모델링에 사용되는 버전 2.1
Matplotlib 시각화 라이브러리파이데이터 커뮤니티리드: SCR_008624성능 그래프 및 시각적 분석에 사용됩니다
NetworkX 그래프 라이브러리PyPI 커뮤니티리드: SCR_005317그래프 구성 및 분석에 사용되는 버전 3.2
NumPy 수치 컴퓨팅 라이브러리파이데이터 커뮤니티리드: SCR_008633수치 연산 및 배열 처리에 사용됩니다
NVIDIA GPU (테슬라 T4 / RTX 3080)엔비디아 코퍼레이션리드: SCR_016409모델 학습을 위한 CUDA 지원 하드웨어 가속기
판다스 데이터 분석 라이브러리파이데이터 커뮤니티리드: SCR_018214구조화된 데이터 조작에 사용됨
파이썬 프로그래밍 언어파이썬 소프트웨어 재단리드: SCR_008394모델 개발 및 데이터 처리에 사용되는 버전 3.10
PyTorch 딥러닝 프레임워크메타 AI리드: SCR_018536신경망 구현에 사용되는 버전 2.0
Scikit-learn 머신러닝 라이브러리Scikit-learn 개발자들리드: SCR_002577버전 1.5는 전처리 및 평가 지표에 사용됨
트랜스포머 NLP 라이브러리포옹하는 얼굴리드: SCR_020989사전 학습된 트랜스포머 모델에 사용되는 버전 4.40
우분투 리눅스 운영 체제캐노니컬 주식회사리드: SCR_018317버전 20.04 LTS 런타임 환경

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Knowledge RetrievalGraph Neural NetworksBERT ModelOntology AlignmentSemantic ReasoningKnowledge GraphsEntity ExtractionRelation ExtractionEnterprise Knowledge ManagementSemantic Search

Related Articles