Method Article

Workflow AI łączący dwukierunkowe reprezentacje enkodera z transformatorów (BERT) i sieci neuronowych grafów (GNN) do wyszukiwania wiedzy w przedsiębiorstwach cyfrowych

DOI:

10.3791/70045

April 28th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Protokół ten prezentuje powtarzalny workflow sterowany AI, który dopracowuje BERT do ekstrakcji encji i relacji, wykorzystuje sieci neuronowe grafów do wyrównywania ontologii, konstruuje grafy wiedzy przedsiębiorstwa z danych nieustrukturyzowanych oraz systematycznie ocenia wydajność wyszukiwania semantycznego i efektywność wsparcia decyzyjnego.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Duże ilości nieustrukturyzowanych danych organizacyjnych mogą utrudniać systemom zarządzania wiedzą przedsiębiorstwa (KM) wydobycie poprawnych i kontekstowo istotnych informacji, co może prowadzić do nieefektywnego dzielenia się wiedzą i opóźnień w podejmowaniu decyzji. Badanie to sugeruje jednolite ramy oparte na sztucznej inteligencji, które pokonają to ograniczenie. Łączy on sieci neuronowe grafów (GNN) do wyrównywania ontologii i rozumowania semantycznego z udoskonalonymi dwukierunkowymi reprezentacjami enkoderów z Transformers (BERT) do wyodrębniania jednostek i relacji specyficznych dla dziedziny. Systematyczne zbieranie danych, wstępne przetwarzanie korpusów tekstowych przedsiębiorstw, dopracowywanie BERT do identyfikacji encji i relacji, konwersja wyodrębnionych trójek na strukturalne grafy wiedzy oraz dopasowanie ontologii oparte na GNN, aby zagwarantować spójność semantyczną pomiędzy heterogenicznymi źródłami wiedzy, tworzą pipeline metodologiczny. Aby ocenić skuteczność systemu w rzeczywistych scenariuszach przedsiębiorstw, ramy integrują również miary oceny zorientowane na zadania, takie jak precyzja wyszukiwania, poprawność dopasowania ontologii oraz opóźnienia decyzyjne. W porównaniu z metodami wyjściowymi, walidacja eksperymentalna w dwóch zastosowaniach branżowych wykazuje spadek opóźnień podejmowania decyzji o 35% oraz wzrost precyzji wyszukiwania wiedzy o 21%.

Ponadto opinie użytkowników wskazują, że interfejs KM zwiększył satysfakcję dzięki swoim funkcjam wyszukiwania semantycznego i kontekstowego tagowania. Sugerowana architektura ułatwia powtarzalne budowanie grafów wiedzy na podstawie nieustrukturyzowanych danych przedsiębiorstwa poprzez metodyczne łączenie rozumowania opartego na grafach i dopasowywania z ekstrakcją informacji opartą na głębokim uczeniu. Wyniki pokazują, że zarówno strategiczne, jak i operacyjne wyniki KM poprawiały się, gdy zorganizowane reprezentacje wiedzy były zgodne z procedurami organizacyjnymi. Podsumowując, proponowana metoda zwiększa dokładność wyszukiwania, przyspiesza reakcje procesów decyzyjnych oraz oferuje funkcjonalną i skalowalną opcję dla systemów KM na poziomie korporacyjnym.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Efektywne KM może być trudne do wdrożenia w programach transformacji cyfrowej ze względu na rozproszone repozytoria danych, różnorodne platformy organizacyjne oraz rozproszoną wiedzę rozproszoną w nieustrukturyzowanych dokumentach. Wielokrotnie, technicznie wdrożalne ramy, które metodycznie wyodrębniają, strukturyzują, dostosowują i uoperacyjniają wiedzę przedsiębiorstwa, nie zostały zaproponowane przez wiele badań, mimo wcześniejszych badań dotyczących adopcji AI i transformacji cyfrowej z perspektywy organizacyjnej i sektorowej 1,2,3. Obecne metody koncentrują się głównie na konsekwencjach menedżerskich lub strategicznych, ale nie oferują wystarczającej ilości szczegółów architektonicznych do wdrożenia na skalę. Wcześniejsze badania wykazały, że skuteczny transfer wiedzy w rozproszonych cyfrowych środowiskach pracy zależy nie tylko od infrastruktury technicznej, ale także od mechanizmów interakcji umożliwiających koordynację, wspólne zrozumienie i ciągłość między aktorami organizacyjnymi (Aman & Nicholson, 2009). To wzmacnia potrzebę istnienia architektur zarządzania wiedzą w przedsiębiorstwie, które robią więcej niż tylko wydobywanie informacji, ale także zachowują warunki kontekstowe niezbędne do znaczącej wymiany wiedzy4.

Tradycyjne systemy zarządzania informacją (MIS) oraz systemy planowania zasobów przedsiębiorstwa (ERP) przetwarzają głównie dane strukturalne i ułatwiają raportowanie transakcyjne, ale nie mogą przetwarzać tekstu niestrukturalnego ani prowadzić kontekstowego rozumowania semantycznego. Z drugiej strony, kontekstowa encja i RE z skomplikowanych korpusów tekstowych 5,6 są możliwe dzięki modelom opartym na transformatorach, takim jak BERT. Podobnie GNN udowodniły dużą zdolność do rozumowania relacyjnego, uczenia się reprezentacji grafów oraz dopasowania ontologii w różnych dziedzinach 7,8,9. Pomimo tych osiągnięć, obecne badania zwykle wykorzystują te modele osobno, zamiast włączać je do spójnego łańcucha KM biznesowego.

Analiza Big Data, chmura obliczeniowa, przemysłowy Internet Rzeczy oraz zaawansowane uczenie maszynowe to przykłady niedawnych osiągnięć technicznych, które przyspieszyły transformację cyfrową w takich branżach jak produkcja, opieka zdrowotna, usługi profesjonalne i zarządzanie 10,11,12,13. Jednocześnie międzynarodowe ramy polityczne kładą duży nacisk na odpowiedzialne stosowanie AI, kładąc nacisk na etyczne dopasowanie, odpowiedzialność i przejrzystość w systemach cyfrowych 14,15,16. Niemniej jednak etyczna interpretowalność i solidność techniczna rzadko są łączone w jednej architekturze w istniejących systemach KM.

W raportach środowiskowych, społecznych i ładu korporacyjnego (ESG), na przykład, podejmowanie decyzji opartych na AI może ignorować złożone kwestie moralne, które wymagają decyzji od ludzi. Zmniejszenie zdolności do analizy danych przy użyciu specjalistycznej decyzji17 może wynikać z nadmiernego polegania na danych. Funkcja doradztwa wykonywana przez PA, która historycznie opierała się na wiedzy ekonomicznej i interakcji z klientem, może ostatecznie zostać osłabiona przez automatyzację18. Może to zakłócić, ponieważ narzędzia mające na celu rozwój zawodu mogą nieumyślnie osłabić kluczowe umiejętności ludzkie.

Naturalne połączenie nowoczesnej technologii cyfrowej z rosnącym dbałością o etyczną efektywność biznesową i przedsiębiorczość, które kieruje ludzi, symbolizuje Branżę 6.0, przełomowy etap w rozwoju przemysłowym19. Ten etap, który kształtuje się na Industry 4.0 i Industry 5.0, jest kolejnym etapem rozwoju technicznego. Wizualizując czas, w którym wynalazek poprawia, a nie zastępuje ludzkie zdolności, Przemysł 6.0 rozszerza te myśli20. Plan ten porusza moralne obawy dotyczące mechanizacji, jednocześnie promując współpracę między ludźmi a robotami, skumulowaną efektywność21. Komponent biznesowy pracownika DL jest istotny, ponieważ interakcje z współpracownikami w firmie często kształtują kompetencje i zrozumienie technologii cyfrowych u jednostki. Ta strategia ma być zgodna z badaniami mającymi na celu wyjaśnienie sposobów umożliwienia współpracy pracowników i nowych technologii, aby w przedsiębiorstwach mogły być realizowane różne zadania i operacje22,23. Ponieważ daje im dostęp do większej bazy konsumentów, DL jest postrzegany jako kluczowy dla przetrwania małych firm24. W porównaniu do tradycyjnych struktur firm, menedżerowie w MŚP mogą prowadzić swoje firmy bardziej efektywnie i z mniejszą liczbą aktywów fizycznych, wykorzystując postęp technologiczny25,26.

Rozwój zdolności reklamowych online, które w praktyce poprawiają wyniki biznesowe, zależy od zasobów technologicznych, takich jak postęp technologiczny oraz powiązania z celami firmy27. Jednak cyfrowe ukierunkowanie firmy i rewolucja techniczna w jej otoczeniu klienta działają jako moderatorzy tych wpływów28. Firmy mogą skuteczniej wykorzystywać postęp IT i synchronizację do rozwijania swoich możliwości promocyjnych online, głęboko integrując technologię cyfrową ze swoimi biznesami, produktami, ofertami i planami.

Dwa mechanizmy rezerw technologicznych AI to wydatki kapitałowe (capex), które mogą być wykorzystywane do organizacji platform Big Data, dodatków i ulepszeń, oraz schematów wynalazczych w naukach o informacji i uczeniu maszynowego, czyli kosztów operacyjnych, które służą do uzyskania licencji na narzędzia AI i Big Data w organizacji, lub wreszcie szkolenia związane z AI dla pracowników29. Korzyści z wdrożenia AI są większe dla firm, które dodatkowo korzystają z innych technologii i realizują wewnętrzną strategię badawczo-rozwojową, według analizyLee 30dotyczącej działań związanych z aktywami AI. Dodatkowo kluczowe jest podjęcie decyzji między zatrudnieniem i zatrudnieniem pracowników wykwalifikowanych w AI31. Pozycja zasobów ludzkich w tej dziedzinie szkoleń jest głównym tematem obecnych badań, a wyniki pokazują, że firmy posiadające wewnętrzną wiedzę o AI inwestują w rozwój tych talentów, aby zyskać przewagę nad konkurencyjnymi32,33.

Interakcje białek przewidywano z GNN w34 przypadkach, a przewidywania weryfikowano za pomocą LLM. Podejście było bardzo precyzyjne i zapewniało interpretowalne wyjaśnienia. Zaawansowane techniki uczenia maszynowego i głębokiego, takie jak BERT, zostały wykorzystane do badania na dużą skalę danych z mediów społecznościowych w czasach kryzysu35. RNN, CNN i GCN pomagają przetwarzać i klasyfikować ogromne ilości danych i mogą być stosowane w wykrywaniu nowotworów36. Autorzy w 37,38,39,40 przedstawiają nowatorskie podejście do wzmacniania systemów rekomendacyjnych poprzez integrację zarówno grafów społecznych, jak i wiedzy z modelami opartymi na GNN.

Wcześniejsze badania nie wykazały, jak można systematycznie integrować ekstrakcję semantyczną opartą na transformatorach i rozumowanie grafowe, aby poprawić zarówno operacyjne, jak i strategiczne funkcje KM, mimo że AI i analiza Big Data są uznawane za siły transformacyjne w środowiskach zawodowych. W szczególności brakuje ustalonych ram, które (i) przekształcają nieustrukturyzowany tekst korporacyjny w semantycznie wyrównane grafy wiedzy, (ii) gwarantują spójność na poziomie ontologii w odległych źródłach oraz (iii) statystycznie oceniają wpływ wsparcia decyzyjnego przedsiębiorstwa.

Aby zniwelować tę lukę, badanie przewiduje, że w porównaniu z tradycyjnymi systemami KM opartymi na ERP/MIS i opartymi na słowach kluczowych, połączenie ekstrakcji informacji opartej na transformatorze adaptacyjnej do domeny z dopasowaniem ontologii i rozumowaniem sterowanym GNN znacznie zwiększy dokładność wyszukiwania semantycznego i zmniejszy opóźnienia decyzyjne przedsiębiorstwa. W niniejszym badaniu proponowany jest wykonywalny framework KM oparty na analizie AI i Big Data. Może wykonywać następujące zadania: ekstrację jednostek i relacji specyficzną dla dziedziny przy użyciu precyzyjnie dostrojonego modelu transformatora; konstrukcja grafów wiedzy z wyodrębnionych trójek; Dopasowanie ontologii oparte na GNN i rozumowanie relacyjne; oraz ocenianie zorientowane na zadania z wykorzystaniem metryk precyzji wyszukiwania, dokładności wyrównania i opóźnień decyzji.

Nowością sugerowanego podejścia jest dwuwarstwowe dopasowanie KM, które jednocześnie wspiera strategiczne KM poprzez strukturyzowaną integrację wiedzy, poprawiającą zwinność organizacji i zdolności innowacyjne; oraz operacyjnego KM poprzez ulepszone wsparcie decyzyjne, optymalizację procesów i kontekstowe wyszukiwanie. Niniejszy artykuł przedstawia kompleksową, empirycznie potwierdzoną architekturę zaimplementowaną na dwóch rzeczywistych systemach przedsiębiorstw, w przeciwieństwie do wcześniejszych badań koncepcyjnych lub pojedynczych modeli. Wyniki eksperymentalne pokazują 35% spadek opóźnień podejmowania decyzji oraz wzrost precyzji wyszukiwania o 21%. Dodatkowo, łącząc wyniki oparte na AI z semantycznie zorganizowanymi reprezentacjami wiedzy, system poprawia interpretowalność i ułatwia przejrzyste oraz odpowiedzialne podejmowanie decyzji. Badanie to tworzy skalowalny i powtarzalny paradygmat dla konstrukcji grafów wiedzy przedsiębiorstwa oraz inteligentnego KM w zaawansowanych środowiskach transformacji cyfrowej, zgodne z zasadami Przemysłu 6.0, poprzez metodyczne łączenie kontekstowego kodowania opartego na transformatorach z rozumowaniem semantycznym opartym na grafach.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Oświadczenie etyczne
Badanie to zostało przeanalizowane i zatwierdzone przez Instytucjonalną Radę Przeglądową (IRB) Narodowego Uniwersytetu Malezji (UKM) przed zebraniem danych (Approval ID: UKM/FEP/2025/AI-047; Data zatwierdzenia: 12 marca 2025). Zatwierdzony protokół obejmował przeprowadzanie ankiet strukturalnych oraz półstrukturyzowanych wywiadów z udziałem uczestników ludzkich. Wszyscy uczestnicy zostali poinformowani o celu badania, dobrowolnym charakterze ich udziału oraz ich prawie do wycofania się w dowolnym momencie bez konsekwencji, a przed ich włączeniem uzyskano pisemną świadomą zgodę. Anonimowość i poufność uczestników były ściśle zachowane, bez danych osobowych w analizie ani publikacji, a wszystkie dane były bezpiecznie przechowywane i wykorzystywane wyłącznie do celów naukowych zgodnie z instytucjonalnymi standardami etycznymi oraz odpowiednimi międzynarodowymi wytycznymi dotyczącymi badań nad ludźmi.

Ogólna architektura proponowanego systemu BERT–GNN KM
Początkowo do przetwarzania nieustrukturyzowanego tekstu, w tym dokumentów wewnętrznych, interakcji z klientami oraz treści w mediach społecznościowych, używano precyzyjnie dostrojonego enkodera transformatora. Ogólna architektura systemu workflow KM opartego na BERT–GNN została przedstawiona na Rysunku 1. Dane przedsiębiorstwa użyte w tym badaniu zostały zebrane w formach dokumentów cyfrowych, w tym w ustrukturyzowanych plikach ankiet, transkrypcjach wywiadów, wewnętrznych raportach przedsiębiorstw oraz publicznie dostępnych dokumentach studiów przypadków. Wszystkie dokumenty zostały skonsolidowane w jednolity korpus do analizy. Treść tekstowa została wyodrębniona z tych źródeł i oczyszczona, aby usunąć nieistotne metadane, duplikaty wpisów i artefakty formatowania. Oczyszczony korpus był następnie segmentowany na zdania i tokenizowany, aby przygotować go do dalszego przetwarzania języka naturalnego, takiego jak ekstrakcja tekstu za pomocą parserów, usuwanie szumów, segmentacja zdań oraz tokenizacja za pomocą tokenizera Word piece. Ten przetworzony zbiór danych tekstowych służył jako wejście do precyzyjnie dostrojonego modelu ekstrakcji encji i relacji34 , który składa się z 12 warstw z 12 głowami uwagi i 768 ukrytymi jednostkami. Wyodrębnione dane zostały zorganizowane w Graf Wiedzy, który zapewniał uporządkowaną i powiązaną reprezentację wiedzy w ramach mapowania ontologii domeny przedsiębiorstwa. GNN zostały zastosowane do wyrównania ontologii z wykorzystaniem podobieństwa kosinusowego i rozumowania, aby zapewnić, że relacje semantyczne między domenami wiedzy są dokładnie uchwycone i logicznie wnioskowane poprzez usunięcie duplikatów poprzez podobieństwo ciągu ciągu z progiem 0,85. Przetworzona wiedza była następnie wykorzystywana w warstwie decyzyjnej, umożliwiając efektywną analizę danych i ułatwiając podejmowanie decyzji opartych na danych. Ta architektura przekształciła fragmentaryczne dane w inteligentne, świadome kontekstu zasoby informacyjne. Ramy zostały zweryfikowane poprzez symulacje przypadków biznesowych i porównane z konwencjonalnymi systemami KM, takimi jak Naive Bayes (NB), Support Vector Machine (SVM), Random Forest (RF), TF-IDF, LDA, TYLKO BERT oraz BERT z KG, z podziałem zbioru danych 70:15:15 i stałym seed 42, aby ocenić poprawę wydajności w zakresie dokładności wyszukiwania, opóźnień decyzji i użyteczności wiedzy.

figure-protocol-1
Rysunek 1: Ogólna architektura systemu workflow KM opartego na BERT-GNN. Ogólna architektura systemu AI–BDA–GNN pokazuje pobieranie danych z wielu źródeł, wstępne przetwarzanie, precyzyjnie dopracowany BERT do ekstrakcji semantycznej, populację KG, dopasowanie ontologii i rozumowanie oparte na GNN oraz warstwę decyzyjną. Strzałki wskazują przepływ danych oraz opcjonalne pętle zwrotne w nauce online. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

Pozyskiwanie danych
Zbiór danych użyty w tym badaniu został zebrany z wielu źródeł, aby wspierać reprezentatywność i zewnętrzną wiarygodność. Podstawowe zbieranie danych poprzez ustrukturyzowane ankiety i półustrukturyzowane wywiady z praktykami z sektorów IT, produkcji, opieki zdrowotnej i edukacji obejmowało certyfikowanych członków Izby Audytorów Finansowych Rumunii. Dane wtórne obejmowały anonimizowane wewnętrzne dokumenty przedsiębiorstw, raporty roczne oraz publicznie dostępne studia przypadków transformacji cyfrowej. Zbieranie danych odbywało się w ściśle określonym okresie badania, a wszystkie dokumenty zostały zanonimizowane ze względu na instytucjonalne zezwolenie etyczne, aby chronić poufność i zapewnić zgodność z przepisami.

Kryteria wyboru uczestników: Aby zagwarantować rzetelność metodologiczną i reprezentatywność, uczestnicy zostali wybrani na podstawie jasno określonych kryteriów włączenia i wykluczenia. Oprócz aktywnego udziału w transformacji cyfrowej, KM, sztucznej inteligencji, analizie big data lub inicjatywach dotyczących systemów informatycznych przedsiębiorstw, uczestnicy musieli posiadać co najmniej trzy lata doświadczenia zawodowego w IT, produkcji, opiece zdrowotnej, edukacji, księgowości lub pokrewnych środowiskach przedsiębiorstw. Certyfikowani profesjonaliści musieli posiadać aktywny status certyfikacyjny w okresie zbierania danych (np. członkowie Izby Audytorów Finansowych Rumunii). Aby dokładnie zrozumieć materiały ankietowe i wywiadowe oraz udzielić fachowej zgody zgodnie z zatwierdzonym protokołem IRB, uczestnicy musieli również wykazać się biegłością w języku rumuńskim lub angielskim. Osoby z mniej niż trzyletnim odpowiednim doświadczeniem, nieaktywnym statusem zawodowym (jeśli dotyczy), brakiem bezpośredniego udziału w procesach wiedzy lub decyzji na poziomie przedsiębiorstwa, niekompletnymi odpowiedziami w ankietach (ponad 20% brakujących danych) lub nieudanymi kontrolami jakości danych zostały wykluczone. Dodatkowo, transkrypcje wywiadów, które nie były wystarczająco szczegółowe lub nieistotne dla technik KM, nie zostały uwzględnione w analizie. Te standardy gwarantowały kompetentną, reprezentatywną dla sektora i analitycznie wiarygodną próbę uczestników.

Certyfikowani członkowie Izby Audytorów Finansowych Rumunii (CAFR) stanowili kluczową grupę docelową do zbierania danych. Opracowano i rozpowszechniono ankietę online za pośrednictwem wewnętrznych kanałów komunikacji CAFR, aby wspierać ukierunkowaną dystrybucję i wysokie wskaźniki odpowiedzi. Aby utworzyć reprezentatywną próbę, przeanalizowano historie CAFR i wybrano 250 zarejestrowanych uczestników na podstawie cech istotnych dla badania.

Struktura instrumentów ankietowych: Badanie wykorzystało ustrukturyzowany kwestionariusz z 24 pozycjami rozłożonymi w pięciu domenach konstrukcyjnych: zwinność organizacyjna i efektywność operacyjna (5 pozycji), strategiczne wsparcie decyzyjne i zdolność innowacji (5 pozycji), wpływ analityki Big Data na dzielenie się wiedzą (5 pozycji), wdrożenie AI w KM (5 pozycji) oraz efektywność i użyteczność systemu postrzeganą przez użytkownika (4 pozycje). Do oceniania każdego punktu stosowano 5-punktową skalę Likerta, gdzie 1 oznacza "zdecydowanie się nie zgadzam", a 5 "zdecydowanie się zgadzam". Narzędzie zostało dostosowane do implementacji AI w przedsiębiorstwie i zmodyfikowane na podstawie wcześniej zweryfikowanych skal KM i transformacji cyfrowej. Trzech naukowców akademickich i dwóch ekspertów biznesowych przeprowadziło przegląd ekspertów, aby potwierdzić ważność treści. Aby poprawić język, zmierzyć klarowność i zmierzyć wiarygodność, przeprowadzono pilotażowe badania z udziałem 20 praktyków; wszystkie komponenty miały wartości alfa Cronbacha powyżej 0,80, co świadczyło o silnej wewnętrznej spójności. Przeprowadzono również półustrukturyzowane wywiady, aby uzupełnić wyniki ankiety. W przewodniku po wywiadzie poruszono pięć tematów: doświadczenie w transformacji cyfrowej, trudności z przepływem wiedzy w przedsiębiorstwie, integrację AI i Big Data w podejmowaniu decyzji, przeszkody w zjednoczeniu semantycznym oraz kwestie etycznego zarządzania. Każdy wywiad przeprowadzono za świadomą zgodą, trwał około 45 do 60 minut, był nagrywany audio, a następnie transkrybowany do analizy jakościowej.

Aby ocenić wydajność sugerowanego ramowego systemu BERT-GNN dla KM w cyfrowo transformujących się organizacjach, przygotowano duży i zróżnicowany zbiór danych pochodzący z różnych źródeł i branż. Zbiór danych obejmuje aspekty ilościowe oraz jakościowe, aby oddać dynamiczne postrzeganie przepływu wiedzy i zmian organizacyjnych. Dane strukturalne zostały zebrane od ponad 250 specjalistów za pomocą internetowego kwestionariusza składającego się z pozycji w skali Likerta (zakres 1–5) do pomiaru postrzeganych efektów sztucznej inteligencji (AI) i analizy Big Data (BDA) na wymianę wiedzy, innowacje i elastyczność biznesową. Równocześnie zebrano dane nieustrukturyzowane poprzez półstrukturalne wywiady z 30 ekspertami z dziedziny, dostarczając ponad 120 000 słów transkrypcji. Zebrano także materiały półstrukturalne, w tym coroczne raporty firm oraz cyfrowe dokumenty strategiczne (ponad 50 dokumentów), aby umieścić wzorce adopcji na skalę przedsiębiorstwa w kontekście. Ponadto dodano 15 szczegółowych studiów przypadków z branż IT, produkcji, opieki zdrowotnej i edukacji, aby przedstawić praktyczne konteksty transformacji. Wewnętrzne dokumenty baz wiedzy (około 200 MB), zanonimizowane ze względów prywatności, zostały również dołączone, aby lepiej przedstawić zasoby wiedzy operacyjnej. Ten wieloźródłowy zbiór danych umożliwia silny proces szkoleniowy i ewaluacyjny dla modeli głębokiego uczenia oraz obejmuje zarówno strategiczne, jak i operacyjne aspekty KM. Tabela 1 przedstawia próbę populacji wykorzystywaną do ewaluacji.

SkładnikTypŹródłoRozmiar/objętość
Profesjonalne odpowiedzi ankietoweStrukturalneAnkiety online od 250+ profesjonalistów~10 000 rekordów
Transkrypcje wywiadówNiestrukturalnePółustrukturyzowane wywiady z 30 ekspertami~120 000 słów
Raporty firmyPółstrukturalneRaporty roczne i cyfrowe dokumenty strategiczne50+ dokumentów
Studia przypadkówMieszaneBranżowe przykłady zastosowań transformacji cyfrowej15 szczegółowych spraw
Zawartość bazy wiedzyNiestrukturalneDokumenty wewnętrzne organizacji (anonimizowane)~200 MB

Tabela 1: Próba populacji użyta do oceny. Dostarcza rozmiar próbki i ramę próbkowania.

Wstępne przetwarzanie danych i precyzyjne dostrajanie BERT
Surowe dane dokumentów przedsiębiorstwa były dostępne z listy kuratorowanej i wstępnie przetwarzane za pomocą segmentacji zdań, tokenizacji, usuwania słów stop oraz normalizacji, aby spełnić wymagania tokenizera. Model wstępnie wytrenowany był następnie dalej modyfikowany, aby dopracowywać model do konkretnego zadania, a następnie do wykonywania zadań rozpoznawania nazwany podmiotów (NER) i ekstrakcji relacji (RE). Model został dopracowany na danych z wcześniej przetworzonego korpusu dla konkretnego liczby epok za pomocą optymalizatora Adama. Wreszcie, kontekstualizowane osadzenia słów (R768) powstały na podstawie zidentyfikowanych bytów i ich relacji. Normalizowane byty były generowane metodą normalizacji opartą na ontologii, w której różne byty, takie jak synonimy, były przekształcane w formę znormalizowaną. Każda odrębna znormalizowana encja była węzłem, podczas gdy relacja między bytami nazywana była krawędzią w reprezentacji grafu wiedzy. Znormalizowane osadzenia encji generowane przez model stanowiły początkowe cechy węzła sieci neuronowej grafu. W kolejnym etapie sieć neuronowa grafu została wytrenowana metodą nadzorowanej predykcji łącza z ujemnym próbkowaniem uzyskanym poprzez uszkodzenie krawędzi. W treningu występuje utrata entropii krzyżowej w kilku epokach. Trenowany framework oceniano na podstawie Knowledge Retrieval Precision, Decision Making Latency oraz User Satisfaction Rate jako metryk oceny.

Zastosowano hybrydowe podejście adnotacji do tworzenia etykiet treningowych dla RE i NER. Dwóch niezależnych ekspertów ręcznie adnotowało specyficzny dla danej dziedziny korpus dokumentów przedsiębiorstwa, takich jak raporty wewnętrzne, logi interakcji z klientami oraz dokumenty polityki, wykorzystując wcześniej ustalony schemat ontologii, który identyfikował kategorie podmiotów (takie jak Organizacja, Proces, Technologia, Rola, KPI) oraz typy relacji (takie jak wsparcia, depends_on i ulepszenia). Aby zagwarantować jednolitość kierunkowości relacji i wykrywania granic podmiotów, opracowano kompleksowe wytyczne dotyczące adnotacji. 20% zbioru danych zostało podwójnie opatrzonych adnotacjami w celu oceny wiarygodności. Kappa Cohena została użyta do testu zgodności między anotatorami, a wyniki wykazały silną zgodność (κ = 0,87 dla oznaczania encji i κ = 0,82 dla ekstrakcji relacji). Słaby nadzór został następnie wykorzystany do rozszerzenia ręcznie anotowanego zbioru danych za pomocą wzorców opartego na regułach i ontologii dopasowania wzorców, z filtrowaniem opartym na pewności w celu redukcji szumów. Aby zagwarantować pełną powtarzalność, rejestrowano wszystkie procedury adnotacji, definicje ontologii, podziały zbiorów danych oraz losowe nasiona.

Efektywność precyzji mierzono na poziomie dokumentu, opóźnienia szacowano na podstawie czasu odpowiedzi na zapytanie end-to-end, a użytkownicy byli zadowoleni z kwestionariuszy skali Likert. Na końcu każdego etapu ustanawiano następujące punkty kontrolne protokołu. (i) punkt kontrolny wyjściowy BERT – wyodrębnione jednostki i trójki relacji; (ii) próbkę punktu kontrolnego KG skonstruowanego podgrafu z etykietami ontologicznymi; (iii) Punkt kontrolny GNN – przykład predykcji ontologii i wnioskowanego powiązania; oraz (iv) punkt kontrolny wyszukiwania – próbka odzyskanych elementów wiedzy z etykietami relewancji.

Proponowany protokół ma następującą strukturę: deterministyczny, wieloetapowy pipeline z dobrze zdefiniowanymi wyjściami pośrednimi, umożliwiającymi pełną powtarzalność. Krok 1, Po surowym i niestrukturalnym wprowadzeniu i wstępnym przetwarzaniu danych przedsiębiorstwa, zostaną wygenerowane oczyszczone korpusy tekstowe oraz znormalizowane macierze cech liczbowych. Krok 2: Zastosowanie precyzyjnie dostrojonych modeli BERT zostanie wykonane do wyodrębniania wiedzy, dając jawne wyniki w postaci nazwanych podmiotów, takich jak Departament, Proces, Dokument i KPI; (ii) relacje semantyczne między bytami, reprezentowane jako trójki podmiot-predykat-dopełnienie. W kroku 3 te trójki są przekształcane w początkowy graf wiedzy, w którym węzły są bytami, a relacje to typowane krawędzie, wyrównane z predefiniowanym schematem ontologii. W kroku 4, zastosowanie sieci neuronowej grafu do wyrównania ontologii i rozumowania generuje lepsze osadzenia węzłów, relacje wnioskowania oraz wyrównywanie etykiet ontologicznych. Krok 5 dostarcza sfinalizowany wykres wiedzy oraz wyniki rozumowania, które będą podstawą do wyszukiwania semantycznego, wsparcia decyzyjnego i oceny efektywności.

Wszystkie artefakty pośrednie, w tym listy encjatów, trójki relacji, grafy wyrównane z ontologią oraz powiązania wnioskowane, są generowane wyraźnie na każdym etapie tego protokołu, co umożliwia niezależną replikację badań bez potrzeby przypominania.

Zbiór danych dzieli się na zbiór treningowy, zbiór walidacyjny i zbiór testowy według stałego stosunku 70:15:15, aby zapewnić powtarzalność wyników eksperymentu. Tokenizacja, pisanie małych liter, usuwanie słów stop oraz skracanie sekwencji do 512 tokenów są wykonywane dla BERT pod względem przygotowania tekstu. Z kolei normalizacja Z-Score służy do normalizacji cech strukturalnych. Ponadto model BERT jest precyzyjnie dopracowywany za pomocą biblioteki ram deep learning z optymalizatorem Adam, gdzie tempo uczenia to 2e-5, wielkość partii równa się 16, a liczba epoch to 5. Przewidywane wyodrębnione encje i relacje są zapisywane w standardowym formacie do konstrukcji grafu wiedzy. Dodatkowo, osadzenie węzła grafu wiedzy (R768) jest wykorzystywane jako wejście do GNN do wyrównywania ontologii i rozumowania.

Interfejs BERT-GNN i przepływ danych
W proponowanym systemie enkoder transformatora jest precyzyjnie dostrojony do wykonywania dwóch zadań NLP: zadania NER oraz zadania RE na korpusie tekstowym przedsiębiorstwa. Na koniec wyjścia modelu obejmują kontekstualizowane osadzenia tokenów (R768), etykiety klasyfikacji encji oraz relacyjne triplety podmiot-predykat-obiekt. Znormalizowane podmioty są wykorzystywane poprzez konstrukcję predefiniowanej ontologii przedsiębiorstwa, gdzie warianty tekstowe i synonimy jednostki są przypisywane do identyfikatora jednostki. Każda unikalna znormalizowana encja otrzymuje nowy węzeł encji w ramach skonstruowanego grafu wiedzy. W zależności od wielkości korpusu branżowego, generowany graf wiedzy w ocenianych scenariuszach przedsiębiorstwa zawiera od 18 000 do 25 000 węzłów podmiotów oraz 42 000 do 60 000 typowanych krawędzi relacyjnych. Osoba, Dział, Proces, Produkt, Organizacja i Dokument to tylko niektóre z typów węzłów występujących na wykresie. Inne typy krawędzi to works_for, zarządza, belongs_to, produces, approved_by oraz related_to. Każdy węzeł otrzymuje odrębny identyfikator oparty na ontologii, pochodzący z wcześniej ustalonej ontologii przedsiębiorstwa. W rezultacie powstały heterogeniczny graf ma typowe krawędzie reprezentujące znormalizowane relacje oraz typowe węzły o właściwościach semantycznych osadzeń. Następnie GNN otrzymują te osadzenia węzłów do rozumowania relacyjnego i dopasowania ontologii. Kluczowe jest to, że GNN działa na wygenerowanym grafie bez wstecznego przekazywania gradientów do enkodera BERT, gwarantując modułowe trenowanie i zachowując rozdzielenie komponentów rozumowania grafu i ekstrakcji semantycznej.

BERT został wykorzystany w tym badaniu do kontekstowego modelowania języka oraz ekstrakcji cech semantycznych. Model może efektywnie nauczyć się przewidywać poprawne etykiety kategorii dla nowych wejść tekstowych, gdy jest precyzyjnie dostrojony za pomocą danych oznaczonych dostosowanych do konkretnego celu klasyfikacji. Ponieważ BERT jest dwukierunkowy, uwzględnia zarówno kontekst poprzedzający, jak i następujący każdego słowa, co umożliwia pełniejsze zrozumienie relacji w tekście. Koder modelu opartego na BERT składa się z 12 bloków transformatorów, z których każdy zawiera 12 głowic samorefleksji i ukryty rozmiar 768. Przed przetwarzaniem tekst wejściowy jest dzielony na tokeny w zależności od wybranego podejścia tokenizacyjnego, które mogą reprezentować słowa lub podsłowa. Reprezentacja sekwencji wyprowadzona za pomocą BERT została opisana w Pliku Uzupełniającym 1. Parametry modelu są optymalizowane poprzez minimalizację logarytmicznego prawdopodobieństwa poprawnej etykiety (Rysunek 2).

figure-protocol-2
Rysunek 2: Szczegółowy proces pracy modelu BERT używanego do wyodrębniania cech semantycznych. Pokazuje wymiary wejścia/wyjścia oraz rolę kontekstowych osadzeń dla populacji KG. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

Konstrukcja grafów wiedzy z wykorzystaniem GNN
Schemat dla Grafu Wiedzy jest wstępnie definiowany przed jego konstruowaniem. Zapewnia spójność semantyczną. Ontologia jest z góry zdefiniowana i odnosi się do skończonej liczby typów zarówno dla bytów, jak i typów relacji, wraz z ograniczeniami zakresu dziedzin, które są pomocne w rozumowaniu. Schemat ten jest stosowany do zapełniania grafu z trójek zebranych z modelu BERT, jak również do wiadomości świadomej relacji przechodzącej przez GNN.

W ramach tego systemu Graf Wiedzy (KG) pełni rolę uporządkowanej reprezentacji wiedzy przedsiębiorstwa, modelując podmioty (np. działy, dokumenty, procesy) oraz relacje semantyczne między nimi. Matematyczne wyprowadzenia KG zostały dodane w pliku uzupełniającym 1. Ta integracja konstrukcji KG i rozumowania opartego na GNN umożliwia dopasowanie ontologii, wnioskowanie relacji oraz ulepszone wyszukiwanie semantyczne w ramach enterprise KM.

Graf Wiedzy (KG) jest reprezentowany jako heterogeniczny graf G, natomiast jego struktura wyrażana jest przez ontologię O. KG można alternatywnie postrzegać jako zbiór faktów wyrażanych przez twierdzenia rozumowania predykatowego. Te podstawy mają następujące opisy35. Graf G jest zmienny, przy czym V reprezentuje zbiór obiektów lub węzłów (oba mogą być używane zamiennie) i figure-protocol-3 reprezentuje zbiór relacji. Trójka (figure-protocol-4) może być również użyta do charakteryzowania odpowiednio kilku obiektów w1 oraz figure-protocol-5 ich powiązania figure-protocol-6. Matematyczne wyprowadzenie konstrukcji KG z użyciem GNN opisano w Pliku Uzupełniającym 1.

Dopasowanie i rozumowanie ontologii oparte na BERT-GNN
Algorytm 1 pokazuje oparty na GNN Alignment i Rozumowanie Ontologii. Proces rozpoczyna się od inicjalizacji możliwości węzła za pomocą wstępnie wyodrębnionych osadzeń oraz tych wygenerowanych za pomocą wysokiej jakości dostrojonej wersji BERT, które przejmują znaczenie semantyczne każdego elementu z nieustrukturyzowanego tekstu. Graf wiedzy, składający się z węzłów (jednostek) i krawędzi (relacji), jest reprezentowany za pomocą macierzy sąsiedztwa (A) oraz macierzy cech (X).

Zestaw reguł przebiega przez więcej niż jedną warstwę GNN. Na każdej warstwie reprezentacja węzła jest aktualna poprzez agregację danych z sąsiednich węzłów, ważonych ich łącznością (czyli z macierzą sąsiedztwa). Matematycznie formułuje się to metodą przekazywania wiadomości, gdzie osadzenia węzłów są rozwijane za pomocą macierzy wagowych do trenowania i przekazywane przez nieliniową cechę aktywacji, która obejmuje ReLU. Krok normalizacji (np. normalizacja warstw lub użycie macierzy dyplomowych jak w równaniu GCN) gwarantuje stabilne zdobywanie wiedzy o wszystkich warstwach.

Po powtórzeniu tego procesu dla zdefiniowanego zakresu warstw T, model generuje ostateczny zestaw osadzeń węzłów Z, które kodują każde otoczenie wraz z jego kształtem i możliwościami semantycznymi. Te osadzenia są następnie przewyższane przez miękką warstwę klasyfikacji maksymalnej, aby przewidywać wyrównane etykiety ontologiczne, w tym sortowanie encji (np. "Dział", "Produkt", "Projekt") lub role semantyczne wewnątrz korporacji.

Algorytm 1: Dopasowanie ontologii oparte na BERT GNN i rozumowanie
Proces wyrównania ontologii i rozumowania oparty na GNN działał na skonstruowanym Grafie Wiedzy, który składał się z jednostek reprezentowanych jako węzły oraz ich relacji reprezentowanych jako krawędzie. Początkowe reprezentacje węzłów zostały wyprowadzone z osadzeń semantycznych opartych na BERT i zorganizowane w macierz cech. Macierz sąsiedztwa reprezentowała strukturę łączności grafu, a do doprecyzowania reprezentacji węzłów zastosowano zdefiniowaną liczbę warstw GNN. Dla każdej warstwy model aktualizował każdy węzeł, agregując informacje z sąsiednich węzłów na podstawie struktury grafu. Ta agregacja w równaniu (1) polega na mnożeniu reprezentacji sąsiednich węzłów za pomocą trenowalnych macierzy wagowych, dodaniu składnika bias oraz zastosowaniu nieliniowej funkcji aktywacji.

figure-protocol-7   (1)

Po każdej aktualizacji warstwy stosowano normalizację, aby ustabilizować trening i zapewnić spójne skale osadzenia. Po przetworzeniu wszystkich warstw uzyskano ostateczne osadzenia węzłów. Te osadzenia były następnie przekazywane przez warstwę klasyfikacyjną z funkcją softmax, aby przewidywać wyrównane etykiety ontologii lub klasy encji. Procedura generowała końcowe osadzenia węzłów udoskonalonych oraz przewidywane etykiety wyrównane z ontologią jako wyjścia.

Proponowana metoda umożliwia semantyczne wyrównanie jednostek z wielu źródeł oraz wspiera rozumowanie nad grafem wiedzy poprzez wnioskowanie nowych relacji i klasyfikację wcześniej nieoznaczonych węzłów.

figure-protocol-8
Rysunek 3: Dopasowanie ontologii i rozumowanie semantyczne z wykorzystaniem GNN. Ilustruje kroki przekazywania i osadzania wiadomości w okolicy. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

Rysunek 3 ilustruje system sieci neuronowej grafu (GNN) używanego do wyrównania ontologii i stylu encji wewnątrz grafu wiedzy, szczególnie w kontekście wykorzystania AI do organizacji wiedzy w cyfrowym przekształcaniu biznesów. Proces rozpoczyna się od cech wejściowych generowanych przez precyzyjnie dostrojony model BERT, który generuje kontekstowe osadzenia dla każdej jednostki w grafie, w tym dokumentów, działów lub jednostek biznesowych. Te byty są reprezentowane jako węzły (v1,v 2,v 3) w formie grafu, a krawędzie oznaczają między nimi powiązania semantyczne lub relacyjne. Wykazano, że węzeł numer jeden (v2) łączy dane z sąsiednich węzłów (v1 iv 3), wykonując statystyki kontekstowe za pomocą procedury zwanej agregacją sąsiedztwa.

Cechy agregowane są transformowane za pomocą macierzy wag specyficznych dla relacji oraz nieliniowej funkcji aktywacji (np. ReLU), generując zaktualizowane osadzenia węzłów, które integrują cechy semantyczne pochodzące z BERT z informacjami strukturalnymi z grafu. Te osadzenia są następnie przekazywane do warstwy klasyfikacyjnej softmax, aby przewidzieć etykiety encji lub wyrównane klasy ontologiczne. Ten ustalony proces sprawia, że GNN jest niezwykle skuteczny w analizie grafów technologii, wspierając zadania takie jak rozróżnianie elementów, wnioskowanie i typ semantyczny, co ostatecznie przyczynia się do inteligentniejszych, napędzanych przez AI struktur kontroli statystyki (Tabela 2).

SkładnikOpis
Framework/ToolkityPython 3.9, PyTorch 2.0.1, Hugging Face Transformers 4.34, DGL 1.1 (Deep Graph Library)
SprzętNVIDIA Tesla V100 GPU (16GB), 128GB RAM, Ubuntu 20.04
Potok wstępnego przetwarzaniaTokenizacja (Word Piece dla BERT), usuwanie słów stop, rozpoznawanie encji (SpaCy), normalizacja z-score dla cech numerycznych
Źródła zbiorów danychAnkiety zawodowe (250+ odpowiedzi), transkrypcje wywiadów (~120 000 słów), raporty firmowe (50+), studia przypadków (15), dokumenty wewnętrzne (200MB)
Podzielenie danych70% szkolenia, 15% walidacji, 15% testowania
Model enkodera tekstowegoPodstawa BERT (bez obudowy), 12 warstw, 768 ukrytych rozmiarów, 12 głowic do uwagi
BERT Fine-Tuning4 epoki, rozmiar partii = 32, tempo uczenia = 2e-5, optymalizator Adama, maksymalna długość seq = 512
Konstrukcja grafuEkstrakcja wiedzy oparta na tripletach (podmiot, predykat, domień)
Typ grafuGraf heterogeniczny z krawędziami wielorelacyjnymi (byty z wyjścia BERT)
Architektura GNN2-warstwowa heterogeniczna sieć neuronowa z grafem (model przekazywania wiadomości)
Parametry hiper GNNUkryty wymiar = 128, Aktywacja = ReLU, Optymalizator = Adam, Szybkość uczenia = 0,001
Typ dekoderaDist. Mult z punktacją iloczynu skalarnego dla przewidywania linków
Funkcja stratyBinarna entropia krzyżowa dla klasyfikacji tripletowej

Tabela 2: Szczegóły konfiguracji modelu BERT. Podsumowuje ustawienia treningowe używane do ekstrakcji semantycznej.

Na koniec protokół kończy się generowaniem następujących wyników: grafu wiedzy korporacyjnej zharmonizowanej z ontologią, modeli BERT i GNN, wyników wyszukiwania informacji i rozumowania oraz raportów KRP, OAA, DML i USR. Dostarczają one końcowego wyniku w formie powtarzalnej. Dla próbkowania ujemnego podczas treningu GNN poprawne trójki są uszkodzone poprzez zastępowanie jednostek zgodnie z ograniczeniami typowymi zdefiniowanymi przez ontologię. Powstałe dopasowania ontologii są weryfikowane pod kątem spójności i ręcznie sprawdzane przez ekspertów dziedzinowych, aby zapewnić spójność semantyczną między wyodrębnionymi bytami a klasami kanonicznych ontologii.

Kryteria oceny
Opóźnienie podejmowania decyzji to miara całkowitego czasu potrzebnego przez system na udzielenie odpowiedzi umożliwiającej wykonanie działania po przesłaniu zapytania użytkownika. Niech i będzie zapytaniem użytkownika, figure-protocol-9 niech będzie momentem jego wysłania, niech będzie momentem, figure-protocol-10 w którym system dostarcza ostateczny wynik decyzji. Opóźnienie podejmowania decyzji (DML) jest dane przez:

figure-protocol-11 (2)

gdzie to całkowita liczba ocenionych zapytań. Ta metryka mierzy ogólny czas reakcji proponowanego ramowego systemu, od wyszukiwania wiedzy po generowanie odpowiedzi. Niższa wartość tego wskaźnika jest idealna, ponieważ pokazuje szybszy czas reakcji systemu, co jest kluczowe dla aplikacji decyzyjnej w przedsiębiorstwie o dużej wrażliwości czasowej.

Wskaźnik pokrycia wiedzy to stosunek zdolności systemu do pobierania wszystkich istotnych elementów wiedzy dostępnych dla danego zapytania. Niech będzie zbiorem wszystkich istotnych elementów wiedzy dla zapytania q, niech będzie zbiorem rzeczywiście pobranych przez system. Wskaźnik pokrycia wiedzy (KCR) definiuje się jako:

figure-protocol-12 (3)

Ten wzór oblicza zupełność elementów wiedzy, które są pobierane. Jest odpowiednikiem miary przypominania używanej w tradycyjnych systemach wyszukiwania informacji.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wstępne przetwarzanie danych i precyzyjne dostrajanie BERT
Proponowane urządzenie integruje najlepiej dostrojoną wersję BERT do nieustrukturyzowanej ekstrakcji z zakresu zrozumienia oraz sieć neuronową grafu (GNN) do wyrównywania ontologii i rozumowania w ramach ram grafów zrozumienia. Eksperymentalny układ dotyczył porównania ogólnej wydajności aspektu BERT w zadaniach NER i RE, podczas gdy czynnik GNN został przeanalizowany na przewidywaniu łącza i klasie węzłów na zbudowanym grafie zrozumienia.

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejsze badanie przedstawia zunifikowany framework enterprise KM, który integruje kontekstową ekstrakcję semantyczną za pomocą BERT z relacyjnym rozumowaniem opartym na grafach oraz dopasowaniem ontologii za pomocą GNN. Aby umożliwić łączenie encji, rozumowanie międzydokumentowe oraz spójną reprezentację wiedzy na różnych źródłach danych biznesowych, głównym wkładem jest integracja głębokiego modelowania językowego kontekstowego ze strukturyzowanym, świadomym ontologią wnioskowaniem w ramach jednego potoku

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają konfliktu interesów

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy z wdzięcznością wyrażają wsparcie udzielane przez Wydział Ekonomii i Zarządzania Narodowego Uniwersytetu Malezji w Bangi, Malezja.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Model wstępnie wytrenowany BERT-Base (bez cased)Google AINie maModel językowy oparty na transformatorze (wariant bert-base-uncaseed)
Biblioteka Głębokich Grafów (DGL)AWS LabsRRID: SCR_017054Wersja 2.1 używana do modelowania sieci neuronowych na grafach
Biblioteka wizualizacji MatplotlibSpołeczność PyDataRRID: SCR_008624Wykorzystywane do wykresów wydajności i analityki wizualnej
Biblioteka grafów NetworkXSpołeczność PyPIRRID: SCR_005317Wersja 3.2 używana do konstrukcji i analizy grafów
Biblioteka obliczeń numerycznych NumPySpołeczność PyDataRRID: SCR_008633Wykorzystywane do operacji numerycznych i przetwarzania tablic
Karta graficzna NVIDIA (Tesla T4 / RTX 3080)NVIDIA CorporationRRID: SCR_016409Sprzętowy akcelerator z CUDA do trenowania modeli
Biblioteka Analizy Danych PandasSpołeczność PyDataRRID: SCR_018214Wykorzystywane do manipulacji danymi strukturalnymi
Język programowania PythonPython Software FoundationRRID: SCR_008394Wersja 3.10 używana do tworzenia modeli i przetwarzania danych
Ramy Głębokiego Uczenia PyTorchMeta AIRRID: SCR_018536Wersja 2.0 używana do implementacji sieci neuronowych
Biblioteka uczenia maszynowego Scikit-learnScikit-learn DevelopersRRID: SCR_002577Wersja 1.5 używana do wstępnego przetwarzania i oceny metryk
Biblioteka NLP TransformersPrzytulająca się twarzRRID: SCR_020989Wersja 4.40 używana dla modeli transformatorów wstępnie wytrenowanych
System operacyjny Ubuntu LinuxCanonical Ltd.RRID: SCR_018317Środowisko uruchomieniowe LTS w wersji 20.04

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Knowledge RetrievalGraph Neural NetworksBERT ModelOntology AlignmentSemantic ReasoningKnowledge GraphsEntity ExtractionRelation ExtractionEnterprise Knowledge ManagementSemantic Search

Related Articles