Methodenartikel

Een AI-workflow die bidirectionele encoderrepresentaties van transformers (BERT) en graph neurale netwerken (GNN's) combineert voor kennisopvraging in digitale ondernemingen

DOI:

10.3791/70045

28 april 2026

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dit protocol presenteert een reproduceerbare, door AI aangedreven workflow die BERT fin-tunt voor entiteit- en relatie-extractie, grafneurale netwerken gebruikt voor ontologie-uitlijning, enterprise knowledge graphs construeert uit ongestructureerde data en systematisch de prestaties van semantische opvraging en de efficiëntie van besluitvormingsondersteuning evalueert.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Grote hoeveelheden ongestructureerde organisatiedata kunnen het voor enterprise knowledge management (KM)-systemen moeilijk maken om correcte en contextueel relevante informatie te extraheren, wat kan leiden tot inefficiënte kennisdeling en vertraagde besluitvorming. Deze studie suggereert een uniform, door kunstmatige intelligentie gedreven kader om deze beperking te overwinnen. Het combineert Graph Neural Networks (GNN's) voor ontologie-uitlijning en semantisch redeneren met verfijnde Bidirectional Encoder Representations from Transformers (BERT) voor domeinspecifieke entiteit- en relatie-extractie. Systematische gegevensverzameling, voorbewerking van bedrijfstekstcorpora, het fijn afstemmen van BERT om entiteiten en relaties te identificeren, het omzetten van geëxtraheerde triples in gestructureerde kennisgrafieken, en GNN-gebaseerde ontologie-uitlijning om semantische consistentie te garanderen over heterogene kennisbronnen, vormen de methodologische pijplijn. Om de effectiviteit van het systeem in echte bedrijfsscenario's te evalueren, integreert het framework ook taakgerichte beoordelingsmetingen, zoals ophaalprecisie, ontologie-uitlijning correctheid en besluitlatenschap. In vergelijking met basismethoden toont experimentele validatie in twee industriële toepassingen een vermindering van 35% in besluitvormingslatentie en een toename van 21% in kennisophaalprecisie.

Bovendien geeft gebruikersfeedback aan dat de KM-interface de gebruikerstevredenheid heeft verhoogd door zijn semantische zoekfunctie en contextuele taggingfuncties. De voorgestelde architectuur faciliteert reproduceerbare kennisgrafieken uit ongestructureerde bedrijfsdata door methodisch grafgebaseerd redeneren en afstemmen te combineren met deep learning-gebaseerde informatie-extractie. De bevindingen tonen aan dat zowel strategische als operationele KM-resultaten verbeterden wanneer georganiseerde kennisrepresentaties werden afgestemd op organisatorische procedures. Uiteindelijk verhoogt de voorgestelde methode de ophaalnauwkeurigheid, versnelt de reactietijden van de beslissingsworkflow en biedt het een werkbare en schaalbare optie voor KM-systemen op bedrijfsniveau.

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Effectieve KM kan moeilijk te implementeren zijn in digitale transformatieprogramma's vanwege onsamenhangende datarepositories, diverse organisatorische platforms en gefragmenteerde kennis verspreid over ongestructureerde documenten. Een reproduceerbaar, technisch uitvoerbaar kader dat methodisch enterprisekennis extraheert, structureert, uitlijnt en operationeel maakt, is door weinig onderzoek voorgesteld, ondanks eerdere studies die AI-adoptie en digitale transformatie vanuit organisatorisch en sectoraal perspectief bekeken, 1,2,3. Huidige methoden richten zich vooral op management- of strategische gevolgen, maar bieden niet genoeg architectonische details voor schaalimplementatie.

Conventionele managementinformatiesystemen (MIS) en enterprise resource planning (ERP) systemen verwerken voornamelijk gestructureerde data en faciliteren transactionele rapportage, maar ze kunnen ongestructureerde tekst niet verwerken of contextbewuste semantische redenering uitvoeren. Aan de andere kant worden contextuele entiteiten en RE uit ingewikkelde tekstuele corpora 4,5 mogelijk gemaakt door transformer-gebaseerde modellen zoals BERT. In dezelfde geest hebben GNN's bewezen zeer capabel te zijn in relationeel redeneren, grafrepresentatieleren en ontologie-uitlijning in diverse vakgebieden 6,7,8. Ondanks deze ontwikkelingen gebruikt huidig onderzoek deze modellen meestal afzonderlijk in plaats van ze te integreren in een samenhangende zakelijke KM-pijplijn.

Big Data Analytics, cloud computing, het Industrial Internet of Things en geavanceerde machine learning zijn voorbeelden van recente technologische vooruitgang die de digitale transformatie in sectoren als productie, gezondheidszorg, professionele dienstenen governance hebben versneld. Tegelijkertijd leggen internationale beleidskaders een sterke nadruk op de verantwoorde toepassing van AI, met nadruk op ethische afstemming, verantwoording en transparantie in digitale systemen 13,14,15. Toch worden ethische interpreteerbaarheid en technische robuustheid zelden gecombineerd in één enkele architectuur in bestaande KM-systemen.

In milieu-, sociale en governancerapporten (ESG) kan bijvoorbeeld AI-gedreven besluitvorming complexe morele kwesties negeren die om beslissingen van mensen vragen. Een vermindering van het vermogen om data te beoordelen met behulp van gespecialiseerde beslissing16 kan het gevolg zijn van een overmatige afhankelijkheid van informatie. De counselingfunctie die PAs uitvoeren, die historisch gebaseerd was op economische kennis en cliëntinteractie, kan uiteindelijk worden verminderd door automatisering17. Dit kan verstoren omdat de middelen die bedoeld zijn om het beroep te bevorderen onbedoeld kritieke menselijke vaardigheden kunnen aantasten.

De natuurlijke combinatie van geavanceerde digitale technologie met een verbeterde focus op morele commerciële prestaties en ondernemerschap die mensen bestelt, symboliseert Industrie 6.0, een baanbrekende fase in industriële ontwikkeling18. Deze fase, die Industrie 4.0 en Industrie 5.0 vormt, is de volgende fase van technologische groei. Door een tijd te visualiseren waarin uitvinding menselijke vaardigheden verbetert in plaats van vervangt, wijst Industry 6.0 deze gedachtenuit. Dit plan behandelt morele zorgen over mechanisatie en stimuleert samenwerking tussen mensen en robots, cumulatieve efficiëntie20. Het zakelijke aspect van de DL van werknemers is belangrijk omdat interacties met collega's binnen het bedrijf vaak de competentie en het begrip van digitale technologie van een individu beïnvloeden. Deze strategie probeert in lijn te zijn met studies die proberen te verduidelijken hoe werknemers en nieuwe technologie kunnen samenwerken, zodat verschillende taken en werkzaamheden in bedrijven kunnen worden uitgevoerd21,22. Omdat het hen blootstelt aan een grotere klantenbasis, wordt DL gezien als cruciaal voor het overleven van kleinebedrijven. In vergelijking met traditionele bedrijfsstructuren kunnen managers in MKB hun bedrijf efficiënter en met minder fysieke activa runnen door gebruik te maken van technologische vooruitgang24,25.

De ontwikkeling van online advertentiecapaciteit, die in feite de bedrijfsprestaties verbetert, is afhankelijk van technologische middelen zoals technologische vooruitgang en verbinding met bedrijfsdoelstellingen26. De elektronische focus van een bedrijf en de technologische revolutie in zijn klantomgeving fungeren echter als beheerders van deze invloeden27. Bedrijven kunnen IT-vooruitgang en synchronisatie effectiever gebruiken om hun online promotiemogelijkheden te ontwikkelen door digitale technologie diep te integreren in hun bedrijf, producten, aanbod en plannen.

De twee mechanismen van AI-technologische reserves zijn kapitaaluitgaven (capex), die kunnen worden gebruikt voor de organisatie van Big Data-platforms, toevoegingen en ontwikkelingen, en informatiewetenschap en machine learning-uitvindingsschema's, of operationele kosten, die worden gebruikt om licenties toe te staan voor AI- en Big Data-tools binnen de organisatie, of tenslotte AI-gerelateerde training voor medewerkers28. De voordelen van het adopteren van AI zijn groter voor bedrijven die zich ook bezighouden met andere technologieën en interne R&D-strategie volgen, volgens Lee's29onderzoek naar AI-activaacties. Daarnaast is het cruciaal om te kiezen tussen werk buiten de autoriteiten en het gebruik van intern AI-geschoold personeel30. De positie van human resources in dit opleidingsveld is een belangrijk aandachtspunt van huidig onderzoek, en de resultaten tonen aan dat bedrijven met interne AI-kennis dat talent investeren in ontwikkeling om een voorsprong te krijgen op concurrenten31,32.

Eiwitinteracties werden voorspeld met GNN's in33 jaar, en voorspellingen werden geverifieerd met LLM's. De aanpak was zeer nauwkeurig en bood interpreteerbare verklaringen. Geavanceerde machine learning- en deep learning-technieken zoals BERT zijn gebruikt om grootschalige sociale mediadata te bestuderen in tijden van crisis34. RNN, CNN en GCN helpen bij het verwerken en classificeren van enorme hoeveelheden data en kunnen worden toegepast bij tumordetectie35. De auteurs presenteren in 36,37,38,39 een nieuwe benadering om aanbevelingssystemen uit te breiden door zowel sociale als kennisgrafieken te integreren met GNN-gebaseerde modellen.

Eerder onderzoek heeft niet grondig onderzocht hoe transformer-gebaseerde semantische extractie en graf-gebaseerd redeneren systematisch kunnen worden geïntegreerd om zowel operationele als strategische KM-functies te verbeteren, ondanks het feit dat AI en Big Data Analytics worden erkend als transformerende krachten in professionele omgevingen. In het bijzonder ontbreken gevestigde kaders die (i) ongestructureerde bedrijfstekst transformeren in semantisch uitgelijnde kennisgrafieken, (ii) consistentie op ontologieniveau over verre bronnen garanderen, en (iii) de impact van enterprise decision support statistisch beoordelen.

Om deze kloof te dichten, voorspelt deze studie dat, in vergelijking met traditionele ERP/MIS-gebaseerde en keyword-gedreven KM-systemen, het combineren van domeinadaptieve transformer-gebaseerde informatie-extractie met GNN-gedreven ontologie-alignment en redenering de semantische opzoeknauwkeurigheid aanzienlijk zal verhogen en de besluitloosheid van ondernemingen zal verlagen. In deze studie wordt een uitvoerbaar AI-Big Data Analytics aangedreven KM-framework voorgesteld. Het kan de volgende taken uitvoeren: domeinspecifieke entiteit- en relatie-extractie met behulp van een fijn afgestemd transformatormodel; kennisgrafiekconstructie uit geëxtraheerde triples; GNN-gebaseerde ontologie-uitlijning en relationeel redeneren; en taakgerichte evaluatie met behulp van ophaalprecisie, uitlijningsnauwkeurigheid en beslissingslatentiemetriek.

Het nieuws van de voorgestelde aanpak is de dubbellaagse KM-uitlijning, die tegelijkertijd strategische KM ondersteunt via gestructureerde kennisintegratie die de organisatorische wendbaarheid en innovatiecapaciteit verbetert; en Operationele KM door verbeterde besluitvormingsondersteuning, procesoptimalisatie en contextuele opvraging. Dit artikel biedt een end-to-end, empirisch bewezen architectuur die is geïmplementeerd over twee echte bedrijfssystemen, in tegenstelling tot eerder conceptueel of enkelmodelonderzoek. De experimentele resultaten tonen een afname van 35% in besluitvormingslatentie en een toename van 21% in de precisie van de retrieval. Daarnaast verbetert het systeem door AI-gedreven output te koppelen aan semantisch georganiseerde kennisrepresentaties de interpreteerbaarheid en faciliteert het transparante en verantwoorde besluitvorming. Deze studie creëert een schaalbaar en herhaalbaar paradigma voor het bouwen van enterprise knowledge graphs en intelligente KM in geavanceerde digitale transformatieomgevingen die in lijn zijn met de principes van Industry 6.0 door methodisch transformer-gebaseerde contextuele codering te combineren met grafgebaseerde semantische redenering.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ethische verklaring

Deze studie werd beoordeeld en goedgekeurd door de Institutional Review Board (IRB) van The National University of Malaysia (UKM) voorafgaand aan de gegevensverzameling (Goedkeurings-ID: UKM/FEP/2025/AI-047; Goedkeuringsdatum: 12 maart 2025). Het goedgekeurde protocol omvatte het afnemen van gestructureerde enquêtes en semi-gestructureerde interviews met menselijke deelnemers. Alle deelnemers werden geïnformeerd over het doel van de studie, het vrijwillige karakter van hun deelname en hun recht om zich op elk moment zonder gevolgen terug te trekken, en er werd schriftelijke geïnformeerde toestemming verkregen voordat ze werden opgenomen. Anonimiteit en vertrouwelijkheid van deelnemers werden strikt gehandhaafd, zonder persoonlijk identificeerbare informatie in de analyse of publicatie, en alle gegevens werden veilig opgeslagen en uitsluitend gebruikt voor academisch onderzoek in overeenstemming met institutionele ethische normen en relevante internationale richtlijnen voor onderzoek met mens.

Algemene architectuur van het voorgestelde BERT–GNN KM-raamwerk

Aanvankelijk werd een fijn afgestemde transformer-encoder gebruikt om ongestructureerde tekst te verwerken, waaronder interne documenten, klantinteracties en content op sociale media. De algemene systeemarchitectuur van de op BERT–GNN gebaseerde KM-workflow is weergegeven in Figuur 1. De bedrijfsgegevens die in deze studie werden gebruikt, werden verzameld in digitale documentformaten, waaronder gestructureerde enquêtebestanden, interviewtranscripties, interne bedrijfsrapporten en publiek beschikbare casestudy-documenten. Alle documenten werden samengevoegd tot een uniform corpus voor analyse. Tekstuele inhoud werd uit deze bronnen gehaald en opgeschoond om irrelevante metadata, dubbele vermeldingen en opmaakartefacten te verwijderen. Het opgeschonen corpus werd vervolgens gesegmenteerd in zinnen en getokeniseerd om het voor te bereiden op downstream natuurlijke taalverwerking zoals tekstextractie met parsers, ruisverwijdering, zinssegmentatie en tokenisatie met Word-stuktokenizer. Deze verwerkte tekstuele dataset diende als input voor het fijn afgestemde model voor entiteit- en relatie-extractie33 , dat 12 lagen heeft met 12 aandachtshoofden en 768 verborgen eenheden. De geëxtraheerde data werden georganiseerd in een kennisgrafiek, die een gestructureerde en onderling verbonden representatie van kennis bood over de ontologiemapping van het ondernemingsdomein. GNN's werden toegepast voor ontologie-uitlijning met behulp van cosinusgelijkenis en redenering om ervoor te zorgen dat semantische relaties over kennisdomeinen nauwkeurig werden vastgelegd en logisch afgeleid door duplicaten te verwijderen via stringgelijkenis met de drempel 0,85. De verwerkte kennis werd vervolgens binnen de besluitvormingslaag gebruikt, waardoor efficiënte data-analyse mogelijk werd gemaakt en datagedreven besluitvorming mogelijk werd. Deze architectuur transformeerde gefragmenteerde data in intelligente, contextbewuste informatiebronnen. Het framework werd gevalideerd via business case-simulaties en vergeleken met conventionele KM-systemen zoals Naive Bayes (NB), Support Vector Machine (SVM), Random Forest (RF), TF-IDF, LDA, BERT only en BERT met KG, met de dataset-verdeling van 70:15:15 en een vaste set van 42 om prestatieverbeteringen in ophaalnauwkeurigheid, beslissingslatentie en kennisnut te evalueren.

figure-protocol-1
Figuur 1. Algemene systeemarchitectuur van BERT-GNN gebaseerde KM Workflow. Algemene AI–BDA–GNN systeemarchitectuur met multi-source data-opname, pre-processing, fijn afgestemde BERT voor semantische extractie, KG-populatie, GNN-gebaseerde ontologie-uitlijning/redenering en de besluitvormingslaag. Pijlen geven datastroom en optionele feedbacklussen voor online leren aan. Klik hier om een grotere versie van deze figuur te bekijken.

Data-acquisitie

De dataset die in deze studie werd gebruikt, is verzameld uit meerdere bronnen om representativiteit en externe validiteit te ondersteunen. Primaire gegevensverzameling via gestructureerde enquêtes en semi-gestructureerde interviews met professionals uit de IT-, productie-, gezondheidszorg- en onderwijssectoren omvatte gecertificeerde leden van de Kamer van Financiële Auditors van Roemenië. De secundaire gegevens omvatten geanonimiseerde interne bedrijfsdocumenten, jaarverslagen en openbaar beschikbare casestudy's van digitale transformatie. De gegevensverzameling vond plaats binnen een duidelijk afgebakende studieperiode en alle dossiers werden geanonimiseerd op grond van institutionele ethische goedkeuring om vertrouwelijkheid te beschermen en naleving te waarborgen.

Selectiecriteria voor deelname: Om methodologische strengheid en representativiteit te garanderen, werden deelnemers geselecteerd op basis van goed gedefinieerde inclusie- en exclusiecriteria. Naast actieve betrokkenheid bij digitale transformatie, KM, kunstmatige intelligentie, big data-analyse of initiatieven voor bedrijfsinformatiesystemen, moesten in aanmerking komende deelnemers minstens drie jaar professionele ervaring hebben in IT, productie, gezondheidszorg, onderwijs, boekhouding of aanverwante ondernemingsomgevingen. Het was noodzakelijk dat gecertificeerde professionals tijdens de gegevensverzamelingsperiode een actieve certificeringsstatus hadden (bijvoorbeeld leden van de Kamer van Financiële Auditors van Roemenië). Om de enquête en interviewmaterialen nauwkeurig te begrijpen en geïnformeerde toestemming te geven volgens het geautoriseerde IRB-protocol, moesten deelnemers ook aantonen dat ze in Roemeens of Engels vaardig waren. Personen met minder dan drie jaar relevante ervaring, inactieve professionele status (indien van toepassing), geen directe betrokkenheid bij kennis- of besluitvormingsprocessen op ondernemingsniveau, onvolledige enquête-antwoorden (meer dan 20% ontbrekende gegevens) of mislukte beoordelingen van gegevenskwaliteit werden allemaal uitgesloten. Daarnaast werden transcripties van interviews die niet voldoende gedetailleerd of relevant waren voor KM-technieken niet opgenomen in de analyse. Een competente, sectorrepresentatieve en analytisch solide deelnemerssteekproef werd door deze normen gegarandeerd.

Gecertificeerde leden van de Kamer van Financiële Auditors van Roemenië (CAFR) waren een belangrijke doelgroep voor gegevensverzameling. Er werd een online enquête ontwikkeld en verspreid via interne communicatiekanalen van CAFR om gerichte verspreiding en hoge responspercentages te ondersteunen. Om een representatieve steekproef te vormen, werden CAFR-geschiedenissen beoordeeld en werden 250 geregistreerde deelnemers geselecteerd op basis van studierelevante kenmerken.

Structuur van enquête-instrumenten: De studie gebruikte een gestructureerde vragenlijst met 24 items verspreid over vijf constructdomeinen: organisatorische wendbaarheid en operationele efficiëntie (5 items), strategische besluitvormingsondersteuning en innovatiecapaciteit (5 items), impact van Big Data Analytics op kennisdeling (5 items), AI-adoptie in KM (5 items) en door gebruikers waargenomen effectiviteit en systeembruikbaarheid (4 items). Een Likert-schaal van 5 punten, waarbij 1 "sterk oneens" en 5 "sterk eens" betekent, werd gebruikt om elk item te beoordelen. De tool werd gecontextualiseerd voor de implementatie van enterprise AI en aangepast van eerder gevalideerde KM- en digitale transformatieschalen. Drie academische wetenschappers en twee bedrijfsdeskundigen voerden een deskundige beoordeling uit om de geldigheid van de inhoud te bevestigen. Om de taal te verbeteren, de duidelijkheid te meten en de betrouwbaarheid te meten, werd een pilotonderzoek uitgevoerd met 20 praktijkmensen; alle componenten hadden Cronbachs alfawaarden groter dan 0,80, wat wijst op een sterke interne consistentie. Er werden ook semi-gestructureerde interviews afgenomen ter aanvulling van de enquêteresultaten. Vijf onderwerpen werden behandeld in de interviewgids: ervaring met digitale transformatie, moeilijkheden met de kennisstroom van ondernemingen, integratie van AI en Big Data in besluitvorming, obstakels voor semantische afstemming en ethische governancekwesties. Elk interview werd afgenomen met geïnformeerde toestemming, duurde ongeveer 45 tot 60 minuten, werd opgenomen in audio en vervolgens getranscribeerd voor kwalitatieve analyse.

Om de prestaties van het voorgestelde BERT-GNN-framework voor KM in digitaal transformerende organisaties te evalueren, werd een grote en diverse dataset opgesteld uit verschillende bronnen in diverse sectoren. De dataset behandelt zowel kwantitatieve als kwalitatieve aspecten om de dynamische percepties over kennisstroom en organisatorische verandering te vertegenwoordigen. Gestructureerde data werden verzameld van meer dan 250 professionals via een online vragenlijst bestaande uit Likert-schaal (bereik 1–5) om de waargenomen effecten van Kunstmatige Intelligentie (AI) en Big Data Analytics (BDA) op kennisdeling, innovatie en zakelijke wendbaarheid te meten. Tegelijkertijd werden ongestructureerde gegevens verzameld via semi-gestructureerde interviews met 30 domeinexperts, wat meer dan 120.000 transcriptwoorden opleverde. Verder werden semi-gestructureerde materialen, waaronder jaarverslagen van het bedrijf en digitale strategiedocumenten (meer dan 50 documenten), verzameld om adoptiepatronen op ondernemingsniveau in context te plaatsen. Daarnaast werden 15 gedetailleerde casestudy's uit de IT-, productie-, gezondheidszorg- en onderwijssectoren toegevoegd om praktische transformatiecontexten te bieden. Interne kennisbankartikelen (circa 200 MB), geanonimeerd om privacyredenen, en werden ook opgenomen om de weergave van operationele kennisbronnen te verbeteren. Deze multi-source dataset maakt een sterke trainings- en evaluatiepijplijn voor deep learning-modellen mogelijk en vangt zowel strategische als operationele aspecten van KM vast. Tabel 1 toont de populatiesteekproef die voor de evaluatie is gebruikt.

ComponentTypeBronGrootte/Volume
Antwoorden op professionele enquêtesGestructureerdOnline enquêtes van 250+ professionals~10.000 records
Transcripties van het interviewOngestructureerdSemi-gestructureerde interviews met 30 experts~120.000 woorden
BedrijfsrapportenSemi-gestructureerdJaarverslagen en digitale strategiedocumenten.50+ documenten
Casestudy'sGemengdIndustriespecifieke toepassingen van digitale transformatie15 gedetailleerde zaken
Inhoud van kennisbasisOngestructureerdInterne documenten van organisaties (geanonimiseerd)~200 MB

Data-voorverwerking en BERT-fine-tuning

De ruwe bedrijfsdocumentgegevens werden benaderd vanuit een gecureerde lijst en vooraf verwerkt met zinssegmentatie, tokenisatie, stopwoordverwijdering en normalisatie om aan de eisen van de tokenizer te voldoen. Het vooraf getrainde model werd vervolgens verder aangepast om het model voor een bepaalde taak te verfijnen, en vervolgens fijn afgesteld om een taak uit te voeren voor naamloze entiteitsherkenning (NER) en relatie-extractie (RE). Het model is verfijnd op de vooraf verwerkte corpusgegevens voor een bepaald epoch-aantal met de Adam-optimizer. Ten slotte werden gecontextualiseerde woordembeddingen (R768) geproduceerd uit geïdentificeerde entiteiten en hun relaties. Genormaliseerde entiteiten werden gegenereerd door een op ontologie gebaseerde normalisatietechniek, waarbij verschillende entiteiten, zoals synoniemen, werden omgezet in genormaliseerde vorm. Elke afzonderlijke genormaliseerde entiteit was een knoop, terwijl de relatie tussen entiteiten een rand werd genoemd in de kennisgrafiekrepresentatie. De genormaliseerde entiteit-embeddings die door het model worden gegenereerd, vormden de initiële knooppunten van het Graph Neural Network. In de volgende stap werd het Graph Neural Network getraind met de methode voor supervised link-voorspelling met negatieve steekproef verkregen via randcorruptie. In de training is er een kruis-entropieverlies over meerdere tijdperken. Het getrainde kader werd beoordeeld door gebruik te maken van Knowledge Retrieval Precision, Decision Making Latency en User Satisfaction Rate als evaluatiemetrics.

Een hybride annotatiebenadering werd gebruikt om trainingslabels voor RE en NER te maken. Twee onafhankelijke inhoudsdeskundigen annoteerden handmatig een domeinspecifiek corpus van bedrijfsdocumenten, zoals interne rapporten, klantinteractielogboeken en beleidsdocumenten, met behulp van een vooraf bepaald ontologieschema dat entiteitscategorieën (zoals Organisatie, Proces, Technologie, Rol, KPI) en relatietypen (zoals supports, depends_on en improves) identificeerde. Om uniformiteit te garanderen in relatie tot richting en detectie van entiteitsgrens, zijn uitgebreide annotatierichtlijnen opgesteld. 20% van de dataset werd dubbel geannoteerd om de betrouwbaarheid te beoordelen. Cohens Kappa werd gebruikt om overeenstemming tussen de annotators te testen, en de resultaten toonden sterke overeenstemming (κ = 0,87 voor entiteitslabeling en κ = 0,82 voor relatie-extractie). Zwakke supervisie werd vervolgens gebruikt om de handmatig geannoteerde dataset uit te breiden met regelgebaseerde en ontologie-beperkte patroonmatching, met betrouwbaarheidsgebaseerde filtering om ruis te verminderen. Om volledige reproduceerbaarheid te garanderen, werden alle annotatieprocedures, ontologiedefinities, datasetsplitsingen en willekeurige seeds geregistreerd.

Efficiëntie in precisie werd op documentniveau gemeten, latentie werd geschat op basis van de end-to-end antwoordtijd van zoekopdrachten, en gebruikers waren tevreden met het gebruik van de Likert-schaalvragenlijsten. Aan het einde van elke fase werden de volgende protocolcontrolepunten ingesteld. (i) BERT-outputcheckpoint - sample-entiteiten en relatietriples geëxtraheerd; (ii) KG-checkpointsteekproef van een geconstrueerde subgraaf met ontologielabels; (iii) GNN-controlepunt - steekproef van ontologievoorspelling en afgeleide link; en (iv) ophaalcontrolepunt - een steekproef van opgehaalde kennisitems met relevantielabels.

Het voorgestelde protocol heeft de volgende structuur: deterministische, meerfasige pijplijn met goed gedefinieerde tussentijdse outputs, waardoor volledige reproduceerbaarheid mogelijk is. Stap 1, Na het innemen en voorverwerken van ruwe gestructureerde, semi-gestructureerde en ongestructureerde enterprise-gegevens, worden gereinigde tekstcorpora en genormaliseerde numerieke feature-matrices gegenereerd. Stap 2: Toepassing van fijn afgestemde BERT-modellen zal worden uitgevoerd voor kennisextractie, waarbij expliciete output wordt gegeven in de vorm van benoemde entiteiten, zoals Afdeling, Proces, Document en KPI; (ii) semantische relaties tussen entiteiten, weergegeven als subject-predicaat-object triples. In stap 3 worden deze triples omgezet in een initiële kennisgrafiek, waarin knooppunten entiteiten zijn en relaties getypeerde randen, uitgelijnd met een vooraf gedefinieerd ontologieschema. In stap 4 zou de toepassing van het Graph Neural Network op deze graaf voor ontologie-uitlijning en redenering verbeterde knoop-embeddings genereren, relaties afleiden en ontologielabels uitlijnen. Stap 5 biedt de definitieve kennisgrafiek en redeneerresultaten die de semantische opvraging, besluitvorming en prestatie-evaluatie zullen voeden.

Alle tussenliggende artefacten, waaronder entiteitslijsten, relatietriples, ontologie-uitgelijnde grafen en afgeleide links, worden expliciet gegenereerd in elke fase van dit protocol, waardoor onafhankelijke replicatie van onderzoek mogelijk is zonder herinneringen.

De dataset wordt verdeeld in de trainingsset, validatieset en testset volgens een vaste 70:15:15-verhouding om de reproduceerbaarheid van de experimentresultaten te waarborgen. Tokenisatie, kleine letters, stopwoord verwijderen en sequentie verkorten tot 512 tokens worden allemaal gedaan voor BERT wat betreft tekstvoorbereiding. Aan de andere kant wordt Z-Score-normalisatie gebruikt om structurele kenmerken te normaliseren. Daarnaast wordt het BERT-model fijn afgesteld met behulp van de deep learning framework-bibliotheek met de Adam optimizer, waarbij de leersnelheid 2e-5 is, batchgrootte gelijk aan 16 en het aantal epochs 5. De voorspelde geëxtraheerde entiteiten en relaties worden opgeslagen in een standaardformaat voor de constructie van de kennisgraaf. Daarnaast wordt de knowledge graph node embedding (R768) gebruikt als input voor de GNN voor ontologie-uitlijning en redenering.

BERT-GNN interface en datastroom

Binnen het voorgestelde kader wordt de transformer-encoder fijn afgesteld om twee NLP-taken uit te voeren: de NER-taak en de RE-taak op een enterprise-tekstcorpus. Ten slotte omvatten de modeluitvoer contextualiseerde token-embeddings (R768), entiteitsclassificatielabels en subject-predicaat-object relationele triplets. Genormaliseerde entiteiten worden gebruikt door een vooraf gedefinieerde enterprise-ontologie te construeren, waarbij tekstuele variaties en synoniemen van de entiteit worden gekoppeld aan een entiteitsidentificatie. Elke unieke genormaliseerde entiteit krijgt een nieuwe entiteitsknoop toegewezen binnen de geconstrueerde kennisgrafiek. Afhankelijk van de grootte van het industriecorpus heeft de gegenereerde kennisgrafiek in de beoordeelde ondernemingsscenario's tussen de 18.000 en 25.000 entiteitsknooppunten en 42.000 tot 60.000 getypeerde relationele randen. Person, Afdeling, Proces, Product, Organisatie en Document zijn slechts enkele van de knoopsoorttypen die in de grafiek voorkomen. Andere randtypes zijn onder andere works_for, manages, belongs_to, produces, approved_by en related_to. Aan elke knoop wordt aan elke knoop een aparte ontologie-gebaseerde identificatie gegeven die is afgeleid van een vooraf bepaalde enterprise-ontologie. Als gevolg hiervan heeft de resulterende heterogene graaf getypeerde randen die genormaliseerde relaties en getypeerde knopen met semantische embedding-eigenschappen vertegenwoordigen. Daarna krijgen de GNN deze node-embeddings voor relationeel redeneren en ontologie-uitlijning. Cruciaal is dat de GNN op de gegenereerde graaf functioneert zonder gradiënten terug te propageren naar de BERT-encoder, wat modulaire training garandeert en de scheiding van de componenten van graafredenering en semantische extractie behoudt.

BERT werd in deze studie gebruikt voor contextuele taalmodellering en het extraheren van semantische kenmerken. Het model kan efficiënt leren de juiste categorielabels voor nieuwe tekstinvoer te voorspellen wanneer het wordt afgestemd met gelabelde data die zijn afgestemd op een specifiek classificatiedoel. Omdat BERT bidirectioneel is, houdt het rekening met zowel de voorafgaande als de volgende context van elk woord, waardoor een meer volledig begrip van de relaties binnen de tekst mogelijk wordt. De encoder van het BERT-basismodel bestaat uit 12 transformatorblokken, elk met 12 zelfaandaghoofden en een verborgen grootte van 768. Voor verwerking wordt de invoertekst onderverdeeld in tokens, afhankelijk van de gekozen tokenisatiemethode, die woorden of subwoorden kunnen vertegenwoordigen. De sequentierepresentatie die is afgeleid met BERT wordt beschreven in Aanvullend Bestand 1. De modelparameters worden geoptimaliseerd door de logaritmische kans op het juiste label te minimaliseren (Figuur 2).

figure-protocol-2
Figuur 2. Gedetailleerd werkproces van het BERT-model dat wordt gebruikt voor het extraheren van semantische kenmerken. Toont input/output-dimensies en de rol van contextuele embeddings voor de KG-populatie. Klik hier om een grotere versie van deze figuur te bekijken.

Kennisgrafiekconstructie met GNN

Het schema voor de Knowledge Graph is vooraf gedefinieerd voordat de graaf wordt geconstrueerd. Het zorgt voor semantische consistentie. De ontologie is vooraf gedefinieerd met betrekking tot een eindig aantal types voor zowel entiteiten als relatietypen, samen met domeinbereikbeperkingen, die nuttig zijn voor redeneren. Het schema is toepasbaar voor het vullen van de graaf uit de triples verzameld uit het BERT-model, evenals voor het relation-bewuste bericht dat door het GNN gaat.

Binnen dit kader dient de Knowledge Graph (KG) als een gestructureerde representatie van bedrijfskennis, modellerende entiteiten (bijv. afdelingen, documenten, processen) en semantische relaties tussen deze onderlingen. De wiskundige afleidingen van KG worden toegevoegd in Supplementair bestand 1. Deze integratie van KG-constructie en GNN-gebaseerd redeneren maakt ontologie-uitlijning, relatie-inferentie en verbeterde semantische opvraging mogelijk binnen het enterprise KM-raamwerk.

De Kennisgraaf (KG) wordt weergegeven als een heterogene graaf G, terwijl de structuur wordt uitgedrukt door zijn ontologie O. KG kan ook worden gezien als een verzameling feiten die worden uitgedrukt door beweringen van predicaatredenering. Deze fundamenten hebben de volgende beschrijvingen34. De graaf G is gevarieerd, waarbij V de verzameling objecten of knopen vertegenwoordigt (beide kunnen door elkaar worden gebruikt) en figure-protocol-3 de verzameling relaties vertegenwoordigt. Een triplet (figure-protocol-4) kan ook worden gebruikt om respectievelijk een paar objecten v1 en figure-protocol-5 hun associatie figure-protocol-6te karakteriseren. De wiskundige afleiding van de KG-constructie met GNN wordt beschreven in Aanvullend Bestand 1.

BERT-GNN-gebaseerde ontologie-uitlijning en redenering

Algoritme 1 toont de GNN-gebaseerde Ontologie Alignment and Reasoning. Het proces begint met het initialiseren van de node-mogelijkheden met behulp van vooraf geëxtraheerde embeddings, samen met die gegenereerd via een hoogwaardige afgestemde BERT-versie, die de semantische betekenis van elke entiteit uit ongestructureerde tekst halen. De kennisgraaf, bestaande uit knooppunten (entiteiten) en randen (relaties), wordt weergegeven door het gebruik van een adjacentiematrix (A) en een featurematrix (X).

De set regels verloopt via meer dan één GNN-laag. Op elke laag is de representatie van een knoop up-to-date door gegevens van de naburige knooppunten te aggregeren, gewogen naar hun connectiviteit (d.w.z. met behulp van de adjacencymatrix). Dit wordt wiskundig geformuleerd met behulp van een berichtoverdrachtsmethode waarbij knoop-embeddingen worden uitgebreid met traineerbare gewichtsmatrices en worden doorgegeven via een niet-lineaire activatiekarakteristiek waaronder ReLU. Een normalisatiestap (bijvoorbeeld laagnormalisatie of het gebruik van diplomamatrices zoals in de GCN-vergelijking) garandeert stabiele kennis over alle lagen heen.

Na het herhalen van dit proces voor een vooraf gedefinieerd bereik van lagen T, produceert het model een definitieve set van knoop-embedding Z, die elke buurt coderen, de vorm en semantische mogelijkheden ervan. Deze embeddings worden vervolgens overtroffen via een soft max-classificatielaag om uitgelijnde ontologielabels te voorspellen, inclusief entiteitsorts (bijv. "Afdeling," "Product," "Project") of semantische rollen binnen het bedrijf.

Algoritme 1: BERT GNN-gebaseerde ontologie-uitlijning en redenering

Het GNN-gebaseerde ontologie-uitlijnings- en redeneerproces werkte op de geconstrueerde Knowledge Graph, die bestond uit entiteiten die als knopen werden weergegeven en hun relaties als randen. De eerste node-representaties werden afgeleid van BERT-gebaseerde semantische embeddings en georganiseerd in een featurematrix. De adjacentiematrix vertegenwoordigde de connectiviteitsstructuur van de graaf, en een vooraf gedefinieerd aantal GNN-lagen werd toegepast om knooprepresentaties te verfijnen. Voor elke laag werkte het model elke knoop bij door informatie van de naburige knopen te aggregeren op basis van de grafiekstructuur. Deze aggregatie in Eqn (1) houdt in dat naburige knooprepresentaties worden vermenigvuldigd met trainbare gewichtmatrices, een biasterm worden toegevoegd en een niet-lineaire activatiefunctie worden toegepast.

figure-protocol-7(1)

Na elke laagupdate werd normalisatie toegepast om de training te stabiliseren en consistente embedding-schalen te garanderen. Zodra alle lagen waren verwerkt, werden de laatste knoop-embeddings verkregen. Deze embeddings werden vervolgens door een classificatielaag met een softmaxfunctie gestuurd om uitgelijnde ontologielabels of entiteitsklassen te voorspellen. De procedure leverde de definitieve verfijnde knoop-embeddings en de voorspelde ontologie-uitgelijnde labels als outputs op.

De voorgestelde methode maakt semantische uitlijning van entiteiten uit meerdere bronnen mogelijk en ondersteunt redeneren over de kennisgrafiek door nieuwe relaties af te leiden en eerder niet-gelabelde knooppunten te classificeren.

figure-protocol-8
Figuur 3. Ontologie-uitlijning en semantisch redeneren met behulp van GNN. Illustreert de updatestappen voor het doorgeven en embedden van buurtberichten. Klik hier om een grotere versie van deze figuur te bekijken.

De geaggregeerde kenmerken worden getransformeerd met relationele specifieke gewichtmatrices en een niet-lineaire activatiefunctie (bijv. ReLU), waarmee bijgewerkte knoop-embeddings worden gegenereerd die semantische kenmerken van BERT integreren met structurele informatie uit de grafiek. Deze embeddings worden vervolgens doorgegeven aan een softmax-classificatielaag om entiteitslabels of uitgelijnde ontologieklassen te voorspellen. Dit gevestigde proces maakt de GNN bijzonder effectief voor redeneren over technologiegrafieken, waarbij taken als entiteitsontwistificatie, zoekende inferentie en semantisch type worden ondersteund, en uiteindelijk bijdraagt aan slimmere, door AI aangestuurde statistiekcontrolestructuren (Tabel 2).

ComponentBeschrijving
Framework/ToolkitsPython 3.9, PyTorch 2.0.1, Hugging Face Transformers 4.34, DGL 1.1 (Deep Graph Library)
HardwareNVIDIA Tesla V100 GPU (16GB), 128GB RAM, Ubuntu 20.04
Pre-processing PipelineTokenisatie (Word Piece voor BERT), stopwoordverwijdering, entiteitsherkenning (SpaCy), z-score normalisatie voor numerieke kenmerken
DatasetbronnenProfessionele enquête (250+ antwoorden), interviewtranscripties (~120.000 woorden), bedrijfsrapporten (50+), casestudy's (15), interne documenten (200MB)
Data Split70% training, 15% validatie, 15% testen
TekstencodermodelBERT-basis (zonder behuizing), 12-laags, 768 verborgen grootte, 12 aandachtkoppen
BERT-fijnafstelling4 epochs, batchgrootte = 32, leersnelheid = 2e-5, Adam optimizer, maximale seq-lengte = 512
GraafconstructieTriplet-gebaseerde kennisextractie (onderwerp, predikaat, object)
GrafentypeHeterogene graaf met multi-relationele randen (entiteiten uit BERT-uitvoer)
GNN-architectuur2-laag heterogeen grafneural netwerk (berichtdoorgiftemodel)
GNN HyperparametersVerborgen dimensie = 128, Activatie = ReLU, Optimizer = Adam, Leersnelheid = 0,001
DecodertypeDist. Mult met dotproduct-scoring voor linkvoorspelling
VerliesfunctieBinaire kruis-entropie voor tripletclassificatie

Ten slotte sluit het protocol af met de generatie van de volgende outputs: een ontologie-uitgelijnde enterprise knowledge graph, BERT- en GNN-modellen, resultaten van informatieopvraging en redenering, en de rapporten van de KRP, OAA, DML en USR. Deze leveren de uiteindelijke output in reproduceerbare vorm. Voor negatieve steekproefneming tijdens GNN-training worden valide triplets corrupt door entiteitsvervanging volgens ontologie-gedefinieerde typebeperkingen. De resulterende ontologie-uitlijningen worden gevalideerd op consistentie en handmatig beoordeeld door domeinexperts om semantische samenhang tussen geëxtraheerde entiteiten en canonieke ontologieklassen te waarborgen.

Beoordelingscriteria

Besluitvormingslatentie is de maat voor de totale tijd die het systeem nodig heeft om een bruikbaar antwoord te geven nadat de gebruikersquery is ingediend. Laat i de gebruikersquery zijn, figure-protocol-9 het moment waarop de query wordt ingediend, figure-protocol-10 het moment waarop het systeem de uiteindelijke beslissingsoutput levert. De Decision-Making Latency (DML) wordt gegeven door:

figure-protocol-11(2)

waarbij het totale aantal geëvalueerde zoekopdrachten is. Deze metriek meet de totale responstijd van het voorgestelde kader, van kennisopvraging tot responsgeneratie. Een lagere waarde voor deze maatstaf is ideaal omdat deze een snellere systeemresponstijd laat zien, wat cruciaal is voor tijdgevoelige zakelijke besluitvormingsapplicaties.

Knowledge Coverage Ratio is de verhouding van het vermogen van het systeem om alle relevante kennisitems die beschikbaar zijn voor een bepaalde query op te halen. Laat de verzameling van alle relevante kennisitems voor query q zijn, en de verzameling van kennisitems die daadwerkelijk door het systeem worden opgehaald. De Knowledge Coverage Ratio (KCR) wordt gedefinieerd als:

figure-protocol-12(3)

Deze formule berekent de volledigheid van de kennisitems die worden opgehaald. Het is equivalent aan de recall-maat die wordt gebruikt in traditionele informatieopvragingssystemen.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Data-voorverwerking en BERT-fine-tuning

Het voorgestelde apparaat integreert een best afgestemde BERT-versie voor ongestructureerde begripextractie en een Graph Neural Network (GNN) voor ontologie-uitlijning en redenering binnen een grafenframework. De experimentele opstelling bestond uit het vergelijken van de algehele prestaties van het BERT-aspect op NER- en RE-taken, terwijl de GNN-factor werd onderzocht op linkvoorspelling en knooppuntkla...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze studie presenteert een geïntegreerd enterprise KM-framework dat contextuele semantische extractie met BERT integreert met grafgebaseerde relationele redenering en ontologie-uitlijning via GNN's. Om entiteitskoppeling, cross-document redenering en coherente kennisrepresentatie over uiteenlopende zakelijke databronnen mogelijk te maken, is de belangrijkste bijdrage de integratie van diepe contextuele taalmodellering met gestructureerde, ontologiebewuste inferentie binnen één enkele pi...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs hebben geen belangenconflict

Dankbetuigingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs erkennen dankbaar de steun van de Faculteit Economie en Management, de Nationale Universiteit van Maleisië, Bangi, Maleisië, en de School of Business.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
BERT-Base (Uncased) Pretrained ModelGoogle AIN/ATransformer-based pretrained language model (bert-base-uncased variant)
Deep Graph Library (DGL)AWS LabsRRID: SCR_017054Versie 2.1 gebruikt voor graaf neurale netwerkmodellering
Matplotlib VisualisatiebibliotheekPyData CommunityRRID: SCR_008624Gebruikt voor prestatieplots en visuele analyse
NetworkX GraafbibliotheekPyPI CommunityRRID: SCR_005317Versie 3.2 gebruikt voor graafconstructie en analyse
NumPy Numerieke RekenbibliotheekPyData CommunityRRID: SCR_008633Gebruikt voor numerieke bewerkingen en arrayverwerking
NVIDIA GPU (Tesla T4 / RTX 3080)NVIDIA CorporationRRID: SCR_016409CUDA-geschikte hardwareversneller voor modeltraining
Pandas Data-analysebibliotheekPyData CommunityRRID: SCR_018214Gebruikt voor gestructureerde gegevensmanipulatie
Python ProgrammeertaalPython Software FoundationRRID: SCR_008394Versie 3.10 gebruikt voor modelontwikkeling en gegevensverwerking
PyTorch Deep Learning FrameworkMeta AIRRID: SCR_018536Versie 2.0 gebruikt voor neurale netwerkimplementatie
Scikit-learn Machine Learning BibliotheekScikit-learn OntwikkelaarsRRID: SCR_002577Versie 1.5 gebruikt voor voorverwerking en evaluatiemetrieken
Transformers NLP BibliotheekHugging FaceRRID: SCR_020989Versie 4.40 gebruikt voor voorgetrainde transformermodellen
Ubuntu Linux BesturingssysteemCanonical Ltd.RRID: SCR_018317Versie 20.04 LTS runtime-omgeving

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

BERT modelontologie uitlijningsemantisch redenerenkennisgrafiekenentiteitsextractierelatie extractiekennismanagement voor ondernemingensemantisch zoeken

Gerelateerde artikelen