$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Ethische verklaring
Deze studie werd beoordeeld en goedgekeurd door de Institutional Review Board (IRB) van The National University of Malaysia (UKM) voorafgaand aan de gegevensverzameling (Goedkeurings-ID: UKM/FEP/2025/AI-047; Goedkeuringsdatum: 12 maart 2025). Het goedgekeurde protocol omvatte het afnemen van gestructureerde enquêtes en semi-gestructureerde interviews met menselijke deelnemers. Alle deelnemers werden geïnformeerd over het doel van de studie, het vrijwillige karakter van hun deelname en hun recht om zich op elk moment zonder gevolgen terug te trekken, en er werd schriftelijke geïnformeerde toestemming verkregen voordat ze werden opgenomen. Anonimiteit en vertrouwelijkheid van deelnemers werden strikt gehandhaafd, zonder persoonlijk identificeerbare informatie in de analyse of publicatie, en alle gegevens werden veilig opgeslagen en uitsluitend gebruikt voor academisch onderzoek in overeenstemming met institutionele ethische normen en relevante internationale richtlijnen voor onderzoek met mens.
Algemene architectuur van het voorgestelde BERT–GNN KM-raamwerk
Aanvankelijk werd een fijn afgestemde transformer-encoder gebruikt om ongestructureerde tekst te verwerken, waaronder interne documenten, klantinteracties en content op sociale media. De algemene systeemarchitectuur van de op BERT–GNN gebaseerde KM-workflow is weergegeven in Figuur 1. De bedrijfsgegevens die in deze studie werden gebruikt, werden verzameld in digitale documentformaten, waaronder gestructureerde enquêtebestanden, interviewtranscripties, interne bedrijfsrapporten en publiek beschikbare casestudy-documenten. Alle documenten werden samengevoegd tot een uniform corpus voor analyse. Tekstuele inhoud werd uit deze bronnen gehaald en opgeschoond om irrelevante metadata, dubbele vermeldingen en opmaakartefacten te verwijderen. Het opgeschonen corpus werd vervolgens gesegmenteerd in zinnen en getokeniseerd om het voor te bereiden op downstream natuurlijke taalverwerking zoals tekstextractie met parsers, ruisverwijdering, zinssegmentatie en tokenisatie met Word-stuktokenizer. Deze verwerkte tekstuele dataset diende als input voor het fijn afgestemde model voor entiteit- en relatie-extractie33 , dat 12 lagen heeft met 12 aandachtshoofden en 768 verborgen eenheden. De geëxtraheerde data werden georganiseerd in een kennisgrafiek, die een gestructureerde en onderling verbonden representatie van kennis bood over de ontologiemapping van het ondernemingsdomein. GNN's werden toegepast voor ontologie-uitlijning met behulp van cosinusgelijkenis en redenering om ervoor te zorgen dat semantische relaties over kennisdomeinen nauwkeurig werden vastgelegd en logisch afgeleid door duplicaten te verwijderen via stringgelijkenis met de drempel 0,85. De verwerkte kennis werd vervolgens binnen de besluitvormingslaag gebruikt, waardoor efficiënte data-analyse mogelijk werd gemaakt en datagedreven besluitvorming mogelijk werd. Deze architectuur transformeerde gefragmenteerde data in intelligente, contextbewuste informatiebronnen. Het framework werd gevalideerd via business case-simulaties en vergeleken met conventionele KM-systemen zoals Naive Bayes (NB), Support Vector Machine (SVM), Random Forest (RF), TF-IDF, LDA, BERT only en BERT met KG, met de dataset-verdeling van 70:15:15 en een vaste set van 42 om prestatieverbeteringen in ophaalnauwkeurigheid, beslissingslatentie en kennisnut te evalueren.

Figuur 1. Algemene systeemarchitectuur van BERT-GNN gebaseerde KM Workflow. Algemene AI–BDA–GNN systeemarchitectuur met multi-source data-opname, pre-processing, fijn afgestemde BERT voor semantische extractie, KG-populatie, GNN-gebaseerde ontologie-uitlijning/redenering en de besluitvormingslaag. Pijlen geven datastroom en optionele feedbacklussen voor online leren aan. Klik hier om een grotere versie van deze figuur te bekijken.
Data-acquisitie
De dataset die in deze studie werd gebruikt, is verzameld uit meerdere bronnen om representativiteit en externe validiteit te ondersteunen. Primaire gegevensverzameling via gestructureerde enquêtes en semi-gestructureerde interviews met professionals uit de IT-, productie-, gezondheidszorg- en onderwijssectoren omvatte gecertificeerde leden van de Kamer van Financiële Auditors van Roemenië. De secundaire gegevens omvatten geanonimiseerde interne bedrijfsdocumenten, jaarverslagen en openbaar beschikbare casestudy's van digitale transformatie. De gegevensverzameling vond plaats binnen een duidelijk afgebakende studieperiode en alle dossiers werden geanonimiseerd op grond van institutionele ethische goedkeuring om vertrouwelijkheid te beschermen en naleving te waarborgen.
Selectiecriteria voor deelname: Om methodologische strengheid en representativiteit te garanderen, werden deelnemers geselecteerd op basis van goed gedefinieerde inclusie- en exclusiecriteria. Naast actieve betrokkenheid bij digitale transformatie, KM, kunstmatige intelligentie, big data-analyse of initiatieven voor bedrijfsinformatiesystemen, moesten in aanmerking komende deelnemers minstens drie jaar professionele ervaring hebben in IT, productie, gezondheidszorg, onderwijs, boekhouding of aanverwante ondernemingsomgevingen. Het was noodzakelijk dat gecertificeerde professionals tijdens de gegevensverzamelingsperiode een actieve certificeringsstatus hadden (bijvoorbeeld leden van de Kamer van Financiële Auditors van Roemenië). Om de enquête en interviewmaterialen nauwkeurig te begrijpen en geïnformeerde toestemming te geven volgens het geautoriseerde IRB-protocol, moesten deelnemers ook aantonen dat ze in Roemeens of Engels vaardig waren. Personen met minder dan drie jaar relevante ervaring, inactieve professionele status (indien van toepassing), geen directe betrokkenheid bij kennis- of besluitvormingsprocessen op ondernemingsniveau, onvolledige enquête-antwoorden (meer dan 20% ontbrekende gegevens) of mislukte beoordelingen van gegevenskwaliteit werden allemaal uitgesloten. Daarnaast werden transcripties van interviews die niet voldoende gedetailleerd of relevant waren voor KM-technieken niet opgenomen in de analyse. Een competente, sectorrepresentatieve en analytisch solide deelnemerssteekproef werd door deze normen gegarandeerd.
Gecertificeerde leden van de Kamer van Financiële Auditors van Roemenië (CAFR) waren een belangrijke doelgroep voor gegevensverzameling. Er werd een online enquête ontwikkeld en verspreid via interne communicatiekanalen van CAFR om gerichte verspreiding en hoge responspercentages te ondersteunen. Om een representatieve steekproef te vormen, werden CAFR-geschiedenissen beoordeeld en werden 250 geregistreerde deelnemers geselecteerd op basis van studierelevante kenmerken.
Structuur van enquête-instrumenten: De studie gebruikte een gestructureerde vragenlijst met 24 items verspreid over vijf constructdomeinen: organisatorische wendbaarheid en operationele efficiëntie (5 items), strategische besluitvormingsondersteuning en innovatiecapaciteit (5 items), impact van Big Data Analytics op kennisdeling (5 items), AI-adoptie in KM (5 items) en door gebruikers waargenomen effectiviteit en systeembruikbaarheid (4 items). Een Likert-schaal van 5 punten, waarbij 1 "sterk oneens" en 5 "sterk eens" betekent, werd gebruikt om elk item te beoordelen. De tool werd gecontextualiseerd voor de implementatie van enterprise AI en aangepast van eerder gevalideerde KM- en digitale transformatieschalen. Drie academische wetenschappers en twee bedrijfsdeskundigen voerden een deskundige beoordeling uit om de geldigheid van de inhoud te bevestigen. Om de taal te verbeteren, de duidelijkheid te meten en de betrouwbaarheid te meten, werd een pilotonderzoek uitgevoerd met 20 praktijkmensen; alle componenten hadden Cronbachs alfawaarden groter dan 0,80, wat wijst op een sterke interne consistentie. Er werden ook semi-gestructureerde interviews afgenomen ter aanvulling van de enquêteresultaten. Vijf onderwerpen werden behandeld in de interviewgids: ervaring met digitale transformatie, moeilijkheden met de kennisstroom van ondernemingen, integratie van AI en Big Data in besluitvorming, obstakels voor semantische afstemming en ethische governancekwesties. Elk interview werd afgenomen met geïnformeerde toestemming, duurde ongeveer 45 tot 60 minuten, werd opgenomen in audio en vervolgens getranscribeerd voor kwalitatieve analyse.
Om de prestaties van het voorgestelde BERT-GNN-framework voor KM in digitaal transformerende organisaties te evalueren, werd een grote en diverse dataset opgesteld uit verschillende bronnen in diverse sectoren. De dataset behandelt zowel kwantitatieve als kwalitatieve aspecten om de dynamische percepties over kennisstroom en organisatorische verandering te vertegenwoordigen. Gestructureerde data werden verzameld van meer dan 250 professionals via een online vragenlijst bestaande uit Likert-schaal (bereik 1–5) om de waargenomen effecten van Kunstmatige Intelligentie (AI) en Big Data Analytics (BDA) op kennisdeling, innovatie en zakelijke wendbaarheid te meten. Tegelijkertijd werden ongestructureerde gegevens verzameld via semi-gestructureerde interviews met 30 domeinexperts, wat meer dan 120.000 transcriptwoorden opleverde. Verder werden semi-gestructureerde materialen, waaronder jaarverslagen van het bedrijf en digitale strategiedocumenten (meer dan 50 documenten), verzameld om adoptiepatronen op ondernemingsniveau in context te plaatsen. Daarnaast werden 15 gedetailleerde casestudy's uit de IT-, productie-, gezondheidszorg- en onderwijssectoren toegevoegd om praktische transformatiecontexten te bieden. Interne kennisbankartikelen (circa 200 MB), geanonimeerd om privacyredenen, en werden ook opgenomen om de weergave van operationele kennisbronnen te verbeteren. Deze multi-source dataset maakt een sterke trainings- en evaluatiepijplijn voor deep learning-modellen mogelijk en vangt zowel strategische als operationele aspecten van KM vast. Tabel 1 toont de populatiesteekproef die voor de evaluatie is gebruikt.
| Component | Type | Bron | Grootte/Volume |
| Antwoorden op professionele enquêtes | Gestructureerd | Online enquêtes van 250+ professionals | ~10.000 records |
| Transcripties van het interview | Ongestructureerd | Semi-gestructureerde interviews met 30 experts | ~120.000 woorden |
| Bedrijfsrapporten | Semi-gestructureerd | Jaarverslagen en digitale strategiedocumenten. | 50+ documenten |
| Casestudy's | Gemengd | Industriespecifieke toepassingen van digitale transformatie | 15 gedetailleerde zaken |
| Inhoud van kennisbasis | Ongestructureerd | Interne documenten van organisaties (geanonimiseerd) | ~200 MB |
Data-voorverwerking en BERT-fine-tuning
De ruwe bedrijfsdocumentgegevens werden benaderd vanuit een gecureerde lijst en vooraf verwerkt met zinssegmentatie, tokenisatie, stopwoordverwijdering en normalisatie om aan de eisen van de tokenizer te voldoen. Het vooraf getrainde model werd vervolgens verder aangepast om het model voor een bepaalde taak te verfijnen, en vervolgens fijn afgesteld om een taak uit te voeren voor naamloze entiteitsherkenning (NER) en relatie-extractie (RE). Het model is verfijnd op de vooraf verwerkte corpusgegevens voor een bepaald epoch-aantal met de Adam-optimizer. Ten slotte werden gecontextualiseerde woordembeddingen (R768) geproduceerd uit geïdentificeerde entiteiten en hun relaties. Genormaliseerde entiteiten werden gegenereerd door een op ontologie gebaseerde normalisatietechniek, waarbij verschillende entiteiten, zoals synoniemen, werden omgezet in genormaliseerde vorm. Elke afzonderlijke genormaliseerde entiteit was een knoop, terwijl de relatie tussen entiteiten een rand werd genoemd in de kennisgrafiekrepresentatie. De genormaliseerde entiteit-embeddings die door het model worden gegenereerd, vormden de initiële knooppunten van het Graph Neural Network. In de volgende stap werd het Graph Neural Network getraind met de methode voor supervised link-voorspelling met negatieve steekproef verkregen via randcorruptie. In de training is er een kruis-entropieverlies over meerdere tijdperken. Het getrainde kader werd beoordeeld door gebruik te maken van Knowledge Retrieval Precision, Decision Making Latency en User Satisfaction Rate als evaluatiemetrics.
Een hybride annotatiebenadering werd gebruikt om trainingslabels voor RE en NER te maken. Twee onafhankelijke inhoudsdeskundigen annoteerden handmatig een domeinspecifiek corpus van bedrijfsdocumenten, zoals interne rapporten, klantinteractielogboeken en beleidsdocumenten, met behulp van een vooraf bepaald ontologieschema dat entiteitscategorieën (zoals Organisatie, Proces, Technologie, Rol, KPI) en relatietypen (zoals supports, depends_on en improves) identificeerde. Om uniformiteit te garanderen in relatie tot richting en detectie van entiteitsgrens, zijn uitgebreide annotatierichtlijnen opgesteld. 20% van de dataset werd dubbel geannoteerd om de betrouwbaarheid te beoordelen. Cohens Kappa werd gebruikt om overeenstemming tussen de annotators te testen, en de resultaten toonden sterke overeenstemming (κ = 0,87 voor entiteitslabeling en κ = 0,82 voor relatie-extractie). Zwakke supervisie werd vervolgens gebruikt om de handmatig geannoteerde dataset uit te breiden met regelgebaseerde en ontologie-beperkte patroonmatching, met betrouwbaarheidsgebaseerde filtering om ruis te verminderen. Om volledige reproduceerbaarheid te garanderen, werden alle annotatieprocedures, ontologiedefinities, datasetsplitsingen en willekeurige seeds geregistreerd.
Efficiëntie in precisie werd op documentniveau gemeten, latentie werd geschat op basis van de end-to-end antwoordtijd van zoekopdrachten, en gebruikers waren tevreden met het gebruik van de Likert-schaalvragenlijsten. Aan het einde van elke fase werden de volgende protocolcontrolepunten ingesteld. (i) BERT-outputcheckpoint - sample-entiteiten en relatietriples geëxtraheerd; (ii) KG-checkpointsteekproef van een geconstrueerde subgraaf met ontologielabels; (iii) GNN-controlepunt - steekproef van ontologievoorspelling en afgeleide link; en (iv) ophaalcontrolepunt - een steekproef van opgehaalde kennisitems met relevantielabels.
Het voorgestelde protocol heeft de volgende structuur: deterministische, meerfasige pijplijn met goed gedefinieerde tussentijdse outputs, waardoor volledige reproduceerbaarheid mogelijk is. Stap 1, Na het innemen en voorverwerken van ruwe gestructureerde, semi-gestructureerde en ongestructureerde enterprise-gegevens, worden gereinigde tekstcorpora en genormaliseerde numerieke feature-matrices gegenereerd. Stap 2: Toepassing van fijn afgestemde BERT-modellen zal worden uitgevoerd voor kennisextractie, waarbij expliciete output wordt gegeven in de vorm van benoemde entiteiten, zoals Afdeling, Proces, Document en KPI; (ii) semantische relaties tussen entiteiten, weergegeven als subject-predicaat-object triples. In stap 3 worden deze triples omgezet in een initiële kennisgrafiek, waarin knooppunten entiteiten zijn en relaties getypeerde randen, uitgelijnd met een vooraf gedefinieerd ontologieschema. In stap 4 zou de toepassing van het Graph Neural Network op deze graaf voor ontologie-uitlijning en redenering verbeterde knoop-embeddings genereren, relaties afleiden en ontologielabels uitlijnen. Stap 5 biedt de definitieve kennisgrafiek en redeneerresultaten die de semantische opvraging, besluitvorming en prestatie-evaluatie zullen voeden.
Alle tussenliggende artefacten, waaronder entiteitslijsten, relatietriples, ontologie-uitgelijnde grafen en afgeleide links, worden expliciet gegenereerd in elke fase van dit protocol, waardoor onafhankelijke replicatie van onderzoek mogelijk is zonder herinneringen.
De dataset wordt verdeeld in de trainingsset, validatieset en testset volgens een vaste 70:15:15-verhouding om de reproduceerbaarheid van de experimentresultaten te waarborgen. Tokenisatie, kleine letters, stopwoord verwijderen en sequentie verkorten tot 512 tokens worden allemaal gedaan voor BERT wat betreft tekstvoorbereiding. Aan de andere kant wordt Z-Score-normalisatie gebruikt om structurele kenmerken te normaliseren. Daarnaast wordt het BERT-model fijn afgesteld met behulp van de deep learning framework-bibliotheek met de Adam optimizer, waarbij de leersnelheid 2e-5 is, batchgrootte gelijk aan 16 en het aantal epochs 5. De voorspelde geëxtraheerde entiteiten en relaties worden opgeslagen in een standaardformaat voor de constructie van de kennisgraaf. Daarnaast wordt de knowledge graph node embedding (R768) gebruikt als input voor de GNN voor ontologie-uitlijning en redenering.
BERT-GNN interface en datastroom
Binnen het voorgestelde kader wordt de transformer-encoder fijn afgesteld om twee NLP-taken uit te voeren: de NER-taak en de RE-taak op een enterprise-tekstcorpus. Ten slotte omvatten de modeluitvoer contextualiseerde token-embeddings (R768), entiteitsclassificatielabels en subject-predicaat-object relationele triplets. Genormaliseerde entiteiten worden gebruikt door een vooraf gedefinieerde enterprise-ontologie te construeren, waarbij tekstuele variaties en synoniemen van de entiteit worden gekoppeld aan een entiteitsidentificatie. Elke unieke genormaliseerde entiteit krijgt een nieuwe entiteitsknoop toegewezen binnen de geconstrueerde kennisgrafiek. Afhankelijk van de grootte van het industriecorpus heeft de gegenereerde kennisgrafiek in de beoordeelde ondernemingsscenario's tussen de 18.000 en 25.000 entiteitsknooppunten en 42.000 tot 60.000 getypeerde relationele randen. Person, Afdeling, Proces, Product, Organisatie en Document zijn slechts enkele van de knoopsoorttypen die in de grafiek voorkomen. Andere randtypes zijn onder andere works_for, manages, belongs_to, produces, approved_by en related_to. Aan elke knoop wordt aan elke knoop een aparte ontologie-gebaseerde identificatie gegeven die is afgeleid van een vooraf bepaalde enterprise-ontologie. Als gevolg hiervan heeft de resulterende heterogene graaf getypeerde randen die genormaliseerde relaties en getypeerde knopen met semantische embedding-eigenschappen vertegenwoordigen. Daarna krijgen de GNN deze node-embeddings voor relationeel redeneren en ontologie-uitlijning. Cruciaal is dat de GNN op de gegenereerde graaf functioneert zonder gradiënten terug te propageren naar de BERT-encoder, wat modulaire training garandeert en de scheiding van de componenten van graafredenering en semantische extractie behoudt.
BERT werd in deze studie gebruikt voor contextuele taalmodellering en het extraheren van semantische kenmerken. Het model kan efficiënt leren de juiste categorielabels voor nieuwe tekstinvoer te voorspellen wanneer het wordt afgestemd met gelabelde data die zijn afgestemd op een specifiek classificatiedoel. Omdat BERT bidirectioneel is, houdt het rekening met zowel de voorafgaande als de volgende context van elk woord, waardoor een meer volledig begrip van de relaties binnen de tekst mogelijk wordt. De encoder van het BERT-basismodel bestaat uit 12 transformatorblokken, elk met 12 zelfaandaghoofden en een verborgen grootte van 768. Voor verwerking wordt de invoertekst onderverdeeld in tokens, afhankelijk van de gekozen tokenisatiemethode, die woorden of subwoorden kunnen vertegenwoordigen. De sequentierepresentatie die is afgeleid met BERT wordt beschreven in Aanvullend Bestand 1. De modelparameters worden geoptimaliseerd door de logaritmische kans op het juiste label te minimaliseren (Figuur 2).

Figuur 2. Gedetailleerd werkproces van het BERT-model dat wordt gebruikt voor het extraheren van semantische kenmerken. Toont input/output-dimensies en de rol van contextuele embeddings voor de KG-populatie. Klik hier om een grotere versie van deze figuur te bekijken.
Kennisgrafiekconstructie met GNN
Het schema voor de Knowledge Graph is vooraf gedefinieerd voordat de graaf wordt geconstrueerd. Het zorgt voor semantische consistentie. De ontologie is vooraf gedefinieerd met betrekking tot een eindig aantal types voor zowel entiteiten als relatietypen, samen met domeinbereikbeperkingen, die nuttig zijn voor redeneren. Het schema is toepasbaar voor het vullen van de graaf uit de triples verzameld uit het BERT-model, evenals voor het relation-bewuste bericht dat door het GNN gaat.
Binnen dit kader dient de Knowledge Graph (KG) als een gestructureerde representatie van bedrijfskennis, modellerende entiteiten (bijv. afdelingen, documenten, processen) en semantische relaties tussen deze onderlingen. De wiskundige afleidingen van KG worden toegevoegd in Supplementair bestand 1. Deze integratie van KG-constructie en GNN-gebaseerd redeneren maakt ontologie-uitlijning, relatie-inferentie en verbeterde semantische opvraging mogelijk binnen het enterprise KM-raamwerk.
De Kennisgraaf (KG) wordt weergegeven als een heterogene graaf G, terwijl de structuur wordt uitgedrukt door zijn ontologie O. KG kan ook worden gezien als een verzameling feiten die worden uitgedrukt door beweringen van predicaatredenering. Deze fundamenten hebben de volgende beschrijvingen34. De graaf G is gevarieerd, waarbij V de verzameling objecten of knopen vertegenwoordigt (beide kunnen door elkaar worden gebruikt) en
de verzameling relaties vertegenwoordigt. Een triplet (
) kan ook worden gebruikt om respectievelijk een paar objecten v1 en
hun associatie
te karakteriseren. De wiskundige afleiding van de KG-constructie met GNN wordt beschreven in Aanvullend Bestand 1.
BERT-GNN-gebaseerde ontologie-uitlijning en redenering
Algoritme 1 toont de GNN-gebaseerde Ontologie Alignment and Reasoning. Het proces begint met het initialiseren van de node-mogelijkheden met behulp van vooraf geëxtraheerde embeddings, samen met die gegenereerd via een hoogwaardige afgestemde BERT-versie, die de semantische betekenis van elke entiteit uit ongestructureerde tekst halen. De kennisgraaf, bestaande uit knooppunten (entiteiten) en randen (relaties), wordt weergegeven door het gebruik van een adjacentiematrix (A) en een featurematrix (X).
De set regels verloopt via meer dan één GNN-laag. Op elke laag is de representatie van een knoop up-to-date door gegevens van de naburige knooppunten te aggregeren, gewogen naar hun connectiviteit (d.w.z. met behulp van de adjacencymatrix). Dit wordt wiskundig geformuleerd met behulp van een berichtoverdrachtsmethode waarbij knoop-embeddingen worden uitgebreid met traineerbare gewichtsmatrices en worden doorgegeven via een niet-lineaire activatiekarakteristiek waaronder ReLU. Een normalisatiestap (bijvoorbeeld laagnormalisatie of het gebruik van diplomamatrices zoals in de GCN-vergelijking) garandeert stabiele kennis over alle lagen heen.
Na het herhalen van dit proces voor een vooraf gedefinieerd bereik van lagen T, produceert het model een definitieve set van knoop-embedding Z, die elke buurt coderen, de vorm en semantische mogelijkheden ervan. Deze embeddings worden vervolgens overtroffen via een soft max-classificatielaag om uitgelijnde ontologielabels te voorspellen, inclusief entiteitsorts (bijv. "Afdeling," "Product," "Project") of semantische rollen binnen het bedrijf.
Algoritme 1: BERT GNN-gebaseerde ontologie-uitlijning en redenering
Het GNN-gebaseerde ontologie-uitlijnings- en redeneerproces werkte op de geconstrueerde Knowledge Graph, die bestond uit entiteiten die als knopen werden weergegeven en hun relaties als randen. De eerste node-representaties werden afgeleid van BERT-gebaseerde semantische embeddings en georganiseerd in een featurematrix. De adjacentiematrix vertegenwoordigde de connectiviteitsstructuur van de graaf, en een vooraf gedefinieerd aantal GNN-lagen werd toegepast om knooprepresentaties te verfijnen. Voor elke laag werkte het model elke knoop bij door informatie van de naburige knopen te aggregeren op basis van de grafiekstructuur. Deze aggregatie in Eqn (1) houdt in dat naburige knooprepresentaties worden vermenigvuldigd met trainbare gewichtmatrices, een biasterm worden toegevoegd en een niet-lineaire activatiefunctie worden toegepast.
(1)
Na elke laagupdate werd normalisatie toegepast om de training te stabiliseren en consistente embedding-schalen te garanderen. Zodra alle lagen waren verwerkt, werden de laatste knoop-embeddings verkregen. Deze embeddings werden vervolgens door een classificatielaag met een softmaxfunctie gestuurd om uitgelijnde ontologielabels of entiteitsklassen te voorspellen. De procedure leverde de definitieve verfijnde knoop-embeddings en de voorspelde ontologie-uitgelijnde labels als outputs op.
De voorgestelde methode maakt semantische uitlijning van entiteiten uit meerdere bronnen mogelijk en ondersteunt redeneren over de kennisgrafiek door nieuwe relaties af te leiden en eerder niet-gelabelde knooppunten te classificeren.

Figuur 3. Ontologie-uitlijning en semantisch redeneren met behulp van GNN. Illustreert de updatestappen voor het doorgeven en embedden van buurtberichten. Klik hier om een grotere versie van deze figuur te bekijken.
De geaggregeerde kenmerken worden getransformeerd met relationele specifieke gewichtmatrices en een niet-lineaire activatiefunctie (bijv. ReLU), waarmee bijgewerkte knoop-embeddings worden gegenereerd die semantische kenmerken van BERT integreren met structurele informatie uit de grafiek. Deze embeddings worden vervolgens doorgegeven aan een softmax-classificatielaag om entiteitslabels of uitgelijnde ontologieklassen te voorspellen. Dit gevestigde proces maakt de GNN bijzonder effectief voor redeneren over technologiegrafieken, waarbij taken als entiteitsontwistificatie, zoekende inferentie en semantisch type worden ondersteund, en uiteindelijk bijdraagt aan slimmere, door AI aangestuurde statistiekcontrolestructuren (Tabel 2).
| Component | Beschrijving |
| Framework/Toolkits | Python 3.9, PyTorch 2.0.1, Hugging Face Transformers 4.34, DGL 1.1 (Deep Graph Library) |
| Hardware | NVIDIA Tesla V100 GPU (16GB), 128GB RAM, Ubuntu 20.04 |
| Pre-processing Pipeline | Tokenisatie (Word Piece voor BERT), stopwoordverwijdering, entiteitsherkenning (SpaCy), z-score normalisatie voor numerieke kenmerken |
| Datasetbronnen | Professionele enquête (250+ antwoorden), interviewtranscripties (~120.000 woorden), bedrijfsrapporten (50+), casestudy's (15), interne documenten (200MB) |
| Data Split | 70% training, 15% validatie, 15% testen |
| Tekstencodermodel | BERT-basis (zonder behuizing), 12-laags, 768 verborgen grootte, 12 aandachtkoppen |
| BERT-fijnafstelling | 4 epochs, batchgrootte = 32, leersnelheid = 2e-5, Adam optimizer, maximale seq-lengte = 512 |
| Graafconstructie | Triplet-gebaseerde kennisextractie (onderwerp, predikaat, object) |
| Grafentype | Heterogene graaf met multi-relationele randen (entiteiten uit BERT-uitvoer) |
| GNN-architectuur | 2-laag heterogeen grafneural netwerk (berichtdoorgiftemodel) |
| GNN Hyperparameters | Verborgen dimensie = 128, Activatie = ReLU, Optimizer = Adam, Leersnelheid = 0,001 |
| Decodertype | Dist. Mult met dotproduct-scoring voor linkvoorspelling |
| Verliesfunctie | Binaire kruis-entropie voor tripletclassificatie |
Ten slotte sluit het protocol af met de generatie van de volgende outputs: een ontologie-uitgelijnde enterprise knowledge graph, BERT- en GNN-modellen, resultaten van informatieopvraging en redenering, en de rapporten van de KRP, OAA, DML en USR. Deze leveren de uiteindelijke output in reproduceerbare vorm. Voor negatieve steekproefneming tijdens GNN-training worden valide triplets corrupt door entiteitsvervanging volgens ontologie-gedefinieerde typebeperkingen. De resulterende ontologie-uitlijningen worden gevalideerd op consistentie en handmatig beoordeeld door domeinexperts om semantische samenhang tussen geëxtraheerde entiteiten en canonieke ontologieklassen te waarborgen.
Beoordelingscriteria
Besluitvormingslatentie is de maat voor de totale tijd die het systeem nodig heeft om een bruikbaar antwoord te geven nadat de gebruikersquery is ingediend. Laat i de gebruikersquery zijn,
het moment waarop de query wordt ingediend,
het moment waarop het systeem de uiteindelijke beslissingsoutput levert. De Decision-Making Latency (DML) wordt gegeven door:
(2)
waarbij het totale aantal geëvalueerde zoekopdrachten is. Deze metriek meet de totale responstijd van het voorgestelde kader, van kennisopvraging tot responsgeneratie. Een lagere waarde voor deze maatstaf is ideaal omdat deze een snellere systeemresponstijd laat zien, wat cruciaal is voor tijdgevoelige zakelijke besluitvormingsapplicaties.
Knowledge Coverage Ratio is de verhouding van het vermogen van het systeem om alle relevante kennisitems die beschikbaar zijn voor een bepaalde query op te halen. Laat de verzameling van alle relevante kennisitems voor query q zijn, en de verzameling van kennisitems die daadwerkelijk door het systeem worden opgehaald. De Knowledge Coverage Ratio (KCR) wordt gedefinieerd als:
(3)
Deze formule berekent de volledigheid van de kennisitems die worden opgehaald. Het is equivalent aan de recall-maat die wordt gebruikt in traditionele informatieopvragingssystemen.