$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Etik ifade
Bu çalışma, veri toplamadan önce Malezya Ulusal Üniversitesi (UKM) Kurumsal İnceleme Kurulu (IRB) tarafından incelenip onaylandı (Onay Kimliği: UKM/FEP/2025/AI-047; Onay Tarihi: 12 Mart 2025). Onaylanmış protokol, insan katılımcıların yer aldığı yapılandırılmış anketlerin ve yarı yapılandırılmış mülakatların uygulanmasını kapsadı. Tüm katılımcılara çalışmanın amacı, katılımlarının gönüllü doğası ve herhangi bir zaman sonuç vermeden çekilme hakları hakkında bilgilendirildi ve dahil edilmeden önce yazılı bilgilendirilmiş onay alındı. Katılımcıların anonimliği ve gizliliği sıkı bir şekilde korundu; analiz veya yayında kişisel olarak tanımlanabilir bilgi yer verilmedi ve tüm veriler, kurumsal etik standartlar ve ilgili uluslararası insan araştırmaları yönergelerine uygun olarak yalnızca akademik araştırma amaçları için güvenli şekilde saklandı ve kullanıldı.
Önerilen BERT–GNN KM çerçevesinin genel mimarisi
Başlangıçta, yapılandırılmamış metinleri, dahili belgeler, müşteri etkileşimleri ve sosyal medya içerikleri dahil olmak üzere ince ayarlanmış bir transformer kodlayıcı kullanıldı. BERT–GNN tabanlı KM iş akışının genel sistem mimarisi Şekil 1'de gösterilmiştir. Bu çalışmada kullanılan kurumsal veriler, yapılandırılmış anket dosyaları, röportaj transkriptleri, iç kurumsal raporlar ve kamuya açık vaka çalışması belgeleri dahil olmak üzere dijital belge formatlarında toplanmıştır. Tüm belgeler analiz için birleşik bir korpusta birleştirildi. Metinsel içerik bu kaynaklardan çıkarıldı ve alakasız meta veriler, tekrarlanan girişler ve biçimlendirme eserleri kaldırılarak temizlendi. Temizlenmiş korpus daha sonra cümlelere bölünür ve belirtilenerek metin çıkarma (ayrıştırıcılar) ile metin çıkarma, gürültü kaldırma, cümle segmentasyonu ve Word parça tokenizer'ı kullanılarak tokenizasyon gibi doğal dil işlemlerinin aşağı akışına hazırlanır. Bu işlenen metin veri seti, 12 katmanlı, 12 dikkat başlığı ve 768 gizli birim olan varlık ve ilişkiçıkarma 33 için ince ayarlanmış model için giriş olarak hizmet etti. Çıkarılan veriler, kurumsal alan ontoloji eşlemesi boyunca bilginin yapılandırılmış ve birbirine bağlı bir temsili sağlayan bir Bilgi Grafiği olarak organize edildi. GNN'ler, bilgi alanları arasındaki anlamsal ilişkilerin doğru şekilde yakalanmasını ve 0.85 eşik eşiğine kadar dizi benzerliği yoluyla kopyaların çıkarılmasıyla mantıksal çıkarıma sahip olmak için kosinüs benzerliği ve akıl yürütme kullanılarak ontoloji hizalanması için uygulandı. İşlenen bilgiler karar alma katmanında kullanılarak verimli veri analizini mümkün kıldı ve veri odaklı karar alma sürecini kolaylaştırdı. Bu mimari, parçalanmış verileri zeki, bağlama duyarlı bilgi varlıklarına dönüştürdü. Çerçeve, iş vakası simülasyonlarıyla doğrulandı ve Naive Bayes (NB), Support Vector Machine (SVM), Random Forest (RF), TF-IDF, LDA, BERT only ve KG ile BERT gibi geleneksel KM sistemlerine karşı karşılaştırıldı; veri seti 70:15:15 bölünmesi ve 42 sabit görünümü ile arama doğruluğu, karar gecikmesi ve bilgi faydası performans iyileştirmelerini değerlendirdi.

Şekil 1. BERT-GNN tabanlı KM İş Akışının Genel Sistem Mimarisi. Genel AI–BDA–GNN sistem mimarisi, çoklu kaynaklı veri alımı, ön işleme, anlamsal çıkarım için ince ayar edilmiş BERT, KG popülasyonu, GNN tabanlı ontoloji hizalama/akıl yürütme ve karar alma katmanını gösterir. Oklar, veri akışını ve çevrimiçi öğrenme için isteğe bağlı geri bildirim döngülerini gösterir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Veri toplama
Bu çalışmada kullanılan veri seti, temsil ve dış geçerliliği desteklemek için birden fazla kaynaktan toplanmıştır. BT, üretim, sağlık ve eğitim sektörlerindeki uygulayıcılarla yapılandırılmış anketler ve yarı yapılandırılmış röportajlar yoluyla birincil veri toplama aşamasında, Romanya Finansal Denetçiler Odası'nın sertifikalı üyeleri yer aldı. İkincil veriler arasında anonimleştirilmiş iç kurumsal belgeler, yıllık raporlar ve halka açık dijital dönüşüm vaka çalışmaları yer alıyordu. Veri toplama, iyi tanımlanmış bir çalışma dönemi içinde gerçekleştirildi ve tüm kayıtlar, gizliliği korumak ve uyumu sağlamak amacıyla kurumsal etik onay gerekçesiyle anonimleştirildi.
Katılım Seçim Kriterleri: Metodolojik titizlik ve temsil etmeyi garanti etmek için, katılımcılar iyi tanımlanmış dahil etme ve dışlama kriterlerine göre seçildi. Dijital dönüşüm, KM, yapay zeka, büyük veri analitiği veya kurumsal bilgi sistemleri girişimlerinde aktif olarak yer almanın yanı sıra, uygun katılımcıların BT, üretim, sağlık hizmetleri, eğitim, muhasebe veya ilgili kurumsal ortamlarda en az üç yıllık profesyonel deneyime sahip olmaları gerekiyordu. Sertifikalı profesyonellerin veri toplama döneminde aktif sertifika statüsüne sahip olması gerekiyordu (örneğin, Romanya Mali Denetçiler Odası üyeleri). Anket ve mülakat materyallerini doğru anlamak ve yetkili IRB protokolüne uygun olarak bilinçli izin vermek için katılımcıların Rumence veya İngilizce yeterliliklerini göstermeleri de gerekmektedir. Üç yıldan az ilgili deneyime, aktif olmayan profesyonel statüsüne (varsa), kurumsal düzeyde bilgi veya karar alma süreçlerine doğrudan katılıma sahip olmayanlar, eksik anket yanıtları (%20'den fazla eksik veri) veya başarısız veri kalitesi tarama kontrolleri olanlar tamamen dışlandı. Ayrıca, KM teknikleriyle yeterince detaylı veya ilgili olmayan mülakat tutanakları analize dahil edilmedi. Bu standartlar tarafından yetkin, sektör temsilcisi ve analitik olarak sağlam bir katılımcı örneklemi garanti edildi.
Romanya Finansal Denetçiler Odası'nın (CAFR) sertifikalı üyeleri, veri toplama için önemli bir hedef grup olarak yer almaktadır. Hedefli dağıtımı ve yüksek yanıt oranlarını desteklemek için CAFR iç iletişim kanalları aracılığıyla çevrimiçi bir anket geliştirildi ve dağıtıldı. Temsilci bir örneklem oluşturmak için CAFR geçmişleri incelendi ve çalışmaya ilişkin özelliklere göre 250 kayıtlı katılımcı seçildi.
Anket aleti yapısı: Çalışma, beş yapı alanına yayılmış 24 maddeden oluşan yapılandırılmış bir anket kullandı: organizasyonel çeviklik ve operasyonel verimlilik (5 madde), stratejik karar desteği ve inovasyon yeteneği (5 madde), Büyük Veri Analitiği bilgi paylaşımına etkisi (5 madde), KM'de yapay zeka benimsemesi (5 madde) ve kullanıcı algısı etkinliği ve sistem kullanılabilirliği (4 madde). Her maddeyi değerlendirmek için 5 puanlık bir Likert ölçeği kullanıldı; 1 "kesinlikle katılmıyorum" ve 5 "kesinlikle katılıyorum" anlamına gelir. Araç, kurumsal yapay zeka uygulaması için bağlamlandırıldı ve daha önce doğrulanmış KM ve dijital dönüşüm ölçeklerinden modifiye edildi. Üç akademik akademisyen ve iki iş uzmanı, içeriğin geçerliliğini doğrulamak için uzman incelemesi yaptı. Dili artırmak, netliği ölçmek ve güvenilirliği ölçmek için 20 uygulayıcıyla pilot araştırma yapıldı; tüm bileşenlerin Cronbach alfa değerleri 0.80'den büyüktü ve bu da güçlü iç tutarlılık gösteriyordu. Anket sonuçlarını desteklemek için yarı yapılandırılmış mülakatlar da yapıldı. Mülakat rehberinde beş konu alanı ele alındı: dijital dönüşüm deneyimi, kurumsal bilgi akışındaki zorluklar, karar alma süreçlerinde yapay zeka ve Büyük Verinin entegrasyonu, anlamsal uyumun önündeki engeller ve etik yönetişim konuları. Her röportaj bilgilendirilmiş onayla yapıldı, yaklaşık 45 ila 60 dakika sürdü, ses kaydı alındı ve ardından nitel analiz için transkribe edildi.
KM için önerilen BERT-GNN çerçevesinin dijital olarak dönüşümlü organizasyonlarda performansını değerlendirmek amacıyla, farklı sektörlerden farklı kaynaklardan büyük ve çeşitli bir veri seti hazırlandı. Veri seti, bilgi akışı ve organizasyonel değişimle ilgili dinamik algıları temsil etmek için hem nicel hem de niteliksel yönleri kapsar. Yapılandırılmış veriler, Yapay Zeka (AI) ve Büyük Veri Analitiği (BDA)'nın bilgi paylaşımı, yenilik ve iş çevikliği üzerindeki algılanan etkilerini ölçmek için Likert ölçeği (1–5 aralığı) maddelerinden oluşan çevrimiçi bir anket aracılığıyla 250'den fazla profesyonelden toplandı. Aynı zamanda, yapılandırılmamış veriler 30 alan uzmanıyla yarı yapılandırılmış röportajlar yoluyla toplandı ve 120.000'den fazla transkript kelimesi sağlandı. Şirket yıllık raporları ve dijital strateji belgeleri (50'den fazla belge) dahil olmak üzere yarı yapılandırılmış materyaller toplanarak kurumsal ölçekli benimseme kalıplarını bağlama oturtmak için oluşturuldu. Ayrıca, BT, üretim, sağlık ve eğitim sektörlerinden 15 ayrıntılı vaka çalışması ekleyerek pratik dönüşüm bağlamları sunuldu. Gizlilik nedenleriyle anonimleştirilmiş ve operasyonel bilgi varlıklarının tasvirini geliştirmek için dahil edilen iç bilgi tabanı makaleleri (yaklaşık 200 MB) yer aldı. Bu çok kaynaklı veri seti, derin öğrenme modelleri için güçlü bir eğitim ve değerlendirme hattı sağlar ve KM'nin hem stratejik hem de operasyonel yönlerini kapsar. Tablo 1, değerlendirme için kullanılan popülasyon örnekliğini göstermektedir.
| Bileşen | Tip | Kaynak | Boyut/Hacim |
| Profesyonel Anket Yanıtları | Yapılandırılmış | 250+ profesyonelden çevrimiçi anketler | ~10.000 plak |
| Röportaj Transkriptleri | Yapılandırılmamış | 30 uzmandan yarı yapılandırılmış röportajlar | ~120.000 kelime |
| Şirket Raporları | Yarı yapılandırılmış | Yıllık raporlar ve dijital strateji dokümanturaları | 50+ belge |
| Vaka Çalışmaları | Karışık | Sektöre özgü dijital dönüşüm kullanım durumları | 15 ayrıntılı dava |
| Bilgi Tabanı İçeriği | Yapılandırılmamış | Kuruluşlardan gelen iç belgeler (anonimleştirilmiş) | ~200 MB |
Veri ön işleme ve BERT ince ayarlama
Ham kurumsal belge verilerine, seçilmiş listeden erişildi ve tokenizer'in gereksinimlerini karşılamak için cümle segmentasyonu, tokenizasyon, stop word kaldırma ve normalizasyon kullanılarak önceden işlendi. Önden eğitilmiş model, belirli bir görev için modeli ince ayar yapmak üzere daha da değiştirildi ve adlandırılmış varlık tanıma (NER) ve ilişki çıkarma (RE) görevini yerine getirecek şekilde ince ayar yapıldı. Model, belirli bir dönem sayısı için önceden işlenmiş korpus verileri üzerinde Adam optimizatörü ile ince ayarlanmıştır. Son olarak, tanımlanmış varlıklar ve onların ilişkilerinden bağlamsallaştırılmış kelime gömme (R768) üretildi. Normalize varlıklar, farklı varlıkların, örneğin eşanlamlıların normalize forma dönüştürüldüğü, ontoloji tabanlı bir normalizasyon tekniğiyle üretilmiştir. Her ayrı normalize varlık bir düğümdür, oysa varlıklar arasındaki ilişkiye bilim grafiği temsilinde kenar denir. Model tarafından üretilen normalize varlık gömülmeleri, Grafik Sinir Ağı'nın ilk düğüm özelliklerini oluşturdu. Bir sonraki adımda, Grafik Sinir Ağı, kenar bozulması yoluyla elde edilen negatif örnekleme ile denetimli bağlantı tahmini yöntemiyle eğitilmiştir. Eğitimde, birkaç dönem boyunca çapraz entropi kaybı yaşanır. Eğitilen çerçeve, değerlendirme metrikleri olarak Bilgi Arama Hassasiyeti, Karar Verme Gecikmesi ve Kullanıcı Memnuniyet Oranı kullanılarak değerlendirildi.
RE ve NER için eğitim etiketleri oluşturmak için hibrit bir notlama yaklaşımı kullanıldı. İki bağımsız konu uzmanı, iç raporlar, müşteri etkileşim kayıtları ve politika belgeleri gibi kurum alanına özgü bir belge korpusunu manuel olarak açıklama yaptı; önceden belirlenmiş bir ontoloji şeması kullanılarak varlık kategorileri (Organizasyon, Süreç, Teknoloji, Rol, KPI) ve ilişki türleri (destekler, depends_on ve iyileştirmeler gibi) tanımlandı. İlişkilerin yönü ve varlık sınır algılamasında tekdüzeliği garanti etmek için kapsamlı açıklama kılavuzları oluşturuldu. Veri setinin %20'si güvenilirlik değerlendirmesi için çift nota edildi. Cohen's Kappa'sı annotatörler arası uyumu test etmek için kullanıldı ve sonuçlar güçlü bir uyum gösterdi (varlık etiketleme için κ = 0.87 ve ilişki çıkarımı için κ = 0.82). Zayıf denetim, manuel olarak notlanmış veri setini kural tabanlı ve ontoloji kısıtlı desen eşleştirme ile genişletmek için kullanıldı; gürültüyü azaltmak için güven temelli filtreleme kullanıldı. Tam tekrarlanabilirliği garanti etmek için tüm açıklama prosedürleri, ontoloji tanımları, veri seti bölünmeleri ve rastgele tohumlar kaydedildi.
Verimlilik hassasiyeti belge düzeyinde ölçüldü, gecikme uçtan uca sorgu yanıt süresine göre tahmin edildi ve kullanıcılar Likert ölçeği anketlerini kullanarak tatmin edildi. Her aşamanın sonunda takip eden protokol kontrol noktaları oluşturuldu. (i) BERT çıkış kontrol noktası - örnek varlıklar ve ilişki üçlüleri çıkarılmıştır; (ii) Ontoloji etiketleriyle oluşturulmuş alt grafikin KG kontrol noktası örneği; (iii) GNN kontrol noktası - ontoloji tahmini ve çıkarılan bağlantı örneği; ve (iv) geri alınan bilgi öğelerinin alaka etiketleriyle ilgili bir örnek.
Önerilen protokol şu yapıya sahiptir: deterministik, çok aşamalı boru hattı, iyi tanımlanmış ara çıktılara sahip, tam tekrarlanabilirlik sağlar. Adım 1: Ham yapılandırılmış, yarı yapılandırılmış ve yapılandırılmamış kurumsal veri alımı ve ön işlemeden sonra, temizlenmiş metin korpusları ve normalize sayısal özellik matrisleri oluşturulacaktır. Adım 2: Bilgi çıkarımı için ince ayarlanmış BERT modelleri uygulanacak ve Departman, Süreç, Belge ve KPI gibi adlandırılmış varlıklar şeklinde açık çıktı verilecektir; (ii) özne-predikat-nesne üçlüleri olarak temsil edilen varlıklar arasındaki anlamsal ilişkiler. Adım 3'te, bu üçlemeler düğümlerin varlıklar olduğu, ilişkilerin ise önceden tanımlanmış bir ontoloji şemasıyla hizalanan tiplenmiş kenarlar olduğu bir başlangıç bilgi grafiğine dönüştürülür. 4. adımda, ontoloji hizalaması ve akıl yürütmesi için bu grafiğe Grafik Sinir Ağı uygulaması, geliştirilmiş düğüm gömmeleri oluşturur, ilişkileri çıkarır ve ontoloji etiketlerini hizalamaya başlar. Adım 5, anlamsal alım, karar desteği ve performans değerlendirmesini besleyecek nihai bilgi grafiği ve akıl yürütme sonuçlarını sağlar.
Varlık listeleri, ilişki üçlüleri, ontoloji uyumlu grafikler ve çıkarılan bağlantılar dahil tüm ara eserler, bu protokolün her aşamasında açıkça oluşturulur ve araştırmanın bağımsız tekrarlanmasına izin verir ve hatırlatıcılara gerek kalmaz.
Veri seti, deney sonuçlarının tekrarlanabilirliğini sağlamak için sabit 70:15:15 oranına göre eğitim seti, doğrulama seti ve test setine bölünür. Metin hazırlığı açısından BERT için tokenizasyon, küçük harfler, stop kelime kaldırma ve 512 token'a kadar sırayı kısaltma işlemleri yapılmaktadır. Öte yandan, yapısal özellikleri normalleştirmek için Z-Score normalizasyonu kullanılır. Ayrıca, BERT modeli, Adam optimizer'ı ile birlikte derin öğrenme çerçeve kütüphanesi kullanılarak ince ayarlanmıştır; öğrenme hızı 2e-5, parti boyutu 16 ve epoch sayısı 5'tir. Tahmin edilen çıkarılmış varlıklar ve ilişkiler, bilgi grafiğinin inşası için standart bir formatta saklanır. Ayrıca, bilgi grafiği düğümü gömülmesi (R768), ontoloji hizalanması ve akıl yürütmesi için GNN için giriş olarak kullanılır.
BERT-GNN arayüzü ve veri akışı
Önerilen çerçeve içinde, transformatör kodlayıcı iki NLP görevini yerine getirecek şekilde ince ayarlanmıştır: NER görevi ve kurumsal metin korpusunda RE görevi. Son olarak, model çıktıları bağlamsallaştırılmış token gömülmeleri (R768), varlık sınıflandırma etiketleri ve özne-predikat-nesne ilişkisel üçlemeleri içerir. Normalize varlıklar, metin varyasyonları ve varlığın eşanlamlılarının bir varlık tanımlayıcısına eşlendiği önceden tanımlanmış bir kurumsal ontoloji oluşturularak kullanılır. Her benzersiz normalize varlık, oluşturulmuş bilgi grafiği içinde yeni bir varlık düğümü atanır. Endüstri korpusunun büyüklüğüne bağlı olarak, değerlendirilen kurumsal senaryolarda oluşturulan bilgi grafiği 18.000 ile 25.000 arasında varlık düğümü ve 42.000 ile 60.000 tiplenmiş ilişkisel kenara sahiptir. Kişi, Departman, Süreç, Ürün, Organizasyon ve Belge, grafikte bulunan düğüm türlerinden sadece birkaçıdır. Diğer kenar türleri arasında works_for, yönetici, belongs_to, üreten, approved_by ve related_to bulunur. Her düğüme önceden belirlenmiş bir kurumsal ontolojiden türetilen ayrı bir ontoloji tabanlı tanımlayıcı verilir. Sonuç olarak, ortaya çıkan heterojen grafik, normalize ilişkileri ve anlamsal göme özelliklerine sahip tiplenmiş düğümleri temsil eden tiplenmiş kenarlara sahiptir. Bundan sonra, GNN bu düğüm gömülemelerini ilişkisel akıl yürütme ve ontoloji hizalanması için alır. Önemli olarak, GNN oluşturulan grafikte BERT kodlayıcısına geri yayılan gradyanlar olmadan çalışır; bu da modüler eğitimi garanti eder ve grafik akıl yürütme ile anlamsal çıkarım bileşenlerinin ayrılmasını sağlar.
BERT, bu çalışmada bağlamsal dil modelleme ve anlamsal özelliklerin çıkarılması için kullanılmıştır. Model, belirli bir sınıflandırma hedefine uyarlanmış etiketli veriler kullanılarak ince ayar edildiğinde, yeni metin girdileri için doğru kategori etiketlerini verimli şekilde tahmin etmeyi öğrenebilir. BERT çift yönlü olduğundan, her kelimenin hem önceki hem de sonraki bağlamını dikkate alır ve metin içindeki ilişkilerin daha kapsamlı anlaşılmasını sağlar. BERT-baz modelinin kodlayıcısı, her biri 12 öz-dikkat başlığı ve 768 gizli boyuta sahip 12 transformatör bloğundan oluşur. İşlemden önce, giriş metni seçilen tokenizasyon yaklaşımına bağlı olarak belirteçlere ayrılır; bu yöntemler kelimeleri veya alt kelimeleri temsil edebilir. BERT kullanılarak türetilen dizi temsili Ek Dosya 1'de açıklanmıştır. Model parametreleri, doğru etiketin log olasılığını en aza indirerek optimize edilir (Şekil 2).

Şekil 2. Semantik Özelliklerin Çıkarılması için kullanılan BERT Modelinin Detaylı Çalışma Süreci. KG popülasyonu için girdi/çıktı boyutlarını ve bağlamsal gömülmelerin rolünü gösterir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
GNN kullanarak bilgi grafiği yapımı
Bilgi Grafiği için şema, grafik oluşturulmadan önce önceden tanımlanmıştır. Anlamsal tutarlılık sağlar. Ontoloji, hem varlıklar hem de ilişki tipleri için sonlu sayıda türle ve akıl yürütme için faydalı olan alan aralığı kısıtlamalarıyla önceden tanımlanmıştır. Şema, BERT modelinden toplanan üçlülerden grafiği doldurmak ve GNN'den geçen ilişki farkında mesaj için geçerlidir.
Bu çerçeve içinde, Bilgi Grafiği (KG), kurumsal bilginin yapılandırılmış bir temsili olarak hizmet eder; modelleme varlıkları (örneğin, departmanlar, belgeler, süreçler) ve aralarındaki anlamsal ilişkileri oluşturur. KG'nin matematiksel türevi Ek dosya 1'e eklenmiştir. KG yapısı ile GNN tabanlı akıl yürütmenin bu entegrasyonu, kurumsal KM çerçevesinde ontoloji hizalanması, ilişki çıkarımı ve gelişmiş anlamsal başvuru mümkün kılar.
Bilgi Grafiği (KG), heterojen bir graf G olarak temsil edilirken, yapısı O ontolojisi ile ifade edilir. KG, alternatif olarak önlem akıl yürütme iddialarıyla ifade edilen bir gerçekler kümesi olarak görülebilir. Bu temellerin aşağıdaki açıklamalarıvardır: 34. Graf G değişkendir; V, nesneler veya düğümler kümesini temsil eder (her ikisi de birbirinin yerine kullanılabilir) ve
ilişkiler kümesini temsil eder. Bir üçlü (
) ayrıca sırasıyla iki nesne v1 ve
ve onların ilişkisini
karakterize etmek için de kullanılabilir. GNN kullanılarak KG yapısının matematiksel türetimi, Ek Dosya 1'de açıklanmıştır.
BERT-GNN temelli ontoloji hizalanması ve akıl yürütmesi
Algoritma 1, GNN tabanlı Ontoloji Hizalanması ve Düşüncelemesi'ni gösterir. Süreç, önceden çıkarılmış gömmeler ve yüksek kaliteli ayarlanmış BERT versiyonu aracılığıyla oluşturulan düğüm yeteneklerinin başlatılmasıyla başlar; bu özellikler, her varlığın anlamsal anlamını yapılandırılmamış metinden ele geçirir. Düğümler (varlıklar) ve kenarlar (ilişkiler) içeren bilgi grafiği, bir bitişik matris (A) ve bir özellik matrisi (X) kullanılarak temsil edilir.
Kurallar seti birden fazla GNN katmanı üzerinden ilerler. Her katmanda, bir düğümün temsili, komşu düğümlerden veri toplayarak güncellenir ve bağlantılarına göre ağırlıklandırılır (yani bitişik matrisi kullanılarak). Bu, düğüm gömülmelerinin dönüştürülebilir ağırlık matrisleri aracılığıyla genişletildiği ve ReLU'yu içeren doğrusal olmayan aktivasyon karakteristikleriyle iletilen mesaj geçirme yöntemiyle matematiksel olarak formüle edilmiştir. Bir normalizasyon adımı (örneğin, katman normalizasyonu veya GCN denkleminde olduğu gibi diploma matrislerinin kullanılması) katmanlar boyunca istikrarlı bilgi edinmesini garanti eder.
Bu süreç önceden tanımlanmış katman aralığı T için tekrarlandıktan sonra, model her komşuluğu ve şeklini ile anlamsal yeteneklerini kodlayan son bir düğüm göme Z seti üretir. Bu gömülmeler, daha sonra yumuşak maksimum sınıflandırma katmanı ile aşılır ve varlık türleri (örneğin, "Departman," "Ürün," "Proje") veya şirket içindeki anlamsal roller dahil olmak üzere uyumlu ontoloji etiketlerini tahmin eder.
Algoritma 1: BERT GNN tabanlı ontoloji hizalanması ve akıl yürütme
GNN tabanlı ontoloji hizalanması ve akıl yürütme süreci, düğümler olarak temsil edilen varlıklar ve kenar olarak temsil edilen ilişkilerden oluşan oluşturulmuş Bilgi Grafiği üzerinde çalışıyordu. İlk düğüm temsilleri BERT tabanlı anlamsal gömmelerden türetilmiş ve bir özellik matrisi içinde düzenlenmiştir. Bitişik matrisi, grafiğin bağlantı yapısını temsil ediyor ve düğüm temsillerini geliştirmek için önceden tanımlanmış sayıda GNN katmanı uygulanıyordu. Her katman için, model her düğümü grafik yapısına göre komşu düğümlerden gelen bilgileri toplayarak günceller. Eşitlik (1)'deki bu toplama, komşu düğüm temsillerinin değiştirilebilir ağırlık matrisleriyle çarpılmasını, bir önyargı terimi eklenmesini ve doğrusal olmayan aktivasyon fonksiyonunun uygulanmasını içerir.
(1)
Her katman güncellemesinden sonra, eğitimi stabilize etmek ve tutarlı gömüleme ölçeklerini sağlamak için normalizasyon uygulandı. Tüm katmanlar işlendikten sonra, son düğüm gömmeleri elde edildi. Bu gömmeler, hizalanmış ontoloji etiketlerini veya varlık sınıflarını tahmin etmek için softmax fonksiyonu olan bir sınıflandırma katmanından geçirildi. Prosedür, nihai geliştirilmiş düğüm gömülmelerini ve öngörülen ontoloji uyumlu etiketleri çıktı olarak üretti.
Önerilen yöntem, birden fazla kaynaktan varlıkların anlamsal hizalanmasını sağlar ve yeni ilişkiler çıkararak ve daha önce etiketlenmemiş düğümleri sınıflandırarak bilgi grafiği üzerinde akıl yürütmeyi destekler.

Şekil 3. GNN kullanarak ontoloji hizalanması ve anlamsal akıl yürütme. Mahalle mesaj iletimi ve gömme güncelleme adımlarını gösterir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Toplanan özellikler, ilişkiye özgü ağırlık matrisleri ve doğrusal olmayan aktivasyon fonksiyonu (örneğin, ReLU) kullanılarak dönüştürülür; böylece BERT'ten türetilen anlamsal özellikleri grafikten alınan yapısal bilgilerle entegre eden güncellenmiş düğüm gömülmeleri oluşturulur. Bu gömmeler, varlık etiketlerini veya hizalanmış ontoloji sınıflarını tahmin etmek için softmax sınıflandırma katmanına geçirilir. Bu yerleşik süreç, GNN'yi bilgiyi anlama konusunda son derece etkili kılan bilgi, anlaşılmazlık ayrımcılığı, çıkarım çıkarımı ve anlamsal tip gibi görevlerde yardımcı olmuş ve sonunda daha akıllı, yapay zeka destekli istatistik kontrol yapılarına katkıda bulunmuş (Tablo 2).
| Bileşen | Tanım |
| Çerçeve/Araç Kitleri | Python 3.9, PyTorch 2.0.1, Hugging Face Transformers 4.34, DGL 1.1 (Derin Grafik Kütüphanesi) |
| Donanım | NVIDIA Tesla V100 GPU (16GB), 128GB RAM, Ubuntu 20.04 |
| Ön İşlem Boru Hattı | Tokenizasyon (BERT için Word Piece), stop kelime kaldırma, varlık tanıma (SpaCy), sayısal özellikler için z-score normalizasyonu |
| Veri Seti Kaynakları | Profesyonel anket (250+ yanıt), mülakat transkriptleri (~120.000 kelime), şirket raporları (50+), vaka çalışmaları (15), iç belgeler (200MB) |
| Veri Bölünmesi | %70 eğitim, %15 doğrulama, %15 test |
| Text Encoder Model | BERT tabanı (kasasız), 12 katmanlı, 768 gizli boyut, 12 dikkat başlığı |
| BERT İnce Ayar | 4 dönem, parti büyüklüğü = 32, öğrenme hızı = 2e-5, Adam optimizator, maksimum dikey süresi = 512 |
| Grafik Yapısı | Üçlü tabanlı bilgi çıkarımı (özne, önlem, nesne) |
| Grafik Tipi | Çok ilişkili kenarlara sahip heterojen grafik (BERT çıktısından alınan varlıklar) |
| GNN Mimarisi | 2 katmanlı Heterojen Grafik Sinir Ağı (mesaj geçirme modeli) |
| GNN Hiper parametreleri | Gizli boyut = 128, Aktivasyon = ReLU, Optimizer = Adam, Öğrenme hızı = 0.001 |
| Dekoder Tipi | Bağlantı tahmini için nokta çarpım puanlama ile Dist. Mult |
| Kayıp Fonksiyonu | Üçlü sınıflandırma için ikili çapraz entropi |
Son olarak, protokol aşağıdaki çıktıların oluşturulmasıyla sona erer: ontolojiye uygun kurumsal bilgi grafiği, BERT ve GNN modelleri, bilgi arama ve akıl yürütme sonuçları ile KRP, OAA, DML ve USR raporları. Bunlar, tekrarlanabilir bir şekilde nihai çıktıyı sağlar. GNN eğitimi sırasında negatif örnekleme için, geçerli üçlemeler ontoloji tarafından tanımlanmış tür kısıtlamalarına göre varlık değiştirme yoluyla bozulur. Ortaya çıkan ontoloji hizalamalar, tutarlılık için doğrulanır ve alan uzmanları tarafından manuel olarak incelenir; böylece çıkarılmış varlıklar ile kanonik ontoloji sınıfları arasında anlamsal tutarlılık sağlanır.
Değerlendirme kriterleri
Karar Verme Gecikmesi, kullanıcı sorgusu gönderildikten sonra sistemin eyleme uygun bir yanıt sunması için harcadığı toplam sürenin ölçüsüdür. I kullanıcı sorgusu olsun,
sorgu gönderildiği zaman olsun,
sistemin nihai karar çıktısını sağladığı zaman olsun. Karar Verme Gecikmesi (DML) şu şekilde verilir:
(2)
burada toplam değerlendirilen sorgu sayısıdır. Bu metrik, önerilen çerçevenin bilgi erişiminden yanıt üretimine kadar olan genel yanıt süresini ölçür. Bu metrik için daha düşük bir değer idealdir çünkü daha hızlı sistem yanıt süresi gösterir ve bu da zaman açısından hassas kurumsal karar alma uygulamaları için çok önemlidir.
Bilgi Kapsama Oranı, sistemin belirli bir sorgu için mevcut olan tüm ilgili bilgi öğelerini geri alma yeteneğinin oranıdır. Soru q için ilgili tüm bilgi öğelerinin kümesi, sistem tarafından gerçekten alınan bilgi öğeleri kümesi olsun. Bilgi Kapsama Oranı (KCR) şu şekilde tanımlanır:
(3)
Bu formül, alınan bilgi öğelerinin tamlığını hesaplar. Bu, geleneksel bilgi arama sistemlerinde kullanılan geri çağırma ölçüsüne eşdeğerdir.