$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
البيان الأخلاقي
تمت مراجعة هذه الدراسة والموافقة عليها من قبل مجلس المراجعة المؤسسية (IRB) في الجامعة الوطنية في ماليزيا (UKM) قبل جمع البيانات (معرف الموافقة: UKM/FEP/2025/AI-047؛ تاريخ الموافقة: 12 مارس 2025). شمل البروتوكول المعتمد إدارة الاستطلاعات المنظمة والمقابلات شبه المنظمة التي تشمل مشاركين بشريين. تم إبلاغ جميع المشاركين بهدف الدراسة، والطبيعة الطوعية لمشاركتهم، وحقهم في الانسحاب في أي وقت دون عواقب، وتم الحصول على موافقة مكتوبة مستنيرة قبل إدراجهم. تم الحفاظ على سرية وسرية المشاركين بشكل صارم، دون تضمين معلومات شخصية قابلة للتعريف في التحليل أو النشر، وتم تخزين جميع البيانات بشكل آمن واستخدامها لأغراض البحث الأكاديمي فقط وفقا للمعايير الأخلاقية المؤسسية والإرشادات الدولية ذات الصلة بأبحاث البشر.
البنية العامة لإطار BERT–GNN المقترح KM
في البداية، كان يستخدم مشفر محول مضبوط لمعالجة النصوص غير المنظمة، بما في ذلك المستندات الداخلية، وتفاعلات العملاء، ومحتوى وسائل التواصل الاجتماعي. يتم عرض البنية العامة للنظام لسير عمل إدارة الأنظمة المعتمد على BERT–GNN في الشكل 1. تم جمع بيانات المؤسسات المستخدمة في هذه الدراسة بصيغ وثائق رقمية، بما في ذلك ملفات الاستبيانات المنظمة، ونصوص المقابلات، والتقارير الداخلية للمؤسسات، ووثائق دراسات الحالة المتاحة للجمهور. تم دمج جميع الوثائق في مجموعة موحدة للتحليل. تم استخراج المحتوى النصي من هذه المصادر وتنظيفه لإزالة البيانات الوصفية غير ذات الصلة، والمدخلات المكررة، وعيوب التنسيق. ثم تم تقسيم المجموعة النظيفة إلى جمل وترميزها لتحضيرها لمعالجة اللغة الطبيعية لاحقا مثل استخراج النصوص باستخدام المحللات، إزالة الضوضاء، تقسيم الجمل، والترميز باستخدام أداة الترميز لقطع الكلمات. وقد خدمت هذه المجموعة النصية المعالجة كمدخل للنموذج المضبوط بدقة لاستخراج الكيان والعلاقات33 ، والذي يحتوي على 12 طبقة مع 12 رأس انتباه و768 وحدة مخفية. تم تنظيم البيانات المستخرجة في رسم بياني معرفي، يوفر تمثيلا منظما ومترابطا للمعرفة عبر خرائط الأنطولوجيا لمجال المؤسسة. تم تطبيق GNNs لمحاذاة الأنطولوجيا باستخدام التشابه الجيب التمام والاستدلال لضمان التقاط العلاقات الدلالية عبر مجالات المعرفة بدقة واستنتاجها منطقيا عن طريق إزالة التكرارات عبر تشابه السلاسل مع العتبة 0.85. ثم تم استخدام المعرفة المعالجة ضمن طبقة اتخاذ القرار، مما مكن من تحليل البيانات بكفاءة وتسهيل اتخاذ القرار القائم على البيانات. حولت هذه البنية البيانات المجزأة إلى أصول معلوماتية ذكية وواعية للسياق. تم التحقق من صحة الإطار من خلال محاكاة حالة الأعمال وتم مقارنته مع أنظمة إدارة الذاكرة التقليدية مثل Naive Bayes (NB)، Support Vector Machine (SVM)، Random Forest (RF)، TF-IDF، LDA، BERT ONLY وBERT مع KG مع تقسيم مجموعة البيانات 70:15:15 ورؤية ثابتة 42 لتقييم تحسينات الأداء في دقة الاسترجاع، زمن الاستجابة للقرار، وفائدة المعرفة.

الشكل 1. البنية العامة للنظام لسير عمل إدارة الأنظمة المعتمد على BERT-GNN. هيكلية النظام العامة AI–BDA–GNN تظهر استيعاب البيانات متعدد المصادر، المعالجة المسبقة، BERT المضبوط للاستخراج الدلالي، عدد سكان KG، محاذاة الأنطولوجيا/التفكير المعتمد على GNN، وطبقة اتخاذ القرار. تشير الأسهم إلى تدفق البيانات وحلقات تغذية راجعة اختيارية للتعلم عبر الإنترنت. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
جمع البيانات
تم جمع مجموعة البيانات المستخدمة في هذه الدراسة من مصادر متعددة لدعم التمثيل والصلاحية الخارجية. شمل جمع البيانات الأولية من خلال استبيانات منظمة ومقابلات شبه منظمة مع ممارسين في قطاعات تكنولوجيا المعلومات والتصنيع والرعاية الصحية والتعليم أعضاء معتمدين في غرفة المدققين الماليين في رومانيا. شملت البيانات الثانوية وثائق داخلية مجهولة الهوية للمؤسسات، وتقارير سنوية، ودراسات حالة للتحول الرقمي متاحة للجمهور. تم جمع البيانات خلال فترة دراسة محددة جيدا، وتم إخفاء هوية جميع السجلات بناء على التصريح الأخلاقي المؤسسي لحماية السرية وضمان الامتثال.
معايير اختيار المشاركة: لضمان الصرامة المنهجية والتمثيلية، تم اختيار المشاركين بناء على معايير إدماج واستبعاد محددة جيدا. بالإضافة إلى مشاركتهم الفعالة في التحول الرقمي، وإدارة المعلومات، والذكاء الاصطناعي، وتحليلات البيانات الضخمة، أو أنظمة المعلومات المؤسسية، كان يجب على المشاركين المؤهلين أن يكون لديهم خبرة مهنية لا تقل عن ثلاث سنوات في تكنولوجيا المعلومات أو التصنيع أو الرعاية الصحية أو التعليم أو المحاسبة أو بيئات المؤسسات ذات الصلة. كان من الضروري أن يكون لدى المحترفين المعتمدين حالة اعتماد نشطة خلال فترة جمع البيانات (مثل أعضاء غرفة المدققين الماليين في رومانيا). لفهم مواد الاستبيان والمقابلات بدقة ومنح الإذن المستنير وفقا لبروتوكول IRB المصرح به، كان مطلوبا أيضا من المشاركين إثبات إتقان اللغة الرومانية أو الإنجليزية. تم استبعاد أولئك الذين لديهم خبرة أقل من ثلاث سنوات ذات صلة، أو حالة مهنية غير نشطة (إذا كان ذلك ينطبق)، أو عدم المشاركة المباشرة في عمليات المعرفة أو اتخاذ القرار على مستوى المؤسسة، أو الردود غير المكتملة على الاستبيانات (أكثر من 20٪ من البيانات المفقودة)، أو فحوصات فحص جودة البيانات غير الناجحة. بالإضافة إلى ذلك، لم يتم تضمين نصوص المقابلات التي لم تكن مفصلة أو ذات صلة كافية بتقنيات KM في التحليل. وقد ضمن هذه المعايير عينة مشارك كفؤة، ممثلة للقطاع، وسليمة تحليليا.
كان الأعضاء المعتمدون في غرفة المدققين الماليين في رومانيا (CAFR) من الفئة المستهدفة الرئيسية لجمع البيانات. تم تطوير وتوزيع استبيان عبر الإنترنت عبر قنوات الاتصال الداخلية لدعم التوزيع المستهدف ومعدلات الاستجابة العالية. لتشكيل عينة تمثيلية، تمت مراجعة تواريخ CAFR وتم اختيار 250 مشاركا مسجلا بناء على الميزات ذات الصلة بالدراسة.
هيكل أدوات الاستطلاع: استخدمت الدراسة استبيانا منظما يضم 24 عنصرا موزعا على خمسة مجالات بنائية: مرونة المنظمة وكفاءة التشغيل (5 عناصر)، دعم القرار الاستراتيجي وقدرة الابتكار (5 بنود)، تأثير تحليلات البيانات الضخمة على تبادل المعرفة (5 عناصر)، اعتماد الذكاء الاصطناعي في إدارة المعرفة (5 عناصر)، وفعالية المستخدم وسهولة استخدام النظام (4 بنود). تم استخدام مقياس ليكرت من 5 نقاط، حيث 1 تعني "أختلف بشدة" و5 تدل على "أوافق بشدة"، لتقييم كل بند. تم وضع الأداة في سياقه لتنفيذ الذكاء الاصطناعي للمؤسسات وتعديلها من مقاييس إدارة المعرفة والتحول الرقمي التي تم التحقق منها سابقا. أجرى ثلاثة علماء أكاديميين وخبيران في مجال الأعمال مراجعة خبيرة لتأكيد صحة المحتوى. لتحسين اللغة، وقياس الوضوح، وقياس الموثوقية، تم إجراء بحث تجريبي مع 20 ممارسا؛ جميع المكونات كانت تحتوي على قيم ألفا لكرونباخ أكبر من 0.80، مما يدل على اتساق داخلي قوي. كما أجريت مقابلات شبه منظمة لدعم نتائج الاستبيان. تم تغطية خمسة مجالات موضوعية في دليل المقابلات: الخبرة في التحول الرقمي، الصعوبات في تدفق المعرفة في المؤسسات، دمج الذكاء الاصطناعي والبيانات الضخمة في اتخاذ القرار، العقبات التي تعيق التوافق الدلالي، وقضايا الحوكمة الأخلاقية. أجريت كل مقابلة بموافقة مستنيرة، واستمرت حوالي 45 إلى 60 دقيقة، وتم تسجيلها صوتيا، ثم تم نسخها للتحليل النوعي.
لتقييم أداء إطار العمل المقترح BERT-GNN لإدارة المعرفة في المؤسسات التي تتحول رقميا، تم إعداد مجموعة بيانات كبيرة ومتنوعة من مصادر مختلفة في صناعات متنوعة. تغطي مجموعة البيانات الجوانب الكمية والنوعية لتمثيل التصورات الديناميكية المتعلقة بتدفق المعرفة والتغير التنظيمي. تم جمع بيانات منظمة من أكثر من 250 محترفا من خلال استبيان إلكتروني يتضمن عناصر على مقياس ليكرت (النطاق 1–5) لقياس التأثيرات المتوقعة للذكاء الاصطناعي (AI) وتحليلات البيانات الضخمة (BDA) على تبادل المعرفة والابتكار ومرونة الأعمال. في الوقت نفسه، تم جمع بيانات غير منظمة من خلال مقابلات شبه منظمة مع 30 خبيرا في المجال، مما وفر أكثر من 120,000 كلمة نص. تم جمع مواد شبه منظمة إضافية تشمل التقارير السنوية للشركات وأوراق الاستراتيجية الرقمية (أكثر من 50 وثيقة) لوضع أنماط التبني على نطاق المؤسسات في سياقها. بالإضافة إلى ذلك، تمت إضافة 15 دراسة حالة مفصلة من صناعات تكنولوجيا المعلومات والتصنيع والرعاية الصحية والتعليم لتقديم سياقات تحول عملية. أوراق قاعدة المعرفة الداخلية (حوالي 200 ميغابايت)، تم إخفاء هويتها لأسباب تتعلق بالخصوصية، كما تم تضمينها لتعزيز تصوير أصول المعرفة التشغيلية. تمكن مجموعة البيانات متعددة المصادر هذه من إنشاء خط تدريب وتقييم قوي لنماذج التعلم العميق وتلتقط الجوانب الاستراتيجية والتشغيلية لإدارة المعلومات. يوضح الجدول 1 العينة السكانية المستخدمة للتقييم.
| المكون | النوع | المصدر | الحجم/الحجم |
| الردود على الاستطلاعات المهنية | هيكلي | استطلاعات عبر الإنترنت من 250+ محترف | ~10,000 تسجيل |
| نصوص المقابلات | غير منظم | مقابلات شبه منظمة من 30 خبيرا | ~120,000 كلمة |
| تقارير الشركة | شبه هيكلي | التقارير السنوية ووثائق الاستراتيجية الرقمية | 50+ وثيقة |
| دراسات حالة | مختلط | حالات استخدام التحول الرقمي الخاصة بالصناعة | 15 قضية مفصلة |
| محتوى قاعدة المعرفة | غير منظم | وثائق داخلية من منظمات (مجهولة) | ~200 ميجابايت |
المعالجة المسبقة للبيانات وضبط BERT الدقيق
تم الوصول إلى بيانات المستندات المؤسسية الخام من قائمة مختارة ومعالجتها مسبقا باستخدام تقسيم الجمل، والترميز، وإزالة كلمة التوقف، والتطبيع لتلبية متطلبات الترميز. ثم تم تعديل النموذج المدرب مسبقا لضبط النموذج لمهمة معينة، وضبطه لأداء مهمة التعرف على الكيانات المسماة (NER) واستخراج العلاقات (RE). تم ضبط النموذج بدقة على بيانات الكوربوس المعالجة مسبقا لعدد فترات معين باستخدام محسن آدم. وأخيرا، تم إنتاج تضمين الكلمات السياقية (R768) من كيانات محددة وعلاقاتها. تم توليد الكيانات الموحدة بواسطة تقنية تطبيع قائمة على الأنطولوجيا، حيث تم تحويل كيانات مختلفة، مثل المرادفات، إلى أشكال مطبعة. كل كيان مميز تم تطبيعه كان عقدة، بينما كانت العلاقة بين الكيانات تسمى حافة في تمثيل رسم المعرفة. شكلت التضمينات النموذجية للكيان التي تولدها النموذج ميزات العقدة الأولية لشبكة الرسم البياني العصبي. في الخطوة التالية، تم تدريب شبكة الرسم البياني العصبية على طريقة التنبؤ بالروابط المراقبة مع أخذ عينات سلبية يتم الحصول عليها من خلال تلف الحواف. في التدريب، يحدث فقدان في الإنتروبيا المتقاطع عبر عدة فترات. تم تقييم الإطار المدرب باستخدام دقة استرجاع المعرفة، وتأخير اتخاذ القرار، ومعدل رضا المستخدمين كمقاييس للتقييم.
تم استخدام نهج هجين للتعليق لإنشاء تسميات تدريبية ل RE و NER. قام خبيران مستقلان في مجال الموضوع بتعليق يدوي على مجموعة وثائق مؤسسية خاصة بالمجال، مثل التقارير الداخلية، سجلات تفاعل العملاء، ووثائق السياسات، باستخدام مخطط أنطولوجي محدد مسبقا يحدد فئات الكيانات (مثل المنظمة، العملية، التكنولوجيا، الأدوار، مؤشرات الأداء الرئيسية) وأنواع العلاقات (مثل الدعم، depends_on، والتحسينات). لضمان التوحيد في اتجاه العلاقات واكتشاف حدود الكيانات، تم إنشاء إرشادات شاملة للتعليقات. تم تضمين 20٪ من مجموعة البيانات بتعليقات مزدوجة لتقييم الموثوقية. تم استخدام كابا لكوهين لاختبار توافق بين المعلقينين، وأظهرت النتائج توافقا قويا (κ = 0.87 لتصنيف الكيانات وκ = 0.82 لاستخراج العلاقات). ثم تم استخدام الإشراف الضعيف لتوسيع مجموعة البيانات المشروحة يدويا باستخدام مطابقة الأنماط القائمة على القواعد والقيود الأنطولوجية، مع تصفية قائمة على الثقة لتقليل الضوضاء. لضمان إمكانية إعادة التكرار الكاملة، تم تسجيل جميع إجراءات التعليق، وتعريفات الأنطولوجيا، وانقسامات مجموعات البيانات، والبذور العشوائية.
تم قياس الكفاءة في الدقة على مستوى المستندات، وتقدير زمن الاستجابة بناء على زمن الاستجابة للاستعلام من البداية إلى النهاية، وتم رضا المستخدمين باستخدام استبيانات مقياس ليكرت. في نهاية كل مرحلة، تم إنشاء نقاط تفتيش بروتوكول متتالية. (i) نقطة تفتيش مخرجات BERT - كيانات عينة وثلاثيات علاقات مستخرجة؛ (2) عينة نقطة التحقق من مخطط فرعي مبني مع تسميات الأنطولوجيا؛ (3) نقطة التحقق GNN - عينة من توقعات الأنطولوجيا والرابط المستنتج؛ و(4) نقطة التحقق للاسترجاع - عينة من عناصر المعرفة المسترجعة مع تسميات ذات صلة.
البروتوكول المقترح هو الهيكل التالي: خط أنابيب حتمي متعدد المراحل مع مخرجات وسيطة محددة جيدا، مما يسمح بإمكانية إعادة الإنتاج الكاملة. الخطوة 1، بعد استيعاب البيانات المؤسسية الخام المنظمة ونصف المنظمة وغير المنظمة والمعالجة المسبقة، سيتم إنشاء مجموعات نصية نظيفة ومصفوفات ميزات عددية مطبعة. الخطوة 2: سيتم تطبيق نماذج BERT مضبوطة بدقة لاستخراج المعرفة، مما يعطي مخرجا صريحا على شكل كيانات مسماة مثل القسم، العملية، المستند، ومؤشرات الأداء الرئيسية؛ (2) العلاقات الدلالية بين الكيانات، ممثلة كثلاثيات فاعل-مسند مفعول بالمفعول. في الخطوة 3، يتم تحويل هذه الثلاثيات إلى رسم بياني معرفي أولي، حيث تكون العقد كيانات والعلاقات حواف مصنفة، متوافقة مع مخطط أنطولوجي محدد مسبقا. في الخطوة 4، سيؤدي تطبيق شبكة الرسم البياني العصبية لهذا الرسم البياني لمحاذاة الأنطولوجيا والاستدلال إلى تحسين تضمين العقد، واستنتاج العلاقات، ومحاذاة تسميات الأنطولوجيا. توفر الخطوة 5 الرسم البياني النهائي للمعرفة ونتائج الاستدلال التي ستغذي الاسترجاع الدلالي، ودعم القرار، وتقييم الأداء.
جميع القطع الوسيطة، بما في ذلك قوائم الكيانات، والثلاثيات العلاقات، والرسوم البيانية المتوافقة مع الأنطولوجيا، والروابط المستنتجة، تولد صراحة في كل مرحلة من مراحل هذا البروتوكول، مما يسمح بتكرار البحث بشكل مستقل دون الحاجة إلى تذكيرات.
تنقسم مجموعة البيانات إلى مجموعة تدريب، مجموعة تحقق، ومجموعة اختبار وفقا لنسبة ثابتة 70:15:15 لضمان قابلية تكرار نتائج التجربة. يتم تنفيذ الترميز، والتقليل من الحرف، وإزالة كلمة التوقف، وتقصير التسلسل إلى 512 رمزا في BERT من حيث إعداد النصوص. من ناحية أخرى، يستخدم تطبيع درجة Z لتطبيع الميزات الهيكلية. بالإضافة إلى ذلك، يتم ضبط نموذج BERT بدقة باستخدام مكتبة إطار التعلم العميق مع محسن آدم حيث يكون معدل التعلم من 2e-5، وحجم الدفعة 16، وعدد الفترات 5. يتم حفظ الكيانات والعلاقات المستخرجة المتوقعة بصيغة قياسية لبناء رسم المعرفة. بالإضافة إلى ذلك، يستخدم تضمين عقدة رسم المعرفة (R768) كمدخل ل GNN لمحاذاة الأنطولوجيا والتفكير.
واجهة BERT-GNN وتدفق البيانات
ضمن الإطار المقترح، يتم ضبط مشفر المحول لأداء مهمتين من معالجة اللغة الطبيعية: مهمة NER ومهمة RE على مجموعة نصية مؤسسية. أخيرا، تشمل مخرجات النموذج تضمينات رموز سياقية (R768)، وتسميات تصنيف الكيانات، والتوائم الثلاثية العلائقية بين الفاعل-المسند-الكائن. تستخدم الكيانات الممطرة من خلال بناء أنطولوجيا مؤسسية محددة مسبقا، حيث يتم ربط التنويعات النصية والمرادفات للكيان بمعرف الكيان. يتم تعيين عقدة كيان جديدة لكل كيان مطبع فريد داخل رسم المعرفة المنشأ. اعتمادا على حجم مجموعة الصناعة، يحتوي رسم المعرفة المولد في سيناريوهات المؤسسة المقيمة على ما بين 18,000 و25,000 عقدة كيان و42,000 و60,000 حافة علاقية مطبوعة. الشخص، القسم، العملية، المنتج، التنظيم، والمستند هي بعض أنواع العقد الموجودة في الرسم البياني. تشمل أنواع الحافة الأخرى works_for، والإدارة و belongs_to والمنتجات الزراعية و approved_by و related_to. يعطى لكل عقدة معرف مميز قائم على الأنطولوجيا مشتقا من أنطولوجيا مؤسسية محددة مسبقا. نتيجة لذلك، يحتوي الرسم البياني غير المتجانس الناتج على حواف مصنفة تمثل علاقات مطبعة وعقد مصنفة ذات خصائص تضمين دلالي. بعد ذلك، تحصل شبكة GNN على هذه التضمينات للعقد للاستدلال العلائقي ومحاذاة الأنطولوجيا. والأهم من ذلك، أن GNN يعمل على الرسم البياني المولد دون الرجوع إلى مشفرة BERT، مما يضمن التدريب المعياري ويحافظ على فصل مكونات الاستدلال والاستخراج الدلالي.
تم استخدام BERT في هذه الدراسة لنمذجة اللغة السياقية واستخراج السمات الدلالية. يمكن للنموذج تعلم التنبؤ بكفاءة بتسميات الفئات الصحيحة لمدخلات النصوص الجديدة عند ضبطها بدقة باستخدام بيانات معنونة مصممة لهدف تصنيف محدد. نظرا لأن BERT ثنائي الاتجاه، فإنه يأخذ في الاعتبار السياق السابق واللاحق لكل كلمة، مما يتيح فهما أكثر شمولا للعلاقات داخل النص. يتكون مشفر نموذج قاعدة BERT من 12 كتلة محول، كل منها يحتوي على 12 رأس تركيز ذاتي وحجم مخفي 768. قبل المعالجة، يتم تقسيم النص المدخل إلى رموز حسب طريقة الترميز المختارة، والتي قد تمثل كلمات أو كلمات فرعية. يتم وصف تمثيل التسلسل المستخرج باستخدام BERT في الملف التكميلي 1. يتم تحسين معلمات النموذج عن طريق تقليل احتمال لوغاريتمية للتسمية الصحيحة (الشكل 2).

الشكل 2. عملية العمل التفصيلية لنموذج BERT المستخدم لاستخراج السمات الدلالية. يوضح أبعاد الإدخال/الإخراج ودور التضمينات السياقية لفئة KG. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
بناء رسم المعرفة باستخدام GNN
مخطط رسم المعرفة محدد مسبقا قبل بناء الرسم البياني. يوفر اتساقا دلاليا. الأنطولوجيا محددة مسبقا فيما يتعلق بعدد محدود من الأنواع لكل من الكيانات وأنواع العلاقات، إلى جانب قيود نطاق المجال، والتي تساعد في التفكير. المخطط قابل للتطبيق على ملء الرسم البياني من الثلاثيات التي جمعت من نموذج BERT وكذلك على الرسالة الواعية للعلاقات التي تمر عبر GNN.
ضمن هذا الإطار، يعمل رسم المعرفة (KG) كتمثيل منظم لمعرفة المؤسسة، ونمذجة الكيانات (مثل الأقسام، الوثائق، العمليات) والعلاقات الدلالية بينها. تمت إضافة الاشتقاقات الرياضية ل KG في الملف التكميلي 1. يتيح هذا التكامل بين بناء KG والاستدلال القائم على GNN محاذاة الأنطولوجيا، واستدلال العلاقات، وتحسين الاسترجاع الدلالي ضمن إطار إدارة الأنظمة المؤسسية.
يمثل رسم المعرفة (KG) كرسم بياني غير متجانس G، بينما يعبر عن بنيته بواسطة أنطولوجيته O. يمكن أيضا اعتبار KG كمجموعة من الحقائق التي تعبر عنها بتأكيدات الاستدلال المحمول. هذه الأساسيات لها الأوصاف التالية34. الرسم البياني G متغير، حيث يمثل V مجموعة الكائنات أو العقد (يمكن استخدام كلاهما بالتبادل) ويمثل
مجموعة العلاقات. يمكن أيضا استخدام الثلاثي (
) لتوصيف زوجين من الكائنات v1 و
وارتباطهما
على التوالي. يتم وصف الاشتقاق الرياضي لبناء KG باستخدام GNN في الملف التكميلي 1.
محاذاة الأنطولوجيا والاستدلال المعتمد على BERT-GNN
تظهر الخوارزمية 1 محاذاة الأنطولوجيا والاستدلال المعتمدة على GNN. تبدأ العملية بتهيئة قدرات العقدة باستخدام تضمين مستخرج مسبقا إلى جانب تلك التي يتم توليدها عبر نسخة BERT مضبوطة عالية الجودة، والتي تلتقط المعنى الدلالي لكل كيان من نص غير منظم. يمثل رسم المعرفة، الذي يتكون من عقد (كيانات) وحواف (علاقات)، باستخدام مصفوفة مجاورة (A) ومصفوفة ميزات (X).
تمر مجموعة القواعد عبر أكثر من طبقة GNN واحدة. في كل طبقة، يكون تمثيل العقدة محدثا من خلال تجميع البيانات من العقد المجاورة، موزونة حسب اتصالها (أي باستخدام مصفوفة المجاورة). يتم صياغة هذا رياضيا باستخدام طريقة تمرير الرسائل حيث يتم توسيع تضمين العقد بواسطة مصفوفات أوزان قابلة للتوجيه وتمريرها عبر خاصية تنشيط غير خطية تشمل ReLU. تضمن خطوة التطبيع (مثل تطبيع الطبقة أو استخدام مصفوفات الدبلوم كما في معادلة GCN) اكتساب المعرفة المستقرة عبر الطبقات.
بعد تكرار هذه العملية لنطاق محدد مسبقا من الطبقات T، ينتج النموذج مجموعة نهائية من الطبقات Z في تضمين العقد، والتي ترمز لكل حي وشكله وقدراته الدلالية. يتم تجاوز هذه التضمينات عبر طبقة تصنيف حد سوفت ماكس للتنبؤ بتسميات الأنطولوجيا المتوافقة، بما في ذلك فرز الكيانات (مثل "قسم"، "منتج"، "مشروع") أو أدوار دلالية داخل الشركة.
الخوارزمية 1: محاذاة واستدلال الأنطولوجيا المبنية على BERT GNN
كانت عملية المحاذاة والاستدلال المعتمدة على GNN تعمل على رسم المعرفة المنشأ، الذي يتكون من كيانات ممثلة كعقد وعلاقاتها ممثلة كحواف. تم اشتقاق تمثيلات العقد الأولية من التضمينات الدلالية المعتمدة على BERT وتنظيمها في مصفوفة الميزات. مثلت مصفوفة المجاور بنية الاتصال في الرسم البياني، وتم تطبيق عدد محدد مسبقا من طبقات GNN لتحسين تمثيلات العقد. لكل طبقة، كان النموذج يحدث كل عقدة عن طريق تجميع المعلومات من العقد المجاورة بناء على بنية الرسم البياني. يتضمن هذا التجميع في المعادلة (1) ضرب تمثيلات العقد المجاورة بمصفوفات أوزان قابلة للتدريب، وإضافة مصطلح تحيز، وتطبيق دالة تنشيط غير خطية.
(1)
بعد كل تحديث للطبقة، تم تطبيق التطبيع لتثبيت التدريب وضمان مقاييس تضمين متسقة. بمجرد معالجة جميع الطبقات، تم الحصول على التضمينات النهائية للعقد. ثم تم تمرير هذه التضمينات عبر طبقة تصنيف مع دالة softmax للتنبؤ بتسميات الأنطولوجيا أو فئات الكيانات المتحالفة. أنتج الإجراء التضمينات النهائية للعقد المنقحة والتسميات المتوقعة المتوافقة مع الأنطولوجيا كمخرجات.
تمكن الطريقة المقترحة من المحاذاة الدلالية للكيانات من مصادر متعددة وتدعم التفكير في رسم المعرفة من خلال استنتاج علاقات جديدة وتصنيف العقد غير الموسومة سابقا.

الشكل 3. محاذاة الأنطولوجيا والتفكير الدلالي باستخدام GNN. يوضح خطوات تحديث تمرير وتضمين رسائل الجوار. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
يتم تحويل الميزات المجمعة باستخدام مصفوفات وزن خاصة بالعلاقة ودالة تفعيل غير خطية (مثل ReLU)، مما يولد تضمينات عقدية محدثة تدمج الميزات الدلالية المشتقة من BERT مع المعلومات البنيوية من الرسم البياني. ثم تمرر هذه التضمينات إلى طبقة تصنيف سوفتماكس للتنبؤ بتسميات الكيانات أو فئات الأنطولوجيا المحاذية. تجعل هذه العملية المعتمدة GNN فعالة للغاية في التفكير عبر الرسوم البيانية التقنية، مما يساعد في مهام مثل تمييز الكيانات، والاستدلال، والنوع الدلالي، مما يساهم في النهاية في هياكل تحكم إحصائية أكثر ذكاء ومدفوعة بالذكاء الاصطناعي (الجدول 2).
| المكون | الوصف |
| الإطارات/الأدوات | بايثون 3.9، بايتورش 2.0.1، محولات هاجينغ فيس 4.34، DGL 1.1 (مكتبة الرسوم البيانية العميقة) |
| الأجهزة | بطاقة رسومات NVIDIA تسلا V100 (16GB)، 128GB RAM، أوبونتو 20.04 |
| خط أنابيب المعالجة المبدئية | الترميز (قطعة كلمة ل BERT)، إزالة كلمة التوقف، التعرف على الكيانات (SpaCy)، تطبيع درجة z للميزات الرقمية |
| مصادر مجموعة البيانات | استبيان مهني (250+ ردا)، نصوص المقابلات (~120,000 كلمة)، تقارير الشركات (50+)، دراسات حالة (15)، وثائق داخلية (200 ميجابايت) |
| تقسيم البيانات | 70٪ تدريب، 15٪ تحقق، 15٪ اختبار |
| نموذج ترميز النص | قاعدة BERT (بدون غلاف)، 12 طبقة، 768 حجم مخفي، 12 رأس انتباه |
| بيرت الضبط الدقيق | 4 عصرات، حجم الدفعة = 32، معدل التعلم = 2e-5، محسن آدم، أقصى طول تسلسل = 512 |
| بناء الرسم البياني | استخراج المعرفة القائم على ثلاثي (الفاعل، المحمول، المفعول به) |
| نوع الرسم البياني | رسم بياني غير متجانس مع حواف متعددة العلاقات (كيانات من مخرجات BERT) |
| هندسة GNN | شبكة الرسم البياني غير المتجانسة ذات الطبقتين (نموذج تمرير الرسائل) |
| معلمات GNN الفائقة | البعد المخفي = 128، التفعيل = ReLU، المحسن = آدم، معدل التعلم = 0.001 |
| نوع فك التشفير | التقسيم متعدد مع نقاط النقاط لتوقع الروابط |
| دالة الخسارة | الإنتروبيا الثنائية المتقاطع لتصنيف الثلاثيات |
أخيرا، يختتم البروتوكول بتوليد المخرجات التالية: رسم بياني معرفي مؤسسي متوافق مع الأنطولوجيا، نماذج BERT وGNN، نتائج استرجاع المعلومات والتفكير، وتقارير KRP وOAA وDML وUSR. هذه توفر المخرج النهائي بشكل قابل للتكرار. بالنسبة للعينة السلبية أثناء تدريب GNN، يتم إفساد الثلاثيات الصالحة من خلال استبدال الكيانات وفقا لقيود النوع المعرفة من قبل الأنطولوجيا. يتم التحقق من صحة المحاذاة الأنطولوجية الناتجة من حيث الاتساق ومراجعتها يدويا من قبل خبراء المجال لضمان التماسك الدلالي بين الكيانات المستخرجة وفئات الأنطولوجيا القانونية.
معايير التقييم
زمن استجابة اتخاذ القرار هو مقياس الوقت الإجمالي الذي يستغرقه النظام لتقديم استجابة قابلة للتنفيذ بعد تقديم استفسار المستخدم. لتكن i هو استعلام المستخدم،
وأن يكون الوقت الذي يتم فيه تقديم الاستعلام،
وأن يكون الوقت الذي يقدم فيه النظام القرار النهائي. يعطى زمن استجابة اتخاذ القرار (DML) بالتالي:
(2)
حيث هو العدد الإجمالي للاستعلامات المقيمة. يقيس هذا المقياس زمن الاستجابة الكلي للإطار المقترح، من استرجاع المعرفة إلى توليد الاستجابة. القيمة الأقل لهذا المقياس مثالية لأنها تظهر زمن استجابة نظام أسرع، وهو أمر بالغ الأهمية لتطبيقات اتخاذ القرار المؤسسية الحساسة للوقت.
نسبة تغطية المعرفة هي نسبة قدرة النظام على استرجاع جميع عناصر المعرفة ذات الصلة المتاحة لاستعلام معين. لتكن مجموعة جميع عناصر المعرفة ذات الصلة للاستعلام q، وتكون مجموعة عناصر المعرفة التي يسترجعها النظام فعليا. تعرف نسبة تغطية المعرفة (KCR) بأنها:
(3)
تحسب هذه الصيغة اكتمال عناصر المعرفة التي يتم استرجاعها. وهو يعادل مقياس الاسترجاع المستخدم في أنظمة استرجاع المعلومات التقليدية.