تدرس هذه الورقة خوارزمية تحسين للجدولة الديناميكية تدمج بين نموذج Transformer والتعلم التعزيزي القائم على تحسين السياسة القريبة (PPO)، مع التركيز على تضاربات الموارد المتكررة وتأخيرات الاستجابة في جدولة الأنشطة النقابية.
مقالة بحثية
تدرس هذه الورقة خوارزمية تحسين للجدولة الديناميكية تدمج بين نموذج Transformer والتعلم التعزيزي القائم على تحسين السياسة القريبة (PPO)، مع التركيز على تضاربات الموارد المتكررة وتأخيرات الاستجابة في جدولة الأنشطة النقابية.
لمعالجة مشكلة انخفاض الكفاءة التنظيمية الناتجة عن تكرار تعارضات تخصيص الموارد وتأخر استجابات الجدولة في إدارة أنشطة النقابات العمالية، تقترح هذه الورقة خوارزمية جدولة ديناميكية تدمج بين نموذج Transformer وخوارزمية PPO (Proximal Policy Optimization). وفي التنفيذ المحدد، تم أولاً تصميم هيكل نمذجة موحد لسيناريو الجدولة لتحويل حالات الأنشطة والأفراد والموارد إلى مدخلات تنسورية (tensor inputs)، وبذلك يتم تحقيق تكامل للقيود متعددة الأبعاد. بعد ذلك، استُخدمت آلية الانتباه متعدد الرؤوس (multi-head attention mechanism) في نموذج Transformer لترميز السلاسل الزمنية لطلبات الأنشطة السابقة وحالة الموارد، واستخراج السمات الزمكانية متعددة الأبعاد، وتعزيز إدراك مخاطر التعارض. وبناءً على نتائج الترميز وشبكة استراتيجية PPO، يتم توليد إجراءات الجدولة من الحالة الراهنة لتعزيز قدرة الاستراتيجية على التكيف مع البيئات المعقدة. وأخيراً، ومن خلال تحديث التقليم (pruning update) وآلية تصحيح دالة الميزة (advantage function correction mechanism)، يتم ضمان استقرار الاستراتيجية أثناء التكرار وتحسين أداء الجدولة. وقد أظهرت التجارب أنه عندما تكون كثافة المهام 1000، بلغ متوسط وقت اتخاذ القرار في خوارزمية الجدولة 0.72s وكان متوسط تأخير الاستجابة 1.59s، مما يشير إلى سرعة استجابة وكفاءة عالية في اتخاذ القرار. وعبر سبعة أنواع من الأنشطة ومستويات تعقيد مختلفة، تراوح معدل تعارض الموارد بين 0.05–0.12؛ وبلغ متوسط معدل استهلاك الموارد 0.75–0.86؛ ومؤشر استقرار الجدولة 0.8–0.91، مما قلل بشكل فعال من تعارضات تخصيص الموارد المتكررة وحقق استقراراً عالياً في الجدولة. وفي ظل ظروف التزامن العالي، بلغ مؤشر توازن الموارد ومؤشر متانة نقل الاستراتيجية 0.88 و0.85 على التوالي، مما يشير إلى قدرة جيدة على التكيف مع أحمال تزامن المهام.
تتضمن أنشطة النقابة جدولة معقدة لمهام وموارد متعددة، مما يتطلب من النظام امتلاك قدرات استجابة ديناميكية فعالة1,2. وتتغير متطلبات الأنشطة بشكل متكرر، كما أن توزيع الموارد البشرية وموارد القاعات يتسم بالتعقيد، وهو ما قد يؤدي بسهولة إلى تضارب في الجدولة وهدر في الموارد3,4. ويعد الرصد الدقيق لسجل الأنشطة وحالة الموارد في الوقت الفعلي، فضلاً عن تحسين القدرة على تحديد التعارضات المحتملة والاستجابة لها، أمراً أساسياً لتعزيز الكفاءة التشغيلية التنظيمية5,6. ويمكن أن يحقق دمج تقنية نمذجة السلاسل الزمنية المتقدمة مع خوارزميات التعلم التعزيزي فهماً عميقاً وتحسيناً ذكياً في بيئات الجدولة المعقدة، مما يساعد في تحقيق أقصى استفادة من الموارد، وتسريع الاستجابة للجدولة، وتعزيز الترقية الذكية لإدارة أنشطة النقابة.
ومع ذلك، فإن نهج الجدولة الحالية المطبقة عملياً تعتمد بشكل كبير على القواعد وهي ثابتة، مما يجعلها تفشل في التكيف مع التغيرات المتكررة في المهام وتقلبات الموارد، وهو ما يؤدي غالباً إلى إطالة أوقات الاستجابة وحدوث تعارضات حادة في الموارد. وفي جدولة أنشطة النقابات، تتنوع أنواع المهام بشكل كبير؛ كما أن استخدام الموارد مقيد للغاية ويتغير باستمرار؛ كما أن التبعيات بين الأنشطة والتنافسية بين الموارد تشكل خارطة جدولة معقدة7,8. ومن الناحية العملية، لا يمكن مطابقة جدول الأنشطة بكفاءة مع النوافذ الزمنية المتاحة للموارد مثل الموظفين والمواقع9,10، وغالباً ما تحدث تعارضات تضعف التماسك العام للعمليات التنظيمية11,12. ولا يواجه نظام الجدولة هدفاً واحداً للتحسين، بل يتطلب توازناً بين مؤشرات متعددة الأبعاد، مثل تقليل تعارضات الموارد، وزيادة سرعة الاستجابة، واستقرار استراتيجية الجدولة، ومعدل إتمام المهام13,14، وهي مؤشرات تظهر خصائص نمطية للتحسين متعدد الأهداف. بالإضافة إلى ذلك، تظهر أنشطة النقابات العمالية مراحل ودورات متميزة، ويجب أن تتكيف استراتيجيات الجدولة ديناميكياً مع هياكل الطلب على الموارد المتغيرة عبر مراحل المهام المختلفة. ولا يمكن للخطط الثابتة التي يتم إنشاؤها لمرة واحدة أن تدعم بيئة تنفيذ تتسم بتغيرات عالية التردد15,16. كما تفتقر منطق الجدولة الحالي إلى الاستكشاف المتعمق لسلوك المهام التاريخية وأنماط تغيرات حالة الموارد، وهو غير قادر على تقديم تنبؤات واستنتاجات استراتيجية دقيقة للمستقبل17,18. وتستجيب استراتيجية الجدولة في النظام ببطء للمهام المفاجئة والتغيرات المؤقتة في الموارد، مما يؤثر على الاستدامة العامة للعملية19,20. لذا أصبح بناء نظام جدولة يتميز بالقدرة التنبؤية والمرونة والاستقرار مطلباً تقنياً أساسياً في التطبيقات العملية. ويتطلب ذلك أن يمتلك النموذج قدرات إدراك للمعلومات عالية الأبعاد، وذاكرة تسلسلية، وقدرات على نقل الاستراتيجيات، مع الحفاظ على اتخاذ قرارات قوية وتوازن الموارد في بيئة متعددة المهام، مما يتيح تنسيقاً ذكياً ومثاليًا لجدولة أنشطة النقابة.
اقترحت دراسات عديدة حلولاً متنوعة لمشكلة الجدولة الديناميكية. ومن بين هذه الحلول، أظهر الجمع بين التعلم العميق والتعلم التعزيزي قدرات قوية على التكيف والتحسين. حيث استخدم بعض الباحثين شبكات LSTM (الذاكرة قصيرة المدى المطولة)21,22 لنمذجة بيانات السلاسل الزمنية ودمج استراتيجيات التعلم التعزيزي لتحسين سلوك الجدولة، مما حقق نتائج معينة. وهناك نوع آخر من الأبحاث يستخدم طريقة 휴ريستية (heuristic) تعتمد على الخوارزمية الجشعة، مع التركيز على بساطة وكفاءة قرارات الجدولة، وهو ما يتناسب مع السيناريوهات ذات القواعد الواضحة23,24. كما استكشفت دراسات أخرى تطبيق شبكة Q العميقة (DQN) في الجدولة، محققة استراتيجيات محسنة من خلال تقريب دالة القيمة25,26. ومع ذلك، تعاني هذه الطرق من مشكلات مثل عدم كفاية التقاط الاعتمادات طويلة المدى، وعدم استقرار تحديثات الاستراتيجية، وتأخر الاستجابة الكبير عند مواجهة سيناريوهات أنشطة مشتركة معقدة ومتغيرة، مما يجعل من الصعب تلبية احتياجات الجدولة للمهام عالية الكثافة والمتنوعة. وبناءً على ذلك، أصبح كيفية بناء خوارزمية جدولة تتمتع بقدرات كفؤة في استخراج الميزات وتحديث مستقر للاستراتيجية بمثابة عنق زجاجة يتطلب التغلب عليه في الأبحاث الحالية.
في أبحاث جدولة المجالات المتعددة، تم تطبيق بنية Transformer على مهام متنوعة للتنبؤ بالسلاسل الزمنية وتحسين الجدولة بفضل آلية الانتباه الذاتي متعدد الرؤوس، والتي تلتقط بفعالية التبعيات الزمنية طويلة المدى27,28. وعند دمجها مع خوارزمية PPO في التعلم التعزيزي، يتم تحديث الاستراتيجية بشكل مستقر وفعال من خلال تقليم دالة الهدف، وقد أظهر هذا النهج أداءً جيدًا في مجالات مثل التحكم في الروبوتات والتصنيع الذكي29,30,31. وقد حاولت بعض الدراسات دمج Transformer مع التعلم التعزيزي لجدولة الموارد المعقدة32. ومع ذلك، في الجدولة الديناميكية لأنشطة النقابة، هناك دراسات قليلة تتناول الجمع بين أنواع الأنشطة المتنوعة وقيود الموارد المعقدة. واستخدمت بعض الدراسات الشبكات العصبية الرسومية لنمذجة العلاقة بين الموارد والمهام، مما أدى إلى تحسين دقة تحديد التعارضات33,34. كما قام بعض الباحثين بتحسين جدولة الموارد بناءً على الحوسبة الطرفية لتعزيز كفاءة وأداء النموذج35,36. بيد أن هذه الأساليب لا تزال ذات قدرات نمذجة محدودة للسياق الزمني. وبناءً على ذلك، تقترح هذه الورقة استخدام Transformer لترميز تسلسلات الأنشطة التاريخية وحالات الموارد، مدمجًا مع شبكة سياسة PPO، لتحقيق إدراك عالٍ لمخاطر التعارض وتحديث مستقر لاستراتيجيات الجدولة لمواجهة الاحتياجات المتغيرة والمعقدة لجدولة أنشطة النقابة.
بحثت دراسات أحدث في تحسين جدولة الموارد من منظورات مختلفة، مثل دمج الأجهزة الافتراضية (VM) لتحقيق كفاءة الطاقة في الحوسبة السحابية37، وخوارزميات المصادقة في الشبكات الخلوية38، وتعزيز دمج الأجهزة الافتراضية مع الهجرة المباشرة من أجل حوسبة سحابية مستدامة39، وتحسين حركة المرور باستخدام التنبؤ بفترات الانتظار والخوارزميات التطورية40، والتخزين السحابي القائم على سلسلة الكتل (blockchain) مع تحسين معزز والحفاظ على السلامة41. ورغم أن هذه الأعمال تقدم رؤى قيمة حول خوارزميات تخصيص الموارد وتحسينها، إلا أنها تستهدف بشكل أساسي البنية التحتية السحابية، أو الاتصالات، أو أنظمة التخزين، ولا تعالج تحديداً قيود الأنشطة متعددة الأنواع، وصراعات موارد الموظفين والمواقع الديناميكية، ومتطلبات الجدولة في الوقت الفعلي المتأصلة في إدارة أنشطة النقابات. ويؤكد هذا التمايز بشكل أكبر الحاجة إلى إطار جدولة مخصص ومصمم ليتناسب مع السياق التنظيمي لأنشطة النقابات.
غالبًا ما تفشل طرق الجدولة الحالية لأنشطة النقابات في استيعاب التبعيات المكانية والزمانية طويلة المدى والحفاظ على استقرار السياسات وسط التغييرات الديناميكية، مما يؤدي إلى بطء أوقات الاستجابة وزيادة تضارب الموارد. ولمعالجة هذه الفجوات البحثية، تقترح هذه الدراسة نموذجًا لتحسين الجدولة يقوم على مبدأ أن آلية الانتباه متعدد الرؤوس في نموذج Transformer يمكنها ترميز التسلسلات التاريخية بفعالية للتنبؤ بالتضاربات، وأن تحسين السياسة القريبة (PPO) مع هدف مقصوص يضمن تحديثات سياسة مستقرة وتكيفية. وبشكل محدد، يتم تطبيق Transformer لترميز تسلسلات حالات الأنشطة والموارد، واستخراج الميزات المكانية والزمانية الرئيسية لتعزيز الاستشراف المسبق للتضاربات، مع دمج PPO لتوليد إجراءات جدولة فعالة وتحديثات مستقرة. كما صُممت مصفوفة قيود موحدة لرسم خرائط الأنشطة والموظفين والقاعات، مما يحسن التعرف على التبعيات المعقدة. وتشمل الابتكارات الجوهرية لهذا العمل ما يلي: (1) دمج الترميز الزمني والتعلم التعزيزي خصيصًا لجدولة أنشطة النقابات؛ (2) آلية انتباه مدركة للتضاربات تعطي الأولوية لإدراك المخاطر؛ (3) تحديث تقليمي مع تصحيح دالة الميزة لضمان متانة الاستراتيجية في حالات التزامن العالي. وتؤكد التجارب المكثفة تحت كثافات وتعقيدات مهام متنوعة تفوق النموذج على الطرق الحالية من حيث سرعة الاستجابة، واستغلال الموارد، والاستقرار، مما يوفر حل جدولة ذكيًا وعمليًا وقابلًا للتوسع لإدارة أنشطة النقابات.
يوضح الشكل 1 بنية نظام جدولة أنشطة الاتحاد الذي يدمج بين نمذجة السلاسل الزمنية والتعلم التعزيزي. تقوم طبقة الإدخال بدمج جداول الأنشطة، وتوافر الموارد، ومعلومات النوافذ الزمنية للموظفين، وتنشئ مصفوفة علاقات تعارض متعددة الأبعاد بين المهام والموارد عبر وحدة الرسم البياني للقيود. يقوم المحول (transformer) بترميز انتباه متعدد الرؤوس عبر التسلسل التاريخي لحالات الأنشطة والموارد، مما ينتج حالات خفية ذات تبعيات زمنية. وتستخدم وحدة السياسة نتائج الترميز لتوليد توزيعات الإجراءات وتقدير الحالة، ثم تنفذ قرارات الجدولة بعد أخذ عينات من الإجراءات. يتم تغذية نتائج التنفيذ مرة أخرى إلى البيئة، مما يؤدي إلى تحديث حالة الموارد وتوليد مكافآت فورية. وبناءً على ذلك، تقوم وحدة التحسين بإنشاء دالة هدف للقص (clipping objective function)، وتقييم دالة الميزة، وتصحيح تقدير شبكة القيمة للحد من انحراف السياسة وضمان تحديثات مستقرة لسلوكيات الجدولة. وبذلك تتشكل حلقة بيانات مغلقة بين الوحدات لتحقيق إدراك عالي الحساسية لتعارضات الموارد وتحديثات استراتيجية تكيفية في البيئات الديناميكية، مما يعز قدرة الاستجابة الذكية وكفاءة تخصيص الموارد لنظام جدولة أنشطة الاتحاد في السيناريوهات متعددة المهام وعالية القيود.
نمذجة سيناريوهات جدولة أنشطة النقابات
تُنظم جميع طلبات الأنشطة في نظام الجدولة ضمن تسلسلات جدولة منفصلة بناءً على خطوات زمنية. ويتم تعريف كل نشاط بأوقات بدء وانتهاء محددة، وفئات الموارد، والمراحل، ومستويات الأولوية. كما يتم نمذجة حالة استخدام الموقع كمصفوفة زمنية ثنائية الأبعاد، حيث يمثل المحور الأفقي وحدة الزمن الموحدة، ويمثل المحور الرأسي رقم المورد المكاني. وتُحدد حالة المورد كـ "متاح" أو "مشغول"، مما يشكل خريطة توزيع أولية للموارد ذات بنية استاتيكية. كما يتم توسيع معلومات جدولة الموظفين في بُعد (الهوية-الزمن) لإنشاء متجه نافذة زمنية مستمر، يسجل كل منها حالة الموظف من حيث (تنفيذ المهمة أو الخمول) ورقم القسم. وتُدمج جميع معلومات المدخلات في بنية تنسور (Tensor) ثلاثية الأبعاد، حيث يرمز $t$ إلى الخطوة الزمنية المنفصلة، ويرمز $r$ إلى عدد كيانات الموارد، ويرمز $a$ إلى رمز سمة استخدام المورد المقابلة (مثل ما إذا كان مشغولاً، أو رقم النشاط، أو أولوية الاستخدام، وما إلى ذلك). وتسمح هذه البنية لنظام الجدولة بقراءة تكوين الموارد في أي وقت، مما يضمن تمثيلاً موحداً لأنواع حالات الموارد المختلفة.
بعد ربط معلومات المهمة بالنموذج، يتم تعيين متجه كثافة المهمة بناءً على أولوية النشاط وفترة استخدام الموارد. ويتم تحديد مجموعة المهام التي قد تسبب تعارضاً من خلال طريقة الكشف عن تداخل النافذة الزمنية. تُحوَّل مجموعات التعارض إلى مجموعات من العقد، وتُنشأ مجموعات الحواف بناءً على أنواع الموارد والفترات المشتركة لتمثيل التبعيات الضمنية بشكل صريح. يحتوي مخطط المهام النهائي المُنشأ على معلومات حدودية حول التسلسل الزمني، أو تداخل الموارد، أو تعارض القيود، مما يوفر أساساً هيكلياً لعمليات الكشف عن التعارض اللاحقة وتوليد استراتيجية الجدولة. ويحتفظ هذا الهيكل بالطبيعة الديناميكية لجدولة المهام والتغيرات المستمرة في حالة الموارد، كما يدعم الإدراك اللحظي للتغيرات في قيود الجدولة.
يستخدم اكتشاف التعارض المناطق المتداخلة المتناثرة لأبعاد الوقت والموارد في بنية التنسور كشروط أولية للحكم. ويقوم بتنفيذ معالجة ترميز العلاقات الساكنة لأزواج المهام ذات أهداف الجدولة المتداخلة. كما يبني بنية رسم بياني G=(V,E,C)، حيث تمثل V مجموعة العقد النشطة، وتمثل E الحواف الناتجة بناءً على تعارضات الموارد، و C هي مصفوفة ترميز وزن التعارض لهذه الحواف. وقد تم تعريف دالة وزن التعارض على النحو التالي:
(1)
ومن بين هذه الرموز، يمثل Cuv وزن التعارض بين النشاطين u وv؛ ويمثل u وv مؤشري النشاط؛ بينما يمثل R العدد الإجمالي لأنواع الموارد؛ ويشير δuvr ∈ {0,1} إلى ما إذا كانت الفترات الزمنية للنشاطين u وv متداخلة على المورد r؛ ويمثل ωr وزن حساسية التعارض للمورد r. وتجري هذه الدالة مجموعاً موزوناً لكثافات التعارض، مع مراعاة الاختلافات في أهمية تعارضات الموارد بالنسبة لنتائج الجدولة، مع الاحتفاظ بتعبير كمي عن توزيع قوة التعارض.
يتم تحويل هيكل مخطط التعارض المذكور أعلاه إلى مصفوفة حدود القيود من خلال تمثيل المصفوفات المتناثرة. ويحتوي كل عنصر في المصفوفة على درجة تعارض الموارد. تدمج هذه المصفوفة في عملية اتخاذ قرار الجدولة لتحديد ما إذا كان يمكن جدولة المهام بالتوازي، بينما تكمن منطق حماية الإجراء في شبكة السياسات. وللتعامل مع تجميع الأنشطة الدورية وتدفقات المهام عالية الكثافة، تم تنفيذ آلية تحديث ديناميكية لمراقبة التغييرات في حالة المهام وتعديل محتوى المصفوفة في الوقت الفعلي عند تحرير الموارد أو إضافتها، مما يضمن استمرارية واتساق حدود الجدولة طوال تطور المهام.
يتيح تطبيق هيكل مخطط التضارب هذا لنظام الجدولة نمذجة الاختناقات المحتملة في الموارد وأنماط تداخل المهام بصرياً، مما يحسن كفاءة تحليل الفصل في شبكة القرار لسيناريوهات القيود المعقدة. ولم يعد سلوك الجدولة يعتمد على المطابقة المنطقية القائمة على القواعد، بل يسعى بدلاً من ذلك إلى إيجاد المسار الأمثل في حيز القيود، مما يعزز القدرة على الموازنة الديناميكية بين تضاربات الموارد المحلية وخريطة المهام الشاملة. ويمكن للنظام الحفاظ على استقرار الجدولة وترابط المهام في بيئة تتذبذب فيها الموارد، ويتم فيها إضافة المهام أو إزالتها بشكل متكرر.
الشكل 2 يوضح مخطط هيكل الشبكة بناءً على علاقة وزن تعارض المهام. تمثل كل عقدة في الشكل مهمة مطلوب جدولتها، وتشير الخطوط بين العقد إلى تعارضات استخدام الموارد. يعكس سمك الحافة وزن التعارض؛ فكلما كان التعارض أكثر حدة، زاد سمك الخط. يدمج حساب الوزن تداخل الموارد ويجمع بين حساسية التعارض لمختلف الموارد لتكوين كثافة تعارض مركبة بين المهام. ويكشف هيكل الرسم البياني أن بعض المهام تشكل مناطق ذات اتصال كثيف، مما يشير إلى منافسة كبيرة على استخدام الموارد. وتعد ظاهرة تجميع التعارضات المحلية هذه المصدر الرئيسي لاختناقات الموارد وتأخير المهام في عملية الجدولة، وبناءً عليه، يمكن لخوارزمية الجدولة تحديد أهداف وساطة الأولويات. يعتمد ترتيب العقد استراتيجية تخطيط موجهة بالقوة (force-directed layout) لتجميع المهام ذات التعارض العالي تلقائياً، مما يمكن نظام الجدولة من تحديد مجموعات المهام الرئيسية وتحسين توزيع الاستراتيجية، وبالتالي تعزيز تماسك الجدولة الشامل وتنسيق الموارد.
ترميز تسلسل الحالة التاريخي
بناءً على مخطط التعارض ومصفوفة القيود التي تم إنشاؤهما، تتمثل الخطوة التالية في ترميز التسلسلات التاريخية للأنشطة وحالات الموارد، بحيث يمكن استخراج الأنماط الزمنية الكامنة وراء هذه القيود لاتخاذ القرارات لاحقاً. تكون المعلومات الأساسية في سيناريو الجدولة من طلبات الأنشطة، وتغييرات حالة الموارد، وسجلات ملاحظات المهام. وتشكل هذه المعلومات سلاسل زمنية غير متجانسة متعددة، تقابل سمات مثل النقاط الزمنية للأحداث، ومعرفات استخدام الموارد، وحالة تنفيذ النشاط. ولتوحيد هيكل المعالجة، يتم ترميز كل نوع من المدخلات كتسلسل متجه متساوي الطول، ويتم إنشاء فهرس زمني موحد لضمان محاذاة الحالة تحت المزامنة الزمنية. يتم تمثيل وحدة الإدخال في كل لحظة من خلال دمج ثلاث مجموعات من متجهات السمات: يمثل متجه سمات النشاط نوع المهمة والأولوية ورقم المرحلة؛ ويسجل متجه سمات الموارد إشغال الموارد الحالي، والسعة المتبقية، وموضع النافذة المتاحة؛ بينما يصف متجه سمات الملاحظات ما إذا كانت المهمة قد نفذت بسلاسة في اللحظة السابقة، وما إذا كان قد حدث تعارض في الموارد أو واقعة تأخير.
يتم تحويل جميع السمات خطياً ورسمها في نفس الفضاء البعدي للحصول على مصفوفة تضمين معيارية X ∈ ℝT×d، حيث يمثل T عدد الخطوات الزمنية ويمثل d بُعد التضمين الموحد. وللحفاظ على البنية الزمنية، تُضاف مصفوفة الإدخال عنصراً بعنصر إلى مصفوفة ترميز الموضع P لتكوين إدخال مدرك للموضع:
Z = X + P (2)
Z هو تسلسل الإدخال النهائي، والذي يعمل كمدخل لآلية الانتباه اللاحقة. يستخدم تصميم ترميز الموضع قالب دالة جيب وجيب تمام ثابتة لمنع تسرب المعلومات المستقبلية وضمان الالتزام الصارم بالقيود السببية أثناء الترميز. وتتيح البنية المذكورة أعلاه للنموذج إدراك خصائص المهمة، وحالة الموارد، والموقع الزمني في آن واحد. كما أنها تمتلك أساساً كاملاً لذاكرة الحالة، مما يوفر بنية موحدة وعالية الدقة لآلية الانتباه اللاحقة.
تعمل وحدة الانتباه على معالجة التسلسل المدخل لالتقاط العلاقات المحتملة بين خطوات زمنية متعددة. وتُستخدم مجموعات متعددة من رؤوس الانتباه لمعالجة التسلسل بشكل منفصل، مما يعزز حساسية النموذج لأنواع مختلفة من مسارات تطور الحالة. يقوم كل رأس انتباه بإنشاء مصفوفة استعلام Q، ومصفوفة مفتاح K، ومصفوفة قيمة V من التسلسل المدخل، ثم يحسب مصفوفة توزيع الأوزان، وينتج تمثيلاً موزوناً. وتكون مخرجات الانتباه أحادي الرأس كما يلي:
(3)
دك هو عدد أبعاد الميزات لكل رأس. وفي هذه المعادلة، سك⊤ يمثل التشابه بين العزوم، √يبدو أنك أرسلت حرفاً واحداً فقط ("d"). يرجى تزويدي بالنص الإنجليزي الكامل الذي ترغب في ترجمته، وسأقوم بتحويله إلى لغة عربية علمية دقيقة وفقاً للمعايير المهنية المحددة.ك تُستخدم لتحقيق الاستقرار العددي، وتضمن دالة softmax تطبيع الأوزان. وتركز رؤوس الانتباه المختلفة على تركيبات متنوعة من الخطوات الزمنية، كما أن التبعيات الديناميكية التي تلتقطها تكون متنوعة أيضًا، مما يساعد في الكشف عن قواعد ضمنية مثل بوادر صراعات المهام، وأنماط استهلاك الموارد، واتجاهات التغذية الراجعة غير الطبيعية.
يتم دمج جميع مخرجات رؤوس الانتباه وتمريرها عبر طبقة تحويل خطي لإنشاء تسلسل ترميز موحد، والذي يعمل كمدخل للحالة لشبكة توليد استراتيجية الجدولة. يدمج هذا التسلسل مسار سلوك المهمة، وخصائص تغيير الموارد، وتأثير انحرافات التنفيذ السابقة في نافذة الجدولة الحالية، مما يعالج بفعالية مشكلة الاعتماد التاريخي العالي في سلوك الجدولة والتعبير المحدود للميزات. كما تم دمج وحدات الاتصال المتبقي وتطبيع الطبقة في طبقة مخرجات الترميز لتعزيز استقرار التدريب وقدرات الاحتفاظ بالتعبير في الشبكة العميقة.
لا يحتفظ تسلسل حالة الحالة المخفية للمخرجات بمعلومات التطور الزمني فحسب، بل يستجيب أيضاً للتغييرات الناشئة عن المهام المفاجئة أو عدم تطابق الموارد المؤقت، مما يظهر قدرة عالية على التكيف. ويتجنب هذا التصميم الهيكلي التحديد الصريح للقواعد، مما يتيح نمذجة منظمة لبيئات الجدولة الديناميكية، ويدعم وحدات السياسة اللاحقة في توليد حلول جدولة تتميز باتساق عالمي وقدرة على التكيف محلياً في ظل ظروف متعددة الأهداف.
توليد استراتيجية الجدولة الديناميكية
تُغذى تسلسلات الحالة الخفية المرمزة، والتي تدمج كلاً من التبعيات الزمنية ومعلومات تضارب الموارد، في شبكة السياسات لتوليد إجراءات جدولة تتكيف مع البيئة الحالية. يُستخدم تسلسل الحالة الخفية الناتج عن وحدة الترميز كمدخل لشبكة استراتيجية الجدولة. وتشكل مجموعة متجهات الحالة في كل لحظة تعبير رصد البيئة الحالية، حيث تغطي تطور خصائص المهام، واتجاهات استخدام الموارد، ومسارات التغذية الراجعة التاريخية. يكون بُعد تمثيل الحالة وطول النافذة الزمنية ثابتين، ويتم التقاط استمرارية تغيرات الحالة عبر آلية تحديث انزلاقية. وقبل إرسال متجهة الحالة إلى شبكة السياسات، يتم تطبيعها وإعادة تنظيم ميزاتها لضمان احتفاظ المدخلات بتوزيع عددي مستقر في الفضاء عالي الأبعاد، مما يقلل من انفجار التدرج وتقلبات التقارب.
تعتمد بنية شبكة السياسة على وحدة مخرجات ذات فرعين، حيث يقوم أحد الفرعين بتوليد توزيع الإجراءات، بينما يقوم الآخر بإخراج تقدير دالة قيمة الحالة. وتتكون مساحة الإجراءات من جميع المهام القابلة للجدولة والموارد القابلة للتخصيص. وتقوم آلية فحص المرشحين بتصفية تركيبات العمليات غير القانونية أو الزائدة عن الحاجة لتشكيل مجموعة محدودة وقانونية من الإجراءات. ويقوم فرع السياسة بإخراج توزيع احتمالي π(at|st)، حيث يمثل at إجراء الجدولة عند الخطوة الزمنية، وst هو مدخل الحالة الحالية. وتُستخدم استراتيجية أخذ عينات غاوسية معيارية أو استراتيجية أخذ عينات softmax لاختيار الإجراءات من التوزيع لغرض الجدولة الفعلية. أما المخرج الآخر فهو تقدير دالة قيمة الحالة، والذي يمثل توقع المكافأة على المدى الطويل عند الحالة المعطاة، ويُستخدم لتقييم السياسة وتحديثها.
في شبكة السياسات، تطبق الطبقة الخفية دوال التنشيط والتطبيع الدفعي لتحسين القدرة التعبيرية غير الخطية وتسريع تقارب الشبكة. وفي عملية صنع القرار، تُعتبر أولوية التنفيذ، وتكلفة جدولة الموارد، والأداء التاريخي للمهام المختلفة عوامل انتباه، وتُطبق على آلية اختيار الإجراء عبر مصفوفة أوزان محددة لتشكيل إطار عمل مخرجات سياسة قابل للتعديل تكيُّفياً. يتجنب هذا التصميم الاعتماد على قواعد ثابتة، مما يعز مرونة الاستراتيجية في التعامل مع النزاعات المفاجئة والاختناقات الهيكلية.
تعتمد استراتيجية الجدولة على آلية أخذ عينات عشوائية لإنشاء تسلسل الإجراءات الفعلي. في كل دورة جدولة، يتم سحب إجراء قابل للتنفيذ من توزيع الإجراءات الحالي، ثم يتم تحديث حالة الموارد وعلامة عقدة المهمة. وبعد تنفيذ الإجراء، يحسب النظام مكافأة التغذية الراجعة الفورية بناءً على التغييرات في الموارد ونتائج تقدم المهمة لقياس تأثير جولة الجدولة هذه على الهدف العام. ويراعي تصميم المكافأة أبعاداً متعددة، بما في ذلك معدل إتمام المهام، وكفاءة استخدام الموارد، ودرجة كبح التعارضات؛ حيث توفر هذه المكافأة تغذية راجعة لوحدة تحديث الاستراتيجية من خلال مؤشرات شاملة.
تقوم عملية الجدولة بأكملها ببناء سلسلة قرار ماركوف وتستخدم طريقة أخذ عينات المسار التجريبية لتسجيل تسلسل الحالة-الإجراء-المكافأة، والذي يُرمز له بالرمز (st, at, rt, st+1). ويعتمد تحسين الاستراتيجية على بناء دالة الميزة، حيث يتم تعريف تقدير الميزة في الصيغة التالية:
(4)
تمثل At قيمة الميزة، و rt هي المكافأة اللحظية الحالية، و γ هو عامل خصم المكافأة، بينما تمثل V(st) و V(st+1) مخرجات دالة قيمة الحالة في الحالتين الحالية والتالية، على التوالي. تعكس دالة الميزة درجة تفوق الإجراء الحالي بالنسبة للأداء المتوسط للاستراتيجية، وتُستخدم لتوجيه تحسين الاستراتيجية اللاحق. فإذا كانت At > 0، فهذا يعني أن الإجراء الحالي أفضل من التوقع المتوسط، وبالتالي يجب زيادة احتمالية حدوثه؛ وخلاف ذلك، يجب تقليل الميل إلى اختياره.
خلال عملية تحديث الاستراتيجية، ولتجنب تذبذبات الاستراتيجية الناتجة عن سعات التحديث المفرطة، يتم تطبيق آلية بتر لتوزيع الهدف للحد من نطاق التغيير بين الاستراتيجيتين الجديدة والقديمة، مما يحافظ على استمرارية واستقرار مخرجات الشبكة. ويتم إنشاء اقتران وثيق بين توزيع الإجراءات ومكافأة التغذية الراجعة، مما يسمح للاستراتيجية بالاستجابة الفورية للتغيرات في القيود المعقدة. وتحافظ هذه الآلية على استقرار اتخاذ القرار والجدولة العقلانية للموارد في الحالات التي تتغير فيها المهام بشكل متكرر أو يحدث عدم تطابق مفاجئ في الموارد، مما يتجنب بفعالية مشكلات مثل التخصيص المزدوج، أو ازدحام الموارد، أو تراكم طوابير المهام. ويمكن لنظام الجدولة الحفاظ على حالة تشغيل أفضل عبر كثافات المهام المتغيرة ونقص الموارد، مما يظهر قدرات تكيفية قوية.
تكرار الاستراتيجية وآلية التحديث المستقرة
لضمان بقاء استراتيجيات الجدولة التي تم إنشاؤها مستقرة وعدم تدهورها عبر جولات التدريب المتكررة، يتم تقديم آلية تحديث تكرارية مع تقليم وتصحيح الميزة في هذا القسم الفرعي. يتم تحديد فاصل تحديث القطع بين الاستراتيجيات القديمة والجديدة، وتُستخدم دالة هدف التقليم للحد من انحراف الاستراتيجية لمنع حدوث صدمات في الجدولة أثناء عملية تحديث الاستراتيجية. كما يتم تصحيح شبكة التقييم بالاشتراك مع دالة الميزة لتحسين دقة الجدولة طويلة المدى.
يكون توزيع احتمالية مخرجات الإجراء لشبكة السياسة عرضة لتقلبات حادة خلال تكرارات الجدولة المستمرة، مما قد يؤدي إلى سلوك غير مستقر أو تخصيص غير منظم للموارد. وللتخفيف من صدمة الجدولة الناتجة عن انحراف السياسة، تم تصميم فاصل تحديث مبتور للتحكم في نطاق التغيير بين السياسات الجديدة والقديمة، كما تم بناء حد تقييدي لتحسين دالة الهدف. يتم تسجيل احتمالية السياسة التاريخية في جولة أخذ العينات، ويتم بناء حد النسبة باستخدام احتمالية السياسة الحالية. وقد تم تحديد هدف تحديث السياسة على النحو التالي:
(5)
هنا، ترمز gt = πθ(at|st)/πθold(at|st) إلى نسبة الاحتمالية بين السياسات الجديدة والقديمة؛ وε هي عتبة القص التي تحدد نطاق تحديث السياسة. وعندما تتجاوز النسبة هذا الحد، تُستخدم قيمة القص بدلاً من ذلك لمنع الاستراتيجية من إنتاج تدرجات مفرطة ناتجة عن عينات متطرفة، مما يضمن بقاء تعديل معاملات الشبكة ضمن النطاق المحدد مسبقاً. يعمل هذا الهيكل على تقييد نطاق التغييرات في الاستراتيجية المخرجة ديناميكياً لكل جولة جدولة، مما يحافظ على سلاسة واتساق مخرجات الاستراتيجية في ظل توزيعات المهام الكثيفة، ويقلل بشكل كبير من معدل تذب سلوك الجدولة.
يتم تعزيز دالة هدف السياسة ببنود التنظيم ومكافأة الأنتروبيا أثناء عملية التحديث لتعزيز تنوع توزيع الإجراءات وكبح التقارب المبكر. وتستخدم كل جولة من تحديثات السياسة دفعات متعددة من عينات مسار الخبرة للتدريب المتدحرج، مما يحافظ على اتساع التغطية في فضاء الحالة. وعند مقارنة توزيع الاحتمالات لتسلسل الإجراءات المخرجة قبل التحديث وبعده، يتم حساب معدل انحراف التوزيع، ويقوم حد فاصل صارم بتصفية نطاق الاضطراب المقبول للسياسة. توفر هذه الآلية تحكماً في الحدود لنقل سياسات الجدولة عبر الدورات، مما يؤدي إلى كبح الإفراط في التخصيص الناتج عن التغيرات الجذرية في حالة الموارد.
تعتمد تحديثات الاستراتيجية على تقييم الحالة الذي توفره دالة القيمة. ويمكن أن تؤثر الانحرافات في تقدير قيمة الحالة بشكل مباشر على دقة دالة الميزة، مما يؤدي بالتالي إلى تغيير اتجاه تكرار الاستراتيجية. ولتحسين دقة التقييم، تم بناء آلية تراجع متعددة السلاسل الزمنية، واستُخدمت القيمة التراكمية المخصومة للمكافآت المستقبلية لتصحيح قيمة الحالة الحالية. وتعتمد مكافأة التراجع على هيكل تقدير الميزة المعمم (GAE)، والذي يُعرَّف على النحو التالي:
(6)
Ât هي قيمة الميزة المصححة؛ وλ هو معامل توازن التتبع الخلفي؛ وrt+l تمثل المكافأة الفورية للخطوة (t+l)؛ وV(st+l) هي قيمة الحالة التي تخرجها شبكة التقييم. يدمج هذا الهيكل بين التغذية الراجعة الفورية قصيرة المدى وتوقعات الحالة طويلة المدى لتصحيح الانحرافات في تنبؤات استجابة الاستراتيجية لتضاربات الموارد المستقبلية، وأحمال الذروة، وتراكم المهام. وتتحكم λ في عمق التتبع الخلفي وتتعدل تلقائيًا خلال فترات التقلبات الديناميكية الحادة في الموارد لتعزيز متانة استجابة شبكة التقييم للأحداث المفاجئة.
تتيح البنية المعتمدة على الزمن ومتعددة المقاييس والمدمجة في دالة الميزة لشبكة التقييم نمذجة اتجاهات الموارد على المدى الطويل. وفيما يخص الكشف عن انحراف مخرجات السياسة، يُستخدم مؤشر اتساق سلوك السياسة لتقييم ما إذا كانت الشبكة تظهر استجابة مفرطة لخطأ التقييم. وتعمل حدود المتبقي للفرق في التغذية الراجعة على مراقبة سلوك تحديث السياسة، كما يتم تصحيح هدف التدريب وسعة تحديث أوزان دالة القيمة ديناميكيًا. ويتم تحسين شبكة القيمة وشبكة السياسة بشكل مشترك لضمان عدم انحراف تقدير القيمة عن هدف إكمال المهمة، مع منع الجدولة عالية التردد من التقدير الخاطئ لحالة تعارض الموارد.
يمكن لآلية تحديث السياسة المستقرة هذه أن تحافظ بفعالية على إمكانية التحكم واتساق تحديثات سلوك السياسة في بيئة مهام ديناميكية عالية الأبعاد، مما يحسن كفاءة تغطية المهام ومرونة استخدام الموارد، ويشكل هيكل جدولة ذكيًا تكراريًا ومستمرًا. ويمنع سلوك الجدولة السقوط في المثالية المحلية أثناء التطور طويل الأمد، ويعز القدرة العامة على التكيف مع التغيرات في أنماط المهام والتقلبات في دورات الموارد.
يوضح الشكل 3A اتجاه قيمة الدالة الهدف كدالة في عدد تكرارات التدريب تحت ظروف عتبات بتر مختلفة. يمثل المحور الأفقي عدد تكرارات التدريب، بينما يمثل المحور الرأسي القيمة العددية للدالة الهدف المقصوصة. تم تعيين قيمة ε على 0.1 و0.2 و0.3، مما يمثل درجات مختلفة من قوة التحكم في انزياح السياسة. والمنحنى المقابل لقيمة ε الأصغر يتقلب بشكل أقل، وتظل الدالة الهدف مستقرة. فعندما تكون ε = 0.1، تتراوح قيمة الدالة الهدف الإجمالية بين 0.8 و1، مما يظهر تدرج واستقرار تحديث الاستراتيجية. ومع ذلك، تؤدي قيمة ε الأكبر إلى تقلبات ملحوظة؛ فعندما تكون ε = 0.3، تتراوح قيمة الدالة الهدف الإجمالية بين 0.65 و0.95، ويظهر منحنى الدالة الهدف سعة تذب أكبر، مما يعكس مخاطر الانحراف الشديد في عملية تحديث الاستراتيجية. وكلما كانت العتبة أصغر، كانت الاستراتيجية أكثر استقراراً، وهو ما يناسب بيئات الجدولة ذات القيود العالية. ويوضح الشكل 3B التغيرات في تقدير الميزة المعمم تحت معاملات توازن تراجع مختلفة. تم تعيين λ على 0.8 و0.9 و1.0 على التوالي للتحكم في عمق تراجع المكافآت المستقبلية. ويظهر المنحنى أنه كلما ارتفعت قيمة λ، قل تذب GAE، وأصبح الاتجاه طويل المدى أكثر سلاسة، وبدقة أكبر في التقاط التأثير المحتمل لسلوك الجدولة بعد خطوات متعددة. أما المنحنى الذي تبلغ فيه قيمة λ 0.8 فيظهر تقلبات دورية ملحوظة، مما يشير إلى أنه أكثر حساسية للمكافآت الفورية وأكثر ملاءمة للمهام القصيرة والمفاجئة. وفي المقابل، تركز قيمة λ التي تبلغ 1.0 بشكل أكبر على نمذجة الاتجاه طويل المدى وتكون مناسبة لسيناريوهات المهام الدورية.
تحليل التعقيد الحسابي والقابلية للتوسع
يتم تحديد التعقيد الحسابي لإطار عمل Transformer-PPO المقترح من خلال مكونين رئيسيين: مشفر Transformer وتحسين سياسة PPO.
بالنسبة لمشفر المحول (Transformer encoder) الذي يحتوي على L من الطبقات، و H من رؤوس الانتباه، وبُعد تضمين d، وطول تسلسل إدخال T (النافذة الزمنية التاريخية)، فإن التعقيد الزمني لكل تمريرة أمامية هو O(L·T2·d + L·T·d2)، حيث ينشأ الحد T2 من آلية الانتباه الذاتي. وفي التنفيذ، تم تحديد L = 3، و H = 4، و d = 128، و T عند 100 خطوة زمنية، مما أدى إلى عبء حسابي يمكن إدارته. وبالنسبة للنوافذ التاريخية الأطول، يصبح الحد التربيعي T2 هو العامل المهيمن؛ ومع ذلك، من الناحية العملية، تتضمن جدولة أنشطة النقابات عادةً آفاقاً تاريخية محدودة (على سبيل المثال، نوافذ متحركة لربع سنة أو سنة واحدة)، ويمكن تعديل دقة الخطوة الزمنية لتحقيق التوازن بين الدقة والكفاءة.
بالنسبة لمكون PPO، تعد شبكة السياسة وشبكة القيمة عبارة عن مدركات متعددة الطبقات (MLPs) خفيفة الوزن (256 و 128 عصبونًا لكل طبقة خفية)، وتبلغ تعقيد الاستدلال فيها O(d·m)، حيث تمثل m عدد الوحدات الخفية، وهو أمر ضئيل مقارنة بمشفر Transformer. يتضمن تحديث السياسة أثناء التدريب عدة دورات من تحديثات تدرج الدفعات الصغيرة، بتعقيد O(B·E·d2)، حيث تمثل B حجم الدفعة، و E عدد دورات التحديث.
من حيث القابلية للتوسع، يظهر إطار العمل ثلاث خصائص إيجابية. أولاً، يمكن موازاة آلية الانتباه عبر الخطوات الزمنية، مما يسمح بتسريع فعال باستخدام وحدات معالجة الرسوميات GPU. ثانياً، لا يعتمد حجم النموذج على عدد الأنشطة أو الموارد، حيث يتم بناء مصفوفة القيود ديناميكياً لكل خطوة جدولة بدلاً من تضمينها كبارامترات ثابتة، وهذا يتيح نشر النموذج المدرب نفسه عبر اتحادات بمقاييس مختلفة دون الحاجة إلى إعادة التدريب. ثالثاً، بالنسبة للسيناريوهات ذات النطاق الواسع للغاية، يمكن تقليل طول النافذة التاريخية T وبُعد التضمين d كحل وسط، أو يمكن اعتماد متغير الانتباه المتناثر لتقليل التعقيد من O(T2) إلى O(T log T) أو O(T).
البيانات التجريبية
لتقييم أداء خوارزمية الجدولة الديناميكية Transformer-PPO المعروضة في هذا البحث بشكل شامل، استخدمت التجربة بيانات إدارة الأنشطة من اتحاد مؤسسي كبير على مدى السنوات الثلاث الماضية كمجموعة بيانات مرجعية. تحتوي مجموعة البيانات هذه على أكثر من 5,0 سجل نشاط، تشمل أنواعاً مختلفة، بما في ذلك الاجتماعات والتدريب والترفيه، مع معلومات الجدولة لعدة موارد، مثل القاعات والمعدات والموظفين. يفصل كل سجل وقت البدء والانتهاء للنشاط، ومتطلبات الموارد، والأولوية، وحالة التنفيذ الفعلية (بما في ذلك أحداث التعارض واستخدام الموارد). ولمحاكاة التغييرات الديناميكية في السيناريوهات الواقعية، تم تعزيز البيانات بنسبة 10% إضافية من المهام المفاجئة العشوائية وأحداث تغيير الموارد (مثل الإشغال المؤقت للموقع وتعديلات النافذة الزمنية للموظفين) للتحقق من قوة الخوارزمية في بيئة عالية عدم اليقين. يوفر تسلسل الحالة المستمر مدخلات مهيكلة لنمذجة التوقيت عبر Transformer وتدريب سياسة PPO. قارنت التجربة أداء الجدولة تحت كثافات وتعقيدات مهام مختلفة لضمان أن التقييم يغطي السيناريوهات النموذجية في التطبيقات الفعلية، كما تمت مقارنتها مع نموذج LSTM-PPO الشائع حالياً، ونموذج جدولة البحث الجشع (greedy search)، ونموذج جدولة سياسة DQN.
يتكون مشفر Transformer من 3 طبقات، تحتوي كل منها على 4 رؤوس انتباه، وبُعد تضمين يبلغ 128، وحجم طبقة خفية للتغذية الأمامية يبلغ 256. وتتشارك شبكة السياسة وشبكة القيمة في مخرجات Transformer نفسها كمدخلات، ثم تتفرعان إلى مدركين متعدد الطبقات (MLPs) منفصلين. يحتوي كل MLP على طبقتين خفيتين تضمّان 256 و128 عصبوناً على التوالي، مع استخدام دالة التنشيط ReLU. وقد تم تهيئة جميع الطبقات الخطية باستخدام تهيئة Xavier الموحدة.
المحسن المستخدم هو Adam بمعدل تعلم قدره 3 × 10-4، وحجم دفعة يبلغ 64، ومعامل إنتروبيا قدره 0.01. تم ضبط معامل القص ε الخاص بـ PPO على 0.2، وعامل الخصم γ = 0.9، وGAE λ = 0.95. يتم تدريب النموذج لمدة 5,0 حلقة، حيث تحتوي كل حلقة على ما يصل إلى 10 خطوة جدولة. ويُطبق قص التدرج بحد أقصى للمعايير يبلغ 0.5 لمنع انفجار التدرج. تم اختيار هذه المعلمات من خلال بحث شبكي أولي وهي تتوافق مع الممارسات الشائعة في مهام الجدولة القائمة على التعلم التعزيزي. تم تشغيل جميع التجارب على مسرع GPU واحد (بذاكرة 40 GB)، باستخدام Python 3.9 وإطار عمل للتعلم العميق (راجع جدول المواد).
الاتجاه الزمني لمخرجات الانتباه متعدد الرؤوس، وتعزيز المتبقي تحت التباين الزمني لميزات الترميز، وطبقات أولوية المهام
باستخدام سجل الجدولة الفعلي كمدخلات، يتم استخراج طلب المهام، وحالة استخدام الموارد، وحالة تنفيذ التغذية الراجعة في خطوات زمنية مستمرة، ويتم تضمين المعلومات متعددة الأنواع في فضاء ميزات موحد عبر التعيين الخطي والترميز الموضعي. تقوم آلية الانتباه متعدد الرؤوس بحساب الارتباطات الزمنية بين تسلسلات الميزات المختلفة بالتوازي وتنتج ثلاثة أنواع من تسلسلات أوزان الانتباه: المهام، والموارد، والتغذية الراجعة. يمثل كل نوع من الأوزان شدة انتباه النموذج للحالة المقابلة عند كل خطوة زمنية. وبعد التطبيع، يتم رسم منحنى اتجاه ليعكس تركيز الإدراك في طبقة الترميز وهيكل التغيير الديناميكي لأبعاد المعلومات المختلفة في سجل الجدولة. تكتمل هذه العملية بناءً على مسار التنفيذ الفعلي للأنشطة وسجل استخدام الموارد في سيناريو الجدولة.
يوضح الشكل 4 اتجاه الانتباه الديناميكي لآلية الانتباه متعدد الرؤوس (multi-head attention) على معلومات الحالة المختلفة في جدولة أنشطة الاتحاد. يمثل المحور الأفقي الخطوة الزمنية، مما يعكس التقدم المستمر لتسلسل الجدولة، بينما يمثل المحور الرأسي وزن الانتباه الطبيعي، والذي يتراوح بين [0,1]، وهو ما يعبر عن الأهمية النسبية للنموذج تجاه خصائص المهام، وحالة الموارد، وحالة التغذية الراجعة. يُظهر الانتباه لخصائص المهام ذروة واضحة حول الخطوة 15؛ ففي المرحلة المبكرة من الجدولة، يعطي النموذج الأولوية لالتقاط الخصائص الزمنية للمهام الرئيسية للتنبؤ بالتعارضات المحتملة واختناقات الموارد، مما يعكس الحساسية تجاه المخاطر في هذه المرحلة من جدولة الأنشطة. أما منحنى الانتباه لحالة الموارد فيظهر تقلبات دورية، وتتراوح أوزان الانتباه الإجمالية من 0.2 إلى 0.8، مما يعكس تتبع نظام الجدولة المستمر للتغيرات في إشغال الموارد، ودعم المعالجة المعقدة لمشاركة الموارد وتخصيصها، والاستجابة الفعالة للمنافسة الديناميكية على الموارد بين مهام متعددة متزامنة. ويزداد الانتباه تدريجياً لحالة التغذية الراجعة، حيث تظهر ذروة الوزن بالقرب من الخطوة 35، مما يسلط الضوء على اهتمام النموذج بالتغذية الراجعة لنتائج التنفيذ والحالات غير الطبيعية في المراحل المتوسطة والمتأخرة من الجدولة، وهو ما يساعد في تعديل الاستراتيجية للتعامل مع انحرافات الجدولة وتحسين متانة الجدولة العامة. يوضح هذا الاتجاه أن بنية الترميز التي تدمج آلية الانتباه متعدد الرؤوس يمكنها التقاط التغيرات الدقيقة في الميزات الزمنية وتعزيز قدرة استراتيجيات الجدولة على التكيف مع الموارد المتنوعة والاعتمادات المعقدة للمهام، مما يؤدي إلى تحسين الكفاءة والاستقرار العام للجدولة الديناميكية لأنشطة الاتحاد.
يتم معالجة تسلسل ترميز الحالة الخفية وبنية استجابة ميزات المهام. ويقوم جزء مقارنة الحالة ببناء مسارات انتشار الميزات قبل وبعد الاتصال المتبقي تحت نفس شرط الإدخال، ويرصد التطور الزمني للحالة الخفية عبر الخطوات الزمنية المتتالية، ويستخلص ميزات الاستقرار المحلي والاستمرارية العالمية لتحليل التطور السلس للتعبير عن الحالة أثناء نقل المعلومات. كما يتم استخلاص اتجاه استجابة أولوية المهام من مسار تنشيط الميزات عبر استراتيجيات أوزان الجدولة المختلفة. ومن خلال تتبع مستويات التنشيط لفئات المهام المختلفة بمرور الوقت، يتم رصد تأثير الضبط الديناميكي للنموذج على القدرة على تمييز المهام.
يوضح الشكل 5A اتجاه الحالة المخفية للنموذج قبل وبعد تطبيق آلية الاتصال المتبقي (residual connection). يمثل المحور الأفقي الخطوة الزمنية، ويمثل المحور الرأسي قيمة الحالة المخفية. يتذب المخرج الأصلي بدون اتصال متبقي بشكل واسع، مما يظهر عدم استقرار محلي واضح وانقطاعات في الاتجاه. ويمثل الخط الأزرق المتصل قيمة الحالة بعد تطبيق البنية المتبقية؛ حيث يظل الاتجاه العام مستقراً، وتنخفض التذبذبات بشكل ملحوظ، مما يشير إلى أن النموذج يحقق تخفيفاً للتدرج (gradient buffering) وتعزيزاً للميزات أثناء انتشار الحالة. وتؤكد هذه الظاهرة دور الآلية المتبقية في تحسين استقرار البنى ذات الاعتماديات طويلة المدى، وكبح تضاؤل المعلومات الناتج عن الطبقات الأكثر عمقاً بشكل فعال، وتعزيز القدرة التعبيرية المستمرة لتسلسلات الحالات التاريخية. أما الشكل 5B فيصور ديناميكيات تنشيط الميزات لثلاثة أنواع من المهام في سلسلة زمنية. يمثل المحور الأفقي الخطوة الزمنية، ويمثل المحور الرأسي قيمة تنشيط الميزة، مما يعكس الحساسية الزمنية واهتمام الاستراتيجية للمهام عند مستويات أولوية مختلفة. تظهر المهام ذات الأولوية المنخفضة اتجاهاً متناقصاً، حيث تنخفض قيمة تنشيط الميزة إلى أقل من 0.5 في المرحلة المتأخرة، مما يشير إلى أن النموذج يوليها اهتماماً مناسباً في المرحلة المبكرة من الجدولة، ثم يضعف استجابة الموارد تدريجياً بمرور الوقت؛ بينما تزداد خصائص المهام ذات الأولوية المتوسطة ببطء بمرور الوقت مع وجود تذبذبات دورية، مما يعكس قيام النموذج بإدراك وتتبع مرن لتقلبات الطلب الخاصة بها؛ أما المهام ذات الأولوية العالية فتحافظ على اتجاه تصاعدي مستمر بمرور الوقت، وتظل قيمة تنشيط الميزة دائماً فوق 2، مع مستوى تنشيط عالٍ ومستقر، مما يشير إلى أن النموذج يحافظ دائماً على درجة عالية من الاستجابة لهذه المهام. وتثبت هذه الاستجابة التفاضلية قدرة وحدة ترميز الحالة على تحديد سمات المهام بدقة، وتوفر أساساً هرمياً لاتخاذ القرار في توليد استراتيجية الجدولة.
تحليل تطور الأداء متعدد الأبعاد لخوارزمية الجدولة الديناميكية Transformer-PPO
بناءً على ترميز Transformer لتسلسلات الجدولة التاريخية وحالة الموارد، يتم استخراج الميزات الزمكانية كمدخلات للحالة في خوارزمية PPO؛ ومن ثم تخرج شبكة السياسات إجراء الجدولة، بينما تمنح البيئة مكافآت فورية وتحدث الحالة؛ وخلال عملية التدريب، يتم تسجيل المؤشرات الأصلية لكل جولة، ثم يتم إزالة الضجيج عبر ترشيح المتوسط المنزلق، وتحليل اتجاه تقارب الخوارزمية؛ وفي التصور النهائي، تُظهر البيانات الأصلية الديناميكيات اللحظية، بينما يعكس المنحنى السلس تحسن الأداء على المدى الطويل، مما يؤكد أن النموذج يحقق جدولة مستقرة من خلال نمذجة السلاسل الزمنية وتحسين السياسات.
الشكل 6A,B يوضح تحليل تطور الأداء متعدد الأبعاد لخوارزمية الجدولة الديناميكية Transformer-PPO. تعكس التقلبات في البيانات الأصلية الضوضاء اللحظية في عملية الجدولة، بينما تستخلص البيانات الممهدة الاتجاه طويل المدى عبر المتوسط المنزلق، مما يلغي تداخل الاضطرابات قصيرة المدى على تقييم أداء الخوارزمية ويجعل ملاحظة تطور الأداء أكثر سهولة. وبتحليل البيانات الممهدة، تظهر العلاقة الديناميكية بين المكافأة وإنتروبيا السياسة أن منحنى المكافأة يظهر نمواً لوغاريتمياً، حيث تتعلم السياسة بسرعة جدولة الإجراءات بفعالية من خلال الاستكشاف؛ ويميل النمو إلى الاستقرار في المرحلة اللاحقة، حيث تستقر قيمة تشبع المكافأة عند حوالي 12، مما يشير إلى أن السياسة قريبة من الحد الأمثل المحلي. تتناقص إنتروبيا السياسة تدريجياً من حوالي 2.2 في البداية إلى حوالي 0.6. يحافظ PPO على قدرة الاستكشاف الضرورية من خلال بند مكافأة الإنتروبيا. ويعز الاستكشاف العالي (إنتروبيا عالية) في المرحلة المبكرة الزيادة السريعة في المكافآت، بينما توازن الاستراتيجية اللاحقة بين الاستكشاف والاستغلال من خلال التشذيب والتحديث. ويظهر التحسين المنسق لمعدل التعارض واستخدام الموارد أن معدل التعارض ينخفض إلى مستوى أقل من 10%، ويعكس حده الأدنى التعارضات التي لا يمكن القضاء عليها في النظام الفعلي بسبب عشوائية المهام. ويعزى هذا الاتجاه النزولي مباشرة إلى قدرة Transformer على ترميز تسلسلات النشاط التاريخية، مما يمكن النموذج من التنبؤ الاستباقي بالتنافس على الموارد. وقد ارتفع استخدام الموارد إلى ما يقرب من 75%، بما يتماشى مع قانون تناقص العوائد الحدية. ومن المنطقي ألا يصل الاستخدام إلى مستوى أعلى، حيث أن الاستخدام المفرط قد يسبب تأخيرات في الاصطفاف. وقد أدى تقليل التعارضات إلى توفير المزيد من الموارد المتاحة، كما أدى تحسين تخصيص الموارد إلى كبح التعارضات بشكل أكبر.
تقييم سرعة الاستجابة وكفاءة اتخاذ القرار
مقارنة متوسط وقت اتخاذ القرار ومتوسط تأخير الاستجابة تحت كثافات مهام مختلفة (عدد المهام: 10، 300، 50، 70، 10). مقارنة نموذج جدولة Transformer-PPO الوارد في هذه الورقة مع نموذج LSTM-PPO، ونموذج جدولة البحث الجشع (greedy search)، ونموذج جدولة استراتيجية DQN.
الشكل 7A,B يوضح متوسط وقت اتخاذ القرار ومتوسط تأخير الاستجابة لأربع استراتيجيات جدولة عبر ظروف كثافة مهام مختلفة، مما يعكس قدرة الخوارزمية على اتخاذ القرار في الوقت الفعلي واستجابة النظام في سيناريوهات الحمل العالي. ومع زيادة عدد المهام، تُظهر كل استراتيجية اتجاهاً تصاعدياً في كلا المؤشرين، إلا أن الزيادات والاستقرار يختلفان. ففي السيناريوهات كثيفة المهام، تحافظ بنية Transformer-PPO على أداء مستقر نسبياً في متوسط وقت اتخاذ القرار. فعندما تكون كثافة المهام 100، يكون متوسط وقت اتخاذ القرار 0.72s، ومتوسط تأخير الاستجابة 1.59s، ويرجع ذلك أساساً إلى تأثير ضغط ترميز الميزات الزمنية على فضاء الحالة والتجنب الفعال للعمليات غير الصالحة في فضاء الإجراءات. في المقابل، تُظهر استراتيجية DQN أوقات اتخاذ قرار وتأخيرات استجابة أطول مع زيادة عدد المهام، مما يعكس قدرتها المحدودة على تعميم السياسات عبر انتقالات الحالة عالية الأبعاد. ورغم أن استراتيجية Greedy تتخذ القرارات بشكل أسرع عبر أعداد مهام متفاوتة، إلا أن أداء استجابتها يتدهور في الرسوم البيانية للمهام المعقدة بسبب الافتقار إلى نمذجة الاعتمادية طويلة المدى. أما LSTM-PPO فتمتلك قدرة معينة على إدراك الوقت في نمذجة التسلسل، لكن أداءها ضعيف في سيناريوهات الاعتمادية طويلة المدى بسبب العمق الهيكلي المحدود. وتكشف النتائج عن التأثير الجوهري للتصميم الهيكلي على استجابة نظام الجدولة، وتؤكد ضرورة التحسين المنسق لآلية الترميز وكفاءة أخذ عينات السياسة في ظروف التزامن العالي.
تقييم معدل التعارض واستخدام الموارد
يتم تحليل معدل تعارض الموارد ومتوسط معدل استخدام الموارد إحصائياً تحت ظروف مختلفة من تعقيد أنواع الأنشطة (نوع واحد، أنواع متعددة مستقلة، أنواع متعددة متقاطعة، سير عمل متعدد المراحل، تعاون بين الأقسام، إدراج مؤقت، دورة متكررة). وتتم مقارنة نموذج الجدولة Transformer-PPO الوارد في هذا البحث مع نماذج الجدولة LSTM-PPO، والبحث الجشع (greedy search)، وDQN.
الشكل 8A,B يوضح معدل تعارض الموارد ومتوسط استهلاك الموارد لنماذج جدولة مختلفة عبر سبعة مستويات من تعقيد النشاط. يمثل المحور الرأسي نموذج الجدولة، بينما يمثل المحور الأفقي نوع النشاط. ويظهر الاتجاه العام أنه مع زيادة تعقيد هيكل النشاط (مثل العمليات متعددة المراحل، والتعاون بين الإدارات، والإدراج المؤقت، والدورات المتكررة)، يزداد معدل التعارض في جميع النماذج. وتظهر الاستراتيجية الجشعة (greedy strategy) ومخطط DQN قدرة محدودة على التكيف مع التغييرات الديناميكية، كما تظهر قصوراً واضحاً في التحكم في التعارضات. أما نموذج Transformer-PPO فيحافظ على معدل تعارض منخفض في ظل ظروف التعقيد العالي، حيث يتراوح معدل تعارض الموارد الإجمالي بين 0.05–0.12، مما يعكس فهمه العميق لهيكل تبعية المهام وتغيرات الموارد. ومن حيث استهلاك الموارد، يحافظ Transformer-PPO على مستوى عالٍ في جميع الظروف، لا سيما في حالات التقاطع متعدد الأنواع والإدراج المؤقت؛ حيث تعمل استراتيجية التعديل الديناميكي الخاصة به على تقليل وقت خمول الموارد بشكل فعال، بمتوسط معدل استهلاك للموارد يتراوح بين 0.75–0.86. وتؤكد هذه البيانات أن نموذج Transformer-PPO يحقق توازناً أفضل بين مرونة الجدولة وكفاءة الموارد، ويوفر قدرة أكبر على التطبيق العملي والقابلية للتوسع.
استقرار الجدولة
يتم حساب مؤشر استقرار الجدولة في ظل ظروف مختلفة من تعقيد أنواع الأنشطة (النوع الواحد، والمتعددة المستقلة، والمتعددة المتقاطعة، والعمليات متعددة المراحل، والتعاون بين الأقسام، والإدراج المؤقت، والدورة المتكررة). ويتم مقارنة نموذج جدولة Transformer-PPO في هذا البحث مع نماذج جدولة LSTM-PPO والبحث الجشع (greedy search) وDQN.
الجدول 1 يوضح نتائج المقارنة لمؤشر استقرار الجدولة عبر نماذج جدولة مختلفة تحت سبع حالات من تعقيد نوع النشاط. ويعكس نوع التعقيد المختار أداء استقرار نظام الجدولة عبر سيناريوهات متعددة. تتراوح قيمة المؤشر من 0 إلى 1، وكلما ارتفعت القيمة، زادت مقاومة النموذج لاضطرابات الجدولة وزاد استقرار مخرجات الاستراتيجية. وتظهر النتائج التجريبية أن نموذج Transformer-PPO يحافظ على مؤشر استقرار مرتفع في جميع هياكل المهام. وبشكل خاص في سيناريوهات التعاون متعدد الأنواع، والعبر-قسمي، والدورات المتكررة، كان استقرار استراتيجية الجدولة الخاصة به أفضل من النماذج الأخرى، مما يظهر قدرات قوية في الحفاظ على الهيكل والجدولة التكيفية. ويتراوح مؤشر استقرار الجدولة الإجمالي من 0.8 إلى 0.91. وفي المقابل، انخفض استقرار الخوارزمية الجشعة (greedy algorithm) ونموذج DQN بشكل ملحوظ مع زيادة تعقيد هيكل المهام، مع ظهور تذب واضح في السياسة وانحرافات في التنفيذ. ويظهر نموذج LSTM-PPO بعض الاستقرار، إلا أن أداءه العام يظل أقل من أداء Transformer-PPO. وتؤكد هذه المقارنة المساهمات الإيجابية لآلية الانتباه متعدد الرؤوس وآلية تحديث تقليم السياسة في استقرار مخرجات الجدولة، مما يبرز ميزة النموذج من حيث الاستقرار في سيناريوهات الأنشطة المشتركة المعقدة.
تحليل تكيف حمل تزامنية المهام
مع استمرار زيادة عدد المهام المتزامنة، يجب على نظام الجدولة معالجة التحديات المزدوجة المتمثلة في تعارضات توزيع الموارد وانخفاض تعميم السياسات. لاختبار قابلية تكيف الجدولة في النماذج المختلفة تحت توسع حمل المهام، يحدد هذا القسم ثلاثة مستويات من تزامنية المهام (منخفضة: 10 عنصر، متوسطة: 50 عنصر، وعالية: 10 عنصر) لمراقبة توزيع موارد النظام واتساق استجابة السياسة خلال دورة الجدولة. ويُستخدم مؤشر توازن الموارد ليعكس توازن الحمل لمختلف وحدات الموارد أثناء عملية الجدولة، ويُحسب على النحو التالي:
(7)
ui يمثل معدل الاستخدام الفعلي لوحدات الموارد؛ و ū يمثل متوسط معدل استخدام جميع الموارد؛ و N يمثل العدد الإجمالي للموارد. نطاق القيمة هو [0,1]، وكلما اقتربت القيمة من 1، كان توزيع الموارد أكثر توازناً.
يقيس مؤشر متانة نقل السياسة Rs درجة اتساق مخرجات السياسة تحت ظروف تحميل مهام مختلفة، ويُعرَّف على النحو التالي:
(8)
πt(L) و πt(H) هما توزيعات استراتيجية الجدولة تحت سيناريوهات الحمل المنخفض والحمل المرتفع، على التوالي، و T هو إجمالي الخطوة الزمنية. وكلما اقتربت القيمة من 1، زادت متانة انتقال الاستراتيجية وارتفعت القدرة على التكيف.
الجدول 2 يعرض بشكل منهجي أداء نماذج الجدولة الأربعة من حيث توازن الموارد ومتانة نقل السياسات تحت أحمال تزامنية متفاوتة للمهام. تم تعيين مستويات تزامنية المهام إلى منخفضة (10 عنصر)، ومتوسطة (50 عنصر)، وعالية (10 عنصر) على التوالي، مما يعكس قدرة النموذج على التكيف مع الجدولة تحت ضغوط مختلفة لنطاق المهام. تُظهر النتائج أن نموذج Transformer-PPO حقق أعلى مؤشر لتوازن الموارد عبر جميع مستويات الحمل، مما يعكس قدرته على تخصيص الموارد بشكل عقلاني في سيناريوهات المهام المتعددة المتزامنة. وفي الوقت نفسه، كان مؤشر متانة نقل السياسات أفضل بكثير من نموذج المقارنة، مما أظهر اتساقاً وقدرة عالية على التكيف في السياسات. وفي ظل ظروف التزامن العالي، بلغ مؤشر توازن الموارد ومؤشر متانة نقل السياسات 0.8 و0.85 على التوالي. ومقارنة بذلك، جاء LSTM-PPO في المرتبة الثانية، بينما أظهرت خوارزمية Greedy ونموذج DQN تدهوراً ملحوظاً في الأداء تحت الحمل العالي، حيث كان توزيع الموارد غير المتكافئ وزيادة تقلبات السياسات أكثر بروزاً. كشف هذا التقييم بوضوح عن الاختلافات في إدارة الموارد ومتانة السياسات في نظام الجدولة عند توسيع حمل المهام، وأكد بشكل أكبر على قابلية تطبيق وتفوق حل دمج Transformer-PPO لجدولة الأنشطة الاتحادية الديناميكية والمعقدة.
المقارنة مع طرق إضافية حديثة
بهدف إجراء تقييم معياري إضافي للطريقة المقترحة مقابل أحدث النهج المتطورة (SOTA)، تم تنفيذ ثلاث خوارزميات ممثلة من الأدبيات الأخيرة التي تدمج التعلم العميق مع التعلم التعزيزي لمشاكل الجدولة: (1) Transformer+DQN42 باستخدام نفس مشفر Transformer المستخدم في طريقتنا ولكن مع استبدال PPO بـ DQN لتعلم السياسات، كما تم استكشافه في الدراسات الحديثة للجدولة القائمة على القيمة؛ و(2) GRU+PPO43 مع استبدال مشفر Transformer بوحدة متكررة ذات بوابة (GRU) لالتقاط الاعتمادات الزمنية، وهو ما يمثل الطرق المتقدمة القائمة على الشبكات العصبية المتكررة RNN؛ و(3) GraphSAGE+PPO4 باستخدام مشفر GraphSAGE لنمذجة العلاقات بين المهام والموارد كرسوم بيانية، وهو ما يعكس النهج الحديث للشبكات العصبية الرسومية في الجدولة. تم تدريب جميع الطرق تحت ظروف تجريبية متطابقة (نفس مجموعة البيانات، وكثافة مهام تبلغ 10، وإعداد الحلقات) مع ضبط المعلمات الفائقة عبر البحث الشبكي لضمان عدالة المقارنة. تم تقييم كل طريقة عبر 10 عمليات تشغيل مستقلة، وتم تسجيل القيم المتوسطة لمقاييس الأداء الرئيسية (تأخير الاستجابة، ومعدل تعارض الموارد، واستغلال الموارد، ومؤشر استقرار الجدولة).
كما هو موضح في الجدول 3، يتفوق منهج Transformer+PPO المقترح باستمرار على جميع الخطوط المرجعية الثلاثة المعتمدة كأفضل التقنيات المتاحة (SOTA) عبر جميع المقاييس التي تم تقييمها. ويعد متوسط تأخير الاستجابة للمنهج المقترح (1.59s) أقل بكثير من تأخير Transformer+DQN (2.13s)، وGRU+PPO (1.89s)، وGraphSAGE+PPO (1.72s)، مما يشير إلى كفاءة فائقة في اتخاذ القرار. كما أن معدل تعارض الموارد في المنهج المقترح (0.09) هو الأدنى، مما يشير إلى تجنب استباقي أفضل للتعارضات. ويُعزى هذا التحسن إلى آلية الانتباه متعدد الرؤوس (multi-head attention) في Transformer، التي تلتقط الاعتمادات طويلة المدى بشكل أكثر فعالية من GRU أو GraphSAGE، مدمجة مع تحديثات السياسة المستقرة في PPO. وفيما يتعلق باستغلال الموارد، حقق المنهج المقترح قيمة 0.82، متفوقاً على المناهج الأخرى بنسبة 8 نقاط مئوية على الأقل، مما يثبت تخصيصاً أكثر كفاءة للموارد. كما أن مؤشر الاستقرار للمنهج المقترح (0.8) هو الأعلى، مما يؤكد أن هدف القص (clipping objective) وتصحيح GAE في PPO ينتجان سياسات جدولة أكثر متانة من DQN أو بدائل PPO الأخرى. وبشكل عام، تؤكد النتائج أن الجمع المحدد بين Transformer وPPO في الإطار المقترح يقدم مزايا واضحة على البنيات البديلة الحديثة، مما يعز من جدوى تطبيقه في جدولة أنشطة الاتحاد الديناميكية.
بيان توفر البيانات:
تم إيداع مجموعة البيانات المجهولة المستخدمة في هذه الدراسة، إلى جانب مسار المعالجة المسبقة للبيانات وبرامج التقييم، في مستودع Figshare وهي متاحة للجمهور عبر الرابط https://doi.org/10.6084/m9.figshare.3059243 (DOI: 10.6084/m9.figshare.3059243). تحتوي مجموعة البيانات على جداول الأنشطة، وسجلات استخدام الموارد، وسجلات أحداث التعارض من نقابة مؤسسية كبيرة، مع إزالة جميع المعلومات التي تحدد الهوية الشخصية والمعلومات الحساسة تجارياً.

الشكل 1هيكل نظام جدولة أنشطة النقابة. يتم دمج طلبات الأنشطة، وتوافر الموارد، ومعلومات النوافذ الزمنية للأفراد لإنشاء رسم بياني لقيود المهام والموارد ومصفوفة تعارض. وتُشفَّر تسلسلات الأنشطة وحالات الموارد التاريخية باستخدام محول (Transformer) مزود بآلية انتباه متعددة الرؤوس. ثم تُزود الحالات المُشفَّرة لشبكات السياسة والقيمة الخاصة بتحسين السياسة القريبة (PPO)، والتي تولد احتمالات إجراءات الجدولة وتقديرات قيمة الحالة. وتعمل الإجراءات المختارة على تحديث بيئة الجدولة وتوليد المكافآت. بعد ذلك، يُستخدم هدف PPO المقصوص وتقدير الميزة العام لتحديث النموذج، مما يشكل حلقة تغذية راجعة مغلقة للجدولة التكيفية وتخصيص الموارد. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 2شبكة أوزان صراع المهام (يعكس سمك الحافة شدة الصراع). تمثل كل عقدة نشاطاً بانتظار الجدولة، ويمثل كل ضلع تعارضاً ناشئاً عن التداخل في استخدام الموظفين، أو المواقع، أو المعدات، أو الموارد الأخرى. وتتناسب سماكة الضلع طردياً مع وزن التعارض المحتسب، حيث تشير الأضلاع الأكثر سماكة إلى تعارضات أكثر حدة. كما تمثل مجموعات العقد ذات الاتصال الكثيف اختناقات محتملة في الموارد ومجموعات من المهام المتنافسة. ويُستخدم تخطيط موجه بالقوة لوضع المهام ذات التعارضات القوية بشكل أقرب من بعضها البعض. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 3خصائص الديناميكية لاستقرار الاستراتيجية وتقدير الميزة أثناء تكرار تحسين الجدولة. (أ) هدف سياسة القص تحت قيم ε متغيرة(ب) تقلبات مكافئ حمض الغاليك عبر إعدادات λ. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 4الاتجاه الزمني لمخرجات الانتباه متعدد الرؤوس يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 5التعزيز المتبقي وتدرج أولويات المهام تحت التباين الزمني لسمات الترميز. (أ) مقارنة الحالة المخفية قبل وبعد الاتصال المتبقي(ب) تفعيل الميزات القائم على الوقت لأولويات المهام المختلفة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 6تحليل تطور الأداء متعدد الأبعاد. (أ) المكافأة وإنتروبيا السياسة (ب) معدل التعارض واستخدام الموارد. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 7متوسط وقت اتخاذ القرار ومتوسط تأخير الاستجابة. (أ): وقت اتخاذ القرار تحت أحمال مهام متفاوتة(ب): زمن استجابة الاستجابة تحت أحمال مهام متغيرة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 8مقارنة معدل تعارض الموارد ومتوسط استغلال الموارد (Aمعدل تعارض الموارد. (Bمتوسط استهلاك الموارد يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
| حالة تعقيد النشاط | Transformer-PPO | LSTM-PPO | الخوارزمية الجشعة | DQN |
| نوع واحد | 0.91 | 0.86 | 0.74 | 0.78 |
| أنواع متعددة مستقلة | 0.8 | 0.81 | 0.7 | 0.73 |
| أنواع متعددة متداخلة | 0.85 | 0.76 | 0.65 | 0.68 |
| سير عمل متعدد المراحل | 0.83 | 0.73 | 0.61 | 0.6 |
| تعاون عابر للأقسام | 0.8 | 0.7 | 0.59 | 0.63 |
| إدراج مؤقت | 0.86 | 0.78 | 0.68 | 0.72 |
| فترة تكرار | 0.84 | 0.75 | 0.64 | 0.69 |
الجدول 1: مقارنة مؤشر استقرار الجدولة عبر تعقيدات مختلفة للأنشطة. تتم مقارنة مؤشرات استقرار الجدولة لنماذج Transformer–PPO وlong short-term memory–PPO (LSTM–PPO) والبحث الجشع (greedy-search) والشبكة العصبية العميقة Q (DQN) عبر سبع حالات: أنشطة من نوع واحد، أنشطة مستقلة متعددة الأنواع، أنشطة متقاطعة متعددة الأنواع، سير عمل متعدد المراحل، تعاون عابر للأقسام، إدراج مهام مؤقتة، وأنشطة ذات دورات متكررة. يتراوح مؤشر الاستقرار من 0 إلى 1، حيث تشير القيم الأعلى إلى مقاومة أكبر لاضطرابات الجدولة ومخرجات سياسة أكثر اتساقاً.
| حالة تزامنية المهام | نموذج الجدولة | مؤشر توازن الموارد | مؤشر متانة نقل السياسة |
| تزامنية منخفضة (10 مهمة) | Transformer-PPO | 0.94 | 0.92 |
| LSTM-PPO | 0.89 | 0.85 | |
| الخوارزمية الجشعة (Greedy Algorithm) | 0.83 | 0.78 | |
| DQN | 0.85 | 0.81 | |
| تزامنية متوسطة (50 مهمة) | Transformer-PPO | 0.91 | 0.89 |
| LSTM-PPO | 0.86 | 0.82 | |
| الخوارزمية الجشعة (Greedy Algorithm) | 0.78 | 0.71 | |
| DQN | 0.81 | 0.76 | |
| تزامنية عالية (10 مهمة) | Transformer-PPO | 0.8 | 0.85 |
| LSTM-PPO | 0.82 | 0.76 | |
| الخوارزمية الجشعة (Greedy Algorithm) | 0.7 | 0.63 | |
| DQN | 0.75 | 0.68 |
الجدول 2: تقييم القابلية للتكيف مع حمل تزامنية المهام. تتم مقارنة مؤشر توازن الموارد ومؤشر متانة نقل السياسة لأربعة نماذج جدولة تحت ظروف تزامنية منخفضة ومتوسطة وعالية، والتي تقابل 10 و50 و1,0 مهمة متزامنة على التوالي. يتراوح كلا المؤشرين بين 0 و1، حيث تشير القيم الأعلى إلى توزيع أكثر توازناً للموارد واتساق أكبر في سياسات الجدولة عبر التغيرات في حمل المهام.
| الطريقة | متوسط تأخير الاستجابة (s) | معدل تعارض الموارد | استهلاك الموارد | مؤشر الاستقرار |
| Transformer+DQN | 2.13 ± 0.12 | 0.18 ± 0.02 | 0.68 ± 0.03 | 0.76 ± 0.04 |
| GRU+PPO | 1.89 ± 0.09 | 0.15 ± 0.01 | 0.72 ± 0.02 | 0.79 ± 0.03 |
| GraphSAGE+PPO | 1.72 ± 0.08 | 0.13 ± 0.01 | 0.74 ± 0.02 | 0.82 ± 0.03 |
| المقترحة | 1.59 ± 0.05 | 0.09 ± 0.01 | 0.82 ± 0.02 | 0.8 ± 0.02 |
| (Transformer+PPO) |
الجدول 3: مقارنة الأداء مع طرق إضافية حديثة.تتم مقارنة طريقة Transformer–PPO المقترحة مع كل من Transformer–DQN، وgated recurrent unit–PPO (GRU–PPO)، وGraphSAGE–PPO تحت ظروف تجريبية متطابقة عند كثافة مهام تبلغ 1,0. تمثل النتائج القيم المتوسطة من 10 تشغيلات مستقلة. تشمل المخرجات التي تم تقييمها تأخير الاستجابة بالثواني، ومعدل تعارض الموارد، ومعدل استغلال الموارد، ومؤشر استقرار الجدولة. تشير تأخيرات الاستجابة ومعدلات التعارض المنخفضة إلى أداء أفضل، بينما يشير ارتفاع استغلال الموارد ومؤشرات الاستقرار إلى أداء أفضل.
تُظهر النتائج التجريبية أن خوارزمية Transformer-PPO المقترحة تتفوق باستمرار على الطرق المرجعية (LSTM-PPO والبحث الجشع DQN) عبر جميع مقاييس التقييم. ويمكن إرجاع هذا الأداء المتفوق إلى عاملين رئيسيين؛ أولاً، تنجح آلية الانتباه الذاتي متعدد الرؤوس في Transformer في التقاط التبعيات الزمنية طويلة المدى في تسلسلات الأنشطة وحالات الموارد، مما يتيح التحديد الاستباقي للصراعات المحتملة. وهذا يفسر سبب بقاء معدل الصراع منخفضاً حتى في ظل التعقيد العالي (على سبيل المثال، التعاون بين الإدارات والإدراج المؤقت)، حيث يمكن للنموذج توقع التنافس على الموارد قبل وقوعه. ثانياً، تضمن دالة الهدف المقصوصة وتصحيح الميزة القائم على GAE في PPO تحديثات مستقرة للسياسة، مما يمنع التقلبات الحادة في قرارات الجدولة ويحافظ على متانة عالية تحت أعباء المهام المتغيرة.
بالمقارنة مع مناهج الجدولة الحالية، تعالج الطريقة المقترحة قصور النماذج القائمة على LSTM التي تعاني من تلاشي التدرجات في التسلسلات الطويلة، وتتجاوز ضعف التعميم في طرق greedy وDQN في البيئات الديناميكية. وبينما يظهر LSTM-PPO أداءً متوسطاً، فإنه يفشل في الحفاظ على الاستقرار عندما تمتد تبعيات المهام عبر آفاق زمنية طويلة، وهو ما ينعكس في ارتفاع معدلات التعارض وانخفاض توازن الموارد تحت ظروف التزامن العالي. أما خوارزمية greedy، ورغم كفاءتها الحسابية، فإنها تفتقر إلى الاستشراف وتؤدي إلى تخصيص غير أمثل للموارد، مما يزيد من تأخيرات الاستجابة. ومن ناحية أخرى، يظهر DQN تذبذباً في السياسة بسبب غياب قيد منطقة الثقة (trust-region constraint)، مما يؤدي إلى تدهور أدائه في سيناريوهات المهام المتعددة.
ومع ذلك، فإن هذه الدراسة تعاني من عدة قيود؛ حيث إن مجموعة البيانات مستمدة من اتحاد مؤسسي واحد، مما قد يحد من إمكانية تعميم النتائج على سياقات تنظيمية أخرى. بالإضافة إلى ذلك، يفترض النموذج أن جميع معلومات النشاط والموارد قابلة للرصد بالكامل، وهو أمر قد لا يتحقق في بيئات العالم الحقيقي حيث تكون البيانات غير مكتملة أو مشوبة بالضجيج. كما تزداد التكلفة الحسابية لمشفر Transformer مع زيادة طول النافذة الزمنية التاريخية، مما قد يؤثر على إمكانية التطبيق في الوقت الفعلي للأنظمة واسعة النطاق للغاية.
يمكن أن تركز الأعمال المستقبلية على توسيع النموذج للتعامل مع البيئات القابلة للملاحظة جزئيًا باستخدام تقدير الحالة المتكرر، ودمج تقنيات التعلم فوقي (meta-learning) لتمكين التكيف السريع مع الاتحادات الجديدة في ظل بيانات تاريخية محدودة. كما نخطط لنشر الخوارزمية في بنية تعاونية بين السحابة والحافة (cloud-edge) لتقليل زمن تأخير القرار ودعم الجدولة الموزعة. علاوة على ذلك، فإن دمج مكونات الذكاء الاصطناعي القابل للتفسير قد يوفر مبررات جدولة قابلة للتفسير للمشغلين البشريين، مما يعزز الثقة والاعتماد العملي.
تدرس هذه الورقة خوارزمية تحسين للجدولة الديناميكية تدمج بين نموذج Transformer والتعلم التعزيزي القائم على PPO، مع التركيز على تضاربات الموارد المتكررة وتأخيرات الاستجابة في جدولة أنشطة النقابة. تفحص الخوارزمية بدقة الخصائص الزمكانية لسجل الأنشطة وحالة الموارد من خلال آلية الانتباه متعدد الرؤوس (multi-head attention mechanism)، مما يعزز القدرة على تحديد مخاطر التضارب المحتملة. وبالاشتراك مع آلية التحديث المستقرة للاستراتيجية الخاصة بدالة هدف القص (clipping objective function)، تحقق الخوارزمية استجابة وتخصيصاً فعالاً للموارد في بيئة ديناميكية. وتظهر هذه الطريقة استقراراً ممتازاً في الجدولة، وكفاءة في استغلال الموارد، وقدرات عالية في التحكم في التضاربات لمختلف أنواع الأنشطة وأحمال المهام المعقدة والمتنوعة. ويظهر التحليل التجريبي أن الخوارزمية تحقق تأخيراً بسيطاً في الاستجابة تحت كثافة مهام عالية. وفي ظل سبعة أنواع وتعقيدات مختلفة من الأنشطة، تراوح معدل تضارب الموارد بين 0.05–0.12، ومتوسط استغلال الموارد بين 0.75–0.86، ومؤشر استقرار الجدولة بين 0.8–0.91. كما حافظت الخوارزمية على معدل منخفض من تضارب الموارد وتوازن عالٍ في توزيعها، وهي نتائج أفضل بكثير من نماذج الجدولة السائدة حالياً مثل LSTM-PPO، والبحث الجشع (greedy search)، و DQN. وفي الوقت ذاته، كانت متانة نقل الاستراتيجية واستقرار الجدولة جيدين، مما يشير إلى أن الخوارزمية تتمتع بقدرة قوية على التكيف ومقاومة الاضطرابات. ويوفر هذا التفوق في الأداء دعماً تقنياً راسخاً لنظام إدارة أنشطة النقابة في سيناريوهات جدولة الموارد الديناميكية والمتغيرة.
يصرح المؤلفون بأنه لا توجد لديهم تضاربات مصالح مالية.
| الاسم | الشركة | رقم فهرسي | التعليقات |
|---|---|---|---|
| Python 3.9 | مؤسسة برمجيات بايثون (Python Software Foundation) | https://www.python.org/downloads/release/python-390/ | لغة البرمجة الأساسية |
| PyTorch 1.12 | ميتا إيه آي (Meta AI) | https://pytorch.org/get-started/previous-versions/ | إطار عمل التعلم العميق (تنفيذ Transformer/PPO) |
| NumPy 1.23 | مُطوّرو NumPy | ملاحظات الإصدار 1.23.0 تم إصدار NumPy 1.23.0 في 13 يونيو 2022. أبرز التغييرات - تم تقديم نظام الـ DType الجديد كلياً، والذي يوفر مرونة أكبر في تعريف الأنواع المخصصة. - تحسينات كبيرة في الأداء لعمليات الفهرسة المتقدمة (Advanced Indexing). - دعم محسن لعمليات الـ SIMD لزيادة سرعة الحسابات العددية. - إضافة دوال جديدة للتعامل مع المصفوفات المتفرقة (Sparse Arrays) في إطار العمل التجريبي. الميزات الجديدة - تقديم `numpy.typing` المحدث لتقديم دعم أفضل للأنواع الثابتة (Static Typing). - إضافة `numpy.experimental` لتجربة الميزات الجديدة قبل اعتمادها بشكل نهائي. - دعم تحسينات في `numpy.linalg` لزيادة كفاءة العمليات الجبرية الخطية. التغييرات في سلوك الدوال (Behavioral Changes) - تحديث طريقة التعامل مع القيم المفقودة (NaN) في بعض دوال التجميع (Reduction Functions). - تعديل في سلوك البث (Broadcasting) ليتوافق مع المعايير الحديثة للغة Python. إصلاحات الأخطاء (Bug Fixes) - إصلاح مشكلة تسريب الذاكرة عند التعامل مع مصفوفات ضخمة في بيئات معينة. - تصحيح خطأ في حساب القيم المتوسطة لبعض أنواع البيانات ذات الدقة المحدودة. التحسينات (Improvements) - تقليل وقت تحميل المكتبة عند بدء التشغيل. - تحسين توثيق الدوال (Documentation) لتوفير أمثلة أكثر وضوحاً للمستخدمين. الكلمات المفتاحية: NumPy, مصفوفات، حسابات عددية, Python, برمجة علمية, إصدار 1.23.0 | مكتبة الحسابات العددية |
| Matplotlib 3.5 | فريق تطوير Matplotlib | تثبيت Matplotlib تثبيت Matplotlib يُعد تثبيت Matplotlib عملية بسيطة في معظم الحالات، ولكن قد تختلف التفاصيل بناءً على نظام التشغيل والبيئة المستخدمة. التثبيت باستخدام pip الطريقة الموصى بها لتثبيت Matplotlib هي استخدام pip، وهو مدير الحزم القياسي للغة Python. يمكنك تشغيل الأمر التالي في واجهة السطر البرمجي (terminal): python -m pip install matplotlib سيقوم هذا الأمر بتثبيت Matplotlib وأي تبعيات مطلوبة من مستودع Python Package Index (PyPI). التثبيت باستخدام conda إذا كنت تستخدم توزيعة Anaconda أو Miniconda، فيمكنك تثبيت Matplotlib باستخدام conda: conda install matplotlib يضمن هذا الخيار توافق الحزم مع بيئة conda الخاصة بك. التثبيت من المصدر (Source) للمستخدمين المتقدمين الذين يحتاجون إلى بناء Matplotlib من المصدر، يمكن اتباع التعليمات المتاحة في وثائق التطوير. تتطلب هذه العملية وجود مترجم C++ ومكتبات تطوير معينة مثبتة مسبقاً على النظام. التحقق من التثبيت بعد إتمام عملية التثبيت، يمكنك التحقق من أن Matplotlib يعمل بشكل صحيح عن طريق تشغيل الكود التالي في بيئة Python: import matplotlib print(matplotlib.__version__) إذا تم طباعة رقم الإصدار دون ظهور أي رسائل خطأ، فقد تمت عملية التثبيت بنجاح. التبعيات (Dependencies) تعتمد Matplotlib على عدة مكتبات أساسية لضمان عملها، وأبرزها: - NumPy: للعمليات الحسابية والمصفوفات. - Pillow: لمعالجة الصور. - Pycoast أو مكتبات أخرى اختيارية لدعم تنسيقات ملفات معينة. تحديث Matplotlib لتحديث Matplotlib إلى أحدث إصدار متاح، استخدم الأمر التالي: python -m pip install --upgrade matplotlib أو عبر conda: conda update matplotlib | تصوير النتائج بصرياً |
| مجموعة بيانات جدولة أنشطة الاتحاد | قاعدة بيانات داخلية لمؤسسة متعاونة (مجهولة الهوية) | غير متاح للعامة بسبب اتفاقية سرية؛ يمكن للباحثين التواصل مع المؤلف المسؤول لطلب الوصول إليه | أكثر من 5000 سجل نشاط (اجتماعات، تدريب، ترفيه) من نقابة مؤسسة كبيرة على مدى ثلاث سنوات |
| وحدة معالجة الرسوميات NVIDIA A100 | |||
| PyTorch |