$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
البيان الأخلاقي
اعتمدت هذه الدراسة بالكامل على بيانات تخطيط القلب العامة المجهولة الهوية التي تم تحميلها من PhysioNet. تم جمع جميع مجموعات البيانات المستخدمة في هذه الدراسة في الأصل بموافقة المشاركين وبموافقة أخلاقية من مالكي البيانات المعنيين. لم يتطلب هذا البحث أي جمع بيانات، أو عمل تجريبي مع أشخاص أو حيوانات، أو معلومات هوية شخصية للمرضى. لذا، لم يطلب أي مراجعة أخلاقية إضافية.
المنهجية
يوضح الشكل 2 سير عمل البنية المقترحة.
جمع البيانات
يتم جمع بيانات تخطيط القلب من قاعدة بيانات PhysioNet، وهي مستودع شهير للإشارات الفسيولوجية. يتم استرجاع مجموعات بيانات متعددة من قاعدة البيانات. يتم دمج هذه المجموعات في مجموعة بيانات رئيسية واحدة تشمل فئات مختلفة من إشارات تخطيط القلب الكهربائي.
مجموعات البيانات المستخدمة
استخدمت هذه الدراسة عدة مجموعات بيانات تخطيط القلب المتاحة للجمهور لتطوير وتقييم نموذج تعلم عميق لتصنيف اضطرابات النظم. تم اختيار هذه المجموعات بعناية، مع الأخذ في الاعتبار تنوعها من حيث التركيبة السكانية للمرضى وتنوع أنواع اضطرابات النظم، لضمان أداء النموذج المقترح بشكل جيد عبر سيناريوهات مختلفة9. في هذه الدراسة، تم دمج بيانات Lead-I فقط من قاعدة بيانات اضطراب نظم MIT-BIH، وقاعدة بيانات اضطراب نظم فوق البطينية في MIT-BIH، وقاعدة بيانات اضطراب نظم القلب فوق البطيني في MIT-BIH، وقاعدة بيانات INCART 12-lead، وقاعدة بيانات هولتر للموت المفاجئ القلبي. تشتهر هذه المجموعات بتسجيلات تخطيط القلب عالية الجودة والمشروحة التي تشمل طيفا واسعا من فئات اضطرابات النظم.
تشمل مجموعات البيانات المجمعة أعلاه التركيبة السكانية للمرضى، وأجهزة التسجيل، وترددات أخذ العينات، والإعدادات. التغير المذكور أعلاه في النموذج يحسن تعميمه من خلال تعريضه لمجموعة واسعة من أشكال تخطيط القلب الكهربائي، والضوضاء، والإيقاعات.
وصف مجموعات البيانات
قاعدة بيانات اضطرابات نظم MIT-BIH
تحتوي مجموعة بيانات اضطراب نظم النظم في MIT-BIH على 48 تسجيلا لتخطيط القلب نصف ساعة، مرقمة من 100 إلى 234. يحتوي كل سجل على إشارات تخطيط القلب ذات قناتين رقمية بسرعة 360 عينة في الثانية. يتم تخزين البيانات بصيغ .dat و.hea و.atr.
قاعدة بيانات اضطراب نظم القلب فوق البطيني في MIT-BIH
هذه مجموعة محددة من قواعد بيانات MIT-BIH. تتضمن قاعدة بيانات اضطراب النظم فوق البطيني في MIT-BIH 78 تسجيلا كاملا لتخطيط القلب الكهربائي، تتراوح مدتها من 30 دقيقة إلى عدة ساعات، مرقمة من 801 إلى 811. يتضمن كل سجل إشارات تخطيط القلب ذات القناتين، يتم تحويلها إلى شكل رقمي بسرعة 128 عينة في الثانية.
قاعدة بيانات اضطراب نظم الضربات المكونة من 12 رصاصة في سانت بطرسبرغ INCART
تتضمن هذه قاعدة البيانات 75 تسجيلا مشروحا مأخوذا من 32 شاشة هولتر. كل تسجيل يستغرق 30 دقيقة ويتضمن 12 مقطع رئيسي قياسي، كل منها تم أخذ عينات على 257 هرتز. تتراوح قوة الإشارة بين 250 و1100 وحدة محول تماثلي إلى رقمي لكل ملي فولت.
قاعدة بيانات هولتر في الوفاة القلبية غير المتوقعة
تعد هذه المجموعة من العديد من تسجيلات هولتر مفتوحة الوصول التي تلتقط الحوادث الواقعية لتسرع القلب البطيني (VT) والرجفان البطيني (VF). كلاهما يمكن أن يؤدي إلى موت قلبي غير متوقع. كل تسجيل طوله 24 ساعة وتم أخذ عينات عند 250 هرتز.
معالجة البيانات المسبقة
في هذه الدراسة، تم استخدام أربع قواعد بيانات عامة لتخطيط القلب بمعدلات أخذ عينات مختلفة: اضطراب نظم MIT-BIH (360 هرتز)، اضطراب نظم القلب فوق البطيني في MIT-BIH (128 هرتز)، سانت بطرسبرغ INCART 12-lead (257 هرتز)، وهولتر الموت القلبي المفاجئ (250 هرتز). لضمان اتساق جميع البيانات وإمكانية دمجها أثناء تدريب النماذج، تم إعادة أخذ عينات لجميع إشارات تخطيط القلب إلى معدل مشترك 360 هرتز، وهو ما يطابق قاعدة بيانات اضطراب نظم MIT-BIH ويستخدم عادة كمعيار في أبحاث تخطيط القلب الكهربائي. تم إجراء إعادة العينات عبر الاستيفاء المحدود النطاق الدراسي؛ في البداية، كانت إشارات تخطيط القلب منخفضة التمرير لتجنب التشابك الداخلي، ولاحقا تم استخدام نواة إعادة بناء تعتمد على السينك للاستيفاء، تلتها إعادة الأخذ النهائي عند 360 هرتز. بعد إعادة العينة، تم تقسيم كل إشارة إلى نوافذ تحتوي على 180 عينة، أي ما يعادل تقريبا 0.5 ثانية من البيانات، مما يضمن أن جميع مجموعات البيانات لها نفس دقة الوقت. مكن هذا التوحيد القياسي دمج الإشارات من قواعد بيانات مختلفة للتدريب والاختبار، مما ساعد النموذج على تعلم أنماط متسقة مع مرور الوقت.
تضمنت المعالجة المسبقة عدة خطوات مهمة لضمان جودة بيانات الإدخال:
تقسيم البيانات:
بعد إعادة العينة، تم تقسيم كل إشارة تخطيط قلب كهربائي إلى نوافذ ثابتة الطول مكونة من 180 عينة. وهذا يعادل حوالي 0.5 ثانية من مدة الإشارة بمعدل أخذ عينات 360 هرتز. استخدم هذا البحث نافذة منزلقة ثابتة وغير متداخلة للتقسيم. جمعت كل نافذة تسلسلا مستمرا من عينات تخطيط القلب الكهربائي. اختارت الدراسة نافذة من 180 عينة لأن فترة 0.5 ثانية كافية لالتقاط دورة قلبية كاملة أو أجزائها الرئيسية: موجة P، مركب QRS، وموجة T، لمعدل ضربات قلب البالغين النموذجية. تم تخصيص تسمية فئة لكل مقطع بناء على التعليق التوضيحي في مركز المقطع. بهذه الطريقة، تطابق تسمية المقطع الشكل الرئيسي لضربات القلب داخل تلك النافذة. طريقة النافذة المنزلقة، تم تطبيق دالة التقسيم هذه:

حيث si هي عينة تخطيط القلب في الزمن i.
التطبيع:
تم تطبيع بيانات تخطيط القلب المجزأة باستخدام مقياس الحد الأدنى (Min-Max) للتأكد من أن جميع الميزات لها قيم بين 0 و110.

تساعد هذه الخطوة في تسريع تقارب النموذج أثناء التدريب.
موازنة الفئات مع SMOTE
كانت النبضات الطبيعية (N) تفوق بكثير الفئات غير الطبيعية في مجموعة بيانات تخطيط القلب الكهربائي، مما أظهر خللا كبيرا في الفئة. بعد التقسيم، والتطبيع، وتقسيم اختبار القطار، خضعت مجموعة بيانات التدريب لتقنية أخذ عينات الأقليات الاصطناعية الزائدة (SMOTE) لمعالجة هذه المشكلة.
تم استخدام فضاء ميزات بطول 180 بعدا لتمثيل كل جزء من تخطيط القلب الكهربائي، ويتكون من 180 عينة مطبعة. استخدم SMOTE المسافة الإقليدية لتحديد k أقرب جيران لكل عينة من فئة الأقلية (k = 5) ضمن فئتها الخاصة. تم تطبيق SMOTE فقط على بيانات التدريب، والتي قسمت إلى مجموعات اختبار بنسبة 70٪ تدريب و30٪ اختبار باستخدام أخذ عينات طبقية. وبهذه الطريقة، لم تضاف أي عينات صناعية إلى مجموعة الاختبار، مما يضمن أن نتائج الاختبار لم تتأثر بعملية العينة الزائدة. ظلت بيانات الاختبار دون تغيير، محافظة على توزيع فئاتها الأصلي، واستخدمت فقط لتقييم النموذج بشكل عادل. نتيجة لذلك، تظهر نتائج الأداء العالي من هذه الدراسة القدرة الحقيقية للنموذج على التعميم، وليس بسبب الإفراط في التوافق أو تضخيم الدرجات الناتجة عن إضافة عينات إضافية.
تقسيم اختبار القطار:
بعد المعالجة المسبقة وتصفية الفئة، تم تقسيم مجموعة البيانات إلى مجموعات تدريب واختبار بنسبة 70٪–30٪ باستخدام أخذ عينات عشوائية طبقية. يعتمد هذا التصنيف على تصنيفات الفئات لضمان الحفاظ على النسب النسبية لكل فئة نبض قلب في مجموعات التدريب والاختبار.
تم تنفيذ التقسيم باستخدام بذرة عشوائية لإعادة الإنتاج. كل جزء من تخطيط القلب ظهر حصريا إما في التدريب أو مجموعة الاختبار. لتجنب التحيز والانحراف في البيانات، تم تنفيذ كل خطوة معالجة مسبقة قد تؤثر على توزيع البيانات (أي موازنة الفئات عبر SMOTE) فقط بعد التقسيم وعلى بيانات التدريب فقط.
وفي هذا الصدد، من خلال الحفاظ على نسب الفئة، واستخدام التقسيم العشوائي، وفصل العينات بدقة إلى مجموعات تدريب واختبار، تقلل عملية التقسيم من احتمال التحيز في العينات، مما يسمح لمقاييس الأداء بعكس تعميم النموذج بدلا من بقايا البيانات الخاصة بالبيانات.
تقسيم مجموعات البيانات وتوزيع الفئات
تم تقسيم مجموعة البيانات النهائية إلى مجموعات تدريب واختبار، حيث 70٪ للتدريب و30٪ للاختبار. بعد تطبيق SMOTE، تم تقليل عدم توازن الفئة، مما ضمن تمثيل كل نوع من اضطرابات نظم القلب بشكل جيد في كل من مجموعات التدريب والاختبار. تم استخدام ما مجموعه 3,966,620 قطعة تخطيط قلب للتدريب، بينما تم استخدام 112,575 قطعة تخطيط قلب للاختبار. مكن حجم البيانات الكبير، إلى جانب تنوع أنواع اضطرابات النظم، من إنشاء نموذج يحدد بفعالية أنواع مختلفة من اضطرابات النظم في إشارات تخطيط القلب الواقعية. تستخدم هذه الدراسة نماذج التعلم العميق لتصنيف اضطرابات نظم تخطيط القلب الكهربائي. تم اختيار أنواع نبضات القلب الخمسة، وهي الطبيعي (N)، كتلة فرع الحزمة الأيسر (L)، كتلة فرع الحزمة اليمنى (R)، نبض الأذين المبكر (A)، والانقباض البطيني المبكر (V)، وفقا لتعليقات النبض الموحدة المقدمة في قاعدة بيانات اضطراب نظم MIT-BIH وكذلك إرشادات AAMI لتعليق نبض تخطيط القلب الكهربائي. تشمل جميع تعليقات النبض الخمسة المذكورة هنا حالات قلبية مهمة تقع ضمن الفئة الواسعة من اضطرابات النظم وتظهر سمات موجية مميزة في إشارات تخطيط القلب حول موجات P وQRS وT.
علاوة على ذلك، تعد هذه الفئات من بين الأكثر شيوعا وموسومة بشكل ثابت في قواعد بيانات تخطيط القلب العامة، مما يسهل اختبار فعاليتها مقارنة بطرق تصنيف إيقاع القلب الأخرى المعتمدة على تخطيط القلب الكهربائي. تم تقسيم مجموعات البيانات باستخدام طريقة بين المرضى. ضمن هذا الإعداد عدم ظهور مقاطع تخطيط القلب من مريض واحد في كل من مجموعة التدريب والاختبار في نفس الوقت. وبمجرد حدوث هذا الانقسام، كان SMOTE يطبق فقط على مجموعة التدريب. ظل مجموعة الاختبار خالية من العينات الصناعية والنوافذ الزمنية المتكررة. كل هذا يساعد على تجنب التداخل على مستوى القطاعات ويدعم التعميم الحقيقي عند التعامل مع مرضى لم يروا من قبل.
توزيع الفئة قبل وبعد SMOTE:
كانت مجموعة البيانات الأصلية تعاني من خلل كبير بين الفئات، مع عدد كبير من النبضات الطبيعية (N) وعدد أقل من العينات للفئات غير الطبيعية. قبل استخدام SMOTE، كانت بيانات التدريب تحتوي على حوالي 133,320 كتلة طبيعية (N)، و8,075 كتلة فرعية للحزمة اليسرى (L)، و10,431 كتلة فرعية للحزمة اليمنى (R)، و4,489 من نبض الأذين المبكر (A)، و60,682 من انقباض البطين المبكر (V). لمعالجة هذا الخلل، تم تطبيق SMOTE فقط على مجموعة التدريب، مما زاد عدد العينات في فئات الأقليات لتتناسب مع فئة الأغلبية. بعد التعزيز، كان لكل دفعة 793,324 جزءا، مما أدى إلى 3,966,620 فقرة تخطيط قلب للتدريب. احتفظت مجموعة الاختبار، التي كانت تحتوي على 112,575 مقطعا، بتوزيع فئاتها الأصلي ولم يتم أخذ عينات زائدة. ضمن هذا النهج تقييما عادلا وغير متحيز لأداء النموذج.
التدريب والاستدلال
نظر إلى الكفاءة الحسابية من خلال فحص أداء التدريب والاستدلال على بطاقة NVIDIA RTX 3050 ذات ذاكرة 6 جيجابايت. استغرقت عملية التدريب حوالي 3.2 ساعات لمدة 60 عصرا. جاء زمن استجابة الاستدلال بمعدل 0.45 مللي ثانية لكل جزء مكون من 180 عينة، مما يجعل الاستخدام في الوقت الحقيقي ممكنا. استهلاك الذاكرة على بطاقة الرسوميات بلغ ذروته عند 4.2 جيجابايت، ويحتوي الطراز على 1.8 مليون معلم فقط، لذا يشعر أنه خفيف الوزن مقارنة بمعظم إعدادات تخطيط القلب المعتمدة على المحولات.
تتضمن عملية التدريب والاستدلال الخطوات التالية:
إعداد التدريب: يتم تعريف معايير التدريب مثل معدل التعلم، حجم الدفعة، والفترات الزمنية (epochs).
تدريب النماذج: يتم تدريب نموذج CNN-Transformer على بيانات التدريب.
التحقق: بعد التدريب، يتم فحص دقة وخسارة التحقق من النموذج. إذا كان الأداء جيدا، يتم إنقاذ النموذج. إذا كان الأداء ضعيفا، يتكرر خط الأنابيب مع معلمات تدريب مختلفة، ثم يعود إلى خطوة إعداد المعلمات.
بنية النماذج
يتكون نظام CNN-Transformer بالكامل من أربعة أجزاء رئيسية: استخراج الميزات الالتفافية، طبقة إسقاط، مشفر المحول، وأخيرا رأس التصنيف. تبدأ الكتلة الالفافية بطبقة الالتفافية أحادية البعد تحتوي على 32 مرشحا، وحجم نواة 3، وخطوة 1، وحشوة بمقدار 1، تليها ReLU. يقلل من الأمور مع أقصى تجمع، حجم النواة 2، لتقليل الدقة الزمنية للإشارة. بعد تلك الطبقة الالفافية الأولى، هناك واحدة أخرى بها 64 مرشحا، نفس حجم النواة 3، stride 1، الحشوة 1، ReLU مرة أخرى، وآخر تجميع أقصى بحجم 2. يتم تسطيح الناتج من كل هذا، ويمرر عبر طبقة إسقاط خطية تربط الميزات إلى فضاء تضمين ذي 128 بعد، والذي يغذي بعد ذلك المحول18,19.
تحتوي كتلة المحول على طبقتين مشفرتين، كل واحدة تحتوي على تركيز ذاتي متعدد الرؤوس باستخدام 4 رؤوس لالتقاط الاعتماديات طويلة المدى في إشارة تخطيط القلب الكهربائي. في كل طبقة، هناك شبكة تغذية متقدمة حسب الموقع بحجم مخفي 256 وانخفاض عند 0.5 للمساعدة في الإفراط في التركيب. يحدث تطبيع الطبقة بعد كل طبقة فرعية، مما يثبت التدريب.
بالنسبة لرأس التصنيف، هو طبقة متصلة بالكامل تنخفض من 128 إلى 64، تليها ReLU ونقطة انقطاع 0.5 مرة أخرى. ثم طبقة الإخراج تحتوي على خمسة عصبونات لفئات اضطراب النظم، مع Softmax للحصول على الاحتمالات.
كتل الشبكة العصبية الالفافية أحادية الأبعاد (CNN):
تتكون كتلة CNN من طبقتين التفافيتين أحادية البعد، كل واحدة تليها تفعيل ReLU وطبقة تجميع قصوى. تساعد هذه الطبقات في تحديد العلاقات المكانية داخل إشارة تخطيط القلب المدخلة. لتعزيز استخراج الميزات، يتم تطبيق وظائف تفعيل إضافية ل ReLU بعد كل خطوة تحويل في طبقات CNN.
الطبقة الالفافية الأولى: تستخدم هذه الطبقة 32 مرشحا، كل منها بحجم 3، على إشارة الإدخال. يمكن كتابة العملية كما يلي:

حيث yi هو المخرج، wj يمثل أوزان المرشح، xi+j هو مقطع الإدخال، b هو مصطلح التحيز، و σ يمثل دالة التفعيل (ReLU). تمر خريطة الميزات الناتجة عبر طبقة تفعيل ReLU لإضافة غير خطية:

طبقة التجميع: بعد كل عملية التفافية، يتم تطبيق خطوة تجميع قصوى لتقليل الأبعاد المكانية إلى النصف. تعرف هذه العملية بأنها:

يساعد ذلك في الحفاظ على أهم الميزات مع تقليل الحمل الحسابي.
الطبقة الالتفافية الثانية: تستخدم هذه الطبقة 64 مرشحا بحجم 3 × 3 لمعالجة خرائط الميزات من الطبقة السابقة، مما يسمح للنموذج باكتشاف أنماط أكثر تعقيدا. بعد الالتفاف، يتم تطبيق دالة تفعيل ReLU لإدخال اللاخطية في النموذج.

تضمن هذه الخطوة أن يلتقط النموذج أنماطا مفصلة من إشارة تخطيط القلب الكهربائي.
طبقات التنشيط الإضافية: يتم تطبيق تفعيل ReLU بعد كل خطوة بعد عملية الالتفاف لمساعدة الشبكة على التقاط الأنماط المعقدة بشكل أفضل، مما يضمن تركيز النموذج على التفعيلات الإيجابية.
عملية التسطيح: بعد عملية التجميع القصوى الثانية، يتم تسطيح خرائط الميزات إلى متجه واحد لإدخال كتلة المحول.
كتل المحولات:
تتكون كتلة المحول من طبقتين من التركيز الذاتي متعدد الرؤوس، مما يساعد النموذج على فهم العلاقات بين أجزاء مختلفة من إشارة تخطيط القلب مع مرور الوقت. يعمل التركيز الذاتي متعدد الرأس من خلال النظر إلى كل زوج من العناصر في التسلسل. بالنسبة لتسلسل يحتوي على استعلام Q، مفتاح K، وقيمة V، يحسب الانتباه كالتالي:

هنا، dk هو أبعاد المتجهات الرئيسية، مما يضمن ثبات المقياس.
طبقات التغذية الأمامية: كل مخرج تركيز ذاتي يمر عبر شبكة تغذية متقدمة متصلة بالكامل مع تفعيل ReLU، يليه تطبيع الطبقة. تقوم هذه الخطوة بتحسين الميزات الزمنية المستخرجة:

حيث W1 و b1 هما الأوزان والتحيزات لطبقة التغذية الأمامية.
تمثيل الدفعة الأولى: يعمل المحول على تسلسلات في ترتيب الدفعة أولا، مما يضمن التوافق مع تنسيق إدخال كتلة CNN.
الطبقات المتصلة بالكامل (الكثيفة):
بعد المعالجة عبر كتلة المحول، يتم تسطيح تسلسل الإخراج ثم إرساله عبر طبقتين متصلتين بالكامل لإجراء التصنيف. تحول الطبقة الأولى المتصلة بالكامل المتجه المدخل إلى فضاء ميزات ذي 128 بعد، وتعيد تشكيله في العملية.

حيث W هو مصفوفة الوزن، x هو المتجه المدخل، وb هو متجه التحيز. يتم تطبيق طبقة تفعيل ReLU التالية:

تتبع طبقة انحدار بمعدل 0.5 لمنع التركيب الزائد.
الطبقة الثانية المتصلة بالكامل: تربط الطبقة الأخيرة الميزات ذات ال128 بعدا بعدها بعدها بعدها بعدد فئات نبض القلب (مثل 5 فئات لاكتشاف اضطرابات النظم). يمر الناتج عبر دالة log-SoftMax لحساب احتمالات لوغاريتم: exp(xi)
نموذج هجين CNN-Transformer
النموذج المعروض هو نموذج هجين للتعلم العميق يجمع بين نقاط قوة CNNs والمحولات لاستخدام التمثيلات المكانية والزمانية معا. تم تعديل هذه البنية خصيصا لمعالجة البيانات المعقدة والطويلة التسلسل مثل الإشارات الفسيولوجية.

تمثل المعادلة تمثيل المدخلات، حيث N = عدد العينات، T = عدد خطوات الزمن، d = بعد الميزة لكل خطوة زمنية.

تشير هذه المعادلة إلى التضمينات الموضعية، حيث pos = الموقع بالتسلسل؛ i = مؤشر أبعاد التضمين.
وحدة CNN – استخراج الميزات المحلية
تتعلم شبكات CNN بكفاءة التبعيات المحلية والأنماط الشكلية مثل القمم والمنحدرات أو الارتفاعات في البيانات المتسلسلة. تستخدم
الطبقة الالتفافية نوى ذات امتداد
مكاني فوق موتر
مدخل. يتم تحديد كل قناة إخراج m بخلال:

= عدد قنوات الإدخال؛ K = حجم النواة؛ W = أوزان المرشح؛ b = انحياز
دالة ReLU
في هذه الحالة،
يمثل الوزن القابل للتعلم و
هو الانحياز للقناة mA، يتم تطبيق التنشيط غير الخطي، مثل الوحدة الخطية المصححة (ReLU):

التجميع وضغط الميزات
تجمع طبقات تقلل من البعد المكاني أو الزمني لخرائط الميزات، مما يحافظ على الميزات المهمة ويقلل من الحساب. في أقصى تجمع مع حجم
النافذة وخطوات الدرع، الميزة المجمعة في الموقع
هي:

طول الإخراج بعد التجميع

حيث
هو طول الإدخال؛ الخطوة تحدد حجم خطوة لتحريك نافذة التجميع. تحسب هذه الصيغة طول خريطة الميزات بعد عملية تجميع (مثل التجميع القصوى). يحسب مدى تصغير خريطة الميزات بناء على طول الإدخال، حجم المجموعة، وسرعة التقدم. يحول خرائط الميزات متعددة الأبعاد إلى متجه للطبقات المتصلة بالكامل.
مشفر المحول – التقاط التبعيات طويلة المدى
تستخدم المحولات الانتباه الذاتي لتعلم الاعتماديات الزمنية طويلة المدى في التسلسلات17.
الانتباه المتوسع لضرب النقاط

Q، K، V هي مصفوفات الاستعلام والمفتاح والقيم التي يتم حسابها من خلال الإسقاطات المتعلمة؛
هو البعد الرئيسي المستخدم لقياس حاصل الضرب النقطي.
انتباه متعدد الرؤوس

كل رأس يحسب الانتباه بشكل مستقل؛ يتم دمج المخرجات وتحويلها خطيا.
هي مصفوفات إسقاط متعلمة لكل رأس.
هو الوزن النهائي للإسقاط بعد الربط18,19.
التوقع النهائي والخسارة
تقوم الطبقات المتصلة بالكامل بتحويل الميزات إلى logits، والتي تتحول بعد ذلك إلى تنبؤات باستخدام دوال التفعيل. بعد بعض الطبقات الالتفافية والتجميع،
يتم تسطيح الطبقة المتصلة بالكامل
بحساب اللوجيتات: ثم تحسب طبقة متصلة بالكامل لوجيتات الفئة:

تفعيل السيجمويد/سوفتماكس:

تقوم دالة التفعيل بتحويل الناتج الخام 'z' للنموذج إلى الاحتمالات. يستخدم السيجمويد على التصنيف الثنائي، وSoftmax لمشاكل الفئات المتعددة لتوزيع الاحتمالات عبر الفئات. z هو الناتج الخطي (مثلا، الطبقة الأخيرة: z = Wx + b). الخرج ŷ بين (0, 1)، مما يدل على احتمال20.
عملية التدريب
تم إجراء التدريب على نظام بمواصفات الأجهزة التالية:
المعالج: AMD Ryzen 7 7840HS
ذاكرة المعالج: 16 جيجابايت
ذاكرة الوصول العشوائي للبطاقة الرسومية: 6 جيجابايت NVIDIA GeForce RTX 3050
تم تدريب النماذج باستخدام محسن آدم، الذي يضبط معدل التعلم أثناء التدريب بناء على اللحظتين الأولى والثانية من التدرج. قاعدة التحديث لآدم تعطى بقول:

في هذا الترتيب، يمثل mt و vt تقديرات اللحظة الأولى والثانية، α هو معدل التعلم، و ε هو ثابت صغير يستخدم لمنع القسمة على الصفر. تم تدريب النماذج لمدة 60 حقبة، مع توقف مبكر لمنع الإفراط في التركيب. تم استخدام حجم دفعة 1024، وتم تحميل بيانات التدريب في النماذج باستخدام DataLoader الخاص ب PyTorch. تم دمج التوقف وتطبيع الدفعات لتنظيم النموذج وتسريع التقارب. الانسحاب هو طريقة تنظيمية تقوم بإيقاف نسبة p من الخلايا العصبية بشكل عشوائي أثناء التدريب، مما يساعد في تقليل فرط التوافق. رياضيا، لنفترض أن zi يدل على تنشيط الخلية العصبيةi. خلال مرحلة التدريب، يتم حساب التفعيل المعدل z' كما يلي:

حيث p هو معدل الانسحاب (مثلا، p = 0.5 لنسبة 50٪ من الانسحاب). أثناء الاستدلال، لا يتم تطبيق انقطاع، ويتم استخدام الشبكة الكاملة.
التقارب في الشبكات العصبية هو مشكلة تؤثر بشكل كبير على أنظمة التصنيف القائمة في قطاع الرعاية الصحية، خاصة عندما تكون التشخيصات غير متسقة بسبب عدم كفاية التقارب. أظهرت الأبحاث الحديثة حول أساليب التحسين في الوقت المحدد مسبقا والتقارب في زمن ثابت أنه لا يزال من الممكن تدريب نماذج تتقارب ضمن عدد ثابت من التكرارات لجميع الحالات الأولية. النماذج المستقبلية المبنية على هذا النموذج يمكن أن تشمل تحسينا في الوقت المحدد مسبقا.
تطبيع الدفعات:
التطبيع الدفعي يثبت التدريب ويسرع من خلال تطبيع المدخلات لكل طبقة. عند إعطاء دفعة صغيرة من التفعيلات x = {x1, x2, . . ., xN}، فإن الناتج المعدل الدفعي xi .يتم حسابه كالتالي:


حيث μB و σB2 هما متوسط وتباين الدفعة، ε ثابت صغير للاستقرار العددي، و γ β هما معلمات قابلة للتعلم تتغير وتغير القيم المطبعة. يساعد التطبيع الدفعي في تقليل التغير الداخلي ويتيح استخدام معدلات تعلم أعلى. تضمن هذه التقنيات، إلى جانب محسن آدم، تدريبا قويا من خلال التخفيف من فرط التركيب وتحسين سرعة التقارب21,22.
يوضح الشكل 3 فقدان التحقق ودقة التحقق عبر العصور أثناء تدريب نموذج تعلم الآلة. تبدأ دقة التحقق (الخط الأزرق، محور Y الأيمن) منخفضة نسبيا (حوالي 97.5٪) وتزداد بسرعة خلال أول عشر عصور. يستمر في التحسن ويصل إلى مستويات تتراوح بين 99.7٪ إلى 99.8٪ بعد حوالي 20 حقبة. هذا يشير إلى أن النموذج يتعلم ويطبق المعرفة بشكل جيد على مجموعة التحقق. خسارة التحقق (الخط الأحمر، محور Y الأيسر) تبدأ مرتفعة، ثم تنخفض بشكل حاد إلى ما يقرب من الصفر خلال العصور الأولى (حوالي 2 إلى 3). بعد ذلك، تبقى النسبة شبه صفر لبقية التدريب23.24.