تشمل المقاييس الأكثر شيوعا لتقييم أداء النموذج في تحليلات التعلم الآلي الدقة والدقة والاستدعاء ودرجة F1. الدقة هي النسبة المئوية الإجمالية لتنبؤات النموذج الصحيحة ، بالنظر إلى البيانات الحقيقية. الدقة هي النسبة المئوية للتنبؤات الإيجابية للنموذج الإيجابية بالفعل (أي المعدل الإيجابي الحقيقي) ، بينما الاستدعاء هو النسبة المئوية للإيجابيات الحقيقية في البيانات الأصلية التي يستطيع النموذج التنبؤ بها بنجاح. درجة F1 هي المتوسط المرجح للدقة والاستدعاء وتعمل كمقياس بديل للدقة يكون أكثر قوة لعدم التوازن في الطبقة. ومع ذلك ، يختلف Ivis عن خوارزميات التعلم الآلي الأخرى شائعة الاستخدام في أن مخرجاته ليست ثنائية. بالنظر إلى مدخلات معينة من voxels الدماغ ، يمثل كل عنصر إخراج الاحتمالات المقابلة لكل فئة من الفئات. تتطلب دقة الحوسبة والدقة والاستدعاء و F1 لهذه المخرجات تزويدها بطريقة "الفائز يأخذ كل شيء" ، حيث تم اعتبار الفئة ذات الاحتمال الأعلى هي الفئة المتوقعة لهذا الحجم. ألغى هذا النهج معلومات مهمة حول ترتيب هذه الاحتمالات التي كانت ذات صلة بتقييم جودة النموذج. وبالتالي ، بينما ما زلنا نحسب هذه المقاييس التقليدية ، استخدمنا درجة متوسط دقة تصنيف التسمية (LRAP) كمقياس أساسي لحساب دقة النموذج في مجموعة الاختبار. يقيس هذا المقياس بشكل أساسي إلى أي مدى قام المصنف بتعيين احتمالات أعلى للتسميات الحقيقية37.
بدرجات متفاوتة ، كان مصنف الشبكة العصبية ناجحا لكل من البشر. بالنسبة للبشر ، تمكنت الخوارزمية من تصنيف كل من الأشياء والإجراءات ، مع نماذج من ثلاث فئات لكليهما تحقق متوسط دقة 70٪. تم استخدام درجة LRAP كمقياس أساسي لحساب دقة النموذج في مجموعة الاختبار. يقيس هذا المقياس مدى تعيين المصنف لاحتمالات أعلى للتسميات الحقيقية37. بالنسبة لكلا الشخصين ، كان متوسط درجات LRAP أكبر من النسبة المئوية 99 لمجموعة من التسميات التي تم تغييرها عشوائيا لجميع النماذج التي تم اختبارها (الجدول 1 ؛ الشكل 2). بالنسبة للكلاب ، كان لنموذج العمل فقط رتبة مئوية متوسطة LRAP أكبر بكثير من الفرصة في كلا المشاركين (الجدول 1 ؛ ص = 0.13 للكائنات و p < 0.001 للإجراءات ؛ يعني درجة LRAP لنموذج العمل المكون من ثلاث فئات للكلاب = 78 بالمائة). كانت هذه النتائج صحيحة لجميع الموضوعات بشكل فردي ، وكذلك عند تجميعها حسب الأنواع.
نظرا لنجاح المصنف ، قمنا بالتدريب واختباره باستخدام فئات إضافية لتحديد حدود النموذج. وشمل ذلك حساب مصفوفات الاختلاف لكامل 52 فئة محتملة ذات أهمية باستخدام خوارزمية التجميع الهرمي لحزمة Python scipy ، والتي تجمعت الفئات بناء على تشابه استجابة دماغ الفرد لكل منها ، كما هو محدد من خلال الارتباط الزوجي. من بين النماذج الإضافية التي تم اختبارها ، كان النموذج الذي حصل على أعلى تصنيف متوسط للنسبة المئوية ل LRAP في كلا الكلبين يحتوي على خمس فئات: "التحدث" الأصلي ، و "الأكل" ، و "الاستنشاق" ، بالإضافة إلى فئتين جديدتين ، "الملاعبة" و "اللعب" (الشكل 2). كان لهذا النموذج متوسط رتبة LRAP المئوية أكبر بكثير من تلك التي تنبأت بها الصدفة لجميع المشاركين (الجدول 1 ؛ ص < 0.001 لكل من والبشر. متوسط درجة LRAP لنموذج العمل المكون من خمس فئات للكلاب = 81 بالمائة).
عند تعيينها مرة أخرى إلى أطالس الدماغ الخاصة بهم ، كشفت درجات أهمية الميزة للفوكسل عن عدد من مجموعات الفوكسل الإعلامية في القشرة القذالية والجدارية والزمنية لكل من والبشر (الشكل 3). في البشر ، كشفت النماذج القائمة على الكائنات والقائمة على العمل عن نمط أكثر تركيزا من وفي المناطق المرتبطة عادة بالتعرف على الأشياء ، على الرغم من وجود اختلافات طفيفة في الموقع المكاني للفوكسل المستندة إلى الكائنات والفوكسل القائم على العمل.
لقد تحققنا من أن هذه الاختلافات في الأنواع لم تكن نتيجة لحركة المرتبطة بالمهام التي تتحرك إلى بعض أنواع مقاطع الفيديو أكثر من غيرها (على سبيل المثال ، مقاطع فيديو أخرى غير ، على سبيل المثال ، السيارات). قمنا بحساب المعيار الإقليدي لمعلمات الحركة الست وقمنا بتركيب نموذج خطي مختلط التأثيرات باستخدام حزمة R lme4 ، مع فئة كتأثير ثابت ورقم تشغيل كتأثير عشوائي لكل. لكل نموذج من النماذج النهائية ، لم نجد أي تأثير كبير لنوع الفئة على الحركة إما لديزي (F (2 ، 2252) = 0.83 ، ص = 0.44 للكائن و F (4 ، 1235) = 1.87 ، ص = 0.11 للقائم على العمل) أو بوبو (F (2 ، 2231) = 1.71 ، ص = 0.18 للكائنات و F (4 ، 1221) = 0.94 ، ص = 0.45 للقائم على العمل).

الشكل 1: مقاطع فيديو طبيعية وعرض تقديمي في تجويف التصوير بالرنين المغناطيسي. (أ) أمثلة على إطارات من مقاطع الفيديو المعروضة للمشاركين. (ب) بوبو ، بوكسر ميكس يبلغ من العمر 4 سنوات ، يشاهد مقاطع الفيديو أثناء خضوعه للرنين المغناطيسي الوظيفي المستيقظ. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

الشكل 2: أداء النموذج في والبشر. توزيع درجات LRAP ، المقدمة كتصنيفات مئوية لتوزيعاتها الفارغة ، أكثر من 100 تكرار للتدريب واختبار خوارزمية التعلم الآلي Ivis لنموذج قائم على كائنات من ثلاث فئات ، ونموذج قائم على عمل من ثلاث فئات ، ونموذج قائم على العمل من خمس فئات ، حيث حاولت النماذج تصنيف استجابات BOLD لمحفزات الفيديو الطبيعية التي تم الحصول عليها عبر استيقظ الرنين المغناطيسي الوظيفي في والبشر. يتم تجميع الدرجات حسب الأنواع. تشير درجة LRAP ذات الترتيب المئوي المرتفع جدا إلى أنه من غير المرجح أن يحقق النموذج درجة LRAP عن طريق الصدفة. النموذج الذي لا يؤدي أفضل من الصدفة سيكون له متوسط تصنيف النسبة المئوية لدرجة LRAP ~ 50. تمثل الخطوط المتقطعة متوسط الترتيب المئوي لدرجة LRAP لكل نوع عبر جميع عمليات التشغيل ال 100. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

الشكل 3: المناطق المهمة للتمييز بين نماذج العمل المكونة من ثلاث فئات وخمس فئات. (أ) المشاركون البشريون و (ب). تم تصنيف Voxels وفقا لأهمية ميزتها باستخدام مصنف غابات عشوائي ، تم حسابه في جميع تكرارات النماذج. يتم تقديم أعلى 5٪ من voxels (أي تلك المستخدمة لتدريب النماذج) هنا ، ويتم تجميعها حسب الأنواع وتحويلها إلى مساحة جماعية لأغراض التصور (الأطالس: البشر3435). تظهر الملصقات مناطق دماغ ذات درجات أهمية عالية للميزات ، بناء على تلك التي حددها جونسون وآخرون 35. الاختصار: SSM = التلفيف فوق البراسيلفي. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.
| نوع النموذج | دقة التدريب | دقة الاختبار | نتيجة F1 | دقة | استذكر | متوسط النسبة المئوية لدرجة LRAP |
| الإنسان 1 | كائن (3 فئات) | 0.98 | 0.69 | 0.48 | 0.52 | 0.49 | >99 |
| أكشن (3 فئات) | 0.98 | 0.72 | 0.51 | 0.54 | 0.54 | >99 |
| أكشن (5 فئات) | 0.97 | 0.51 | 0.28 | 0.37 | 0.27 | >99 |
| الإنسان 2 | كائن (3 فئات) | 0.98 | 0.68 | 0.45 | 0.5 | 0.47 | >99 |
| أكشن (3 فئات) | 0.98 | 0.69 | 0.46 | 0.5 | 0.48 | >99 |
| أكشن (5 فئات) | 0.97 | 0.53 | 0.3 | 0.4 | 0.27 | >99 |
| بوبو | كائن (3 فئات) | 0.99 | 0.61 | 0.38 | 0.41 | 0.39 | 57 |
| أكشن (3 فئات) | 0.98 | 0.63 | 0.38 | 0.4 | 0.4 | 87 |
| أكشن (5 فئات) | 0.99 | 0.45 | 0.16 | 0.29 | 0.13 | 88 |
| زهر اللؤلؤ | كائن (3 فئات) | 1 | 0.61 | 0.38 | 0.43 | 0.39 | 43 |
| أكشن (3 فئات) | 0.97 | 0.62 | 0.35 | 0.38 | 0.35 | 60 |
| أكشن (5 فئات) | 0.99 | 0.44 | 0.16 | 0.27 | 0.13 | 76 |
الجدول 1: المقاييس المجمعة لخوارزمية التعلم الآلي Ivis أكثر من 100 تكرار للتدريب والاختبار على استجابات BOLD لمحفزات الفيديو الطبيعية التي تم الحصول عليها عبر الرنين المغناطيسي الوظيفي المستيقظ في والبشر. كانت نماذج الكائنات تحتوي على ثلاث فئات مستهدفة ("" ، "إنسان" ، "سيارة") ، وكانت نماذج الحركة إما ثلاث أو خمس فئات (ثلاث فئات: "التحدث" ، "الأكل" ، "الاستنشاق" ؛ خمس فئات: "التحدث" ، "الأكل" ، "الاستنشاق" ، "الملاعبة" ، "اللعب"). تظهر القيم الأكبر بكثير من الصدفة بالخط العريض.
الجدول التكميلي 1: تسميات الفئة. الرجاء النقر هنا لتنزيل هذا الملف.
الفيلم التكميلي 1: عينة من مقطع الفيديو. الرجاء النقر هنا لتنزيل هذا الملف.