تجرى جميع التجارب على منصة Google Colab (A100 مع 40 جيجابايت رام RAM). لإجراء التجارب، تم جمع مفاتيح API (بطاقات النماذج) لLlama2-7B وMistral-7B وDolly-7B من موقع Hugging Face.
ينقسم البروتوكول إلى ثلاثة أجزاء. أولا، بناء مجموعة بيانات تعمل كأساس لتقييم التحيز الاجتماعي في نماذج اللغة الكبيرة (LLMs). ثم صمم اثني عشر مغيرا مميزا للمحفز، متوافقة مع العمل الذي قام به كمرزمان وكيم38 للتحقيق في وجود التحيز الاجتماعي في الاستدلالات التي تولدها نماذج اللغة الكبيرة (LLMs). ثم قم بضبط نماذج اللغة الكبيرة على مجموعة بيانات من الجمل غير المتحيزة المتعلقة بالعرق والدين والجنس والمهنة، واستكشفها ....