مقالة بحثية

تعزيز العدالة في نماذج اللغة الكبيرة لتطبيقات الذكاء الاصطناعي السريري من خلال الضبط الدقيق والتوجيه

DOI:

10.3791/69132

يناير 2, 2026

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تواجه نماذج اللغة الكبيرة الخاصة بالرعاية الصحية تحديات أخلاقية وتقنية، حيث تعكس مثل نماذج اللغة الكبيرة الأخرى التحيزات الكامنة في بيانات تدريبها. يتحقق البروتوكول المعروض هنا من قمع أربعة أنواع من التحيز (الجنس، العرق، المهنة، الدين) باستخدام متغيرات المحفز عبر ثلاثة نماذج مفتوحة المصدر.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يتم تطبيق نماذج اللغة الكبيرة (LLMs) بشكل متزايد على مجالات حساسة مثل الرعاية الطبية، والتي تطرح تحديات تقنية وأخلاقية متعددة. تشمل القضايا الأكثر إلحاحا التحيزات المدمجة في هذه النماذج، والتي تم تدريبها على مجموعات بيانات كبيرة قد تعكس تحاملات المجتمع. يمكن أن تؤدي هذه التحيزات إلى نتائج غير عادلة أو غير قابلة للتعميم أو حتى ضارة، مما يجعلها غير قابلة للتطبيق سريريا في العالم الحقيقي وغير متوافقة مع القيود الأخلاقية والتنظيمية. نفحص مدى فعالية كبت التحيز عندما يتم تحفيز النماذج المضبوطة بدقة عبر أربع فئات حاسمة (الجنس، العرق، المهنة، والدين). نقوم بتنظيم مجموعة بيانات استدلالية متنوعة يدويا وننشئ اثني عشر متغير من نوع الأوامر — ستة منها غير متحيزة — لاختبار مخرجات ثلاثة نماذج كبيرة مفتوحة المصدر: Llama2-7B، Mistral-7B، وDolly-7B. يتم تقييم العدالة وقابلية التفسير للمخرجات باستخدام مقياس تقييم التحيز، حيث تشير الدرجات المنخفضة إلى عدالة وتفسير أفضل. نلاحظ أيضا أن المحفزات غير المتحيزة تقلل من الانحياز، وضبط النموذج الدقيق يؤدي بشكل أفضل. تؤكد النتائج على الأهمية الحاسمة للعمل في الوقت المناسب، ومتانة النماذج، والتدقيق الأخلاقي المستمر لنشر نماذج اللغة الكبيرة الموثوقة والعادلة في بيئات واقعية، مثل التصوير الطبي، وصيانة السجلات الصحية الإلكترونية (EHR).

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تتميز نماذج اللغة الكبيرة بصدى هائل كأدوات لدعم المهام المتنوعة، بما في ذلك اتخاذ القرار 1,2، توليد النصوص3، ترجمة النصوص4، تحليل مشاعر العملاء5، الإجابة على الأسئلة6، وتوليد التقارير السريرية7. حدثت عدة حالات في الآونة الأخيرة استخدمت فيها التطبيقات نماذج اللغة الكبيرة لإنتاج محتوى يضر بالأفراد أو المجموعات الاجتماعيةالمحرومة 8,9,10. السبب الرئيسي وراء هذه الردود المبتذلة هو أن هذه النماذج مدربة على مجموعات بيانات تحتوي بطبيعتها على تحيزات مجتمعية مرتبطة بالعرق أو الجنس أو الطبقة الاجتماعية والاقتصادية وعوامل مشابهة. لكن ما تعنيه ب "التحيز" و"العدالة" في نظام الذكاء الاصطناعي في الرعاية الصحية يمكن أن يكون ذاتيا ويعتمد على السياق. بذل الباحثون جهدا كبيرا للتخفيف من التحيزات الاجتماعية في نماذج اللغة الكبيرة11، 12؛ ومع ذلك، لا يزال هناك حاجة لمزيد من التحسين. اقترح الباحثون استراتيجيات متعددة للتخفيف من الانحيازات، يمكن تصنيفها كمعالجة مسبقة، أثناء المعالجة، ما بعد المعالجة، أو تركيبات منها، عبر مجموعة متنوعة من التطبيقات. يعتمد هذا التصنيف على المرحلة التي يتم فيها اتخاذ إجراء التخفيف. يجمع هذا البروتوكول بين الاستراتيجيات الثلاث لمعالجة التحيز الاجتماعي وتخفيفه في ستة أنواع من نماذج اللغة الكبيرة ويبحث في تقليل التحيز عبر أربعة أبعاد للتحيز الاجتماعي: الجنس، والمهنة، والعرق، والدين. أولا، يتم تطوير مجموعة بيانات استدلالية باستخدام تقنية تعزيز البيانات لتمكين نماذج اللغة الكبيرة من توليد الاستنتاجات. ثانيا، تم تصميم اثني عشر نوعا من المحفزات لإثارة ردود نمطية من نماذج اللغة الكبيرة (LLM). ثالثا، تم ضبط Llama-2-7B13، Mistral-7B14، وDolly-7B15 بدقة على مجموعة بيانات تحتوي على جمل غير متحيزة عبر الفئات الاجتماعية الأربع: الجنس، العرق، المهنة، والدين، ليتم ضبط Llama-2-7Bبدقة، وMistral-7B مضبوطة بدقة، وDolly-7B مضبوطةبدقة، على التوالي. وأخيرا، يتم استخلاص الاستنتاجات من خلال تحفيز نماذج اللغة الكبيرة المضبوطة بدقة على دراسة فعاليتها في تقديم ردود عادلة.

قمنا بصياغة الأسئلة البحثية التالية وتناولناها في هذه الورقة. لكل سؤال بحثي مصاغ (RQ)، تم صياغة فرضية صفرية (H0) وفرضية بديلة (H1).

RQ1: هل مجموعة بيانات الاستدلال وتقنيات التوجيه الأساسية فعالة في تقييم التحيزات المجتمعية في نماذج اللغة الكبيرة (LLMs)؟ الفرضية الصفرية (H01): درجات التحيز المستمدة من مجموعة بيانات الاستدلال عند دمجها مع المحفزات الأساسية لا يمكن تمييزها إحصائيا عن درجات التحيز الأساسي لنماذج اللغة الكبيرة. الفرضية البديلة (H11): درجات التحيز من مجموعة بيانات الاستدلال مع المحفزات الأساسية تختلف بشكل دلالي إحصائيا عن درجات التحيز الأساسي لنماذج اللغة الكبيرة (LLMs). لاختبار الفرضية، تم اختيار مجموعة بيانات تسمى NeutralSet عن طريق تعديل StereoSet16 وتقييم كل نموذج لغوي كبير باستخدام تقنيات التوجيه الأساسية لتقييم قدرته على إنتاج ردود غير نمطية. في بيئاتنا، ندرج ستة مطالبات أساسية -- المعيار (موجه صفر الطلقة لتوجيه النموذج الكبير لاستنتاجات)، سلسلة الأفكار (CoT مصمم لطلب النموذج الكبير التفكير خطوة بخطوة لاستنتاج النتائج)، System1 (طلب يسمح للنموذج بالتفكير بسرعة أثناء الإجابة)، System2 (طلب لجعل النموذج يفكر ببطء وبتفكير)، الشخصية البشرية 1 (HP1 مصمم لجعل النموذج يتبنى هوية الإنسان الذي يفكر بسرعة أثناء اتخاذ القرارات)، وHuman Persona 2 (HP2 مصمم لجعل LLM يتبنى الهوية البشرية التي تفكر ببطء وبتفكير أثناء الإجابة).

RQ2: هل تقنيات تحفيز إزالة التحيز فعالة في كشف وتخفيف التحيزات المجتمعية في نماذج اللغة الكبيرة (LLMs)؟ فرضية الصفر (H0₂): تقنيات تحفيز إزالة التحيز غير فعالة في كشف وتخفيف التحيزات المجتمعية في نماذج اللغة الكبيرة (LLMs). فرضية بديلة (H12): تنخفض درجات التحيز المقاسة بشكل كبير عند استخدام تقنيات التحفيز غير التحيزي في نماذج اللغة الكبيرة (LLM). نبحث في تأثير النسخ غير المتحيزة من المحفزات الأساسية على ثلاثة نماذج لغوية مفتوحة المصدر لتحقيق توليد نصوص عادل وخالي من أي تمييز اجتماعي.

RQ3: هل يمكن تقليل الانحيازات المجتمعية أكثر من خلال ضبط نماذج اللغة الكبيرة بدقة؟ فرضية الصفر (H03): ضبط نماذج اللغة الكبيرة الدقيق لا يقلل من التحيزات المجتمعية أكثر من التخفيضات التي تتحقق من خلال تقنيات التحفيز فقط. فرضية بديلة (H13): ضبط نماذج اللغة الكبيرة بدقة يقلل أكثر من التحيزات المجتمعية التي تتجاوز التخفيضات التي تتحقق من خلال تقنيات التحفيز فقط. للإجابة على هذا السؤال، نقوم بتعديل مجموعة البيانات17 وضبط نماذج اللغة الكبيرة عليها لتقييم تأثير الضبط الدقيق في تقليل استجابات الصور النمطية.

يوضح الشكل 1 تأثير تباين المحفزات وضبط نماذج اللغة الكبيرة على النتيجة المتوقعة المحايدة جنسيا. تكمن حداثة عملنا من دمج التنظيم اليدوي لمجموعات البيانات، واستراتيجيات متعددة لإزالة التحيز المحفز، والضبط الدقيق تحت بروتوكول واحد لتحليل نموذج اللغة الكبيرة لتحديد التحيز المجتمعي وتخفيفه، وهو أمر ذي صلة بالتطبيقات الحساسة في العالم الحقيقي مثل التصوير الطبي وصيانة السجلات الصحية الإلكترونية. قمنا بتجميع الأدبيات المتعلقة بالتحيز في نماذج اللغة الكبيرة في أربعة وجهات نظر: مجموعات بيانات للتحيز والارتباطات المعرفية؛ أطر اكتشاف وتقييم التحيز؛ طرق التخفيف من التحيز؛ والتحيز في المجالات المتخصصة.

يواصل الباحثون توليد مجموعات بيانات لتمكين تقييم التحيز وتحليل الارتباط الدلالي في نماذج اللغة الكبيرة (LLMs). على سبيل المثال، في علم النفس المعرفي واللسانيات، تكون الارتباطات الحرة دائما محورية في تنظيم المعرفة المفاهيمية. محاكاة نفس الارتباط في التوزيع الكامن لنماذج اللغة الكبيرة، قام أبرامسكي وآخرون 18 ببناء مجموعة بيانات باسم عالم الكلمات لنماذج اللغة الكبيرة (LWOW). مجموعة بيانات معايير الارتباط الحر الإنجليزية LWOW، التي تضم ملايين الردود من ثلاثة نماذج لغوية كبيرة: Mistral-7B14، Llama-3.1-8B19، وكلود-3-5-هايكو-أحدث20. يستلهم هذا الكتاب من كتاب Small World of Words (SWOW)21، أكبر مجموعة بيانات لمعايير الارتباط الحر للإنجليزية البشرية، والذي استخدم على نطاق واسع في مجموعة متنوعة من الأبحاث النفسية واللغوية. علاوة على ذلك، يساعد LWOW في بناء شبكة معرفية تتكون من عقد، كل منها يمثل كلمة، مع عقد تتوافق مع كلمات متشابهة دلاليا وأقرب إلى بعضها في الشبكة. يساعد ذلك في تقييم التحيز في مخرجات نماذج اللغة الكبيرة من خلال تقدير المسافة بين الكلمات في الشبكة المعرفية الاصطناعية كمقياس رئيسي. إحدى العقبات الرئيسية في استخدام نماذج اللغة الكبيرة المملوكة هي أن مكوناتها الداخلية غير قابلة للوصول. على الرغم من الجهود الكبيرة التي بذلت في هذه النماذج لمعالجة التحيز، إلا أن مجموعات بيانات المحاذاة لا تزال نادرة. لمعالجة هذا القلق، تم اقتراح مجموعة بيانات تسمى GenderAlign في Zhang وآخرون 22 للتخفيف من التحيز الجندري في نماذج اللغة الكبيرة. يقترح UnStereoEval23، وهو مجموعة بيانات مرجعية، للتحقيق في التحيز النمطي للجندر في المهن والمشاعر. تكشف نتائجهم عن مستوى منخفض من العدالة عبر 28 نموذجا لغويا كبيرا. طور بارتل وليفي24 مجموعة بيانات تسمى Tiny Heap، حيث يتم استبدال الجمل التي تحتوي على إشارات نمطية بنظيراتها المحايدة وتعديل ثلاثة نماذج لغوية دقيقة (GPT-225، PHI-1.526، وRoBERTa27). في نتائجهم، لاحظوا انخفاضا كبيرا في ميول النماذج النمطية للجنس.

تم اقتراح عدة أطر متعددة الطبقات لتحديد وتخفيف التحيزات في نماذج اللغة الكبيرة (LLMs). في Raza وآخرين، تم اقتراح إطار عمل يسمى NBIAS يتكون من أربع طبقات: إنشاء مجموعات البيانات، تطوير النماذج، التخفيف من التحيز، والتقييم. تم بناء مجموعة البيانات ضمن الإطار من مجالات متنوعة، بما في ذلك الرعاية الصحية، وسائل التواصل الاجتماعي، وبوابات التوظيف. يظهرون فعالية نموذجهم من خلال التفوق على الأساس (BERT29) بنسبة 1٪ إلى 8٪ من حيث الإنصاف. في إطار عمل آخر من هذا النوع، GenderCARE30، يقترح استراتيجية للحد من التحيز الجندري في ماجستير اللغة الكبيرة. في إعدادهم التجريبي الموسع، خفضوا التحيز الجنسي بمعدل 35٪ تقريبا عبر اثني عشر نموذجا كبيرا مختلفا. يكتشف إطار عمل، BiasAlet31، التحيز الاجتماعي تلقائيا في النص المفتوح الذي تولده نماذج اللغة الكبيرة (LLMs). تأتي هذه الدراسة مع بعض القيود: أولا، تجرى الدراسة على مجموعة بيانات مركبة بسبب عدم توفر معيار لتقييم التحيز في توليد النصوص المفتوحة في نموذج اللغة الكبيرة، وثانيا، إنها مبنية على مجموعة بيانات قديمة تسمى SBIC32، مما يصعب التمييز بين أهمية التحيز الضمني والتحيز في مجموعة البيانات نفسها. قد يتم إدخال التحيز في البيانات التي يولدها الإنسان في نماذج مدربة عليها. استخدام مثل هذه النماذج مثير للجدل في الوظائف ذات المخاطر العالية، حيث قد يؤثر إنتاجها سلبا على الفئات المحرومة. ولمعالجة ذلك، تم تصميم إطار عمل يدعى BiasBuster33 لاكتشاف وتقييم وتخفيف التحيز المعرفي في نماذج اللغة الكبيرة. وبما يتماشى مع ذلك، يقترح الباحثون في عمل آخر34 إطارا تفاعليا لتوليد نص عادل ومنطقي ونقدي من خلال محفزات النظام 2 (المصممة لتمكين النموذج الكبير من التفكير بتفكير وببطء) تكمل المحفزات المصقولة والدلالية. ومع ذلك، يقتصر الإطار على المهام ضمن الفضاء الكامن لنماذج اللغة الكبيرة. طور دونغ وآخرون إطارا يستخدم الاستقصاء غير المباشر للتخفيف وتقييم التحيز الجنسي في عشرة نماذج لغوية مفتوحة المصدر. في طريقتهم البحثية، دون استغلال الإشارات النمطية المباشرة، يكشفون عن التحيز غير المباشر للجندر.

يبحث لين وآخرون في التحيز السياسي في توليد النصوص بواسطة نماذج اللغة الكبيرة لكل من النماذج المغلقة (GPT-3.5-turbo، وGPT-437) والنماذج المفتوحة (Llama-2-7B13، Mistral-7B14، Vicuna29). حددوا ما إذا كان النص الذي يولده النموذج يؤدي إلى تحيز الوسائط اليسار أو اليمين. علاوة على ذلك، وضعوا استراتيجية للتخفيف من خلال ضبط النموذج بدقة وتوفير محفزات إضافية غير متحيزة أثناء توليد النصوص. بعد تطبيق تقنية التخفيف من التحيز، يميل النموذج إلى توليد نص محايد؛ وسائل الإعلام اليسارية أو اليمينية لا تؤثر على ذلك. تماشيا مع ذلك، اقترح راج وآخرون حلا لإزالة التحيز، إزالة التحيز في الاتصال الاجتماعي (SCD)، استنادا إلى فرضية الاتصال في علم النفس، والتي تشمل توليد محفزات يفهم أيديولوجيات المجموعات الاجتماعية المختلفة لتقليل التحيز في توليد النصوص لثلاثة نماذج لغوية مفتوحة المصدر. بالتوازي مع ذلك، اقترح كمرزمان وكيم38 تقنية إزالة التحيز الاجتماعي تستغل سلسلة التفكير في النظام 1 والنظام 2 لتخفيف التحليل عبر اثني عشر بعدا انحياز في خمسة نماذج كبيرة (GPT-3.5، GPT-437، Llama-2-7B13، Mistral-7B14، وGemini-1.039). هنا، يهدف موجه النظام 1 إلى جعل نموذج اللغة الكبيرة يستجيب بسرعة، بينما يهدف إلى توجيهه نحو إجابات أكثر تفكيرا وعمقا. على الرغم من إجراء دراسات مختلفة تستخدم الهندسة الفورمية للتخفيف من التحيز في نماذج اللغة الكبيرة، إلا أن القليل جدا من استكشاف تأثير التغير الفوري على مخرجات النماذج اللغوية الكبيرة. لمعالجة هذه المشكلة، قام هيدا وآخرون 40 بدراسة حساسية مخرجات النماذج اللغوية الاثني عشر مفتوحة المصدر لتحفيز التباين وحللوا تأثيرها على أداء المهام ومقايضات التحيز. تكشف نتائجهم أن نتائج إزالة التحيز حساسة للطلب؛ انخفاض التحيز في مخرجات النماذج يؤدي إلى أداء أقل للمهام. اقترح كامبوج وآخرون 41 نهجا للمعالجة اللاحقة للحد من التحيز الجنسي في التضمينات السياقية لنموذج T5 (نموذج النص إلى النص والتحويل42). يوفر أوبا وآخرون 43 مقدمات نصية تم إنشاؤها يدويا كإشارات لنماذج اللغة الكبيرة لقمع تجديدها المتحيز.

التحيزات المعرفية، التي كانت مصدرا للأخطاء التشخيصية في الرعاية الصحية لعقود، معرضة لخطر أن تطبع وتضخم من خلال نماذج اللغة الكبيرة (LLMs) في اتخاذ القرار السريري. لمواجهة هذا الخطر، يقترح مهاجان وآخرون 44 أن استراتيجيات التخفيف لتنفيذ هذه التقنيات يجب أن تركز على ثلاثة مواضيع: أولا، التأمل الذاتي (إعادة تقييم متكررة للمخرجات)، ثانيا، التفكير السياقي (يتضمن تاريخ المرضى الكامل وإرشادات مبنية على الأدلة)، وأخيرا، مسارات التفكير الشفاف (تفسيرات لعمليات التفكير المتاحة للتدقيق). تستخدم نماذج اللغة الكبيرة، بفضل قدرتها المنتشرة، على نطاق واسع أيضا لإنشاء شيفرة البرمجة. لذا، يعد هذا مصدر قلق بارز للباحثين للتحقيق في الآثار السلبية لأي تحيز اجتماعي في الشيفرة المولدة. إذا تم اكتشاف مثل هذا التحيز، يجب ابتكار تقنيات التخفيف المقابلة. وفي نفس الاتجاه، اقترح هوانغ وآخرون 45 تقنية لتقييم التحيز الاجتماعي والتخفيف من الآثار واختبروها على خمسة نماذج لغوية مستخدمة على نطاق واسع. في الآونة الأخيرة، شهدنا تقدما هائلا في هياكل نماذج اللغة الكبيرة وقدرتها على توليد ردود تبدو شبيهة بالبشر. ما إذا كانت نماذج اللغة الكبيرة يمكن أن تكون بديلة للبشر في اتخاذ القرار لا يزال غير مستكشف ويستحق المزيد من البحث. وفي هذا الاتجاه، تم تنسيق إطار عمل ومجموعة بيانات من قبل Tjuatja وآخرون.46 للتحقيق في قدرة نماذج اللغة الكبيرة على تقديم إجابات شبيهة بالبشر في استبيان استبياني.

على الرغم من هذه التقدمات، لا تزال هناك ثلاث فجوات بحثية. أولا، تميل الأبحاث السابقة إلى التركيز على أنواع ضيقة من التحيز (مثل النوع الاجتماعي أو السياسي) أو مجالات محددة (مثل موضوع معين). ثانيا، رغم انتشار الهندسة الفورماتية، إلا أن القليل من الدراسات تفحص تأثيرات التنوع المنهجي في النماذج اللغوية الكبيرة (LLM). ثالثا، تتناول الأبحاث المحدودة التمييز في بيئة الضبط الدقيق المحدودة للموارد في نماذج اللغة المفتوحة المصدر ذات الصلة بالمجالات الحيوية مثل الرعاية الصحية. لمعالجة هذه الفجوات، يتم تقديم بروتوكول واحد للتخفيف من التحيز وتقييمه يمكن أن يساعد في قياس التحيز النمطي عبر بنى النماذج المختلفة، مع دمج الضبط الدقيق تحت القيود الحسابية وتقييم متانة قرارات النموذج مقابل مقاييس التحيز.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تجرى جميع التجارب على منصة Google Colab (A100 مع 40 جيجابايت رام RAM). لإجراء التجارب، تم جمع مفاتيح API (بطاقات النماذج) لLlama2-7B وMistral-7B وDolly-7B من موقع Hugging Face.

ينقسم البروتوكول إلى ثلاثة أجزاء. أولا، بناء مجموعة بيانات تعمل كأساس لتقييم التحيز الاجتماعي في نماذج اللغة الكبيرة (LLMs). ثم صمم اثني عشر مغيرا مميزا للمحفز، متوافقة مع العمل الذي قام به كمرزمان وكيم38 للتحقيق في وجود التحيز الاجتماعي في الاستدلالات التي تولدها نماذج اللغة الكبيرة (LLMs). ثم قم بضبط نماذج اللغة الكبيرة على مجموعة بيانات من الجمل غير المتحيزة المتعلقة بالعرق والدين والجنس والمهنة، واستكشفها مرة أخرى بنفس المحفزات للتحقيق في تأثير الضبط الدقيق على الاستدلالات المولدة. الإطار المقترح موضح في الشكل 2.

تنسيق مجموعة بيانات
يستخدم الإطار مجموعتين من البيانات. يستخدم أحدهما لاشتقاق الاستنتاجات، والآخر يطبق لضبط نماذج اللغة الكبيرة بدقة. تقوم هذه الدراسة بتعديل StereoSet16 لبناء مجموعة بيانات جديدة، NeutralSet، والتي تعد أساسا لتوليد الاستدلال. استخدمت نماذج اللغة الكبيرة مجموعة ستيريو لإجراء توقعات عبر أربعة أنواع تحيز: العرق، الدين، النوع الاجتماعي، والمهنة. تتكون ستيريو ست من مجموعتين فرعيتين فرعيتين: البيانات داخل الجملة وبين الجمل. تم عرض نسخة من NeutralSet في الجدول 1. أعط جملة من سياق العمود كاستعلام إلى نموذج اللغة الكبير واطلب ملء الفراغ بأي من الكلمات من الأعمدة: مضاد للصورة النمطية، النمطية، أو المحايد. يمكن تقييم درجة التحيز في الماجستير من الخيار الذي يختاره. وجود عمود محايد في NeutralSet يميزه عن StereoSet. الغرض من إضافتها إلى مجموعة البيانات الجديدة هو تقليل احتمالية اختيار خيار النمط النمطي أثناء استنتاجات نماذج اللغة الكبيرة (LLM). تضاف الكلمات في العمود المحايد وفقا للخطوات المذكورة في الخوارزمية 1 (الملف التكميلي 1). حيث Vs و Vهما متجهات الكلمات النمطية والمضادة للنمطية على التوالي. يتم بعد ذلك اختيار كلمة من القاموس يكون متجه الأقرب إلى Vn، والذي يوضع سياقيا بين متجهات الكلمات النمطية والمضادة للنمط، وتضاف هذه الكلمة إلى العمود المحايد في الصف المحدد. يلخص الجدول 2 عملية إنشاء NeutralSet. ثم عدل مجموعة البيانات17لضبط نماذج اللغة الكبيرة بدقة. تتضمن مجموعة البيانات المعدلة 25,020 حالة، كل منها يتكون من استعلام مقترن بإجابة غير متحيزة اجتماعيا، تستخدم لتدريب النماذج. تم تصميم الاستعلامات لمعالجة جميع أنواع التحيزات الاجتماعية الأربعة.

تحفيز نماذج اللغة الكبيرة
افحص التحيزات الاجتماعية في نماذج اللغة الكبيرة من خلال توفير مجموعة من المحفزات كتعليمات إدخال. أولا، أنشئ اثني عشر نوعا من المحفزات: ستة أساسيات وستة متغيرات غير متحيزة مقابلة. محتويات جميع تقنيات التوجيه مدرجة في الجدول 3. خضعت المحفزات في هذه الدراسة لعملية دورية ورسمية من الصياغة والتنفيذ والتأمل والمراجعة، مما أدى إلى سلسلة من المحفزات التي تم صقلها مع مرور الوقت من خلال التجربة والخطأ والتحسينات الكبيرة. مكن ذلك من تغطية مجموعة متنوعة من أنواع الطلبات، بما في ذلك الأوامر الأساسية، وCoT، ومحفزات الشخصية البشرية. لم يتم التحقق من صحة تصاميم التوجيه والتقييم من قبل خبراء المجال الخارجي (مثل الأطباء أو المتخصصين في القضايا الاجتماعية أو المنصة). يلخص الجدول 4 أنواع المحفزات المختلفة، مسلطا الضوء على أساليب تفكيرها، وقدراتها في التخفيف من التحيز، وحالات الاستخدام المناسبة لتوجيه الاختيار المناسب. تقييم نماذج اللغة الكبيرة في هذه الورقة لا يحتفظ بالمعلومات السابقة عبر الجلسات أو الجولات. هناك أمر يجب توضيحه في النموذج النهائي وهو أن كل طلب يجب تنفيذه بشكل منفصل، مما يعني أنه لا يتم نقل تاريخ المحادثة من طلب إلى آخر. ضمن هذا التصميم أن الردود السابقة لا تؤثر على المخرجات اللاحقة. خلال مرحلة الضبط الدقيق، قم بتعديل معلمات النموذج فقط بناء على مجموعة بيانات التدريب، كما هو موضح في كل من التعلم التحويلي الفعال للمعلمات (PEFT47) والتكيف الكمي منخفض الرتبة (QLoRA48). قم ببناء الموضوع كما هو مذكور أدناه:

التعليمات القياسية: هذه تقنية تحفيز بدون طلقة حيث يتم توجيه النموذج اللغوي الكبير بمعلومات قليلة جدا لإجراء الاستنتاج. الرسالة هي: "أدخل الكلمة الأنسب في الفراغ من بين الخيارات المتاحة.". يستخدم هذا كأساس لقياس وتقييم التحيز الاجتماعي في جميع نماذج اللغة الستة.

سؤال CoT: تتضمن الرسالة عبارة "فكر خطوة بخطوة واملأ الفراغ. اختر الأنسب لل BLANK من بين الخيارات المتاحة...". في هذه التقنية التحفيزية، يشجع النموذج على الانخراط في عمليته الإدراكية والتفكير خطوة بخطوة قبل تقديم الإجابة.

محفزات System1 و System2: من خلال تضمين عبارة "الرد على الأسئلة بسرعة..."، توجه محفزات System1 النموذج اللغوي لتقديم ردود سريعة وبديهية، مشابهة لكيفية عمل الإدراك البشري في System1. من ناحية أخرى، تم تصميم محفزات System2 لإثارة ردود أكثر تفكيرا وتفصيلا وتحليلا وتعمدا من نموذج اللغة الكبيرة من خلال إضافة عبارة "أنت ترد على الأسئلة بشكل شامل ومتعمد. إجاباتك مدروسة وموثوقة "في التعليم".

محفزات HP1 و HP2: تبدأ التعليمات ب: "تبني هوية شخص يجيب على الأسئلة بسرعة واملأ الفراغ مع الالتزام الصارم بطبيعة هذه الهوية... ". في تقنية التوجيه HP1، تم توجيه النموذج الكبير لتبني هوية الإنسان الذي يستجيب بسرعة. الغرض من هذا الإعداد هو جعل نموذج اللغة الكبيرة يقلد الإنسان في عملية الإدراك في System1. على النقيض من ذلك، في ملف HP2، يدفع نموذج اللغة الكبيرة إلى تبني هوية شبيهة بالإنسان تفكر بتفكير وتركيز قبل الإجابة على الأسئلة، مما يحقق نتائج أكثر دقة. تبدأ رسالة HP2 بالعبارة: "تبني هوية شخص يجيب على الأسئلة بتفكير وتفكير، واملأ الفراغ مع الالتزام الصارم بطبيعة هذه الهوية...". الفكرة الأساسية وراء تضمين هذه المحفزات هي تقييم قدرة نموذج اللغة الكبيرة على محاكاة الإدراك البشري بالكامل.

متغيرات ديباياس: يتم بناء نسخة ديبايات بإضافة بيان يوجه النموذج لاتخاذ القرار بشكل محايد، دون أي تحيز نمطي.

تقييم نماذج اللغة الكبيرة
تقييم ستة نماذج لغوية كبيرة: 1) Llama-2-7B13، باستخدام نقطة التفتيش meta-llama/Llama-2-7b-chat-hf على Huggingface; 2) ميسترال-7B14، باستخدام نقطة التفتيش mistralai/Mistral-7B-Instruct-v0.3 على Huggingface؛ 3) دولي-7B15، باستخدام نقطة التفتيش databricks/dolly-v2-7b على Huggingface؛ 4) Llama2-7Bمضبوطة بدقة، نسخة مضبوطة بدقة من Llama-2-7B؛ 5) Mistral-7Bمضبوطة بدقة، نسخة مضبوطة بدقة من Mistral-7B؛ 6) دولي-7Bمضبوطة بدقة، نسخة مضبوطة بدقة من دولي-7بي.

قم بجميع التجارب على وحدة معالجة رسومات عالية السرعة، مثل A100 بذاكرة 40 جيجابايت أو أكثر. لضبط نماذج اللغة الكبيرة بدقة، قسم مجموعة البيانات إلى مجموعات تدريب، والتحقق من الصحة، ومجموعات اختبار، باستخدام التقسيم القياسي 70٪:10٪:20٪. لتجنب إعادة التدريب الكاملة للنموذج، تستخدم هذه الدراسة تكوين PEFT47 للضبط الدقيق، الذي يجمد جزءا كبيرا من معلمات النموذج ويضيف فقط عددا قليلا من المعلمات الخاصة بالمهمة. استخدم دقة 4-بت في QLoRA48 لتحميل نموذج اللغة الكبيرة إذا كانت الموارد الحسابية محدودة. سيتيح ذلك ضبطا دقيقا أسرع دون التخفيف من أداء الطراز.

لتقييم التحيز النمطي في نماذج اللغة الكبيرة، استخدمدرجة التحيز كمقياس. كما هو موضح في المعادلة 1، يتم حسابدرجة التحيز كنسبة استجابات الصور النمطية إلى إجمالي عدد الردود الصحيحة من نموذج اللغة الكبيرة لطلب معين.

figure-protocol-1(1)

حيث Ns، Nك، وNn تمثل عدد الاستجابات النمطية، والمضادة للنمطية، والمحايدة على التوالي. تشير درجة انحياز أقل إلى أن مخرجات النموذج أقل نمطية.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

باستخدام درجة التحيز المحددة في المعادلة 1، نجيب بشكل منهجي على أسئلة البحث ونقيم التحيزات المجتمعية في نماذج اللغة الكبيرة عبر أربعة أبعاد اجتماعية. توفر التخفيضات ذات الدلالة الإحصائية في درجات التحيز التي لوحظت صحة تجريبية للبروتوكول المقترح لتقليل التحيز في نماذج اللغة الكبيرة للمهام عالية المخاطر. لتقييم فعالية NeutralSet، أي مجموعة بيانات الاستدلال المنسقة، نقوم باستعلام جميع نماذج اللغة الكبيرة الثلاثة الأصلية على كل من StereoSet و NeutralSet من خلال الملف المعياري الأساسي ونحسب م...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

في هذا العمل، نقدم بروتوكولا قابلا للتوسع لتقليل التحيزات الاجتماعية في نماذج اللغة الكبيرة يستفيد من Llama2-7B13، Mistral-7B14، وDolly-7B15. يجمع هذا النهج بين هندسة المحفزات في HP2، وإزالة تحيز تعديلات الملاحقات، والضبط الدقيق المستهدف لتطوير بروتوكول لتقليل التحيز المستمر في مخرجات نماذج اللغة الكبيرة عبر الأبعاد المجتمعية الأربعة الرئيسية وهي النوع الاجتماعي، والعرق، والمهنة، والدين. أثناء تقييم النماذج الأصلية ب...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

المؤلفون ليس لديهم ما يكشفون عنه.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
جوجل كولابجوجلhttps://colab.research.google.com/يستخدم لتشغيل التجارب 
ميندلي ديسكتوبمندليhttps://www.mendeley.com/يستخدم لإدارة الاستشهادات والمراجع.

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. STRUX: An LLM for decision-making with structured explanations. Lu, Y., Hu, Y., Foroosh, H., Jin, W., Liu, F. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  2. Eigner, E., Händler, T. Determinants of LLM-assisted decision-making. arXiv. , (2024).
  3. Wu, Y. Large Language Model and Text Generation. Natural Language Processing in Biomedicine: A Practical Guide. , Springer. Cham. (2024).
  4. Wang, L., et al. Benchmarking and improving long-text translation with large language models. Find Assoc Comput Linguist: ACL. 2024, 7175-7187 (2024).
  5. Ghatora, P. S., Hosseini, S. E., Pervez, S., Iqbal, M. J., Shaukat, N. Sentiment analysis of product reviews using machine learning and pre-trained LLM. Big Data Cogn Comput. 8 (12), 199(2024).
  6. Arefeen, M. A., Debnath, B., Chakradhar, S. LeanContext: Cost-efficient domain-specific question answering using LLMs. Nat Lang Process J. 7, 100065(2024).
  7. Ye, Y., Sarkar, S., Bhaskar, A., Tomlinson, B., Monteiro, O. Using ChatGPT in a clinical setting: A case report. MedComm Future Med. 2 (2), e51(2023).
  8. How are LLMs mitigating stereotyping harms? Learning from search engine studies. Leidinger, A., Rogers, R. Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society, 7, 839-854 (2024).
  9. Gender bias and stereotypes in large language models. Kotek, H., Dockum, R., Sun, D. Proceedings of the ACM Collective Intelligence Conference, 2023, 12-24 (2023).
  10. Uncovering stereotypes in large language models: A task complexity-based approach. Shrawgi, H., Rath, P., Singhal, T., Dandapat, S. Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics, 1, 1841-1857 (2024).
  11. Kwak, D. -H., Holtkamp, P., Kim, S. S. Measuring and controlling social desirability bias: Applications in information systems research. J Assoc Inf Syst. 20 (4), 317-345 (2019).
  12. Self-debiasing large language models: Zero-shot recognition and reduction of stereotypes. Gallegos, I. O., et al. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  13. Touvron, H., et al. Llama 2: Open foundation and finetuned chat models. arXiv. , (2023).
  14. Jiang, A. Q., et al. Mistral 7B. arXiv. , (2023).
  15. Conover, M., et al. Free Dolly: Introducing the world's first truly open instruction-tuned LLM. , databricks.com/blog/2023/04/12/dolly-first-open-commercially-viable-instruction-tuned-llm (2023).
  16. Nadeem, M., Bethke, A., Reddy, S. StereoSet: Measuring stereotypical bias in pretrained language models. arXiv. , (2020).
  17. Breaking bias, building bridges: Evaluation and mitigation of social biases in LLMs via contact hypothesis. Raj, C., Mukherjee, A., Caliskan, A., Anastasopoulos, A., Zhu, Z. Proceedings of the Seventh AAAI/ACM Conference on AI, Ethics, and Society, 2024, 1180-1189 (2024).
  18. Abramski, K., Improta, R., Rossetti, G., Stella, M. The "LLM world of words" English free association norms generated by large language models. Sci Data. 12 (1), 1-16 (2025).
  19. Lhama Team, Meta AI. The Llama 3 herd of models. arXiv. , (2024).
  20. Claude Haiku 3.5. , Anthropic. At anthropic.com/claude/haiku (2025).
  21. De Deyne, S., Navarro, D. J., Perfors, A., Brysbaert, M., Storms, G. The "small world of words" English word association norms for over 12,000 cue words. Behav Res Methods. 51 (3), 987-1006 (2019).
  22. GenderAlign: An alignment dataset for mitigating gender bias in large language models. Zhang, T., et al. Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics, , (2025).
  23. Are models biased on text without gender-related language. Belém, C. G., Seshadri, P., Razeghi, Y., Singh, S. The Twelfth International Conference on Learning Representations (ICLR), , openreview.net/forum?id=w1JanwReU6 (2024).
  24. From showgirls to performers: Finetuning with gender-inclusive language for bias reduction in LLMs. Bartl, M., Leavy, S. Proceedings of the 5th Workshop on Gender Bias in Natural Language Processing (GeBNLP), 5, 280-294 (2024).
  25. Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., Sutskever, I. Language models are unsupervised multitask learners. OpenAI Blog. 1 (8), 9(2019).
  26. Li, Y., Bubeck, S., Eldan, R., Giorno, A. D., Gunasekar, S., Lee, Y. T. Textbooks are all you need II: Phi-1.5 technical report. arXiv. , (2023).
  27. Liu, Y., et al. A robustly optimized BERT pretraining approach. arXiv. , (2019).
  28. Raza, S., Garg, M., John, D., Raza, S., Ding, C. Nbias: A natural language processing framework for BIAS identification in text. Expert Syst Appl. 237 (PB), 121542(2024).
  29. Vicuna: An open-source chatbot impressing GPT-4 with 90%* ChatGPT quality. , Available from: lmsys.org/blog/2023-03-30-vicuna/ (2025).
  30. GenderCARE: A comprehensive framework for assessing and reducing gender bias in large language models. Tang, K., et al. CCS '24: Proceedings of the 2024 on ACM SIGSAC Conference on Computer and Communications Security, 2024, 1196-1210 (2024).
  31. BiasAlert: A plug-and-play tool for social bias detection in LLMs. Fan, Z., Chen, R., Xu, R., Liu, Z. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, 2024, 14778-14790 (2024).
  32. Social bias frames: Reasoning about social and power implications of language. Sap, M., Gabriel, S., Qin, L., Jurafsky, D., Smith, N. A., Choi, Y. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, 58, 5477-5490 (2020).
  33. Echterhoff, J., Liu, Y., Alessa, A., McAuley, J., He, Z. Cognitive bias in decision-making with LLMs. Findings of the Association for Computational Linguistics: EMNLP 2024. 2024, 12640-12653 (2024).
  34. Furniturewala, S., et al. Thinking fair and slow: On the efficacy of structured prompts for debiasing language models. arXiv. , (2024).
  35. Dong, X., Wang, Y., Yu, P. S., Caverlee, J. Disclosure and mitigation of gender bias in LLMs. arXiv. , (2024).
  36. Investigating bias in LLM-based bias detection: Disparities between LLMs and human perception. Lin, L., Wang, L., Guo, J., Wong, K. 31st International Conference on Computational Linguistics, 31, 10634-10649 (2025).
  37. OpenAI. GPT-4 technical report. arXiv. , (2023).
  38. Kamruzzaman, M., Kim, G. L. Prompting techniques for reducing social bias in LLMs through system 1 and system 2 cognitive processes. Proceedings of Recent Advances in Natural Language Processing. 2024, 511-520 (2024).
  39. Gemini Team. Gemini: A family of highly capable multimodal models. arxiv. , (2023).
  40. Hida, R., Kaneko, M., Okazaki, N. Social bias evaluation for large language models requires prompt variations. Find Assoc Comput Linguist: EMNLP 2025. , 14507-14530 (2025).
  41. Measuring and mitigating gender bias in contextualized word embeddings. Kamboj, P., Kumar, S., Goyal, V. Proc IEEE Int Conf Blockchain Distrib Syst Secur, , (2023).
  42. Raffel, C., et al. Exploring the limits of transfer learning with a unified text-to-text transformer. J Mach Learn Res. 21, 1-67 (2023).
  43. In-contextual gender bias suppression for large language models. Oba, D., Kaneko, M., Bollegala, D. EACL 2024 - 18th Conference of the European Chapter of the Association for Computational Linguistics, Findings of EACL 2024, 2024, 1722-1742 (2024).
  44. Mahajan, A., Obermeyer, Z., Daneshjou, R., Lester, J., Powell, D. Cognitive bias in clinical large language models. npj Digit Med. 8 (1), 1-4 (2025).
  45. Huang, D., Bu, Q., Zhang, J., Xie, X., Chen, J., Cui, H. Bias testing and mitigation in LLM-based code generation. ACM Trans Softw Eng Methodol. , (2025).
  46. Tjuatja, L., Chen, V., Wu, S. T., Talwalkar, A., Neubig, G. Do LLMs exhibit human-like response biases? A case study in survey design. arXiv. , (2024).
  47. Houlsby, N., et al. Parameter-efficient transfer learning for NLP. arXiv. , (2019).
  48. Dettmers, T., Pagnoni, A., Holtzman, A., Zettlemoyer, L. QLoRA: Efficient finetuning of quantized LLMs. arXiv. , (2023).
  49. Xiao, H., Xiang, Z., Wang, D., Devadas, S. A Theory to instruct differentially-private learning via clipping bias reduction. IEEE Symposium on Security and Privacy (SP). , (2023).
  50. Kamboj, P., Kumar, S., Goyal, V. Mitigating Social Bias in Generative AI: A comprehensive review. KSII Trans Internet Inf Syst. 19 (10), 3372-3394 (2025).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

الفيديو قريباً

مقالات ذات صلة