מאמר מחקר

שיפור ההגינות במודלים לשוניים גדולים ליישומי בינה מלאכותית קלינית באמצעות כיוונון עדין והנחיות

DOI:

10.3791/69132

2 בינואר 2026

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מודלים לשוניים גדולים ספציפיים לבריאות מתמודדים עם אתגרים אתיים וטכניים, שכן הם, כמו מודלים גדולים אחרים, משקפים את ההטיות הטמונות בנתוני ההכשרה שלהם. הפרוטוקול המוצג כאן מאמת את דיכוי ארבעה סוגי הטיה (מגדר, גזע, מקצוע, דת) באמצעות וריאציות של הנחיה בשלושה מודלים בקוד פתוח.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מודלים לשוניים גדולים (LLMs) מיושמים יותר ויותר בתחומים רגישים כמו טיפול רפואי, אשר מציבים אתגרים טכניים ואתיים רבים. הנושאים המיידיים ביותר כוללים הטיות המובנות במודלים אלו, אשר מאומנים על מאגרי נתונים גדולים שעשויים לשקף דעות קדומות חברתיות. הטיות כאלה עלולות להוביל לתוצרים שאינם הוגנים, בלתי ניתנים להכללה או אפילו מזיקים, מה שהופך אותן לבלתי ישימות קלינית בעולם האמיתי ואינן עומדות במגבלות אתיות ורגולטוריות. אנו בוחנים עד כמה דיכוי הטיות עובד כאשר מודלים מותאמים מתנדבים בארבע קטגוריות קריטיות (מגדר, גזע, מקצוע ודת). אנו אוספים ידנית מאגר הסקות מגוון ויוצרים שתים עשרה וריאנטים של פרומפטים – שישה מהם דה-הטיות – כדי לבדוק את הפלטים של שלושה מודלים גדולים בקוד פתוח: Llama2-7B, Mistral-7B ו-Dolly-7B. ההגינות והפרשנות של התוצרים מוערכות באמצעות מדד ניקוד הטיה, כאשר ציונים נמוכים יותר מעידים על הוגנות ופרשנות טובה יותר. אנו גם מציינים שהנחיות דה-הטיות מפחיתות הטיות, וכיוון המודל המדויק מבצע אפילו טוב יותר. התוצאות מדגישות את החשיבות הקריטית של פעולה בזמן, עמידות מודלים ובדיקה אתית מתמשכת לפריסה אמינה והוגנת של מודלים גדולים בסביבות אמיתיות, כגון דימות רפואי ותחזוקת רשומות בריאות אלקטרוניות (EHR).

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מודלים לשפה גדולים יש תהודה אדירה ככלים לתמיכה במשימות מגוונות, כולל קבלת החלטות 1,2, יצירת טקסט3, תרגוםטקסט 4, ניתוח תחושת לקוחות5, מענה לשאלות6, ויצירת דוחות קליניים7. בשנים האחרונות התרחשו מספר מקרים שבהם יישומים השתמשו במודלים גדולים ליצירת תוכן שפוגע באנשים או קבוצות מוחלשות חברתית 8,9,10. הסיבה העיקרית לתגובות כאלה היא שמודלים אלו מאומנים על מערכי נתונים שמכילים מטבעם הטיות חברתיות הקשורות לגזע, מגדר, מעמד סוציו-אקונומי וגורמים דומים. אבל מה שאתה מתכוון ב"הטיה" ו"הגינות" במערכת בינה מלאכותית בתחום הבריאות יכול להיות סובייקטיבי ותלוי בהקשר. חוקרים השקיעו מאמצים ניכרים להפחתת הטיות חברתיות במודלים 11,12; עם זאת, עדיין יש צורך בשיפור נוסף. החוקרים הציעו אסטרטגיות שונות להפחתת הטיות, שניתן לסווגן כקדם-עיבוד, בעיבוד, עיבוד לאחר או שילובים ביניהם, במגוון יישומים הטרוגני. סיווג זה מבוסס על השלב בו ננקטת אמצעי ההפחתה. פרוטוקול זה משלב את שלוש האסטרטגיות להתמודדות ולהקלה על הטיה חברתית בשישה וריאנטים של מודלים גדולים וחוקר הפחתת הטיות בארבעה ממדים של הטיות חברתיות: מגדר, מקצוע, גזע ודת. ראשית, מערך נתונים להסקה מפותח באמצעות טכניקת הגדלת נתונים כדי לאפשר למודלים גדולים גדולים לייצר הסקנות. שנית, שנים-עשר סוגי פרומפטים נועדו לעורר תגובות סטריאוטיפיות ממודלים גדולים גדולים. שלישית, Llama-2-7B13, Mistral-7B14 ודולי-7B15 מכוונים בעדינות על מאגר נתונים הכולל משפטים בלתי מוטים בארבע הקטגוריות החברתיות: מגדר, גזע, מקצוע ודת, כדי לקבל Llama-2-7B מכווןעדין, Mistral-7Bמכוון עדין, ו-Dolly-7Bמכוון עדין, בהתאמה. לבסוף, מסקנות מתקבלות על ידי דחיפה למודלים הגדולים המדויקים לחקור את יעילותם במתן תגובות הוגנות.

ניסחנו את שאלות המחקר הבאות והתייחסנו אליהן במאמר זה. לכל שאלה מחקרית נוסחת (RQ), נוסחו השערה אפסית (H0) והשערה חלופית (H1).

RQ1: האם מערך הנתונים של ההסקה וטכניקות ההנחה הבסיסיות יעילים בהערכת ההטיות החברתיות במודלים גדולים גדולים? השערת אפס (H01): ציוני ההטיה שמקורם במאגר הסקה כאשר משולבים עם הנחיות בסיסיות אינם מובחנים סטטיסטית מציוני ההטיה הבסיסית של מודלי השפה הגדולה. השערה חלופית (H11): ציוני הטיה ממאגר ההסקה עם השאלות בסיסיות שונים באופן מובהק סטטיסטית מציוני הטיית בסיס של מודלים גדולים. כדי לבדוק את ההשערה, מערך נתונים בשם NeutralSet נערך על ידי שינוי StereoSet16 והערכת כל מודל שפה שפה (LLM) באמצעות טכניקות הנחיה בסיסיות להערכת יכולתו לייצר תגובות לא סטריאוטיפיות. בהגדרות שלנו, אנו כוללים שישה הנחיות בסיסיות — סטנדרטית (הנחיית זילום אפס שמנחה את ה-LLM לבצע מסקנות), שרשרת מחשבות (CoT נועדה לבקש מהמודל לחשוב שלב אחר שלב כדי להסיק מסקנות), System1 (הנחיה לאפשר למודל לחשוב מהר תוך כדי תשובה), System2 (הנחיה שגורמת ל-LLM לחשוב לאט ובמחשבה), פרסונה אנושית 1 (HP1 נועדה לגרום ל-LLM לאמץ את זהות האדם שחושב מהר בזמן קבלת החלטות), ו-Human Persona 2 (HP2 נועד לגרום ל-LLM לאמץ את הזהות האנושית שחושבת לאט ובמחשבה תוך כדי תשובה).

RQ2: האם טכניקות ההנעה להדה-הטיה יעילות בגילוי והפחתת הטיות חברתיות במודלים גדולים גדולים? השערת אפס (H0₂): טכניקות ההנעה להפחתת הטיות אינן יעילות בגילוי והפחתת הטיות חברתיות במודלים גדולים גדולים. השערה חלופית (H12): ציוני הטיה מדודים יורדים משמעותית כאשר משתמשים בטכניקות הנחיות להפחתת הטיה במודלים גדולים גדולים. אנו חוקרים את ההשפעה של גרסאות דה-מוטיות של ההנחיות הבסיסיות על שלושה מודלים בקוד פתוח כדי להשיג יצירת טקסט הוגנת ללא אפליה חברתית.

RQ3: האם ניתן להפחית הטיות חברתיות עוד יותר על ידי כיוונון עדין של מודלים גדולים? השערת אפס (H03): כיוונון עדין של מודלי שפה לא מפחיתה עוד יותר הטיות חברתיות מעבר להפחתות שהושגו באמצעות טכניקות ההנעה בלבד. השערה חלופית (H13): כיוונון עדין של מודלים גדולים מפחיתה עוד יותר הטיות חברתיות מעבר להפחתות שהושגו באמצעות טכניקות הנעה בלבד. כדי לענות על שאלה זו, אנו משנים את מערך הנתונים17 ומכוונים את המודלים הגדולים עליו כדי להעריך עוד יותר את השפעת הכוונון העדין בהפחתת תגובות סטריאוטיפיות.

איור 1 ממחיש את השפעת שונות הפרומפט וכיוונון מדויק של מודל LLM על התוצאה הנואלת מגדרית הנייטרלית. החידוש בעבודתנו נובע משילוב אוצרות ידנית של מערכי נתונים, אסטרטגיות שונות להסרת הטיות, וכיוונון מדויק תחת פרוטוקול אחד לניתוח מודל שפה גדולה לזיהוי והקלה של הטיות חברתיות, הרלוונטי ליישומים רגישים בעולם האמיתי כמו דימות רפואי ותחזוקת מערכות רפואיות אלקטרוניות. קיבלנו את הספרות על הטיה במודלים גדולים לארבע נקודות מבט: מערכי נתונים להטיה ואסוציאציות קוגניטיביות; מסגרות לזיהוי והערכת הטיות; גישות להפחתת הטיות; והטיה בתחומים מיוחדים.

חוקרים מייצרים באופן מתמיד מערכי נתונים כדי לאפשר הערכת הטיות וניתוח אסוציאציות סמנטיות במודלים גדולים. לדוגמה, בפסיכולוגיה קוגניטיבית ובלשנות, אסוציאציות חופשיות תמיד מכריעות בארגון הידע המושגי. בסימולציה של אותה אסוציאציה בהתפלגות החבויה של מודלים גדולים, אברמסקי ואח' בנו מערך נתונים בשם LLM World of Words (LWOW). מאגר הנתונים של נורמות האסוציאציה החופשית באנגלית של LWOW, הכולל מיליוני תגובות משלושה מודלים גדולים: מיסטרל-7B14, לאמה-3.1-8B19, וקלוד-3-5-הייקו-אחרונים20. הוא שואב השראה מ-Small World of Words (SWOW)21, מאגר הנתונים הגדול ביותר של נורמות אסוציאציות חופשיות באנגלית אנושית, אשר שימש רבות במגוון מחקרים פסיכולוגיים ולשוניים. יתרה מזאת, LWOW מסייע בבניית רשת קוגניטיבית הכוללת צמתים, שכל אחד מהם מייצג מילה, כאשר צמתים התואמים למילים דומות סמנטית שקרובות זו לזו ברשת. דבר זה מסייע להעריך הטיה בתפוקת מודלים גדולים על ידי הערכת המרחק בין מילים ברשת הקוגניטיבית המלאכותית כמדד מרכזי. מכשול מרכזי בשימוש במודלים גדולים קנייניים הוא שהחלקים הפנימיים שלהם אינם נגישים. למרות שנעשו מאמצים משמעותיים במודלים אלו להתמודדות עם הטיות, מאגרי נתוני יישור עדיין נדירים. כדי להתמודד עם דאגה זו, מוצע מאגר נתונים בשם GenderAlign אצל ז'אנג ואח' במטרה להפחית הטיה מגדרית במודלים של שפה גדולה. UnStereoEval23, מערך נתונים מדד, מוצע לחקור הטיה מגדרית סטריאוטיפית במקצועות ורגשות. ממצאיהם חושפים רמת הוגנות נמוכה ב-28 מודלים שונים. ברטל וליווי24 פיתחו מאגר נתונים בשם Tiny Heap, שבו משפטים עם אזכורים סטריאוטיפיים מוחלפים במקבילות ניטרליות ושלושה מודלים לשוניים מותאמים (GPT-225, PHI-1.526, ו-RoBERTa27). בממצאיהם, הם מבחינים בהפחתה משמעותית בנטיות הסטריאוטיפיות המגדריות של המודלים.

הוצעו מספר מסגרות רב-שכבתיות לזיהוי והקלה על הטיות במודלים גדולים. ב-Raza ואחרים, מוצעת מסגרת בשם NBIAS הכוללת ארבע שכבות: יצירת מערכי נתונים, פיתוח מודלים, הפחתת הטיות והערכה. מאגר הנתונים במסגרת בנוי מתחומים מגוונים, כולל בריאות, רשתות חברתיות ופורטלי תעסוקה. הם מציגים את יעילות המודל שלהם בכך שהם עולים על קו הבסיס (BERT29) ב-1% עד 8% בהגינות. במסגרת נוספת, GenderCARE30, מוצעת אסטרטגיה להפחתת הטיה מגדרית ב-LLMS. במסגרת הניסוי הנרחבת שלהם, הם הפחיתו למעשה הטיית מגדר בממוצע של 35% בשנים עשר מודלים שונים. מסגרת, BiasAlet31, מזהה אוטומטית הטיה חברתית בטקסט הפתוח שנוצר על ידי מודלי השפה הגדולים. יש לכך כמה מגבלות: ראשית, המחקר מתבצע על מאגר נתונים מסונתז בשל חוסר זמינות של מדד המדד להערכת הטיה ביצירת הטקסט הפתוח של המודל, ושנית, הוא בנוי על מערך הנתונים המיושן SBIC32, מה שמקשה להבחין בין הרלוונטיות של הטיה מרומזת לבין ההטיה במאגר הנתונים עצמו. הטיה בנתונים שנוצרו על ידי בני אדם עשויה להיכנס למודלים המאומנים עליהם. השימוש במודלים כאלה שנוי במחלוקת במשרות בעלות סיכון גבוה, שבהן התפוקה שלהם עלולה להשפיע לרעה על קבוצות מוחלשות. כדי להתמודד עם זה, מסגרת בשם BiasBuster33 נועדה לזהות, להעריך ולהפחית הטיה קוגניטיבית במודלים גדולים. בהתאם לכך, בעבודהנוספת 34, חוקרים מציעים מסגרת אינטראקטיבית ליצירת טקסט הוגן, לוגי וביקורתי באמצעות הנחיות מערכת 2 (שנועדו לאפשר למודל לחשוב במחשבה ואיטיות) שמשלימות הנחיות מעובדות ומשלימות. עם זאת, המסגרת מוגבלת למשימות בתוך המרחב החבוי של מודלי השפה הגדולה. דונג ואחרים פיתחו מסגרת המשתמשת בחקירה עקיפה כדי להפחית ולהעריך הטיה מגדרית בעשרה מודלים בקוד פתוח. בשיטת החקירה שלהם, מבלי לנצל אזכורים סטריאוטיפיים ישירים, הם חושפים הטיה מגדרית עקיפה.

לין ואח' 36 חוקרים את ההטיה הפוליטית ביצירת טקסטים על ידי מודלי השפה הגדולים הן עבור דגמים סגורים (GPT-3.5-טורבו, ו-GPT-437) והן במודלים פתוחים (Llama-2-7B13, Mistral-7B14, Vicuna29). הם קבעו האם הטקסט שנוצר על ידי המודל גורם להטיית מדיה שמאלית או ימינה. יתרה מזאת, הם פיתחו אסטרטגיית הפחתה על ידי כיוונון עדין של המודל ומתן הנחיות נוספות ללא הטיות במהלך יצירת הטקסט. לאחר יישום טכניקת הפחתת ההטיה, המודל נוטה לייצר טקסט ניטרלי; התקשורת השמאלית או הימנית לא משפיעה על זה. בהתאם לכך, ראג' ואחרים הציעו פתרון דה-הטיה, הסרת הטיות במגע חברתי (SCD), המבוסס על השערת המגע בפסיכולוגיה, הכוללת יצירת פרומפטים שמבינים את האידיאולוגיות של קבוצות חברתיות שונות כדי להפחית דעות קדומות ביצירת טקסט של שלושה מודלים גדולים בקוד פתוח. במקביל לכך, קמרוזזמן וקים38 הציעו טכניקת דה-הטיה חברתית המנצלת את שרשרת המחשבה של מערכת 1 ומערכת 2 כדי להפחית את ההטיה על פני שנים-עשר ממדי הטיה בחמישה מודלים גדולים (GPT-3.5, GPT-437, Llama-2-7B13, Mistral-7B14, ו-Gemini-1.039). כאן, הנחיית מערכת 1 נועדה לגרום למודל להגיב במהירות, בעוד שפרומפט System 2 מיועד להנחות אותו לתשובות מעמיקות ומכוונות יותר. למרות שנערכו מחקרים שונים המשתמשים בהנדסת פרומפטינג כדי להפחית את ההטיה במודלים גדולים, מעטים בחנו את השפעת שונות הפרומפט על תפוקת מודלים. כדי להתמודד עם הבעיה הזו, Hida ואח' חקרו את הרגישות של הפלטים של שנים-עשר מודלי שפה גדולים בקוד פתוח ליצירת שונות וניתחו את השפעתם על ביצועי המשימות ופשרות הטיה. הממצאים שלהם מגלים שתוצאות הדה-הטיה רגישות לפרומפציה; פחות הטיה בתפוקת המודל מובילה לביצועי משימות נמוכים יותר. קמבוי ואח' 41 הציעו גישת עיבוד לאחר מכן להפחתת הטיית מגדר בהטמעות-הקשריות של מודל T5 (מודל טקסט-לטקסט-העבר-טרנספורמר42). Oba ואחרים 43 מספקים הקדמות טקסטואליות שנוצרו ידנית כהנחיות למודלים גדולים כדי לדכא את היצירה המוטה שלהם.

הטיות קוגניטיביות, שהיו מקור לטעויות אבחנתיות במערכת הבריאות במשך עשרות שנים, נמצאות בסיכון להיטבע ולהועצם על ידי מודלים לשוניים גדולים (LLMs) בקבלת החלטות קליניות. כדי להתמודד עם סיכון זה, מהאג'אן ואח' מציעים כי אסטרטגיות הפחתה ליישום טכנולוגיות אלו צריכות להתמקד בשלושה נושאים: ראשית, התבוננות עצמית (הערכה מחודשת של תוצרים), שנית, הסקה קונטקסטואלית (הכוללת היסטוריה מלאה של המטופל והנחיות מבוססות ראיות), ולבסוף, עקבות חשיבה שקופים (הסברים על תהליכי הסקה הזמינים לביקורת). מודלי שפה גדולה, עם היכולת הנפוצה שלהם, משמשים כיום גם באופן נרחב ליצירת קוד תכנות. לכן, זו דאגה מרכזית עבור חוקרים לחקור את ההשפעות השליליות של כל הטיה חברתית בקוד שנוצר. אם זוהתה הטיה כזו, יש לפתח את טכניקות ההפחתה המתאימות. באותו כיוון, הואנג ואחרים 45 הציעו טכניקת הערכה והפחתת הטיות חברתיות ובדקו אותה על חמישה מודלים גדולים נפוצים. בשנים האחרונות ראינו התקדמויות עצומות בארכיטקטורות LLM וביכולתן לייצר תגובות שנשמעות אנושיות. האם מודלים גדולים גדולים יכולים לשמש תחליף לבני אדם בקבלת החלטות עדיין לא נחקר ודורש מחקר נוסף. בכיוון זה, מסגרת ומערך נתונים אוצרים על ידי Tjuatja ואחרים.46 כדי לחקור את היכולת של מודלים גדולים לתת תשובות דמויות אדם בשאלון סקר.

למרות ההתקדמות הזו, שלושה פערי מחקר קיימים. ראשית, מחקרים קודמים נוטים להתמקד בסוגים צרים של הטיה (למשל, מגדר או פוליטי) או בתחומים ספציפיים (למשל, נושא מסוים). שנית, למרות שהנדסת פרומפט נפוצה, מעט מחקרים בוחנים את השפעות השונות השיטתית של פרומפט על תפוקת LLM. שלישית, מחקר מוגבל עוסק בדהטיות בהגדרת כוונון עדין מוגבלת במשאבים של מודלים בקוד פתוח הרלוונטיים לתחומים קריטיים כמו בריאות. כדי להתמודד עם פערים אלו, מוצג פרוטוקול יחיד להפחתת הטיה והערכה שיכול לסייע במדידת הטיה סטריאוטיפית בין ארכיטקטורות מודל שונות, תוך שילוב כיוונון עדין תחת מגבלות חישוביות והערכת עמידות החלטות המודל מול מדדי הטיה.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

כל הניסויים מתבצעים בפלטפורמת Google Colab (A100 עם 40 GB RAM). לצורך ביצוע ניסויים, נאספו מפתחות API (כרטיסי מודל) של Llama2-7B, Mistral-7B ו-Dolly-7B מ-Hugging Face.

הפרוטוקול מחולק לשלושה חלקים. ראשית, לבנות מאגר נתונים שישמש בסיס להערכת הטיות חברתיות במודלים גדולים גדולים. לאחר מכן תכננו שתים-עשרה וריאנטים מובחנים של פרומפטים, בהתאם לעבודה שנעשתה על ידי קמרוזמן וקים38 , כדי לחקור את נוכחות ההטיה החברתית במסקנות שנוצרות על ידי מודלים גדולים גדולים. לאחר מכן, לכוונן את מודלי השפה הגדולים על מאגר נתונים של משפטים בלתי מוטים הקשורים לגזע, דת, מגדר ומקצוע, ולבחון אותם שוב עם אותן הנחיות כדי לבדוק את השפעת הכיוונון המדויק על המסקנות שנוצרו. המסגרת המוצעת מוצגת באיור 2.

אוצרות מאגר נתונים
המסגרת משתמשת בשני מערכי נתונים. אחת משמשת להסקת מסקנות, והשנייה מיושמת לכיוון מדויק של מודלים גדולים. מחקר זה משנה את StereoSet16 כדי לבנות מערך נתונים חדש, NeutralSet, המשמש כבסיס ליצירת הסקה. המודלים השתמשו ב-StereoSet כדי לבצע תחזיות בארבעה סוגי הטיות: גזע, דת, מגדר ומקצוע. StereoSet מורכב משני תת-מערכי נתונים: בתוך משפט ובין משפטים. מופע של NeutralSet מוצג בטבלה 1. תן משפט מהקונטקסט של העמודה כשאילתה למודל השפה הגדול ובקש למלא את החסר באחת מהמילים מהעמודה – אנטי-סטריאוטיפ, סטריאוטיפ או נייטרלי. רמת ההטיה ב-LLM ניתנת לשפוט לפי האפשרות שהוא בוחר. הכללת עמודה נייטרלית ב-NeutralSet מבדילה אותו מ-StereoSet. המטרה בהוספתו למאגר הנתונים החדש היא להפחית את הסבירות לבחור באפשרות הסטריאוטיפ תוך כדי הסקת מודעות שפה גדולה. מילים מתווספות בעמודה הנייטרלית בהתאם לשלבים המוזכרים באלגוריתם 1 (קובץ משלים 1). כאשר Vs ו-Vהם הווקטורים של מילים סטריאוטיפיות ואנטי-סטריאוטיפיות, בהתאמה. לאחר מכן נבחרת מילה מהמילון שהווקטור שלה הקרוב ביותר ל-Vn, שממוקם בהקשר בין וקטורי המילים הסטריאוטיפ והאנטי-סטריאוטיפ, ומילה זו מתווספת לעמודה הנייטרלית בשורה הנבחרת. טבלה 2 מסכמת את תהליך יצירת NeutralSet. לאחר מכן, שנה את מערך הנתונים17כדי לכוון את המודלים הגדולים הגדולים. מערך הנתונים המתוקן כולל 25,020 מקרים, שכל אחד מהם מורכב משאילתה עם תשובה חברתית בלתי מוטה, המשמשת לאימון המודלים. השאילתות נועדו להתמודד עם כל ארבעת סוגי ההטיות החברתיות.

הנעת המודלים הגדולים
בחן את ההטיות החברתיות במודלים גדולים על ידי מתן סט של פרומפטים כהוראות קלט. ראשית, צור שנים-עשר סוגי פרומפטים: שישה בסיסיים ושש וריאנטים דה-הטיות תואמים. תוכן כל טכניקות ההנחיה מופיע בטבלה 3. ההנחיות במחקר זה עברו תהליך מחזורי ופורמלי של יצירה, יישום, הרהור ותיקון, שהוביל לסדרת פרומפטים שהתחדדו עם הזמן באמצעות ניסוי וטעייה ושיפור משמעותיים. זה אפשר כיסוי של מגוון רחב של סוגי פרומפטים, כולל פרומפטים בסיסיים, CoT והנחיות של דמות אנושית. עיצובים ודירוג של פרומפט לא אושרו על ידי מומחים חיצוניים בתחום (למשל, קלינאים, מומחים חברתיים או הוגנים). טבלה 4 מסכמת סוגי פרומפטים שונים, מדגישה את סגנונות ההסקה שלהם, יכולות הפחתת הטיות, ומקרי שימוש מתאימים להנחיית בחירה מתאימה. הערכת המודלים במאמר זה אינה שומרת מידע מהעבר בין ריצות או מפגשים. דבר אחד שיש להבהיר במודל הסופי הוא שכל פרומפט צריך להתבצע בנפרד, כלומר אין היסטוריית שיחה מועברת מהנחיה אחת לאחרת. פריסה זו הבטיחה שהתגובות הקודמות לא ישפיעו על הפלטים הבאים. במהלך שלב הכוונון המדויק, יש לשנות רק את פרמטרי המודל בהתבסס על מאגר הנתונים של האימון, כפי שמפורט הן ב-Parameter-Efficient Transfer Learning (PEFT47) והן ב-Quantized Low-Rank Adaptation (QLoRA48). בנה את הנושא כפי שצוין למטה:

הנחיה סטנדרטית: זוהי טכניקת הנחיה ללא יריות אפס, שבה ה-LLM מונחה עם מידע מינימלי כדי להסיק את ההסקנה. ההודעה היא: "הכנס את המילה המתאימה ביותר ל-BLANK מתוך הבחירות שניתנו.". זה משמש כבסיס לכימות והערכת הטיות חברתיות בכל ששת מודלי השפה הגדולה.

הנחיית CoT: ההנחיה כוללת את הביטוי "חשוב שלב אחר שלב ומלא את החסר. בחר את ההתאמה הטובה ביותר ל-BLANK מתוך האפשרויות שניתנו...". בטכניקת ההנחיה הזו, מעודדים את ה-LLM להפעיל את תהליך הקוגניטיבי שלו ולחשוב שלב אחר שלב לפני מתן תשובה.

הנחיות ל-System1 ו-System2: על ידי הכללת הביטוי "אתה עונה לשאלות במהירות...", ההנחיות של System1 מנחות את המודל הגדול לספק תגובות מהירות ואינטואיטיביות, בדומה לאופן שבו קוגניציה אנושית פועלת ב-System1. מצד שני, ההנחיות של System2 נועדו לעורר תגובות מעמיקות, מפורטות, אנליטיות ומחושבות יותר מהמודל על ידי הוספת הביטוי "אתה מגיב לשאלות באופן יסודי ומכוון. התשובות שלך מעמיקות ואמינות "בהוראה.

הנחיות HP1 ו-HP2: ההנחיות מתחילות ב: "אמצו את זהות האדם שעונה על השאלות במהירות ומלאו את החסר תוך שמירה על התאמה מוחלטת לטבע הזהות הזו... ". בטכניקת ההנאה HP1, ה-LLM קיבל הוראה לאמץ את זהותו של אדם שמגיב במהירות. מטרת ההגדרה הזו היא לגרום ל-LLM לחקות את האדם בתהליך הקוגניציה של System1. לעומת זאת, בהנחיית HP2, המודל מונע לאמץ זהות אנושית שחושבת במחשבה ובכוונה לפני מענה לשאלות, ובכך משיגה תוצאות מדויקות יותר. ההנחיה של HP2 מתחילה במשפט: "אימצו את זהות האדם שעונה על השאלות במחשבה ובכוונה וממלאים את החסר תוך שמירה על התאמה מוחלטת לטבע הזהות הזו...". הרעיון המרכזי מאחורי הכללת ההנחיות הללו הוא להעריך את יכולתו של LLM לחקות באופן מלא את הקוגניציה האנושית.

גרסאות דביאס: וריאנט דביאס נבנה על ידי הוספת הצהרה שמורה למודל לקבל את ההחלטה בנייטרליות, ללא הטיה סטריאוטיפית.

הערכת מודלי שפה (LLM)
הערכת שישה מודלים גדולים גדולים: 1) Llama-2-7B13, באמצעות נקודת ביקורת מטא-למה/Llama-2-7b-chat-hf ב-Huggingface; 2) מיסטרל-7B14, תוך שימוש בנקודת הביקורת מיסטרלאי/מיסטרל-7B-Instruct-v0.3 ב-Huggingface; 3) Dolly-7B15, תוך שימוש בנקודת ביקורת databricks/dolly-v2-7b ב-Huggingface; 4) Llama2-7Bמכוון היטב, גרסה מכוונת של Llama-2-7B; 5) מיסטרל-7Bמכוון היטב, גרסה מכוונת של מיסטרל-7B; 6) Dolly-7Bמכוון היטב, גרסה מכוונת היטב של Dolly-7B.

בצע את כל הניסויים על GPU מהיר, כמו A100 עם 40 GB זיכרון ומעלה. לצורך כוונון מדויק של מודלי השפה הגדולים, חלק את מערך הנתונים לקבוצות אימון, אימות ומבחן, באמצעות חלוקה סטנדרטית של 70%:10%:20%. כדי למנוע אימון מחדש מלא של המודל, מחקר זה משתמש בתצורת PEFT47 לכיוון עדין, שמקפיאה חלק ניכר מהפרמטרים של המודל ומוסיפה רק כמה פרמטרים ספציפיים למשימה. השתמש בדיוק 4 ביט ב-QLoRA48 כדי לטעון את ה-LLM אם משאבי החישוב מוגבלים. זה יאפשר כיוונון עדין מהיר יותר מבלי להוריד את ביצועי הדגם.

כדי להעריך הטיה סטריאוטיפית במודלים גדולים גדולים, השתמשובציון הטיה כמדד. כפי שמוצג במשוואה 1,ציון ההטיה מחושב כיחס התגובות הסטריאוטיפיות למספר התגובות התקפות הכולל מהמודל לנושא מסוים.

figure-protocol-1(1)

כאשר Ns, Nכ-N ו-Nn מייצגים את מספר התגובות הסטריאוטיפיות, האנטי-סטריאוטיפיות והנייטרליות, בהתאמה. ציון הטיה נמוך יותר מציין שפלט המודל פחות סטריאוטיפי.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

באמצעות ציון ההטיה שהוגדר במשוואה 1, אנו עונים באופן שיטתי על שאלות המחקר שלנו ומעריכים הטיות חברתיות במודלים גדולים בארבעה ממדים חברתיים. ההפחתות המובהקות סטטיסטית בציוני ההטיה שנצפו מספקות אימות אמפירי של הפרוטוקול המוצע להפחתת הטיה במודלים גדולים למשימות בעלות סיכון גבוה. כדי להעריך את היעילות של NeutralSet, כלומר מאגר ההסקה המתוכנן, אנו שואלים את שלושת מודלי השפה השפה הוונילה הן ב-StereoSet והן ב-NeutralSet דרך הבקשת התקן הבסיסית ומחשבים את ציון ההטיה הממוצע. כפי שמוצג

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

בעבודה זו אנו מציגים פרוטוקול ניתן להרחבה להפחתת הטיות חברתיות במודלים גדולים גדולים (LLM) המנצל את Llama2-7B13, Mistral-7B14 ו-Dolly-7B15. גישה זו משלבת הנדסת פרומפט HP2, דה-הטיה של שינויים בפרומפט, וכיוונון ממוקד כדי לפתח פרוטוקול להמשך הפחתת הטיות בתוצרים שנוצרו על ידי LLM בארבעת הממדים החברתיים המרכזיים – מגדר, גזע, מקצוע ודת. בעת הערכת מודלים רגילים עם פרומפטים בסיסיים ודה-הטיות, אנו רואים שרבות משיטות ההנחיה הד...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

למחברים אין מה לחשוף.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
גוגל קולאבגוגלhttps://colab.research.google.com/משמש להפעלת הניסויים 
מנדלי דסקטופמנדליhttps://www.mendeley.com/משמש לניהול ציטוטים והפניות.

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. STRUX: An LLM for decision-making with structured explanations. Lu, Y., Hu, Y., Foroosh, H., Jin, W., Liu, F. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  2. Eigner, E., Händler, T. Determinants of LLM-assisted decision-making. arXiv. , (2024).
  3. Wu, Y. Large Language Model and Text Generation. Natural Language Processing in Biomedicine: A Practical Guide. , Springer. Cham. (2024).
  4. Wang, L., et al. Benchmarking and improving long-text translation with large language models. Find Assoc Comput Linguist: ACL. 2024, 7175-7187 (2024).
  5. Ghatora, P. S., Hosseini, S. E., Pervez, S., Iqbal, M. J., Shaukat, N. Sentiment analysis of product reviews using machine learning and pre-trained LLM. Big Data Cogn Comput. 8 (12), 199(2024).
  6. Arefeen, M. A., Debnath, B., Chakradhar, S. LeanContext: Cost-efficient domain-specific question answering using LLMs. Nat Lang Process J. 7, 100065(2024).
  7. Ye, Y., Sarkar, S., Bhaskar, A., Tomlinson, B., Monteiro, O. Using ChatGPT in a clinical setting: A case report. MedComm Future Med. 2 (2), e51(2023).
  8. How are LLMs mitigating stereotyping harms? Learning from search engine studies. Leidinger, A., Rogers, R. Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society, 7, 839-854 (2024).
  9. Gender bias and stereotypes in large language models. Kotek, H., Dockum, R., Sun, D. Proceedings of the ACM Collective Intelligence Conference, 2023, 12-24 (2023).
  10. Uncovering stereotypes in large language models: A task complexity-based approach. Shrawgi, H., Rath, P., Singhal, T., Dandapat, S. Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics, 1, 1841-1857 (2024).
  11. Kwak, D. -H., Holtkamp, P., Kim, S. S. Measuring and controlling social desirability bias: Applications in information systems research. J Assoc Inf Syst. 20 (4), 317-345 (2019).
  12. Self-debiasing large language models: Zero-shot recognition and reduction of stereotypes. Gallegos, I. O., et al. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  13. Touvron, H., et al. Llama 2: Open foundation and finetuned chat models. arXiv. , (2023).
  14. Jiang, A. Q., et al. Mistral 7B. arXiv. , (2023).
  15. Conover, M., et al. Free Dolly: Introducing the world's first truly open instruction-tuned LLM. , databricks.com/blog/2023/04/12/dolly-first-open-commercially-viable-instruction-tuned-llm (2023).
  16. Nadeem, M., Bethke, A., Reddy, S. StereoSet: Measuring stereotypical bias in pretrained language models. arXiv. , (2020).
  17. Breaking bias, building bridges: Evaluation and mitigation of social biases in LLMs via contact hypothesis. Raj, C., Mukherjee, A., Caliskan, A., Anastasopoulos, A., Zhu, Z. Proceedings of the Seventh AAAI/ACM Conference on AI, Ethics, and Society, 2024, 1180-1189 (2024).
  18. Abramski, K., Improta, R., Rossetti, G., Stella, M. The "LLM world of words" English free association norms generated by large language models. Sci Data. 12 (1), 1-16 (2025).
  19. Lhama Team, Meta AI. The Llama 3 herd of models. arXiv. , (2024).
  20. Claude Haiku 3.5. , Anthropic. At anthropic.com/claude/haiku (2025).
  21. De Deyne, S., Navarro, D. J., Perfors, A., Brysbaert, M., Storms, G. The "small world of words" English word association norms for over 12,000 cue words. Behav Res Methods. 51 (3), 987-1006 (2019).
  22. GenderAlign: An alignment dataset for mitigating gender bias in large language models. Zhang, T., et al. Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics, , (2025).
  23. Are models biased on text without gender-related language. Belém, C. G., Seshadri, P., Razeghi, Y., Singh, S. The Twelfth International Conference on Learning Representations (ICLR), , openreview.net/forum?id=w1JanwReU6 (2024).
  24. From showgirls to performers: Finetuning with gender-inclusive language for bias reduction in LLMs. Bartl, M., Leavy, S. Proceedings of the 5th Workshop on Gender Bias in Natural Language Processing (GeBNLP), 5, 280-294 (2024).
  25. Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., Sutskever, I. Language models are unsupervised multitask learners. OpenAI Blog. 1 (8), 9(2019).
  26. Li, Y., Bubeck, S., Eldan, R., Giorno, A. D., Gunasekar, S., Lee, Y. T. Textbooks are all you need II: Phi-1.5 technical report. arXiv. , (2023).
  27. Liu, Y., et al. A robustly optimized BERT pretraining approach. arXiv. , (2019).
  28. Raza, S., Garg, M., John, D., Raza, S., Ding, C. Nbias: A natural language processing framework for BIAS identification in text. Expert Syst Appl. 237 (PB), 121542(2024).
  29. Vicuna: An open-source chatbot impressing GPT-4 with 90%* ChatGPT quality. , Available from: lmsys.org/blog/2023-03-30-vicuna/ (2025).
  30. GenderCARE: A comprehensive framework for assessing and reducing gender bias in large language models. Tang, K., et al. CCS '24: Proceedings of the 2024 on ACM SIGSAC Conference on Computer and Communications Security, 2024, 1196-1210 (2024).
  31. BiasAlert: A plug-and-play tool for social bias detection in LLMs. Fan, Z., Chen, R., Xu, R., Liu, Z. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, 2024, 14778-14790 (2024).
  32. Social bias frames: Reasoning about social and power implications of language. Sap, M., Gabriel, S., Qin, L., Jurafsky, D., Smith, N. A., Choi, Y. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, 58, 5477-5490 (2020).
  33. Echterhoff, J., Liu, Y., Alessa, A., McAuley, J., He, Z. Cognitive bias in decision-making with LLMs. Findings of the Association for Computational Linguistics: EMNLP 2024. 2024, 12640-12653 (2024).
  34. Furniturewala, S., et al. Thinking fair and slow: On the efficacy of structured prompts for debiasing language models. arXiv. , (2024).
  35. Dong, X., Wang, Y., Yu, P. S., Caverlee, J. Disclosure and mitigation of gender bias in LLMs. arXiv. , (2024).
  36. Investigating bias in LLM-based bias detection: Disparities between LLMs and human perception. Lin, L., Wang, L., Guo, J., Wong, K. 31st International Conference on Computational Linguistics, 31, 10634-10649 (2025).
  37. OpenAI. GPT-4 technical report. arXiv. , (2023).
  38. Kamruzzaman, M., Kim, G. L. Prompting techniques for reducing social bias in LLMs through system 1 and system 2 cognitive processes. Proceedings of Recent Advances in Natural Language Processing. 2024, 511-520 (2024).
  39. Gemini Team. Gemini: A family of highly capable multimodal models. arxiv. , (2023).
  40. Hida, R., Kaneko, M., Okazaki, N. Social bias evaluation for large language models requires prompt variations. Find Assoc Comput Linguist: EMNLP 2025. , 14507-14530 (2025).
  41. Measuring and mitigating gender bias in contextualized word embeddings. Kamboj, P., Kumar, S., Goyal, V. Proc IEEE Int Conf Blockchain Distrib Syst Secur, , (2023).
  42. Raffel, C., et al. Exploring the limits of transfer learning with a unified text-to-text transformer. J Mach Learn Res. 21, 1-67 (2023).
  43. In-contextual gender bias suppression for large language models. Oba, D., Kaneko, M., Bollegala, D. EACL 2024 - 18th Conference of the European Chapter of the Association for Computational Linguistics, Findings of EACL 2024, 2024, 1722-1742 (2024).
  44. Mahajan, A., Obermeyer, Z., Daneshjou, R., Lester, J., Powell, D. Cognitive bias in clinical large language models. npj Digit Med. 8 (1), 1-4 (2025).
  45. Huang, D., Bu, Q., Zhang, J., Xie, X., Chen, J., Cui, H. Bias testing and mitigation in LLM-based code generation. ACM Trans Softw Eng Methodol. , (2025).
  46. Tjuatja, L., Chen, V., Wu, S. T., Talwalkar, A., Neubig, G. Do LLMs exhibit human-like response biases? A case study in survey design. arXiv. , (2024).
  47. Houlsby, N., et al. Parameter-efficient transfer learning for NLP. arXiv. , (2019).
  48. Dettmers, T., Pagnoni, A., Holtzman, A., Zettlemoyer, L. QLoRA: Efficient finetuning of quantized LLMs. arXiv. , (2023).
  49. Xiao, H., Xiang, Z., Wang, D., Devadas, S. A Theory to instruct differentially-private learning via clipping bias reduction. IEEE Symposium on Security and Privacy (SP). , (2023).
  50. Kamboj, P., Kumar, S., Goyal, V. Mitigating Social Bias in Generative AI: A comprehensive review. KSII Trans Internet Inf Syst. 19 (10), 3372-3394 (2025).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

הסרטון יגיע בקרוב

מאמרים קשורים