$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
מודלים לשפה גדולים יש תהודה אדירה ככלים לתמיכה במשימות מגוונות, כולל קבלת החלטות 1,2, יצירת טקסט3, תרגוםטקסט 4, ניתוח תחושת לקוחות5, מענה לשאלות6, ויצירת דוחות קליניים7. בשנים האחרונות התרחשו מספר מקרים שבהם יישומים השתמשו במודלים גדולים ליצירת תוכן שפוגע באנשים או קבוצות מוחלשות חברתית 8,9,10. הסיבה העיקרית לתגובות כאלה היא שמודלים אלו מאומנים על מערכי נתונים שמכילים מטבעם הטיות חברתיות הקשורות לגזע, מגדר, מעמד סוציו-אקונומי וגורמים דומים. אבל מה שאתה מתכוון ב"הטיה" ו"הגינות" במערכת בינה מלאכותית בתחום הבריאות יכול להיות סובייקטיבי ותלוי בהקשר. חוקרים השקיעו מאמצים ניכרים להפחתת הטיות חברתיות במודלים 11,12; עם זאת, עדיין יש צורך בשיפור נוסף. החוקרים הציעו אסטרטגיות שונות להפחתת הטיות, שניתן לסווגן כקדם-עיבוד, בעיבוד, עיבוד לאחר או שילובים ביניהם, במגוון יישומים הטרוגני. סיווג זה מבוסס על השלב בו ננקטת אמצעי ההפחתה. פרוטוקול זה משלב את שלוש האסטרטגיות להתמודדות ולהקלה על הטיה חברתית בשישה וריאנטים של מודלים גדולים וחוקר הפחתת הטיות בארבעה ממדים של הטיות חברתיות: מגדר, מקצוע, גזע ודת. ראשית, מערך נתונים להסקה מפותח באמצעות טכניקת הגדלת נתונים כדי לאפשר למודלים גדולים גדולים לייצר הסקנות. שנית, שנים-עשר סוגי פרומפטים נועדו לעורר תגובות סטריאוטיפיות ממודלים גדולים גדולים. שלישית, Llama-2-7B13, Mistral-7B14 ודולי-7B15 מכוונים בעדינות על מאגר נתונים הכולל משפטים בלתי מוטים בארבע הקטגוריות החברתיות: מגדר, גזע, מקצוע ודת, כדי לקבל Llama-2-7B מכווןעדין, Mistral-7Bמכוון עדין, ו-Dolly-7Bמכוון עדין, בהתאמה. לבסוף, מסקנות מתקבלות על ידי דחיפה למודלים הגדולים המדויקים לחקור את יעילותם במתן תגובות הוגנות.
ניסחנו את שאלות המחקר הבאות והתייחסנו אליהן במאמר זה. לכל שאלה מחקרית נוסחת (RQ), נוסחו השערה אפסית (H0) והשערה חלופית (H1).
RQ1: האם מערך הנתונים של ההסקה וטכניקות ההנחה הבסיסיות יעילים בהערכת ההטיות החברתיות במודלים גדולים גדולים? השערת אפס (H01): ציוני ההטיה שמקורם במאגר הסקה כאשר משולבים עם הנחיות בסיסיות אינם מובחנים סטטיסטית מציוני ההטיה הבסיסית של מודלי השפה הגדולה. השערה חלופית (H11): ציוני הטיה ממאגר ההסקה עם השאלות בסיסיות שונים באופן מובהק סטטיסטית מציוני הטיית בסיס של מודלים גדולים. כדי לבדוק את ההשערה, מערך נתונים בשם NeutralSet נערך על ידי שינוי StereoSet16 והערכת כל מודל שפה שפה (LLM) באמצעות טכניקות הנחיה בסיסיות להערכת יכולתו לייצר תגובות לא סטריאוטיפיות. בהגדרות שלנו, אנו כוללים שישה הנחיות בסיסיות — סטנדרטית (הנחיית זילום אפס שמנחה את ה-LLM לבצע מסקנות), שרשרת מחשבות (CoT נועדה לבקש מהמודל לחשוב שלב אחר שלב כדי להסיק מסקנות), System1 (הנחיה לאפשר למודל לחשוב מהר תוך כדי תשובה), System2 (הנחיה שגורמת ל-LLM לחשוב לאט ובמחשבה), פרסונה אנושית 1 (HP1 נועדה לגרום ל-LLM לאמץ את זהות האדם שחושב מהר בזמן קבלת החלטות), ו-Human Persona 2 (HP2 נועד לגרום ל-LLM לאמץ את הזהות האנושית שחושבת לאט ובמחשבה תוך כדי תשובה).
RQ2: האם טכניקות ההנעה להדה-הטיה יעילות בגילוי והפחתת הטיות חברתיות במודלים גדולים גדולים? השערת אפס (H0₂): טכניקות ההנעה להפחתת הטיות אינן יעילות בגילוי והפחתת הטיות חברתיות במודלים גדולים גדולים. השערה חלופית (H12): ציוני הטיה מדודים יורדים משמעותית כאשר משתמשים בטכניקות הנחיות להפחתת הטיה במודלים גדולים גדולים. אנו חוקרים את ההשפעה של גרסאות דה-מוטיות של ההנחיות הבסיסיות על שלושה מודלים בקוד פתוח כדי להשיג יצירת טקסט הוגנת ללא אפליה חברתית.
RQ3: האם ניתן להפחית הטיות חברתיות עוד יותר על ידי כיוונון עדין של מודלים גדולים? השערת אפס (H03): כיוונון עדין של מודלי שפה לא מפחיתה עוד יותר הטיות חברתיות מעבר להפחתות שהושגו באמצעות טכניקות ההנעה בלבד. השערה חלופית (H13): כיוונון עדין של מודלים גדולים מפחיתה עוד יותר הטיות חברתיות מעבר להפחתות שהושגו באמצעות טכניקות הנעה בלבד. כדי לענות על שאלה זו, אנו משנים את מערך הנתונים17 ומכוונים את המודלים הגדולים עליו כדי להעריך עוד יותר את השפעת הכוונון העדין בהפחתת תגובות סטריאוטיפיות.
איור 1 ממחיש את השפעת שונות הפרומפט וכיוונון מדויק של מודל LLM על התוצאה הנואלת מגדרית הנייטרלית. החידוש בעבודתנו נובע משילוב אוצרות ידנית של מערכי נתונים, אסטרטגיות שונות להסרת הטיות, וכיוונון מדויק תחת פרוטוקול אחד לניתוח מודל שפה גדולה לזיהוי והקלה של הטיות חברתיות, הרלוונטי ליישומים רגישים בעולם האמיתי כמו דימות רפואי ותחזוקת מערכות רפואיות אלקטרוניות. קיבלנו את הספרות על הטיה במודלים גדולים לארבע נקודות מבט: מערכי נתונים להטיה ואסוציאציות קוגניטיביות; מסגרות לזיהוי והערכת הטיות; גישות להפחתת הטיות; והטיה בתחומים מיוחדים.
חוקרים מייצרים באופן מתמיד מערכי נתונים כדי לאפשר הערכת הטיות וניתוח אסוציאציות סמנטיות במודלים גדולים. לדוגמה, בפסיכולוגיה קוגניטיבית ובלשנות, אסוציאציות חופשיות תמיד מכריעות בארגון הידע המושגי. בסימולציה של אותה אסוציאציה בהתפלגות החבויה של מודלים גדולים, אברמסקי ואח' בנו מערך נתונים בשם LLM World of Words (LWOW). מאגר הנתונים של נורמות האסוציאציה החופשית באנגלית של LWOW, הכולל מיליוני תגובות משלושה מודלים גדולים: מיסטרל-7B14, לאמה-3.1-8B19, וקלוד-3-5-הייקו-אחרונים20. הוא שואב השראה מ-Small World of Words (SWOW)21, מאגר הנתונים הגדול ביותר של נורמות אסוציאציות חופשיות באנגלית אנושית, אשר שימש רבות במגוון מחקרים פסיכולוגיים ולשוניים. יתרה מזאת, LWOW מסייע בבניית רשת קוגניטיבית הכוללת צמתים, שכל אחד מהם מייצג מילה, כאשר צמתים התואמים למילים דומות סמנטית שקרובות זו לזו ברשת. דבר זה מסייע להעריך הטיה בתפוקת מודלים גדולים על ידי הערכת המרחק בין מילים ברשת הקוגניטיבית המלאכותית כמדד מרכזי. מכשול מרכזי בשימוש במודלים גדולים קנייניים הוא שהחלקים הפנימיים שלהם אינם נגישים. למרות שנעשו מאמצים משמעותיים במודלים אלו להתמודדות עם הטיות, מאגרי נתוני יישור עדיין נדירים. כדי להתמודד עם דאגה זו, מוצע מאגר נתונים בשם GenderAlign אצל ז'אנג ואח' במטרה להפחית הטיה מגדרית במודלים של שפה גדולה. UnStereoEval23, מערך נתונים מדד, מוצע לחקור הטיה מגדרית סטריאוטיפית במקצועות ורגשות. ממצאיהם חושפים רמת הוגנות נמוכה ב-28 מודלים שונים. ברטל וליווי24 פיתחו מאגר נתונים בשם Tiny Heap, שבו משפטים עם אזכורים סטריאוטיפיים מוחלפים במקבילות ניטרליות ושלושה מודלים לשוניים מותאמים (GPT-225, PHI-1.526, ו-RoBERTa27). בממצאיהם, הם מבחינים בהפחתה משמעותית בנטיות הסטריאוטיפיות המגדריות של המודלים.
הוצעו מספר מסגרות רב-שכבתיות לזיהוי והקלה על הטיות במודלים גדולים. ב-Raza ואחרים, מוצעת מסגרת בשם NBIAS הכוללת ארבע שכבות: יצירת מערכי נתונים, פיתוח מודלים, הפחתת הטיות והערכה. מאגר הנתונים במסגרת בנוי מתחומים מגוונים, כולל בריאות, רשתות חברתיות ופורטלי תעסוקה. הם מציגים את יעילות המודל שלהם בכך שהם עולים על קו הבסיס (BERT29) ב-1% עד 8% בהגינות. במסגרת נוספת, GenderCARE30, מוצעת אסטרטגיה להפחתת הטיה מגדרית ב-LLMS. במסגרת הניסוי הנרחבת שלהם, הם הפחיתו למעשה הטיית מגדר בממוצע של 35% בשנים עשר מודלים שונים. מסגרת, BiasAlet31, מזהה אוטומטית הטיה חברתית בטקסט הפתוח שנוצר על ידי מודלי השפה הגדולים. יש לכך כמה מגבלות: ראשית, המחקר מתבצע על מאגר נתונים מסונתז בשל חוסר זמינות של מדד המדד להערכת הטיה ביצירת הטקסט הפתוח של המודל, ושנית, הוא בנוי על מערך הנתונים המיושן SBIC32, מה שמקשה להבחין בין הרלוונטיות של הטיה מרומזת לבין ההטיה במאגר הנתונים עצמו. הטיה בנתונים שנוצרו על ידי בני אדם עשויה להיכנס למודלים המאומנים עליהם. השימוש במודלים כאלה שנוי במחלוקת במשרות בעלות סיכון גבוה, שבהן התפוקה שלהם עלולה להשפיע לרעה על קבוצות מוחלשות. כדי להתמודד עם זה, מסגרת בשם BiasBuster33 נועדה לזהות, להעריך ולהפחית הטיה קוגניטיבית במודלים גדולים. בהתאם לכך, בעבודהנוספת 34, חוקרים מציעים מסגרת אינטראקטיבית ליצירת טקסט הוגן, לוגי וביקורתי באמצעות הנחיות מערכת 2 (שנועדו לאפשר למודל לחשוב במחשבה ואיטיות) שמשלימות הנחיות מעובדות ומשלימות. עם זאת, המסגרת מוגבלת למשימות בתוך המרחב החבוי של מודלי השפה הגדולה. דונג ואחרים פיתחו מסגרת המשתמשת בחקירה עקיפה כדי להפחית ולהעריך הטיה מגדרית בעשרה מודלים בקוד פתוח. בשיטת החקירה שלהם, מבלי לנצל אזכורים סטריאוטיפיים ישירים, הם חושפים הטיה מגדרית עקיפה.
לין ואח' 36 חוקרים את ההטיה הפוליטית ביצירת טקסטים על ידי מודלי השפה הגדולים הן עבור דגמים סגורים (GPT-3.5-טורבו, ו-GPT-437) והן במודלים פתוחים (Llama-2-7B13, Mistral-7B14, Vicuna29). הם קבעו האם הטקסט שנוצר על ידי המודל גורם להטיית מדיה שמאלית או ימינה. יתרה מזאת, הם פיתחו אסטרטגיית הפחתה על ידי כיוונון עדין של המודל ומתן הנחיות נוספות ללא הטיות במהלך יצירת הטקסט. לאחר יישום טכניקת הפחתת ההטיה, המודל נוטה לייצר טקסט ניטרלי; התקשורת השמאלית או הימנית לא משפיעה על זה. בהתאם לכך, ראג' ואחרים הציעו פתרון דה-הטיה, הסרת הטיות במגע חברתי (SCD), המבוסס על השערת המגע בפסיכולוגיה, הכוללת יצירת פרומפטים שמבינים את האידיאולוגיות של קבוצות חברתיות שונות כדי להפחית דעות קדומות ביצירת טקסט של שלושה מודלים גדולים בקוד פתוח. במקביל לכך, קמרוזזמן וקים38 הציעו טכניקת דה-הטיה חברתית המנצלת את שרשרת המחשבה של מערכת 1 ומערכת 2 כדי להפחית את ההטיה על פני שנים-עשר ממדי הטיה בחמישה מודלים גדולים (GPT-3.5, GPT-437, Llama-2-7B13, Mistral-7B14, ו-Gemini-1.039). כאן, הנחיית מערכת 1 נועדה לגרום למודל להגיב במהירות, בעוד שפרומפט System 2 מיועד להנחות אותו לתשובות מעמיקות ומכוונות יותר. למרות שנערכו מחקרים שונים המשתמשים בהנדסת פרומפטינג כדי להפחית את ההטיה במודלים גדולים, מעטים בחנו את השפעת שונות הפרומפט על תפוקת מודלים. כדי להתמודד עם הבעיה הזו, Hida ואח' חקרו את הרגישות של הפלטים של שנים-עשר מודלי שפה גדולים בקוד פתוח ליצירת שונות וניתחו את השפעתם על ביצועי המשימות ופשרות הטיה. הממצאים שלהם מגלים שתוצאות הדה-הטיה רגישות לפרומפציה; פחות הטיה בתפוקת המודל מובילה לביצועי משימות נמוכים יותר. קמבוי ואח' 41 הציעו גישת עיבוד לאחר מכן להפחתת הטיית מגדר בהטמעות-הקשריות של מודל T5 (מודל טקסט-לטקסט-העבר-טרנספורמר42). Oba ואחרים 43 מספקים הקדמות טקסטואליות שנוצרו ידנית כהנחיות למודלים גדולים כדי לדכא את היצירה המוטה שלהם.
הטיות קוגניטיביות, שהיו מקור לטעויות אבחנתיות במערכת הבריאות במשך עשרות שנים, נמצאות בסיכון להיטבע ולהועצם על ידי מודלים לשוניים גדולים (LLMs) בקבלת החלטות קליניות. כדי להתמודד עם סיכון זה, מהאג'אן ואח' מציעים כי אסטרטגיות הפחתה ליישום טכנולוגיות אלו צריכות להתמקד בשלושה נושאים: ראשית, התבוננות עצמית (הערכה מחודשת של תוצרים), שנית, הסקה קונטקסטואלית (הכוללת היסטוריה מלאה של המטופל והנחיות מבוססות ראיות), ולבסוף, עקבות חשיבה שקופים (הסברים על תהליכי הסקה הזמינים לביקורת). מודלי שפה גדולה, עם היכולת הנפוצה שלהם, משמשים כיום גם באופן נרחב ליצירת קוד תכנות. לכן, זו דאגה מרכזית עבור חוקרים לחקור את ההשפעות השליליות של כל הטיה חברתית בקוד שנוצר. אם זוהתה הטיה כזו, יש לפתח את טכניקות ההפחתה המתאימות. באותו כיוון, הואנג ואחרים 45 הציעו טכניקת הערכה והפחתת הטיות חברתיות ובדקו אותה על חמישה מודלים גדולים נפוצים. בשנים האחרונות ראינו התקדמויות עצומות בארכיטקטורות LLM וביכולתן לייצר תגובות שנשמעות אנושיות. האם מודלים גדולים גדולים יכולים לשמש תחליף לבני אדם בקבלת החלטות עדיין לא נחקר ודורש מחקר נוסף. בכיוון זה, מסגרת ומערך נתונים אוצרים על ידי Tjuatja ואחרים.46 כדי לחקור את היכולת של מודלים גדולים לתת תשובות דמויות אדם בשאלון סקר.
למרות ההתקדמות הזו, שלושה פערי מחקר קיימים. ראשית, מחקרים קודמים נוטים להתמקד בסוגים צרים של הטיה (למשל, מגדר או פוליטי) או בתחומים ספציפיים (למשל, נושא מסוים). שנית, למרות שהנדסת פרומפט נפוצה, מעט מחקרים בוחנים את השפעות השונות השיטתית של פרומפט על תפוקת LLM. שלישית, מחקר מוגבל עוסק בדהטיות בהגדרת כוונון עדין מוגבלת במשאבים של מודלים בקוד פתוח הרלוונטיים לתחומים קריטיים כמו בריאות. כדי להתמודד עם פערים אלו, מוצג פרוטוקול יחיד להפחתת הטיה והערכה שיכול לסייע במדידת הטיה סטריאוטיפית בין ארכיטקטורות מודל שונות, תוך שילוב כיוונון עדין תחת מגבלות חישוביות והערכת עמידות החלטות המודל מול מדדי הטיה.