$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Duże modele językowe mają ogromny rezonat jako narzędzia wspierające różnorodne zadania, w tym podejmowanie decyzji 1,2, generowanie tekstu3, tłumaczenie tekstu4, analiza nastrojów klientów5, odpowiadanie na pytania6 oraz generowanie raportów klinicznych7. W ostatnich latach zdarzało się kilka przypadków, gdy aplikacje wykorzystywały LLM do generowania treści szkodzących społecznie niekorzystnym osobom lub grupom 8,9,10. Głównym powodem takich banalnych odpowiedzi jest to, że modele te są trenowane na zbiorach danych, które z natury zawierają uprzedzenia społeczne związane z rasą, płcią, klasą społeczno-ekonomiczną i podobnymi czynnikami. Ale to, co rozumiesz przez "stronniczość" i "sprawiedliwość" w systemie AI w opiece zdrowotnej, może być subiektywne i zależne od kontekstu. Naukowcy włożyli znaczne wysiłki, aby złagodzić uprzedzenia społeczne w LLM11,12; jednak dalsze ulepszenia pozostają konieczne. Naukowcy zaproponowali wiele strategii ograniczania uprzedzeń, które można podzielić na preprocessing, in-processing, postprocessing lub ich kombinacje, w różnorodnym zakresie zastosowań. Ta klasyfikacja opiera się na etapie, na którym podejmowana jest miara łagodząca. Protokół ten łączy wszystkie trzy strategie mające na celu zwalczanie i łagodzenie uprzedzeń społecznych w sześciu wariantach LLM oraz bada redukcję uprzedzeń w czterech wymiarach uprzedzeń społecznych: płeć, zawód, rasa i religia. Po pierwsze, zbiór danych wnioskowania jest opracowywany z wykorzystaniem techniki augmentacji danych, aby umożliwić LLM generowanie wniosków. Po drugie, dwanaście typów promptów zostało zaprojektowanych tak, aby wywoływać stereotypowe odpowiedzi u LLM. Po trzecie, Llama-2-7B13, Mistral-7B14 i Dolly-7B15 są dopracowywane na zbiorze danych zawierającym bezstronne zdania z czterech kategorii społecznych: płeć, rasa, zawód i religia, aby uzyskać Llama-2-7BFinetuned, Mistral-7BFinetuned i Dolly-7BFinetuned, odpowiednio. Na koniec, wnioski są wyciągane, zachęcając dopracowane LLM do zbadania ich skuteczności w udzielaniu sprawiedliwych odpowiedzi.
Sformułowaliśmy następujące pytania badawcze i odnieśliśmy się do nich w tym artykule. Dla każdego sformułowanego pytania badawczego (RQ) formułowano hipotezę zerową (H0) oraz alternatywną hipotezę (H1).
RQ1: Czy zbiór danych wnioskowania i podstawowe techniki promptingu są skuteczne w ocenie społecznych uprzedzeń w LLM? Hipoteza zerowa (H01): Wyniki błędu uzyskane z zestawu danych wnioskowania w połączeniu z podstawowymi promptami są statystycznie nieodróżnialne od wyników błędu wyjściowego LLM. Alternatywna hipoteza (H11): Wyniki błędu z zestawu wnioskowania z podstawowymi promptami statystycznie istotnie różnią się od wyników błędu wyjściowego LLM. Aby przetestować hipotezę, zestaw danych NeutralSet został opracowany poprzez modyfikację StereoSet16 i ocenę każdego LLM za pomocą podstawowych technik promptingu, aby ocenić jego zdolność do generowania niestereotypowych odpowiedzi. W naszych ustawieniach uwzględniamy sześć podstawowych promptów – Standard (prompt zero-shot, który instruuje LLM do wyciągania wniosków), Chain-of-Thoughts (CoT jest zaprojektowany, by LLM myślał krok po kroku i wyciągał wnioski), System1 (prompt, który pozwala LLM szybko myśleć podczas odpowiadania), System2 (prompt, który ma zmusić LLM do myślenia powoli i z przemyślaniem), Human Persona 1 (HP1 został zaprojektowany tak, by LLM przyjął tożsamość człowieka, który myśli szybko podczas wykonywania oraz Human Persona 2 (HP2 zostało zaprojektowane tak, by LLM przyjął ludzką tożsamość, myśląc powoli i rozważnie odpowiadając).
RQ2: Czy techniki debasowania są skuteczne w ujawnianiu i łagodzeniu społecznych uprzedzeń w LLM? Hipoteza zerowa (H0₂): Techniki deboasing prompting nie są skuteczne w ujawnianiu i łagodzeniu społecznych uprzedzeń w LLM. Alternatywna hipoteza (H12): Zmierzone wyniki bias znacząco spadają, gdy stosowane są techniki debaasing prompting w LLM. Badamy wpływ odstronionych wariantów podstawowych promptów na trzy otwartoźródłowe LLM, aby osiągnąć sprawiedliwe generowanie tekstu wolne od jakiejkolwiek dyskryminacji społecznej.
RQ3: Czy uprzedzenia społeczne można dodatkowo ograniczyć poprzez dopracowywanie LLM? Hipoteza zerowa (H03): Dopracowywanie LLM nie zmniejsza dalszych uprzedzeń społecznych poza redukcją osiąganą wyłącznie technikami promptingu. Alternatywna hipoteza (H13): Precyzyjne dostrojenie LLM dodatkowo redukuje uprzedzenia społeczne poza redukcją osiąganą wyłącznie technikami promptowania. Aby odpowiedzieć na to pytanie, modyfikujemy zbiór danych17 i dopracowujemy na nim LLM, aby lepiej ocenić wpływ dostrojenia na ograniczanie reakcji stereotypowych.
Rysunek 1 ilustruje wpływ szybkiej zmienności i dopracowywania LLM na przewidywany wynik neutralny płciowo. Nowość naszej pracy wynika z integracji ręcznej kuracji zbiorów danych, wielu strategii debiasowania promptów oraz dopracowywania pod jednym protokołem analizy LLM w celu identyfikacji i łagodzenia uprzedzeń społecznych, istotnych dla wrażliwych rzeczywistych zastosowań, takich jak obrazowanie medyczne i utrzymanie EHR. Pogrupowaliśmy literaturę dotyczącą uprzedzeń w LLM w cztery perspektywy: zbiory danych dotyczące stronniczości i skojarzeń poznawczych; ramy wykrywania i oceny uprzedzeń; podejścia do ograniczania błędów uprzedzeń; oraz stronniczość w wyspecjalizowanych dziedzinach.
Naukowcy nieustannie generują zbiory danych, aby umożliwić ocenę błędów uprzedzeń i analizę skojarzeń semantycznych w LLM. Na przykład w psychologii poznawczej i lingwistyce swobodne skojarzenia zawsze odgrywają kluczową rolę w organizacji wiedzy pojęciowej. Symulując to samo powiązanie w utajonym rozkładzie LLM, Abramski i in.18 stworzyli zbiór danych LLM World of Words (LWOW). Zbiór danych LWOW o normach swobodnych skojarzeń angielskich, zawierający miliony odpowiedzi z trzech LLM: Mistral-7B14, Llama-3.1-8B19 oraz Claude-3-5-haiku-latest20. Inspiracją jest Small World of Words (SWOW)21, największym zbiorem danych o normach swobodnych skojarzeń w języku angielskim, który jest szeroko stosowany w różnych badaniach psychologicznych i językowych. Ponadto LWOW pomaga budować sieć poznawczą składającą się z węzłów, z których każdy reprezentuje jedno słowo, z węzłami odpowiadającymi semantycznie podobnym słowom, które są bliżej siebie w sieci. Pomaga to ocenić błędy w wynikach LLM, szacując odległość między słowami w sztucznej sieci poznawczej jako kluczową metrykę. Jedną z głównych przeszkód przy korzystaniu z zastrzeżonych LLM jest to, że ich wewnętrzne elementy są niedostępne. Mimo że w tych modelach podjęto znaczne wysiłki w celu przeciwdziałania błędom błędów, zbiory danych o dopasowaniu wciąż są rzadkie. Aby rozwiązać ten problem, w Zhang i in.22 zaproponowano zestaw danych o nazwie GenderAlign, mający na celu ograniczenie uprzedzeń płciowych w LLM. UnStereoEval23, zbiór benchmarków, ma badać stereotypowe uprzedzenia płciowe w zawodach i emocjach. Ich wyniki ujawniają niski poziom sprawiedliwości w 28 różnych LLM. Bartl i Leavy24 opracowali zbiór danych Tiny Heap, w którym zdania zawierające stereotypowe wzmianki są zastępowane neutralnymi odpowiednikami i dopracowano trzy modele językowe (GPT-225, PHI-1.526 i RoBERTa27). W swoich wynikach zauważają znaczący spadek stereotypowych tendencji modelek do płci.
Zaproponowano kilka wielowarstwowych ram mających na celu identyfikację i złagodzenie uprzedzeń w LLM. W Raza i in.28 proponowany jest ramowy model NBIAS, który obejmuje cztery warstwy: tworzenie zbiorów danych, rozwój modelu, łagodzenie uprzedzeń oraz ewaluację. Zbiór danych w ramach ramy opiera się na różnych dziedzinach, w tym na opiece zdrowotnej, mediach społecznościowych oraz portalach pracy. Pokazują skuteczność swojego modelu, przewyższając wartość wyjściową (29) o 1% do 8% w uczciwości. W innym takim ramie, GenderCARE30, proponowana jest strategia mająca na celu ograniczenie uprzedzeń płciowych w LLMS. W swoim szeroko zakrojonym programie eksperymentalnym skutecznie zmniejszyli uprzedzenia płciowe średnio o 35% w dwunastu różnych LLM. Ramowy system BiasAlet31 automatycznie wykrywa stronniczość społeczną w otwartym tekście generowanym przez LLM. Ma pewne ograniczenia: po pierwsze, badanie prowadzone jest na syntetycznym zbiorze danych z powodu braku punktu odniesienia do oceny stronniczości w generowaniu otwartego tekstu LLM, a po drugie, jest zbudowane na przestarzałym zbiorze danych SBIC32, co utrudnia rozróżnienie istotności ukrytego uprzedzenia od uprzedzenia samego zbioru danych. Uprzedzenia w danych generowanych przez człowieka mogą być wprowadzane do modeli trenowanych na nich. Stosowanie takich modeli budzi kontrowersje w miejscach o wysokiej stawce, gdzie ich wyniki mogą negatywnie wpływać na grupy w trudnej sytuacji. Aby temu sprostać, opracowano ramy BiasBuster33, które mają wykrywać, oceniać i łagodzić błędy poznawcze w LLM. W związku z tym, w innej pracy34 badacze proponują interaktywne ramy generujące sprawiedliwy, logiczny i krytyczny tekst za pomocą promptów System 2 (zaprojektowanych tak, by pozwolić LLM myśleć powoli i przemyślane), które uzupełniają samodzielnie dopracowane i implikujące prompty. Jednak ramy ograniczone są do zadań w przestrzeni ukrytej LLM. Dong i in.35 opracowali ramy wykorzystujące pośrednie badania do łagodzenia i oceny uprzedzeń płciowych w dziesięciu open-source LLM. W swojej metodzie badawczej, nie wykorzystując bezpośrednich stereotypowych wzmianek, ujawniają pośrednie uprzedzenia ze względu na płeć.
Lin i in.36 badają polityczne uprzedzenia w generowaniu tekstów przez LLM zarówno dla modeli zamkniętych (GPT-3.5-turbo i GPT-437), jak i otwartych (Llama-2-7B13, Mistral-7B14, Vicuna29). Ustalili, czy tekst generowany przez model wywołuje lewicowe czy prawicowe uprzedzenia medialne. Ponadto opracowali strategię łagodzenia poprzez dopracowywanie modelu i dostarczanie dodatkowych debiasowanych promptów podczas generowania tekstu. Po zastosowaniu techniki łagodzenia uprzedzeń model ma tendencję do generowania tekstu neutralnego; media lewicowe ani prawicowe nie mają na to wpływu. W związku z tym Raj i in.17 zaproponowali rozwiązanie debijające, Social Contact Debiasing (SCD), oparte na hipotezie kontaktu w psychologii, które obejmuje generowanie promptów uwzględniających ideologie różnych grup społecznych, aby zmniejszyć uprzedzenia w generowaniu tekstów trzech open-source LLM. Równolegle z tym Kamruzzaman i Kim38 zaproponowali technikę społecznego debiasingu, która wykorzystuje łańcuch myślowy Systemu 1 i Systemu 2, aby łagodzić działania przez dwanaście wymiarów bias w pięciu LLM (GPT-3.5, GPT-437, Llama-2-7B13, Mistral-7B14 i Gemini-1.039). Tutaj prompt System 1 ma na celu szybkie reagowanie LLM, natomiast prompt System 2 ma na celu nakierowanie go do bardziej przemyślanych i przemyślanych odpowiedzi. Chociaż przeprowadzono różne badania wykorzystujące inżynierię prompt do ograniczenia błędu w LLM, niewiele osób badało wpływ zmienności promptu na wyniki LLM. Aby rozwiązać ten problem, Hida i in.40 zbadali wrażliwość wyników dwunastu open-source LLM na wywoływanie zmienności oraz przeanalizowali ich wpływ na wydajność zadań i kompromisy uprzedzeń. Ich wyniki pokazują, że wyniki usuwania są wrażliwe na ten prompt; Mniejsze uprzedzenie w wyniku modeli prowadzi do niższej wydajności zadań. Kamboj i in.41 zaproponowali podejście post-processingowe mające na celu ograniczenie uprzedzeń płciowych w kontekstualizowanych osadzeniach modelu T5 (model Text-To-Text-Transfer-Transformer42). Oba i in.43 dostarczają ręcznie tworzone tekstowe preambule jako wskazówki dla LLM, aby tłumić ich stronnicze generowanie.
Błędy poznawcze, które od dziesięcioleci są źródłem błędów diagnostycznych w opiece zdrowotnej, są narażone na wszczepienie się i wzmacnianie przez duże modele językowe (LLM) w podejmowaniu decyzji klinicznych. Aby przeciwdziałać temu ryzyku, Mahajan i in.44 proponują, aby strategie łagodzenia wdrażania tych technologii koncentrowały się na trzech tematach: po pierwsze, autorefleksji (iteracyjnej ponownej ocenie rezultatów), po drugie, rozumowaniu kontekstowym (uwzględniającym pełną historię pacjentów i wytycznych opartych na dowodach) oraz wreszcie na przejrzystych śladach rozumowania (wyjaśnienia procesów rozumowania udostępnione do audytu). LLM, dzięki swojej powszechnej możliwości, są obecnie szeroko wykorzystywane do generowania kodu programistycznego. Dlatego jest to istotny problem dla badaczy, aby zbadać negatywne skutki ewentualnych społecznych uprzedzeń w generowanym kodzie. Jeśli takie uprzedzenie zostanie wykryte, należy opracować odpowiednie techniki łagodzenia. W tym samym kierunku Huang i in.45 zaproponowali technikę oceny i łagodzenia uprzedzeń społecznych oraz przetestowali ją na pięciu szeroko stosowanych LLM. W ostatnich latach obserwujemy ogromne postępy w architekturach LLM i ich zdolności do generowania odpowiedzi brzmiących ludzko. Czy LLM mogą pełnić rolę zastępców ludzi w podejmowaniu decyzji, pozostaje niedostatecznie zbadane i wymaga dalszych badań. W tym kierunku Tjuatja i in.46 opracowali ramy i zbiór danych, aby zbadać zdolność LLM do udzielania odpowiedzi podobnych do człowieka w kwestionariuszu ankietowym.
Pomimo tych postępów, istnieją trzy luki badawcze. Po pierwsze, wcześniejsze badania koncentrowały się na wąskich typach uprzedzeń (np. płeć lub polityka) lub na konkretnych obszarach (np. konkretny temat). Po drugie, chociaż inżynieria prompt jest powszechna, niewiele badań analizuje wpływ systematycznej zmienności promptu na wyniki LLM. Po trzecie, ograniczone badania dotyczą debijania w wymagającym, ograniczonym zasobowo precyzyjnym dostrojeniu LLM-ów otwartych dla kluczowych dziedzin, takich jak opieka zdrowotna. Aby załagodzić te luki, przedstawiono pojedynczy protokół ograniczania i oceny uprzedzeń, który może pomóc mierzyć stereotypowe uprzedzenia w różnych architekturach modeli, uwzględniając precyzyjne dostrojenie pod ograniczeniami obliczeniowymi oraz ocenę odporności decyzji modelowych względem metryk błędu.