Artykuł badawczy

Poprawa sprawiedliwości w dużych modelach językowych dla zastosowań sztucznej inteligencji klinicznej poprzez precyzyjne dostrojenie i prompting

DOI:

10.3791/69132

2 stycznia 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Duże modele językowe specyficzne dla opieki zdrowotnej napotykają wyzwania etyczne i techniczne, ponieważ podobnie jak inne duże modele językowe, odzwierciedlają uprzedzenia inherentne w danych treningowych. Przedstawiony tutaj protokół weryfikuje tłumienie czterech typów uprzedzeń (płeć, rasa, zawód, religia) za pomocą wariantów prompt w trzech modelach open-source.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Duże modele językowe (LLM) są coraz częściej stosowane w wrażliwych obszarach, takich jak opieka medyczna, które stawiają przed sobą liczne wyzwania techniczne i etyczne. Najpilniejsze problemy to uprzedzenia wbudowane w te modele, które są trenowane na dużych zbiorach danych mogących odzwierciedlać uprzedzenia społeczne. Takie uprzedzenia mogą prowadzić do wyników niesprawiedliwych, nieuogólnialnych, a nawet szkodliwych, czyniąc je klinicznie niestosowalnymi w rzeczywistym świecie i niezgodnymi z ograniczeniami etycznymi oraz regulacyjnymi. Analizujemy, jak skutecznie działa tłumienie uprzedzeń, gdy dopracowane modele są wywoływane w czterech kluczowych kategoriach (płeć, rasa, zawód i religia). Ręcznie wybieramy różnorodny zbiór danych wnioskowania i tworzymy dwanaście wariantów promptów — z których sześć jest usuwanych — aby przetestować wyniki trzech open-source LLM: Llama2-7B, Mistral-7B i Dolly-7B. Sprawiedliwość i interpretowalność wyników oceniane są za pomocą metryki punktacji uprzedzenia, gdzie niższe wyniki wskazują na lepszą sprawiedliwość i łatwość interpretacji. Zauważamy też, że prompty z debiasem zmniejszają stronniczość, a precyzyjne dostrojenie modelu działa jeszcze lepiej. Wyniki podkreślają kluczowe znaczenie terminowego działania, odporności modelu oraz ciągłej kontroli etycznej dla wiarygodnego i sprawiedliwego wdrażania LLM w rzeczywistych warunkach, takich jak obrazowanie medyczne, oraz utrzymanie elektronicznej dokumentacji medycznej (EHR).

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Duże modele językowe mają ogromny rezonat jako narzędzia wspierające różnorodne zadania, w tym podejmowanie decyzji 1,2, generowanie tekstu3, tłumaczenie tekstu4, analiza nastrojów klientów5, odpowiadanie na pytania6 oraz generowanie raportów klinicznych7. W ostatnich latach zdarzało się kilka przypadków, gdy aplikacje wykorzystywały LLM do generowania treści szkodzących społecznie niekorzystnym osobom lub grupom 8,9,10. Głównym powodem takich banalnych odpowiedzi jest to, że modele te są trenowane na zbiorach danych, które z natury zawierają uprzedzenia społeczne związane z rasą, płcią, klasą społeczno-ekonomiczną i podobnymi czynnikami. Ale to, co rozumiesz przez "stronniczość" i "sprawiedliwość" w systemie AI w opiece zdrowotnej, może być subiektywne i zależne od kontekstu. Naukowcy włożyli znaczne wysiłki, aby złagodzić uprzedzenia społeczne w LLM11,12; jednak dalsze ulepszenia pozostają konieczne. Naukowcy zaproponowali wiele strategii ograniczania uprzedzeń, które można podzielić na preprocessing, in-processing, postprocessing lub ich kombinacje, w różnorodnym zakresie zastosowań. Ta klasyfikacja opiera się na etapie, na którym podejmowana jest miara łagodząca. Protokół ten łączy wszystkie trzy strategie mające na celu zwalczanie i łagodzenie uprzedzeń społecznych w sześciu wariantach LLM oraz bada redukcję uprzedzeń w czterech wymiarach uprzedzeń społecznych: płeć, zawód, rasa i religia. Po pierwsze, zbiór danych wnioskowania jest opracowywany z wykorzystaniem techniki augmentacji danych, aby umożliwić LLM generowanie wniosków. Po drugie, dwanaście typów promptów zostało zaprojektowanych tak, aby wywoływać stereotypowe odpowiedzi u LLM. Po trzecie, Llama-2-7B13, Mistral-7B14 i Dolly-7B15 są dopracowywane na zbiorze danych zawierającym bezstronne zdania z czterech kategorii społecznych: płeć, rasa, zawód i religia, aby uzyskać Llama-2-7BFinetuned, Mistral-7BFinetuned i Dolly-7BFinetuned, odpowiednio. Na koniec, wnioski są wyciągane, zachęcając dopracowane LLM do zbadania ich skuteczności w udzielaniu sprawiedliwych odpowiedzi.

Sformułowaliśmy następujące pytania badawcze i odnieśliśmy się do nich w tym artykule. Dla każdego sformułowanego pytania badawczego (RQ) formułowano hipotezę zerową (H0) oraz alternatywną hipotezę (H1).

RQ1: Czy zbiór danych wnioskowania i podstawowe techniki promptingu są skuteczne w ocenie społecznych uprzedzeń w LLM? Hipoteza zerowa (H01): Wyniki błędu uzyskane z zestawu danych wnioskowania w połączeniu z podstawowymi promptami są statystycznie nieodróżnialne od wyników błędu wyjściowego LLM. Alternatywna hipoteza (H11): Wyniki błędu z zestawu wnioskowania z podstawowymi promptami statystycznie istotnie różnią się od wyników błędu wyjściowego LLM. Aby przetestować hipotezę, zestaw danych NeutralSet został opracowany poprzez modyfikację StereoSet16 i ocenę każdego LLM za pomocą podstawowych technik promptingu, aby ocenić jego zdolność do generowania niestereotypowych odpowiedzi. W naszych ustawieniach uwzględniamy sześć podstawowych promptów – Standard (prompt zero-shot, który instruuje LLM do wyciągania wniosków), Chain-of-Thoughts (CoT jest zaprojektowany, by LLM myślał krok po kroku i wyciągał wnioski), System1 (prompt, który pozwala LLM szybko myśleć podczas odpowiadania), System2 (prompt, który ma zmusić LLM do myślenia powoli i z przemyślaniem), Human Persona 1 (HP1 został zaprojektowany tak, by LLM przyjął tożsamość człowieka, który myśli szybko podczas wykonywania oraz Human Persona 2 (HP2 zostało zaprojektowane tak, by LLM przyjął ludzką tożsamość, myśląc powoli i rozważnie odpowiadając).

RQ2: Czy techniki debasowania są skuteczne w ujawnianiu i łagodzeniu społecznych uprzedzeń w LLM? Hipoteza zerowa (H0₂): Techniki deboasing prompting nie są skuteczne w ujawnianiu i łagodzeniu społecznych uprzedzeń w LLM. Alternatywna hipoteza (H12): Zmierzone wyniki bias znacząco spadają, gdy stosowane są techniki debaasing prompting w LLM. Badamy wpływ odstronionych wariantów podstawowych promptów na trzy otwartoźródłowe LLM, aby osiągnąć sprawiedliwe generowanie tekstu wolne od jakiejkolwiek dyskryminacji społecznej.

RQ3: Czy uprzedzenia społeczne można dodatkowo ograniczyć poprzez dopracowywanie LLM? Hipoteza zerowa (H03): Dopracowywanie LLM nie zmniejsza dalszych uprzedzeń społecznych poza redukcją osiąganą wyłącznie technikami promptingu. Alternatywna hipoteza (H13): Precyzyjne dostrojenie LLM dodatkowo redukuje uprzedzenia społeczne poza redukcją osiąganą wyłącznie technikami promptowania. Aby odpowiedzieć na to pytanie, modyfikujemy zbiór danych17 i dopracowujemy na nim LLM, aby lepiej ocenić wpływ dostrojenia na ograniczanie reakcji stereotypowych.

Rysunek 1 ilustruje wpływ szybkiej zmienności i dopracowywania LLM na przewidywany wynik neutralny płciowo. Nowość naszej pracy wynika z integracji ręcznej kuracji zbiorów danych, wielu strategii debiasowania promptów oraz dopracowywania pod jednym protokołem analizy LLM w celu identyfikacji i łagodzenia uprzedzeń społecznych, istotnych dla wrażliwych rzeczywistych zastosowań, takich jak obrazowanie medyczne i utrzymanie EHR. Pogrupowaliśmy literaturę dotyczącą uprzedzeń w LLM w cztery perspektywy: zbiory danych dotyczące stronniczości i skojarzeń poznawczych; ramy wykrywania i oceny uprzedzeń; podejścia do ograniczania błędów uprzedzeń; oraz stronniczość w wyspecjalizowanych dziedzinach.

Naukowcy nieustannie generują zbiory danych, aby umożliwić ocenę błędów uprzedzeń i analizę skojarzeń semantycznych w LLM. Na przykład w psychologii poznawczej i lingwistyce swobodne skojarzenia zawsze odgrywają kluczową rolę w organizacji wiedzy pojęciowej. Symulując to samo powiązanie w utajonym rozkładzie LLM, Abramski i in.18 stworzyli zbiór danych LLM World of Words (LWOW). Zbiór danych LWOW o normach swobodnych skojarzeń angielskich, zawierający miliony odpowiedzi z trzech LLM: Mistral-7B14, Llama-3.1-8B19 oraz Claude-3-5-haiku-latest20. Inspiracją jest Small World of Words (SWOW)21, największym zbiorem danych o normach swobodnych skojarzeń w języku angielskim, który jest szeroko stosowany w różnych badaniach psychologicznych i językowych. Ponadto LWOW pomaga budować sieć poznawczą składającą się z węzłów, z których każdy reprezentuje jedno słowo, z węzłami odpowiadającymi semantycznie podobnym słowom, które są bliżej siebie w sieci. Pomaga to ocenić błędy w wynikach LLM, szacując odległość między słowami w sztucznej sieci poznawczej jako kluczową metrykę. Jedną z głównych przeszkód przy korzystaniu z zastrzeżonych LLM jest to, że ich wewnętrzne elementy są niedostępne. Mimo że w tych modelach podjęto znaczne wysiłki w celu przeciwdziałania błędom błędów, zbiory danych o dopasowaniu wciąż są rzadkie. Aby rozwiązać ten problem, w Zhang i in.22 zaproponowano zestaw danych o nazwie GenderAlign, mający na celu ograniczenie uprzedzeń płciowych w LLM. UnStereoEval23, zbiór benchmarków, ma badać stereotypowe uprzedzenia płciowe w zawodach i emocjach. Ich wyniki ujawniają niski poziom sprawiedliwości w 28 różnych LLM. Bartl i Leavy24 opracowali zbiór danych Tiny Heap, w którym zdania zawierające stereotypowe wzmianki są zastępowane neutralnymi odpowiednikami i dopracowano trzy modele językowe (GPT-225, PHI-1.526 i RoBERTa27). W swoich wynikach zauważają znaczący spadek stereotypowych tendencji modelek do płci.

Zaproponowano kilka wielowarstwowych ram mających na celu identyfikację i złagodzenie uprzedzeń w LLM. W Raza i in.28 proponowany jest ramowy model NBIAS, który obejmuje cztery warstwy: tworzenie zbiorów danych, rozwój modelu, łagodzenie uprzedzeń oraz ewaluację. Zbiór danych w ramach ramy opiera się na różnych dziedzinach, w tym na opiece zdrowotnej, mediach społecznościowych oraz portalach pracy. Pokazują skuteczność swojego modelu, przewyższając wartość wyjściową (29) o 1% do 8% w uczciwości. W innym takim ramie, GenderCARE30, proponowana jest strategia mająca na celu ograniczenie uprzedzeń płciowych w LLMS. W swoim szeroko zakrojonym programie eksperymentalnym skutecznie zmniejszyli uprzedzenia płciowe średnio o 35% w dwunastu różnych LLM. Ramowy system BiasAlet31 automatycznie wykrywa stronniczość społeczną w otwartym tekście generowanym przez LLM. Ma pewne ograniczenia: po pierwsze, badanie prowadzone jest na syntetycznym zbiorze danych z powodu braku punktu odniesienia do oceny stronniczości w generowaniu otwartego tekstu LLM, a po drugie, jest zbudowane na przestarzałym zbiorze danych SBIC32, co utrudnia rozróżnienie istotności ukrytego uprzedzenia od uprzedzenia samego zbioru danych. Uprzedzenia w danych generowanych przez człowieka mogą być wprowadzane do modeli trenowanych na nich. Stosowanie takich modeli budzi kontrowersje w miejscach o wysokiej stawce, gdzie ich wyniki mogą negatywnie wpływać na grupy w trudnej sytuacji. Aby temu sprostać, opracowano ramy BiasBuster33, które mają wykrywać, oceniać i łagodzić błędy poznawcze w LLM. W związku z tym, w innej pracy34 badacze proponują interaktywne ramy generujące sprawiedliwy, logiczny i krytyczny tekst za pomocą promptów System 2 (zaprojektowanych tak, by pozwolić LLM myśleć powoli i przemyślane), które uzupełniają samodzielnie dopracowane i implikujące prompty. Jednak ramy ograniczone są do zadań w przestrzeni ukrytej LLM. Dong i in.35 opracowali ramy wykorzystujące pośrednie badania do łagodzenia i oceny uprzedzeń płciowych w dziesięciu open-source LLM. W swojej metodzie badawczej, nie wykorzystując bezpośrednich stereotypowych wzmianek, ujawniają pośrednie uprzedzenia ze względu na płeć.

Lin i in.36 badają polityczne uprzedzenia w generowaniu tekstów przez LLM zarówno dla modeli zamkniętych (GPT-3.5-turbo i GPT-437), jak i otwartych (Llama-2-7B13, Mistral-7B14, Vicuna29). Ustalili, czy tekst generowany przez model wywołuje lewicowe czy prawicowe uprzedzenia medialne. Ponadto opracowali strategię łagodzenia poprzez dopracowywanie modelu i dostarczanie dodatkowych debiasowanych promptów podczas generowania tekstu. Po zastosowaniu techniki łagodzenia uprzedzeń model ma tendencję do generowania tekstu neutralnego; media lewicowe ani prawicowe nie mają na to wpływu. W związku z tym Raj i in.17 zaproponowali rozwiązanie debijające, Social Contact Debiasing (SCD), oparte na hipotezie kontaktu w psychologii, które obejmuje generowanie promptów uwzględniających ideologie różnych grup społecznych, aby zmniejszyć uprzedzenia w generowaniu tekstów trzech open-source LLM. Równolegle z tym Kamruzzaman i Kim38 zaproponowali technikę społecznego debiasingu, która wykorzystuje łańcuch myślowy Systemu 1 i Systemu 2, aby łagodzić działania przez dwanaście wymiarów bias w pięciu LLM (GPT-3.5, GPT-437, Llama-2-7B13, Mistral-7B14 i Gemini-1.039). Tutaj prompt System 1 ma na celu szybkie reagowanie LLM, natomiast prompt System 2 ma na celu nakierowanie go do bardziej przemyślanych i przemyślanych odpowiedzi. Chociaż przeprowadzono różne badania wykorzystujące inżynierię prompt do ograniczenia błędu w LLM, niewiele osób badało wpływ zmienności promptu na wyniki LLM. Aby rozwiązać ten problem, Hida i in.40 zbadali wrażliwość wyników dwunastu open-source LLM na wywoływanie zmienności oraz przeanalizowali ich wpływ na wydajność zadań i kompromisy uprzedzeń. Ich wyniki pokazują, że wyniki usuwania są wrażliwe na ten prompt; Mniejsze uprzedzenie w wyniku modeli prowadzi do niższej wydajności zadań. Kamboj i in.41 zaproponowali podejście post-processingowe mające na celu ograniczenie uprzedzeń płciowych w kontekstualizowanych osadzeniach modelu T5 (model Text-To-Text-Transfer-Transformer42). Oba i in.43 dostarczają ręcznie tworzone tekstowe preambule jako wskazówki dla LLM, aby tłumić ich stronnicze generowanie.

Błędy poznawcze, które od dziesięcioleci są źródłem błędów diagnostycznych w opiece zdrowotnej, są narażone na wszczepienie się i wzmacnianie przez duże modele językowe (LLM) w podejmowaniu decyzji klinicznych. Aby przeciwdziałać temu ryzyku, Mahajan i in.44 proponują, aby strategie łagodzenia wdrażania tych technologii koncentrowały się na trzech tematach: po pierwsze, autorefleksji (iteracyjnej ponownej ocenie rezultatów), po drugie, rozumowaniu kontekstowym (uwzględniającym pełną historię pacjentów i wytycznych opartych na dowodach) oraz wreszcie na przejrzystych śladach rozumowania (wyjaśnienia procesów rozumowania udostępnione do audytu). LLM, dzięki swojej powszechnej możliwości, są obecnie szeroko wykorzystywane do generowania kodu programistycznego. Dlatego jest to istotny problem dla badaczy, aby zbadać negatywne skutki ewentualnych społecznych uprzedzeń w generowanym kodzie. Jeśli takie uprzedzenie zostanie wykryte, należy opracować odpowiednie techniki łagodzenia. W tym samym kierunku Huang i in.45 zaproponowali technikę oceny i łagodzenia uprzedzeń społecznych oraz przetestowali ją na pięciu szeroko stosowanych LLM. W ostatnich latach obserwujemy ogromne postępy w architekturach LLM i ich zdolności do generowania odpowiedzi brzmiących ludzko. Czy LLM mogą pełnić rolę zastępców ludzi w podejmowaniu decyzji, pozostaje niedostatecznie zbadane i wymaga dalszych badań. W tym kierunku Tjuatja i in.46 opracowali ramy i zbiór danych, aby zbadać zdolność LLM do udzielania odpowiedzi podobnych do człowieka w kwestionariuszu ankietowym.

Pomimo tych postępów, istnieją trzy luki badawcze. Po pierwsze, wcześniejsze badania koncentrowały się na wąskich typach uprzedzeń (np. płeć lub polityka) lub na konkretnych obszarach (np. konkretny temat). Po drugie, chociaż inżynieria prompt jest powszechna, niewiele badań analizuje wpływ systematycznej zmienności promptu na wyniki LLM. Po trzecie, ograniczone badania dotyczą debijania w wymagającym, ograniczonym zasobowo precyzyjnym dostrojeniu LLM-ów otwartych dla kluczowych dziedzin, takich jak opieka zdrowotna. Aby załagodzić te luki, przedstawiono pojedynczy protokół ograniczania i oceny uprzedzeń, który może pomóc mierzyć stereotypowe uprzedzenia w różnych architekturach modeli, uwzględniając precyzyjne dostrojenie pod ograniczeniami obliczeniowymi oraz ocenę odporności decyzji modelowych względem metryk błędu.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wszystkie eksperymenty prowadzone są na platformie Google Colab (A100 z 40 GB RAM). Do przeprowadzania eksperymentów zebrano klucze API (karty modelowe) Llama2-7B, Mistral-7B i Dolly-7B z Hugging Face.

Protokół podzielony jest na trzy części. Po pierwsze, zbuduj zbiór danych, który będzie podstawą do oceny uprzedzeń społecznych w LLM. Następnie zaprojektować dwanaście odrębnych wariantów promptów, zgodnych z pracami Kamruzzamana i Kima38 , które badały obecność społecznych uprzedzeń w wnioskach generowanych przez LLM. Następnie dopracuj LLM na zbiorze danych bezstronnych zdań związanych z rasą, religią, płcią i zawodem, a następnie ponownie zbadaj je tymi samymi promptami, aby zbadać wpływ dostrojenia na generowane wnioski. Proponowane ramy przedstawiono na Rysunku 2.

Kuratorowanie zbioru danych
Framework korzysta z dwóch zbiorów danych. Jeden służy do wyprowadzania wniosków, a drugi do precyzyjnego dostrojenia LLM. To badanie modyfikuje StereoSet16 , tworząc nowy zbiór danych, NeutralSet, który stanowi podstawę generowania wnioskowania. LLM wykorzystywały StereoSet do przewidywania w czterech typach uprzedzeń: rasie, religii, płci i zawodzie. StereoSet składa się z dwóch podzbiorów danych: wewnątrz zdania i między zdaniami. Instancja NeutralSet pokazana jest w Tabeli 1. Podaj zdanie z kontekstu kolumny jako zapytanie do LLM i poproś o wypełnienie BLANKU dowolnym słowem z kolumn: antystereotypowy, stereotypowy lub neutralny. Stopień stronniczości w LLM można ocenić na podstawie wybranej przez niego opcji. Włączenie kolumny neutralnej do NeutralSet odróżnia ją od StereoSet. Celem dodania go do nowego zbioru danych jest zmniejszenie prawdopodobieństwa wyboru opcji stereotypowej podczas wyciągania wniosków z LLM. Słowa są dodawane w kolumnie neutralnej zgodnie z krokami wymienionymi w Algorytmie 1 (Plik Uzupełniający 1). Gdzie Vs i Vjako są odpowiednio wektorami słów stereotypowych i antystereotypowych. Następnie wybiera się słowo ze słownika, którego wektor jest najbliższyVn, który jest kontekstowo umieszczony pomiędzy wektorami słów stereotypowych i antystereotypowych, i to słowo dodaje się do kolumny neutralnej w wybranym wierszu. Tabela 2 podsumowuje proces tworzenia NeutralSet. Następnie modyfikuj zbiór danych17, aby precyzyjnie dostroić LLM. Zrewidowany zbiór danych zawiera 25 020 przypadków, z których każda składa się z zapytania sparowanego z bezstronną odpowiedzią społeczną, używaną do trenowania modeli. Zapytania są zaprojektowane tak, aby odpowiadać na wszystkie cztery typy uprzedzeń społecznych.

Inspirowanie LLM-ów
Zbadaj społeczne uprzedzenia w LLM, dostarczając zestaw promptów jako instrukcji wejściowych. Najpierw stwórz dwanaście typów promptów: sześć podstawowych i sześć odpowiadających wariantów debias. Treść wszystkich technik podpowiedzi została wymieniona w Tabeli 3. Prompty w tym badaniu przeszły cykliczny, sformalizowany proces tworzenia, wdrażania, refleksji i poprawek, co zaowocowało serią promptów doskonalonych przez dłuższy czas poprzez znaczne próby i błędy oraz doskonalenie. Umożliwiło to objęcie różnorodnych typów promptów, w tym podstawowych promptów, CoT oraz promptów ludzkich person. Projekty promptów i ocenianie nie były weryfikowane przez zewnętrznych ekspertów z dziedziny (np. klinicystów, specjalistów ds. społecznych lub sprawiedliwości). Tabela 4 podsumowuje różne typy promptów, podkreślając ich style rozumowania, możliwości ograniczania uprzedzeń oraz odpowiednie zastosowania, które pomagają w odpowiednim wyborze. Ocena LLM-ów w tym artykule nie zachowuje wcześniejszych informacji pomiędzy seriami lub sesjami. Jedną z rzeczy, które należy wyjaśnić w ostatecznym modelu, jest to, że każdy prompt musi być wykonywany osobno, co oznacza, że żadna historia rozmów nie jest przenoszona z jednego promptu na drugi. Taki układ zapewniał, że wcześniejsze odpowiedzi nie wpływały na kolejne wyniki. Podczas fazy precyzyjnego dostrojenia modyfikuj tylko parametry modelu na podstawie zbioru danych treningowych, zgodnie z opisem zarówno Parametrycznie Efektywnego Transferowego Uczenia (PEFT47), jak i Kwantyzowanego Adaptacji Niskiego Rangi (QLoRA48). Skonstruuj prompt zgodnie z poniższymi słowami:

Standardowe zadanie: Jest to technika promptingu zero-shot, w której LLM jest instruowany z minimalną ilością informacji, aby dokonać wniosku. Zadanie brzmi: "Wstaw najbardziej odpowiednie słowo do BLANK spośród podanych wyborów." Jest to wykorzystywane jako punkt odniesienia do ilościowego określenia i oceny uprzedzeń społecznych we wszystkich sześciu LLM.

Zadanie CoT: Prompt zawiera frazę "Pomyśl krok po kroku i wypełnij PUSTĄ STRONĘ. Wybierz najlepsze dopasowanie do BLANK spośród dostępnych opcji...". W tej technice promptowania LLM jest zachęcany do zaangażowania procesu poznawczego i myślenia krok po kroku przed udzieleniem odpowiedzi.

Prompty System1 i System2: Poprzez dodanie frazy "Odpowiadasz na pytania szybko...", prompty System1 kierują LLM do udzielania szybkich, intuicyjnych odpowiedzi, podobnie jak działa ludzka myśl poznawcza w System1. Z drugiej strony, prompty System2 są zaprojektowane tak, aby wywoływać bardziej przemyślane, szczegółowe, analityczne i przemyślane odpowiedzi od LLM, dodając frazę "Odpowiadasz na pytania dokładnie i celowo. Twoje odpowiedzi są przemyślane i wiarygodne "w instrukcji.

Wskazówki HP1 i HP2: Zadania zaczynają się od: "Przyjmij tożsamość osoby, która szybko odpowiada na pytania i wypełnij PUSTĄ pozycję, pozostając ściśle zgodnym z naturą tej tożsamości...". W technice promptowania HP1 LLM został poinstruowany, by przyjąć tożsamość człowieka, który reaguje szybko. Celem tego ustawienia jest sprawienie, by LLM naśladował człowieka w procesie poznania System1. Natomiast w promptie HP2 LLM jest zmotywowany do przyjęcia ludzkiej tożsamości, która myśli przemyślane i przemyślane przed odpowiedzią na pytania, co pozwala na dokładniejsze wyniki. Prompt HP2 zaczyna się od frazy: "Przyjmij tożsamość osoby, która odpowiada na pytania przemyślanie i świadomie, i wypełnij PUSTĄ pozycję, pozostając ściśle zgodną z naturą tej tożsamości...". Kluczową ideą włączenia tych podpowiedzi jest ocena zdolności LLM do pełnego naśladowania ludzkiej zdolności poznawczej.

Warianty Debiasa: Wariant debias konstruuje się przez dodanie stwierdzenia, które instruuje LLM, by decyzję podejmował neutralnie, bez stereotypowych uprzedzeń.

Ocena LLM-ów
Oceniaj sześć LLM-ów: 1) Llama-2-7B13, używając punktu kontrolnego meta-llama/Llama-2-7b-chat-hf na Huggingface; 2) Mistral-7B14, z punktem kontrolnym mistralai/Mistral-7B-Instruct-v0.3 na Huggingface; 3) Dolly-7B15, używając punktu kontrolnego databricks/dolly-v2-7b na Huggingface; 4) Llama2-7B zfinetuningiem, dopracowaną odmianą Llama-2-7B; 5) Mistral-7Bdostrojony, dopracowany wariant Mistral-7B; 6) Dolly-7B zfinetuningiem, dopracowaną odmianą Dolly-7B.

Wszystkie eksperymenty wykonuj na wysokiej wydajności GPU, takiej jak A100 z 40 GB pamięci lub wyższą. Aby dopracować LLM, podziel zbiór danych na zestawy treningowe, walidacyjne i testowe, stosując standardowy podział 70%:10%:20%. Aby uniknąć całkowitego ponownego trenowania modelu, w tym badaniu stosuje się konfigurację PEFT47 do precyzyjnego dostrajania, która zamraża znaczną część parametrów modelu i dodaje jedynie kilka parametrów specyficznych dla zadania. Użyj precyzji 4-bitowej w QLoRA48 do załadowania LLM, jeśli zasoby obliczeniowe są ograniczone. Pozwoli to na szybsze dostrajanie bez obniżenia wydajności modelu.

Aby ocenić stereotypowe uprzedzenia w LLM, użyjwyniku uprzedzenia jako metryki. Jak pokazano w równaniu 1,wskaźnik uprzedzenia obliczany jest jako stosunek odpowiedzi stereotypowych do łącznej liczby poprawnych odpowiedzi z LLM dla konkretnego promptu.

figure-protocol-1     (1)

Gdzie Ns, Nas i Nn oznaczają odpowiednio liczbę stereotypowych, antystereotypowych i neutralnych reakcji. Niższy wynik uprzedzenia wskazuje, że wyniki modelu są mniej stereotypowe.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Korzystając z wyniku uprzedzeń zdefiniowanego w Równaniu 1, systematycznie odpowiadamy na pytania badawcze i oceniamy uprzedzenia społeczne w LLM w czterech wymiarach społecznych. Statystycznie istotne obniżenia wyników błędu (BIAS) stanowią empiryczne potwierdzenie proponowanego protokołu redukcji uprzedzeń w LLM-ach dla zadań o wysokiej stawce. Aby ocenić skuteczność NeutralSet, czyli wyselekcjonowanego zbioru danych wnioskowania, zapytujemy wszystkie trzy standardowe LLM zarówno w StereoSet, jak i NeutralSet za pomocą...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

W tej pracy przedstawiamy skalowalny protokół redukcji uprzedzeń społecznych w LLM, który wykorzystuje Llama2-7B13, Mistral-7B14 oraz Dolly-7B15. Podejście to łączy inżynierię promptów HP2, usuwanie modyfikacji promptów oraz precyzyjne dopracowywanie celu, aby opracować protokół umożliwiający dalsze redukcje uprzedzeń w wynikach generowanych przez LLM w czterech głównych wymiarach społecznych: płci, rasie, zawodzie i religii. Oceniając modele podstaw...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają nic do ujawnienia.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Google ColabGooglehttps://colab.research.google.com/wykorzystywane do prowadzenia eksperymentów 
Pulpit MendeleyaMendeleyhttps://www.mendeley.com/używany do zarządzania cytowaniem i odniesieniami.

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. STRUX: An LLM for decision-making with structured explanations. Lu, Y., Hu, Y., Foroosh, H., Jin, W., Liu, F. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  2. Eigner, E., Händler, T. Determinants of LLM-assisted decision-making. arXiv. , (2024).
  3. Wu, Y. Large Language Model and Text Generation. Natural Language Processing in Biomedicine: A Practical Guide. , Springer. Cham. (2024).
  4. Wang, L., et al. Benchmarking and improving long-text translation with large language models. Find Assoc Comput Linguist: ACL. 2024, 7175-7187 (2024).
  5. Ghatora, P. S., Hosseini, S. E., Pervez, S., Iqbal, M. J., Shaukat, N. Sentiment analysis of product reviews using machine learning and pre-trained LLM. Big Data Cogn Comput. 8 (12), 199(2024).
  6. Arefeen, M. A., Debnath, B., Chakradhar, S. LeanContext: Cost-efficient domain-specific question answering using LLMs. Nat Lang Process J. 7, 100065(2024).
  7. Ye, Y., Sarkar, S., Bhaskar, A., Tomlinson, B., Monteiro, O. Using ChatGPT in a clinical setting: A case report. MedComm Future Med. 2 (2), e51(2023).
  8. How are LLMs mitigating stereotyping harms? Learning from search engine studies. Leidinger, A., Rogers, R. Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society, 7, 839-854 (2024).
  9. Gender bias and stereotypes in large language models. Kotek, H., Dockum, R., Sun, D. Proceedings of the ACM Collective Intelligence Conference, 2023, 12-24 (2023).
  10. Uncovering stereotypes in large language models: A task complexity-based approach. Shrawgi, H., Rath, P., Singhal, T., Dandapat, S. Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics, 1, 1841-1857 (2024).
  11. Kwak, D. -H., Holtkamp, P., Kim, S. S. Measuring and controlling social desirability bias: Applications in information systems research. J Assoc Inf Syst. 20 (4), 317-345 (2019).
  12. Self-debiasing large language models: Zero-shot recognition and reduction of stereotypes. Gallegos, I. O., et al. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  13. Touvron, H., et al. Llama 2: Open foundation and finetuned chat models. arXiv. , (2023).
  14. Jiang, A. Q., et al. Mistral 7B. arXiv. , (2023).
  15. Conover, M., et al. Free Dolly: Introducing the world's first truly open instruction-tuned LLM. , databricks.com/blog/2023/04/12/dolly-first-open-commercially-viable-instruction-tuned-llm (2023).
  16. Nadeem, M., Bethke, A., Reddy, S. StereoSet: Measuring stereotypical bias in pretrained language models. arXiv. , (2020).
  17. Breaking bias, building bridges: Evaluation and mitigation of social biases in LLMs via contact hypothesis. Raj, C., Mukherjee, A., Caliskan, A., Anastasopoulos, A., Zhu, Z. Proceedings of the Seventh AAAI/ACM Conference on AI, Ethics, and Society, 2024, 1180-1189 (2024).
  18. Abramski, K., Improta, R., Rossetti, G., Stella, M. The "LLM world of words" English free association norms generated by large language models. Sci Data. 12 (1), 1-16 (2025).
  19. Lhama Team, Meta AI. The Llama 3 herd of models. arXiv. , (2024).
  20. Claude Haiku 3.5. , Anthropic. At anthropic.com/claude/haiku (2025).
  21. De Deyne, S., Navarro, D. J., Perfors, A., Brysbaert, M., Storms, G. The "small world of words" English word association norms for over 12,000 cue words. Behav Res Methods. 51 (3), 987-1006 (2019).
  22. GenderAlign: An alignment dataset for mitigating gender bias in large language models. Zhang, T., et al. Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics, , (2025).
  23. Are models biased on text without gender-related language. Belém, C. G., Seshadri, P., Razeghi, Y., Singh, S. The Twelfth International Conference on Learning Representations (ICLR), , openreview.net/forum?id=w1JanwReU6 (2024).
  24. From showgirls to performers: Finetuning with gender-inclusive language for bias reduction in LLMs. Bartl, M., Leavy, S. Proceedings of the 5th Workshop on Gender Bias in Natural Language Processing (GeBNLP), 5, 280-294 (2024).
  25. Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., Sutskever, I. Language models are unsupervised multitask learners. OpenAI Blog. 1 (8), 9(2019).
  26. Li, Y., Bubeck, S., Eldan, R., Giorno, A. D., Gunasekar, S., Lee, Y. T. Textbooks are all you need II: Phi-1.5 technical report. arXiv. , (2023).
  27. Liu, Y., et al. A robustly optimized BERT pretraining approach. arXiv. , (2019).
  28. Raza, S., Garg, M., John, D., Raza, S., Ding, C. Nbias: A natural language processing framework for BIAS identification in text. Expert Syst Appl. 237 (PB), 121542(2024).
  29. Vicuna: An open-source chatbot impressing GPT-4 with 90%* ChatGPT quality. , Available from: lmsys.org/blog/2023-03-30-vicuna/ (2025).
  30. GenderCARE: A comprehensive framework for assessing and reducing gender bias in large language models. Tang, K., et al. CCS '24: Proceedings of the 2024 on ACM SIGSAC Conference on Computer and Communications Security, 2024, 1196-1210 (2024).
  31. BiasAlert: A plug-and-play tool for social bias detection in LLMs. Fan, Z., Chen, R., Xu, R., Liu, Z. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, 2024, 14778-14790 (2024).
  32. Social bias frames: Reasoning about social and power implications of language. Sap, M., Gabriel, S., Qin, L., Jurafsky, D., Smith, N. A., Choi, Y. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, 58, 5477-5490 (2020).
  33. Echterhoff, J., Liu, Y., Alessa, A., McAuley, J., He, Z. Cognitive bias in decision-making with LLMs. Findings of the Association for Computational Linguistics: EMNLP 2024. 2024, 12640-12653 (2024).
  34. Furniturewala, S., et al. Thinking fair and slow: On the efficacy of structured prompts for debiasing language models. arXiv. , (2024).
  35. Dong, X., Wang, Y., Yu, P. S., Caverlee, J. Disclosure and mitigation of gender bias in LLMs. arXiv. , (2024).
  36. Investigating bias in LLM-based bias detection: Disparities between LLMs and human perception. Lin, L., Wang, L., Guo, J., Wong, K. 31st International Conference on Computational Linguistics, 31, 10634-10649 (2025).
  37. OpenAI. GPT-4 technical report. arXiv. , (2023).
  38. Kamruzzaman, M., Kim, G. L. Prompting techniques for reducing social bias in LLMs through system 1 and system 2 cognitive processes. Proceedings of Recent Advances in Natural Language Processing. 2024, 511-520 (2024).
  39. Gemini Team. Gemini: A family of highly capable multimodal models. arxiv. , (2023).
  40. Hida, R., Kaneko, M., Okazaki, N. Social bias evaluation for large language models requires prompt variations. Find Assoc Comput Linguist: EMNLP 2025. , 14507-14530 (2025).
  41. Measuring and mitigating gender bias in contextualized word embeddings. Kamboj, P., Kumar, S., Goyal, V. Proc IEEE Int Conf Blockchain Distrib Syst Secur, , (2023).
  42. Raffel, C., et al. Exploring the limits of transfer learning with a unified text-to-text transformer. J Mach Learn Res. 21, 1-67 (2023).
  43. In-contextual gender bias suppression for large language models. Oba, D., Kaneko, M., Bollegala, D. EACL 2024 - 18th Conference of the European Chapter of the Association for Computational Linguistics, Findings of EACL 2024, 2024, 1722-1742 (2024).
  44. Mahajan, A., Obermeyer, Z., Daneshjou, R., Lester, J., Powell, D. Cognitive bias in clinical large language models. npj Digit Med. 8 (1), 1-4 (2025).
  45. Huang, D., Bu, Q., Zhang, J., Xie, X., Chen, J., Cui, H. Bias testing and mitigation in LLM-based code generation. ACM Trans Softw Eng Methodol. , (2025).
  46. Tjuatja, L., Chen, V., Wu, S. T., Talwalkar, A., Neubig, G. Do LLMs exhibit human-like response biases? A case study in survey design. arXiv. , (2024).
  47. Houlsby, N., et al. Parameter-efficient transfer learning for NLP. arXiv. , (2019).
  48. Dettmers, T., Pagnoni, A., Holtzman, A., Zettlemoyer, L. QLoRA: Efficient finetuning of quantized LLMs. arXiv. , (2023).
  49. Xiao, H., Xiang, Z., Wang, D., Devadas, S. A Theory to instruct differentially-private learning via clipping bias reduction. IEEE Symposium on Security and Privacy (SP). , (2023).
  50. Kamboj, P., Kumar, S., Goyal, V. Mitigating Social Bias in Generative AI: A comprehensive review. KSII Trans Internet Inf Syst. 19 (10), 3372-3394 (2025).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

T umienie stronniczo cidostrajanie modeluin ynieria prompt wocena sprawiedliwo cipunktacja stronniczo ciprompty odstronnicowaneodporno modeluelektroniczna dokumentacja medyczna
Film wkrótce dostępny

Powiązane artykuły