Forschungsartikel

Verbesserung der Fairness in großen Sprachmodellen für klinische KI-Anwendungen durch Feinabstimmung und Prompting

DOI:

10.3791/69132

2. Januar 2026

In diesem Artikel

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gesundheitsspezifische große Sprachmodelle stehen vor ethischen und technischen Herausforderungen, da sie – wie andere große Sprachmodelle – die in ihren Trainingsdaten enthaltenen Verzerrungen widerspiegeln. Das hier vorgestellte Protokoll überprüft die Unterdrückung von vier Arten von Vorurteilen (Geschlecht, Rasse, Beruf, Religion) mittels prompter Varianten über drei Open-Source-Modelle hinweg.

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Large Language Models (LLMs) werden zunehmend auf sensible Bereiche wie die medizinische Versorgung angewandt, die mehrere technische und ethische Herausforderungen mit sich bringen. Die unmittelbarsten Probleme sind in diese Modelle eingebaute Verzerrungen, die auf großen Datensätzen trainiert sind, die gesellschaftliche Vorurteile widerspiegeln könnten. Solche Vorurteile können zu unfairen, nicht verallgemeinerbaren oder sogar schädlichen Ergebnissen führen, wodurch sie in der realen Welt klinisch unanwendbar und nicht ethischen und regulatorischen Einschränkungen entsprechen. Wir untersuchen, wie gut die Unterdrückung von Vorurteilen funktioniert, wenn fein abgestimmte Modelle in vier entscheidenden Kategorien (Geschlecht, Rasse, Beruf und Religion) angeregt werden. Wir kuratieren manuell einen vielfältigen Inferenzdatensatz und erstellen zwölf Prompt-Varianten – von denen sechs debiased sind –, um die Ergebnisse von drei Open-Source-LLMs zu testen: Llama2-7B, Mistral-7B und Dolly-7B. Die Fairness und Interpretierbarkeit der Ergebnisse werden mit einer Bias-Scoring-Metrik bewertet, wobei niedrigere Werte auf bessere Fairness und Interpretierbarkeit hinweisen. Wir stellen außerdem fest, dass debiased Prompts die Verzerrung verringern und das Feinjustieren des Modells sogar noch besser funktioniert. Die Ergebnisse unterstreichen die entscheidende Bedeutung zeitnahes Handelns, Modellrobustheit und fortlaufender ethischer Prüfung für eine vertrauenswürdige und faire Einführung von LLMs in realen Umgebungen, wie der medizinischen Bildgebung und der Pflege elektronischer Gesundheitsakten (EHR).

Einleitung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Große Sprachmodelle verfügen über eine enorme Nachhallwirkung als Werkzeuge zur Unterstützung vielfältiger Aufgaben, darunter Entscheidungsfindung 1,2, Textgenerierung3, Textübersetzung4, Kundenstimmungsanalyse5, Fragestellung6 und Erstellung klinischer Berichte7. In jüngerer Zeit gab es mehrere Fälle, in denen Anwendungen LLMs nutzten, um Inhalte zu erzeugen, die sozial benachteiligten Personen oder Gruppen schaden 8,9,10. Der Hauptgrund für solche plattitüden Antworten ist, dass diese Modelle auf Datensätzen trainiert sind, die gesellschaftliche Verzerrungen enthalten, die mit Rasse, Geschlecht, sozioökonomischer Klasse und ähnlichen Faktoren verbunden sind. Aber was du mit "Verzerrung" und "Fairness" in einem KI-System im Gesundheitswesen meinst, kann subjektiv und kontextabhängig sein. Forscher haben erhebliche Anstrengungen unternommen, um soziale Vorurteile in den LLMs11,12 zu mindern; weitere Verbesserungen sind jedoch weiterhin notwendig. Die Forscher haben mehrere Strategien zur Verzerrung vorgeschlagen, die in Vorverarbeitung, In-Bearbeitung, Nachbearbeitung oder Kombinationen davon in einer heterogenen Anwendungsspanne klassifiziert werden können. Diese Kategorisierung basiert auf dem Stadium, in dem die Minderungsmaßnahme ergriffen wird. Dieses Protokoll vereint alle drei Strategien, um soziale Vorurteile in sechs Varianten von LLMs zu bekämpfen und zu verringern, und untersucht die Verzerrung der Verzerrung in vier sozialen Bias-Dimensionen: Geschlecht, Beruf, Rasse und Religion. Zunächst wird ein Inferenzdatensatz mit einer Datenerweiterungstechnik entwickelt, um LLMs die Erzeugung von Schlussfolgerungen zu ermöglichen. Zweitens sind zwölf Arten von Prompts darauf ausgelegt, stereotype Antworten von LLMs hervorzurufen. Drittens sind Llama-2-7B13, Mistral-7B14 und Dolly-7B15 auf einem Datensatz mit unvoreingenommenen Sätzen über die vier sozialen Kategorien – Geschlecht, Rasse, Beruf und Religion – fein abgestimmt, um Llama-2-7BFinetuned, Mistral-7BFinetuned und Dolly-7BFinetuned zu erhalten, jeweils. Schließlich werden Schlussfolgerungen gezogen, indem die fein abgestimmten LLMs dazu aufgefordert werden, ihre Wirksamkeit bei fairen Antworten zu untersuchen.

Wir formulierten die folgenden Forschungsfragen und behandelten sie in diesem Artikel. Für jede formulierte Forschungsfrage (RQ) wurden eine Nullhypothese (H0) und eine alternative Hypothese (H1) formuliert.

RQ1: Sind der Inferenzdatensatz und grundlegende Prompting-Techniken wirksam, um die gesellschaftlichen Verzerrungen in LLMs zu bewerten? Nullhypothese (H01): Die aus einem Inferenzdatensatz abgeleiteten Verzerrungswerte sind in Kombination mit einfachen Prompts statistisch nicht von den Baseline-Bias-Scores der LLMs zu unterscheiden. Alternative Hypothese (H11): Bias-Scores aus dem Inferenzdatensatz mit einfachen Prompts unterscheiden sich statistisch signifikant von den Baseline-Bias-Scores der LLMs. Um die Hypothese zu testen, wurde ein Datensatz namens NeutralSet kuratiert, indem StereoSet16 modifiziert und jedes LLM mit grundlegenden Prompting-Techniken bewertet wurde, um seine Fähigkeit zu bewerten, nicht-stereotype Antworten zu erzeugen. In unseren Einstellungen enthalten wir sechs grundlegende Prompts – Standard (Ein Zero-Shot-Prompt, um den LLM anweist, Schlussfolgerungen zu ziehen), Chain-of-Thoughts (CoT soll den LLM dazu bringen, Schritt für Schritt zu denken, um Schlussfolgerungen zu ziehen), System1 (Ein Prompt, damit der LLM beim Antworten schnell denken kann), System2 (Ein Prompt, der den LLM langsam und nachdenklich denken lässt), Human Persona 1 (HP1 ist darauf ausgelegt, dass der LLM die Identität eines Menschen annimmt, der beim Treffen von Entscheidungen schnell denkt), und Human Persona 2 (HP2 ist darauf ausgelegt, den LLM dazu zu bringen, die menschliche Identität anzunehmen, indem er langsam und nachdenklich beim Antworten denkt).

RQ2: Sind die Debiasing Prompting-Techniken wirksam, um gesellschaftliche Vorurteile in LLMs aufzudecken und abzumildern? Nullhypothese (H0₂): Debiasing Prompting-Techniken sind nicht wirksam, um gesellschaftliche Verzerrungen in LLMs aufzudecken und abzumildern. Alternative Hypothese (H12): Gemessene Bias-Scores sinken signifikant, wenn Debiasing Prompting-Techniken in LLMs verwendet werden. Wir untersuchen die Auswirkungen voreingenommener Varianten der grundlegenden Prompts auf drei Open-Source-LLMs, um eine faire Textgenerierung ohne jegliche soziale Diskriminierung zu erreichen.

RQ3: Können gesellschaftliche Vorurteile weiter reduziert werden, indem die LLMs feinjustiert werden? Nullhypothese (H03): Die Feinabstimmung der LLMs reduziert gesellschaftliche Verzerrungen nicht weiter als die allein durch Prompting-Techniken erzielten Reduktionen. Alternative Hypothese (H13): Das Feinabstimmen von LLMs reduziert gesellschaftliche Verzerrungen weiter über die Reduktionen hinaus, die allein durch Prompting-Techniken erreicht werden. Um diese Frage zu beantworten, passen wir den Datensatz17 an und feinjustieren die darauf enthaltenen LLMs, um die Auswirkungen von Fine-Tuning bei der Reduzierung von Stereotypreaktionen weiter zu bewerten.

Abbildung 1 veranschaulicht den Effekt von Prompt-Variation und Feinabstimmung von LLM auf das geschlechtsneutrale vorhergesagte Ergebnis. Die Neuheit unserer Arbeit beruht auf der Integration manueller Datensatzkuratierung, mehrerer Debiasing-Promptstrategien und Feinabstimmung unter einem einzigen Protokoll, um ein LLM zur Identifizierung und Linderung gesellschaftlicher Verzerrungen zu analysieren, was für sensible, reale Anwendungen wie medizinische Bildverarbeitung und EHR-Wartung relevant ist. Wir gruppierten die Literatur zu Bias in LLMs in vier Perspektiven: Datensätze für Bias und kognitive Assoziationen; Konzepte zur Erkennung und Bewertung von Verzerrungen; Ansätze zur Verzerrung von Vorurteilen; und Voreingenommenheit in spezialisierten Bereichen.

Forscher generieren kontinuierlich Datensätze, um eine Verzerrungsbewertung und semantische Assoziationsanalyse in LLMs zu ermöglichen. Zum Beispiel sind in der Kognitionspsychologie und Linguistik freie Assoziationen stets entscheidend für die Organisation des konzeptuellen Wissens. Indem sie dieselbe Assoziation in der latenten Verteilung von LLMs simulieren, haben Abramski et al.18 einen Datensatz konstruiert, LLM World of Words (LWOW). Der LWOW English Free Association Norms Dataset, der Millionen von Antworten von drei LLMs umfasst: Mistral-7B14, Llama-3.1-8B19 und Claude-3-5-haiku-latest20. Es ist inspiriert von Small World of Words (SWOW)21, dem größten Datensatz menschlicher englischer freier Assoziationsnormen, der in verschiedenen psychologischen und sprachlichen Untersuchungen vielfach eingesetzt wurde. Darüber hinaus hilft LWOW, ein kognitives Netzwerk aufzubauen, das aus Knoten besteht, die jeweils ein Wort repräsentieren, wobei Knoten semantisch ähnlichen Wörtern entsprechen, die im Netzwerk näher beieinander liegen. Dies hilft, Verzerrungen in den Ausgaben von LLMs zu bewerten, indem der Abstand zwischen den Wörtern im künstlichen kognitiven Netzwerk als Schlüsselkennzahl geschätzt wird. Ein großes Problem bei der Verwendung proprietärer LLMs ist, dass deren Interna nicht zugänglich ist. Obwohl in diesen Modellen erhebliche Anstrengungen unternommen wurden, um Verzerrungen zu beheben, sind Ausrichtungsdatensätze weiterhin knapp. Um dieses Problem anzugehen, wird in Zhang et al.22 ein Datensatz namens GenderAlign vorgeschlagen, um Geschlechterbias in den LLMs zu mindern. UnStereoEval23, ein Benchmark-Datensatz, soll stereotype Geschlechterverzerrungen in Berufen und Emotionen untersuchen. Ihre Ergebnisse zeigen ein geringes Maß an Fairness in 28 verschiedenen LLMs. Bartl und Leavy24 entwickelten einen Datensatz, Tiny Heap, in dem Sätze mit stereotypen Erwähnungen durch neutrale Äquivalente ersetzt und drei Sprachmodelle (GPT-225, PHI-1.526 und RoBERTa27) fein abgestimmt werden. In ihren Ergebnissen beobachten sie eine signifikante Reduktion der geschlechtsstereotypen Tendenzen der Modelle.

Mehrere mehrschichtige Frameworks wurden vorgeschlagen, um Verzerrungen in LLMs zu identifizieren und zu verringern. In Raza et al.28 wird ein Rahmenwerk, NBIAS, vorgeschlagen, das vier Schichten umfasst: Datensatzerstellung, Modellentwicklung, Verzerrungsminderung und Bewertung. Der Datensatz innerhalb des Rahmens basiert auf verschiedenen Bereichen, darunter Gesundheitswesen, soziale Medien und Beschäftigungsportale. Sie zeigen die Wirksamkeit ihres Modells, indem sie die Ausgangslinie (BERT29) um 1 % bis 8 % in Fairness übertreffen. In einem weiteren solchen Rahmen, GenderCARE30, wird eine Strategie zur Minderung von Geschlechtervorurteilen in LLMS vorgeschlagen. In ihrem umfangreichen experimentellen Aufbau reduzierten sie den Geschlechterbias effektiv um durchschnittlich 35 % über zwölf verschiedene LLMs hinweg. Ein Framework, BiasAlet31, erkennt automatisch soziale Voreingenommenheit im offenen Text, der von den LLMs generiert wird. Sie bringt einige Einschränkungen mit sich: Erstens wird die Studie auf einem synthetisierten Datensatz durchgeführt, da kein Benchmark zur Bewertung von Verzerrungen bei der Open-Text-Generierung des LLM verfügbar ist, und zweitens basiert sie auf dem veralteten Datensatz SBIC32, was es erschwert, zwischen der Relevanz impliziter Verzerrung und der Verzerrung im Datensatz selbst zu unterscheiden. Verzerrungen in menschengenerierten Daten können in darauf trainierte Modelle eingeführt werden. Der Einsatz solcher Modelle ist in hochrisikoreichen Berufen umstritten, da ihre Ergebnisse benachteiligten Gruppen nachteilig beeinflussen können. Um dem entgegenzuwirken, wurde ein Rahmenwerk, BiasBuster33, entwickelt, um kognitive Verzerrungen in den LLMs zu erkennen, zu bewerten und zu mindern. In Anlehnung daran schlagen Forscher in einem weiteren Werk34 einen interaktiven Rahmen vor, um fairen, logischen und kritischen Text durch System-2-Prompts zu erzeugen (die dazu dienen, dass das LLM nachdenklich und langsam denken kann), die selbstverfeinerte und implikative Prompts ergänzen. Das Framework ist jedoch auf die Aufgaben innerhalb des latenten Raums der LLMs beschränkt. Dong et al.35 entwickeln einen Rahmenwerk, der indirektes Probing nutzt, um Geschlechterbias in zehn Open-Source-LLMs zu mindern und zu bewerten. In ihrer Untersuchungsmethode offenbaren sie, ohne direkte stereotype Erwähnungen zu nutzen, eine indirekte Geschlechtervoreingenommenheit.

Lin et al.36 untersuchen die politische Verzerrung bei der Textgenerierung durch LLMs sowohl für geschlossene (GPT-3.5-turbo und GPT-437) als auch für offene Modelle (Llama-2-7B13, Mistral-7B14, Vicuna29). Sie stellten fest, ob der modellgenerierte Text eine links- oder rechtsgerichtete Medienverzerrung induzierte. Darüber hinaus entwickelten sie eine Minderungsstrategie, indem sie das Modell feinjustierten und während der Textgenerierung zusätzliche unvoreingenommene Hinweise bereitstellten. Nach Anwendung der Verzerrungstechnik neigt das Modell dazu, neutralen Text zu erzeugen; Links- oder rechtsgerichtete Medien beeinflussen das nicht. In diesem Zusammenhang haben Raj et al.17 eine Debiasing-Lösung vorgeschlagen, Social Contact Debiasing (SCD), die auf der Kontakthypothese in der Psychologie basiert und eine Promptgenerierung umfasst, die die Ideologien verschiedener sozialer Gruppen versteht, um Vorurteile bei der Texterstellung von drei Open-Source-LLMs zu verringern. Parallel dazu haben Kamruzzaman und Kim38 eine Methode zur sozialen Debiasing vorgeschlagen, die System-1- und System-2-Denkketten-Prompting nutzt, um über zwölf Verzerrungsdimensionen in fünf LLMs (GPT-3.5, GPT-437, Llama-2-7B13, Mistral-7B14 und Gemini-1.039) zu mindern. Hier soll der System-1-Prompt das LLM dazu bringen, schnell zu reagieren, während der System-2-Prompt dazu dient, es zu durchdachteren und durchdachteren Antworten zu führen. Obwohl verschiedene Studien durchgeführt wurden, die Prompt Engineering zur Abschwächung des Bias in LLMs nutzen, hat kaum jemand die Auswirkungen von prompt variation auf die Ausgabe von LLMs untersucht. Um dieses Problem anzugehen, haben Hida et al.40 die Empfindlichkeit der Ausgaben der zwölf Open-Source-LLMs untersucht, um Variationen anzustoßen, und deren Auswirkungen auf die Aufgabenleistung und Verzerrungen analysiert. Ihre Ergebnisse zeigen, dass die Debiasing von Ergebnissen sensibel auf die Eingabeaufforderung reagiert; Weniger Verzerrung in der Modellausgabe führt zu einer geringeren Aufgabenleistung. Kamboj et al.41 haben einen Nachbearbeitungsansatz vorgeschlagen, um Geschlechterverzerrung bei kontextualisierten Einbettungen eines T5-Modells zu mindern (Text-To-Text-Transfer-Transformer Modell42). Oba et al.43 stellen manuell erstellte Textpräamblen als Hinweise an LLMs zur Verfügung, um deren verzerrte Generierung zu unterdrücken.

Kognitive Verzerrungen, die seit Jahrzehnten eine Quelle diagnostischer Fehler im Gesundheitswesen sind, laufen Gefahr, in große Sprachmodelle (LLMs) in klinische Entscheidungsprozesse eingeprägt und verstärkt zu werden. Um diesem Risiko entgegenzuwirken, schlagen Mahajan et al.44 vor, dass sich die Minderungsstrategien zur Umsetzung dieser Technologien auf drei Themen konzentrieren sollten: Erstens Selbstreflexion (iterative Neubewertung der Ergebnisse), zweitens kontextuelles Schließen (einschließlich vollständiger Patientenanamnese und evidenzbasierter Leitlinien) und schließlich transparente Schlussfolgerspuren (Erklärungen der Schlussfolgerungsprozesse, die zur Prüfung bereitgestellt werden). LLMs werden mit ihrer allgegenwärtigen Fähigkeit heute auch weit verbreitet zur Erzeugung von Programmiercode verwendet. Daher ist dies ein zentrales Anliegen für Forscher, die negativen Auswirkungen jeglicher sozialer Voreingenommenheit im generierten Code zu untersuchen. Wenn eine solche Verzerrung erkannt wird, müssen entsprechende Minderungstechniken entwickelt werden. In dieselbe Richtung schlugen Huang et al.45 eine Methode zur Bewertung und Minderung sozialer Voreingenommenheit vor und testeten sie an fünf weit verbreiteten LLMs. In jüngerer Zeit haben wir enorme Fortschritte bei LLM-Architekturen und deren Fähigkeit gesehen, menschliche Reaktionen zu erzeugen. Ob LLMs als Stellvertreter für Menschen bei Entscheidungsfindung dienen können, ist noch wenig erforscht und erfordert weitere Forschung. In diese Richtung werden von Tjuatja et al.46 ein Rahmen und ein Datensatz kuratiert, um die Fähigkeit von LLMs zu untersuchen, menschenähnliche Antworten in einem Umfragefragebog zu liefern.

Trotz dieser Fortschritte bestehen drei Forschungslücken. Erstens konzentrieren sich frühere Forschungen tendenziell auf enge Arten von Vorurteilen (z. B. Geschlecht oder Politik) oder spezifische Bereiche (z. B. ein bestimmtes Thema). Zweitens, obwohl Prompt Engineering weit verbreitet ist, untersuchen nur wenige Studien die Auswirkungen systematischer Prompt-Variation auf LLM-Ausgaben. Drittens behandelt begrenzte Forschung Debiasing im anspruchsvollen, ressourcenbeschränkten Feinabstimmungsbereich von Open-Source-LLMs, die für kritische Bereiche wie das Gesundheitswesen relevant sind. Um diese Lücken zu beheben, wird ein einziges Protokoll zur Minimierung und Bewertung von Verzerrungen vorgestellt, das helfen kann, stereotype Verzerrungen über verschiedene Modellarchitekturen hinweg zu messen, Feinabstimmung unter Rechenbedingungen einzubeziehen und die Robustheit von Modellentscheidungen gegenüber Verzerrungsmetriken zu bewerten.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Alle Experimente werden auf der Google Colab-Plattform (A100 mit 40 GB RAM) durchgeführt. Für die Durchführung von Experimenten wurden API-Schlüssel (Modellkarten) von Llama2-7B, Mistral-7B und Dolly-7B von Hugging Face gesammelt.

Das Protokoll ist in drei Teile unterteilt. Erstens sollte man einen Datensatz aufbauen, der als Grundlage zur Bewertung sozialer Voreingenommenheit in LLMs dient. Anschließend entwerfen Sie zwölf verschiedene prompte Varianten, die sich an die Arbeit von Kamruzzaman und Kim38 orientiert, um das Vorhandensein sozialer Voreingenommenheit in den von LLMs erzeugten Folgerungen zu untersuchen. Feinjustieren Sie dann die LLMs an einem Datensatz unvoreingenommener Sätze, die sich auf Rasse, Religion, Geschlecht und Beruf beziehen, und untersuchen Sie sie erneut mit denselben Eingaben, um die Wirkung des Feinabstimmungs auf die erzeugten Schlussfolgerungen zu untersuchen. Der vorgeschlagene Rahmen ist in Abbildung 2 dargestellt.

Kuratierung eines Datensatzes
Das Framework verwendet zwei Datensätze. Das eine wird verwendet, um Schlussfolgerungen zu ziehen, das andere wird zur Feinabstimmung von LLMs angewandt. Diese Studie modifiziert StereoSet16 , um einen neuen Datensatz namens NeutralSet zu erstellen, der als Grundlage für die Inferenzgenerierung dient. Die LLMs nutzten das StereoSet, um Vorhersagen über vier Vorurteile hinweg zu treffen: Rasse, Religion, Geschlecht und Beruf. StereoSet besteht aus zwei Unterdatensätzen: intra-satz- und zwischen-satz-Datensätzen. Eine Instanz von NeutralSet ist in Tabelle 1 dargestellt. Gib dem LLM einen Satz aus dem Spaltenkontext als Anfrage und bitte darum, das BLANK mit einem der Worte aus den Spalten zu füllen: Anti-Stereotype, Stereotype oder Neutral. Das Ausmaß der Verzerrung im LLM lässt sich an der gewählten Option beurteilen. Die Einbeziehung einer neutralen Spalte in NeutralSet unterscheidet es von StereoSet. Der Zweck des Hinzufügens zum neuen Datensatz ist es, die Wahrscheinlichkeit zu verringern, die Stereotyp-Option auszuwählen, während LLM-Inferenzen gezogen werden. Wörter werden in der neutralen Spalte gemäß den im Algorithmus 1 (Supplementary File 1) genannten Schritte hinzugefügt. Wobei Vs und Vas die Vektoren von Stereotyp- bzw. Antistereotyp-Wörtern sind. Dann wird ein Wort aus dem Wörterbuch ausgewählt, dessen Vektor Vn am nächsten ist, das kontextuell zwischen den Stereotyp- und Anti-Stereotyp-Wortvektoren positioniert ist, und dieses Wort wird der neutralen Spalte in der ausgewählten Zeile hinzugefügt. Tabelle 2 fasst den Prozess zur Erstellung von NeutralSet zusammen. Dann modifizieren Sie den Datensatz17, um die LLMs zu feinjustieren. Der überarbeitete Datensatz umfasst 25.020 Instanzen, von denen jede aus einer Anfrage mit einer sozial unvoreingenommenen Antwort besteht, die zum Training der Modelle verwendet wird. Abfragen sind darauf ausgelegt, alle vier Arten sozialer Vorurteile zu adressieren.

Anleitung der LLMs
Untersuchen Sie die sozialen Verzerrungen in LLMs, indem Sie eine Reihe von Eingaben als Eingabeanweisungen bereitstellen. Erstens erstellen Sie zwölf Arten von Prompts: sechs grundlegende und sechs entsprechende debiased Varianten. Der Inhalt aller Prompting-Techniken ist in Tabelle 3 aufgeführt. Die Prompts in dieser Studie durchliefen einen zyklischen, formalisierten Prozess aus Erstellung, Implementierung, Reflexion und Überarbeitung, was zu einer Reihe von Prompts führte, die im Laufe der Zeit durch umfangreiches Ausprobieren und Verfeinerung verfeinert wurden. Dies ermöglichte die Abdeckung einer Vielzahl von Prompt-Typen, darunter Baseline-, CoT- und Mensch-Persona-Prompts. Prompt-Designs und Scoring wurden von externen Fachexperten (z. B. Kliniker, Sozial- oder Fairness-Spezialisten) nicht validiert. Tabelle 4 fasst verschiedene Prompt-Typen zusammen und hebt deren Argumentationsstile, Verzerrungsfähigkeiten und geeignete Anwendungsfälle hervor, um die passende Auswahl zu leiten. Die Bewertung der LLMs in diesem Papier speichert keine bisherigen Informationen über Läufe oder Sitzungen hinweg. Eine Sache, die im Endmodell klargestellt werden sollte, ist, dass jeder Prompt isoliert ausgeführt werden muss, was bedeutet, dass keine Gesprächshistorie von einem Prompt auf einen anderen übertragen wird. Dieses Layout stellte sicher, dass frühere Antworten die nachfolgenden Ausgaben nicht beeinflussten. Während der Feinabstimmungsphase werden nur die Modellparameter auf Basis des Trainingsdatensatzes modifiziert, wie sie sowohl in Parameter-Efficient Transfer Learning (PEFT47) als auch in Quantized Low-Rank Adaptation (QLoRA48) beschrieben sind. Erstellen Sie den Prompt wie unten beschrieben:

Standard-Eingabeaufforderung: Dies ist eine Zero-Shot-Prompting-Technik, bei der das LLM mit minimalen Informationen angewiesen wird, die Schlussfolgerung zu ziehen. Die Aufforderung lautet: "Füge das passendste Wort aus den gegebenen Optionen in den BLANK ein." Dies dient als Basis, um soziale Voreingenommenheit in allen sechs LLMs zu quantifizieren und zu bewerten.

CoT-Aufforderung: Der Prompt enthält den Satz: "Denk Schritt für Schritt und fülle die LÜCKE aus. Wählen Sie die beste Passform für den BLANK aus den angebotenen Optionen aus...". Bei dieser Prompting-Technik wird der LLM ermutigt, seinen kognitiven Prozess zu aktivieren und Schritt für Schritt zu denken, bevor er eine Antwort gibt.

System1- und System2-Prompts: Durch die Verwendung des Satzes "Sie antworten prompt auf Fragen..." führen die System1-Eingaben das LLM dazu, schnelle, intuitive Antworten zu liefern, ähnlich wie menschliche Kognition in System1. System2-Prompts hingegen sind darauf ausgelegt, dem LLM durchdachtere, detailliertere, analytischere und gezieltere Antworten zu entlocken, indem der Satz hinzugefügt wird: "Sie beantworten Fragen gründlich und bewusst. Ihre Antworten sind durchdacht und zuverlässig "in der Anleitung".

HP1- und HP2-Prompts: Die Prompts beginnen mit: "Nimm die Identität einer Person an, die die Fragen schnell beantwortet, und fülle das LEERE aus, während du strikt der Natur dieser Identität entspricht... ". Bei der HP1-Prompting-Technik wurde das LLM angewiesen, die Identität eines Menschen anzunehmen, der schnell reagiert. Der Zweck dieses Settings ist es, das LLM dazu zu bringen, den Menschen im System1-Kognitionsprozess zu imitieren. Im Gegensatz dazu ist der LLM im HP2-Prompt dazu getrieben, eine menschenähnliche Identität anzunehmen, die sorgfältig und bewusst nachdenkt, bevor sie Fragen beantwortet, um so genauere Ergebnisse zu erzielen. Der HP2-Prompt beginnt mit dem Satz: "Nimm die Identität einer Person an, die die Fragen durchdacht und bewusst beantwortet, und fülle die LÜCKE aus, während du strikt im Einklang mit der Natur dieser Identität bleibst..." Die zentrale Idee hinter der Einbindung dieser Prompts ist es, die Fähigkeit eines LLM zu bewerten, menschliche Kognition vollständig nachzuahmen.

Debias-Varianten: Eine Debias-Variante wird durch das Hinzufügen einer Aussage konstruiert, die das LLM anweist, die Entscheidung neutral und ohne stereotype Vorurteile zu treffen.

Bewertung der LLMs
Bewerten Sie sechs LLMs: 1) Llama-2-7B13, mit dem Meta-llama/Llama-2-7b-chat-hf Checkpoint auf Huggingface; 2) Mistral-7B14, über den Mistralai/Mistral-7B-Instruct-v0.3 Kontrollpunkt auf Huggingface; 3) Dolly-7B15, mit dem Databricks/dolly-v2-7b Checkpoint auf Huggingface; 4) Llama2-7Bfein abgestimmt, eine fein abgestimmte Variante des Llama-2-7B; 5) Mistral-7BFinetuned, eine fein abgestimmte Variante des Mistral-7B; 6) Dolly-7BFinetuned, eine fein abgestimmte Variante des Dolly-7B.

Führen Sie alle Experimente auf einer Hochgeschwindigkeits-GPU durch, wie z. B. A100 mit 40 GB Speicher oder mehr. Zur Feinabstimmung der LLMs unterteilen Sie den Datensatz in Training, Validierung und Testsätze, wobei die Standardaufteilung von 70%:10%:20% verwendet wird. Um ein vollständiges Neutraining des Modells zu vermeiden, verwendet diese Studie diePEFT-47-Konfiguration zur Feinabstimmung, die einen erheblichen Teil der Modellparameter einfriert und nur wenige aufgabenspezifische Parameter hinzufügt. Verwenden Sie 4-Bit-Präzision in QLoRA48 , um das LLM zu laden, wenn die Rechenressourcen begrenzt sind. Dies ermöglicht eine schnellere Feinabstimmung, ohne die Leistung des Modells zu beeinträchtigen.

Um stereotype Verzerrungen in LLMs zu bewerten, verwenden Sie denBias-Score als Kennzahl. Wie in Gleichung 1 gezeigt, wird derBias-Score als Verhältnis der Stereotypantworten zur Gesamtzahl der gültigen Antworten des LLM für einen bestimmten Prompt berechnet.

figure-protocol-1(1)

Wobei Ns, Nas und Nn die Anzahl der stereotypen, antistereotypen bzw. neutralen Reaktionen darstellen. Ein niedrigerer Bias-Wert zeigt, dass das Ergebnis des Modells weniger stereotyp ist.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Anhand des in Gleichung 1 definierten Verzerrungswerts beantworten wir systematisch unsere Forschungsfragen und bewerten gesellschaftliche Verzerrungen in LLMs über vier soziale Dimensionen hinweg. Die statistisch signifikanten Reduktionen der beobachteten Verzerrungswerte liefern empirische Validierung des vorgeschlagenen Protokolls zur Verzerrung von Verzerrungen bei LLMs für Aufgaben mit hohem Einsatz. Um die Wirksamkeit von NeutralSet, also des kuratierten Inferenzdatensatzes, zu bew...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

In dieser Arbeit präsentieren wir ein skalierbares Protokoll zur Reduzierung sozialer Vorurteile in LLMs, das Llama2-7B13, Mistral-7B14 und Dolly-7B15 nutzt. Dieser Ansatz kombiniert HP2-Prompt-Engineering, das Debiasing von Prompt-Modifikationen und gezielte Feinabstimmung, um ein Protokoll zur kontinuierlichen Reduktion von Verzerrungen in LLM-generierten Ergebnissen über die vier wichtigsten gesellschaftlichen Dim...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren haben nichts offenzulegen.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
Google ColabGooglehttps://colab.research.google.com/verwendet für die Durchführung der Experimente 
Mendeley DesktopMendeleyhttps://www.mendeley.com/wird zur Verwaltung von Zitaten und Referenzen verwendet.

Referenzen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. STRUX: An LLM for decision-making with structured explanations. Lu, Y., Hu, Y., Foroosh, H., Jin, W., Liu, F. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  2. Eigner, E., Händler, T. Determinants of LLM-assisted decision-making. arXiv. , (2024).
  3. Wu, Y. Large Language Model and Text Generation. Natural Language Processing in Biomedicine: A Practical Guide. , Springer. Cham. (2024).
  4. Wang, L., et al. Benchmarking and improving long-text translation with large language models. Find Assoc Comput Linguist: ACL. 2024, 7175-7187 (2024).
  5. Ghatora, P. S., Hosseini, S. E., Pervez, S., Iqbal, M. J., Shaukat, N. Sentiment analysis of product reviews using machine learning and pre-trained LLM. Big Data Cogn Comput. 8 (12), 199(2024).
  6. Arefeen, M. A., Debnath, B., Chakradhar, S. LeanContext: Cost-efficient domain-specific question answering using LLMs. Nat Lang Process J. 7, 100065(2024).
  7. Ye, Y., Sarkar, S., Bhaskar, A., Tomlinson, B., Monteiro, O. Using ChatGPT in a clinical setting: A case report. MedComm Future Med. 2 (2), e51(2023).
  8. How are LLMs mitigating stereotyping harms? Learning from search engine studies. Leidinger, A., Rogers, R. Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society, 7, 839-854 (2024).
  9. Gender bias and stereotypes in large language models. Kotek, H., Dockum, R., Sun, D. Proceedings of the ACM Collective Intelligence Conference, 2023, 12-24 (2023).
  10. Uncovering stereotypes in large language models: A task complexity-based approach. Shrawgi, H., Rath, P., Singhal, T., Dandapat, S. Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics, 1, 1841-1857 (2024).
  11. Kwak, D. -H., Holtkamp, P., Kim, S. S. Measuring and controlling social desirability bias: Applications in information systems research. J Assoc Inf Syst. 20 (4), 317-345 (2019).
  12. Self-debiasing large language models: Zero-shot recognition and reduction of stereotypes. Gallegos, I. O., et al. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  13. Touvron, H., et al. Llama 2: Open foundation and finetuned chat models. arXiv. , (2023).
  14. Jiang, A. Q., et al. Mistral 7B. arXiv. , (2023).
  15. Conover, M., et al. Free Dolly: Introducing the world's first truly open instruction-tuned LLM. , databricks.com/blog/2023/04/12/dolly-first-open-commercially-viable-instruction-tuned-llm (2023).
  16. Nadeem, M., Bethke, A., Reddy, S. StereoSet: Measuring stereotypical bias in pretrained language models. arXiv. , (2020).
  17. Breaking bias, building bridges: Evaluation and mitigation of social biases in LLMs via contact hypothesis. Raj, C., Mukherjee, A., Caliskan, A., Anastasopoulos, A., Zhu, Z. Proceedings of the Seventh AAAI/ACM Conference on AI, Ethics, and Society, 2024, 1180-1189 (2024).
  18. Abramski, K., Improta, R., Rossetti, G., Stella, M. The "LLM world of words" English free association norms generated by large language models. Sci Data. 12 (1), 1-16 (2025).
  19. Lhama Team, Meta AI. The Llama 3 herd of models. arXiv. , (2024).
  20. Claude Haiku 3.5. , Anthropic. At anthropic.com/claude/haiku (2025).
  21. De Deyne, S., Navarro, D. J., Perfors, A., Brysbaert, M., Storms, G. The "small world of words" English word association norms for over 12,000 cue words. Behav Res Methods. 51 (3), 987-1006 (2019).
  22. GenderAlign: An alignment dataset for mitigating gender bias in large language models. Zhang, T., et al. Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics, , (2025).
  23. Are models biased on text without gender-related language. Belém, C. G., Seshadri, P., Razeghi, Y., Singh, S. The Twelfth International Conference on Learning Representations (ICLR), , openreview.net/forum?id=w1JanwReU6 (2024).
  24. From showgirls to performers: Finetuning with gender-inclusive language for bias reduction in LLMs. Bartl, M., Leavy, S. Proceedings of the 5th Workshop on Gender Bias in Natural Language Processing (GeBNLP), 5, 280-294 (2024).
  25. Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., Sutskever, I. Language models are unsupervised multitask learners. OpenAI Blog. 1 (8), 9(2019).
  26. Li, Y., Bubeck, S., Eldan, R., Giorno, A. D., Gunasekar, S., Lee, Y. T. Textbooks are all you need II: Phi-1.5 technical report. arXiv. , (2023).
  27. Liu, Y., et al. A robustly optimized BERT pretraining approach. arXiv. , (2019).
  28. Raza, S., Garg, M., John, D., Raza, S., Ding, C. Nbias: A natural language processing framework for BIAS identification in text. Expert Syst Appl. 237 (PB), 121542(2024).
  29. Vicuna: An open-source chatbot impressing GPT-4 with 90%* ChatGPT quality. , Available from: lmsys.org/blog/2023-03-30-vicuna/ (2025).
  30. GenderCARE: A comprehensive framework for assessing and reducing gender bias in large language models. Tang, K., et al. CCS '24: Proceedings of the 2024 on ACM SIGSAC Conference on Computer and Communications Security, 2024, 1196-1210 (2024).
  31. BiasAlert: A plug-and-play tool for social bias detection in LLMs. Fan, Z., Chen, R., Xu, R., Liu, Z. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, 2024, 14778-14790 (2024).
  32. Social bias frames: Reasoning about social and power implications of language. Sap, M., Gabriel, S., Qin, L., Jurafsky, D., Smith, N. A., Choi, Y. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, 58, 5477-5490 (2020).
  33. Echterhoff, J., Liu, Y., Alessa, A., McAuley, J., He, Z. Cognitive bias in decision-making with LLMs. Findings of the Association for Computational Linguistics: EMNLP 2024. 2024, 12640-12653 (2024).
  34. Furniturewala, S., et al. Thinking fair and slow: On the efficacy of structured prompts for debiasing language models. arXiv. , (2024).
  35. Dong, X., Wang, Y., Yu, P. S., Caverlee, J. Disclosure and mitigation of gender bias in LLMs. arXiv. , (2024).
  36. Investigating bias in LLM-based bias detection: Disparities between LLMs and human perception. Lin, L., Wang, L., Guo, J., Wong, K. 31st International Conference on Computational Linguistics, 31, 10634-10649 (2025).
  37. OpenAI. GPT-4 technical report. arXiv. , (2023).
  38. Kamruzzaman, M., Kim, G. L. Prompting techniques for reducing social bias in LLMs through system 1 and system 2 cognitive processes. Proceedings of Recent Advances in Natural Language Processing. 2024, 511-520 (2024).
  39. Gemini Team. Gemini: A family of highly capable multimodal models. arxiv. , (2023).
  40. Hida, R., Kaneko, M., Okazaki, N. Social bias evaluation for large language models requires prompt variations. Find Assoc Comput Linguist: EMNLP 2025. , 14507-14530 (2025).
  41. Measuring and mitigating gender bias in contextualized word embeddings. Kamboj, P., Kumar, S., Goyal, V. Proc IEEE Int Conf Blockchain Distrib Syst Secur, , (2023).
  42. Raffel, C., et al. Exploring the limits of transfer learning with a unified text-to-text transformer. J Mach Learn Res. 21, 1-67 (2023).
  43. In-contextual gender bias suppression for large language models. Oba, D., Kaneko, M., Bollegala, D. EACL 2024 - 18th Conference of the European Chapter of the Association for Computational Linguistics, Findings of EACL 2024, 2024, 1722-1742 (2024).
  44. Mahajan, A., Obermeyer, Z., Daneshjou, R., Lester, J., Powell, D. Cognitive bias in clinical large language models. npj Digit Med. 8 (1), 1-4 (2025).
  45. Huang, D., Bu, Q., Zhang, J., Xie, X., Chen, J., Cui, H. Bias testing and mitigation in LLM-based code generation. ACM Trans Softw Eng Methodol. , (2025).
  46. Tjuatja, L., Chen, V., Wu, S. T., Talwalkar, A., Neubig, G. Do LLMs exhibit human-like response biases? A case study in survey design. arXiv. , (2024).
  47. Houlsby, N., et al. Parameter-efficient transfer learning for NLP. arXiv. , (2019).
  48. Dettmers, T., Pagnoni, A., Holtzman, A., Zettlemoyer, L. QLoRA: Efficient finetuning of quantized LLMs. arXiv. , (2023).
  49. Xiao, H., Xiang, Z., Wang, D., Devadas, S. A Theory to instruct differentially-private learning via clipping bias reduction. IEEE Symposium on Security and Privacy (SP). , (2023).
  50. Kamboj, P., Kumar, S., Goyal, V. Mitigating Social Bias in Generative AI: A comprehensive review. KSII Trans Internet Inf Syst. 19 (10), 3372-3394 (2025).

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Nachdrucke und Genehmigungen

Genehmigung beantragen, um den Text oder die Abbildungen dieses JoVE-Artikels zu verwenden

Genehmigung beantragen

Schlagwörter

Bias Unterdr ckungModell FeinabstimmungPrompt EngineeringFairness EvaluierungBias Bewertungdebiasierte PromptsModellrobustheitelektronische Gesundheitsakten
Video demnächst verfügbar

Verwandte Artikel