Onderzoeksartikel

Verbetering van eerlijkheid in grote taalmodellen voor klinische kunstmatige intelligentietoepassingen door fine-tuning en prompting

DOI:

10.3791/69132

2 januari 2026

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gezondheidszorgspecifieke grote taalmodellen staan voor ethische en technische uitdagingen, omdat zij, net als andere grote taalmodellen, de vertekeningen in hun trainingsdata weerspiegelen. Het hier gepresenteerde protocol verifieert de onderdrukking van vier soorten vooringenomenheid (geslacht, ras, beroep, religie) met promptvarianten verspreid over drie open source-modellen.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Grote taalmodellen (LLM's) worden steeds vaker toegepast op gevoelige domeinen zoals medische zorg, die meerdere technische en ethische uitdagingen met zich meebrengen. De meest directe problemen zijn bias die in deze modellen zijn ingebouwd, die zijn getraind op grote datasets die mogelijk maatschappelijke vooroordelen weerspiegelen. Dergelijke biases kunnen resulteren in resultaten die oneerlijk, niet generaliseerbaar of zelfs schadelijk zijn, waardoor ze klinisch niet toepasbaar zijn in de echte wereld en niet voldoen aan ethische en regelgevende beperkingen. We onderzoeken hoe goed biasonderdrukking werkt wanneer fijn afgestelde modellen worden geïnspireerd in vier cruciale categorieën (geslacht, ras, beroep en religie). We cureren handmatig een diverse inferentiedataset en maken twaalf promptvarianten – waarvan zes bevooroordeeld zijn – om de output van drie open-source LLM's te testen: Llama2-7B, Mistral-7B en Dolly-7B. De eerlijkheid en interpreteerbaarheid van de uitkomsten worden geëvalueerd met behulp van een bias-scoring, waarbij lagere scores beter eerlijkheid en interpreteerbaarheid aangeven. We merken ook op dat onbevooroordeelde prompts de bias verminderen, en het fijn afstemmen van het model presteert nog beter. De resultaten benadrukken het cruciale belang van tijdig handelen, robuustheid van het model en voortdurende ethische controle voor een betrouwbare en eerlijke implementatie van LLM's in praktijkomgevingen, zoals medische beeldvorming en het bijhouden van elektronische patiëntendossiers (EPD).

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Grote taalmodellen hebben een enorme weerklank als hulpmiddelen ter ondersteuning van diverse taken, waaronder besluitvorming 1,2, tekstgeneratie3, tekstvertaling4, klantsentimentanalyse5, vraagbeantwoording6 en het genereren van klinische rapporten7. Er zijn de laatste tijd verschillende gevallen geweest waarin applicaties LLM's hebben gebruikt om content te genereren die maatschappelijk kansarme individuen of groepen schaadt 8,9,10. De belangrijkste reden achter zulke clichéloze antwoorden is dat deze modellen zijn getraind op datasets die inherent maatschappelijke vooroordelen bevatten die samenhangen met ras, geslacht, sociaaleconomische klasse en vergelijkbare factoren. Maar wat je bedoelt met "bias" en "eerlijkheid" in een AI-systeem in de gezondheidszorg kan subjectief en contextafhankelijk zijn. Onderzoekers hebben aanzienlijke inspanningen geleverd om sociale vooroordelen in LLM's11,12 te verminderen; toch blijft verdere verbetering noodzakelijk. De onderzoekers hebben meerdere strategieën voor het mitigeren van biasen voorgesteld, die kunnen worden ingedeeld als pre-processing, in-processing, post-processing of combinaties daarvan, over een heterogeen scala aan toepassingen. Deze categorisering is gebaseerd op het stadium waarin de mitigatiemaatregel wordt genomen. Dit protocol combineert alle drie de strategieën om sociale vooringenomenheid in zes varianten van LLM's aan te pakken en te verlichten en onderzoekt het verminderen van vooroordelen over vier dimensies van sociale vooroordelen: geslacht, beroep, ras en religie. Eerst wordt een inferentiedataset ontwikkeld met behulp van een data-augmentatietechniek om LLM's in staat te stellen inferenties te genereren. Ten tweede zijn twaalf soorten prompts ontworpen om stereotiepe reacties uit LLM's uit te lokken. Ten derde zijn Llama-2-7B13, Mistral-7B14 en Dolly-7B15 fijn afgesteld op een dataset met onbevooroordeelde zinnen over de vier sociale categorieën: geslacht, ras, beroep en religie, om Llama-2-7BFinetuned, Mistral-7BFinetuned en Dolly-7BFinetuned te krijgen, respectievelijk. Tot slot worden conclusies getrokken door de fijn afgestemde LLM's te laten onderzoeken hoe effectief ze zijn in het geven van eerlijke antwoorden.

We formuleerden de volgende onderzoeksvragen en behandelden deze in dit artikel. Voor elke geformuleerde onderzoeksvraag (RQ) werden een nulhypothese (H0) en een alternatieve hypothese (H1) opgesteld.

RQ1: Zijn de inferentiedataset en basispromptingtechnieken effectief bij het evalueren van maatschappelijke biases in LLM's? Nulhypothese (H01): De biasscores die uit een inferentiedataset zijn afgeleid, gecombineerd met basisprompts, statistisch niet te onderscheiden van de basislijn-biasscores van de LLM's. Alternatieve hypothese (H11): Biasscores uit de inferentiedataset met basisprompts verschillen statistisch significant van de baseline biasscores van de LLM's. Om de hypothese te testen werd een dataset, NeutralSet, samengesteld door StereoSet16 aan te passen en elke LLM te evalueren met behulp van basispromptingtechnieken om het vermogen te beoordelen om niet-stereotiepe antwoorden te produceren. In onze settings bevatten we zes basisprompts -- Standard (Een zero-shot prompt om de LLM te laten instrueren inferenties te trekken), Chain-of-Thoughts (CoT is ontworpen om de LLM stap voor stap te vragen om conclusies te trekken), System1 (Een prompt om de LLM snel te laten denken tijdens het antwoorden), System2 (Een prompt om de LLM langzaam en bedachtzaam te laten denken), Human Persona 1 (HP1 is ontworpen om de LLM de identiteit van een mens te laten aannemen die snel denkt tijdens het nemen van beslissingen), en Human Persona 2 (HP2 is ontworpen om de LLM de menselijke identiteit te laten aannemen en langzaam en bedachtzaam te denken tijdens het antwoorden).

RQ2: Zijn de debiasing prompting-technieken effectief in het onthullen en verminderen van maatschappelijke vooroordelen in LLM's? Nulhypothese (H0₂): Debiasing prompting-technieken zijn niet effectief in het onthullen en verminderen van maatschappelijke biases in LLM's. Alternatieve hypothese (H12): Gemeten biasscores dalen significant wanneer debiasing promptingtechnieken worden gebruikt in LLM's. We onderzoeken de impact van bevooroordeelde varianten van de basisprompts op drie open-source LLM's om eerlijke tekstgeneratie te bereiken zonder sociale discriminatie.

RQ3: Kunnen maatschappelijke vooroordelen verder worden verminderd door de LLM's fijn af te stemmen? Nulhypothese (H03): Het fijn afstemmen van de LLM's vermindert maatschappelijke biases niet verder dan de reducties die alleen door promptingtechnieken worden bereikt. Alternatieve hypothese (H13): Het fijn afstemmen van LLM's vermindert maatschappelijke biases verder dan de reducties die alleen door promptingtechnieken worden bereikt. Om deze vraag te beantwoorden, passen we dataset17 aan en verfijnen we de LLM's erop om de impact van fine-tuning bij het verminderen van stereotyperesponsen verder te beoordelen.

Figuur 1 illustreert het effect van promptvariatie en LLM-fine-tuning op de genderneutrale voorspelde uitkomst. De nieuwheid van ons werk komt voort uit het integreren van handmatige datasetcuratie, meerdere debiasing promptstrategieën en fine-tuning onder één protocol om een LLM te analyseren voor maatschappelijke bias-identificatie en -verlichting, relevant voor gevoelige toepassingen in de praktijk zoals medische beeldvorming en EPD-onderhoud. We groepeerden de literatuur over bias in LLM's in vier perspectieven: datasets voor bias en cognitieve associaties; raamwerken voor het opsporen en evalueren van bias; benaderingen van vooringenomenheid; en vooringenomenheid in gespecialiseerde domeinen.

Onderzoekers genereren voortdurend datasets om bias-evaluatie en analyse van semantische associaties in LLM's mogelijk te maken. Zo zijn vrije associaties in cognitieve psychologie en taalkunde altijd cruciaal voor het organiseren van conceptuele kennis. Door dezelfde associatie in de latente verdeling van LLM's te simuleren, hebben Abramski et al.18 een dataset geconstrueerd, LLM World of Words (LWOW). De LWOW Engelse vrije associatienormen-dataset, bestaande uit miljoenen antwoorden van drie LLM's: Mistral-7B14, Llama-3.1-8B19 en Claude-3-5-haiku-latest20. Het is geïnspireerd op Small World of Words (SWOW)21, de grootste dataset van menselijke Engelse vrije associatienormen, die veelvuldig is gebruikt in diverse psychologische en taalkundige onderzoeken. Verder helpt LWOW bij het opbouwen van een cognitief netwerk bestaande uit knooppunten, elk een woord vertegenwoordigend, met knooppunten die overeenkomen met semantisch vergelijkbare woorden die dichter bij elkaar in het netwerk liggen. Dit helpt om bias in de output van LLM's te evalueren door de afstand tussen woorden in het kunstmatige cognitieve netwerk als belangrijke maatstaf te schatten. Een groot struikelblok bij het gebruik van propriëtaire LLM's is dat hun interne onderdelen ontoegankelijk zijn. Hoewel er aanzienlijke inspanningen zijn geleverd in deze modellen om bias aan te pakken, zijn alignment-datasets nog steeds schaars. Om deze zorg aan te pakken, wordt in Zhang et al.22 een dataset genaamd GenderAlign voorgesteld om genderbias in de LLM's te verminderen. UnStereoEval23, een benchmarkdataset, wordt voorgesteld om stereotiepe genderbias in beroepen en emoties te onderzoeken. Hun bevindingen tonen een laag niveau van eerlijkheid aan over 28 verschillende LLM's. Bartl en Leavy24 ontwikkelden een dataset, Tiny Heap, waarin zinnen met stereotiepe vermeldingen worden vervangen door hun neutrale equivalenten en drie taalmodellen fijn worden afgestemd (GPT-225, PHI-1.526 en RoBERTa27). In hun bevindingen zien ze een significante vermindering van de genderstereotiepe neigingen van de modellen.

Verschillende meerlaagse raamwerken zijn voorgesteld om biases in LLM's te identificeren en te verminderen. In Raza et al.28 wordt een raamwerk voorgesteld, NBIAS, dat uit vier lagen bestaat: datasetcreatie, modelontwikkeling, biasmitigatie en evaluatie. De dataset binnen het kader is opgebouwd uit diverse domeinen, waaronder gezondheidszorg, sociale media en werkgelegenheidsportalen. Ze tonen de effectiviteit van hun model aan door eerlijk te zijn met 1% tot 8% beter dan de basislijn (BERT29). In een ander dergelijk kader, GenderCARE30, wordt een strategie voorgesteld om genderbias in LLMS te verminderen. In hun uitgebreide experimentele opzet verminderden ze de genderbias effectief met gemiddeld 35% over twaalf verschillende LLM's. Een framework, BiasAlet31, detecteert automatisch sociale bias in de open tekst die door de LLM's wordt gegenereerd. Het heeft enkele beperkingen: ten eerste wordt de studie uitgevoerd op een gesynthetiseerde dataset vanwege het ontbreken van een benchmark om bias in de open-text generatie van de LLM te evalueren, en ten tweede is het gebaseerd op de verouderde dataset SBIC32, wat het moeilijk maakt om het belang van impliciete bias te onderscheiden van de bias in de dataset zelf. Bias in door mensen gegenereerde data kan worden geïntroduceerd in modellen die erop zijn getraind. Het gebruik van dergelijke modellen is controversieel in banen met hoge inzet, waar hun output een nadelige impact kan hebben op kansarme groepen. Om dit aan te pakken, is een framework, BiasBuster33, ontworpen om cognitieve bias in LLM's te detecteren, evalueren en verminderen. In lijn hiermee stellen onderzoekers in een ander werk34 een interactief kader voor om eerlijke, logische en kritische tekst te genereren via System 2-prompts (ontworpen om de LLM doordacht en langzaam te laten nadenken) die zelfverfijnde en implicatieve prompts aanvullen. Het raamwerk is echter beperkt tot de taken binnen de latente ruimte van de LLM's. Dong et al.35 ontwikkelen een raamwerk dat indirect probing gebruikt om genderbias in tien open-source LLM's te verminderen en te evalueren. In hun onderzoekende methode, zonder gebruik te maken van directe stereotiepe vermeldingen, onthullen ze indirecte genderbias.

Lin et al.36 onderzoeken de politieke vooringenomenheid in tekstgeneratie door de LLM's voor zowel gesloten (GPT-3.5-turbo en GPT-437) als open-einde modellen (Llama-2-7B13, Mistral-7B14, Vicuna29). Zij bepaalden of de door het model gegenereerde tekst een links- of rechtsgerichte mediabias veroorzaakte. Bovendien ontwikkelden ze een mitigatiestrategie door het model fijn af te stemmen en extra onbevooroordeelde prompts te bieden tijdens tekstgeneratie. Na toepassing van de bias mitigatietechniek genereert het model meestal neutrale tekst; Linkse of rechts georiënteerde media beïnvloeden dat niet. In lijn hiermee hebben Raj et al.17 een debiasing-oplossing voorgesteld, Social Contact Debiasing (SCD), gebaseerd op de contacthypothese in de psychologie, die prompt generation omvat die de ideologieën van verschillende sociale groepen begrijpt om vooroordelen in de tekstgeneratie van drie open source LLM's te verminderen. Parallel hieraan hebben Kamruzzaman en Kim38 een techniek voor sociale debiasing voorgesteld die gebruikmaakt van Systeem 1 en Systeem 2 van gedachte-aansturing om te mititeren over twaalf biasdimensies in vijf LLM's (GPT-3.5, GPT-437, Llama-2-7B13, Mistral-7B14 en Gemini-1.039). Hier is de System 1-prompt bedoeld om de LLM snel te laten reageren, terwijl de System 2-prompt bedoeld is om het te leiden naar meer doordachte en doordachte antwoorden. Hoewel er verschillende studies zijn uitgevoerd die gebruik maken van prompt engineering om de bias in LLM's te verminderen, heeft bijna niemand de impact van promptvariatie op de output van LLM's onderzocht. Om dit probleem aan te pakken, hebben Hida et al.40 de gevoeligheid van de output van de twaalf open-source LLM's onderzocht om variatie te stimuleren en hun impact op taakprestaties en afwegingen van bias geanalyseerd. Hun bevindingen tonen aan dat debias-resultaten gevoelig zijn voor de prompt; Minder bias in de output van de modellen leidt tot een lagere taakprestatie. Kamboj et al.41 hebben een post-processing benadering voorgesteld om genderbias in contextualiseerde embeddings van een T5-model (Text-To-Text-Transfer-Transformer model42) te verminderen. Oba et al.43 bieden handmatig gemaakte tekstuele preambels als prompts aan LLM's om hun bevooroordeelde generatie te onderdrukken.

Cognitieve biases, die al decennialang een bron van diagnostische fouten in de gezondheidszorg zijn, lopen het risico te worden ingeprent in en versterkt door grote taalmodellen (LLM's) in klinische besluitvorming. Om dit risico tegen te gaan, stellen Mahajan et al.44 voor dat mitigatiestrategieën voor de implementatie van deze technologieën zich moeten richten op drie thema's: ten eerste zelfreflectie (iteratieve herwaardering van outputs), ten tweede contextueel redeneren (volledige patiëntengeschiedenis en evidence-based richtlijnen), en ten slotte transparante redeneersporen (uitleg van redeneerprocessen die beschikbaar zijn voor audit). LLM's, met hun alomtegenwoordige mogelijkheden, worden nu ook veel gebruikt om programmeercode te genereren. Daarom is dit een belangrijke zorg voor onderzoekers om de nadelige effecten van sociale bias in gegenereerde code te onderzoeken. Als zo'n bias wordt ontdekt, moeten de bijbehorende mitigatietechnieken worden ontwikkeld. In dezelfde richting stelden Huang et al.45 een techniek voor om sociale vooringenomenheid te evalueren en te mitigeren en deze te testen op vijf veelgebruikte LLM's. In recente tijden hebben we enorme vooruitgang gezien in LLM-architecturen en hun vermogen om antwoorden te genereren die menselijk klinken. Of LLM's als proxy voor mensen kunnen dienen bij besluitvorming blijft nog onderbelicht en verdient verder onderzoek. In deze richting worden een kader en een dataset samengesteld door Tjuatja et al.46 om het vermogen van LLM's te onderzoeken om mensachtige antwoorden te geven in een enquêtevragenlijst.

Ondanks deze vooruitgang blijven er drie onderzoeksgaten bestaan. Ten eerste richt eerder onderzoek zich vaak op smalle soorten vooringenomenheid (bijvoorbeeld geslacht of politiek) of specifieke domeinen (bijvoorbeeld een bepaald onderwerp). Ten tweede, hoewel prompt engineering wijdverbreid is, onderzoeken weinig studies de effecten van systematische promptvariatie op LLM-output. Ten derde richt beperkt onderzoek zich op debiasing in de uitdagende resource-beperkte fine-tuning setting van open-source LLM's die relevant zijn voor kritieke domeinen zoals de gezondheidszorg. Om deze hiaten aan te pakken, wordt een enkel bias-mitigatie- en evaluatieprotocol gepresenteerd dat kan helpen bij het meten van stereotiepe bias over verschillende modelarchitecturen, waarbij fine-tuning onder computationele beperkingen wordt geïntegreerd en de robuustheid van modelbeslissingen ten opzichte van bias-metrieken wordt beoordeeld.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Alle experimenten worden uitgevoerd op het Google Collab-platform (A100 met 40 GB RAM). Voor het uitvoeren van experimenten werden API-sleutels (modelkaarten) van Llama2-7B, Mistral-7B en Dolly-7B verzameld van Hugging Face.

Het protocol is verdeeld in drie delen. Bouw eerst een dataset op die dient als basis voor het evalueren van sociale bias in LLM's. Vervolgens ontwerpen ze twaalf verschillende promptvarianten, afgestemd op het werk van Kamruzzaman en Kim38 om de aanwezigheid van sociale bias in de door LLM's gegenereerde inferenties te onderzoeken. Vervolgens verfijn je de LLM's op een dataset van onbevooroordeelde zinnen gerelateerd aan ras, religie, geslacht en beroep, en onderzoek je ze opnieuw met dezelfde prompts om het effect van fine-tuning op de gegenereerde inferenties te onderzoeken. Het voorgestelde kader is weergegeven in Figuur 2.

Het cureren van een dataset
Het framework gebruikt twee datasets. De ene wordt gebruikt om inferenties af te leiden, de andere wordt toegepast om LLM's fijn af te stemmen. Deze studie past StereoSet16 aan om een nieuwe dataset te bouwen, NeutralSet, die dient als basis voor inferentiegeneratie. De LLM's gebruikten de StereoSet om voorspellingen te doen over vier soorten vooroordelen: ras, religie, geslacht en beroep. StereoSet bestaat uit twee subdatasets: intra-zin en inter-zinn. Een instantie van NeutralSet wordt weergegeven in Tabel 1. Geef een zin uit de kolomcontext als vraag aan de LLM en vraag om het BLANK in te vullen met een van de woorden uit de kolommen: anti-stereotype, stereotype of neutrale. De mate van vooringenomenheid in de LLM kan worden afgemeten aan de keuze van de keuze. De opname van een neutrale kolom in NeutralSet onderscheidt het van StereoSet. Het doel van het toevoegen aan de nieuwe dataset is om de kans te verkleinen dat je de stereotypeoptie kiest bij het trekken van LLM-inferenties. Woorden worden toegevoegd in de neutrale kolom volgens de stappen vermeld in Algoritme 1 (Aanvullend Bestand 1). Waar Vs en Vas respectievelijk de vectoren zijn van stereotype en antistereotype woorden. Vervolgens wordt een woord uit het woordenboek geselecteerd waarvan de vector het dichtst bij Vn ligt, dat contextueel tussen de stereotype- en anti-stereotype woordvectoren ligt, en dit woord wordt toegevoegd aan de neutrale kolom in de geselecteerde rij. Tabel 2 vat het proces samen van het aanmaken van NeutralSet. Pas vervolgens dataset17aan om de LLM's fijn af te stemmen. De herziene dataset bevat 25.020 instanties, elk bestaande uit een zoekopdracht gekoppeld aan een sociaal onbevooroordeeld antwoord, gebruikt voor het trainen van de modellen. Queries zijn ontworpen om alle vier de soorten sociale vooroordelen aan te pakken.

Aanleiding voor de LLM's
Onderzoek de sociale biases in LLM's door een set prompts als invoerinstructies te geven. Maak eerst twaalf soorten prompts: zes basisprompts en zes bijbehorende debiased varianten. De inhoud van alle promptingtechnieken staat vermeld in Tabel 3. De prompts in deze studie ondergingen een cyclisch, geformaliseerd proces van schrijven, uitvoeren, reflecteren en herzien, wat resulteerde in een reeks prompts die in de loop van de tijd werden verfijnd door veel trial-and-error en verfijning. Dit maakte dekking mogelijk van een diverse set prompttypes, waaronder baseline-, CoT- en mens-persona-prompts. Prompt-ontwerpen en -scores werden niet gevalideerd door externe domeinexperts (bijv. clinici, specialisten in sociale of rechtvaardigheid). Tabel 4 vat verschillende prompttypes samen, waarbij hun redeneerstijlen, bias-mitigatiemogelijkheden en geschikte gebruikssituaties worden benadrukt om de juiste selectie te sturen. De evaluatie van de LLM's in dit artikel behoudt geen eerdere informatie over runs of sessies. Een ding dat in het uiteindelijke model moet worden verduidelijkt, is dat elke prompt geïsoleerd moet worden uitgevoerd, wat betekent dat er geen gespreksgeschiedenis van de ene prompt naar de andere wordt overgenomen. Deze indeling zorgde ervoor dat eerdere antwoorden geen invloed hadden op latere uitkomsten. Tijdens de fine-tuningfase past u alleen de modelparameters aan op basis van de trainingsdataset, zoals uiteengezet in zowel Parameter-Efficient Transfer Learning (PEFT47) als Quantized Low-Rank Adaptation (QLoRA48). Stel de prompt op zoals hieronder vermeld:

Standaardprompt: Dit is een zero-shot prompting-techniek waarbij de LLM met minimale informatie wordt geïnstrueerd om de inferentie te maken. De prompt is: "Voeg het meest geschikte woord in de BLANCO in uit de gegeven keuzes." Dit wordt gebruikt als basis om sociale bias in alle zes LLM's te kwantificeren en te evalueren.

CoT-prompt: De prompt bevat de zin: "Denk stap voor stap en vul het LEGE INVUL. Kies de beste match voor de BLANK uit de aangeboden opties...". Bij deze aanmoedigingstechniek wordt de LLM aangemoedigd om zijn cognitieve proces te activeren en stap voor stap na te denken voordat hij een antwoord geeft.

System1- en System2-prompts: Door de zin "U reageert prompt op vragen..." op te nemen, leiden de System1-prompts de LLM om snelle, intuïtieve antwoorden te geven, vergelijkbaar met hoe menselijke cognitie werkt in System1. System2-prompts zijn daarentegen ontworpen om meer doordachte, gedetailleerde, analytische en doordachte antwoorden uit de LLM te krijgen door de zin toe te voegen: "Je beantwoordt vragen grondig en doelbewust. Je antwoorden zijn doordacht en betrouwbaar "in de instructie".

HP1- en HP2-prompts: De opdrachten beginnen met: "Neem de identiteit aan van iemand die de vragen snel beantwoordt en vul het BLANCO in, terwijl je strikt in overeenstemming blijft met de aard van deze identiteit... ". In de HP1-promptingtechniek kreeg de LLM de instructie om de identiteit aan te nemen van een mens die snel reageert. Het doel van deze setting is om de LLM de mens te laten imiteren in het System1-cognitieproces. Daarentegen wordt de LLM in de HP2-prompt gedreven om een mensachtige identiteit aan te nemen die doordacht en doordacht voordat hij vragen beantwoordt, waardoor nauwkeurigere resultaten worden behaald. HP2-prompt begint met de zin: "Neem de identiteit aan van een persoon die de vragen doordacht en doelbewust beantwoordt en vul het LEGE IN terwijl je strikt in overeenstemming blijft met de aard van deze identiteit...". Het belangrijkste idee achter het opnemen van deze prompts is het beoordelen van het vermogen van een LLM om menselijke cognitie volledig na te bootsen.

Debias-varianten: Een debiasvariant wordt geconstrueerd door een verklaring toe te voegen die de LLM instrueert de beslissing neutraal te nemen, zonder stereotiepe vooroordelen.

Evaluatie van de LLM's
Evalueer zes LLM's: 1) Llama-2-7B13, met behulp van het meta-llama/Llama-2-7b-chat-hf checkpoint op Huggingface; 2) Mistral-7B14, met gebruik van het mistralai/Mistral-7B-Instruct-v0.3 checkpoint op Huggingface; 3) Dolly-7B15, met gebruik van het databricks/dolly-v2-7b checkpoint op Huggingface; 4) Llama2-7Bfinetuned, een fijn afgestemde variant van Llama-2-7B; 5) Mistral-7Bfinetuned, een fijn afgestelde variant van Mistral-7B; 6) Dolly-7Bfinetuned, een fijn afgestelde variant van Dolly-7B.

Voer alle experimenten uit op een snelle GPU, zoals de A100 met 40 GB geheugen of hoger. Voor het fijn afstemmen van de LLM's verdeel je de dataset in training, validatie en testsets, met de standaard 70%:10%:20% verdeling. Om volledige hertraining van het model te voorkomen, gebruikt deze studie de PEFT47-configuratie voor fine-tuning, waarbij een aanzienlijk deel van de modelparameters bevriest en slechts enkele taakspecifieke parameters worden toegevoegd. Gebruik 4-bits precisie in QLoRA48 om de LLM te laden als de rekenkrachten beperkt zijn. Dit maakt snellere fijnafstelling mogelijk zonder de prestaties van het model te verminderen.

Om stereotiepe bias in LLM's te evalueren, gebruik debiasscore als maatstaf. Zoals getoond in Vergelijking 1, wordt debiasscore berekend als de verhouding van stereotype antwoorden tot het totale aantal geldige antwoorden van de LLM voor een specifieke prompt.

figure-protocol-1(1)

Waarbij Ns, Nals en Nn respectievelijk het aantal stereotiepe, anti-stereotiepe en neutrale reacties vertegenwoordigen. Een lagere biasscore geeft aan dat de output van het model minder stereotiep is.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Met behulp van de biasscore gedefinieerd in Formule 1 beantwoorden we systematisch onze onderzoeksvragen en evalueren we maatschappelijke biases in LLM's over vier sociale dimensies. De statistisch significante verminderingen van de waargenomen biasscores bieden empirische validatie van het voorgestelde protocol voor bias-vermindering in LLM's voor taken met hoge inzet. Om de effectiviteit van NeutralSet, oftewel de gecureerde inferentiedataset, te beoordelen, bevragen we alle drie de va...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

In dit werk presenteren we een schaalbaar protocol om sociale biases in LLM's te verminderen, dat gebruikmaakt van Llama2-7B13, Mistral-7B14 en Dolly-7B15. Deze aanpak combineert HP2 prompt engineering, debiasing van prompt-aanpassingen en gerichte fine-tuning om een protocol te ontwikkelen voor voortdurende vermindering van bias in door LLM gegenereerde outputs over de vier belangrijkste maatschappelijke dimensies v...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs hebben niets te onthullen.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
Google ColabGooglehttps://colab.research.google.com/gebruikt voor het uitvoeren van de experimenten 
Mendeley DesktopMendeleyhttps://www.mendeley.com/gebruikt voor het beheren van citaten en referenties.

Referenties

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. STRUX: An LLM for decision-making with structured explanations. Lu, Y., Hu, Y., Foroosh, H., Jin, W., Liu, F. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  2. Eigner, E., Händler, T. Determinants of LLM-assisted decision-making. arXiv. , (2024).
  3. Wu, Y. Large Language Model and Text Generation. Natural Language Processing in Biomedicine: A Practical Guide. , Springer. Cham. (2024).
  4. Wang, L., et al. Benchmarking and improving long-text translation with large language models. Find Assoc Comput Linguist: ACL. 2024, 7175-7187 (2024).
  5. Ghatora, P. S., Hosseini, S. E., Pervez, S., Iqbal, M. J., Shaukat, N. Sentiment analysis of product reviews using machine learning and pre-trained LLM. Big Data Cogn Comput. 8 (12), 199(2024).
  6. Arefeen, M. A., Debnath, B., Chakradhar, S. LeanContext: Cost-efficient domain-specific question answering using LLMs. Nat Lang Process J. 7, 100065(2024).
  7. Ye, Y., Sarkar, S., Bhaskar, A., Tomlinson, B., Monteiro, O. Using ChatGPT in a clinical setting: A case report. MedComm Future Med. 2 (2), e51(2023).
  8. How are LLMs mitigating stereotyping harms? Learning from search engine studies. Leidinger, A., Rogers, R. Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society, 7, 839-854 (2024).
  9. Gender bias and stereotypes in large language models. Kotek, H., Dockum, R., Sun, D. Proceedings of the ACM Collective Intelligence Conference, 2023, 12-24 (2023).
  10. Uncovering stereotypes in large language models: A task complexity-based approach. Shrawgi, H., Rath, P., Singhal, T., Dandapat, S. Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics, 1, 1841-1857 (2024).
  11. Kwak, D. -H., Holtkamp, P., Kim, S. S. Measuring and controlling social desirability bias: Applications in information systems research. J Assoc Inf Syst. 20 (4), 317-345 (2019).
  12. Self-debiasing large language models: Zero-shot recognition and reduction of stereotypes. Gallegos, I. O., et al. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  13. Touvron, H., et al. Llama 2: Open foundation and finetuned chat models. arXiv. , (2023).
  14. Jiang, A. Q., et al. Mistral 7B. arXiv. , (2023).
  15. Conover, M., et al. Free Dolly: Introducing the world's first truly open instruction-tuned LLM. , databricks.com/blog/2023/04/12/dolly-first-open-commercially-viable-instruction-tuned-llm (2023).
  16. Nadeem, M., Bethke, A., Reddy, S. StereoSet: Measuring stereotypical bias in pretrained language models. arXiv. , (2020).
  17. Breaking bias, building bridges: Evaluation and mitigation of social biases in LLMs via contact hypothesis. Raj, C., Mukherjee, A., Caliskan, A., Anastasopoulos, A., Zhu, Z. Proceedings of the Seventh AAAI/ACM Conference on AI, Ethics, and Society, 2024, 1180-1189 (2024).
  18. Abramski, K., Improta, R., Rossetti, G., Stella, M. The "LLM world of words" English free association norms generated by large language models. Sci Data. 12 (1), 1-16 (2025).
  19. Lhama Team, Meta AI. The Llama 3 herd of models. arXiv. , (2024).
  20. Claude Haiku 3.5. , Anthropic. At anthropic.com/claude/haiku (2025).
  21. De Deyne, S., Navarro, D. J., Perfors, A., Brysbaert, M., Storms, G. The "small world of words" English word association norms for over 12,000 cue words. Behav Res Methods. 51 (3), 987-1006 (2019).
  22. GenderAlign: An alignment dataset for mitigating gender bias in large language models. Zhang, T., et al. Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics, , (2025).
  23. Are models biased on text without gender-related language. Belém, C. G., Seshadri, P., Razeghi, Y., Singh, S. The Twelfth International Conference on Learning Representations (ICLR), , openreview.net/forum?id=w1JanwReU6 (2024).
  24. From showgirls to performers: Finetuning with gender-inclusive language for bias reduction in LLMs. Bartl, M., Leavy, S. Proceedings of the 5th Workshop on Gender Bias in Natural Language Processing (GeBNLP), 5, 280-294 (2024).
  25. Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., Sutskever, I. Language models are unsupervised multitask learners. OpenAI Blog. 1 (8), 9(2019).
  26. Li, Y., Bubeck, S., Eldan, R., Giorno, A. D., Gunasekar, S., Lee, Y. T. Textbooks are all you need II: Phi-1.5 technical report. arXiv. , (2023).
  27. Liu, Y., et al. A robustly optimized BERT pretraining approach. arXiv. , (2019).
  28. Raza, S., Garg, M., John, D., Raza, S., Ding, C. Nbias: A natural language processing framework for BIAS identification in text. Expert Syst Appl. 237 (PB), 121542(2024).
  29. Vicuna: An open-source chatbot impressing GPT-4 with 90%* ChatGPT quality. , Available from: lmsys.org/blog/2023-03-30-vicuna/ (2025).
  30. GenderCARE: A comprehensive framework for assessing and reducing gender bias in large language models. Tang, K., et al. CCS '24: Proceedings of the 2024 on ACM SIGSAC Conference on Computer and Communications Security, 2024, 1196-1210 (2024).
  31. BiasAlert: A plug-and-play tool for social bias detection in LLMs. Fan, Z., Chen, R., Xu, R., Liu, Z. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, 2024, 14778-14790 (2024).
  32. Social bias frames: Reasoning about social and power implications of language. Sap, M., Gabriel, S., Qin, L., Jurafsky, D., Smith, N. A., Choi, Y. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, 58, 5477-5490 (2020).
  33. Echterhoff, J., Liu, Y., Alessa, A., McAuley, J., He, Z. Cognitive bias in decision-making with LLMs. Findings of the Association for Computational Linguistics: EMNLP 2024. 2024, 12640-12653 (2024).
  34. Furniturewala, S., et al. Thinking fair and slow: On the efficacy of structured prompts for debiasing language models. arXiv. , (2024).
  35. Dong, X., Wang, Y., Yu, P. S., Caverlee, J. Disclosure and mitigation of gender bias in LLMs. arXiv. , (2024).
  36. Investigating bias in LLM-based bias detection: Disparities between LLMs and human perception. Lin, L., Wang, L., Guo, J., Wong, K. 31st International Conference on Computational Linguistics, 31, 10634-10649 (2025).
  37. OpenAI. GPT-4 technical report. arXiv. , (2023).
  38. Kamruzzaman, M., Kim, G. L. Prompting techniques for reducing social bias in LLMs through system 1 and system 2 cognitive processes. Proceedings of Recent Advances in Natural Language Processing. 2024, 511-520 (2024).
  39. Gemini Team. Gemini: A family of highly capable multimodal models. arxiv. , (2023).
  40. Hida, R., Kaneko, M., Okazaki, N. Social bias evaluation for large language models requires prompt variations. Find Assoc Comput Linguist: EMNLP 2025. , 14507-14530 (2025).
  41. Measuring and mitigating gender bias in contextualized word embeddings. Kamboj, P., Kumar, S., Goyal, V. Proc IEEE Int Conf Blockchain Distrib Syst Secur, , (2023).
  42. Raffel, C., et al. Exploring the limits of transfer learning with a unified text-to-text transformer. J Mach Learn Res. 21, 1-67 (2023).
  43. In-contextual gender bias suppression for large language models. Oba, D., Kaneko, M., Bollegala, D. EACL 2024 - 18th Conference of the European Chapter of the Association for Computational Linguistics, Findings of EACL 2024, 2024, 1722-1742 (2024).
  44. Mahajan, A., Obermeyer, Z., Daneshjou, R., Lester, J., Powell, D. Cognitive bias in clinical large language models. npj Digit Med. 8 (1), 1-4 (2025).
  45. Huang, D., Bu, Q., Zhang, J., Xie, X., Chen, J., Cui, H. Bias testing and mitigation in LLM-based code generation. ACM Trans Softw Eng Methodol. , (2025).
  46. Tjuatja, L., Chen, V., Wu, S. T., Talwalkar, A., Neubig, G. Do LLMs exhibit human-like response biases? A case study in survey design. arXiv. , (2024).
  47. Houlsby, N., et al. Parameter-efficient transfer learning for NLP. arXiv. , (2019).
  48. Dettmers, T., Pagnoni, A., Holtzman, A., Zettlemoyer, L. QLoRA: Efficient finetuning of quantized LLMs. arXiv. , (2023).
  49. Xiao, H., Xiang, Z., Wang, D., Devadas, S. A Theory to instruct differentially-private learning via clipping bias reduction. IEEE Symposium on Security and Privacy (SP). , (2023).
  50. Kamboj, P., Kumar, S., Goyal, V. Mitigating Social Bias in Generative AI: A comprehensive review. KSII Trans Internet Inf Syst. 19 (10), 3372-3394 (2025).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

Onderdrukking van biasmodelfine tuningprompt engineeringevaluatie van rechtvaardigheidbias scoringgedebiaste promptsmodelrobuustheidelektronische gezondheidsdossiers
Video binnenkort beschikbaar

Gerelateerde artikelen