Article de recherche

Améliorer l’équité dans les grands modèles de langage pour les applications cliniques d’intelligence artificielle grâce à l’ajustement fin et au prompting

DOI :

10.3791/69132

2 janvier 2026

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les grands modèles de langage spécifiques à la santé font face à des défis éthiques et techniques, car, comme d’autres grands modèles de langage, ils reflètent les biais inhérents à leurs données d’entraînement. Le protocole présenté ici vérifie la suppression de quatre types de biais (genre, race, profession, religion) à l’aide de variantes prompt réparties à travers trois modèles open source.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les grands modèles de langage (LLM) sont de plus en plus appliqués à des domaines sensibles tels que les soins médicaux, qui posent de multiples défis techniques et éthiques. Les problèmes les plus immédiats incluent les biais intégrés à ces modèles, qui sont entraînés sur de grands ensembles de données pouvant refléter les préjugés sociétaux. De tels biais peuvent produire des résultats injustes, non généralisables, voire nuisibles, les rendant cliniquement inapplicables dans le monde réel et non conformes aux contraintes éthiques et réglementaires. Nous examinons dans quelle mesure la suppression des biais fonctionne lorsque des modèles affinés sont proposés dans quatre catégories critiques (genre, race, profession et religion). Nous sélectionnons manuellement un ensemble de données d’inférence diversifié et créons douze variantes de prompts — dont six sont debiasées — pour tester les résultats de trois LLM open source : Llama2-7B, Mistral-7B et Dolly-7B. L’équité et l’interprétabilité des résultats sont évaluées à l’aide d’une métrique de notation biaisée, où des scores plus faibles indiquent une meilleure équité et interprétabilité. Nous notons également que les invites débidées réduisent le biais, et que l’ajustement fin du modèle fonctionne encore mieux. Les résultats soulignent l’importance cruciale d’agir en temps voulu, de la robustesse du modèle et d’un contrôle éthique continu pour un déploiement fiable et équitable de LLM dans des contextes réels, tels que l’imagerie médicale et la tenue des dossiers médicaux électroniques (DSE).

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les grands modèles de langage ont une réverbération prodigieuse en tant qu’outils pour soutenir diverses tâches, notamment la prise de décision 1,2, la générationde texte 3,la traduction de texte 4, l’analyse du sentiment client5, la réponse auxquestions 6, et la génération de rapportscliniques 7. Plusieurs cas ont récemment été réalisés où des applications ont utilisé des LLM pour générer du contenu nuisant à des individus ou groupes socialementdéfavorisés 8,9,10. La principale raison de ces réponses platitudineuses est que ces modèles sont entraînés sur des ensembles de données qui contiennent intrinsèquement des biais sociétaux liés à la race, au genre, à la classe socio-économique et à des facteurs similaires. Mais ce que vous entendez par « biais » et « équité » dans un système d’IA de santé peut être subjectif et dépendre du contexte. Les chercheurs ont déployé des efforts considérables pour atténuer les biais sociaux dans les LLM11,12 ; cependant, des améliorations supplémentaires restent nécessaires. Les chercheurs ont proposé plusieurs stratégies d’atténuation des biais, qui peuvent être classées en prétraitement, en traitement, post-traitement, ou combinaisons de ceux-ci, dans un éventail hétérogène d’applications. Cette catégorisation est basée sur le stade auquel la mesure d’atténuation est prise. Ce protocole combine les trois stratégies pour lutter et atténuer les biais sociaux dans six variantes de LLM et étudie la réduction des biais dans quatre dimensions sociales : genre, profession, race et religion. Tout d’abord, un jeu de données d’inférence est développé en utilisant une technique d’augmentation de données pour permettre aux LLM de générer des inférences. Deuxièmement, douze types d’incitations sont conçus pour susciter des réponses stéréotypées chez les LLM. Troisièmement, Llama-2-7B13, Mistral-7B14 et Dolly-7B15 sont affinés sur un jeu de données contenant des phrases impartiales réparties dans les quatre catégories sociales : genre, race, profession et religion, afin d’obtenir Llama-2-7BFinetuné, Mistral-7BFinetuned et Dolly-7BFinetuned, respectivement. Enfin, des inférences sont tirées en incitant les LLM affinés à examiner leur efficacité à fournir des réponses équitables.

Nous avons formulé les questions de recherche suivantes et les avons abordées dans cet article. Pour chaque question de recherche formulée (RQ), une hypothèse nulle (H0) et une hypothèse alternative (H1) ont été formulées.

RQ1 : Les jeux de données d’inférence et les techniques de base d’incitation sont-ils efficaces pour évaluer les biais sociétaux dans les LLM ? Hypothèse nulle (H01) : Les scores de biais dérivés d’un jeu de données d’inférence, combinés à des prompts de base, sont statistiquement indiscernables des scores de biais de base des LLM. Hypothèse alternative (H11) : Les scores de biais issus du jeu de données d’inférence avec des prompts de base sont statistiquement significativement différents des scores de biais de base des LLM. Pour tester l’hypothèse, un jeu de données, NeutralSet, a été sélectionné en modifiant StereoSet16 et en évaluant chaque LLM à l’aide de techniques d’incitation de base afin d’évaluer sa capacité à produire des réponses non stéréotypées. Dans nos contextes, nous incluons six consignes de base — Standard (une invite zéro shot pour instruire le LLM à faire des inférences), Chain-of-Thoughts (CoT est conçu pour demander au LLM de réfléchir étape par étape pour faire des inférences), System1 (Un prompt permettant au LLM de réfléchir rapidement pendant qu’il répond), System2 (Un prompt pour faire réfléchir le LLM lentement et réfléchiment), Human Persona 1 (HP1 est conçu pour faire adopter au LLM l’identité d’un humain qui réfléchit rapidement en prenant des décisions), et Human Persona 2 (HP2 est conçu pour faire adopter le LLM l’identité humaine en réfléchissant lentement et réfléchiment en répondant).

RQ2 : Les techniques de debiasing prompting sont-elles efficaces pour révéler et atténuer les biais sociétaux dans les LLM ? Hypothèse nulle (H0₂) : Les techniques de débidisation des incitations ne sont pas efficaces pour révéler et atténuer les biais sociétaux dans les LLM. Hypothèse alternative (H12) : Les scores de biais mesurés diminuent significativement lorsque les techniques de debiasing prompting sont utilisées dans les LLM. Nous étudions l’impact des variantes debiasées des questions de base sur trois LLM open source afin d’obtenir une génération de texte équitable, sans discrimination sociale.

RQ3 : Peut-on encore réduire les biais sociétaux en affinant les LLM ? Hypothèse nulle (H03) : L’ajustement fin des LLM ne réduit pas davantage les biais sociétaux au-delà des réductions obtenues uniquement par des techniques d’incitation. Hypothèse alternative (H13) : L’ajustement fin des LLM réduit encore les biais sociétaux au-delà des réductions obtenues uniquement par les techniques d’incitation. Pour répondre à cette question, nous modifions le jeu de données17 et ajustons les LLM qui y sont intégrés afin d’évaluer davantage l’impact de l’ajustement fin dans la réduction des réponses stéréotypées.

La figure 1 illustre l’effet de la variation sur le prompt et de l’ajustement fin des LLM sur le résultat prédit neutre en termes de genre. La nouveauté de notre travail vient de l’intégration manuelle de la curation des ensembles de données, de multiples stratégies de débasement des prompts, et de l’ajustement fin sous un seul protocole pour analyser un LLM afin d’identifier et d’atténuer les biais sociétaux, pertinents pour des applications sensibles du monde réel telles que l’imagerie médicale et la maintenance des DSE. Nous avons regroupé la littérature sur le biais dans les LLM en quatre perspectives : ensembles de données pour les biais et les associations cognitives ; des cadres de détection et d’évaluation des biais ; des approches de mitigation des biais ; et les biais dans des domaines spécialisés.

Les chercheurs génèrent continuellement des ensembles de données pour permettre l’évaluation des biais et l’analyse des associations sémantiques dans les LLM. Par exemple, en psychologie cognitive et en linguistique, les associations libres sont toujours essentielles dans l’organisation de la connaissance conceptuelle. En simulant la même association dans la distribution latente des LLM, Abramski et al.18 ont construit un jeu de données, LLM World of Words (LWOW). Le jeu de données de normes d’association libre en anglais de LWOW, comprenant des millions de réponses provenant de trois LLM : Mistral-7B14, Llama-3.1-8B19 et Claude-3-5-haiku-latest20. Il s’inspire de Small World of Words (SWOW)21, le plus grand ensemble de données de normes d’association libre en anglais humain, largement utilisé dans diverses recherches psychologiques et linguistiques. De plus, LWOW aide à construire un réseau cognitif composé de nœuds, chacun représentant un mot, avec des nœuds correspondant à des mots sémantiquement similaires qui sont plus proches les uns des autres dans le réseau. Cela aide à évaluer les biais dans la production des LLM en estimant la distance entre les mots dans le réseau cognitif artificiel comme une métrique clé. Un obstacle majeur à l’utilisation de LLM propriétaires est que leurs composants internes sont inaccessibles. Même si des efforts importants ont été déployés dans ces modèles pour traiter les biais, les ensembles de données d’alignement restent rares. Pour répondre à cette préoccupation, un ensemble de données nommé GenderAlign est proposé dans Zhang et al.22 pour atténuer les biais de genre dans les LLM.UnStereoEval 23, un jeu de données de référence, est proposé pour étudier les biais stéréotypés de genre dans les professions et les émotions. Leurs résultats révèlent un faible niveau d’équité entre 28 LLM différents. Bartl et Leavy24 ont développé un jeu de données, Tiny Heap, dans lequel les phrases comportant des mentions stéréotypées sont remplacées par leurs équivalents neutres et affinées trois modèles de langage (GPT-225, PHI-1.526 et RoBERTa27). Dans leurs résultats, ils observent une réduction significative des tendances stéréotypées de genre des modèles.

Plusieurs cadres multicouches ont été proposés pour identifier et atténuer les biais dans les LLM. Dans Raza et al.28, un cadre, NBIAS, est proposé comprenant quatre couches : création de jeux de données, développement de modèles, atténuation des biais et évaluation. L’ensemble de données du cadre est construit à partir de domaines variés, notamment la santé, les réseaux sociaux et les portails d’emploi. Ils démontrent l’efficacité de leur modèle en surpassant la référence (BERT 29) de 1 % à 8 % par équité. Dans un autre cadre similaire,GenderCARE 30, une stratégie visant à atténuer les biais de genre dans les LLMS est proposée. Dans leur vaste dispositif expérimental, ils ont effectivement réduit les biais de genre d’une moyenne de 35 % sur douze LLM différents. Un cadre, BiasAlet31, détecte automatiquement les biais sociaux dans le texte ouvert généré par les LLM. Elle présente certaines limites : premièrement, l’étude est menée sur un ensemble de données synthétisé en raison de l’indisponibilité d’un benchmark pour évaluer les biais dans la génération de texte ouvert du LLM, et deuxièmement, elle est construite sur le jeu de données désuet SBIC32, ce qui rend difficile la distinction entre la pertinence du biais implicite et le biais dans le jeu de données lui-même. Un biais dans les données générées par l’humain peut être introduit dans les modèles entraînés dessus. L’utilisation de tels modèles est controversée dans les emplois à enjeux élevés, où leur production peut avoir un impact négatif sur les groupes défavorisés. Pour y remédier, un cadre,BiasBuster 33, est conçu pour détecter, évaluer et atténuer les biais cognitifs dans les LLM. Conformément à cela, dans un autreouvrage 34, les chercheurs proposent un cadre interactif pour générer un texte juste, logique et critique à travers des prompts System 2 (conçus pour permettre au LLM de réfléchir lentement) qui complètent des prompts auto-affinés et impliquants. Cependant, le cadre est limité aux tâches situées dans l’espace latent des LLM. Dong et al.35 développent un cadre utilisant le sondage indirect pour atténuer et évaluer les biais de genre dans dix LLM open source. Dans leur méthode d’exploration, sans exploiter les mentions stéréotypées directes, ils révèlent des biais indirects de genre.

Lin et al.36 étudient le biais politique dans la génération de texte par les LLM, tant pour les modèles fermés (GPT-3.5-turbo et GPT-437) que pour les modèles ouverts (Llama-2-7B13, Mistral-7B14, Vicuna29). Ils ont déterminé si le texte généré par le modèle induisait un biais médiatique de gauche ou de droite. De plus, ils ont élaboré une stratégie d’atténuation en affinant le modèle et en fournissant des invites debiasées supplémentaires lors de la génération de texte. Après application de la technique de mitigation des biais, le modèle tend à générer un texte neutre ; Les médias de gauche ou de droite n’influencent pas cela. Dans cette optique, Raj et al.17 ont proposé une solution de débidaising, Social Contact Debiasing (SCD), basée sur l’hypothèse du contact en psychologie, qui inclut la génération de prompts comprenant les idéologies de différents groupes sociaux afin de réduire les préjugés dans la génération de texte de trois LLM open source. Parallèlement, Kamruzzaman et Kim38 ont proposé une technique de débasation sociale qui exploite les incitations de la chaîne de pensée Système 1 et Système 2 pour atténuer sur douze dimensions de biais dans cinq LLM (GPT-3.5, GPT-437, Llama-2-7B13, Mistral-7B14 et Gemini-1.039). Ici, la consigne System 1 vise à faire réagir rapidement le LLM, tandis que la suggestion System 2 vise à l’orienter vers des réponses plus réfléchies et réfléchies. Bien que diverses études aient été menées utilisant l’ingénierie des prompts pour atténuer le biais dans les LLM, peu d’autres n’ont examiné l’impact de la variation des prompts sur la production des LLM. Pour répondre à ce problème, Hida et al.40 ont étudié la sensibilité des sorties des douze LLM open source à la variation incitée et analysé leur impact sur la performance des tâches et les compromis de biais. Leurs résultats révèlent que les résultats de debiasing sont sensibles à l’invite ; Moins de biais dans la sortie des modèles conduit à une performance de tâche moindre. Kamboj et al.41 ont proposé une approche de post-traitement pour atténuer les biais de genre dans les embeddings contextualisés d’un modèle T5 (modèle42 Text-to-Text-Transfer-Transformer). Oba et al.43 fournissent des préambules textuels créés manuellement comme incitations aux LLM pour supprimer leur génération biaisée.

Les biais cognitifs, qui sont une source d’erreur diagnostique dans le secteur de la santé depuis des décennies, risquent d’être intégrés et amplifiés par les grands modèles de langage (LLM) dans la prise de décision clinique. Pour lutter contre ce risque, Mahajan et al.44 proposent que les stratégies d’atténuation pour la mise en œuvre de ces technologies devraient se centrer sur trois thèmes : premièrement, l’auto-réflexion (réévaluation itérative des résultats), deuxièmement, le raisonnement contextuel (intégrant l’historique complet des patients et des lignes directrices fondées sur des preuves), et enfin, les traces de raisonnement transparentes (explications des processus de raisonnement mises à disposition pour audit). Les LLM, grâce à leur capacité omniprésente, sont désormais également largement utilisés pour générer du code de programmation. C’est pourquoi il s’agit d’une préoccupation majeure pour les chercheurs afin d’étudier les effets négatifs de tout biais social dans le code généré. Si un tel biais est détecté, les techniques d’atténuation correspondantes doivent être élaborées. Dans le même ordre d’idées, Huang et al.45 ont proposé une technique d’évaluation et d’atténuation des biais sociaux et l’ont testée sur cinq LLM largement utilisés. Ces derniers temps, nous avons observé d’énormes avancées dans les architectures de LLM et leur capacité à générer des réponses qui semblent humaines. La question de savoir si les LLM peuvent servir de substituts aux humains dans la prise de décision reste peu explorée et mérite des recherches supplémentaires. Dans cette optique, un cadre et un ensemble de données sont élaborés par Tjuatja et al.46 pour étudier la capacité des LLM à fournir des réponses similaires à celles des humains dans un questionnaire d’enquête.

Malgré ces avancées, trois lacunes de recherche persistent. Premièrement, les recherches antérieures ont tendance à se concentrer sur des types étroits de biais (par exemple, genre ou politique) ou des domaines spécifiques (par exemple, un sujet particulier). Deuxièmement, bien que l’ingénierie des prompts soit omniprésente, peu d’études examinent les effets de la variation systématique des prompts sur la production des LLM. Troisièmement, des recherches limitées abordent la débidisation dans le contexte complexe et limité des ressources limitées des LLM open source pertinents pour des domaines critiques tels que la santé. Pour combler ces lacunes, un protocole unique d’atténuation et d’évaluation des biais est présenté pour aider à mesurer les biais stéréotypés à travers différentes architectures de modèles, en intégrant un ajustement fin sous contraintes computationnelles et en évaluant la robustesse des décisions du modèle face aux métriques de biais.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Toutes les expériences sont menées sur la plateforme Google Colab (A100 avec 40 Go de RAM). Pour réaliser des expériences, des clés API (cartes modèles) de Llama2-7B, Mistral-7B et Dolly-7B ont été collectées à partir de Hugging Face.

Le protocole est divisé en trois parties. Tout d’abord, construisez un ensemble de données qui sert de base pour évaluer les biais sociaux dans les LLM. Ensuite, concevons douze variantes distinctes de prompts, alignées sur les travaux réalisés par Kamruzzaman et Kim38 pour étudier la présence de biais social dans les inférences générées par les LLM. Ensuite, ajustez les LLM sur un ensemble de données de phrases impartiales liées à la race, à la religion, au genre et à la profession, puis revenez à nouveau avec les mêmes indications pour étudier l’effet de l’ajustement fin sur les inférences générées. Le cadre proposé est illustré à la Figure 2.

Élaborer un ensemble de données
Le cadre utilise deux ensembles de données. L’un est utilisé pour dériver des inférences, l’autre est appliqué à l’ajustement fin des LLM. Cette étude modifie StereoSet16 pour construire un nouveau jeu de données, NeutralSet, qui sert de base à la génération d’inférences. Les LLM utilisaient le StereoSet pour faire des prédictions sur quatre types de biais : race, religion, genre et profession. StereoSet comprend deux sous-ensembles de données : intra-phrase et inter-phrases. Une instance de NeutralSet est présentée dans le tableau 1. Donnez une phrase du contexte de la colonne en tant que requête au LLM et demandez à remplir le BLANC avec n’importe lequel des mots des colonnes anti-stéréotype, stéréotype ou neutre. Le degré de biais dans le LLM peut être jugé à partir de l’option qu’il choisit. L’inclusion d’une colonne neutre dans NeutralSet le distingue de StereoSet. Le but de l’ajouter au nouveau jeu de données est de réduire la probabilité de sélectionner l’option stéréotype lors de l’inférence LLM. Les mots sont ajoutés dans la colonne neutre selon les étapes mentionnées dans l’Algorithme 1 (Fichier Supplémentaire 1). Où Vs etV as sont respectivement les vecteurs des mots stéréotypés et anti-stéréotypes. Un mot du dictionnaire est alors sélectionné dont le vecteur est le plus proche de Vn, qui est positionné contextuellement entre les vecteurs de mots stéréotype et anti-stéréotype, et ce mot est ajouté à la colonne neutre de la ligne sélectionnée. Le tableau 2 résume le processus de création de NeutralSet. Ensuite, modifiez le jeude données 17pour affiner les LLM. Le jeu de données révisé comprend 25 020 instances, chacune composée d’une requête associée à une réponse socialement impartiale, utilisée pour entraîner les modèles. Les requêtes sont conçues pour traiter les quatre types de biais sociaux.

Incitation aux LLM
Examinez les biais sociaux dans les LLM en fournissant un ensemble d’instructions d’entrée. Tout d’abord, créez douze types d’invites : six de base et six variantes debiase correspondantes. Le contenu de toutes les techniques d’incitation est listé dans le tableau 3. Les propos de cette étude ont suivi un processus cyclique et formalisé de création, d’implémentation, de réflexion et de révision, aboutissant à une série de prompts affinés au fil du temps grâce à un essai-erreur et un affinement significatifs. Cela permettait de couvrir un ensemble diversifié de types de prompts, incluant les prompts de baseline, CoT et les prompts de persona humaine. Les plans de prompts et les notations n’ont pas été validés par des experts externes (par exemple, cliniciens, spécialistes du social ou de l’équité). Le tableau 4 résume différents types de prompts, en mettant en lumière leurs styles de raisonnement, leurs capacités de réduction des biais et les cas d’utilisation appropriés pour guider la sélection appropriée. L’évaluation des LLM dans cet article ne conserve pas les informations passées entre les sessions ou les exécutions. Une chose à clarifier dans le modèle final est que chaque invite doit être exécutée isolément, c’est-à-dire qu’aucun historique de conversation n’est transféré d’une invite à une autre. Cette disposition garantissait que les réponses passées n’affectaient pas les résultats ultérieurs. Pendant la phase d’ajustement fin, modifier uniquement les paramètres du modèle en fonction du jeu de données d’entraînement, comme décrit à la fois dans Parameter-Efficient Transfer Learning (PEFT47) et Quantized Low-Rank Adaptation (QLoRA48). Construis le prompt comme mentionné ci-dessous :

Prompt standard : Il s’agit d’une technique de demande zéro shot dans laquelle le LLM reçoit des instructions avec un minimum d’informations pour faire l’inférence. L’invite est : « Insérez le mot le plus approprié dans le BLANK parmi les choix proposés. » Cela sert de référence pour quantifier et évaluer les biais sociaux dans les six LLM.

Prompt CoT : Le prompt inclut la phrase « Réfléchissez étape par étape et remplissez le VIDE. Choisissez le meilleur choix pour le BLANK parmi les options proposées... ». Dans cette technique d’incitation, le LLM est encouragé à engager son processus cognitif et à réfléchir étape par étape avant de fournir une réponse.

Prompts System1 et System2 : En incluant l’expression « Vous répondez rapidement aux questions... », les consignes System1 guident le LLM pour fournir des réponses rapides et intuitives, de manière similaire à la façon dont la cognition humaine fonctionne dans System1. En revanche, les prompts System2 sont conçus pour susciter des réponses plus réfléchies, détaillées, analytiques et délibérées du LLM en ajoutant la phrase « Vous répondez aux questions de manière complète et délibérée. Vos réponses sont réfléchies et fiables « dans l’enseignement.

Prompts HP1 et HP2 : Les consignes commencent par : « Adoptez l’identité d’une personne qui répond rapidement aux questions et remplissez le BLANC tout en restant strictement conforme à la nature de cette identité... ". Dans la technique d’incitation HP1, le LLM a reçu l’instruction d’adopter l’identité d’un humain qui répond rapidement. Le but de ce cadre est de faire imiter le LLM l’humain dans le processus cognitif System1. En revanche, dans l’invite HP2, le LLM est poussé à adopter une identité humaine qui réfléchit et réfléchit avant de répondre aux questions, obtenant ainsi des résultats plus précis. Le prompt HP2 commence par la phrase : « Adoptez l’identité d’une personne qui répond aux questions de manière réfléchie et délibérée et remplissez le BLANC tout en restant strictement conforme à la nature de cette identité... ». L’idée clé derrière l’inclusion de ces prompts est d’évaluer la capacité d’un LLM à émuler pleinement la cognition humaine.

Variantes de Debias : Une variante de debias est construite en ajoutant une instruction qui ordonne au LLM de prendre la décision de manière neutre, sans préjugé stéréotypé.

Évaluation des LLM
Évaluer six LLM : 1) Llama-2-7B13, utilisant le point de contrôle meta-llama/Llama-2-7b-chat-hf sur Huggingface ; 2) Mistral-7B14, utilisant le point de contrôle mistralai/Mistral-7B-Instruct-v0.3 sur Huggingface ; 3) Dolly-7B15, utilisant les databricks/dolly-v2-7b checkpoint sur Huggingface ; 4) Llama2-7Baffiné, une variante finement réglée du Llama-2-7B ; 5) Miseau point du Mistral-7B, une variante affinée du Mistral-7B ; 6) Dolly-7Baffiné, une variante finement réglée de Dolly-7B.

Effectuez toutes les expériences sur un GPU haute vitesse, comme l’A100 avec 40 Go de mémoire ou plus. Pour l’ajustement fin des LLM, divisez le jeu de données en ensembles d’entraînement, de validation et de test, en utilisant la répartition standard 70 % : 10 % : 20 %. Pour éviter une rééducation complète du modèle, cette étude utilise la configuration PEFT47 pour l’ajustement fin, ce qui fige une part importante des paramètres du modèle et n’ajoute que quelques paramètres spécifiques à chaque tâche. Utilisez la précision 4 bits dans QLoRA48 pour charger le LLM si les ressources de calcul sont limitées. Cela permettra un réglage fin plus rapide sans ralentir les performances du modèle.

Pour évaluer les biais stéréotypés dans les LLM, utilisez lescore de biais comme indicateur. Comme montré dans l’équation 1, lescore de biais est calculé comme le ratio des réponses stéréotypées par rapport au nombre total de réponses valides du LLM pour une consigne spécifique.

figure-protocol-1(1)

Ns, Nas et Nn représentent respectivement le nombre de réponses stéréotypées, anti-stéréotypées et neutres. Un score de biais plus faible indique que la sortie du modèle est moins stéréotypée.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

En utilisant le score de biais défini dans l’Équation 1, nous répondons systématiquement à nos questions de recherche et évaluons les biais sociétaux dans les LLM à travers quatre dimensions sociales. Les réductions statistiquement significatives des scores de biais observées fournissent une validation empirique du protocole proposé pour la réduction des biais dans les LLM pour des tâches à enjeux élevés. Pour évaluer l’efficacité de NeutralSet, c’est-à-dire le jeu de données d’inférence...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dans ce travail, nous présentons un protocole évolutif pour réduire les biais sociaux dans les LLM qui exploite Llama2-7B13, Mistral-7B14 et Dolly-7B15. Cette approche combine l’ingénierie des prompts HP2, les modifications de prompts de debiasing et un ajustement fin ciblé pour développer un protocole permettant de réduire progressivement les biais dans les résultats générés par les LLM à travers les quatre grandes ...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs n’ont rien à divulguer.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Google ColabGooglehttps://colab.research.google.com/utilisé pour mener les expériences   ;
Ordinateur de bureau MendeleyMendeleyhttps://www.mendeley.com/Utilisé pour gérer les citations et références.

Références

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. STRUX: An LLM for decision-making with structured explanations. Lu, Y., Hu, Y., Foroosh, H., Jin, W., Liu, F. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  2. Eigner, E., Händler, T. Determinants of LLM-assisted decision-making. arXiv. , (2024).
  3. Wu, Y. Large Language Model and Text Generation. Natural Language Processing in Biomedicine: A Practical Guide. , Springer. Cham. (2024).
  4. Wang, L., et al. Benchmarking and improving long-text translation with large language models. Find Assoc Comput Linguist: ACL. 2024, 7175-7187 (2024).
  5. Ghatora, P. S., Hosseini, S. E., Pervez, S., Iqbal, M. J., Shaukat, N. Sentiment analysis of product reviews using machine learning and pre-trained LLM. Big Data Cogn Comput. 8 (12), 199(2024).
  6. Arefeen, M. A., Debnath, B., Chakradhar, S. LeanContext: Cost-efficient domain-specific question answering using LLMs. Nat Lang Process J. 7, 100065(2024).
  7. Ye, Y., Sarkar, S., Bhaskar, A., Tomlinson, B., Monteiro, O. Using ChatGPT in a clinical setting: A case report. MedComm Future Med. 2 (2), e51(2023).
  8. How are LLMs mitigating stereotyping harms? Learning from search engine studies. Leidinger, A., Rogers, R. Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society, 7, 839-854 (2024).
  9. Gender bias and stereotypes in large language models. Kotek, H., Dockum, R., Sun, D. Proceedings of the ACM Collective Intelligence Conference, 2023, 12-24 (2023).
  10. Uncovering stereotypes in large language models: A task complexity-based approach. Shrawgi, H., Rath, P., Singhal, T., Dandapat, S. Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics, 1, 1841-1857 (2024).
  11. Kwak, D. -H., Holtkamp, P., Kim, S. S. Measuring and controlling social desirability bias: Applications in information systems research. J Assoc Inf Syst. 20 (4), 317-345 (2019).
  12. Self-debiasing large language models: Zero-shot recognition and reduction of stereotypes. Gallegos, I. O., et al. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  13. Touvron, H., et al. Llama 2: Open foundation and finetuned chat models. arXiv. , (2023).
  14. Jiang, A. Q., et al. Mistral 7B. arXiv. , (2023).
  15. Conover, M., et al. Free Dolly: Introducing the world's first truly open instruction-tuned LLM. , databricks.com/blog/2023/04/12/dolly-first-open-commercially-viable-instruction-tuned-llm (2023).
  16. Nadeem, M., Bethke, A., Reddy, S. StereoSet: Measuring stereotypical bias in pretrained language models. arXiv. , (2020).
  17. Breaking bias, building bridges: Evaluation and mitigation of social biases in LLMs via contact hypothesis. Raj, C., Mukherjee, A., Caliskan, A., Anastasopoulos, A., Zhu, Z. Proceedings of the Seventh AAAI/ACM Conference on AI, Ethics, and Society, 2024, 1180-1189 (2024).
  18. Abramski, K., Improta, R., Rossetti, G., Stella, M. The "LLM world of words" English free association norms generated by large language models. Sci Data. 12 (1), 1-16 (2025).
  19. Lhama Team, Meta AI. The Llama 3 herd of models. arXiv. , (2024).
  20. Claude Haiku 3.5. , Anthropic. At anthropic.com/claude/haiku (2025).
  21. De Deyne, S., Navarro, D. J., Perfors, A., Brysbaert, M., Storms, G. The "small world of words" English word association norms for over 12,000 cue words. Behav Res Methods. 51 (3), 987-1006 (2019).
  22. GenderAlign: An alignment dataset for mitigating gender bias in large language models. Zhang, T., et al. Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics, , (2025).
  23. Are models biased on text without gender-related language. Belém, C. G., Seshadri, P., Razeghi, Y., Singh, S. The Twelfth International Conference on Learning Representations (ICLR), , openreview.net/forum?id=w1JanwReU6 (2024).
  24. From showgirls to performers: Finetuning with gender-inclusive language for bias reduction in LLMs. Bartl, M., Leavy, S. Proceedings of the 5th Workshop on Gender Bias in Natural Language Processing (GeBNLP), 5, 280-294 (2024).
  25. Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., Sutskever, I. Language models are unsupervised multitask learners. OpenAI Blog. 1 (8), 9(2019).
  26. Li, Y., Bubeck, S., Eldan, R., Giorno, A. D., Gunasekar, S., Lee, Y. T. Textbooks are all you need II: Phi-1.5 technical report. arXiv. , (2023).
  27. Liu, Y., et al. A robustly optimized BERT pretraining approach. arXiv. , (2019).
  28. Raza, S., Garg, M., John, D., Raza, S., Ding, C. Nbias: A natural language processing framework for BIAS identification in text. Expert Syst Appl. 237 (PB), 121542(2024).
  29. Vicuna: An open-source chatbot impressing GPT-4 with 90%* ChatGPT quality. , Available from: lmsys.org/blog/2023-03-30-vicuna/ (2025).
  30. GenderCARE: A comprehensive framework for assessing and reducing gender bias in large language models. Tang, K., et al. CCS '24: Proceedings of the 2024 on ACM SIGSAC Conference on Computer and Communications Security, 2024, 1196-1210 (2024).
  31. BiasAlert: A plug-and-play tool for social bias detection in LLMs. Fan, Z., Chen, R., Xu, R., Liu, Z. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, 2024, 14778-14790 (2024).
  32. Social bias frames: Reasoning about social and power implications of language. Sap, M., Gabriel, S., Qin, L., Jurafsky, D., Smith, N. A., Choi, Y. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, 58, 5477-5490 (2020).
  33. Echterhoff, J., Liu, Y., Alessa, A., McAuley, J., He, Z. Cognitive bias in decision-making with LLMs. Findings of the Association for Computational Linguistics: EMNLP 2024. 2024, 12640-12653 (2024).
  34. Furniturewala, S., et al. Thinking fair and slow: On the efficacy of structured prompts for debiasing language models. arXiv. , (2024).
  35. Dong, X., Wang, Y., Yu, P. S., Caverlee, J. Disclosure and mitigation of gender bias in LLMs. arXiv. , (2024).
  36. Investigating bias in LLM-based bias detection: Disparities between LLMs and human perception. Lin, L., Wang, L., Guo, J., Wong, K. 31st International Conference on Computational Linguistics, 31, 10634-10649 (2025).
  37. OpenAI. GPT-4 technical report. arXiv. , (2023).
  38. Kamruzzaman, M., Kim, G. L. Prompting techniques for reducing social bias in LLMs through system 1 and system 2 cognitive processes. Proceedings of Recent Advances in Natural Language Processing. 2024, 511-520 (2024).
  39. Gemini Team. Gemini: A family of highly capable multimodal models. arxiv. , (2023).
  40. Hida, R., Kaneko, M., Okazaki, N. Social bias evaluation for large language models requires prompt variations. Find Assoc Comput Linguist: EMNLP 2025. , 14507-14530 (2025).
  41. Measuring and mitigating gender bias in contextualized word embeddings. Kamboj, P., Kumar, S., Goyal, V. Proc IEEE Int Conf Blockchain Distrib Syst Secur, , (2023).
  42. Raffel, C., et al. Exploring the limits of transfer learning with a unified text-to-text transformer. J Mach Learn Res. 21, 1-67 (2023).
  43. In-contextual gender bias suppression for large language models. Oba, D., Kaneko, M., Bollegala, D. EACL 2024 - 18th Conference of the European Chapter of the Association for Computational Linguistics, Findings of EACL 2024, 2024, 1722-1742 (2024).
  44. Mahajan, A., Obermeyer, Z., Daneshjou, R., Lester, J., Powell, D. Cognitive bias in clinical large language models. npj Digit Med. 8 (1), 1-4 (2025).
  45. Huang, D., Bu, Q., Zhang, J., Xie, X., Chen, J., Cui, H. Bias testing and mitigation in LLM-based code generation. ACM Trans Softw Eng Methodol. , (2025).
  46. Tjuatja, L., Chen, V., Wu, S. T., Talwalkar, A., Neubig, G. Do LLMs exhibit human-like response biases? A case study in survey design. arXiv. , (2024).
  47. Houlsby, N., et al. Parameter-efficient transfer learning for NLP. arXiv. , (2019).
  48. Dettmers, T., Pagnoni, A., Holtzman, A., Zettlemoyer, L. QLoRA: Efficient finetuning of quantized LLMs. arXiv. , (2023).
  49. Xiao, H., Xiang, Z., Wang, D., Devadas, S. A Theory to instruct differentially-private learning via clipping bias reduction. IEEE Symposium on Security and Privacy (SP). , (2023).
  50. Kamboj, P., Kumar, S., Goyal, V. Mitigating Social Bias in Generative AI: A comprehensive review. KSII Trans Internet Inf Syst. 19 (10), 3372-3394 (2025).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Suppression des biaisAjustement fin du mod leIng nierie des invitesvaluation de l quitNotation des biaisInvites d biais esRobustesse du mod leDossiers sant lectroniques
Vidéo bientôt disponible

Articles connexes