$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Les grands modèles de langage ont une réverbération prodigieuse en tant qu’outils pour soutenir diverses tâches, notamment la prise de décision 1,2, la générationde texte 3,la traduction de texte 4, l’analyse du sentiment client5, la réponse auxquestions 6, et la génération de rapportscliniques 7. Plusieurs cas ont récemment été réalisés où des applications ont utilisé des LLM pour générer du contenu nuisant à des individus ou groupes socialementdéfavorisés 8,9,10. La principale raison de ces réponses platitudineuses est que ces modèles sont entraînés sur des ensembles de données qui contiennent intrinsèquement des biais sociétaux liés à la race, au genre, à la classe socio-économique et à des facteurs similaires. Mais ce que vous entendez par « biais » et « équité » dans un système d’IA de santé peut être subjectif et dépendre du contexte. Les chercheurs ont déployé des efforts considérables pour atténuer les biais sociaux dans les LLM11,12 ; cependant, des améliorations supplémentaires restent nécessaires. Les chercheurs ont proposé plusieurs stratégies d’atténuation des biais, qui peuvent être classées en prétraitement, en traitement, post-traitement, ou combinaisons de ceux-ci, dans un éventail hétérogène d’applications. Cette catégorisation est basée sur le stade auquel la mesure d’atténuation est prise. Ce protocole combine les trois stratégies pour lutter et atténuer les biais sociaux dans six variantes de LLM et étudie la réduction des biais dans quatre dimensions sociales : genre, profession, race et religion. Tout d’abord, un jeu de données d’inférence est développé en utilisant une technique d’augmentation de données pour permettre aux LLM de générer des inférences. Deuxièmement, douze types d’incitations sont conçus pour susciter des réponses stéréotypées chez les LLM. Troisièmement, Llama-2-7B13, Mistral-7B14 et Dolly-7B15 sont affinés sur un jeu de données contenant des phrases impartiales réparties dans les quatre catégories sociales : genre, race, profession et religion, afin d’obtenir Llama-2-7BFinetuné, Mistral-7BFinetuned et Dolly-7BFinetuned, respectivement. Enfin, des inférences sont tirées en incitant les LLM affinés à examiner leur efficacité à fournir des réponses équitables.
Nous avons formulé les questions de recherche suivantes et les avons abordées dans cet article. Pour chaque question de recherche formulée (RQ), une hypothèse nulle (H0) et une hypothèse alternative (H1) ont été formulées.
RQ1 : Les jeux de données d’inférence et les techniques de base d’incitation sont-ils efficaces pour évaluer les biais sociétaux dans les LLM ? Hypothèse nulle (H01) : Les scores de biais dérivés d’un jeu de données d’inférence, combinés à des prompts de base, sont statistiquement indiscernables des scores de biais de base des LLM. Hypothèse alternative (H11) : Les scores de biais issus du jeu de données d’inférence avec des prompts de base sont statistiquement significativement différents des scores de biais de base des LLM. Pour tester l’hypothèse, un jeu de données, NeutralSet, a été sélectionné en modifiant StereoSet16 et en évaluant chaque LLM à l’aide de techniques d’incitation de base afin d’évaluer sa capacité à produire des réponses non stéréotypées. Dans nos contextes, nous incluons six consignes de base — Standard (une invite zéro shot pour instruire le LLM à faire des inférences), Chain-of-Thoughts (CoT est conçu pour demander au LLM de réfléchir étape par étape pour faire des inférences), System1 (Un prompt permettant au LLM de réfléchir rapidement pendant qu’il répond), System2 (Un prompt pour faire réfléchir le LLM lentement et réfléchiment), Human Persona 1 (HP1 est conçu pour faire adopter au LLM l’identité d’un humain qui réfléchit rapidement en prenant des décisions), et Human Persona 2 (HP2 est conçu pour faire adopter le LLM l’identité humaine en réfléchissant lentement et réfléchiment en répondant).
RQ2 : Les techniques de debiasing prompting sont-elles efficaces pour révéler et atténuer les biais sociétaux dans les LLM ? Hypothèse nulle (H0₂) : Les techniques de débidisation des incitations ne sont pas efficaces pour révéler et atténuer les biais sociétaux dans les LLM. Hypothèse alternative (H12) : Les scores de biais mesurés diminuent significativement lorsque les techniques de debiasing prompting sont utilisées dans les LLM. Nous étudions l’impact des variantes debiasées des questions de base sur trois LLM open source afin d’obtenir une génération de texte équitable, sans discrimination sociale.
RQ3 : Peut-on encore réduire les biais sociétaux en affinant les LLM ? Hypothèse nulle (H03) : L’ajustement fin des LLM ne réduit pas davantage les biais sociétaux au-delà des réductions obtenues uniquement par des techniques d’incitation. Hypothèse alternative (H13) : L’ajustement fin des LLM réduit encore les biais sociétaux au-delà des réductions obtenues uniquement par les techniques d’incitation. Pour répondre à cette question, nous modifions le jeu de données17 et ajustons les LLM qui y sont intégrés afin d’évaluer davantage l’impact de l’ajustement fin dans la réduction des réponses stéréotypées.
La figure 1 illustre l’effet de la variation sur le prompt et de l’ajustement fin des LLM sur le résultat prédit neutre en termes de genre. La nouveauté de notre travail vient de l’intégration manuelle de la curation des ensembles de données, de multiples stratégies de débasement des prompts, et de l’ajustement fin sous un seul protocole pour analyser un LLM afin d’identifier et d’atténuer les biais sociétaux, pertinents pour des applications sensibles du monde réel telles que l’imagerie médicale et la maintenance des DSE. Nous avons regroupé la littérature sur le biais dans les LLM en quatre perspectives : ensembles de données pour les biais et les associations cognitives ; des cadres de détection et d’évaluation des biais ; des approches de mitigation des biais ; et les biais dans des domaines spécialisés.
Les chercheurs génèrent continuellement des ensembles de données pour permettre l’évaluation des biais et l’analyse des associations sémantiques dans les LLM. Par exemple, en psychologie cognitive et en linguistique, les associations libres sont toujours essentielles dans l’organisation de la connaissance conceptuelle. En simulant la même association dans la distribution latente des LLM, Abramski et al.18 ont construit un jeu de données, LLM World of Words (LWOW). Le jeu de données de normes d’association libre en anglais de LWOW, comprenant des millions de réponses provenant de trois LLM : Mistral-7B14, Llama-3.1-8B19 et Claude-3-5-haiku-latest20. Il s’inspire de Small World of Words (SWOW)21, le plus grand ensemble de données de normes d’association libre en anglais humain, largement utilisé dans diverses recherches psychologiques et linguistiques. De plus, LWOW aide à construire un réseau cognitif composé de nœuds, chacun représentant un mot, avec des nœuds correspondant à des mots sémantiquement similaires qui sont plus proches les uns des autres dans le réseau. Cela aide à évaluer les biais dans la production des LLM en estimant la distance entre les mots dans le réseau cognitif artificiel comme une métrique clé. Un obstacle majeur à l’utilisation de LLM propriétaires est que leurs composants internes sont inaccessibles. Même si des efforts importants ont été déployés dans ces modèles pour traiter les biais, les ensembles de données d’alignement restent rares. Pour répondre à cette préoccupation, un ensemble de données nommé GenderAlign est proposé dans Zhang et al.22 pour atténuer les biais de genre dans les LLM.UnStereoEval 23, un jeu de données de référence, est proposé pour étudier les biais stéréotypés de genre dans les professions et les émotions. Leurs résultats révèlent un faible niveau d’équité entre 28 LLM différents. Bartl et Leavy24 ont développé un jeu de données, Tiny Heap, dans lequel les phrases comportant des mentions stéréotypées sont remplacées par leurs équivalents neutres et affinées trois modèles de langage (GPT-225, PHI-1.526 et RoBERTa27). Dans leurs résultats, ils observent une réduction significative des tendances stéréotypées de genre des modèles.
Plusieurs cadres multicouches ont été proposés pour identifier et atténuer les biais dans les LLM. Dans Raza et al.28, un cadre, NBIAS, est proposé comprenant quatre couches : création de jeux de données, développement de modèles, atténuation des biais et évaluation. L’ensemble de données du cadre est construit à partir de domaines variés, notamment la santé, les réseaux sociaux et les portails d’emploi. Ils démontrent l’efficacité de leur modèle en surpassant la référence (BERT 29) de 1 % à 8 % par équité. Dans un autre cadre similaire,GenderCARE 30, une stratégie visant à atténuer les biais de genre dans les LLMS est proposée. Dans leur vaste dispositif expérimental, ils ont effectivement réduit les biais de genre d’une moyenne de 35 % sur douze LLM différents. Un cadre, BiasAlet31, détecte automatiquement les biais sociaux dans le texte ouvert généré par les LLM. Elle présente certaines limites : premièrement, l’étude est menée sur un ensemble de données synthétisé en raison de l’indisponibilité d’un benchmark pour évaluer les biais dans la génération de texte ouvert du LLM, et deuxièmement, elle est construite sur le jeu de données désuet SBIC32, ce qui rend difficile la distinction entre la pertinence du biais implicite et le biais dans le jeu de données lui-même. Un biais dans les données générées par l’humain peut être introduit dans les modèles entraînés dessus. L’utilisation de tels modèles est controversée dans les emplois à enjeux élevés, où leur production peut avoir un impact négatif sur les groupes défavorisés. Pour y remédier, un cadre,BiasBuster 33, est conçu pour détecter, évaluer et atténuer les biais cognitifs dans les LLM. Conformément à cela, dans un autreouvrage 34, les chercheurs proposent un cadre interactif pour générer un texte juste, logique et critique à travers des prompts System 2 (conçus pour permettre au LLM de réfléchir lentement) qui complètent des prompts auto-affinés et impliquants. Cependant, le cadre est limité aux tâches situées dans l’espace latent des LLM. Dong et al.35 développent un cadre utilisant le sondage indirect pour atténuer et évaluer les biais de genre dans dix LLM open source. Dans leur méthode d’exploration, sans exploiter les mentions stéréotypées directes, ils révèlent des biais indirects de genre.
Lin et al.36 étudient le biais politique dans la génération de texte par les LLM, tant pour les modèles fermés (GPT-3.5-turbo et GPT-437) que pour les modèles ouverts (Llama-2-7B13, Mistral-7B14, Vicuna29). Ils ont déterminé si le texte généré par le modèle induisait un biais médiatique de gauche ou de droite. De plus, ils ont élaboré une stratégie d’atténuation en affinant le modèle et en fournissant des invites debiasées supplémentaires lors de la génération de texte. Après application de la technique de mitigation des biais, le modèle tend à générer un texte neutre ; Les médias de gauche ou de droite n’influencent pas cela. Dans cette optique, Raj et al.17 ont proposé une solution de débidaising, Social Contact Debiasing (SCD), basée sur l’hypothèse du contact en psychologie, qui inclut la génération de prompts comprenant les idéologies de différents groupes sociaux afin de réduire les préjugés dans la génération de texte de trois LLM open source. Parallèlement, Kamruzzaman et Kim38 ont proposé une technique de débasation sociale qui exploite les incitations de la chaîne de pensée Système 1 et Système 2 pour atténuer sur douze dimensions de biais dans cinq LLM (GPT-3.5, GPT-437, Llama-2-7B13, Mistral-7B14 et Gemini-1.039). Ici, la consigne System 1 vise à faire réagir rapidement le LLM, tandis que la suggestion System 2 vise à l’orienter vers des réponses plus réfléchies et réfléchies. Bien que diverses études aient été menées utilisant l’ingénierie des prompts pour atténuer le biais dans les LLM, peu d’autres n’ont examiné l’impact de la variation des prompts sur la production des LLM. Pour répondre à ce problème, Hida et al.40 ont étudié la sensibilité des sorties des douze LLM open source à la variation incitée et analysé leur impact sur la performance des tâches et les compromis de biais. Leurs résultats révèlent que les résultats de debiasing sont sensibles à l’invite ; Moins de biais dans la sortie des modèles conduit à une performance de tâche moindre. Kamboj et al.41 ont proposé une approche de post-traitement pour atténuer les biais de genre dans les embeddings contextualisés d’un modèle T5 (modèle42 Text-to-Text-Transfer-Transformer). Oba et al.43 fournissent des préambules textuels créés manuellement comme incitations aux LLM pour supprimer leur génération biaisée.
Les biais cognitifs, qui sont une source d’erreur diagnostique dans le secteur de la santé depuis des décennies, risquent d’être intégrés et amplifiés par les grands modèles de langage (LLM) dans la prise de décision clinique. Pour lutter contre ce risque, Mahajan et al.44 proposent que les stratégies d’atténuation pour la mise en œuvre de ces technologies devraient se centrer sur trois thèmes : premièrement, l’auto-réflexion (réévaluation itérative des résultats), deuxièmement, le raisonnement contextuel (intégrant l’historique complet des patients et des lignes directrices fondées sur des preuves), et enfin, les traces de raisonnement transparentes (explications des processus de raisonnement mises à disposition pour audit). Les LLM, grâce à leur capacité omniprésente, sont désormais également largement utilisés pour générer du code de programmation. C’est pourquoi il s’agit d’une préoccupation majeure pour les chercheurs afin d’étudier les effets négatifs de tout biais social dans le code généré. Si un tel biais est détecté, les techniques d’atténuation correspondantes doivent être élaborées. Dans le même ordre d’idées, Huang et al.45 ont proposé une technique d’évaluation et d’atténuation des biais sociaux et l’ont testée sur cinq LLM largement utilisés. Ces derniers temps, nous avons observé d’énormes avancées dans les architectures de LLM et leur capacité à générer des réponses qui semblent humaines. La question de savoir si les LLM peuvent servir de substituts aux humains dans la prise de décision reste peu explorée et mérite des recherches supplémentaires. Dans cette optique, un cadre et un ensemble de données sont élaborés par Tjuatja et al.46 pour étudier la capacité des LLM à fournir des réponses similaires à celles des humains dans un questionnaire d’enquête.
Malgré ces avancées, trois lacunes de recherche persistent. Premièrement, les recherches antérieures ont tendance à se concentrer sur des types étroits de biais (par exemple, genre ou politique) ou des domaines spécifiques (par exemple, un sujet particulier). Deuxièmement, bien que l’ingénierie des prompts soit omniprésente, peu d’études examinent les effets de la variation systématique des prompts sur la production des LLM. Troisièmement, des recherches limitées abordent la débidisation dans le contexte complexe et limité des ressources limitées des LLM open source pertinents pour des domaines critiques tels que la santé. Pour combler ces lacunes, un protocole unique d’atténuation et d’évaluation des biais est présenté pour aider à mesurer les biais stéréotypés à travers différentes architectures de modèles, en intégrant un ajustement fin sous contraintes computationnelles et en évaluant la robustesse des décisions du modèle face aux métriques de biais.