$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Grandes Modelos de Linguagem têm uma enorme repercusão como ferramentas para apoiar tarefas diversas, incluindo tomada de decisão 1,2, geraçãode texto 3,tradução de texto 4, análise de sentimentodo cliente 5, respostaa perguntas 6 e geração de relatóriosclínicos 7. Vários casos ocorreram recentemente em que aplicativos usaram LLMs para gerar conteúdo que prejudica indivíduos ou grupos socialmentedesfavorecidos 8,9,10. A principal razão por trás dessas respostas banalidades é que esses modelos são treinados com conjuntos de dados que contêm inerentemente vieses sociais associados a raça, gênero, classe socioeconômica e fatores similares. Mas o que você quer dizer com "viés" e "justiça" em um sistema de IA em saúde pode ser subjetivo e depender do contexto. Pesquisadores têm feito considerável esforço para mitigar vieses sociais nosLLMs 11,12; No entanto, ainda são necessárias melhorias adicionais. Os pesquisadores propuseram múltiplas estratégias de mitigação de vieses, que podem ser classificadas como pré-processamento, in-processing, pós-processamento ou combinações dessas, em uma gama heterogênea de aplicações. Essa categorização é baseada no estágio em que a medida de mitigação é tomada. Esse protocolo combina as três estratégias para combater e aliviar o viés social em seis variantes de LLMs e investiga a redução de viés em quatro dimensões sociais: Gênero, Profissão, Raça e Religião. Primeiro, um conjunto de dados de inferência é desenvolvido usando uma técnica de aumento de dados para permitir que LLMs gerem inferências. Segundo, doze tipos de prompts são projetados para provocar respostas estereotipadas dos LLMs. Terceiro, Llama-2-7B13, Mistral-7B14 e Dolly-7B15 são ajustados em um conjunto de dados contendo frases imparciais nas quatro categorias sociais: gênero, raça, profissão e religião, para obter Llama-2-7BFinetuned, Mistral-7BFinetuned e Dolly-7BFinetuned, respectivamente. Por fim, inferências são feitas ao incentivar os LLMs finamente ajustados a investigar sua eficácia em dar respostas justas.
Formulamos as seguintes questões de pesquisa e as abordamos neste artigo. Para cada questão de pesquisa formulada (CR), foram formuladas uma hipótese nula (H0) e uma hipótese alternativa (H1).
RQ1: O conjunto de dados de inferência e as técnicas básicas de prompting são eficazes na avaliação dos vieses sociais em LLMs? Hipótese nula (H01): As pontuações de viés derivadas de um conjunto de dados de inferência, quando combinadas com prompts básicos, são estatisticamente indistinguíveis das pontuações de viés de referência dos LLMs. Hipótese alternativa (H11): As pontuações de viés do conjunto de dados de inferência com prompts básicos são estatisticamente significativamente diferentes das pontuações de viés de base dos LLMs. Para testar a hipótese, um conjunto de dados, NeutralSet, foi curado modificando o StereoSet16 e avaliando cada LLM usando técnicas básicas de prompting para avaliar sua capacidade de produzir respostas não estereotipadas. Em nossos cenários, incluímos seis prompts básicos — Standard (um prompt zero-shot para instruir o LLM a fazer inferências), Chain-of-Thoughts (CoT é projetado para pedir ao LLM que pense passo a passo para fazer inferências), System1 (Um prompt para deixar o LLM pensar rapidamente enquanto responde), System2 (um prompt para fazer o LLM pensar devagar e de forma reflexiva), Human Persona 1 (HP1 foi projetado para fazer o LLM adotar a identidade de um humano que pensa rápido ao tomar decisões), e Human Persona 2 (HP2 foi criado para fazer o LLM adotar a identidade humana, que pensa devagar e de forma reflexiva ao responder).
RQ2: As técnicas de prompting de debiasing são eficazes para revelar e mitigar vieses sociais em LLMs? Hipótese nula (H0₂): Técnicas de prompting de debiasing não são eficazes para revelar e mitigar vieses sociais em LLMs. Hipótese alternativa (H12): As pontuações de viés medidas diminuem significativamente quando técnicas de prompting de debiasing são usadas em LLMs. Investigamos o impacto de variantes debiase dos prompts básicos em três LLMs de código aberto para alcançar uma geração de texto justa, livre de qualquer discriminação social.
RQ3: Os vieses sociais podem ser ainda mais reduzidos com o ajuste fino dos LLMs? Hipótese nula (H03): O ajuste fino dos LLMs não reduz ainda mais os vieses sociais além das reduções alcançadas apenas por técnicas de prompting. Hipótese alternativa (H13): O ajuste fino dos LLMs reduz ainda mais os vieses sociais além das reduções alcançadas apenas por técnicas de prompting. Para responder a essa pergunta, modificamos o conjunto de dados17 e ajustamos os LLMs nele para avaliar melhor o impacto do ajuste fino na redução das respostas estereotípicas.
A Figura 1 ilustra o efeito da variação no prompt e do ajuste fino do LLM no resultado previsto neutro em relação ao gênero. A novidade do nosso trabalho vem da integração da curadoria manual de conjuntos de dados, múltiplas estratégias de prompts de debiasing e ajustes finos sob um único protocolo para analisar um LLM para identificação e alívio de vieses sociais, relevantes para aplicações sensíveis do mundo real, como imagens médicas e manutenção de EHR. Agrupamos a literatura sobre viés em LLMs em quatro perspectivas: conjuntos de dados para viés e associações cognitivas; estruturas de detecção e avaliação de vieses; abordagens de mitigação de vieses; e viés em domínios especializados.
Pesquisadores estão continuamente gerando conjuntos de dados para possibilitar a avaliação de viés e a análise de associação semântica em LLMs. Por exemplo, em psicologia cognitiva e linguística, associações livres são sempre fundamentais na organização do conhecimento conceitual. Simulando a mesma associação na distribuição latente dos LLMs, Abramski et al.18 construíram um conjunto de dados, LLM World of Words (LWOW). O conjunto de dados de normas de associação livre em inglês do LWOW, que compreende milhões de respostas de três LLMs: Mistral-7B14, Llama-3.1-8B19 e Claude-3-5-haiku-latest20. Ele é inspirado no Small World of Words (SWOW)21, o maior conjunto de dados de normas de associação livre em inglês humano, amplamente empregado em diversas investigações psicológicas e linguísticas. Além disso, o LWOW ajuda a construir uma rede cognitiva composta por nós, cada um representando uma palavra, com nós correspondentes a palavras semanticamente semelhantes que estão mais próximas umas das outras na rede. Isso ajuda a avaliar o viés na produção dos LLMs ao estimar a distância entre palavras na rede cognitiva artificial como métrica chave. Um grande obstáculo no uso de LLMs proprietários é que seus internos são inacessíveis. Embora esforços significativos tenham sido feitos nesses modelos para combater o viés, os conjuntos de dados de alinhamento ainda são escassos. Para abordar essa preocupação, um conjunto de dados chamado GenderAlign é proposto em Zhang et al.22 para mitigar o viés de gênero nos LLMs.UnStereoEval 23, um conjunto de dados de referência, é proposto para investigar o viés de gênero estereotipado em ocupações e emoções. Seus achados revelam um baixo nível de justiça em 28 LLMs diferentes. Bartl e Leavy24 desenvolveram um conjunto de dados, Tiny Heap, no qual frases com menções estereotipadas são substituídas por seus equivalentes neutros e ajustados três modelos linguísticos (GPT-225, PHI-1.526 e RoBERTa27). Em suas descobertas, observam uma redução significativa nas tendências estereotipadas de gênero dos modelos.
Vários frameworks multilayer foram propostos para identificar e aliviar vieses em LLMs. Em Raza et al.28, é proposto um framework, o NBIAS, que compreende quatro camadas: criação de conjuntos de dados, desenvolvimento de modelos, mitigação de vieses e avaliação. O conjunto de dados dentro do framework é construído a partir de diversos domínios, incluindo saúde, mídias sociais e portais de emprego. Eles demonstram a eficácia do modelo ao superar a linha de base (BERT 29) em 1% a 8%, para ser justo. Em outro marco semelhante, oGenderCARE 30, é proposta uma estratégia para mitigar o viés de gênero no LLMS. Em sua extensa configuração experimental, reduziram efetivamente o viés de gênero em uma média de 35% em doze LLMs diferentes. Um framework, BiasAlet31, detecta automaticamente viés social no texto aberto gerado pelos LLMs. Ele tem algumas limitações: primeiro, o estudo é conduzido com um conjunto de dados sintetizado devido à indisponibilidade de um benchmark para avaliar o viés na geração de texto aberto do LLM, e segundo, é construído sobre o antiquado conjunto de dados SBIC32, o que dificulta distinguir entre a relevância do viés implícito e o viés no próprio conjunto de dados. O viés em dados gerados por humanos pode ser introduzido em modelos treinados nele. O uso desses modelos é controverso em empregos de alto risco, onde sua produção pode impactar negativamente grupos desfavorecidos. Para enfrentar isso, um framework,BiasBuster 33, foi desenvolvido para detectar, avaliar e mitigar o viés cognitivo nos LLMs. Em consonância com isso, em outrotrabalho 34, pesquisadores propõem um framework interativo para gerar texto justo, lógico e crítico por meio de prompts do System 2 (projetados para permitir que o LLM pense de forma reflexiva e lenta) que complemente prompts auto-refinados e implicativos. No entanto, a estrutura é limitada às tarefas dentro do espaço latente dos LLMs. Dong et al.35 desenvolvem uma estrutura que utiliza sondagens indiretas para mitigar e avaliar o viés de gênero em dez LLMs de código aberto. Em seu método de sondagem, sem explorar menções estereotipadas diretas, eles revelam viés indireto de gênero.
Lin et al.36 investigam o viés político na geração de texto pelos LLMs tanto para modelos fechados (GPT-3.5-turbo e GPT-437) quanto abertos (Llama-2-7B13, Mistral-7B14, Vicuna29). Eles determinaram se o texto gerado pelo modelo induzia viés de mídia de esquerda ou direita. Além disso, eles elaboraram uma estratégia de mitigação ao ajustar o modelo e fornecer prompts debiase adicionais durante a geração de texto. Após aplicar a técnica de mitigação de viés, o modelo tende a gerar texto neutro; Mídias de esquerda ou direita não influenciam isso. Em consonância com isso, Raj et al.17 propuseram uma solução de debiasing, Social Contact Debiasing (SCD), baseada na hipótese do contato em psicologia, que inclui geração de prompts que compreende as ideologias de diferentes grupos sociais para reduzir o preconceito na geração de texto de três LLMs de código aberto. Paralelamente a isso, Kamruzzaman e Kim38 propuseram uma técnica de debiasing social que explora a cadeia de pensamento System 1 e System 2 para mitigar ao longo de doze dimensões de viés em cinco LLMs (GPT-3.5, GPT-437, Llama-2-7B13, Mistral-7B14 e Gemini-1.039). Aqui, o prompt do System 1 tem como objetivo fazer o LLM responder rapidamente, enquanto o prompt do System 2 tem como objetivo guiá-lo para respostas mais reflexivas e deliberadas. Embora vários estudos tenham sido realizados utilizando engenharia de prompts para mitigar o viés em LLMs, quase ninguém investigou o impacto da variação de prompt na produção dos LLMs. Para resolver essa questão, Hida et al.40 investigaram a sensibilidade dos resultados dos doze LLMs de código aberto à variação rápida e analisaram seu impacto no desempenho das tarefas e nos compromissos de viés. As descobertas revelam que os resultados do debiasing são sensíveis ao prompt; Menos viés na saída dos modelos leva a menor desempenho na tarefa. Kamboj et al.41 propuseram uma abordagem de pós-processamento para mitigar o viés de gênero em embeddings contextualizados de um modelo T5 (Text-to-Text-Transfer-Transformer modelo42). Oba et al.43 fornecem preâmbulos textuais criados manualmente como prompts para LLMs suprimirem sua geração tendenciosa.
Vieses cognitivos, que têm sido fonte de erro diagnóstico na saúde por décadas, correm o risco de serem impressos e amplificados por grandes modelos de linguagem (LLMs) na tomada de decisão clínica. Para combater esse risco, Mahajan et al.44 propõem que as estratégias de mitigação para implementar essas tecnologias devem se concentrar em três temas: primeiro, autorreflexão (reavaliação iterativa dos resultados), segundo, raciocínio contextual (incorporando histórico completo do paciente e diretrizes baseadas em evidências) e, por fim, traços de raciocínio transparentes (explicações dos processos de raciocínio disponibilizadas para auditoria). LLMs, com sua capacidade ubíqua, agora também são amplamente usados para gerar código de programação. Portanto, essa é uma preocupação proeminente para os pesquisadores investigarem os efeitos adversos de qualquer viés social no código gerado. Se tal viés for detectado, as técnicas de mitigação correspondentes precisam ser desenvolvidas. Na mesma direção, Huang et al.45 propuseram uma técnica de avaliação e mitigação de viés social e a testaram em cinco LLMs amplamente utilizados. Nos últimos tempos, vimos avanços enormes em arquiteturas de LLMs e em sua capacidade de gerar respostas que soam humanas. Se os LLMs podem servir como representantes para humanos na tomada de decisão ainda é pouco explorado e merece mais pesquisas. Nessa direção, um quadro e um conjunto de dados são curados por Tjuatja et al.46 para investigar a capacidade dos LLMs de fornecer respostas semelhantes às humanas em um questionário de pesquisa.
Apesar desses avanços, três lacunas em pesquisas persistem. Primeiro, pesquisas anteriores tendem a focar em tipos restritos de viés (por exemplo, gênero ou político) ou domínios específicos (por exemplo, um tema específico). Segundo, embora a engenharia de prompts seja difundida, poucos estudos examinam os efeitos da variação sistemática de prompts na produção do LLM. Terceiro, pesquisas limitadas abordam a debiasing no desafiador cenário de ajuste fino e com recursos limitados de LLMs open-source relevantes para domínios críticos como saúde. Para atender a essas lacunas, é apresentado um único protocolo de mitigação e avaliação de viés que pode ajudar a medir o viés estereotipado em várias arquiteturas de modelos, incorporando ajuste fino sob restrições computacionais e avaliando a robustez das decisões do modelo contra métricas de viés.