Artigo de investigação

Aprimorando a Justiça em Grandes Modelos de Linguagem para Aplicações Clínicas de Inteligência Artificial por Meio de Ajuste Fino e Prompting

DOI:

10.3791/69132

2 de janeiro de 2026

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Grandes modelos de linguagem específicos para a saúde enfrentam desafios éticos e técnicos, pois, assim como outros grandes modelos de linguagem, refletem os vieses inerentes aos seus dados de treinamento. O protocolo apresentado aqui verifica a supressão de quatro tipos de viés (gênero, raça, profissão, religião) usando variantes prompt em três modelos de código aberto.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Grandes Modelos de Linguagem (LLMs) estão sendo cada vez mais aplicados a domínios sensíveis, como a assistência médica, que apresentam múltiplos desafios técnicos e éticos. As questões mais imediatas incluem vieses incorporados nesses modelos, que são treinados com grandes conjuntos de dados que podem refletir preconceitos sociais. Tais vieses podem gerar resultados injustos, não generalizáveis ou até prejudiciais, tornando-os clinicamente inaplicáveis no mundo real e não conformes às restrições éticas e regulatórias. Examinamos o quão bem funciona a supressão de viés quando modelos finamente ajustados são orientados em quatro categorias críticas (gênero, raça, profissão e religião). Curamos manualmente um conjunto de dados de inferência diversificado e criamos doze variantes de prompt — seis das quais são debiase — para testar os resultados de três LLMs open-source: Llama2-7B, Mistral-7B e Dolly-7B. A justiça e interpretabilidade dos resultados são avaliadas usando uma métrica de pontuação de viés, onde pontuações mais baixas indicam melhor justiça e interpretabilidade. Também observamos que prompts debiase reduzem o viés, e o ajuste fino do modelo tem desempenho ainda melhor. Os resultados enfatizam a importância crítica de uma ação oportuna, robustez do modelo e escrutínio ético contínuo para a implementação confiável e justa de LLMs em ambientes do mundo real, como imagens médicas e a manutenção de Prontuários Eletrônicos de Saúde (EHR).

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Grandes Modelos de Linguagem têm uma enorme repercusão como ferramentas para apoiar tarefas diversas, incluindo tomada de decisão 1,2, geraçãode texto 3,tradução de texto 4, análise de sentimentodo cliente 5, respostaa perguntas 6 e geração de relatóriosclínicos 7. Vários casos ocorreram recentemente em que aplicativos usaram LLMs para gerar conteúdo que prejudica indivíduos ou grupos socialmentedesfavorecidos 8,9,10. A principal razão por trás dessas respostas banalidades é que esses modelos são treinados com conjuntos de dados que contêm inerentemente vieses sociais associados a raça, gênero, classe socioeconômica e fatores similares. Mas o que você quer dizer com "viés" e "justiça" em um sistema de IA em saúde pode ser subjetivo e depender do contexto. Pesquisadores têm feito considerável esforço para mitigar vieses sociais nosLLMs 11,12; No entanto, ainda são necessárias melhorias adicionais. Os pesquisadores propuseram múltiplas estratégias de mitigação de vieses, que podem ser classificadas como pré-processamento, in-processing, pós-processamento ou combinações dessas, em uma gama heterogênea de aplicações. Essa categorização é baseada no estágio em que a medida de mitigação é tomada. Esse protocolo combina as três estratégias para combater e aliviar o viés social em seis variantes de LLMs e investiga a redução de viés em quatro dimensões sociais: Gênero, Profissão, Raça e Religião. Primeiro, um conjunto de dados de inferência é desenvolvido usando uma técnica de aumento de dados para permitir que LLMs gerem inferências. Segundo, doze tipos de prompts são projetados para provocar respostas estereotipadas dos LLMs. Terceiro, Llama-2-7B13, Mistral-7B14 e Dolly-7B15 são ajustados em um conjunto de dados contendo frases imparciais nas quatro categorias sociais: gênero, raça, profissão e religião, para obter Llama-2-7BFinetuned, Mistral-7BFinetuned e Dolly-7BFinetuned, respectivamente. Por fim, inferências são feitas ao incentivar os LLMs finamente ajustados a investigar sua eficácia em dar respostas justas.

Formulamos as seguintes questões de pesquisa e as abordamos neste artigo. Para cada questão de pesquisa formulada (CR), foram formuladas uma hipótese nula (H0) e uma hipótese alternativa (H1).

RQ1: O conjunto de dados de inferência e as técnicas básicas de prompting são eficazes na avaliação dos vieses sociais em LLMs? Hipótese nula (H01): As pontuações de viés derivadas de um conjunto de dados de inferência, quando combinadas com prompts básicos, são estatisticamente indistinguíveis das pontuações de viés de referência dos LLMs. Hipótese alternativa (H11): As pontuações de viés do conjunto de dados de inferência com prompts básicos são estatisticamente significativamente diferentes das pontuações de viés de base dos LLMs. Para testar a hipótese, um conjunto de dados, NeutralSet, foi curado modificando o StereoSet16 e avaliando cada LLM usando técnicas básicas de prompting para avaliar sua capacidade de produzir respostas não estereotipadas. Em nossos cenários, incluímos seis prompts básicos — Standard (um prompt zero-shot para instruir o LLM a fazer inferências), Chain-of-Thoughts (CoT é projetado para pedir ao LLM que pense passo a passo para fazer inferências), System1 (Um prompt para deixar o LLM pensar rapidamente enquanto responde), System2 (um prompt para fazer o LLM pensar devagar e de forma reflexiva), Human Persona 1 (HP1 foi projetado para fazer o LLM adotar a identidade de um humano que pensa rápido ao tomar decisões), e Human Persona 2 (HP2 foi criado para fazer o LLM adotar a identidade humana, que pensa devagar e de forma reflexiva ao responder).

RQ2: As técnicas de prompting de debiasing são eficazes para revelar e mitigar vieses sociais em LLMs? Hipótese nula (H0₂): Técnicas de prompting de debiasing não são eficazes para revelar e mitigar vieses sociais em LLMs. Hipótese alternativa (H12): As pontuações de viés medidas diminuem significativamente quando técnicas de prompting de debiasing são usadas em LLMs. Investigamos o impacto de variantes debiase dos prompts básicos em três LLMs de código aberto para alcançar uma geração de texto justa, livre de qualquer discriminação social.

RQ3: Os vieses sociais podem ser ainda mais reduzidos com o ajuste fino dos LLMs? Hipótese nula (H03): O ajuste fino dos LLMs não reduz ainda mais os vieses sociais além das reduções alcançadas apenas por técnicas de prompting. Hipótese alternativa (H13): O ajuste fino dos LLMs reduz ainda mais os vieses sociais além das reduções alcançadas apenas por técnicas de prompting. Para responder a essa pergunta, modificamos o conjunto de dados17 e ajustamos os LLMs nele para avaliar melhor o impacto do ajuste fino na redução das respostas estereotípicas.

A Figura 1 ilustra o efeito da variação no prompt e do ajuste fino do LLM no resultado previsto neutro em relação ao gênero. A novidade do nosso trabalho vem da integração da curadoria manual de conjuntos de dados, múltiplas estratégias de prompts de debiasing e ajustes finos sob um único protocolo para analisar um LLM para identificação e alívio de vieses sociais, relevantes para aplicações sensíveis do mundo real, como imagens médicas e manutenção de EHR. Agrupamos a literatura sobre viés em LLMs em quatro perspectivas: conjuntos de dados para viés e associações cognitivas; estruturas de detecção e avaliação de vieses; abordagens de mitigação de vieses; e viés em domínios especializados.

Pesquisadores estão continuamente gerando conjuntos de dados para possibilitar a avaliação de viés e a análise de associação semântica em LLMs. Por exemplo, em psicologia cognitiva e linguística, associações livres são sempre fundamentais na organização do conhecimento conceitual. Simulando a mesma associação na distribuição latente dos LLMs, Abramski et al.18 construíram um conjunto de dados, LLM World of Words (LWOW). O conjunto de dados de normas de associação livre em inglês do LWOW, que compreende milhões de respostas de três LLMs: Mistral-7B14, Llama-3.1-8B19 e Claude-3-5-haiku-latest20. Ele é inspirado no Small World of Words (SWOW)21, o maior conjunto de dados de normas de associação livre em inglês humano, amplamente empregado em diversas investigações psicológicas e linguísticas. Além disso, o LWOW ajuda a construir uma rede cognitiva composta por nós, cada um representando uma palavra, com nós correspondentes a palavras semanticamente semelhantes que estão mais próximas umas das outras na rede. Isso ajuda a avaliar o viés na produção dos LLMs ao estimar a distância entre palavras na rede cognitiva artificial como métrica chave. Um grande obstáculo no uso de LLMs proprietários é que seus internos são inacessíveis. Embora esforços significativos tenham sido feitos nesses modelos para combater o viés, os conjuntos de dados de alinhamento ainda são escassos. Para abordar essa preocupação, um conjunto de dados chamado GenderAlign é proposto em Zhang et al.22 para mitigar o viés de gênero nos LLMs.UnStereoEval 23, um conjunto de dados de referência, é proposto para investigar o viés de gênero estereotipado em ocupações e emoções. Seus achados revelam um baixo nível de justiça em 28 LLMs diferentes. Bartl e Leavy24 desenvolveram um conjunto de dados, Tiny Heap, no qual frases com menções estereotipadas são substituídas por seus equivalentes neutros e ajustados três modelos linguísticos (GPT-225, PHI-1.526 e RoBERTa27). Em suas descobertas, observam uma redução significativa nas tendências estereotipadas de gênero dos modelos.

Vários frameworks multilayer foram propostos para identificar e aliviar vieses em LLMs. Em Raza et al.28, é proposto um framework, o NBIAS, que compreende quatro camadas: criação de conjuntos de dados, desenvolvimento de modelos, mitigação de vieses e avaliação. O conjunto de dados dentro do framework é construído a partir de diversos domínios, incluindo saúde, mídias sociais e portais de emprego. Eles demonstram a eficácia do modelo ao superar a linha de base (BERT 29) em 1% a 8%, para ser justo. Em outro marco semelhante, oGenderCARE 30, é proposta uma estratégia para mitigar o viés de gênero no LLMS. Em sua extensa configuração experimental, reduziram efetivamente o viés de gênero em uma média de 35% em doze LLMs diferentes. Um framework, BiasAlet31, detecta automaticamente viés social no texto aberto gerado pelos LLMs. Ele tem algumas limitações: primeiro, o estudo é conduzido com um conjunto de dados sintetizado devido à indisponibilidade de um benchmark para avaliar o viés na geração de texto aberto do LLM, e segundo, é construído sobre o antiquado conjunto de dados SBIC32, o que dificulta distinguir entre a relevância do viés implícito e o viés no próprio conjunto de dados. O viés em dados gerados por humanos pode ser introduzido em modelos treinados nele. O uso desses modelos é controverso em empregos de alto risco, onde sua produção pode impactar negativamente grupos desfavorecidos. Para enfrentar isso, um framework,BiasBuster 33, foi desenvolvido para detectar, avaliar e mitigar o viés cognitivo nos LLMs. Em consonância com isso, em outrotrabalho 34, pesquisadores propõem um framework interativo para gerar texto justo, lógico e crítico por meio de prompts do System 2 (projetados para permitir que o LLM pense de forma reflexiva e lenta) que complemente prompts auto-refinados e implicativos. No entanto, a estrutura é limitada às tarefas dentro do espaço latente dos LLMs. Dong et al.35 desenvolvem uma estrutura que utiliza sondagens indiretas para mitigar e avaliar o viés de gênero em dez LLMs de código aberto. Em seu método de sondagem, sem explorar menções estereotipadas diretas, eles revelam viés indireto de gênero.

Lin et al.36 investigam o viés político na geração de texto pelos LLMs tanto para modelos fechados (GPT-3.5-turbo e GPT-437) quanto abertos (Llama-2-7B13, Mistral-7B14, Vicuna29). Eles determinaram se o texto gerado pelo modelo induzia viés de mídia de esquerda ou direita. Além disso, eles elaboraram uma estratégia de mitigação ao ajustar o modelo e fornecer prompts debiase adicionais durante a geração de texto. Após aplicar a técnica de mitigação de viés, o modelo tende a gerar texto neutro; Mídias de esquerda ou direita não influenciam isso. Em consonância com isso, Raj et al.17 propuseram uma solução de debiasing, Social Contact Debiasing (SCD), baseada na hipótese do contato em psicologia, que inclui geração de prompts que compreende as ideologias de diferentes grupos sociais para reduzir o preconceito na geração de texto de três LLMs de código aberto. Paralelamente a isso, Kamruzzaman e Kim38 propuseram uma técnica de debiasing social que explora a cadeia de pensamento System 1 e System 2 para mitigar ao longo de doze dimensões de viés em cinco LLMs (GPT-3.5, GPT-437, Llama-2-7B13, Mistral-7B14 e Gemini-1.039). Aqui, o prompt do System 1 tem como objetivo fazer o LLM responder rapidamente, enquanto o prompt do System 2 tem como objetivo guiá-lo para respostas mais reflexivas e deliberadas. Embora vários estudos tenham sido realizados utilizando engenharia de prompts para mitigar o viés em LLMs, quase ninguém investigou o impacto da variação de prompt na produção dos LLMs. Para resolver essa questão, Hida et al.40 investigaram a sensibilidade dos resultados dos doze LLMs de código aberto à variação rápida e analisaram seu impacto no desempenho das tarefas e nos compromissos de viés. As descobertas revelam que os resultados do debiasing são sensíveis ao prompt; Menos viés na saída dos modelos leva a menor desempenho na tarefa. Kamboj et al.41 propuseram uma abordagem de pós-processamento para mitigar o viés de gênero em embeddings contextualizados de um modelo T5 (Text-to-Text-Transfer-Transformer modelo42). Oba et al.43 fornecem preâmbulos textuais criados manualmente como prompts para LLMs suprimirem sua geração tendenciosa.

Vieses cognitivos, que têm sido fonte de erro diagnóstico na saúde por décadas, correm o risco de serem impressos e amplificados por grandes modelos de linguagem (LLMs) na tomada de decisão clínica. Para combater esse risco, Mahajan et al.44 propõem que as estratégias de mitigação para implementar essas tecnologias devem se concentrar em três temas: primeiro, autorreflexão (reavaliação iterativa dos resultados), segundo, raciocínio contextual (incorporando histórico completo do paciente e diretrizes baseadas em evidências) e, por fim, traços de raciocínio transparentes (explicações dos processos de raciocínio disponibilizadas para auditoria). LLMs, com sua capacidade ubíqua, agora também são amplamente usados para gerar código de programação. Portanto, essa é uma preocupação proeminente para os pesquisadores investigarem os efeitos adversos de qualquer viés social no código gerado. Se tal viés for detectado, as técnicas de mitigação correspondentes precisam ser desenvolvidas. Na mesma direção, Huang et al.45 propuseram uma técnica de avaliação e mitigação de viés social e a testaram em cinco LLMs amplamente utilizados. Nos últimos tempos, vimos avanços enormes em arquiteturas de LLMs e em sua capacidade de gerar respostas que soam humanas. Se os LLMs podem servir como representantes para humanos na tomada de decisão ainda é pouco explorado e merece mais pesquisas. Nessa direção, um quadro e um conjunto de dados são curados por Tjuatja et al.46 para investigar a capacidade dos LLMs de fornecer respostas semelhantes às humanas em um questionário de pesquisa.

Apesar desses avanços, três lacunas em pesquisas persistem. Primeiro, pesquisas anteriores tendem a focar em tipos restritos de viés (por exemplo, gênero ou político) ou domínios específicos (por exemplo, um tema específico). Segundo, embora a engenharia de prompts seja difundida, poucos estudos examinam os efeitos da variação sistemática de prompts na produção do LLM. Terceiro, pesquisas limitadas abordam a debiasing no desafiador cenário de ajuste fino e com recursos limitados de LLMs open-source relevantes para domínios críticos como saúde. Para atender a essas lacunas, é apresentado um único protocolo de mitigação e avaliação de viés que pode ajudar a medir o viés estereotipado em várias arquiteturas de modelos, incorporando ajuste fino sob restrições computacionais e avaliando a robustez das decisões do modelo contra métricas de viés.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Todos os experimentos são realizados na plataforma Google Colab (A100 com 40 GB de RAM). Para realizar experimentos, chaves API (cartões modelo) de Llama2-7B, Mistral-7B e Dolly-7B foram coletadas do Hugging Face.

O protocolo é dividido em três partes. Primeiro, construa um conjunto de dados que sirva como base para avaliar o viés social em LLMs. Depois, projetar doze variantes distintas de prompts, alinhadas com o trabalho realizado por Kamruzzaman e Kim38 para investigar a presença de viés social nas inferências geradas pelos LLMs. Depois, ajuste os LLMs em um conjunto de dados de frases imparciais relacionadas a raça, religião, gênero e profissão, e os explore novamente com os mesmos estímulos para investigar o efeito do ajuste fino nas inferências geradas. A estrutura proposta é mostrada na Figura 2.

Curadoria de um conjunto de dados
O framework utiliza dois conjuntos de dados. Um é usado para derivar inferências, e o outro é aplicado para ajustar finamente LLMs. Este estudo modifica o StereoSet16 para construir um novo conjunto de dados, o NeutralSet, que serve como base para a geração de inferências. Os LLMs usaram o StereoSet para fazer previsões em quatro tipos de vieses: raça, religião, gênero e profissão. O StereoSet compreende dois subconjuntos de dados: intra-frase e inter-sentença. Uma instância do NeutralSet é mostrada na Tabela 1. Dê uma frase do contexto da coluna como consulta ao LLM e peça para preencher o ESPAÇO com qualquer uma das palavras das colunas anti-estereótipo, estereótipo ou neutro. O grau de viés no LLM pode ser avaliado pela opção escolhida. A inclusão de uma coluna neutra no NeutralSet o distingue do StereoSet. O objetivo de adicioná-lo ao novo conjunto de dados é reduzir a probabilidade de selecionar a opção de estereótipo ao fazer inferências de LLM. As palavras são adicionadas na coluna neutra de acordo com os passos mencionados no Algoritmo 1 (Arquivo Suplementar 1). Onde Vs eV as são, respectivamente, os vetores das palavras estereotipadas e anti-estereótipos. Uma palavra do dicionário é então selecionada cujo vetor está mais próximo de Vn, que está posicionado contextualmente entre os vetores de palavras estereótipo e anti-estereótipo, e essa palavra é adicionada à coluna neutra na linha selecionada. A Tabela 2 resume o processo de criação do NeutralSet. Depois, modifique o conjuntode dados 17para ajustar os LLMs. O conjunto de dados revisado inclui 25.020 instâncias, cada uma consistindo em uma consulta emparelhada com uma resposta socialmente imparcial, usada para treinar os modelos. As consultas são projetadas para abordar os quatro tipos de vieses sociais.

Motivação para os LLMs
Examine os vieses sociais em LLMs fornecendo um conjunto de prompts como instruções de entrada. Primeiro, crie doze tipos de prompts: seis básicos e seis variantes debiased correspondentes. O conteúdo de todas as técnicas de prompting está listado na Tabela 3. Os temas deste estudo passaram por um processo cíclico e formalizado de criação, implementação, reflexão e revisão, resultando em uma série de prompts que foram aprimorados ao longo do tempo por meio de tentativa e erro significativos e refinamentos. Isso permitiu a cobertura de um conjunto diversificado de tipos de prompts, incluindo prompts baseline, CoT e persona-humana. Os desenhos de prompts e a pontuação não foram validados por especialistas externos do domínio (por exemplo, clínicos, especialistas em social ou justiça). A Tabela 4 resume diferentes tipos de prompts, destacando seus estilos de raciocínio, capacidades de mitigação de vieses e casos de uso adequados para orientar a seleção adequada. A avaliação dos LLMs neste artigo não mantém informações passadas entre execuções ou sessões. Uma coisa a esclarecer no modelo final é que cada prompt deve ser executado isoladamente, ou seja, nenhum histórico de conversa é transferido de um prompt para outro. Esse layout garantia que respostas passadas não afetassem as saídas subsequentes. Durante a fase de ajuste fino, modifique apenas os parâmetros do modelo com base no conjunto de dados de treinamento, conforme descrito tanto no Parameter-Efficient Transfer Learning (PEFT47) quanto no Quantized Low-Rank Adaptation (QLoRA48). Construa o prompt conforme mencionado abaixo:

Prompt padrão: Esta é uma técnica de prompting zero-shot na qual o LLM é instruído com informações mínimas para fazer a inferência. O prompt é: "Insira a palavra mais apropriada no ESPAÇO entre as opções fornecidas." Isso é usado como referência para quantificar e avaliar o viés social em todos os seis LLMs.

Proposta de CoT: O prompt inclui a frase "Pense passo a passo e preencha o ESPAÇO. Escolha o melhor ajuste para o BLANK entre as opções fornecidas...". Nessa técnica de incentivo, o LLM é incentivado a engajar seu processo cognitivo e pensar passo a passo antes de fornecer uma resposta.

Prompts do System1 e do System2: Ao incluir a frase "Você responde às perguntas prontamente...", os prompts do System1 guiam o LLM para fornecer respostas rápidas e intuitivas, semelhante a como a cognição humana opera no System1. Por outro lado, os prompts do System2 são projetados para provocar respostas mais reflexivas, detalhadas, analíticas e deliberadas do LLM, adicionando a frase "Você responde às perguntas de forma completa e deliberada. Suas respostas são ponderadas e confiáveis "na instrução.

Prompts de HP1 e HP2: Os prompts começam com: "Adote a identidade de uma pessoa que responde rapidamente às perguntas e preencha o ESPAÇO mantendo estrita conformidade com a natureza dessa identidade... ". Na técnica de prompting HP1, o LLM foi instruído a adotar a identidade de um humano que responde rapidamente. O objetivo dessa configuração é fazer com que o LLM imite o humano no processo cognitivo do System1. Em contraste, no prompt HP2, o LLM é impulsionado a adotar uma identidade semelhante à humana, que pensa de forma reflexiva e deliberada antes de responder perguntas, alcançando assim resultados mais precisos. O prompt do HP2 começa com a frase: "Adote a identidade de uma pessoa que responde às perguntas de forma reflexiva e deliberada e preencha o ESPAÇO em BRANCO, mantendo-se em estrita conformidade com a natureza dessa identidade...". A ideia principal por trás da inclusão desses estímulos é avaliar a capacidade de um LLM de emular completamente a cognição humana.

Variantes de Debias: Uma variante de debias é construída adicionando uma instrução que instrui o LLM a tomar a decisão de forma neutra, sem qualquer preconceito estereotipado.

Avaliação dos LLMs
Avalie seis LLMs: 1) Llama-2-7B13, usando o ponto de controle meta-llama/Llama-2-7b-chat-hf no Huggingface; 2) Mistral-7B14, usando o checkpoint mistralai/Mistral-7B-Instruct-v0.3 em Huggingface; 3) Dolly-7B15, usando o checkpoint databricks/dolly-v2-7b no Huggingface; 4) Llama2-7Bajustado finamente, uma variante afinada da Llama-2-7B; 5) Mistral-7Bajustado, uma variante finamente ajustada do Mistral-7B; 6) Dolly-7Bajustado finamente, uma variante finamente ajustada do Dolly-7B.

Realize todos os experimentos em uma GPU de alta velocidade, como a A100 com 40 GB de memória ou superior. Para ajustar os LLMs, divida o conjunto de dados em conjuntos de treinamento, validação e teste, usando a divisão padrão 70%:10%:20%. Para evitar o retreinamento completo do modelo, este estudo utiliza a configuração do PEFT47 para ajuste fino, que congela uma quantidade substancial dos parâmetros do modelo e adiciona apenas alguns parâmetros específicos para cada tarefa. Use precisão de 4 bits no QLoRA48 para carregar o LLM se os recursos computacionais forem limitados. Isso permitirá ajustes finos mais rápidos sem diminuir o desempenho do modelo.

Para avaliar o viés estereotipado em LLMs, usea pontuação de viés como métrica. Como mostrado na Equação 1,a pontuação de viés é calculada como a razão entre as respostas do estereótipo e o número total de respostas válidas do LLM para um prompt específico.

figure-protocol-1(1)

Onde Ns, Nas e Nn representam, respectivamente, o número de respostas estereotipadas, anti-estereotipadas e neutras. Uma pontuação de viés menor indica que a saída do modelo é menos estereotipada.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Usando a pontuação de viés definida na Equação 1, respondemos sistematicamente às nossas perguntas de pesquisa e avaliamos vieses sociais em LLMs em quatro dimensões sociais. As reduções estatisticamente significativas das pontuações de viés observadas fornecem validação empírica do protocolo proposto para redução de viés em LLMs para tarefas de alto risco. Para avaliar a eficácia do NeutralSet, ou seja, do conjunto de dados de inferência curado, consultamos os três LLMs padrão tanto no ...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Neste trabalho, apresentamos um protocolo escalável para reduzir vieses sociais em LLMs que utiliza Llama2-7B13, Mistral-7B14 e Dolly-7B15. Essa abordagem combina engenharia de prompts HP2, modificações de prompts de debiasing e ajuste fino direcionado para desenvolver um protocolo para a redução contínua do viés nos resultados gerados por LLMs nas quatro principais dimensões sociais de gênero, raça, profissão e reli...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores não têm nada a revelar.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Google ColabGooglehttps://colab.research.google.com/usado para realizar os experimentos  
Mendeley DesktopMendeleyhttps://www.mendeley.com/Usado para gerenciar citações e referências.

Referências

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. STRUX: An LLM for decision-making with structured explanations. Lu, Y., Hu, Y., Foroosh, H., Jin, W., Liu, F. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  2. Eigner, E., Händler, T. Determinants of LLM-assisted decision-making. arXiv. , (2024).
  3. Wu, Y. Large Language Model and Text Generation. Natural Language Processing in Biomedicine: A Practical Guide. , Springer. Cham. (2024).
  4. Wang, L., et al. Benchmarking and improving long-text translation with large language models. Find Assoc Comput Linguist: ACL. 2024, 7175-7187 (2024).
  5. Ghatora, P. S., Hosseini, S. E., Pervez, S., Iqbal, M. J., Shaukat, N. Sentiment analysis of product reviews using machine learning and pre-trained LLM. Big Data Cogn Comput. 8 (12), 199(2024).
  6. Arefeen, M. A., Debnath, B., Chakradhar, S. LeanContext: Cost-efficient domain-specific question answering using LLMs. Nat Lang Process J. 7, 100065(2024).
  7. Ye, Y., Sarkar, S., Bhaskar, A., Tomlinson, B., Monteiro, O. Using ChatGPT in a clinical setting: A case report. MedComm Future Med. 2 (2), e51(2023).
  8. How are LLMs mitigating stereotyping harms? Learning from search engine studies. Leidinger, A., Rogers, R. Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society, 7, 839-854 (2024).
  9. Gender bias and stereotypes in large language models. Kotek, H., Dockum, R., Sun, D. Proceedings of the ACM Collective Intelligence Conference, 2023, 12-24 (2023).
  10. Uncovering stereotypes in large language models: A task complexity-based approach. Shrawgi, H., Rath, P., Singhal, T., Dandapat, S. Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics, 1, 1841-1857 (2024).
  11. Kwak, D. -H., Holtkamp, P., Kim, S. S. Measuring and controlling social desirability bias: Applications in information systems research. J Assoc Inf Syst. 20 (4), 317-345 (2019).
  12. Self-debiasing large language models: Zero-shot recognition and reduction of stereotypes. Gallegos, I. O., et al. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  13. Touvron, H., et al. Llama 2: Open foundation and finetuned chat models. arXiv. , (2023).
  14. Jiang, A. Q., et al. Mistral 7B. arXiv. , (2023).
  15. Conover, M., et al. Free Dolly: Introducing the world's first truly open instruction-tuned LLM. , databricks.com/blog/2023/04/12/dolly-first-open-commercially-viable-instruction-tuned-llm (2023).
  16. Nadeem, M., Bethke, A., Reddy, S. StereoSet: Measuring stereotypical bias in pretrained language models. arXiv. , (2020).
  17. Breaking bias, building bridges: Evaluation and mitigation of social biases in LLMs via contact hypothesis. Raj, C., Mukherjee, A., Caliskan, A., Anastasopoulos, A., Zhu, Z. Proceedings of the Seventh AAAI/ACM Conference on AI, Ethics, and Society, 2024, 1180-1189 (2024).
  18. Abramski, K., Improta, R., Rossetti, G., Stella, M. The "LLM world of words" English free association norms generated by large language models. Sci Data. 12 (1), 1-16 (2025).
  19. Lhama Team, Meta AI. The Llama 3 herd of models. arXiv. , (2024).
  20. Claude Haiku 3.5. , Anthropic. At anthropic.com/claude/haiku (2025).
  21. De Deyne, S., Navarro, D. J., Perfors, A., Brysbaert, M., Storms, G. The "small world of words" English word association norms for over 12,000 cue words. Behav Res Methods. 51 (3), 987-1006 (2019).
  22. GenderAlign: An alignment dataset for mitigating gender bias in large language models. Zhang, T., et al. Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics, , (2025).
  23. Are models biased on text without gender-related language. Belém, C. G., Seshadri, P., Razeghi, Y., Singh, S. The Twelfth International Conference on Learning Representations (ICLR), , openreview.net/forum?id=w1JanwReU6 (2024).
  24. From showgirls to performers: Finetuning with gender-inclusive language for bias reduction in LLMs. Bartl, M., Leavy, S. Proceedings of the 5th Workshop on Gender Bias in Natural Language Processing (GeBNLP), 5, 280-294 (2024).
  25. Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., Sutskever, I. Language models are unsupervised multitask learners. OpenAI Blog. 1 (8), 9(2019).
  26. Li, Y., Bubeck, S., Eldan, R., Giorno, A. D., Gunasekar, S., Lee, Y. T. Textbooks are all you need II: Phi-1.5 technical report. arXiv. , (2023).
  27. Liu, Y., et al. A robustly optimized BERT pretraining approach. arXiv. , (2019).
  28. Raza, S., Garg, M., John, D., Raza, S., Ding, C. Nbias: A natural language processing framework for BIAS identification in text. Expert Syst Appl. 237 (PB), 121542(2024).
  29. Vicuna: An open-source chatbot impressing GPT-4 with 90%* ChatGPT quality. , Available from: lmsys.org/blog/2023-03-30-vicuna/ (2025).
  30. GenderCARE: A comprehensive framework for assessing and reducing gender bias in large language models. Tang, K., et al. CCS '24: Proceedings of the 2024 on ACM SIGSAC Conference on Computer and Communications Security, 2024, 1196-1210 (2024).
  31. BiasAlert: A plug-and-play tool for social bias detection in LLMs. Fan, Z., Chen, R., Xu, R., Liu, Z. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, 2024, 14778-14790 (2024).
  32. Social bias frames: Reasoning about social and power implications of language. Sap, M., Gabriel, S., Qin, L., Jurafsky, D., Smith, N. A., Choi, Y. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, 58, 5477-5490 (2020).
  33. Echterhoff, J., Liu, Y., Alessa, A., McAuley, J., He, Z. Cognitive bias in decision-making with LLMs. Findings of the Association for Computational Linguistics: EMNLP 2024. 2024, 12640-12653 (2024).
  34. Furniturewala, S., et al. Thinking fair and slow: On the efficacy of structured prompts for debiasing language models. arXiv. , (2024).
  35. Dong, X., Wang, Y., Yu, P. S., Caverlee, J. Disclosure and mitigation of gender bias in LLMs. arXiv. , (2024).
  36. Investigating bias in LLM-based bias detection: Disparities between LLMs and human perception. Lin, L., Wang, L., Guo, J., Wong, K. 31st International Conference on Computational Linguistics, 31, 10634-10649 (2025).
  37. OpenAI. GPT-4 technical report. arXiv. , (2023).
  38. Kamruzzaman, M., Kim, G. L. Prompting techniques for reducing social bias in LLMs through system 1 and system 2 cognitive processes. Proceedings of Recent Advances in Natural Language Processing. 2024, 511-520 (2024).
  39. Gemini Team. Gemini: A family of highly capable multimodal models. arxiv. , (2023).
  40. Hida, R., Kaneko, M., Okazaki, N. Social bias evaluation for large language models requires prompt variations. Find Assoc Comput Linguist: EMNLP 2025. , 14507-14530 (2025).
  41. Measuring and mitigating gender bias in contextualized word embeddings. Kamboj, P., Kumar, S., Goyal, V. Proc IEEE Int Conf Blockchain Distrib Syst Secur, , (2023).
  42. Raffel, C., et al. Exploring the limits of transfer learning with a unified text-to-text transformer. J Mach Learn Res. 21, 1-67 (2023).
  43. In-contextual gender bias suppression for large language models. Oba, D., Kaneko, M., Bollegala, D. EACL 2024 - 18th Conference of the European Chapter of the Association for Computational Linguistics, Findings of EACL 2024, 2024, 1722-1742 (2024).
  44. Mahajan, A., Obermeyer, Z., Daneshjou, R., Lester, J., Powell, D. Cognitive bias in clinical large language models. npj Digit Med. 8 (1), 1-4 (2025).
  45. Huang, D., Bu, Q., Zhang, J., Xie, X., Chen, J., Cui, H. Bias testing and mitigation in LLM-based code generation. ACM Trans Softw Eng Methodol. , (2025).
  46. Tjuatja, L., Chen, V., Wu, S. T., Talwalkar, A., Neubig, G. Do LLMs exhibit human-like response biases? A case study in survey design. arXiv. , (2024).
  47. Houlsby, N., et al. Parameter-efficient transfer learning for NLP. arXiv. , (2019).
  48. Dettmers, T., Pagnoni, A., Holtzman, A., Zettlemoyer, L. QLoRA: Efficient finetuning of quantized LLMs. arXiv. , (2023).
  49. Xiao, H., Xiang, Z., Wang, D., Devadas, S. A Theory to instruct differentially-private learning via clipping bias reduction. IEEE Symposium on Security and Privacy (SP). , (2023).
  50. Kamboj, P., Kumar, S., Goyal, V. Mitigating Social Bias in Generative AI: A comprehensive review. KSII Trans Internet Inf Syst. 19 (10), 3372-3394 (2025).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

Supress o de Vi sAjuste Fino de ModeloEngenharia de PromptAvalia o de EquidadePontua o de Vi sPrompts DesenviesadosRobustez do ModeloRegistros Eletr nicos de Sa de
Vídeo em breve

Artigos relacionados