$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Los Grandes Modelos de Lenguaje tienen una repercusión prodigiosa como herramientas para apoyar tareas diversas, incluyendo la toma de decisiones 1,2, la generaciónde texto 3,la traducción de texto 4, el análisis de sentimientodel cliente 5, la respuesta a preguntas6 y la generación de informesclínicos 7. En tiempos recientes se han producido varios casos en los que aplicaciones han utilizado LLMs para generar contenido que perjudica a individuos o grupos socialmentedesfavorecidos 8,9,10. La razón principal detrás de estas respuestas tan platitudinas es que estos modelos se entrenan con conjuntos de datos que contienen inherentemente sesgos sociales asociados con la raza, el género, la clase socioeconómica y factores similares. Pero lo que entiendes por "sesgo" y "equidad" en un sistema de IA sanitaria puede ser subjetivo y depender del contexto. Los investigadores han realizado un esfuerzo considerable para mitigar los sesgos sociales en losLLMs 11,12; sin embargo, aún es necesario mejorar más. Los investigadores han propuesto múltiples estrategias de mitigación de sesgos, que pueden clasificarse como preprocesamiento, in-processing, post-processing o combinaciones de estos, a lo largo de una gama heterogénea de aplicaciones. Esta categorización se basa en la etapa en la que se adopta la medida de mitigación. Este protocolo combina las tres estrategias para abordar y aliviar el sesgo social en seis variantes de LLMs e investiga la reducción del sesgo en cuatro dimensiones sociales: género, profesión, raza y religión. En primer lugar, se desarrolla un conjunto de datos de inferencias utilizando una técnica de aumento de datos para permitir que los LLMs generen inferencias. Segundo, doce tipos de prompts están diseñados para provocar respuestas estereotipadas de los LLMs. Tercero, Llama-2-7B13, Mistral-7B14 y Dolly-7B15 están ajustados en un conjunto de datos que contiene frases imparciales en las cuatro categorías sociales: género, raza, profesión y religión, para obtener Llama-2-7BFinetuned, Mistral-7B Finetuned y Dolly-7BFinetuned, respectivamente. Por último, se hacen inferencias al incitar a los LLMs afinados a investigar su eficacia para dar respuestas justas.
Formulamos las siguientes preguntas de investigación y las abordamos en este artículo. Para cada pregunta de investigación formulada (RQ), se formularon una hipótesis nula (H0) y una hipótesis alternativa (H1).
RQ1: ¿Son efectivos los conjuntos de datos de inferencia y las técnicas básicas de prompting para evaluar los sesgos sociales en los LLMs? Hipótesis nula (H01): Las puntuaciones de sesgo derivadas de un conjunto de datos de inferencia, combinadas con prompts básicos, son estadísticamente indistinguibles de las puntuaciones de sesgo de base de los LLMs. Hipótesis alternativa (H11): Las puntuaciones de sesgo del conjunto de datos de inferencia con prompts básicos son estadísticamente significativamente diferentes de las puntuaciones de sesgo de línea base de los LLMs. Para probar la hipótesis, se curó un conjunto de datos, NeutralSet, modificando StereoSet16 y evaluando cada LLM utilizando técnicas básicas de indicación para evaluar su capacidad de producir respuestas no estereotipadas. En nuestro entorno incluimos seis prompts básicos: Standard (un prompt de cero disparo para instruir al LLM a hacer inferencias), Chain-of-Thoughts (CoT está diseñado para pedir al LLM que piense paso a paso para hacer inferencias), System1 (Un prompt para que el LLM piense rápido mientras responde), System2 (un prompt para que el LLM piense despacio y con reflexión), Human Persona 1 (HP1 está diseñado para que el LLM adopte la identidad de un humano que piensa rápido al tomar decisiones), y Human Persona 2 (HP2 está diseñado para que el LLM adopte la identidad humana que piensa lenta y reflexivamente mientras responde).
RQ2: ¿Son efectivas las técnicas de debiasing prompting para revelar y mitigar los sesgos sociales en los LLMs? Hipótesis nula (H0₂): Las técnicas de prompting debiasing no son efectivas para revelar y mitigar sesgos sociales en los LLMs. Hipótesis alternativa (H12): Las puntuaciones de sesgo medidas disminuyen significativamente cuando se utilizan técnicas de prompting de debiasing en los LLMs. Investigamos el impacto de variantes debiase de los prompts básicos en tres LLMs de código abierto para lograr una generación de texto justa, libre de cualquier discriminación social.
RQ3: ¿Se pueden reducir aún más los sesgos sociales ajustando los LLMs? Hipótesis nula (H03): Afinar los LLMs no reduce aún más los sesgos sociales más allá de las reducciones logradas únicamente mediante técnicas de prompting. Hipótesis alternativa (H13): El ajuste fino de los LLMs reduce aún más los sesgos sociales más allá de las reducciones logradas únicamente mediante técnicas de prompting. Para responder a esta pregunta, modificamos el conjunto de datos17 y ajustamos finamente los LLMs en él para evaluar mejor el impacto del ajuste fino en la reducción de respuestas estereotipos.
La Figura 1 ilustra el efecto de la variación en prompt y el ajuste fino de LLM sobre el resultado predicho neutral en cuanto al género. La novedad de nuestro trabajo proviene de la integración de la curación manual de conjuntos de datos, múltiples estrategias de debiasing de prompts y el ajuste fino bajo un único protocolo para analizar un LLM con el fin de identificar y aliviar sesgos sociales, relevantes para aplicaciones sensibles del mundo real como la imagen médica y el mantenimiento de EHR. Agrupamos la literatura sobre sesgo en LLMs en cuatro perspectivas: conjuntos de datos para sesgos y asociaciones cognitivas; marcos de detección y evaluación de sesgos; enfoques de mitigación de sesgos; y sesgo en dominios especializados.
Los investigadores generan continuamente conjuntos de datos para permitir la evaluación de sesgos y el análisis de asociaciones semánticas en los LLMs. Por ejemplo, en psicología cognitiva y lingüística, las asociaciones libres son siempre fundamentales para organizar el conocimiento conceptual. Simulando la misma asociación en la distribución latente de los LLMs, Abramski et al.18 han construido un conjunto de datos, LLM World of Words (LWOW). El conjunto de datos de normas de asociación libre de LWOW en inglés, que comprende millones de respuestas de tres LLMs: Mistral-7B14, Llama-3.1-8B19 y Claude-3-5-haiku-latest20. Está inspirado en Small World of Words (SWOW)21, el mayor conjunto de datos de normas de asociación libre en inglés humano, que se ha empleado ampliamente en diversas investigaciones psicológicas y lingüísticas. Además, LWOW ayuda a construir una red cognitiva compuesta por nodos, cada uno representando una palabra, con nodos correspondientes a palabras semánticamente similares que están más próximas entre sí en la red. Esto ayuda a evaluar el sesgo en la producción de los LLMs estimando la distancia entre palabras en la red cognitiva artificial como métrica clave. Uno de los principales obstáculos al usar LLMs propietarios es que sus componentes internos son inaccesibles. Aunque se han realizado esfuerzos significativos en estos modelos para abordar el sesgo, los conjuntos de datos de alineación siguen siendo escasos. Para abordar esta preocupación, se propone en Zhang et al.22 un conjunto de datos llamado GenderAlign para mitigar el sesgo de género en los LLMs. Se proponeUnStereoEval 23, un conjunto de datos de referencia, para investigar el sesgo de género estereotipado en ocupaciones y emociones. Sus hallazgos revelan un bajo nivel de equidad en 28 LLMs diferentes. Bartl y Leavy24 desarrollaron un conjunto de datos, Tiny Heap, en el que las frases con menciones estereotipadas son reemplazadas por sus equivalentes neutrales y ajustan finamente tres modelos de lenguaje (GPT-225, PHI-1.526 y RoBERTa27). En sus hallazgos, observan una reducción significativa en las tendencias estereotipadas de género de los modelos.
Se han propuesto varios marcos multicapa para identificar y aliviar sesgos en los LLMs. En Raza et al.28, se propone un marco, NBIAS, que consta de cuatro capas: creación de conjuntos de datos, desarrollo de modelos, mitigación de sesgos y evaluación. El conjunto de datos dentro del marco se construye a partir de diversos dominios, incluyendo la sanidad, las redes sociales y los portales de empleo. Demuestran la eficacia de su modelo superando la línea base (BERT 29) entre un 1% y un 8% en justicia. En otro marco similar,GenderCARE 30, se propone una estrategia para mitigar el sesgo de género en los LLMS. En su extenso entorno experimental, redujeron efectivamente el sesgo de género en un promedio del 35% en doce LLMs diferentes. Un marco, BiasAlet31, detecta automáticamente el sesgo social en el texto abierto generado por los LLMs. Tiene algunas limitaciones: en primer lugar, el estudio se realiza con un conjunto de datos sintetizado debido a la falta de un punto de referencia para evaluar el sesgo en la generación de texto abierto del LLM, y segundo, se basa en el anticuado conjunto de datos SBIC32, lo que dificulta distinguir entre la relevancia del sesgo implícito y el sesgo en el propio conjunto de datos. El sesgo en los datos generados por humanos puede introducirse en los modelos entrenados con ellos. El uso de estos modelos es controvertido en empleos de alto riesgo, donde su producción puede afectar negativamente a grupos desfavorecidos. Para abordar esto, se diseña un marco,BiasBuster 33, para detectar, evaluar y mitigar el sesgo cognitivo en los LLMs. En línea con esto, en otro trabajo34, los investigadores proponen un marco interactivo para generar texto justo, lógico y crítico a través de prompts del Sistema 2 (diseñados para permitir que el LLM piense de forma reflexiva y lenta) que complemente prompts auto-refinados e implicativos. Sin embargo, el marco está limitado a las tareas dentro del espacio latente de los LLMs. Dong et al.35 desarrollan un marco que utiliza la sondeación indirecta para mitigar y evaluar el sesgo de género en diez LLMs de código abierto. En su método de exploración, sin explotar menciones estereotípicas directas, revelan sesgos indirectos de género.
Lin et al.36 investigan el sesgo político en la generación de texto por parte de los LLMs tanto para modelos cerrados (GPT-3.5-turbo y GPT-437) como abiertos (Llama-2-7B13, Mistral-7B14, Vicuna29). Determinaron si el texto generado por el modelo inducía un sesgo mediático de izquierdas o de derechas. Además, idearon una estrategia de mitigación ajustando el modelo y proporcionando prompts debiase adicionales durante la generación de texto. Tras aplicar la técnica de mitigación de sesgos, el modelo tiende a generar texto neutro; Los medios de izquierdas o derechas no influyen en eso. En línea con esto, Raj et al.17 han propuesto una solución de debiasing, Social Contact Debiasing (SCD), basada en la hipótesis del contacto en psicología, que incluye la generación de prompts que comprende las ideologías de diferentes grupos sociales para reducir prejuicios en la generación de texto de tres LLMs de código abierto. Paralelamente, Kamruzzaman y Kim38 han propuesto una técnica de debiasing social que explota la cadena de pensamiento del Sistema 1 y el Sistema 2 para mitigar a lo largo de doce dimensiones de sesgo en cinco LLMs (GPT-3.5, GPT-437, Llama-2-7B13, Mistral-7B14 y Gemini-1.039). Aquí, el enunciado del Sistema 1 está pensado para que el LLM responda rápidamente, mientras que el del Sistema 2 está pensado para guiarlo hacia respuestas más reflexivas y deliberadas. Aunque se han realizado varios estudios que utilizan la ingeniería de prompts para mitigar el sesgo en los LLMs, casi nadie ha investigado el impacto de la variación prompt en la producción de los LLMs. Para abordar este problema, Hida et al.40 han investigado la sensibilidad de los resultados de los doce LLMs de código abierto para provocar variaciones y analizado su impacto en el rendimiento de las tareas y los compromisos de sesgos. Sus hallazgos revelan que los resultados de debiasing son sensibles al prompt; Menos sesgo en la salida de los modelos conduce a un menor rendimiento en la tarea. Kamboj et al.41 han propuesto un enfoque de postprocesamiento para mitigar el sesgo de género en incrustaciones contextualizadas de un modelo T5 (modelo42 de Transformador de Transferencia de Texto a Texto). Oba et al.43 proporcionan preámbulos textuales creados manualmente como prompts a los LLMs para suprimir su generación sesgada.
Los sesgos cognitivos, que han sido fuente de error diagnóstico en la sanidad durante décadas, corren el riesgo de ser grabados y amplificados por grandes modelos de lenguaje (LLMs) en la toma de decisiones clínicas. Para combatir este riesgo, Mahajan et al.44 proponen que las estrategias de mitigación para implementar estas tecnologías deben centrarse en tres temas: primero, la autorreflexión (reevaluación iterativa de los resultados), segundo, el razonamiento contextual (incorporando la historia clínica completa del paciente y directrices basadas en la evidencia) y, finalmente, las trazas de razonamiento transparentes (explicaciones de los procesos de razonamiento disponibles para auditoría). Los LLM, con su capacidad ubicua, ahora también se utilizan ampliamente para generar código de programación. Por tanto, esta es una preocupación importante para los investigadores investigar los efectos adversos de cualquier sesgo social en el código generado. Si se detecta dicho sesgo, deben diseñarse las técnicas de mitigación correspondientes. En la misma dirección, Huang et al.45 propusieron una técnica de evaluación y mitigación de sesgos sociales y la probaron en cinco LLMs ampliamente utilizados. En tiempos recientes, hemos visto enormes avances en las arquitecturas de LLM y su capacidad para generar respuestas que suenan humanas. Si los LLMs pueden servir como sustitutos de los humanos en la toma de decisiones sigue sin explorarse y merece más investigación. En esta dirección, Tjuatja et al.46 han elaborado un marco y un conjunto de datos para investigar la capacidad de los LLMs para dar respuestas similares a las humanas en un cuestionario de encuesta.
A pesar de estos avances, persisten tres lagunas en la investigación. En primer lugar, la investigación previa tiende a centrarse en tipos específicos de sesgo (por ejemplo, género o político) o en dominios específicos (por ejemplo, un tema concreto). En segundo lugar, aunque la ingeniería de prompts es omnipresente, pocos estudios examinan los efectos de la variación sistemática de prompts en la salida de los LLM. Tercero, la investigación limitada aborda el debiasing en el desafiante entorno de ajuste fino y con recursos limitados de los LLMs de código abierto relevantes para dominios críticos como la sanidad. Para abordar estas lagunas, se presenta un único protocolo de mitigación y evaluación de sesgos que puede ayudar a medir el sesgo estereotipado en diversas arquitecturas de modelos, incorporando ajustes finos bajo restricciones computacionales y evaluando la robustez de las decisiones del modelo frente a métricas de sesgo.