Artículo de investigación

Mejorar la equidad en grandes modelos de lenguaje para aplicaciones clínicas de inteligencia artificial mediante el ajuste fino y la aplicación de prompts

DOI:

10.3791/69132

2 de enero de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los grandes modelos de lenguaje específicos de la sanidad enfrentan desafíos éticos y técnicos, ya que, al igual que otros grandes modelos de lenguaje, reflejan los sesgos inherentes a sus datos de entrenamiento. El protocolo presentado aquí verifica la supresión de cuatro tipos de sesgo (género, raza, ocupación, religión) utilizando variantes de prompt a través de tres modelos de código abierto.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los Grandes Modelos de Lenguaje (LLM) se aplican cada vez más a dominios sensibles como la atención médica, que plantean múltiples desafíos técnicos y éticos. Los problemas más inmediatos incluyen los sesgos incorporados en estos modelos, que se entrenan con grandes conjuntos de datos que pueden reflejar prejuicios sociales. Estos sesgos pueden generar resultados injustos, ingeneralizables o incluso perjudiciales, lo que los hace clínicamente inaplicables en el mundo real y no cumplen con las restricciones éticas y regulatorias. Examinamos qué tan bien funciona la supresión de sesgos cuando se impulsan modelos finamente ajustados en cuatro categorías críticas (género, raza, profesión y religión). Curamos manualmente un conjunto de datos de inferencias diverso y creamos doce variantes de prompt —seis de las cuales están debiasadas— para probar los resultados de tres LLMs de código abierto: Llama2-7B, Mistral-7B y Dolly-7B. La equidad y la interpretabilidad de los resultados se evalúan mediante una métrica de puntuación por sesgo, donde puntuaciones más bajas indican mejor equidad e interpretabilidad. También observamos que los prompts debiase reducen el sesgo y que afinar el modelo funciona aún mejor. Los resultados subrayan la importancia crítica de la acción oportuna, la robustez del modelo y un escrutinio ético continuo para un despliegue confiable y justo de LLMs en entornos reales, como la imagen médica y el mantenimiento de Historiales Electrónicos de Salud (EHR).

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los Grandes Modelos de Lenguaje tienen una repercusión prodigiosa como herramientas para apoyar tareas diversas, incluyendo la toma de decisiones 1,2, la generaciónde texto 3,la traducción de texto 4, el análisis de sentimientodel cliente 5, la respuesta a preguntas6 y la generación de informesclínicos 7. En tiempos recientes se han producido varios casos en los que aplicaciones han utilizado LLMs para generar contenido que perjudica a individuos o grupos socialmentedesfavorecidos 8,9,10. La razón principal detrás de estas respuestas tan platitudinas es que estos modelos se entrenan con conjuntos de datos que contienen inherentemente sesgos sociales asociados con la raza, el género, la clase socioeconómica y factores similares. Pero lo que entiendes por "sesgo" y "equidad" en un sistema de IA sanitaria puede ser subjetivo y depender del contexto. Los investigadores han realizado un esfuerzo considerable para mitigar los sesgos sociales en losLLMs 11,12; sin embargo, aún es necesario mejorar más. Los investigadores han propuesto múltiples estrategias de mitigación de sesgos, que pueden clasificarse como preprocesamiento, in-processing, post-processing o combinaciones de estos, a lo largo de una gama heterogénea de aplicaciones. Esta categorización se basa en la etapa en la que se adopta la medida de mitigación. Este protocolo combina las tres estrategias para abordar y aliviar el sesgo social en seis variantes de LLMs e investiga la reducción del sesgo en cuatro dimensiones sociales: género, profesión, raza y religión. En primer lugar, se desarrolla un conjunto de datos de inferencias utilizando una técnica de aumento de datos para permitir que los LLMs generen inferencias. Segundo, doce tipos de prompts están diseñados para provocar respuestas estereotipadas de los LLMs. Tercero, Llama-2-7B13, Mistral-7B14 y Dolly-7B15 están ajustados en un conjunto de datos que contiene frases imparciales en las cuatro categorías sociales: género, raza, profesión y religión, para obtener Llama-2-7BFinetuned, Mistral-7B Finetuned y Dolly-7BFinetuned, respectivamente. Por último, se hacen inferencias al incitar a los LLMs afinados a investigar su eficacia para dar respuestas justas.

Formulamos las siguientes preguntas de investigación y las abordamos en este artículo. Para cada pregunta de investigación formulada (RQ), se formularon una hipótesis nula (H0) y una hipótesis alternativa (H1).

RQ1: ¿Son efectivos los conjuntos de datos de inferencia y las técnicas básicas de prompting para evaluar los sesgos sociales en los LLMs? Hipótesis nula (H01): Las puntuaciones de sesgo derivadas de un conjunto de datos de inferencia, combinadas con prompts básicos, son estadísticamente indistinguibles de las puntuaciones de sesgo de base de los LLMs. Hipótesis alternativa (H11): Las puntuaciones de sesgo del conjunto de datos de inferencia con prompts básicos son estadísticamente significativamente diferentes de las puntuaciones de sesgo de línea base de los LLMs. Para probar la hipótesis, se curó un conjunto de datos, NeutralSet, modificando StereoSet16 y evaluando cada LLM utilizando técnicas básicas de indicación para evaluar su capacidad de producir respuestas no estereotipadas. En nuestro entorno incluimos seis prompts básicos: Standard (un prompt de cero disparo para instruir al LLM a hacer inferencias), Chain-of-Thoughts (CoT está diseñado para pedir al LLM que piense paso a paso para hacer inferencias), System1 (Un prompt para que el LLM piense rápido mientras responde), System2 (un prompt para que el LLM piense despacio y con reflexión), Human Persona 1 (HP1 está diseñado para que el LLM adopte la identidad de un humano que piensa rápido al tomar decisiones), y Human Persona 2 (HP2 está diseñado para que el LLM adopte la identidad humana que piensa lenta y reflexivamente mientras responde).

RQ2: ¿Son efectivas las técnicas de debiasing prompting para revelar y mitigar los sesgos sociales en los LLMs? Hipótesis nula (H0₂): Las técnicas de prompting debiasing no son efectivas para revelar y mitigar sesgos sociales en los LLMs. Hipótesis alternativa (H12): Las puntuaciones de sesgo medidas disminuyen significativamente cuando se utilizan técnicas de prompting de debiasing en los LLMs. Investigamos el impacto de variantes debiase de los prompts básicos en tres LLMs de código abierto para lograr una generación de texto justa, libre de cualquier discriminación social.

RQ3: ¿Se pueden reducir aún más los sesgos sociales ajustando los LLMs? Hipótesis nula (H03): Afinar los LLMs no reduce aún más los sesgos sociales más allá de las reducciones logradas únicamente mediante técnicas de prompting. Hipótesis alternativa (H13): El ajuste fino de los LLMs reduce aún más los sesgos sociales más allá de las reducciones logradas únicamente mediante técnicas de prompting. Para responder a esta pregunta, modificamos el conjunto de datos17 y ajustamos finamente los LLMs en él para evaluar mejor el impacto del ajuste fino en la reducción de respuestas estereotipos.

La Figura 1 ilustra el efecto de la variación en prompt y el ajuste fino de LLM sobre el resultado predicho neutral en cuanto al género. La novedad de nuestro trabajo proviene de la integración de la curación manual de conjuntos de datos, múltiples estrategias de debiasing de prompts y el ajuste fino bajo un único protocolo para analizar un LLM con el fin de identificar y aliviar sesgos sociales, relevantes para aplicaciones sensibles del mundo real como la imagen médica y el mantenimiento de EHR. Agrupamos la literatura sobre sesgo en LLMs en cuatro perspectivas: conjuntos de datos para sesgos y asociaciones cognitivas; marcos de detección y evaluación de sesgos; enfoques de mitigación de sesgos; y sesgo en dominios especializados.

Los investigadores generan continuamente conjuntos de datos para permitir la evaluación de sesgos y el análisis de asociaciones semánticas en los LLMs. Por ejemplo, en psicología cognitiva y lingüística, las asociaciones libres son siempre fundamentales para organizar el conocimiento conceptual. Simulando la misma asociación en la distribución latente de los LLMs, Abramski et al.18 han construido un conjunto de datos, LLM World of Words (LWOW). El conjunto de datos de normas de asociación libre de LWOW en inglés, que comprende millones de respuestas de tres LLMs: Mistral-7B14, Llama-3.1-8B19 y Claude-3-5-haiku-latest20. Está inspirado en Small World of Words (SWOW)21, el mayor conjunto de datos de normas de asociación libre en inglés humano, que se ha empleado ampliamente en diversas investigaciones psicológicas y lingüísticas. Además, LWOW ayuda a construir una red cognitiva compuesta por nodos, cada uno representando una palabra, con nodos correspondientes a palabras semánticamente similares que están más próximas entre sí en la red. Esto ayuda a evaluar el sesgo en la producción de los LLMs estimando la distancia entre palabras en la red cognitiva artificial como métrica clave. Uno de los principales obstáculos al usar LLMs propietarios es que sus componentes internos son inaccesibles. Aunque se han realizado esfuerzos significativos en estos modelos para abordar el sesgo, los conjuntos de datos de alineación siguen siendo escasos. Para abordar esta preocupación, se propone en Zhang et al.22 un conjunto de datos llamado GenderAlign para mitigar el sesgo de género en los LLMs. Se proponeUnStereoEval 23, un conjunto de datos de referencia, para investigar el sesgo de género estereotipado en ocupaciones y emociones. Sus hallazgos revelan un bajo nivel de equidad en 28 LLMs diferentes. Bartl y Leavy24 desarrollaron un conjunto de datos, Tiny Heap, en el que las frases con menciones estereotipadas son reemplazadas por sus equivalentes neutrales y ajustan finamente tres modelos de lenguaje (GPT-225, PHI-1.526 y RoBERTa27). En sus hallazgos, observan una reducción significativa en las tendencias estereotipadas de género de los modelos.

Se han propuesto varios marcos multicapa para identificar y aliviar sesgos en los LLMs. En Raza et al.28, se propone un marco, NBIAS, que consta de cuatro capas: creación de conjuntos de datos, desarrollo de modelos, mitigación de sesgos y evaluación. El conjunto de datos dentro del marco se construye a partir de diversos dominios, incluyendo la sanidad, las redes sociales y los portales de empleo. Demuestran la eficacia de su modelo superando la línea base (BERT 29) entre un 1% y un 8% en justicia. En otro marco similar,GenderCARE 30, se propone una estrategia para mitigar el sesgo de género en los LLMS. En su extenso entorno experimental, redujeron efectivamente el sesgo de género en un promedio del 35% en doce LLMs diferentes. Un marco, BiasAlet31, detecta automáticamente el sesgo social en el texto abierto generado por los LLMs. Tiene algunas limitaciones: en primer lugar, el estudio se realiza con un conjunto de datos sintetizado debido a la falta de un punto de referencia para evaluar el sesgo en la generación de texto abierto del LLM, y segundo, se basa en el anticuado conjunto de datos SBIC32, lo que dificulta distinguir entre la relevancia del sesgo implícito y el sesgo en el propio conjunto de datos. El sesgo en los datos generados por humanos puede introducirse en los modelos entrenados con ellos. El uso de estos modelos es controvertido en empleos de alto riesgo, donde su producción puede afectar negativamente a grupos desfavorecidos. Para abordar esto, se diseña un marco,BiasBuster 33, para detectar, evaluar y mitigar el sesgo cognitivo en los LLMs. En línea con esto, en otro trabajo34, los investigadores proponen un marco interactivo para generar texto justo, lógico y crítico a través de prompts del Sistema 2 (diseñados para permitir que el LLM piense de forma reflexiva y lenta) que complemente prompts auto-refinados e implicativos. Sin embargo, el marco está limitado a las tareas dentro del espacio latente de los LLMs. Dong et al.35 desarrollan un marco que utiliza la sondeación indirecta para mitigar y evaluar el sesgo de género en diez LLMs de código abierto. En su método de exploración, sin explotar menciones estereotípicas directas, revelan sesgos indirectos de género.

Lin et al.36 investigan el sesgo político en la generación de texto por parte de los LLMs tanto para modelos cerrados (GPT-3.5-turbo y GPT-437) como abiertos (Llama-2-7B13, Mistral-7B14, Vicuna29). Determinaron si el texto generado por el modelo inducía un sesgo mediático de izquierdas o de derechas. Además, idearon una estrategia de mitigación ajustando el modelo y proporcionando prompts debiase adicionales durante la generación de texto. Tras aplicar la técnica de mitigación de sesgos, el modelo tiende a generar texto neutro; Los medios de izquierdas o derechas no influyen en eso. En línea con esto, Raj et al.17 han propuesto una solución de debiasing, Social Contact Debiasing (SCD), basada en la hipótesis del contacto en psicología, que incluye la generación de prompts que comprende las ideologías de diferentes grupos sociales para reducir prejuicios en la generación de texto de tres LLMs de código abierto. Paralelamente, Kamruzzaman y Kim38 han propuesto una técnica de debiasing social que explota la cadena de pensamiento del Sistema 1 y el Sistema 2 para mitigar a lo largo de doce dimensiones de sesgo en cinco LLMs (GPT-3.5, GPT-437, Llama-2-7B13, Mistral-7B14 y Gemini-1.039). Aquí, el enunciado del Sistema 1 está pensado para que el LLM responda rápidamente, mientras que el del Sistema 2 está pensado para guiarlo hacia respuestas más reflexivas y deliberadas. Aunque se han realizado varios estudios que utilizan la ingeniería de prompts para mitigar el sesgo en los LLMs, casi nadie ha investigado el impacto de la variación prompt en la producción de los LLMs. Para abordar este problema, Hida et al.40 han investigado la sensibilidad de los resultados de los doce LLMs de código abierto para provocar variaciones y analizado su impacto en el rendimiento de las tareas y los compromisos de sesgos. Sus hallazgos revelan que los resultados de debiasing son sensibles al prompt; Menos sesgo en la salida de los modelos conduce a un menor rendimiento en la tarea. Kamboj et al.41 han propuesto un enfoque de postprocesamiento para mitigar el sesgo de género en incrustaciones contextualizadas de un modelo T5 (modelo42 de Transformador de Transferencia de Texto a Texto). Oba et al.43 proporcionan preámbulos textuales creados manualmente como prompts a los LLMs para suprimir su generación sesgada.

Los sesgos cognitivos, que han sido fuente de error diagnóstico en la sanidad durante décadas, corren el riesgo de ser grabados y amplificados por grandes modelos de lenguaje (LLMs) en la toma de decisiones clínicas. Para combatir este riesgo, Mahajan et al.44 proponen que las estrategias de mitigación para implementar estas tecnologías deben centrarse en tres temas: primero, la autorreflexión (reevaluación iterativa de los resultados), segundo, el razonamiento contextual (incorporando la historia clínica completa del paciente y directrices basadas en la evidencia) y, finalmente, las trazas de razonamiento transparentes (explicaciones de los procesos de razonamiento disponibles para auditoría). Los LLM, con su capacidad ubicua, ahora también se utilizan ampliamente para generar código de programación. Por tanto, esta es una preocupación importante para los investigadores investigar los efectos adversos de cualquier sesgo social en el código generado. Si se detecta dicho sesgo, deben diseñarse las técnicas de mitigación correspondientes. En la misma dirección, Huang et al.45 propusieron una técnica de evaluación y mitigación de sesgos sociales y la probaron en cinco LLMs ampliamente utilizados. En tiempos recientes, hemos visto enormes avances en las arquitecturas de LLM y su capacidad para generar respuestas que suenan humanas. Si los LLMs pueden servir como sustitutos de los humanos en la toma de decisiones sigue sin explorarse y merece más investigación. En esta dirección, Tjuatja et al.46 han elaborado un marco y un conjunto de datos para investigar la capacidad de los LLMs para dar respuestas similares a las humanas en un cuestionario de encuesta.

A pesar de estos avances, persisten tres lagunas en la investigación. En primer lugar, la investigación previa tiende a centrarse en tipos específicos de sesgo (por ejemplo, género o político) o en dominios específicos (por ejemplo, un tema concreto). En segundo lugar, aunque la ingeniería de prompts es omnipresente, pocos estudios examinan los efectos de la variación sistemática de prompts en la salida de los LLM. Tercero, la investigación limitada aborda el debiasing en el desafiante entorno de ajuste fino y con recursos limitados de los LLMs de código abierto relevantes para dominios críticos como la sanidad. Para abordar estas lagunas, se presenta un único protocolo de mitigación y evaluación de sesgos que puede ayudar a medir el sesgo estereotipado en diversas arquitecturas de modelos, incorporando ajustes finos bajo restricciones computacionales y evaluando la robustez de las decisiones del modelo frente a métricas de sesgo.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Todos los experimentos se realizan en la plataforma Google Colab (A100 con 40 GB de RAM). Para realizar experimentos, se recogieron claves API (tarjetas modelo) de Llama2-7B, Mistral-7B y Dolly-7B de Hugging Face.

El protocolo se divide en tres partes. Primero, construir un conjunto de datos que sirva como base para evaluar el sesgo social en los LLMs. Luego diseñar doce variantes distintas de prompts, alineadas con el trabajo realizado por Kamruzzaman y Kim38 para investigar la presencia de sesgo social en las inferencias generadas por los LLMs. Luego, ajusta finamente los LLMs en un conjunto de datos de frases imparciales relacionadas con raza, religión, género y profesión, y vuelve a sondarlos con los mismos indicios para investigar el efecto del ajuste fino en las inferencias generadas. El marco propuesto se muestra en la Figura 2.

Elaboración de un conjunto de datos
El marco utiliza dos conjuntos de datos. Uno se utiliza para derivar inferencias y el otro se aplica para afinar finamente los LLMs. Este estudio modifica StereoSet16 para construir un nuevo conjunto de datos, NeutralSet, que sirve como base para la generación de inferencias. Los LLMs utilizaron el StereoSet para hacer predicciones sobre cuatro tipos de sesgo: raza, religión, género y profesión. StereoSet comprende dos subconjuntos de datos: intra-oración e inter-oraciones. Una instancia de NeutralSet se muestra en la Tabla 1. Da una frase del contexto de la columna como consulta al LLM y pide rellenar el ESPACIO con cualquiera de las palabras de las columnas anti-estereotipo, estereotipo o neutral. El grado de sesgo en el LLM puede juzgarse por la opción que elija. La inclusión de una columna neutra en NeutralSet la distingue de StereoSet. El propósito de añadirlo al nuevo conjunto de datos es reducir la probabilidad de seleccionar la opción de estereotipo al hacer inferencias LLM. Las palabras se añaden en la columna neutral según los pasos mencionados en el Algoritmo 1 (Archivo Suplementario 1). Donde Vs yV as son los vectores de palabras estereotipo y antiestereotipo, respectivamente. A continuación, se selecciona una palabra del diccionario cuyo vector está más cercano a Vn, que está contextualmente posicionado entre los vectores de palabras estereotipo y antiestereotipo, y esta palabra se añade a la columna neutra de la fila seleccionada. La Tabla 2 resume el proceso de creación de NeutralSet. Luego, modifica el conjunto de datos17para afinar los LLMs. El conjunto de datos revisado incluye 25.020 instancias, cada una compuesta por una consulta acompañada de una respuesta socialmente imparcial, utilizada para entrenar los modelos. Las consultas están diseñadas para abordar los cuatro tipos de sesgos sociales.

Motivación para los LLMs
Examina los sesgos sociales en los LLMs proporcionando un conjunto de prompts como instrucciones de entrada. Primero, crea doce tipos de indicaciones: seis básicas y seis variantes debiased correspondientes. El contenido de todas las técnicas de prompting se enumera en la Tabla 3. Los temas de este estudio pasaron por un proceso cíclico y formalizado de elaboración, implementación, reflexión y revisión, resultando en una serie de prompts que se perfeccionaron con el tiempo mediante un importante ensayo y error y refinamiento. Esto permitió cubrir una amplia variedad de tipos de prompts, incluyendo prompts baseline, CoT y personas-personas. Los diseños de prompts y la puntuación no fueron validados por expertos externos del dominio (por ejemplo, clínicos, especialistas en sociales o equidad). La Tabla 4 resume los diferentes tipos de prompts, destacando sus estilos de razonamiento, capacidades de mitigación de sesgos y casos de uso adecuados para guiar la selección adecuada. La evaluación de los LLMs en este artículo no retiene información previa entre ejecuciones o sesiones. Una cosa a aclarar en el modelo final es que cada prompt debe ejecutarse de forma aislada, es decir, no se traslada el historial de conversación de un prompt a otro. Este diseño aseguraba que las respuestas pasadas no afectaran a los resultados posteriores. Durante la fase de ajuste fino, modificar solo los parámetros del modelo basándose en el conjunto de datos de entrenamiento, tal y como se describe tanto en Parameter-Efficient Transfer Learning (PEFT47) como en Quantized Low-Rank Adaptation (QLoRA48). Construye el prompt como se menciona a continuación:

Prompt estándar: Esta es una técnica de indicación de cero disparos en la que el LLM recibe instrucciones con información mínima para hacer la inferencia. El prompt es: "Inserta la palabra más adecuada en el ESPACIO BLANCO de las opciones dadas." Esto se utiliza como referencia para cuantificar y evaluar el sesgo social en los seis LLMs.

Prompt de CoT: El prompt incluye la frase "Piensa paso a paso y rellena el ESPACIO. Elige el que mejor se ajusta al BLANK entre las opciones proporcionadas...". En esta técnica de prompting, se anima al LLM a involucrar su proceso cognitivo y pensar paso a paso antes de dar una respuesta.

Prompts de System1 y System2: Al incluir la frase "Respondes a las preguntas rápidamente...", las indicaciones del System1 guían al LLM para proporcionar respuestas rápidas e intuitivas, de forma similar a cómo funciona la cognición humana en el System1. Por otro lado, los prompts de System2 están diseñados para obtener respuestas más reflexivas, detalladas, analíticas y deliberadas del LLM añadiendo la frase "Respondes a preguntas de forma exhaustiva y deliberada. Tus respuestas son reflexivas y fiables "en la instrucción.

Prompts de HP1 y HP2: Los prompts comienzan con: "Adopta la identidad de una persona que responde rápidamente a las preguntas y rellena el ESPACIO en BLANCO manteniéndote en estricta conformidad con la naturaleza de esa identidad... ". En la técnica de sugerencia HP1, se instruyó al LLM para adoptar la identidad de un humano que responde rápidamente. El propósito de este entorno es hacer que el LLM imite al humano en el proceso cognitivo del System1. En cambio, en el prompt HP2, el LLM se ve impulsado a adoptar una identidad similar a la humana que piensa de forma reflexiva y deliberada antes de responder preguntas, logrando así resultados más precisos. El prompt de HP2 comienza con la frase: "Adopta la identidad de una persona que responde a las preguntas de forma reflexiva y deliberada y rellena el ESPACIO en BLANCO manteniéndote en estricta conformidad con la naturaleza de esa identidad...". La idea clave detrás de incluir estos estímulos es evaluar la capacidad de un LLM para emular completamente la cognición humana.

Variantes de Debias: Una variante debias se construye añadiendo una afirmación que instruye al LLM a tomar la decisión de forma neutral, sin ningún prejuicio estereotipado.

Evaluación de los LLMs
Evalúa seis LLMs: 1) Llama-2-7B13, usando el punto de control meta-llama/Llama-2-7b-chat-hf en Huggingface; 2) Mistral-7B14, usando el punto de control mistralai/Mistral-7B-Instruct-v0.3 en Huggingface; 3) Dolly-7B15, usando los datos de bloques/punto de control dolly-v2-7b en Huggingface; 4) Llama2-7Bajustado, una variante afinada de Llama-2-7B; 5) Mistral-7Bajustado, una variante afinada del Mistral-7B; 6) Dolly-7Bfine-tuned, una variante finamente afinada de Dolly-7B.

Realiza todos los experimentos en una GPU de alta velocidad, como la A100 con 40 GB de memoria o superior. Para afinar los LLMs, divide el conjunto de datos en conjuntos de entrenamiento, validación y prueba, usando la división estándar 70%:10%:20%. Para evitar un reentrenamiento completo del modelo, este estudio utiliza la configuración PEFT47 para el ajuste fino, lo que congela una cantidad sustancial de parámetros del modelo y añade solo unos pocos parámetros específicos de la tarea. Utiliza precisión de 4 bits en QLoRA48 para cargar el LLM si los recursos computacionales son limitados. Esto permitirá un ajuste fino más rápido sin disminuir el rendimiento del modelo.

Para evaluar el sesgo estereotipado en los LLM, utilizala puntuación de sesgo como métrica. Como se muestra en la Ecuación 1, lapuntuación de sesgo se calcula como la proporción de respuestas estereotipadas respecto al número total de respuestas válidas del LLM para un prompt específico.

figure-protocol-1(1)

Donde Ns, Nas y Nn representan el número de respuestas estereotipadas, antiestereotipadas y neutrales, respectivamente. Una puntuación de sesgo más baja indica que la salida del modelo es menos estereotipada.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Utilizando la puntuación de sesgo definida en la Ecuación 1, respondemos sistemáticamente a nuestras preguntas de investigación y evaluamos los sesgos sociales en los LLMs a lo largo de cuatro dimensiones sociales. Las reducciones estadísticamente significativas de las puntuaciones de sesgo observadas proporcionan una validación empírica del protocolo propuesto para la reducción de sesgos en LLMs para tareas de alto riesgo. Para evaluar la efectividad de NeutralSet, es decir, el conjunto...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

En este trabajo, presentamos un protocolo escalable para reducir los sesgos sociales en LLMs que aprovecha Llama2-7B13, Mistral-7B14 y Dolly-7B15. Este enfoque combina ingeniería de prompts HP2, modificaciones de prompts de debiasing y ajuste fino dirigido para desarrollar un protocolo que permita la reducción continua del sesgo en los resultados generados por LLM a lo largo de las cuatro principales dimensiones soci...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen nada que revelar.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Google ColabGooglehttps://colab.research.google.com/Utilizado para realizar los experimentos  
Escritorio MendeleyMendeleyhttps://www.mendeley.com/Utilizado para gestionar citas y referencias.

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. STRUX: An LLM for decision-making with structured explanations. Lu, Y., Hu, Y., Foroosh, H., Jin, W., Liu, F. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  2. Eigner, E., Händler, T. Determinants of LLM-assisted decision-making. arXiv. , (2024).
  3. Wu, Y. Large Language Model and Text Generation. Natural Language Processing in Biomedicine: A Practical Guide. , Springer. Cham. (2024).
  4. Wang, L., et al. Benchmarking and improving long-text translation with large language models. Find Assoc Comput Linguist: ACL. 2024, 7175-7187 (2024).
  5. Ghatora, P. S., Hosseini, S. E., Pervez, S., Iqbal, M. J., Shaukat, N. Sentiment analysis of product reviews using machine learning and pre-trained LLM. Big Data Cogn Comput. 8 (12), 199(2024).
  6. Arefeen, M. A., Debnath, B., Chakradhar, S. LeanContext: Cost-efficient domain-specific question answering using LLMs. Nat Lang Process J. 7, 100065(2024).
  7. Ye, Y., Sarkar, S., Bhaskar, A., Tomlinson, B., Monteiro, O. Using ChatGPT in a clinical setting: A case report. MedComm Future Med. 2 (2), e51(2023).
  8. How are LLMs mitigating stereotyping harms? Learning from search engine studies. Leidinger, A., Rogers, R. Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society, 7, 839-854 (2024).
  9. Gender bias and stereotypes in large language models. Kotek, H., Dockum, R., Sun, D. Proceedings of the ACM Collective Intelligence Conference, 2023, 12-24 (2023).
  10. Uncovering stereotypes in large language models: A task complexity-based approach. Shrawgi, H., Rath, P., Singhal, T., Dandapat, S. Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics, 1, 1841-1857 (2024).
  11. Kwak, D. -H., Holtkamp, P., Kim, S. S. Measuring and controlling social desirability bias: Applications in information systems research. J Assoc Inf Syst. 20 (4), 317-345 (2019).
  12. Self-debiasing large language models: Zero-shot recognition and reduction of stereotypes. Gallegos, I. O., et al. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  13. Touvron, H., et al. Llama 2: Open foundation and finetuned chat models. arXiv. , (2023).
  14. Jiang, A. Q., et al. Mistral 7B. arXiv. , (2023).
  15. Conover, M., et al. Free Dolly: Introducing the world's first truly open instruction-tuned LLM. , databricks.com/blog/2023/04/12/dolly-first-open-commercially-viable-instruction-tuned-llm (2023).
  16. Nadeem, M., Bethke, A., Reddy, S. StereoSet: Measuring stereotypical bias in pretrained language models. arXiv. , (2020).
  17. Breaking bias, building bridges: Evaluation and mitigation of social biases in LLMs via contact hypothesis. Raj, C., Mukherjee, A., Caliskan, A., Anastasopoulos, A., Zhu, Z. Proceedings of the Seventh AAAI/ACM Conference on AI, Ethics, and Society, 2024, 1180-1189 (2024).
  18. Abramski, K., Improta, R., Rossetti, G., Stella, M. The "LLM world of words" English free association norms generated by large language models. Sci Data. 12 (1), 1-16 (2025).
  19. Lhama Team, Meta AI. The Llama 3 herd of models. arXiv. , (2024).
  20. Claude Haiku 3.5. , Anthropic. At anthropic.com/claude/haiku (2025).
  21. De Deyne, S., Navarro, D. J., Perfors, A., Brysbaert, M., Storms, G. The "small world of words" English word association norms for over 12,000 cue words. Behav Res Methods. 51 (3), 987-1006 (2019).
  22. GenderAlign: An alignment dataset for mitigating gender bias in large language models. Zhang, T., et al. Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics, , (2025).
  23. Are models biased on text without gender-related language. Belém, C. G., Seshadri, P., Razeghi, Y., Singh, S. The Twelfth International Conference on Learning Representations (ICLR), , openreview.net/forum?id=w1JanwReU6 (2024).
  24. From showgirls to performers: Finetuning with gender-inclusive language for bias reduction in LLMs. Bartl, M., Leavy, S. Proceedings of the 5th Workshop on Gender Bias in Natural Language Processing (GeBNLP), 5, 280-294 (2024).
  25. Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., Sutskever, I. Language models are unsupervised multitask learners. OpenAI Blog. 1 (8), 9(2019).
  26. Li, Y., Bubeck, S., Eldan, R., Giorno, A. D., Gunasekar, S., Lee, Y. T. Textbooks are all you need II: Phi-1.5 technical report. arXiv. , (2023).
  27. Liu, Y., et al. A robustly optimized BERT pretraining approach. arXiv. , (2019).
  28. Raza, S., Garg, M., John, D., Raza, S., Ding, C. Nbias: A natural language processing framework for BIAS identification in text. Expert Syst Appl. 237 (PB), 121542(2024).
  29. Vicuna: An open-source chatbot impressing GPT-4 with 90%* ChatGPT quality. , Available from: lmsys.org/blog/2023-03-30-vicuna/ (2025).
  30. GenderCARE: A comprehensive framework for assessing and reducing gender bias in large language models. Tang, K., et al. CCS '24: Proceedings of the 2024 on ACM SIGSAC Conference on Computer and Communications Security, 2024, 1196-1210 (2024).
  31. BiasAlert: A plug-and-play tool for social bias detection in LLMs. Fan, Z., Chen, R., Xu, R., Liu, Z. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, 2024, 14778-14790 (2024).
  32. Social bias frames: Reasoning about social and power implications of language. Sap, M., Gabriel, S., Qin, L., Jurafsky, D., Smith, N. A., Choi, Y. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, 58, 5477-5490 (2020).
  33. Echterhoff, J., Liu, Y., Alessa, A., McAuley, J., He, Z. Cognitive bias in decision-making with LLMs. Findings of the Association for Computational Linguistics: EMNLP 2024. 2024, 12640-12653 (2024).
  34. Furniturewala, S., et al. Thinking fair and slow: On the efficacy of structured prompts for debiasing language models. arXiv. , (2024).
  35. Dong, X., Wang, Y., Yu, P. S., Caverlee, J. Disclosure and mitigation of gender bias in LLMs. arXiv. , (2024).
  36. Investigating bias in LLM-based bias detection: Disparities between LLMs and human perception. Lin, L., Wang, L., Guo, J., Wong, K. 31st International Conference on Computational Linguistics, 31, 10634-10649 (2025).
  37. OpenAI. GPT-4 technical report. arXiv. , (2023).
  38. Kamruzzaman, M., Kim, G. L. Prompting techniques for reducing social bias in LLMs through system 1 and system 2 cognitive processes. Proceedings of Recent Advances in Natural Language Processing. 2024, 511-520 (2024).
  39. Gemini Team. Gemini: A family of highly capable multimodal models. arxiv. , (2023).
  40. Hida, R., Kaneko, M., Okazaki, N. Social bias evaluation for large language models requires prompt variations. Find Assoc Comput Linguist: EMNLP 2025. , 14507-14530 (2025).
  41. Measuring and mitigating gender bias in contextualized word embeddings. Kamboj, P., Kumar, S., Goyal, V. Proc IEEE Int Conf Blockchain Distrib Syst Secur, , (2023).
  42. Raffel, C., et al. Exploring the limits of transfer learning with a unified text-to-text transformer. J Mach Learn Res. 21, 1-67 (2023).
  43. In-contextual gender bias suppression for large language models. Oba, D., Kaneko, M., Bollegala, D. EACL 2024 - 18th Conference of the European Chapter of the Association for Computational Linguistics, Findings of EACL 2024, 2024, 1722-1742 (2024).
  44. Mahajan, A., Obermeyer, Z., Daneshjou, R., Lester, J., Powell, D. Cognitive bias in clinical large language models. npj Digit Med. 8 (1), 1-4 (2025).
  45. Huang, D., Bu, Q., Zhang, J., Xie, X., Chen, J., Cui, H. Bias testing and mitigation in LLM-based code generation. ACM Trans Softw Eng Methodol. , (2025).
  46. Tjuatja, L., Chen, V., Wu, S. T., Talwalkar, A., Neubig, G. Do LLMs exhibit human-like response biases? A case study in survey design. arXiv. , (2024).
  47. Houlsby, N., et al. Parameter-efficient transfer learning for NLP. arXiv. , (2019).
  48. Dettmers, T., Pagnoni, A., Holtzman, A., Zettlemoyer, L. QLoRA: Efficient finetuning of quantized LLMs. arXiv. , (2023).
  49. Xiao, H., Xiang, Z., Wang, D., Devadas, S. A Theory to instruct differentially-private learning via clipping bias reduction. IEEE Symposium on Security and Privacy (SP). , (2023).
  50. Kamboj, P., Kumar, S., Goyal, V. Mitigating Social Bias in Generative AI: A comprehensive review. KSII Trans Internet Inf Syst. 19 (10), 3372-3394 (2025).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Supresi n de sesgosajuste fino del modeloingenier a de promptsevaluaci n de la equidadcalificaci n de sesgosprompts eliminados de sesgosrobustez del modelohistorias cl nicas electr nicas
Video próximamente

Artículos relacionados