Исследовательская статья

Повышение справедливости в больших языковых моделях для клинических приложений искусственного интеллекта посредством тонкой настройки и подсказок

DOI:

10.3791/69132

2 января 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Крупные языковые модели, специфичные для здравоохранения, сталкиваются с этическими и техническими проблемами, поскольку, как и другие крупные языковые модели, отражают предвзятости, присущие их обучающим данным. Представленный здесь протокол проверяет подавление четырёх типов предвзятости (гендер, раса, профессия, религия) с помощью вариантов подсказок в трёх открытых моделях.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Крупные языковые модели (LLM) всё чаще применяются к чувствительным сферам, таким как медицинская помощь, которые создают множество технических и этических вызовов. Самые насущные проблемы включают предвзятости, заложенные в эти модели, которые обучаются на больших наборах данных, которые могут отражать общественные предубеждения. Такие искажения могут привести к результатам, которые несправедливы, необобщаемые или даже вредные, делая их клинически неприменимыми в реальном мире и не соответствующими этическим и нормативным ограничениям. Мы изучаем, насколько хорошо работает подавление предвзятости, когда тонко настроенные модели используются в четырёх критических категориях (гендер, раса, профессия и религия). Мы вручную курируем разнообразный набор выводов и создаём двенадцать вариантов подсказок — шесть из которых де-предвзяты — для тестирования результатов трёх открытых LLM: Llama2-7B, Mistral-7B и Dolly-7B. Справедливость и интерпретируемость результатов оцениваются с помощью метрики предвзятости, где более низкие показатели указывают на лучшую справедливость и интерпретируемость. Также отмечается, что дебиассированные подсказки снижают смещение, а тонкая настройка модели работает ещё лучше. Результаты подчёркивают критическую важность своевременных действий, надёжности моделей и постоянного этического контроля для надёжного и справедливого внедрения LLM в реальных условиях, таких как медицинская визуализация и ведение электронных медицинских записей (EHR).

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Крупные языковые модели обладают огромным реверберацией как инструменты для поддержки различных задач, включая принятиерешений 1,2,генерацию текста 3, переводтекста 4, анализ настроенийклиентов 5, ответына вопросы 6 и создание клиническихотчётов 7. В последнее время произошло несколько случаев, когда приложения использовали LLM для создания контента, наносящего вред социально неблагополучным людям илигруппам 8,9,10. Основная причина таких банальных ответов заключается в том, что эти модели обучаются на наборах данных, которые по своей природе содержат общественные предубеждения, связанные с расой, гендером, социально-экономическим классом и подобными факторами. Но то, что вы имеете в виду под «предвзятостью» и «справедливостью» в системе ИИ в здравоохранении, может быть субъективным и зависеть от контекста. Исследователи приложили значительные усилия для смягчения социальных предвзятостей вLLM 11,12; Однако дальнейшее совершенствование остаётся необходимым. Исследователи предложили несколько стратегий смягчения предвзятости, которые можно классифицировать как предварительную, в процессе, постобработку или их комбинации в различных областях применений. Эта классификация основана на этапе, на котором принимаются меры смягчения. Этот протокол объединяет все три стратегии для борьбы с социальной предвзятостью в шести вариантах LLM и исследует снижение предвзятости по четырём социальным измерениям: гендер, профессия, раса и религия. Во-первых, с использованием техники расширения данных разрабатывается набор выводов, чтобы LLM могли генерировать выводы. Во-вторых, двенадцать типов заданий разработаны для получения стереотипных ответов у LLM. В-третьих, Llama-2-7B13, Mistral-7B14 иDolly-7B 15 тонко настраиваются на наборе данных, содержащем беспристрастные предложения по четырём социальным категориям: гендер, раса, профессия и религия, чтобы Llama-2-7BFinetuned, Mistral-7BFinetuned и Dolly-7BFinetuned, соответственно. Наконец, выводы делаются, побуждая отточенные LLM исследовать свою эффективность в даче справедливых ответов.

Мы сформулировали следующие исследовательские вопросы и рассмотрели их в этой статье. Для каждого сформулированного исследовательского вопроса (RQ) формировались нулевая гипотеза (H0) и альтернативная гипотеза (H1).

RQ1: Эффективны ли набор данных вывода и базовые методы подсказки для оценки общественных предубеждений в LLM? Нулевая гипотеза (H01): Оценки смещения, полученные из набора выводов в сочетании с базовыми подсказками, статистически неотличимы от базовых оценок смещения LLM. Альтернативная гипотеза (H11): Оценки смещения из набора выводов с базовыми подсказками статистически существенно отличаются от базовых оценок смещения LLM. Для проверки гипотезы был курирован набор данных NeutralSet путём модификацииStereoSet 16 и оценки каждого LLM с использованием базовых методов подсказки для оценки его способности давать нестереотипные ответы. В наших сеттингах мы включаем шесть базовых подсказок — Standard (нулевое задание для инструктажа LLM делать выводы), Chain-of-Thoughts (CoT предназначен для того, чтобы LLM пошагово думал и делать выводы), System1 (подсказка, позволяющая LLM быстро думать при ответе), System2 (подсказка, заставляющая LLM думать медленно и вдумчиво), Human Persona 1 (HP1 предназначен для того, чтобы LLM принял личность человека, который быстро сообразяет при принятии решений), и Human Persona 2 (HP2 создан для того, чтобы LLM принял человеческую идентичность, которая думает медленно и вдумчиво, отвечая).

RQ2: Эффективны ли методы устранения предвзятости для выявления и снижения общественных предвзятостей в LLM? Нулевая гипотеза (H0₂): Методы устранения предвзятости неэффективны для выявления и смягчения общественных предубеждений в LLM. Альтернативная гипотеза (H12): Измеренные оценки смещения значительно снижаются при использовании методов устранения предвзятости в LLM. Мы исследуем влияние дебизированных вариантов базовых запросов на три открытых LLM для достижения справедливой генерации текста, свободного от какой-либо социальной дискриминации.

RQ3: Можно ли дополнительно снизить общественные предубеждения, доработав LLM? Нулевая гипотеза (H03): Тонкая настройка LLM не снижает общественные предвзятости дальше, чем сокращения, достигнутые только методами подсказки. Альтернативная гипотеза (H13): Тонкая настройка LLM дополнительно снижает общественные предвзятости, выходящие за рамки снижения, достигнутых только методами подсказки. Чтобы ответить на этот вопрос, мы модифицируем наборданных 17 и тонко настраиваем LLM на нём, чтобы дополнительно оценить влияние тонкой настройки на снижение стереотипных откликов.

Рисунок 1 иллюстрирует влияние вариации подсказок и тонкой настройки LLM на гендерно-нейтральный прогнозируемый результат. Новизна нашей работы заключается в интеграции ручного курирования наборов данных, множества стратегий устранения предвзятости и тонкой настройки в рамках единого протокола для анализа LLM с целью выявления и снижения общественных предвзятостей, что актуально для чувствительных реальных приложений, таких как медицинская визуализация и обслуживание ЭМК. Мы сгруппировали литературу по предвзятости в LLM в четыре направления: наборы данных для предвзятости и когнитивных ассоциаций; рамки обнаружения и оценки предвзятости; методы снижения предвзятости; и смещение в специализированных областях.

Исследователи постоянно генерируют наборы данных для оценки предвзятости и семантического анализа ассоциаций в LLM. Например, в когнитивной психологии и лингвистике свободные ассоциации всегда играют ключевую роль в организации концептуальных знаний. Моделируя ту же ассоциацию в латентном распределении LLM, Абрамски и др.18 создали набор данных LLM World of Words (LWOW). Набор данных LWOW English Free Association Norms, включающий миллионы ответов от трёх LLM: Mistral-7B14, Llama-3.1-8B19 и Claude-3-5-haiku-latest20. Он вдохновлён Small World of Words (SWOW)21 — крупнейшим набором данных по нормам свободных ассоциаций в человеческом английском языке, который широко применяется в различных психологических и лингвистических исследованиях. Кроме того, LWOW помогает построить когнитивную сеть, состоящую из узлов, каждый из которых представляет слово, с узлами, соответствующими семантически похожим словам, расположенным ближе друг к другу в сети. Это помогает оценить смещение в результатах LLM, оценивая расстояние между словами в искусственной когнитивной сети как ключевую метрику. Одной из главных проблем при использовании проприетарных LLM является недоступность их внутренних устройств. Хотя в этих моделях были предприняты значительные усилия для устранения смещения, наборы данных по выравниванию всё ещё редки. Для решения этой проблемы в Zhang et al.22 предложен набор данных под названием GenderAlign для снижения гендерной предвзятости в LLM. UnStereoEval23, эталонный набор данных, предлагается для изучения стереотипных гендерных предубеждений в профессиях и эмоциях. Их результаты показывают низкий уровень справедливости в 28 различных LLM. Бартл иЛиви 24 разработали набор данных Tiny Heap, в котором предложения с стереотипными упоминаниями заменены их нейтральными аналогами и доработаны три языковые модели (GPT-225, PHI-1.526 и RoBERTa27). В своих результатах наблюдается значительное снижение гендерно-стереотипных тенденций моделей.

Было предложено несколько многоуровневых фреймворков для выявления и снижения искажений в LLM. В Raza и др.28 предложена структура NBIAS, включающая четыре уровня: создание наборов данных, разработка моделей, снижение смещения и оценку. Набор данных внутри фреймворка создан из различных областей, включая здравоохранение, социальные сети и порталы по трудоустройству. Они демонстрируют эффективность своей модели, превосходя базовый уровень (BERT 29) на 1%–8% по справедливости. В другой такой структуре,GenderCARE 30, предлагается стратегия по снижению гендерной предвзятости в LLMS. В рамках обширной экспериментальной системы они эффективно снизили гендерную предвзятость в среднем на 35% в двенадцати различных LLM. Фреймворк BiasAlet31 автоматически обнаруживает социальную предвзятость в открытом тексте, генерируемом LLM. Она имеет некоторые ограничения: во-первых, исследование проводится на синтезированном наборе данных из-за отсутствия бенчмарка для оценки смещения при генерации открытого текста LLM, а во-вторых, оно построено на устаревшем наборе данныхSBIC 32, что затрудняет различие между значимостью неявного искажения и смещения в самом наборе данных. Смещение в техноручных данных может быть введено в модели, обученные на них. Использование таких моделей вызывает споры в профессиях с высокими ставками, где их результат может негативно сказываться на неблагополучных группах. Для решения этой задачи разработана структураBiasBuster 33 для обнаружения, оценки и смягчения когнитивных искажений в LLM. В соответствии с этим, в другой работе34 исследователи предлагают интерактивную структуру для генерации справедливого, логичного и критического текста с помощью подсказок Системы 2 (предназначенных для того, чтобы LLM мог мыслить вдумчиво и медленно), которые дополняют самоотточенные и импликативные подсказки. Однако фреймворк ограничен задачами внутри латентного пространства LLM. Донг и др.35 разрабатывают фреймворк, использующий косвенное исследование для смягчения и оценки гендерных предубеждений в десяти открытых LLM. В своём методе исследования, не используя прямые стереотипные упоминания, они выявляют косвенную гендерную предвзятость.

Лин и др.36 исследуют политическую предвзятость в генерации текста LLM как для закрытых (GPT-3.5-turbo иGPT-4 37), так и для открытых моделей (Llama-2-7B13, Mistral-7B14,Vicuna 29). Они определяли, вызывает ли текст, сгенерированный моделью, смещение СМИ с левым или правым уклоном. Кроме того, они разработали стратегию смягчения последствий, доработав модель и предоставив дополнительные депресированные подсказки при генерации текста. После применения метода смягчения смещения модель обычно генерирует нейтральный текст; Левые или правые СМИ на это не влияют. В соответствии с этим Радж и др.17 предложили решение для устранения предвзятости — социальное дебиасирование (SCD), основанное на гипотезе контакта в психологии, включающее генерацию подсказок, охватывающую идеологии различных социальных групп для снижения предвзятости при генерации текстов трех открытых LLM. Параллельно с этим Камруззаман иКим 38 предложили метод социальной депредатизации, который использует цепочку мышления Системы 1 и Системы 2 для смягчения по двенадцати измерениям смещений в пяти LLM (GPT-3.5,GPT-4 37, Llama-2-7B13, Mistral-7B14 и Gemini-1.039). Здесь запрос System 1 предназначен для быстрого ответа LLM, а запрос System 2 — для более продуманных и взвешенных ответов. Хотя проводились различные исследования, использующие инженерию подсказок для снижения смещения в LLM, мало кто изучал влияние вариаций prompt на результат LLM. Для решения этой проблемы Хида и др.40 исследовали чувствительность выходных данных двенадцати открытых LLM для стимулирования вариаций и проанализировали их влияние на производительность задач и компромиссы по смещению. Их результаты показывают, что результаты удаления предвзятости чувствительны к заданию; меньшее смещение в результатах моделей приводит к снижению производительности задач. Камбодж и др.41 предложили подход постобработки для смягчения гендерной предвзятости в контекстуализированных вложениях модели T5 (модель Text-to-text-Transfer-Transformer42). Оба и др.43 предоставляют вручную созданные текстовые преамбулы в качестве подсказок к LLM, чтобы подавить их предвзятое генерирование.

Когнитивные искажения, которые десятилетиями были источником диагностических ошибок в здравоохранении, рискуют быть запечатлены и усилены крупными языковыми моделями (LLM) при принятии клинических решений. Для борьбы с этим риском Махаджан и др.44 предлагают, чтобы стратегии смягчения последствий при внедрении этих технологий были сосредоточены на трёх темах: во-первых, саморефлексии (итеративная переоценка результатов), во-вторых, контекстуальное мышление (с использованием полной истории пациентов и основанных на доказательствах рекомендаций), и, наконец, прозрачные следы рассуждений (объяснения процессов рассуждений, предоставляемые для аудита). LLM, обладающие их повсеместной возможностью, теперь также широко используются для генерации программного кода. Поэтому для исследователей важно изучать негативные последствия любых социальных предвзятостей в сгенерированном коде. Если такое смещение обнаружено, необходимо разработать соответствующие методы снижения. В том же направлении Хуанг и др.45 предложили метод оценки и смягчения социальных предвзятостей и протестировали её на пяти широко используемых LLM. В последнее время мы наблюдаем огромный прогресс в архитектурах LLM и их способности генерировать ответы, звучащие как человек. Вопрос о том, могут ли LLM служить прокси для человека при принятии решений, остаётся недостаточно изученным и требует дальнейших исследований. В этом направлении Tjuatja и др.46 созданы рамки и набор данных для изучения способности LLM давать ответы, похожие на человека, в опросной анкете.

Несмотря на эти достижения, три исследовательских пробела сохраняются. Во-первых, предыдущие исследования обычно сосредоточены на узких типах предвзятости (например, гендерные или политические) или на конкретных областях (например, на конкретной теме). Во-вторых, хотя инженерия подсказок широко распространена, немногие исследования изучают влияние систематических вариаций подсказок на результат LLM. В-третьих, ограниченные исследования направлены на устранение предвзятости в сложной системе тонкой настройки с ограничением ресурсов в открытых LLM, релевантных для критически важных областей, таких как здравоохранение. Для устранения этих пробелов представлен единый протокол по снижению и оценки смещения, который может помочь измерить стереотипные смещения в различных архитектурах моделей, включая тонкую настройку в условиях вычислительных ограничений и оценку устойчивости решений моделей с учетом метрик смещения.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Все эксперименты проводятся на платформе Google Colab (A100 с 40 ГБ оперативной памяти). Для проведения экспериментов были собраны ключи API (карты моделей) Llama2-7B, Mistral-7B и Dolly-7B из Hugging Face.

Протокол разделён на три части. Во-первых, создайте набор данных, который служит основой для оценки социальной предвзятости в LLM. Затем спроектировать двенадцать различных вариантов запросов, согласованных с работой Камруззамана иКима 38 для изучения наличия социальной предвзятости в выводах, генерируемых LLM. Затем тонко настройте LLM на наборе непредвзятых предложений, связанных с расой, религией, гендером и профессией, и снова изучите их с теми же подсказками, чтобы изучить влияние тонкой настройки на сгенерированные выводы. Предлагаемая структура показана на рисунке 2.

Курирование набора данных
Фреймворк использует два набора данных. Один используется для вывода выводов, а другой — для тонкой настройки LLM. В этом исследовании модифицируетсяStereoSet 16 для создания нового набора данных NeutralSet, который служит основой для генерации выводов. LLM использовали StereoSet для прогнозирования по четырём типам предвзятости: раса, религия, пол и профессия. StereoSet состоит из двух поднасетов: внутрипредложенных и межпредложенных. Пример NeutralSet приведён в таблице 1. Дайте предложение из контекста столбца в качестве запроса LLM и попросите заполнить ПУСТОЕ слово любым из столбцов — антистереотипный, стереотип или нейтральный. Степень предвзятости в LLM можно оценить по выбранному варианту. Включение нейтрального столбца в NeutralSet отличает его от StereoSet. Цель добавления её в новый набор данных — снизить вероятность выбора стереотипа при выполнении выводов LLM. Слова добавляются в нейтральный столбец согласно шагам, указанным в Алгоритме 1 (Дополнительный файл 1). где Vs иV as — векторы стереотипных и антистереотипных слов соответственно. Затем выбирается слово из словаря, вектор которого ближе всего к Vn, который контекстно расположен между векторами стереотипа и антистереотипного слов, и это слово добавляется в нейтральный столбец выбранной строки. Таблица 2 резюмирует процесс создания NeutralSet. Затем модифицируйте наборданных 17, чтобы тонко настроить LLM. Переработанный набор данных включает 25 020 экземпляров, каждый из которых состоит из запроса в паре с социально беспристрастным ответом, используемых для обучения моделей. Запросы разработаны для решения всех четырёх типов социальных предубеждений.

Появление LLM
Изучите социальные предубеждения в LLM, предоставив набор подсказок в качестве инструкций для ввода. Сначала создайте двенадцать типов подсказок: шесть базовых и шесть соответствующих вариантов с уклонением от предвзятости. Содержание всех техник подсказки перечислено в Таблице 3. Задания в этом исследовании прошли циклично, формализованный процесс разработки, внедрения, рефлексии и редактирования, в результате чего были созданы серии заданий, которые со временем оттачивались с помощью значительных проб, ошибок и доработки. Это позволило охватить широкий набор типов запросов, включая базовые, CoT и человеческие персонажи. Дизайн подсказок и оценка не были подтверждены внешними экспертами (например, клиницистами, социальными или специалистами по справедливости). Таблица 4 суммирует различные типы запросов, выделяя их стили рассуждения, возможности по снижению предвзятости и подходящие сценарии использования для правильного выбора. Оценка LLM в данной статье не сохраняет прошлую информацию за пробеги или сессии. Один момент, который нужно уточнить в финальной модели — каждый запрос должен выполняться изолированно, то есть история разговоров не переносится из одного запроса в другой. Такое расположение гарантировало, что прошлые ответы не влияют на последующие выходы. Во время фазы тонкой настройки модифицировать только параметры модели на основе обучающего набора данных, как описано в Parameter-Efficient Transfer Learning (PEFT 47) и Quantized Low-Rank Adaptation (QLoRA48). Постройте задание так, как указано ниже:

Стандартный запрос: Это техника нулевого подсказки, при которой LLM инструктируется с минимальными данными для вывода. Подсказка звучит так: «Вставьте наиболее подходящее слово в BLANK из заданных вариантов.» Это используется как база для количественной оценки и оценки социальной предвзятости во всех шести LLM.

Задание CoT: В задании есть фраза: «Думайте шаг за шагом и заполните ПРОБЕЛ. Выберите лучший вариант для BLANK из предложенных вариантов...". В этой технике подсказки LLM поощряется включать свой когнитивный процесс и думать шаг за шагом, прежде чем дать ответ.

Подсказки System1 и System2: Используя фразу «Вы своевременно отвечаете на вопросы...», подсказки System1 направляют LLM к быстрым, интуитивно понятным ответам, подобно тому, как работает человеческое мышление в System1. С другой стороны, подсказки System2 предназначены для получения более вдумчивых, детальных, аналитических и осознанных ответов от LLM, добавляя фразу: «Вы отвечаете на вопросы тщательно и осознанно. Ваши ответы продуманны и надёжны в инструкции.

Запросы HP1 и HP2: Подсказки начинаются так: «Примите личность человека, который быстро отвечает на вопросы, и заполните ПРОБЕЛ, строго соблюдая характер этой идентичности... ". В технике подсказки HP1 LLM получил инструкцию принять личность человека, который быстро реагирует. Цель этого сеттинга — заставить LLM подражать человеку в процессе когнитивного процесса System1. В отличие от этого, в задании HP2 LLM стремится принять человеческую идентичность, которая думает вдумчиво и осознанно, прежде чем отвечать на вопросы, тем самым достигая более точных результатов. Запрос HP2 начинается с фразы: «Примите личность человека, который отвечает на вопросы вдумчиво и осознанно, и заполните ПРОБЕЛ, строго соблюдая характер этой идентичности...». Ключевая идея включения этих подсказок — оценить способность LLM полностью имитировать человеческое мышление.

Варианты Дебиаса: Вариант Дебиаса строится путём добавления утверждения, которое инструктует LLM принимать решение нейтрально, без стереотипных предубеждений.

Оценка LLM
Оценить шесть LLM: 1) Llama-2-7B13, используя контрольную точку мета-ламы/Llama-2-7b-chat-hf на Huggingface; 2) Mistral-7B14, использующий контрольную точку mistralai/Mistral-7B-Instruct-v0.3 на Huggingface; 3) Dolly-7B15, использующий контрольную точку databricks/dolly-v2-7b на Huggingface; 4)Llama2-7B finetuned, тонко настроенный вариант Llama-2-7B; 5)Мистраль-7Б с тонкой настройкой, тонко настроенный вариант Мистраля-7Б; 6)Dolly-7B finetuned, доработанная версия Dolly-7B.

Проводите все эксперименты на высокоскоростной видеокарте, такой как A100 с 40 ГБ памяти и выше. Для тонкой настройки LLM разделите набор данных на обучающий, валидационный и тестовый наборы, используя стандартное разделение 70%:10%:20%. Чтобы избежать полного переобучения модели, в этом исследовании используется конфигурацияPEFT 47 для тонкой настройки, которая замораживает значительную часть параметров модели и добавляет лишь несколько специфических для задач параметров. Используйте 4-битную точность в QLoRA48 для загрузки LLM, если вычислительные ресурсы ограничены. Это позволит быстрее настраивать без снижения производительности модели.

Для оценки стереотипного смещения в LLM используйтеBias score в качестве метрики. Как показано в уравнении 1, оценка смещениярассчитывается как отношение стереотипных ответов к общему числу допустимых ответов LLM на конкретный запрос.

figure-protocol-1(1)

Где Ns, Nкак иN представляют соответственно количество стереотипных, антистереотипных и нейтральных ответов. Более низкий показатель смещения указывает на менее стереотипный результат модели.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Используя балл предвзятости, определённый в Уравнении 1, мы систематически отвечаем на наши исследовательские вопросы и оцениваем общественные предвзятости в LLM по четырём социальным измерениям. Статистически значимые снижения оценок смещения, наблюдаемые, обеспечивают эмпирическую валидацию предложенного протокола по снижению смещения в LLM для задач с высокими ставками. Чтобы оценить эффективность NeutralSet, то есть курируемого набора выводов, мы запрашиваем все три стандартных LLM к...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этой работе мы представляем масштабируемый протокол для снижения социальных предвзятостей в LLM, который использует Llama2-7B13, Mistral-7B14 и Dolly-7B15. Этот подход сочетает в себе инженерию подсказок HP2, изменения подсказок и целенаправленную тонкую настройку для разработки протокола для дальнейшего снижения предвзятости в результатах, генерируемых LLM, по четырём основным социальным измерениям: гендеру, расе,...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторам нечего раскрывать.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Google ColabGooglehttps://colab.research.google.com/используется для проведения экспериментов 
Менделей ДесктопМенделейhttps://www.mendeley.com/используется для управления ссылками и ссылками.

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. STRUX: An LLM for decision-making with structured explanations. Lu, Y., Hu, Y., Foroosh, H., Jin, W., Liu, F. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  2. Eigner, E., Händler, T. Determinants of LLM-assisted decision-making. arXiv. , (2024).
  3. Wu, Y. Large Language Model and Text Generation. Natural Language Processing in Biomedicine: A Practical Guide. , Springer. Cham. (2024).
  4. Wang, L., et al. Benchmarking and improving long-text translation with large language models. Find Assoc Comput Linguist: ACL. 2024, 7175-7187 (2024).
  5. Ghatora, P. S., Hosseini, S. E., Pervez, S., Iqbal, M. J., Shaukat, N. Sentiment analysis of product reviews using machine learning and pre-trained LLM. Big Data Cogn Comput. 8 (12), 199(2024).
  6. Arefeen, M. A., Debnath, B., Chakradhar, S. LeanContext: Cost-efficient domain-specific question answering using LLMs. Nat Lang Process J. 7, 100065(2024).
  7. Ye, Y., Sarkar, S., Bhaskar, A., Tomlinson, B., Monteiro, O. Using ChatGPT in a clinical setting: A case report. MedComm Future Med. 2 (2), e51(2023).
  8. How are LLMs mitigating stereotyping harms? Learning from search engine studies. Leidinger, A., Rogers, R. Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society, 7, 839-854 (2024).
  9. Gender bias and stereotypes in large language models. Kotek, H., Dockum, R., Sun, D. Proceedings of the ACM Collective Intelligence Conference, 2023, 12-24 (2023).
  10. Uncovering stereotypes in large language models: A task complexity-based approach. Shrawgi, H., Rath, P., Singhal, T., Dandapat, S. Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics, 1, 1841-1857 (2024).
  11. Kwak, D. -H., Holtkamp, P., Kim, S. S. Measuring and controlling social desirability bias: Applications in information systems research. J Assoc Inf Syst. 20 (4), 317-345 (2019).
  12. Self-debiasing large language models: Zero-shot recognition and reduction of stereotypes. Gallegos, I. O., et al. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  13. Touvron, H., et al. Llama 2: Open foundation and finetuned chat models. arXiv. , (2023).
  14. Jiang, A. Q., et al. Mistral 7B. arXiv. , (2023).
  15. Conover, M., et al. Free Dolly: Introducing the world's first truly open instruction-tuned LLM. , databricks.com/blog/2023/04/12/dolly-first-open-commercially-viable-instruction-tuned-llm (2023).
  16. Nadeem, M., Bethke, A., Reddy, S. StereoSet: Measuring stereotypical bias in pretrained language models. arXiv. , (2020).
  17. Breaking bias, building bridges: Evaluation and mitigation of social biases in LLMs via contact hypothesis. Raj, C., Mukherjee, A., Caliskan, A., Anastasopoulos, A., Zhu, Z. Proceedings of the Seventh AAAI/ACM Conference on AI, Ethics, and Society, 2024, 1180-1189 (2024).
  18. Abramski, K., Improta, R., Rossetti, G., Stella, M. The "LLM world of words" English free association norms generated by large language models. Sci Data. 12 (1), 1-16 (2025).
  19. Lhama Team, Meta AI. The Llama 3 herd of models. arXiv. , (2024).
  20. Claude Haiku 3.5. , Anthropic. At anthropic.com/claude/haiku (2025).
  21. De Deyne, S., Navarro, D. J., Perfors, A., Brysbaert, M., Storms, G. The "small world of words" English word association norms for over 12,000 cue words. Behav Res Methods. 51 (3), 987-1006 (2019).
  22. GenderAlign: An alignment dataset for mitigating gender bias in large language models. Zhang, T., et al. Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics, , (2025).
  23. Are models biased on text without gender-related language. Belém, C. G., Seshadri, P., Razeghi, Y., Singh, S. The Twelfth International Conference on Learning Representations (ICLR), , openreview.net/forum?id=w1JanwReU6 (2024).
  24. From showgirls to performers: Finetuning with gender-inclusive language for bias reduction in LLMs. Bartl, M., Leavy, S. Proceedings of the 5th Workshop on Gender Bias in Natural Language Processing (GeBNLP), 5, 280-294 (2024).
  25. Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., Sutskever, I. Language models are unsupervised multitask learners. OpenAI Blog. 1 (8), 9(2019).
  26. Li, Y., Bubeck, S., Eldan, R., Giorno, A. D., Gunasekar, S., Lee, Y. T. Textbooks are all you need II: Phi-1.5 technical report. arXiv. , (2023).
  27. Liu, Y., et al. A robustly optimized BERT pretraining approach. arXiv. , (2019).
  28. Raza, S., Garg, M., John, D., Raza, S., Ding, C. Nbias: A natural language processing framework for BIAS identification in text. Expert Syst Appl. 237 (PB), 121542(2024).
  29. Vicuna: An open-source chatbot impressing GPT-4 with 90%* ChatGPT quality. , Available from: lmsys.org/blog/2023-03-30-vicuna/ (2025).
  30. GenderCARE: A comprehensive framework for assessing and reducing gender bias in large language models. Tang, K., et al. CCS '24: Proceedings of the 2024 on ACM SIGSAC Conference on Computer and Communications Security, 2024, 1196-1210 (2024).
  31. BiasAlert: A plug-and-play tool for social bias detection in LLMs. Fan, Z., Chen, R., Xu, R., Liu, Z. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, 2024, 14778-14790 (2024).
  32. Social bias frames: Reasoning about social and power implications of language. Sap, M., Gabriel, S., Qin, L., Jurafsky, D., Smith, N. A., Choi, Y. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, 58, 5477-5490 (2020).
  33. Echterhoff, J., Liu, Y., Alessa, A., McAuley, J., He, Z. Cognitive bias in decision-making with LLMs. Findings of the Association for Computational Linguistics: EMNLP 2024. 2024, 12640-12653 (2024).
  34. Furniturewala, S., et al. Thinking fair and slow: On the efficacy of structured prompts for debiasing language models. arXiv. , (2024).
  35. Dong, X., Wang, Y., Yu, P. S., Caverlee, J. Disclosure and mitigation of gender bias in LLMs. arXiv. , (2024).
  36. Investigating bias in LLM-based bias detection: Disparities between LLMs and human perception. Lin, L., Wang, L., Guo, J., Wong, K. 31st International Conference on Computational Linguistics, 31, 10634-10649 (2025).
  37. OpenAI. GPT-4 technical report. arXiv. , (2023).
  38. Kamruzzaman, M., Kim, G. L. Prompting techniques for reducing social bias in LLMs through system 1 and system 2 cognitive processes. Proceedings of Recent Advances in Natural Language Processing. 2024, 511-520 (2024).
  39. Gemini Team. Gemini: A family of highly capable multimodal models. arxiv. , (2023).
  40. Hida, R., Kaneko, M., Okazaki, N. Social bias evaluation for large language models requires prompt variations. Find Assoc Comput Linguist: EMNLP 2025. , 14507-14530 (2025).
  41. Measuring and mitigating gender bias in contextualized word embeddings. Kamboj, P., Kumar, S., Goyal, V. Proc IEEE Int Conf Blockchain Distrib Syst Secur, , (2023).
  42. Raffel, C., et al. Exploring the limits of transfer learning with a unified text-to-text transformer. J Mach Learn Res. 21, 1-67 (2023).
  43. In-contextual gender bias suppression for large language models. Oba, D., Kaneko, M., Bollegala, D. EACL 2024 - 18th Conference of the European Chapter of the Association for Computational Linguistics, Findings of EACL 2024, 2024, 1722-1742 (2024).
  44. Mahajan, A., Obermeyer, Z., Daneshjou, R., Lester, J., Powell, D. Cognitive bias in clinical large language models. npj Digit Med. 8 (1), 1-4 (2025).
  45. Huang, D., Bu, Q., Zhang, J., Xie, X., Chen, J., Cui, H. Bias testing and mitigation in LLM-based code generation. ACM Trans Softw Eng Methodol. , (2025).
  46. Tjuatja, L., Chen, V., Wu, S. T., Talwalkar, A., Neubig, G. Do LLMs exhibit human-like response biases? A case study in survey design. arXiv. , (2024).
  47. Houlsby, N., et al. Parameter-efficient transfer learning for NLP. arXiv. , (2019).
  48. Dettmers, T., Pagnoni, A., Holtzman, A., Zettlemoyer, L. QLoRA: Efficient finetuning of quantized LLMs. arXiv. , (2023).
  49. Xiao, H., Xiang, Z., Wang, D., Devadas, S. A Theory to instruct differentially-private learning via clipping bias reduction. IEEE Symposium on Security and Privacy (SP). , (2023).
  50. Kamboj, P., Kumar, S., Goyal, V. Mitigating Social Bias in Generative AI: A comprehensive review. KSII Trans Internet Inf Syst. 19 (10), 3372-3394 (2025).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Видео скоро будет доступно

Похожие статьи