$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Крупные языковые модели обладают огромным реверберацией как инструменты для поддержки различных задач, включая принятиерешений 1,2,генерацию текста 3, переводтекста 4, анализ настроенийклиентов 5, ответына вопросы 6 и создание клиническихотчётов 7. В последнее время произошло несколько случаев, когда приложения использовали LLM для создания контента, наносящего вред социально неблагополучным людям илигруппам 8,9,10. Основная причина таких банальных ответов заключается в том, что эти модели обучаются на наборах данных, которые по своей природе содержат общественные предубеждения, связанные с расой, гендером, социально-экономическим классом и подобными факторами. Но то, что вы имеете в виду под «предвзятостью» и «справедливостью» в системе ИИ в здравоохранении, может быть субъективным и зависеть от контекста. Исследователи приложили значительные усилия для смягчения социальных предвзятостей вLLM 11,12; Однако дальнейшее совершенствование остаётся необходимым. Исследователи предложили несколько стратегий смягчения предвзятости, которые можно классифицировать как предварительную, в процессе, постобработку или их комбинации в различных областях применений. Эта классификация основана на этапе, на котором принимаются меры смягчения. Этот протокол объединяет все три стратегии для борьбы с социальной предвзятостью в шести вариантах LLM и исследует снижение предвзятости по четырём социальным измерениям: гендер, профессия, раса и религия. Во-первых, с использованием техники расширения данных разрабатывается набор выводов, чтобы LLM могли генерировать выводы. Во-вторых, двенадцать типов заданий разработаны для получения стереотипных ответов у LLM. В-третьих, Llama-2-7B13, Mistral-7B14 иDolly-7B 15 тонко настраиваются на наборе данных, содержащем беспристрастные предложения по четырём социальным категориям: гендер, раса, профессия и религия, чтобы Llama-2-7BFinetuned, Mistral-7BFinetuned и Dolly-7BFinetuned, соответственно. Наконец, выводы делаются, побуждая отточенные LLM исследовать свою эффективность в даче справедливых ответов.
Мы сформулировали следующие исследовательские вопросы и рассмотрели их в этой статье. Для каждого сформулированного исследовательского вопроса (RQ) формировались нулевая гипотеза (H0) и альтернативная гипотеза (H1).
RQ1: Эффективны ли набор данных вывода и базовые методы подсказки для оценки общественных предубеждений в LLM? Нулевая гипотеза (H01): Оценки смещения, полученные из набора выводов в сочетании с базовыми подсказками, статистически неотличимы от базовых оценок смещения LLM. Альтернативная гипотеза (H11): Оценки смещения из набора выводов с базовыми подсказками статистически существенно отличаются от базовых оценок смещения LLM. Для проверки гипотезы был курирован набор данных NeutralSet путём модификацииStereoSet 16 и оценки каждого LLM с использованием базовых методов подсказки для оценки его способности давать нестереотипные ответы. В наших сеттингах мы включаем шесть базовых подсказок — Standard (нулевое задание для инструктажа LLM делать выводы), Chain-of-Thoughts (CoT предназначен для того, чтобы LLM пошагово думал и делать выводы), System1 (подсказка, позволяющая LLM быстро думать при ответе), System2 (подсказка, заставляющая LLM думать медленно и вдумчиво), Human Persona 1 (HP1 предназначен для того, чтобы LLM принял личность человека, который быстро сообразяет при принятии решений), и Human Persona 2 (HP2 создан для того, чтобы LLM принял человеческую идентичность, которая думает медленно и вдумчиво, отвечая).
RQ2: Эффективны ли методы устранения предвзятости для выявления и снижения общественных предвзятостей в LLM? Нулевая гипотеза (H0₂): Методы устранения предвзятости неэффективны для выявления и смягчения общественных предубеждений в LLM. Альтернативная гипотеза (H12): Измеренные оценки смещения значительно снижаются при использовании методов устранения предвзятости в LLM. Мы исследуем влияние дебизированных вариантов базовых запросов на три открытых LLM для достижения справедливой генерации текста, свободного от какой-либо социальной дискриминации.
RQ3: Можно ли дополнительно снизить общественные предубеждения, доработав LLM? Нулевая гипотеза (H03): Тонкая настройка LLM не снижает общественные предвзятости дальше, чем сокращения, достигнутые только методами подсказки. Альтернативная гипотеза (H13): Тонкая настройка LLM дополнительно снижает общественные предвзятости, выходящие за рамки снижения, достигнутых только методами подсказки. Чтобы ответить на этот вопрос, мы модифицируем наборданных 17 и тонко настраиваем LLM на нём, чтобы дополнительно оценить влияние тонкой настройки на снижение стереотипных откликов.
Рисунок 1 иллюстрирует влияние вариации подсказок и тонкой настройки LLM на гендерно-нейтральный прогнозируемый результат. Новизна нашей работы заключается в интеграции ручного курирования наборов данных, множества стратегий устранения предвзятости и тонкой настройки в рамках единого протокола для анализа LLM с целью выявления и снижения общественных предвзятостей, что актуально для чувствительных реальных приложений, таких как медицинская визуализация и обслуживание ЭМК. Мы сгруппировали литературу по предвзятости в LLM в четыре направления: наборы данных для предвзятости и когнитивных ассоциаций; рамки обнаружения и оценки предвзятости; методы снижения предвзятости; и смещение в специализированных областях.
Исследователи постоянно генерируют наборы данных для оценки предвзятости и семантического анализа ассоциаций в LLM. Например, в когнитивной психологии и лингвистике свободные ассоциации всегда играют ключевую роль в организации концептуальных знаний. Моделируя ту же ассоциацию в латентном распределении LLM, Абрамски и др.18 создали набор данных LLM World of Words (LWOW). Набор данных LWOW English Free Association Norms, включающий миллионы ответов от трёх LLM: Mistral-7B14, Llama-3.1-8B19 и Claude-3-5-haiku-latest20. Он вдохновлён Small World of Words (SWOW)21 — крупнейшим набором данных по нормам свободных ассоциаций в человеческом английском языке, который широко применяется в различных психологических и лингвистических исследованиях. Кроме того, LWOW помогает построить когнитивную сеть, состоящую из узлов, каждый из которых представляет слово, с узлами, соответствующими семантически похожим словам, расположенным ближе друг к другу в сети. Это помогает оценить смещение в результатах LLM, оценивая расстояние между словами в искусственной когнитивной сети как ключевую метрику. Одной из главных проблем при использовании проприетарных LLM является недоступность их внутренних устройств. Хотя в этих моделях были предприняты значительные усилия для устранения смещения, наборы данных по выравниванию всё ещё редки. Для решения этой проблемы в Zhang et al.22 предложен набор данных под названием GenderAlign для снижения гендерной предвзятости в LLM. UnStereoEval23, эталонный набор данных, предлагается для изучения стереотипных гендерных предубеждений в профессиях и эмоциях. Их результаты показывают низкий уровень справедливости в 28 различных LLM. Бартл иЛиви 24 разработали набор данных Tiny Heap, в котором предложения с стереотипными упоминаниями заменены их нейтральными аналогами и доработаны три языковые модели (GPT-225, PHI-1.526 и RoBERTa27). В своих результатах наблюдается значительное снижение гендерно-стереотипных тенденций моделей.
Было предложено несколько многоуровневых фреймворков для выявления и снижения искажений в LLM. В Raza и др.28 предложена структура NBIAS, включающая четыре уровня: создание наборов данных, разработка моделей, снижение смещения и оценку. Набор данных внутри фреймворка создан из различных областей, включая здравоохранение, социальные сети и порталы по трудоустройству. Они демонстрируют эффективность своей модели, превосходя базовый уровень (BERT 29) на 1%–8% по справедливости. В другой такой структуре,GenderCARE 30, предлагается стратегия по снижению гендерной предвзятости в LLMS. В рамках обширной экспериментальной системы они эффективно снизили гендерную предвзятость в среднем на 35% в двенадцати различных LLM. Фреймворк BiasAlet31 автоматически обнаруживает социальную предвзятость в открытом тексте, генерируемом LLM. Она имеет некоторые ограничения: во-первых, исследование проводится на синтезированном наборе данных из-за отсутствия бенчмарка для оценки смещения при генерации открытого текста LLM, а во-вторых, оно построено на устаревшем наборе данныхSBIC 32, что затрудняет различие между значимостью неявного искажения и смещения в самом наборе данных. Смещение в техноручных данных может быть введено в модели, обученные на них. Использование таких моделей вызывает споры в профессиях с высокими ставками, где их результат может негативно сказываться на неблагополучных группах. Для решения этой задачи разработана структураBiasBuster 33 для обнаружения, оценки и смягчения когнитивных искажений в LLM. В соответствии с этим, в другой работе34 исследователи предлагают интерактивную структуру для генерации справедливого, логичного и критического текста с помощью подсказок Системы 2 (предназначенных для того, чтобы LLM мог мыслить вдумчиво и медленно), которые дополняют самоотточенные и импликативные подсказки. Однако фреймворк ограничен задачами внутри латентного пространства LLM. Донг и др.35 разрабатывают фреймворк, использующий косвенное исследование для смягчения и оценки гендерных предубеждений в десяти открытых LLM. В своём методе исследования, не используя прямые стереотипные упоминания, они выявляют косвенную гендерную предвзятость.
Лин и др.36 исследуют политическую предвзятость в генерации текста LLM как для закрытых (GPT-3.5-turbo иGPT-4 37), так и для открытых моделей (Llama-2-7B13, Mistral-7B14,Vicuna 29). Они определяли, вызывает ли текст, сгенерированный моделью, смещение СМИ с левым или правым уклоном. Кроме того, они разработали стратегию смягчения последствий, доработав модель и предоставив дополнительные депресированные подсказки при генерации текста. После применения метода смягчения смещения модель обычно генерирует нейтральный текст; Левые или правые СМИ на это не влияют. В соответствии с этим Радж и др.17 предложили решение для устранения предвзятости — социальное дебиасирование (SCD), основанное на гипотезе контакта в психологии, включающее генерацию подсказок, охватывающую идеологии различных социальных групп для снижения предвзятости при генерации текстов трех открытых LLM. Параллельно с этим Камруззаман иКим 38 предложили метод социальной депредатизации, который использует цепочку мышления Системы 1 и Системы 2 для смягчения по двенадцати измерениям смещений в пяти LLM (GPT-3.5,GPT-4 37, Llama-2-7B13, Mistral-7B14 и Gemini-1.039). Здесь запрос System 1 предназначен для быстрого ответа LLM, а запрос System 2 — для более продуманных и взвешенных ответов. Хотя проводились различные исследования, использующие инженерию подсказок для снижения смещения в LLM, мало кто изучал влияние вариаций prompt на результат LLM. Для решения этой проблемы Хида и др.40 исследовали чувствительность выходных данных двенадцати открытых LLM для стимулирования вариаций и проанализировали их влияние на производительность задач и компромиссы по смещению. Их результаты показывают, что результаты удаления предвзятости чувствительны к заданию; меньшее смещение в результатах моделей приводит к снижению производительности задач. Камбодж и др.41 предложили подход постобработки для смягчения гендерной предвзятости в контекстуализированных вложениях модели T5 (модель Text-to-text-Transfer-Transformer42). Оба и др.43 предоставляют вручную созданные текстовые преамбулы в качестве подсказок к LLM, чтобы подавить их предвзятое генерирование.
Когнитивные искажения, которые десятилетиями были источником диагностических ошибок в здравоохранении, рискуют быть запечатлены и усилены крупными языковыми моделями (LLM) при принятии клинических решений. Для борьбы с этим риском Махаджан и др.44 предлагают, чтобы стратегии смягчения последствий при внедрении этих технологий были сосредоточены на трёх темах: во-первых, саморефлексии (итеративная переоценка результатов), во-вторых, контекстуальное мышление (с использованием полной истории пациентов и основанных на доказательствах рекомендаций), и, наконец, прозрачные следы рассуждений (объяснения процессов рассуждений, предоставляемые для аудита). LLM, обладающие их повсеместной возможностью, теперь также широко используются для генерации программного кода. Поэтому для исследователей важно изучать негативные последствия любых социальных предвзятостей в сгенерированном коде. Если такое смещение обнаружено, необходимо разработать соответствующие методы снижения. В том же направлении Хуанг и др.45 предложили метод оценки и смягчения социальных предвзятостей и протестировали её на пяти широко используемых LLM. В последнее время мы наблюдаем огромный прогресс в архитектурах LLM и их способности генерировать ответы, звучащие как человек. Вопрос о том, могут ли LLM служить прокси для человека при принятии решений, остаётся недостаточно изученным и требует дальнейших исследований. В этом направлении Tjuatja и др.46 созданы рамки и набор данных для изучения способности LLM давать ответы, похожие на человека, в опросной анкете.
Несмотря на эти достижения, три исследовательских пробела сохраняются. Во-первых, предыдущие исследования обычно сосредоточены на узких типах предвзятости (например, гендерные или политические) или на конкретных областях (например, на конкретной теме). Во-вторых, хотя инженерия подсказок широко распространена, немногие исследования изучают влияние систематических вариаций подсказок на результат LLM. В-третьих, ограниченные исследования направлены на устранение предвзятости в сложной системе тонкой настройки с ограничением ресурсов в открытых LLM, релевантных для критически важных областей, таких как здравоохранение. Для устранения этих пробелов представлен единый протокол по снижению и оценки смещения, который может помочь измерить стереотипные смещения в различных архитектурах моделей, включая тонкую настройку в условиях вычислительных ограничений и оценку устойчивости решений моделей с учетом метрик смещения.