Исследовательская статья

Семантическая система ответов на вопросы с закрытой доменной областью как вариант использования BERT-моделей на основе трансформаторов

DOI:

10.3791/69424

14 ноября 2025 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом исследовании разрабатывается адаптивная система обучения для извлечения знаний из текста для ответов на вопросы, сравнивая модели Google-BERT, DistilBERT, RoBERTa и TF-IDF с использованием косинусного сходства, по задержке и семантической обобщению. Google-BERT работает лучше всего, хотя система остается чувствительной к орфографическим ошибкам, подчеркивая необходимость строгой предварительной обработки для практического применения.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Чтобы извлекать знания из текстовых файлов и отвечать на вопросы пользователей, находя нужную информацию в контексте, для этой цели разработана адаптивная система обучения, такая как система ответов на вопросы (QAS). Этот акцент способствует дальнейшему изучению систем прямых ответов и использованию крупномасштабных тестов для заданий на вопросы (QA). Чтобы облегчить эту задачу, набор семантических данных с закрытой областью (SCD-QA), который включает в себя как фактоидные, так и нефактоидные вопросы, используется в сочетании с предварительно обученными моделями трансформеров. В этом исследовании измеряется и сравнивается способность делать выводы между тремя предварительно обученными моделями трансформеров, такими как Google-BERT, DistilBERT и RoBERTa, на наборе данных SQuAD, и классической моделью TF-IDF на основе ключевых слов с косинусным сходством. Результаты показывают, что Google-BERT работает лучше всего, со средним показателем точного совпадения (EM) 90,0 и средней задержкой 1,27 с. Система также хорошо справляется с вопросами с синонимами, демонстрируя четкое понимание смысла. Но он неадекватно справляется с вопросами с орфографическими ошибками, что указывает на то, что он чувствителен к орфографическим ошибкам и требует лучшей ранней обработки при использовании.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Обработка естественного языка (NLP) — это подобласть искусственного интеллекта (ИИ), в которой может быть создана система контроля качества, позволяющая компьютерным системам автоматически генерировать ответы на вопросы1. НЛП в первую очередь фокусируется на понимании и интерпретации письменной речи таким образом, чтобы она имитировала когнитивные процессычеловеческого мозга. Участие в решении этих задач делает НЛП ключевым методом в построении системы, способной генерировать человеческие реакции.

QAS, который отвечает на вопросы пользователя, является одним из примеров использования NLP3. QAS — это область изучения, которая включает в себя исследования из различных областей с общими проблемами, таких как поиск информации (IR), извлечение информации (IE) и NLP. В настоящее время современные поисковые системы в основном выполняют задачи поиска документов4. Другими словами, при наличии конкретных ключевых слов эти поисковые системы выдают исключительно список релевантных документов, ранжированных на основе релевантности и содержащих указанные ключевые слова. Они не дают точного ответа. Цель QAS состоит в том, чтобы помочь людям найти точные ответы на конкретные вопросы в ограниченных предметных областях5. Группировка QAS может быть выполнена на основе следующих категорий, показанных на рисунке 1: 6. Как фактоидные, так и нефактоидные QAS работают с использованием естественного языка (NL) и предназначены для ответа на вопросы, поставленные на NL. Система использует методы NLP для предоставления ответов на основе имеющегося корпуса7.

Рисунок 1
Рисунок 1: Категоризация систем QA. На рисунке показана интеллект-карта основных компонентов системы контроля качества. В центре находится система контроля качества, которая обрабатывает различные типы вопросов, включая фактоиды, не-фактоиды, гибриды, визуальные, разговорные вопросы и вопросы с несколькими вариантами ответов. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

В этом исследовании представлена семантическая система ответов на вопросы в закрытой области (SCD-QA) для ответов пользователям в NL о политике и процедурах приема на докторскую степень. Система использует правила и нормы для получения степени доктора философии PDF8 в качестве основного контекста и реализует модель Bidirectional Encoder Representations from Transformers (BERT)9 на основе трансформаторов в качестве основной основы для генерации ответов. Цель состоит в том, чтобы разработать семантически разговорный QAS на основе часто задаваемых вопросов, который предоставляет точные ответы на распространенные вопросы, облегчая вновь поступившим студентам быстрый поиск необходимой им важной информации.

Для достижения этой цели были использованы три широко известные модели BERT на основе трансформаторов: Google-BERT9, DistilBERT10,11 и RoBERTa 12,13, все они были обучены на Стэнфордском наборе данных для ответов на вопросы (SQuAD)14. Их производительность оценивалась с помощью двух критических параметров: семантического соответствия, измеряемого с помощью Exact Match (EM)14, и модели Latency15, анализируемой по среднему времени реакции. Кроме того, для хранения семантических встраиваний использовалась векторная база данных (VD)16,17, облегчающая извлечение наиболее семантически релевантного контекста для вопроса пользователя на основе оценок семантического сходства.

Обзор литературы

Модели на основе трансформаторов пересмотрели область NLP, что привело к значительным улучшениям в QAS. С введением стандарта BERT9 было подчеркнуто, что архитектура трансформаторов является важным компонентом в разработке надежного и точного контроля качества. В этом разделе представлен всесторонний обзор последних усовершенствований в моделях на основе трансформеров и семантических встраиваниях, с акцентом на их релевантность для контроля качества семантического диалогового диалога (SeCD). Сравнительный анализ проводится для обоснования интеграции этих моделей в данной работе, подчеркивая их жизнеспособность для получения значимых идей в полевых условиях.

Архитектуры на основе трансформеров, такие как BERT, DistilBBERT и RoBERTa, используют методологию самовнимания для захвата сложных контекстуальных отношений в тексте, что делает их идеальными для задач, требующих значительного семантического понимания, таких как контроль качества. Эти модели, наряду со специализированными преобразователями предложений, генерируют семантические встраивания, помогают обеспечить быстрое и точное извлечение контекста с помощью векторного поиска сходства в SeCD QA. Недавние исследования сосредоточены на улучшении этих моделей и внедрении методов для повышения пропускной способности, масштабируемости и эффективности, особенно для конкретных задач, таких как SCD-QA.

Сенгупта и др.18 представили творческий подход к усилению QAS с множественным выбором ответов (MCQAS) для научно обоснованных вопросов путем тонкой настройки моделей BERT. В своей структуре они сначала оценили распределенное семантическое сходство между парами вопрос-ответ, а затем ввели эти оценки сходства вместе с исходными признаками в классификационный слой. Этот комбинированный подход позволил получить оценку F1 90,2% по набору данных SciQ, что подчеркивает эффективность BERT в QAS для конкретных задач, которые требуют тонкого понимания и точной классификации.

Cichecki et al.19 сравнили ChatGPT и тонко настроенные модели BERT для интеллектуальных систем поддержки проектирования и обнаружили, что точно настроенные модели BERT превосходят большие языковые модели общего назначения (LLM), такие как ChatGPT, в задачах, специфичных для предметной области, достигнув оценки F1 88,5% на специально разработанном наборе данных. Исследование показывает важность предметно-ориентированной тонкой настройки для повышения производительности моделей в специализированных приложениях.

Guo et al.20 рассмотрели эффективность стратегий тонкой настройки для QAS для конкретных задач в условиях ограниченных бюджетов аннотаций. Их работа показала, что двойной подход к тонкой настройке — сначала на общем наборе данных QA, таком как SQuAD, с последующей тонкой настройкой на наборе данных для конкретной задачи — приводит к значительному повышению оценки F1 на 15% по таким наборам данных, как COVID-QA. Этот вывод подчеркивает критическую роль последовательной тонкой настройки в повышении производительности систем контроля качества SeCD.

Pudasaini и Shakya21 изучили применение точно настроенных моделей BERT для обеспечения качества в биомедицинских исследовательских работах, сообщив о баллах EM и F1 83,89% и 89,67% соответственно на пользовательском наборе данных биомедицинского QA, полученном от PubMed. Используя трансферное обучение с PubMedBERT, их метод продемонстрировал заметную способность обрабатывать сложные биомедицинские запросы, подчеркивая потенциал тонкой настройки для конкретных задач в этой области.

Baek et al.22 предложили фреймворк Knowledge-Augmented Language Model Prompting для нулевого сканирования Knowledge Graph (KG) QA. Этот подход использует семантическое сходство для извлечения релевантных фактов из KG и включает их во входной вопрос. В результате она достигла оценки F1 примерно 85% по наборам данных KG-QA. Работа иллюстрирует потенциал объединения КГ и моделей трансформаторов, подчеркивая преимущества расширения знаний для повышения эффективности контроля качества.

Hu et al.23 описали QAS, разработанную для домена регистрации домашних хозяйств, используя KG вместе с моделями на основе BERT (RoBERTa-BiLSTM-MultiHeadAttention) для классификации намерений и семантического анализа. За счет упрощения вопросов до сущностей одного события и отношений намерений была достигнута высокая точность запросов к структурированным данным. Кроме того, масштабируемость методологии на другие области подчеркивает ее потенциал для широкого применения в системах контроля качества на основе KG.

Luo et al.24 представили схему на основе BERT для обеспечения качества базы знаний (KB), интегрируя модель многогранулярного обрезания (MGPM) с вниманием к отношениям. Их подход достигает значительной точности в 94,4% в SimpleQuestions, 68,6% в WebQuestionsSP и 63,7% в WebQuestions. Эти результаты показывают эффективность BERT в использовании семантического сходства для запросов структурированных данных. В целом, данное исследование подчеркивает потенциал моделей на основе трансформаторов для KB-QA, особенно в сценариях, где важна точная идентификация сущностей и отношений.

Wu et al.25 разработали фреймворк генерации с расширением поиска для обеспечения качества в управлении строительством, уделяя особое внимание запросам на безопасность и соответствие требованиям. Благодаря интеграции семантических встраиваний на основе BERT с моделью генеративного трансформатора и KG для конкретной задачи, их подход достиг оценки F1 88,7% в наборе данных QA, связанном со строительством. Это исследование демонстрирует потенциал сочетания семантического понимания с извлечением данных на основе KG для повышения точности набора данных контроля качества для конкретных задач для управления строительством.

Peng et al.26 систематически оценивали LLM, включая модели на основе BERT и GPT, для обеспечения медицинского контроля. Объединив контекстуальное понимание BERT и генеративные способности GPT, они использовали генерацию с дополнением к извлечению и тонкую настройку для конкретной области, чтобы достичь оценки F1 86,2% на наборе данных из PubMed и клинических заметках. Это исследование подчеркивает потенциал ансамблевых моделей для повышения точности выводов в здравоохранении, где критически важны как контекст, так и точная генерация.

Гардази и др.27 рассмотрели использование BERT в задачах NLP, таких как контроль качества, анализ тональности и распознавание именованных сущностей (NER). Их анализ показал, что точно настроенные модели BERT достигают баллов F1 85%-92% в наборах данных QA, специфичных для конкретных задач, таких как SQuAD. Это показывает, что BERT надежно создает эффективные контекстуальные встраивания и добавляет KG, что делает его хорошо подходящим для SeCD QAS.

Модели на основе трансформаторов стали решающим выбором для систем контроля качества SeCD благодаря их уникальной способности захватывать контекстно-зависимую обработку, эффективно масштабироваться и адаптироваться к задачам, специфичным для предметной области. Таблица 1 иллюстрирует это решающее преимущество путем сравнения моделей на основе трансформаторов с альтернативными методами, рассмотренными в данном исследовании 18,20,22,23,24,25.

ПодходКлючевые особенностиПреимуществаОграниченияМетрики производительности (SQuAD)Пригодность для вариантов использования
Модели на основе трансформаторов (BERT, RoBERTa, DistilBERT)Двунаправленное контекстное моделирование, самовнимание, тонкая настройка на предметно-ориентированных данных 16, 17, 19, 24, 25Высокая точность, надежное семантическое понимание, масштабируемость с векторными базами данных 18, 20, 22, 24, 25Более высокие вычислительные затраты, требует предварительного обучения 17, 18EM: 80–90%, F1: 85–93% 16, 17, 19, 24, 25Идеально подходит для систем Closed Domain (CD) -QA, FAQ и семантического поиска 16, 17, 19, 20, 22, 24, 25
Традиционные системы, основанные на правилахПравила, созданные вручную, сопоставление ключевых слов 16Низкие вычислительные затраты, простая реализация 16Ограниченная масштабируемость, плохая обработка сложных запросов 16, 18ЭМ: 50–60%, F1: 55–65% 16Базовое QAS со структурированными данными 16
Рекуррентные нейронные сети (РНС)Последовательная обработка, архитектуры LSTM/GRU 19Умеренная производительность при выполнении последовательных задач 19Проблемы с дальнодействующими зависимостями, более медленный вывод 19, 9EM: 65–75%, F1: 70–80% 19Общие задачи NLP, менее эффективны для CD-QA 19, 9
Поисковые системы на основе ключевых словАлгоритмы TF-IDF, BM25 18, 22Быстрое извлечение, низкое потребление ресурсов 18, 22Ограничено совпадением на поверхностном уровне, плохое понимание семантики 18, 22EM: 40–50%, F1: 45–55% 18, 22Поиск документов, не подходит для точного QAS 18, 22
Сверточные нейронные сети (СНС)Извлечение локальных признаков, сверточные слои 25Эффективность для классификации коротких текстов, быстрый вывод 25Ограниченное понимание контекста, менее эффективно для сложных QAS 25EM: 60–70%, F1: 65–75% 25Классификация текста, не идеальная для CD-QA 25
Графовые нейронные сети (GNN)Моделирование на основе графов, реляционные рассуждения 20Эффективен для многоскачковых рассуждений, фиксирует связи между документами 20Высокая вычислительная сложность, требуются структурированные данные 20ЭМ: 70–80%, F1: 75–85% 20QAS с несколькими переходами, менее подходящий для одноконтекстного CD-QA 20
Системы на основе графов знанийСтруктурированное представление знаний, связывание сущностей 21Устойчив к запросам структурированных данных, использует внешние знания 21Требуются предварительно созданные графы знаний, ограниченные известными сущностями 21ЭМ: 65–75%, F1: 70–80% 21Предметно-ориентированный контроль качества со структурированными данными 21
Модели с дополненным вниманиемУсиленные механизмы внимания, контекстно-ориентированная обработка 24Улучшенная фокусировка на релевантных текстовых сегментах, высокая точность 24Более высокие вычислительные затраты, сложная реализация 24EM: 85–90%, F1: 88–92% 24Комплексные вопросы CD-QA, нефактоидные вопросы 24
Модели с мешком словЧастотное представление слов 22Простой, облегченный в вычислительном отношении 22Плохое семантическое понимание, неэффективно для сложных запросов 22, 25ЭМ: 35–45%, F1: 40–50% 22Базовое извлечение текста, не подходит для QAS 22, 25
Гибридные нейронные модели (CNN+RNN)Сочетает в себе локальную и последовательную обработку 25Баланс между местным и контекстуальным пониманием 25Умеренная сложность, трудности с длинными контекстами 25EM: 68–78%, F1: 72–82% 25Общие задачи НЛП, умеренно подходит для CD-QA 25
Статистические языковые моделиВероятностные словесные ассоциации 18Быстрый для простых запросов, низкое потребление ресурсов 18Ограниченное понимание контекста, плохая масштабируемость 18ЭМ: 45–55%, F1: 50–60% 18Базовый QAS, не подходит для сложных CD-QA 18

Таблица 1: Сравнение моделей на основе трансформаторов с другими подходами к QAS. В таблице представлено параллельное сравнение различных подходов к системам обеспечения качества, включая модели на основе трансформаторов, системы, основанные на правилах, RNN и другие. В нем обобщены их основные особенности, сильные и слабые стороны, производительность на SQuAD и задачи, для которых они лучше всего подходят, такие как CD-QA, семантический поиск и классификация текста.

Основной целью данного исследования является расширение доступа студентов к институциональной информации путем разработки эффективных, масштабируемых и точных систем SCD-QA в NLP. В частности, в этом подтверждающем исследовании применяются и проверяются предварительно обученные модели на основе трансформаторов в рамках политики приема на соискание ученой степени доктора философии. Цель состоит в том, чтобы продемонстрировать их эффективность и практическую осуществимость путем включения семантического сопоставления, оценки задержки модели и семантического извлечения на основе VD. Этот подход предлагает глубокий анализ для получения точных, специфичных для предметной области ответов в узком институциональном контексте. На рисунке 2 показана целостная архитектурная структура системы.

Рисунок 2
Рисунок 2: Общая схема системы SCD-QA. На рисунке показана блок-схема системы контроля качества, использующей большие языковые модели (LLM). Он начинается с файла контекста и вопроса пользователя, которые обрабатываются тремя моделями: Google-BERT, DistilBERT и RoBERTa, а также одной моделью, основанной на ключевых словах: TF-IDF. Система оценивает производительность каждой модели с помощью контрольного списка, а затем на основе результатов выбирает лучшую. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Всесторонняя теоретическая база

Компонент QAS: Фреймворк QAS состоит из трех сегментов, как показано на рисунке 3: i) модуль обработки вопросов (QPM), ii) модуль обработки документов (DPM) и iii) модуль извлечения и формулировки ответов (AEFM). Система получает вопросы, которые делятся на две основные категории: Фактоиды и Не-Фактоиды. В вопросах на основе фактов обычно используются вопросительные слова, такие как «что», «где», «когда» или «кто», в то время как в вопросах, не относящихся к фактоидам, используются такие слова, как «как» и «почему».

DPM: Из предоставленного списка пользователь может выбрать конкретный отрывок. Затем каждый токен в отрывке помечается тегом с помощью теггера части речи (POS). Чтобы извлечь глаголы, определите все лексемы, помеченные как глаголы. Объедините эти глаголы со списком нетрадиционных глаголов и примените логику для правильных глаголов. Создайте структуру данных (массив), содержащую извлеченные глаголы, их времена и формы -ing.

QPM: Система получает входные данные в виде вопроса от пользователя. Текст размечается с помощью класса StringTokenizer, а полученные токены хранятся в отдельной структуре данных. Затем эта структура данных возвращается для дальнейшего использования в рамках программы.

AEFM: Первый шаг – это определение глагола в данном вопросе. Недавно идентифицированный глагол сопоставляется с маркерами, созданными на этапе обработки документа. Выбранный случай для конкретного типа фактического вопроса (например, что или когда) используется для извлечения и построения ответа более точным образом.

Прежде чем выбрать тип опроса, пользователю сначала предлагается выбрать отрывок по своему выбору. QPM отвечает за обработку вопроса пользователя и его переадресацию в AEFM. AEFM использует извлечения, полученные из DPM, и обработанные документы, содержащие помеченный формат исходного входного документа. Модуль передаст необходимые алгоритмы в модуль формулировки для получения желаемого ответа.

Рисунок 3
Рисунок 3: Компоненты QAS. На рисунке показан четырехэтапный процесс работы системы контроля качества: вопрос, обработка вопроса, обработка ответа и ответ. В разделе «Обработка вопросов» система классифицирует вопрос. В Answer Processing он находит и анализирует документы и отрывки для получения ответа. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Модель BERT: Чтобы обнаружить связи между словами в тексте, метод BERT использует преобразователь. В трансформаторе есть два механизма - энкодер и декодер28, но для BERT нужен только энкодер. BERT использует двусторонний подход и систематически сканирует входной текст, чтобы самостоятельно изучить значение слов в их контексте. Кодировщик принимает в качестве входных данных ряд токенов, которые были векторизованы. Затем векторы подаются в нейронную сеть, которая создает серию векторов, отражающих входные данные. Вектор вывода слова изменяется в зависимости от предложения, в котором оно встречается. Вектор слова может меняться в зависимости от контекста, в котором оно появляется; например, «нравится» в «Он любит играть в крикет» имеет другой вектор, чем «нравится» в «Его лицо стало красным, как помидор». Этот подход начинается с этапа обработки текста, а затем переходит к этапу построения модели. Шаги, которые BERT предпринимает для обработки текста, обсуждаются в следующем разделе28.

Обработка текста: Модель BERT представляет собой входной текст в соответствии с заданным набором принципов. Кроме того, этот фактор способствует повышению производительности модели. Входное вложение в BERT состоит из амальгамы трех различных типов вложений28.

Вложения позиций (PE): Для изучения информации, связанной с заказами в вложениях, используются PE. ПЭ используются для восстановления информации о порядке, который был потерян в трансформаторах. BERT разрабатывает отдельные ПЭ специально для каждой точки входной последовательности. BERT обладает способностью передавать позиционную информацию о словах внутри предложения с помощью PE. Это позволяет BERT эффективно захватывать и представлять последовательность или порядок слов.

Встраивание предложений (SE): Кроме того, чтобы помочь модели различать первое и второе предложения, BERT изучает встраивание, которое является уникальным для каждого из них. Он также способен принимать парные предложения в качестве входных данных для таких действий, как QA.

Встраивание лексем (TEs): TE преподаются для каждой лексемы в словаре лексем WordPiece. Словарь лексем WordPiece состоит из единиц подслов, полученных из слов, найденных в корпусе. В качестве иллюстративного примера, этот словарный запас будет включать в себя все мыслимые подслова термина «вопрос», включая Questio, Questi и так далее.

Входное представление токена строится путем сложения его вложений на уровнях сегмента и позиции. Из-за этого именно обширный подход к встраиванию предоставляет в модель огромный объем информации. На рисунке 49 изображены вложения модели BERT.

Рисунок 4
Рисунок 4: Встраивания BERT. На рисунке показано, как создаются входные вложения для модели трансформатора. Он начинается с последовательности ввода: [CLS] небо [MASK] облачное [SEP] пойдет дождь [SEP]. Каждый токен в последовательности получает собственное вложение, например Ethe или E[MASK]. Затем для каждого предложения добавляются вложения, такие как EA для первого и EB для второго. Позиционные вложения, помеченные от E0 до E9, также включены для обозначения положения каждого токена. Все они объединяются для формирования окончательных входных вложений. Эта цифра была изменена с9Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Проектирование QAS с использованием BERT: В иллюстративных целях рассмотрим этот вопрос в сочетании с абзацем, взятым из статьи в Википедии о Футбольной лиге28.

Вопрос: Где была основана Футбольная лига?

Пассаж: В 1888 году в Англии была основана Футбольная лига, ставшая первым из многих профессиональных футбольных соревнований. В течение 20-го века несколько различных видов футбола стали одними из самых популярных командных видов спорта в мире.

Ответ: Англия

Модель BERT использует извлечение токенов как из вопроса, так и из контекста, а затем объединяет их в единый вход. Как уже говорилось ранее, процесс начинается с использования токена [CLS], который служит индикатором начала предложения. Кроме того, разделитель [SEP] используется для четкого разделения вопроса и отрывка. В дополнение к токену [SEP], BERT включает в себя SE для различения вопроса и отрывка28 , содержащего ответ. BERT использует два SE, один из которых посвящен вопросу, а другой – отрывку, чтобы установить четкое различие между ними. Впоследствии вложения комбинируются с одногорячим представлением28 лексем, чтобы различать вопрос и отрывок. Этот процесс проиллюстрирован на рисунке 5.

Рисунок 5
Рисунок 5: Входное представление BERT. На рисунке показано, как генерируются входные вложения для QAS на основе BERT. Он начинается с токена [CLS], затем следует вопрос Сколько? [SEP], и отрывок BERT large, каждый со своими вложениями предложений (A для вопроса, B для отрывка). Лексемы, предложения и позиционные вложения объединяются для получения окончательного ввода. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Впоследствии комбинированное встроенное представление28 вопроса и контекста используется в качестве входных данных в модели BERT. Последний скрытый слой BERT модифицируется для использования SoftMax для генерации распределений вероятностей. Эти распределения определяют начальный и конечный индексы подстроки во входном текстовом предложении, которое представляет ответ, как показано на рисунке 6, для визуального представления.

Рисунок 6
Рисунок 6: Рабочий процесс обработки BERT для QA. На рисунке показано, как работает модель BERT для QA. Он представляет собой последовательность ввода, которая включает вопрос, помеченный маркером классификации [CLS] в начале и маркером-разделителем [SEP] в конце, за которым следует контекст, разделенный другим [SEP]. Лексемы в этой последовательности превращаются во вложения. Затем модель прогнозирует начальную и конечную позиции ответа в отрывке. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Векторная база данных (VD): VD17,18 — это специализированная система для эффективного хранения, управления, индексации и запроса многомерных векторных представлений данных. Векторы часто генерируются на основе моделей глубокого обучения и инкапсулируют семантическую или контекстуальную информацию о данных. Каждое измерение вектора представляет определенный признак. Встраиваемые объекты — это числовые представления объектов, таких как текст, изображения, видео и аудио. Эти встраивания используются в различных приложениях, включая машинное обучение (ML), NLP, рекомендательные системы, компьютерное зрение и IR. VD упрощают эффективный поиск сходства и семантические запросы, группируя похожие объекты близко друг к другу в векторном пространстве. Facebook AI Similarity Search (FAISS)29 — это важная VD, используемая в этом исследовании для определения наиболее релевантного контекста для запросов пользователей. В таблице 2 приведены основные характеристики VD и варианты их использования.

ОсобенностьОписание
Многомерные данныеОбрабатывает данные с сотнями или тысячами измерений.
Приблизительное число ближайших соседей (ИНС)Обеспечивает быстрый поиск сходства путем аппроксимации расстояний.
МасштабируемостьПоддерживает крупномасштабные наборы данных с миллиардами векторов.
ИнтеграцияЧасто интегрируется с фреймворками и инструментами AI/ML для бесперебойных рабочих процессов.
Запросы в режиме реального времениОбеспечивает векторный поиск с низкой задержкой для интерактивных приложений.

Таблица 2: Основные характеристики ВД. В таблице представлены важные особенности VD. К ним относятся обработка многомерных данных, быстрый поиск сходства с использованием алгоритмов ИНС, масштабирование до больших наборов данных, работа с инструментами искусственного интеллекта и машинного обучения, а также поддержка быстрых запросов в режиме реального времени для интерактивного использования.

Метрики оценки эффективности: Система SCD-QA оценивалась с использованием двух основных показателей: EM score14 и Model Latency15. Оценка EM, стандартная метрика в исследованиях QA, оценивает точность прогнозов, измеряя долю прогнозируемых ответов, которые точно соответствуют истине. Для набора из N вопросов балл EM формально определяется в уравнении 1 следующим образом:

Уравнение 1где Уравнение 2 (1)

Эта метрика присваивает оценку 1 за точное совпадение с эталонным ответом и 0 за любую разницу.

Метрика Задержка количественно определяет общее время обработки, необходимое системе для создания ответа на отдельный запрос. Эта метрика вычисляется как среднее затраченное время по всем запросам, как показано в уравнении 2:

Уравнение 3 (2)

где Tstarti и Tendi — временные метки, обозначающие начало и окончание обработки i-го запроса соответственно. Задержка указывается в единицах s и отражает скорость отклика системы, охватывающую все этапы от обработки ввода до генерации ответа.

Метод

Для реализации SCD-QA в настоящий документ включены следующие тестовые исследования.

Набор данных SCD-QA: Предлагается набор данных30 для реализации системы SCD-QA. Этот набор данных получен на основе текстового корпуса, содержащего правила докторантуры на 2022 год8 для студенческих рекомендаций из NIT Аруначал-Прадеш, Индия. Чтобы создать систему SCD-QA, необходимо сгенерировать файл JSON, который будет включать в себя всю необходимую информацию в точном формате. Набор данных генерируется на основе текстового корпуса с помощью инструмента аннотаций Haystack (версия 2.18.1)31, фреймворка с открытым исходным кодом. Этот инструмент облегчает создание набора данных SCD-QA в стиле SQuAD14. Шаги по созданию аннотированного набора данных типа SQuAD из PDF-файла показаны на рисунке 7, а структура нашего набора данных в стиле SQuAD проиллюстрирована на рисунке 8.

Рисунок 7
Рисунок 7: Шаги по созданию аннотированного набора данных из PDF-файла. На рисунке показан пошаговый рабочий процесс создания аннотированного набора данных в стиле SQuAD с помощью инструментов Haystack. В нем описывается процесс, начиная с извлечения текста из PDF-файлов, очистки и разделения его на отрывки, ручного аннотирования пар вопрос-ответ, хранения аннотаций в формате SQuAD JSON и, наконец, экспорта набора данных для обучения модели. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Рисунок 8
Рисунок 8: Структура набора данных по контролю качества фактоидов. На рисунке показана структура данных JSON, представляющая собой параграф и пару QA из набора данных. В нем есть параграфический раздел, в котором содержится набор вопросов и ответов. Один из вопросов звучит так: «Какой минимальный балл требуется для поступления в докторантуру?» У каждого вопроса есть идентификатор и массив ответов. Ответ включает в себя идентификатор документа, идентификатор вопроса, текст 60% баллов, начальную позицию ответа и неуказанную категорию ответа. Флаг is_impossible установлен в значение false. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Набор данных структурирован в виде списка словарей, каждый из которых содержит ключевые поля, такие как данные, абзацы, вопрос, answer_id, document_id, question_id, текст, answer_start, answer_end, is_impossible и контекст.

data: Содержит общую информацию о вопросах и ответах.
параграфы: Конкретный контекст, вместе с его вопросами и ответами.
вопрос: Конкретный вопрос.
answer_id: уникальный идентификационный номер для каждого текста ответа.
document_id: уникальный идентификационный номер для каждого контекста.
question_id: уникальный идентификационный номер для каждого вопроса.
text: текст ответа.
answer_start: Начальное место правильного ответа в контексте.
answer_end: Место окончания правильного ответа в контексте.
is_impossible: Он показывает, доступен ли ответ на заданный вопрос в контексте или нет.
context: Текстовый корпус, из которого можно найти ответ.
Все 80 вопросов в предложенном наборе данных соответствуют формату фактоидных и нефактоидных вопросов. Примеры некоторых типов вопросов с рамками приведены в таблице 3.

Вопросы
Кто такой PS?
Каков размер шрифта современного документа?
Сколько дней в декретном отпуске?

Таблица 3: Пример вопроса из набора данных. В таблице приведены примеры двух типов вопросов: первый и второй являются фактоидными вопросами, а третий — нефактоидными вопросами.

FAISS: FAISS (версия faiss_cpu-1.9.0)29,32, разработанная Facebook AI Research (FAIR), представляет собой библиотеку с открытым исходным кодом, которая облегчает эффективный поиск сходства и кластеризацию плотных векторов. Он специально разработан для эффективного управления большими объемами данных. Эта система обеспечивает быстрый и масштабируемый поиск ИНС в наборах данных, содержащих миллионы или миллиарды векторов. Он широко используется в приложениях, связанных со встраиванием, включая NLP, рекомендательные системы, а также поиск изображений или видео. FAISS предлагает несколько методов индексации, включая плоский (грубая сила), инвертированный файл (IVF), иерархические навигационные графы малого мира (HNSW) и квантование продукта (PQ). Эти методы позволяют пользователям оптимизировать производительность поиска в соответствии с размером данных, размерностью и техническими характеристиками оборудования. В данном исследовании используется плоская индексация, которая выполняет перебор с использованием расстояния L2 (евклидово расстояние) для идентификации ближайших соседей. Масштабируемость системы поддерживает реализации как ЦП, так и ГП, обеспечивая высокопроизводительные вычисления для больших наборов данных. Кроме того, он обеспечивает гибкость для оптимизации баланса между скоростью и точностью в зависимости от конкретных требований приложения. FAISS часто используется в NLP для оценки семантического сходства во встраиваниях, таких как BERT или Word2Vec. FAISS используется в системе контроля качества для хранения и управления векторными представлениями документов или предложений. Он выполняет приблизительный поиск33 ИНС для извлечения наиболее релевантного контекста для вопросов пользователя, улучшая семантический поиск с помощью встраиваний из моделей преобразователей, таких как BERT. FAISS является фундаментальным инструментом в рабочих процессах искусственного интеллекта и машинного обучения благодаря своей универсальности.

Модель BERT-large-uncased-whole-word-masking-finetuned- SQuAD: В настоящей работе используется предварительно обученная языковая модель, известная как BERT-large-uncased-whole-word-masking finetuned-squad9 для разработки фактоидного QAS с использованием набора данных, предложенного в исследовании. Модель BERT прошла предварительное обучение на BookCorpus, наборе данных из 11 038 неопубликованныхкниг9, а также на английской Википедии, за исключением списков, таблиц и заголовков. Рассматриваемая модель не имеет регистра, что означает, что она не делает различий между словами english и english. Модель представляет собой предварительно обученную модель трансформатора, которая была обучена на значительном объеме данных на английском языке с использованием самоконтролируемого подхода. Модель была предварительно обучена исключительно на сырых текстах, без каких-либо человеческих аннотаций. Это позволяет ей использовать большой объем общедоступных данных. Процесс предварительного обучения включает в себя автоматическую генерацию входных данных и меток из предоставленных текстов. Модель обучалась с двумя конкретными целями9:

MLM: Процесс включает в себя случайную маскировку 15%9 слов во входном предложении. Затем модель обрабатывает все замаскированное предложение и предсказывает замаскированные слова. Этот подход отличается от обычных рекуррентных нейронных сетей (RNN), которые обычно обрабатывают слова последовательно, и от авторегрессионных моделей, таких как GPT, которые используют внутреннюю маскировку будущих токенов. Эта функциональность позволяет модели получить двунаправленное представление предложения.

НСП: На этапе предварительного обучения модель объединяет два замаскированных предложения в качестве входных данных. В некоторых случаях эти предложения соседствуют в оригинальном тексте, что указывает на прямую связь. В других случаях это не так, что означает, что нет никакой исходной близости или контекста, связывающего их. Следующий шаг включает в себя модель, предсказывающую, являются ли два предложения логически согласованными.

Данная модель характеризуется последующей конфигурацией: архитектура модели состоит из 24 слоев, со скрытой размерностью 1024. Он использует 16 головок внимания и имеет в общей сложности 336 миллионов параметров9.

WordPiece используется для токенизации текстов с размером словаря в 30 000 слов на этапах предварительной обработки. Входные данные модели будут выглядеть следующим образом: [CLS] Предложение A [SEP] Предложение B [SEP]. Единственное требование – общая длина объединенных предложений должна быть меньше 512 токенов9. Конкретная предварительно обученная модель дает последующие выходные данные: полученный балл F1 составляет 93,15 %, в то время как точный показатель совпадения составляет 86,91 %9.

Модель Distilbert/distilbert-base-cased-distilled-squad: Модель Distilbert10 является более компактным, быстрым и эффективным вариантом модели BERT9 , разработанным для сохранения большей части семантической способности BERT к пониманию, будучи при этом менее ресурсоемким и более подходящим для практических приложений с ограниченной вычислительной мощностью. Версия distilbert-base-cased-distilled-squad была доработана на SQuAD14 для задач QA. Модель использует архитектуру трансформатора, в том числе уменьшенный размер на 66 миллионов параметров по сравнению со 110 миллионами в BERT, сохраняя при этом 97% эффективности BERT в понимании языка. DistilBERT достигает этого с помощью метода, известного как дистилляция знаний, который передает информацию из более крупной модели BERT в более компактную модель DistilBERT. Благодаря меньшим размерам он может быстрее выводить информацию и использовать меньше памяти, что делает его идеальным для приложений с ограниченными ресурсами, таких как мобильные или периферийные устройства. Модель, тщательно настроенная на основе набора данных SQuAD 1.1, демонстрирует исключительное мастерство в задачах контроля качества, где цель состоит в том, чтобы найти сегмент текста из указанного контекста, отвечающий на вопрос. DistilBERT достигает примерно 85% баллов BERT F1 в таблице лидеров SQuAD и сохраняет значительную часть лингвистических возможностей BERT, несмотря на свой меньший размер. Эта модель является исключительно эффективным решением для задач контроля качества на уровне производства, оптимизируя как производительность, так и эффективность вычислений.

Deepset/roberta-base-squad2: deepset/roberta-base-squad2 model12,13 является тонко настроенным вариантом архитектуры RoBERTa. Он специально разработан для набора данных SQuAD14 2.0, который включает в себя как отвеченные, так и неразрешимые вопросы. Эта улучшенная среда RoBERTa устраняет9 заданий NSP BERT. Он также использует динамическое маскирование во время обучения для повышения эффективности и производительности в задачах на понимание NL. Модель имеет 125 миллионов параметров и использует двунаправленный трансформатор. Это позволяет ему получать контекстуальную информацию с обоих направлений и преуспевать в задачах по контролю качества.

Тонкая настройка в SQuAD 2.0 позволяет модели определить правильный диапазон отклика в заданном контексте и распознать, когда ответ отсутствует. Он использует маркеризатор кодирования пар байтов (BPE), который обрабатывает разметку подслов и сохраняет чувствительность к регистру. Это улучшает его способность обрабатывать необычные и сложные слова. Модель показывает хорошие результаты, достигая примерно 85%-90% F1 и 80%-85% EM. Его способность выявлять вопросы, на которые нет ответа, и эффективное использование делают его ценным для обслуживания клиентов, извлечения знаний и виртуальных помощников.

Наиболее эффективным способом развертывания SQuAD-тонко настроенных моделей BERT для контроля качества является использование конвейера34 Hugging Face Transformers. Эта платформа оптимизирует токенизацию, форматирование входных данных, загрузку модели и постобработку выходных данных. Эти модели широко признаны за их эффективность в добывающем QA, где ответом является текстовый диапазон, непосредственно извлеченный из данного контекста. Для руководства реализацией в следующей процедуре описаны шаги по выполнению моделей BERT.

Ввод и настройка: Для этого процесса требуется четыре основных входных параметра и параметра настройки: имя модели, указанное в виде строкового идентификатора из Hugging Face Hub (например, google-bert/bert-large-uncased-whole-word-masking-finetuned-squad, distilbert/distilbert-base-cased-distilled-squad или deepset/roberta-base-squad2); вопрос (Q), предоставленный в виде строки, содержащей запрос; и контекст (C), строка, представляющая соответствующий текст или отрывок. Основным используемым инструментом является высокоуровневая функция конвейера из библиотеки преобразователей Hugging Face (версия 4.57.0) в Python (версия 3.12.12).

Процесс: Выполнение (конвейер Hugging Face): Процесс состоит из шести основных этапов и использует конвейер Hugging Face для решения сложной задачи контроля качества:

Установите библиотеку: Начните с установки необходимой библиотеки с помощью команды pip install transformers. Эта установка обеспечивает доступ к моделям и оптимизированным функциям конвейера.

Конвейер импорта: Импортируйте функцию конвейера с помощью: из трансформаторов импортируйте трубопровод.

Инициализация конвейера контроля качества: Инициализируйте конвейер контроля качества с помощью qa_pipeline = pipeline("question-answering", model=""). Эта команда загружает модель и токенизатор, делая их готовыми к выводу.

Определите входные данные: Задать вопрос = ... и контекст = ... для подготовки данных модели.

Запустите вывод: Передайте вопрос и контекст в конвейер с результатом = qa_pipeline(вопрос=вопрос, контекст=контекст). Модель обрабатывает входные данные и предоставляет ответ.

Извлечение ответа: Получите строку ответа из выходного словаря с помощью: answer = result['answer'].

Выпуск: В процессе создается несколько выходных параметров в следующем порядке: Answer (извлеченный текстовый диапазон из контекста, представленный в виде строки), Score (значение с плавающей запятой, количественно оценивающее достоверность модели в ее прогнозе) и индексы Start и End (целые числа, указывающие символьные позиции диапазона ответов в контексте).

Предложения-трансформеры/все-MiniLM-L6-v2: all-MiniLM-L6-v235 — это предварительно обученный преобразователь предложений из библиотеки Sentence-Transformers (версия 5.1.1)36. Он оптимизирован для эффективного и точного встраивания текста. Разработанная на платформе Microsoft MiniLM, она включает в себя шесть слоев трансформации и 384-мерные вложения. Такая конструкция сочетает в себе производительность и вычислительные навыки, что делает ее подходящей для приложений реального времени. Модель была обучена на более чем миллиарде пар фраз из таких наборов данных, как SNLI, MultiNLI, тесты STS и данные веб-сканирования. В результате он демонстрирует мастерство в задачах, связанных с семантическим сходством, группировкой и поиском. Благодаря своему небольшому размеру (~22 МБ) и повышенной производительности вывода, all-MiniLM-L6-v2 упрощает такие приложения, как семантический поиск, обнаружение дублирования и категоризация текста. Несмотря на небольшой вес, он обеспечивает высокую точность в таких тестах, как STS-B и SICK-R, что делает его эффективным выбором как для масштабируемых, так и для ограниченных ресурсов. Рабочий процесс создания встраивания с помощью Sentence-Transformer показан на рисунке 9 ниже.

Рисунок 9
Рисунок 9: Шаг процесса встраивания с использованием модели преобразователя предложений. На рисунке показан рабочий процесс создания встраиваемых текстов с помощью фреймворка преобразователей предложений. В нем описывается процесс от импорта библиотек и загрузки предварительно обученной модели до подготовки текстовых данных, создания встраиваемых систем, преобразования их в массивы NumPy и их хранения для последующих задач, таких как индексирование или поиск сходства. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Предлагаемый алгоритм: В этом исследовании изложена предлагаемая методология в Алгоритме 1 для разработки системы SCD-QA на основе SeCD, способной отвечать как на фактоидные, так и на нефактические вопросы, задаваемые пользователями.

АЛГОРИТМ 1: Алгоритм предлагаемой системы SCD-QA на основе SeCD
Входные данные: набор необработанного файла контекста (C) и запрос пользователя (Q).
Выход: Выбранный оптимальный LLM (M') на основе трансформатора и отклик, генерируемый M'.
Контексты предварительной обработки: аннотирование необработанного набора контекстов C для создания структурированного набора данных в формате DSQuAD .
DSQuAD = fannonate (C)
Генерация встраиваемых контекстов: Используйтевстраиваемое средство Sentence-Transformer f для преобразования каждого контекста c Уравнение 100 DSQuAD в встраиваемое произведение ec.
Уравнение 15
Хранение встраиваемых данных: Храните Ec в векторной базе данных V для эффективного поиска сходства.
Уравнение 18
Создание встраиваемого запроса: Преобразуйте запрос пользователя Q в встраиваемый eq с помощью того же преобразователя предложений.
Уравнение 20
Извлечение контекста: извлечение наиболее релевантных встраиваемых контекстов Уравнение 21 из базы данных V на основе сходства с eq.
Уравнение 22
где sim(eq,e c) — функция подобия.
Передача контекста в LLM: Передача полученного контекста Уравнение 21 в 3 LLM на основе трансформеров: Google-BERT (M1), DistilBERT (M2), RoBERTa (M3) и традиционную модель: TF-IDF + Cosine Similarity (M4)
Уравнение 28
Оценка модели: Сравните ответы {R1,R 2,R 3,R 4} с помощью функции оценкиféval, которая оценивает каждый ответ.
Уравнение 31
Выберите лучшую модель: Определите модель M' с наивысшим оценочным баллом S'
Уравнение 33
Generate Final Output: Используйте M' для генерации окончательного ответа R на основеУравнение 36
Уравнение 37
Конец

Предложенный алгоритм описывает системный подход (рис. 10) к выбору идеального LLM на основе трансформатора для решения вопросов пользователей. Он включает в себя предварительную обработку, извлечение контекста на основе встраивания и оценку нескольких моделей, чтобы гарантировать высококачественные и контекстуально релевантные ответы. Ниже для наглядности поясняется пошаговый процесс:

Подготовка и предварительная обработка данных: Первый этап включает в себя обработку исходных текстовых данных.

Ввод: Необработанные текстовые файлы8 адаптированы к системе.

Инструмент аннотаций31: Входные данные преобразуются в структурированный набор данных в формате SQuAD14 . Этот шаг включает в себя создание QA-пар. Он также организует релевантные текстовые данные в четко определенные контекстные блоки.

Выходные данные: Теперь набор данных готов к созданию встраиваний.

Генерация встраивания контекста: Чтобы обеспечить эффективное и масштабируемое извлечение контекста, к аннотированному набору данных применяется обученная модель Sentence-Transformer35,36. Этот преобразователь преобразует текст в многомерные вложения, которые улавливают семантическое значение. Вложения хранятся в VD, FAISS29,32 для обеспечения быстрого поиска на основе сходства.

Обработка пользовательского запроса: Когда пользователь отправляет вопрос, вопрос обрабатывается тем же преобразователем предложений35,36. При этом генерируется соответствующее встраивание в то же векторное пространство 29,32, что и контекстные вложения. Такая структура гарантирует, что запрос может быть сопоставлен с соответствующими записями контекста.

Извлечение контекста с использованием векторного сходства: Используя метрику сходства (например, косинусное сходство), система сравнивает встраивание запроса с сохраненными вложениями контекста. Система выбирает наиболее релевантный контекст на основе наивысшей оценки сходства. Это гарантирует, что в нижестоящие модели передается только релевантный контекст. Этот процесс снижает вычислительные затраты и повышает релевантность.

Оценка модели в нескольких LLM: Выбранный контекст оценивается тремя LLM на основе трансформаторов: Google-BERT28, DistilBERT10 и RoBERTa12. Он также оценивается с помощью традиционного TF-IDF37 на основе ключевых слов с моделью косинусного сходства. Каждая модель обрабатывает контекст и генерирует ответ на вопрос пользователя.

Сравнительная оценка: Ответы четырех моделей LLM оцениваются с использованием двух ключевых показателей. Во-первых, семантическое соответствие оценивается по EM14. Во-вторых, задержка модели анализируется по среднему времени реакции15.

Выбор модели и окончательный результат: Наиболее эффективная модель выбирается в качестве подходящей LLM для вопроса пользователя. Учитывается итоговый отклик от выбранной модели. Это обеспечивает баланс между эффективностью вычислений и качеством отклика.

Рисунок 10
Рисунок 10: Рабочий процесс системы SCD-QA с использованием моделей на основе трансформаторов. На рисунке показано, как работает система SCD-QA. Сначала необработанный контекстный файл обрабатывается инструментом аннотаций для создания набора данных в формате SQuAD. Затем преобразователь предложений генерирует вложения, которые сохраняются в векторной базе данных FAISS. Когда пользователь задает вопрос, система создает для него встраивание и выбирает наиболее релевантный контекст. Он сравнивает три модели на основе трансформаторов - Google-BERT, DistilBT и RoBERTa, а также одну традиционную оценку сходства TFIDF + косинус - и использует наиболее эффективную из них для получения ответа. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В реализации системы SCD-QA использовались четыре LLM и набор данных из 80 фактоидных и нефактоидных вопросов. Обработка проводилась в Google Colab с использованием графических процессоров NVIDIA Tesla T4 (версия драйвера: 550.54.15, версия CUDA: 12.4) с 12,7 ГБ системной ОЗУ, 15 ГБ ОЗУ графического процессора и 112,6 ГБ дискового пространства. Производительность модели оценивалась с помощью двух метрик: EM14 для семантического сопоставления и задержка модели

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом исследовании представлена система SCD-QA, которая использует языковые модели на основе трансформеров для предоставления точных, контекстно-зависимых ответов из структурированных институциональных документов. Документооборот системы состоит из: (1) предварительной обработки данных; (2) встраивание генерации с использованием современного преобразователя предложений, all-MiniLM-L6-v2; (3) поиск на основе сходства с помощью FAISS; и (4) всесторонняя оценка модели. Конвейер был протест...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторам нечего раскрывать.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы с благодарностью благодарят преданных своему делу преподавателей и администрацию NIT штата Аруначал-Прадеш за их непоколебимую поддержку и руководство на протяжении всего этого исследования. Кроме того, мы глубоко благодарны разработчикам и участникам NLP-инструментов с открытым исходным кодом и предварительно обученных моделей, чья работа сделала возможным это исследование. При подготовке данной рукописи авторы использовали программу Grammarly Proofreader для большей ясности. Авторы несут полную ответственность за точность и целостность контента.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
всё MiniLM-L6-v2MicrosoftВерсия 5.1.1Предварительно обученная модель трансформера предложений для генерации вложений в высокие размерности. Преобразует текст в вложения для поиска контекста.
Инструмент аннотацииСтог сенаВерсия 2.18.1Платформа для структурирования сырого текста в формате SQuAD. Готовит набор данных путём создания пар QA и контекстных блоков.
Модель DistilBERTОбнимающее лицоNAЛёгкий LLM на базе трансформаторов с меньшими вычислительными требованиями. Оценка для сравнения обеспечивает меньшую задержку, но меньшую точность.
FAISS VDFacebookfaiss_cpu-1.9.0Масштабируемая VD для поиска по сходству. Хранит и извлекает высокоразмерные вложения для эффективного сопоставления запросов.
Модель Google-BERTGoogleNAПредварительно обученная LLM на базе трансформаторов с двунаправленным контекстным моделированием. Основная модель для получения точных ответов на фактоидные и нефактоидные запросы.
Видеокарты NVIDIA Tesla T4NVIDIAВерсия драйвера: 550.54.15
версия CUDA: 12.4
Видеокарты с 15 ГБ ОПЕРАТИВНОЙ ПАМЯТИ для вывода моделей. Обеспечивает вычислительную мощность для обработки и оценки LLM.
ПитонФонд программного обеспечения PythonВерсия 3.12.12Python является ведущим языком программирования в области обработки естественного языка (NLP) благодаря прямолинейному синтаксису, комплексным библиотекам и сильной поддержке сообщества. Он поддерживает широкий спектр задач NLP, включая фундаментальную предобработку текста и сложные реализации машинного обучения.
Модель RoBERTaDeepsetNAОптимизированная LLM на базе трансформаторов с усовершенствованными стратегиями обучения. Оценка для сравнения, балансирует точность и задержку.
Набор данных SCD-QA как SQuAD  ФорматNAВерсия 2.0Стандартизированный формат для пар вопрос-ответ. Структурный набор данных для совместимости с моделями трансформаторов.

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Pirtoaca, G. S., Rebedea, T., Ruseti, S. Improving retrieval-based question answering with deep inference models. Int Joint Conf Neural Network. , 1-8 (2019).
  2. NLP-QA framework based on LSTM-RNN. Zhang, X., Chen, M. H., Qin, Y. Int Conf Data Sci Business Anal, , 307-311 (2018).
  3. Natural language processing based new approach to design factoid question answering system. Machhirke, V. S., Soni, A. Second Int Conf Inventive Res Computing Appl, , 276-281 (2020).
  4. Biancofiore, G. M., Deldjoo, Y., Di Noia, T., Di Sciascio, E., Narducci, F. Interactive question answering systems: literature review. ACM Comput Surv. 1 (1), Article 1(2024).
  5. Singh, S., Das, N., Michael, R., Tanwar, P. The question answering system using NLP and AI. Int J Sci Eng Res. 7 (12), 2229-5518 (2016).
  6. Pandya, H. A., Bhatt, B. S. Question answering survey: Directions, challenges, datasets, evaluation matrices. arXiv. , (2021).
  7. Khvalchik, M. A., Kulkarni, K. Open-domain non-factoid question answering. , Springer International Publishing. Cham. (2017).
  8. NIT Arunachal Pradesh PhD rules and regulations year. , National Institute of Technology Arunachal Pradesh. https://www.nitap.ac.in/storage/pdf/140508582e7c89a8b2295595085e3abe-%2003-37-28F%20IN%20AL.pdf (2022).
  9. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. BERT: Pre-training of deep bidirectional transformers for language understanding. Proc NAACL-HLT. , 4171-4186 (2019).
  10. Sanh, V., Debut, L., Chaumond, J., Wolf, T. DistilBERT, a distilled version of BERT: Smaller, faster, cheaper and lighter. arXiv. , (2019).
  11. DistilBERT HuggingFace. , https://huggingface.co/distilbert/distilbert-base-cased-distilled-squad (2023).
  12. Liu, Y., et al. A robustly optimized BERT pretraining approach. arXiv. , (2019).
  13. RoBERTa base squad2. Deepset. , https://huggingface.co/deepset/roberta-base-squad2 (2023).
  14. SQuAD: 100,000+ questions for machine comprehension of text. Rajpurkar, P., Zhang, J., Lopyrev, K., Liang, P. Proc 2016 Conf Empirical Meth Natural Language Proc, , 2383-2392 (2016).
  15. Attention is all you need. Vaswani, A., et al. 31st Conf Neural Informat Proc Syst, , 1-11 (2017).
  16. Malkov, Y. A., Yashunin, D. A. Efficient and robust approximate nearest neighbor search using hierarchical navigable small world graphs. IEEE Trans Pattern Anal Mach Intell. 42 (4), 824-836 (2018).
  17. Similarity search in high dimensions via hashing. Gionis, A., Indyk, P., Motwani, R. Proc 25th VLDB Conf, , 518-529 (1999).
  18. HIJLI_JU at SemEval-2024 task 7: Enhancing quantitative question answering using fine-tuned BERT models. Sengupta, P., Sarkar, S., Das, D. Proc 18th Int Workshop Semantic Evaluat, , 279-284 (2024).
  19. Kocoń, J., et al. ChatGPT: Jack of all trades, master of none. Inf Fusion. 99, 101861(2023).
  20. Fine-tuning strategies for domain specific question answering under low annotation budget constraints. Guo, K., Diefenbach, D., Gourru, A., Gravier, C. IEEE 35th Int Conf Tools with Artificial Intell, , 166-171 (2023).
  21. Question answering on biomedical research papers using transfer learning on BERT-base models. Pudasaini, S., Shakya, S. 7th Int Conf I-SMAC (IoT in Social, Mobile, Analytics and Cloud), , 496-501 (2023).
  22. Knowledge-augmented language model prompting for zero-shot knowledge graph question answering. Baek, J., Aji, A. F., Saffari, A. Proc 1st Workshop Natural Language Reasoning Struct Explanat, , 78-106 (2023).
  23. Hu, S., Zhang, H., Zhang, W. Domain knowledge graph question answering based on semantic analysis and data augmentation. Appl Sci. 13 (15), (2023).
  24. A BERT-based approach for knowledge base question answering. Luo, D., Su, J., Yu, S. Int Joint Conf Neural Networks, , 1-8 (2020).
  25. Wu, C., et al. Retrieval augmented generation-driven information retrieval and question answering in construction management. Adv Eng Inform. 65, 103158(2025).
  26. Peng, C., et al. A study of generative large language model for medical research and healthcare. NPJ Digit Med. 6 (1), 210(2023).
  27. Gardazi, N. M., et al. applications in natural language processing: a review. Artif Intell Rev. 58 (6), 1-49 (2025).
  28. Sabharwal, N., Agrawal, A. Hands-on question answering systems with BERT: applications in neural networks and natural language processing. , Apress Berkeley. CA. (2021).
  29. FAISS documentation. , https://faiss.ai/ (2025).
  30. Bhattacharya, D. SCD-QA dataset. Zenodo. , (2025).
  31. Annotation tool. , https://docs.haystack.deepset.ai/docs/annotation (2025).
  32. Johnson, J., Douze, M., Jégou, H. Billion-scale similarity search with GPUs. IEEE Transac Big Data. 7 (3), 535-547 (2021).
  33. Sun, P., Guo, R., Kumar, S. Automating nearest neighbor search configuration with constrained optimization. arXiv. , (2023).
  34. BERT. , Hugging Face. https://huggingface.co/docs/transformers/model_doc/bert (2025).
  35. MiniLM: Deep self-attention distillation for task-agnostic compression of pre-trained transformers. Wang, W., et al. Proc 34th Int Conf Neural Informat Process Syst, , 5776-5788 (2020).
  36. Sentence transformer documentation. , https://www.sbert.net/ (2025).
  37. Cosine similarity to determine similarity measure: study case in online essay assessment. Lahitani, A. R., Permanasari, A. E., Setiawan, N. A. 4th Int Conf Cyber IT Service Manag, , 1-6 (2016).
  38. A comparative analysis of transformer models in zero-shot text classification. Kyritsis, K., Liapis, C. M., Spatiotis, N., Perikos, I., Paraskevas, M. 15th Int Conf Informat Intelligence Syst Applicat, , 1-4 (2024).
  39. Howard, J., Ruder, S. Universal language model fine-tuning for text classification. Proc 56th Ann Meeting Associat Computat Linguistics. , 328-339 (2018).
  40. Asai, A., Hashimoto, K., Hajishirzi, H., Socher, R., Xiong, C. Learning to retrieve reasoning paths over Wikipedia graph for question answering. arXiv. , (2019).
  41. Lewis, P., et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. arXiv. , (2021).
  42. Leveraging passage retrieval with generative models for open domain question answering. Izacard, G., Grave, E. Proc Conf Eur Chapter Associat Computat Linguistics, , 874-880 (2021).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

QASQuADTF IDF

Похожие статьи