$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Всесторонняя теоретическая база
Компонент QAS: Фреймворк QAS состоит из трех сегментов, как показано на рисунке 3: i) модуль обработки вопросов (QPM), ii) модуль обработки документов (DPM) и iii) модуль извлечения и формулировки ответов (AEFM). Система получает вопросы, которые делятся на две основные категории: Фактоиды и Не-Фактоиды. В вопросах на основе фактов обычно используются вопросительные слова, такие как «что», «где», «когда» или «кто», в то время как в вопросах, не относящихся к фактоидам, используются такие слова, как «как» и «почему».
DPM: Из предоставленного списка пользователь может выбрать конкретный отрывок. Затем каждый токен в отрывке помечается тегом с помощью теггера части речи (POS). Чтобы извлечь глаголы, определите все лексемы, помеченные как глаголы. Объедините эти глаголы со списком нетрадиционных глаголов и примените логику для правильных глаголов. Создайте структуру данных (массив), содержащую извлеченные глаголы, их времена и формы -ing.
QPM: Система получает входные данные в виде вопроса от пользователя. Текст размечается с помощью класса StringTokenizer, а полученные токены хранятся в отдельной структуре данных. Затем эта структура данных возвращается для дальнейшего использования в рамках программы.
AEFM: Первый шаг – это определение глагола в данном вопросе. Недавно идентифицированный глагол сопоставляется с маркерами, созданными на этапе обработки документа. Выбранный случай для конкретного типа фактического вопроса (например, что или когда) используется для извлечения и построения ответа более точным образом.
Прежде чем выбрать тип опроса, пользователю сначала предлагается выбрать отрывок по своему выбору. QPM отвечает за обработку вопроса пользователя и его переадресацию в AEFM. AEFM использует извлечения, полученные из DPM, и обработанные документы, содержащие помеченный формат исходного входного документа. Модуль передаст необходимые алгоритмы в модуль формулировки для получения желаемого ответа.

Рисунок 3: Компоненты QAS. На рисунке показан четырехэтапный процесс работы системы контроля качества: вопрос, обработка вопроса, обработка ответа и ответ. В разделе «Обработка вопросов» система классифицирует вопрос. В Answer Processing он находит и анализирует документы и отрывки для получения ответа. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Модель BERT: Чтобы обнаружить связи между словами в тексте, метод BERT использует преобразователь. В трансформаторе есть два механизма - энкодер и декодер28, но для BERT нужен только энкодер. BERT использует двусторонний подход и систематически сканирует входной текст, чтобы самостоятельно изучить значение слов в их контексте. Кодировщик принимает в качестве входных данных ряд токенов, которые были векторизованы. Затем векторы подаются в нейронную сеть, которая создает серию векторов, отражающих входные данные. Вектор вывода слова изменяется в зависимости от предложения, в котором оно встречается. Вектор слова может меняться в зависимости от контекста, в котором оно появляется; например, «нравится» в «Он любит играть в крикет» имеет другой вектор, чем «нравится» в «Его лицо стало красным, как помидор». Этот подход начинается с этапа обработки текста, а затем переходит к этапу построения модели. Шаги, которые BERT предпринимает для обработки текста, обсуждаются в следующем разделе28.
Обработка текста: Модель BERT представляет собой входной текст в соответствии с заданным набором принципов. Кроме того, этот фактор способствует повышению производительности модели. Входное вложение в BERT состоит из амальгамы трех различных типов вложений28.
Вложения позиций (PE): Для изучения информации, связанной с заказами в вложениях, используются PE. ПЭ используются для восстановления информации о порядке, который был потерян в трансформаторах. BERT разрабатывает отдельные ПЭ специально для каждой точки входной последовательности. BERT обладает способностью передавать позиционную информацию о словах внутри предложения с помощью PE. Это позволяет BERT эффективно захватывать и представлять последовательность или порядок слов.
Встраивание предложений (SE): Кроме того, чтобы помочь модели различать первое и второе предложения, BERT изучает встраивание, которое является уникальным для каждого из них. Он также способен принимать парные предложения в качестве входных данных для таких действий, как QA.
Встраивание лексем (TEs): TE преподаются для каждой лексемы в словаре лексем WordPiece. Словарь лексем WordPiece состоит из единиц подслов, полученных из слов, найденных в корпусе. В качестве иллюстративного примера, этот словарный запас будет включать в себя все мыслимые подслова термина «вопрос», включая Questio, Questi и так далее.
Входное представление токена строится путем сложения его вложений на уровнях сегмента и позиции. Из-за этого именно обширный подход к встраиванию предоставляет в модель огромный объем информации. На рисунке 49 изображены вложения модели BERT.

Рисунок 4: Встраивания BERT. На рисунке показано, как создаются входные вложения для модели трансформатора. Он начинается с последовательности ввода: [CLS] небо [MASK] облачное [SEP] пойдет дождь [SEP]. Каждый токен в последовательности получает собственное вложение, например Ethe или E[MASK]. Затем для каждого предложения добавляются вложения, такие как EA для первого и EB для второго. Позиционные вложения, помеченные от E0 до E9, также включены для обозначения положения каждого токена. Все они объединяются для формирования окончательных входных вложений. Эта цифра была изменена с9. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Проектирование QAS с использованием BERT: В иллюстративных целях рассмотрим этот вопрос в сочетании с абзацем, взятым из статьи в Википедии о Футбольной лиге28.
Вопрос: Где была основана Футбольная лига?
Пассаж: В 1888 году в Англии была основана Футбольная лига, ставшая первым из многих профессиональных футбольных соревнований. В течение 20-го века несколько различных видов футбола стали одними из самых популярных командных видов спорта в мире.
Ответ: Англия
Модель BERT использует извлечение токенов как из вопроса, так и из контекста, а затем объединяет их в единый вход. Как уже говорилось ранее, процесс начинается с использования токена [CLS], который служит индикатором начала предложения. Кроме того, разделитель [SEP] используется для четкого разделения вопроса и отрывка. В дополнение к токену [SEP], BERT включает в себя SE для различения вопроса и отрывка28 , содержащего ответ. BERT использует два SE, один из которых посвящен вопросу, а другой – отрывку, чтобы установить четкое различие между ними. Впоследствии вложения комбинируются с одногорячим представлением28 лексем, чтобы различать вопрос и отрывок. Этот процесс проиллюстрирован на рисунке 5.

Рисунок 5: Входное представление BERT. На рисунке показано, как генерируются входные вложения для QAS на основе BERT. Он начинается с токена [CLS], затем следует вопрос Сколько? [SEP], и отрывок BERT large, каждый со своими вложениями предложений (A для вопроса, B для отрывка). Лексемы, предложения и позиционные вложения объединяются для получения окончательного ввода. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Впоследствии комбинированное встроенное представление28 вопроса и контекста используется в качестве входных данных в модели BERT. Последний скрытый слой BERT модифицируется для использования SoftMax для генерации распределений вероятностей. Эти распределения определяют начальный и конечный индексы подстроки во входном текстовом предложении, которое представляет ответ, как показано на рисунке 6, для визуального представления.

Рисунок 6: Рабочий процесс обработки BERT для QA. На рисунке показано, как работает модель BERT для QA. Он представляет собой последовательность ввода, которая включает вопрос, помеченный маркером классификации [CLS] в начале и маркером-разделителем [SEP] в конце, за которым следует контекст, разделенный другим [SEP]. Лексемы в этой последовательности превращаются во вложения. Затем модель прогнозирует начальную и конечную позиции ответа в отрывке. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Векторная база данных (VD): VD17,18 — это специализированная система для эффективного хранения, управления, индексации и запроса многомерных векторных представлений данных. Векторы часто генерируются на основе моделей глубокого обучения и инкапсулируют семантическую или контекстуальную информацию о данных. Каждое измерение вектора представляет определенный признак. Встраиваемые объекты — это числовые представления объектов, таких как текст, изображения, видео и аудио. Эти встраивания используются в различных приложениях, включая машинное обучение (ML), NLP, рекомендательные системы, компьютерное зрение и IR. VD упрощают эффективный поиск сходства и семантические запросы, группируя похожие объекты близко друг к другу в векторном пространстве. Facebook AI Similarity Search (FAISS)29 — это важная VD, используемая в этом исследовании для определения наиболее релевантного контекста для запросов пользователей. В таблице 2 приведены основные характеристики VD и варианты их использования.
| Особенность | Описание |
| Многомерные данные | Обрабатывает данные с сотнями или тысячами измерений. |
| Приблизительное число ближайших соседей (ИНС) | Обеспечивает быстрый поиск сходства путем аппроксимации расстояний. |
| Масштабируемость | Поддерживает крупномасштабные наборы данных с миллиардами векторов. |
| Интеграция | Часто интегрируется с фреймворками и инструментами AI/ML для бесперебойных рабочих процессов. |
| Запросы в режиме реального времени | Обеспечивает векторный поиск с низкой задержкой для интерактивных приложений. |
Таблица 2: Основные характеристики ВД. В таблице представлены важные особенности VD. К ним относятся обработка многомерных данных, быстрый поиск сходства с использованием алгоритмов ИНС, масштабирование до больших наборов данных, работа с инструментами искусственного интеллекта и машинного обучения, а также поддержка быстрых запросов в режиме реального времени для интерактивного использования.
Метрики оценки эффективности: Система SCD-QA оценивалась с использованием двух основных показателей: EM score14 и Model Latency15. Оценка EM, стандартная метрика в исследованиях QA, оценивает точность прогнозов, измеряя долю прогнозируемых ответов, которые точно соответствуют истине. Для набора из N вопросов балл EM формально определяется в уравнении 1 следующим образом:
где
(1)
Эта метрика присваивает оценку 1 за точное совпадение с эталонным ответом и 0 за любую разницу.
Метрика Задержка количественно определяет общее время обработки, необходимое системе для создания ответа на отдельный запрос. Эта метрика вычисляется как среднее затраченное время по всем запросам, как показано в уравнении 2:
(2)
где Tstarti и Tendi — временные метки, обозначающие начало и окончание обработки i-го запроса соответственно. Задержка указывается в единицах s и отражает скорость отклика системы, охватывающую все этапы от обработки ввода до генерации ответа.
Метод
Для реализации SCD-QA в настоящий документ включены следующие тестовые исследования.
Набор данных SCD-QA: Предлагается набор данных30 для реализации системы SCD-QA. Этот набор данных получен на основе текстового корпуса, содержащего правила докторантуры на 2022 год8 для студенческих рекомендаций из NIT Аруначал-Прадеш, Индия. Чтобы создать систему SCD-QA, необходимо сгенерировать файл JSON, который будет включать в себя всю необходимую информацию в точном формате. Набор данных генерируется на основе текстового корпуса с помощью инструмента аннотаций Haystack (версия 2.18.1)31, фреймворка с открытым исходным кодом. Этот инструмент облегчает создание набора данных SCD-QA в стиле SQuAD14. Шаги по созданию аннотированного набора данных типа SQuAD из PDF-файла показаны на рисунке 7, а структура нашего набора данных в стиле SQuAD проиллюстрирована на рисунке 8.

Рисунок 7: Шаги по созданию аннотированного набора данных из PDF-файла. На рисунке показан пошаговый рабочий процесс создания аннотированного набора данных в стиле SQuAD с помощью инструментов Haystack. В нем описывается процесс, начиная с извлечения текста из PDF-файлов, очистки и разделения его на отрывки, ручного аннотирования пар вопрос-ответ, хранения аннотаций в формате SQuAD JSON и, наконец, экспорта набора данных для обучения модели. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Рисунок 8: Структура набора данных по контролю качества фактоидов. На рисунке показана структура данных JSON, представляющая собой параграф и пару QA из набора данных. В нем есть параграфический раздел, в котором содержится набор вопросов и ответов. Один из вопросов звучит так: «Какой минимальный балл требуется для поступления в докторантуру?» У каждого вопроса есть идентификатор и массив ответов. Ответ включает в себя идентификатор документа, идентификатор вопроса, текст 60% баллов, начальную позицию ответа и неуказанную категорию ответа. Флаг is_impossible установлен в значение false. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Набор данных структурирован в виде списка словарей, каждый из которых содержит ключевые поля, такие как данные, абзацы, вопрос, answer_id, document_id, question_id, текст, answer_start, answer_end, is_impossible и контекст.
data: Содержит общую информацию о вопросах и ответах.
параграфы: Конкретный контекст, вместе с его вопросами и ответами.
вопрос: Конкретный вопрос.
answer_id: уникальный идентификационный номер для каждого текста ответа.
document_id: уникальный идентификационный номер для каждого контекста.
question_id: уникальный идентификационный номер для каждого вопроса.
text: текст ответа.
answer_start: Начальное место правильного ответа в контексте.
answer_end: Место окончания правильного ответа в контексте.
is_impossible: Он показывает, доступен ли ответ на заданный вопрос в контексте или нет.
context: Текстовый корпус, из которого можно найти ответ.
Все 80 вопросов в предложенном наборе данных соответствуют формату фактоидных и нефактоидных вопросов. Примеры некоторых типов вопросов с рамками приведены в таблице 3.
| Вопросы |
| Кто такой PS? |
| Каков размер шрифта современного документа? |
| Сколько дней в декретном отпуске? |
Таблица 3: Пример вопроса из набора данных. В таблице приведены примеры двух типов вопросов: первый и второй являются фактоидными вопросами, а третий — нефактоидными вопросами.
FAISS: FAISS (версия faiss_cpu-1.9.0)29,32, разработанная Facebook AI Research (FAIR), представляет собой библиотеку с открытым исходным кодом, которая облегчает эффективный поиск сходства и кластеризацию плотных векторов. Он специально разработан для эффективного управления большими объемами данных. Эта система обеспечивает быстрый и масштабируемый поиск ИНС в наборах данных, содержащих миллионы или миллиарды векторов. Он широко используется в приложениях, связанных со встраиванием, включая NLP, рекомендательные системы, а также поиск изображений или видео. FAISS предлагает несколько методов индексации, включая плоский (грубая сила), инвертированный файл (IVF), иерархические навигационные графы малого мира (HNSW) и квантование продукта (PQ). Эти методы позволяют пользователям оптимизировать производительность поиска в соответствии с размером данных, размерностью и техническими характеристиками оборудования. В данном исследовании используется плоская индексация, которая выполняет перебор с использованием расстояния L2 (евклидово расстояние) для идентификации ближайших соседей. Масштабируемость системы поддерживает реализации как ЦП, так и ГП, обеспечивая высокопроизводительные вычисления для больших наборов данных. Кроме того, он обеспечивает гибкость для оптимизации баланса между скоростью и точностью в зависимости от конкретных требований приложения. FAISS часто используется в NLP для оценки семантического сходства во встраиваниях, таких как BERT или Word2Vec. FAISS используется в системе контроля качества для хранения и управления векторными представлениями документов или предложений. Он выполняет приблизительный поиск33 ИНС для извлечения наиболее релевантного контекста для вопросов пользователя, улучшая семантический поиск с помощью встраиваний из моделей преобразователей, таких как BERT. FAISS является фундаментальным инструментом в рабочих процессах искусственного интеллекта и машинного обучения благодаря своей универсальности.
Модель BERT-large-uncased-whole-word-masking-finetuned- SQuAD: В настоящей работе используется предварительно обученная языковая модель, известная как BERT-large-uncased-whole-word-masking finetuned-squad9 для разработки фактоидного QAS с использованием набора данных, предложенного в исследовании. Модель BERT прошла предварительное обучение на BookCorpus, наборе данных из 11 038 неопубликованныхкниг9, а также на английской Википедии, за исключением списков, таблиц и заголовков. Рассматриваемая модель не имеет регистра, что означает, что она не делает различий между словами english и english. Модель представляет собой предварительно обученную модель трансформатора, которая была обучена на значительном объеме данных на английском языке с использованием самоконтролируемого подхода. Модель была предварительно обучена исключительно на сырых текстах, без каких-либо человеческих аннотаций. Это позволяет ей использовать большой объем общедоступных данных. Процесс предварительного обучения включает в себя автоматическую генерацию входных данных и меток из предоставленных текстов. Модель обучалась с двумя конкретными целями9:
MLM: Процесс включает в себя случайную маскировку 15%9 слов во входном предложении. Затем модель обрабатывает все замаскированное предложение и предсказывает замаскированные слова. Этот подход отличается от обычных рекуррентных нейронных сетей (RNN), которые обычно обрабатывают слова последовательно, и от авторегрессионных моделей, таких как GPT, которые используют внутреннюю маскировку будущих токенов. Эта функциональность позволяет модели получить двунаправленное представление предложения.
НСП: На этапе предварительного обучения модель объединяет два замаскированных предложения в качестве входных данных. В некоторых случаях эти предложения соседствуют в оригинальном тексте, что указывает на прямую связь. В других случаях это не так, что означает, что нет никакой исходной близости или контекста, связывающего их. Следующий шаг включает в себя модель, предсказывающую, являются ли два предложения логически согласованными.
Данная модель характеризуется последующей конфигурацией: архитектура модели состоит из 24 слоев, со скрытой размерностью 1024. Он использует 16 головок внимания и имеет в общей сложности 336 миллионов параметров9.
WordPiece используется для токенизации текстов с размером словаря в 30 000 слов на этапах предварительной обработки. Входные данные модели будут выглядеть следующим образом: [CLS] Предложение A [SEP] Предложение B [SEP]. Единственное требование – общая длина объединенных предложений должна быть меньше 512 токенов9. Конкретная предварительно обученная модель дает последующие выходные данные: полученный балл F1 составляет 93,15 %, в то время как точный показатель совпадения составляет 86,91 %9.
Модель Distilbert/distilbert-base-cased-distilled-squad: Модель Distilbert10 является более компактным, быстрым и эффективным вариантом модели BERT9 , разработанным для сохранения большей части семантической способности BERT к пониманию, будучи при этом менее ресурсоемким и более подходящим для практических приложений с ограниченной вычислительной мощностью. Версия distilbert-base-cased-distilled-squad была доработана на SQuAD14 для задач QA. Модель использует архитектуру трансформатора, в том числе уменьшенный размер на 66 миллионов параметров по сравнению со 110 миллионами в BERT, сохраняя при этом 97% эффективности BERT в понимании языка. DistilBERT достигает этого с помощью метода, известного как дистилляция знаний, который передает информацию из более крупной модели BERT в более компактную модель DistilBERT. Благодаря меньшим размерам он может быстрее выводить информацию и использовать меньше памяти, что делает его идеальным для приложений с ограниченными ресурсами, таких как мобильные или периферийные устройства. Модель, тщательно настроенная на основе набора данных SQuAD 1.1, демонстрирует исключительное мастерство в задачах контроля качества, где цель состоит в том, чтобы найти сегмент текста из указанного контекста, отвечающий на вопрос. DistilBERT достигает примерно 85% баллов BERT F1 в таблице лидеров SQuAD и сохраняет значительную часть лингвистических возможностей BERT, несмотря на свой меньший размер. Эта модель является исключительно эффективным решением для задач контроля качества на уровне производства, оптимизируя как производительность, так и эффективность вычислений.
Deepset/roberta-base-squad2: deepset/roberta-base-squad2 model12,13 является тонко настроенным вариантом архитектуры RoBERTa. Он специально разработан для набора данных SQuAD14 2.0, который включает в себя как отвеченные, так и неразрешимые вопросы. Эта улучшенная среда RoBERTa устраняет9 заданий NSP BERT. Он также использует динамическое маскирование во время обучения для повышения эффективности и производительности в задачах на понимание NL. Модель имеет 125 миллионов параметров и использует двунаправленный трансформатор. Это позволяет ему получать контекстуальную информацию с обоих направлений и преуспевать в задачах по контролю качества.
Тонкая настройка в SQuAD 2.0 позволяет модели определить правильный диапазон отклика в заданном контексте и распознать, когда ответ отсутствует. Он использует маркеризатор кодирования пар байтов (BPE), который обрабатывает разметку подслов и сохраняет чувствительность к регистру. Это улучшает его способность обрабатывать необычные и сложные слова. Модель показывает хорошие результаты, достигая примерно 85%-90% F1 и 80%-85% EM. Его способность выявлять вопросы, на которые нет ответа, и эффективное использование делают его ценным для обслуживания клиентов, извлечения знаний и виртуальных помощников.
Наиболее эффективным способом развертывания SQuAD-тонко настроенных моделей BERT для контроля качества является использование конвейера34 Hugging Face Transformers. Эта платформа оптимизирует токенизацию, форматирование входных данных, загрузку модели и постобработку выходных данных. Эти модели широко признаны за их эффективность в добывающем QA, где ответом является текстовый диапазон, непосредственно извлеченный из данного контекста. Для руководства реализацией в следующей процедуре описаны шаги по выполнению моделей BERT.
Ввод и настройка: Для этого процесса требуется четыре основных входных параметра и параметра настройки: имя модели, указанное в виде строкового идентификатора из Hugging Face Hub (например, google-bert/bert-large-uncased-whole-word-masking-finetuned-squad, distilbert/distilbert-base-cased-distilled-squad или deepset/roberta-base-squad2); вопрос (Q), предоставленный в виде строки, содержащей запрос; и контекст (C), строка, представляющая соответствующий текст или отрывок. Основным используемым инструментом является высокоуровневая функция конвейера из библиотеки преобразователей Hugging Face (версия 4.57.0) в Python (версия 3.12.12).
Процесс: Выполнение (конвейер Hugging Face): Процесс состоит из шести основных этапов и использует конвейер Hugging Face для решения сложной задачи контроля качества:
Установите библиотеку: Начните с установки необходимой библиотеки с помощью команды pip install transformers. Эта установка обеспечивает доступ к моделям и оптимизированным функциям конвейера.
Конвейер импорта: Импортируйте функцию конвейера с помощью: из трансформаторов импортируйте трубопровод.
Инициализация конвейера контроля качества: Инициализируйте конвейер контроля качества с помощью qa_pipeline = pipeline("question-answering", model=""). Эта команда загружает модель и токенизатор, делая их готовыми к выводу.
Определите входные данные: Задать вопрос = ... и контекст = ... для подготовки данных модели.
Запустите вывод: Передайте вопрос и контекст в конвейер с результатом = qa_pipeline(вопрос=вопрос, контекст=контекст). Модель обрабатывает входные данные и предоставляет ответ.
Извлечение ответа: Получите строку ответа из выходного словаря с помощью: answer = result['answer'].
Выпуск: В процессе создается несколько выходных параметров в следующем порядке: Answer (извлеченный текстовый диапазон из контекста, представленный в виде строки), Score (значение с плавающей запятой, количественно оценивающее достоверность модели в ее прогнозе) и индексы Start и End (целые числа, указывающие символьные позиции диапазона ответов в контексте).
Предложения-трансформеры/все-MiniLM-L6-v2: all-MiniLM-L6-v235 — это предварительно обученный преобразователь предложений из библиотеки Sentence-Transformers (версия 5.1.1)36. Он оптимизирован для эффективного и точного встраивания текста. Разработанная на платформе Microsoft MiniLM, она включает в себя шесть слоев трансформации и 384-мерные вложения. Такая конструкция сочетает в себе производительность и вычислительные навыки, что делает ее подходящей для приложений реального времени. Модель была обучена на более чем миллиарде пар фраз из таких наборов данных, как SNLI, MultiNLI, тесты STS и данные веб-сканирования. В результате он демонстрирует мастерство в задачах, связанных с семантическим сходством, группировкой и поиском. Благодаря своему небольшому размеру (~22 МБ) и повышенной производительности вывода, all-MiniLM-L6-v2 упрощает такие приложения, как семантический поиск, обнаружение дублирования и категоризация текста. Несмотря на небольшой вес, он обеспечивает высокую точность в таких тестах, как STS-B и SICK-R, что делает его эффективным выбором как для масштабируемых, так и для ограниченных ресурсов. Рабочий процесс создания встраивания с помощью Sentence-Transformer показан на рисунке 9 ниже.

Рисунок 9: Шаг процесса встраивания с использованием модели преобразователя предложений. На рисунке показан рабочий процесс создания встраиваемых текстов с помощью фреймворка преобразователей предложений. В нем описывается процесс от импорта библиотек и загрузки предварительно обученной модели до подготовки текстовых данных, создания встраиваемых систем, преобразования их в массивы NumPy и их хранения для последующих задач, таких как индексирование или поиск сходства. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Предлагаемый алгоритм: В этом исследовании изложена предлагаемая методология в Алгоритме 1 для разработки системы SCD-QA на основе SeCD, способной отвечать как на фактоидные, так и на нефактические вопросы, задаваемые пользователями.
АЛГОРИТМ 1: Алгоритм предлагаемой системы SCD-QA на основе SeCD
Входные данные: набор необработанного файла контекста (C) и запрос пользователя (Q).
Выход: Выбранный оптимальный LLM (M') на основе трансформатора и отклик, генерируемый M'.
Контексты предварительной обработки: аннотирование необработанного набора контекстов C для создания структурированного набора данных в формате DSQuAD .
DSQuAD = fannonate (C)
Генерация встраиваемых контекстов: Используйтевстраиваемое средство Sentence-Transformer f для преобразования каждого контекста c
DSQuAD в встраиваемое произведение ec.

Хранение встраиваемых данных: Храните Ec в векторной базе данных V для эффективного поиска сходства.

Создание встраиваемого запроса: Преобразуйте запрос пользователя Q в встраиваемый eq с помощью того же преобразователя предложений.

Извлечение контекста: извлечение наиболее релевантных встраиваемых контекстов
из базы данных V на основе сходства с eq.

где sim(eq,e c) — функция подобия.
Передача контекста в LLM: Передача полученного контекста
в 3 LLM на основе трансформеров: Google-BERT (M1), DistilBERT (M2), RoBERTa (M3) и традиционную модель: TF-IDF + Cosine Similarity (M4)

Оценка модели: Сравните ответы {R1,R 2,R 3,R 4} с помощью функции оценкиféval, которая оценивает каждый ответ.

Выберите лучшую модель: Определите модель M' с наивысшим оценочным баллом S'

Generate Final Output: Используйте M' для генерации окончательного ответа R на основе

Конец
Предложенный алгоритм описывает системный подход (рис. 10) к выбору идеального LLM на основе трансформатора для решения вопросов пользователей. Он включает в себя предварительную обработку, извлечение контекста на основе встраивания и оценку нескольких моделей, чтобы гарантировать высококачественные и контекстуально релевантные ответы. Ниже для наглядности поясняется пошаговый процесс:
Подготовка и предварительная обработка данных: Первый этап включает в себя обработку исходных текстовых данных.
Ввод: Необработанные текстовые файлы8 адаптированы к системе.
Инструмент аннотаций31: Входные данные преобразуются в структурированный набор данных в формате SQuAD14 . Этот шаг включает в себя создание QA-пар. Он также организует релевантные текстовые данные в четко определенные контекстные блоки.
Выходные данные: Теперь набор данных готов к созданию встраиваний.
Генерация встраивания контекста: Чтобы обеспечить эффективное и масштабируемое извлечение контекста, к аннотированному набору данных применяется обученная модель Sentence-Transformer35,36. Этот преобразователь преобразует текст в многомерные вложения, которые улавливают семантическое значение. Вложения хранятся в VD, FAISS29,32 для обеспечения быстрого поиска на основе сходства.
Обработка пользовательского запроса: Когда пользователь отправляет вопрос, вопрос обрабатывается тем же преобразователем предложений35,36. При этом генерируется соответствующее встраивание в то же векторное пространство 29,32, что и контекстные вложения. Такая структура гарантирует, что запрос может быть сопоставлен с соответствующими записями контекста.
Извлечение контекста с использованием векторного сходства: Используя метрику сходства (например, косинусное сходство), система сравнивает встраивание запроса с сохраненными вложениями контекста. Система выбирает наиболее релевантный контекст на основе наивысшей оценки сходства. Это гарантирует, что в нижестоящие модели передается только релевантный контекст. Этот процесс снижает вычислительные затраты и повышает релевантность.
Оценка модели в нескольких LLM: Выбранный контекст оценивается тремя LLM на основе трансформаторов: Google-BERT28, DistilBERT10 и RoBERTa12. Он также оценивается с помощью традиционного TF-IDF37 на основе ключевых слов с моделью косинусного сходства. Каждая модель обрабатывает контекст и генерирует ответ на вопрос пользователя.
Сравнительная оценка: Ответы четырех моделей LLM оцениваются с использованием двух ключевых показателей. Во-первых, семантическое соответствие оценивается по EM14. Во-вторых, задержка модели анализируется по среднему времени реакции15.
Выбор модели и окончательный результат: Наиболее эффективная модель выбирается в качестве подходящей LLM для вопроса пользователя. Учитывается итоговый отклик от выбранной модели. Это обеспечивает баланс между эффективностью вычислений и качеством отклика.

Рисунок 10: Рабочий процесс системы SCD-QA с использованием моделей на основе трансформаторов. На рисунке показано, как работает система SCD-QA. Сначала необработанный контекстный файл обрабатывается инструментом аннотаций для создания набора данных в формате SQuAD. Затем преобразователь предложений генерирует вложения, которые сохраняются в векторной базе данных FAISS. Когда пользователь задает вопрос, система создает для него встраивание и выбирает наиболее релевантный контекст. Он сравнивает три модели на основе трансформаторов - Google-BERT, DistilBT и RoBERTa, а также одну традиционную оценку сходства TFIDF + косинус - и использует наиболее эффективную из них для получения ответа. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.