Artigo de investigação

Sistema de Resposta a Perguntas Semânticas de Domínio Fechado como um Caso de Uso de Modelos BERT Baseados em Transformadores

DOI:

10.3791/69424

14 de novembro de 2025

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo projeta um sistema de aprendizagem adaptativa para extrair conhecimento do texto para responder a perguntas, comparando o modelo Google-BERT, DistilBERT, RoBERTa e TF-IDF, usando similaridade de cosseno, sobre latência e generalização semântica. O Google-BERT tem melhor desempenho, embora o sistema permaneça sensível a erros de ortografia, enfatizando a necessidade de um pré-processamento forte para aplicação prática.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Para extrair conhecimento de arquivos de texto e responder às perguntas dos usuários encontrando as informações corretas no contexto, um sistema de aprendizado adaptativo, como um Sistema de Resposta a Perguntas (QAS), é projetado para essa finalidade. Esse foco incentiva um estudo mais aprofundado sobre sistemas de resposta direta e o uso de testes em larga escala para tarefas de resposta a perguntas (QA). Para facilitar isso, um conjunto de dados de controle de qualidade semântico de domínio fechado (SCD-QA), que engloba questões factóides e não factóides, é empregado em conjunto com modelos de transformadores pré-treinados. Neste estudo, a capacidade de fazer inferências é medida e comparada entre três modelos de transformadores pré-treinados, como Google-BERT, DistilBERT e RoBERTa, no conjunto de dados SQuAD, e um modelo TF-IDF clássico baseado em palavras-chave com similaridade de cosseno. Os resultados mostram que o Google-BERT tem melhor desempenho, com uma pontuação média de correspondência exata (EM) de 90,0 e uma latência média de 1,27 s. O sistema também tem um bom desempenho em perguntas com sinônimos, mostrando uma forte compreensão do significado. Mas ele tem um desempenho inadequado em perguntas com erros de ortografia, indicando que é sensível a erros ortográficos e requer um melhor processamento inicial em uso.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O Processamento de Linguagem Natural (NLP) é um subdomínio da Inteligência Artificial (IA) onde o QAS pode ser construído, permitindo que os sistemas de computador gerem automaticamente respostas às perguntas1. A PNL se concentra principalmente na compreensão e interpretação da linguagem escrita de uma maneira que emula os processos cognitivos do cérebro humano2. Envolver-se nessas tarefas estabelece a PNL como uma técnica fundamental na construção de um sistema capaz de gerar respostas semelhantes às humanas.

O QAS, que responde às perguntas do usuário, é um exemplo de como a PNL é usada3. QAS é uma área de estudo que incorpora pesquisas de vários domínios com problemas comuns, como Recuperação de Informações (IR), Extração de Informações (IE) e PNL. Atualmente, os mecanismos de pesquisa contemporâneos executam principalmente tarefas de recuperação de documentos4. Em outras palavras, quando fornecidos com palavras-chave específicas, esses mecanismos de pesquisa produzem exclusivamente uma lista de documentos relevantes classificados com base na relevância e contendo as palavras-chave especificadas. Eles não fornecem uma resposta precisa. O objetivo do QAS é ajudar os indivíduos a localizar respostas precisas para perguntas específicas em áreas temáticas limitadas5. O agrupamento de QAS pode ser feito com base nas seguintes categorias descritas na Figura 16. Tanto o QAS factóide quanto o não factóide operam usando linguagem natural (NL) e são projetados para responder a perguntas feitas em NL. O sistema utiliza técnicas de PNL para fornecer respostas com base nocorpus 7 disponível.

Figura 1
Figura 1: Categorização dos sistemas de controle de qualidade. A figura ilustra um mapa mental dos principais componentes de um sistema de controle de qualidade. No centro está o sistema de controle de qualidade, que lida com vários tipos de perguntas, incluindo factóides, não factóides, híbridos, visuais, conversacionais e perguntas de múltipla escolha. Clique aqui para ver uma versão maior desta figura.

Este estudo apresenta um sistema de Resposta a Perguntas Semânticas de Domínio Fechado (SCD-QA) para responder aos usuários em NL sobre Ph.D. políticas e procedimentos de admissão. O sistema usa o Ph.D. regras e regulamentos PDF8 como seu contexto central e implementa o modelo Bidirectional Encoder Representations from Transformers (BERT)9 baseado em transformador como a estrutura principal para gerar respostas. O objetivo é criar um QAS baseado em perguntas frequentes semanticamente conversacional que forneça respostas precisas a perguntas comuns, tornando mais fácil para os alunos recém-admitidos encontrar rapidamente as informações essenciais de que precisam.

Para atingir esse objetivo, três modelos BERT baseados em transformadores amplamente conhecidos foram empregados: Google-BERT9, DistilBERT10,11 e RoBERTa 12,13, todos treinados no Stanford Question Answering Dataset (SQuAD)14. Seu desempenho foi avaliado por meio de dois parâmetros críticos: correspondência semântica, medida por Correspondência Exata (EM)14, e Latência do modelo15, analisada por tempos médios de reação. Além disso, um banco de dados vetorial (VD)16,17 foi usado para armazenar incorporações semânticas, facilitando a recuperação do contexto semanticamente mais relevante para a pergunta de um usuário com base em pontuações de similaridade semântica.

Revisão da literatura

Os modelos baseados em transformadores revisaram o campo da PNL, produzindo melhorias significativas no QAS. A introdução do BERT9 enfatizou firmemente as arquiteturas de transformadores como um componente essencial no desenvolvimento de QAS robusto e preciso. Nesta seção, é apresentada uma revisão abrangente das melhorias recentes em modelos baseados em transformadores e incorporações semânticas, com foco em sua relevância para o QA do Diálogo Conversacional Semântico (SeCD). Uma análise comparativa é realizada para justificar a integração desses modelos neste trabalho, enfatizando sua viabilidade para gerar insights significativos no campo.

Arquiteturas baseadas em transformadores como BERT, DistilBERT e RoBERTa usam metodologia de autoatenção para capturar relações contextuais complexas no texto, o que as torna ideais para tarefas que precisam de compreensão semântica significativa, como QAS. Esses modelos, juntamente com transformadores de frases especializados, geram incorporações semânticas, ajudam a permitir a recuperação rápida e precisa do contexto por meio de pesquisas de similaridade baseadas em vetores no controle de qualidade do SeCD. Pesquisas recentes se concentram em melhorar esses modelos e incorporar técnicas para aumentar a taxa de transferência, escalabilidade e eficiência, especialmente para usos específicos de tarefas, como SCD-QA.

Sengupta et al.18 introduziram uma abordagem criativa para impulsionar o QAS de múltipla escolha (MCQAS) para questões baseadas na ciência, ajustando os modelos BERT. Em sua estrutura, eles primeiro avaliaram a similaridade semântica distribuída entre os pares de perguntas e respostas e, em seguida, alimentaram essas pontuações de similaridade, juntamente com as características originais, em uma camada de classificação. Essa abordagem combinada alcançou uma pontuação F1 de 90,2% no conjunto de dados SciQ, destacando a eficácia do BERT em QASs específicos de tarefas que exigem compreensão diferenciada e classificação precisa.

Cichecki et al.19 compararam o ChatGPT e os modelos BERT ajustados para sistemas de suporte de design inteligente e descobriram que os modelos BERT ajustados superam os Large Language Models (LLMs) de uso geral, como o ChatGPT, em tarefas específicas de domínio, alcançando uma pontuação F1 de 88,5% em um conjunto de dados personalizado. O estudo mostra a importância do ajuste fino específico do domínio para melhorar o desempenho do modelo em aplicativos especializados.

Guo et al.20 examinaram a eficiência das estratégias de ajuste fino específicas da tarefa para QASs sob orçamentos de anotação limitados. Seu trabalho revelou que uma abordagem de ajuste fino duplo - inicialmente em um conjunto de dados de controle de qualidade geral, como o SQuAD, seguida de ajuste fino em um conjunto de dados específico da tarefa - atinge um avanço significativo de 15% na pontuação F1 em conjuntos de dados como COVID-QA. Essa descoberta destaca o papel crítico do ajuste fino sequencial na melhoria do desempenho dos QASs SeCD.

Pudasaini e Shakya21 examinaram a aplicação de modelos BERT ajustados para controle de qualidade em artigos de pesquisa biomédica, relatando pontuações EM e F1 de 83,89% e 89,67%, respectivamente, em um conjunto de dados biomédico personalizado de controle de qualidade proveniente do PubMed. Ao alavancar o aprendizado de transferência com o PubMedBERT, sua técnica ilustrou uma capacidade notável de processar consultas biomédicas complexas, enfatizando o potencial de ajuste fino específico da tarefa neste campo.

Baek et al.22 propuseram a estrutura de Prompting do Modelo de Linguagem Aumentada por Conhecimento para QA de Gráfico de Conhecimento (KG) zero-shot. Essa abordagem usa semelhanças semânticas para recuperar fatos pertinentes de um KG e incorporá-los à pergunta de entrada. Como resultado, alcançou uma pontuação F1 de aproximadamente 85% nos conjuntos de dados KG-QA. O trabalho ilustra o potencial da combinação de KGs e modelos de transformadores, destacando os benefícios do aumento do conhecimento na melhoria do desempenho do controle de qualidade.

Hu et al.23 descreveram um QAS projetado para o domínio de registro de domicílios, aproveitando um KG juntamente com modelos baseados em BERT (RoBERTa-BiLSTM-MultiHeadAttention) para classificação de intenção e análise semântica. Ao simplificar as perguntas em entidades de evento único e relações de intenção, isso alcançou alta precisão na consulta de dados estruturados. Além disso, a escalabilidade da metodologia para outros domínios enfatiza seu potencial de ampla aplicabilidade em QAS baseado em KG.

Luo et al.24 introduziram um esquema baseado em BERT para controle de qualidade da Base de Conhecimento (KB), integrando um Modelo de Poda de Multigranularidade (MGPM) com atenção sensível à relação. Sua abordagem alcança precisões significativas de 94,4% no SimpleQuestions, 68,6% no WebQuestionsSP e 63,7% no WebQuestions. Esses resultados mostram a eficácia do BERT em alavancar a similaridade semântica para consultas de dados estruturados. No geral, este estudo destaca o potencial dos modelos baseados em transformadores para KB-QA, particularmente em cenários em que a identificação exata de entidades e relações é importante.

Wu et al.25 projetaram uma estrutura de geração aumentada por recuperação para controle de qualidade no gerenciamento de construção, com foco específico em consultas de segurança e conformidade. Ao integrar incorporações semânticas baseadas em BERT com um modelo de transformador generativo e um KG específico da tarefa, sua abordagem alcançou uma pontuação F1 de 88,7% em um conjunto de dados de controle de qualidade relacionado à construção. Este estudo demonstra o potencial de combinar a compreensão semântica com a recuperação baseada em KG para melhorar a precisão em um conjunto de dados de controle de qualidade específico da tarefa para gerenciamento de construção.

Peng et al.26 avaliaram sistematicamente LLMs, incluindo modelos baseados em BERT e GPT, para controle de qualidade médico. Ao combinar a compreensão contextual do BERT e as habilidades generativas do GPT, eles usaram a geração aumentada por recuperação e o ajuste fino específico do domínio para alcançar uma pontuação F1 de 86,2% em um conjunto de dados do PubMed e notas clínicas. Este estudo destaca o potencial dos modelos de conjunto para melhorar a precisão da inferência na área da saúde, onde tanto o contexto quanto a geração precisa são críticos.

Gardazi et al.27 revisaram o uso do BERT em tarefas de PNL, como controle de qualidade, análise de sentimentos e reconhecimento de entidades nomeadas (NER). Sua análise mostrou que os modelos BERT ajustados atingem pontuações F1 de 85% a 92% em conjuntos de dados de controle de qualidade específicos da tarefa, como o SQuAD. Isso mostra que o BERT produz de forma confiável incorporações contextuais eficazes e adiciona KGs, tornando-o adequado para SeCD QAS.

Os modelos baseados em transformadores tornaram-se a escolha decisiva para QASs SeCD devido à sua capacidade única de capturar processamento sensível ao contexto, dimensionar com eficiência e se adaptar a tarefas específicas de domínio. A Tabela 1 ilustra essa vantagem decisiva comparando modelos baseados em transformadores com métodos alternativos examinados neste estudo 18,20,22,23,24,25.

AproximaçãoCaracterísticas principaisVantagensLimitaçõesMétricas de desempenho (SQuAD)Adequação do caso de uso
Modelos baseados em transformadores (BERT, RoBERTa, DistilBERT)Modelagem de contexto bidirecional, autoatenção, ajuste fino em dados específicos de domínio 16, 17, 19, 24, 25Alta precisão, compreensão semântica robusta, escalável com bancos de dados vetoriais 18, 20, 22, 24, 25Maior custo computacional, requer pré-treinamento 17, 18EM: 80–90%, F1: 85–93% 16, 17, 19, 24, 25Ideal para sistemas de domínio fechado (CD) -QA, perguntas frequentes e pesquisa semântica 16, 17, 19, 20, 22, 24, 25
Sistemas tradicionais baseados em regrasRegras feitas à mão, correspondência de palavras-chave 16Baixo custo computacional, implementação simples 16Escalabilidade limitada, tratamento inadequado de consultas complexas 16, 18EM: 50–60%, F1: 55–65% 16QAS básico com dados estruturados 16
Redes Neurais Recorrentes (RNNs)Processamento sequencial, arquiteturas LSTM/GRU 19Desempenho moderado para tarefas sequenciais 19Lutas com dependências de longo alcance, inferência mais lenta 19, 9EM: 65–75%, F1: 70–80% 19Tarefas gerais de PNL, menos eficazes para CD-QA 19, 9
Sistemas de recuperação baseados em palavras-chaveAlgoritmos TF-IDF, BM25 18, 22Recuperação rápida, baixo uso de recursos 18, 22Limitado à correspondência no nível da superfície, má compreensão semântica 18, 22EM: 40–50%, F1: 45–55% 18, 22Recuperação de documentos, não adequado para QAS 18, 22 precisos
Redes neurais convolucionais (CNNs)Extração de recursos locais, camadas convolucionais 25Eficiente para classificação de texto curto, inferência rápida 25Compreensão contextual limitada, menos eficaz para QAS 25 complexoEM: 60–70%, F1: 65–75% 25Classificação de texto, não ideal para CD-QA 25
Redes neurais de grafos (GNNs)Modelagem baseada em grafos, raciocínio relacional 20Eficaz para raciocínio multi-hop, captura relacionamentos de documentos 20Alta complexidade computacional, requer dados estruturados 20EM: 70–80%, F1: 75–85% 20QAS multi-hop, menos adequado para CD-QA 20 de contexto único
Sistemas baseados em gráficos de conhecimentoRepresentação estruturada do conhecimento, vinculação de entidades 21Forte para consultas de dados estruturados, aproveita o conhecimento externo 21Requer gráficos de conhecimento pré-construídos, limitados a entidades conhecidas 21EM: 65–75%, F1: 70–80% 21QAS específico de domínio com dados estruturados 21
Modelos de atenção aumentadaMecanismos de atenção aprimorados, processamento focado no contexto 24Foco aprimorado em segmentos de texto relevantes, alta precisão 24Maior custo computacional, implementação complexa 24EM: 85–90%, F1: 88–92% 24CD-QA complexo, perguntas não factóides 24
Modelos de saco de palavrasRepresentação baseada em frequência de palavras 22Simples, computacionalmente leve 22Má compreensão semântica, ineficaz para consultas complexas 22, 25EM: 35–45%, F1: 40–50% 22Recuperação de texto básica, não adequada para QAS 22, 25
Modelos Neurais Híbridos (CNN+RNN)Combina processamento local e sequencial 25Equilibra a compreensão local e contextual 25Complexidade moderada, lutas com contextos longos 25EM: 68–78%, F1: 72–82% 25Tarefas gerais de PNL, ajuste moderado para CD-QA 25
Modelos de linguagem estatísticaAssociações probabilísticas de palavras 18Rápido para consultas simples, baixo uso de recursos 18Compreensão contextual limitada, baixa escalabilidade 18EM: 45–55%, F1: 50–60% 18QAS básico, não adequado para CD-QA 18 complexo

Tabela 1: Comparação de modelos baseados em transformadores com outras abordagens para QAS. A tabela fornece uma comparação lado a lado de várias abordagens de sistema de controle de qualidade, incluindo modelos baseados em transformadores, sistemas baseados em regras, RNNs e outros. Ele resume seus principais recursos, pontos fortes, fracos, desempenho no SQuAD e as tarefas para as quais eles são mais adequados, como CD-QA, pesquisa semântica e classificação de texto.

O principal objetivo desta pesquisa é melhorar o acesso dos alunos às informações institucionais, desenvolvendo sistemas SCD-QA eficientes, escaláveis e precisos em PNL. Especificamente, este estudo confirmatório aplica e valida modelos baseados em transformadores pré-treinados dentro do domínio do Ph.D. políticas de admissão. O objetivo é demonstrar sua eficácia e viabilidade prática, incorporando correspondência semântica, avaliação de latência do modelo e recuperação semântica orientada por VD. Essa abordagem oferece uma análise aprofundada para fornecer respostas precisas e específicas de domínio em um contexto institucional focado. A Figura 2 ilustra a estrutura arquitetônica holística do sistema.

Figura 2
Figura 2: Esquema geral do sistema SCD-QA. A figura ilustra um fluxograma de um sistema de controle de qualidade que utiliza grandes modelos de linguagem (LLMs). Ele começa com um arquivo de contexto e uma pergunta do usuário, que são tratados por três modelos: Google-BERT, DistilBERT e RoBERTa, e um modelo baseado em palavras-chave: TF-IDF. O sistema avalia o desempenho de cada modelo usando uma lista de verificação e, em seguida, seleciona o melhor com base nos resultados. Clique aqui para ver uma versão maior desta figura.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Base teórica abrangente

Componente QAS: A estrutura QAS consiste em três segmentos, conforme mostrado na Figura 3: i) Módulo de processamento de perguntas (QPM), ii) Módulo de processamento de documentos (DPM) e iii) Módulo de extração e formulação de respostas (AEFM). O sistema recebe perguntas que se enquadram em duas categorias principais: Factoide e Não Factóide. As perguntas factóides geralmente usam palavras interrogativas como o quê, onde, quando ou quem, enquanto as perguntas não factóides usam palavras como como e por quê.

DPM: Na lista fornecida, o usuário pode selecionar uma passagem específica. Em seguida, cada token na passagem é marcado usando um marcador de parte da fala (POS). Para extrair verbos, identifique todos os tokens marcados como verbos. Combine esses verbos com uma lista de verbos não convencionais e aplique lógica para verbos regulares. Crie uma estrutura de dados (array) contendo os verbos extraídos, seus tempos verbais e suas formas -ing.

QPM: O sistema recebe entrada na forma de uma pergunta do usuário. O texto é indexado usando a classe StringTokenizer e os tokens resultantes são armazenados em uma estrutura de dados separada. Essa estrutura de dados é então retornada para utilização posterior dentro do programa.

AEFM: O primeiro passo é identificar o verbo na pergunta dada. O verbo que foi identificado recentemente agora é correspondido aos tokens que foram gerados durante o estágio de processamento do documento. O caso escolhido para um tipo específico de pergunta factual (como o quê ou quando) é utilizado para extrair e construir a resposta de maneira mais precisa.

Antes de escolher o tipo de questionamento, o usuário é solicitado a selecionar a passagem de sua escolha. O QPM é responsável por processar a pergunta do usuário e encaminhá-la para o AEFM. O AEFM utiliza as extrações obtidas do DPM e os documentos processados que contêm o formato marcado do documento de entrada original. O módulo passará os algoritmos necessários para o módulo de formulação para obter a resposta desejada.

Figura 3
Figura 3: Componentes do QAS. A figura ilustra o processo de quatro etapas de um sistema de controle de qualidade: Pergunta, Processamento de perguntas, Processamento de respostas e Resposta. No Processamento de perguntas, o sistema classifica a pergunta. No Processamento de Respostas, ele encontra e revisa documentos e passagens para produzir a resposta. Clique aqui para ver uma versão maior desta figura.

Modelo BERT: Para descobrir as associações entre palavras em um texto, o método BERT usa um transformador. Existem dois mecanismos em um transformador - um codificador e um decodificador28, mas apenas o codificador é necessário para o BERT. O BERT adota uma abordagem bidirecional e verifica sistematicamente o texto de entrada para ensinar a si mesmo o significado das palavras em seu contexto. O codificador usa como entrada uma série de tokens que foram vetorizados. Os vetores são então alimentados na rede neural, que produz uma série de vetores que refletem a entrada. O vetor de saída de uma palavra muda dependendo da frase em que ela aparece. O vetor de uma palavra pode variar dependendo do contexto em que ela aparece; por exemplo, "like" em "He likes to play cricket" tem um vetor diferente de "like" em "His face turned red like a tomato". A abordagem começa com uma fase de processamento de texto antes de passar para a fase de construção do modelo. As etapas que o BERT executa para processar o texto são discutidas na próxima seção28.

Processamento de texto: O modelo BERT representa o texto de entrada de acordo com um conjunto prescrito de princípios. Além disso, esse fator contribui para o melhor desempenho do modelo. A incorporação de entrada no BERT consiste em um amálgama de três tipos distintos de incorporações28.

Incorporações de posição (PEs): Para aprender as informações relacionadas à ordem nas incorporações, são usados PEs. Os PEs são usados para restaurar informações sobre a ordem perdida nos transformadores. O BERT desenvolve PEs distintos especificamente para cada ponto na sequência de entrada. O BERT possui a capacidade de transmitir as informações posicionais das palavras dentro de uma frase, utilizando PEs. Isso permite que o BERT capture e represente efetivamente a sequência ou a ordem das palavras.

Incorporações de sentenças (SEs): Além disso, para ajudar o modelo a distinguir entre a primeira e a segunda frases, o BERT aprende uma incorporação que é exclusiva para cada uma delas. Também é capaz de aceitar frases emparelhadas como entradas para atividades como controle de qualidade.

Incorporações de token (TEs): TEs são ensinados para cada token no vocabulário de token WordPiece. O vocabulário do token WordPiece compreende unidades de subpalavras derivadas de palavras encontradas no corpus. Como um exemplo ilustrativo, esta coleção de vocabulário abrangerá todas as subpalavras concebíveis do termo Pergunta, incluindo Questio, Questi e assim por diante.

A representação de entrada de um token é construída adicionando suas incorporações nos níveis de segmento e posição. Por causa disso, é uma abordagem de incorporação extensa que fornece uma riqueza de informações para o modelo. A Figura 49 mostra as incorporações do modelo BERT.

Figura 4
Figura 4: Incorporações do BERT. A figura mostra como as incorporações de entrada são criadas para um modelo de transformador. Começa com uma sequência de entrada: [CLS] o céu [MASK] está nublado [SEP] vai chover [SEP]. Cada token na sequência recebe sua própria incorporação, como Ethe ou E[MASK]. Em seguida, as incorporações de frases são adicionadas para cada frase, como EA para a primeira e EB para a segunda. Incorporações posicionais, rotuladas de E0 a E9, também são incluídas para indicar a posição de cada token. Tudo isso é combinado para formar as incorporações de entrada finais. Este número foi modificado de9Clique aqui para ver uma versão maior desta figura.

Projeto QAS usando BERT: Para fins ilustrativos, examine esta questão em conjunto com um parágrafo extraído de uma entrada da Wikipedia sobre a Football League28.

Pergunta: Onde foi fundada a Football League?

Passagem: Em 1888, a Football League foi fundada na Inglaterra, tornando-se a primeira de muitas competições profissionais de futebol. Durante o século 20, vários dos vários tipos de futebol cresceram e se tornaram alguns dos esportes coletivos mais populares do mundo.

Resposta: Inglaterra

O modelo BERT utiliza a extração de token da pergunta e do contexto, combinando-os posteriormente em uma entrada unificada. Como dito anteriormente, o processo começa com a utilização de um token [CLS], que serve como um indicador para o início de uma frase. Além disso, um separador [SEP] é empregado para separar distintamente a pergunta e a passagem. Além do token [SEP], o BERT incorpora SEs para distinguir entre a pergunta e a passagem28 que contém a resposta. O BERT usa dois SEs, um dedicado à pergunta e outro à passagem, para estabelecer uma distinção clara entre eles. As incorporações são posteriormente combinadas com uma representação one-hot28 de tokens para diferenciar entre a pergunta e a passagem. Esse processo é ilustrado na Figura 5.

Figura 5
Figura 5: Representação de entrada BERT. A figura ilustra como as incorporações de entrada são geradas para um QAS baseado em BERT. Começa com o token [CLS], depois a pergunta Quantos? [SEP], e a passagem BERT grande é, cada uma com suas incorporações de frases (A para a pergunta, B para a passagem). Token, frase e incorporações posicionais são combinadas para fazer a entrada final. Clique aqui para ver uma versão maior desta figura.

Posteriormente, a representação incorporada combinada28 da pergunta e do contexto é utilizada como entrada no modelo BERT. A camada oculta final do BERT é modificada para usar o SoftMax para gerar distribuições de probabilidade. Essas distribuições determinam os índices inicial e final de uma subcadeia de caracteres dentro da frase de texto de entrada, que representa uma resposta, conforme ilustrado na Figura 6, para uma representação visual.

Figura 6
Figura 6: Fluxo de trabalho de processamento do BERT para controle de qualidade. A figura mostra como o modelo BERT funciona para controle de qualidade. Ele apresenta uma sequência de entrada que inclui uma pergunta, marcada por um token de classificação [CLS] no início e um token separador [SEP] no final, seguido por um contexto, separado por outro [SEP]. Os tokens nesta sequência são transformados em incorporações. O modelo então prevê as posições inicial e final da resposta dentro da passagem. Clique aqui para ver uma versão maior desta figura.

Banco de dados vetorial (VD): Um VD17,18 é um sistema especializado para armazenar, gerenciar, indexar e consultar com eficiência representações vetoriais de dados de alta dimensão. Os vetores geralmente são gerados a partir de modelos de aprendizado profundo e encapsulam informações semânticas ou contextuais sobre os dados. Cada dimensão de um vetor representa uma característica específica. Incorporações são representações numéricas de objetos como texto, imagens, vídeos e áudio. Essas incorporações são usadas em vários aplicativos, incluindo Machine Learning (ML), NLP, sistemas de recomendação, visão computacional e IR. Os VDs facilitam pesquisas de similaridade eficazes e consultas semânticas agrupando objetos semelhantes próximos no espaço vetorial. O Facebook AI Similarity Search (FAISS)29 é um VD proeminente usado neste estudo para identificar o contexto mais relevante para as consultas do usuário. A Tabela 2 descreve as principais características dos VDs e seus casos de uso.

CaracterísticaDescrição
Dados de alta dimensãoLida com dados com centenas ou milhares de dimensões.
Vizinho mais próximo aproximado (RNA)Permite pesquisas rápidas de similaridade aproximando distâncias.
EscalabilidadeSuporta conjuntos de dados em grande escala com bilhões de vetores.
IntegraçãoGeralmente se integra a estruturas e ferramentas de IA/ML para fluxos de trabalho contínuos.
Consultas em tempo realFornece pesquisas vetoriais de baixa latência para aplicativos interativos.

Tabela 2: Principais características da DV. A tabela destaca características importantes da DV. Isso inclui lidar com dados de alta dimensão, executar pesquisas rápidas de similaridade usando algoritmos de ANN, dimensionar para grandes conjuntos de dados, trabalhar com ferramentas de IA e ML e oferecer suporte a consultas rápidas e em tempo real para uso interativo.

Métricas de avaliação de desempenho: O sistema SCD-QA foi avaliado usando duas métricas primárias: escore EM14 e modelo Latência15. A pontuação EM, uma métrica padrão em estudos de controle de qualidade, avalia a precisão da previsão medindo a proporção de respostas previstas que correspondem exatamente à verdade. Para um conjunto de N questões, a pontuação EM é formalmente definida na Equação 1 da seguinte forma:

Equação 1onde Equação 2 (1)

Essa métrica atribui uma pontuação de 1 para uma correspondência exata com a resposta de referência e 0 para qualquer diferença.

A métrica Latência quantifica o tempo total de processamento necessário para o sistema gerar uma resposta a uma consulta individual. Essa métrica é calculada como o tempo médio decorrido em todas as consultas, conforme apresentado na Equação 2:

Equação 3 (2)

onde Tstarti e Tendi são os carimbos de data/hora que marcam o início e o fim do processamento da i-ésima consulta, respectivamente. A latência é relatada em s e captura a capacidade de resposta do sistema, abrangendo todos os estágios, desde o processamento de entrada até a geração de respostas.

Método

Para implementar o SCD-QA, os seguintes estudos de teste são incorporados neste artigo.

Conjunto de dados SCD-QA: Um conjunto de dados proposto30 é introduzido para a implementação do sistema SCD-QA. Este conjunto de dados é derivado de um corpus de texto contendo Ph.D. regras para 20228, para diretrizes de alunos do NIT Arunachal Pradesh, Índia. Para estabelecer o sistema SCD-QA, é necessário gerar um arquivo JSON que englobará todas as informações pertinentes em um formato preciso. O conjunto de dados é gerado a partir do corpus de texto usando a ferramenta de anotação Haystack (versão 2.18.1)31, uma estrutura de código aberto. Essa ferramenta facilita a criação do conjunto de dados SCD-QA no estilo do SQuAD14. As etapas para criar um conjunto de dados anotado do tipo SQuAD a partir do arquivo PDF são mostradas na Figura 7, e a estrutura de nosso conjunto de dados no estilo SQuAD é ilustrada na Figura 8.

Figura 7
Figura 7: Etapas para criar um conjunto de dados anotado a partir de um arquivo PDF. A figura ilustra um fluxo de trabalho passo a passo para criar um conjunto de dados anotado no estilo SQuAD usando ferramentas Haystack. Ele descreve o processo de extração de texto de PDFs, limpeza e divisão em passagens, anotação manual de pares de perguntas e respostas, armazenamento das anotações no formato JSON SQuAD e, finalmente, exportação do conjunto de dados para treinamento de modelos. Clique aqui para ver uma versão maior desta figura.

Figura 8
Figura 8: Estrutura do conjunto de dados de controle de qualidade do factoide. A figura exibe uma estrutura de dados JSON que representa um parágrafo e um par de controle de qualidade de um conjunto de dados. Possui uma seção de parágrafos, que contém um conjunto de perguntas e respostas. Uma pergunta é: Qual é a nota mínima exigida para ser admitido no Ph.D. Ciência? Cada pergunta tem um ID e uma matriz de respostas. A resposta inclui um ID de documento, ID de pergunta, as notas de 60% do texto, a posição inicial da resposta e uma categoria de resposta não especificada. O sinalizador is_impossible é definido como false. Clique aqui para ver uma versão maior desta figura.

O conjunto de dados é estruturado como uma lista de dicionários, em que cada dicionário contém campos-chave, como dados, parágrafos, pergunta, answer_id, document_id, question_id, texto, answer_start, answer_end, is_impossible e contexto.

data: contém as informações gerais de resposta às perguntas.
parágrafos: Um contexto específico, juntamente com suas perguntas e respostas.
pergunta: Uma pergunta particular.
answer_id: Um número de identificação exclusivo para cada texto de resposta.
document_id: Um número de identificação exclusivo para cada contexto.
question_id: Um número de identificação exclusivo para cada pergunta.
text: o texto da resposta.
answer_start: O local inicial da resposta correta no contexto.
answer_end: O local final da resposta correta no contexto.
is_impossible: Informa se a resposta à pergunta feita está disponível no contexto ou não.
context: O corpus de texto a partir do qual uma resposta pode ser encontrada.
Todas as 80 perguntas no conjunto de dados proposto seguem o formato de pergunta factóide e não factóide. Exemplos de alguns tipos de perguntas formuladas são mostrados na Tabela 3.

Perguntas
Quem é PS?
Qual é o tamanho da fonte do documento de última geração?
Quantos dias tem a Licença Maternidade?

Tabela 3: Exemplo de pergunta do conjunto de dados. A tabela mostra exemplos de dois tipos de perguntas: a primeira e a segunda são perguntas factóides, enquanto a terceira é uma pergunta não factóide.

FAISS: FAISS (versão faiss_cpu-1.9.0)29,32, desenvolvido pela Facebook AI Research (FAIR), é uma biblioteca de código aberto que facilita a pesquisa eficiente de similaridade e o agrupamento de vetores densos. Ele é projetado especificamente para gerenciar dados de alta dimensão e em grande escala de forma eficaz. Este sistema facilita pesquisas rápidas e escaláveis de RNA em conjuntos de dados que compreendem milhões ou bilhões de vetores. É amplamente utilizado em aplicações relacionadas a incorporações, incluindo PNL, sistemas de recomendação e recuperação de imagem ou vídeo. O FAISS oferece vários métodos de indexação, incluindo Flat (força bruta), Arquivo Invertido (IVF), gráficos Hierárquicos Navigable Small World (HNSW) e quantização de produtos (PQ). Esses métodos permitem que os usuários otimizem o desempenho da pesquisa de acordo com o tamanho dos dados, a dimensionalidade e as especificações de hardware. Neste estudo, é utilizada a indexação plana, que realiza uma busca de força bruta usando a distância L2 (euclidiana) para identificar os vizinhos mais próximos. A escalabilidade do sistema suporta implementações de CPU e GPU, permitindo cálculos de alto desempenho em extensos conjuntos de dados. Além disso, oferece flexibilidade para otimizar o equilíbrio entre velocidade e precisão com base nos requisitos específicos da aplicação. O FAISS é frequentemente usado na PNL para avaliar a similaridade semântica em incorporações, como BERT ou Word2Vec. O FAISS é utilizado no QAS para armazenar e gerenciar representações vetoriais de documentos ou frases. Ele realiza pesquisas aproximadas de RNA33 para recuperar o contexto mais relevante para as perguntas do usuário, aprimorando a pesquisa semântica com incorporações de modelos de transformadores, como o BERT. O FAISS é uma ferramenta fundamental nos fluxos de trabalho de IA e ML devido à sua versatilidade.

BERT-large-uncased-whole-word-masking-finetuned- SQuAD model: O presente trabalho utiliza um modelo de linguagem pré-treinado conhecido como BERT-large-uncased-whole-word-mmasking-finetuned-squad9 para desenvolver um QAS factóide usando o conjunto de dados proposto no estudo. O modelo BERT passou por pré-treinamento no BookCorpus, um conjunto de dados de 11.038 livros não publicados9, bem como na Wikipédia em inglês, com exceção de listas, tabelas e cabeçalhos. O modelo em questão não tem caixa, o que significa que não distingue entre as palavras inglês e inglês. O modelo é um modelo de transformador pré-treinado que foi treinado em uma quantidade substancial de dados em inglês usando uma abordagem auto-supervisionada. O modelo foi pré-treinado exclusivamente em textos brutos, sem anotações humanas. Isso permite que ele aproveite uma grande quantidade de dados acessíveis ao público. O processo de pré-treinamento envolve a geração automática de entradas e rótulos a partir dos textos fornecidos. O modelo foi treinado com dois objetivos específicos9:

MLM: O processo envolve mascarar aleatoriamente 15%9 das palavras na frase de entrada. O modelo então processa toda a frase mascarada e prevê as palavras mascaradas. Essa abordagem diverge das Redes Neurais Recorrentes (RNNs) convencionais, que normalmente processam palavras sequencialmente, e de modelos autorregressivos, como o GPT, que empregam mascaramento interno de tokens futuros. A funcionalidade permite que o modelo adquira uma representação bidirecional da frase.

NSP: Durante a fase de pré-treinamento, o modelo combina duas frases disfarçadas como entradas. Em alguns casos, essas frases são adjacentes no texto original, indicando uma relação direta. Em outros casos, eles não são, o que significa que não há proximidade ou contexto original ligando-os. A etapa subsequente envolve o modelo prevendo se as duas frases são logicamente coerentes.

O presente modelo é caracterizado pela configuração subsequente: a arquitetura do modelo consiste em 24 camadas, com uma dimensão oculta de 1024. Ele utiliza 16 cabeças de atenção e tem um total de 336 milhões de parâmetros9.

WordPiece é usado para tokenizar os textos com um tamanho de vocabulário de 30.000 palavras nas etapas de pré-processamento. As entradas do modelo ficariam assim: [CLS] Frase A [SEP] Frase B [SEP]. O único requisito é que o comprimento total das frases combinadas seja inferior a 512 tokens9. O modelo pré-treinado específico produz a saída subsequente: a pontuação F1 alcançada é de 93,15%, enquanto a pontuação precisa da correspondência é de 86,91%9.

Modelo Distilbert/distilbert-base-cased-distilled-squad: O modelo DistilBERT10 é uma variante mais compacta, rápida e eficiente do modelo BERT9 , desenvolvido para manter a maior parte da capacidade semântica de compreensão do BERT, sendo menos intensivo em recursos e mais apropriado para aplicações práticas com capacidade computacional restrita. A versão distilbert-base-cased-distilled-squad foi ajustada no SQuAD14 para tarefas de controle de qualidade. O modelo utiliza a arquitetura do transformador, incluindo um tamanho reduzido de 66 milhões de parâmetros em contraste com os 110 milhões do BERT, mantendo 97% da eficácia do BERT na compreensão da linguagem. O DistilBERT consegue isso usando um método conhecido como Destilação de Conhecimento, que transmite informações do modelo BERT maior para o modelo DistilBERT mais compacto. Devido ao seu tamanho menor, ele pode inferir informações mais rapidamente e usar menos memória, o que o torna perfeito para aplicativos com recursos limitados, como dispositivos móveis ou de borda. O modelo, cuidadosamente ajustado no conjunto de dados SQuAD 1.1, demonstra proficiência excepcional em tarefas de controle de qualidade extrativas, em que o objetivo é localizar um segmento de texto de um contexto especificado que responda a uma pergunta. O DistilBERT atinge aproximadamente 85% da pontuação F1 do BERT na tabela de classificação do SQuAD e retém uma parte significativa da capacidade linguística do BERT, apesar de seu tamanho reduzido. Este modelo é uma solução excepcionalmente eficiente para trabalhos de controle de qualidade em nível de produção, otimizando o desempenho e a eficiência computacional.

Deepset/roberta-base-squad2: O modelo deepset/roberta-base-squad212,13 é uma variante ajustada da arquitetura RoBERTa. Ele foi projetado especificamente para o conjunto de dados SQuAD14 2.0, que inclui perguntas respondidas e não respondidas. Essa estrutura RoBERTa aprimorada elimina os9 trabalhos NSP do BERT. Ele também usa mascaramento dinâmico durante o treinamento para aumentar a eficiência e o desempenho em tarefas de compreensão de NL. O modelo tem 125 milhões de parâmetros e usa um transformador bidirecional. Isso permite que ele adquira informações contextuais de ambas as direções e se destaque em tarefas de controle de qualidade extrativas.

O ajuste fino no SQuAD 2.0 permite que o modelo identifique o intervalo de resposta correto em um determinado contexto e reconheça quando não há resposta. Ele usa um tokenizer BPE (Byte Pair Encoding) que lida com a tokenização de subpalavras e preserva a diferenciação de maiúsculas e minúsculas. Isso melhora sua capacidade de processar palavras incomuns e complexas. O modelo tem um bom desempenho, alcançando cerca de 85% -90% F1 e 80% -85% EM. Sua capacidade de detectar perguntas sem resposta e sua implantação eficaz o tornam valioso para atendimento ao cliente, recuperação de conhecimento e assistentes virtuais.

A maneira mais eficaz de implantar modelos BERT ajustados pelo SQuAD para controle de qualidade é usar o pipeline Hugging Face Transformers34. Essa estrutura simplifica a tokenização, a formatação de entrada, o carregamento de modelos e o pós-processamento de saída. Esses modelos são amplamente reconhecidos por sua eficácia no controle de qualidade extrativo, onde a resposta é um intervalo de texto recuperado diretamente do contexto fornecido. Para orientar a implementação, o procedimento a seguir descreve as etapas para executar modelos BERT.

Entrada e configuração: Esse processo requer quatro entradas principais e parâmetros de configuração: o nome do modelo, especificado como um identificador de string do Hugging Face Hub (por exemplo, google-bert/bert-large-uncased-whole-word-masking-finetuned-squad, distilbert/distilbert-base-cased-distilled-squad ou deepset/roberta-base-squad2); a pergunta (Q), fornecida como uma string contendo a consulta; e o contexto (C), uma string que representa o texto ou passagem relevante. A principal ferramenta usada é a função de pipeline de alto nível da biblioteca de transformadores Hugging Face (versão 4.57.0) em Python (versão 3.12.12).

Processo: Execução (Hugging Face Pipeline): O processo consiste em seis etapas principais e emprega o pipeline Hugging Face para lidar com a complexidade da tarefa de controle de qualidade:

Instalar biblioteca: Comece instalando a biblioteca necessária com o comando pip install transformers. Essa instalação permite o acesso aos modelos e à funcionalidade simplificada do pipeline.

Pipeline de importação: Importe a função de tubulação usando: do pipeline de importação de transformadores.

Inicialize o pipeline de controle de qualidade: Inicialize o pipeline de controle de qualidade usando qa_pipeline = pipeline("question-answering", model=""). Esse comando baixa o modelo e o tokenizador, tornando-os prontos para inferência.

Definir entrada: Definir pergunta = ... e contexto = ... para preparar os dados do modelo.

Executar inferência: Passe a pergunta e o contexto para o pipeline com result = qa_pipeline(question=question, context=context). O modelo processa a entrada e fornece uma resposta.

Extrair resposta: Obtenha a string de resposta do dicionário de saída usando: answer = result['answer'].

Saída: O processo produz vários parâmetros de saída na seguinte ordem: Resposta (o intervalo de texto extraído do contexto, apresentado como uma cadeia de caracteres), Pontuação (um valor de ponto flutuante que quantifica a confiança do modelo em sua previsão) e índices de início e fim (inteiros que especificam as posições de caracteres do intervalo de resposta dentro do contexto).

Transformadores de sentença/todos-MiniLM-L6-v2: O MiniLM-L6-v235 é um transformador de sentença pré-treinado da biblioteca Sentence-Transformers (versão 5.1.1)36. Ele é otimizado para incorporação de texto eficiente e precisa. Desenvolvido na estrutura MiniLM da Microsoft, inclui seis camadas de transformador e incorporações de 384 dimensões. Esse design equilibra desempenho e proficiência computacional, tornando-o adequado para aplicações em tempo real. O modelo foi treinado em mais de um bilhão de pares de frases de conjuntos de dados como SNLI, MultiNLI, benchmarks STS e dados rastreados pela web. Como resultado, ele demonstra proficiência em similaridade semântica, agrupamento e tarefas relacionadas à pesquisa. Devido ao seu tamanho pequeno (~ 22 MB) e desempenho de inferência aprimorado, o MiniLM-L6-v2 simplifica aplicativos como pesquisa semântica, detecção de duplicação e categorização de texto. Embora seja leve, ele oferece forte precisão em benchmarks como STS-B e SICK-R, tornando-o uma escolha eficaz para cenários escaláveis e de recursos limitados. O fluxo de trabalho para gerar a incorporação usando o Sentence-Transformer é representado na Figura 9 abaixo.

Figura 9
Figura 9: Etapa do processo de incorporação usando o modelo de transformador de frase. A figura ilustra o fluxo de trabalho para gerar incorporações de texto usando a estrutura de transformadores de frase. Ele descreve o processo desde a importação de bibliotecas e o carregamento de um modelo pré-treinado até a preparação de dados de texto, geração de incorporações, conversão em matrizes NumPy e armazenamento para tarefas downstream, como indexação ou pesquisa de similaridade. Clique aqui para ver uma versão maior desta figura.

Algoritmo proposto: Este estudo descreve uma metodologia sugerida no Algoritmo 1 para o desenvolvimento do sistema SCD-QA baseado em SeCD, capaz de abordar perguntas factóides e não factóides feitas pelos usuários.

ALGORITMO 1: Algoritmo do sistema SCD-QA baseado em SeCD proposto
Entrada: Conjunto de arquivo de contexto bruto (C) e a consulta do usuário (Q).
Saída: O LLM (M') baseado em transformador ideal selecionado e a resposta gerada por M'.
Contextos de pré-processamento: anote o conjunto de contexto bruto C para criar um conjunto de dados estruturado no formato DSQuAD .
DSQuAD = fanonato (C)
Gerar incorporações de contexto: Use um transformador de sentença fembed para converter cada contexto c Equação 100 DSQuAD em uma incorporação ec.
Equação 15
Armazenar incorporações: Armazene Ec em um banco de dados vetorial V para pesquisa de similaridade eficiente.
Equação 18
Gerar Incorporação de Consulta: Transforme a consulta Q do usuário em uma incorporação eq usando o mesmo Transformador de Frase.
Equação 20
Recuperação de contexto: Recupere a incorporação Equação 21 de contexto mais relevante do banco de dados V com base na semelhança com eq.
Equação 22
onde sim(eq,e c), é a função de similaridade.
Passe o contexto para LLMs: alimente o contexto Equação 21 recuperado em 3 LLMs baseados em transformadores: Google-BERT (M1), DistilBERT (M2), RoBERTa (M3) e um modelo tradicional: TF-IDF+Similaridade de cosseno (M4)
Equação 28
Avaliação do modelo: Compare as respostas {R1,R 2,R 3,R 4} usando uma função de avaliaçãofeval, que pontua cada resposta.
Equação 31
Selecione o melhor modelo: Identifique o modelo M' com a maior pontuação de avaliação S'
Equação 33
Gerar saída final: Use M' para gerar a resposta final R com base emEquação 36
Equação 37
Fim

O processo de algoritmo proposto descreve uma abordagem sistemática (Figura 10) para escolher um LLM baseado em transformador ideal para responder às perguntas do usuário. Ele incorpora pré-processamento, recuperação de contexto baseada em incorporação e avaliação de vários modelos para garantir respostas de alta qualidade e contextualmente relevantes. Abaixo, o processo passo a passo é explicado para maior clareza:

Preparação e pré-processamento de dados: A primeira fase envolve o processamento de dados textuais brutos

Entrada: Os arquivos de texto bruto8 são adaptados ao sistema.

Ferramenta de anotação31: A entrada é transformada em um conjunto de dados estruturado no formato SQuAD14 . Esta etapa envolve a criação de pares de controle de qualidade. Ele também organiza dados textuais relevantes em blocos de contexto bem definidos.

Saída: o conjunto de dados agora está pronto para criar incorporações.

Geração de incorporação de contexto: para permitir a recuperação de contexto eficiente e escalável, um modelo Sentence-Transformer35,36 treinado é aplicado ao conjunto de dados anotado. Esse transformador converte texto em incorporações de alta dimensão que capturam o significado semântico. As incorporações são armazenadas em VD, FAISS29,32 para permitir pesquisas rápidas baseadas em similaridade.

Processamento de consulta do usuário: Quando um usuário envia uma pergunta, a pergunta é processada pelo mesmo Transformador de Sentença35,36. Isso gera uma incorporação correspondente no mesmo espaço vetorial29,32 que as incorporações de contexto. Esse design garante que a consulta possa ser correspondida com entradas de contexto relevantes.

Recuperação de contexto usando similaridade de vetor: usando uma métrica de similaridade (por exemplo, similaridade de cosseno), o sistema compara a inserção de consulta com incorporações de contexto armazenado. O sistema seleciona o contexto mais relevante com base na pontuação de similaridade mais alta. Isso garante que apenas o contexto pertinente seja passado para modelos downstream. O processo reduz a sobrecarga computacional e melhora a relevância.

Avaliação do modelo em vários LLMs: O contexto selecionado é avaliado por três LLMs baseados em transformadores: Google-BERT28, DistilBERT10 e RoBERTa12. Também é avaliado por um TF-IDF37 tradicional baseado em palavras-chave com um modelo de similaridade de cosseno. Cada modelo processa o contexto e gera uma resposta à pergunta do usuário.

Avaliação comparativa: As respostas dos quatro modelos LLM são avaliadas usando duas métricas principais. Primeiro, a correspondência semântica é avaliada pelo EM14. Em segundo lugar, a latência do modelo é analisada pelos tempos médios de reação15.

Seleção de modelo e saída final: O modelo de melhor desempenho é selecionado como o LLM apropriado para a pergunta do usuário. A resposta final do modelo selecionado é considerada. Isso garante um equilíbrio entre eficiência computacional e qualidade de resposta.

Figura 10
Figura 10: Fluxo de trabalho do sistema SCD-QA usando modelos baseados em transformador. A figura mostra como funciona o sistema SCD-QA. Primeiro, um arquivo de contexto bruto é processado por uma ferramenta de anotação para criar um conjunto de dados no formato SQuAD. Um transformador de sentença gera incorporações, que são armazenadas em um banco de dados vetorial FAISS. Quando um usuário faz uma pergunta, o sistema cria uma incorporação para ela e seleciona o contexto mais relevante. Ele compara três modelos baseados em transformadores - Google-BERT, DistilBERT e RoBERTa, e uma pontuação tradicional de similaridade TFIDF + cosseno - e usa o de melhor desempenho para fornecer a resposta. Clique aqui para ver uma versão maior desta figura.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A implementação do sistema SCD-QA usou quatro LLMs e um conjunto de dados de 80 perguntas factóides e não factóides. O processamento foi realizado no Google Colab, utilizando GPUs NVIDIA Tesla T4 (versão do driver: 550.54.15, versão CUDA: 12.4) com 12,7 GB de RAM do sistema, 15 GB de RAM da GPU e 112,6 GB de espaço em disco. O desempenho do modelo foi avaliado usando duas métricas: EM14 para correspondência semântica e latência do modelo15 p...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo apresenta o sistema SCD-QA, que aproveita modelos de linguagem baseados em transformadores para fornecer respostas precisas e sensíveis ao contexto a partir de documentos institucionais estruturados. O fluxo de trabalho do sistema consiste em: (1) pré-processamento de dados; (2) geração de incorporação usando o transformador de sentença de última geração, all-MiniLM-L6-v2; (3) recuperação baseada em similaridade por meio do FAISS; e (4) avaliação abrangente do modelo. O pipel...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores não têm nada a divulgar.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores agradecem ao corpo docente dedicado e à administração do NIT Arunachal Pradesh por seu apoio e orientação inabaláveis ao longo deste estudo. Além disso, somos profundamente gratos aos desenvolvedores e colaboradores de ferramentas de PNL de código aberto e modelos pré-treinados, cujo trabalho tornou essa pesquisa possível. Durante a preparação deste manuscrito, os autores usaram o Grammarly Proofreader para aumentar a clareza. Os autores assumem total responsabilidade pela precisão e integridade do conteúdo.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
All-MiniLM-L6-v2MicrosoftVersão 5.1.1Modelo pré-treinado de transformador de frase para gerar embeddings de alta dimensão. Converte texto em embeddings para recuperação de contexto.
Ferramenta de AnotaçãoPalheiroVersão 2.18.1Plataforma para estruturar texto bruto no formato SQuAD. Prepara o conjunto de dados criando pares de QA e blocos de contexto.
Modelo DistilBERTRosto de AbraçoNALLM leve baseado em transformador com requisitos computacionais reduzidos. Avaliado para comparação, oferece menor latência, mas menor precisão.
FAISS VDFacebookfaiss_cpu-1.9.0VD escalável para buscas baseadas em similaridade. Armazena e recupera embeddings de alta dimensão para um ajuste eficiente de consultas.
Modelo Google-BERTGoogleNALLM pré-treinado baseado em transformador com modelagem de contexto bidirecional. Modelo primário para gerar respostas precisas a consultas de facto e não.
NVIDIA Tesla T4 GPUsNVIDIAVersão do Driver: 550.54.15
Versão CUDA: 12.4
GPUs com 15 GB DE RAM GPU para inferência de modelos. Fornece poder computacional para processamento e avaliação de LLMs.
PitãoFundação de Software PythonVersão 3.12.12Python é uma linguagem de programação líder no campo do Processamento de Linguagem Natural (PLN) devido à sua sintaxe direta, bibliotecas abrangentes e forte suporte comunitário. Ele suporta uma ampla gama de tarefas de PLN, incluindo pré-processamento fundamental de texto e implementações complexas de aprendizado de máquina.
Modelo RoBERTaDeepsetNALLM otimizado baseado em transformadores com estratégias de treinamento aprimoradas. Avaliado para comparação, equilibrando precisão e latência.
Conjunto de dados SCD-QA como SQuAD  FormatoNAVersão 2.0Formato padronizado para pares pergunta-resposta. Estrutura para compatibilidade com modelos de transformadores.

Referências

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Pirtoaca, G. S., Rebedea, T., Ruseti, S. Improving retrieval-based question answering with deep inference models. Int Joint Conf Neural Network. , 1-8 (2019).
  2. NLP-QA framework based on LSTM-RNN. Zhang, X., Chen, M. H., Qin, Y. Int Conf Data Sci Business Anal, , 307-311 (2018).
  3. Natural language processing based new approach to design factoid question answering system. Machhirke, V. S., Soni, A. Second Int Conf Inventive Res Computing Appl, , 276-281 (2020).
  4. Biancofiore, G. M., Deldjoo, Y., Di Noia, T., Di Sciascio, E., Narducci, F. Interactive question answering systems: literature review. ACM Comput Surv. 1 (1), Article 1(2024).
  5. Singh, S., Das, N., Michael, R., Tanwar, P. The question answering system using NLP and AI. Int J Sci Eng Res. 7 (12), 2229-5518 (2016).
  6. Pandya, H. A., Bhatt, B. S. Question answering survey: Directions, challenges, datasets, evaluation matrices. arXiv. , (2021).
  7. Khvalchik, M. A., Kulkarni, K. Open-domain non-factoid question answering. , Springer International Publishing. Cham. (2017).
  8. NIT Arunachal Pradesh PhD rules and regulations year. , National Institute of Technology Arunachal Pradesh. https://www.nitap.ac.in/storage/pdf/140508582e7c89a8b2295595085e3abe-%2003-37-28F%20IN%20AL.pdf (2022).
  9. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. BERT: Pre-training of deep bidirectional transformers for language understanding. Proc NAACL-HLT. , 4171-4186 (2019).
  10. Sanh, V., Debut, L., Chaumond, J., Wolf, T. DistilBERT, a distilled version of BERT: Smaller, faster, cheaper and lighter. arXiv. , (2019).
  11. DistilBERT HuggingFace. , https://huggingface.co/distilbert/distilbert-base-cased-distilled-squad (2023).
  12. Liu, Y., et al. A robustly optimized BERT pretraining approach. arXiv. , (2019).
  13. RoBERTa base squad2. Deepset. , https://huggingface.co/deepset/roberta-base-squad2 (2023).
  14. SQuAD: 100,000+ questions for machine comprehension of text. Rajpurkar, P., Zhang, J., Lopyrev, K., Liang, P. Proc 2016 Conf Empirical Meth Natural Language Proc, , 2383-2392 (2016).
  15. Attention is all you need. Vaswani, A., et al. 31st Conf Neural Informat Proc Syst, , 1-11 (2017).
  16. Malkov, Y. A., Yashunin, D. A. Efficient and robust approximate nearest neighbor search using hierarchical navigable small world graphs. IEEE Trans Pattern Anal Mach Intell. 42 (4), 824-836 (2018).
  17. Similarity search in high dimensions via hashing. Gionis, A., Indyk, P., Motwani, R. Proc 25th VLDB Conf, , 518-529 (1999).
  18. HIJLI_JU at SemEval-2024 task 7: Enhancing quantitative question answering using fine-tuned BERT models. Sengupta, P., Sarkar, S., Das, D. Proc 18th Int Workshop Semantic Evaluat, , 279-284 (2024).
  19. Kocoń, J., et al. ChatGPT: Jack of all trades, master of none. Inf Fusion. 99, 101861(2023).
  20. Fine-tuning strategies for domain specific question answering under low annotation budget constraints. Guo, K., Diefenbach, D., Gourru, A., Gravier, C. IEEE 35th Int Conf Tools with Artificial Intell, , 166-171 (2023).
  21. Question answering on biomedical research papers using transfer learning on BERT-base models. Pudasaini, S., Shakya, S. 7th Int Conf I-SMAC (IoT in Social, Mobile, Analytics and Cloud), , 496-501 (2023).
  22. Knowledge-augmented language model prompting for zero-shot knowledge graph question answering. Baek, J., Aji, A. F., Saffari, A. Proc 1st Workshop Natural Language Reasoning Struct Explanat, , 78-106 (2023).
  23. Hu, S., Zhang, H., Zhang, W. Domain knowledge graph question answering based on semantic analysis and data augmentation. Appl Sci. 13 (15), (2023).
  24. A BERT-based approach for knowledge base question answering. Luo, D., Su, J., Yu, S. Int Joint Conf Neural Networks, , 1-8 (2020).
  25. Wu, C., et al. Retrieval augmented generation-driven information retrieval and question answering in construction management. Adv Eng Inform. 65, 103158(2025).
  26. Peng, C., et al. A study of generative large language model for medical research and healthcare. NPJ Digit Med. 6 (1), 210(2023).
  27. Gardazi, N. M., et al. applications in natural language processing: a review. Artif Intell Rev. 58 (6), 1-49 (2025).
  28. Sabharwal, N., Agrawal, A. Hands-on question answering systems with BERT: applications in neural networks and natural language processing. , Apress Berkeley. CA. (2021).
  29. FAISS documentation. , https://faiss.ai/ (2025).
  30. Bhattacharya, D. SCD-QA dataset. Zenodo. , (2025).
  31. Annotation tool. , https://docs.haystack.deepset.ai/docs/annotation (2025).
  32. Johnson, J., Douze, M., Jégou, H. Billion-scale similarity search with GPUs. IEEE Transac Big Data. 7 (3), 535-547 (2021).
  33. Sun, P., Guo, R., Kumar, S. Automating nearest neighbor search configuration with constrained optimization. arXiv. , (2023).
  34. BERT. , Hugging Face. https://huggingface.co/docs/transformers/model_doc/bert (2025).
  35. MiniLM: Deep self-attention distillation for task-agnostic compression of pre-trained transformers. Wang, W., et al. Proc 34th Int Conf Neural Informat Process Syst, , 5776-5788 (2020).
  36. Sentence transformer documentation. , https://www.sbert.net/ (2025).
  37. Cosine similarity to determine similarity measure: study case in online essay assessment. Lahitani, A. R., Permanasari, A. E., Setiawan, N. A. 4th Int Conf Cyber IT Service Manag, , 1-6 (2016).
  38. A comparative analysis of transformer models in zero-shot text classification. Kyritsis, K., Liapis, C. M., Spatiotis, N., Perikos, I., Paraskevas, M. 15th Int Conf Informat Intelligence Syst Applicat, , 1-4 (2024).
  39. Howard, J., Ruder, S. Universal language model fine-tuning for text classification. Proc 56th Ann Meeting Associat Computat Linguistics. , 328-339 (2018).
  40. Asai, A., Hashimoto, K., Hajishirzi, H., Socher, R., Xiong, C. Learning to retrieve reasoning paths over Wikipedia graph for question answering. arXiv. , (2019).
  41. Lewis, P., et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. arXiv. , (2021).
  42. Leveraging passage retrieval with generative models for open domain question answering. Izacard, G., Grave, E. Proc Conf Eur Chapter Associat Computat Linguistics, , 874-880 (2021).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

Modelos TransformerQA de Dom nio FechadoConjunto de Dados SQuADPerguntas FactuaisPerguntas N o FactuaisModelo TF IDFSimilaridade do CossenoCorrespond ncia de Sin nimos

Artigos relacionados