Artículo de investigación

Sistema de respuesta a preguntas semánticas de dominio cerrado como caso de uso de modelos BERT basados en transformadores

DOI:

10.3791/69424

14 de noviembre de 2025

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio diseña un sistema de aprendizaje adaptativo para extraer conocimiento del texto para responder preguntas, comparando el modelo Google-BERT, DistilBERT, RoBERTa y TF-IDF, utilizando la similitud de coseno, sobre latencia y generalización semántica. Google-BERT funciona mejor, aunque el sistema sigue siendo sensible a los errores ortográficos, lo que enfatiza la necesidad de un preprocesamiento sólido para la aplicación práctica.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Para extraer conocimiento de los archivos de texto y responder a las preguntas de los usuarios encontrando la información correcta en contexto, se diseña un sistema de aprendizaje adaptativo, como un sistema de respuesta a preguntas (QAS), para este propósito. Este enfoque fomenta un mayor estudio sobre los sistemas de respuesta directa y el uso de pruebas a gran escala para tareas de respuesta a preguntas (QA). Para facilitar esto, se emplea un conjunto de datos de control de calidad semántico de dominio cerrado (SCD-QA), que abarca preguntas factoides y no factoides, junto con modelos de transformadores preentrenados. En este estudio, la capacidad de hacer inferencias se mide y compara entre tres modelos de transformadores preentrenados, como Google-BERT, DistilBERT y RoBERTa, en el conjunto de datos SQuAD, y un modelo TF-IDF clásico basado en palabras clave con similitud de coseno. Los resultados muestran que Google-BERT funciona mejor, con una puntuación media de coincidencia exacta (EM) de 90,0 y una latencia media de 1,27 s. El sistema también funciona bien en preguntas con sinónimos, mostrando una sólida comprensión del significado. Pero funciona de manera inadecuada en preguntas con errores ortográficos, lo que indica que es sensible a los errores ortográficos y requiere un mejor procesamiento temprano en uso.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El procesamiento del lenguaje natural (NLP) es un subdominio de la inteligencia artificial (IA) donde se puede construir QAS, lo que permite que los sistemas informáticos generen automáticamente respuestas a las preguntas1. La PNL se centra principalmente en la comprensión e interpretación del lenguaje escrito de una manera que emula los procesos cognitivos del cerebro humano2. Participar en estas tareas establece la PNL como una técnica fundamental en la construcción de un sistema capaz de generar respuestas similares a las humanas.

QAS, que responde a las preguntas del usuario, es un ejemplo de cómo se usa la PNL3. QAS es un área de estudio que incorpora investigación de varios dominios con problemas comunes, como la recuperación de información (RI), la extracción de información (IE) y la PNL. En la actualidad, los motores de búsqueda contemporáneos realizan principalmente tareas de recuperación de documentos4. En otras palabras, cuando se les proporcionan palabras clave específicas, estos motores de búsqueda producen exclusivamente una lista de documentos relevantes clasificados según la relevancia y que contienen las palabras clave especificadas. No proporcionan una respuesta precisa. El propósito de QAS es ayudar a las personas a encontrar respuestas precisas a consultas particulares dentro de áreas temáticas limitadas5. La agrupación de QAS se puede realizar en función de las siguientes categorías descritas en la Figura 16. Tanto el QAS factoide como el no factoide operan utilizando lenguaje natural (NL) y están diseñados para responder a las preguntas planteadas en NL. El sistema utiliza técnicas de PNL para proporcionar respuestas basadas en el corpus7 disponible.

Figura 1
Figura 1: Categorización de los sistemas de control de calidad. La figura ilustra un mapa mental de los componentes primarios de un sistema de control de calidad. En el centro está el sistema de control de calidad, que maneja varios tipos de preguntas, incluidas preguntas fácticas, no fácticas, híbridas, visuales, conversacionales y de opción múltiple. Haga clic aquí para ver una versión más grande de esta figura.

Este estudio presenta un sistema semántico de respuesta a preguntas de dominio cerrado (SCD-QA) para responder a los usuarios en NL sobre las políticas y procedimientos de admisión de doctorado. El sistema utiliza las reglas y regulaciones de doctorado PDF8 como su contexto central e implementa el modelo de representaciones de codificador bidireccional de transformadores (BERT)9 basado en transformadores como el marco principal para generar respuestas. El objetivo es diseñar un QAS basado en preguntas frecuentes semánticamente conversacional que brinde respuestas precisas a preguntas comunes, lo que facilita que los estudiantes recién admitidos encuentren rápidamente la información esencial que necesitan.

Para lograr este objetivo, se emplearon tres modelos BERT basados en transformadores ampliamente conocidos: Google-BERT9, DistilBERT10,11 y RoBERTa12,13, todos entrenados en el conjunto de datos de respuesta a preguntas de Stanford (SQuAD)14. Su rendimiento se evaluó utilizando dos parámetros críticos: el emparejamiento semántico, medido por Exact Match (EM)14, y el modelo Latency15, analizado por los tiempos medios de reacción. Además, se utilizó una base de datos vectorial (VD)16,17 para almacenar incrustaciones semánticas, lo que facilitó la recuperación del contexto más semánticamente relevante para la pregunta de un usuario en función de las puntuaciones de similitud semántica.

Revisión de la literatura

Los modelos basados en transformadores han revisado el campo de NLP, produciendo mejoras significativas en QAS. La introducción de BERT9 ha enfatizado firmemente las arquitecturas de transformadores como un componente esencial en el desarrollo de QAS robusto y preciso. En esta sección, se presenta una revisión exhaustiva de las mejoras recientes en los modelos basados en transformadores y las incrustaciones semánticas, con un enfoque en su relevancia para el control de calidad del diálogo conversacional semántico (SeCD). Se realiza un análisis comparativo para justificar la integración de estos modelos en este trabajo, enfatizando su viabilidad para impulsar conocimientos significativos en el campo.

Las arquitecturas basadas en transformadores como BERT, DistilBERT y RoBERTa utilizan la metodología de autoatención para capturar relaciones contextuales complejas en el texto, lo que las hace ideales para tareas que necesitan una comprensión semántica significativa, como QAS. Estos modelos, junto con transformadores de oraciones especializados, generan incrustaciones semánticas, ayudan a permitir una recuperación de contexto rápida y precisa a través de búsquedas de similitud basadas en vectores en SeCD QA. Investigaciones recientes se centran en mejorar estos modelos e incorporar técnicas para aumentar el rendimiento, la escalabilidad y la eficiencia, especialmente para usos específicos de tareas como SCD-QA.

Sengupta et al.18 introdujeron un enfoque creativo para impulsar el QAS de opción múltiple (MCQAS) para preguntas basadas en la ciencia mediante el ajuste fino de los modelos BERT. En su marco, primero evaluaron la similitud semántica distribuida entre los pares de preguntas y respuestas y luego introdujeron estos puntajes de similitud, junto con las características originales, en una capa de clasificación. Este enfoque combinado logró una puntuación F1 del 90,2% en el conjunto de datos de SciQ, lo que destaca la eficacia de BERT en QAS específicos de tareas que requieren una comprensión matizada y una clasificación precisa.

Cichecki et al.19 compararon ChatGPT y los modelos BERT ajustados para sistemas de soporte de diseño inteligente y encontraron que los modelos BERT ajustados superan a los modelos de lenguaje grande (LLM) de propósito general como ChatGPT en tareas específicas de dominio, logrando una puntuación F1 del 88,5% en un conjunto de datos diseñado a medida. El estudio muestra la importancia del ajuste fino específico del dominio para mejorar el rendimiento del modelo en aplicaciones especializadas.

Guo et al.20 examinaron la eficiencia de las estrategias de ajuste de tareas específicas para los QAS bajo presupuestos de anotación limitados. Su trabajo reveló que un enfoque de doble ajuste, inicialmente en un conjunto de datos de control de calidad general como SQuAD, seguido de un ajuste fino en un conjunto de datos específico de la tarea, logra un avance significativo del 15% en la puntuación F1 en conjuntos de datos como COVID-QA. Este hallazgo destaca el papel fundamental del ajuste secuencial en la mejora del rendimiento de los SGC SeCD.

Pudasaini y Shakya21 examinaron la aplicación de modelos BERT ajustados para el control de calidad en trabajos de investigación biomédica, informando puntajes EM y F1 del 83,89% y 89,67%, respectivamente, en un conjunto de datos de control de calidad biomédico personalizado procedente de PubMed. Al aprovechar el aprendizaje por transferencia con PubMedBERT, su técnica ilustró una notable capacidad para procesar consultas biomédicas complejas, enfatizando el potencial del ajuste fino específico de la tarea en este campo.

Baek et al.22 propusieron el marco de inducción del modelo de lenguaje aumentado por el conocimiento para el control de calidad del gráfico de conocimiento (KG) de disparo cero. Este enfoque utiliza similitudes semánticas para recuperar hechos pertinentes de un KG y los incorpora a la pregunta de entrada. Como resultado, logró una puntuación F1 de aproximadamente el 85% en los conjuntos de datos KG-QA. El trabajo ilustra el potencial de combinar KG y modelos de transformadores, destacando los beneficios del aumento del conocimiento para mejorar el rendimiento del control de calidad.

Hu et al.23 describieron un SGC diseñado para el dominio de registro de hogares, aprovechando un KG junto con modelos basados en BERT (RoBERTa-BiLSTM-MultiHeadAttention) para la clasificación de intenciones y el análisis semántico. Al simplificar las preguntas en entidades de un solo evento y relaciones de intención, se logró una alta precisión en la consulta de datos estructurados. Además, la escalabilidad de la metodología a otros dominios enfatiza su potencial para una amplia aplicabilidad en QAS basado en KG.

Luo et al.24 introdujeron un esquema basado en BERT para el control de calidad de la base de conocimientos (KB), integrando un modelo de poda de granularidad múltiple (MGPM) con atención consciente de las relaciones. Su enfoque logra precisiones significativas del 94,4% en SimpleQuestions, el 68,6% en WebQuestionsSP y el 63,7% en WebQuestions. Estos resultados muestran la eficacia de BERT para aprovechar la similitud semántica para consultas de datos estructurados. En general, este estudio destaca el potencial de los modelos basados en transformadores para KB-QA, particularmente en escenarios donde la identificación exacta de entidades y relaciones es importante.

Wu et al.25 diseñaron un marco de generación aumentada por recuperación para el control de calidad en la gestión de la construcción, con un enfoque específico en las consultas de seguridad y cumplimiento. Al integrar incrustaciones semánticas basadas en BERT con un modelo de transformador generativo y un KG específico de la tarea, su enfoque logró una puntuación F1 del 88,7% en un conjunto de datos de control de calidad relacionado con la construcción. Este estudio demuestra el potencial de combinar la comprensión semántica con la recuperación basada en KG para mejorar la precisión en un conjunto de datos de control de calidad específico de la tarea para la gestión de la construcción.

Peng et al.26 evaluaron sistemáticamente los LLM, incluidos los modelos basados en BERT y GPT, para el control de calidad médico. Al combinar la comprensión contextual de BERT y las capacidades generativas de GPT, utilizaron la generación aumentada por recuperación y el ajuste fino específico del dominio para lograr una puntuación F1 del 86,2% en un conjunto de datos de PubMed y notas clínicas. Este estudio destaca el potencial de los modelos de conjunto para mejorar la precisión de la inferencia en la atención médica, donde tanto el contexto como la generación precisa son críticos.

Gardazi et al.27 revisaron el uso de BERT en tareas de NLP como QA, análisis de sentimientos y reconocimiento de entidades nombradas (NER). Su análisis mostró que los modelos BERT ajustados logran puntajes F1 del 85% al 92% en conjuntos de datos de control de calidad específicos de tareas como SQuAD. Esto demuestra que BERT produce de manera confiable incrustaciones contextuales efectivas y agrega KG, lo que lo hace muy adecuado para SeCD QAS.

Los modelos basados en transformadores se han convertido en la opción decisiva para los QAS de SeCD debido a su capacidad única para capturar el procesamiento sensible al contexto, escalar de manera eficiente y adaptarse a tareas específicas del dominio. La Tabla 1 ilustra esta ventaja decisiva al comparar los modelos basados en transformadores con métodos alternativos examinados en este estudio 18,20,22,23,24,25.

AcercarseCaracterísticas principalesVentajasLimitacionesMétricas de rendimiento (SQuAD)Idoneidad del caso de uso
Modelos basados en transformadores (BERT, RoBERTa, DistilBERT)Modelado de contexto bidireccional, autoatención, ajuste fino de datos específicos del dominio 16, 17, 19, 24, 25Alta precisión, comprensión semántica robusta, escalable con bases de datos vectoriales 18, 20, 22, 24, 25Mayor costo computacional, requiere entrenamiento previo 17, 18EM: 80-90%, F1: 85-93% 16, 17, 19, 24, 25Ideal para sistemas de control de calidad de dominio cerrado (CD), preguntas frecuentes y búsqueda semántica 16, 17, 19, 20, 22, 24, 25
Sistemas tradicionales basados en reglasReglas hechas a mano, concordancia de palabras clave 16Bajo costo computacional, implementación simple 16Escalabilidad limitada, manejo deficiente de consultas complejas 16, 18EM: 50-60%, F1: 55-65% 16SGC básico con datos estructurados 16
Redes neuronales recurrentes (RNN)Procesamiento secuencial, arquitecturas LSTM/GRU 19Rendimiento moderado para tareas secuenciales 19Lucha con dependencias de largo alcance, inferencia más lenta 19, 9EM: 65-75%, F1: 70-80% 19Tareas generales de PNL, menos efectivas para CD-QA 19, 9
Sistemas de recuperación basados en palabras claveTF-IDF, algoritmos BM25 18, 22Recuperación rápida, bajo uso de recursos 18, 22Limitado a la coincidencia a nivel superficial, mala comprensión semántica 18, 22EM: 40-50%, F1: 45-55% 18, 22Recuperación de documentos, no adecuada para QAS 18, 22 precisos
Redes neuronales convolucionales (CNN)Extracción de características locales, capas convolucionales 25Eficiente para la clasificación de textos cortos, inferencia rápida 25Comprensión contextual limitada, menos eficaz para QAS complejo 25EM: 60-70%, F1: 65-75% 25Clasificación de texto, no ideal para CD-QA 25
Redes neuronales gráficas (GNN)Modelado basado en grafos, razonamiento relacional 20Eficaz para el razonamiento de múltiples saltos, captura las relaciones de los documentos 20Alta complejidad computacional, requiere datos estructurados 20EM: 70-80%, F1: 75-85% 20QAS multisalto, menos adecuado para CD-QA de contexto único 20
Sistemas basados en grafos de conocimientoRepresentación estructurada del conocimiento, vinculación de entidades 21Fuerte para consultas de datos estructurados, aprovecha el conocimiento externo 21Requiere gráficos de conocimiento preconstruidos, limitados a entidades conocidas 21EM: 65-75%, F1: 70-80% 21QAS específico del dominio con datos estructurados 21
Modelos de atención aumentadaMecanismos de atención mejorados, procesamiento centrado en el contexto 24Enfoque mejorado en segmentos de texto relevantes, alta precisión 24Mayor costo computacional, implementación compleja 24EM: 85-90%, F1: 88-92% 24CD-QA complejo, preguntas no factoides 24
Modelos de bolsa de palabrasRepresentación basada en la frecuencia de palabras 22Simple, computacionalmente ligero 22Comprensión semántica deficiente, ineficaz para consultas complejas 22, 25EM: 35-45%, F1: 40-50% 22Recuperación de texto básica, no adecuada para QAS 22, 25
Modelos neuronales híbridos (CNN+RNN)Combina procesamiento local y secuencial 25Equilibra la comprensión local y contextual 25Complejidad moderada, lucha con contextos largos 25EM: 68-78%, F1: 72-82% 25Tareas generales de PNL, ajuste moderado para CD-QA 25
Modelos de lenguaje estadísticoAsociaciones probabilísticas de palabras 18Rápido para consultas simples, bajo uso de recursos 18Comprensión contextual limitada, escasa escalabilidad 18EM: 45-55%, F1: 50-60% 18QAS básico, no adecuado para CD-QA 18 complejos

Tabla 1: Comparación de modelos basados en transformadores con otros enfoques para QAS. La tabla proporciona una comparación lado a lado de varios enfoques de sistemas de control de calidad, incluidos los modelos basados en transformadores, los sistemas basados en reglas, las RNN y otros. Resume sus principales características, fortalezas, debilidades, rendimiento en SQuAD y las tareas para las que son más adecuados, como CD-QA, búsqueda semántica y clasificación de texto.

El objetivo principal de esta investigación es mejorar el acceso de los estudiantes a la información institucional mediante el desarrollo de sistemas SCD-QA eficientes, escalables y precisos en PNL. Específicamente, este estudio confirmatorio aplica y valida modelos basados en transformadores preentrenados dentro del dominio de Ph.D. políticas de admisión. El objetivo es demostrar su eficacia y viabilidad práctica mediante la incorporación de la coincidencia semántica, la evaluación de la latencia del modelo y la recuperación semántica basada en VD. Este enfoque ofrece un análisis en profundidad para brindar respuestas precisas y específicas del dominio en un contexto institucional enfocado. La Figura 2 ilustra el marco arquitectónico holístico del sistema.

Figura 2
Figura 2: Esquema general del sistema SCD-QA. La figura ilustra un diagrama de flujo de un sistema de control de calidad que utiliza grandes modelos de lenguaje (LLM). Comienza con un archivo de contexto y una pregunta del usuario, que son manejados por tres modelos: Google-BERT, DistilBERT y RoBERTa, y un modelo basado en palabras clave: TF-IDF. El sistema evalúa el rendimiento de cada modelo utilizando una lista de verificación y luego selecciona el mejor en función de los resultados. Haga clic aquí para ver una versión más grande de esta figura.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Base teórica integral

Componente QAS: El marco QAS consta de tres segmentos, como se muestra en la Figura 3: i) Módulo de procesamiento de preguntas (QPM), ii) Módulo de procesamiento de documentos (DPM) y iii) Módulo de extracción y formulación de respuestas (AEFM). El sistema recibe preguntas que se dividen en dos categorías principales: Factoides y No Factoides. Las preguntas Factoid suelen usar palabras interrogativas como qué, dónde, cuándo o quién, mientras que las preguntas no Factoid usan palabras como cómo y por qué.

DPM: De la lista proporcionada, el usuario puede seleccionar un pasaje específico. A continuación, cada token del pasaje se etiqueta mediante un etiquetador de parte de la oración (POS). Para extraer verbos, identifique todos los tokens etiquetados como verbos. Combine estos verbos con una lista de verbos no convencionales y aplique lógica para los verbos regulares. Cree una estructura de datos (matriz) que contenga los verbos extraídos, sus tiempos y sus formas -ing.

QPM: El sistema recibe información en forma de pregunta del usuario. El texto se tokeniza mediante la clase StringTokenizer y los tokens resultantes se almacenan en una estructura de datos independiente. Esta estructura de datos se devuelve para su posterior utilización dentro del programa.

AEFM: El primer paso es identificar el verbo en la pregunta dada. El verbo que se ha identificado recientemente ahora coincide con los tokens que se generaron durante la fase de procesamiento de documentos. El caso elegido para un tipo específico de pregunta fáctica (como qué o cuándo) se utiliza para extraer y construir la respuesta de una manera más precisa.

Antes de elegir el tipo de pregunta, primero se le pide al usuario que seleccione el pasaje de su elección. El QPM es responsable de procesar la pregunta del usuario y reenviarla a la AEFM. El AEFM utiliza las extracciones obtenidas del DPM y los documentos procesados que contienen el formato etiquetado del documento de entrada original. El módulo pasará los algoritmos requeridos al módulo de formulación para obtener la respuesta deseada.

Figura 3
Figura 3: Componentes del QAS. La figura ilustra el proceso de cuatro pasos de un sistema de control de calidad: pregunta, procesamiento de preguntas, procesamiento de respuestas y respuesta. En Procesamiento de preguntas, el sistema clasifica la pregunta. En el procesamiento de respuestas, encuentra y revisa documentos y pasajes para producir la respuesta. Haga clic aquí para ver una versión más grande de esta figura.

Modelo BERT: Para descubrir las asociaciones entre palabras en un texto, el método BERT utiliza un transformador. Hay dos mecanismos en un transformador: un codificador y un decodificador28, pero solo se necesita el codificador para BERT. BERT adopta un enfoque bidireccional y escanea sistemáticamente el texto de entrada para enseñarse a sí mismo el significado de las palabras en su contexto. El codificador toma como entrada una serie de tokens que han sido vectorizados. Luego, los vectores se introducen en la red neuronal, que produce una serie de vectores que reflejan la entrada. El vector de salida de una palabra cambia según la oración en la que aparece. El vector de una palabra puede variar según el contexto en el que aparece; por ejemplo, "me gusta" en "Le gusta jugar al cricket" tiene un vector diferente al de "me gusta" en "Su cara se puso roja como un tomate". El enfoque comienza con una fase de procesamiento de texto antes de pasar a la fase de construcción del modelo. Los pasos que BERT toma para procesar el texto se analizan en la siguiente sección28.

Procesamiento de texto: El modelo BERT representa el texto de entrada de acuerdo con un conjunto prescrito de principios. Además, este factor contribuye a mejorar el rendimiento del modelo. La incrustación de entrada en BERT consiste en una amalgama de tres tipos distintos de incrustaciones28.

Incrustaciones de posición (PE): Para conocer la información relacionada con el orden en las incrustaciones, se utilizan PE. Los PE se utilizan para restaurar información sobre el orden que se pierde en los transformadores. BERT desarrolla distintos PE específicamente para cada punto de la secuencia de entrada. BERT posee la capacidad de transmitir la información posicional de las palabras dentro de una oración mediante el uso de PE. Esto permite a BERT capturar y representar eficazmente la secuencia u orden de las palabras.

Incrustaciones de oraciones (SE): Además, para ayudar al modelo a distinguir entre la primera y la segunda oración, BERT aprende una incrustación que es única para cada una de ellas. También es capaz de aceptar oraciones emparejadas como entradas para actividades como el control de calidad.

Incrustaciones de tokens (TE): Los TE se enseñan para cada token en el vocabulario de tokens de WordPiece. El vocabulario de tokens de WordPiece comprende unidades de subpalabras derivadas de palabras que se encuentran dentro del corpus. Como ejemplo ilustrativo, esta colección de vocabulario abarcará todas las subpalabras concebibles del término Pregunta, incluidas Questio, Questi, etc.

La representación de entrada de un token se construye sumando sus incrustaciones en los niveles de segmento y posición. Debido a esto, es un enfoque de incrustación extenso que proporciona una gran cantidad de información al modelo. La Figura 49 muestra las incrustaciones del modelo BERT.

Figura 4
Figura 4: Incrustaciones BERT. La figura muestra cómo se crean las incrustaciones de entrada para un modelo de transformador. Comienza con una secuencia de entrada: [CLS] el cielo de [MASK] está nublado [SEP] lloverá [SEP]. Cada token de la secuencia recibe su propia incrustación, como Ethe o E[MASK]. Luego, se agregan incrustaciones de oraciones para cada oración, como EA para la primera y EB para la segunda. También se incluyen incrustaciones posicionales, etiquetadas como E0 a E9, para indicar la posición de cada token. Todos estos se combinan para formar las incrustaciones de entrada finales. Esta cifra ha sido modificada de9Haga clic aquí para ver una versión más grande de esta figura.

Diseño de QAS usando BERT: Con fines ilustrativos, examine esta pregunta junto con un párrafo extraído de una entrada de Wikipedia sobre Football League28.

Pregunta: ¿Dónde se fundó la Liga de Fútbol?

Pasaje: En 1888, se fundó la Liga de Fútbol en Inglaterra, convirtiéndose en la primera de muchas competiciones de fútbol profesional. Durante el siglo XX, varios de los diversos tipos de fútbol crecieron hasta convertirse en algunos de los deportes de equipo más populares del mundo.

Respuesta: Inglaterra

El modelo BERT utiliza la extracción de tokens tanto de la pregunta como del contexto, combinándolos posteriormente en una entrada unificada. Como se indicó anteriormente, el proceso comienza con la utilización de un token [CLS], que sirve como indicador para el comienzo de una oración. Además, se emplea un separador [SEP] para separar claramente la pregunta y el pasaje. Además del token [SEP], BERT incorpora SE para distinguir entre la pregunta y el pasaje28 que contiene la respuesta. BERT utiliza dos SE, uno dedicado a la pregunta y otro al pasaje, para establecer una clara distinción entre ellos. Las incrustaciones se combinan posteriormente con una representación de28 tokens para diferenciar entre la pregunta y el pasaje. Este proceso se ilustra en la Figura 5.

Figura 5
Figura 5: Representación de entrada BERT. La figura ilustra cómo se generan las incrustaciones de entrada para un QAS basado en BERT. Comienza con el token [CLS], luego la pregunta ¿Cuántos? [SEP], y el pasaje BERT grande es, cada uno con sus incrustaciones de oraciones (A para la pregunta, B para el pasaje). Las incrustaciones de tokens, oraciones y posiciones se combinan para realizar la entrada final. Haga clic aquí para ver una versión más grande de esta figura.

Posteriormente, la representación integrada combinada28 de la pregunta y el contexto se utiliza como entrada en el modelo BERT. La capa oculta final de BERT se modifica para usar SoftMax para generar distribuciones de probabilidad. Estas distribuciones determinan los índices de inicio y fin de una subcadena dentro de la oración de texto de entrada, que representa una respuesta, como se muestra en la Figura 6, para una representación visual.

Figura 6
Figura 6: Flujo de trabajo de procesamiento BERT para control de calidad. La figura muestra cómo funciona el modelo BERT para el control de calidad. Presenta una secuencia de entrada que incluye una pregunta, marcada por un token de clasificación [CLS] al principio y un token separador [SEP] al final, seguido de un contexto, separado por otro [SEP]. Los tokens de esta secuencia se convierten en incrustaciones. Luego, el modelo predice las posiciones inicial y final de la respuesta dentro del pasaje. Haga clic aquí para ver una versión más grande de esta figura.

Base de datos vectorial (VD): Un VD17,18 es un sistema especializado para almacenar, administrar, indexar y consultar de manera eficiente representaciones vectoriales de datos de alta dimensión. Los vectores a menudo se generan a partir de modelos de aprendizaje profundo y encapsulan información semántica o contextual sobre los datos. Cada dimensión de un vector representa una característica específica. Las incrustaciones son representaciones numéricas de objetos como texto, imágenes, videos y audio. Estas incrustaciones se utilizan en diversas aplicaciones, como el aprendizaje automático (ML), el NLP, los sistemas de recomendación, la visión artificial y la infrarracción. Los VD facilitan las búsquedas de similitud efectivas y las consultas semánticas al agrupar objetos similares juntos en el espacio vectorial. Facebook AI Similarity Search (FAISS)29 es un VD destacado utilizado en este estudio para identificar el contexto más relevante para las consultas de los usuarios. La Tabla 2 describe las principales características de los VD y sus casos de uso.

CaracterísticaDescripción
Datos de alta dimensiónManeja datos con cientos o miles de dimensiones.
Vecino más cercano aproximado (RNA)Permite búsquedas rápidas de similitud mediante la aproximación de distancias.
EscalabilidadAdmite conjuntos de datos a gran escala con miles de millones de vectores.
IntegraciónA menudo se integra con marcos y herramientas de IA/ML para flujos de trabajo fluidos.
Consultas en tiempo realProporciona búsquedas vectoriales de baja latencia para aplicaciones interactivas.

Tabla 2: Principales características de la VD. La tabla destaca las características importantes de VD. Estos incluyen el manejo de datos de alta dimensión, la ejecución de búsquedas rápidas de similitud utilizando algoritmos ANN, la ampliación a grandes conjuntos de datos, el trabajo con herramientas de IA y ML, y el soporte de consultas rápidas y en tiempo real para uso interactivo.

Métricas de evaluación del desempeño: El sistema SCD-QA se evaluó utilizando dos métricas principales: puntuación EM14 y latencia del modelo15. La puntuación EM, una métrica estándar en los estudios de control de calidad, evalúa la precisión de la predicción midiendo la proporción de respuestas predichas que coinciden exactamente con la verdad fundamental. Para un conjunto de N preguntas, la puntuación EM se define formalmente en la Ecuación 1 de la siguiente manera:

Ecuación 1donde Ecuación 2 (1)

Esta métrica asigna una puntuación de 1 para una coincidencia exacta con la respuesta de referencia y 0 para cualquier diferencia.

La métrica Latencia cuantifica el tiempo total de procesamiento requerido por el sistema para generar una respuesta a una consulta individual. Esta métrica se calcula como el tiempo medio transcurrido en todas las consultas, como se presenta en la Ecuación 2:

Ecuación 3 (2)

donde Tstarti y Tendi son las marcas de tiempo que marcan el inicio y el final del procesamiento de la i-ésima consulta, respectivamente. La latencia se informa en s y captura la capacidad de respuesta del sistema, abarcando todas las etapas, desde el procesamiento de entrada hasta la generación de respuestas.

Método

Para implementar el SCD-QA, en este documento se incorporan los siguientes estudios de prueba.

Conjunto de datos SCD-QA: Se presenta un conjunto de datos propuesto30 para la implementación del sistema SCD-QA. Este conjunto de datos se deriva de un corpus de texto que contiene Ph.D. reglas para 20228, para las pautas estudiantiles de NIT Arunachal Pradesh, India. Para establecer el sistema SCD-QA, es necesario generar un archivo JSON que abarque toda la información pertinente en un formato preciso. El conjunto de datos se genera a partir del corpus de texto utilizando la herramienta de anotación Haystack (versión 2.18.1)31, un marco de código abierto. Esta herramienta facilita la creación del conjunto de datos SCD-QA al estilo del SQuAD14. Los pasos para crear un conjunto de datos anotado de tipo SQuAD a partir del archivo PDF se muestran en la Figura 7, y la estructura de nuestro conjunto de datos en estilo SQuAD se ilustra en la Figura 8.

Figura 7
Figura 7: Pasos para crear un conjunto de datos anotado a partir de un archivo PDF. La figura ilustra un flujo de trabajo paso a paso para crear un dataset anotado de estilo SQuAD utilizando las herramientas de Haystack. Describe el proceso desde la extracción de texto de archivos PDF, la limpieza y división en pasajes, la anotación manual de pares de preguntas y respuestas, el almacenamiento de las anotaciones en formato SQuAD JSON y, finalmente, la exportación del conjunto de datos para el entrenamiento del modelo. Haga clic aquí para ver una versión más grande de esta figura.

Figura 8
Figura 8: Estructura del conjunto de datos de control de calidad factoide. La figura muestra una estructura de datos JSON que representa un párrafo y un par de control de calidad de un conjunto de datos. Tiene una sección de párrafos, que contiene un conjunto de preguntas y respuestas. Una pregunta pregunta: ¿Cuál es la calificación mínima requerida para ingresar a Ph.D. Science? Cada pregunta tiene un ID y una matriz de respuestas. La respuesta incluye un ID de documento, un ID de pregunta, el texto con un 60% de puntos, la posición inicial de la respuesta y una categoría de respuesta no especificada. La marca is_impossible se establece en false. Haga clic aquí para ver una versión más grande de esta figura.

El conjunto de datos está estructurado como una lista de diccionarios, donde cada diccionario contiene campos clave como datos, párrafos, pregunta, answer_id, document_id, question_id, texto, answer_start, answer_end, is_impossible y contexto.

data: Contiene la información general de preguntas y respuestas.
párrafos: Un contexto particular, junto con sus preguntas y respuestas.
pregunta: Una pregunta en particular.
answer_id: Un número de identificación único para cada texto de respuesta.
document_id: Un número de identificación único para cada contexto.
question_id: Un número de identificación único para cada pregunta.
text: El texto de la respuesta.
answer_start: La ubicación inicial de la respuesta correcta en contexto.
answer_end: La ubicación final de la respuesta correcta en contexto.
is_impossible: Indica si la respuesta a la pregunta formulada está disponible en el contexto o no.
context: El corpus de texto del que se puede encontrar una respuesta.
Las 80 preguntas del conjunto de datos propuesto siguen el formato de preguntas factoides y no factoides. En la Tabla 3 se muestran ejemplos de algunos tipos de preguntas enmarcadas.

Preguntas
¿Quién es PS?
¿Cuál es el tamaño de fuente del documento de última generación?
¿Cuántos días hay de baja por maternidad?

Tabla 3: Pregunta de muestra del conjunto de datos. La tabla muestra ejemplos de dos tipos de preguntas: la primera y la segunda son preguntas fácticas, mientras que la tercera es una pregunta no fáctica.

FAISS: FAISS (versión faiss_cpu-1.9.0)29,32, desarrollada por Facebook AI Research (FAIR), es una biblioteca de código abierto que facilita la búsqueda eficiente de similitudes y la agrupación de vectores densos. Está diseñado específicamente para administrar datos de alta dimensión a gran escala de manera efectiva. Este sistema facilita búsquedas de RNA rápidas y escalables dentro de conjuntos de datos que comprenden millones o miles de millones de vectores. Se utiliza ampliamente en aplicaciones relacionadas con incrustaciones, incluido NLP, sistemas de recomendación y recuperación de imágenes o videos. FAISS ofrece múltiples métodos de indexación, incluidos Flat (fuerza bruta), Archivo invertido (IVF), Gráficos de mundo pequeño navegables jerárquicos (HNSW) y cuantificación de productos (PQ). Estos métodos permiten a los usuarios optimizar el rendimiento de búsqueda de acuerdo con el tamaño de los datos, la dimensionalidad y las especificaciones de hardware. En este estudio, se utiliza la indexación plana, que realiza una búsqueda de fuerza bruta utilizando la distancia L2 (euclidiana) para identificar los vecinos más cercanos. La escalabilidad del sistema admite implementaciones de CPU y GPU, lo que permite cálculos de alto rendimiento en amplios conjuntos de datos. Además, proporciona flexibilidad para optimizar el equilibrio entre velocidad y precisión en función de los requisitos específicos de la aplicación. FAISS se usa con frecuencia en PNL para evaluar la similitud semántica en incrustaciones, como BERT o Word2Vec. FAISS se utiliza en QAS para almacenar y administrar representaciones vectoriales de documentos u oraciones. Realiza búsquedas ANN aproximadas33 para recuperar el contexto más relevante para las preguntas de los usuarios, mejorando la búsqueda semántica con incrustaciones de modelos de transformadores como BERT. FAISS es una herramienta fundamental en los flujos de trabajo de IA y ML debido a su versatilidad.

Modelo BERT-large-uncased-whole-word-masking-finetuned-SQuAD: El presente trabajo utiliza un modelo de lenguaje preentrenado conocido como BERT-large-uncased-whole-word-masking finetuned-squad9 para desarrollar un QAS factoide utilizando el conjunto de datos propuesto en el estudio. El modelo BERT se sometió a un entrenamiento previo en BookCorpus, un conjunto de datos de 11.038 libros inéditos9, así como en Wikipedia en inglés, con la excepción de listas, tablas y encabezados. El modelo en cuestión no tiene mayúsculas y minúsculas, lo que significa que no distingue entre las palabras inglés e inglés. El modelo es un modelo de transformador preentrenado que se ha entrenado con una cantidad sustancial de datos en inglés utilizando un enfoque autosupervisado. El modelo se entrenó previamente exclusivamente en textos sin procesar, sin anotaciones humanas. Esto le permite aprovechar una gran cantidad de datos de acceso público. El proceso de preentrenamiento implica generar automáticamente entradas y etiquetas a partir de los textos proporcionados. El modelo fue entrenado con dos objetivos específicos9:

MLM: El proceso consiste en enmascarar aleatoriamente el 15%9 de las palabras en la oración de entrada. Luego, el modelo procesa toda la oración enmascarada y predice las palabras enmascaradas. Este enfoque difiere de las redes neuronales recurrentes (RNN) convencionales, que generalmente procesan palabras secuencialmente, y de los modelos autorregresivos como GPT, que emplean enmascaramiento interno de tokens futuros. La funcionalidad permite que el modelo adquiera una representación bidireccional de la oración.

NSP: Durante la fase de preentrenamiento, el modelo combina dos oraciones disfrazadas como entradas. En algunos casos, estas oraciones son adyacentes en el texto original, lo que indica una relación directa. En otros casos, no lo son, lo que significa que no hay una proximidad original o un contexto que los vincule. El siguiente paso implica que el modelo prediga si las dos oraciones son lógicamente coherentes.

El modelo actual se caracteriza por la configuración posterior: la arquitectura del modelo consta de 24 capas, con una dimensión oculta de 1024. Utiliza 16 cabezales de atención y tiene un total de 336 millones de parámetros9.

WordPiece se utiliza para tokenizar los textos con un tamaño de vocabulario de 30.000 palabras en los pasos de preprocesamiento. Las entradas del modelo se verían así: [CLS] Oración A [SEP] Oración B [SEP]. El único requisito es que la duración total de las oraciones combinadas sea inferior a 512 tokens9. El modelo específico preentrenado produce el resultado posterior: la puntuación F1 lograda es del 93,15 %, mientras que la puntuación de coincidencia precisa es del 86,91 %9.

Modelo Distilbert / distilbert-base-cased-distilled-squad: El modelo DistilBERT10 es una variante más compacta, rápida y eficiente del modelo BERT9 , desarrollado para mantener la mayor parte de la capacidad semántica de BERT para comprender mientras consume menos recursos y es más apropiado para aplicaciones prácticas con capacidad computacional restringida. La versión distilbert-base-cased-distilled-squad se ha ajustado en el SQuAD14 para tareas de control de calidad. El modelo utiliza la arquitectura del transformador, incluido un tamaño reducido de 66 millones de parámetros en contraste con los 110 millones de BERT, mientras mantiene el 97% de la eficacia de BERT en la comprensión del lenguaje. DistilBERT llega a esto utilizando un método conocido como Destilación del Conocimiento, que transmite información del modelo BERT más grande al modelo DistilBERT más compacto. Debido a su tamaño más pequeño, puede inferir información más rápidamente y usar menos memoria, lo que lo hace perfecto para aplicaciones con recursos limitados, como dispositivos móviles o perimetrales. El modelo, cuidadosamente ajustado en el conjunto de datos SQuAD 1.1, demuestra una competencia excepcional en tareas de control de calidad extractivas, por lo que el objetivo es localizar un segmento de texto de un contexto específico que responda a una pregunta. DistilBERT logra aproximadamente el 85% de la puntuación F1 de BERT en la tabla de clasificación de SQuAD y conserva una parte significativa de la capacidad lingüística de BERT, a pesar de su tamaño reducido. Este modelo es una solución excepcionalmente eficiente para trabajos de control de calidad a nivel de producción, optimizando tanto el rendimiento como la eficiencia computacional.

Deepset/roberta-base-squad2: El deepset/roberta-base-squad2 modelo12,13 es una variante afinada de la arquitectura RoBERTa. Está diseñado específicamente para el conjunto de datos SQuAD14 2.0, que incluye preguntas respondidas y no respondidas. Este marco RoBERTa mejorado elimina los9 puestos de trabajo NSP de BERT. También utiliza el enmascaramiento dinámico durante el entrenamiento para aumentar la eficiencia y el rendimiento en las tareas de comprensión NL. El modelo tiene 125 millones de parámetros y utiliza un transformador bidireccional. Esto le permite adquirir información contextual de ambas direcciones y sobresalir en tareas extractivas de control de calidad.

El ajuste fino en SQuAD 2.0 permite que el modelo identifique el intervalo de respuesta correcto dentro de un contexto determinado y reconozca cuándo no hay respuesta. Utiliza un tokenizador de codificación de pares de bytes (BPE) que controla la tokenización de subpalabras y conserva la distinción entre mayúsculas y minúsculas. Esto mejora su capacidad para procesar palabras poco comunes y complejas. El modelo funciona bien, logrando aproximadamente 85%-90% F1 y 80%-85% EM. Su capacidad para detectar preguntas sin respuesta y su implementación efectiva lo hacen valioso para el servicio al cliente, la recuperación de conocimientos y los asistentes virtuales.

La forma más eficaz de implementar modelos BERT ajustados por SQuAD para el control de calidad es utilizar la canalización Hugging Face Transformers34. Este marco optimiza la tokenización, el formato de entrada, la carga del modelo y el posprocesamiento de salida. Estos modelos son ampliamente reconocidos por su eficacia en el control de calidad extractivo, donde la respuesta es un intervalo de texto recuperado directamente del contexto dado. Para guiar la implementación, el siguiente procedimiento describe los pasos para ejecutar modelos BERT.

Entrada y configuración: Este proceso requiere cuatro entradas principales y parámetros de configuración: el nombre del modelo, especificado como un identificador de cadena del Hugging Face Hub (por ejemplo, google-bert/bert-large-uncased-whole-word-masking-finetuned-squad, distilbert/distilbert-base-cased-distilled-squad o deepset/roberta-base-squad2); la pregunta (Q), proporcionada como una cadena que contiene la consulta; y el contexto (C), una cadena que representa el texto o pasaje relevante. La herramienta principal utilizada es la función de canalización de alto nivel de la biblioteca Hugging Face transformers (versión 4.57.0) en Python (versión 3.12.12).

Proceso: Ejecución (canalización de cara abrazada): El proceso consta de seis pasos principales y emplea la canalización Hugging Face para abordar la complejidad de la tarea de control de calidad:

Instalar biblioteca: Comience instalando la biblioteca requerida con el comando pip install transformers. Esta instalación permite el acceso a los modelos y a la funcionalidad de canalización optimizada.

Canalización de importación: Importe la función de tubería usando: desde transformadores import pipeline.

Inicializar canalización de control de calidad: Inicialice la canalización de control de calidad mediante qa_pipeline = pipeline("question-answering", model=""). Este comando descarga el modelo y el tokenizador, preparándolos para la inferencia.

Definir entrada: Establecer pregunta = ... y contexto = ... para preparar los datos del modelo.

Ejecutar inferencia: Pase la pregunta y el contexto a la canalización con result = qa_pipeline(question=question, context=context). El modelo procesa la entrada y proporciona una respuesta.

Extracto de respuesta: Obtenga la cadena de respuesta del diccionario de salida usando: answer = result['answer'].

Salida: El proceso produce varios parámetros de salida en el siguiente orden: Respuesta (el intervalo de texto extraído del contexto, presentado como una cadena), Puntuación (un valor de punto flotante que cuantifica la confianza del modelo en su predicción) e índices de inicio y fin (enteros que especifican las posiciones de caracteres del intervalo de respuesta dentro del contexto).

Transformadores de oraciones / all-MiniLM-L6-v2: El all-MiniLM-L6-v235 es un transformador de oraciones preentrenado de la biblioteca Sentence-Transformers (versión 5.1.1)36. Está optimizado para una incrustación de texto eficiente y precisa. Desarrollado en el marco MiniLM de Microsoft, incluye seis capas de transformadores e incrustaciones de 384 dimensiones. Este diseño equilibra el rendimiento y la competencia computacional, lo que lo hace adecuado para aplicaciones en tiempo real. El modelo se entrenó con más de mil millones de pares de frases de conjuntos de datos como SNLI, MultiNLI, puntos de referencia STS y datos rastreados en la web. Como resultado, demuestra competencia en la similitud semántica, la agrupación y las tareas relacionadas con la búsqueda. Debido a su pequeño tamaño (~22 MB) y su rendimiento de inferencia mejorado, all-MiniLM-L6-v2 simplifica aplicaciones como la búsqueda semántica, la detección de duplicaciones y la categorización de texto. Aunque es liviano, ofrece una gran precisión en puntos de referencia como STS-B y SICK-R, lo que lo convierte en una opción efectiva tanto para escenarios escalables como de recursos limitados. El flujo de trabajo para generar la incrustación mediante Sentence-Transformer se muestra en la Figura 9 a continuación.

Figura 9
Figura 9: Paso del proceso de incrustación utilizando el modelo de transformador de frases. La figura ilustra el flujo de trabajo para generar incrustaciones de texto utilizando el marco de transformación de frases. Describe el proceso desde la importación de bibliotecas y la carga de un modelo preentrenado hasta la preparación de datos de texto, la generación de incrustaciones, la conversión en matrices NumPy y su almacenamiento para tareas posteriores como la indexación o la búsqueda de similitudes. Haga clic aquí para ver una versión más grande de esta figura.

Algoritmo propuesto: Este estudio describe una metodología sugerida en el Algoritmo 1 para el desarrollo del sistema SCD-QA basado en SeCD, capaz de abordar preguntas factoides y no factoides formuladas por los usuarios.

ALGORITMO 1: Algoritmo del sistema SCD-QA propuesto basado en SeCD
Entrada: Conjunto de archivo de contexto sin procesar (C) y la consulta del usuario (Q).
Salida: El LLM óptimo basado en transformador seleccionado (M') y la respuesta generada por M'.
Contextos de preprocesamiento: anote el conjunto de contextos sin procesar C para crear un conjunto de datos estructurado en formato DSQuAD .
DSQuAD =f anonato (C)
Generar incrustaciones de contexto: Utilice un transformador de oraciones fembed para convertir cada contexto c Ecuación 100 DSQuAD en una incrustación ec.
Ecuación 15
Almacenar incrustaciones: Almacene Ec en una base de datos vectorial V para una búsqueda de similitud eficiente.
Ecuación 18
Generar incrustación de consultas: Transforme la consulta del usuario Q en una incrustación eq utilizando el mismo transformador de oraciones.
Ecuación 20
Recuperación de contexto: recupere la incrustación Ecuación 21 de contexto más relevante de la base de datos V en función de la similitud con eq.
Ecuación 22
donde sim(eq,e c), es la función de similitud.
Pasar contexto a LLM: Alimente el contexto Ecuación 21 recuperado en 3 LLM basados en transformadores: Google-BERT (M1), DistilBERT (M2), RoBERTa (M3) y un modelo tradicional: TF-IDF + Similitud de coseno (M4)
Ecuación 28
Evaluación del modelo: Compare las respuestas {R1,R 2,R 3,R 4} utilizando una función de evaluaciónf-eval, que califica cada respuesta.
Ecuación 31
Seleccione el mejor modelo: identifique el modelo M' con la puntuación de evaluación más alta S'
Ecuación 33
Generar salida final: use M' para generar la respuesta final R basada enEcuación 36
Ecuación 37
Fin

El proceso algorítmico propuesto describe un enfoque sistemático (Figura 10) para elegir un LLM basado en transformador ideal para abordar las preguntas de los usuarios. Incorpora preprocesamiento, recuperación de contexto basada en incrustación y evaluación de múltiples modelos para garantizar respuestas de alta calidad y contextualmente relevantes. A continuación, se explica el proceso paso a paso para mayor claridad:

Preparación y preprocesamiento de datos: La primera fase implica el procesamiento de datos textuales sin procesar.

Entrada: Los archivos de texto sin procesar8 se adaptan al sistema.

Herramienta de anotación31: La entrada se transforma en un conjunto de datos estructurado en formato SQuAD14 . Este paso implica la creación de pares de control de calidad. También organiza los datos textuales relevantes en bloques de contexto bien definidos.

Salida: el conjunto de datos ya está listo para crear incrustaciones.

Generación de incrustación de contexto: Para permitir una recuperación de contexto eficiente y escalable, se aplica un modelo entrenado de Sentence-Transformer35,36 al conjunto de datos anotado. Este transformador convierte el texto en incrustaciones de alta dimensión que capturan el significado semántico. Las incrustaciones se almacenan en VD, FAISS29,32 para permitir búsquedas rápidas basadas en similitudes.

Procesamiento de consultas de usuario: Cuando un usuario envía una pregunta, la pregunta es procesada por el mismo Transformador de oraciones35,36. Esto genera una incrustación correspondiente en el mismo espacio vectorial 29,32 que las incrustaciones de contexto. Este diseño garantiza que la consulta se pueda hacer coincidir con las entradas de contexto relevantes.

Recuperación de contexto mediante similitud vectorial: mediante una métrica de similitud (por ejemplo, similitud de coseno), el sistema compara la incrustación de consultas con las incrustaciones de contexto almacenadas. El sistema selecciona el contexto más relevante en función de la puntuación de similitud más alta. Esto garantiza que solo se pase el contexto pertinente a los modelos posteriores. El proceso reduce la sobrecarga computacional y mejora la relevancia.

Evaluación del modelo en múltiples LLM: el contexto seleccionado se evalúa mediante tres LLM basados en transformadores: Google-BERT28, DistilBERT10 y RoBERTa12. También se evalúa mediante un TF-IDF37 tradicional basado en palabras clave con un modelo de similitud de coseno. Cada modelo procesa el contexto y genera una respuesta a la pregunta del usuario.

Evaluación comparativa: Las respuestas de los cuatro modelos de LLM se evalúan utilizando dos métricas clave. Primero, el emparejamiento semántico es evaluado por EM14. En segundo lugar, la latencia del modelo se analiza por los tiempos medios de reacción15.

Selección del modelo y salida final: El modelo con mejor rendimiento se selecciona como el LLM apropiado para la pregunta del usuario. Se considera la respuesta final del modelo seleccionado. Esto garantiza un equilibrio entre la eficiencia computacional y la calidad de respuesta.

Figura 10
Figura 10: Flujo de trabajo del sistema SCD-QA utilizando modelos basados en transformadores. La figura muestra cómo funciona el sistema SCD-QA. En primer lugar, una herramienta de anotación procesa un archivo de contexto sin procesar para crear un dataset en formato SQuAD. A continuación, un transformador de frases genera incrustaciones, que se almacenan en una base de datos vectorial FAISS. Cuando un usuario hace una pregunta, el sistema crea una incrustación para ella y selecciona el contexto más relevante. Compara tres modelos basados en transformadores: Google-BERT, DistilBERT y RoBERTa, y una puntuación de similitud tradicional TFIDF + coseno, y utiliza el de mejor rendimiento para proporcionar la respuesta. Haga clic aquí para ver una versión más grande de esta figura.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La implementación del sistema SCD-QA utilizó cuatro LLM y un conjunto de datos de 80 preguntas factoides y no factoides. El procesamiento se realizó en Google Colab, utilizando GPU NVIDIA Tesla T4 (versión del controlador: 550.54.15, versión CUDA: 12.4) con 12,7 GB de RAM del sistema, 15 GB de RAM de GPU y 112,6 GB de espacio en disco. El rendimiento del modelo se evaluó utilizando dos métricas: EM14 para el emparejamiento semántico y latencia del modelo

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio presenta el sistema SCD-QA, que aprovecha los modelos de lenguaje basados en transformadores para ofrecer respuestas precisas y sensibles al contexto a partir de documentos institucionales estructurados. El flujo de trabajo del sistema consiste en: (1) preprocesamiento de datos; (2) generación de incrustación utilizando el transformador de oraciones de última generación, all-MiniLM-L6-v2; (3) recuperación basada en similitudes a través de FAISS; y (4) evaluación integral del...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen nada que revelar.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores agradecen a la facultad dedicada y la administración de NIT Arunachal Pradesh por su apoyo y orientación inquebrantables a lo largo de este estudio. Además, estamos profundamente agradecidos a los desarrolladores y colaboradores de herramientas de NLP de código abierto y modelos preentrenados, cuyo trabajo hizo posible esta investigación. Durante la preparación de este manuscrito, los autores utilizaron Grammarly Proofreader para mejorar la claridad. Los autores asumen toda la responsabilidad por la exactitud e integridad del contenido.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
todo MiniLM-L6-v2MicrosoftVersión 5.1.1Modelo de transformador de oración preentrenado para generar incrustaciones de alta dimensión. Convierte texto en incrustaciones para la recuperación de contexto.
Herramienta de anotaciónAlmiarVersión 2.18.1Plataforma para estructurar texto en bruto en formato SQuAD. Prepara el conjunto de datos creando pares de QA y bloques de contexto.
Modelo DistilBERTCara de abrazoNALLM ligero basado en transformador con requisitos computacionales reducidos. Evaluado para comparación, ofrece menor latencia pero menor precisión.
FAISS VDFacebookfaiss_cpu-1.9.0Disparo de VD escalable para búsquedas basadas en similitud. Almacena y recupera incrustaciones de alta dimensión para una coincidencia eficiente de consultas.
Modelo Google-BERTGoogleNALLM preentrenado basado en transformadores con modelado de contexto bidireccional. Modelo principal para generar respuestas precisas a consultas de factoid y no factoid.
NVIDIA Tesla T4 GPUsNVIDIAVersión del controlador: 550.54.15
CUDA Versión: 12.4
GPUs con 15 GB DE RAM GPU para inferencia de modelos. Proporciona potencia computacional para procesar y evaluar LLMs.
PitónFundación de Software PythonVersión 3.12.12Python es un lenguaje de programación líder en el campo del Procesamiento de Lenguaje Natural (PLN) debido a su sintaxis sencilla, bibliotecas completas y un sólido apoyo comunitario. Soporta una amplia gama de tareas de PLN, incluyendo preprocesamiento fundamental de texto e implementaciones complejas de aprendizaje automático.
Modelo RoBERTaDeepsetNALLM optimizado basado en transformadores con estrategias de entrenamiento mejoradas. Evaluado para comparación, equilibra precisión y latencia.
Conjunto de datos SCD-QA como SQuAD  FormatoNAVersión 2.0Formato estandarizado para pares de preguntas y respuestas. Conjunto de datos de estructuras para compatibilidad con modelos de transformadores.

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Pirtoaca, G. S., Rebedea, T., Ruseti, S. Improving retrieval-based question answering with deep inference models. Int Joint Conf Neural Network. , 1-8 (2019).
  2. NLP-QA framework based on LSTM-RNN. Zhang, X., Chen, M. H., Qin, Y. Int Conf Data Sci Business Anal, , 307-311 (2018).
  3. Natural language processing based new approach to design factoid question answering system. Machhirke, V. S., Soni, A. Second Int Conf Inventive Res Computing Appl, , 276-281 (2020).
  4. Biancofiore, G. M., Deldjoo, Y., Di Noia, T., Di Sciascio, E., Narducci, F. Interactive question answering systems: literature review. ACM Comput Surv. 1 (1), Article 1(2024).
  5. Singh, S., Das, N., Michael, R., Tanwar, P. The question answering system using NLP and AI. Int J Sci Eng Res. 7 (12), 2229-5518 (2016).
  6. Pandya, H. A., Bhatt, B. S. Question answering survey: Directions, challenges, datasets, evaluation matrices. arXiv. , (2021).
  7. Khvalchik, M. A., Kulkarni, K. Open-domain non-factoid question answering. , Springer International Publishing. Cham. (2017).
  8. NIT Arunachal Pradesh PhD rules and regulations year. , National Institute of Technology Arunachal Pradesh. https://www.nitap.ac.in/storage/pdf/140508582e7c89a8b2295595085e3abe-%2003-37-28F%20IN%20AL.pdf (2022).
  9. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. BERT: Pre-training of deep bidirectional transformers for language understanding. Proc NAACL-HLT. , 4171-4186 (2019).
  10. Sanh, V., Debut, L., Chaumond, J., Wolf, T. DistilBERT, a distilled version of BERT: Smaller, faster, cheaper and lighter. arXiv. , (2019).
  11. DistilBERT HuggingFace. , https://huggingface.co/distilbert/distilbert-base-cased-distilled-squad (2023).
  12. Liu, Y., et al. A robustly optimized BERT pretraining approach. arXiv. , (2019).
  13. RoBERTa base squad2. Deepset. , https://huggingface.co/deepset/roberta-base-squad2 (2023).
  14. SQuAD: 100,000+ questions for machine comprehension of text. Rajpurkar, P., Zhang, J., Lopyrev, K., Liang, P. Proc 2016 Conf Empirical Meth Natural Language Proc, , 2383-2392 (2016).
  15. Attention is all you need. Vaswani, A., et al. 31st Conf Neural Informat Proc Syst, , 1-11 (2017).
  16. Malkov, Y. A., Yashunin, D. A. Efficient and robust approximate nearest neighbor search using hierarchical navigable small world graphs. IEEE Trans Pattern Anal Mach Intell. 42 (4), 824-836 (2018).
  17. Similarity search in high dimensions via hashing. Gionis, A., Indyk, P., Motwani, R. Proc 25th VLDB Conf, , 518-529 (1999).
  18. HIJLI_JU at SemEval-2024 task 7: Enhancing quantitative question answering using fine-tuned BERT models. Sengupta, P., Sarkar, S., Das, D. Proc 18th Int Workshop Semantic Evaluat, , 279-284 (2024).
  19. Kocoń, J., et al. ChatGPT: Jack of all trades, master of none. Inf Fusion. 99, 101861(2023).
  20. Fine-tuning strategies for domain specific question answering under low annotation budget constraints. Guo, K., Diefenbach, D., Gourru, A., Gravier, C. IEEE 35th Int Conf Tools with Artificial Intell, , 166-171 (2023).
  21. Question answering on biomedical research papers using transfer learning on BERT-base models. Pudasaini, S., Shakya, S. 7th Int Conf I-SMAC (IoT in Social, Mobile, Analytics and Cloud), , 496-501 (2023).
  22. Knowledge-augmented language model prompting for zero-shot knowledge graph question answering. Baek, J., Aji, A. F., Saffari, A. Proc 1st Workshop Natural Language Reasoning Struct Explanat, , 78-106 (2023).
  23. Hu, S., Zhang, H., Zhang, W. Domain knowledge graph question answering based on semantic analysis and data augmentation. Appl Sci. 13 (15), (2023).
  24. A BERT-based approach for knowledge base question answering. Luo, D., Su, J., Yu, S. Int Joint Conf Neural Networks, , 1-8 (2020).
  25. Wu, C., et al. Retrieval augmented generation-driven information retrieval and question answering in construction management. Adv Eng Inform. 65, 103158(2025).
  26. Peng, C., et al. A study of generative large language model for medical research and healthcare. NPJ Digit Med. 6 (1), 210(2023).
  27. Gardazi, N. M., et al. applications in natural language processing: a review. Artif Intell Rev. 58 (6), 1-49 (2025).
  28. Sabharwal, N., Agrawal, A. Hands-on question answering systems with BERT: applications in neural networks and natural language processing. , Apress Berkeley. CA. (2021).
  29. FAISS documentation. , https://faiss.ai/ (2025).
  30. Bhattacharya, D. SCD-QA dataset. Zenodo. , (2025).
  31. Annotation tool. , https://docs.haystack.deepset.ai/docs/annotation (2025).
  32. Johnson, J., Douze, M., Jégou, H. Billion-scale similarity search with GPUs. IEEE Transac Big Data. 7 (3), 535-547 (2021).
  33. Sun, P., Guo, R., Kumar, S. Automating nearest neighbor search configuration with constrained optimization. arXiv. , (2023).
  34. BERT. , Hugging Face. https://huggingface.co/docs/transformers/model_doc/bert (2025).
  35. MiniLM: Deep self-attention distillation for task-agnostic compression of pre-trained transformers. Wang, W., et al. Proc 34th Int Conf Neural Informat Process Syst, , 5776-5788 (2020).
  36. Sentence transformer documentation. , https://www.sbert.net/ (2025).
  37. Cosine similarity to determine similarity measure: study case in online essay assessment. Lahitani, A. R., Permanasari, A. E., Setiawan, N. A. 4th Int Conf Cyber IT Service Manag, , 1-6 (2016).
  38. A comparative analysis of transformer models in zero-shot text classification. Kyritsis, K., Liapis, C. M., Spatiotis, N., Perikos, I., Paraskevas, M. 15th Int Conf Informat Intelligence Syst Applicat, , 1-4 (2024).
  39. Howard, J., Ruder, S. Universal language model fine-tuning for text classification. Proc 56th Ann Meeting Associat Computat Linguistics. , 328-339 (2018).
  40. Asai, A., Hashimoto, K., Hajishirzi, H., Socher, R., Xiong, C. Learning to retrieve reasoning paths over Wikipedia graph for question answering. arXiv. , (2019).
  41. Lewis, P., et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. arXiv. , (2021).
  42. Leveraging passage retrieval with generative models for open domain question answering. Izacard, G., Grave, E. Proc Conf Eur Chapter Associat Computat Linguistics, , 874-880 (2021).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Modelos TransformerQA de dominio cerradoconjunto de datos SQuADpreguntas f cticaspreguntas no f cticasmodelo TF IDFsimilitud del cosenocoincidencia de sin nimos

Artículos relacionados