$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Base teórica integral
Componente QAS: El marco QAS consta de tres segmentos, como se muestra en la Figura 3: i) Módulo de procesamiento de preguntas (QPM), ii) Módulo de procesamiento de documentos (DPM) y iii) Módulo de extracción y formulación de respuestas (AEFM). El sistema recibe preguntas que se dividen en dos categorías principales: Factoides y No Factoides. Las preguntas Factoid suelen usar palabras interrogativas como qué, dónde, cuándo o quién, mientras que las preguntas no Factoid usan palabras como cómo y por qué.
DPM: De la lista proporcionada, el usuario puede seleccionar un pasaje específico. A continuación, cada token del pasaje se etiqueta mediante un etiquetador de parte de la oración (POS). Para extraer verbos, identifique todos los tokens etiquetados como verbos. Combine estos verbos con una lista de verbos no convencionales y aplique lógica para los verbos regulares. Cree una estructura de datos (matriz) que contenga los verbos extraídos, sus tiempos y sus formas -ing.
QPM: El sistema recibe información en forma de pregunta del usuario. El texto se tokeniza mediante la clase StringTokenizer y los tokens resultantes se almacenan en una estructura de datos independiente. Esta estructura de datos se devuelve para su posterior utilización dentro del programa.
AEFM: El primer paso es identificar el verbo en la pregunta dada. El verbo que se ha identificado recientemente ahora coincide con los tokens que se generaron durante la fase de procesamiento de documentos. El caso elegido para un tipo específico de pregunta fáctica (como qué o cuándo) se utiliza para extraer y construir la respuesta de una manera más precisa.
Antes de elegir el tipo de pregunta, primero se le pide al usuario que seleccione el pasaje de su elección. El QPM es responsable de procesar la pregunta del usuario y reenviarla a la AEFM. El AEFM utiliza las extracciones obtenidas del DPM y los documentos procesados que contienen el formato etiquetado del documento de entrada original. El módulo pasará los algoritmos requeridos al módulo de formulación para obtener la respuesta deseada.

Figura 3: Componentes del QAS. La figura ilustra el proceso de cuatro pasos de un sistema de control de calidad: pregunta, procesamiento de preguntas, procesamiento de respuestas y respuesta. En Procesamiento de preguntas, el sistema clasifica la pregunta. En el procesamiento de respuestas, encuentra y revisa documentos y pasajes para producir la respuesta. Haga clic aquí para ver una versión más grande de esta figura.
Modelo BERT: Para descubrir las asociaciones entre palabras en un texto, el método BERT utiliza un transformador. Hay dos mecanismos en un transformador: un codificador y un decodificador28, pero solo se necesita el codificador para BERT. BERT adopta un enfoque bidireccional y escanea sistemáticamente el texto de entrada para enseñarse a sí mismo el significado de las palabras en su contexto. El codificador toma como entrada una serie de tokens que han sido vectorizados. Luego, los vectores se introducen en la red neuronal, que produce una serie de vectores que reflejan la entrada. El vector de salida de una palabra cambia según la oración en la que aparece. El vector de una palabra puede variar según el contexto en el que aparece; por ejemplo, "me gusta" en "Le gusta jugar al cricket" tiene un vector diferente al de "me gusta" en "Su cara se puso roja como un tomate". El enfoque comienza con una fase de procesamiento de texto antes de pasar a la fase de construcción del modelo. Los pasos que BERT toma para procesar el texto se analizan en la siguiente sección28.
Procesamiento de texto: El modelo BERT representa el texto de entrada de acuerdo con un conjunto prescrito de principios. Además, este factor contribuye a mejorar el rendimiento del modelo. La incrustación de entrada en BERT consiste en una amalgama de tres tipos distintos de incrustaciones28.
Incrustaciones de posición (PE): Para conocer la información relacionada con el orden en las incrustaciones, se utilizan PE. Los PE se utilizan para restaurar información sobre el orden que se pierde en los transformadores. BERT desarrolla distintos PE específicamente para cada punto de la secuencia de entrada. BERT posee la capacidad de transmitir la información posicional de las palabras dentro de una oración mediante el uso de PE. Esto permite a BERT capturar y representar eficazmente la secuencia u orden de las palabras.
Incrustaciones de oraciones (SE): Además, para ayudar al modelo a distinguir entre la primera y la segunda oración, BERT aprende una incrustación que es única para cada una de ellas. También es capaz de aceptar oraciones emparejadas como entradas para actividades como el control de calidad.
Incrustaciones de tokens (TE): Los TE se enseñan para cada token en el vocabulario de tokens de WordPiece. El vocabulario de tokens de WordPiece comprende unidades de subpalabras derivadas de palabras que se encuentran dentro del corpus. Como ejemplo ilustrativo, esta colección de vocabulario abarcará todas las subpalabras concebibles del término Pregunta, incluidas Questio, Questi, etc.
La representación de entrada de un token se construye sumando sus incrustaciones en los niveles de segmento y posición. Debido a esto, es un enfoque de incrustación extenso que proporciona una gran cantidad de información al modelo. La Figura 49 muestra las incrustaciones del modelo BERT.

Figura 4: Incrustaciones BERT. La figura muestra cómo se crean las incrustaciones de entrada para un modelo de transformador. Comienza con una secuencia de entrada: [CLS] el cielo de [MASK] está nublado [SEP] lloverá [SEP]. Cada token de la secuencia recibe su propia incrustación, como Ethe o E[MASK]. Luego, se agregan incrustaciones de oraciones para cada oración, como EA para la primera y EB para la segunda. También se incluyen incrustaciones posicionales, etiquetadas como E0 a E9, para indicar la posición de cada token. Todos estos se combinan para formar las incrustaciones de entrada finales. Esta cifra ha sido modificada de9. Haga clic aquí para ver una versión más grande de esta figura.
Diseño de QAS usando BERT: Con fines ilustrativos, examine esta pregunta junto con un párrafo extraído de una entrada de Wikipedia sobre Football League28.
Pregunta: ¿Dónde se fundó la Liga de Fútbol?
Pasaje: En 1888, se fundó la Liga de Fútbol en Inglaterra, convirtiéndose en la primera de muchas competiciones de fútbol profesional. Durante el siglo XX, varios de los diversos tipos de fútbol crecieron hasta convertirse en algunos de los deportes de equipo más populares del mundo.
Respuesta: Inglaterra
El modelo BERT utiliza la extracción de tokens tanto de la pregunta como del contexto, combinándolos posteriormente en una entrada unificada. Como se indicó anteriormente, el proceso comienza con la utilización de un token [CLS], que sirve como indicador para el comienzo de una oración. Además, se emplea un separador [SEP] para separar claramente la pregunta y el pasaje. Además del token [SEP], BERT incorpora SE para distinguir entre la pregunta y el pasaje28 que contiene la respuesta. BERT utiliza dos SE, uno dedicado a la pregunta y otro al pasaje, para establecer una clara distinción entre ellos. Las incrustaciones se combinan posteriormente con una representación de28 tokens para diferenciar entre la pregunta y el pasaje. Este proceso se ilustra en la Figura 5.

Figura 5: Representación de entrada BERT. La figura ilustra cómo se generan las incrustaciones de entrada para un QAS basado en BERT. Comienza con el token [CLS], luego la pregunta ¿Cuántos? [SEP], y el pasaje BERT grande es, cada uno con sus incrustaciones de oraciones (A para la pregunta, B para el pasaje). Las incrustaciones de tokens, oraciones y posiciones se combinan para realizar la entrada final. Haga clic aquí para ver una versión más grande de esta figura.
Posteriormente, la representación integrada combinada28 de la pregunta y el contexto se utiliza como entrada en el modelo BERT. La capa oculta final de BERT se modifica para usar SoftMax para generar distribuciones de probabilidad. Estas distribuciones determinan los índices de inicio y fin de una subcadena dentro de la oración de texto de entrada, que representa una respuesta, como se muestra en la Figura 6, para una representación visual.

Figura 6: Flujo de trabajo de procesamiento BERT para control de calidad. La figura muestra cómo funciona el modelo BERT para el control de calidad. Presenta una secuencia de entrada que incluye una pregunta, marcada por un token de clasificación [CLS] al principio y un token separador [SEP] al final, seguido de un contexto, separado por otro [SEP]. Los tokens de esta secuencia se convierten en incrustaciones. Luego, el modelo predice las posiciones inicial y final de la respuesta dentro del pasaje. Haga clic aquí para ver una versión más grande de esta figura.
Base de datos vectorial (VD): Un VD17,18 es un sistema especializado para almacenar, administrar, indexar y consultar de manera eficiente representaciones vectoriales de datos de alta dimensión. Los vectores a menudo se generan a partir de modelos de aprendizaje profundo y encapsulan información semántica o contextual sobre los datos. Cada dimensión de un vector representa una característica específica. Las incrustaciones son representaciones numéricas de objetos como texto, imágenes, videos y audio. Estas incrustaciones se utilizan en diversas aplicaciones, como el aprendizaje automático (ML), el NLP, los sistemas de recomendación, la visión artificial y la infrarracción. Los VD facilitan las búsquedas de similitud efectivas y las consultas semánticas al agrupar objetos similares juntos en el espacio vectorial. Facebook AI Similarity Search (FAISS)29 es un VD destacado utilizado en este estudio para identificar el contexto más relevante para las consultas de los usuarios. La Tabla 2 describe las principales características de los VD y sus casos de uso.
| Característica | Descripción |
| Datos de alta dimensión | Maneja datos con cientos o miles de dimensiones. |
| Vecino más cercano aproximado (RNA) | Permite búsquedas rápidas de similitud mediante la aproximación de distancias. |
| Escalabilidad | Admite conjuntos de datos a gran escala con miles de millones de vectores. |
| Integración | A menudo se integra con marcos y herramientas de IA/ML para flujos de trabajo fluidos. |
| Consultas en tiempo real | Proporciona búsquedas vectoriales de baja latencia para aplicaciones interactivas. |
Tabla 2: Principales características de la VD. La tabla destaca las características importantes de VD. Estos incluyen el manejo de datos de alta dimensión, la ejecución de búsquedas rápidas de similitud utilizando algoritmos ANN, la ampliación a grandes conjuntos de datos, el trabajo con herramientas de IA y ML, y el soporte de consultas rápidas y en tiempo real para uso interactivo.
Métricas de evaluación del desempeño: El sistema SCD-QA se evaluó utilizando dos métricas principales: puntuación EM14 y latencia del modelo15. La puntuación EM, una métrica estándar en los estudios de control de calidad, evalúa la precisión de la predicción midiendo la proporción de respuestas predichas que coinciden exactamente con la verdad fundamental. Para un conjunto de N preguntas, la puntuación EM se define formalmente en la Ecuación 1 de la siguiente manera:
donde
(1)
Esta métrica asigna una puntuación de 1 para una coincidencia exacta con la respuesta de referencia y 0 para cualquier diferencia.
La métrica Latencia cuantifica el tiempo total de procesamiento requerido por el sistema para generar una respuesta a una consulta individual. Esta métrica se calcula como el tiempo medio transcurrido en todas las consultas, como se presenta en la Ecuación 2:
(2)
donde Tstarti y Tendi son las marcas de tiempo que marcan el inicio y el final del procesamiento de la i-ésima consulta, respectivamente. La latencia se informa en s y captura la capacidad de respuesta del sistema, abarcando todas las etapas, desde el procesamiento de entrada hasta la generación de respuestas.
Método
Para implementar el SCD-QA, en este documento se incorporan los siguientes estudios de prueba.
Conjunto de datos SCD-QA: Se presenta un conjunto de datos propuesto30 para la implementación del sistema SCD-QA. Este conjunto de datos se deriva de un corpus de texto que contiene Ph.D. reglas para 20228, para las pautas estudiantiles de NIT Arunachal Pradesh, India. Para establecer el sistema SCD-QA, es necesario generar un archivo JSON que abarque toda la información pertinente en un formato preciso. El conjunto de datos se genera a partir del corpus de texto utilizando la herramienta de anotación Haystack (versión 2.18.1)31, un marco de código abierto. Esta herramienta facilita la creación del conjunto de datos SCD-QA al estilo del SQuAD14. Los pasos para crear un conjunto de datos anotado de tipo SQuAD a partir del archivo PDF se muestran en la Figura 7, y la estructura de nuestro conjunto de datos en estilo SQuAD se ilustra en la Figura 8.

Figura 7: Pasos para crear un conjunto de datos anotado a partir de un archivo PDF. La figura ilustra un flujo de trabajo paso a paso para crear un dataset anotado de estilo SQuAD utilizando las herramientas de Haystack. Describe el proceso desde la extracción de texto de archivos PDF, la limpieza y división en pasajes, la anotación manual de pares de preguntas y respuestas, el almacenamiento de las anotaciones en formato SQuAD JSON y, finalmente, la exportación del conjunto de datos para el entrenamiento del modelo. Haga clic aquí para ver una versión más grande de esta figura.

Figura 8: Estructura del conjunto de datos de control de calidad factoide. La figura muestra una estructura de datos JSON que representa un párrafo y un par de control de calidad de un conjunto de datos. Tiene una sección de párrafos, que contiene un conjunto de preguntas y respuestas. Una pregunta pregunta: ¿Cuál es la calificación mínima requerida para ingresar a Ph.D. Science? Cada pregunta tiene un ID y una matriz de respuestas. La respuesta incluye un ID de documento, un ID de pregunta, el texto con un 60% de puntos, la posición inicial de la respuesta y una categoría de respuesta no especificada. La marca is_impossible se establece en false. Haga clic aquí para ver una versión más grande de esta figura.
El conjunto de datos está estructurado como una lista de diccionarios, donde cada diccionario contiene campos clave como datos, párrafos, pregunta, answer_id, document_id, question_id, texto, answer_start, answer_end, is_impossible y contexto.
data: Contiene la información general de preguntas y respuestas.
párrafos: Un contexto particular, junto con sus preguntas y respuestas.
pregunta: Una pregunta en particular.
answer_id: Un número de identificación único para cada texto de respuesta.
document_id: Un número de identificación único para cada contexto.
question_id: Un número de identificación único para cada pregunta.
text: El texto de la respuesta.
answer_start: La ubicación inicial de la respuesta correcta en contexto.
answer_end: La ubicación final de la respuesta correcta en contexto.
is_impossible: Indica si la respuesta a la pregunta formulada está disponible en el contexto o no.
context: El corpus de texto del que se puede encontrar una respuesta.
Las 80 preguntas del conjunto de datos propuesto siguen el formato de preguntas factoides y no factoides. En la Tabla 3 se muestran ejemplos de algunos tipos de preguntas enmarcadas.
| Preguntas |
| ¿Quién es PS? |
| ¿Cuál es el tamaño de fuente del documento de última generación? |
| ¿Cuántos días hay de baja por maternidad? |
Tabla 3: Pregunta de muestra del conjunto de datos. La tabla muestra ejemplos de dos tipos de preguntas: la primera y la segunda son preguntas fácticas, mientras que la tercera es una pregunta no fáctica.
FAISS: FAISS (versión faiss_cpu-1.9.0)29,32, desarrollada por Facebook AI Research (FAIR), es una biblioteca de código abierto que facilita la búsqueda eficiente de similitudes y la agrupación de vectores densos. Está diseñado específicamente para administrar datos de alta dimensión a gran escala de manera efectiva. Este sistema facilita búsquedas de RNA rápidas y escalables dentro de conjuntos de datos que comprenden millones o miles de millones de vectores. Se utiliza ampliamente en aplicaciones relacionadas con incrustaciones, incluido NLP, sistemas de recomendación y recuperación de imágenes o videos. FAISS ofrece múltiples métodos de indexación, incluidos Flat (fuerza bruta), Archivo invertido (IVF), Gráficos de mundo pequeño navegables jerárquicos (HNSW) y cuantificación de productos (PQ). Estos métodos permiten a los usuarios optimizar el rendimiento de búsqueda de acuerdo con el tamaño de los datos, la dimensionalidad y las especificaciones de hardware. En este estudio, se utiliza la indexación plana, que realiza una búsqueda de fuerza bruta utilizando la distancia L2 (euclidiana) para identificar los vecinos más cercanos. La escalabilidad del sistema admite implementaciones de CPU y GPU, lo que permite cálculos de alto rendimiento en amplios conjuntos de datos. Además, proporciona flexibilidad para optimizar el equilibrio entre velocidad y precisión en función de los requisitos específicos de la aplicación. FAISS se usa con frecuencia en PNL para evaluar la similitud semántica en incrustaciones, como BERT o Word2Vec. FAISS se utiliza en QAS para almacenar y administrar representaciones vectoriales de documentos u oraciones. Realiza búsquedas ANN aproximadas33 para recuperar el contexto más relevante para las preguntas de los usuarios, mejorando la búsqueda semántica con incrustaciones de modelos de transformadores como BERT. FAISS es una herramienta fundamental en los flujos de trabajo de IA y ML debido a su versatilidad.
Modelo BERT-large-uncased-whole-word-masking-finetuned-SQuAD: El presente trabajo utiliza un modelo de lenguaje preentrenado conocido como BERT-large-uncased-whole-word-masking finetuned-squad9 para desarrollar un QAS factoide utilizando el conjunto de datos propuesto en el estudio. El modelo BERT se sometió a un entrenamiento previo en BookCorpus, un conjunto de datos de 11.038 libros inéditos9, así como en Wikipedia en inglés, con la excepción de listas, tablas y encabezados. El modelo en cuestión no tiene mayúsculas y minúsculas, lo que significa que no distingue entre las palabras inglés e inglés. El modelo es un modelo de transformador preentrenado que se ha entrenado con una cantidad sustancial de datos en inglés utilizando un enfoque autosupervisado. El modelo se entrenó previamente exclusivamente en textos sin procesar, sin anotaciones humanas. Esto le permite aprovechar una gran cantidad de datos de acceso público. El proceso de preentrenamiento implica generar automáticamente entradas y etiquetas a partir de los textos proporcionados. El modelo fue entrenado con dos objetivos específicos9:
MLM: El proceso consiste en enmascarar aleatoriamente el 15%9 de las palabras en la oración de entrada. Luego, el modelo procesa toda la oración enmascarada y predice las palabras enmascaradas. Este enfoque difiere de las redes neuronales recurrentes (RNN) convencionales, que generalmente procesan palabras secuencialmente, y de los modelos autorregresivos como GPT, que emplean enmascaramiento interno de tokens futuros. La funcionalidad permite que el modelo adquiera una representación bidireccional de la oración.
NSP: Durante la fase de preentrenamiento, el modelo combina dos oraciones disfrazadas como entradas. En algunos casos, estas oraciones son adyacentes en el texto original, lo que indica una relación directa. En otros casos, no lo son, lo que significa que no hay una proximidad original o un contexto que los vincule. El siguiente paso implica que el modelo prediga si las dos oraciones son lógicamente coherentes.
El modelo actual se caracteriza por la configuración posterior: la arquitectura del modelo consta de 24 capas, con una dimensión oculta de 1024. Utiliza 16 cabezales de atención y tiene un total de 336 millones de parámetros9.
WordPiece se utiliza para tokenizar los textos con un tamaño de vocabulario de 30.000 palabras en los pasos de preprocesamiento. Las entradas del modelo se verían así: [CLS] Oración A [SEP] Oración B [SEP]. El único requisito es que la duración total de las oraciones combinadas sea inferior a 512 tokens9. El modelo específico preentrenado produce el resultado posterior: la puntuación F1 lograda es del 93,15 %, mientras que la puntuación de coincidencia precisa es del 86,91 %9.
Modelo Distilbert / distilbert-base-cased-distilled-squad: El modelo DistilBERT10 es una variante más compacta, rápida y eficiente del modelo BERT9 , desarrollado para mantener la mayor parte de la capacidad semántica de BERT para comprender mientras consume menos recursos y es más apropiado para aplicaciones prácticas con capacidad computacional restringida. La versión distilbert-base-cased-distilled-squad se ha ajustado en el SQuAD14 para tareas de control de calidad. El modelo utiliza la arquitectura del transformador, incluido un tamaño reducido de 66 millones de parámetros en contraste con los 110 millones de BERT, mientras mantiene el 97% de la eficacia de BERT en la comprensión del lenguaje. DistilBERT llega a esto utilizando un método conocido como Destilación del Conocimiento, que transmite información del modelo BERT más grande al modelo DistilBERT más compacto. Debido a su tamaño más pequeño, puede inferir información más rápidamente y usar menos memoria, lo que lo hace perfecto para aplicaciones con recursos limitados, como dispositivos móviles o perimetrales. El modelo, cuidadosamente ajustado en el conjunto de datos SQuAD 1.1, demuestra una competencia excepcional en tareas de control de calidad extractivas, por lo que el objetivo es localizar un segmento de texto de un contexto específico que responda a una pregunta. DistilBERT logra aproximadamente el 85% de la puntuación F1 de BERT en la tabla de clasificación de SQuAD y conserva una parte significativa de la capacidad lingüística de BERT, a pesar de su tamaño reducido. Este modelo es una solución excepcionalmente eficiente para trabajos de control de calidad a nivel de producción, optimizando tanto el rendimiento como la eficiencia computacional.
Deepset/roberta-base-squad2: El deepset/roberta-base-squad2 modelo12,13 es una variante afinada de la arquitectura RoBERTa. Está diseñado específicamente para el conjunto de datos SQuAD14 2.0, que incluye preguntas respondidas y no respondidas. Este marco RoBERTa mejorado elimina los9 puestos de trabajo NSP de BERT. También utiliza el enmascaramiento dinámico durante el entrenamiento para aumentar la eficiencia y el rendimiento en las tareas de comprensión NL. El modelo tiene 125 millones de parámetros y utiliza un transformador bidireccional. Esto le permite adquirir información contextual de ambas direcciones y sobresalir en tareas extractivas de control de calidad.
El ajuste fino en SQuAD 2.0 permite que el modelo identifique el intervalo de respuesta correcto dentro de un contexto determinado y reconozca cuándo no hay respuesta. Utiliza un tokenizador de codificación de pares de bytes (BPE) que controla la tokenización de subpalabras y conserva la distinción entre mayúsculas y minúsculas. Esto mejora su capacidad para procesar palabras poco comunes y complejas. El modelo funciona bien, logrando aproximadamente 85%-90% F1 y 80%-85% EM. Su capacidad para detectar preguntas sin respuesta y su implementación efectiva lo hacen valioso para el servicio al cliente, la recuperación de conocimientos y los asistentes virtuales.
La forma más eficaz de implementar modelos BERT ajustados por SQuAD para el control de calidad es utilizar la canalización Hugging Face Transformers34. Este marco optimiza la tokenización, el formato de entrada, la carga del modelo y el posprocesamiento de salida. Estos modelos son ampliamente reconocidos por su eficacia en el control de calidad extractivo, donde la respuesta es un intervalo de texto recuperado directamente del contexto dado. Para guiar la implementación, el siguiente procedimiento describe los pasos para ejecutar modelos BERT.
Entrada y configuración: Este proceso requiere cuatro entradas principales y parámetros de configuración: el nombre del modelo, especificado como un identificador de cadena del Hugging Face Hub (por ejemplo, google-bert/bert-large-uncased-whole-word-masking-finetuned-squad, distilbert/distilbert-base-cased-distilled-squad o deepset/roberta-base-squad2); la pregunta (Q), proporcionada como una cadena que contiene la consulta; y el contexto (C), una cadena que representa el texto o pasaje relevante. La herramienta principal utilizada es la función de canalización de alto nivel de la biblioteca Hugging Face transformers (versión 4.57.0) en Python (versión 3.12.12).
Proceso: Ejecución (canalización de cara abrazada): El proceso consta de seis pasos principales y emplea la canalización Hugging Face para abordar la complejidad de la tarea de control de calidad:
Instalar biblioteca: Comience instalando la biblioteca requerida con el comando pip install transformers. Esta instalación permite el acceso a los modelos y a la funcionalidad de canalización optimizada.
Canalización de importación: Importe la función de tubería usando: desde transformadores import pipeline.
Inicializar canalización de control de calidad: Inicialice la canalización de control de calidad mediante qa_pipeline = pipeline("question-answering", model=""). Este comando descarga el modelo y el tokenizador, preparándolos para la inferencia.
Definir entrada: Establecer pregunta = ... y contexto = ... para preparar los datos del modelo.
Ejecutar inferencia: Pase la pregunta y el contexto a la canalización con result = qa_pipeline(question=question, context=context). El modelo procesa la entrada y proporciona una respuesta.
Extracto de respuesta: Obtenga la cadena de respuesta del diccionario de salida usando: answer = result['answer'].
Salida: El proceso produce varios parámetros de salida en el siguiente orden: Respuesta (el intervalo de texto extraído del contexto, presentado como una cadena), Puntuación (un valor de punto flotante que cuantifica la confianza del modelo en su predicción) e índices de inicio y fin (enteros que especifican las posiciones de caracteres del intervalo de respuesta dentro del contexto).
Transformadores de oraciones / all-MiniLM-L6-v2: El all-MiniLM-L6-v235 es un transformador de oraciones preentrenado de la biblioteca Sentence-Transformers (versión 5.1.1)36. Está optimizado para una incrustación de texto eficiente y precisa. Desarrollado en el marco MiniLM de Microsoft, incluye seis capas de transformadores e incrustaciones de 384 dimensiones. Este diseño equilibra el rendimiento y la competencia computacional, lo que lo hace adecuado para aplicaciones en tiempo real. El modelo se entrenó con más de mil millones de pares de frases de conjuntos de datos como SNLI, MultiNLI, puntos de referencia STS y datos rastreados en la web. Como resultado, demuestra competencia en la similitud semántica, la agrupación y las tareas relacionadas con la búsqueda. Debido a su pequeño tamaño (~22 MB) y su rendimiento de inferencia mejorado, all-MiniLM-L6-v2 simplifica aplicaciones como la búsqueda semántica, la detección de duplicaciones y la categorización de texto. Aunque es liviano, ofrece una gran precisión en puntos de referencia como STS-B y SICK-R, lo que lo convierte en una opción efectiva tanto para escenarios escalables como de recursos limitados. El flujo de trabajo para generar la incrustación mediante Sentence-Transformer se muestra en la Figura 9 a continuación.

Figura 9: Paso del proceso de incrustación utilizando el modelo de transformador de frases. La figura ilustra el flujo de trabajo para generar incrustaciones de texto utilizando el marco de transformación de frases. Describe el proceso desde la importación de bibliotecas y la carga de un modelo preentrenado hasta la preparación de datos de texto, la generación de incrustaciones, la conversión en matrices NumPy y su almacenamiento para tareas posteriores como la indexación o la búsqueda de similitudes. Haga clic aquí para ver una versión más grande de esta figura.
Algoritmo propuesto: Este estudio describe una metodología sugerida en el Algoritmo 1 para el desarrollo del sistema SCD-QA basado en SeCD, capaz de abordar preguntas factoides y no factoides formuladas por los usuarios.
ALGORITMO 1: Algoritmo del sistema SCD-QA propuesto basado en SeCD
Entrada: Conjunto de archivo de contexto sin procesar (C) y la consulta del usuario (Q).
Salida: El LLM óptimo basado en transformador seleccionado (M') y la respuesta generada por M'.
Contextos de preprocesamiento: anote el conjunto de contextos sin procesar C para crear un conjunto de datos estructurado en formato DSQuAD .
DSQuAD =f anonato (C)
Generar incrustaciones de contexto: Utilice un transformador de oraciones fembed para convertir cada contexto c
DSQuAD en una incrustación ec.

Almacenar incrustaciones: Almacene Ec en una base de datos vectorial V para una búsqueda de similitud eficiente.

Generar incrustación de consultas: Transforme la consulta del usuario Q en una incrustación eq utilizando el mismo transformador de oraciones.

Recuperación de contexto: recupere la incrustación
de contexto más relevante de la base de datos V en función de la similitud con eq.

donde sim(eq,e c), es la función de similitud.
Pasar contexto a LLM: Alimente el contexto
recuperado en 3 LLM basados en transformadores: Google-BERT (M1), DistilBERT (M2), RoBERTa (M3) y un modelo tradicional: TF-IDF + Similitud de coseno (M4)

Evaluación del modelo: Compare las respuestas {R1,R 2,R 3,R 4} utilizando una función de evaluaciónf-eval, que califica cada respuesta.

Seleccione el mejor modelo: identifique el modelo M' con la puntuación de evaluación más alta S'

Generar salida final: use M' para generar la respuesta final R basada en

Fin
El proceso algorítmico propuesto describe un enfoque sistemático (Figura 10) para elegir un LLM basado en transformador ideal para abordar las preguntas de los usuarios. Incorpora preprocesamiento, recuperación de contexto basada en incrustación y evaluación de múltiples modelos para garantizar respuestas de alta calidad y contextualmente relevantes. A continuación, se explica el proceso paso a paso para mayor claridad:
Preparación y preprocesamiento de datos: La primera fase implica el procesamiento de datos textuales sin procesar.
Entrada: Los archivos de texto sin procesar8 se adaptan al sistema.
Herramienta de anotación31: La entrada se transforma en un conjunto de datos estructurado en formato SQuAD14 . Este paso implica la creación de pares de control de calidad. También organiza los datos textuales relevantes en bloques de contexto bien definidos.
Salida: el conjunto de datos ya está listo para crear incrustaciones.
Generación de incrustación de contexto: Para permitir una recuperación de contexto eficiente y escalable, se aplica un modelo entrenado de Sentence-Transformer35,36 al conjunto de datos anotado. Este transformador convierte el texto en incrustaciones de alta dimensión que capturan el significado semántico. Las incrustaciones se almacenan en VD, FAISS29,32 para permitir búsquedas rápidas basadas en similitudes.
Procesamiento de consultas de usuario: Cuando un usuario envía una pregunta, la pregunta es procesada por el mismo Transformador de oraciones35,36. Esto genera una incrustación correspondiente en el mismo espacio vectorial 29,32 que las incrustaciones de contexto. Este diseño garantiza que la consulta se pueda hacer coincidir con las entradas de contexto relevantes.
Recuperación de contexto mediante similitud vectorial: mediante una métrica de similitud (por ejemplo, similitud de coseno), el sistema compara la incrustación de consultas con las incrustaciones de contexto almacenadas. El sistema selecciona el contexto más relevante en función de la puntuación de similitud más alta. Esto garantiza que solo se pase el contexto pertinente a los modelos posteriores. El proceso reduce la sobrecarga computacional y mejora la relevancia.
Evaluación del modelo en múltiples LLM: el contexto seleccionado se evalúa mediante tres LLM basados en transformadores: Google-BERT28, DistilBERT10 y RoBERTa12. También se evalúa mediante un TF-IDF37 tradicional basado en palabras clave con un modelo de similitud de coseno. Cada modelo procesa el contexto y genera una respuesta a la pregunta del usuario.
Evaluación comparativa: Las respuestas de los cuatro modelos de LLM se evalúan utilizando dos métricas clave. Primero, el emparejamiento semántico es evaluado por EM14. En segundo lugar, la latencia del modelo se analiza por los tiempos medios de reacción15.
Selección del modelo y salida final: El modelo con mejor rendimiento se selecciona como el LLM apropiado para la pregunta del usuario. Se considera la respuesta final del modelo seleccionado. Esto garantiza un equilibrio entre la eficiencia computacional y la calidad de respuesta.

Figura 10: Flujo de trabajo del sistema SCD-QA utilizando modelos basados en transformadores. La figura muestra cómo funciona el sistema SCD-QA. En primer lugar, una herramienta de anotación procesa un archivo de contexto sin procesar para crear un dataset en formato SQuAD. A continuación, un transformador de frases genera incrustaciones, que se almacenan en una base de datos vectorial FAISS. Cuando un usuario hace una pregunta, el sistema crea una incrustación para ella y selecciona el contexto más relevante. Compara tres modelos basados en transformadores: Google-BERT, DistilBERT y RoBERTa, y una puntuación de similitud tradicional TFIDF + coseno, y utiliza el de mejor rendimiento para proporcionar la respuesta. Haga clic aquí para ver una versión más grande de esta figura.