Artículo de investigación

Verificación de afirmaciones impulsada por NLI adaptativa con modelado de decisiones estadísticas para la reducción de alucinaciones de baja latencia en modelos de lenguaje extensos

0 vistas

DOI:

10.3791/72636

3 de septiembre de 2026

En este artículo

Resumen

Este estudio presenta un marco ligero para reducir las alucinaciones en modelos grandes de lenguaje mediante verificación a nivel de afirmación y umbral estadístico adaptativo. Al corregir selectivamente afirmaciones no respaldadas utilizando inferencia del lenguaje natural, el enfoque mejora la precisión factual manteniendo una baja latencia de respuesta y una eficiencia práctica en la implementación.

Resumen

Los modelos lingüísticos grandes (LLM) presentan una tendencia crítica a generar salidas lingüísticamente fluidas pero factualmente incorrectas, un fenómeno denominado alucinación, que supone riesgos graves en aplicaciones que requieren alta precisión. Las estrategias actuales de mitigación, incluyendo la generación aumentada con recuperación y el muestreo de autoconsistencia, o bien introducen una latencia sustancial durante la inferencia o dependen de infraestructuras externas de conocimiento, lo que limita su aplicabilidad en implementaciones en tiempo real. Este artículo propone un marco ligero de verificación de afirmaciones en dos pasos que descompone las respuestas del LLM en afirmaciones factuales atómicas y verifica independientemente cada afirmación extraída frente a una referencia generada por separado mediante un estímulo aislado de recuperación factual. Aunque el generador y el verificador comparten el mismo modelo lingüístico subyacente, separar la generación de respuestas de la recuperación factual reduce el condicionamiento directo de la respuesta y mitiga el sesgo de confirmación durante la verificación, utilizando inferencia lingüística natural (NLI), y aplica un umbral estadístico adaptativo —definido como τ = µ + kσ sobre la distribución de puntuaciones de confianza NLI— para corregir selectivamente solo las afirmaciones contradictorias. A diferencia de métodos previos basados en NLI que dependen de límites de decisión fijos, el marco propuesto adapta dinámicamente su umbral de verificación a la distribución de confianza de cada respuesta, mostrando un rendimiento consistente en las pruebas evaluadas sin necesidad de reentrenar el modelo. Evaluado en TruthfulQA y FEVER, el marco reduce la tasa de alucinación del 28 % al 9 % en TruthfulQA —una reducción relativa del 67,9 %—, con un aumento adicional de solo 160 ms de latencia respecto al LLM de referencia, superando además a SelfCheckGPT y FActScore en precisión de detección de alucinaciones. Estos resultados indican que el marco puede ofrecer un equilibrio favorable entre fiabilidad factual y latencia de respuesta en las pruebas evaluadas, aunque se requiere una validación adicional en distintos dominios y entornos de implementación.

Introducción

Los modelos de lenguaje grandes (LLMs) han surgido como componentes fundamentales de los sistemas modernos de inteligencia artificial, demostrando una capacidad notable en una amplia gama de tareas de lenguaje natural, incluyendo la generación de texto, la respuesta a preguntas, la sumarización y el razonamiento complejo.1Su capacidad para producir respuestas fluidas y contextualmente coherentes ha acelerado su adopción en áreas de alto impacto, como el apoyo a la toma de decisiones clínicas, el análisis jurídico, la ingeniería de software y la tecnología educativa.2Sin embargo, una limitación crítica y persistente socava su fiabilidad en estos contextos: la alucinación, fenómeno en el cual los modelos generan respuestas lingüísticamente fluidas pero factualmente incorrectas, infundadas o completamente inventadas³. Estudios empíricos reportan tasas de alucinación que van desde el 15 % hasta más del 40 %, dependiendo de la tarea y del modelo, y hasta sistemas de última generación como GPT-4 presentan inconsistencias factuales medibles cuando se evalúan en dominios específicos.2,3. Esta limitación plantea riesgos graves en aplicaciones que requieren precisión, donde las salidas erróneas pueden provocar desinformación, diagnósticos incorrectos o toma de decisiones defectuosa4. Las alucinaciones surgen fundamentalmente de la naturaleza probabilística del modelado del lenguaje: los modelos lingüísticos grandes (LLM) generan tokens prediciendo continuaciones estadísticamente probables de secuencias de entrada, en lugar de recuperar o razonar sobre conocimientos factuales verificados5Como consecuencia, las salidas generadas pueden incluir afirmaciones verosímiles pero inexactas, introducir aserciones no respaldadas o confundir conceptos semánticamente relacionados pero factualmente distintos.6.

Las estrategias de mitigación existentes abordan este problema mediante varios paradigmas, cada uno con limitaciones notables. La generación aumentada por recuperación (Retrieval-Augmented Generation, RAG) reduce la alucinación al fundamentar las respuestas en documentos recuperados externamente, pero introduce una sobrecarga significativa de latencia, requiere acceso a bases de conocimiento mantenidas y sigue siendo vulnerable a fallos de recuperación en dominios especializados o con pocos recursos7,8,9.

Aunque el generador de respuestas y el generador de referencias se instancian utilizando el mismo modelo subyacente GPT-3.5 Turbo, operan bajo objetivos de activación y contextos de ejecución diferentes. El generador de respuestas produce una respuesta sin restricciones a la consulta del usuario, mientras que el generador de referencias realiza una tarea aislada de recuperación de hechos sin acceso a la respuesta generada previamente. Esta separación reduce los efectos directos de condicionamiento de la respuesta y limita el sesgo de confirmación durante la verificación de afirmaciones. Por lo tanto, el marco trata a la referencia generada como independiente desde un punto de vista procedimental, más que estadísticamente independiente.

Investigaciones recientes también han explorado estrategias de decodificación ligeras para reducir las alucinaciones en la generación de texto sin depender de recuperación externa ni verificación repetida. Un enfoque representativo es la Decodificación mediante Contraste de Capas (DoLA), que mejora la veracidad contrastando representaciones de capas intermedias y finales del transformador durante la decodificación. A diferencia de los marcos de verificación posterior a la generación, estos métodos intervienen directamente durante la generación de tokens y, por lo tanto, optimizan una etapa diferente del proceso de generación del lenguaje. Estas estrategias complementarias demuestran que la mitigación de alucinaciones puede lograrse ya sea durante la decodificación o mediante verificación posterior a la generación, ofreciendo cada enfoque compensaciones distintas en términos de sobrecarga computacional, complejidad de implementación y fiabilidad factual.

Los métodos de autoconsistencia mejoran la fiabilidad factual mediante el muestreo de múltiples respuestas y la selección de la salida más frecuente o coherente, pero su costo computacional aumenta linealmente con el número de muestras, lo que los hace inadecuados para implementaciones sensibles a la latencia8. Los enfoques de refinamiento iterativo, que revisan repetidamente las salidas mediante bucles de retroalimentación interna, reducen progresivamente las tasas de error, pero amplían considerablemente el tiempo de inferencia con cada paso adicional9. Los métodos de verificación basados en inferencia natural (NLI) ofrecen una alternativa más específica al evaluar la implicación semántica entre afirmaciones generadas y textos de referencia, pero las implementaciones existentes dependen de umbrales de decisión fijos que no logran adaptarse a diferentes distribuciones de confianza, dominios o comportamientos del modelo10,11. En conjunto, estos enfoques imponen una sobrecarga computacional inaceptable, dependen de infraestructuras externas o carecen de la adaptabilidad necesaria para una implementación generalizada. Se proporciona una comparación de las características principales de estos enfoques de verificación de alucinaciones en la Tabla Suplementaria 1.

Este artículo propone un marco ligero de verificación en dos pasos, diseñado para reducir las alucinaciones en las salidas de los modelos lingüísticos grandes (LLM) manteniendo una baja latencia de respuesta. En la primera etapa, el LLM genera una respuesta inicial, que luego se descompone en afirmaciones factuales atómicas. En la segunda etapa, cada afirmación se verifica mediante inferencia del lenguaje natural (NLI) frente a una referencia factual generada por separado mediante un proceso aislado de razonamiento que no accede a la respuesta original generada, y un umbral de confianza derivado estadísticamente rige la decisión de aceptar o corregir a nivel de afirmación. Las principales contribuciones de este trabajo son las siguientes: (1) Una tubería de verificación a nivel de afirmación en dos pasos que separa la generación de respuestas de la validación factual, permitiendo una evaluación independiente y específica de cada afirmación atómica sin necesidad de recuperación externa o regeneración completa de la respuesta; (2) Un mecanismo adaptativo de umbralización estadística basado en la distribución de las puntuaciones de confianza de NLI (τ = µ + kσ), que determina dinámicamente los límites de aceptación y corrección en lugar de depender de reglas de decisión fijas, mejorando la robustez en diferentes distribuciones de confianza; (3) Una estrategia de corrección selectiva que limita la regeneración únicamente a aquellas afirmaciones clasificadas como contradictorias, reduciendo sustancialmente la carga computacional en comparación con enfoques de remuestreo completo de la respuesta o refinamiento iterativo; (4) Una evaluación empírica en un conjunto de pruebas centrado en alucinaciones, que demuestra que el marco propuesto reduce las tasas de alucinación del 28 % al 9 % manteniendo la latencia de respuesta dentro de límites prácticos para su implementación.

Protocolo

Este estudio no involucró participantes humanos, animales, especímenes biológicos ni datos de pacientes. Por lo tanto, no se requirió aprobación ética institucional ni consentimiento informado.

Resumen del diseño del estudio

Se implementó un marco de verificación en dos etapas para mejorar la fiabilidad factual de las salidas de modelos grandes de lenguaje (LLM). El procedimiento consistió en la generación de respuestas, extracción de afirmaciones, construcción aislada de referencias, verificación basada en inferencia del lenguaje natural (NLI), toma de decisiones estadística adaptativa, corrección selectiva y ensamblaje final de la respuesta. El marco se evaluó utilizando los conjuntos de datos de referencia TruthfulQA y FEVER.

Flujo de trabajo general

Consulta del usuario → Generación de respuesta inicial → Extracción de afirmaciones → Generación independiente de referencias → Verificación mediante inferencia natural (NLI) → Cálculo del umbral estadístico → Corrección de afirmaciones → Respuesta verificada final. El flujo de trabajo general del marco adaptativo de verificación de afirmaciones se ilustra en Figura 1.

Preparación del conjunto de datos

El conjunto de datos TruthfulQA12, que contiene 817 preguntas orientadas a hechos, se descargó y preparó para su evaluación. El conjunto de datos FEVER13 comprende 185.445 afirmaciones anotadas etiquetadas como Apoyadas, Refutadas o Información Insuficiente; la evaluación utilizó los datos de desarrollo etiquetados con sus campos de afirmación, evidencia y etiqueta de verdad fundamental. Cada afirmación se evaluó en función de su evidencia proporcionada, mientras que la etiqueta original FEVER se conservó como resultado de referencia para verificación. El conjunto de datos FEVER, que contiene pares afirmación-evidencia para verificación de hechos, fue obtenido y preprocesado. Las preguntas y afirmaciones de entrada se convirtieron a un formato de texto estandarizado. Se eliminaron las entradas duplicadas y las muestras incompletas antes de la experimentación. TruthfulQA se dividió en subconjuntos de validación y prueba. Aproximadamente el 20 % de las muestras de TruthfulQA (164 preguntas) se utilizó para el ajuste de umbral, mientras que las 653 preguntas restantes se reservaron para la evaluación del rendimiento. Para FEVER, las afirmaciones proporcionadas por el conjunto de referencia se utilizaron directamente como unidades de verificación y no pasaron por el procedimiento de generación de respuestas y extracción de afirmaciones aplicado a TruthfulQA. Las características de los conjuntos de datos de referencia utilizados para el desarrollo y evaluación del marco se resumen en Tabla 1.

Generación de la respuesta inicial

Cada consulta se envió al modelo de lenguaje base. Las respuestas se generaron utilizando muestreo por núcleo con una temperatura de 0.7 y un top-p de 0.9. La longitud máxima de salida se limitó a 256 tokens. Las respuestas generadas se almacenaron sin ningún tipo de postprocesamiento o modificación manual. El texto generado se envió directamente a la etapa de extracción de afirmaciones.

Extracción de afirmaciones

Cada respuesta generada se descompuso en afirmaciones factuales independientemente verificables. Se utilizó una consigna estructurada de descomposición para identificar afirmaciones atómicas. Las declaraciones compuestas se separaron en unidades factuales mínimas. Se eliminaron opiniones subjetivas, expresiones estilísticas y elementos conversacionales irrelevantes. Cada afirmación extraída se almacenó como una unidad de verificación independiente.

Ejemplo:

Respuesta original:

«Marie Curie fue una física y química de origen polaco que realizó investigaciones pioneras sobre la radiactividad.»

Afirmaciones extraídas: (1) Marie Curie nació en Polonia; (2) Marie Curie fue física y química; (3) Marie Curie realizó investigaciones sobre la radiactividad.

Construcción de referencia aislada:

Para cada afirmación extraída, se generó una referencia factual independiente. El modelo verificador recibió únicamente la consulta original del usuario. Se restringió el acceso a la respuesta generada original para evitar sesgos de confirmación. Se utilizó una indicación de recuperación factual para fomentar respuestas concisas y basadas en evidencia. Las referencias generadas se almacenaron para su verificación posterior.

Verificación de inferencia del lenguaje natural

Cada par de afirmación y referencia se envió a un modelo NLI preentrenado. El modelo NLI clasificó la relación como: Implicación, Neutral o Contradicción. Se registraron las probabilidades de confianza para las tres clases. Se asignó una puntuación de verificación con signo: valor positivo para implicación, cero para neutral o un valor negativo para contradicción. Se recopilaron todas las puntuaciones de verificación para el cálculo del umbral.

Cálculo adaptativo del umbral estadístico

La confianza de verificación generada por el modelo NLI varía considerablemente entre las respuestas, ya que diferentes consultas producen distintas cantidades de afirmaciones, niveles de complejidad semántica y distribuciones de confianza. Un umbral global fijo asume que todas las respuestas siguen un perfil de confianza similar, lo cual rara vez se observa en la práctica. Para acomodar esta variabilidad, el marco propuesto estima el límite de decisión individualmente para cada respuesta utilizando la media y la desviación estándar de sus puntuaciones de verificación. La media refleja el nivel general de confianza de la respuesta, mientras que la desviación estándar captura la dispersión de los valores de confianza entre las afirmaciones extraídas. Esta formulación adaptativa permite que el criterio de aceptación se ajuste a la incertidumbre específica de cada respuesta, en lugar de depender de un único umbral para todas las entradas.

Se calcularon la media (µ) y la desviación estándar (σ) de todas las puntuaciones de verificación con signo.

El umbral de decisión adaptativo se calculó como:

figure-protocol-1

donde τ representa el umbral adaptativo, µ denota la puntuación media de verificación, σ denota la desviación estándar, y k representa el parámetro de sensibilidad.

El parámetro de sensibilidad se inicializó en 0,7. Las afirmaciones clasificadas como implicación con puntuaciones mayores o iguales que +τ se aceptaron. Las afirmaciones clasificadas como contradicción con puntuaciones menores o iguales que −τ se marcaron para su corrección. Las afirmaciones con puntuaciones dentro del intervalo (−τ, +τ) se conservaron como neutrales.

Corrección selectiva de reclamaciones

Se presentó una reclamación para su corrección solo cuando el modelo NLI clasificó el par reclamación-referencia como una contradicción, y su puntuación de verificación firmada correspondiente cumplía con el criterio del umbral adaptativo si ≤ -τ. Por lo tanto, la decisión de corrección se determinó conjuntamente mediante la etiqueta de clase NLI y el umbral estadístico específico de la respuesta. Las reclamaciones clasificadas como implicación con si ≥ τ se aceptaron, mientras que las reclamaciones que caían dentro del intervalo -τ < si < τ se consideraron neutrales y se mantuvieron sin corrección. Este criterio combinado aseguró que la corrección se aplicara únicamente a las reclamaciones que mostraban tanto contradicción semántica como evidencia de verificación negativa suficientemente fuerte.

Reconstrucción de la respuesta

Las afirmaciones aceptadas y corregidas se organizaron en su secuencia original. Se restablecieron los límites de las oraciones para mantener la legibilidad. Se realizaron ajustes gramaticales menores cuando fue necesario. La salida ensamblada se almacenó como la respuesta final verificada.

Evaluación del rendimiento

El marco se evaluó utilizando cuatro métricas: (1) Precisión: la proporción de respuestas que permanecieron factualmente correctas tras la verificación; (2) Puntaje F1: la media armónica entre la precisión y la exhaustividad (recall) en la detección de alucinaciones; (3) Latencia de la respuesta: el tiempo total de procesamiento desde el envío de la consulta hasta la generación de la respuesta verificada; (4) Tasa de alucinaciones

figure-protocol-2

La latencia se informó como el tiempo medio de ejecución en mediciones repetidas. Debido a que no se conservaron los valores individuales de latencia por ejecución, no se calcularon las desviaciones estándar ni los intervalos de confianza.

Evaluación de la corrección específica del conjunto de pruebas

Para TruthfulQA, la respuesta final verificada se comparó con las referencias de respuestas validadas por humanos del conjunto de referencia y con las listas de respuestas incorrectas. Se consideró correcta una respuesta cuando sus afirmaciones fácticas eran coherentes con la información de la respuesta aceptada y no contenía contenido correspondiente a los patrones identificados de respuestas incorrectas. Para FEVER, cada afirmación en la salida final se evaluó en comparación con su evidencia asociada y la anotación original de FEVER; las afirmaciones respaldadas se consideraron verificadas fácticamente, mientras que las refutadas se contabilizaron como incorrectas. Los casos de No hay suficiente información se mantuvieron como indeterminados, en lugar de considerarlos como evidencia fáctica positiva. Las decisiones resultantes a nivel de afirmación se agruparon en cada conjunto de referencia para calcular la Precisión y la Tasa de Alucinaciones informadas.

Ambiente experimental

El marco fue implementado utilizando Python 3.9. Las operaciones de procesamiento de datos se realizaron usando bibliotecas de análisis numérico y tabular. El modelo NLI operó en modo de inferencia sin ajuste fino adicional. Los experimentos se ejecutaron en una estación de trabajo equipada con un procesador Intel Core i5, 16 GB de RAM y un sistema operativo de 64 bits. Todas las evaluaciones se realizaron utilizando una configuración de inferencia de un solo paso para garantizar un funcionamiento de baja latencia. Todos los experimentos se llevaron a cabo utilizando configuraciones idénticas de hardware y software para asegurar una evaluación consistente entre conjuntos de datos y métodos de referencia.

Resultado esperado

El protocolo está diseñado para generar decisiones de verificación a nivel de afirmación identificando afirmaciones potencialmente no respaldadas y reenviando selectivamente las afirmaciones fuertemente contradichas para su corrección. La salida esperada es una respuesta verificada con inconsistencias factuales reducidas y una sobrecarga de procesamiento adicional limitada, sujeta al rendimiento observado durante la evaluación experimental.

Resultados

Generación de la respuesta inicial

El modelo de lenguaje de referencia generó respuestas fluidas y contextualmente relevantes para preguntas de ambos conjuntos de datos de referencia. Sin embargo, un examen detallado reveló afirmaciones infundadas e inexactas desde el punto de vista factual en varias respuestas. En el conjunto de datos TruthfulQA, el sistema de referencia presentó una tasa de alucinaciones del 28 %, mientras que se observó una tasa de alucinaciones del 26 % en el conjunto de datos FEVER. Estos hallazgos confirmaron que la generación directa de lenguaje por sí sola era insuficiente para aplicaciones que requieren alta fiabilidad factual, y establecieron la condición de referencia frente a la cual se compararon todos los procedimientos posteriores de verificación.

Extracción de afirmaciones

El procedimiento de extracción de afirmaciones descompuso con éxito las respuestas generadas en unidades factuales independientemente verificables. Las respuestas de TruthfulQA contenían un promedio de 3,2 afirmaciones atómicas, mientras que las muestras de FEVER generalmente consistían en una sola afirmación. El proceso de descomposición aisló las afirmaciones factuales sin introducir información adicional, permitiendo que cada enunciado fuera evaluado por separado. Esta observación respaldó la hipótesis de que la verificación a nivel de afirmación ofrece una mayor precisión que evaluar respuestas completas como una única unidad.

Construcción de referencias independientes

Se generaron referencias independientes para cada afirmación extraída mediante un proceso de razonamiento separado, condicionado únicamente a la consulta original. Las referencias generadas proporcionaron descripciones factuales concisas que eran suficientemente distintas de las respuestas originales para servir como fuentes de verificación independientes. El proceso de generación de referencias se mantuvo aislado de la respuesta inicial para evitar condicionar directamente la referencia factual a la salida previa del modelo. Esta separación tenía como objetivo reducir el posible sesgo de confirmación y proporcionar una base controlada para la verificación posterior a nivel de afirmación; el estudio no cuantifica de forma independiente la magnitud de este efecto. La generación exitosa de referencias independientes respaldó el principio de diseño propuesto de separar la recuperación del conocimiento de la generación de respuestas.

Verificación de inferencia del lenguaje natural

La etapa de verificación de NLI clasificó eficazmente los pares afirmación-referencia en categorías de implicación, contradicción y neutralidad. Las afirmaciones contradictorias recibieron consistentemente puntuaciones negativas de verificación, mientras que las afirmaciones respaldadas fácticamente obtuvieron puntuaciones positivas. Las clasificaciones neutrales se asignaron a aquellas afirmaciones para las cuales no había evidencia de apoyo suficiente. Este comportamiento demostró que la inferencia semántica podía identificar de manera confiable afirmaciones fácticas no respaldadas y proporcionar la evidencia necesaria para su corrección específica. En comparación con una estrategia simple de verificación de consistencia, la verificación mediante NLI redujo la tasa de alucinaciones del 20 % al 15 %, lo que indica una mayor capacidad de detección.

Umbralización estadística adaptativa

La aplicación del umbral estadístico adaptativo mejoró aún más el rendimiento de verificación mediante el ajuste dinámico de los límites de decisión basado en la distribución de las puntuaciones de confianza de cada respuesta. El análisis de sensibilidad del umbral demostró que el rendimiento mejoró cuando el parámetro del umbral aumentó de 0,3 a 0,7. Con un valor de sensibilidad de 0,7, el marco alcanzó una precisión de 0,87 mientras reducía las alucinaciones al 9 % (Figura 2). Los resultados completos del análisis de sensibilidad para los valores evaluados de k se proporcionan en la Tabla Suplementaria 2. Aumentar el umbral más allá de este punto produjo solo mejoras menores en precisión, mientras incrementaba la latencia. Estas observaciones respaldaron la hipótesis de que los umbrales adaptativos son más efectivos que los límites de decisión fijos para manejar distribuciones variables de confianza entre las respuestas.

El umbral adaptativo también refleja la variabilidad de las puntuaciones de confianza dentro de cada respuesta. Las respuestas con puntuaciones de verificación altamente consistentes producen una desviación estándar más pequeña, lo que da lugar a un límite de decisión más selectivo. En contraste, las respuestas que contienen afirmaciones con valores de confianza heterogéneos generan una desviación estándar mayor, lo que conduce a una región de aceptación más amplia y reduce las correcciones innecesarias para afirmaciones inciertas. Aunque este comportamiento adaptativo no puede eliminar todos los falsos positivos o falsos negativos, permite que el límite de decisión responda a las características de incertidumbre de cada respuesta, en lugar de aplicar un criterio uniforme a todas las entradas.

Corrección selectiva de reclamaciones y ensamblaje de respuestas

Solo se presentaron para corrección las afirmaciones identificadas como contradictorias, mientras que las afirmaciones respaldadas y neutrales se mantuvieron sin cambios. Esta estrategia selectiva de corrección minimizó la regeneración innecesaria y preservó la estructura original de la respuesta. Tras la corrección y la reconstrucción de la respuesta, la tasa de alucinaciones en TruthfulQA disminuyó del 28 % al 9 %, lo que representa una reducción relativa del 67,9 %. Se observaron mejoras similares en FEVER, donde las alucinaciones disminuyeron del 26 % al 10 %. Las comparaciones de precisión y tasas de alucinación entre las configuraciones evaluadas se presentan en las Figuras 3 y 4, respectivamente.

Evaluación del rendimiento

La evaluación comparativa mostró que el marco propuesto alcanzó el rendimiento general más alto entre todos los métodos probados. En TruthfulQA, el marco logró una precisión de 0,87 y una puntuación F1 de 0,85, superando tanto a la verificación con umbral fijo como a los enfoques basados en autoconsistencia (Tabla 2, Figuras 3 y 4). En FEVER, el marco alcanzó una precisión de 0,89 y una puntuación F1 de 0,87 (Tabla 3, Figuras 3 y 4). La contribución incremental de los componentes del marco se examina mediante el análisis de ablación presentado en la Tabla 4. Estas mejoras confirmaron que combinar la verificación a nivel de afirmación con una toma de decisiones estadística adaptativa aumentó la fiabilidad factual en múltiples conjuntos de datos. La precisión en la detección de alucinaciones para SelfCheckGPT, FActScore y el marco propuesto se compara en la Figura 5.

Análisis de latencia

La canalización completa de verificación mantuvo un bajo costo computacional. El tiempo medio de respuesta aumentó de 820 ms para el modelo de referencia a 980 ms para el marco completo, lo que representa un incremento moderado en el tiempo de procesamiento (Tabla 5). La generación de respuestas representó la mayor parte de la latencia total, mientras que las etapas de verificación y corrección aportaron relativamente poca sobrecarga adicional. En el cuadro suplementario 3 se proporciona el desglose del tiempo de procesamiento por etapa. En comparación con los sistemas de verificación basados en recuperación, que requerían aproximadamente 1600 ms por consulta, el marco propuesto logró una latencia sustancialmente menor manteniendo una precisión factual comparable. Estos hallazgos respaldaron la hipótesis de que la reducción de alucinaciones puede lograrse sin sacrificar la usabilidad en tiempo real.

Dado que la generación de respuestas depende de un modelo de lenguaje basado en la nube, las mediciones individuales de latencia están sujetas a fluctuaciones debidas a las condiciones de la red y la planificación del lado del servidor, más que a un tiempo de ejecución determinista. Por lo tanto, se utilizaron mediciones repetidas para obtener valores promedio representativos, reduciendo la influencia de la variabilidad transitoria en la ejecución, al tiempo que se preservan las comparaciones relativas entre los métodos evaluados. Los valores de latencia se reportan como tiempos medios de ejecución a lo largo de ejecuciones experimentales repetidas. No se conservaron los valores individuales de latencia por ejecución; por consiguiente, no fue posible el cálculo a posteriori de varianza, intervalos de confianza u otras medidas de variabilidad. En consecuencia, los valores de latencia y la comparación entre velocidad y precisión en la Figura 6 se presentan como estimaciones puntuales sin barras de error.

Para concluir, los resultados demostraron que combinar la extracción de afirmaciones, la generación independiente de referencias, la verificación mediante inferencia del lenguaje natural, el umbral estadístico adaptativo y la corrección selectiva mejoró la confiabilidad factual de las salidas de modelos grandes de lenguaje. El marco redujo la tasa de alucinaciones del 28 % al 9 % en TruthfulQA y del 26 % al 10 % en FEVER. Los resultados indican que la verificación adaptativa a nivel de afirmación mejoró las métricas de confiabilidad factual, limitando al mismo tiempo el aumento adicional de latencia de respuesta bajo las condiciones evaluadas.

Disponibilidad de datos

Los conjuntos de datos analizados en este estudio están disponibles públicamente a través de sus fuentes oficiales respectivas. El manuscrito proporciona la información sobre los conjuntos de datos, las configuraciones del modelo y los detalles metodológicos necesarios para respaldar la replicación de los análisis descritos. Los datos procesados para la evaluación y los resultados complementarios generados durante el estudio se incluyen en los Archivos Suplementarios.

figure-results-1
Figura 1: Flujo de trabajo del marco adaptativo de verificación de afirmaciones. Una respuesta inicial generada por un modelo lingüístico grande (LLM) se descompone en afirmaciones factuales, seguida de la generación independiente de referencias, verificación basada en inferencia lingüística natural (NLI), puntuación de confianza y umbralización estadística. Las afirmaciones que cumplen con el criterio de aceptación se conservan, mientras que las afirmaciones que cumplen con el criterio de corrección pasan por una corrección específica antes del ensamblaje final de la respuesta. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-2
Figura 2: Efecto del parámetro de sensibilidad (k) sobre la precisión de la verificación. Precisión en TruthfulQA y FEVER en valores de k de 0,3, 0,5, 0,7 y 1,0. La precisión aumentó con k en ambos conjuntos de datos, con k = 0,7 seleccionado para la evaluación primaria. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-3
Figura 3: Comparación de precisión entre métodos de verificación. Precisión del modelo de lenguaje base, la verificación basada en inferencia natural (NLI) y el marco de verificación adaptativa propuesto en TruthfulQA y FEVER. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-4
Figura 4: Comparación de la tasa de alucinaciones entre métodos de verificación. Tasas de alucinaciones para el modelo de lenguaje de referencia, la verificación basada en inferencia natural y el marco propuesto en TruthfulQA y FEVER. El marco propuesto redujo la tasa del 28 % al 9 % en TruthfulQA y del 26 % al 10 % en FEVER. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-5
Figura 5: Precisión en la detección de alucinaciones entre diferentes métodos. Precisión de detección de SelfCheckGPT, FActScore y el marco propuesto en los conjuntos de datos TruthfulQA y FEVER. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-6
Figura 6: Compromiso entre tiempo de respuesta y precisión en los distintos métodos de verificación. Relación entre la latencia de respuesta y la precisión para los métodos evaluados en TruthfulQA y FEVER, que ilustra el compromiso entre rendimiento y latencia asociado con el marco propuesto y los enfoques comparadores. Haga clic aquí para ver una versión más grande de esta figura.

Conjunto de datosMuestras utilizadasDominiosLongitud promedio de la respuesta (tokens)Tasa de alucinación del LLM de referencia
TruthfulQA81738 (ciencia, historia, derecho, etc.)4228%
FEVER1.000Afirmaciones factuales generales1826%

Tabla 1: Características del conjunto de datos de referencia. Resumen de los conjuntos de datos TruthfulQA y FEVER utilizados para el desarrollo y evaluación del marco, que incluye el número de muestras, la precisión de referencia, la tasa de alucinación de referencia y el número promedio de afirmaciones por muestra.

MétodoPrecisiónExactitudRecuperaciónPuntuación F1Porcentaje de alucinaciones
Modelo de lenguaje base (inferencia única)0.720.710.690.728%
Verificación basada en inferencia natural (umbral fijo)0.820.8150.7850.815%
SelfCheckGPT0.760.7550.7250.7422%
FActScore0.850.84250.81750.8311%
Marco propuesto (umbral estadístico)0.870.860.840.859%

Tabla 2: Comparación de rendimiento en TruthfulQA. Precisión, exactitud, recuperación, puntuación F1 y tasa de alucinaciones para el modelo de lenguaje de referencia, SelfCheckGPT, FActScore, verificación NLI y el marco propuesto.

MétodoPrecisiónExactitudRecuperaciónPuntuación F1Porcentaje de alucinaciones
SelfCheckGPT0.78
FActScore0.87
Modelo base de lenguaje†0.740.730.710.7226%
Verificación basada en inferencia natural (umbral fijo)0.830.82250.79750.8114%
Marco propuesto (umbral estadístico)0.890.87750.86250.8710%

Tabla 3: Comparación de rendimiento en FEVER. Precisión, exactitud, recuperación, puntuación F1 y tasa de alucinaciones para el modelo LLM de referencia, SelfCheckGPT, FActScore, verificación NLI y el marco propuesto.

ConfiguraciónPrecisiónExactitudRecuperaciónF1 (agregada)Tasa de alucinación
Modelo de lenguaje de referencia0.720.710.690.728%
Referencia + verificación secundaria (sin NLI)0.780.77250.74750.76*20%
Referencia + verificación basada en NLI (umbral fijo)0.820.8150.7850.815%
Referencia + módulo estadístico de decisión (completo)0.870.860.840.859%

Tabla 4: Análisis de ablación de los componentes del marco. Cambios en la precisión, la puntuación F1 y la tasa de alucinación tras la incorporación secuencial de la validación secundaria, la verificación NLI y el umbral estadístico adaptativo.

MétodoTiempo medio de respuesta (ms)
LLM de referencia (generación única)820
Mecanismo de autovalidación910
Marco estadístico propuesto980
Verificación aumentada con recuperación (RAG)1600

Tabla 5: Latencia de respuesta entre los métodos de verificación. Tiempo medio de respuesta y latencia adicional en comparación con el LLM de referencia para la autovalidación, el marco propuesto y la verificación aumentada por recuperación.

Tabla suplementaria 1: Comparación de enfoques de verificación de alucinaciones. Comparación del marco propuesto con métodos existentes en cuanto a recuperación externa, verificación a nivel de afirmación, umbral adaptativo y procesamiento eficiente en latencia.Haga clic aquí para descargar este archivo.

Tabla suplementaria 2: Análisis de sensibilidad del parámetro umbral (k). Se obtuvieron la exactitud, precisión, recuperación, puntuación F1 y la tasa de alucinaciones para valores del parámetro umbral de 0.3, 0.5, 0.7 y 1.0. Se utilizó un valor de k = 0.7 para la evaluación principal.Haga clic aquí para descargar este archivo.

Tabla suplementaria 3: Tiempo de procesamiento en las distintas etapas del proceso de verificación. Tiempo medio de ejecución y contribución porcentual de la generación inicial de respuestas, descomposición de afirmaciones, generación de referencias, inferencia NLI y corrección selectiva al tiempo total de respuesta.Haga clic aquí para descargar este archivo.

Tabla suplementaria 4: Distribución de errores identificados durante la verificación. Número y porcentaje de falsos negativos, falsos positivos y errores de corrección, junto con las categorías principales de alucinaciones asociadas a cada tipo de error.Haga clic aquí para descargar este archivo.

Discusión

El marco propuesto mejoró el desempeño en la verificación de hechos, evitando al mismo tiempo el muestreo repetido y la recuperación externa. En TruthfulQA, la tasa de alucinaciones disminuyó del 28 % en el modelo LLM de referencia al 9 % con el marco completo, mientras que la precisión aumentó de 0,72 a 0,87. En FEVER, la tasa de alucinaciones bajó del 26 % al 10 %, con un aumento en la precisión de 0,74 a 0,89. Estas comparaciones deben interpretarse dentro de los contextos experimentales y las implementaciones utilizadas en este estudio, y no como evidencia de una superioridad universal en distintas condiciones de implementación. El marco realiza una verificación a nivel de afirmaciones tras la generación, utilizando una referencia factual aislada y una corrección selectiva, lo que establece un equilibrio entre el anclaje en conocimiento externo, la inferencia repetida y la verificación ligera tras la generación. Los generadores de respuestas y de referencias utilizan el mismo modelo subyacente GPT-3.5 Turbo, pero operan bajo objetivos de indicación diferentes y en contextos de ejecución aislados. El generador de referencias recibe únicamente la consulta original y no accede a la respuesta generada previamente. Por lo tanto, los dos procesos de generación son independientes desde un punto de vista procedural, pero no estadísticamente, y podrían conservar sesgos factuales correlacionados originados en su modelo previamente entrenado compartido.

Comparación con los enfoques existentes

La línea base de NLI con umbral fijo aplica un umbral de confianza de 0,7 basado en trabajos previos sobre verificación de facticidad basada en NLI14. SelfCheckGPT15 representa un enfoque de detección de alucinaciones sin recursos previos que genera múltiples muestras estocásticas y utiliza NLI para identificar afirmaciones inconsistentes. FActScore16 descompone las respuestas generadas en hechos atómicos y los verifica frente a referencias recuperadas de una fuente de conocimiento basada en Wikipedia. En contraste, el marco propuesto realiza verificación a nivel de afirmación sin necesidad de generar repetidamente toda la respuesta ni de realizar recuperación externa.

DoLA es un enfoque ligero complementario que mejora la generación de hechos contrastando las probabilidades de los tokens derivadas de diferentes capas del transformador durante la inferencia. No se incluyó una comparación experimental directa porque DoLA modifica el proceso de generación de tokens, mientras que el marco propuesto realiza una verificación y corrección selectiva a nivel de afirmación tras la generación. La implementación de DoLA requeriría acceso a representaciones internas de las capas del transformador, las cuales no están disponibles en la API de GPT-3.5 Turbo utilizada en este estudio. La ausencia de recuperación externa reduce la dependencia de recuperación y los requisitos de procesamiento asociados, pero también limita la verificación al conocimiento disponible para los modelos subyacentes. Por consiguiente, las invenciones completas o afirmaciones especializadas fuera del alcance del conocimiento del verificador siguen siendo difíciles de corregir.

Umbralización estadística adaptativa y corrección selectiva

El umbral adaptativo se deriva de la distribución empírica de puntuaciones de confianza y controla el equilibrio entre la recuperación en la detección de alucinaciones y la precisión en la corrección. Un análisis de sensibilidad evaluó los valores de 0,3, 0,5, 0,7 y 1,0 en una división de validación de TruthfulQA reservada. Un valor de k = 0,7 proporcionó el equilibrio más equilibrado entre la reducción de alucinaciones y la eficiencia computacional para los puntos de referencia evaluados.

El umbral óptimo puede variar entre dominios de aplicación porque la distribución de las puntuaciones de confianza del NLI depende de la naturaleza del contenido generado. Para aplicar esto a un nuevo dominio, se puede utilizar un conjunto de validación que refleje la aplicación objetivo con el fin de evaluar valores candidatos y seleccionar un valor que equilibre el rendimiento en la verificación de hechos, la tasa de corrección y la latencia de procesamiento. Dado que la optimización del umbral implica un único parámetro escalar y no el reentrenamiento de los modelos, la adaptación no requiere modificar los modelos subyacentes.

La corrección selectiva restringe la regeneración a afirmaciones clasificadas como Contradicción y que cumplen el criterio del umbral estadístico. Esto evita el procesamiento repetido de afirmaciones que no cumplen con el criterio de corrección y distingue el marco de los enfoques de remuestreo de respuesta completa y refinamiento iterativo.

Compromiso entre latencia y rendimiento

El marco propuesto logró un tiempo medio de respuesta de 980 ms en comparación con 820 ms para el modelo de lenguaje base y 1600 ms para la verificación aumentada por recuperación. El análisis por etapas mostró que la generación inicial de la respuesta representó el 83,7 % de la latencia total, mientras que la inferencia NLI contribuyó con el 3,9 % y la corrección selectiva contribuyó menos del 1 % en promedio. Los valores de latencia se informan como tiempos medios de ejecución a lo largo de múltiples ejecuciones experimentales repetidas. No se conservaron los valores individuales de latencia por ejecución; por lo tanto, no fue posible el cálculo a posteriori de la varianza, intervalos de confianza u otras medidas de variabilidad. En consecuencia, los valores de latencia y la comparación velocidad–precisión se presentan como estimaciones puntuales sin barras de error. Los valores de latencia informados reflejan el entorno experimental utilizado en este estudio y pueden variar bajo condiciones diferentes de implementación, especialmente cuando se emplean API de modelos de lenguaje basados en la nube. La latencia de red, la carga del servidor y la disponibilidad del servicio pueden influir independientemente en los tiempos absolutos de respuesta, independientemente del marco de verificación propuesto.

Análisis de errores

Las afirmaciones gestionadas incorrectamente en el conjunto de pruebas TruthfulQA se clasificaron como falsos negativos, falsos positivos o errores de corrección. La distribución y las categorías principales de estos errores se resumen en la Tabla Suplementaria 4. Los falsos negativos representaron el 52,6 % de todos los errores y estuvieron principalmente asociados con alucinaciones temporales y sustituciones factuales sutiles. Es posible que se pasen por alto errores temporales cuando el verificador comparte el límite de entrenamiento del modelo base, mientras que las sustituciones factuales sutiles pueden obtener puntuaciones NLI en la banda Neutral en lugar de Contradicción.

Los falsos positivos representaron el 35,9 % de los errores y ocurrieron principalmente en hechos poco comunes, altamente específicos o recientemente establecidos, fuera del alcance de conocimiento de alta confianza del modelo verificador. Estos casos produjeron puntuaciones débiles de implicación en el NLI, a pesar de que las afirmaciones eran factualmente correctas. Los errores de corrección representaron el 11,5 % de todos los errores y ocurrieron cuando se identificaron fabricaciones completas, pero el proceso de corrección generó otra afirmación inexacta debido a la cobertura insuficiente del conocimiento del verificador.

Estos hallazgos indican que los errores residuales surgen tanto de la discriminación NLI como de la cobertura del conocimiento del verificador, particularmente en lo referente a inexactitudes temporales, sustituciones factuales sutiles, hechos poco comunes y fabricaciones completas.

Análisis estadístico

La tasa de alucinaciones disminuyó del 15 % con la verificación NLI de umbral fijo al 9 % con el marco estadístico propuesto, mientras que el marco completo redujo la tasa del 28 % del sistema básico al 9 % en TruthfulQA. Estas diferencias se presentan como cambios descriptivos en el rendimiento, y no se afirma una significancia estadística formal, ya que la evaluación actual no incluye los resultados de pruebas estadísticas ni las estimaciones del tamaño del efecto necesarias para respaldar dicha inferencia17,18.

Limitaciones

El rendimiento de verificación del marco está limitado por la capacidad del modelo subyacente de NLI. Es posible que DeBERTa-v3-large tenga dificultades con comparaciones numéricas finas, razonamiento temporal y afirmaciones que requieran inferencia de múltiples pasos a través de varios hechos. Las limitaciones del modelo de NLI también se asociaron con falsos negativos que implican sustituciones factuales sutiles, y las debilidades sistemáticas en el modelo de NLI pueden propagarse hacia las decisiones de verificación.

Los generadores de respuesta y de referencia utilizan el mismo modelo subyacente GPT-3.5 Turbo. Aunque diferentes objetivos de estimulación y contextos de ejecución aislados proporcionan independencia procedural, los dos procesos no son estadísticamente independientes y pueden conservar sesgos factuales correlacionados provenientes de su modelo previamente entrenado compartido.

La combinación evaluador-verificador representa una limitación adicional. La evaluación final de alucinaciones utiliza el mismo modelo de inferencia natural del lenguaje (NLI) que verifica las afirmaciones dentro del flujo de trabajo propuesto. Esto podría introducir un acuerdo entre el verificador y el evaluador e influir en la mejora medida. Por lo tanto, los resultados informados deben interpretarse como un desempeño bajo el procedimiento de evaluación basado en NLI definido, y no como evidencia completamente independiente de una reducción de alucinaciones. Una evaluación humana independiente o un modelo de evaluación desarrollado por separado proporcionaría una validación más sólida.

La etapa de descomposición de afirmaciones se evaluó únicamente por su contribución a la verificación de extremo a extremo y no se analizó de forma independiente frente a los límites de afirmaciones anotados por humanos. En consecuencia, el estudio no proporciona una estimación cuantitativa separada de la precisión de la descomposición ni de su propagación individual de errores hacia la verificación posterior.

La evaluación se limitó a TruthfulQA y FEVER, y al contenido en inglés. Por lo tanto, el rendimiento observado no establece una generalización a dominios especializados, entornos multilingües ni a la generación de textos largos. El valor óptimo de k también puede variar entre dominios de aplicación, ya que las distribuciones de las puntuaciones de confianza en la inferencia lingüística natural (NLI) dependen de la naturaleza del contenido generado. Por consiguiente, se requiere una calibración específica del dominio y una evaluación más amplia antes de extender los hallazgos más allá de las condiciones evaluadas en este estudio.

Finalmente, las mediciones de latencia son específicas para la configuración experimental y pueden variar entre entornos de ejecución. Dado que no se conservaron las mediciones individuales por ejecución, no fue posible estimar la variabilidad ni los intervalos de confianza a posteriori. En evaluaciones futuras se deberían conservar las mediciones individuales e incluir una caracterización estadística más amplia de la latencia en distintos entornos de ejecución.

Trabajos futuros

Los estudios futuros deben abordar las limitaciones principales identificadas en el marco actual. Se requiere una calibración del umbral sensible al dominio, ya que el valor fijo (k = 0.7) seleccionado mediante TruthfulQA podría no ser óptimo para dominios especializados con distribuciones diferentes de puntuaciones de confianza en la inferencia lingüística natural. Podrían utilizarse datos de validación específicos del dominio para calibrar el umbral y, cuando sea necesario, aplicar penalizaciones asimétricas por errores de falso negativo y falso positivo19.

La descomposición mejorada de afirmaciones debería incluir una evaluación independiente utilizando límites de afirmaciones anotados por humanos para cuantificar la completitud, la corrección y la propagación de errores en etapas posteriores. Los modelos de descomposición ajustados finamente y las medidas de confianza en la descomposición podrían reducir aún más los errores derivados de afirmaciones mal segmentadas. Las evaluaciones comparativas futuras también deberían incluir enfoques ligeros basados en decodificación, como DoLA, bajo un protocolo experimental unificado.

La ampliación ligera de recuperación podría ayudar a abordar las fabricaciones completas, que siguen siendo difíciles cuando el verificador carece de conocimientos factuales suficientes. Un sistema de recuperación selectivo como respaldo para afirmaciones contradictorias con baja confianza podría proporcionar apoyo factual externo sin requerir la recuperación para cada afirmación20.

También se requiere una extensión multilingüe porque la evaluación actual está limitada a referencias en inglés3. Los estudios futuros deben evaluar modelos multilingües de inferencia lingüística natural y prompts específicos del idioma para descomposición y corrección de afirmaciones en referencias multilingües de alucinaciones.

Conclusión

Este estudio presentó un marco de verificación de afirmaciones en dos pasos que combina la descomposición en afirmaciones atómicas, la generación separada de referencias factuales mediante indicaciones específicas, la verificación mediante inferencia lingüística natural (NLI), el umbral estadístico adaptativo y la corrección selectiva. En TruthfulQA, el marco redujo la tasa de alucinaciones del 28 % al 9 %, aumentando la latencia media en 160 ms respecto al modelo de lenguaje base. En FEVER, la tasa de alucinaciones disminuyó del 26 % al 10 %.

El marco propuesto logró un rendimiento competitivo en la verificación de hechos sin muestreo repetido de respuestas completas ni recuperación externa. La umbralización adaptativa y la corrección selectiva contribuyeron al rendimiento observado, al tiempo que limitaron el sobrecoste adicional de procesamiento. Sin embargo, los hallazgos están restringidos a los bancos de pruebas evaluados y a las condiciones experimentales, y siguen estando sujetos a la dependencia del modelo de inferencia natural (NLI), el acoplamiento entre evaluador y verificador, la incertidumbre en la descomposición de afirmaciones, la calibración de umbrales específica por dominio y la variabilidad en la latencia. Por tanto, se requiere una evaluación más amplia, independiente, específica por dominio y multilingüe antes de extender los hallazgos a entornos de despliegue más generales.

Divulgaciones

Los autores no tienen conflictos de intereses que declarar.

Agradecimientos

Los autores desean expresar su sincera gratitud a su institución por proporcionar el entorno académico y los recursos computacionales necesarios para llevar a cabo esta investigación. Los autores también reconocen a los desarrolladores y mantenedores de los conjuntos de datos de referencia públicos utilizados en este estudio, que permitieron una evaluación integral del marco propuesto. Se agradece a colegas y revisores sus comentarios constructivos, que ayudaron a mejorar la calidad y claridad de este trabajo. Los autores reconocen además a la comunidad de investigación de código abierto por proporcionar las bibliotecas y herramientas de software que facilitaron la experimentación, el análisis de datos y la visualización de resultados. Sus esfuerzos continuos han avanzado significativamente la investigación en procesamiento del lenguaje natural e inteligencia artificial confiable. Los autores declaran que no recibieron apoyo financiero externo ni fondos para esta investigación.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Conjunto de datos de referencia FEVERTarea compartida FEVER (Thorne et al.)https://fever.ai/dataset/fever.htmlConjunto de datos público de verificación de hechos compuesto por pares de afirmaciones y evidencias, utilizado para evaluación
GPT-3.5 Turbo (modelo lingüístico grande B10+2:12:12OpenAIIdentificación del modelo: gpt-3.5-turbo; https://developers.openai.com/api/docs/models/gpt-3.5-turboUtilizado tanto como generador de respuestas como generador de referencias independiente, accedido mediante la API de OpenAI
NumPyDesarrolladores de NumPy (código abierto)https://numpy.org/Biblioteca de cálculo numérico utilizada para cálculos estadísticos, incluyendo la media y la desviación estándar de las puntuaciones de verificación NLI
Openai (biblioteca cliente de Python)OpenAIhttps://github.com/openai/openai-pythonBiblioteca cliente de Python utilizada para enviar indicaciones y recuperar respuestas de GPT-3.5 Turbo
pandasEquipo de desarrollo de pandas (código abierto)https://pandas.pydata.org/Biblioteca de análisis de datos tabulares utilizada para el preprocesamiento de conjuntos de datos y el manejo de resultados
Modelo de clasificación preentrenado de Inferencia del Lenguaje Natural (NLI)Repositorio de modelos de Hugging Face (modelo basado en la arquitectura DeBERTa-v3-large de Microsoft)MoritzLaurer/DeBERTa-v3-large-mnli-fever-anli-ling-wanliUtilizado en modo inferencia, sin ajuste fino, para clasificar cada par afirmación-referencia como implicación, neutralidad o contradicción
PythonPython Software FoundationVersión 3.9; https://www.python.org/downloads/release/python-390/Lenguaje de programación principal utilizado para implementar el marco de verificación
SciPyDesarrolladores de SciPy (código abierto)https://scipy.org/Biblioteca de computación científica utilizada para apoyar el análisis estadístico de los resultados experimentales
Transformers (biblioteca Hugging Face Transformers)Hugging Facehttps://github.com/huggingface/transformersBiblioteca de Python utilizada para cargar y ejecutar el modelo NLI preentrenado
Conjunto de datos de referencia TruthfulQAOriginalmente publicado por Lin, Hilton y Evanshttps://github.com/sylinrl/TruthfulQAConjunto de datos de referencia público compuesto por 817 preguntas orientadas a hechos, utilizado para ajuste de umbrales y evaluación
Computadora de estación de trabajoNo especificado en el manuscrito (por favor confirme el fabricante/modelo)Procesador Intel Core i5; 16 GB de RAM; sistema operativo de 64 bitsHardware utilizado para ejecutar todos los experimentos bajo configuraciones idénticas
Nota: Todas las URL enumeradas anteriormente fueron verificadas y confirmadas como activas a la fecha de elaboración de esta tabla. 

Referencias

  1. Dai Z, et al. Promptagator: Few-shot dense retrieval from 8 examples [conference presentation]. Presented at: The Eleventh International Conference on Learning Representations; 2022. [https://iclr.cc/virtual/2023/poster/10937]
  2. Achiam J, et al. GPT-4 technical report. arXiv. 2023;arXiv:2303.08774. [https://arxiv.org/abs/2303.08774]
  3. Ji Z, et al. Survey of hallucination in natural language generation. ACM Comput Surv. 2023;55(12):1-38.
  4. Bender EM, McMillan-Major A, Shmitchell S, Gebru T. On the dangers of stochastic parrots: Can language models be too big? [conference presentation]. Presented at: 2021 ACM Conference on Fairness, Accountability, and Transparency; 2021. [https://dl.acm.org/doi/10.1145/3442188.3445922]
  5. Devlin J, et al. BERT: Pre-training of deep bidirectional transformers for language understanding [conference presentation]. Presented at: 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; 2019. [https://arxiv.org/abs/1810.04805]
  6. Maynez J, Narayan S, Bohnet B, McDonald R. On faithfulness and factuality in abstractive summarization [conference presentation]. Presented at: 58th Annual Meeting of the Association for Computational Linguistics; 2020. [https://arxiv.org/abs/2005.00661]
  7. Brown T, et al. Language models are few-shot learners. Adv Neural Inf Process Syst. 2020;33:1877-901.
  8. Guu K, et al. Retrieval augmented language model pre-training [conference presentation]. Presented at: International Conference on Machine Learning; 2020. [https://arxiv.org/abs/2002.08909]
  9. Izacard G, Grave E. Leveraging passage retrieval with generative models for open domain question answering [conference presentation]. Presented at: 16th Conference of the European Chapter of the Association for Computational Linguistics; 2021. [https://arxiv.org/abs/2007.01282]
  10. Bowman SR, Angeli G, Potts C, Manning CD. A large annotated corpus for learning natural language inference [conference presentation]. Presented at: 2015 Conference on Empirical Methods in Natural Language Processing; 2015. [https://arxiv.org/abs/1508.05326]
  11. Platt J. Probabilistic outputs for support vector machines and comparisons to regularized likelihood methods. Adv Large Margin Classif. 1999;10(3):61-74.
  12. Lin S, Hilton J, Evans O. Truthfulqa: Measuring how models mimic human falsehoods. InProceedings of the 60th annual meeting of the association for computational linguistics (volume 1: long papers) 2022 May (pp. 3214-3252).
  13. Thorne J, Vlachos A, Christodoulopoulos C, Mittal A. FEVER: A large-scale dataset for fact extraction and verification [conference presentation]. Presented at: 2018 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; 2018. [https://aclanthology.org/N18-1074/]
  14. Williams A, Nangia N, Bowman SR. A broad-coverage challenge corpus for sentence understanding through inference. arXiv. 2017;arXiv:1704.05426.
  15. Manakul P, Liusie A, Gales M. SelfCheckGPT: Zero-resource black-box hallucination detection for generative large language models [conference presentation]. Presented at: 2023 Conference on Empirical Methods in Natural Language Processing; 2023.
  16. Min S, et al. FActScore: Fine-grained atomic evaluation of factual precision in long-form text generation. arXiv. 2023;arXiv:2305.14251.
  17. Cohen J. Statistical power analysis for the behavioral sciences. Routledge; New York; 2013.
  18. Kadavath S, et al. Language models (mostly) know what they know. arXiv. 2022;arXiv:2207.05221.
  19. Hendrycks D, et al. Aligning AI with shared human values. arXiv. 2020;arXiv:2008.02275.
  20. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-74.

Reimpresiones y permisos

Etiquetas

Inferencia de lenguaje naturalrecuperaci n de hechosumbral adaptativoverificaci n de baja latenciabanco de pruebas TruthfulQASelfCheckGPT
Video próximamente