Generación de la respuesta inicial
El modelo de lenguaje de referencia generó respuestas fluidas y contextualmente relevantes para preguntas de ambos conjuntos de datos de referencia. Sin embargo, un examen detallado reveló afirmaciones infundadas e inexactas desde el punto de vista factual en varias respuestas. En el conjunto de datos TruthfulQA, el sistema de referencia presentó una tasa de alucinaciones del 28 %, mientras que se observó una tasa de alucinaciones del 26 % en el conjunto de datos FEVER. Estos hallazgos confirmaron que la generación directa de lenguaje por sí sola era insuficiente para aplicaciones que requieren alta fiabilidad factual, y establecieron la condición de referencia frente a la cual se compararon todos los procedimientos posteriores de verificación.
Extracción de afirmaciones
El procedimiento de extracción de afirmaciones descompuso con éxito las respuestas generadas en unidades factuales independientemente verificables. Las respuestas de TruthfulQA contenían un promedio de 3,2 afirmaciones atómicas, mientras que las muestras de FEVER generalmente consistían en una sola afirmación. El proceso de descomposición aisló las afirmaciones factuales sin introducir información adicional, permitiendo que cada enunciado fuera evaluado por separado. Esta observación respaldó la hipótesis de que la verificación a nivel de afirmación ofrece una mayor precisión que evaluar respuestas completas como una única unidad.
Construcción de referencias independientes
Se generaron referencias independientes para cada afirmación extraída mediante un proceso de razonamiento separado, condicionado únicamente a la consulta original. Las referencias generadas proporcionaron descripciones factuales concisas que eran suficientemente distintas de las respuestas originales para servir como fuentes de verificación independientes. El proceso de generación de referencias se mantuvo aislado de la respuesta inicial para evitar condicionar directamente la referencia factual a la salida previa del modelo. Esta separación tenía como objetivo reducir el posible sesgo de confirmación y proporcionar una base controlada para la verificación posterior a nivel de afirmación; el estudio no cuantifica de forma independiente la magnitud de este efecto. La generación exitosa de referencias independientes respaldó el principio de diseño propuesto de separar la recuperación del conocimiento de la generación de respuestas.
Verificación de inferencia del lenguaje natural
La etapa de verificación de NLI clasificó eficazmente los pares afirmación-referencia en categorías de implicación, contradicción y neutralidad. Las afirmaciones contradictorias recibieron consistentemente puntuaciones negativas de verificación, mientras que las afirmaciones respaldadas fácticamente obtuvieron puntuaciones positivas. Las clasificaciones neutrales se asignaron a aquellas afirmaciones para las cuales no había evidencia de apoyo suficiente. Este comportamiento demostró que la inferencia semántica podía identificar de manera confiable afirmaciones fácticas no respaldadas y proporcionar la evidencia necesaria para su corrección específica. En comparación con una estrategia simple de verificación de consistencia, la verificación mediante NLI redujo la tasa de alucinaciones del 20 % al 15 %, lo que indica una mayor capacidad de detección.
Umbralización estadística adaptativa
La aplicación del umbral estadístico adaptativo mejoró aún más el rendimiento de verificación mediante el ajuste dinámico de los límites de decisión basado en la distribución de las puntuaciones de confianza de cada respuesta. El análisis de sensibilidad del umbral demostró que el rendimiento mejoró cuando el parámetro del umbral aumentó de 0,3 a 0,7. Con un valor de sensibilidad de 0,7, el marco alcanzó una precisión de 0,87 mientras reducía las alucinaciones al 9 % (Figura 2). Los resultados completos del análisis de sensibilidad para los valores evaluados de k se proporcionan en la Tabla Suplementaria 2. Aumentar el umbral más allá de este punto produjo solo mejoras menores en precisión, mientras incrementaba la latencia. Estas observaciones respaldaron la hipótesis de que los umbrales adaptativos son más efectivos que los límites de decisión fijos para manejar distribuciones variables de confianza entre las respuestas.
El umbral adaptativo también refleja la variabilidad de las puntuaciones de confianza dentro de cada respuesta. Las respuestas con puntuaciones de verificación altamente consistentes producen una desviación estándar más pequeña, lo que da lugar a un límite de decisión más selectivo. En contraste, las respuestas que contienen afirmaciones con valores de confianza heterogéneos generan una desviación estándar mayor, lo que conduce a una región de aceptación más amplia y reduce las correcciones innecesarias para afirmaciones inciertas. Aunque este comportamiento adaptativo no puede eliminar todos los falsos positivos o falsos negativos, permite que el límite de decisión responda a las características de incertidumbre de cada respuesta, en lugar de aplicar un criterio uniforme a todas las entradas.
Corrección selectiva de reclamaciones y ensamblaje de respuestas
Solo se presentaron para corrección las afirmaciones identificadas como contradictorias, mientras que las afirmaciones respaldadas y neutrales se mantuvieron sin cambios. Esta estrategia selectiva de corrección minimizó la regeneración innecesaria y preservó la estructura original de la respuesta. Tras la corrección y la reconstrucción de la respuesta, la tasa de alucinaciones en TruthfulQA disminuyó del 28 % al 9 %, lo que representa una reducción relativa del 67,9 %. Se observaron mejoras similares en FEVER, donde las alucinaciones disminuyeron del 26 % al 10 %. Las comparaciones de precisión y tasas de alucinación entre las configuraciones evaluadas se presentan en las Figuras 3 y 4, respectivamente.
Evaluación del rendimiento
La evaluación comparativa mostró que el marco propuesto alcanzó el rendimiento general más alto entre todos los métodos probados. En TruthfulQA, el marco logró una precisión de 0,87 y una puntuación F1 de 0,85, superando tanto a la verificación con umbral fijo como a los enfoques basados en autoconsistencia (Tabla 2, Figuras 3 y 4). En FEVER, el marco alcanzó una precisión de 0,89 y una puntuación F1 de 0,87 (Tabla 3, Figuras 3 y 4). La contribución incremental de los componentes del marco se examina mediante el análisis de ablación presentado en la Tabla 4. Estas mejoras confirmaron que combinar la verificación a nivel de afirmación con una toma de decisiones estadística adaptativa aumentó la fiabilidad factual en múltiples conjuntos de datos. La precisión en la detección de alucinaciones para SelfCheckGPT, FActScore y el marco propuesto se compara en la Figura 5.
Análisis de latencia
La canalización completa de verificación mantuvo un bajo costo computacional. El tiempo medio de respuesta aumentó de 820 ms para el modelo de referencia a 980 ms para el marco completo, lo que representa un incremento moderado en el tiempo de procesamiento (Tabla 5). La generación de respuestas representó la mayor parte de la latencia total, mientras que las etapas de verificación y corrección aportaron relativamente poca sobrecarga adicional. En el cuadro suplementario 3 se proporciona el desglose del tiempo de procesamiento por etapa. En comparación con los sistemas de verificación basados en recuperación, que requerían aproximadamente 1600 ms por consulta, el marco propuesto logró una latencia sustancialmente menor manteniendo una precisión factual comparable. Estos hallazgos respaldaron la hipótesis de que la reducción de alucinaciones puede lograrse sin sacrificar la usabilidad en tiempo real.
Dado que la generación de respuestas depende de un modelo de lenguaje basado en la nube, las mediciones individuales de latencia están sujetas a fluctuaciones debidas a las condiciones de la red y la planificación del lado del servidor, más que a un tiempo de ejecución determinista. Por lo tanto, se utilizaron mediciones repetidas para obtener valores promedio representativos, reduciendo la influencia de la variabilidad transitoria en la ejecución, al tiempo que se preservan las comparaciones relativas entre los métodos evaluados. Los valores de latencia se reportan como tiempos medios de ejecución a lo largo de ejecuciones experimentales repetidas. No se conservaron los valores individuales de latencia por ejecución; por consiguiente, no fue posible el cálculo a posteriori de varianza, intervalos de confianza u otras medidas de variabilidad. En consecuencia, los valores de latencia y la comparación entre velocidad y precisión en la Figura 6 se presentan como estimaciones puntuales sin barras de error.
Para concluir, los resultados demostraron que combinar la extracción de afirmaciones, la generación independiente de referencias, la verificación mediante inferencia del lenguaje natural, el umbral estadístico adaptativo y la corrección selectiva mejoró la confiabilidad factual de las salidas de modelos grandes de lenguaje. El marco redujo la tasa de alucinaciones del 28 % al 9 % en TruthfulQA y del 26 % al 10 % en FEVER. Los resultados indican que la verificación adaptativa a nivel de afirmación mejoró las métricas de confiabilidad factual, limitando al mismo tiempo el aumento adicional de latencia de respuesta bajo las condiciones evaluadas.
Disponibilidad de datos
Los conjuntos de datos analizados en este estudio están disponibles públicamente a través de sus fuentes oficiales respectivas. El manuscrito proporciona la información sobre los conjuntos de datos, las configuraciones del modelo y los detalles metodológicos necesarios para respaldar la replicación de los análisis descritos. Los datos procesados para la evaluación y los resultados complementarios generados durante el estudio se incluyen en los Archivos Suplementarios.

Figura 1: Flujo de trabajo del marco adaptativo de verificación de afirmaciones. Una respuesta inicial generada por un modelo lingüístico grande (LLM) se descompone en afirmaciones factuales, seguida de la generación independiente de referencias, verificación basada en inferencia lingüística natural (NLI), puntuación de confianza y umbralización estadística. Las afirmaciones que cumplen con el criterio de aceptación se conservan, mientras que las afirmaciones que cumplen con el criterio de corrección pasan por una corrección específica antes del ensamblaje final de la respuesta. Haga clic aquí para ver una versión más grande de esta figura.

Figura 2: Efecto del parámetro de sensibilidad (k) sobre la precisión de la verificación. Precisión en TruthfulQA y FEVER en valores de k de 0,3, 0,5, 0,7 y 1,0. La precisión aumentó con k en ambos conjuntos de datos, con k = 0,7 seleccionado para la evaluación primaria. Haga clic aquí para ver una versión más grande de esta figura.

Figura 3: Comparación de precisión entre métodos de verificación. Precisión del modelo de lenguaje base, la verificación basada en inferencia natural (NLI) y el marco de verificación adaptativa propuesto en TruthfulQA y FEVER. Haga clic aquí para ver una versión más grande de esta figura.

Figura 4: Comparación de la tasa de alucinaciones entre métodos de verificación. Tasas de alucinaciones para el modelo de lenguaje de referencia, la verificación basada en inferencia natural y el marco propuesto en TruthfulQA y FEVER. El marco propuesto redujo la tasa del 28 % al 9 % en TruthfulQA y del 26 % al 10 % en FEVER. Haga clic aquí para ver una versión más grande de esta figura.

Figura 5: Precisión en la detección de alucinaciones entre diferentes métodos. Precisión de detección de SelfCheckGPT, FActScore y el marco propuesto en los conjuntos de datos TruthfulQA y FEVER. Haga clic aquí para ver una versión más grande de esta figura.

Figura 6: Compromiso entre tiempo de respuesta y precisión en los distintos métodos de verificación. Relación entre la latencia de respuesta y la precisión para los métodos evaluados en TruthfulQA y FEVER, que ilustra el compromiso entre rendimiento y latencia asociado con el marco propuesto y los enfoques comparadores. Haga clic aquí para ver una versión más grande de esta figura.
| Conjunto de datos | Muestras utilizadas | Dominios | Longitud promedio de la respuesta (tokens) | Tasa de alucinación del LLM de referencia |
| TruthfulQA | 817 | 38 (ciencia, historia, derecho, etc.) | 42 | 28% |
| FEVER | 1.000 | Afirmaciones factuales generales | 18 | 26% |
Tabla 1: Características del conjunto de datos de referencia. Resumen de los conjuntos de datos TruthfulQA y FEVER utilizados para el desarrollo y evaluación del marco, que incluye el número de muestras, la precisión de referencia, la tasa de alucinación de referencia y el número promedio de afirmaciones por muestra.
| Método | Precisión | Exactitud | Recuperación | Puntuación F1 | Porcentaje de alucinaciones |
| Modelo de lenguaje base (inferencia única) | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| Verificación basada en inferencia natural (umbral fijo) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| SelfCheckGPT | 0.76 | 0.755 | 0.725 | 0.74 | 22% |
| FActScore | 0.85 | 0.8425 | 0.8175 | 0.83 | 11% |
| Marco propuesto (umbral estadístico) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
Tabla 2: Comparación de rendimiento en TruthfulQA. Precisión, exactitud, recuperación, puntuación F1 y tasa de alucinaciones para el modelo de lenguaje de referencia, SelfCheckGPT, FActScore, verificación NLI y el marco propuesto.
| Método | Precisión | Exactitud | Recuperación | Puntuación F1 | Porcentaje de alucinaciones |
| SelfCheckGPT | 0.78 | — | — | — | — |
| FActScore | 0.87 | — | — | — | — |
| Modelo base de lenguaje† | 0.74 | 0.73 | 0.71 | 0.72 | 26% |
| Verificación basada en inferencia natural (umbral fijo) | 0.83 | 0.8225 | 0.7975 | 0.81 | 14% |
| Marco propuesto (umbral estadístico) | 0.89 | 0.8775 | 0.8625 | 0.87 | 10% |
Tabla 3: Comparación de rendimiento en FEVER. Precisión, exactitud, recuperación, puntuación F1 y tasa de alucinaciones para el modelo LLM de referencia, SelfCheckGPT, FActScore, verificación NLI y el marco propuesto.
| Configuración | Precisión | Exactitud | Recuperación | F1 (agregada) | Tasa de alucinación |
| Modelo de lenguaje de referencia | 0.72 | 0.71 | 0.69 | 0.7 | 28% |
| Referencia + verificación secundaria (sin NLI) | 0.78 | 0.7725 | 0.7475 | 0.76* | 20% |
| Referencia + verificación basada en NLI (umbral fijo) | 0.82 | 0.815 | 0.785 | 0.8 | 15% |
| Referencia + módulo estadístico de decisión (completo) | 0.87 | 0.86 | 0.84 | 0.85 | 9% |
Tabla 4: Análisis de ablación de los componentes del marco. Cambios en la precisión, la puntuación F1 y la tasa de alucinación tras la incorporación secuencial de la validación secundaria, la verificación NLI y el umbral estadístico adaptativo.
| Método | Tiempo medio de respuesta (ms) |
| LLM de referencia (generación única) | 820 |
| Mecanismo de autovalidación | 910 |
| Marco estadístico propuesto | 980 |
| Verificación aumentada con recuperación (RAG) | 1600 |
Tabla 5: Latencia de respuesta entre los métodos de verificación. Tiempo medio de respuesta y latencia adicional en comparación con el LLM de referencia para la autovalidación, el marco propuesto y la verificación aumentada por recuperación.
Tabla suplementaria 1: Comparación de enfoques de verificación de alucinaciones. Comparación del marco propuesto con métodos existentes en cuanto a recuperación externa, verificación a nivel de afirmación, umbral adaptativo y procesamiento eficiente en latencia.Haga clic aquí para descargar este archivo.
Tabla suplementaria 2: Análisis de sensibilidad del parámetro umbral (k). Se obtuvieron la exactitud, precisión, recuperación, puntuación F1 y la tasa de alucinaciones para valores del parámetro umbral de 0.3, 0.5, 0.7 y 1.0. Se utilizó un valor de k = 0.7 para la evaluación principal.Haga clic aquí para descargar este archivo.
Tabla suplementaria 3: Tiempo de procesamiento en las distintas etapas del proceso de verificación. Tiempo medio de ejecución y contribución porcentual de la generación inicial de respuestas, descomposición de afirmaciones, generación de referencias, inferencia NLI y corrección selectiva al tiempo total de respuesta.Haga clic aquí para descargar este archivo.
Tabla suplementaria 4: Distribución de errores identificados durante la verificación. Número y porcentaje de falsos negativos, falsos positivos y errores de corrección, junto con las categorías principales de alucinaciones asociadas a cada tipo de error.Haga clic aquí para descargar este archivo.