Research Article

Ajuste fino de grandes modelos de lenguaje usando el Índice de Alucinaciones de Entidades para la Resumen de Texto

DOI:

10.3791/68962

January 9th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Proponemos un enfoque de ajuste fino basado en aprendizaje por refuerzo para grandes modelos de lenguaje que utiliza el Índice de Alucinaciones de Enti (EHI) como señal de recompensa para reducir las alucinaciones a nivel de entidad en la resumen de texto. Los experimentos con transcripciones de reuniones muestran que este método mejora la fidelidad y precisión de las entidades.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los avances recientes en los grandes modelos de lenguaje (LLMs) han llevado a mejoras notables en la calidad de la sumarización abstracta. Sin embargo, la alucinación —especialmente la alucinación a nivel de entidad donde se introducen entidades inexistentes o incorrectas— sigue siendo un desafío crítico. En este trabajo, proponemos un marco de ajuste fino basado en recompensas para modelos de resumen utilizando el Índice de Alucinaciones de Entidades (EHI) como métrica guía. La metodología aquí comienza generando resúmenes iniciales a partir de modelos preentrenados como Flan-T5, DistilBART y Mistral (u otro LLM popular) en conjuntos de datos estructurados de transcripciones, XSUM. Calculamos el EHI extrayendo entidades nombradas tanto de resúmenes generados como de referencias de oro, evaluando la precisión y penalizando a las entidades fabricadas. El proceso de ajuste fino está guiado por el aprendizaje por refuerzo, donde el EHI actúa como señal de recompensa. Adoptamos un mecanismo de actualización al estilo REINFORCE para optimizar el modelo de sumarización y maximizar la fidelidad de las entidades. Los experimentos demuestran que los modelos ajustados con EHI logran tasas de alucinación más bajas sin comprometer la información. Además, mostramos que los modelos guiados por EHI generalizan mejor en tareas de resumen fuera del dominio, lo que sugiere una mayor robustez. El enfoque aquí ofrece una dirección práctica para mejorar la factualidad en la resumen, enfatizando el papel fundamental de la representación precisa de entidades.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los modelos de resumen abstracto, impulsados por grandes modelos de lenguaje (LLM), han logrado resultados impresionantes en diversos dominios. Sin embargo, un desafío persistente sigue siendo la alucinación, donde los resúmenes generados incluyen información incorrecta o fabricada que no está fundamentada en la entradafuente 1,2. En aplicaciones de alto riesgo como la recapitulación de reuniones, la presentación de informes médicos o la documentación financiera, las alucinaciones, especialmente las entidades nombradas, pueden minar significativamente la fiabilidad y la utilidad3.

Los investigadores de Rrealizaron una evaluación humana a gran escala y encontraron que los sumarios producen frecuentemente alucinaciones —contenido que no está respaldado por el documento fuente— y que estas alucinaciones se correlacionan con repetición e incoherencia1. Otro estudio mostró que los modelos con mayor abstracción tienden a ser menos fieles; Su estudio informó que los resultados con mayor abstracción tenían menor precisión fáctica y más frasesinfieles 2. El índice de referencia FRANK informó que aproximadamente el 30% de los resúmenes contienen inconsistencias fácticas, y otro estudio popular señaló tasas de error similares, argumentando que altos niveles de alucinaciones hacen que los resúmenes sean prácticamenteinútiles 1,2. Las alucinaciones pueden categorizarse como intrínsecas (contradiciendo la fuente) o extrínsecas (no verificables a partir de la fuente). Un tutorial sobre alucinaciones en resumen abstracto explica que las alucinaciones intrínsecas ocurren cuando el contenido generado contradice la entrada (por ejemplo, al informar erróneamente una vacuna aprobada como rechazada), mientras que las alucinaciones extrínsecas añaden hechos no verificables, como afirmar ensayos clínicos para una vacuna que no semencionan 4. También informó que los sumarios de última generación producen contenido alucinado en aproximadamente el 25% de sus resultados cuando se evaluan con ROUGE, BLEU y METEOR, y advierte que las alucinaciones pueden ser perjudiciales en ámbitos como la salud, el derecho o la ciberseguridad.

Las métricas tradicionales de n-gramas (ROUGE5, BLEU, METEOR) se correlacionan mal con los juicios humanos sobre la factualidad, lo que ha impulsado el desarrollo de métricas basadas y libres dereferencias 6. Métricas basadas en QA como FEQA y QuestEval evalúan los resúmenes preguntando si los pares pregunta-respuesta derivados del resumen pueden responderse usando el texto fuente. FEQA se correlaciona más fuertemente con los juicios humanos y muestra que los resúmenes más abstractos tienden a ser menos fieles, mientras que QuestEval mejora sustancialmente la correlación con los juicios humanos en consistencia, coherencia, fluidez y relevancia. QAFactEval refina este enfoque seleccionando respuestas por frase nominal y generando preguntas antes de responderlas; esta estrategia mejora la correlación con las evaluaciones humanas en el benchmark SummaC. Las métricas de extracción de información (IE) representan el conocimiento como tuplas sujeto-relación-objeto, pero son vulnerables a errores en el proceso de extracción. Las métricas de inferencia en lenguaje natural (NLI) —como FactCC y SummaC— clasifican las oraciones resumidas como implicadas o contradichas por la fuente4. FactCC utiliza datos débilmente supervisados para entrenar un clasificador que detecta consistencia fáctica y resalta spansinconsistentes 2. SummaC aplica modelos NLI con la granularidad adecuada y ofrece estimaciones sólidas de factualidad, pero el benchmark FRANK señala que estas métricas siguen tratando la factualidad como binaria y carecen de un marcounificado 1,7,8. Las dimensiones de evaluación humana propuestas por los investigadores son ampliamente adoptadas9. Otro estudio de evaluación enfatiza que la consistencia es la dimensión más objetiva porque simplemente comprueba si el resumen está implicado por la fuente; señala que hasta el 92% de los resúmenes XSum contienen errores defidelidad 9,10. Sin embargo, la evaluación humana es costosa y lleva mucho tiempo, por lo que las métricas automáticas son esenciales para una evaluaciónescalable 8. Las métricas actuales suelen agregar alucinaciones intrínsecas y extrínsecas en una única puntuación, dificultando el diagnósticode error 4.

Dado que el entrenamiento de máxima verosimilitud no optimiza directamente la calidad de los resumen, se ha aplicado el aprendizaje por refuerzo (RL) para mejorar la relevancia y la factualidad. Pasunuru y Bansal introdujeron un marco de RL multi-recompensa que combina saliencia (ROUGE) y recompensas de implicación, y demostraron un rendimiento de última generación11. RL se aplicó para resumen extractivo usando el algoritmo REFORCE; su modelo maximiza las puntuaciones ROUGE y produce resúmenes más informativos que los enfoques basados en clasificadores, como muestran las evaluaciones humanas de preguntasy respuestas 12. Los modelos multitarea incorporan además la generación de preguntas y de implicaciones para garantizar la cobertura yla coherencia 12. Una encuesta exhaustiva de 2024 sobre resumen abstracto destaca la coherencia factual como un desafío fundamental y aboga por el RL para fomentar una síntesis veraza. La encuesta sugiere recompensar los resúmenes factualmente consistentes e incorporar fuentes externas de conocimiento y control de atributos para mejorar la precisión13. El RL a partir de la retroalimentación humana (RLHF) amplía esta idea entrenando un modelo de recompensa basado en las preferencias humanas y ajustando finamente el resumidor para maximizar esta recompensaaprendida 9. El aprendizaje por refuerzo a partir de la retroalimentación humana (RLHF) ha ganado popularidad para alinear los resultados del modelo con cualidades deseadas, como la factualidad y la utilidad 4,14. Aunque el RL y el RLHF multi-recompensa alinean los modelos con las nociones humanas de fidelidad, se basan en métricas groseras como ROUGE o la factualidad binaria. En contraste, el trabajo detallado aquí propone usar un índice de alucinaciones a nivel de entidad como recompensa, lo cual es empírico y computacionalmente menos costoso sin retroalimentación humana.

A pesar de numerosos indicadores, persisten varias limitaciones. Las métricas N-gram ignoran la corrección semántica, las métricas basadas en QA y en IE propagan errores de los modelos de generación y extracción de preguntas, y las métricas NLI reducen la factualidad a decisiones binarias de implicación 1,4,6. En el trabajo de investigación, se enfatizó que las métricas basadas en modelos existentes tienen dificultades para identificar alucinaciones con una granularidad fina porque operan a nivel de oración o documento y no pueden aislar entidades específicas que causanerrores 4. Las evaluaciones humanas siguen siendo el estándar de oro, pero son costosas ysubjetivas 15. Además, las métricas existentes no distinguen entre alucinaciones intrínsecas y extrínsecas ni capturan el sobrefoco y el subfoco de lasrelaciones 1. Los grandes modelos de lenguaje pueden alucinar porque predicen el texto basándose en la probabilidad estadística en lugar de en la verificación factual. Los modelos generan resultados seguros pero incorrectos debido a limitaciones en los datos de entrenamiento, generación probabilística y falta de verificación de hechos, y la sobreconfianza y los sesgos pueden hacer que afirmen información falsa con alta certeza; La guía defiende la generación aumentada por recuperación y la memoria a largo plazo para modelos terrestres en datosexternos 15. Sin embargo, estas técnicas se centran en tareas basadas en recuperación; La resumen sigue requiriendo métricas que identifiquen y penalicen a las entidades alucinadas. Trabajos previos han reconocido la importancia de la evaluación a nivel de entidad para la factualidad. Métricas como FEQA y QuestEval intentan evaluar la consistencia factual utilizando técnicas de respuestaa preguntas 16,17. Sin embargo, estos métodos a menudo requieren resúmenes de referencia o sistemas externos de control de calidad, lo que limita la escalabilidad. Nuestro trabajo se basa en esta línea empleando el Índice de Alucinaciones de Entidades (EHI), una métrica empírica ligera que se centra específicamente en la fidelidad de entidades nombradas, categorizando las entidades en cinco tipos de factores alucinatorios, como se muestra en la Figura 1.

La evidencia indica que la alucinación es omnipresente, las métricas de evaluación son imperfectas y las técnicas de RL carecen de recompensas detalladas. Los estudios en humanos muestran que los modelos de sumificación alucinan en una fracción significativa de los casos, a menudo intercambiando entidades o fabricando detalles9. Las métricas existentes enfatizan la superposición de n-gramos o tratan la factualidad como binaria, y los métodos actuales de RL optimizan señales ROUGE o de factualidad gruesa. Existe una laguna para las métricas a nivel de entidad que miden cuando un resumen menciona entidades que no están presentes en la fuente (alucinación negativa), omite entidades clave (alucinación de enfoque perdido) y otros escenarios. El método propuesto de ajuste fino sobre el Índice de Alucinaciones de Entidades (EHI) cubre esta carencia cuantificando las alucinaciones a nivel de entidad y proporcionando una recompensa estructurada por el aprendizaje por refuerzo. Al integrar EHI en RLHF, pretendemos afinar los grandes modelos de lenguaje para minimizar las alucinaciones a nivel de entidad y producir resúmenes que sean fluidos y fieles a los hechos.

En este trabajo, proponemos un enfoque novedoso de ajuste fino que aprovecha el Índice de Alucinaciones de Entidades (EHI) como señal de recompensa para reducir las alucinaciones a nivel de entidad. EHI cuantifica la corrección y fundamentación de las entidades comparando las entidades extraídas de las salidas del modelo con las presentes en el documento de entrada, permitiendo una reducción de la dependencia de lasreferencias 18. El método descrito aquí sesga el modelo hacia producir más resúmenes fieles a la entidad sin requerir anotaciones de factualidad humana.

En resumen, se han utilizado modelos de recompensa conscientes de la factualidad para ajustarfinamente 19,20. A diferencia de enfoques anteriores que se basan en recompensas factuales groseras o conjuntos de datos etiquetados por humanos, proponemos un ajuste fino usando EHI como una señal de recompensa directa y automática, promoviendo así una sumarización basada en entidades sin supervisión adicional. Las contribuciones novedosas de este estudio son las siguientes: (i) el estudio introduce un marco de ajuste fino guiado por EHI que mejora la fidelidad de las entidades en la resumen abstracto, (ii) presenta una cadena escalable de aprendizaje por refuerzo que no depende de conjuntos de datos de factualidad etiquetados por humanos, (iii) el estudio demuestra mejoras empíricas en las puntuaciones EHI en conjuntos de datos de transcripciones de reuniones, conjunto de datos de noticias XSUM y realiza análisis cualitativos para destacar reducciones en las alucinaciones, (iv) el estudio comparte una implementación reproducible basada en Colab para facilitar investigaciones adicionales sobre la sumarización consciente de lasalucinaciones 21.

Este estudio evalúa la hipótesis de que optimizar modelos de lenguaje con recompensas centradas en entidades de gran detalle como EHI proporciona una vía eficaz para mejorar la fidelidad y fiabilidad en tareas de resumen con un cálculo mínimo. El enfoque contribuye al creciente campo del ajuste fino eficiente en parámetros para la fidelidad en la resumen: (i) demostrando efectividad tanto en arquitecturas codificador-decodificador (DistilBART, FlanT5) como solo decodificador (Mistral), (ii) proporcionando un marco que pueda adaptarse a diferentes tipos de modelos, dominios y escalas, y (iii) ofreciendo eficiencia computacional en comparación con el reentrenamiento completo.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El objetivo de este estudio es afinar un modelo de lenguaje (LM) para generar resúmenes con alucinaciones de entidades reducidas. Las alucinaciones ocurren cuando un modelo "produce con confianza resultados incorrectos o irrelevantes" porque genera texto según la probabilidad estadística en lugar de la verificación fáctica. Esto se consigue diseñando una función de recompensa basada en el Índice de Alucinaciones de Entidades (EHI) y aplicando aprendizaje por refuerzo para maximizarla.

Formulación del problema
Dado un documento de entrada Xi, el objetivo es generar un resumen Yi de modo que las entidades mencionadas en Yi estén fundamentadas en Xi. El entrenamiento tradicional de máxima verosimilitud no optimiza explícitamente la consistencia fáctica. Estos métodos de formación no penalizan la inclusión de entidades fabricadas. Por ello, se introduce una estrategia de ajuste fino basada en recompensas, donde la recompensa es proporcional a la fidelidad de la entidad, medida mediante EHI.

Conjunto de datos y método
Se utilizan dos corpus: primero, un conjunto de datos de transcripción de diálogos con transcripciones de reuniones de varios turnos y resúmenes abstractos de oro, y segundo, el benchmark de resumen de noticiasXSUM 22,23. Cada conjunto de datos fue limpiado, aplanado y dividido en particiones del 80% de tren, 10% de validación y 10% de prueba. Los diálogos son ricos en lenguaje informal y pronombres, mientras que XSUM contiene artículos de noticias concisos; La combinación nos permite evaluar tanto la generalización dentro como fuera del dominio.

La extracción de entidades se realiza tanto en documentos fuente como en resúmenes para calcular el Índice de Alucinaciones de Entidades (EHI). Durante el ajuste fino, este estudio utiliza exclusivamente la división de entrenamiento, mientras que las puntuaciones EHI de validación se monitorizan para seleccionar el mejor punto de control. Las evaluaciones finales se reportan en el conjunto de pruebas que se ha extendido, que permanece sin disparo antes y después del ajuste fino de los modelos.

En resumen, primero, las transcripciones se organizan en un formato aplanado y se dividen los datos. El modelo preentrenado genera resúmenes de referencia. En segundo lugar, el EHI se calcula usando NER basado en transformadores y los cinco factores de alucinación. Durante el ajuste fino, el modelo se actualiza con la recompensa EHI mediante adaptadores LoRa. Finalmente, los resúmenes se generan utilizando el modelo ajustado y se evalúan usando EHI, Entidad F1 y otras métricas (Figura 2). Todos los experimentos son reproducibles mediante el código y los archivos de configuración proporcionados. La Figura 3 muestra el flujo de proceso paso a paso para la preparación del conjunto de datos, la síntesis de la línea base, el cálculo de EHI, el ajuste fino y la evaluación.

Resumen de la línea base
Se eligen tres LLMs preentrenados y se capturan sus resúmenes base: Flan-T5, Mistral (Nous-Hermes-2-Mistral-7B-DPO) y DistilBART 24,25,26. Cada modelo se ejecutaba en modo zero-shot para producir un resumen inicial (Yi) para cada documento de entrada (xi). Se utilizó búsqueda de haz con un ancho de haz de 4 y una penalización de longitud de 1,0 para fomentar resúmenes fluidos pero concisos. Estos resúmenes basales servían para estimar la prevalencia de alucinaciones y proporcionaban puntos de partida para el ajuste fino.

Extracción de entidades y cálculo EHI
Calcular con precisión el Índice de Alucinaciones de Entidades (EHI) requiere un NER robusto. Inicialmente, Spacy se utilizó para operaciones de la NER. Se entiende que los modelos NER basados en transformadores son más precisos, pero Spacy fue la elección inicial por las siguientes razones: (1) Los modelos NER basados en transformadores han demostrado alucinar más que Spacy. (2) El espaciamiento al ser estadístico aporta eficiencia computacional en términos de coste de implementación y tiempo de ejecución. (3) También nos ayuda a demostrar que el EHI es robusto en la reducción de alucinaciones incluso con un modelo de NER más débil. Sin embargo, dado que los experimentos se realizan con conjuntos de datos establecidos y el modelo en_core_web_sm de spaCy es frágil en las transcripcionescoloquiales 13. El espacio se sustituye por un modelo NER basado en transformadores (dslim/bert-base-NER), que es un modelo BERT ajustado con el conjunto de datos CoNLL-2003. Se ha demostrado que los sistemas NER basados en BERT superan a los modelos spaCy en tareas específicas de dominio; por ejemplo, un modelo Aviation-BERT-NER alcanzó un F1 del 94,78% mientras identificaba 17 entidades, frente al 93,73% de spaCy NER que reconocíasiete entidades 27. El modelo BERT NER se configuró mediante Hugging Face Transformers28 y realizó emparejamiento insensible a mayúsculas y mayúsculas. Para capturar pronombres y variaciones en la forma superficial, este método aplicaba además reglas simples que asignaban "Mr. Smith" y "Smith" a la misma forma canónica; sin embargo, la resolución completa de copreferencia sigue siendo trabajo futuro. El análisis comparativo de los modelos NER sobre una muestra de 200 registros del conjunto de datos XSUM puede inferirse de la Tabla 1.

El Índice de Alucinaciones de la Entidad (EHI) se calcula como:

figure-protocol-1

donde PH, EF, OF, NH, LF representan puntuaciones correspondientes a Alucinación Positiva (HP), Factor de Extracción (FE), Alucinación Negativa (NH), Entidades Sobrefocalizadas (OF) y Enfoque Perdido (LF), respectivamente, para el artículo i.

Detalles de los factores de alucinación:

Alucinación positiva (HP): Medidas de entidades recién introducidas que son correctas y beneficiosas en el fado.

Factor de extracción (FE): Mide las entidades extraídas con precisión del documento de entrada en el resumen.

Alucinación negativa (NH): Captura entidades alucinadas que son incorrectas o no están fundamentadas en la entrada.

Demasiado enfocado (OF): Penaliza resúmenes que se centran excesivamente en un subconjunto reducido de entidades, faltando diversidad.

Foco perdido (LF): Penaliza resúmenes que omiten entidades importantes presentes en la entrada.

El cálculo de los factores anteriores se detalla en la Figura 4 con un ejemplo de cálculo para fines ilustrativos. Considerando un ejemplo de Entidades de Documento de Entrada (I):"John", "IA"," conferencia" Entidades de Resumen de Referencia (R):"John"," "IA" Entidades Resumen Generadas (G):"John", "IA"," tecnología". Valores más altos de EHI indican una mejor fidelidad a las entidades, recompensando resúmenes que son tanto extractivos como positivamente alucinados (introduciendo entidades útiles pero fieles), mientras que penalizan a entidades20 sin fundamento, excesivas o ausentes. Estos factores se normalizaron por el número total de entidades detectadas para producir una puntuación EHI entre 0 y 1. Durante el entrenamiento se monitorizó la validación EHI para seleccionar el mejor punto de control. PH y EF recompensan a entidades nuevas beneficiosas y la extracción correcta, mientras que OF, NH y LF penalizan la repetición, fabricación y omisión. Una puntuación perfecta de 1,0 significa que todas las entidades del resumen están ancladas o han tenido alucinaciones beneficiosas, mientras que una puntuación de 0 indica que ninguna entidad nombrada aparece en el resumen en la fuente.

Procedimiento de ajuste fino con RL
La configuración detallada de hiperparámetros para el ajuste fino se proporciona por separado en las Tablas 2, Tabla 3 y Tabla 4, que muestran los tipos de optimizadores, tasas de aprendizaje, tamaños de lote, especificaciones de hardware y otros detalles de configuración para Mistral-7B, DistilBart y Flan-T5, respectivamente. El objetivo aquí es afinar los parámetros del modelo θ maximizando la recompensa esperada del Índice de Alucinaciones de Entidades (EHI) a través de los resúmenes generados. Formalmente, para un documento de entrada Xi, un resumen generado Yi y parámetros del modelo θ , el objetivo de recompensa esperada se define como:

figure-protocol-2(2)

donde EHI (y, x) denota el Índice de Alucinaciones de la Entidad calculado entre el resumen generado Yi y la entrada Xi.

Siguiendo el algoritmoREINFORCE 25, el gradiente de este objetivo se estima como:

figure-protocol-3(3)

En la práctica, se tomaron resúmenes de los modelos, se calcularon sus correspondientes puntuaciones EHI y se aplicaron actualizaciones del gradiente de políticas para fomentar resultados de mayor recompensa. Para permitir un ajuste fino eficiente en parámetros de parámetros, este estudio utilizó la Adaptación de Rango Bajo (LoRA). Solo se actualizaron los adaptadores LoRA, mientras que los pesos del modelo base permanecieron congelados. El ajuste fino se realizó en una GPU A100 con una tasa de aprendizaje baja (por ejemplo, 5 × 10-6), tamaño de lote de 4 y acumulación de gradiente en 8 pasos con el optimizadorAdam 29. Los resúmenes se regeneraban cada 500 actualizaciones para actualizar las estimaciones de recompensas, y la formación continuaba hasta que el EHI de validación convergía. La línea base de REINFORCE se estableció como el promedio continuo de las recompensas recientes para reducir la varianza. Además de EHI, las puntuaciones de la Entidad F12 y ROUGE-1/2/L se registraron para monitorizar la calidad general. Los resúmenes se regeneran periódicamente para reflejar las mejoras del modelo durante el ajuste fino.

Métricas de evaluación
Los resultados se evaluaron utilizando métricas de Informatividad como Rouge-1,Rouge-2 5. Métrica de fluidez como la RougeLCS 5. Métrica de solapamiento de entidades Entidad F1, y métricas de alucinación como EHI, FactCC y QAGS 2,6,18,30. FactCC utiliza un clasificador entrenado con datos sintéticos de contradicción para etiquetar las oraciones como implicadas o contradichas por la fuente. El FactCC da dos puntuaciones; las partituras se capturaron donde la etiqueta es VÁLIDA. Por otro lado, QAGS utiliza un método de preguntas y respuestas que funciona en un LLM. El modelo ligero T5 pequeño se utilizó para generar preguntas sobre el texto31. Roberta_base_Squad2 se utilizaba para generar respuestas sobre el textode salida 32. Estos modelos se eligieron por su conveniente coste de cálculo para la ejecución.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los experimentos aquí se centran en la evidencia cuantitativa sobre el impacto que el ajuste fino guiado por EHI tiene en la reducción de alucinaciones a nivel de entidad a través de múltiples arquitecturas de modelos y conjuntos de datos. Los resultados demuestran mejoras constantes en las métricas de alucinaciones, manteniendo la coherencia factual y preservando la capacidad de responder preguntas.

Rendimiento del conjunto de datos

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Las métricas basadas en QA (por ejemplo, FEQA/QuestEval/QAFactEval) y las métricas basadas en NLI (por ejemplo, FactCC/SummaC) requieren componentes auxiliares de QA/implicación y a menudo proporcionan juicios a nivel de oración. En cambio, el EHI es una puntuación ligera, sin referencias, a nivel de entidad que (i) apunta directamente al modo de fallo primario que observamos: alucinación de entidades; (ii) es agnóstico respecto al modelo y rápido de calcular; y (iii) sirve como una reco...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen nada que revelar.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Colab NVIDIA A100 GPUNVIDIAN/AGoogle Colaboratory Pro
DistilBART (Encoder–Decoder)Hugging Facehttps://huggingface.co/sshleifer/distilbart-cnn-12-6
dslim/bert-base-NERHugging Face (dslim)https://huggingface.co/dslim/bert-base-NERBERT base ajustado para NER en inglés
Evaluation Models  QAGS (Basado en preguntas)Salesforce ResearchN/AClasificador de facticidad
Evaluation Models (Factuality) FactCCGoogle ResearchN/AClasificador de facticidad
Flan-T5 (Encoder–Decoder)Googlehttps://huggingface.co/docs/transformers/main/en/model_doc/flan-t5Modelo de lenguaje de código abierto, de texto a texto, de gran tamaño
Hugging Face TransformersHugging Face, Inc.https://huggingface.co/docs/transformers/indexCarga y ajuste de modelos
Nous-Hermes-2-Mistral-7B-DPOMistralhttps://huggingface.co/NousResearch/Nous-Hermes-2-Mistral-7B-DPOModelo de lenguaje de 7 mil millones de parámetros
Lenguaje de programación
Python 3.10 (Entorno de ejecución Colab)
Python Software FoundationVersión 3.10Implementación principal
StreamlitOpen Sourcehttps://streamlit.io/Clasificador de facticidad
XLSUM datasetBUEThttps://github.com/csebuetnlp/xl-sum
XSUM datasetUniversity of Edinburghhttps://github.com/EdinburghNLP/XSum

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Maynez, J., Narayan, S., Bohnet, B., McDonald, R. On faithfulness and factuality in abstractive summarization. Proc Annu Meet Assoc Comput Linguist. 2020, 173-173 (2020).
  2. FEQA: A question answering evaluation framework for faithfulness assessment in abstractive summarization. Durmus, E., He, H., Diab, M. Proc Conf Empir Methods Nat Lang Process, , 454-454 (2020).
  3. A short summary of automatic summarization. NLG Blog. , Andong. https://andongluis.github.io/nlg-blog/Summarization-post/ (2018).
  4. Understanding factuality in abstractive summarization. Pagnoni, A., Padmakumar, V., May, J. Proc Conf North Am Chapter Assoc Comput Linguist Hum Lang Technol, 2021, 4812-4829 (2021).
  5. Lin, C. Y. ROUGE: A package for automatic evaluation of summaries. Workshop Text Summarization Branches Out. 2004, 74-81 (2004).
  6. Evaluating the factual consistency of abstractive text summarization. Kryściński, W., McCann, B., Xiong, C., Socher, R. Proc Conf Empir Methods Nat Lang Process, 2020, 750-750 (2020).
  7. Goyal, T., Durmus, E., Cardie, C. Fact checking summarization with self supervised and few shot learning. Proc Annu Meet Assoc Comput Linguist. 2022, 564-579 (2022).
  8. QuestEval: Summarization asks for fact-based evaluation. Scialom, T., Dray, P. A., Lamprier, S., Piwowarski, B., Staiano, J., Wang, A., Gallinari, P. Proc Conf Empir Methods Nat Lang Process, 2021, 6594-6604 (2021).
  9. Mukesh, K. Hallucinations in abstractive summarization. Medium. , https://medium.com/@mukesh.kr/hallucinations-in-abstractive-summarization-b5904bc1c5c5 (2023).
  10. Factual error correction for abstractive summarization models. Cao, M., Dong, Y., Wu, J., Cheung, J. C. K. Proc Conf Empir Methods Nat Lang Process, 2020, 6251-6258 (2020).
  11. Yan, E. Evaluation & hallucination detection for abstractive summaries. , https://eugeneyan.com/writing/abstractive-summarization-evaluation/ (2021).
  12. Uekawa, A. Evaluation metrics for summarization. , https://dev.to/akuer/evaluation-metrics-for-summarization-1d7f (2023).
  13. Honnibal, M., Montani, I. spaCy 2: Natural language understanding with Bloom embeddings convolutional neural networks and incremental parsing. Zenodo. , (2017).
  14. Reinforcement learning from human feedback: Aligning large language models. , At https://neptune.ai/blog/reinforcement-learning-from-human-feedback (2023).
  15. Shakil, H., Farooq, A., Kalita, J. Abstractive text summarization: State of the art, challenges, and improvements. Neurocomputing. 603, 128255-128255 (2024).
  16. AI, Z. Reducing LLM hallucinations: A developer's guide. GetZep. , https://www.getzep.com/ai-agents/reducing-llm-hallucinations/ (2025).
  17. Ouyang, L., et al. Training language models to follow instructions with human feedback. Adv Neural Inf Process Syst. 2022, 27730-27744 (2022).
  18. Entity hallucination index in abstractive summarization-A metric. Praveenkumar, K., Balbantaray, R. C., Vittala, K. P. Proc Int Conf Commun Circuits Syst, 2023, 1-5 (2023).
  19. Multi-reward reinforced summarization with saliency and entailment. Pasunuru, R., Bansal, M. Proc Conf North Am Chapter Assoc Comput Linguist Hum Lang Technol, 2018, 646-653 (2018).
  20. Williams, R. J. Simple statistical gradient-following algorithms for connectionist reinforcement learning. Mach Learn. 8 (3-4), 229-256 (1992).
  21. Katwe NLP. EHI_XLSUM_XSUM_Finetuning. , GitHub. https://github.com/katweNLP/EHI_XLSUM_XSUM_Finetuning (2025).
  22. ELITR minuting corpus: A novel dataset for automatic minuting from multi-party meetings in English and Czech. Nedoluzhko, A., Singh, M., Hledíková, M., Ghosal, T., Bojar, O. Proc Int Conf Lang Resour Eval (LREC), 2022, 2623-2632 (2022).
  23. Don't give me the details, just the summary! Topic aware convolutional neural networks for extreme summarization. Narayan, S., Cohen, S. B., Lapata, M. Proc Conf Empir Methods Nat Lang Process, 2018, 1797-1807 (2018).
  24. Lewis, M., et al. Denoising sequence to sequence pre training for natural language generation, translation, and comprehension. Proc Annu Meet Assoc Comput Linguist. 2020, 7871-7880 (2020).
  25. Chung, H. W., et al. Scaling instruction fine-tuned language models. J Mach Learn Res. 25 (1), 1-53 (2024).
  26. Jiang, A. Q., et al. Mistral 7B. arXiv. , (2023).
  27. Chandra, C., Ojima, Y., Bendarkar, M. V., Mavris, D. N. Aviation BERT NER: Named entity recognition for aviation safety reports. Aerospace. 11 (11), 890-890 (2024).
  28. Lim, D. S. bert-base-NER. , https://huggingface.co/dslim/bert-base-NER (2021).
  29. Adam: A method for stochastic optimization. Kingma, D. P., Ba, J. Int Conf Learn Represent, , (2015).
  30. QAGS: Evaluating question answering and generation for summarization. Wang, A., Cho, K. Proc Conf Empir Methods Nat Lang Process, 2020, 390-402 (2020).
  31. Patil, S. valhalla/t5-small-qg-hl. , https://huggingface.co/valhalla/t5-small-qg-hl (2020).
  32. deepset/roberta-base-squad2. , Deepset GmbH. https://huggingface.co/deepset/roberta-base-squad2 (2020).
  33. Factually consistent summarization via reinforcement learning with textual entailment feedback. Roit, P., et al. Proc Annu Meet Assoc Comput Linguist, 2023, 8027-8044 (2023).
  34. Hallucination diversity aware active learning for text summarization. Xia, Y., et al. Proc Conf North Am Chapter Assoc Comput Linguist Hum Lang Technol, 2024, 3885-3900 (2024).
  35. Wei, Z., et al. TruthRL: Incentivizing truthful large language models via reinforcement learning. arXiv. , (2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Large Language ModelsEntity HallucinationText SummarizationEntity Hallucination IndexAbstractive SummarizationReinforcement LearningNamed Entity ExtractionModel Fine TuningSummarization RobustnessFactuality Improvement

Related Articles