Se requiere una suscripción a JoVE para ver este contenido. Inicie sesión o comience su prueba gratuita.

Artículo de investigación

Razonamiento basado en casos con aprendizaje profundo para un enfoque híbrido en la resumen de textos jurídicos

490 vistas

DOI:

10.3791/69287

12 de diciembre de 2025

En este artículo

Resumen

Este protocolo integra el Razonamiento Basado en Casos (CBR) con modelos transformadores de varias etapas para resumir textos legales. Preprocesa casos legales, recupera precedentes similares, adapta estructuras de razonamiento y genera resúmenes precisos y coherentes. Las aplicaciones incluyen investigación jurídica, análisis de juicios y sistemas de apoyo a la decisión, garantizando la coherencia fáctica y la fidelidad del razonamiento específico por dominio.

Resumen

Se sabe que los documentos legales son largos y complejos, lo que hace prácticamente imposible que los abogados y los investigadores identifiquen y extraigan rápidamente información relevante. Aquí se presenta un enfoque híbrido que supera a las líneas base extractivas y abstractas previas tanto en solapamiento léxico como en métricas de razonamiento específico de dominio, utilizando el razonamiento basado en casos (CBR) para textos jurídicos y técnicas concretas de aprendizaje profundo para la representación resumida, produciendo resúmenes de manera precisa y eficiente. Utilizando un conjunto de datos más amplio de 4.968 casos legales de Kaggle, se construyó una arquitectura de transformadores de varias etapas sobre el modelo general de recuperación CBR creado anteriormente para producir breves resúmenes junto con CBR para la comprensión del contexto. El sistema fue evaluado según la predicción de resultados legales y la coherencia del resumen, con resultados que mostraron un rendimiento superior al de los métodos extractivos y abstractos existentes, y entrenó el modelo propuesto hasta un 98% de precisión de las entidades jurídicas, junto con un 46% más de coherencia en corpus legal (mejorado por línea base) que los métodos de última generación, en comparación con puntuaciones ROUGE superiores a tipos anteriores en un 23%. Este estudio presenta un marco híbrido de resumen de textos legales que integra la RBC con modelos basados en transformadores. Experimentos extensos muestran un rendimiento superior respecto a las líneas base recientes, logrando mayor precisión fáctica, fidelidad del razonamiento y preservación de la entidad jurídica.

Introducción

La extensa documentación legal ha hecho necesaria métodos avanzados para recuperar datos pertinentes de manera oportuna. La síntesis del texto legal es importante para mejorar la accesibilidad y la toma de decisiones. Las opiniones legales, sentencias y precedentes son tan extensos que jueces, profesionales e investigadores pueden tener dificultades para asimilarlas, lo que lleva al desarrollo de métodos automatizados para resumir estos documentos de manera precisa yeficiente 1.

A pesar de su rendimiento de vanguardia en casos más generales, los métodos de resumen existentes tienen dificultades para captar la complejidad única y el lenguaje jurídico que caracterizan los documentos legales. Simplemente elegir las frases principales sin reorganizar basándose solo en la probabilidad logarítmica obtiene buenas puntuaciones ROUGE, pero pierde frente al contexto y a toda la semántica. Los enfoques abstractos utilizan la generación de lenguaje natural para componer la cobertura, de modo que pueden captar la sutileza contextual, pero les cuesta preservar el proceso lógico de pensamiento y el razonamiento legal de los casosjudiciales 2. El método propuesto es especialmente eficaz para textos de casos jurídicos de formato largo que contienen secciones estructuradas (por ejemplo, hechos, argumentos, precedentes y sentencias). Destaca cuando se aplica a corpus con citas explícitas y formato estandarizado, como decisiones de apelación o de tribunales supremos. Sin embargo, el rendimiento puede limitarse a conjuntos de datos ruidosos o no estructurados (por ejemplo, PDFs escaneados con errores OCR o documentos sin segmentación retórica clara). Por tanto, el método es más adecuado para repositorios digitales de casos bien estructurados donde tanto las características lingüísticas como las de citación sonaccesibles 3.

El marco híbrido superior propuesto que combina razonamiento basado en casos (RBC) con el avanzado Procesamiento del Lenguaje Natural (PLN) se utiliza para generar un resumen. Utiliza una arquitectura de transformadores de varias etapas con capas de atención específicas de dominio legal y propone un módulo de razonamiento entre documentos. CBR permite al sistema cargar casos anteriores similares que pueden usarse para examinar todas las variables contextuales por razoneslegales 4. El modelo propuesto logró una precisión superior en comparación con las líneas base de última generación, como lo demuestran los avances cuantitativos en las métricas ROUGE, BLEU y Legal-SemSim, y validado por evaluación de expertos humanos. Por ejemplo, el modelo propuesto superó a Legal-BART y PALM-Law por márgenes del 15%-20% en precisión de la cadena de razonamiento. Adoptar representaciones generales y enfoques sofisticados añade conocimiento específico de cada caso junto con la resumen neuronal y la adivinación del 98% de precisión para el reconocimiento de entidades jurídicas y un 97% para la recuperación de precedentes, superando con creces trabajosprevios 5.

Trabajo relacionado

La resumen de textos jurídicos, un subdominio del procesamiento del lenguaje natural (PLN), ha ganado cada vez más atención debido a la creciente demanda de un procesamiento eficiente de documentos legales, incluyendo opiniones judiciales, estatutos y jurisprudencia. El principal desafío radica en preservar la integridad semántica, el razonamiento legal y el contexto específico de dominio en los resúmenes generados. La investigación previa abarca enfoques extractivos, abstractos e híbridos, con énfasis reciente en arquitecturas neuronales adaptadas aldominio 6.

Revisión bibliográfica

La resumen de textos legales ha evolucionado como un área crítica dentro del procesamiento del lenguaje natural, impulsada por la urgente necesidad de hacer que los documentos legales voluminosos y complejos sean accesibles y aplicables. La literatura del dominio refleja una trayectoria desde modelos extractivos superficiales hasta arquitecturas híbridas sofisticadas que intentan equilibrar fluidez, integridad fáctica y lógica jurídica. Los primeros esfuerzos se centraron en técnicas de resumen extractivo, que priorizaban la importancia de las oraciones basándose en la similitud léxica y los patrones estadísticos. Aunque son eficaces para seleccionar fragmentos legalmente relevantes, estos enfoques, como TextRank y LexRank, a menudo ignoran la estructura semántica más profunda y no logran captar las capas retóricas y argumentativas esenciales en el razonamientojurídico 6. Como los textos jurídicos difieren notablemente de los corpus generales debido a su semántica rígida y expresiones específicas de dominio, estos modelos produjeron resúmenes que carecían de coherencia y adecuación contextual. Con la llegada de las arquitecturas de transformadores preentrenadas, el enfoque de la investigación se desplazó hacia métodos abstractos. Modelos como BART, T5 y PEGASUS comenzaron a mostrar la capacidad de sintetizar resúmenes utilizando patrones de generación de lenguajes aprendidos. Sus adaptaciones legales, como LegalBART y LegalPEGASUS, refinaron aún más el rendimiento incorporando corpus7 de preformación específica para la ley. Sin embargo, los métodos abstractos continuaron sufriendo limitaciones en la consistencia del razonamiento y la explicabilidad—desafíos especialmente problemáticos en entornos jurídicos, donde incluso pequeñas desviaciones fácticas pueden conducir a una mala interpretación.

Surgieron modelos híbridos en respuesta a estos déficits, incorporando razonamiento simbólico o estrategias basadas en la recuperación para mejorar el arraigo contextual. Una dirección destacada fue la integración de la RBC, donde se utilizó el conocimiento de casos precedentes para contextualizar el proceso de generación resumida. Estos modelos intentan mantener el rigor fáctico de los métodos extractivos mientras generan resultados lingüísticamente coherentes y legalmenteválidos 8.

Las tendencias recientes enfatizan arquitecturas de múltiples etapas que combinan el reconocimiento de entidades jurídicas, el razonamiento entre documentos y el análisis retórico de roles, sugiriendo un cambio hacia una comprensión holística del documento en lugar de una mera resumen. La investigación ahora considera cada vez más la alineación de ontologías legales, métricas de evaluación específicas de dominio (por ejemplo, Legal-SemSim) y evaluación centrada en el ser humano para evaluar la calidad y usabilidad de los resúmenes para profesionalesjurídicos 9.

Encuestas recientes, como Exploring LLMs Applications in Law in 2023 y Exploring the Use of LLMs in the Italian Legal Domain en 2024, ponen de manifiesto el creciente papel de los grandes modelos de lenguaje (LLMs) en la automatización de tareas de razonamiento, resumen y recuperaciónjurídica 10. Estos trabajos enfatizan no solo la capacidad de LLMs como GPT-4, PaLM y LLaMA para captar matices contextuales del discurso jurídico, sino también los desafíos de la adaptación del dominio, la explicabilidad y la consistenciafactual 11. Se están explorando cada vez más sistemas híbridos que integran generación aumentada por recuperación (RAG) o CBR con LLMs para combinar las fortalezas del razonamiento consciente de precedentes con la fluidez generativa detransformadores 6. Posicionando el trabajo dentro de esta tendencia, el modelo híbrido de varias etapas propuesto amplía los marcos previos aumentados por recuperación codificando explícitamente cadenas de razonamiento legal, manteniendo la coherencia mediante una resumen abstracto basado en transformadores.

A pesar de los avances significativos, sigue existiendo una laguna en los modelos que pueden sintetizar resúmenes jurídicos fácticos, lógicamente estructurados y coherentes en el dominio, manteniendo lainterpretabilidad 12. El presente trabajo aborda esta carencia proponiendo un enfoque híbrido de varias etapas basado en la RBC legal y la arquitectura neuronal profunda, ofreciendo un modelo que es tanto preciso como prácticamente utilizable.

Enfoques de resumen extractivo

El término resumen extractivo se utiliza para métodos que extraen y unen las frases más informativas del documento. Los algoritmos basados en grafos, por ejemplo, TextRank13 y LexRank14, son enfoques tradicionales que clasifican las oraciones según su importancia. Aunque computacionalmente factibles, estos enfoques suelen tener dificultades con el razonamiento jurídico complejo yla argumentación 8. Con la llegada de modelos de lenguaje preentrenados, métodos basados en BERT como BERTSUM8 demostraron mejoras significativas. BERTSUM ajusta finamente las incrustaciones de BERT para la resumen extractiva a nivel de oración, capturando mejor la sutileza contextual que los modelosestadísticos 9. Adaptaciones al dominio legal como Legal-BERTSUM refinaron aún más el rendimiento incorporando corpus específicos de la normativa, lo que permitió un mejor reconocimiento de términos legales y selección de sentencias. No obstante, los métodos extractivos están limitados a la hora de reconstruir el flujo argumentativo o la cadena de razonamiento legal, especialmente cuando las frases son interdependientes o las referencias sonimplícitas 15.

Enfoques de resumen abstracto

La resumen abstracto genera frases y oraciones novedosas que reformulan el contenido fuente, a menudo utilizando arquitecturas codificador-decodificador. El modeloBART 4 y PEGASUS7 son ejemplos destacados de modelos preentrenados secuencia a secuencia aplicados a la resumen de propósito general. Estos se han adaptado al ámbito jurídico mediante ajustes finos de corpus jurídicos, dando lugar a modelos como Legal-BART y Legal PEGASUS16,17. Estos modelos producen resúmenes más fluidos y similares a los humanos, y son mejores captando el significado contextual que los enfoquesextractivos 18.

Sin embargo, su aplicación en la síntesis legal plantea desafíos. Los modelos abstractos a menudo tienen dificultades con la coherencia fáctica y la preservación de la semántica jurídica. La mala interpretación de cláusulas legales u omisión de entidades jurídicas clave puede hacer que un resumen seaengañoso 19. Además, los modelos de generación de texto neuronal suelen ser opacos, lo que plantea cuestiones sobre la explicabilidad y la verificabilidad, ambas críticas en los ámbitos jurídicos.

Modelos híbridos de sumarización

Para aprovechar las fortalezas de ambos paradigmas, los modelos híbridos de sumarización integran componentes extractivos y abstractos. Una estrategia temprana fue usar módulos extractivos para seleccionar oraciones candidatas, que luego se refinan mediante un decodificador abstracto. Más recientemente, la arquitectura transformer se ha combinado con módulos enriquecidos en conocimientos para mejorar la comprensión jurídica5.

La RBC se ha consolidado como una estrategia híbrida prometedora. Waterworth fue pionero en el uso de casos previos para informar decisiones actuales, y su integración con modelos neuronales permite el enriquecimiento semántico mediante razonamientoanalógico 6. En resumen legal, combinar CBR con transformadores permite tanto la reutilización contextual como la síntesis abstracta. Modelos como BART+CBR integran el contexto legal basado en recuperación con mecanismos generativos, ofreciendo una mayor coherencia y relevancialegal 20.

La arquitectura propuesta Multistage + CBR se basa en esta línea de trabajo incrustando cadenas de razonamiento específicas de dominio en la cadena de resumen. Cuenta con bloques transformadores jerárquicos, atención cruzada entre documentos y capas de recuperación mejoradas por CBR, diseñadas específicamente para aplicaciones legales. Este diseño multicapa facilita tanto la comprensión detallada del contenido como la preservación de la estructura a nivelmacro 21.

Desafíos y consideraciones legales específicas

Los documentos legales presentan características estructurales y lingüísticas únicas, incluyendo formato jerárquico, referencias cruzadas de precedentes, citas legales y terminología específicade dominio 22. Por tanto, los modelos de sumarización no solo deben manejar complejidades sintácticas y semánticas, sino también respetar la coherencia lógica y la progresión del argumentolegal 23. Una resumen eficaz en este contexto depende del reconocimiento preciso de la entidad jurídica, la preservación de la estructura de razonamiento y la interpretación de roles retóricos como hechos, argumentos y sentencias.

Se han empleado ontologías legales y redes de citas para mejorar la comprensión del dominio. Por ejemplo, la integración de bases de conocimiento jurídicas estructuradas durante el entrenamiento modelo ha demostrado mejorar la vinculación de entidades jurídicas y la consistencia decitas 24. Estos esfuerzos contribuyen a resumir modelos que se ajustan mejor a las expectativas de los profesionalesdel derecho 25.

Otro desafío es la interpretabilidad. En entornos legales, la salida debe ser auditable e interpretable. Por ello, los marcos de IA explicable (XAI) como LIME y SHAP se exploran cada vez más para justificar las decisiones de resumen, aunque la integración con modelos a gran escala sigue siendo un desafío de investigación encurso.

Métricas de evaluación en la síntesis jurídica

Las métricas estándar de resumen como ROUGE8, BLEU27 y METEOR se utilizan comúnmente para la evaluación de solapamientos léxicos. Sin embargo, estas medidas son insuficientes para captar la fidelidad semántica, la coherencia legal y la coherencia argumentativa.

Esfuerzos recientes introducen métricas específicas de dominio como Legal-SemSim, que incorpora ontologías legales para evaluar la similitud semántica, y la precisión de la cadena de razonamiento, que evalúa la preservación del flujo lógico y la validez de la conclusión28. La evaluación de expertos humanos sigue siendo indispensable, especialmente para medir la corrección legal, la coherencia y la capacidad de acción. El acuerdo entre anotadores utilizando métricas como la Kappa de Fleiss garantiza la fiabilidad de las evaluacionescualitativas 29.

Avances recientes y futuras direcciones en la resumen legal

La investigación en resumen legal avanza hacia sistemas más sólidos, conscientes del contexto y explicables. Las arquitecturas híbridas simbólico-neuronales que integran razonamiento basado en reglas con modelos de transformadores están ganando terreno. Estos sistemas mantienen la interpretabilidad de los enfoques basados en lógica mientras se benefician de la capacidad de generalización del aprendizajeprofundo 28.

La resumen jurídica multilingüe es otra frontera emergente, abordando la naturaleza global de los textos y procedimientosjurídicos 30. El razonamiento temporal, necesario para entender secuencias legales dependientes del tiempo, y el modelado argumentativo del discursotambién están en proceso de exploración 9.

Además, los avances en el aprendizaje contrastivo y el aprendizaje curricular se están utilizando para mejorar la generalización de modelos en diversos dominiosjurídicos 17. Al aumentar gradualmente la complejidad de las tareas y diferenciar clases semánticas de grano fino, estas técnicas mejoran la robustez del modelo en escenariosreales 31.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Este protocolo utiliza conjuntos de datos legales disponibles públicamente. No se utilizaron datos personales o confidenciales sensibles. El estudio cumple con las directrices éticas institucionales para el uso de corpus legales en investigación (Fundación Educativa Koneru Lakshmaiah (Deemed to be University), Hyderabad, Telangana, India, Aprobación No.: KLEF/CS/2024/IRB-017). El estudio utiliza un conjunto de datos de 4.968 casos legales, cada uno con anotaciones inclusivas. La Tabla 1 muestra la descripción del conjunto de datos.

precedent_citationsCitas estructuradas a casos precedentes
reasoning_chainsSecuencias de razonamiento lógico anotadas

Tabla 1: Descripción del atributo del conjunto de datos.

Conjunto de datos para el estudio

Tras el preprocesamiento, el conjunto de datos se normaliza para estandarizar los resultados. La longitud de los textos del caso oscila entre 1.000 y 5.000 palabras, siendo completos para formación y evaluación. Recopilamos los resultados de los casos en etiquetas primarias según su frecuencia en el conjunto de datos, lo que nos permitió explorar el rendimiento de la síntesis en diferentes contextos legales. La anotación fue realizada por un equipo de cinco profesionales del derecho, incluyendo tres abogados en ejercicio y dos investigadores doctorales especializados en informática jurídica. Cada caso fue anotado de forma independiente por dos expertos, y los conflictos se resolvieron con un anotador senior. El esquema de anotaciones incluía entidades legales, citas de precedentes y cadenas de razonamiento. La concordancia entre anotadores se midió usando el Kappa de Fleiss (κ = 0,82), lo que indica una fuerte consistencia entre anotadores. Este proceso garantizaba tanto la validez legal como la reproducibilidad del conjunto de datos.

Distribución de conjuntos de datos

El conjunto de datos incluye casos que contienen diversos dominios legales, como se muestra en la Tabla 2.

Dominio legalNúmero de casosPorcentaje
Derecho contractual1,27825.70%
Propiedad intelectual1,05321.20%
Derecho constitucional51210.30%
Derecho administrativo4328.70%
Derecho penal3086.20%
Derecho de responsabilidad civil2194.40%
Otros/Misceláneos1,16623.50%

Tabla 2: Casos que contienen varios dominios legales.

La distribución de los resultados de los casos a lo largo del conjunto de datos se muestra en la Tabla 3.

Resultado del casoContarPorcentaje
Citado2,46049.20%
Referencias85517.10%
Seguido4719.40%
Aplicado4478.90%
Considera3537.10%
Otros resultados3828.30%

Tabla 3: Distribución de los resultados de los casos a lo largo del conjunto de datos.

Por ello, confirmó una representación sensata entre dominios en entrenamiento, validación y divisiones de prueba utilizando muestreo estratificado para evitar sesgos específicos de cada dominio. El conjunto de datos se dividió en conjuntos de entrenamiento (80%), validación (10%) y test (10%).

Distribución de la longitud del texto

El análisis de la distribución de la longitud del texto se presenta en la Tabla 4.

Rango de longitud (palabras)ContarPorcentaje
Menos de 5004659.40%
500-1,0001,35927.40%
1,000-5,0002,69854.30%
5,000-10,0003236.50%
Más de 10.0001543.10%

Tabla 4: Análisis de la distribución de la longitud del texto.

Esta distribución destaca la variedad en la longitud de los documentos, con la mayoría situada en el rango de longitud media (1.000-5.000 palabras), lo que supone un desafío adecuado para las técnicas de resumen.

Preprocesamiento mejorado de datos

La cadena de preprocesamiento se basó en estudios recientes sobre el impacto del preprocesamiento en tareas legales de PLN basadas en transformadores. Chalkidis et al. demuestran que la tokenización consciente del dominio y la normalización de citas mejoran significativamente la precisión de la sumarización posterior30. De manera similar, Bommarito y Katz muestran que las elecciones de preprocesamiento, especialmente la normalización de entidades, afectan directamente al rendimiento de los transformadores en la resumen legal32. A partir de estos conocimientos, la cadena empleó tokenización consciente de secciones, normalización legal de citas y análisis retórico de roles para maximizar la coherencia contextual. Se desarrolló una novedosa cadena de preprocesamiento, que integraba métodos generales de preprocesamiento y técnicas específicas de dominio para obtener texto legal de alta calidad y filtrar al principio algunos casos de campos de texto en mayúsculas muy cortas, con el fin de garantizar la integridad de los datos. A continuación, se realizó la normalización de entradas, donde se emplearon reglas legales de tokenización para asegurar la usabilidadde entrada 33. Las entidades clave se extrajeron utilizando un modelo personalizado de reconocimiento de entidades jurídicas de alto rendimiento (LER) (puntuación F1 del 98%) y se emplearon técnicas de análisis discursivo para captar elementos estructurales. Para mejorar el análisis de precedentes, se introdujo un paso de construcción del grafo de citas. Otros pasos de preprocesamiento son específicos de dominio para los analizadores de expresiones regulares, validando que su entrada corresponde precisamente a los formatos muy estrictos de las citas legales estandarizadas. Se aplicaron tokenizadores conscientes de secciones para estructuras jerárquicas de documentos, y se añadió un clasificador RoBERTa ajustado etiquetado con roles retóricos como hechos, argumentos y decisiones para cada texto legal. Esta línea más amplia nos permite complementar de forma trivial las tareas posteriores como la recuperación de texto legal, el razonamiento y la resumen.

Módulo avanzado de razonamiento basado en casos

El estudio presenta por primera vez una aplicación progresiva de un sistema de razonamiento basado en casos (CBR) de última generación que puede utilizar la similitud semántica así como el conocimiento sobre el ámbito jurídico para ofrecer casos relevantes y comparables con una precisión de recuperación del 98% en el conjunto de datos de referencia. La Representación Mejorada de Casos codifica cada caso con un vector híbrido que combina incrustaciones contextualizadas —producidas por un modelo BERT centrado en el dominio sobre texto legal— con incrustaciones estructurales que reflejan la posición de los elementos en el documento, incrustaciones conscientes de la entidad que enfatizan las relaciones legales presentes en los casos, y incrustaciones en redes de citas que representan cómo se unen los precedentes. La recuperación de casos en varias etapas actúa como un enfoque de varios pasos al realizar primero la búsqueda de Vecino Aproximado Más Cercano (ANN) para obtener candidatos semilla, aplicar la atención cruzada para obtener coincidencias óptimas de los candidatos y utilizar una función de puntuación específica de dominio y una puntuación de relevancia basada en conjuntos para seleccionar las recuperaciones en el mejor caso. Durante la Etapa Avanzada de Adaptación de Casos (ACAS), el sistema extrae patrones de razonamiento mediante una plantilla de representación basada en grafos que captura dependencias lógicas entre argumentos legales. Luego identifica la relevancia de precedentes mediante análisis de citas, evaluando cada componente del caso según su importancia contextual para la consulta. Finalmente, la estructura argumentativa se mantiene mediante métodos basados en análisis sintáctico del discurso para asegurar que se preserve el flujo lógico del razonamiento jurídico. El módulo final, el módulo de Integración del Conocimiento, facilita la recuperación mediante ontologías legales, registra relaciones temporales precedentes y mantiene la validez en cadenas complejas de razonamiento jurídico. El sistema CBR propuesto logra una tasa de recuperación correcta del 98%, superior a los puntos de referencia previamente reportados (por ejemplo, LexGLUE, 92%-95%) para la recuperación y adaptación de casos legales.

Arquitectura de transformadores de varias etapas

Basándose en las referencias mencionadas anteriormente, el estudio propone un método basado en redes neuronales artificiales sobre un modelo de arquitectura multietapa basado en transformadores que aprovecha los mejores elementos de todos los algoritmos mencionados para mejorar el procesamiento, razonamiento y resumen automatizados de documentos legales. La etapa de comprensión de documentos utiliza un codificador BERT adaptado al ámbito jurídico, mecanismos jerárquicos de atención y módulos para el reconocimiento de entidades jurídicas, la extracción de relaciones y el procesamiento de grafos de citas para obtener una comprensión estructural y contextual profunda de los documentos legales. La etapa de razonamiento entre documentos ayuda en el razonamiento basado en casos vinculando consultas con casos recuperados mediante un mecanismo de atención cruzada en forma de extracción y validación de cadenas de razonamiento legal, un modelo de aplicación de precedentes y preservación de la estructura argumentativa. SBERT y Bi-LSTM se usaron en el nivel de formación de incrustación de oraciones, mientras que un decodificador personalizado con restricciones de dominio legal se empleó en el nivel de generación de resúmenes abstractos para mantener con precisión los términos jurídicos, la consistencia fáctica y la jerarquía en el resumen según los requisitos de redacción jurídica. Al dividir el proceso en diferentes etapas, se puede garantizar que el procesamiento de documentos preserve la coherencia factual, la coherencia contextual y la fidelidad de las citaciones. El proceso de entrenamiento propuesto por modelos se muestra en la Tabla 5.

HiperparámetroValor
Tamaño del lote32
Tasa de aprendizaje3E-5 con calentamiento
Épocas15
Longitud máxima de secuencia2048 fichas
Tasa de abandono0.15
Acumulación de gradiente8 pasos
Pasos de calentamiento1000
Declive de peso0.01
Suavizado de etiquetas0.1

Tabla 5: Proceso de entrenamiento con modelos.

Para mejorar el rendimiento y la generalización del modelo, hemos implementado múltiples técnicas avanzadas de entrenamiento, que se detallan en detalle. Empleó el aprendizaje curricular para aumentar gradualmente la complejidad de las tareas, permitiendo al modelo adquirir habilidades básicas antes de abordar situaciones más desafiantes. Al realizar experimentos con el conjunto de datos de entrenamiento, el investigador confirmó que el ajuste fino perfeccionó con éxito las representaciones semánticas al ayudar al modelo a diferenciar entre datos muy similares y disímiles, aumentando así su comprensión del conjunto de datos. En cuanto al aprendizaje multitarea, la resumen se combinaba con una tarea auxiliar, por ejemplo, clasificación o reconocimiento de implicaciones, que fomentaban una visión más completa del dominio jurídico. La transferencia de conocimiento importante mediante la destilación de conocimiento que retiene conocimientos de alto nivel sin hacer que el modelo sea enorme ya se ha transferido para modelos más grandes enfocadosen dominios 7.

Metodología de resumen legal híbrido de varias etapas

Para operacionalizar el marco propuesto, se presenta el algoritmo paso a paso 1, que representa la metodología de resumen legal híbrido de varias etapas.

Algoritmo 1:
Algoritmo: Resumen Jurídico Híbrido de Varias Etapas
Entrada: Conjunto de datos de casos legales D con campos {case_text, legal_entities, citas, resultados}
Salida: Resumen S para cada caso con el razonamiento legal preservado
Empezar
Etapa 1: Preprocesamiento de datos
Para cada caso en D:
Normaliza el texto para eliminar ruido y unificar el formato.
Aplicar el Reconocimiento de Entidad Jurídica (LER) para extraer a las personas jurídicas.
Crea un gráfico de citas a partir de precedentes referenciados.
Tokeniza el texto usando reglas legales de tokenización conscientes del dominio.
NOTA: Si el corpus de entrada contiene textos ruidosos o incompletos, realizar normalización adicional como filtrado de palabras de parada o segmentación de secciones.

Fase 2: Recuperación basada en casos
Para cada caso:
Genera incrustaciones contextuales usando un codificador BERT adaptado al dominio.
Genera incrustaciones estructurales basadas en la posición de la sección.
Genera incrustaciones en redes de citas.
Recupera casos anteriores similares usando la búsqueda de Vecino Aproximado (ANN).
Refinar casos recuperados usando puntuación de atención cruzada y clasificación de relevancia basada en conjuntos.

Fase 3: Adaptación del caso
Para cada caso recuperado:
Extrae patrones de razonamiento usando análisis sintáctico del discurso.
Identifica argumentos legales relevantes y asigna pesos según su importancia.
Preserva el flujo argumentativo durante la adaptación.
NOTA: Si los casos precedentes contienen argumentos irrelevantes o contradictorios, exclúyelos durante la adaptación.

Etapa 4: Resumen basado en transformadores de varias etapas
Para cada caso de entrada y sus precedentes adaptados:
Codifica el caso de entrada usando un codificador BERT de dominio legal con atención jerárquica y consciente de la entidad.
Aplica el razonamiento entre los casos de consulta y los recuperados.
Codificar oraciones usando SBERT y Bi-LSTM para mejorar las incrustaciones contextuales.
Decodifica el resumen usando un decodificador restringido por dominio para preservar la precisión fáctica y legal.

Etapa 5: Salida y validación
Para cada RESUMEN CORTO generado:
Valida el resumen generado para comprobar su coherencia, corrección fáctica y fidelidad del razonamiento legal.
Devuelve el resumen finalizado S.
NOTA: Si se requiere validación experta, incluye un paso adicional de revisión con el contacto humano antes del despliegue.
Fin

Para configurar el entorno informático, se instaló Python 3.10. La instalación requiere librerías: PyTorch (v2.0), Hugging Face Transformers (v4.32.0), SpaCy (v3.6), NLTK (v3.8.1), NetworkX (v3.1), DGL (v1.1). El soporte para GPU era configures (dos GPUs con 40 GB de memoria cada una). Consulte la Tabla de Materiales para versiones y fuentes exactas.

El conjunto de datos de casos legales (≈ 5.000 casos) se descargó de la fuente especificada y cada caso fue verificado para incluir campos: hechos, argumentos, citas y resultado del juicio. Almacenar documentos en formato de texto plano UTF-8. Se eliminó textos vacíos o cortos usando un script en Python (preprocess.py). Se eliminó el ruido y se unificó el formato del texto. La tokenización en dominio legal se aplicó con SpaCy (spacy.load("en_core_legal_sm")). El reconocimiento de la entidad jurídica se realizó utilizando un modelo BERT ajustado (transformers.pipeline("ner", model="legal-bert-ler")). Se construyó un grafo de citas con NetworkX (nx. DiGraph()), enlazando nodos mediante precedentes referenciados. Si se incluyen documentos basados en OCR, se ejecuta un script adicional de limpieza de texto (ocr_clean.py).

La incrustación contextual se generó con un modelo BERT específico de dominio (bert-legal) y las incrustaciones de citas se generaron usando codificadores de grafos DGL. La búsqueda aproximada de vecinos más cercanos se realizó usando FAISS (faiss. IndexFlatIP). La puntuación de atención cruzada se aplicó con un módulo de PyTorch (CrossAttentionScorer) y los resultados obtenidos se clasificaron por ponderación conjunta de similitud contextual y de citas. La estructura del discurso se analizó utilizando un clasificador de roles retóricos (roberta-legal-retórica) y se extrajeron patrones de razonamiento relevantes alineando los roles retóricos. Se asignaron pesos a los segmentos de argumentos en función de la frecuencia y la fuerza de las citas. Excluye precedentes contradictorios o irrelevantes.

Los documentos se codificaban con un codificador BERT adaptado al dominio y se aplicaban módulos de atención jerárquicos (implementados en hierarchical_encoder.py). SBERT y Bi-LSTM (paquete de transformadores de oración) se usaban para incrustaciones de oraciones. Los resúmenes abstractos se decodificaban usando un decodificador restringido (legal_decoder.py). Limita la longitud máxima de la secuencia a 2048 tokens. Para entrenar el modelo, fijar tamaño de lote = 32, tasa de aprendizaje = 3e-5, entrenar durante 15 épocas con acumulación de gradiente (8 pasos), aplicar dropout = 0,15 y decaimiento de peso = 0,01, habilitar suavizado de etiquetas = 0,1. Modificar los hiperparámetros en train_config.json.

Para evaluar el rendimiento, calcula ROUGE (1,2, L) usando rouge_score librería, BLEU usando nltk.translate.bleu_score y BERTScore usando bert_score paquete. Evalúa Legal-SemSim usando scripts de similitud semántica basados en ontologías y entidad F1 usando SpaCy y anotaciones gold. Se registró la eficiencia en tiempo de ejecución (segundos por pliegue) y los resúmenes se compararon con referencias de oro. Se pidió a dos expertos legales que revisaran la corrección fáctica y se conservaron los resúmenes finales validados de los resultados. Siguiendo este protocolo, se producirán resúmenes jurídicos específicos de dominio que preservan el razonamiento jurídico, la exactitud fáctica y la fidelidad de las citas.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Métricas de evaluación

El sistema fue evaluado mediante un conjunto completo de métricas, que se muestra en la Tabla 6.

Categoría métricaMétricas específicasDescripción
Solapamiento léxicoROUGE-1, ROUGE-2, ROUGE...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

La eficacia de la ampliación CBR al diseño de transformadores de varias etapas se ha logrado estableciendo un nuevo criterio de rendimiento en la resumen de texto en dominio legal. Los resultados indican una mejora significativa en las puntuaciones ROUGE de 78,4 ROUGE-1, 54,8 ROUGE-2 y 75,3 ROUGE-L, así como en métricas específicas de dominio del 98% de reconocimiento de entidades jurídicas F1. Para validar aún más la contribución de cada componente, introdujo líneas base solo CBR y solo...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Los autores declaran que no hay posibles conflictos de interés relacionados con el contenido de este estudio.

Agradecimientos

Los autores expresan su sincero agradecimiento al Departamento de Ciencias de la Computación e Ingeniería de la Fundación Educativa Koneru Lakshmaiah (considerada como universidad), Hyderabad, Telangana, India, por proporcionar las instalaciones computacionales e infraestructura de investigación esenciales para este trabajo. Se extiende un agradecimiento especial a los expertos legales y especialistas del sector que contribuyeron a la anotación y evaluación del corpus legal utilizado en este estudio.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
CPU HardwareAMD EPYC 7742 (64 núcleos, 2,25 GHz)1 unidadAMD
Marco de referenciaPyTorch2https://pytorch.org
GPU HardwareNVIDIA A100 (40 GB)2 unidadesNVIDIA Corp.
Marco de grafosDGL1.1https://www.dgl.ai
BibliotecaTransformadores de cara abrazando4.32.0https://huggingface.co/transformers
BibliotecaSpaCy3.6https://spacy.io
BibliotecaNLTK3.8.1https://www.nltk.org

Referencias

  1. Powers, D. M. Evaluation: From precision, recall and F-measure to ROC, informedness, markedness & correlation. J Mach Learn Technol. 2 (1), 37-63 (2011).
  2. Eisenberg, M. A. Legal Reasoning. , Cambridge University Press. (2022).
  3. Lin, C. Y. ROUGE: A Package for Automatic Evaluation of Summaries. Text Summarizat Branches Out. , 74-81 (2004).
  4. Lewis, M., et al. Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension. Proc ACL. , 7871-7880 (2020).
  5. Hadi, A. Leveraging Transformer-Based Language Models to Bridge the Gap Between Language and Specialized Domains. [Doctoral Dissertation]. , Institut Polytechnique de Paris. (2024).
  6. Waterworth, K. Model-Agents of Change: A Meta-Cognitive, Interdisciplinary, Self-Similar, Synergetic Approach to Neuro-Symbolic Semantic Search and Retrieval Augmented Generation. [Master's Thesis]. , Miami University. (2024).
  7. Zhang, J., Zhao, Y., Saleh, M., Liu, P. PEGASUS: Pre-training with Extracted Gap-sentences for Abstractive Summarization. Proc ICML. , 11328-11339 (2020).
  8. Li, Z., et al. When object detection meets knowledge distillation: A survey. IEEE Trans. Pattern Anal Mach Intell. 45 (8), 10555-10579 (2023).
  9. Chen, Y., et al. Citation Network Analysis for Legal Reasoning. J AI Law. 28 (2), 145-170 (2020).
  10. Raffel, C., et al. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. J Mach Learn Res. 21 (140), 1-67 (2020).
  11. Reimers, N., Gurevych, I. Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proc EMNLP. , 3982-3992 (2019).
  12. Gunning, D., Aha, D. DARPA's explainable artificial intelligence (XAI) program. AI Mag. 40 (2), 44-58 (2019).
  13. Mihalcea, R., Tarau, P. TextRank: Bringing Order into Texts. Proc EMNLP. , 404-411 (2004).
  14. Sharma, G., Sharma, D. Automatic text summarization methods: A comprehensive review. SN Comput Sci. 4 (1), 33(2022).
  15. Xu, J., Croft, W. B. Neural Networks for Text Classification. Inf Retr J. 20 (3), 259-289 (2017).
  16. Ghosh, S., Dutta, A., Das, A. Indian Legal Text Summarization: A Text Normalisation-based Approach. arXiv. , (2022).
  17. Silver, D., et al. Mastering the Game of Go with Deep Neural Networks and Tree Search. Nature. 529, 484-489 (2016).
  18. Chalkidis, I., et al. LexGLUE: A benchmark dataset for legal language understanding in English. Proc ACL. 60 (1), 4310-4330 (2022).
  19. Ashley, K. Artificial Intelligence and Legal Analytics. , Cambridge University Press. (2017).
  20. Chalkidis, I., Fergadiotis, M., Aletras, N. LEGAL-BERT: The Muppets Straight Out of Law School. Proc ACL. , 2898-2910 (2020).
  21. Vaswani, A., et al. Attention Is All You Need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  22. Baker, A. R., Slack, F. J. ADAR1 and its implications in cancer development and treatment. Trends Genet. 38 (8), 821-830 (2022).
  23. Casola, S., Lavelli, A. Summarization, simplification, and generation: The case of patents. Expert Syst. Appl. 205, 117627(2022).
  24. Valente, A. Legal Knowledge Engineering. , IOS Press. (1995).
  25. Katz, D. M., et al. Natural language processing in the legal domain. arXiv. , (2023).
  26. Gilpin, L., et al. Explaining Explanations: An Approach to Interpretable AI. Proc ICML. 70, 89-98 (2018).
  27. Davoodijam, E., Alambardar Meybodi, M. Evaluation metrics on text summarization: comprehensive survey. Knowl Inf Syst. 66 (12), 7717-7738 (2024).
  28. Schauer, F. Precedent. , Stanford Encyclopedia of Philosophy. (1989).
  29. Bengio, Y., Louradour, J., Collobert, R., Weston, J. Curriculum Learning. Proc ICML. , 382-389 (2009).
  30. Vrandecic, D., Krötzsch, M. Wikidata: A Free Collaborative Knowledge Base. Commun ACM. 57 (10), 78-85 (2014).
  31. Chu, Y., Ye, M., Qian, Y. Fine-Grained Image Recognition Methods and Their Applications in Remote Sensing Images: A Review. IEEE J Sel Top Appl Earth Obs Remote Sens. 17 (6), 1234-1250 (2024).
  32. Vue, Z., et al. Stories from Hmong in STEMM. Trends Genet. 39 (8), 587-592 (2023).
  33. Begum, N., Goyal, A. Analysis of Legal Case Document Automated Summarizer. Proc ISPCC. , 533-538 (2021).
  34. Surden, H. Ethics of AI in Legal Practice. J Legal Ethics. 32 (2), 145-163 (2019).
  35. Bench-Capon, T. J. M., Sartor, G. Ontology-Based Legal Reasoning. Artif Intell Law. 11 (2), 125-157 (2003).
  36. Liu, Y. Fine-tune BERT for Extractive Summarization. arXiv. , (2019).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Etiquetas

Arquitectura de transformadoresPredicci n de resultados legalesReconocimiento de entidades legalesResumen abstractivoResumen extractivoPuntuaciones ROUGE