É necessária uma assinatura do JoVE para visualizar este conteúdo. Faça login ou inicie seu teste gratuito.

Artigo de investigação

Raciocínio Baseado em Casos com Aprendizado Profundo para uma Abordagem Híbrida de Sumarização de Textos Jurídicos

490 vistas

DOI:

10.3791/69287

12 de dezembro de 2025

Neste artigo

Resumo

Esse protocolo integra Raciocínio Baseado em Casos (CBR) com modelos transformadores de múltiplos estágios para resumir textos jurídicos. Ele pré-processa casos jurídicos, recupera precedentes semelhantes, adapta estruturas de raciocínio e gera resumos precisos e coerentes. As aplicações incluem pesquisa jurídica, análise de julgamentos e sistemas de suporte à decisão, garantindo consistência factual e fidelidade do raciocínio específico para cada domínio.

Resumo

Documentos jurídicos são conhecidos por serem longos e complicados, o que torna praticamente impossível para profissionais jurídicos e pesquisadores identificarem e extraírem rapidamente informações relevantes. Aqui, é apresentada uma abordagem híbrida que supera as linhas de base extrativas e abstratas anteriores tanto em sobreposição lexical quanto em métricas de raciocínio específico de domínio, utilizando o Raciocínio Baseado em Casos (CBR) para textos jurídicos e técnicas concretas de deep learning para representação resumida, produzindo resumos de forma precisa e eficiente. Usando um conjunto de dados maior de 4.968 casos jurídicos do Kaggle, uma arquitetura de transformador multi-estágio foi construída sobre o modelo geral de recuperação de CBR criado anteriormente para produzir resumos breves junto com CBR para compreensão de contexto. O sistema foi avaliado na previsão de resultados legais e na coerência do resumo, com resultados mostrando desempenho superior aos métodos extrativos e abstratos existentes, e treinou o modelo proposto até 98% de precisão das entidades jurídicas, além de 46% mais corpus jurídico coerente (aprimorado pela linha de base) do que métodos de última geração, comparado ao uso de escores ROUGE acima dos tipos anteriores em 23%. Este estudo apresenta uma estrutura híbrida de resumo de texto jurídico que integra RBC com modelos baseados em transformadores. Experimentos extensos mostram desempenho superior em relação às linhas de base recentes, alcançando maior precisão factual, fidelidade do raciocínio e preservação de entidades jurídicas.

Introdução

A extensa documentação jurídica exigiu métodos avançados para recuperar dados pertinentes de forma oportuna. A resumida do texto jurídico é importante para melhorar a acessibilidade e a tomada de decisões. Pareceres jurídicos, decisões e precedentes são tão extensos que juízes, profissionais e pesquisadores podem ter dificuldade em analisá-los, levando ao desenvolvimento de métodos automatizados para resumir esses documentos de forma precisa eeficiente 1.

Apesar de seu desempenho de ponta em casos mais gerais, os métodos de sumarização existentes têm dificuldade em capturar a complexidade única e o jargão jurídico que caracterizam os documentos jurídicos. Simplesmente escolher as frases superiores sem rearranjar apenas com base na probabilidade logarítmica obtém boas pontuações ROUGE, mas perde para o contexto e a semântica completa. Abordagens abstratas usam geração de linguagem natural para compor a cobertura, para capturar a nuance contextual, mas têm dificuldade em preservar o raciocínio lógico e o raciocínio jurídico dos casosjudiciais 2. O método proposto é particularmente eficaz para textos longos de casos jurídicos contendo seções estruturadas (por exemplo, fatos, argumentos, precedentes e sentenças). Ele se destaca quando aplicado a corpora com citações explícitas e formatação padronizada, como decisões de cortes de apelação ou da Suprema Corte. No entanto, o desempenho pode ser limitado a conjuntos de dados ruidosos ou não estruturados (por exemplo, PDFs escaneados com erros de OCR ou documentos sem segmentação retórica clara). Assim, o método é mais adequado para repositórios digitais de casos bem estruturados, onde recursos linguísticos e de citação sãoacessíveis 3.

O framework híbrido superior proposto que combina raciocínio baseado em casos (CBR) com o avançado Processamento de Linguagem Natural (PLN) é usado para gerar um resumo. Utiliza uma arquitetura de transformador multi-estágio com camadas de atenção específicas de domínio jurídico e propõe um módulo de raciocínio entre documentos. O CBR permite que o sistema carregue casos anteriores semelhantes que podem ser usados para examinar todas as variáveis contextuais por razões legais4. O modelo proposto alcançou precisão superior em comparação com as linhas de base de última geração, como demonstrado por ganhos quantitativos nas métricas ROUGE, BLEU e Legal-SemSim, e validado por avaliação de especialistas humanos. Por exemplo, o modelo proposto superou o Legal-BART e o PALM-Law por margens de 15%-20% na precisão da cadeia de raciocínio. Adotar representações gerais e abordagens sofisticadas adiciona conhecimento específico para cada caso junto com sumarização neural e adivinhar 98% de precisão para reconhecimento de entidades jurídicas e 97% para recuperação de precedentes, superando em muito trabalhos anteriores5.

Trabalhos relacionados

A sumarização de textos jurídicos, um subdomínio do processamento de linguagem natural (PLN), ganhou cada vez mais atenção devido à crescente demanda por processamento eficiente de documentos jurídicos, incluindo pareceres judiciais, estatutos e jurisprudência. O principal desafio está em preservar a integridade semântica, o raciocínio jurídico e o contexto específico do domínio nos resumos gerados. Pesquisas anteriores abrangem abordagens extrativas, abstratas e híbridas, com ênfase recente em arquiteturas neurais adaptadas aodomínio 6.

Revisão da literatura

A sumarização de textos jurídicos evoluiu como uma área crítica dentro do processamento de linguagem natural, impulsionada pela necessidade urgente de tornar documentos jurídicos volumosos e complexos acessíveis e acionáveis. A literatura do domínio reflete uma trajetória que vai de modelos extrativos em nível superficial até arquiteturas híbridas sofisticadas que tentam equilibrar fluência, integridade factual e lógica jurídica. Os primeiros esforços focaram em técnicas de sumarização extrativa, que priorizavam a importância das frases com base na similaridade lexical e nos padrões estatísticos. Embora eficazes na seleção de fragmentos juridicamente relevantes, essas abordagens, como TextRank e LexRank, frequentemente ignoram a estrutura semântica mais profunda e falham em capturar as camadas retóricas e argumentativas essenciais no raciocíniojurídico 6. Como os textos jurídicos diferem marcadamente dos corpora gerais devido à sua semântica rígida e expressões específicas de domínio, esses modelos produziram resumos que careciam de coerência e adequação contextual. Com o advento das arquiteturas de transformadores pré-treinadas, o foco da pesquisa mudou para métodos abstratos. Modelos como BART, T5 e PEGASUS começaram a demonstrar capacidade de sintetizar resumos usando padrões de geração de linguagens aprendidas. Suas adaptações jurídicas, como LegalBART e LegalPEGASUS, refinaram ainda mais a performance ao incorporar corpora pré-treinamento específicos para alei 7. No entanto, os métodos abstratos continuaram a sofrer com limitações na consistência do raciocínio e na explicabilidade — desafios particularmente problemáticos em contextos jurídicos, onde até mesmo pequenas desvios factuais podem levar a má interpretação.

Modelos híbridos surgiram em resposta a esses déficits, incorporando raciocínio simbólico ou estratégias baseadas em recuperação para melhorar o enraizamento contextual. Uma direção notável foi a integração da RBC, onde o conhecimento de casos precedentes foi utilizado para contextualizar o processo de geração resumida. Esses modelos tentam manter o rigor factual dos métodos extrativos enquanto geram resultados linguisticamente coerentes e legalmenteválidos 8.

Tendências recentes enfatizam arquiteturas em múltiplas etapas que combinam reconhecimento de entidades jurídicas, raciocínio entre documentos e análise retórica de papéis, sugerindo uma mudança para a compreensão holística do documento, em vez de mera resumo. A pesquisa agora considera cada vez mais o alinhamento de ontologias jurídicas, métricas de avaliação específicas de domínio (por exemplo, Legal-SemSim) e avaliação centrada no ser humano para avaliar a qualidade e usabilidade dos resumos para profissionaisjurídicos 9.

Pesquisas recentes, como Exploring LLMs Applications in Law em 2023 e Exploring the Use of LLMs in the Italian Legal Domain em 2024, destacam o papel crescente dos grandes modelos de linguagem (LLMs) na automatização de tarefas de raciocínio jurídico, resumo erecuperação 10. Esses trabalhos enfatizam não apenas a capacidade de LLMs como GPT-4, PaLM e LLaMA de capturar nuances contextuais do discurso jurídico, mas também os desafios da adaptação do domínio, explicabilidade e consistência factual11. Sistemas híbridos que integram geração aumentada por recuperação (RAG) ou CBR com LLMs estão sendo cada vez mais explorados para combinar as forças do raciocínio consciente de precedentes com a fluência generativa dostransformers 6. Posicionando o trabalho dentro dessa tendência, o modelo híbrido de múltiplos estágios proposto estende frameworks de recuperação aumentada anteriormente ao codificar explicitamente cadeias de raciocínio jurídico, mantendo a coerência por meio de sumarização abstrativa baseada em transformadores.

Apesar do progresso significativo, ainda existe uma lacuna em modelos capazes de sintetizar resumos jurídicos factuais, logicamente estruturados e consistentes em domínio, mantendo ainterpretabilidade 12. O presente trabalho aborda essa lacuna propondo uma abordagem híbrida em múltiplas etapas baseada em RBC legal e arquitetura neural profunda, oferecendo um modelo que é ao mesmo tempo preciso e praticamente utilizável.

Abordagens de sumarização extrativa

O termo sumarização extrativa é usado para métodos que extraem e unem as frases mais informativas do documento. Algoritmos baseados em grafos, por exemplo, TextRank13 e LexRank14, são abordagens tradicionais que classificam frases com base em sua importância. Embora computacionalmente viáveis, tais abordagens normalmente enfrentam dificuldades com raciocínio jurídico complexo eargumentação 8. Com o advento de modelos de linguagem pré-treinados, métodos baseados em BERT como o BERTSUM8 demonstraram melhorias significativas. O BERTSUM ajusta finamente as embeddings do BERT para sumarização extrativa em nível de sentença, capturando nuances contextuais melhor do que os modelosestatísticos 9. Adaptações do domínio jurídico, como o Legal-BERTSUM, refinaram ainda mais o desempenho ao incorporar corpora específicos do direito, permitindo um reconhecimento aprimorado de termos legais e seleção de sentenças. No entanto, métodos extrativos são limitados na reconstrução do fluxo argumentativo ou cadeia de raciocínio legal, especialmente quando as sentenças são interdependentes ou as referências sãoimplícitas 15.

Abordagens de sumarização abstrativa

A sumarização abstrativa gera frases e sentenças inovadoras que reformulam o conteúdo fonte, frequentemente usando arquiteturas codificador-decodificador. O modeloBART 4 e o PEGASUS7 são exemplos líderes de modelos pré-treinados sequência a sequência aplicados à sumarização de uso geral. Esses foram adaptados para o domínio jurídico por meio de ajustes finos nos corpus jurídicos — resultando em modelos como Legal-BART e Legal PEGASUS16,17. Esses modelos produzem resumos mais fluentes e semelhantes aos humanos, e são melhores em capturar significado contextual do que abordagensextrativas 18.

No entanto, sua aplicação na sumarização jurídica apresenta desafios. Modelos abstratos frequentemente têm dificuldades com consistência factual e preservação da semântica jurídica. A má interpretação de cláusulas legais ou a omissão de entidades jurídicas-chave podem tornar um resumoenganoso 19. Além disso, modelos neurais de geração de texto são geralmente opacos, levantando questões sobre explicabilidade e verificabilidade, ambas críticas nos domínios juritários.

Modelos híbridos de sumarização

Para aproveitar as forças de ambos os paradigmas, modelos híbridos de sumarização integram componentes extrativos e abstrativos. Uma estratégia inicial foi usar módulos extrativos para selecionar sentenças candidatas, que são então refinadas por um decodificador abstrato. Mais recentemente, a arquitetura transformer foi combinada com módulos enriquecidos em conhecimento para aprimorar a compreensão jurídica5.

O RBC emergiu como uma estratégia híbrida promissora. Waterworth foi pioneiro no uso de casos anteriores para informar decisões atuais, e sua integração com modelos neurais possibilita o enriquecimento semântico por meio do raciocínioanalógico 6. Na sumarização jurídica, combinar CBR com transformadores permite tanto o reuso contextual quanto a síntese abstrata. Modelos como BART+CBR integram contexto jurídico baseado em recuperação com mecanismos generativos, oferecendo maior coerência e relevânciajurídica 20.

A arquitetura proposta Multistage + CBR se baseia nessa linha de trabalho ao incorporar cadeias de raciocínio específicas de domínio no pipeline de sumarização. Ele conta com blocos transformadores hierárquicos, atenção cruzada entre documentos e camadas de recuperação aprimoradas por CBR, especificamente adaptadas para aplicações jurídicas. Esse design multilayer facilita tanto a compreensão detalhada do conteúdo quanto a preservação da estrutura em nívelmacro 21.

Desafios e considerações legais específicas

Documentos jurídicos apresentam características estruturais e linguísticas únicas, incluindo formatação hierárquica, cruzamento de precedentes, citações estatutárias e terminologia específica de domínio22. Modelos de sumarização devem, portanto, não apenas lidar com complexidades sintáticas e semânticas, mas também respeitar a coerência lógica e a progressão do argumentojurídico 23. A resumibilização eficaz nesse contexto depende do reconhecimento preciso de entidades jurídicas, preservação da estrutura de raciocínio e interpretação de papéis retóricos como fatos, argumentos e julgamentos.

Ontologias jurídicas e redes de citação foram empregadas para melhorar a compreensão do domínio. Por exemplo, integrar bases de conhecimento jurídicas estruturadas durante o treinamento modelo demonstrou melhorar a vinculação de entidades jurídicas e a consistênciadas citações 24. Esses esforços contribuem para resumir modelos que melhor se alinham às expectativas dos profissionaisdo direito 25.

Outro desafio é a interpretabilidade. Em contextos jurídicos, a produção deve ser auditável e interpretável. Assim, frameworks de IA explicável (XAI) como LIME e SHAP são cada vez mais explorados para justificar decisões de sumar, embora a integração com modelos em grande escala continue sendo um desafio de pesquisacontínuo 26.

Métricas de avaliação na sumarização jurídica

Métricas padrão de sumarização como ROUGE8, BLEU27 e METEOR são comumente usadas para avaliação de sobreposição lexical. No entanto, essas medidas são insuficientes para capturar fidelidade semântica, consistência jurídica e coerência argumentativa.

Esforços recentes introduzem métricas específicas de domínio como o Legal-SemSim, que incorpora ontologias jurídicas para avaliar similaridade semântica, e a precisão da cadeia de raciocínio, que avalia a preservação do fluxo lógico e a validade da conclusão28. A avaliação de especialistas humanos continua sendo indispensável, especialmente para medir a correção legal, a coerência e a capacidade de agir. O acordo entre anotadores usando métricas como a Kappa de Fleiss garante a confiabilidade das avaliaçõesqualitativas 29.

Avanços recentes e direções futuras na sumarição jurídica

A pesquisa em sumarização jurídica está caminhando para sistemas mais robustos, conscientes do contexto e explicáveis. Arquiteturas híbridas simbólico-neurais que integram raciocínio baseado em regras com modelos de transformadores estão ganhando força. Esses sistemas mantêm a interpretabilidade de abordagens baseadas em lógica enquanto se beneficiam da capacidade de generalização do deeplearning 28.

A sumarização jurídica multilíngue é outra fronteira emergente, abordando a natureza global dos textos e procedimentosjurídicos 30. O raciocínio temporal, necessário para entender sequências legais dependentes do tempo, e a modelagem argumentativa do discurso também estão sendoexploradas 9.

Além disso, avanços na aprendizagem contrastiva e na aprendizagem curricular estão sendo usados para aprimorar a generalização de modelos em diversos domíniosjurídicos 17. Ao aumentar gradualmente a complexidade das tarefas e diferenciar classes semânticas de granulação fina, essas técnicas melhoram a robustez do modelo em cenáriosdo mundo real 31.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Este protocolo utiliza conjuntos de dados jurídicos disponíveis publicamente. Nenhum dado pessoal ou confidencial sensível foi utilizado. O estudo está em conformidade com as diretrizes éticas institucionais para o uso de corpora jurídicos em pesquisa (Koneru Lakshmaiah Education Foundation (Deemed to be University), Hyderabad, Telangana, Índia, Aprovação nº: KLEF/CS/2024/IRB-017). O estudo utiliza um conjunto de dados de 4.968 casos jurídicos, cada um com anotações inclusivas. A Tabela 1 mostra a descrição do conjunto de dados.

precedent_citationsCitações estruturadas para casos de precedente
reasoning_chainsSequências de raciocínio lógico anotado

Tabela 1: Descrição do atributo do conjunto de dados.

Conjunto de dados do estudo

Após o pré-processamento, o conjunto de dados é normalizado para padronizar os resultados. O comprimento dos textos do caso varia entre 1.000 e 5.000 palavras, abrangentes para treinamento e avaliação. Reunimos os resultados dos casos em rótulos primários de acordo com sua frequência no conjunto de dados, permitindo explorar o desempenho da sumarização em diferentes contextos jurídicos. A anotação foi conduzida por uma equipe de cinco profissionais do direito, incluindo três advogados em exercício e dois pesquisadores de doutorado especializados em informática jurídica. Cada caso era anotado independentemente por dois especialistas, com conflitos resolvidos por um anotador sênior. O esquema de anotação incluía entidades jurídicas, citações de precedentes e cadeias de raciocínio. A concordância entre anotadores foi medida usando o Kappa de Fleiss (κ = 0,82), indicando forte consistência entre anotadores. Esse processo garantiu tanto a validade legal quanto a reprodutibilidade do conjunto de dados.

Distribuição de conjuntos de dados

O conjunto de dados inclui casos que contêm vários domínios jurídicos, conforme mostrado na Tabela 2.

Domínio JurídicoNúmero de casosPorcentagem
Direito Contratual1,27825.70%
Propriedade intelectual1,05321.20%
Direito constitucional51210.30%
Direito administrativo4328.70%
Direito penal3086.20%
Direito de Responsabilidade Civil2194.40%
Outros/Diversos1,16623.50%

Tabela 2: Casos contendo vários domínios jurídicos.

A distribuição dos resultados dos casos ao longo do conjunto de dados é mostrada na Tabela 3.

Desfecho do CasoContarPorcentagem
Citado2,46049.20%
Referido85517.10%
Seguido4719.40%
Aplicado4478.90%
Considerado3537.10%
Outros desfechos3828.30%

Tabela 3: Distribuição dos resultados dos casos ao longo do conjunto de dados.

Portanto, confirmou uma representação sensata entre domínios em treinamento, validação e divisões de teste usando amostragem estratificada para evitar vieses específicos de domínio. O conjunto de dados foi dividido em treinamentos (80%), validação (10%) e testes (10%).

Distribuição do comprimento do texto

A análise da distribuição do comprimento do texto é apresentada na Tabela 4.

Faixa de Comprimento (palavras)ContarPorcentagem
Menos de 5004659.40%
500-1,0001,35927.40%
1,000-5,0002,69854.30%
5,000-10,0003236.50%
Mais de 10.0001543.10%

Tabela 4: Análise da distribuição do comprimento do texto.

Essa distribuição destaca a variedade de comprimentos dos documentos, com a maioria se situando na faixa de comprimento médio (1.000-5.000 palavras), o que representa um desafio adequado para técnicas de resumo.

Pré-processamento aprimorado de dados

O pipeline de pré-processamento foi informado por estudos recentes sobre o impacto do pré-processamento em tarefas legais de PLN baseadas em transformadores. Chalkidis et al. demonstram que a tokenização consciente do domínio e a normalização de citações melhoram significativamente a precisão da sumarização ajusante 30. De forma semelhante, Bommarito e Katz mostram que as escolhas de pré-processamento, particularmente a normalização de entidades, afetam diretamente o desempenho dos transformadores na sumarização jurídica32. Com base nesses insights, o pipeline utilizou tokenização consciente de seções, normalização legal de citações e análise de papéis retóricos para maximizar a coerência contextual. Foi desenvolvido um pipeline inovador de pré-processamento, integrando métodos gerais de pré-processamento e técnicas específicas de domínio para obter texto jurídico de alta qualidade e filtrar alguns casos de campos de texto em branco ou muito curto inicialmente, a fim de garantir a integridade dos dados. Em seguida, foi feita a normalização de entradas, onde regras legais de tokenização foram empregadas para garantir a usabilidadeda entrada 33. As entidades-chave foram extraídas usando um modelo personalizado de reconhecimento de entidades jurídicas de alto desempenho (LER) (pontuação F1 de 98%), e técnicas de análise de discurso foram usadas para compreender elementos estruturais. Para aprimorar a análise de precedentes, foi introduzida uma etapa de construção de grafos de citações. Outras etapas de pré-processamento são específicas de domínio para os analisadores de expressões regulares, validando que sua entrada corresponde precisamente aos formatos muito rigorosos para citações jurídicas padronizadas. Tokenizadores conscientes de seção para estruturas hierárquicas de documentos foram aplicados, e um classificador RoBERTa ajustado, rotulado com funções retóricas como fatos, argumentos e decisões, foi adicionado para cada texto jurídico. Esse pipeline mais amplo nos permite complementar trivialmente as tarefas posteriores, como recuperação de texto jurídico, raciocínio e resumo.

Módulo avançado de raciocínio baseado em casos

O estudo apresenta pela primeira vez uma aplicação gradual de um sistema de Raciocínio Baseado em Casos (CBR) de última geração, que pode usar similaridade semântica, bem como conhecimento sobre o domínio jurídico, para entregar casos relevantes e comparáveis com uma precisão de recuperação de 98% no conjunto de dados de referência. A Representação Aprimorada de Casos codifica cada caso com um vetor híbrido que combina embeddings contextualizados – produzidos por um modelo BERT focado em domínio em texto jurídico – com embeddings estruturais que refletem a posição dos elementos no documento, embeddings conscientes da entidade que enfatizam as relações jurídicas presentes nos casos, e embeddings em rede de citações que representam como precedentes são ligados entre si. A recuperação de casos em múltiplas etapas atua como uma abordagem em várias etapas, primeiro realizando a busca por Vizinho Aproximado Mais Próximo (ANN) para obter candidatos semente, aplicando atenção cruzada para obter correspondências ótimas dos candidatos e utilizando uma função de pontuação específica de domínio e pontuação de relevância baseada em conjunto para selecionar as recuperações do melhor caso. Durante a Fase Avançada de Adaptação de Casos (ACAS), o sistema extrai padrões de raciocínio por meio de um modelo de representação baseado em grafos que captura dependências lógicas entre argumentos jurídicos. Em seguida, identifica a relevância do precedente por meio de análise de citações, ponderando cada componente do caso de acordo com sua importância contextual para a consulta. Por fim, a estrutura argumentativa é mantida usando métodos baseados em análise sintática do discurso para garantir que o fluxo lógico do raciocínio jurídico seja preservado. O módulo final, o módulo de Integração do Conhecimento, auxilia na recuperação por meio de ontologias jurídicas, registra relações temporais de precedentes e mantém a validade em cadeias complexas de raciocínio jurídico. O sistema de RBC proposto alcança uma taxa de recuperação correta de 98%, maior do que os benchmarks previamente reportados (por exemplo, LexGLUE, 92%-95%) para a recuperação e adaptação de casos jurídicos.

Arquitetura de transformador de múltiplos estágios

Com base nas referências mencionadas acima, o estudo propõe um método baseado em rede neural artificial em um modelo de arquitetura multi-estágio baseado em transformadores, que aproveita os melhores elementos de todos os algoritmos mencionados para melhorar o processamento automatizado, raciocínio e resumo de documentos legais. A etapa de compreensão de documentos utiliza um codificador BERT adaptado ao domínio jurídico, mecanismos hierárquicos de atenção e módulos para reconhecimento de entidades jurídicas, extração de relacionamentos e processamento de grafos de citação, para obter uma compreensão estrutural e contextual profunda dos documentos jurídicos. A etapa de raciocínio entre documentos auxilia no raciocínio baseado em casos ao vincular consultas com casos recuperados por meio de um mecanismo de atenção cruzada, na forma de extração e validação de cadeias de raciocínio jurídico, um modelo de aplicação de precedentes e preservação da estrutura de argumentação. SBERT e Bi-LSTM foram usados no nível de formação de embedding de sentenças, enquanto um decodificador personalizado com restrições de domínio jurídico foi usado no nível de geração de resumo abstrato para manter com precisão termos jurídicos, consistência factual e hierarquia no resumo conforme os requisitos de redação jurídica. Ao dividir o processo em diferentes etapas, é possível garantir que o processamento de documentos preserve consistência factual, coerência contextual e fidelidade da citação. O processo de treinamento proposto para modelos está mostrado na Tabela 5.

HiperparâmetroValor
Tamanho do lote32
Taxa de aprendizado3e-5 com aquecimento
Épocas15
Comprimento máximo da sequência2048 fichas
Taxa de evasão escolar0.15
Acumulação de gradiente8 passos
Passos de aquecimento1000
Decaimento do peso0.01
Suavização de rótulos0.1

Tabela 5: Processo de treinamento de modelos.

Para melhorar o desempenho e a generalização do modelo, implementamos múltiplas técnicas avançadas de treinamento, que são abordadas em detalhes. Utilizou o aprendizado curricular para aumentar gradualmente a complexidade das tarefas, permitindo que o modelo adquirisse habilidades básicas antes de enfrentar situações mais desafiadoras. Ao realizar experimentos no conjunto de dados de treinamento, o pesquisador confirmou que o ajuste fino refinou com sucesso representações semânticas ao ajudar o modelo a diferenciar dados altamente semelhantes e diferentes de dados, aumentando assim sua compreensão do conjunto de dados. No que diz respeito à aprendizagem multitarefa, a sumarização foi combinada com uma tarefa auxiliar, por exemplo, classificação ou reconhecimento de implicações, que promoveu uma compreensão mais abrangente do domínio jurídico. A transferência de conhecimento importante por meio da destilação de conhecimento que retém conhecimento de alto nível sem tornar o modelo enorme já foi transferida para modelos maiores focadosem domínios 7.

Metodologia híbrida de sumarização jurídica em múltiplas etapas

Para operacionalizar o framework proposto, é apresentado o algoritmo passo a passo 1, representando a metodologia híbrida de sumarização jurídica em múltiplos estágios.

Algoritmo 1:
Algoritmo: Resumo Jurídico Híbrido em Múltiplas Etapas
Entrada: Conjunto de Dados de Casos Jurídicos D com campos {case_text, legal_entities, citações, resultado}
Saída: Resumo S para cada caso com raciocínio jurídico preservado
Começar
Etapa 1: Pré-processamento de dados
Para cada caso em D:
Normalize o texto para remover ruídos e unificar a formatação.
Aplicar o Reconhecimento de Entidade Jurídica (LER) para extrair as entidades jurídicas.
Construa um gráfico de citações a partir de precedentes referenciados.
Tokenize o texto usando regras legais de tokenização conscientes do domínio.
NOTA: Se o corpus de entrada contiver textos ruidosos ou incompletos, realize normalizações adicionais, como filtragem de palavras paradas ou segmentação de seções.

Etapa 2: Recuperação Baseada em Casos
Para cada caso:
Gerar embeddings contextuais usando um codificador BERT adaptado ao domínio.
Gerar embeddings estruturais baseados na posição da seção.
Gerar embeddings em rede de citações.
Recupere casos anteriores semelhantes usando a busca por Vizinho Aproximado (ANN).
Refinar casos recuperados usando pontuação de atenção cruzada e classificação de relevância baseada em conjunto.

Estágio 3: Adaptação do Caso
Para cada caso recuperado:
Extraia padrões de raciocínio usando análise discursiva.
Identifique argumentos legais relevantes e atribua pesos com base em sua importância.
Mantenha o fluxo argumentativo durante a adaptação.
NOTA: Se casos de precedente contêm argumentos irrelevantes ou contraditórios, exclua-os durante a adaptação.

Etapa 4: Resumo Baseado em Transformadores de Múltiplos Estágios
Para cada caso de entrada e seus precedentes adaptados:
Codificar o caso de entrada usando um codificador BERT de domínio jurídico com atenção hierárquica e consciente da entidade.
Aplique raciocínio entre documentos entre a consulta e os casos recuperados.
Codificar frases usando SBERT e Bi-LSTM para aprimorar embeddings contextuais.
Decode o resumo usando um decodificador restrito ao domínio para preservar a precisão factual e legal.

Etapa 5: Saída e Validação
Para cada RESUMO CURTO gerado:
Valide o resumo gerado quanto à coerência, correção factual e fidelidade do raciocínio jurídico.
Devolva o resumo finalizado S.
NOTA: Se for necessária validação de especialistas, inclua uma etapa adicional de revisão com o humano no ciclo antes da implantação.
Fim

Para configurar o ambiente de computação, foi instalado o Python 3.10. A instalação requer bibliotecas: PyTorch (v2.0), Hugging Face Transformers (v4.32.0), SpaCy (v3.6), NLTK (v3.8.1), NetworkX (v3.1), DGL (v1.1). O suporte para GPU era configuré (duas GPUs com 40 GB de memória cada). Veja a Tabela de Materiais para versões exatas e fontes.

O conjunto de dados de casos jurídicos (≈ 5.000 casos) foi baixado da fonte especificada e cada caso foi verificado para incluir campos: fatos, argumentos, citações e resultado do julgamento. Armazene documentos em formato de texto simples UTF-8. A remoção de textos vazios ou curtos usando um script em Python (preprocess.py) foi feita. Foram realizadas a remoção do ruído e a unificação da formatação do texto. A tokenização em domínio legal foi aplicada com o SpaCy (spacy.load("en_core_legal_sm")). O Reconhecimento de Entidade Jurídica foi realizado usando um modelo BERT ajustado (transformers.pipeline("ner", model="legal-bert-ler")). Um gráfico de citações foi construído com o NetworkX (nx. DiGraph()), ligando nós por precedentes referenciados. Se documentos baseados em OCR forem incluídos, um script adicional de limpeza de texto (ocr_clean.py) era executado.

A incorporação contextual foi gerada com um modelo BERT específico de domínio (bert-legal) e incorporações de citação foram geradas usando codificadores de grafo DGL. A busca aproximada de vizinho mais próximo foi realizada usando FAISS (faiss. IndexFlatIP). A pontuação de atenção cruzada foi aplicada com um módulo PyTorch (CrossAttentionScorer) e os resultados obtidos foram classificados por ponderação conjunta da similaridade contextual e das citações. A estrutura discursiva foi analisada usando um classificador de papéis retóricos (roberta-legal-retórica) e padrões de raciocínio relevantes foram extraídos alinhando papéis retóricos. Os pesos foram atribuídos aos segmentos de argumento com base na frequência e na força das citações. Exclua precedentes contraditórios ou irrelevantes.

Os documentos eram codificados com um codificador BERT adaptado ao domínio e módulos de atenção hierárquica eram aplicados (implementados em hierarchical_encoder.py). SBERT e Bi-LSTM (pacote de transformadores de sentença) eram usados para embeddings de sentenças. Resumos abstratos foram decodificados usando um decodificador restrito (legal_decoder.py). Limite o comprimento máximo da sequência a 2048 tokens. Para treinar o modelo, defina tamanho do lote = 32, taxa de aprendizado = 3e-5, treine para 15 épocas com acumulação de gradiente (8 passos), aplique dropout = 0,15 e decaimento de peso = 0,01, ative suavização de rótulos = 0,1. Modificar hiperparâmetros em train_config.json.

Para avaliar o desempenho, calcule o ROUGE (1,2, L) usando rouge_score biblioteca, o BLEU usando nltk.translate.bleu_score e o BERTScore usando bert_score pacote. Avalie o Legal-SemSim usando scripts de similaridade semântica baseados em ontologias e a entidade F1 usando SpaCy e anotações gold. A eficiência em tempo de execução (segundos por dobra) era registrada, e os resumos eram comparados com referências de ouro. Dois especialistas jurídicos foram solicitados a revisar a correção factual e os resumos finais validados dos resultados foram salvos. Seguir esse protocolo produzirá resumos jurídicos específicos para cada domínio que preservam o raciocínio jurídico, a precisão factual e a fidelidade das citações.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Métricas de avaliação

O sistema foi avaliado usando um conjunto abrangente de métricas, que está mostrado na Tabela 6.

Categoria métricaMétricas EspecíficasDescrição
Sobreposição LexicalROUGE-1, ROUGE-2, ROUGE-L...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

A eficácia do aumento do CBR ao projeto de transformadores de múltiplos estágios foi alcançada pelo estabelecimento de um novo parâmetro de desempenho na sumarização de textos em domínio jurídico. Os resultados indicam uma melhora significativa nas pontuações ROUGE de 78,4 ROUGE-1, 54,8 ROUGE-2 e 75,3 ROUGE-L, e métricas específicas de domínio de 98% de reconhecimento de entidade jurídica F1. Para validar ainda mais a contribuição de cada componente, foram introduzidas linhas de base ape...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Os autores declaram que não existem conflitos de interesse potenciais relacionados ao conteúdo deste estudo.

Agradecimentos

Os autores expressam sua sincera gratidão ao Departamento de Ciência da Computação e Engenharia da Koneru Lakshmaiah Education Foundation (Considerada Universidade), Hyderabad, Telangana, Índia, por fornecer as instalações computacionais e a infraestrutura de pesquisa essenciais para esse trabalho. Agradecimentos especiais são enviados aos especialistas jurídicos e especialistas do setor que contribuíram para a anotação e avaliação do corpus jurídico utilizado neste estudo.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
CPU HardwareAMD EPYC 7742 (64 Cores, 2,25 GHz)1 unidadeAMD
EstruturaPyTorch2https://pytorch.org
GPU HardwareNVIDIA A100 (40 GB)2 unidadesNVIDIA Corp.
Estrutura de GrafosDGL1.1https://www.dgl.ai
BibliotecaTransformadores de Face Abraçando4.32.0https://huggingface.co/transformers
BibliotecaSpaCy3.6https://spacy.io
BibliotecaNLTK3.8.1https://www.nltk.org

Referências

  1. Powers, D. M. Evaluation: From precision, recall and F-measure to ROC, informedness, markedness & correlation. J Mach Learn Technol. 2 (1), 37-63 (2011).
  2. Eisenberg, M. A. Legal Reasoning. , Cambridge University Press. (2022).
  3. Lin, C. Y. ROUGE: A Package for Automatic Evaluation of Summaries. Text Summarizat Branches Out. , 74-81 (2004).
  4. Lewis, M., et al. Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension. Proc ACL. , 7871-7880 (2020).
  5. Hadi, A. Leveraging Transformer-Based Language Models to Bridge the Gap Between Language and Specialized Domains. [Doctoral Dissertation]. , Institut Polytechnique de Paris. (2024).
  6. Waterworth, K. Model-Agents of Change: A Meta-Cognitive, Interdisciplinary, Self-Similar, Synergetic Approach to Neuro-Symbolic Semantic Search and Retrieval Augmented Generation. [Master's Thesis]. , Miami University. (2024).
  7. Zhang, J., Zhao, Y., Saleh, M., Liu, P. PEGASUS: Pre-training with Extracted Gap-sentences for Abstractive Summarization. Proc ICML. , 11328-11339 (2020).
  8. Li, Z., et al. When object detection meets knowledge distillation: A survey. IEEE Trans. Pattern Anal Mach Intell. 45 (8), 10555-10579 (2023).
  9. Chen, Y., et al. Citation Network Analysis for Legal Reasoning. J AI Law. 28 (2), 145-170 (2020).
  10. Raffel, C., et al. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. J Mach Learn Res. 21 (140), 1-67 (2020).
  11. Reimers, N., Gurevych, I. Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proc EMNLP. , 3982-3992 (2019).
  12. Gunning, D., Aha, D. DARPA's explainable artificial intelligence (XAI) program. AI Mag. 40 (2), 44-58 (2019).
  13. Mihalcea, R., Tarau, P. TextRank: Bringing Order into Texts. Proc EMNLP. , 404-411 (2004).
  14. Sharma, G., Sharma, D. Automatic text summarization methods: A comprehensive review. SN Comput Sci. 4 (1), 33(2022).
  15. Xu, J., Croft, W. B. Neural Networks for Text Classification. Inf Retr J. 20 (3), 259-289 (2017).
  16. Ghosh, S., Dutta, A., Das, A. Indian Legal Text Summarization: A Text Normalisation-based Approach. arXiv. , (2022).
  17. Silver, D., et al. Mastering the Game of Go with Deep Neural Networks and Tree Search. Nature. 529, 484-489 (2016).
  18. Chalkidis, I., et al. LexGLUE: A benchmark dataset for legal language understanding in English. Proc ACL. 60 (1), 4310-4330 (2022).
  19. Ashley, K. Artificial Intelligence and Legal Analytics. , Cambridge University Press. (2017).
  20. Chalkidis, I., Fergadiotis, M., Aletras, N. LEGAL-BERT: The Muppets Straight Out of Law School. Proc ACL. , 2898-2910 (2020).
  21. Vaswani, A., et al. Attention Is All You Need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  22. Baker, A. R., Slack, F. J. ADAR1 and its implications in cancer development and treatment. Trends Genet. 38 (8), 821-830 (2022).
  23. Casola, S., Lavelli, A. Summarization, simplification, and generation: The case of patents. Expert Syst. Appl. 205, 117627(2022).
  24. Valente, A. Legal Knowledge Engineering. , IOS Press. (1995).
  25. Katz, D. M., et al. Natural language processing in the legal domain. arXiv. , (2023).
  26. Gilpin, L., et al. Explaining Explanations: An Approach to Interpretable AI. Proc ICML. 70, 89-98 (2018).
  27. Davoodijam, E., Alambardar Meybodi, M. Evaluation metrics on text summarization: comprehensive survey. Knowl Inf Syst. 66 (12), 7717-7738 (2024).
  28. Schauer, F. Precedent. , Stanford Encyclopedia of Philosophy. (1989).
  29. Bengio, Y., Louradour, J., Collobert, R., Weston, J. Curriculum Learning. Proc ICML. , 382-389 (2009).
  30. Vrandecic, D., Krötzsch, M. Wikidata: A Free Collaborative Knowledge Base. Commun ACM. 57 (10), 78-85 (2014).
  31. Chu, Y., Ye, M., Qian, Y. Fine-Grained Image Recognition Methods and Their Applications in Remote Sensing Images: A Review. IEEE J Sel Top Appl Earth Obs Remote Sens. 17 (6), 1234-1250 (2024).
  32. Vue, Z., et al. Stories from Hmong in STEMM. Trends Genet. 39 (8), 587-592 (2023).
  33. Begum, N., Goyal, A. Analysis of Legal Case Document Automated Summarizer. Proc ISPCC. , 533-538 (2021).
  34. Surden, H. Ethics of AI in Legal Practice. J Legal Ethics. 32 (2), 145-163 (2019).
  35. Bench-Capon, T. J. M., Sartor, G. Ontology-Based Legal Reasoning. Artif Intell Law. 11 (2), 125-157 (2003).
  36. Liu, Y. Fine-tune BERT for Extractive Summarization. arXiv. , (2019).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Etiquetas

Arquitetura TransformerPredi o de Desfecho Jur dicoReconhecimento de Entidades Jur dicasSumariza o AbstrativaSumariza o ExtrativaPontua es ROUGE