Un abonnement JoVE est requis pour visualiser ce contenu. Connectez-vous ou commencez votre période d'essai gratuite.

Article de recherche

Raisonnement fondé sur des cas avec apprentissage profond pour une approche hybride du résumé de textes juridiques

490 vues

DOI :

10.3791/69287

12 décembre 2025

Dans cet article

Résumé

Ce protocole intègre le raisonnement basé sur les cas (CBR) avec des modèles de transformateurs à plusieurs étapes pour résumer les textes juridiques. Il prétraite les affaires juridiques, récupère des précédents similaires, adapte des structures de raisonnement et génère des résumés précis et cohérents. Les applications incluent la recherche juridique, l’analyse des jugements et les systèmes d’assistance à la décision, garantissant la cohérence factuelle et la fidélité du raisonnement spécifique au domaine.

Résumé

Les documents juridiques sont connus pour être longs et complexes, ce qui rend pratiquement impossible pour les praticiens du droit et les chercheurs d’identifier et d’extraire rapidement les informations pertinentes. Ici, une approche hybride est présentée qui surpasse les références extractives et abstraites antérieures sur les métriques de chevauchement lexical et de raisonnement spécifique au domaine, utilisant le raisonnement basé sur les cas (CBR) pour les textes juridiques et des techniques concrètes d’apprentissage profond pour la représentation sommaire, produisant des résumés de manière précise et efficace. En utilisant un ensemble de données plus vaste de 4 968 affaires juridiques de Kaggle, une architecture de transformateur à plusieurs étapes a été construite sur le modèle général de récupération CBR créé auparavant pour produire de brefs résumés ainsi que des CBR pour la compréhension du contexte. Le système a été évalué sur la prédiction des résultats juridiques et la cohérence du résumé, avec des résultats montrant des performances supérieures aux méthodes extractives et abstraites existantes, et entraîné le modèle proposé jusqu’à une précision de 98 % des entités juridiques, ainsi qu’un corpus juridique cohérent (amélioré par la ligne de base) en plus que les méthodes de pointe, comparé de 23 % avec des scores ROUGE supérieurs aux types précédents. Cette étude présente un cadre hybride de résumé de texte juridique qui intègre la RBC avec des modèles basés sur des transformateurs. Des expériences approfondies montrent des performances supérieures par rapport aux références récentes, obtenant une précision factuelle plus élevée, une fidélité de raisonnement et une préservation de l’entité juridique supérieures.

Introduction

La documentation juridique étendue a nécessité des méthodes avancées pour récupérer les données pertinentes en temps opportun. Le résumé du texte juridique est important pour améliorer l’accessibilité et la prise de décision. Les avis juridiques, jugements et précédents sont si verbeux que juges, praticiens et chercheurs peuvent avoir du mal à les examiner, ce qui conduit au développement de méthodes automatisées pour résumer ces documents de manière préciseet efficace 1.

Malgré leur performance de pointe dans les affaires plus générales, les méthodes de synthèse existantes peinent à saisir la complexité unique et le jargon juridique qui caractérisent les documents juridiques. Choisir simplement les phrases du haut sans réarranger uniquement en fonction de la probabilité logarithmique permet d’obtenir de bons scores ROUGE mais perd face au contexte et à la sémantique complète. Les approches abstraites utilisent la génération de langage naturel pour composer la couverture, afin de capturer la nuance contextuelle, mais elles peinent à préserver le raisonnement logique et juridique des affairesjudiciaires 2. La méthode proposée est particulièrement efficace pour les textes de litige longs contenant des sections structurées (par exemple, faits, arguments, précédents et jugements). Il excelle lorsqu’il est appliqué à des corpus avec des citations explicites et une mise en forme standardisée, comme les décisions d’appel ou de la Cour suprême. Cependant, la performance peut être limitée à des ensembles de données bruyants ou non structurés (par exemple, des PDF numérisés avec des erreurs OCR, ou des documents sans segmentation rhétorique claire). Ainsi, la méthode convient mieux aux dépôts numériques de cas bien structurés où les fonctionnalités linguistiques et de citation sontaccessibles 3.

Le cadre hybride supérieur proposé qui combine le raisonnement basé sur les cas (CBR) avec le traitement avancé du langage naturel (NLP) est utilisé pour générer un résumé. Il utilise une architecture de transformateur à plusieurs étapes avec des couches d’attention juridiques spécifiques au domaine et propose un module de raisonnement inter-documents. CBR permet au système de charger des cas antérieurs similaires qui peuvent être utilisés pour examiner toutes les variables contextuelles pour des raisonsjuridiques 4. Le modèle proposé a obtenu une précision supérieure à celle des références de pointe, comme le démontrent les gains quantitatifs sur les métriques ROUGE, BLEU et Legal-SemSim, et validé par une évaluation d’experts humains. Par exemple, le modèle proposé a surpassé Legal-BART et PALM-Law par des marges de 15 % à 20 % en matière de précision de la chaîne de raisonnement. L’adoption de représentations générales et d’approches sophistiquées apporte des connaissances spécifiques à chaque cas en parallèle avec la synthèse neuronale et la précision de 98 % pour la reconnaissance des entités juridiques et 97 % pour la recherche de précédents, dépassant largement les travauxprécédents 5.

Travaux connexes

Le résumé du texte juridique, un sous-domaine du traitement du langage naturel (NLP), a attiré une attention croissante en raison de la demande croissante pour un traitement efficace des documents juridiques, y compris les avis judiciaires, les lois et la jurisprudence. Le principal défi réside dans la préservation de l’intégrité sémantique, du raisonnement juridique et du contexte spécifique au domaine dans les résumés générés. Les recherches antérieures couvrent les approches extractives, abstraites et hybrides, avec un accent récent sur les architectures neuronales adaptées audomaine 6.

Revue de la littérature

La synthèse de texte juridique est devenue un domaine crucial du traitement du langage naturel, motivée par le besoin pressant de rendre accessibles et exploitables des documents juridiques volumineux et complexes. La littérature du domaine reflète une trajectoire allant des modèles extractifs de surface à des architectures hybrides sophistiquées qui tentent d’équilibrer fluidité, intégrité factuelle et logique juridique. Les premiers efforts se sont concentrés sur les techniques de synthèse extractive, qui privilégiaient l’importance des phrases en fonction de la similarité lexicale et des schémas statistiques. Bien qu’efficaces pour sélectionner des fragments juridiquement pertinents, ces approches, telles que TextRank et LexRank, ignorent souvent la structure sémantique plus profonde et ne parviennent pas à saisir les couches rhétoriques et argumentatives essentielles au raisonnement juridique6. Comme les textes juridiques diffèrent nettement des corpus généraux en raison de leur sémantique rigide et de leurs expressions spécifiques au domaine, ces modèles produisaient des résumés manquant de cohérence et d’adéquation contextuelle. Avec l’avènement des architectures de transformateurs pré-entraînées, l’orientation de la recherche s’est déplacée vers des méthodes abstraites. Des modèles comme BART, T5 et PEGASUS ont commencé à montrer la capacité de synthétiser des résumés en utilisant des schémas de génération de langages appris. Leurs adaptations juridiques, telles que LegalBART et LegalPEGASUS, ont encore affiné la performance en incorporant les corpus de préentraînement spécifiques àla loi 7. Cependant, les méthodes abstraites continuaient de souffrir de limitations dans la cohérence du raisonnement et de l’explicabilité — des défis particulièrement problématiques dans les contextes juridiques, où même de légères écartations factuelles peuvent conduire à une mauvaise interprétation.

Des modèles hybrides ont émergé en réponse à ces déficiences, incorporant des stratégies de raisonnement symbolique ou de récupération pour améliorer l’ancrage contextuel. Une orientation notable a été l’intégration de la RCC, où les connaissances issues de cas précédents ont été utilisées pour contextualiser le processus de génération sommaire. Ces modèles tentent de conserver la rigueur factuelle des méthodes extractives tout en générant des résultats linguistiquement cohérents et juridiquementvalides 8.

Les tendances récentes mettent l’accent sur des architectures à plusieurs étapes combinant la reconnaissance des entités juridiques, le raisonnement inter-documents et l’analyse rhétorique des rôles, suggérant un virage vers une compréhension holistique des documents plutôt qu’une simple synthèse. La recherche prend désormais de plus en plus en compte l’alignement des ontologies juridiques, les métriques d’évaluation spécifiques au domaine (par exemple, Legal-SemSim) et l’évaluation centrée sur l’humain afin d’évaluer la qualité et l’utilisabilité des résumés pour les professionnelsdu droit 9.

Des enquêtes récentes, telles que Exploring LLMs Applications in Law en 2023 et Exploring the Use of LLM in the Italian Legal Domain en 2024, mettent en lumière le rôle croissant des grands modèles de langage (LLM) dans l’automatisation des tâches de raisonnement juridique, de synthèse etde récupération 10. Ces travaux mettent en avant non seulement la capacité des LLM comme GPT-4, PaLM et LLaMA à saisir les nuances contextuelles du discours juridique, mais aussi les défis liés à l’adaptation du domaine, à l’explicabilité et à la cohérencefactuelle 11. Les systèmes hybrides intégrant la génération augmentée par récupération (RAG) ou CBR avec les LLM sont de plus en plus explorés afin de combiner les forces du raisonnement conscient des précédents avec la fluidité générative destransformers 6. En positionnant le travail dans cette tendance, le modèle hybride à plusieurs étapes proposé étend les cadres augmentés par récupération antérieure en encodant explicitement des chaînes de raisonnement juridique, tout en maintenant la cohérence grâce à une synthèse abstraite basée sur des transformateurs.

Malgré des progrès significatifs, il subsiste une lacune dans les modèles capables de synthétiser des résumés juridiques factuels, logiquement structurés et cohérents dans leur domaine tout en maintenantl’interprétabilité 12. Le présent travail comble ce vide en proposant une approche hybride à plusieurs étapes fondée sur la RBC juridique et une architecture neuronale profonde, offrant un modèle à la fois précis et pratiquement utilisable.

Approches de synthèse extractive

Le terme résumé extractif est utilisé pour désigner les méthodes qui extraient et assemblent les phrases les plus informatives du document. Les algorithmes basés sur les graphes, par exemple TextRank13 et LexRank14, sont des approches traditionnelles qui classent les phrases en fonction de leur importance. Bien que calculationnellement réalisables, ces approches peinent généralement à gérer le raisonnement juridique complexe etl’argumentation 8. Avec l’avènement des modèles de langage pré-entraînés, des méthodes basées sur BERT comme BERTSUM8 ont montré des améliorations significatives. BERTSUM ajuste finement les embeddings de BERT pour la synthèse extractive au niveau de la phrase, capturant mieux la nuance contextuelle que les modèlesstatistiques 9. Des adaptations du domaine juridique telles que Legal-BERTSUM affinent encore davantage la performance en intégrant des corpus spécifiques à des juridictions, permettant une meilleure reconnaissance juridique des termes et une meilleure sélection des peines. Néanmoins, les méthodes extractives sont limitées dans la reconstruction du flux argumentatif ou de la chaîne de raisonnement juridique, en particulier lorsque les phrases sont interdépendantes ou que les références sontimplicites 15.

Approches de synthèse abstraitive

La synthèse abstraite génère des phrases et phrases nouvelles qui reformulent le contenu source, souvent en utilisant des architectures encodeur-décodeur. Le modèleBART 4 et PEGASUS7 sont des exemples majeurs de modèles pré-entraînés séquence à séquence appliqués à la synthèse à usage général. Ces modèles ont été adaptés au domaine juridique grâce à des ajustements finis des corpus juridiques, ce qui a donné lieu à des modèles comme Legal-BART et Legal PEGASUS16,17. Ces modèles produisent des résumés plus fluides et proches de l’humain, et sont meilleurs pour saisir le sens contextuel que les approchesextractives 18.

Cependant, leur application en résumé juridique pose des défis. Les modèles abstraits ont souvent du mal à garantir la cohérence factuelle et à préserver la sémantique juridique. Une mauvaise interprétation des clauses juridiques ou l’omission de personnes juridiques clés peut rendre un résumétrompeur 19. De plus, les modèles de génération de texte neuronal sont généralement opaques, soulevant des questions d’explicabilité et de vérifiabilité, deux éléments essentiels dans les domaines juridiques.

Modèles de synthèse hybrides

Pour tirer parti des forces des deux paradigmes, les modèles hybrides de synthèse intègrent des composantes extractives et abstraites. Une stratégie précoce consistait à utiliser des modules extractifs pour sélectionner des phrases candidates, qui sont ensuite affinées par un décodeur abstrait. Plus récemment, l’architecture transformer a été combinée à des modules imprégnés de connaissances pour améliorer la compréhension juridique5.

La RBC s’est imposée comme une stratégie hybride prometteuse. Waterworth a été pionnier dans l’utilisation de cas antérieurs pour éclairer les décisions actuelles, et son intégration avec les modèles neuronaux permet l’enrichissement sémantique par raisonnementanalogique 6. En résumé juridique, combiner la CBR avec les transformateurs permet à la fois la réutilisation contextuelle et la synthèse abstraite. Des modèles comme BART+CBR intègrent un contexte juridique basé sur la récupération avec des mécanismes génératifs, offrant une cohérence et une pertinence juridiqueaméliorées 20.

L’architecture Multistage + CBR proposée s’appuie sur cette ligne de travail en intégrant des chaînes de raisonnement spécifiques au domaine dans le pipeline de synthèse. Il propose des blocs transformateurs hiérarchiques, une attention inter-documents et des couches de récupération améliorées par CBR, spécialement adaptées aux applications juridiques. Cette conception à plusieurs niveaux facilite à la fois une compréhension fine du contenu et la préservation de la structure au niveaumacro 21.

Défis et considérations juridiques spécifiques

Les documents juridiques présentent des caractéristiques structurelles et linguistiques uniques, notamment une mise en forme hiérarchique, le recoupement des précédents, les citations statutaires et la terminologie spécifique audomaine 22. Les modèles de synthèse doivent donc non seulement traiter les complexités syntaxiques et sémantiques, mais aussi respecter la cohérence logique et la progression de l’argumentjuridique 23. Une synthèse efficace dans ce contexte repose sur la reconnaissance précise des entités juridiques, la préservation de la structure de raisonnement et l’interprétation des rôles rhétoriques tels que les faits, les arguments et les jugements.

Des ontologies juridiques et des réseaux de citation ont été utilisés pour améliorer la compréhension du domaine. Par exemple, l’intégration de bases de connaissances juridiques structurées lors de la formation modèle a démontré qu’elle améliore la cohérence des liens entre entités juridiques et la cohérence descitations 24. Ces efforts contribuent à résumer des modèles mieux alignés sur les attentes des praticiensdu droit 25.

Un autre défi est l’interprétabilité. Dans les contextes juridiques, les résultats doivent être auditables et interprétables. Ainsi, les cadres d’IA explicable (XAI) tels que LIME et SHAP sont de plus en plus explorés pour justifier des décisions de synthèse, bien que l’intégration avec des modèles à grande échelle reste un défi de recherchepersistant 26.

Indicateurs d’évaluation dans la synthèse juridique

Les métriques de synthèse standard telles que ROUGE8, BLEU27 et METEOR sont couramment utilisées pour l’évaluation du chevauchement lexical. Cependant, ces mesures sont insuffisantes pour capturer la fidélité sémantique, la cohérence juridique et la cohérence argumentative.

Des efforts récents introduisent des métriques spécifiques au domaine comme Legal-SemSim, qui intègre des ontologies juridiques pour évaluer la similarité sémantique, et la précision de la chaîne de raisonnement, qui évalue la préservation du flux logique et la validité desconclusions 28. L’évaluation par un expert humain reste indispensable, notamment pour mesurer la justesse juridique, la cohérence et la capacité d’action. L’accord inter-annotateurs utilisant des métriques telles que la Kappa de Fleiss garantit la fiabilité des évaluationsqualitatives 29.

Avancées récentes et orientations futures en résumé juridique

La recherche sur la synthèse juridique évolue vers des systèmes plus robustes, conscients du contexte et explicables. Les architectures hybrides symbolique-neuronales qui intègrent le raisonnement basé sur des règles avec des modèles de transformateurs gagnent en popularité. Ces systèmes maintiennent l’interprétabilité des approches basées sur la logique tout en bénéficiant de la capacité de généralisation de l’apprentissageprofond 28.

La synthèse juridique multilingue est une autre frontière émergente, abordant la nature mondiale des textes et procéduresjuridiques 30. Le raisonnement temporel, nécessaire pour comprendre les séquences juridiques dépendantes du temps, et la modélisation argumentative du discours sont également à l’étude9.

De plus, les avancées dans l’apprentissage contrastif et l’apprentissage du programme sont utilisées pour améliorer la généralisation des modèles dans divers domainesjuridiques 17. En augmentant progressivement la complexité des tâches et en différenciant les classes sémantiques fines, ces techniques améliorent la robustesse du modèle dans les scénariosréels 31.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Ce protocole utilise des ensembles de données juridiques accessibles publiquement. Aucune donnée personnelle ou confidentielle sensible n’a été utilisée. L’étude respecte les directives éthiques institutionnelles pour l’utilisation des corpus juridiques en recherche (Koneru Lakshmaiah Education Foundation (Deemed to be University), Hyderabad, Telangana, Inde, Approbation n° : KLEF/CS/2024/IRB-017). L’étude utilise un ensemble de données de 4 968 affaires juridiques, chacune avec des annotations inclusives. Le tableau 1 présente la description du jeu de données.

precedent_citationsCitations structurées de cas précédents
reasoning_chainsSéquences de raisonnement logique annotées

Tableau 1 : Description de l’attribut du jeu de données.

Jeu de données pour l’étude

Après prétraitement, le jeu de données est normalisé pour standardiser les résultats. La longueur des textes de l’affaire varie entre 1 000 et 5 000 mots, complet pour la formation et l’évaluation. Nous avons recueilli les résultats des cas dans les labels primaires selon leur fréquence dans le jeu de données, ce qui nous a permis d’explorer la performance de synthèse dans différents contextes juridiques. L’annotation a été réalisée par une équipe de cinq professionnels du droit, dont trois avocats en exercice et deux doctorants spécialisés en informatique juridique. Chaque affaire était annotée indépendamment par deux experts, les conflits étant résolus par un annoteur senior. Le schéma d’annotation comprenait des entités juridiques, des citations de précédents et des chaînes de raisonnement. L’accord entre les annotateurs a été mesuré à l’aide du Kappa de Fleiss (κ = 0,82), indiquant une forte cohérence entre les annotateurs. Ce processus a garanti à la fois la validité juridique et la reproductibilité de l’ensemble de données.

Distribution des jeux de données

Le jeu de données comprend des cas contenant divers domaines juridiques, comme montré dans le Tableau 2.

Domaine juridiqueNombre d’affairesPourcentage
Droit des contrats1,27825.70%
Propriété intellectuelle1,05321.20%
Droit constitutionnel51210.30%
Droit administratif4328.70%
Droit pénal3086.20%
Droit de la responsabilité délictuelle2194.40%
Autres/Divers1,16623.50%

Tableau 2 : Affaires contenant divers domaines juridiques.

La répartition des résultats des cas à travers l’ensemble de données est présentée dans le tableau 3.

Résultat de l’affaireCompterPourcentage
Cité2,46049.20%
Référencés85517.10%
Suivi4719.40%
Appliqué4478.90%
Considéré3537.10%
Autres issues3828.30%

Tableau 3 : Répartition des résultats des cas à travers l’ensemble de données.

Elle a donc confirmé une représentation sensée à travers les domaines d’entraînement, de validation et de répartition des tests en utilisant un échantillonnage stratifié pour éviter les biais spécifiques à chaque domaine. Le jeu de données était divisé en ensembles d’entraînement (80 %), de validation (10 %) et de test (10 %).

Distribution de la longueur du texte

L’analyse de la distribution de la longueur du texte est présentée dans le tableau 4.

Plage de longueur (mots)CompterPourcentage
Moins de 5004659.40%
500-1,0001,35927.40%
1,000-5,0002,69854.30%
5,000-10,0003236.50%
Plus de 10 0001543.10%

Tableau 4 : Analyse de la distribution de la longueur du texte.

Cette répartition met en lumière la variété des longueurs de documents, la majorité se situant dans la fourchette moyenne (1 000-5 000 mots), ce qui pose un défi approprié pour les techniques de synthèse.

Prétraitement amélioré des données

La chaîne de prétraitement a été informée par des études récentes sur l’impact du prétraitement dans les tâches légales de NLP basées sur des transformateurs. Chalkidis et al. démontrent que la tokenisation consciente du domaine et la normalisation des citations améliorent significativement la précision des résumés enaval 30. De même, Bommarito et Katz montrent que les choix de prétraitement, en particulier la normalisation d’entité, affectent directement la performance des transformateurs dans la synthèsejuridique 32. Sur la base de ces enseignements, le pipeline a utilisé la tokenisation consciente des sections, la normalisation des citations légales et l’analyse du rôle rhétorique pour maximiser la cohérence contextuelle. Un nouveau pipeline de prétraitement a été développé, intégrant des méthodes générales de prétraitement et des techniques spécifiques au domaine pour obtenir un texte juridique de haute qualité et filtrer d’abord quelques cas de champs de texte en majuscules vides ou très courts, afin d’assurer l’intégrité des données. Ensuite, la normalisation des entrées a été effectuée, où des règles légales de tokenisation ont été appliquées pour garantir l’utilisabilitédes entrées 33. Les entités clés ont été extraites à l’aide d’un modèle personnalisé de reconnaissance d’entités juridiques (LER) (score F1 de 98 %) (F1 de 98 %), et des techniques d’analyse discursive ont été utilisées pour saisir les éléments structurels. Pour améliorer l’analyse des précédents, une étape de construction du graphe de citation a été introduite. D’autres étapes de prétraitement sont spécifiques au domaine des analyseurs d’expressions régulières, validant que leur entrée correspond précisément aux formats très stricts des citations juridiques standardisées. Des tokenizateurs sensibles à la section pour les structures hiérarchiques des documents ont été appliqués, et un classificateur RoBERTa affiné, identifié par des rôles rhétoriques comme faits, arguments et décisions, a été ajouté pour chaque texte juridique. Ce pipeline plus large nous permet d’augmenter facilement les tâches en aval comme la récupération de texte juridique, le raisonnement et la synthèse.

Module avancé de raisonnement basé sur les cas

L’étude présente pour la première fois une application accrue d’un système de raisonnement basé sur les cas (CBR) de pointe, capable d’utiliser la similarité sémantique ainsi que la connaissance du domaine juridique pour fournir des cas pertinents et comparables avec une précision de récupération de 98 % sur l’ensemble de données de référence. La représentation améliorée des cas encode chaque cas avec un vecteur hybride qui combine des embeddings contextualisés – produits par un modèle BERT axé sur le domaine sur le texte juridique – avec des embeddings structurels qui reflètent la position des éléments dans le document, des embeddings conscients de l’entité qui mettent en avant les relations juridiques présentes dans les affaires, et des embeddings de réseau de citations qui représentent la manière dont les précédents sont liés entre eux. La récupération de cas à plusieurs étapes agit comme une approche en plusieurs étapes en effectuant d’abord une recherche de voisin approximatif (ANN) pour obtenir les candidats de départ, en appliquant l’attention croisée pour obtenir des correspondances optimales avec les candidats, et en utilisant une fonction de notation spécifique au domaine ainsi qu’un score de pertinence basé sur un ensemble pour sélectionner les récupérations dans le meilleur cas. Lors de l’Advanced Case Adaptation Stage (ACAS), le système extrait des motifs de raisonnement via un modèle de représentation basé sur un graphe qui capture les dépendances logiques entre les arguments juridiques. Il identifie ensuite la pertinence des précédents via l’analyse des citations, en pesant chaque composante du cas selon son importance contextuelle pour la requête. Enfin, la structure argumentative est maintenue à l’aide de méthodes basées sur l’analyse syntaxique du discours afin de garantir la préservation du flux logique du raisonnement juridique. Le dernier module, le module d’Intégration des connaissances, facilite la recherche via des ontologies juridiques, enregistre les relations de précédent temporel et conserve sa validité dans des chaînes complexes de raisonnement juridique. Le système CBR proposé atteint un taux de récupération correcte de 98 %, supérieur aux références précédemment rapportées (par exemple, LexGLUE, 92 %-95 %) pour la récupération et l’adaptation des affaires juridiques.

Architecture de transformateur à plusieurs étages

Sur la base des références mentionnées ci-dessus, l’étude propose une méthode basée sur un réseau de neurones artificiels sur un modèle d’architecture multi-étapes basé sur un transformateur, qui exploite les meilleurs éléments de tous les algorithmes mentionnés pour améliorer le traitement automatisé, le raisonnement et la synthèse des documents juridiques. La phase de compréhension des documents utilise un encodeur BERT adapté au domaine juridique, des mécanismes d’attention hiérarchique et des modules pour la reconnaissance des entités juridiques, l’extraction de relations et le traitement des graphes de citation afin d’acquérir une compréhension structurelle et contextuelle approfondie des documents juridiques. La phase de raisonnement inter-documents aide au raisonnement basé sur les cas en reliant les requêtes aux cas récupérés via un mécanisme d’attention croisée sous forme d’extraction et de validation des chaînes de raisonnement juridique, un modèle d’application de précédent et la préservation de la structure d’argumentation. SBERT et Bi-LSTM ont été utilisés au niveau de formation de l’inclusion de phrases, tandis qu’un décodeur personnalisé avec contraintes de domaine juridique a été utilisé au niveau de génération de résumé abstrait pour maintenir avec précision les termes juridiques, la cohérence factuelle et la hiérarchie du résumé selon les exigences de la rédaction juridique. En divisant le processus en différentes étapes, il peut garantir que le traitement des documents préserve la cohérence factuelle, la cohérence contextuelle et la fidélité des citations. Le processus d’entraînement proposé par le modèle est présenté dans le tableau 5.

HyperparamètreValeur
Taille du lot32
Taux d’apprentissage3E-5 avec échauffement
Époques15
Longueur maximale de la séquence2048 jetons
Taux d’abandon scolaire0.15
Accumulation de gradient8 étapes
Étapes d’échauffement1000
Perte de poids0.01
Lissage des étiquettes0.1

Tableau 5 : Processus d’entraînement par modèle.

Pour améliorer la performance et la généralisation des modèles, nous avons mis en place plusieurs techniques d’entraînement avancées, qui sont traitées en détail. Il a utilisé l’apprentissage du programme pour augmenter progressivement la complexité des tâches, permettant au modèle d’acquérir des compétences de base avant d’affronter des situations plus difficiles. En menant des expériences sur le jeu de données d’entraînement, le chercheur a confirmé que l’ajustement fin a réussi à affiner les représentations sémantiques en aidant le modèle à différencier les données très similaires des données dissemblables, augmentant ainsi sa compréhension de l’ensemble de données. En ce qui concerne l’apprentissage multitâche, la synthèse était associée à une ou plusieurs tâches auxiliaires, par exemple la classification ou la reconnaissance des implications, qui favorisaient une compréhension plus complète du domaine juridique. Le transfert de connaissances importantes par distillation de connaissances qui conserve des connaissances de haut niveau sans rendre le modèle énorme a déjà été transféré pour des modèles axés sur le domaineplus large 7.

Méthodologie de synthèse juridique hybride à plusieurs étapes

Pour opérationnaliser le cadre proposé, l’algorithme étape par étape 1 est présenté, représentant la méthodologie de synthèse juridique hybride à plusieurs étapes.

Algorithme 1 :
Algorithme: Résumé juridique hybride en plusieurs étapes
Entrée: Ensemble de données de cas juridiques D avec champs {case_text, legal_entities, citations, résultats}
Sortie: Résumé S pour chaque cas avec raisonnement juridique préservé
Commencer
Étape 1 : Prétraitement des données
Pour chaque cas dans D :
Normalisez le texte pour supprimer le bruit et unifier la mise en forme.
Appliquer la reconnaissance des entités juridiques (LER) pour extraire les entités juridiques.
Construis un graphique de citations à partir de précédents référencés.
Tokenisez le texte en utilisant des règles de tokenisation légales conscientes du domaine.
NOTE: Si le corpus d’entrée contient des textes bruyants ou incomplets, effectuer une normalisation supplémentaire telle que le filtrage des stop-mots ou la segmentation des sections.

Étape 2 : Récupération basée sur les cas
Pour chaque cas :
Générez des embeddings contextuels à l’aide d’un encodeur BERT adapté au domaine.
Générez des encastrements structurels basés sur la position de la section.
Générez des inclusions dans le réseau de citations.
Récupérez des cas similaires passés en utilisant la recherche Approximate Nearest Neighbor (ANN).
Raffinez les cas récupérés en utilisant le score d’attention croisée et le classement de pertinence basé sur l’ensemble.

Étape 3 : Adaptation de l’affaire
Pour chaque cas récupéré :
Extraire des schémas de raisonnement en utilisant l’analyse discursive.
Identifiez les arguments juridiques pertinents et attribuez des poids en fonction de leur importance.
Préserver le flux argumentatif pendant l’adaptation.
NOTE: Si des cas précédents contiennent des arguments non pertinents ou contradictoires, il faut les exclure lors de l’adaptation.

Étape 4 : Résumé basé sur un transformateur multi-étages
Pour chaque cas d’entrée et ses précédents adaptés :
Codez le cas d’entrée à l’aide d’un encodeur BERT du domaine juridique avec une attention hiérarchique et consciente de l’entité.
Appliquez le raisonnement inter-documents entre la requête et les cas récupérés.
Encodez des phrases en utilisant SBERT et Bi-LSTM pour des embeddings contextuels améliorés.
Décodez le résumé à l’aide d’un décodeur limité par le domaine afin de préserver l’exactitude factuelle et juridique.

Étape 5 : Sortie et validation
Pour chaque RÉSUMÉ COURT généré :
Validez le résumé généré pour sa cohérence, sa justesse factuelle et la fidélité du raisonnement juridique.
Retourner le résumé final S.
NOTE: Si une validation experte est requise, incluez une étape supplémentaire de révision humaine dans la boucle avant le déploiement.
Fin

Pour configurer l’environnement informatique, Python 3.10 a été installé. L’installation nécessite des bibliothèques : PyTorch (v2.0), Hugging Face Transformers (v4.32.0), SpaCy (v3.6), NLTK (v3.8.1), NetworkX (v3.1), DGL (v1.1). Le support GPU était configuré (deux GPU de 40 Go de mémoire chacun). Voir le tableau des matériaux pour les versions exactes et les sources.

L’ensemble de données de cas juridiques (≈ 5 000 cas) a été téléchargé depuis la source spécifiée et chaque cas a été vérifié pour inclure des champs : faits, arguments, citations et résultat du jugement. Stockez les documents au format texte brut UTF-8. La suppression des textes vides ou courts à l’aide d’un script Python (preprocess.py) a été effectuée. La suppression du bruit et l’unification de la mise en forme du texte ont été réalisées. La tokenisation en domaine juridique a été appliquée avec SpaCy (spacy.load(« en_core_legal_sm »)). La reconnaissance des entités juridiques a été réalisée à l’aide d’un modèle BERT affiné (transformers.pipeline(« ner », model="legal-bert-ler »)). Un graphique de citation a été construit avec NetworkX (nx. DiGraph()), reliant les nœuds par des précédents référencés. Si des documents basés sur OCR sont inclus, un script de nettoyage de texte supplémentaire (ocr_clean.py) était exécuté.

L’intégration contextuelle était générée avec un modèle BERT spécifique au domaine (bert-légal) et les incorporations de citations étaient générées à l’aide de codeurs de graphes DGL. La recherche approximative du plus proche voisin a été effectuée à l’aide de FAISS (faiss. IndexFlatIP). Le notage par attention croisée a été appliqué avec un module PyTorch (CrossAttentionScorer) et les résultats obtenus ont été classés par pondération d’ensemble de similarité contextuelle et de citation. La structure du discours a été analysée à l’aide d’un classificateur de rôles rhétorique (roberta-legal-rhétorique) et des schémas de raisonnement pertinents ont été extraits en alignant les rôles rhétoriques. Des poids ont été attribués aux segments d’arguments en fonction de la fréquence et de la force des citations. Excluez les précédents contradictoires ou hors sujet.

Les documents étaient encodés avec un encodeur BERT adapté au domaine et des modules d’attention hiérarchique étaient appliqués (implémentés en hierarchical_encoder.py). SBERT et Bi-LSTM (package transformateurs de phrases) étaient utilisés pour les inclusions de phrases. Les résumés abstraits étaient décodés à l’aide d’un décodeur contraint (legal_decoder.py). Limitez la longueur maximale de la séquence à 2048 jetons. Pour entraîner le modèle, définir la taille du lot = 32, taux d’apprentissage = 3e-5, entraîner pour 15 époques avec accumulation de gradient (8 étapes), appliquer le dropout = 0,15 et la décroissance du poids = 0,01, activer le lissage des étiquettes = 0,1. Modifier les hyperparamètres dans train_config.json.

Pour évaluer la performance, calculez ROUGE (1,2, L) en utilisant rouge_score bibliothèque, BLEU avec nltk.translate.bleu_score, et BERTScore avec bert_score package. Évaluer Legal-SemSim en utilisant des scripts de similarité sémantique basés sur des ontologies et l’entité F1 en utilisant SpaCy et des annotations gold. L’efficacité en temps d’exécution (secondes par pliage) était enregistrée, et les résumés comparés aux références or. Deux experts juridiques ont été sollicités pour examiner la veracité factuelle et les résumés finaux validés des résultats ont été conservés. En suivant ce protocole, on produira des résumés juridiques spécifiques au domaine qui préservent le raisonnement juridique, l’exactitude factuelle et la fidélité des citations.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Indicateurs d’évaluation

Le système a été évalué à l’aide d’un ensemble complet de métriques, qui est présenté dans le tableau 6.

Catégorie métriqueIndicateurs spécifiquesDescription
Chevauchement lexicalROUGE-1...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

L’efficacité de l’augmentation du CBR à la conception du transformateur à plusieurs étages a été atteinte en établissant une nouvelle référence de performance dans la synthèse textuelle du domaine juridique. Les résultats indiquent une amélioration significative des scores ROUGE de 78,4 ROUGE-1, 54,8 ROUGE-2 et 75,3 ROUGE-L, ainsi que des indicateurs spécifiques au domaine de 98 % de reconnaissance des entités juridiques F1. Pour valider davantage la contribution de chaque composant, on ...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Les auteurs déclarent qu’aucun conflit d’intérêts potentiel n’est lié au contenu de cette étude.

Remerciements

Les auteurs expriment leur sincère gratitude au département d’informatique et d’ingénierie de la Koneru Lakshmaiah Education Foundation (reconnue comme université), Hyderabad, Telangana, Inde, pour la fourniture des installations informatiques et de l’infrastructure de recherche essentielles à ce travail. Un merci tout particulier est adressé aux experts juridiques et spécialistes du domaine qui ont contribué à l’annotation et à l’évaluation du corpus juridique utilisé dans cette étude.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Matériel CPUAMD EPYC 7742 (64 cœurs, 2,25 GHz)1 unitéAMD
CadrePyTorch2https://pytorch.org
Matériel GPUNVIDIA A100 (40 Go)2 unitésNVIDIA Corp.
Cadre de graphesDGL1.1https://www.dgl.ai
BibliothèqueTransformateurs Face Câlins4.32.0https://huggingface.co/transformers
BibliothèqueSpaCy3.6https://spacy.io
BibliothèqueNLTK3.8.1https://www.nltk.org

Références

  1. Powers, D. M. Evaluation: From precision, recall and F-measure to ROC, informedness, markedness & correlation. J Mach Learn Technol. 2 (1), 37-63 (2011).
  2. Eisenberg, M. A. Legal Reasoning. , Cambridge University Press. (2022).
  3. Lin, C. Y. ROUGE: A Package for Automatic Evaluation of Summaries. Text Summarizat Branches Out. , 74-81 (2004).
  4. Lewis, M., et al. Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension. Proc ACL. , 7871-7880 (2020).
  5. Hadi, A. Leveraging Transformer-Based Language Models to Bridge the Gap Between Language and Specialized Domains. [Doctoral Dissertation]. , Institut Polytechnique de Paris. (2024).
  6. Waterworth, K. Model-Agents of Change: A Meta-Cognitive, Interdisciplinary, Self-Similar, Synergetic Approach to Neuro-Symbolic Semantic Search and Retrieval Augmented Generation. [Master's Thesis]. , Miami University. (2024).
  7. Zhang, J., Zhao, Y., Saleh, M., Liu, P. PEGASUS: Pre-training with Extracted Gap-sentences for Abstractive Summarization. Proc ICML. , 11328-11339 (2020).
  8. Li, Z., et al. When object detection meets knowledge distillation: A survey. IEEE Trans. Pattern Anal Mach Intell. 45 (8), 10555-10579 (2023).
  9. Chen, Y., et al. Citation Network Analysis for Legal Reasoning. J AI Law. 28 (2), 145-170 (2020).
  10. Raffel, C., et al. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. J Mach Learn Res. 21 (140), 1-67 (2020).
  11. Reimers, N., Gurevych, I. Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proc EMNLP. , 3982-3992 (2019).
  12. Gunning, D., Aha, D. DARPA's explainable artificial intelligence (XAI) program. AI Mag. 40 (2), 44-58 (2019).
  13. Mihalcea, R., Tarau, P. TextRank: Bringing Order into Texts. Proc EMNLP. , 404-411 (2004).
  14. Sharma, G., Sharma, D. Automatic text summarization methods: A comprehensive review. SN Comput Sci. 4 (1), 33(2022).
  15. Xu, J., Croft, W. B. Neural Networks for Text Classification. Inf Retr J. 20 (3), 259-289 (2017).
  16. Ghosh, S., Dutta, A., Das, A. Indian Legal Text Summarization: A Text Normalisation-based Approach. arXiv. , (2022).
  17. Silver, D., et al. Mastering the Game of Go with Deep Neural Networks and Tree Search. Nature. 529, 484-489 (2016).
  18. Chalkidis, I., et al. LexGLUE: A benchmark dataset for legal language understanding in English. Proc ACL. 60 (1), 4310-4330 (2022).
  19. Ashley, K. Artificial Intelligence and Legal Analytics. , Cambridge University Press. (2017).
  20. Chalkidis, I., Fergadiotis, M., Aletras, N. LEGAL-BERT: The Muppets Straight Out of Law School. Proc ACL. , 2898-2910 (2020).
  21. Vaswani, A., et al. Attention Is All You Need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  22. Baker, A. R., Slack, F. J. ADAR1 and its implications in cancer development and treatment. Trends Genet. 38 (8), 821-830 (2022).
  23. Casola, S., Lavelli, A. Summarization, simplification, and generation: The case of patents. Expert Syst. Appl. 205, 117627(2022).
  24. Valente, A. Legal Knowledge Engineering. , IOS Press. (1995).
  25. Katz, D. M., et al. Natural language processing in the legal domain. arXiv. , (2023).
  26. Gilpin, L., et al. Explaining Explanations: An Approach to Interpretable AI. Proc ICML. 70, 89-98 (2018).
  27. Davoodijam, E., Alambardar Meybodi, M. Evaluation metrics on text summarization: comprehensive survey. Knowl Inf Syst. 66 (12), 7717-7738 (2024).
  28. Schauer, F. Precedent. , Stanford Encyclopedia of Philosophy. (1989).
  29. Bengio, Y., Louradour, J., Collobert, R., Weston, J. Curriculum Learning. Proc ICML. , 382-389 (2009).
  30. Vrandecic, D., Krötzsch, M. Wikidata: A Free Collaborative Knowledge Base. Commun ACM. 57 (10), 78-85 (2014).
  31. Chu, Y., Ye, M., Qian, Y. Fine-Grained Image Recognition Methods and Their Applications in Remote Sensing Images: A Review. IEEE J Sel Top Appl Earth Obs Remote Sens. 17 (6), 1234-1250 (2024).
  32. Vue, Z., et al. Stories from Hmong in STEMM. Trends Genet. 39 (8), 587-592 (2023).
  33. Begum, N., Goyal, A. Analysis of Legal Case Document Automated Summarizer. Proc ISPCC. , 533-538 (2021).
  34. Surden, H. Ethics of AI in Legal Practice. J Legal Ethics. 32 (2), 145-163 (2019).
  35. Bench-Capon, T. J. M., Sartor, G. Ontology-Based Legal Reasoning. Artif Intell Law. 11 (2), 125-157 (2003).
  36. Liu, Y. Fine-tune BERT for Extractive Summarization. arXiv. , (2019).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Mots-clés

Architecture TransformerPr diction de l juridiqueReconnaissance d entit s nomm es juridiquesR sum abstractifR sum extractifScores ROUGE