È richiesta un abbonamento a JoVE per visualizzare questo contenuto. Accedi o inizia la tua prova gratuita.

Articolo di ricerca

Ragionamento basato su casi con deep learning per un approccio ibrido alla sintesi di testi giuridici

483 visualizzazioni

DOI:

10.3791/69287

12 dicembre 2025

In questo articolo

Sommario

Questo protocollo integra il Ragionamento Basato sul Caso (CBR) con modelli di trasformatori a più stadi per riassumere testi giuridici. Pre-elabora casi legali, recupera precedenti simili, adatta strutture di ragionamento e genera riassunti accurati e coerenti. Le applicazioni includono la ricerca giuridica, l'analisi dei giudizi e i sistemi di supporto decisionale, garantendo coerenza fattuale e fedeltà del ragionamento specifico per dominio.

Abstract

I documenti legali sono noti per essere lunghi e complessi, il che rende praticamente impossibile per i professionisti legali e i ricercatori identificare e estrarre rapidamente le informazioni rilevanti. Qui viene presentato un approccio ibrido che supera le precedenti basi estrattive e astrattive sia sulle metriche di sovrapposizione lessicale sia su metriche di ragionamento specifico per dominio, utilizzando il Ragionamento Basato sui Casi (CBR) per i testi giuridici e tecniche concrete di deep learning per la rappresentazione sommaria, producendo riassunti in modo accurato ed efficiente. Utilizzando un dataset più ampio di 4.968 casi legali di Kaggle, è stata costruita un'architettura di trasformatore multistadio sopra il modello generale di recupero CBR creato in precedenza per produrre brevi riassunti insieme al CBR per la comprensione del contesto. Il sistema è stato valutato sulla previsione degli esiti giuridici e sulla coerenza del sommario, con risultati che mostravano prestazioni superiori rispetto ai metodi estrattivi e astratti esistenti, e ha addestrato il modello proposto fino al 98% di accuratezza delle entità giuridiche, insieme al 46% di corpus giuridico coerente in più (migliorato dalla baseline) rispetto ai metodi all'avanguardia, rispetto all'uso di punteggi ROUGE superiori ai tipi precedenti del 23%. Questo studio presenta un quadro ibrido di sintesi giuridiche che integra la CBR con modelli basati su trasformatori. Esperimenti estesi mostrano prestazioni superiori rispetto alle recenti basi, raggiungendo una maggiore accuratezza fattuale, fedeltà del ragionamento e conservazione dell'entità giuridica.

Introduzione

L'ampia documentazione legale ha reso necessari metodi avanzati per recuperare i dati pertinenti in modo tempestivo. La sintesi del testo giuridico è importante per migliorare l'accessibilità e il processo decisionale. Pareri legali, sentenze e precedenti sono così verbosi che giudici, professionisti e ricercatori possono avere difficoltà a elaborarli, portando così allo sviluppo di metodi automatizzati per riassumere questi documenti in modo accurato edefficiente 1.

Nonostante le loro prestazioni all'avanguardia nei casi più generali, i metodi di sintesi esistenti faticano a catturare la complessità unica e il gergo giuridico che caratterizzano i documenti legali. Semplicemente scegliere le frasi più in cima senza riorganizzare basandosi sulla probabilità logaritmica ottiene buoni punteggi ROUGE, ma perde per il contesto e la semantica completa. Gli approcci astratti utilizzano la generazione di linguaggio naturale per comporre la copertura, così da poter catturare la sfumatura contestuale, ma faticano a preservare il processo logico e il ragionamento giuridico dei casigiudiziari 2. Il metodo proposto è particolarmente efficace per i testi legali di lunga forma contenenti sezioni strutturate (ad esempio, fatti, argomentazioni, precedenti e sentenze). Eccelle quando viene applicato a corpora con citazioni esplicite e formattazione standardizzata, come decisioni d'appello o della corte suprema. Tuttavia, le prestazioni possono essere limitate a dataset rumorosi o non strutturati (ad esempio, PDF scansionati con errori OCR o documenti privi di chiara segmentazione retorica). Pertanto, il metodo è più adatto a repository digitali ben strutturati dove sono accessibili sia le funzionalità linguistiche che quelle dicitazione 3.

Il framework ibrido superiore proposto che combina il ragionamento basato sui casi (CBR) con l'avanzato Natural Language Processing (NLP) viene utilizzato per generare un sommario. Utilizza un'architettura di trasformatori a più stadi con strati di attenzione legali specifici per dominio e propone un modulo di ragionamento cross-document. Il CBR consente al sistema di caricare casi simili passati che possono essere utilizzati per esaminare tutte le variabili contestuali per motivigiuridici 4. Il modello proposto ha raggiunto una precisione superiore rispetto alle basi all'avanguardia, come dimostrato dai progressi quantitativi nelle metriche ROUGE, BLEU e Legal-SemSim, e convalidato da una valutazione da esperti umani. Ad esempio, il modello proposto ha superato Legal-BART e PALM-Law con margini del 15%-20% nell'accuratezza della catena di ragionamento. Abbracciare rappresentazioni generali e approcci sofisticati aggiunge conoscenze specifiche per caso insieme alla sintesi neurali e alla divinazione del 98% di precisione per il riconoscimento delle entità giuridiche e del 97% per il recupero di precedenti, superando di gran lunga i lavoriprecedenti 5.

Lavori correlati

La sintesi del testo giuridico, un sottodominio dell'elaborazione del linguaggio naturale (NLP), ha attirato sempre più attenzione a causa della crescente domanda di elaborazione efficiente dei documenti giuridici, inclusi pareri giudiziari, statuti e giurisprudenza. La sfida principale risiede nel preservare l'integrità semantica, il ragionamento giuridico e il contesto specifico del dominio nei riassunti generati. Le ricerche precedenti spaziano tra approcci estrattivi, astratti e ibridi, con recente enfasi sulle architetture neurali adattate aldominio 6.

Revisione della letteratura

La sintesi del testo giuridico si è evoluta come un'area critica all'interno dell'elaborazione del linguaggio naturale, spinta dalla pressante necessità di rendere voluminosi e complessi documenti legali accessibili e utilizzabili. La letteratura del dominio riflette una traiettoria che va da modelli estrattivi superficiali a architetture ibride sofisticate che cercano di bilanciare fluidità, integrità fattuale e logica legale. I primi sforzi si sono concentrati su tecniche di riassunto estrattivo, che davano priorità all'importanza delle frasi basandosi sulla somiglianza lessicale e sui modelli statistici. Sebbene efficaci nel selezionare frammenti giuridicamente rilevanti, questi approcci, come TextRank e LexRank, spesso ignorano la struttura semantica più profonda e non riescono a catturare gli strati retorici e argomentativi essenziali nel ragionamentogiuridico 6. Poiché i testi giuridici differiscono nettamente dai corpora generali a causa della loro semantica rigida e delle espressioni specifiche per dominio, questi modelli producevano riassunti privi di coerenza e adeguatezza contestuale. Con l'avvento delle architetture a transformer pre-addestrate, il focus della ricerca si spostò verso metodi astratti. Modelli come BART, T5 e PEGASUS iniziarono a mostrare la capacità di sintetizzare riepiloghi utilizzando schemi di generazione di linguaggio appreso. Le loro adattazioni giuridiche, come LegalBART e LegalPEGASUS, hanno ulteriormente perfezionato le prestazioni incorporando corpora pretrainingspecifici per la legge 7. Tuttavia, i metodi astratti continuarono a soffrire di limitazioni nella coerenza del ragionamento e nella spiegabilità—sfide particolarmente problematiche in contesti giuridici, dove anche piccole deviazioni fattuali possono portare a interpretazioni errate.

Modelli ibridi sono emersi in risposta a questi deficit, incorporando strategie basate sul ragionamento simbolico o sul recupero per migliorare il fondamento contestuale. Una direzione notevole è stata l'integrazione della CBR, dove la conoscenza dei casi precedenti è stata utilizzata per contestualizzare il processo di generazione sommaria. Questi modelli cercano di mantenere il rigore fattuale dei metodi estrattivi generando al contempo output linguisticamente coerenti e legalmentevalidi 8.

Le tendenze recenti enfatizzano architetture a più stadi che combinano riconoscimento di entità giuridiche, ragionamento tra documenti e paring retorico dei ruoli, suggerendo uno spostamento verso una comprensione olistica dei documenti piuttosto che una semplice sintesi. La ricerca ora considera sempre più spesso l'allineamento delle ontologie giuridiche, le metriche di valutazione specifiche per dominio (ad esempio, Legal-SemSim) e la valutazione centrica sull'uomo per valutare la qualità e l'usabilità dei riassunti per i professionistilegali 9.

Sondaggi recenti, come Exploring LLM Applications in Law nel 2023 e Exploring the Use of LLM in the Italian Legal Domain nel 2024, evidenziano il ruolo crescente dei grandi modelli linguistici (LLM) nell'automatizzazione del ragionamento giuridico, della sintesi e dei compiti direcupero 10. Questi lavori sottolineano non solo la capacità di LLM come GPT-4, PaLM e LLaMA di catturare le sfumature contestuali del discorso giuridico, ma anche le sfide dell'adattamento del dominio, della spiegabilità e della coerenzafattuale 11. I sistemi ibridi che integrano la generazione aumentata al recupero (RAG) o CBR con LLM sono sempre più esplorati per combinare i punti di forza del ragionamento consapevole dei precedenti con la fluidità generativa deitransformer 6. Posizionando il lavoro all'interno di questa tendenza, il modello ibrido multistadio proposto estende i precedenti framework potenziati al recupero codificando esplicitamente catene di ragionamento legale, mantenendo la coerenza tramite una sintesi astratta basata su transformer.

Nonostante i progressi significativi, rimane una lacuna nei modelli in grado di sintetizzare sintesi giuridiche fattuali, logicamente strutturate e coerenti nel dominio, mantenendo al contempol'interpretabilità 12. Il presente lavoro colma questo vuoto proponendo un approccio ibrido a più stadi basato su CBR legale e architettura neurale profonda, offrendo un modello sia accurato che praticamente utilizzabile.

Approcci di riassunto estrattivo

Il termine riassunto estrattivo viene utilizzato per i metodi che estraggono e uniscono insieme le frasi più informative dal documento. Gli algoritmi basati su grafi, ad esempio TextRank13 e LexRank14, sono approcci tradizionali che classificano le frasi in base alla loro importanza. Sebbene computazionalmente fattibile, tali approcci tipicamente faticano con ragionamenti giuridici complessi eargomentazioni 8. Con l'avvento dei modelli linguistici pre-addestrati, metodi basati su BERT comeBERTSUM 8 hanno mostrato miglioramenti significativi. BERTSUM affina gli embedding BERT per la sintesi estrattive a livello di frase, catturando meglio le sfumature contestuali rispetto ai modellistatistici 9. Adattamenti di dominio legale come Legal-BERTSUM affinano ulteriormente le prestazioni incorporando corpora specifici per il giuridico, permettendo un migliore riconoscimento dei termini giuridici e una migliore selezione delle sentenze. Tuttavia, i metodi estrattivi sono limitati nella ricostruzione del flusso argomentativo o della catena di ragionamento legale, specialmente quando le frasi sono interdipendenti o i riferimenti sonoimpliciti 15.

Approcci di riassunta

La sintesi astratta genera frasi e frasi innovative che riformulano il contenuto sorgente, spesso utilizzando architetture codificatore-decodificatore. Il modelloBART 4 e PEGASUS7 sono esempi di riferimento di modelli sequenzia a sequenza pre-addestrati applicati alla sintesi generale. Questi sono stati adattati al dominio legale tramite la perfezione dei corpora giuridici, dando origine a modelli come Legal-BART e Legal PEGASUS16,17. Questi modelli producono riassunti più fluidi e simili a quelli umani e sono più efficaci nel catturare il significato contestuale rispetto agli approcciestrattivi 18.

Tuttavia, la loro applicazione nella sintesi giuridica pone delle sfide. I modelli astratti spesso faticano con la coerenza fattuale e la conservazione della semantica legale. L'interpretazione errata di clausole legali o l'omissione di entità giuridiche chiave possono rendere un sommariofuorviante 19. Inoltre, i modelli di generazione di testi neurali sono generalmente opachi, sollevando questioni riguardo alla spiegabilità e alla verificabilità, entrambe fondamentali nei domini giuridici.

Modelli di riassunto ibrido

Per sfruttare i punti di forza di entrambi i paradigmi, i modelli di riassunto ibrido integrano componenti estrattive e astrattiche. Una delle prime strategie era utilizzare moduli estrattivi per selezionare frasi candidate, che poi venivano raffinate da un decodificatore astrattivo. Più recentemente, l'architettura dei transformer è stata combinata con moduli integrati dalla conoscenza per migliorare la comprensionegiuridica 5.

La RBC si è affermata come una promettente strategia ibrida. Waterworth fu pioniere nell'uso di casi precedenti per informare le decisioni attuali, e la sua integrazione con i modelli neurali consente l'arricchimento semantico attraverso il ragionamentoanalogico 6. In sintesi giuridiche, combinare CBR con trasformatori consente sia il riutilizzo contestuale sia la sintesi astratta. Modelli come BART+CBR integrano un contesto giuridico basato sul recupero con meccanismi generativi, offrendo coerenza e rilevanza giuridicamigliorate 20.

L'architettura proposta Multistage + CBR si basa su questa linea di lavoro incorporando catene di ragionamento specifiche per dominio nella pipeline di sintesi. Presenta blocchi gerarchici di trasformatore, attenzione cross-document e strati di recupero migliorati con CBR, specificamente pensati per applicazioni legali. Questo design multilivello facilita sia la comprensione dei contenuti a grana fine sia la conservazione della struttura a livellomacro 21.

Sfide e considerazioni legali specifiche

I documenti giuridici presentano caratteristiche strutturali e linguistiche uniche, tra cui formattazione gerarchica, riferimenti incrociati di precedenti, citazioni statutarie e terminologia specifica per dominio22. I modelli di riassunto devono quindi non solo gestire complessità sintattiche e semantiche, ma anche rispettare la coerenza logica e la progressione dell'argomentazionegiuridica 23. Una sintesi efficace in questo contesto si basa sul riconoscimento accurato delle entità giuridiche, sulla conservazione della struttura di ragionamento e sull'interpretazione dei ruoli retorici come fatti, argomentazioni e giudizi.

Ontologie legali e reti di citazione sono state impiegate per migliorare la comprensione del dominio. Ad esempio, l'integrazione di basi di conoscenza giuridiche strutturate durante l'addestramento al modello ha dimostrato di migliorare il collegamento tra le entità legali e la coerenza dellecitazioni 24. Questi sforzi contribuiscono a riassumere modelli che si allineano meglio alle aspettative dei professionisti del diritto25.

Un'altra sfida è l'interpretabilità. In contesti giuridici, l'output deve essere auditabile e interpretabile. Pertanto, i framework di IA spiegabile (XAI) come LIME e SHAP sono sempre più esplorati per giustificare le decisioni di sintesi, anche se l'integrazione con modelli su larga scala rimane una sfida di ricerca incorso.

Metriche di valutazione nella sintesi giuridiche

Metriche di riassunto standard come ROUGE8, BLEU27 e METEOR sono comunemente utilizzate per la valutazione della sovrapposizione lessicale. Tuttavia, queste misure sono insufficienti per catturare fedeltà semantica, coerenza giuridica e coerenza argomentativa.

Sforzi recenti introducono metriche specifiche per dominio come Legal-SemSim, che incorpora ontologie legali per valutare la similarità semantica, e l'accuratezza della catena di ragionamento, che valuta la conservazione del flusso logico e la validità dellaconclusione 28. La valutazione degli esperti umani rimane indispensabile, in particolare per misurare la correttezza legale, la coerenza e la capacità di agire. L'accordo inter-annotatori utilizzando metriche come la Kappa di Fleiss garantisce affidabilità delle valutazioni qualitative29.

Recenti progressi e future direzioni nella sintesi giuridica

La ricerca sulla riassuntazione legale si sta muovendo verso sistemi più robusti, consapevoli del contesto e spiegabili. Le architetture ibride simbolico-neurale che integrano il ragionamento basato su regole con modelli di trasformatori stanno guadagnando terreno. Questi sistemi mantengono l'interpretabilità degli approcci basati sulla logica beneficiando della capacità di generalizzazione del deeplearning 28.

La sintesi giuridica multilingue è un'altra frontiera emergente, che affronta la natura globale dei testi e dei procedimentigiuridici 30. Il ragionamento temporale, necessario per comprendere le sequenze legali dipendenti dal tempo, e la modellazione argomentativa del discorso sono anch'essi inesplorazione 9.

Inoltre, i progressi nell'apprendimento contrastivo e nell'apprendimento curricolareche vengono utilizzati per migliorare la generalizzazione dei modelli in diversi dominigiuridici 17. Aumentando gradualmente la complessità dei compiti e differenziando classi semantiche a grana fine, queste tecniche migliorano la robustezza del modello negli scenarireali 31.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Questo protocollo utilizza dataset legali pubblicamente disponibili. Non sono stati utilizzati dati personali o riservati sensibili. Lo studio è conforme alle linee guida etiche istituzionali per l'uso dei corpora legali nella ricerca (Koneru Lakshmaiah Education Foundation (Deemed to be University), Hyderabad, Telangana, India, Approvazione n.: KLEF/CS/2024/IRB-017). Lo studio utilizza un dataset di 4.968 casi legali, ciascuno con annotazioni inclusive. La Tabella 1 mostra la descrizione del dataset.

precedent_citationsCitazioni strutturate ai casi precedenti
reasoning_chainsSequenze di ragionamento logico annotate

Tabella 1: Descrizione dell'attributo del dataset.

Dataset per lo studio

Dopo la pre-elaborazione, il dataset viene normalizzato per standardizzare i risultati. La lunghezza dei testi dei casi varia tra 1.000 e 5.000 parole, esausti per la formazione e la valutazione. Abbiamo raccolto i risultati dei casi in etichette primarie in base alla loro frequenza nel dataset, permettendoci di esplorare le prestazioni di sintesi in diversi contesti giuridici. L'annotazione è stata condotta da un team di cinque professionisti del diritto, tra cui tre avvocati in attività e due ricercatori di dottorato specializzati in informatica legale. Ogni caso veniva annotato indipendentemente da due esperti, con i conflitti risolti da un annotatore senior. Lo schema di annotazione includeva entità giuridiche, citazioni di precedenti e catene di ragionamento. L'accordo tra annotatori è stato misurato usando il Kappa di Fleiss (κ = 0,82), indicando una forte coerenza tra gli annotatori. Questo processo garantiva sia la validità legale sia la riproducibilità del dataset.

Distribuzione dei dataset

Il dataset include casi che contengono vari domini giuridici, come mostrato nella Tabella 2.

Dominio GiuridicoNumero di casiPercentuale
Diritto dei Contratti1,27825.70%
Proprietà intellettuale1,05321.20%
Diritto costituzionale51210.30%
Diritto amministrativo4328.70%
Diritto penale3086.20%
Diritto della responsabilità civile2194.40%
Altro/Vari1,16623.50%

Tabella 2: Casi contenenti vari domini giuridici.

La distribuzione degli esiti dei casi nel dataset è mostrata nella Tabella 3.

Esito del casoContarePercentuale
Citato2,46049.20%
Riferito85517.10%
Seguito4719.40%
Applicato4478.90%
Considerato3537.10%
Altri esiti3828.30%

Tabella 3: Distribuzione degli esiti dei casi attraverso il dataset.

Pertanto, ha confermato una rappresentazione sensata tra domini nell'addestramento, nella validazione e nelle suddivisioni dei test utilizzando campionamenti stratificati per prevenire bias specifici di dominio. Il dataset era suddiviso in set di addestramento (80%), validazione (10%) e set di test (10%).

Distribuzione della lunghezza del testo

L'analisi della distribuzione della lunghezza del testo è presentata nella Tabella 4.

Intervallo di lunghezza (parole)ContarePercentuale
Sotto i 5004659.40%
500-1,0001,35927.40%
1,000-5,0002,69854.30%
5,000-10,0003236.50%
Oltre 10.0001543.10%

Tabella 4: Analisi della distribuzione della lunghezza del testo.

Questa distribuzione evidenzia la varietà di lunghezze dei documenti, con la maggior parte che si colloca nella fascia di lunghezza media (1.000-5.000 parole), il che rappresenta una sfida appropriata per le tecniche di riassunto.

Pre-elaborazione dei dati migliorata

La pipeline di preprocessing è stata informata da studi recenti sull'impatto della preprocessing nei compiti NLP legali basati su transformer. Chalkidis et al. dimostrano che la tokenizzazione consapevole del dominio e la normalizzazione delle citazioni migliorano significativamente l'accuratezza della sommizzazione avalle 30. Analogamente, Bommarito e Katz mostrano che le scelte di preelaborazione, in particolare la normalizzazione delle entità, influenzano direttamente le prestazioni dei transformer nella riassuntogiuridico 32. Sulla base di queste intuizioni, la pipeline impiegava tokenizzazione consapevoli delle sezioni, normalizzazione delle citazioni legali e parsing retorico dei ruoli per massimizzare la coerenza contestuale. Fu sviluppata una nuova pipeline di pre-elaborazione, che integrava metodi generali di pre-processing e tecniche specifiche per dominio per ottenere testo legale di alta qualità ed eliminare inizialmente alcuni casi di campi di testo vuoti o molto brevi, al fine di garantire l'integrità dei dati. Successivamente, è stata effettuata la normalizzazione degli input, dove sono state applicate regole legali di tokenizzazione per garantire l'usabilità degli input33. Le entità chiave sono state estratte utilizzando un modello personalizzato di riconoscimento delle entità giuridiche ad alte prestazioni (LER) (punteggio F1 del 98%) e sono state utilizzate tecniche di parsing del discorso per comprendere gli elementi strutturali. Per migliorare l'analisi dei precedenti, è stato introdotto un passaggio di costruzione del grafo di citazione. Altri passaggi di pre-elaborazione sono specifici per i parser di espressioni regolari, validando che il loro input corrisponde esattamente ai formati molto rigorosi per le citazioni legali standardizzate. Sono stati applicati tokenizzatori consapevoli di sezione per strutture gerarchiche di documenti, e per ogni testo legale è stato aggiunto un classificatore RoBERTa finemente calibrato, etichettato con ruoli retori come fatti, argomentazioni e decisioni. Questa pipeline più ampia ci permette di integrare in modo semplice i compiti a valle come il recupero del testo legale, il ragionamento e la sintesi.

Modulo avanzato di ragionamento basato su casi

Lo studio presenta per la prima volta un'applicazione avanzata di un sistema di ragionamento basato sui casi (CBR) all'avanguardia che può utilizzare la similarità semantica e la conoscenza del dominio legale per fornire casi rilevanti e comparabili con una precisione di recupero del 98% sul dataset di benchmark. La Enhanced Case Representation codifica ogni caso con un vettore ibrido che combina embedding contestualizzati - prodotti da un modello BERT focalizzato sul dominio su testo giuridico - con embedding strutturali che riflettono la posizione degli elementi nel documento, embedding consapevoli dell'entità che enfatizzano le relazioni legali presenti nei casi, e embedding di rete di citazione che rappresentano come i precedenti sono legati tra loro. Il recupero dei casi a più stadi agisce come un approccio a più fasi, eseguendo prima la ricerca Approximate Nearest Neighbor (ANN) per ottenere i candidati seed, applicando l'attenzione incrociata per ottenere corrispondenze ottimali dai candidati e utilizzando una funzione di punteggio specifica per dominio e una rilevanza basata su ensemble per selezionare i recuperi nel miglior caso. Durante la Advanced Case Adaptation Stage (ACAS), il sistema estrae schemi di ragionamento tramite un template di rappresentazione basato su grafi che cattura dipendenze logiche tra argomentazioni giuridiche. Successivamente identifica la rilevanza dei precedenti tramite analisi delle citazioni, pesando ogni componente del caso in base alla sua importanza contestuale per la richiesta. Infine, la struttura argomentativa viene mantenuta utilizzando metodi basati sull'analisi del discorso per garantire che il flusso logico del ragionamento giuridico sia preservato. L'ultimo modulo, il modulo Integrazione della Conoscenza, facilita il recupero tramite ontologie giuridiche, registra le relazioni temporali precedente e mantiene la validità in catene complesse di ragionamento giuridico. Il sistema CBR proposto raggiunge un tasso di recupero corretto del 98%, superiore ai benchmark precedentemente riportati (ad esempio, LexGLUE, 92%-95%) per il recupero e l'adattamento di casi legali.

Architettura a trasformatore multistadio

Sulla base dei riferimenti sopra menzionati, lo studio propone un metodo basato su reti neurali artificiali su un modello di architettura multistadio basato su trasformatori che sfrutta i migliori elementi di tutti gli algoritmi menzionati per migliorare l'elaborazione, il ragionamento e la sintesi automatica dei documenti giuridici. La fase di comprensione dei documenti utilizza un codificatore BERT adattato al dominio legale, meccanismi gerarchici di attenzione e moduli per il riconoscimento di entità giuridiche, l'estrazione delle relazioni e l'elaborazione dei grafi di citazione per acquisire una comprensione strutturale e contestuale profonda dei documenti giuridici. La fase di ragionamento cross-document aiuta il ragionamento basato sui casi collegando le query ai casi recuperati attraverso un meccanismo di attenzione incrociata, sotto forma di estrazione e convalida delle catene di ragionamento giuridico, un modello di applicazione dei precedenti e la conservazione della struttura argomentativa. SBERT e Bi-LSTM sono stati utilizzati nel livello di formazione dell'embedding delle frasi, mentre un decodificatore personalizzato con vincoli di dominio legale è stato utilizzato a livello di generazione di riepilogo astratto per mantenere accuratamente i termini legali, la coerenza fattuale e la gerarchia nel riassunto secondo i requisiti di scrittura legale. Dividendo il processo in diverse fasi, si può garantire che l'elaborazione dei documenti preservi la coerenza fattuale, la coerenza contestuale e la fedeltà delle citazioni. Il processo di addestramento proposto per il modello è mostrato nella Tabella 5.

IperparametroValore
Dimensione del lotto32
Tasso di apprendimento3e-5 con riscaldamento
Epoche15
Lunghezza massima della sequenza2048 gettoni
Tasso di abbandono0.15
Accumulo di gradiente8 passaggi
Passaggi di riscaldamento1000
Decadimento del peso0.01
Levigatura dell'etichetta0.1

Tabella 5: Processo di addestramento con modello.

Per migliorare le prestazioni e la generalizzazione dei modelli, abbiamo implementato molteplici tecniche di addestramento avanzate, che sono state trattate in dettaglio. Ha impiegato l'apprendimento curricolare per aumentare gradualmente la complessità dei compiti, permettendo al modello di acquisire competenze di base prima di affrontare situazioni più impegnative. Conducendo esperimenti sul dataset di addestramento, il ricercatore ha confermato che il fine-tuning ha rifinito con successo le rappresentazioni semantiche aiutando il modello a differenziare tra dati altamente simili e dissimili, aumentando così la comprensione del dataset. Per quanto riguarda l'apprendimento multi-task, la sintesi era accompagnata da un compito ausiliario, ad esempio classificazione o riconoscimento delle conseguenze, che favorivano una comprensione più ampia del dominio giuridico. Il trasferimento di conoscenze importanti tramite distillazione della conoscenza che mantiene conoscenze di alto livello senza rendere il modello enorme è già stato trasferito per modelli più ampi focalizzati suldominio 7.

Metodologia di sintesi legali ibride a più stadi

Per operazionalizzare il quadro proposto, viene presentato l'algoritmo passo a passo 1, che rappresenta la metodologia di sintesi legali ibride a più stadi.

Algoritmo 1:
Algoritmo: Riassunto Legale Ibrido Multi-Fasi
Immissione: Dataset di Casi Legali D con campi {case_text, legal_entities, citazioni, risultato}
Prodotto: Sommario S per ogni caso con il ragionamento giuridico preservato
Cominciare
Fase 1: Preprocessing dei dati
Per ogni caso in D:
Normalizza il testo per rimuovere il rumore e unificare la formattazione.
Applicare il Riconoscimento dell'Entità Giuridica (LER) per estrarre le entità giuridiche.
Costruisci un grafico delle citazioni partendo dai precedenti citati.
Tokenizza il testo utilizzando regole di tokenizzazione legali domain-conscious.
NOTA: Se il corpus di input contiene testi rumorosi o incompleti, eseguire ulteriori normalizzazioni come il filtraggio delle parole stop o la segmentazione delle sezioni.

Fase 2: Recupero basato su casi
Per ogni caso:
Genera embedding contestuali utilizzando un codificatore BERT adatto al dominio.
Genera embeddings strutturali basati sulla posizione della sezione.
Genera embedding nella rete di citazioni.
Recupera casi simili passati utilizzando la ricerca Approximate Nearest Neighbor (ANN).
Rifinire i casi recuperati utilizzando la valutazione a attenzione incrociata e la classificazione di rilevanza basata su ensemble.

Fase 3: Adattamento del caso
Per ogni caso recuperato:
Estrai i modelli di ragionamento usando il discourse parsing.
Identifica argomentazioni legali rilevanti e assegna pesi in base alla loro importanza.
Preserva il flusso argomentativo durante l'adattamento.
NOTA: Se i casi precedenti contengono argomenti irrilevanti o contraddittori, escluderli durante l'adattamento.

Fase 4: Sintesi basate su trasformatori multistadio
Per ogni caso di input e i suoi precedenti adattati:
Codificare il caso di input usando un encoder BERT di dominio legale con attenzione gerarchica e consapevole dell'entità.
Applica il ragionamento cross-document tra la query e i casi recuperati.
Codificare frasi usando SBERT e Bi-LSTM per inserimenti contestuali migliorati.
Decodifica il riassunto utilizzando un decoder vincolato al dominio per preservare l'accuratezza fattuale e legale.

Fase 5: Output e Validazione
Per ogni BREVE ABSTRACT generato:
Valida il riassunto generato per verificare coerenza, correttezza fattuale e fedeltà del ragionamento giuridico.
Restituisci il riassunto finale S.
NOTA: Se è richiesta una validazione esperta, includere un ulteriore passaggio di revisione umano nel ciclo prima del deployment.
Fine

Per configurare l'ambiente informatico, è stato installato Python 3.10. L'installazione richiede librerie: PyTorch (v2.0), Hugging Face Transformers (v4.32.0), SpaCy (v3.6), NLTK (v3.8.1), NetworkX (v3.1), DGL (v1.1). Il supporto GPU era configurato (due GPU ciascuna con 40 GB di memoria). Consulta la Tabella dei Materiali per versioni esatte e fonti.

Il dataset dei casi legali (≈ 5.000 casi) è stato scaricato dalla fonte specificata e ogni caso è stato verificato includendo campi: fatti, argomentazioni, citazioni ed esito del giudizio. Memorizza i documenti in formato di testo semplice UTF-8. È stata effettuata la rimozione di testi vuoti o brevi tramite uno script Python (preprocess.py). Fu effettuata la rimozione del rumore e l'unificazione della formattazione del testo. La tokenizzazione a dominio legale veniva applicata con SpaCy (spacy.load("en_core_legal_sm")). Il riconoscimento dell'entità giuridica veniva eseguito utilizzando un modello BERT fine-tuned (transformers.pipeline("ner", model="legal-bert-ler")). Un grafo delle citazioni è stato costruito con NetworkX (nx. DiGraph()), collegando i nodi tramite precedenti riferiti. Se sono inclusi documenti basati su OCR, viene eseguito uno script aggiuntivo di pulizia del testo (ocr_clean.py).

L'embedding contestuale veniva generato con un modello BERT specifico per dominio (bert-legal) e gli embedding di citazione venivano generati utilizzando codificatori di grafo DGL. La ricerca approssimativa del vicino più prossimo veniva effettuata utilizzando FAISS (faiss. IndexFlatIP). Il punteggio di attenzione incrociata è stato applicato con un modulo PyTorch (CrossAttentionScorer) e i risultati ottenuti sono stati classificati in base al ponderamento dell'ensemble della somiglianza contestuale e delle citazioni. La struttura del discorso è stata analizzata utilizzando un classificatore di ruoli retorici (roberta-legal-retorica) e i modelli di ragionamento rilevanti sono stati estratti allineando i ruoli retorici. I pesi sono stati assegnati ai segmenti argomentati in base alla frequenza e alla forza delle citazioni. Escludere precedenti contraddittori o irrilevanti.

I documenti venivano codificati con un encoder BERT adattato al dominio e venivano applicati moduli di attenzione gerarchica (implementati nel hierarchical_encoder.py). SBERT e Bi-LSTM (pacchetto trasformatori di frase) venivano utilizzati per le incorporate delle frasi. I riassunti astrattivi venivano decodificati utilizzando un decodificatore vincolato (legal_decoder.py). Limita la lunghezza massima della sequenza a 2048 token. Per addestrare il modello, impostare la dimensione del lotto = 32, tasso di apprendimento = 3e-5, Allenare per 15 epoche con accumulo gradiente (8 passi), Applicare dropout = 0,15 e decadimento del peso = 0,01, Abilitare il levigamento dell'etichetta = 0,1. Modifica iperparametri in train_config.json.

Per valutare le prestazioni, calcolare ROUGE (1,2, L) usando rouge_score libreria, BLEU usando nltk.translate.bleu_score e BERTScore usando bert_score pacchetto. Valuta Legal-SemSim utilizzando script di similarità semantica basati su ontologie e entità F1 usando SpaCy e annotazioni gold. L'efficienza in tempo di esecuzione (secondi per piega) veniva registrata e i riassunti venivano confrontati con i riferimenti oro. A due esperti legali è stato chiesto di esaminare la correttezza fattuale e sono stati salvati i riassunti finali validati dei risultati. Seguendo questo protocollo, verranno prodotti riassunti legali specifici per dominio che preservano il ragionamento giuridico, l'accuratezza fattuale e la fedeltà delle citazioni.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Metriche di valutazione

Il sistema è stato valutato utilizzando un insieme completo di metriche, come mostrato nella Tabella 6.

Categoria metricaMetriche specificheDescrizione
Sovrapposizione lessicaleROUGE-1, R...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

L'efficacia dell'aumento CBR al progetto del trasformatore a più stadi è stata raggiunta stabilendo un nuovo benchmark di prestazioni nella sintesi del testo nel dominio legale. I risultati indicano un miglioramento significativo nei punteggi ROUGE di 78,4 ROUGE-1, 54,8 ROUGE-2 e 75,3 ROUGE-L, e nelle metriche specifiche per dominio di riconoscimento del 98% delle entità legali F1. Per convalidare ulteriormente il contributo di ciascun componente, sono state introdotte basi solo CBR e so...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Gli autori dichiarano che non ci sono potenziali conflitti di interesse legati al contenuto di questo studio.

Ringraziamenti

Gli autori esprimono la loro sincera gratitudine al Dipartimento di Informatica e Ingegneria, Koneru Lakshmaiah Education Foundation (Deemed to be University), Hyderabad, Telangana, India, per aver fornito le strutture computazionali e l'infrastruttura di ricerca essenziali a questo lavoro. Un ringraziamento speciale è rivolto agli esperti legali e agli specialisti del settore che hanno contribuito all'annotazione e alla valutazione del corpus giuridico utilizzato in questo studio.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
CPU HardwareAMD EPYC 7742 (64 Core, 2,25 GHz)1 unitàAMD
QuadroPyTorch2https://pytorch.org
GPU HardwareNVIDIA A100 (40 GB)2 unitàNVIDIA Corp.
Quadro di GrafoDGL1.1https://www.dgl.ai
BibliotecaTrasformatori Facciali Abbraccianti4.32.0https://huggingface.co/transformers
BibliotecaSpaCy3.6https://spacy.io
BibliotecaNLTK3.8.1https://www.nltk.org

Riferimenti

  1. Powers, D. M. Evaluation: From precision, recall and F-measure to ROC, informedness, markedness & correlation. J Mach Learn Technol. 2 (1), 37-63 (2011).
  2. Eisenberg, M. A. Legal Reasoning. , Cambridge University Press. (2022).
  3. Lin, C. Y. ROUGE: A Package for Automatic Evaluation of Summaries. Text Summarizat Branches Out. , 74-81 (2004).
  4. Lewis, M., et al. Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension. Proc ACL. , 7871-7880 (2020).
  5. Hadi, A. Leveraging Transformer-Based Language Models to Bridge the Gap Between Language and Specialized Domains. [Doctoral Dissertation]. , Institut Polytechnique de Paris. (2024).
  6. Waterworth, K. Model-Agents of Change: A Meta-Cognitive, Interdisciplinary, Self-Similar, Synergetic Approach to Neuro-Symbolic Semantic Search and Retrieval Augmented Generation. [Master's Thesis]. , Miami University. (2024).
  7. Zhang, J., Zhao, Y., Saleh, M., Liu, P. PEGASUS: Pre-training with Extracted Gap-sentences for Abstractive Summarization. Proc ICML. , 11328-11339 (2020).
  8. Li, Z., et al. When object detection meets knowledge distillation: A survey. IEEE Trans. Pattern Anal Mach Intell. 45 (8), 10555-10579 (2023).
  9. Chen, Y., et al. Citation Network Analysis for Legal Reasoning. J AI Law. 28 (2), 145-170 (2020).
  10. Raffel, C., et al. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. J Mach Learn Res. 21 (140), 1-67 (2020).
  11. Reimers, N., Gurevych, I. Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proc EMNLP. , 3982-3992 (2019).
  12. Gunning, D., Aha, D. DARPA's explainable artificial intelligence (XAI) program. AI Mag. 40 (2), 44-58 (2019).
  13. Mihalcea, R., Tarau, P. TextRank: Bringing Order into Texts. Proc EMNLP. , 404-411 (2004).
  14. Sharma, G., Sharma, D. Automatic text summarization methods: A comprehensive review. SN Comput Sci. 4 (1), 33(2022).
  15. Xu, J., Croft, W. B. Neural Networks for Text Classification. Inf Retr J. 20 (3), 259-289 (2017).
  16. Ghosh, S., Dutta, A., Das, A. Indian Legal Text Summarization: A Text Normalisation-based Approach. arXiv. , (2022).
  17. Silver, D., et al. Mastering the Game of Go with Deep Neural Networks and Tree Search. Nature. 529, 484-489 (2016).
  18. Chalkidis, I., et al. LexGLUE: A benchmark dataset for legal language understanding in English. Proc ACL. 60 (1), 4310-4330 (2022).
  19. Ashley, K. Artificial Intelligence and Legal Analytics. , Cambridge University Press. (2017).
  20. Chalkidis, I., Fergadiotis, M., Aletras, N. LEGAL-BERT: The Muppets Straight Out of Law School. Proc ACL. , 2898-2910 (2020).
  21. Vaswani, A., et al. Attention Is All You Need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  22. Baker, A. R., Slack, F. J. ADAR1 and its implications in cancer development and treatment. Trends Genet. 38 (8), 821-830 (2022).
  23. Casola, S., Lavelli, A. Summarization, simplification, and generation: The case of patents. Expert Syst. Appl. 205, 117627(2022).
  24. Valente, A. Legal Knowledge Engineering. , IOS Press. (1995).
  25. Katz, D. M., et al. Natural language processing in the legal domain. arXiv. , (2023).
  26. Gilpin, L., et al. Explaining Explanations: An Approach to Interpretable AI. Proc ICML. 70, 89-98 (2018).
  27. Davoodijam, E., Alambardar Meybodi, M. Evaluation metrics on text summarization: comprehensive survey. Knowl Inf Syst. 66 (12), 7717-7738 (2024).
  28. Schauer, F. Precedent. , Stanford Encyclopedia of Philosophy. (1989).
  29. Bengio, Y., Louradour, J., Collobert, R., Weston, J. Curriculum Learning. Proc ICML. , 382-389 (2009).
  30. Vrandecic, D., Krötzsch, M. Wikidata: A Free Collaborative Knowledge Base. Commun ACM. 57 (10), 78-85 (2014).
  31. Chu, Y., Ye, M., Qian, Y. Fine-Grained Image Recognition Methods and Their Applications in Remote Sensing Images: A Review. IEEE J Sel Top Appl Earth Obs Remote Sens. 17 (6), 1234-1250 (2024).
  32. Vue, Z., et al. Stories from Hmong in STEMM. Trends Genet. 39 (8), 587-592 (2023).
  33. Begum, N., Goyal, A. Analysis of Legal Case Document Automated Summarizer. Proc ISPCC. , 533-538 (2021).
  34. Surden, H. Ethics of AI in Legal Practice. J Legal Ethics. 32 (2), 145-163 (2019).
  35. Bench-Capon, T. J. M., Sartor, G. Ontology-Based Legal Reasoning. Artif Intell Law. 11 (2), 125-157 (2003).
  36. Liu, Y. Fine-tune BERT for Extractive Summarization. arXiv. , (2019).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Ristampe e permessi

Tag

Architettura TransformerPredizione dell Esito LegaleRiconoscimento di Entit LegaliRiassunto AstrattivoRiassunto EstrattivoPunteggi ROUGE