Bu içeriği görüntülemek için JoVE aboneliğiniz gereklidir. Giriş yapın veya ücretsiz denemenizi bugün başlatın.

Araştırma makalesi

Hukuki metin özetlemesinde hibrit bir yaklaşım için derin öğrenme ile vaka temelli akıl yürütme

490 görüntüleme

DOI:

10.3791/69287

12 Aralık 2025

Bu makalede

Özet

Bu protokol, Vaka Tabanlı Akıl Yürütmeyi (CBR) çok aşamalı transformator modelleri ile entegre ederek hukuki metinleri özetlemektedir. Hukuki davaları ön işler, benzer emsalleri geri getirir, akıl yürütme yapılarını uyarlar ve doğru, tutarlı özetler oluşturur. Uygulamalar arasında hukuki araştırma, yargı analizi ve karar destek sistemleri bulunur; bu sistemler olgun tutarlılık ve alana özgü akıl yürütme sadıklığını sağlar.

Özet

Hukuki belgelerin uzun ve karmaşık olduğu bilinir, bu da hukuk uygulayıcıları ve araştırmacıların ilgili bilgileri hızlıca tespit edip çıkarmasını neredeyse imkansız hale getirir. Burada, önceki çıkarıcı ve soyut temelleri hem sözcüksel örtüşme hem de alana özgü akıl yürütme metriklerinde geride kalan hibrit bir yaklaşım sunulur; bu yaklaşım, hukuki metinler için Duruma Dayalı Akıl Yürütme (CBR) ve özet temsili için somut derin öğrenme teknikleri kullanır ve özetleri doğru ve verimli şekilde üretir. Kaggle'dan alınan 4.968 hukuki davadan oluşan daha büyük bir veri seti kullanılarak, daha önce oluşturulan genel CBR arama modelinin üzerine çok aşamalı bir transformator mimarisi inşa edildi; böylece bağlam anlaşılması için CBR ile birlikte kısa özetler üretildi. Sistem, yasal sonuç tahmini ve özet tutarlılığı üzerine değerlendirildi; sonuçlar mevcut çıkarıcı ve soyut yöntemlerden daha üstün performans gösterdi ve önerilen modeli yasal varlıkların %98 doğruluğuna kadar eğitti, ayrıca ROUGE puanları kullanılarak önceki türlerin üzerinde %23 oranında daha tutarlı hukuki korpus (başlangıç olarak geliştirilmiş) %46 daha fazla oldu. Bu çalışma, CBR'yi transformatör tabanlı modellerle entegre eden hibrit bir hukuki metin özetleme çerçevesi sunmaktadır. Kapsamlı deneyler, son dönem temellerine göre daha üstün performans göstererek, daha yüksek gerçek doğruluğu, akıl yürütme doğruluğu ve yasal varlıkların korunması elde edilmiştir.

Giriş

Kapsamlı yasal belgeler, ilgili verileri zamanında geri almak için gelişmiş yöntemler gerektirmiştir. Hukuki metin özetlemesi, erişilebilirliği ve karar alma süreçlerini iyileştirmek için önemlidir. Hukuki görüşler, kararlar ve emsaller o kadar ayrıntılıdır ki, hakimler, uygulayıcılar ve araştırmacılar bunları incelemekte zorlanabilir; bu da bu belgeleri doğru ve verimli bir şekilde özetlemek için otomatik yöntemlerin geliştirilmesine yolaçar 1.

Daha genel davalarda en son performanslarına rağmen, mevcut özetleme yöntemleri hukuki belgeleri karakterize eden benzersiz karmaşıklığı ve hukuki jargonu yakalamakta zorlanıyor. Sadece log-olasılık temelinde en üst cümleleri seçmek, yeniden düzenleme yapmadan iyi ROUGE puanları alır ama bağlam ve tam anlam kaybı sağlar. Soyut yaklaşımlar, kapsamı oluşturmak için doğal dil üretimini kullanır, böylece bağlamsal nüansları yakalayabiliyorlar, ancak mahkeme davalarının mantıksal düşünce sürecini ve hukuki gerekçesini korumaktazorlanıyorlar 2. Önerilen yöntem, özellikle yapılandırılmış bölümler içeren uzun biçimli hukuki dava metinleri için etkilidir (örneğin, gerçekler, argümanlar, emsaller ve kararlar). Temyiz veya Yüksek Mahkeme kararları gibi açık atıflar ve standart biçimlendirmelerle korporasyonlara uygulandığında üstün başarı gösterir. Ancak, performans gürültülü veya yapılandırılmamış veri setleriyle sınırlı olabilir (örneğin, OCR hataları olan taranmış PDF'ler veya net retorik segmentasyonu olmayan belgeler). Bu nedenle, yöntem hem dilsel hem de atıf özelliklerinin erişilebilir olduğu iyi yapılandırılmış dijital vaka depoları için enuygundur 3.

Vaka tabanlı akıl yürütmeyi (CBR) gelişmiş Doğal Dil İşleme (NLP) ile birleştiren önerilen üstün hibrit çerçeve, bir özet oluşturmak için kullanılır. Hukuki alana özgü dikkat katmanlarına sahip çok aşamalı bir transformator mimarisi kullanır ve çapraz belge akıl yürütme modülü önerir. CBR, sistemin geçmişteki benzer vakaları yüklemesini sağlar ve bu davaları yasalnedenlerle incelemek için kullanılabilir 4. Önerilen model, ROUGE, BLEU ve Legal-SemSim metriklerindeki nicel kazanımlarla gösterildiği ve insan uzman değerlendirmesiyle doğrulandığı gibi, son teknoloji temel verilere kıyasla üstün doğruluk sağlamıştır. Örneğin, önerilen model, Legal-BART ve PALM-Law'u akıl yürütme zinciri doğruluğu açısından %15-%20 farkla geride bıraktı. Genel temsilleri ve gelişmiş yaklaşımları benimsemek, dava özetli bilginin yanı sıra sinirsel özetleme ve tahmin ile birlikte hukuki kişilik tanıma için %98, emsal tespit için %97 hassasiyet sağlar ve önceki çalışmaları büyük ölçüdeaşmaktadır 5.

İlgili çalışmalar

Doğal dil işlemenin (NLP) bir alt alanı olan hukuki metin özetleme, yargı görüşleri, yasalar ve içtihat hukuku dahil olmak üzere verimli hukuki belge işleme talebinin artması nedeniyle giderek artan ilgi görmektedir. Temel zorluk, oluşturulan özetlerde anlamsal bütünlüğün, hukuki gerekçenin ve alana özgü bağlamın korunmasıdır. Önceki araştırmalar, ekstraktif, soyut ve hibrit yaklaşımları kapsıyor ve son dönemde alan uyumu olan sinirmimarilerine odaklanıyor.

Literatür incelemesi

Hukuki metin özetleme, büyük ve karmaşık hukuki belgelerin erişilebilir ve uygulanabilir hale getirilmesi zorunluluğu nedeniyle doğal dil işlemede kritik bir alan haline gelmiştir. Alan literatürü, yüzeysel çıkarma modellerinden, akıcılık, gerçeksel bütünlük ve hukuki mantığı dengelemeye çalışan sofistike hibrit mimarilere doğru bir yol göstermektedir. İlk çalışmalar, cümle önemini sözcük benzerliği ve istatistiksel kalıplara göre önceliklendiren ekstraktif özetleme tekniklerine odaklandı. Yasal olarak belirgin parçaları seçmede etkili olsalar da, TextRank ve LexRank gibi bu yaklaşımlar genellikle daha derin anlamsal yapıyı göz ardı eder ve hukuki akıl yürütmede temel olan retorik ve tartışmacı katmanları yakalayamıyor6. Hukuk metinleri, katı anlamsalları ve alana özgü ifadeleri nedeniyle genel korpuslardan belirgin şekilde farklılaştığı için, bu modeller tutarlılık ve bağlamsal yeterlilikten yoksun özetler üretmiştir. Önceden eğitilmiş transformatör mimarilerinin ortaya çıkmasıyla birlikte araştırma odağı soyut yöntemlere kaymıştır. BART, T5 ve PEGASUS gibi modeller, öğrenilmiş dil üretim kalıpları kullanarak özetleri sentezleme kapasitesini göstermeye başladı. LegalBART ve LegalPEGASUS gibi yasal uyarlamaları, hukuka özgü ön eğitimkorpusu 7'yi dahil ederek performansı daha da geliştirdi. Ancak, soyutif yöntemler, özellikle hukuki ortamlarda sorunlu olan akıl yürütme tutarlılığı ve açıklanabilirlik zorluklarıyla mücadele etmeye devam etti; burada küçük gerçek sapmalar bile yanlış yorumlamaya yol açabiliyordu.

Bu eksikliklere yanıt olarak, bağlamsal temeli geliştirmek için sembolik akıl yürütme veya geri getirme tabanlı stratejiler içeren hibrit modeller ortaya çıktı. Dikkate değer bir yön, öngörülü vakalardan elde edilen bilgilerin özet oluşturma sürecini bağlamlandırmak için kullanıldığı CBR'nin entegrasyonuydu. Bu modeller, çıkarma yöntemlerinin gerçek titizliğini korumaya çalışırken, dilsel olarak tutarlı ve yasal olarak geçerliçıktılar üretmeye çalışır 8.

Son eğilimler, hukuki kişi tanıma, çapraz belge akıl yürütme ve retorik rol ayrıştırmasını birleştiren çok aşamalı mimarileri vurguluyor; bu da sadece özetleme yerine bütüncül belge anlayışına doğru bir kayım olduğunu gösteriyor. Araştırmalar artık giderek daha fazla hukuki ontoloji hizalanmasını, alana özgü değerlendirme metriklerini (örneğin, Hukuki-SemSim) ve insan merkezli değerlendirmeyi ele alarak hukuk profesyonelleri için özetlerin kalitesini ve kullanılabilirliğinideğerlendirmektedir 9.

2023'te LLM'lerin hukukta uygulamalarını araştırır ve 2024'te İtalyan Hukuk alanında LLM'lerin kullanımını araştırır, büyük dil modellerinin (LLM'ler) hukuki akıl yürütme, özetleme ve geri getirme görevlerini otomatikleştirmede artan rolünüvurgulamaktadır 10. Bu çalışmalar, sadece GPT-4, PaLM ve LLaMA gibi LLM'lerin hukuki söylemin bağlamsal nüanslarını yakalama kapasitesini değil, aynı zamanda alan uyarlaması, açıklanabilirlik ve gerçek tutarlılığı gibi zorlukları davurgular. Geri alım-artırılmış üretim (RAG) veya CBR'yi LLM'lerle entegre eden hibrit sistemler, öncelikli akıl yürütmenin güçlü güçlerinitransformers 6'nın üretken akıcılığı ile birleştirmek için giderek daha fazla araştırılıyor. Çalışmayı bu eğilim içinde konumlandıran çok aşamalı hibrit model, yasal akıl yürütme zincirlerini açıkça kodlayarak önceki geri kazanım-artırılmış çerçeveleri genişletirken, transformator tabanlı soyutif özetleme yoluyla tutarlılığı korur.

Önemli ilerlemelere rağmen, yorumlanabilirliği koruyarak gerçekçilere, mantıksal yapılandırılmış ve alan uyumlu hukuki özetleri sentezleyebilen modellerde bir boşlukvar. Mevcut çalışma, yasal CBR ve derin sinir mimarisine dayanan çok aşamalı hibrit yaklaşım önererek hem doğru hem de pratik kullanılabilir bir model sunarak bu boşluğu gideriyor.

Ekstraktif özetleme yaklaşımları

Ekstraktif özetleme terimi, belgeden en bilgilendirici cümleleri çıkarıp birleştiren yöntemler için kullanılır. Grafik tabanlı algoritmalar, örneğin TextRank13 ve LexRank14, cümleleri önemlerine göre sıralayan geleneksel yaklaşımlardır. Hesaplama açısından mümkün olsa da, bu yaklaşımlar genellikle karmaşık hukuki akıl yürütme ve argümanlama ile mücadeleeder 8. Önceden eğitilmiş dil modellerinin ortaya çıkmasıyla birlikte, BERTSUM8 gibi BERT tabanlı yöntemler önemli gelişmeler gösterdi. BERTSUM, BERT gömülmelerini cümle düzeyinde çıkarıcı özetleme için ince ayarlar yapar ve istatistiksel modellerden daha iyi bağlamsal nüanslarıyakalar. 9. Legal-BERTSUM gibi hukuki alan uyarlamaları, hukuki özel korpuslar dahil ederek performansı daha da geliştirerek hukuki terim tanıma ve cümle seçimini geliştirdi. Buna rağmen, çıkarıcı yöntemler, özellikle cümleler birbirine bağımlı veya referanslar örtük olduğunda, tartışma akışını veya hukuki akıl yürütme zincirini yeniden yapılandırmadasınırlıdır 15.

Soyut özetleme yaklaşımları

Soyut özetleme, kaynak içeriği yeniden ifade eden yeni ifadeler ve cümleler üretir; genellikle kodlayıcı-kodlayıcı mimarileri kullanılır. BART model4 ve PEGASUS7, genel amaçlı özetleme için uygulanan önceden eğitilmiş diziden dizilere modellerin önde gelen örnekleridir. Bunlar, hukuk kurumlarında ince ayar yapılarak hukuki alana uyarlanmıştır ve Legal-BART ile Legal PEGASUS16,17 gibi modeller ortaya çıkmıştır. Bu modeller daha akıcı ve insansı özetler üretir ve çıkarıcı yaklaşımlardan daha iyi bağlamsal anlamı yakalamaktadaha iyidir 18.

Ancak, hukuki özetlemede uygulamaları zorluklar yaratmaktadır. Soyut modeller genellikle olgusal tutarlılık ve hukuki anlamların korunması konusunda mücadele eder. Hukuki maddelerin yanlış yorumlanması veya kilit tüzel kişilerin eksikliği özeti yanıltıcıhale getirebilir 19. Ayrıca, sinirsel metin üretim modelleri genellikle şeffaf değildir ve bu da açıklanabilirlik ve doğrulanabilirlik konularını gündeme getirir; bunlar hukuk alanlarında kritik öneme sahiptir.

Hibrit özetleme modelleri

Her iki paradigmanın güçlü yönlerinden yararlanmak için, hibrit özetleme modelleri ekstraktif ve soyut bileşenleri entegre eder. Erken stratejilerden biri, aday cümleleri seçmek için ekstraktif modüller kullanmaktı; bu cümleler soyutif bir kod çözücü ile geliştirilirdi. Son zamanlarda, transformatör mimarisi, hukuki anlayışı geliştirmek için bilgi dolumodüllerle birleştirilmiştir 5.

CBR, umut vadeden bir hibrit strateji olarak ortaya çıktı. Waterworth, mevcut kararları bilgilendirmek için önceki vakaların kullanımında öncülük etti ve sinirsel modellerle entegrasyonu, analogik akıl yürütme yoluyla anlamsal zenginleşmeyimümkün kılar 6. Hukuki özetlemede, CBR'yi transformatörlerle birleştirmek hem bağlamsal yeniden kullanımı hem de soyut sentezi sağlar. BART+CBR gibi modeller, arama temelli hukuki bağlamı üretken mekanizmalarla entegre ederek, daha iyi tutarlılık ve hukuki önemsunar 20.

Önerilen Çok aşamalı + CBR mimarisi, özetleme boru hattına alan spesifik akıl yürütme zincirleri gömleyerek bu çalışma alanını geliştirir. Hiyerarşik transformatör blokları, çapraz belge dikkati ve CBR ile güçlendirilmiş erişim katmanları içerir; bunlar özellikle hukuki uygulamalar için uyarlanmıştır. Bu çok katmanlı tasarım, hem ince tanenli içerik anlayışını hem de makro düzeyde yapı korumasınısağlar 21.

Hukuki özgün zorluklar ve hususlar

Hukuki belgeler, hiyerarşik biçimlendirme, emsal örneklerin çapraz referansı, yasal atıflar ve alana özgü terminoloji gibi benzersiz yapısal ve dilsel özelliklersergiler. Bu nedenle özetleme modelleri yalnızca sözdizimsel ve anlamsal karmaşıklıkları ele almakla kalmayıp, mantıksal tutarlılık ve hukuki argüman ilerleyişine de saygıgöstermelidir 23. Bu bağlamda etkili özetleme, doğru hukuki varlık tanıma, gerekçe yapısının korunması ve gerçekler, argümanlar ve yargılar gibi retorik rollerin yorumlanmasına bağlıdır.

Alan anlayışını geliştirmek için hukuki ontolojiler ve atıf ağları kullanılmıştır. Örneğin, model eğitimi sırasında yapılandırılmış hukuki bilgi tabanlarının entegre edilmesi, tüzel kişilik bağlantısını ve atıf tutarlılığını artırdığıgösterilmiştir 24. Bu çabalar, hukuk uygulayıcılarının beklentileriyle daha iyi uyumlu modellerin özetlenmesinekatkıda bulunur 25.

Bir diğer zorluk ise yorumlanabilirliktir. Hukuki ortamlarda, çıktı denetlenebilir ve yorumlanabilir olmalıdır. Bu nedenle, LIME ve SHAP gibi açıklanabilir yapay zeka (XAI) çerçeveleri, özetleme kararlarını haklı çıkarmak için giderek daha fazla araştırılmaktadır; ancak büyük ölçekli modellerle entegrasyon devam eden bir araştırma zorluğuolarak devam etmektedir 26.

Hukuki özetlemede değerlendirme metrikleri

ROUGE8, BLEU27 ve METEOR gibi standart özetleme metrikleri sözcük örtüşme değerlendirmesinde yaygın olarak kullanılır. Ancak, bu ölçümler anlamsal doğruluğu, hukuki tutarlılığı ve tartışmacı tutarlılığı yakalamak için yeterli değildir.

Son çalışmalar, anlamsal benzerliği değerlendirmek için hukuki ontolojileri içeren Legal-SemSim gibi alana özgü metrikler ve mantıksal akışın korunması ile sonuç geçerliliğini değerlendiren akıl yürütme zinciridoğruluğu gibi metrikler getiriyor 28. İnsan uzman değerlendirmesi, özellikle hukuki doğruluğu, tutarlılığı ve uygulanabilirliği ölçmek için vazgeçilmez olmaya devam etmektedir. Fleiss'in Kappa'sı gibi metrikler kullanılarak yapılan annotatörler arası anlaşma, nitel değerlendirmelerin güvenilirliğinisağlar 29.

Hukuki özetlemede son gelişmeler ve gelecekteki yönler

Hukuki özetleme araştırmaları daha sağlam, bağlama duyarlı ve açıklanabilir sistemlere doğru ilerliyor. Kural temelli akıl yürütmeyi transformatör modellerle bütünleyen hibrit sembolik-sinir mimarileri giderek daha fazla ilgi görmektedir. Bu sistemler, mantık tabanlı yaklaşımların yorumlanabilirliğini korur ve derin öğrenmenin genellemekapasitesinden faydalanır 28.

Çok dilli hukuki özetleme, hukuki metinlerin ve süreçlerin küresel doğasını ele alan bir başka gelişmekte olanbir sınırdır. Zamana bağlı hukuki dizileri anlamak için gerekli olan zamansal akıl yürütme ve tartışmacı söylem modelleme deincelenme aşamasında yer alır 9.

Ayrıca, karşılaştırmalı öğrenme ve müfredat öğrenimindeki gelişmeler, çeşitli hukuk alanlarında model genellemesini geliştirmek içinkullanılmaktadır 17. Görev karmaşıklığını kademeli olarak artırarak ve ince taneli anlamsal sınıfları ayırt ederek, bu teknikler modelin gerçek dünya senaryolarındaki dayanıklılığınıartırır 31.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Bu protokol, halka açık yasal veri setlerini kullanır. Hassas kişisel veya gizli veriler kullanılmadı. Çalışma, araştırmada hukuki kurumların kullanımına ilişkin kurumsal etik yönergelere uygundur (Koneru Lakshmaiah Eğitim Vakfı (Üniversite olarak kabul edilir), Haydarabad, Telangana, Hindistan, Onay No.: KLEF/CS/2024/IRB-017). Çalışma, her biri kapsayıcı açıklamalara sahip 4.968 hukuki davadan oluşan bir veri seti kullanıyor. Tablo 1 , veri seti açıklamasını gösterir.

precedent_citationsÖncelikli davalara yapılandırılmış atıflar
reasoning_chainsAçıklamalı mantıksal akıl yürütme dizileri

Tablo 1: Veri seti öznitelik açıklaması.

Çalışma için veri seti

Ön işlemeden sonra, veri seti sonuçları standartlaştırmak için normalleştirilir. Dava metinlerinin uzunluğu 1.000 ile 5.000 kelime arasında değişmekte olup, eğitim ve değerlendirme için kapsamlıdır. Veri setindeki sıklıklarına göre birincil etiketlere dava sonuçlarını topladık, böylece farklı hukuki bağlamlarda özetleme performansını incelememize olanak sağladık. Açıklama, üç avukat ve hukuki bilişim alanında uzmanlaşmış iki doktora araştırmacısı dahil olmak üzere beş hukuk profesyoneli ekip tarafından gerçekleştirildi. Her vaka iki uzman tarafından bağımsız olarak açıklama yapılmış, çatışmalar ise kıdemli bir anlatıcı tarafından çözülmüştür. Açıklama şeması tüzel kişilikleri, emsal atıfları ve akıl yürütme zincirlerini içeriyordu. Annotatörler arası anlaşma Fleiss'in Kappa'sı (κ = 0.82) kullanılarak ölçüldü ve bu da annotatörler arasında güçlü tutarlılığı göstermektedir. Bu süreç, veri setinin hem yasal geçerliliğini hem de tekrarlanabilirliğini garanti altına aldı.

Veri seti dağılımı

Veri seti, Tablo 2'de gösterildiği gibi çeşitli hukuki alanları içeren vakaları içerir.

Hukuki AlanVaka SayısıYüzde
Sözleşme Hukuku1,27825.70%
Fikri Mülkiyet1,05321.20%
Anayasa Hukuku51210.30%
İdari Hukuk4328.70%
Ceza Hukuku3086.20%
Haksız Hak Hukuku2194.40%
Diğer/Çeşitli1,16623.50%

Tablo 2: Çeşitli hukuki alanlar içeren davalar.

Veri kümesi genelindeki vaka sonuçlarının dağılımı Tablo 3'te gösterilmiştir.

Dava SonucuSaymakYüzde
Atıf2,46049.20%
Referans85517.10%
Takip4719.40%
Uygulamalı4478.90%
Kabul3537.10%
Diğer sonuçlar3828.30%

Tablo 3: Veri seti genelinde vaka sonuçlarının dağılımı

Bu nedenle, alana özgü önyargıları önlemek için stratifike örnekleme kullanılarak eğitim, doğrulama ve test bölünmelerinde alanlar arasında mantıklı bir tasvir doğrulandı. Veri seti eğitim (%80), doğrulama (%10) ve test (%10) setlerine ayrıldı.

Metin uzunluğu dağılımı

Metin uzunluğu dağılımı analizi Tablo 4'te sunulmaktadır.

Uzunluk Aralığı (kelimeler)SaymakYüzde
500 Altında4659.40%
500-1,0001,35927.40%
1,000-5,0002,69854.30%
5,000-10,0003236.50%
10.000'in üzerinde1543.10%

Tablo 4: Metin uzunluğu dağılımının analizi.

Bu dağılım, belge uzunluklarındaki çeşitliliği vurgular; çoğunluğu orta uzunluk aralığında (1.000-5.000 kelime) yer alır ve bu da özetleme teknikleri için uygun bir zorluk oluşturur.

Gelişmiş veri ön işleme

Ön işleme boru hattı, transformator tabanlı yasal NLP görevlerinde ön işlemenin etkisiyle ilgili son çalışmalarla şekillenmiştir. Chalkidis ve ark. alan farkında tokenizasyon ve atıf normalizasyonunun aşağı akış özetleme doğruluğunu önemli ölçüdeiyileştirdiğini göstermektedir 30. Benzer şekilde, Bommarito ve Katz, özellikle varlık normalizasyonunun, özellikle varlık normalizasyonunun, yasal özetlemede transformator performansını doğrudan etkilediğinigöstermektedir. Bu içgörülerle, pipeline bölüm farkında tokenizasyon, yasal atıf normalizasyonu ve retorik rol ayrıştırma kullanarak bağlamsal tutarlılığı en üst düzeye çıkardı. Verilerin bütünlüğünü sağlamak için yüksek kaliteli hukuki metin elde etmek ve ilk başta birkaç boş ya da çok kısa vaka metin alanı filtrelemek için genel ön işleme yöntemleri ve alana özgü teknikleri entegre eden yeni bir ön işleme boru hattı geliştirildi. Sonra, girdi normalizasyonu yapıldı ve girdi kullanılabilirliğini sağlamak için yasal tokenizasyon kurallarıuygulandı 33. Ana varlıklar, özel yüksek performanslı bir hukuki kişi tanıma (LER) modeliyle çıkarıldı (F1 puanı %98), yapısal unsurları kavramak için dissöylem teknikleri kullanıldı. Öncesi analizi geliştirmek için, bir atıf grafiği oluşturma adımı getirildi. Diğer ön işleme adımları, düzenli ifade ayrıştırıcılarına özgü olan alana özgelidir ve bu da girdilerinin standartlaştırılmış yasal atıflar için çok katı formatlara tam olarak karşılık geldiğini doğrular. Hiyerarşik belge yapıları için bölüm farkında tokenizerler uygulandı ve her hukuki metin için gerçekler, argümanlar ve kararlar gibi retorik rollerle etiketlenmiş ince ayarlanmış bir RoBERTa sınıflandırıcı eklendi. Bu daha geniş ürün hattı, hukuki metin buluşması, akıl yürütme ve özetleme gibi sonraki görevleri basit bir şekilde artırmamıza olanak tanıyor.

İleri vaka tabanlı akıl yürütme modülü

Çalışma, ilk kez, anlamsal benzerlik ve hukuki alan bilgisini kullanarak ilgili ve karşılaştırılabilir vakaları kıyaslama veri setinde %98 geri bildirim doğruluğuyla sunabilen son teknoloji Vaka Temelli Akıl yürütme (CBR) sisteminin kademeli bir uygulamasını sunmaktadır. Geliştirilmiş Dava Temsili, her vakayı, hukuk metinde alan odaklı BERT modeliyle üretilen bağlamsallaştırılmış gömmeler, belgelerdeki öğelerin konumunu yansıtan yapısal gömmeler, davalarda bulunan hukuki ilişkileri vurgulayan varlık farkında gömmeler ve emsallerin nasıl birbirine bağlandığını temsil eden atıf ağı gömmeleri ile birleştiren hibrit bir vektörle kodlar. Çok aşamalı vaka alımı, tohum adaylarını elde etmek için önce Yaklaşık En Yakın Komşu (ANN) araması yaparak çok adımlı bir yaklaşım olarak işlev görür, adaylardan optimal eşleşmeleri almak için çapraz dikkat uygular ve en iyi vaka alımlarını seçmek için alan adına özgü puanlama fonksiyonu ile topluluk tabanlı alaka puanlaması kullanır. İleri Dava Uyum Aşaması (ACAS) sırasında, sistem hukuki argümanlar arasındaki mantıksal bağımlılıkları yakalayan grafik tabanlı bir temsil şablonu aracılığıyla akıl yürütme kalıplarını çıkarır. Daha sonra, atıf analiziyle öncesi önemi belirler ve her vaka bileşenini sorgu için bağlamsal önemine göre tartar. Son olarak, tartışma yapısı, hukuki akıl yürütmesinin mantıksal akışının korunmasını sağlamak için söylem tabanlı yöntemlerle korunur. Son modül olan Bilgi Entegrasyonu modülü, hukuki ontolojiler aracılığıyla geri kazanımı destekler, zamansal emsal ilişkileri kaydeder ve karmaşık hukuki akıl yürütme zincirlerinde geçerliliğini korur. Önerilen CBR sistemi, yasal davaların geri alınması ve uyarlanması için daha önce bildirilen kıyaslamalardan (örneğin LexGLUE, %92-95) daha yüksek bir doğru geri alma oranı sağlar.

Çok aşamalı transformatör mimarisi

Yukarıda belirtilen kaynaklara dayanarak, çalışma, tüm bahsedilen algoritmaların en iyi unsurlarından yararlanarak yasal belgelerin otomatik işlemesi, akıl yürütmesi ve özetlenmesini geliştiren transformator tabanlı çok aşamalı mimari model üzerinde yapay sinir ağı tabanlı bir yöntem önermektedir. Belge anlama aşaması, hukuki alanlara uyarlanmış bir BERT kodlayıcısı, hiyerarşik dikkat mekanizmaları ve hukuki varlıkların tanınması, ilişki çıkarma ve atıf grafiği işleme modüllerini kullanarak hukuki belgelerin derin yapısal ve bağlamsal anlaşılmasını sağlar. Çapraz belge akıl yürütme aşaması, soruları alınan vakalarla bağlantılı bir dikkat mekanizması aracılığıyla yardımcı olur; bu mekanizma hukuki akıl yürütme zincirlerinin çıkarılması ve doğrulanması, emsal uygulama modeli ve argümanasyon yapısının korunmasıdır. Cümle göme oluşturma seviyesinde SBERT ve Bi-LSTM kullanılırken, soyut özet üretim seviyesinde yasal terimleri, olgusal tutarlılığı ve hiyerarşisini yasal yazım gereksinimlerine göre doğru korumak için yasal alan kısıtlamalarına sahip özel bir kod çözücü kullanıldı. Süreci farklı aşamalara bölerek, belge işlemenin gerçek tutarlılığını, bağlamsal tutarlılığı ve atıfın sadık şekilde korunmasını sağlayabilir. Önerilen model eğitim süreci Tablo 5'te gösterilmiştir.

HiperparametreDeğer
Parti büyüklüğü32
Öğrenme hızı3e-5 ısınma ile
Çağlar15
Maksimum dizi uzunluğu2048 jeton
Okuldan ayrılma oranı0.15
Gradient birikimi8 adım
Isınma adımları1000
Ağırlık kaybı0.01
Etiket düzgünleştirme0.1

Tablo 5: Model eğitim süreci.

Model performansını ve genellemeyi artırmak için, ayrıntılı olarak ele alınan birden fazla gelişmiş eğitim tekniği uyguladık. Müfredat öğrenimini kullanarak görev karmaşıklığını kademeli olarak artırdı ve modelin daha zorlu durumlara geçmeden önce temel beceriler edinmesini sağladı. Eğitim veri seti üzerinde deneyler yaparak araştırmacı, ince ayarın modelin çok benzer ve farklı verileri ayırt etmesine yardımcı olarak anlamsal temsilleri başarıyla geliştirdiğini ve böylece veri setinin anlaşılmasını artırdığını doğruladı. Çok görevli öğrenme açısından, özetleme, yasal alanın daha kapsamlı bir algısını sağlayan sınıflandırma veya varım tanıma gibi yardımcı görevlerle birleştirildi. Önemli bilginin, modeli büyütmeden yüksek seviyeli bilgiyi koruyan bilgi damıtılması yoluyla aktarılması, daha büyük alan odaklı modeller için zatenaktarılmıştır 7.

Çok aşamalı hibrit hukuki özetleme metodolojisi

Önerilen çerçeveyi operasyonel hale getirmek için, çok aşamalı hibrit hukuki özetleme metodolojisini temsil eden adımlı algoritma 1 sunulmaktadır.

Algoritma 1:
Algoritma: Çok Aşamalı Hibrit Hukuki Özetleme
Girdi: Hukuki Dava Veri Seti D ile {case_text, legal_entities, atıflar, sonuç}
Çıktı: Her dava için Özet S ve hukuki gerekçeler korundu
Başlamak
Aşama 1: Veri Ön İşleme
D'deki her durum için:
Metni normalize ederek gürültüyü ortadan kaldırın ve biçimlendirmeyi birleştirin.
Tüzel kişilik çıkarmak için Yasal Kişilik Tanıma (LER) uygulanır.
Referans verilen emsallerden bir atıf grafiği oluşturun.
Metni, alan adına uygun yasal tokenizasyon kuralları kullanarak tokenize edin.
NOT: Giriş korpusunda gürültülü veya eksik metinler varsa, kesintili kelime filtreleme veya bölüm segmentasyonu gibi ek normalizasyon uygulanın.

Aşama 2: Vaka Bazlı Alım
Her vaka için:
Alana uyarlanmış bir BERT kodlayıcı kullanarak bağlamsal gömmeler oluşturun.
Bölüm konumuna göre yapısal gömmeler oluşturun.
Atıf ağı gömütmeleri oluşturun.
Benzer geçmiş vakaları Yaklaşık En Yakın Komşu (ANN) aramasıyla elde edin.
Çapraz dikkat puanlama ve topluluk tabanlı alaka sıralaması kullanarak alınan vakaları iyileştirin.

3. Aşama: Vaka Uyarlaması
Her alınan vaka için:
Söylem ayrıştırmasıyla akıl yürütme kalıplarını çıkar.
İlgili hukuki argümanları belirleyin ve önemlerine göre ağırlıklar atayın.
Adaptasyon sırasında argüman akışını koruyun.
NOT: Eğer emsal davalarda alakasız veya çelişkili argümanlar varsa, uyarlama sırasında bunları hariç tutun.

Aşama 4: Çok Aşamalı Transformatör Tabanlı Özetleme
Her girdi vakası ve uyarlanmış emsal örnekler için:
Girdi vakasını hiyerarşik ve varlık farkında dikkatle yasal alan BERT kodlayıcısı ile kodlayın.
Sorgu ile alınan vakalar arasında çapraz belge gerekçesi uygulan.
Gelişmiş bağlamsal gömmeler için SBERT ve Bi-LSTM kullanarak cümleleri kodlayın.
Özeti alan sınırı kısıtlı bir kodlayıcı kullanarak çözümle, böylece gerçek ve yasal doğruluğu korursunuz.

5. Aşama: Çıktı ve Doğrulama
Her oluşturulan KISA ÖZET için:
Oluşturulan özeti tutarlılık, gerçekçilik ve hukuki gerekçelerin doğruluğu açısından doğrulayın.
Kesin özeti S'yi geri gönderin.
NOT: Uzman doğrulaması gerekiyorsa, dağıtımdan önce ek bir insan inceleme adımı ekleyin.
Son

Hesaplama ortamını kurmak için Python 3.10 yüklendi. Kurulum için şu kütüphaneler gereklidir: PyTorch (v2.0), Hugging Face Transformers (v4.32.0), SpaCy (v3.6), NLTK (v3.8.1), NetworkX (v3.1), DGL (v1.1). GPU desteği konfigürasyonlardı (her biri 40 GB belleğe sahip iki GPU). Kesin versiyonlar ve kaynaklar için Materyaller Tablosu'na bakınız.

Hukuki dava veri seti (≈ 5.000 dava) belirtilen veri seti kaynağından indirildi ve her dava alanlar açısından doğrulandı: gerçekler, argümanlar, atıflar ve karar sonuçları. Belgeleri UTF-8 düz metin formatında depolayın. Boş veya kısa metinlerin Python scripti (preprocess.py) kullanılarak kaldırılması yapıldı. Gürültünün kaldırılması ve metnin biçimlendirilmesinin birleştirilmesi gerçekleştirildi. Yasal alan tokenizasyonu SpaCy (spacy.load("en_core_legal_sm")) ile uygulandı. Yasal Kişilik Tanıma, ince ayarlanmış bir BERT modeli kullanılarak gerçekleştirildi (transformers.pipeline("ner", model="legal-bert-ler")). NetworkX (nx. DiGraph()), düğümleri referans verilen önceklere göre bağlar. OCR tabanlı belgeler dahil edildiğinde, ek bir metin temizleme betiği (ocr_clean.py) çalıştırılır.

Bağlamsal gömme, alana özgü bir BERT modeli (bert-legal) ile oluşturuldu ve atıf gömülmeleri DGL grafik kodlayıcıları kullanılarak oluşturuldu. Yaklaşık En Yakın Komşu araması FAISS kullanılarak gerçekleştirildi (faiss. IndexFlatIP). Çapraz dikkat puanlama, bir PyTorch modülü (CrossAttentionScorer) ile uygulandı ve elde edilen sonuçlar, bağlamsal ve atıf benzerliğinin toplu ağırlıklandırılmasıyla sıralandı. Söylem yapısı, retorik rol sınıflandırıcısı (roberta-legal-retoric) kullanılarak ayrıştı ve ilgili akıl yürütme kalıpları retorik rollerin hizalanmasıyla çıkarıldı. Ağırlıklar, argüman segmentlerine frekans ve atıf gücüne göre atanmıştır. Çelişkili veya alakasız emsalları dışlayın.

Belgeler, alan uyumuna uygun bir BERT kodlayıcı ile kodlandı ve hiyerarşik dikkat modülleri uygulandı (hierarchical_encoder.py'da uygulandı). Cümle gömme için SBERT ve Bi-LSTM (cümle dönüştürücü paketi) kullanıldı. Soyutif özetler, kısıtlı bir kodlayıcı (legal_decoder.py) kullanılarak çözülürdü. Maksimum dizi uzunluğunu 2048 jeton ile sınırlayın. Modeli eğitmek için, parti boyutu = 32, öğrenme hızı = 3e-5, gradyan birikimiyle 15 dönem için eğitim (8 adım), dropout uygula = 0.15 ve ağırlık azalması = 0.01, etiket düzgünleştirmeyi etkinleştir = 0.1. Hiperparametreleri train_config.json değiştirin.

Performansı değerlendirmek için ROUGE (1,2, L) rouge_score kütüphanesi, BLEU nltk.translate.bleu_score ve BERTScore bert_score paket kullanılarak hesaplanın. Ontoloji tabanlı anlamsal benzerlik betikleri kullanarak Legal-SemSim'i ve SpaCy ile altın açıklamalarla F1'i değerlendirin. Çalışma süresi verimliliği (katlama başına saniye) kaydedildi ve özetler altın referanslarla karşılaştırıldı. İki hukuk uzmanından gerçeklerin doğruluğunu incelemeleri istendi ve sonuçların nihai doğrulanmış özetleri kaydedildi. Bu protokole uyulmak, hukuki gerekçeyi, olgusal doğruluğu ve atıf doğruluğunu koruyan alan özetleri üretecektir.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Değerlendirme metrikleri

Sistem, Tablo 6'da gösterilen kapsamlı bir metrik seti kullanılarak değerlendirildi.

Metrik KategoriÖzel ÖlçütlerAçıklama
Sözcük ÖrtüşmesiROUGE-1, ROUGE-2, ROUGE-LÜretilen v...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

Çok aşamalı transformatör tasarımındaki CBR artırılmasının etkinliği, yasal alan metin özetlemesinde yeni bir performans kıyaslaması oluşturularak sağlanmıştır. Sonuçlar, ROUGE puanlarında 78.4 ROUGE-1, 54.8 ROUGE-2 ve 75.3 ROUGE-L ile alan özelinde %98 yasal kişi tanıma F1 ölçütlerinde önemli bir iyileşme göstermektedir. Her bileşenin katkısını daha da doğrulamak için, yalnızca CBR ve sadece Transformer tabanlı temel çizgiler tanıtıldı. Yalnızca CBR temel alanı, güçlü gerçekçilik ve man...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Yazarlar, bu çalışmanın içeriğiyle ilgili olası çıkar çatışması olmadığını belirtmektedir.

Teşekkürler

Yazarlar, bu çalışmaya gerekli hesaplama olanaklarını ve araştırma altyapısını sağladıkları için Koneru Lakshmaiah Eğitim Vakfı (Üniversite olarak kabul edilen) Bilgisayar Bilimleri ve Mühendisliği Bölümü'ne, Hyderabad, Telangana, Hindistan'a içten teşekkürlerini sunarlar. Bu çalışmada kullanılan hukuki korpusun notansasyonu ve değerlendirilmesine katkıda bulunan hukuk uzmanları ve alan uzmanlarına özel teşekkürler.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
CPU DonanımıAMD EPYC 7742 (64 çekirdekli, 2.25 GHz)1 birimAMD
ÇerçevePyTorch2https://pytorch.org
GPU DonanımıNVIDIA A100 (40 GB)2 birimNVIDIA Şirketi.
Grafik ÇerçevesiDGL1.1https://www.dgl.ai
KütüphaneSarılma Yüzü Transformatörleri4.32.0https://huggingface.co/transformers
KütüphaneSpaCy3.6https://spacy.io
KütüphaneNLTK3.8.1https://www.nltk.org

Kaynaklar

  1. Powers, D. M. Evaluation: From precision, recall and F-measure to ROC, informedness, markedness & correlation. J Mach Learn Technol. 2 (1), 37-63 (2011).
  2. Eisenberg, M. A. Legal Reasoning. , Cambridge University Press. (2022).
  3. Lin, C. Y. ROUGE: A Package for Automatic Evaluation of Summaries. Text Summarizat Branches Out. , 74-81 (2004).
  4. Lewis, M., et al. Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension. Proc ACL. , 7871-7880 (2020).
  5. Hadi, A. Leveraging Transformer-Based Language Models to Bridge the Gap Between Language and Specialized Domains. [Doctoral Dissertation]. , Institut Polytechnique de Paris. (2024).
  6. Waterworth, K. Model-Agents of Change: A Meta-Cognitive, Interdisciplinary, Self-Similar, Synergetic Approach to Neuro-Symbolic Semantic Search and Retrieval Augmented Generation. [Master's Thesis]. , Miami University. (2024).
  7. Zhang, J., Zhao, Y., Saleh, M., Liu, P. PEGASUS: Pre-training with Extracted Gap-sentences for Abstractive Summarization. Proc ICML. , 11328-11339 (2020).
  8. Li, Z., et al. When object detection meets knowledge distillation: A survey. IEEE Trans. Pattern Anal Mach Intell. 45 (8), 10555-10579 (2023).
  9. Chen, Y., et al. Citation Network Analysis for Legal Reasoning. J AI Law. 28 (2), 145-170 (2020).
  10. Raffel, C., et al. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. J Mach Learn Res. 21 (140), 1-67 (2020).
  11. Reimers, N., Gurevych, I. Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proc EMNLP. , 3982-3992 (2019).
  12. Gunning, D., Aha, D. DARPA's explainable artificial intelligence (XAI) program. AI Mag. 40 (2), 44-58 (2019).
  13. Mihalcea, R., Tarau, P. TextRank: Bringing Order into Texts. Proc EMNLP. , 404-411 (2004).
  14. Sharma, G., Sharma, D. Automatic text summarization methods: A comprehensive review. SN Comput Sci. 4 (1), 33(2022).
  15. Xu, J., Croft, W. B. Neural Networks for Text Classification. Inf Retr J. 20 (3), 259-289 (2017).
  16. Ghosh, S., Dutta, A., Das, A. Indian Legal Text Summarization: A Text Normalisation-based Approach. arXiv. , (2022).
  17. Silver, D., et al. Mastering the Game of Go with Deep Neural Networks and Tree Search. Nature. 529, 484-489 (2016).
  18. Chalkidis, I., et al. LexGLUE: A benchmark dataset for legal language understanding in English. Proc ACL. 60 (1), 4310-4330 (2022).
  19. Ashley, K. Artificial Intelligence and Legal Analytics. , Cambridge University Press. (2017).
  20. Chalkidis, I., Fergadiotis, M., Aletras, N. LEGAL-BERT: The Muppets Straight Out of Law School. Proc ACL. , 2898-2910 (2020).
  21. Vaswani, A., et al. Attention Is All You Need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  22. Baker, A. R., Slack, F. J. ADAR1 and its implications in cancer development and treatment. Trends Genet. 38 (8), 821-830 (2022).
  23. Casola, S., Lavelli, A. Summarization, simplification, and generation: The case of patents. Expert Syst. Appl. 205, 117627(2022).
  24. Valente, A. Legal Knowledge Engineering. , IOS Press. (1995).
  25. Katz, D. M., et al. Natural language processing in the legal domain. arXiv. , (2023).
  26. Gilpin, L., et al. Explaining Explanations: An Approach to Interpretable AI. Proc ICML. 70, 89-98 (2018).
  27. Davoodijam, E., Alambardar Meybodi, M. Evaluation metrics on text summarization: comprehensive survey. Knowl Inf Syst. 66 (12), 7717-7738 (2024).
  28. Schauer, F. Precedent. , Stanford Encyclopedia of Philosophy. (1989).
  29. Bengio, Y., Louradour, J., Collobert, R., Weston, J. Curriculum Learning. Proc ICML. , 382-389 (2009).
  30. Vrandecic, D., Krötzsch, M. Wikidata: A Free Collaborative Knowledge Base. Commun ACM. 57 (10), 78-85 (2014).
  31. Chu, Y., Ye, M., Qian, Y. Fine-Grained Image Recognition Methods and Their Applications in Remote Sensing Images: A Review. IEEE J Sel Top Appl Earth Obs Remote Sens. 17 (6), 1234-1250 (2024).
  32. Vue, Z., et al. Stories from Hmong in STEMM. Trends Genet. 39 (8), 587-592 (2023).
  33. Begum, N., Goyal, A. Analysis of Legal Case Document Automated Summarizer. Proc ISPCC. , 533-538 (2021).
  34. Surden, H. Ethics of AI in Legal Practice. J Legal Ethics. 32 (2), 145-163 (2019).
  35. Bench-Capon, T. J. M., Sartor, G. Ontology-Based Legal Reasoning. Artif Intell Law. 11 (2), 125-157 (2003).
  36. Liu, Y. Fine-tune BERT for Extractive Summarization. arXiv. , (2019).

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Yeniden basım ve izinler

Etiketler

Transformer MimarisiHukuki Sonu TahminiHukuki Varl k Tan maSoyutlay c zetlemekar msal zetlemeROUGE Skorlar