يتطلب اشتراك JoVE لعرض هذا المحتوى. تسجيل الدخول أو ابدأ نسخة تجريبية مجانية

مقالة بحثية

التفكير القائم على الحالة مع التعلم العميق لنهج هجين في تلخيص النصوص القانونية

490 مشاهدات

DOI:

10.3791/69287

ديسمبر 12, 2025

في هذه المقالة

ملخص

يدمج هذا البروتوكول الاستدلالية القائمة على الحالة (CBR) مع نماذج المحولات متعددة المراحل لتلخيص النصوص القانونية. تقوم بمعالجة القضايا القانونية مسبقا، وتستعيد السوابق المماثلة، وتكييف هياكل التفكير، وتولد ملخصات دقيقة ومتسقة. تشمل التطبيقات البحث القانوني، وتحليل الأحكام، وأنظمة دعم القرار، مما يضمن اتساقا وواقعيا ودقة في التفكير الخاص بالمجال.

الملخص

الوثائق القانونية معروفة بأنها طويلة ومعقدة، مما يجعل من المستحيل عمليا على الممارسين القانونيين والباحثين تحديد المعلومات ذات الصلة واستخراجها بسرعة. هنا، يقدم نهج هجين يتفوق على القواعد الاستخراصية والمجردية السابقة على كل من مقاييس التداخل المعجمي ومعايير الاستدلال الخاصة بالمجال، حيث يستخدم الاستدلالية القائمة على الحالة (CBR) للنصوص القانونية وتقنيات التعلم العميق الملموسة لتمثيل الملخص، مما ينتج ملخصات بدقة وكفاءة. باستخدام مجموعة بيانات أكبر تضم 4,968 قضية قانونية من كاجل، تم بناء بنية محول متعددة المراحل فوق نموذج استرجاع CBR العام الذي تم إنشاؤه سابقا لإنتاج ملخصات موجزة مع CBR لفهم السياق. تم تقييم النظام بناء على التنبؤ بالنتائج القانونية وتماسك الملخص، حيث أظهرت النتائج أداء متفوقا على الطرق الاستخراجية والتجريدية القائمة، ودرب النموذج المقترح حتى وصلت دقة الكيانات القانونية إلى 98٪، بالإضافة إلى مجموعة قانونية أكثر تماسكا بنسبة 46٪ (معززة بخط الأساس) مقارنة بالطرق الحديثة، مقارنة باستخدام درجات ROUGE أعلى من الأنواع السابقة بنسبة 23٪. تقدم هذه الدراسة إطار عمل هجين لتلخيص النصوص القانونية يدمج CBR مع نماذج قائمة على المحولات. أظهرت التجارب الواسعة أداء متفوقا مقارنة بالأساسيات الحديثة، محققة دقة واقعية أعلى، ودقة استدلال، وحفظ الكيانات القانونية.

المقدمة

تطلب الوثائق القانونية الواسعة طرقا متقدمة لاسترجاع البيانات ذات الصلة في الوقت المناسب. تلخيص النصوص القانونية مهم لتحسين سهولة الوصول واتخاذ القرار. الآراء القانونية والأحكام والسوابق مطولة جدا لدرجة أن القضاة والممارسين والباحثين قد يجدون صعوبة في إدراجها، مما يؤدي إلى تطوير طرق آلية لتلخيص هذه الوثائق بدقة وكفاءة1.

على الرغم من أدائها المتطور في القضايا العامة، إلا أن طرق التلخيص الحالية تكافح لالتقاط التعقيد الفريد والمصطلحات القانونية التي تميز الوثائق القانونية. اختيار الجمل العليا دون إعادة ترتيب بناء فقط على الاحتمالات اللوغاريتمية يمنح درجات ROUGE جيدة لكنه يخسر السياق والدلالات الكاملة. تستخدم المناهج التجريدية توليد اللغة الطبيعية لتكوين التغطية، بحيث يمكنها التقاط الفروق السياقية، لكنها تكافح للحفاظ على عملية التفكير المنطقية والمنطق القانوني لقضايا المحكمة2. الطريقة المقترحة فعالة بشكل خاص لنصوص القضايا القانونية الطويلة التي تحتوي على أقسام منظمة (مثل الحقائق، الحجج، السوابق القضائية، والأحكام). تتفوق عند تطبيقها على المجموعات التي تحتوي على استشهادات صريحة وتنسيق موحد، مثل قرارات الاستئناف أو المحكمة العليا. ومع ذلك، قد يقتصر الأداء على مجموعات بيانات صاخبة أو غير منظمة (مثل ملفات PDF الممسوحة ضوئيا مع أخطاء OCR، أو المستندات التي تفتقر إلى تقسيم بلاغي واضح). لذا، فإن الطريقة مناسبة بشكل أفضل لمستودعات الحالات الرقمية المنظمة جيداحيث تتوفر كل من الميزات اللغوية والاستشهادية 3.

يستخدم الإطار الهجين المتفوق المقترح الذي يجمع بين التفكير القائم على الحالة (CBR) ومعالجة اللغة الطبيعية المتقدمة (NLP) لإنشاء ملخص. يستخدم بنية محول متعددة المراحل مع طبقات انتباه قانونية خاصة بالمجالات ويقترح وحدة استدلال عبر المستندات. يسمح CBR للنظام بتحميل قضايا سابقة مماثلة يمكن استخدامها لفحص جميع المتغيرات السياقية لأسباب قانونية4. حقق النموذج المقترح دقة أعلى مقارنة بالخطوط الأساسية المتقدمة، كما يتضح من المكاسب الكمية عبر مقاييس ROUGE وBLEU وLegal-SemSim، وتم التحقق من ذلك من خلال تقييم الخبراء البشري. على سبيل المثال، تفوق النموذج المقترح على Legal-BART وPALM-Law بهوامش تتراوح بين 15٪-20٪ في دقة سلسلة التفكير. تبني التمثيلات العامة والأساليب المتطورة يضيف معرفة خاصة بالحالة إلى جانب التلخيص العصبي وتحقيق دقة 98٪ للتعرف على الكيانات القانونية و97٪ لاسترجاع السوابق، متجاوزابكثير الأعمال السابقة.

أعمال ذات صلة

تلخيص النصوص القانونية، وهو مجال فرعي من معالجة اللغة الطبيعية (NLP)، حظي باهتمام متزايد بسبب الطلب المتزايد على معالجة الوثائق القانونية بكفاءة، بما في ذلك الآراء القضائية، والقوانين، والسوابق القضائية. التحدي الأساسي يكمن في الحفاظ على السلامة الدلالية، والاستدلال القانوني، والسياق الخاص بالمجال في الملخصات التي تم إنشاؤها. تمتد أبحاثها السابقة عبر الأساليب الاستخراجية والتجريدية والهجينة، مع التركيز الحديث على البنى العصبية المتكيفة مع المجال6.

مراجعة الأدبيات

لقد تطور تلخيص النصوص القانونية كمجال حيوي في معالجة اللغة الطبيعية، مدفوعا بالحاجة الملحة لجعل الوثائق القانونية الضخمة والمعقدة متاحة وقابلة للتنفيذ. تعكس أدبيات هذا المجال مسارا من نماذج استخراجية سطحية إلى هياكل هجينة متطورة تحاول تحقيق التوازن بين الطلاقة، والنزاهة الواقعية، والمنطق القانوني. ركزت الجهود المبكرة على تقنيات التلخيص الاستخراجي، التي أعطت الأولوية لأهمية الجملة بناء على التشابه المعجمي والأنماط الإحصائية. على الرغم من فعاليتها في اختيار الشظايا القانونية البارزة، إلا أن هذه الأساليب مثل TextRank وLexRank غالبا ما تتجاهل البنية الدلالية الأعمق وتفشل في التقاط الطبقات البلاغية والجدلية الأساسية في التفكير القانوني6. نظرا لاختلاف النصوص القانونية بشكل ملحوظ عن النصوص العامة بسبب دلالاتها الصارمة وتعبيراتها الخاصة بالمجالات، فقد أنتجت هذه النماذج ملخصات تفتقر إلى التماسك والكفاءة السياقية. مع ظهور هياكل المحولات المدربة مسبقا، تحول تركيز البحث إلى الطرق التجريدية. بدأت نماذج مثل BART وT5 وPEGASUS تظهر القدرة على تلخيص الملخصات باستخدام أنماط توليد اللغة المكتسبة. أما تعديلاتهم القانونية، مثل LegalBART وLegalPEGASUS، فقد أضفت الأداء إلى صقل الأداء من خلال دمج كوربورا7 للتدريب المسبق الخاص بالقانون. ومع ذلك، استمرت الأساليب التجريدية في المعاناة من قيود في اتساق الاستدلال وتحديات التفسير - وهي تحديات إشكالية خاصة في البيئات القانونية، حيث حتى الانحرافات البسيطة في الحقائق قد تؤدي إلى سوء التفسير.

ظهرت نماذج هجينة استجابة لهذه العجز، مدمجة استراتيجيات التفكير الرمزي أو الاسترجاع لتحسين التأسيس السياقي. كان من الاتجاهات البارزة دمج السجل التأملي المجتمعي، حيث تم استخدام المعرفة من القضايا السابقة لوضع عملية إنشاء الملخصات في سياقها. تحاول هذه النماذج الحفاظ على الدقة الواقعية لطرق الاستخلاص مع توليد مخرجات متماسكة لغويا وصحيحة قانونيا8.

تركز الاتجاهات الحديثة على البنى متعددة المراحل التي تجمع بين الاعتراف بالكيانات القانونية، والاستدلال عبر الوثائق، وتحليل الأدوار البلاغية، مما يشير إلى تحول نحو فهم الوثائق الشامل بدلا من مجرد التلخيص. تأخذ الأبحاث الآن بشكل متزايد في النظر في توافق الأنطولوجيا القانونية، ومقاييس التقييم الخاصة بالمجال (مثل Legal-SemSim)، والتقييم المرتكز على الإنسان لتقييم جودة وقابلية استخدام الملخصات للمهنيين القانونيين9.

تسلط الاستطلاعات الحديثة، مثل استكشاف تطبيقات النماذج الكبيرة في القانون عام 2023 واستكشاف استخدام النماذج الكبيرة في المجال القانوني الإيطالي عام 2024، الضوء على الدور المتزايد لنماذج اللغة الكبيرة (LLMs) في أتمتة مهام التفكير القانوني والتلخيص والاسترجاع10. تركز هذه الأعمال ليس فقط على قدرة نماذج اللغة الكبيرة مثل GPT-4 وPaLM وLLaMA على التقاط الفروق السياقية للخطاب القانوني، بل أيضا على تحديات تكييف المجال، وقابلية الشرح، والاتساق الواقعي11. يتم استكشاف أنظمة هجينة تدمج التوليد المعزز بالسحب (RAG) أو CBR مع نماذج اللغة الكبيرة بشكل متزايد لدمج قوة التفكير الواعي بالسوابق مع طلاقة المحولات التوليدية6. وبوضع العمل ضمن هذا الاتجاه، يوسع النموذج الهجين متعدد المراحل المقترح الأطر المعززة بالاسترجاع السابقة من خلال ترميز سلاسل الاستدلال القانونية بشكل صريح، مع الحفاظ على التماسك من خلال التلخيص التجريدي المعتمد على المحولات.

على الرغم من التقدم الكبير، لا يزال هناك فجوة في النماذج التي يمكنها تلخيص ملخصات قانونية واقعية ومنظمة منطقيا ومتسقة مع المجال مع الحفاظ على قابلية التفسير12. يعالج العمل الحالي هذا الفراغ من خلال اقتراح نهج هجين متعدد المراحل قائم على التحليل الجماعي القانوني والبنية العصبية العميقة، مقدما نموذجا دقيقا وقابلا للاستخدام عمليا.

أساليب التلخيص الاستخراجي

يستخدم مصطلح التلخيص الاستخراجي للطرق التي تستخرج وتجمع أكثر الجمل إفادة من المستند. الخوارزميات القائمة على الرسوم البيانية، مثل TextRank13 وLexRank14، هي أساليب تقليدية تقوم بترتيب الجمل بناء على أهميتها. على الرغم من إمكانية التحقيق الحسابي، إلا أن هذه الأساليب عادة ما تواجه صعوبة في التفكير القانوني المعقد والحجج8. مع ظهور نماذج اللغة المدربة مسبقا، أظهرت طرق BERT المعتمدة على BERT مثل BERTSUM8 تحسنا كبيرا. يقوم BERTSUM بضبط تضمينات BERT للتلخيص الاستخراجي على مستوى الجملة، مع التقاط الفروق السياقية بشكل أفضل من النماذج الإحصائية9. أدت تعديلات المجال القانوني مثل Legal-BERTSUM إلى تحسين الأداء من خلال دمج مجموعات قانونية محددة، مما أتاح تحسين التعرف على الفترات القانونية واختيار العقوبات. ومع ذلك، فإن الطرق الاستخراجية محدودة في إعادة بناء التدفق الجدلي أو سلسلة التفكير القانوني، خاصة عندما تكون الجمل مترابطة أو تكون المراجع ضمنية15.

أساليب التلخيص التجريدي

يلخص التجريد عبارات وجمل جديدة تعيد صياغة المحتوى المصدر، غالبا باستخدام بنى المشفر-فك الترميز. يعد نموذج BART4 وPEGASUS7 أمثلة رائدة على نماذج التسلسلات المدربة مسبقا والمطبقة على التلخيص العام الاستخدام. تم تكييف هذه النماذج لتناسب المجال القانوني من خلال ضبط المجموعات القانونية - مما أدى إلى نماذج مثل Legal-BART وLegal PEGASUS16,17. تنتج هذه النماذج ملخصات أكثر سلاسة وبشرية، وهي أفضل في التقاط المعنى السياقي مقارنة بالأساليب الاستخراجية18.

ومع ذلك، فإن تطبيقها في التلخيص القانوني يطرح تحديات. غالبا ما تواجه النماذج التجريدية صعوبة في الاتساق الواقعي والحفاظ على دلالات القانون. سوء تفسير البنود القانونية أو إغفال الكيانات القانونية الرئيسية يمكن أن يجعل الملخص مضللا19. علاوة على ذلك، فإن نماذج توليد النصوص العصبية عموما غير واضحة، مما يثير قضايا حول قابلية الشرح والتحقق، وكلاهما ضروري في المجالات القانونية.

نماذج التلخيص الهجين

للاستفادة من نقاط قوة كلا النموذجين، تدمج نماذج التلخيص الهجينة المكونات الاستخراجية والمجردة. كانت إحدى الاستراتيجيات المبكرة استخدام الوحدات الاستخراجية لاختيار الجمل المرشحة، والتي يتم تحسينها بعد ذلك بواسطة مفك تشفير تجريدي. مؤخرا، تم دمج هندسة المحولات مع وحدات مليئة بالمعرفة لتعزيز الفهم القانوني5.

برزت CBR كاستراتيجية هجينة واعدة للمجتمع. كان ووتروورث رائدا في استخدام الحالات السابقة لتوجيه القرارات الحالية، وتكاملها مع النماذج العصبية يتيح إثراء دلالي من خلال التفكير التناظري6. في التلخيص القانوني، يسمح دمج CBR مع المحولات بإعادة الاستخدام السياقي والتركيب المجرد. نماذج مثل BART+CBR تدمج السياق القانوني القائم على الاسترجاع مع آليات توليدية، مما يوفر تماسكا محسنا وملاءمة قانونية20.

تبني بنية Multistage + CBR المقترحة على هذا الخط من العمل من خلال تضمين سلاسل الاستدلال الخاصة بالمجال في خط أنابيب التلخيص. يتميز ببلوك محولات هرمية، وانتباه عبر المستندات، وطبقات استرجاع معززة ب CBR، مصممة خصيصا للتطبيقات القانونية. يسهل هذا التصميم متعدد الطبقات فهما دقيقا للمحتوى والحفاظ على البنية على المستوى الكلي21.

التحديات والاعتبارات القانونية الخاصة

تظهر الوثائق القانونية خصائص هيكلية ولغوية فريدة، بما في ذلك التنسيق الهرمي، ومقارنة السوابق القضائية، والاستشهادات القانونية، والمصطلحات الخاصة بالمجال22. لذا يجب على نماذج التلخيص ألا تتعامل فقط مع التعقيدات النحوية والدلالية، بل تحترم أيضا التماسك المنطقي وتطور الحجج القانونية23. يعتمد التلخيص الفعال في هذا السياق على التعرف الدقيق على الكيان القانوني، والحفاظ على بنية التفكير، وتفسير الأدوار البلاغية مثل الحقائق والحجج والأحكام.

تم استخدام الوجوديات القانونية وشبكات الاستشهاد لتحسين فهم المجالات. على سبيل المثال، أظهر دمج قواعد المعرفة القانونية المنظمة أثناء تدريب النماذج يعزز الربط بين الكيانات القانونية وثبات الاستشهادات. تساهم هذه الجهود في تلخيص نماذج تتماشى بشكل أفضل مع توقعات الممارسين القانونيين25.

تحد آخر هو قابلية التفسير. في السياقات القانونية، يجب أن يكون الناتج قابلا للتدقيق والتفسير. لذا، يتم استكشاف أطر الذكاء الاصطناعي القابل للتفسير (XAI) مثل LIME وSHAP بشكل متزايد لتبرير قرارات التلخيص، رغم أن التكامل مع النماذج واسعة النطاق لايزال تحديا بحثيا مستمرا.

مقاييس التقييم في التلخيص القانوني

تستخدم مقاييس التلخيص القياسية مثل ROUGE8 وBLEU27 وMETEOR عادة لتقييم التداخل المعجمي. ومع ذلك، فإن هذه المقاييس غير كافية لالتقاط الدقة الدلالية، والاتساق القانوني، والتماسك الجدلي.

تقدم الجهود الحديثة مقاييس خاصة بالمجال مثل Legal-SemSim، التي تدمج أنطولوجيات قانونية لتقييم التشابه الدلالي، ودقة سلسلة الاستدلال التي تقيم الحفاظ على التدفق المنطقي وصحة الاستنتاج28. يظل تقييم الخبراء البشري أمرا لا غنى عنه، خاصة لقياس الصوابية القانونية، والتماسك، وقابلية اتخاذ النظام. الاتفاق بين المعلقين باستخدام مقاييس مثل كابا فلايس يضمن موثوقية التقييمات النوعية29.

التطورات الأخيرة والاتجاهات المستقبلية في تلخيص القانون

تتجه أبحاث تلخيص القانون نحو أنظمة أكثر قوة، ووعيا بالسياق، وقابلية للتفسير. البنى الرمزية-العصبية الهجينة التي تدمج الاستدلال القائم على القواعد مع نماذج المحولات تكتسب زخما. تحافظ هذه الأنظمة على قابلية تفسير النهج المنطقية مع الاستفادة من قدرةالتعميم في التعلم العميق.

التلخيص القانوني متعدد اللغات هو مجال ناشئ آخر، يتناول الطبيعة العالمية للنصوص القانونية والإجراءات30. الاستدلال الزمني، الضروري لفهم التسلسلات القانونية المعتمدة على الزمن، ونمذجة الخطاب الجدلي قيد الاستكشافأيضا. 9.

علاوة على ذلك، يتم استخدام التطورات في التعلم التبايني والتعلم من المناهج لتعزيز تعميم النماذج عبر مجالات قانونية متنوعة17. من خلال زيادة تعقيد المهام تدريجيا وتمييز الفئات الدلالية الدقيقة، تحسن هذه التقنيات متانة النموذج في سيناريوهات العالم الحقيقي31.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

يستخدم هذا البروتوكول مجموعات بيانات قانونية متاحة للجمهور. لم تستخدم أي بيانات شخصية أو سرية حساسة. تتوافق الدراسة مع الإرشادات الأخلاقية المؤسسية لاستخدام المجموعات القانونية في البحث (مؤسسة كونيرو لاكشمايا التعليمية (جامعة معتبرة)، حيدر أباد، تيلانجانا، الهند، رقم الموافقة: KLEF/CS/2024/IRB-017). تستخدم الدراسة مجموعة بيانات تضم 4,968 قضية قانونية، كل منها يحتوي على تعليقات شاملة. يوضح الجدول 1 وصف مجموعة البيانات.

precedent_citationsالاستشهادات المنظمة لقضايا السوابق القضائية
reasoning_chainsتسلسلات الاستدلال المنطقي المشروحة

الجدول 1: وصف سمة مجموعة البيانات.

مجموعة بيانات الدراسة

بعد المعالجة المسبقة، يتم تطبيع مجموعة البيانات لتوحيد النتائج. يتراوح طول نصوص القضايا بين 1,000 و5,000 كلمة، شاملة للتدريب والتقييم. جمعنا نتائج القضايا في تسميات أولية حسب تكرارها في مجموعة البيانات، مما أتاح لنا استكشاف أداء التلخيص عبر سياقات قانونية مختلفة. تم إجراء التعليق بواسطة فريق مكون من خمسة محترفين قانونيين، من بينهم ثلاثة محامين ممارسين وباحثين في الدكتوراه المتخصصين في المعلوماتية القانونية. تم تعليق كل حالة بشكل مستقل من قبل خبيرين، مع حل النزاعات بواسطة معلق كبير. شمل مخطط التعليقات الكيانات القانونية، والاستشهادات السابقة، وسلاسل التفكير. تم قياس التوافق بين التعليقات باستخدام كابا فلايس (κ = 0.82)، مما يشير إلى اتساق قوي بين المشرفين. ضمنت هذه العملية كل من الصلاحية القانونية وقابلية إعادة إنتاج مجموعة البيانات.

توزيع مجموعات البيانات

تتضمن مجموعة البيانات قضايا تحتوي على مجالات قانونية متنوعة، كما هو موضح في الجدول 2.

المجال القانونيعدد القضاياالنسبه المئويه
قانون العقود1,27825.70%
الملكية الفكرية1,05321.20%
القانون الدستوري51210.30%
القانون الإداري4328.70%
القانون الجنائي3086.20%
قانون المسؤولية التقصيرية2194.40%
أخرى/متنوعة1,16623.50%

الجدول 2: القضايا التي تحتوي على مجالات قانونية متنوعة.

توزيع نتائج الحالات عبر مجموعة البيانات موضح في الجدول 3.

نتيجة القضيةعدالنسبه المئويه
استشهد2,46049.20%
المشار إليه85517.10%
متبع4719.40%
مطبق4478.90%
النظر3537.10%
نتائج أخرى3828.30%

الجدول 3: توزيع نتائج الحالات عبر مجموعة البيانات.

لذلك، أكد التحليل تصويرا منطقيا عبر المجالات في التدريب، والتحقق، وانقسامات الاختبار باستخدام أخذ عينات طبقية لمنع التحيزات الخاصة بالمجال. تم تقسيم مجموعة البيانات إلى مجموعات تدريب (80٪)، والتحقق (10٪)، ومجموعات اختبار (10٪).

توزيع طول النص

يتم عرض تحليل توزيع طول النص في الجدول 4.

نطاق الطول (كلمات)عدالنسبه المئويه
تحت 5004659.40%
500-1,0001,35927.40%
1,000-5,0002,69854.30%
5,000-10,0003236.50%
أكثر من 10,0001543.10%

الجدول 4: تحليل توزيع طول النص.

يبرز هذا التوزيع التنوع في طول المستندات، حيث تقع الغالبية في النطاق المتوسط (1000-5000 كلمة)، مما يشكل تحديا مناسبا لتقنيات التلخيص.

معالجة البيانات المبدئية المحسنة

استند خط معالجة ما قبل المعالجة إلى دراسات حديثة حول تأثير المعالجة المسبقة في مهام معالجة اللغة الطبيعية القانونية القائمة على المحولات. يظهر تشالكيديس وآخرون أن الترميز الواعي للمجال وتطبيع الاستشهاد يحسنان بشكل كبير من دقة التلخيص في المراحل النهائية30. وبالمثل، يظهر بوماريتو وكاتز أن خيارات المعالجة المسبقة، وخاصة تطبيع الكيانات، تؤثر مباشرة على أداء المحول في التلخيص القانوني32. استنادا إلى هذه الرؤى، استخدم خط الأنابيب الترميز الواعي بالقسم، وتطبيع الاستشهادات القانونية، وتحليل الأدوار البلاغية لتعظيم التماسك السياقي. تم تطوير خط معالجة مسبقة مبتكر، يدمج طرق المعالجة المسبقة العامة وتقنيات خاصة بالمجال للحصول على نصوص قانونية عالية الجودة وتصفية بعض حالات حقول الحالات الفارغة أو القصيرة جدا في البداية، لضمان سلامة البيانات. بعد ذلك، تم إجراء تطبيع المدخلات، حيث تم استخدام قواعد قانونية للترميز لضمان سهولة استخدامالمدخلات 33. تم استخراج الكيانات الرئيسية باستخدام نموذج التعرف على الكيانات القانونية عالية الأداء المخصص (درجة F1 98٪)، واستخدمت تقنيات تحليل الخطاب لفهم العناصر الهيكلية. لتعزيز تحليل السوابق، تم إدخال خطوة بناء رسم بياني الاستشهاد. خطوات المعالجة المسبقة الأخرى خاصة بمحللي التعبيرات المنتظمة، مما يؤكد أن مدخلاتهم تتوافق بدقة مع الصيغ الصارمة جدا للاستشهادات القانونية الموحدة. تم تطبيق رمزيات واعية للأقسام لهياكل الوثائق الهرمية، وأضيف مصنف RoBERTa مضبوط بدقة يحمل أدوارا بلاغية مثل الحقائق والحجج والقرارات لكل نص قانوني. يتيح لنا هذا المسار الأوسع تعزيز المهام اللاحقة بشكل بسيط مثل استرجاع النصوص القانونية، والتفكير، والتلخيص.

وحدة التفكير المتقدمة القائمة على الحالة

تقدم الدراسة لأول مرة تطبيقا متقدما لنظام الاستدلالات القائم على القضايا (CBR) المتطور الذي يمكنه استخدام التشابه الدلالي بالإضافة إلى المعرفة بالمجال القانوني لتقديم قضايا ذات صلة وقابلة للمقارنة بدقة استرجاع 98٪ على مجموعة بيانات المعيار. يرمز تمثيل القضايا المحسن لكل قضية بمتجه هجين يجمع بين التضمينات السياقية - التي تنتجها نموذج BERT يركز على المجالات على النص القانوني - مع التضمينات الهيكلية التي تعكس موقع العناصر في المستند، والتضمينات الواعية للكيانات التي تبرز العلاقات القانونية الموجودة في القضايا، وتضمينات شبكة الاستشهادات التي تمثل كيفية ربط السوابق معا. يعمل استرجاع الحالات متعدد المراحل كنهج متعدد الخطوات من خلال إجراء البحث التقريبي للجار (ANN) أولا للحصول على مرشحي البذرة، وتطبيق الانتباه المتقاطع للحصول على أفضل تطابقات من المرشحين، واستخدام دالة تقييم خاصة بالمجال وتقييم الصلة المعتمد على المجموعات لاختيار أفضل حالات الاسترجاع. خلال مرحلة التكيف المتقدم للحالات (ACAS)، يستخرج النظام أنماط الاستدلال من خلال قالب تمثيل قائم على الرسوم البيانية يلتقط التبعيات المنطقية بين الحجج القانونية. ثم يحدد الصلة بالسوابق من خلال تحليل الاستشهاد، ويزن كل مكون حالة وفقا لأهميته السياقية للاستعلام. وأخيرا، يتم الحفاظ على هيكل الحجج باستخدام طرق تحليل الخطابات لضمان الحفاظ على التدفق المنطقي للاستدلال القانوني. الوحدة الأخيرة، وحدة تكامل المعرفة، تساعد في الاسترجاع من خلال الأنطولوجيات القانونية، وتسجل العلاقات الزمنية للسوابق، وتحافظ على صلاحيتها في سلاسل معقدة من التفكير القانوني. يحقق نظام CBR المقترح معدل استرجاع صحيح بنسبة 98٪، وهو أعلى من المعايير السابقة (مثل LexGLUE، 92٪-95٪) لاسترجاع وتكييف القضايا القانونية.

بنية المحول متعدد المراحل

استنادا إلى المراجع المذكورة أعلاه، تقترح الدراسة طريقة مصطنعة تعتمد على الشبكة العصبية الاصطناعية على نموذج معماري متعدد المراحل يعتمد على المحول، يستفيد من أفضل عناصر جميع الخوارزميات المذكورة لتحسين المعالجة الآلية، والتفكير، والتلخيص الوثائقي القانونية. تستخدم مرحلة فهم المستندات مشفر BERT متكيف مع المجال القانوني، وآليات الانتباه الهرمية، والوحدات الخاصة بالتعرف على الكيانات القانونية، واستخراج العلاقات، ومعالجة رسم بياني الاستشهادات للحصول على فهم هيكلي وسياقي عميق للوثائق القانونية. تساعد مرحلة التفكير عبر الوثائق في التفكير القائم على الحالات من خلال ربط الاستعلامات بالقضايا المسترجعة عبر آلية تقاطعية في شكل استخراج والتحقق من سلاسل الاستدلال القانوني، ونموذج تطبيق السوابق القضائية، والحفاظ على بنية الحجج. تم استخدام SBERT وBi-LSTM في مستوى تكوين الجمل، بينما تم استخدام فك تشفير مخصص مع قيود المجال القانوني في مستوى توليد الملخصات المجردة للحفاظ بدقة على المصطلحات القانونية، واتساق الحقائق، والتسلسل الهرمي في الملخص وفقا لمتطلبات الكتابة القانونية. من خلال تقسيم العملية إلى مراحل مختلفة، يمكن ضمان أن تحافظ معالجة المستندات على اتساق الواقع، والتماسك السياقي، والاقتباس بالدقة. يتم عرض عملية تدريب النماذج المقترحة في الجدول 5.

المعاملة الفائقةقيمة
حجم الدفعة32
معدل التعلم3e-5 مع الإحماء
العهود15
أقصى طول تسلسلرموز 2048
معدل التسرب0.15
تراكم التدرج8 خطوات
خطوات الإحماء1000
تآكل الوزن0.01
تنعيم الملصقات0.1

الجدول 5: نموذج عملية التدريب.

لتعزيز أداء النموذج والتعميم، قمنا بتنفيذ عدة تقنيات تدريب متقدمة، والتي تم تغطيتها بالتفصيل. استخدمت هذه التقنية التعلم من المنهج لزيادة تعقيد المهام تدريجيا، مما مكن النموذج من اكتساب المهارات الأساسية قبل التعامل مع الحالات الأكثر تحديا. من خلال إجراء تجارب على مجموعة بيانات التدريب، أكد الباحث أن الضبط الدقيق قد نقلت التمثيلات الدلالية بنجاح من خلال مساعدة النموذج على التمييز بين البيانات المتشابهة جدا والمختلفة، مما زاد من فهمه لمجموعة البيانات. فيما يتعلق بالتعلم متعدد المهام، تم اقتران التلخيص بمهمة أو مهمة مساعدة، مثل التصنيف أو التعرف على التعريات، مما عزز فهما أكثر شمولا للمجال القانوني. نقل المعرفة المهمة من خلال تقطير المعرفة التي تحتفظ بمعرفة عالية المستوى دون جعل النموذج ضخما، وقد تم نقلها بالفعلإلى نماذج أكبر تركز على المجالات.

منهجية التلخيص القانوني الهجين متعددة المراحل

لتفعيل الإطار المقترح، يتم عرض خوارزمية خطوة بخطوة 1، تمثل منهجية التلخيص القانوني الهجين متعددة المراحل.

الخوارزمية 1:
خوارزمية: تلخيص قانوني هجين متعدد المراحل
الادخال: مجموعة بيانات القضايا القانونية D مع الحقول {case_text، legal_entities، الاستشهادات، النتائج}
الناتج: ملخص S لكل قضية مع الحفاظ على الأسباب القانونية
بدأ
المرحلة الأولى: معالجة البيانات المسبقة
لكل حالة في D:
قم بتطبيع النص لإزالة الضوضاء وتوحيد التنسيق.
تطبيق الاعتراف بالكيان القانوني (LER) لاستخراج الكيانات القانونية.
ابن رسم بياني للاقتباسات من السوابق المشار إليها.
قم بترميز النص باستخدام قواعد الترميز القانونية الواعية بالنطاق.
ملاحظه: إذا كان مجموعة الإدخال تحتوي على نصوص صاخبة أو غير مكتملة، قم بإجراء تطبيع إضافي مثل تصفية الكلمات الثابتة أو تقسيم الأقسام.

المرحلة 2: الاسترجاع القائم على الحالة
لكل حالة:
توليد تضمينات سياقية باستخدام مشفر BERT مكيف مع المجال.
توليد تضمينات هيكلية بناء على موقع المقطع.
توليد تضمينات شبكة الاستشهاد.
استرجاع حالات مماثلة سابقة باستخدام البحث التقريبي لأقرب جار (ANN).
قم بتحسين الحالات المسترجعة باستخدام تقييم الانتباه المتقاطع وترتيب الصلة القائم على المجموعات.

المرحلة 3: اقتباس الحالة
لكل حالة تم استرجاعها:
استخلاص أنماط التفكير باستخدام تحليل الخطاب.
حدد الحجج القانونية ذات الصلة وحدد أوزانا بناء على أهميتها.
حافظ على تدفق الحجة أثناء التكييف.
ملاحظه: إذا احتوت القضايا السابقة على حجج غير ذات صلة أو متناقضة، استبعدها أثناء التكييف.

المرحلة 4: تلخيص متعدد المراحل يعتمد على المحول
لكل حالة إدخال وسوابقها المعدلة:
ترميز حالة الإدخال باستخدام مشفر BERT في المجال القانوني مع انتباه هرمي وواعي بالكيانات.
تطبيق التفكير عبر المستندات بين الاستعلام والحالات المسترجعة.
ترميز الجمل باستخدام SBERT وBi-LSTM لتعزيز التضمينات السياقية.
فك شفرة الملخص باستخدام جهاز فك تشفير مقيد النطاق للحفاظ على الدقة الواقعية والقانونية.

المرحلة 5: المخرج والتحقق
لكل ملخص قصير تم إنشاؤه:
تحقق من صحة الملخص الذي تم إنشاؤه من حيث التماسك، وصحة الحقائق، وأمانة الاستدلال القانوني.
أعد الملخص النهائي S.
ملاحظه: إذا كان هناك حاجة إلى التحقق من الخبراء، أضف خطوة مراجعة إضافية لشخص مطلع قبل النشر.
انتهاء

لإعداد بيئة الحوسبة، تم تثبيت بايثون 3.10. يتطلب التثبيت مكتبات: PyTorch (v2.0)، Hugging Face Transformers (v4.32.0)، SpaCy (v3.6)، NLTK (v3.8.1)، NetworkX (v3.1)، DGL (v1.1). دعم بطاقة الرسوميات كان متوفرا (وحدتا رسومات بسعة 40 جيجابايت لكل منهما). انظر جدول المواد للنسخ والمصادر الدقيقة.

تم تنزيل مجموعة بيانات القضايا القانونية (≈ 5,000 قضية) من مصدر مجموعة البيانات المحددة وتم التحقق من صحة كل قضية لتشمل الحقول: الحقائق، الحجج، الاستشهادات، ونتائج الحكم. تخزين المستندات بصيغة UTF-8 النصية العادية. تمت إزالة النصوص الفارغة أو القصيرة باستخدام سكريبت بايثون (preprocess.py). تم تنفيذ إزالة الضوضاء وتوحيد تنسيق النصوص. تم تطبيق ترميز النطاق القانوني باستخدام SpaCy (spacy.load("en_core_legal_sm")). تم إجراء التعرف على الكيان القانوني باستخدام نموذج BERT مضبوط بدقة (transformers.pipeline("ner", model="legal-bert-ler")). تم بناء رسم بياني للاقتباس باستخدام NetworkX (nx. DiGraph())، يربط العقد حسب السوابق المشار إليها. إذا تم تضمين مستندات قائمة على OCR، يتم تشغيل سكريبت إضافي لتنظيف النصوص (ocr_clean.py).

تم توليد تضمين سياقي باستخدام نموذج BERT خاص النطاق (bert-legal) وتم توليد تضمينات الاستشهادات باستخدام مشفرات الرسوم البيانية DGL. تم إجراء بحث تقريبي عن أقرب جار باستخدام FAISS (faiss. IndexFlatIP). تم تطبيق تقييم الانتباه المتقاطع باستخدام وحدة PyTorch (CrossAttentionScorer) وتم تصنيف النتائج حسب وزن المجموعات للتشابه السياقي والاقتباس. تم تحليل هيكل الخطاب باستخدام مصنف أدوار بلاغي (روبرتا-ليجال-بلاغة) وتم استخراج أنماط التفكير ذات الصلة من خلال محاذاة الأدوار البلاغية. تم تخصيص أوزان لمقاطع الحجج بناء على التكرار وقوة الاستشهاد. استبعد السوابق المتناقضة أو غير ذات الصلة.

تم ترميز المستندات باستخدام مشفر BERT مكيف مع المجال وتم تطبيق وحدات الانتباه الهرمية (تنفيذها في hierarchical_encoder.py). تم استخدام SBERT وBi-LSTM (حزمة محولات الجمل) لتضمينات الجمل. تم فك تشفير الملخصات التجريدية باستخدام مفكك ترميز مقيد (legal_decoder.py). حدد الحد الأقصى لطول التسلسل ب 2048 رمزا. لتدريب النموذج، اضبط حجم الدفعة = 32، معدل التعلم = 3e-5، التدريب لمدة 15 حقبة مع تراكم التدرج (8 خطوات)، تطبيق dropout = 0.15 وتقليل الوزن = 0.01، تمكين تنعيم التسمية = 0.1. عدل المعاملات الفائقة في train_config.json.

لتقييم الأداء، قم بحساب ROUGE (1,2, L) باستخدام مكتبة rouge_score، وBLEU باستخدام nltk.translate.bleu_score، وBERTScore باستخدام حزمة bert_score. تقييم Legal-SemSim باستخدام نصوص التشابه الدلالي القائمة على الأنطولوجيا وF1 الكيان باستخدام SpaCy وتعليقات ذهبية. تم تسجيل كفاءة وقت التشغيل (ثوان لكل طي)، وتمت مقارنة الملخصات مع المراجع الذهبية. طلب من خبيرين قانونيين مراجعة صحة الوقائع وتم حفظ الملخصات النهائية المعتمدة للنتائج. اتباع هذا البروتوكول سينتج ملخصات قانونية خاصة بالمجال تحافظ على الاستدلال القانوني، والدقة الواقعية، وأمانة الاستشهادات.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

مقاييس التقييم

تم تقييم النظام باستخدام مجموعة شاملة من المقاييس، كما هو موضح في الجدول 6.

الفئة المتريةالمقاييس المحددةوصف
التداخل المعجميروج-1، روج-2، روج-إلالتداخل بين الملخصات المولدة والمرجعية ...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

تم تحقيق فعالية تعزيز CBR في تصميم المحول متعدد المراحل من خلال إنشاء معيار أداء جديد في تلخيص نصوص المجال القانوني. تشير النتائج إلى تحسن كبير في درجات ROUGE بمقدار 78.4 ROUGE-1، 54.8 ROUGE-2، و75.3 ROUGE-L، ومقاييس خاصة بالمجال بنسبة 98٪ من الاعتراف بالكيانات القانونية F1. ولمزيد من التحقق من مساهمة كل مكون، تم تقديم خطوط أساس تعتمد على CBR فقط وخطوط التحويل فقط. أظهر الأساس فقط لإعادة التأهيل القائم دقة واقعية قوية والحفاظ على المنطق، لكنه افتقر إلى الطلاقة والتغطية الشاملة. وعلى العك...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

يعلن المؤلفون أنه لا توجد تضارب محتمل في المصالح مرتبط بمحتوى هذه الدراسة.

شكر وتقدير

يعبر المؤلفون عن امتنانهم العميق لقسم علوم وهندسة الحاسوب، مؤسسة كونيرو لاكشمايا التعليمية (جامعة معروفة)، حيدر أباد، تيلانجانا، الهند، لتوفير المرافق الحاسوبية والبنية التحتية البحثية الأساسية لهذا العمل. نقدم شكرا خاصا للخبراء القانونيين والمتخصصين في المجال الذين ساهموا في التعليقات وتقييم النموذج القانوني المستخدم في هذه الدراسة.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
أجهزة وحدة المعالجة المركزيةAMD EPYC 7742 (64 نواة، 2.25 جيجاهرتز)وحدة واحدةAMD
الإطاربايتورش2https://pytorch.org
أجهزة وحدة معالجة الرسوماتNVIDIA A100 (40 جيجابايت)وحدتانشركة إنفيديا
إطار الرسم البيانيDGL1.1https://www.dgl.ai
المكتبةمحولات الوجه العناق4.32.0https://huggingface.co/transformers
المكتبةسباسي3.6https://spacy.io
المكتبةNLTK3.8.1https://www.nltk.org

المراجع

  1. Powers, D. M. Evaluation: From precision, recall and F-measure to ROC, informedness, markedness & correlation. J Mach Learn Technol. 2 (1), 37-63 (2011).
  2. Eisenberg, M. A. Legal Reasoning. , Cambridge University Press. (2022).
  3. Lin, C. Y. ROUGE: A Package for Automatic Evaluation of Summaries. Text Summarizat Branches Out. , 74-81 (2004).
  4. Lewis, M., et al. Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension. Proc ACL. , 7871-7880 (2020).
  5. Hadi, A. Leveraging Transformer-Based Language Models to Bridge the Gap Between Language and Specialized Domains. [Doctoral Dissertation]. , Institut Polytechnique de Paris. (2024).
  6. Waterworth, K. Model-Agents of Change: A Meta-Cognitive, Interdisciplinary, Self-Similar, Synergetic Approach to Neuro-Symbolic Semantic Search and Retrieval Augmented Generation. [Master's Thesis]. , Miami University. (2024).
  7. Zhang, J., Zhao, Y., Saleh, M., Liu, P. PEGASUS: Pre-training with Extracted Gap-sentences for Abstractive Summarization. Proc ICML. , 11328-11339 (2020).
  8. Li, Z., et al. When object detection meets knowledge distillation: A survey. IEEE Trans. Pattern Anal Mach Intell. 45 (8), 10555-10579 (2023).
  9. Chen, Y., et al. Citation Network Analysis for Legal Reasoning. J AI Law. 28 (2), 145-170 (2020).
  10. Raffel, C., et al. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. J Mach Learn Res. 21 (140), 1-67 (2020).
  11. Reimers, N., Gurevych, I. Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proc EMNLP. , 3982-3992 (2019).
  12. Gunning, D., Aha, D. DARPA's explainable artificial intelligence (XAI) program. AI Mag. 40 (2), 44-58 (2019).
  13. Mihalcea, R., Tarau, P. TextRank: Bringing Order into Texts. Proc EMNLP. , 404-411 (2004).
  14. Sharma, G., Sharma, D. Automatic text summarization methods: A comprehensive review. SN Comput Sci. 4 (1), 33(2022).
  15. Xu, J., Croft, W. B. Neural Networks for Text Classification. Inf Retr J. 20 (3), 259-289 (2017).
  16. Ghosh, S., Dutta, A., Das, A. Indian Legal Text Summarization: A Text Normalisation-based Approach. arXiv. , (2022).
  17. Silver, D., et al. Mastering the Game of Go with Deep Neural Networks and Tree Search. Nature. 529, 484-489 (2016).
  18. Chalkidis, I., et al. LexGLUE: A benchmark dataset for legal language understanding in English. Proc ACL. 60 (1), 4310-4330 (2022).
  19. Ashley, K. Artificial Intelligence and Legal Analytics. , Cambridge University Press. (2017).
  20. Chalkidis, I., Fergadiotis, M., Aletras, N. LEGAL-BERT: The Muppets Straight Out of Law School. Proc ACL. , 2898-2910 (2020).
  21. Vaswani, A., et al. Attention Is All You Need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  22. Baker, A. R., Slack, F. J. ADAR1 and its implications in cancer development and treatment. Trends Genet. 38 (8), 821-830 (2022).
  23. Casola, S., Lavelli, A. Summarization, simplification, and generation: The case of patents. Expert Syst. Appl. 205, 117627(2022).
  24. Valente, A. Legal Knowledge Engineering. , IOS Press. (1995).
  25. Katz, D. M., et al. Natural language processing in the legal domain. arXiv. , (2023).
  26. Gilpin, L., et al. Explaining Explanations: An Approach to Interpretable AI. Proc ICML. 70, 89-98 (2018).
  27. Davoodijam, E., Alambardar Meybodi, M. Evaluation metrics on text summarization: comprehensive survey. Knowl Inf Syst. 66 (12), 7717-7738 (2024).
  28. Schauer, F. Precedent. , Stanford Encyclopedia of Philosophy. (1989).
  29. Bengio, Y., Louradour, J., Collobert, R., Weston, J. Curriculum Learning. Proc ICML. , 382-389 (2009).
  30. Vrandecic, D., Krötzsch, M. Wikidata: A Free Collaborative Knowledge Base. Commun ACM. 57 (10), 78-85 (2014).
  31. Chu, Y., Ye, M., Qian, Y. Fine-Grained Image Recognition Methods and Their Applications in Remote Sensing Images: A Review. IEEE J Sel Top Appl Earth Obs Remote Sens. 17 (6), 1234-1250 (2024).
  32. Vue, Z., et al. Stories from Hmong in STEMM. Trends Genet. 39 (8), 587-592 (2023).
  33. Begum, N., Goyal, A. Analysis of Legal Case Document Automated Summarizer. Proc ISPCC. , 533-538 (2021).
  34. Surden, H. Ethics of AI in Legal Practice. J Legal Ethics. 32 (2), 145-163 (2019).
  35. Bench-Capon, T. J. M., Sartor, G. Ontology-Based Legal Reasoning. Artif Intell Law. 11 (2), 125-157 (2003).
  36. Liu, Y. Fine-tune BERT for Extractive Summarization. arXiv. , (2019).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

الوسوم

ROUGE