Для просмотра этого контента требуется подписка на JoVE. Войдите или начните свой бесплатный пробный период.

Исследовательская статья

Рассуждение на основе кейса с глубоким обучением для гибридного подхода к суммаризации юридического текста

491 просмотров

DOI:

10.3791/69287

12 декабря 2025 г.

В этой статье

Краткое содержание

Этот протокол интегрирует Case-Based Reasoning (CBR) с многоступенчатыми моделями трансформаторов для обобщения юридических текстов. Он предварительно обрабатывает юридические дела, находит схожие прецеденты, адаптирует структуры рассуждений и генерирует точные, последовательные резюме. Области применения включают юридические исследования, анализ суждений и системы поддержки принятия решений, обеспечивающие фактическую согласованность и точность рассуждений в зависимости от области.

Аннотация

Юридические документы известны своей длиной и сложностью, что фактически делает невозможным для юристов и исследователей быстро выявлять и извлекать релевантную информацию. Здесь представлен гибридный подход, который превосходит предыдущие экстрактивные и абстрактные базовые показатели как по лексическому перекрытию, так и по специфическим предметным показателям рассуждения, использующий Case-Based Reasoning (CBR) для юридических текстов и конкретные методы глубокого обучения для краткого представления, что позволяет точно и эффективно создавать резюме. Используя более крупный набор данных из 4 968 судебных дел от Kaggle, была построена многоступенчатая архитектура трансформаторов на основе общей модели поиска CBR для получения кратких резюме вместе с CBR для понимания контекста. Система оценивалась по прогнозированию юридических результатов и согласованности резюме, результаты показали превосходство существующих экстрактивных и абстрактных методов, и обучена предлагаемая модель до 98% точности юридических лиц, а также на 46% более последовательный юридический корпус (с базовым уровнем) по сравнению с современными методами, по сравнению с использованием баллов ROUGE выше предыдущих типов на 23%. В данном исследовании представлена гибридная рамка суммирования юридических текстов, интегрирующая CBR с моделями на основе трансформаторов. Обширные эксперименты показали более высокие результаты по сравнению с недавними базовыми показателями, достигая более высокой фактической точности, точности рассуждений и сохранения юридических лиц.

Введение

Обширная юридическая документация потребовала современных методов своевременного получения важных данных. Краткое содержание юридических текстов важно для повышения доступности и принятия решений. Юридические заключения, решения и прецеденты настолько многословны, что судьям, практикам и исследователям сложно их осмыслить, что приводит к разработке автоматизированных методов для точного и эффективного обобщения этих документов. 1.

Несмотря на современные результаты в более общих делах, существующие методы резюме с трудом отражают уникальную сложность и юридический жаргон, характерные для юридических документов. Простое выбор верхних предложений без перестановки только на основе лог-вероятности даёт хорошие оценки ROUGE, но проигрывает контексту и полной семантике. Абстрактные подходы используют генерацию естественного языка для составления материала, чтобы захватить контекстуальные нюансы, но при этом им сложно сохранить логический процесс мышления и юридическую обоснованность судебных дел2. Предлагаемый метод особенно эффективен для длинных судебных материалов, содержащих структурированные разделы (например, факты, аргументы, прецеденты и решения). Он отлично справляется с корпусами с явными ссылками и стандартизированным форматированием, например, апелляционными или решениями Верховного суда. Однако производительность может ограничиваться шумными или неструктурированными наборами данных (например, отсканированные PDF-файлы с ошибками OCR или документы без чёткой риторической сегментации). Таким образом, этот метод лучше всего подходит для хорошо структурированных цифровых репозиториев, где доступны как лингвистические, так и цитируемыеособенности 3.

Для создания резюме используется предложенная более совершенная гибридная структура, сочетающая рассуждение на основе падежа (CBR) с продвинутой обработкой естественного языка (NLP). Он использует многоступенчатую архитектуру трансформатора с юридическими слоями внимания, специфическим для конкретной области, и предлагает модуль рассуждения между документами. CBR позволяет системе загружать аналогичные прошлые дела, которые можно использовать для анализа всех контекстуальных переменных по юридическимпричинам 4. Предлагаемая модель достигла превосходной точности по сравнению с современными базовыми показателями, что подтверждается количественными приростами по метрикам ROUGE, BLEU и Legal-SemSim, а также подтверждено экспертной оценкой на людях. Например, предлагаемая модель превзошла Legal-BART и PALM-Law на 15%-20% по точности цепочки рассуждения. Использование общих представлений и сложных подходов добавляет знания, специфичные для конкретного случая, наряду с нейронной суммаризацией и предсказанием, на 98% точности для признания юридических лиц и на 97% для поиска прецедентов, значительно превосходя предыдущиеработы 5.

Связанные работы

Резюме юридических текстов, являющаяся подобластью обработки естественного языка (NLP), привлекает всё больше внимания из-за растущего спроса на эффективную обработку юридических документов, включая судебные заключения, законы и судебную практику. Основная задача заключается в сохранении семантической целостности, юридического рассуждения и контекста, специфического для предмета, в сгенерированных резюме. Предыдущие исследования охватывают экстрактивные, абстрактные и гибридные подходы, с недавним акцентом на нейронные архитектуры, адаптированные кдомену 6.

Обзор литературы

Резюме юридических текстов эволюционировало как критически важная область в области обработки естественного языка, вызванная острой потребностью сделать объёмные, сложные юридические документы доступными и применимыми. Литература по этой области отражает траекторию от поверхностных экстрактивных моделей к сложным гибридным архитектурам, стремящимся сбалансировать беглость, фактическую целостность и юридическую логику. Ранние усилия были сосредоточены на методах экстрактивного резюме, которые приоритизировали важность предложений на основе лексического сходства и статистических закономерностей. Хотя эти подходы, такие как TextRank и LexRank, эффективны при выборе юридически значимых фрагментов, они часто игнорируют более глубокую семантическую структуру и не охватывают риторические и аргументативные слои, необходимые для юридическогорассуждения 6. Поскольку юридические тексты существенно отличаются от общих корпусов из-за своей жёсткой семантики и специфических для каждой области выражений, эти модели приводили к кратким изложениям, которым не хватало связности и контекстуальной адекватности. С появлением заранее обученных трансформаторных архитектур внимание исследований сместилось на абстрактные методы. Модели, такие как BART, T5 и PEGASUS, начали демонстрировать способность синтезировать резюме с использованием шаблонов генерации изученных языков. Их юридические адаптации, такие как LegalBART и LegalPEGASUS, ещё больше усовершенствовали производительность, включив специализированный юридический корпус предобучения7. Однако абстрактные методы продолжали страдать от ограничений в согласованности рассуждений и проблемах объяснимости, особенно проблематичных в юридических условиях, где даже незначительные отклонения от фактов могут привести к неправильному толкованию.

Гибридные модели возникли в ответ на эти недостатки, включающие символическое мышление или стратегии поиска для улучшения контекстуального обоснования. Важным направлением стала интеграция CBR, где знания из прецедентных дел использовались для контекстуализации процесса генерации резюме. Эти модели стремятся сохранить фактическую строгость экстрактивных методов, одновременно генерируя лингвистически согласованные и юридически обоснованные результаты8.

Последние тенденции делают акцент на многоступенчатых архитектурах, сочетающих распознавание юридических лиц, междокументное рассуждение и риторический разбор ролей, что свидетельствует о переходе к целостному пониманию документов, а не к простому обобщению. Исследования теперь всё чаще учитывают согласование юридических онтологий, специфические для предмета метрики оценки (например, Legal-SemSim) и ориентированную на человека оценку для оценки качества и удобства использования резюме дляюристов 9.

Недавние опросы, такие как Exploring LLMs Applications in Law в 2023 году и Exploring the Use of LLM in the Italian Legal Domain в 2024 году, подчёркивают растущую роль крупных языковых моделей (LLM) в автоматизации юридических рассуждений, суммирования и поиска задач10. Эти работы подчёркивают не только способность LLM, таких как GPT-4, PaLM и LLaMA отражать контекстуальные нюансы юридического дискурса, но и задачи адаптации доменов, объяснимости и фактическойсогласованности 11. Гибридные системы, интегрирующие генерацию с дополнительной генерацией (RAG) или CBR с LLM, всё активнее исследуются, чтобы объединить сильные стороны прецедентного обоснования с генеративной беглостьютрансформаторов 6. Позиционируя работу в рамках этой тенденции, предложенная многоступенчатая гибридная модель расширяет рамки, дополняемые предыдущим поиском, явно кодируя цепочки юридических рассуждений, при этом сохраняя согласованность через абстрактное суммирование на основе трансформаторов.

Несмотря на значительный прогресс, сохраняется пробел в моделях, способных синтезировать фактические, логически структурированные и соответствующие домену юридические резюме, сохраняя при этоминтерпретируемость 12. Настоящая работа решает этот пробел, предлагая многоступенчатый гибридный подход, основанный на юридическом CBR и глубокой нейронной архитектуре, предлагая модель, которая одновременно точна и практически применима.

Методы экстракционного суммирования

Термин экстракционное резюме используется для методов, которые извлекают и соединяют наиболее информативные предложения из документа. Алгоритмы на основе графов, например,TextRank 13 иLexRank 14, — это традиционные подходы, которые ранжируют предложения по их важности. Хотя такие подходы вычислительно осуществимы, они обычно испытывают трудности со сложным юридическим рассуждением иаргументацией 8. С появлением предварительно обученных языковых моделей методы на базе BERT, такие какBERTSUM 8 , показали значительные улучшения. BERTSUM тонко настраивает вложения BERT для экстракционного резюме на уровне предложений, лучше отражая контекстуальные нюансы, чем статистическиемодели 9. Юридические адаптации, такие как Legal-BERTSUM, ещё больше усовершенствовали производительность, включая юридические корпусы, что позволило улучшить распознавание юридических терминов и выбор предложений. Тем не менее, экстрактивные методы ограничены в реконструкции аргументативного потока или цепочки юридических рассуждений, особенно когда предложения взаимозависимы или ссылкинеявны 15.

Абстрактные подходы к суммаризации

Абстрактное резюме генерирует новые фразы и предложения, перефразирующие исходное содержимое, часто с использованием архитектур кодировщика и декодера. МодельBART 4 иPEGASUS 7 являются ведущими примерами предварительно обученных моделей последовательности к последовательности, применяемых к обобщению общего назначения. Они были адаптированы для юридической сферы путём доработки юридических корпусов — в результате появились такие модели, как Legal-BART и LegalPEGASUS 16,17. Эти модели дают более плавные и человеческие резюме и лучше передают контекстуальный смысл, чем экстрактивныеподходы 18.

Однако их применение в юридическим резюме вызывает сложности. Абстрактные модели часто испытывают трудности с фактической согласованностью и сохранением юридической семантики. Неправильное толкование юридических положений или упущение ключевых юридических лиц может сделать сводящее резюме вводящим взаблуждение 19. Кроме того, модели генерации нейронного текста обычно непрозрачны, что вызывает вопросы объяснимости и проверяемости, которые имеют решающее значение в юридических сферах.

Гибридные модели суммирования

Чтобы использовать сильные стороны обеих парадигм, гибридные модели суммаризации интегрируют экстрактивные и абстрактные компоненты. Одной из ранних стратегий было использование экстрактивных модулей для выбора кандидатных предложений, которые затем уточняются абстрактным декодером. В последнее время архитектура трансформаторов была объединена с модулями, наполненными знаниями, для улучшения юридическогопонимания 5.

CBR стала перспективной гибридной стратегией. Уотерворт стал пионером в использовании предыдущих случаев для принятия текущих решений, а его интеграция с нейронными моделями позволяет семантически обогащать с помощью аналогическогомышления 6. В юридическом резюме сочетание CBR с трансформаторами позволяет как контекстуальное повторное использование, так и абстрактный синтез. Такие модели, как BART+CBR, интегрируют правовой контекст, основанный на поиске, с генеративными механизмами, обеспечивая повышенную согласованность и юридическуюзначимость 20.

Предлагаемая архитектура Multistage + CBR основывается на этом направлении, встраивая цепочки рассуждения, специфичные для каждой области, в конвейер суммирования. Он оснащён иерархическими трансформаторными блоками, кросс-документным вниманием и усиленными CBR уровнями поиска, специально адаптированными для юридических приложений. Такой многоуровневый дизайн способствует как тонкому пониманию содержания, так и сохранению структуры намакроуровне 21.

Юридические сложности и аспекты

Юридические документы обладают уникальными структурными и лингвистическими особенностями, включая иерархическое форматирование, перекрёстные ссылки на прецеденты, статутные цитаты и терминологию, специфичную для предметнойобласти 22. Модели суммаризации, следовательно, должны учитывать не только синтаксические и семантические сложности, но и уважать логическую согласованность и правовую прогрессиюаргументов 23. Эффективное обобщение в этом контексте зависит от точного признания юридического лица, сохранения структуры рассуждений и интерпретации риторических ролей, таких как факты, аргументы и суждения.

Юридические онтологии и сети цитирования были использованы для улучшения понимания домена. Например, интеграция структурированных юридических баз знаний во время обучения моделей показала улучшение связывания юридических лиц и согласованность цитирования24. Эти усилия способствуют обобщению моделей, которые лучше соответствуют ожиданиямюристов 25.

Ещё одна сложность — это интерпретируемость. В юридических условиях результат должен быть аудифицируемым и интерпретируемым. Поэтому всё чаще исследуются объяснимые фреймворки ИИ (XAI), такие как LIME и SHAP, для обоснования решений по суммированию, хотя интеграция с крупномасштабными моделями остаётся постоянной исследовательскойзадачей 26.

Метрики оценки в юридическом резюме

Стандартные метрики суммаризации, такие как ROUGE8,BLEU 27 и METEOR, обычно используются для оценки лексического перекрытия. Однако эти меры недостаточны для достижения семантической точности, юридической последовательности и аргументативной связности.

Недавние исследования вводят специфические для предмета метрики, такие как Legal-SemSim, которая включает юридические онтологии для оценки семантического сходства, и точность цепочки рассуждений, оценивающая сохранение логического потока и валидностьвыводов 28. Экспертная оценка на людях остаётся незаменимой, особенно для оценки юридической корректности, согласованности и применимости. Межаннотационное соглашение с использованием метрик, таких как Kappa Флейса, гарантирует надёжность качественныхоценок 29.

Последние достижения и будущие направления в юридической суммизации

Исследования юридического резюме движутся к более надёжным, контекстно-осознанным и объяснимым системам. Гибридные символо-нейронные архитектуры, интегрирующие рассуждение на основе правил с моделями трансформеров, набирают популярность. Эти системы сохраняют интерпретируемость логических подходов, одновременно используя возможности к обобщению глубокогообучения 28.

Многоязычное юридическое резюме — ещё одна новая рубеж, затрагивающая глобальный характер юридических текстов и процедур30. Временное мышление, необходимое для понимания временно-зависимых юридических последовательностей, и моделирование аргументативного дискурса также находятся в стадииисследования 9.

Кроме того, достижения в области контрастивного обучения и обучения по учебным программам используются для улучшения обобщения моделей в различных правовых областях17. Постепенно увеличивая сложность задач и дифференцируя мелкозернистые семантические классы, эти методы повышают устойчивость модели в реальныхсценариях 31.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Этот протокол использует общедоступные легальные наборы данных. Не использовались конфиденциальные или конфиденциальные данные. Исследование соответствует институциональным этическим нормам по использованию юридических корпусов в исследованиях (Koneru Lakshmaiah Education Foundation (считается университетом), Хайдарабад, Телангана, Индия, No одобрения: KLEF/CS/2024/IRB-017). В исследовании используется набор данных из 4 968 юридических дел, каждое из которых содержит инклюзивные аннотации. Таблица 1 показывает описание набора данных.

precedent_citationsСтруктурированные ссылки на прецедентные дела
reasoning_chainsАннотированные последовательности логического рассуждения

Таблица 1: Описание атрибута набора данных.

Набор данных для исследования

После предварительной обработки набор данных нормализуется для стандартизации результатов. Объём учебников по делу варьируется от 1 000 до 5 000 слов, что подходит для обучения и оценки. Мы собрали результаты дел в первичные метки в соответствии с их частотой в наборе данных, что позволило нам исследовать результаты суммирования в различных юридических контекстах. Аннотация проводилась командой из пяти юристов, включая трёх практикующих юристов и двух докторов, специализирующихся на юридической информатике. Каждый случай был независимо аннотирован двумя экспертами, а конфликты разрешался старшим аннотатором. Схема аннотаций включала юридические лица, прецедентные цитаты и цепочки рассуждения. Согласование между аннотаторами измерялось с помощью Каппы Флейса (κ = 0,82), что указывает на сильную согласованность между аннотаторами. Этот процесс обеспечивал как юридическую достоверность, так и воспроизводимость набора данных.

Распределение наборов данных

Набор данных включает дела, содержащие различные юридические домены, как показано в Таблице 2.

Юридическая сфераКоличество делПроцент
Договорное право1,27825.70%
Интеллектуальная собственность1,05321.20%
Конституционное право51210.30%
Административное право4328.70%
Уголовное право3086.20%
Деликтное право2194.40%
Другое/Разное1,16623.50%

Таблица 2: Дела, охватывающие различные правовые области.

Распределение исходов по делам по набору данных показано в таблице 3.

Итоги делаСчитатьПроцент
Привел2,46049.20%
Упоминается85517.10%
Следовал4719.40%
Прикладной4478.90%
Обдуманный3537.10%
Другие результаты3828.30%

Таблица 3: Распределение исходов по делам по набору данных.

Таким образом, он подтвердил разумное представление по всем доменам при обучении, валидации и разделении тестов с использованием стратифицированной выборки для предотвращения специфических искажений. Набор данных был разделён на обучающие (80%), валидационные (10%) и тестовые (10%).

Распределение длины текста

Анализ распределения длины текста представлен в Таблице 4.

Диапазон длины (слова)СчитатьПроцент
До 500 лет4659.40%
500-1,0001,35927.40%
1,000-5,0002,69854.30%
5,000-10,0003236.50%
Более 10 0001543.10%

Таблица 4: Анализ распределения длины текста.

Такое распределение подчёркивает разнообразие длины документов, большинство из которых относятся к среднеобъёму (1 000–5 000 слов), что представляет собой соответствующую сложность для методов обобщения.

Улучшенная предобработка данных

Конвейер предварительной обработки был основан на недавних исследованиях влияния предобработки на юридические задачи НЛП на основе трансформаторов. Чалкидис и соавт. демонстрируют, что доменно-ориентированная токенизация и нормализация цитирования значительно повышают точность суммаризации вдальнейшем сегменте 30. Аналогично, Боммарито и Кац показывают, что выборы предварительной обработки, особенно нормализация сущности, напрямую влияют на производительность трансформаторов в юридическойсуммаризации 32. Основываясь на этих инсайтах, конвейер использовал токенизацию, ориентированную на разделы, нормализацию юридических цитирований и риторический разбор ролей для максимизации контекстуальной когерентности. Был разработан новый конвейер предварительной обработки, объединяющий общие методы предварительной обработки и специфичные для предмета техники для получения высококачественного юридического текста и сначала фильтрации нескольких случаев пустых или очень коротких падежей, чтобы обеспечить целостность данных. Далее была проведена нормализация входов, где применялись законные правила токенизации для обеспечения удобствавхода 33. Ключевые сущности были извлечены с помощью индивидуальной высокоэффективной модели признания юридического лица (LER) (оценка F1 98%), а для понимания структурных элементов использовались методы анализа дискурса. Для улучшения анализа прецедентов был введён этап построения графа цитат. Другие этапы предварительной обработки являются доменно-специфичными для парсеров регулярных выражений, что подтверждает, что их входные данные точно соответствуют очень строгим форматам стандартизированных юридических ссылок. Для иерархических структур документов были применены токенизаторы с учётом разделов, а для каждого юридического текста был добавлен тонко настроенный классификатор RoBERTa с риторическими ролями, такими как факты, аргументы и решения. Этот более широкий конвейер позволяет нам легко дополнить последующие задачи, такие как поиск юридических текстов, рассуждения и резюме.

Продвинутый модуль рассуждения на основе кейсов

В исследовании впервые представлено расширенное применение современной системы рассуждения на основе кейса (CBR), которая может использовать семантическое сходство и знания о правовой области для предоставления релевантных и сопоставимых дел с точностью поиска 98% на основе эталонного набора данных. Enhanced Case Representation кодирует каждое дело гибридным вектором, который сочетает контекстуализированные эмбеддинги — созданные с помощью доменно-ориентированной модели BERT на юридическом тексте — со структурными вложениями, отражающими позицию элементов в документе, субъектно-осознанными вэмеддингами, подчеркивающими юридические отношения, присутствующие в делах, и вэмеддингами сети цитирования, отражающими, как прецеденты связаны между собой. Многоступенчатый поиск кейсов действует как многоступенчатый подход: сначала выполняется поиск по приблизительному ближайшему соседу (ANN) для получения кандидатов в семя, применяется перекрёстное внимание для получения оптимальных совпадений от кандидатов и использование доменно-специфичной функции скоринга и ансамблевого оценивания релевантности для выбора лучших вариантов. Во время этапа адаптации по продвинутому делу (ACAS) система извлекает шаблоны рассуждений с помощью шаблона представления на основе графов, который фиксирует логические зависимости между юридическими аргументами. Затем он определяет релевантность прецедента с помощью анализа цитирования, взвешивая каждый компонент дела с учетом его контекстуальной важности для запроса. Наконец, структура аргументации поддерживается с использованием методов дискурса, основанного на парсинге, чтобы обеспечить сохранение логического потока юридического рассуждения. Последний модуль, модуль интеграции знаний, способствует поиску через юридические онтологии, фиксирует временные прецедентные отношения и сохраняет действительность в сложных цепочках юридического рассуждения. Предлагаемая система CBR обеспечивает 98% правильного уровня извлечения, что выше, чем ранее сообщаемые показатели (например, LexGLUE, 92%-95%) для извлечения и адаптации судебных дел.

Архитектура многоступенчатых трансформаторов

Основываясь на перечисленных выше ссылках, исследование предлагает метод искусственной нейронной сети на основе многоступенчатой архитектуры на основе трансформаторов, который использует лучшие элементы всех упомянутых алгоритмов для улучшения автоматизированной обработки, рассуждений и суммирования юридических документов. Этап понимания документов использует кодировщик BERT, адаптированный к юридической сфере, иерархические механизмы внимания и модули для распознавания юридических лиц, извлечения отношений и обработки графов цитирования для получения глубокого структурного и контекстуального понимания юридических документов. Этап рассуждения по документам помогает в рассуждении на основе кейса, связывая запросы с полученными делами через механизм перекрёстного внимания в виде извлечения и валидации цепочек юридических рассуждений, модели применения прецедентов и сохранения структуры аргументации. SBERT и Bi-LSTM использовались на уровне формирования вложения предложений, а пользовательский декодер с ограничениями юридической области использовался на уровне генерации абстрактного резюме для точного поддержания юридических терминов, фактической согласованности и иерархии в резюме в соответствии с требованиями юридического письма. Разделяя процесс на разные этапы, можно обеспечить сохранение фактической согласованности, контекстной согласованности и точности цитирования. Предлагаемый процесс обучения модели показан в таблице 5.

ГиперпараметрЦенность
Размер партии32
Скорость обучения3e-5 с разминкой
Эпох15
Максимальная длина последовательностиЖетоны 2048 года
Процент отсева0.15
Накопление градиентов8 шагов
Шаги разминки1000
Снижение веса0.01
Сглаживание маркировки0.1

Таблица 5: Процесс обучения моделей.

Для повышения производительности и обобщения модели мы внедрили несколько продвинутых методов обучения, которые подробно рассмотрены. Он использовал обучение по учебной программе для постепенного увеличения сложности задач, позволяя модели приобретать базовые навыки перед тем, как браться за более сложные случаи. Проводя эксперименты с обучающим набором данных, исследователь подтвердил, что тонкая настройка успешно дорабатывает семантические представления, помогая модели различать очень похожие и разнородные данные, тем самым расширяя понимание набора данных. Что касается многозадачного обучения, суммирование сочеталось с вспомогательными задачами, например, классификацией или признанием последствий, что способствовало более всестороннему пониманию правовой сферы. Передача важных знаний через дистилляцию знаний, сохраняющая высокоуровневые знания без увеличения модели, уже была перенесена в более крупные доменно-ориентированныемодели 7.

Многоступенчатая гибридная методология суммирования прав

Для операционализации предлагаемой структуры представлен пошаговый алгоритм 1, представляющий многоступенчатую гибридную методологию юридического резюме.

Алгоритм 1:
Алгоритм: Многоступенчатое гибридное судебное резюме
Ввод: Налет данных по правовому делу D с полями {case_text, legal_entities, citations, outcome}
Выпуск: Резюме S для каждого дела с сохранением юридического обоснования
Начинать
Этап 1: Предварительная обработка данных
Для каждого случая в D:
Нормализуйте текст, чтобы убрать шум и унифицировать форматирование.
Применяйте признание юридического лица (LER) для извлечения юридических лиц.
Постройте график цитирования на основе упомянутых прецедентов.
Токенизируйте текст с помощью юридических правил токенизации, учитывающих домен.
ЗАМЕТКА: Если входный корпус содержит шумные или неполные тексты, выполните дополнительную нормализацию, такую как фильтрация стоп-вордов или сегментация разделов.

Этап 2: Извлечение по случаям
Для каждого случая:
Генерировать контекстные вложения с помощью доменно-адаптированного кодировщика BERT.
Генерируйте структурные вложения на основе положения сечения.
Генерируйте вэмеддинги цитируемой сети.
Получите аналогичные прошлые случаи с помощью поиска Approximate Nearest Neighbor (ANN).
Доработали полученные случаи с помощью перекрёстного внимания и ансамблевого ранжирования релевантности.

Этап 3: Адаптация кейса
Для каждого полученного случая:
Извлекайте шаблоны рассуждений с помощью анализа дискурса.
Определите релевантные юридические аргументы и присваивайте им вес, исходя из их важности.
Сохраняйте поток аргументации во время адаптации.
ЗАМЕТКА: Если прецедентные дела содержат нерелевантные или противоречивые аргументы, исключайте их при адаптации.

Этап 4: Многоступенчатое суммирование на основе трансформаторов
Для каждого входного случая и его адаптированных прецедентов:
Кодировать входный случай с помощью кодировщика BERT в юридической области с иерархическим и сущностным вниманием.
Применяйте междокументное рассуждение между запросом и полученными случаями.
Кодировать предложения с использованием SBERT и Bi-LSTM для улучшенных контекстных вложений.
Декодировать резюме с помощью декодера с ограничением по домену для сохранения фактической и юридической точности.

Этап 5: Вывод и валидация
Для каждого сгенерированного КРАТКОГО АННОТАЦИИ:
Проверьте сформированное резюме на согласованность, фактическую корректность и достоверность юридического рассуждения.
Вернуть окончательное резюме S.
ЗАМЕТКА: Если требуется экспертная валидация, включите дополнительный этап проверки с участием человека в цикле перед развертыванием.
Конец

Для настройки вычислительной среды был установлен Python 3.10. Для установки нужны библиотеки: PyTorch (v2.0), Hugging Face Transformers (v4.32.0), SpaCy (v3.6), NLTK (v3.8.1), NetworkX (v3.1), DGL (v1.1). Поддержка видеокарты была настроена (два GPU по 40 ГБ памяти каждая). См. таблицу материалов для точных версий и источников.

Набор данных по судебным делам (≈ 5 000 дел) был скачаван из указанного источника, и каждое дело проверялось с включением полей: факты, аргументы, цитаты и результат судебного решения. Храните документы в формате UTF-8 в открытом тексте. Было удалено пустые или короткие тексты с помощью скрипта на Python (preprocess.py). Были проведены устранение шума и унификация форматирования текста. Токенизация в юридических доменах применялась с помощью SpaCy (spacy.load("en_core_legal_sm")). Распознавание юридических лиц осуществлялось с использованием тонко настроенной модели BERT (transformers.pipeline("ner", model="legal-bert-ler")). Был построен граф цитирования с помощью NetworkX (nx. DiGraph()), связывая узлы по ссылающимся прецедентам. Если включались документы на основе OCR, запускался дополнительный скрипт очистки текста (ocr_clean.py.

Контекстное вложение генерировалось с помощью доменно-специфичной модели BERT (bert-legal), а вложения цитирования — с помощью графовых энкодеров DGL. Приблизительный поиск по ближайшему соседу выполнялся с помощью FAISS (faiss. IndexFlatIP). Оценка перекрёстного внимания применялась с помощью модуля PyTorch (CrossAttentionScorer), а полученные результаты ранжировались по ансамблевому взвешиванию контекстного и сходства цитирования. Структура дискурса была проанализирована с помощью риторического классификатора ролей (роберта-юридическая риторика), а соответствующие шаблоны рассуждений извлекались путём согласования риторических ролей. Веса присваивались сегментам аргумента на основе частоты и силы цитирования. Исключать противоречивые или нерелевантные прецеденты.

Документы кодировались с помощью доменно-адаптированного кодировщика BERT, и применялись иерархические модули внимания (реализованные в hierarchical_encoder.py). Для вложения предложений использовались SBERT и Bi-LSTM (пакет преобразователей предложений). Абстрактные резюме декодировались с помощью ограниченного декодера (legal_decoder.py). Ограничьте максимальную длину последовательности 2048 токенами. Для обучения модели установите размер пакета = 32, скорость обучения = 3e-5, тренируйте для 15 эпох с накоплением градиентов (8 шагов), примените dropout = 0.15 и вес decay = 0.01, включите сглаживание меток = 0.1. Модифицировать гиперпараметры в train_config.json.

Для оценки производительности вычислите ROUGE (1,2, L) с помощью rouge_score библиотеки, BLEU — nltk.translate.bleu_score, а BERTScore — bert_score пакете. Оценивайте Legal-SemSim с использованием скриптов семантического сходства на основе онтологий и сущности F1 с использованием аннотаций SpaCy и золотого. Эффективность выполнения (секунды за фолд) фиксировалась, а сводки сравнивались с золотыми справочниками. Двух юридических экспертов пригласили проверить фактическую корректность, и были сохранены окончательные валидированные резюме результатов. Следование этому протоколу будет создавать специализированные юридические резюме, которые сохраняют юридическую обоснованность, точность фактов и достоверность цитирования.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Метрики оценки

Система оценивалась с использованием комплексного набора метрик, показанных в таблице 6.

...
Метрическая категорияСпецифические метрикиОписание
Лексическое пересечениеROUGE-1, ROUGE-2, ROUGE-L

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Эффективность расширения CBR в конструкции многоступенчатого трансформатора была достигнута благодаря установлению нового стандарта производительности в резюме текста в юридической области. Результаты свидетельствуют о значительном улучшении показателей ROUGE на 78,4 ROUGE-1, 54,8 ROUGE-2 и 75,3 ROUGE-L, а также в доменно-специфических показателях с 98% признания юридических лиц F1. Для дальнейшей проверки вклада каждого компонента были введены базовые линии только для CBR и только для T...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Авторы заявляют, что нет потенциальных конфликтов интересов, связанных с содержанием этого исследования.

Благодарности

Авторы выражают искреннюю благодарность кафедре компьютерных наук и инженерии, Фонду образования Конеру Лакшмайя (считается университетом), Хайдарабад, Телангана, Индия, за предоставление вычислительных возможностей и исследовательской инфраструктуры, необходимых для этой работы. Особая благодарность выражаем юридическим экспертам и специалистам в области области, которые внесли вклад в аннотирование и оценку юридических корпусов, использованных в данном исследовании.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Аппаратное обеспечение процессораAMD EPYC 7742 (64 ядра, 2,25 ГГц)1 единицаAMD
ФреймворкPyTorch2https://pytorch.org
Аппаратное обеспечение GPUNVIDIA A100 (40 ГБ)2 единицыNVIDIA Corp.
Графовый фреймворкDGL1.1https://www.dgl.ai
БиблиотекаТрансформеры с объятием лица4.32.0https://huggingface.co/transformers
БиблиотекаSpaCy3.6https://spacy.io
БиблиотекаNLTK3.8.1https://www.nltk.org

Ссылки

  1. Powers, D. M. Evaluation: From precision, recall and F-measure to ROC, informedness, markedness & correlation. J Mach Learn Technol. 2 (1), 37-63 (2011).
  2. Eisenberg, M. A. Legal Reasoning. , Cambridge University Press. (2022).
  3. Lin, C. Y. ROUGE: A Package for Automatic Evaluation of Summaries. Text Summarizat Branches Out. , 74-81 (2004).
  4. Lewis, M., et al. Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension. Proc ACL. , 7871-7880 (2020).
  5. Hadi, A. Leveraging Transformer-Based Language Models to Bridge the Gap Between Language and Specialized Domains. [Doctoral Dissertation]. , Institut Polytechnique de Paris. (2024).
  6. Waterworth, K. Model-Agents of Change: A Meta-Cognitive, Interdisciplinary, Self-Similar, Synergetic Approach to Neuro-Symbolic Semantic Search and Retrieval Augmented Generation. [Master's Thesis]. , Miami University. (2024).
  7. Zhang, J., Zhao, Y., Saleh, M., Liu, P. PEGASUS: Pre-training with Extracted Gap-sentences for Abstractive Summarization. Proc ICML. , 11328-11339 (2020).
  8. Li, Z., et al. When object detection meets knowledge distillation: A survey. IEEE Trans. Pattern Anal Mach Intell. 45 (8), 10555-10579 (2023).
  9. Chen, Y., et al. Citation Network Analysis for Legal Reasoning. J AI Law. 28 (2), 145-170 (2020).
  10. Raffel, C., et al. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. J Mach Learn Res. 21 (140), 1-67 (2020).
  11. Reimers, N., Gurevych, I. Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proc EMNLP. , 3982-3992 (2019).
  12. Gunning, D., Aha, D. DARPA's explainable artificial intelligence (XAI) program. AI Mag. 40 (2), 44-58 (2019).
  13. Mihalcea, R., Tarau, P. TextRank: Bringing Order into Texts. Proc EMNLP. , 404-411 (2004).
  14. Sharma, G., Sharma, D. Automatic text summarization methods: A comprehensive review. SN Comput Sci. 4 (1), 33(2022).
  15. Xu, J., Croft, W. B. Neural Networks for Text Classification. Inf Retr J. 20 (3), 259-289 (2017).
  16. Ghosh, S., Dutta, A., Das, A. Indian Legal Text Summarization: A Text Normalisation-based Approach. arXiv. , (2022).
  17. Silver, D., et al. Mastering the Game of Go with Deep Neural Networks and Tree Search. Nature. 529, 484-489 (2016).
  18. Chalkidis, I., et al. LexGLUE: A benchmark dataset for legal language understanding in English. Proc ACL. 60 (1), 4310-4330 (2022).
  19. Ashley, K. Artificial Intelligence and Legal Analytics. , Cambridge University Press. (2017).
  20. Chalkidis, I., Fergadiotis, M., Aletras, N. LEGAL-BERT: The Muppets Straight Out of Law School. Proc ACL. , 2898-2910 (2020).
  21. Vaswani, A., et al. Attention Is All You Need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  22. Baker, A. R., Slack, F. J. ADAR1 and its implications in cancer development and treatment. Trends Genet. 38 (8), 821-830 (2022).
  23. Casola, S., Lavelli, A. Summarization, simplification, and generation: The case of patents. Expert Syst. Appl. 205, 117627(2022).
  24. Valente, A. Legal Knowledge Engineering. , IOS Press. (1995).
  25. Katz, D. M., et al. Natural language processing in the legal domain. arXiv. , (2023).
  26. Gilpin, L., et al. Explaining Explanations: An Approach to Interpretable AI. Proc ICML. 70, 89-98 (2018).
  27. Davoodijam, E., Alambardar Meybodi, M. Evaluation metrics on text summarization: comprehensive survey. Knowl Inf Syst. 66 (12), 7717-7738 (2024).
  28. Schauer, F. Precedent. , Stanford Encyclopedia of Philosophy. (1989).
  29. Bengio, Y., Louradour, J., Collobert, R., Weston, J. Curriculum Learning. Proc ICML. , 382-389 (2009).
  30. Vrandecic, D., Krötzsch, M. Wikidata: A Free Collaborative Knowledge Base. Commun ACM. 57 (10), 78-85 (2014).
  31. Chu, Y., Ye, M., Qian, Y. Fine-Grained Image Recognition Methods and Their Applications in Remote Sensing Images: A Review. IEEE J Sel Top Appl Earth Obs Remote Sens. 17 (6), 1234-1250 (2024).
  32. Vue, Z., et al. Stories from Hmong in STEMM. Trends Genet. 39 (8), 587-592 (2023).
  33. Begum, N., Goyal, A. Analysis of Legal Case Document Automated Summarizer. Proc ISPCC. , 533-538 (2021).
  34. Surden, H. Ethics of AI in Legal Practice. J Legal Ethics. 32 (2), 145-163 (2019).
  35. Bench-Capon, T. J. M., Sartor, G. Ontology-Based Legal Reasoning. Artif Intell Law. 11 (2), 125-157 (2003).
  36. Liu, Y. Fine-tune BERT for Extractive Summarization. arXiv. , (2019).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Теги

ROUGE