Отправьте статью сегодня! Журнал выйдет ..., печатный экземпляр отправим ...
Опубликовать статью

Молодой учёный

Программный модуль для контекстного анализа данных юридических документов

Информационные технологии
Препринт статьи
25.07.2026
1
Поделиться
Аннотация
В статье рассматривается программный модуль, предназначенный для преобразования неструктурированного текста юридических документов в набор структурированных фактов. Основное внимание уделено контекстному выделению дат событий, временных интервалов и даты рождения участника производства. Предлагаемый подход сочетает нормализацию текста, регулярные выражения, словари юридически значимых маркеров и эвристические правила разрешения неоднозначностей. Описаны архитектура модуля, этапы формирования кандидатов, анализ локального контекста, фильтрация служебных дат и представление результата с указанием происхождения каждого извлечённого факта. Модуль ориентирован на обработку судебных актов, приговоров, протоколов и архивных материалов.
Библиографическое описание
Тагунков, М. В. Программный модуль для контекстного анализа данных юридических документов / М. В. Тагунков. — Текст : непосредственный // Молодой ученый. — 2026. — № 30 (633). — URL: https://moluch.ru/archive/633/139445.


Введение

Юридические документы содержат значительный объём фактической информации, однако её форма редко является однородной. Одна и та же дата может обозначать момент совершения события, дату составления документа, время проведения экспертизы, дату вступления решения в силу либо дату рождения участника дела. При простом поиске календарных выражений все такие упоминания попадают в единый список, из-за чего результат требует длительной ручной проверки. Для прикладной обработки важен не сам факт наличия даты в тексте, а её смысловая роль и связь с описываемым событием. Поэтому задача извлечения хронологических сведений должна рассматриваться как задача контекстного анализа, включающая распознавание сущности, классификацию её назначения и сохранение связи с фрагментом исходного документа.

Обработка естественного языка включает нормализацию, поиск сущностей и их интерпретацию [1, с. 21–30]. Для юридического текста эти операции осложняются канцелярскими конструкциями, длинными предложениями, перечислениями эпизодов и повторным упоминанием фактов. Значение выражения часто определяется процессуальной ролью лица и видом документа [2]. Цель модуля состоит в выделении временных фактов и преобразовании их в структурированный результат: точные даты, интервалы неопределённости, дату рождения целевого лица, контекстные признаки и ссылку на исходный фрагмент.

Постановка задачи контекстного анализа

Датой-кандидатом считается календарное выражение, которое может обозначать юридически значимый факт. Кандидаты включают полные числовые и словесные даты, упоминания месяца и года, а также конструкции «в начале марта 1991 года», «с марта по май 1991 года», «в период с 10 по 14 апреля». Сначала выражение рассматривается без предположения о назначении, затем анализируются предложение, соседние фразы, заголовок раздела и ближайшие слова-маркеры. Найденная последовательность связывается с контекстом и приводится к нормализованному виду [3, с. 19–24].

Выделяются три категории: даты событий, персональные даты и служебные даты. К первой относятся моменты совершения деяния, обнаружения последствий, передачи имущества и другие эпизоды фабулы. Ко второй — прежде всего дата рождения выбранного участника. Третья категория включает даты приговора, постановления, заседания, экспертизы, регистрации и иных процессуальных действий, которые не должны смешиваться с хронологией описываемых фактов.

Архитектура программного модуля

Модуль состоит из слабо связанных компонентов. Сервис обработки документов использует общий интерфейс обработчика: TXT-файлы читаются с контролем кодировки, а из DOCX извлекается содержимое абзацев и таблиц через Open XML. Использование специализированного SDK позволяет получать текст без запуска Microsoft Word. Единый интерфейс изолирует парсер от формата источника, а композиционный корень создаёт компоненты и передаёт зависимости, поэтому модуль можно подключать к настольной программе, серверному сервису или пакетному обработчику.

Центральный компонент — класс CrimeDateParser, реализующий интерфейс IDateParser. Он получает нормализованный текст и возвращает ParseResult со списком объектов CrimePeriod, выбранной датой рождения, отклонёнными кандидатами и диагностическими сведениями. CrimePeriod хранит начало и конец интервала; для точной даты значения совпадают. DateCandidate содержит исходное написание, позицию, категорию, оценку контекста и сработавшие правила. Реализация на C# использует строгую типизацию, интерфейсы и развитые средства работы со строками.

Алгоритм выделения и классификации временных фактов

Первый этап — нормализация текста. Удаляются невидимые символы, повторяющиеся пробелы, технические номера сносок и разрывы слов; тире и кавычки приводятся к единой форме. Для распознанного текста допускается осторожное исправление ошибок внутри календарного шаблона: замена «О» на «0», восстановление разделителей и объединение разорванного года. Обычные слова при этом не изменяются.

На втором этапе регулярные выражения находят полные числовые даты, формы со словесным месяцем, месяц и год, диапазоны дней или месяцев и приблизительные периоды. Именованные группы позволяют раздельно получить день, месяц, год и границы интервала. Группы, альтернативы и проверки окружения.NET описывают варианты написания без привязки к одному формату. Найденный фрагмент преобразуется в кандидата, но ещё не включается в итоговый список.

Третий этап — анализ контекстного окна: предложения с кандидатом, соседних предложений и ближайших слов. Положительные маркеры фабулы — «совершил», «произошло», «напал», «похитил», «передал», «обнаружен», «эпизод», «деяние», «в период». Отрицательные маркеры отражают процессуальные действия: «приговор», «постановление», «заседание», «экспертиза», «протокол», «решение вступило», «судимость». Каждому правилу назначается вес: близкий положительный признак повышает оценку, отрицательный снижает её. Даты внутри нумерованных эпизодов получают дополнительный приоритет, а реквизиты документа и фразы о вынесении решения указывают на служебную дату. При равенстве признаков кандидат сохраняется как неоднозначный, а не принимается автоматически.

Дата рождения определяется отдельными правилами. Модуль ищет выражения «родился», «дата рождения», «года рождения» и устанавливает, к какому лицу они относятся. Приоритет имеют контексты с ролями «обвиняемый», «подсудимый», «осуждённый» или фамилией выбранного лица. Даты потерпевшего, свидетеля и эксперта не подменяют целевое значение; при нескольких вариантах остальные сохраняются в диагностическом перечне.

Неполные даты нормализуются без создания ложной точности. «Март 1991 года» представляется границами месяца, «в начале марта» — начальным отрезком, а «март–май 1991 года» — периодом от начала марта до конца мая. Восстановление повреждённого года допускается только при однозначном контексте и фиксируется как предположение. После этого удаляются дубли, проверяется календарная допустимость и сохраняется порядок упоминаний в документе.

Формирование результата и интерпретируемость

Результат должен быть объяснимым. Вместе с датой сохраняются исходная цитата, номер абзаца, имя файла и правила классификации. Можно установить, что дата принята из-за маркера «совершил» либо исключена из-за сочетания «дата вынесения приговора». Автоматическое решение остаётся проверяемым по первоисточнику.

При пакетной обработке совпадающие факты объединяются, но все ссылки на источники сохраняются. Ошибка чтения отдельного документа не уничтожает уже полученные сведения: сервис возвращает частичный результат и диагностику. Выходная модель может сериализоваться в JSON, записываться в базу данных или передаваться другому компоненту, не связывая парсер с последующими операциями.

Заключение

Разработанный программный модуль выполняет получение и нормализацию текста, поиск календарных выражений, анализ юридического контекста, определение роли участника, обработку точных и интервальных дат, удаление дублей и формирование объяснимого результата. Разделение компонентов по интерфейсам обеспечивает независимость от формата документа и способа дальнейшего использования данных. Подход сокращает объём ручного просмотра, сохраняя смысловую связь даты с фактом и возможность проследить её происхождение до конкретного фрагмента. Дальнейшее развитие может быть связано с выделением участников, мест и правовых оснований, а также с сочетанием интерпретируемых правил и статистических моделей.

Литература:

  1. Jurafsky D., Martin J. H. Speech and Language Processing. 2nd ed. Upper Saddle River: Pearson Prentice Hall, 2009. 1024 p.
  2. Chalkidis I., Fergadiotis M., Malakasiotis P., Aletras N., Androutsopoulos I. LEGAL-BERT: The Muppets straight out of Law School // Findings of the Association for Computational Linguistics: EMNLP 2020. P. 2898–2904.
  3. Manning C. D., Raghavan P., Schütze H. Introduction to Information Retrieval. Cambridge: Cambridge University Press, 2008. 482 p.
Можно быстро и просто опубликовать свою научную статью в журнале «Молодой Ученый». Сразу предоставляем препринт и справку о публикации.
Опубликовать статью
Молодой учёный №30 (633) июль 2026 г.
📄 Препринт
Файл будет доступен после публикации номера
Похожие статьи
Разработка программного средства для анализа данных о серийных преступлениях
Разработка программных модулей обработки многомерных данных различной природы в среде EXCEL
Программное средство анализа и визуализации параметров технологического процесса
Современные методы фиксации и анализа цифровых следов в киберпреступлениях
Автоматизированная фильтрация данных аппаратуры электромагнитного исследования геологической среды с помощью программных средств
Поиск программного искажения движений документов при производстве судебной компьютерно-технической экспертизы «1С:Предприятие»
Языковые особенности криминальных новостей
Электронный документ как особый объект криминалистической экспертизы
Информационные технологии в юриспруденции
Методология использования информационных технологий в расследовании преступлений

Молодой учёный