Отправьте статью сегодня! Журнал выйдет ..., печатный экземпляр отправим ...
Опубликовать статью

Молодой учёный

Применение больших языковых моделей (LLM) для автоматизации первичного анализа и структурирования технической документации

Информационные технологии
Препринт статьи
29.07.2026
3
Поделиться
Аннотация
Рассматриваются вопросы применения больших языковых моделей (LLM) и архитектуры RAG для автоматизации анализа и структурирования неструктурированной технической документации. Проанализированы особенности инженерных текстов, описан модульный алгоритм сегментации и семантического поиска. Экспериментально подтверждено сокращение времени первичной обработки документации на 82 % при высоком качестве извлечения параметров (F1-score = 0,93).
Библиографическое описание
Журавлев, З. А. Применение больших языковых моделей (LLM) для автоматизации первичного анализа и структурирования технической документации / З. А. Журавлев. — Текст : непосредственный // Молодой ученый. — 2026. — № 31 (634). — URL: https://moluch.ru/archive/634/139489.


1. Введение и актуальность исследования

Современное машиностроение оперирует большими объёмами нормативно-технической документации (ГОСТ, ТУ, паспорта оборудования). Традиционный ручной анализ отличается высокой трудоёмкостью и риском ошибок из-за человеческого фактора. Применение технологий обработки естественного языка (NLP) и больших языковых моделей (LLM) позволяет автоматизировать извлечение ключевых параметров и построение структурированных баз знаний, что является актуальной научно-практической задачей [1, с. 10; 4].

2. Специфика инженерно-технических текстов и архитектура LLM-системы

Инженерно-техническая документация отличается высокой плотностью терминов, наличием таблиц и строгой модальностью требований («должен», «допускается»). Ограничения контекстного окна LLM и риск галлюцинаций преодолеваются использованием гибридной архитектуры Retrieval-Augmented Generation (RAG) [2].

Процесс обработки включает три этапа:

  1. Предобработка: OCR-парсинг текста и таблиц с сохранением иерархии документа.
  2. Векторизация: разбиение текста на семантические фрагменты (chunks) и их индексация в векторной базе.
  3. RAG-поиск и генерация: формирование релевантного контекста и построение итогового отчёта с помощью LLM.

3. Алгоритм автоматизированного извлечения и структурирования параметров

Процесс извлечения целевого вектора параметров P = {p1, p2, …, pn\} из текста T с помощью модели с параметрами Θ описывается максимизацией условной вероятности:

P_target = argmax P_Θ(P | T, S_schema) (1)

где S_schema — формализованная схема целевых данных. Для сложных нормативных документов применяется метод Chain-of-Thought Prompting, обеспечивающий поэтапную проверку условий применимости требований.

4. Экспериментальное исследование и сравнительный анализ

Тестирование проводилось на массиве из 35 документов (25 паспортов станков с ЧПУ и 10 ГОСТов, всего 480 страниц). Сравнивались показатели работы инженеров-технологов и разработанного программного комплекса.

Таблица 1

Сравнительные показатели эффективности обработки технической документации

Параметр сравнения

Ручной анализ (Инженеры)

Автоматизированный анализ (LLM + RAG)

Среднее время обработки 100 страниц (мин)

180

32

Точность извлечения числовых параметров (Precision)

0,96

0,94

Полнота извлечения требований (Recall)

0,88

0,92

Итоговая мера качества (F1-score)

0,92

0,93

Формат выходных данных

Разрозненные заметки / таблицы Excel

Унифицированный JSON / БД

Ниже приведен пример конфигурации схемы извлечения параметров для LLM в формате JSON:

5. Анализ результатов и обсуждение

Анализ полученных данных показывает, что использование нейросетевого подхода сокращает затраты времени на первичную обработку массива нормативных и технических документов более чем в 5 раз. При этом интеграция RAG-технологии с векторизацией таблиц позволила решить проблему пропущенных требований: полнота извлечения (Recall) у нейросетевой системы оказалась даже выше, чем у инженеров, проводивших рутинную проверку на фоне утомляемости (0,92 против 0,88).

Основным ограничением метода остается необходимость обязательного контроля человеком-экспертом (Human-in-the-loop) в критических узлах проектирования для валидации извлеченных значений, имеющих сложную контекстную зависимость.

6. Заключение

В исследовании подтверждена высокая эффективность использования больших языковых моделей (LLM) в сочетании с архитектурой RAG для автоматизации анализа и структурирования технической документации. Предложенный подход позволяет трансформировать неструктурированные тексты регламентов и паспортов в машиночитаемый формат, существенно снижая рутинную нагрузку на инженерно-технический персонал. Результаты работы могут быть использованы при создании интеллектуальных систем поддержки принятия решений (СППР) на машиностроительных предприятиях.

Литература:

  1. ГОСТ Р 43.0.7–2011. Информационное обеспечение техники и операторской деятельности. Информационно-управляющие системы. Общие положения. — Введ. 2012–09–01. — Москва: Стандартинформ, 2012. — 24 с.
  2. ГОСТ Р 59895–2021. Технологии искусственного интеллекта в промышленности. Понятия и определения. — Введ. 2022–01–01. — Москва: Российский институт стандартизации, 2021. — 16 с.
Можно быстро и просто опубликовать свою научную статью в журнале «Молодой Ученый». Сразу предоставляем препринт и справку о публикации.
Опубликовать статью
Молодой учёный №31 (634) июль 2026 г.
📄 Препринт
Файл будет доступен после публикации номера
Похожие статьи
Исследование применения больших языковых моделей для автоматизации оценки сроков и бюджета IT-проектов
Разработка программного средства оценки качества аргументации в структурированных дебатах
Цифровая герменевтика. Применение технологий искусственного интеллекта для анализа исторических правовых текстов
Многоагентная архитектура больших языковых моделей для логико-смыслового анализа текстовых протоколов совещаний
Автоматизированная разметка набора открытых данных с применением больших языковых моделей
Анализ больших данных с использованием больших языковых моделей: роль языковых моделей в автоматизации аналитических процессов
Переход от парадигмы text-to-code к подходу text-to-model в задачах автоматизированного архитектурного комплаенса
Разработка интеллектуальной системы генерации высокоуровневого тематического описания текстовых документов
Социальные сети как зеркало общества: новые методы анализа с помощью искусственного интеллекта
Разработка программного модуля автоматизации деятельности преподавателя на основе интеграции с большими языковыми моделями

Молодой учёный