1. Введение и актуальность исследования
Современное машиностроение оперирует большими объёмами нормативно-технической документации (ГОСТ, ТУ, паспорта оборудования). Традиционный ручной анализ отличается высокой трудоёмкостью и риском ошибок из-за человеческого фактора. Применение технологий обработки естественного языка (NLP) и больших языковых моделей (LLM) позволяет автоматизировать извлечение ключевых параметров и построение структурированных баз знаний, что является актуальной научно-практической задачей [1, с. 10; 4].
2. Специфика инженерно-технических текстов и архитектура LLM-системы
Инженерно-техническая документация отличается высокой плотностью терминов, наличием таблиц и строгой модальностью требований («должен», «допускается»). Ограничения контекстного окна LLM и риск галлюцинаций преодолеваются использованием гибридной архитектуры Retrieval-Augmented Generation (RAG) [2].
Процесс обработки включает три этапа:
- Предобработка: OCR-парсинг текста и таблиц с сохранением иерархии документа.
- Векторизация: разбиение текста на семантические фрагменты (chunks) и их индексация в векторной базе.
- RAG-поиск и генерация: формирование релевантного контекста и построение итогового отчёта с помощью LLM.
3. Алгоритм автоматизированного извлечения и структурирования параметров
Процесс извлечения целевого вектора параметров P = {p1, p2, …, pn\} из текста T с помощью модели с параметрами Θ описывается максимизацией условной вероятности:
P_target = argmax P_Θ(P | T, S_schema) (1)
где S_schema — формализованная схема целевых данных. Для сложных нормативных документов применяется метод Chain-of-Thought Prompting, обеспечивающий поэтапную проверку условий применимости требований.
4. Экспериментальное исследование и сравнительный анализ
Тестирование проводилось на массиве из 35 документов (25 паспортов станков с ЧПУ и 10 ГОСТов, всего 480 страниц). Сравнивались показатели работы инженеров-технологов и разработанного программного комплекса.
Таблица 1
Сравнительные показатели эффективности обработки технической документации
|
Параметр сравнения |
Ручной анализ (Инженеры) |
Автоматизированный анализ (LLM + RAG) |
|
Среднее время обработки 100 страниц (мин) |
180 |
32 |
|
Точность извлечения числовых параметров (Precision) |
0,96 |
0,94 |
|
Полнота извлечения требований (Recall) |
0,88 |
0,92 |
|
Итоговая мера качества (F1-score) |
0,92 |
0,93 |
|
Формат выходных данных |
Разрозненные заметки / таблицы Excel |
Унифицированный JSON / БД |
Ниже приведен пример конфигурации схемы извлечения параметров для LLM в формате JSON:
5. Анализ результатов и обсуждение
Анализ полученных данных показывает, что использование нейросетевого подхода сокращает затраты времени на первичную обработку массива нормативных и технических документов более чем в 5 раз. При этом интеграция RAG-технологии с векторизацией таблиц позволила решить проблему пропущенных требований: полнота извлечения (Recall) у нейросетевой системы оказалась даже выше, чем у инженеров, проводивших рутинную проверку на фоне утомляемости (0,92 против 0,88).
Основным ограничением метода остается необходимость обязательного контроля человеком-экспертом (Human-in-the-loop) в критических узлах проектирования для валидации извлеченных значений, имеющих сложную контекстную зависимость.
6. Заключение
В исследовании подтверждена высокая эффективность использования больших языковых моделей (LLM) в сочетании с архитектурой RAG для автоматизации анализа и структурирования технической документации. Предложенный подход позволяет трансформировать неструктурированные тексты регламентов и паспортов в машиночитаемый формат, существенно снижая рутинную нагрузку на инженерно-технический персонал. Результаты работы могут быть использованы при создании интеллектуальных систем поддержки принятия решений (СППР) на машиностроительных предприятиях.
Литература:
- ГОСТ Р 43.0.7–2011. Информационное обеспечение техники и операторской деятельности. Информационно-управляющие системы. Общие положения. — Введ. 2012–09–01. — Москва: Стандартинформ, 2012. — 24 с.
- ГОСТ Р 59895–2021. Технологии искусственного интеллекта в промышленности. Понятия и определения. — Введ. 2022–01–01. — Москва: Российский институт стандартизации, 2021. — 16 с.

