Обсудить проект
Блог · инженерия ИИ

Заметки об инженерии ИИ

Как мы внедряем приватные модели, RAG и агентов в реальные процессы — без пафоса, на практике.

Пайплайн обработки заявок: OCR → LLM → маршрутизация

Входящая заявка редко приходит в удобном виде: PDF-скан договора, фото накладной с телефона, письмо с вложением Excel, сообщение в чате. Менеджер или кладовщи...

Входящая заявка редко приходит в удобном виде: PDF-скан договора, фото накладной с телефона, письмо с вложением Excel, сообщение в чате. Менеджер или кладовщик вручную перепечатывает данные в 1С — это 5–15 минут на документ и стабильный поток опечаток. Пайплайн OCR → LLM → маршрутизация разбивает работу на три управляемых этапа, каждый из которых можно тестировать и улучшать отдельно.

Почему конвейер надёжнее одной большой модели

Соблазн отдать весь документ мультимодальной модели и попросить «сразу JSON» понятен, но на потоке в сотни заявок в день он проигрывает. Причины прагматичные: OCR-ошибки в цифрах (0 и O, 1 и l, 3 и 8) модель замечает не всегда, а стоимость обработки изображения в 5–10 раз выше, чем текста. Конвейер даёт контрольные точки: видно, на каком шаге потерялись данные, и есть куда поставить правило-предохранитель.

Отдельный аргумент — требования 152-ФЗ и внутренней безопасности. Персональные данные можно маскировать или обрабатывать на своём контуре до того, как текст уйдёт в модель.

Шаг 1. OCR: текст, координаты, уверенность

Задача OCR — не просто «прочитать», а отдать текст с геометрией: координаты блоков, уверенность по символам, разметку таблиц. Для российских документов работают Tesseract с дообучением на своих формах, движки ABBYY и open-source решения на базе PaddleOCR. Ключевой момент — предобработка: выравнивание, бинаризация, поворот скана. На фотографиях накладных с телефона это поднимает точность распознавания цифр на 10–20%.

Если уверенность по критичному полю (ИНН, сумма, номер счёта) ниже порога — документ уходит на ручную проверку, не доходя до LLM.

Шаг 2. LLM: извлечение полей и нормализация

На вход модели подаётся текст с координатами, на выход — строгий JSON по схеме: контрагент, ИНН, номенклатура, количество, сумма, дата, номер заявки. Здесь работают три приёма:

  • JSON Schema или function calling — модель физически не может вернуть поле вне схемы.
  • Few-shot примеры на реальных обезличенных документах компании — точность извлечения заметно выше, чем при абстрактных инструкциях.
  • Валидация после модели — проверка ИНН по контрольной сумме, сверка «количество × цена», контроль дат.

Нормализация — отдельная ценность: «ООО "Ромашка"», «Ромашка ООО» и «ООО Ромашка» должны превратиться в один контрагент из справочника 1С.

Шаг 3. Маршрутизация: правила поверх модели

Маршрутизация — не задача LLM, а бизнес-логика. Модель отдаёт структурированные данные, дальше вступают правила: сумма до 100 000 ₽ — автопроведение, выше — согласование руководителя; новый контрагент — проверка службы безопасности; нестандартная номенклатура — очередь снабжения. Правила живут в коде или в 1С и меняются без переобучения модели.

Интеграция выполняется через HTTP-сервисы 1С или обмен по REST/ODATA: создаётся документ «Заявка», привязываются файлы, пишется лог обработки. Всё, что не прошло автоматически, попадает в очередь оператора с уже заполненными полями — человек только подтверждает.

Что ломается на практике

  • Новые типы документов. Раз в квартал появляется форма, которой не было в выборке. Нужен мониторинг доли ручных правок и короткий цикл добавления примеров.
  • Грязные сканы. Решение — не улучшать модель, а ужесточить требования к сканированию или перевести поставщиков на ЭДО.
  • Дубли. Одна заявка, пришедшая по почте и в чате, должна схлопываться по хешу содержимого.
  • Дрейф справочников. Номенклатура в 1С меняется, матчинг приходится периодически переиндексировать.

Метрики, за которыми стоит следить: доля автопроведённых заявок, точность по полям, среднее время обработки, доля правок оператором. Реалистичная цель первого этапа — 60–70% автоматизации на топ-3 типах документов, дальше показатель растёт.

Как мы можем помочь

Мы проектируем и внедряем такие конвейеры: подбираем OCR под ваши формы, разворачиваем приватную LLM на вашем контуре, пишем валидацию и маршрутизацию, интегрируем результат с 1С и CRM. Начинаем с пилота на одном типе заявок и трёх метриках, чтобы через 4–6 недель эффект был виден в цифрах. Обсудить проект

1С и ИИ ИИ автоматизация АПС

Внедрить это в вашей компании

Приватный ИИ, RAG-поиск и агенты на вашем сервере — пилот за пару недель покажет эффект до полного бюджета.

Обсудить проект

Комментарии (0)

Пока нет комментариев — будьте первым.