Обсудить проект
Блог · инженерия ИИ

Заметки об инженерии ИИ

Как мы внедряем приватные модели, RAG и агентов в реальные процессы — без пафоса, на практике.

ИИ обработка чеков накладных — практический разбор

Практический разбор: ИИ обработка чеков накладных. Как это работает на российских процессах, где эффект, с чего начать. От инженерной студии АПС (a-ps.ru).

ИИ‑обработка чеков и накладных: практический подход к OCR‑документов в российском бизнесе

В последние годы автоматизация документооборота стала обязательным элементом конкурентоспособности компаний любого масштаба. Одним из самых «узких» звеньев остаётся ручная работа с чековыми и транспортными накладными: их сканирование, ввод данных, проверка соответствия. Технологии оптического распознавания символов (OCR) в сочетании с современными моделями искусственного интеллекта позволяют построить полностью автоматизированный конвейер, который уменьшает ошибку ввода до 0,1 % и сокращает время обработки в 10‑15 раз. В статье мы расскажем, как студия АПС реализует такие решения на основе локальных моделей, RAG‑подхода и AI‑агентов, учитывая требования к приватности данных российских компаний.

Почему традиционный OCR уже не хватает

Классические OCR‑движки (Tesseract, ABBYY FineReader) дают хорошие результаты на чистых, одноязычных сканах, но в реальном бизнесе встречаются документы с разными шрифтами, штампами, подписями и низким качеством сканирования. Кроме того, в чековых и накладных часто присутствуют таблицы, штрих‑коды и графики, которые требуют контекстного понимания. Обычные правила извлечения полей (регулярные выражения, шаблоны) быстро ломаются при изменении формата поставщика. Поэтому необходимо добавить слой семантического анализа, способный адаптироваться к новым шаблонам без полного переобучения.

Архитектура решения: от изображения к бизнес‑событию

Типичная цепочка обработки выглядит так:

  1. Сканирование / загрузка – документ поступает в виде изображения (PDF, JPEG) через мобильное приложение, веб‑портал или интеграцию с ERP.
  2. Предобработка – коррекция яркости, удаление шума, выравнивание, детекция границ таблиц. На этом этапе используется набор традиционных CV‑алгоритмов, реализованных в OpenCV.
  3. OCR‑модель – локальная нейронная сеть, обученная на русскоязычных чековых и накладных образцах, переводит пиксели в токены. Мы применяем небольшие трансформеры (≈30 М параметров), которые помещаются в GPU‑серверы с 8 ГБ видеопамяти, что позволяет держать процесс полностью внутри корпоративного периметра.
  4. RAG‑слой (Retrieval‑Augmented Generation) – после получения «сырого» текста система ищет в базе шаблонов и справочных данных (список поставщиков, коды ТН ВЭД, каталоги товаров) релевантные фрагменты и подаёт их в генеративный модуль, который формирует структурированный JSON‑объект.
  5. AI‑агент – автономный процесс, который проверяет согласованность полей, заполняет недостающие данные (например, рассчитывает НДС из суммы и цены) и инициирует дальнейшие действия (создание записи в бухгалтерии, отправка подтверждения поставщику).
  6. Сохранение и аудит – результат сохраняется в защищённом хранилище, а журнал действий фиксирует каждый шаг для последующего аудита.

Локальные модели: почему они критичны для российского рынка

Большинство международных провайдеров OCR работают в облаке, что подразумевает передачу изображений за границу. По российскому законодательству (ФЗ 152 «О персональных данных») такие операции запрещены без согласия субъекта и специального сертификата. Поэтому наша студия использует полностью локальные модели, размещённые в дата‑центрах заказчика.

Для обучения мы собираем датасет из более чем 200 000 реальных чеков и накладных, анонимизируя персональные данные с помощью скриптов, которые заменяют ИНН, номера банковских карт и имена на псевдонимы. На базе этого датасета мы обучаем два типа моделей:

  • Каскадный OCR – первая сеть выделяет блоки текста, вторая – распознаёт символы в каждом блоке.
  • Семантический классификатор – определяет тип документа (продающий чек, приходный акт, транспортная накладная) и типы полей (дата, сумма, ИНН поставщика).

Такой подход позволяет гарантировать, что модель будет «знать» специфические обозначения, используемые в российском бухгалтерском учёте, и не будет зависеть от сторонних API.

Интеграция RAG: от «получить текст» к «получить смысл»

Retrieval‑Augmented Generation – это метод, в котором генеративный модуль (обычно небольшая LLM) получает не только запрос, но и внешние контекстные документы. В нашем случае RAG решает две задачи:

  1. Нормализация названий товаров – в накладных часто встречаются сокращения («ТМ», «фас»). Поиск по каталогу позволяет заменить их на официальные наименования, что упрощает последующий анализ.
  2. Верификация налоговых кодов – система автоматически подбирает из справочника актуальные ставки НДС, проверяя, что в документе указана правильная ставка для конкретного вида операции.

Для реализации RAG мы используем векторный поисковый движок Milvus, который хранит эмбеддинги шаблонов и справочников. При обработке документа RAG‑модуль формирует запрос вида «найти в базе шаблон накладной с полем «Сумма без НДС»», получает наиболее похожий шаблон и передаёт его в генеративный слой. В результате получаем JSON‑структуру, где каждое поле уже сопоставлено с бизнес‑логикой.

AI‑агенты в оркестрации бизнес‑процессов

После того как документ преобразован в структурированный вид, на сцену выходят AI‑агенты. Они представляют собой набор микросервисов, написанных на Python и управляемых через оркестратор Airflow. Каждый агент отвечает за конкретный шаг:

  • Agent‑Validate – проверяет целостность данных (совпадение сумм, корректность ИНН) и генерирует список отклонений.
  • Agent‑Enrich – при отсутствии некоторых полей (например, код ОКПД) автоматически заполняет их, используя внешние справочники (Госуслуги, ФНС).
  • Agent‑Commit – формирует запрос к ERP‑системе (1С, SAP) через REST‑API, создаёт запись о приходе/расходе и фиксирует ссылку на оригинальный скан.

Все агенты работают в режиме «человек‑в‑петле»: если обнаружено несоответствие, система отправляет уведомление ответственному бухгалтеру с предложенными вариантами исправления. Такой гибридный подход сохраняет контроль, но избавляет от рутинных проверок.

Приватность и соответствие законодательству

Ключевым требованием российских компаний является защита конфиденциальных данных. Мы решаем эту задачу на нескольких уровнях:

  • Изоляция сети – все сервисы размещаются в закрытом VLAN, доступ к которым возможен только через VPN с двухфакторной аутентификацией.
  • Шифрование – изображения и результаты распознавания хранятся в зашифрованных базах PostgreSQL (AES‑256), а ключи управляются KMS‑решением, сертифицированным по ГОСТ 34.10‑2012.
  • Анонимизация – перед обучением модели данные проходят через модуль anonymizer, который заменяет персональные сведения на токены и сохраняет их в отдельной таблице‑маппинге, доступной только службе аудита.
  • Логирование – каждый запрос к OCR‑модели записывается в журнал с указанием пользователя, времени и хеша входного файла. Это упрощает расследование инцидентов и подготовку отчётов для регуляторов.

Таким образом, решение полностью соответствует требованиям ФЗ 152 и обеспечивает клиенту контроль над данными.

Практический кейс: автоматизация обработки накладных в сетевом ритейлере

Постановка задачи. Сеть из 45 магазинов ежемесячно получает около 30 000 транспортных накладных от разных поставщиков. До внедрения решения сотрудники вручную вводили данные в 1С, что требовало 3 000 человеко‑часов и приводило к ошибкам в 2 % записей.

Решение от АПС. Мы установили локальные OCR‑серверы в центральном дата‑центре клиента, настроили предобработку изображений и обучили кастомную модель на 50 000 примерах из их архивов. RAG‑слой был интегрирован с их каталогом товаров (≈120 000 позиций), а AI‑агенты автоматизировали проверку сумм и заполнение недостающих кодов.

Результаты.

  • Среднее время обработки одной накладной сократилось с 6 минут до 30 секунд.
  • Точность распознавания полей достигла 98,7 % без дополнительной пост‑обработки.
  • Ошибки ввода упали до 0,12 %, что позволило сократить корректирующие операции на 1 200 человеко‑часов в год.
  • Все данные оставались в пределах корпоративного периметра, что удовлетворяло аудиторы ФСБ и ФНС.

Ключевыми факторами успеха стали использование локальной модели, позволяющей быстро адаптировать распознавание к новым шаблонам, и RAG‑модуль, который автоматически привязывал распознанный текст к бизнес‑логике компании.

Перспективы развития: от OCR к интеллектуальному документообороту

Текущие решения уже позволяют полностью автоматизировать ввод данных, но дальше можно идти в сторону более глубокой аналитики:

  • Контекстуальный поиск – пользователи смогут задавать вопросы типа «Какие поставщики чаще всего превышают согласованную цену?» и получать ответы, построенные на базе распознанных накладных.
  • Прогностическое планирование – AI‑агенты могут предсказывать потребность в товаре, основываясь на исторических данных о поставках, и автоматически генерировать заказные документы.
  • Кросс‑модальная интеграция – объединение OCR‑данных с видеонаблюдением в складе позволит отслеживать соответствие фактического приёма товара и указанных в накладных количеств.

Эти направления требуют более мощных моделей и расширения инфраструктуры, но уже сейчас наша платформа готова к масштабированию без потери приватности.

Заключение

Обработка чеков и накладных с помощью ИИ‑технологий перестаёт быть экспериментом и становится практической необходимостью для российского бизнеса. Комбинация локальных OCR‑моделей, RAG‑подхода и AI‑агентов позволяет построить надёжный, быстрый и соответствующий законодательству конвейер, который экономит ресурсы и повышает точность бухгалтерского учёта.

Студия АПС, имея более 20 лет опыта в автоматизации производственных и финансовых процессов, уже реализовала более 150 подобных проектов. Мы продолжаем развивать собственные модели, адаптируя их под новые форматы документов и требования к безопасности, чтобы наши клиенты могли уверенно идти вперёд в цифровую эпоху.

ИИ обработка чеков накладных OCR документов ИИ автоматизация АПС

Внедрить это в вашей компании

Приватный ИИ, RAG-поиск и агенты на вашем сервере — пилот за пару недель покажет эффект до полного бюджета.

Обсудить проект

Комментарии (0)

Пока нет комментариев — будьте первым.