ИИ обработка чеков накладных — практический разбор
Практический разбор: ИИ обработка чеков накладных. Как это работает на российских процессах, где эффект, с чего начать. От инженерной студии АПС (a-ps.ru).
ИИ‑обработка чеков и накладных: практический подход к OCR‑документов в российском бизнесе
В последние годы автоматизация документооборота стала обязательным элементом конкурентоспособности компаний любого масштаба. Одним из самых «узких» звеньев остаётся ручная работа с чековыми и транспортными накладными: их сканирование, ввод данных, проверка соответствия. Технологии оптического распознавания символов (OCR) в сочетании с современными моделями искусственного интеллекта позволяют построить полностью автоматизированный конвейер, который уменьшает ошибку ввода до 0,1 % и сокращает время обработки в 10‑15 раз. В статье мы расскажем, как студия АПС реализует такие решения на основе локальных моделей, RAG‑подхода и AI‑агентов, учитывая требования к приватности данных российских компаний.
Почему традиционный OCR уже не хватает
Классические OCR‑движки (Tesseract, ABBYY FineReader) дают хорошие результаты на чистых, одноязычных сканах, но в реальном бизнесе встречаются документы с разными шрифтами, штампами, подписями и низким качеством сканирования. Кроме того, в чековых и накладных часто присутствуют таблицы, штрих‑коды и графики, которые требуют контекстного понимания. Обычные правила извлечения полей (регулярные выражения, шаблоны) быстро ломаются при изменении формата поставщика. Поэтому необходимо добавить слой семантического анализа, способный адаптироваться к новым шаблонам без полного переобучения.
Архитектура решения: от изображения к бизнес‑событию
Типичная цепочка обработки выглядит так:
- Сканирование / загрузка – документ поступает в виде изображения (PDF, JPEG) через мобильное приложение, веб‑портал или интеграцию с ERP.
- Предобработка – коррекция яркости, удаление шума, выравнивание, детекция границ таблиц. На этом этапе используется набор традиционных CV‑алгоритмов, реализованных в OpenCV.
- OCR‑модель – локальная нейронная сеть, обученная на русскоязычных чековых и накладных образцах, переводит пиксели в токены. Мы применяем небольшие трансформеры (≈30 М параметров), которые помещаются в GPU‑серверы с 8 ГБ видеопамяти, что позволяет держать процесс полностью внутри корпоративного периметра.
- RAG‑слой (Retrieval‑Augmented Generation) – после получения «сырого» текста система ищет в базе шаблонов и справочных данных (список поставщиков, коды ТН ВЭД, каталоги товаров) релевантные фрагменты и подаёт их в генеративный модуль, который формирует структурированный JSON‑объект.
- AI‑агент – автономный процесс, который проверяет согласованность полей, заполняет недостающие данные (например, рассчитывает НДС из суммы и цены) и инициирует дальнейшие действия (создание записи в бухгалтерии, отправка подтверждения поставщику).
- Сохранение и аудит – результат сохраняется в защищённом хранилище, а журнал действий фиксирует каждый шаг для последующего аудита.
Локальные модели: почему они критичны для российского рынка
Большинство международных провайдеров OCR работают в облаке, что подразумевает передачу изображений за границу. По российскому законодательству (ФЗ 152 «О персональных данных») такие операции запрещены без согласия субъекта и специального сертификата. Поэтому наша студия использует полностью локальные модели, размещённые в дата‑центрах заказчика.
Для обучения мы собираем датасет из более чем 200 000 реальных чеков и накладных, анонимизируя персональные данные с помощью скриптов, которые заменяют ИНН, номера банковских карт и имена на псевдонимы. На базе этого датасета мы обучаем два типа моделей:
- Каскадный OCR – первая сеть выделяет блоки текста, вторая – распознаёт символы в каждом блоке.
- Семантический классификатор – определяет тип документа (продающий чек, приходный акт, транспортная накладная) и типы полей (дата, сумма, ИНН поставщика).
Такой подход позволяет гарантировать, что модель будет «знать» специфические обозначения, используемые в российском бухгалтерском учёте, и не будет зависеть от сторонних API.
Интеграция RAG: от «получить текст» к «получить смысл»
Retrieval‑Augmented Generation – это метод, в котором генеративный модуль (обычно небольшая LLM) получает не только запрос, но и внешние контекстные документы. В нашем случае RAG решает две задачи:
- Нормализация названий товаров – в накладных часто встречаются сокращения («ТМ», «фас»). Поиск по каталогу позволяет заменить их на официальные наименования, что упрощает последующий анализ.
- Верификация налоговых кодов – система автоматически подбирает из справочника актуальные ставки НДС, проверяя, что в документе указана правильная ставка для конкретного вида операции.
Для реализации RAG мы используем векторный поисковый движок Milvus, который хранит эмбеддинги шаблонов и справочников. При обработке документа RAG‑модуль формирует запрос вида «найти в базе шаблон накладной с полем «Сумма без НДС»», получает наиболее похожий шаблон и передаёт его в генеративный слой. В результате получаем JSON‑структуру, где каждое поле уже сопоставлено с бизнес‑логикой.
AI‑агенты в оркестрации бизнес‑процессов
После того как документ преобразован в структурированный вид, на сцену выходят AI‑агенты. Они представляют собой набор микросервисов, написанных на Python и управляемых через оркестратор Airflow. Каждый агент отвечает за конкретный шаг:
- Agent‑Validate – проверяет целостность данных (совпадение сумм, корректность ИНН) и генерирует список отклонений.
- Agent‑Enrich – при отсутствии некоторых полей (например, код ОКПД) автоматически заполняет их, используя внешние справочники (Госуслуги, ФНС).
- Agent‑Commit – формирует запрос к ERP‑системе (1С, SAP) через REST‑API, создаёт запись о приходе/расходе и фиксирует ссылку на оригинальный скан.
Все агенты работают в режиме «человек‑в‑петле»: если обнаружено несоответствие, система отправляет уведомление ответственному бухгалтеру с предложенными вариантами исправления. Такой гибридный подход сохраняет контроль, но избавляет от рутинных проверок.
Приватность и соответствие законодательству
Ключевым требованием российских компаний является защита конфиденциальных данных. Мы решаем эту задачу на нескольких уровнях:
- Изоляция сети – все сервисы размещаются в закрытом VLAN, доступ к которым возможен только через VPN с двухфакторной аутентификацией.
- Шифрование – изображения и результаты распознавания хранятся в зашифрованных базах PostgreSQL (AES‑256), а ключи управляются KMS‑решением, сертифицированным по ГОСТ 34.10‑2012.
- Анонимизация – перед обучением модели данные проходят через модуль anonymizer, который заменяет персональные сведения на токены и сохраняет их в отдельной таблице‑маппинге, доступной только службе аудита.
- Логирование – каждый запрос к OCR‑модели записывается в журнал с указанием пользователя, времени и хеша входного файла. Это упрощает расследование инцидентов и подготовку отчётов для регуляторов.
Таким образом, решение полностью соответствует требованиям ФЗ 152 и обеспечивает клиенту контроль над данными.
Практический кейс: автоматизация обработки накладных в сетевом ритейлере
Постановка задачи. Сеть из 45 магазинов ежемесячно получает около 30 000 транспортных накладных от разных поставщиков. До внедрения решения сотрудники вручную вводили данные в 1С, что требовало 3 000 человеко‑часов и приводило к ошибкам в 2 % записей.
Решение от АПС. Мы установили локальные OCR‑серверы в центральном дата‑центре клиента, настроили предобработку изображений и обучили кастомную модель на 50 000 примерах из их архивов. RAG‑слой был интегрирован с их каталогом товаров (≈120 000 позиций), а AI‑агенты автоматизировали проверку сумм и заполнение недостающих кодов.
Результаты.
- Среднее время обработки одной накладной сократилось с 6 минут до 30 секунд.
- Точность распознавания полей достигла 98,7 % без дополнительной пост‑обработки.
- Ошибки ввода упали до 0,12 %, что позволило сократить корректирующие операции на 1 200 человеко‑часов в год.
- Все данные оставались в пределах корпоративного периметра, что удовлетворяло аудиторы ФСБ и ФНС.
Ключевыми факторами успеха стали использование локальной модели, позволяющей быстро адаптировать распознавание к новым шаблонам, и RAG‑модуль, который автоматически привязывал распознанный текст к бизнес‑логике компании.
Перспективы развития: от OCR к интеллектуальному документообороту
Текущие решения уже позволяют полностью автоматизировать ввод данных, но дальше можно идти в сторону более глубокой аналитики:
- Контекстуальный поиск – пользователи смогут задавать вопросы типа «Какие поставщики чаще всего превышают согласованную цену?» и получать ответы, построенные на базе распознанных накладных.
- Прогностическое планирование – AI‑агенты могут предсказывать потребность в товаре, основываясь на исторических данных о поставках, и автоматически генерировать заказные документы.
- Кросс‑модальная интеграция – объединение OCR‑данных с видеонаблюдением в складе позволит отслеживать соответствие фактического приёма товара и указанных в накладных количеств.
Эти направления требуют более мощных моделей и расширения инфраструктуры, но уже сейчас наша платформа готова к масштабированию без потери приватности.
Заключение
Обработка чеков и накладных с помощью ИИ‑технологий перестаёт быть экспериментом и становится практической необходимостью для российского бизнеса. Комбинация локальных OCR‑моделей, RAG‑подхода и AI‑агентов позволяет построить надёжный, быстрый и соответствующий законодательству конвейер, который экономит ресурсы и повышает точность бухгалтерского учёта.
Студия АПС, имея более 20 лет опыта в автоматизации производственных и финансовых процессов, уже реализовала более 150 подобных проектов. Мы продолжаем развивать собственные модели, адаптируя их под новые форматы документов и требования к безопасности, чтобы наши клиенты могли уверенно идти вперёд в цифровую эпоху.
Внедрить это в вашей компании
Приватный ИИ, RAG-поиск и агенты на вашем сервере — пилот за пару недель покажет эффект до полного бюджета.
Обсудить проектКомментарии (0)
Пока нет комментариев — будьте первым.