Обсудить проект
Блог · инженерия ИИ

Заметки об инженерии ИИ

Как мы внедряем приватные модели, RAG и агентов в реальные процессы — без пафоса, на практике.

Локальный OCR-сервер: Tesseract против нейросетей в 2026

Что изменилось к 2026 году Ещё недавно локальный OCR в корпоративном контуре означал одну связку: Tesseract плюс самописные регулярки. К 2026 году качество оп...

Что изменилось к 2026 году

Ещё недавно локальный OCR в корпоративном контуре означал одну связку: Tesseract плюс самописные регулярки. К 2026 году качество определяют vision-language модели — Qwen2.5-VL, dots.ocr, GOT-OCR2.0, Surya, PaddleOCR-VL. Они возвращают не строку текста, а структуру: блоки, порядок чтения, координаты, таблицы и JSON по заданной схеме.

Tesseract при этом не исчез. Он остался самым дешёвым способом снять текст с чистого машинописного скана 300 dpi и до сих пор закрывает до половины страниц в типовом архиве. Вопрос не «что лучше», а «что дешевле на конкретном потоке документов».

Где Tesseract всё ещё выигрывает

На однотипных печатных документах хорошего качества Tesseract 5 с LSTM-движком даёт CER 1–3% по русскому тексту и обрабатывает страницу за 0,2–0,5 секунды на восьми ядрах CPU. Сервер без GPU обходится в 200–400 тысяч рублей и масштабируется контейнерами.

Проблемы начинаются там, где документ перестаёт быть «ровным»: перекос 2–3 градуса, шум факса, печати поверх текста, таблицы с объединёнными ячейками, рукописные вставки, бланки с плавающей вёрсткой. На таких страницах CER уходит к 15–30%, а извлечение таблиц превращается в набор эвристик, которые ломаются при смене формы документа.

Что дают нейросетевые OCR и VLM

VLM-модели уровня 7–8B в 4-битном квантовании работают на одной RTX 4090 (24 ГБ) и выдают 1,5–4 секунды на страницу. На A100 или H100 с vLLM и батчингом пропускная способность достигает десятков страниц в секунду при CER 2–5% даже на плохих сканах.

Ключевое отличие — структура. Вместо «текст + координаты» модель сразу отдаёт поля: номер, дата, ИНН, сумма, позиции таблицы. Для УПД, счетов-фактур, актов и выписок это снимает целый слой постобработки. Отдельно решается задача рукописных анкет и архивных машинописных документов 1960–1990-х, где классический OCR практически бесполезен.

Как выбрать: практические шаги

Первый шаг — собрать golden dataset из 300–1000 страниц именно вашего потока, с ручной разметкой эталонных полей. Без него сравнение превращается в спор о вкусах: метрики на чужих бенчмарках не переносятся на ваши бланки.

Второй шаг — считать не общий CER, а точность по критичным полям и стоимость ошибки. Для бухгалтерии ошибка в сумме стоит дороже, чем потерянная строка примечания.

Третий шаг — гибридная маршрутизация. Дешёвый слой на Tesseract с проверкой по словарю и регуляркам, а на сложные страницы — VLM. На практике такая схема снижает нагрузку на GPU в 2–4 раза при том же итоговом качестве.

Четвёртый шаг — контроль качества в проде: логировать уверенность модели, отправлять спорные документы на ручную проверку, дообучать промпты и словари по накопленным ошибкам.

Инфраструктура и стоимость локального контура

Локальный OCR-сервер собирается из Docker, NVIDIA Container Toolkit, очереди задач и vLLM или TensorRT-LLM для инференса. Модели хранятся в закрытом реестре, доступ — по внутреннему API, наружу не уходит ни байт.

Для 152-ФЗ и работы с персональными данными это принципиально: облачные OCR-API формально допустимы только при наличии правовых оснований и оценки рисков, а локальный контур снимает вопрос целиком. Типовой узел на RTX 4090 обходится в 1,5–3 млн рублей и окупается на потоке от 20–30 тысяч страниц в месяц. Интеграция с 1С и CRM делается через REST: на входе PDF или скан, на выходе JSON с полями и ссылкой на исходный файл.

Как мы можем помочь

Мы разворачиваем приватные OCR-контуры: подбираем модель под ваш тип документов, собираем golden dataset, настраиваем гибридную маршрутизацию Tesseract и VLM, подключаем извлечение структурированных полей и интеграцию с 1С, CRM и документооборотом. Считаем экономику на вашем объёме страниц и передаём систему с метриками качества и регламентом дообучения. Обсудить проект

OCR документов ИИ автоматизация АПС

Внедрить это в вашей компании

Приватный ИИ, RAG-поиск и агенты на вашем сервере — пилот за пару недель покажет эффект до полного бюджета.

Обсудить проект

Комментарии (0)

Пока нет комментариев — будьте первым.