Обсудить проект
Блог · инженерия ИИ

Заметки об инженерии ИИ

Как мы внедряем приватные модели, RAG и агентов в реальные процессы — без пафоса, на практике.

Мультимодальные модели в продакшене: картинки + текст + аудио

Что меняется, когда модель видит и слышит Текстовая LLM работает с тем, что уже кто-то описал словами. Мультимодальная модель принимает исходные данные: скан...

Что меняется, когда модель видит и слышит

Текстовая LLM работает с тем, что уже кто-то описал словами. Мультимодальная модель принимает исходные данные: скан накладной, фото дефекта, запись звонка. В продакшене это снимает целый слой ручной работы — расшифровку, описание, перенос в учётную систему.

Технически это уже не экзотика: открытые Qwen2.5-VL, Llama 3.2 Vision, InternVL, связки Whisper + LLM закрывают большинство задач. Вопрос не в том, существует ли модель, а в том, как встроить её в процесс так, чтобы ошибка распознавания не уходила в 1С или CRM.

Где мультимодальность окупается

Первый сценарий — входящие документы. Счета, акты, УПД, паспорта оборудования, рукописные заявки. VLM извлекает поля в JSON, дальше правило-ориентированная валидация сверяет суммы и ИНН, и только спорные позиции уходят оператору. На потоке 2–5 тысяч документов в месяц это снимает 60–80% ручного ввода.

Второй — аудио. Голосовые обращения, звонки в поддержку, протоколы совещаний. Схема: диаризация → ASR → постобработка LLM (суммаризация, извлечение задач, классификация причин обращения). Важно не путать: ASR даёт текст, а бизнес-смысл достаёт уже языковая модель.

Третий — визуальный контроль. Фото продукции на линии, снимки с тепловизоров, кадры с камер. Модель отвечает на конкретный вопрос («есть ли скол на кромке»), а не выдаёт общее описание картинки. Формулировка промпта здесь важнее выбора модели.

Архитектура: как это собирается на практике

Продакшен-схема почти всегда гибридная. Быстрый детерминированный шаг (OCR, детекция, нарезка) выполняется специализированной моделью, а рассуждение и структурирование — VLM или LLM. Это дешевле и предсказуемее, чем пытаться решить всё одной большой моделью.

Обязательные элементы: очередь задач с ретраями, кэш по хешу файла, версионирование промптов, логирование входов и выходов, порог уверенности с эскалацией на человека. Без этого качество нечем измерять, а инциденты нечем разбирать.

Отдельно — оценка. Соберите 200–300 реальных примеров с эталонными ответами и считайте точность по полям, а не «на глаз». Метрика «доля документов, прошедших без правок оператора» понятна бизнесу и меняется предсказуемо.

Российская специфика

Ключевые ограничения — приватность и инфраструктура. Персональные данные и коммерческая тайна уходят в контур заказчика, поэтому внешние API подходят не всегда. Рабочая конфигурация: open-weight модель на своих GPU, в закрытом сегменте сети, с журналированием доступа.

По железу реалистично ориентироваться на одну-две карты уровня RTX 4090/A6000 для пилота и на пул серверов для потока. Квантованные 7–32B модели дают приемлемое качество на извлечении полей и классификации, если домен узкий и есть дообучение на своих примерах.

Для русского аудио обязательно тестируйте ASR на своих записях: качество на телефонных звонках с плохой связью и на совещаниях с несколькими голосами различается радикально. Домены вроде «номер заявки», «артикул», «ФИО» стоит добавлять в горячий словарь распознавателя.

Практические шаги

  1. Выберите один процесс с измеримой стоимостью ручной операции.
  2. Соберите датасет 200–300 реальных примеров и зафиксируйте метрику.
  3. Разделите пайплайн: детерминированный препроцессинг + модель + валидация правилами.
  4. Запустите пилот в теневом режиме рядом с человеком, сравните результаты.
  5. Внедряйте поэтапно: сначала подсказки оператору, потом автозаполнение полей.

Как мы можем помочь

Мы в АПС проектируем и внедряем такие системы под ключ: разворачиваем приватные мультимодальные модели в вашем контуре, собираем пайплайны OCR + VLM + ASR, интегрируем результат с 1С и CRM, настраиваем метрики качества и мониторинг. Начинаем с короткого пилота на ваших данных, чтобы вы увидели точность и экономику до масштабирования. Обсудить проект

Модели ИИ автоматизация АПС

Внедрить это в вашей компании

Приватный ИИ, RAG-поиск и агенты на вашем сервере — пилот за пару недель покажет эффект до полного бюджета.

Обсудить проект

Комментарии (0)

Пока нет комментариев — будьте первым.