Мультимодальные модели в продакшене: картинки + текст + аудио
Что меняется, когда модель видит и слышит Текстовая LLM работает с тем, что уже кто-то описал словами. Мультимодальная модель принимает исходные данные: скан...
Что меняется, когда модель видит и слышит
Текстовая LLM работает с тем, что уже кто-то описал словами. Мультимодальная модель принимает исходные данные: скан накладной, фото дефекта, запись звонка. В продакшене это снимает целый слой ручной работы — расшифровку, описание, перенос в учётную систему.
Технически это уже не экзотика: открытые Qwen2.5-VL, Llama 3.2 Vision, InternVL, связки Whisper + LLM закрывают большинство задач. Вопрос не в том, существует ли модель, а в том, как встроить её в процесс так, чтобы ошибка распознавания не уходила в 1С или CRM.
Где мультимодальность окупается
Первый сценарий — входящие документы. Счета, акты, УПД, паспорта оборудования, рукописные заявки. VLM извлекает поля в JSON, дальше правило-ориентированная валидация сверяет суммы и ИНН, и только спорные позиции уходят оператору. На потоке 2–5 тысяч документов в месяц это снимает 60–80% ручного ввода.
Второй — аудио. Голосовые обращения, звонки в поддержку, протоколы совещаний. Схема: диаризация → ASR → постобработка LLM (суммаризация, извлечение задач, классификация причин обращения). Важно не путать: ASR даёт текст, а бизнес-смысл достаёт уже языковая модель.
Третий — визуальный контроль. Фото продукции на линии, снимки с тепловизоров, кадры с камер. Модель отвечает на конкретный вопрос («есть ли скол на кромке»), а не выдаёт общее описание картинки. Формулировка промпта здесь важнее выбора модели.
Архитектура: как это собирается на практике
Продакшен-схема почти всегда гибридная. Быстрый детерминированный шаг (OCR, детекция, нарезка) выполняется специализированной моделью, а рассуждение и структурирование — VLM или LLM. Это дешевле и предсказуемее, чем пытаться решить всё одной большой моделью.
Обязательные элементы: очередь задач с ретраями, кэш по хешу файла, версионирование промптов, логирование входов и выходов, порог уверенности с эскалацией на человека. Без этого качество нечем измерять, а инциденты нечем разбирать.
Отдельно — оценка. Соберите 200–300 реальных примеров с эталонными ответами и считайте точность по полям, а не «на глаз». Метрика «доля документов, прошедших без правок оператора» понятна бизнесу и меняется предсказуемо.
Российская специфика
Ключевые ограничения — приватность и инфраструктура. Персональные данные и коммерческая тайна уходят в контур заказчика, поэтому внешние API подходят не всегда. Рабочая конфигурация: open-weight модель на своих GPU, в закрытом сегменте сети, с журналированием доступа.
По железу реалистично ориентироваться на одну-две карты уровня RTX 4090/A6000 для пилота и на пул серверов для потока. Квантованные 7–32B модели дают приемлемое качество на извлечении полей и классификации, если домен узкий и есть дообучение на своих примерах.
Для русского аудио обязательно тестируйте ASR на своих записях: качество на телефонных звонках с плохой связью и на совещаниях с несколькими голосами различается радикально. Домены вроде «номер заявки», «артикул», «ФИО» стоит добавлять в горячий словарь распознавателя.
Практические шаги
- Выберите один процесс с измеримой стоимостью ручной операции.
- Соберите датасет 200–300 реальных примеров и зафиксируйте метрику.
- Разделите пайплайн: детерминированный препроцессинг + модель + валидация правилами.
- Запустите пилот в теневом режиме рядом с человеком, сравните результаты.
- Внедряйте поэтапно: сначала подсказки оператору, потом автозаполнение полей.
Как мы можем помочь
Мы в АПС проектируем и внедряем такие системы под ключ: разворачиваем приватные мультимодальные модели в вашем контуре, собираем пайплайны OCR + VLM + ASR, интегрируем результат с 1С и CRM, настраиваем метрики качества и мониторинг. Начинаем с короткого пилота на ваших данных, чтобы вы увидели точность и экономику до масштабирования. Обсудить проект
Внедрить это в вашей компании
Приватный ИИ, RAG-поиск и агенты на вашем сервере — пилот за пару недель покажет эффект до полного бюджета.
Обсудить проектКомментарии (0)
Пока нет комментариев — будьте первым.