Обсудить проект
Блог · инженерия ИИ

Заметки об инженерии ИИ

Как мы внедряем приватные модели, RAG и агентов в реальные процессы — без пафоса, на практике.

Мультимодальные модели в продакшене: картинки + текст + аудио

Что меняется, когда модель видит и слышит Мультимодальная модель в продакшене — это не «чат, который умеет прикреплять файлы». Это сервис, который на входе пр...

Что меняется, когда модель видит и слышит

Мультимодальная модель в продакшене — это не «чат, который умеет прикреплять файлы». Это сервис, который на входе принимает изображение, текст, аудио или их комбинацию, а на выходе отдаёт структурированный результат: JSON, запись в базе, решение по заявке. Разница принципиальная: демо показывает «вау», продакшен измеряется долей корректных ответов, стоимостью запроса и предсказуемым временем отклика.

В 2024–2025 годах порог входа резко упал. Открытые vision-language модели (Qwen2.5-VL, InternVL, LLaVA-семейство) и сильные ASR-решения (Whisper, GigaAM, T-one) позволяют собрать приватный контур без отправки данных в зарубежные API. Для российского бизнеса это часто не «приятный бонус», а обязательное условие: персональные данные, коммерческая тайна, требования регуляторов.

Три потока данных и три разных инженерных задачи

Картинки. Типовые сценарии — распознавание сканов и фото документов, дефектов на производстве, полок в ритейле, показаний приборов. Здесь модель почти никогда не работает «в лоб»: сначала детекция и выравнивание, потом кроп, потом распознавание. Качество на входе определяет 80% результата.

Текст. Классический RAG: поиск по базе знаний, извлечение сущностей, генерация ответа со ссылками на источник. В мультимодальном контуре текст часто становится «клеем» — он связывает распознанный документ, транскрипт звонка и данные из CRM в единую карточку.

Аудио. Диаризация (кто говорил), транскрибация, суммаризация, извлечение договорённостей и следующих шагов. Для контакт-центров это самый быстрый путь к окупаемости: контроль качества перестаёт быть выборочным и становится сплошным.

Архитектура, которая выдерживает нагрузку

Рабочая схема выглядит так: очередь задач (Kafka или RabbitMQ) → препроцессинг (нормализация изображений, нарезка аудио по тишине) → инференс на GPU-ноде с vLLM или TensorRT-LLM → постпроцессинг и валидация по схеме → запись в целевую систему. Каждый шаг логируется отдельно, иначе при деградации качества невозможно понять, где именно сломалось.

Ключевое решение — разделять модели по задачам. Держать одну большую мультимодальную модель «на всё» дорого и медленно. На практике выгоднее ансамбль: лёгкая модель для рутинной классификации, тяжёлая — только для сложных случаев, эскалация по порогу уверенности.

Российская практика: документы, 1С, CRM

Самый востребованный сценарий — обработка входящих документов: УПД, накладные, акты, счета. Мультимодальная модель читает скан целиком, включая таблицы и печати, и возвращает поля в структуре, которую дальше принимает 1С. Это заметно устойчивее классического OCR с шаблонами: новый формат бланка не ломает процесс.

Второй по частоте кейс — речевая аналитика. Транскрипт звонка связывается с карточкой клиента в CRM, из него извлекаются возражения, обещания менеджера и причины отказа. Руководитель получает не отчёт раз в месяц, а ежедневную сводку по всем диалогам.

Важная деталь: почти всегда требуется гибридный поиск (векторный + по ключевым словам) и учёт синонимов, аббревиатур и опечаток — язык реальных документов далёк от чистого текста из обучающих датасетов.

Стоимость, задержки и метрики

Считайте не «цену за миллион токенов», а стоимость обработки одной единицы: одного документа, одного звонка, одной заявки. В неё входят GPU-часы, препроцессинг, хранение и ручная проверка сомнительных случаев. Реалистичная цель — автоматическое принятие 70–85% объёма, остальное уходит оператору.

Задержка критична для интерактивных сценариев. Если ответ нужен в чате, целевой ориентир — до 3–5 секунд на полный цикл, и здесь помогают кэширование, стриминг и предварительный прогрев моделей. Для пакетной обработки документов ночью можно пожертвовать скоростью ради качества.

Что проверить перед запуском

Соберите тестовый набор минимум из 300–500 реальных примеров, включая «грязные»: плохие сканы, шумные записи, смешанные языки. Зафиксируйте метрики до внедрения и сравните после — иначе спор о качестве останется вкусовым. Обязательно предусмотрите fallback: если модель недоступна, процесс не должен останавливаться. И заложите контур оценки (LLM-as-judge плюс ручная выборка), иначе деградация после обновления версии модели обнаружится через месяцы.

Как мы можем помочь

Мы в АПС проектируем и внедряем приватные мультимодальные контуры: разворачиваем модели на вашем железе или в изолированном облаке, собираем пайплайны для документов, аудио и изображений, интегрируем результат с 1С и CRM. Начинаем с аудита данных и пилота на одном процессе, чтобы вы увидели измеримый эффект до масштабирования. Обсудить проект

Модели ИИ автоматизация АПС

Внедрить это в вашей компании

Приватный ИИ, RAG-поиск и агенты на вашем сервере — пилот за пару недель покажет эффект до полного бюджета.

Обсудить проект

Комментарии (0)

Пока нет комментариев — будьте первым.