Обсудить проект
Блог · инженерия ИИ

Заметки об инженерии ИИ

Как мы внедряем приватные модели, RAG и агентов в реальные процессы — без пафоса, на практике.

Mistral Medium 3: чем интересна и где применима

Mistral Medium 3 вышла в мае 2025 года и заняла нишу, которую многие компании искали давно: уровень топовых проприетарных моделей при стоимости инференса в ра...

Mistral Medium 3 вышла в мае 2025 года и заняла нишу, которую многие компании искали давно: уровень топовых проприетарных моделей при стоимости инференса в разы ниже. Для бизнеса, который считает деньги на каждом миллионе токенов, это не абстрактное улучшение, а прямая экономика проекта.

Что это за модель и в чём её особенность

Medium 3 — dense-модель с контекстом 128 тысяч токенов, поддержкой текста и изображений, а также function calling из коробки. Заявленное качество — около 90% от Claude Sonnet 3.7 на профильных бенчмарках при цене порядка $0,4 за миллион входных и $2 за миллион выходных токенов. Это примерно на порядок дешевле, чем у моделей верхнего ценового сегмента.

Ключевое отличие от открытых весов (Mistral Small 3.1, Qwen, Llama) в том, что Medium 3 не публикуется как открытая модель, но лицензия допускает развёртывание на собственной инфраструктуре — от четырёх GPU. То есть компания получает и качество проприетарного API, и возможность держать данные внутри контура.

Где модель выигрывает

Сильные стороны Medium 3 — генерация и рефакторинг кода, задачи STEM, работа с длинными документами и мультиязычные инструкции. На русском языке она заметно устойчивее мелких открытых моделей: лучше держит формат ответа, меньше «галлюцинирует» в извлечении полей и реже ломает структуру JSON при вызове функций.

Практические сценарии, где модель окупается быстрее всего: разбор входящей документации, извлечение реквизитов из сканов после OCR, ассистент по внутренней нормативке, проверка договоров на отклонения от шаблона, агентные цепочки с обращением к 1С и CRM. Во всех этих задачах важна не «глубина рассуждений», а стабильность на потоке.

Российская практика: контур, 152-ФЗ, интеграции

Для российских заказчиков главный вопрос — не бенчмарки, а размещение. Требования 152-ФЗ, госконтуры и внутренние политики ИБ часто исключают передачу данных во внешние API. Здесь Medium 3 интересна именно вариантом self-hosted: модель поднимается в ЦОДе компании или у провайдера, доступ к ней идёт через внутренний шлюз, наружу ничего не уходит.

Типовая схема, которую мы видим на проектах: модель в изолированном сегменте, векторная база с корпоративными документами, тонкий слой интеграции к 1С/CRM и логирование всех запросов для аудита. Отдельно решается вопрос с GPU — обычно это 4–8 ускорителей под нагрузку нескольких десятков одновременных запросов.

Практические шаги перед внедрением

  1. Выбрать 2–3 сценария с измеримой метрикой: доля корректно извлечённых полей, время обработки документа, процент ответов без правок оператора.
  2. Собрать golden set из 100–300 реальных примеров — без него сравнение моделей превращается в спор о вкусах.
  3. Прогнать на этом наборе Medium 3, текущую модель и одну открытую локальную. Смотреть не только на качество, но и на стабильность формата.
  4. Посчитать TCO: стоимость токенов через API против затрат на GPU, электричество и сопровождение.
  5. Разворачивать через OpenAI-совместимый API (vLLM и аналоги) — тогда смена модели не потребует переписывать код приложения.
  6. Добавить RAG поверх корпоративных документов и кэширование промптов: на повторяющихся запросах это снижает расходы на 30–50%.

Ограничения, о которых стоит знать

Веса закрыты, поэтому свободно дообучать модель под узкую задачу не получится — доступен только fine-tuning через вендора. Для простых задач (классификация, короткие ответы по шаблону) Medium 3 избыточна, там дешевле открытые модели на 7–12B. И на сложных многошаговых рассуждениях она уступает специализированным reasoning-моделям — её стоит ставить в поток, а не в самые «умные» сценарии.

Оптимальная стратегия — маршрутизация: простые запросы уходят на локальную малую модель, средние и сложные — на Medium 3, а редкие пиковые задачи — на топовую модель через API.

Как мы можем помочь

Мы разворачиваем приватные LLM в контуре заказчика, строим RAG по корпоративным документам, подключаем OCR и интегрируем модели с 1С и CRM. Если вы хотите проверить Medium 3 на своих данных — соберём пилот на ваших примерах, замерим качество и стоимость до промышленного запуска. Обсудить проект

Модели ИИ автоматизация АПС

Внедрить это в вашей компании

Приватный ИИ, RAG-поиск и агенты на вашем сервере — пилот за пару недель покажет эффект до полного бюджета.

Обсудить проект

Комментарии (0)

Пока нет комментариев — будьте первым.