Обсудить проект
Блог · инженерия ИИ

Заметки об инженерии ИИ

Как мы внедряем приватные модели, RAG и агентов в реальные процессы — без пафоса, на практике.

DeepSeek-V3.1: гибридное мышление для агентностей

DeepSeek-V3.1 — это не просто очередная ревизия открытой модели. Ключевое отличие в том, что разработчик объединил в одном наборе весов два режима: быстрый «n...

DeepSeek-V3.1 — это не просто очередная ревизия открытой модели. Ключевое отличие в том, что разработчик объединил в одном наборе весов два режима: быстрый «non-thinking» и пошаговый «thinking» с цепочкой рассуждений. Переключение задаётся на уровне чат-шаблона, а не отдельным чекпоинтом, и это радикально упрощает архитектуру агентных систем. Для инженера это означает один эндпоинт вместо двух моделей и одну инфраструктуру вместо двух кластеров.

Что даёт гибридное мышление

Раньше приходилось выбирать: быстрая instruct-модель для рутины или reasoning-модель для сложных задач. V3.1 позволяет управлять глубиной рассуждения параметром запроса: в thinking-режиме модель строит промежуточные шаги и проверяет гипотезы, в обычном — отвечает с низкой задержкой. Архитектурно это MoE примерно на 671 млрд параметров при ~37 млрд активных на токен, контекст — 128 тыс. токенов. Такой контекст позволяет подать в один запрос документацию, логи предыдущих шагов и историю диалога, не разрезая задачу на куски.

Почему это критично для агентов

Агент — это цикл: наблюдение, планирование, вызов инструмента, проверка результата. Большая часть шагов рутинная — распарсить ответ API, вытащить поле, сверить статус, — и тратить на них reasoning-токены дорого и медленно. Гибридность даёт естественное разделение: планировщик работает в thinking-режиме, исполнители — в обычном. Вторая причина не менее важна: V3.1 заметно улучшил стабильность tool calling и соблюдение JSON-схем, а для продакшн-агента доля «сломанных» шагов важнее прироста на академических бенчмарках.

Российская практика

В российских проектах модель чаще всего разворачивают on-premise: веса открыты, лицензия допускает коммерческое использование. Типовой стек — vLLM или SGLang на локальных GPU, прокси с авторизацией и логированием, изоляция периметра под требования 152-ФЗ. Реальные сценарии уже устоялись: разбор входящих документов через OCR с последующей проверкой реквизитов, ассистент по внутренней нормативке на RAG, агент для сверки данных между 1С и CRM. В таких задачах гибридный режим даёт предсказуемую экономику: сложные проверки идут через thinking, массовые операции — без него.

Практические шаги внедрения

Начните с замеров, а не с выбора железа. Соберите 30–50 реальных задач и прогоните их в обоих режимах, сравнивая не только качество, но и токены на задачу — на практике thinking нужен лишь в 15–20% случаев. Затем зафиксируйте контракт инструментов: JSON-схемы, таймауты, идемпотентность вызовов, потому что никакая модель не спасёт плохо описанный API. Добавьте слой валидации аргументов до исполнения и логирование траекторий агента — без этого отладка превращается в гадание. Отдельно настройте кэш и батчинг на инференс-сервере: при потоковой нагрузке это снижает стоимость кратно. И заведите офлайн-набор для регрессии, иначе при смене версии модели агент деградирует незаметно.

Ограничения, о которых стоит помнить

Открытые веса не отменяют рисков: рассуждения в thinking-режиме выглядят убедительнее, а значит ошибка в них опаснее для доверия пользователя. Модель не знает специфики вашего учёта — ей нужен RAG, справочники и правила постпроверки. Требования к железу для полной версии всё ещё высоки: нужен кластер или продуманное квантование с контролем деградации на ваших задачах.

Как мы можем помочь

Мы разворачиваем приватные LLM, включая линейку DeepSeek, на вашей инфраструктуре, строим RAG по внутренним документам и агентов с интеграцией в 1С и CRM. Начинаем с пилота на ваших данных и заранее считаем стоимость токена и задержки до продакшна. Обсудить проект.

Модели ИИ автоматизация АПС

Внедрить это в вашей компании

Приватный ИИ, RAG-поиск и агенты на вашем сервере — пилот за пару недель покажет эффект до полного бюджета.

Обсудить проект

Комментарии (0)

Пока нет комментариев — будьте первым.