Обсудить проект
Блог · инженерия ИИ

Заметки об инженерии ИИ

Как мы внедряем приватные модели, RAG и агентов в реальные процессы — без пафоса, на практике.

Qwen3: смешанное мышление и гибридный режим

Гибридный режим: одна модель вместо двух Qwen3 — семейство открытых моделей Alibaba, вышедшее в 2025 году, в котором на уровне обучения объединены два режима...

Гибридный режим: одна модель вместо двух

Qwen3 — семейство открытых моделей Alibaba, вышедшее в 2025 году, в котором на уровне обучения объединены два режима работы: «мышление» (thinking) и быстрый ответ (non-thinking). Раньше под задачи рассуждений брали одну модель, под диалог и извлечение данных — другую. Теперь переключение происходит внутри одного инференса. Линейка включает две MoE-модели (235B-A22B и 30B-A3B) и шесть плотных (0.6B–32B), что позволяет подобрать вариант под конкретное железо.

Как устроено смешанное мышление

В thinking-режиме модель генерирует цепочку рассуждений перед финальным ответом — это заметно повышает качество на математике, коде и многошаговых инструкциях. В non-thinking режиме тот же вес отвечает сразу, без промежуточных токенов, что снижает задержку и стоимость. Переключение задаётся параметром enable_thinking в chat-шаблоне, а также «мягкими» маркерами /think и /no_think прямо в промпте. Отдельно управляется thinking budget — лимит токенов на рассуждение, который позволяет не тратить ресурс на простых запросах.

Почему это важно для продакшена

Главная выгода — экономика инференса. Держать одну модель в двух режимах дешевле, чем две модели: меньше VRAM, один пайплайн деплоя, одна система мониторинга. MoE-версии активируют лишь часть параметров на токен (у 235B-A22B — около 22 млрд активных), поэтому пропускная способность выше, чем у плотной модели сопоставимого размера. Для российских команд это критично: GPU-ресурсы ограничены, а требования к latency в чат-ботах и голосовых ассистентах жёсткие.

Российская практика

Типовой сценарий — маршрутизация запросов внутри одного сервиса. Простые вопросы (статус заказа, выбор из справочника, нормализация адреса) уходят в non-thinking; расчёты, разбор договора, генерация SQL к 1С или построение плана действий агента — в thinking. Qwen3 уверенно работает в tool-calling и по протоколу MCP, поэтому её часто ставят ядром ИИ-агента поверх внутренних API. В RAG-контурах модель удобно применять для переранжирования и синтеза ответа по найденным фрагментам, ограничивая thinking budget, чтобы не платить за лишние токены.

Практические шаги внедрения

  1. Выберите размер под задачу: 4B–8B для классификации и извлечения сущностей, 14B–32B для диалогов и RAG, MoE — когда нужен максимум качества при приемлемой задержке.
  2. Разверните через vLLM или SGLang для продакшена, через Ollama/llama.cpp — для прототипа и локальных стендов.
  3. Квантуйте под своё железо: AWQ/GPTQ для GPU, GGUF Q4–Q5 для CPU-контуров. Деградацию проверяйте на своём наборе, а не на публичных бенчмарках.
  4. Настройте политику режимов: правила роутинга по типу запроса, лимиты thinking budget, таймауты и фолбэк в non-thinking.
  5. Заложите оценку качества: набор из 100–300 реальных кейсов, метрики точности и p95-задержки, регрессионные прогоны при каждом обновлении.

На что смотреть

Thinking-режим расходует в разы больше токенов, а при потоковой выдаче пользователь видит «паузу» перед ответом — это стоит маскировать индикатором прогресса или стримингом рассуждений. Лицензия Apache 2.0 упрощает юридическую сторону, но данные всё равно разумно держать в закрытом контуре, если речь о персональных данных и коммерческой тайне. И не забывайте про дообучение: LoRA на 5–10 тыс. доменных примеров часто даёт больше, чем переход на модель крупнее.

Как мы можем помочь

Мы в АПС разворачиваем Qwen3 и другие открытые модели в приватном контуре заказчика, настраиваем гибридный режим под конкретные сценарии, собираем RAG и ИИ-агентов с интеграцией в 1С и CRM. Проведём замер на ваших данных и покажем, где thinking реально повышает качество, а где достаточно быстрого режима. Обсудить проект.

Модели ИИ автоматизация АПС

Внедрить это в вашей компании

Приватный ИИ, RAG-поиск и агенты на вашем сервере — пилот за пару недель покажет эффект до полного бюджета.

Обсудить проект

Комментарии (0)

Пока нет комментариев — будьте первым.