Обсудить проект
Блог · инженерия ИИ

Заметки об инженерии ИИ

Как мы внедряем приватные модели, RAG и агентов в реальные процессы — без пафоса, на практике.

DeepSeek V3: китайский подход к открытым моделям

Что такое DeepSeek V3 и почему вокруг неё столько шума DeepSeek V3 — открытая языковая модель китайской лаборатории DeepSeek, вышедшая в конце 2024 года и обн...

Что такое DeepSeek V3 и почему вокруг неё столько шума

DeepSeek V3 — открытая языковая модель китайской лаборатории DeepSeek, вышедшая в конце 2024 года и обновлённая весной 2025-го. Заявленные бенчмарки ставят её в один ряд с GPT-4o и Claude 3.5 Sonnet, но ключевое отличие не в цифрах качества, а в том, что веса выложены в открытый доступ, а стоимость обучения оказалась на порядок ниже, чем у конкурентов. Для рынка это означает простой факт: модель уровня топовых проприетарных решений можно развернуть в собственном контуре.

Архитектура: MoE, MLA и экономика обучения

V3 построена на разреженной архитектуре Mixture-of-Experts: 671 млрд параметров всего, но на каждый токен активируется лишь 37 млрд. Это даёт качество большой модели при вычислительных затратах средней. Механизм Multi-head Latent Attention сжимает KV-кеш, что критично для длинного контекста в 128 тыс. токенов и для инференса на ограниченном числе GPU.

Отдельная инженерная находка — обучение в FP8 mixed precision и стратегия балансировки экспертов без вспомогательной функции потерь. В сумме это позволило обучить модель на 14,8 трлн токенов примерно за 2,8 млн GPU-часов H800. Оценка стоимости — около 5,6 млн долларов, что для модели такого класса выглядит почти неправдоподобно и стало главным поводом для дискуссий в индустрии.

Открытые веса и лицензия: что реально можно делать

Веса V3 доступны для скачивания, лицензия разрешает коммерческое использование с рядом ограничений — в частности, запрещено использовать выходы модели для обучения конкурирующих решений без разрешения. Это не MIT, как у линейки R1, но для корпоративного внедрения ограничения некритичны.

Практический вывод: модель можно дообучать на своих данных, ставить за периметр и не отправлять ни один запрос во внешний API. Для организаций, работающих с персональными данными и коммерческой тайной, это принципиальный аргумент.

Китайский подход: инженерная эффективность вместо масштаба

Главный урок DeepSeek — не «догнать и перегнать», а выжать максимум из доступного железа. Пока западные лаборатории наращивали кластеры, китайская команда оптимизировала память, точность вычислений и балансировку нагрузки. Результат — модель, которую можно запустить на восьми ускорителях H100 в FP8, а в 4-битном квантовании — на существенно более скромной конфигурации.

Это меняет планирование бюджетов: вместо аренды облачных API появляется сценарий собственного inference-сервера с предсказуемой стоимостью владения. Для российских компаний, ограниченных в доступе к зарубежным облакам, такой вариант часто единственно реалистичный.

Практика в России: где это применимо

Типовые сценарии — внутренний ассистент по нормативной базе, разбор договоров, генерация описаний товаров, суммаризация переписки с клиентами, помощь в написании SQL и кода 1С. Связка V3 с RAG по корпоративным документам закрывает большую часть запросов, где раньше требовался внешний сервис.

Разворачивают обычно через vLLM или SGLang на серверах с GPU, реже — через Ollama для пилотов. На Astra Linux и РЕД ОС стек работает штатно. Отдельная тема — интеграция с 1С и CRM: модель выступает как сервис, к которому обращаются по внутреннему API, а логирование и разграничение доступа реализуются на стороне заказчика.

Как развернуть: практические шаги

  1. Определите класс задач и требуемый контекст — от этого зависит выбор между полной V3 и дистиллированными версиями.
  2. Посчитайте память: FP8 требует около 700 ГБ, 4-битный квант — порядка 200–250 ГБ, плюс запас на KV-кеш.
  3. Соберите пилот на 2–4 недели с фиксированным набором из 50–100 реальных запросов и метриками качества.
  4. Настройте RAG-контур: чанкинг документов, эмбеддинги, гибридный поиск, переранжирование.
  5. Заложите мониторинг галлюцинаций и регрессионные тесты перед каждым обновлением модели.

Главная ошибка — начинать с железа. Сначала сценарий и метрика, потом инфраструктура.

Как мы можем помочь

Мы в АПС разворачиваем открытые модели в закрытом контуре заказчика, строим RAG по внутренним документам и подключаем ИИ к 1С и CRM. Проведём аудит задач, подберём конфигурацию под ваш бюджет и доведём пилот до промышленной эксплуатации. Обсудить проект

Модели ИИ автоматизация АПС

Внедрить это в вашей компании

Приватный ИИ, RAG-поиск и агенты на вашем сервере — пилот за пару недель покажет эффект до полного бюджета.

Обсудить проект

Комментарии (0)

Пока нет комментариев — будьте первым.