Обсудить проект
Блог · инженерия ИИ

Заметки об инженерии ИИ

Как мы внедряем приватные модели, RAG и агентов в реальные процессы — без пафоса, на практике.

Qwen 2.5-72B: открытая модель для локального сервера

Qwen 2.5-72B — плотная открытая модель на 72 млрд параметров от Alibaba Cloud, которую можно развернуть в закрытом контуре и не отправлять во внешние API ни о...

Qwen 2.5-72B — плотная открытая модель на 72 млрд параметров от Alibaba Cloud, которую можно развернуть в закрытом контуре и не отправлять во внешние API ни одного запроса. Для задач, где данные нельзя выносить за периметр — договоры, техдокументация, кадровые и финансовые документы, — это один из немногих вариантов уровня топовых коммерческих моделей, доступных полностью локально.

Что даёт локальный запуск

Ключевое преимущество — контроль: вы сами задаёте политику логирования, сроки хранения промптов и правила доступа сотрудников. Модель не обучается на ваших данных, а весь трафик остаётся внутри сети, что снимает значительную часть вопросов по 152-ФЗ и внутренним регламентам ИБ. Дополнительно исчезает зависимость от курса, лимитов и внезапных изменений тарифов зарубежных провайдеров.

Архитектура и возможности

Qwen 2.5-72B — decoder-only трансформер с 64 слоями, grouped-query attention (64 головы запросов на 8 голов ключей и значений), RMSNorm и SwiGLU. Контекст — до 128 тыс. токенов, поэтому в промпт целиком помещаются длинные регламенты, тендерная документация или несколько десятков страниц переписки. Обучение велось на 18 трлн токенов с упором на мультиязычность: русский модель держит уверенно, но на сложных юридических формулировках всё равно требует проверки человеком.

Сколько нужно железа

В bf16 веса занимают около 145 ГБ, поэтому практичный минимум — два ускорителя по 80 ГБ (A100 или H100) либо четыре 48-гигабайтные карты. Для сервера с 4×RTX 4090 (24 ГБ) реалистичен запуск в 4-битном квантовании: AWQ или GPTQ дают ~40–45 ГБ и работают через vLLM, а GGUF Q4_K_M (~47 ГБ) — через llama.cpp или Ollama. Квантование теряет единицы процентов качества на типовых задачах, но заметнее бьёт по математике и длинным цепочкам рассуждений.

Движки и скорость

Для многопользовательской нагрузки выбирают vLLM или TensorRT-LLM: непрерывная батчинг-обработка позволяет держать десятки одновременных запросов на одной паре GPU. Одиночный сервер на llama.cpp выдаёт порядка 10–20 токенов в секунду на 4-битной модели — этого достаточно для внутреннего чата и пакетной обработки документов. Перед закупкой железа стоит прогнать замеры на своих промптах: цифры из бенчмарков плохо переносятся на реальные длины контекста.

Дообучение и RAG

В большинстве корпоративных сценариев дообучение не требуется: связка RAG плюс few-shot примеры закрывает поиск по базе знаний, извлечение полей и подготовку черновиков. Если нужен свой стиль ответов или жёсткий формат вывода (JSON для интеграции с 1С, CRM, BPM), применяют QLoRA на 1–2 тыс. качественных примеров — это укладывается в одну 80-гигабайтную карту. Дообучение на сырых логах без разметки обычно даёт деградацию, а не прирост.

Российская практика

В отечественных внедрениях Qwen 2.5-72B чаще всего ставится на разбор входящего потока документов: сканы счетов и накладных после OCR, сверка условий договоров, ответы по внутренней нормативке, генерация описаний в каталогах. Типовая схема — сервер с двумя GPU в защищённом сегменте, векторная база (Qdrant или pgvector) и слой интеграции, который возвращает результат в учётную систему. Отдельный момент — лицензия Qwen допускает коммерческое использование, но требует атрибуции, поэтому юридическую проверку условий под конкретный продукт лучше провести заранее.

Практические шаги внедрения

Начните с пилота на одном сценарии и фиксированной выборке из 100–200 реальных запросов — это даст объективную метрику качества вместо впечатления от демонстрации. Затем подберите квантование и движок под нужную пропускную способность, настройте мониторинг (латентность, доля отказов, стоимость обработки одного запроса) и только после этого масштабируйте на смежные процессы. Разумный резерв — держать меньшую модель (Qwen 2.5-32B или 14B) для простых запросов и маршрутизировать сложные на 72B.

Как мы можем помочь

Мы разворачиваем приватные LLM в контуре заказчика: подбираем железо и квантование, настраиваем vLLM или llama.cpp, собираем RAG по вашим документам, дообучаем под требуемый формат вывода и интегрируем с 1С и CRM. Если нужен расчёт под ваш сценарий и объём запросов — Обсудить проект.

Модели ИИ автоматизация АПС

Внедрить это в вашей компании

Приватный ИИ, RAG-поиск и агенты на вашем сервере — пилот за пару недель покажет эффект до полного бюджета.

Обсудить проект

Комментарии (0)

Пока нет комментариев — будьте первым.