Обсудить проект
Блог · инженерия ИИ

Заметки об инженерии ИИ

Как мы внедряем приватные модели, RAG и агентов в реальные процессы — без пафоса, на практике.

Модели на своём железе: считаем TCO локальной LLM на 3 года

Локальный контур с открытой LLM обычно считают «на глаз»: сервер, видеокарты, электричество. На горизонте трёх лет картина другая — больше половины TCO формир...

Локальный контур с открытой LLM обычно считают «на глаз»: сервер, видеокарты, электричество. На горизонте трёх лет картина другая — больше половины TCO формируют эксплуатация, инженерные часы и утилизация железа. Ниже — рабочая модель, которую можно применить к своему профилю задач.

Из чего складывается TCO

CAPEX — железо и ввод в работу. Узел под инференс с двумя RTX 4090 (48 ГБ VRAM), 256 ГБ RAM и NVMe на 4 ТБ обходится в 1,4–1,8 млн ₽; ИБП, сетевое оборудование и СХД — ещё 150–250 тыс.; монтаж, прошивки, настройка vLLM и мониторинга — 150–300 тыс. Итого 1,7–2,3 млн ₽ на узел.

OPEX в год считаем отдельно по пяти статьям. Электричество и отвод тепла: при средней нагрузке 0,8 кВт и тарифе 7 ₽/кВт·ч это ~50 тыс. ₽ плюс 30–40% на кондиционирование. Администрирование — 0,2–0,3 FTE (250–450 тыс. ₽). Резерв на ремонт, диски и блоки питания — около 5% CAPEX. Мониторинг, бэкапы, лицензии — 50–100 тыс. Стойка в ЦОД — 180–360 тыс. при 15–30 тыс. ₽/мес.

Итого за три года: 1,7–2,3 млн CAPEX + 3 × (0,6–1,0 млн) OPEX ≈ 3,5–5,3 млн ₽. Остаточная стоимость железа на конец третьего года — 25–40% CAPEX, её корректно вычитать, если сервер продаётся или переиспользуется под другие задачи.

Где экономика ломается

Первый риск — утилизация. Простаивающий 90% времени узел стоит столько же, сколько загруженный на 70%, а себестоимость токена различается на порядок. Второй — инженерные часы: квантование, обновление весов, разбор деградации качества, переезд на новую модель — это 100–200 часов в год, которые почти никогда не попадают в бюджет.

Третий риск — смена моделей. За три года основная модель меняется 2–3 раза, и требования к VRAM растут: то, что сегодня влезает в 48 ГБ, через год может потребовать 80–96 ГБ. Закладывайте в план либо замену GPU, либо переход на более агрессивное квантование с потерей качества на части задач.

Точка безубыточности против API

Считаем в токенах. Узел на двух GPU с моделью 8–14B в 4-битном квантовании через vLLM при пакетной обработке выдаёт 1500–2500 токенов/с суммарно, то есть до 150–200 млн токенов в сутки на пределе. При TCO 4,5 млн ₽ за три года и облачной цене 0,3 ₽ за 1000 токенов безубыточность наступает на объёме около 15 млрд токенов, или 400–420 млн в месяц.

Это соответствует примерно 5 тыс. документов в сутки при 3 тыс. токенов на документ либо 1,5–2 тыс. активных пользователей чат-бота. Ниже этого порога API дешевле — если регуляторика позволяет выносить данные за контур.

Что сравнивать на самом деле

Корректная база сравнения — не API, а стоимость ручной операции. Если оператор тратит 4 минуты на документ и стоит 400 ₽/час, это ~27 ₽ за документ, или 135 тыс. ₽ в сутки на 5 тыс. документов. Локальный контур при тех же объёмах стоит 120–150 тыс. ₽ в месяц. Именно этот разрыв, а не цена токена, окупает железо.

Отдельная категория — задачи, где внешний API неприменим: персональные данные по 152-ФЗ, коммерческая тайна, гостайна, требования регулятора к хранению. Здесь TCO локального контура сравнивается не с облаком, а с отказом от автоматизации вообще.

Практические шаги

  1. Замерить объём: сколько операций в месяц, сколько токенов на операцию, где пиковые часы.
  2. Поставить пилот на одном узле на 3–4 недели и снять реальный throughput и латентность на своих данных, а не на бенчмарках.
  3. Построить модель на 36 месяцев со сценариями загрузки 20/50/80% и остаточной стоимостью железа.
  4. Сравнить три варианта: полностью локально, API, гибрид — чувствительное в контуре, массовое в облаке.
  5. Заложить в бюджет инженерные часы и одну плановую замену GPU за трёхлетку.

Как мы можем помочь

Мы в АПС считаем TCO под ваш профиль задач: разворачиваем пилотный контур на вашем или нашем железе, замеряем реальную пропускную способность на ваших документах и данных, строим финансовую модель на три года с учётом 152-ФЗ и интеграций с 1С и CRM. Обсудить проект

Бюджеты и ROI ИИ автоматизация АПС

Внедрить это в вашей компании

Приватный ИИ, RAG-поиск и агенты на вашем сервере — пилот за пару недель покажет эффект до полного бюджета.

Обсудить проект

Комментарии (0)

Пока нет комментариев — будьте первым.