Сколько токенов жрёт ваш бизнес: считаем стоимость владения LLM
Токен — это не абстракция, а строка в счёте Когда обсуждают внедрение ИИ, почти никогда не считают, сколько стоит один запрос к модели. А ведь LLM — редкая ча...
Токен — это не абстракция, а строка в счёте
Когда обсуждают внедрение ИИ, почти никогда не считают, сколько стоит один запрос к модели. А ведь LLM — редкая часть ИТ-ландшафта, где расходы растут линейно от активности пользователей: чем успешнее пилот, тем быстрее увеличивается счёт. Поэтому стоимость владения LLM нужно считать до запуска, а не после первого «сюрприза» в биллинге.
Из чего складывается стоимость владения
Прямые расходы — это входные токены (системный промпт, RAG-контекст, история диалога), выходные токены (обычно в 3–5 раз дороже входных), эмбеддинги для индексации и пересборка индекса при каждом обновлении базы знаний. Косвенные — векторная база, оркестратор, логирование, GPU или аренда мощностей, интеграции с 1С и CRM, мониторинг качества, дообучение. В зрелых проектах инференс занимает лишь 30–50% бюджета, остальное — инфраструктура и работа инженеров.
Почему счёт растёт незаметно
Три типовые причины. Первая — раздутый контекст: в промпт кладут 15–20 чанков из RAG «на всякий случай», хотя релевантных обычно 3–5. Вторая — агентные циклы: задача решается за 4–6 вызовов модели вместо одного, и каждый шаг тащит за собой всю предыдущую переписку. Третья — отсутствие кэширования: неизменный системный промпт и инструкции оплачиваются заново при каждом обращении.
Как посчитать unit-экономику
Возьмите один сценарий и посчитайте его целиком. Пример: сервис обрабатывает 50 000 обращений в месяц, на каждое уходит 6 000 входных токенов (с учётом шагов агента) и 400 выходных. Это 300 млн входных и 20 млн выходных токенов. При условных 300 ₽ за миллион входных и 1 200 ₽ за миллион выходных получается около 114 000 ₽ в месяц только за инференс — плюс инфраструктура и поддержка.
Дальше считайте не «цену токена», а стоимость бизнес-результата: обработка одного документа, одного звонка, одного ответа клиенту. Если ИИ закрывает 40% обращений в поддержку, сравните расходы с ФОТ операторов — и только тогда решение становится обоснованным. Обязательно заложите рост: пилот на 20 пользователей и продуктив на 500 — это разница в расходах на порядок.
Что реально снижает расходы
Кэширование промптов снимает до 80–90% затрат на повторяющемся префиксе. Роутинг моделей — простые запросы (классификация, извлечение полей) уходят на компактную модель, сложные — на большую. Сокращение RAG-контекста и переранжирование чанков уменьшают входной промпт в 2–3 раза без потери качества. Квантизация и локальный инференс переводят переменные расходы в фиксированные: вы платите за GPU, а не за каждый токен.
Отдельно стоит посчитать батчинг и асинхронную обработку: ночная пакетная обработка документов обходится дешевле, чем интерактивные запросы в часы пик.
Российская специфика
В России к токенам добавляются два фактора. Первый — оплата зарубежных API через посредников и курсовая волатильность: бюджет, сверстанный в валюте, к концу года может отличаться в полтора раза. Второй — 152-ФЗ: персональные данные нельзя отправлять во внешние сервисы, поэтому для клиентских сценариев часто нужен локальный инференс на своих серверах.
Практика показывает: для задач с высокой нагрузкой и чувствительными данными локальный контур окупается за 6–12 месяцев. Для экспериментов и низкой нагрузки выгоднее внешние API с жёсткими лимитами и алертами по расходу.
Как мы можем помочь
Мы считаем unit-экономику вашего сценария до начала разработки: разбираем промпты, оцениваем объём контекста, подбираем модель под задачу и показываем, где расходы можно сократить в разы. Дальше — проектируем контур: внешние API или приватная LLM на ваших мощностях, RAG, агенты, интеграции с 1С и CRM. Обсудить проект — и вы получите расчёт стоимости владения, а не обещание «ИИ всё удешевит».
Внедрить это в вашей компании
Приватный ИИ, RAG-поиск и агенты на вашем сервере — пилот за пару недель покажет эффект до полного бюджета.
Обсудить проектКомментарии (0)
Пока нет комментариев — будьте первым.