Сколько стоит ИИ-функция в продукте: токены, кэш и счёт, который удивляет

«Лавка чая» запустила на сайте ИИ-консультанта. Он отвечает покупателям про сорта, заказы, доставку и подбирает подарки. Тестировали на двадцати вопросах: всё работало, расходы на тесты составили несколько рублей. Запустили на весь трафик: двадцать тысяч обращений в день. Через неделю бухгалтер спросил у директора, почему в статье расходов «ИИ» несколько миллионов.
Никто не воровал, и ошибки не было. Просто стоимость ИИ-функции масштабируется вместе с использованием, а не вместе со сложностью разработки. Это принципиально иная экономика, чем у обычного кода. Разберём её на графиках, а в конце сами попробуем уложиться в бюджет.
Из чего состоит цена одного запроса
Сначала немного арифметики. Модели считают в токенах (о том, что это такое, мы говорили в статье про окно контекста), и платят отдельно за входные и выходные. Цена запроса получается простая: токены на входе умножить на цену входа, плюс токены на выходе умножить на цену выхода. Умножьте на число запросов, и получите месяц.
Самое неожиданное начинается, когда смотришь, из чего состоит вход. Человек пишет один короткий вопрос, но к нему приклеивается всё остальное:
Обратите внимание на пропорции. Вопрос покупателя, то есть единственное, что есть в запросе от живого человека, стоит копейки. Основные деньги уходят на то, что «едет» в каждом запросе одинаково: длинную инструкцию и подтянутые фрагменты базы знаний. И на ответ, который дороже входа.
Класс модели решает больше всего
Второй рычаг, который никто не ожидает, это модель. Разница между лёгкой и флагманской может составлять десятки раз. Посмотрите на тот же самый запрос на трёх классах:
Отсюда простой, но неудобный вывод: выбор модели это бизнес-решение, а не техническое. «Возьмём самую умную, чтобы не париться» превращает функцию в статью расходов, которая может обогнать пользу. Как выбирать модель под требования закона и под задачу, мы разбирали в статье про российские и зарубежные нейросети.
Рычаг первый: кэш
Теперь про то, как снижать. Начнём с самого дешёвого по усилиям. Большая часть запроса консультанта не меняется: инструкции, описание магазина, правила ответа. Если провайдер поддерживает кэширование промпта, он может хранить такую часть и читать её потом заметно дешевле. Попробуйте оценить эффект сами:
Что стоит запомнить про кэш. Он выгоден, когда общая часть большая и стабильная: у консультанта с длинной инструкцией это так. Кэш живёт ограниченное время, поэтому он работает при частых запросах и почти бесполезен, если запросы редкие. И устроен он по-разному у разных провайдеров, поэтому перед внедрением нужно открыть их документацию, а не полагаться на общие слова.
Рычаг второй: роутер
Если выбирать только один приём, то это роутер. Идея в том, что вопросы бывают разной сложности. В поддержке и консультировании огромная доля обращений типовые, и совсем не нужна сильная модель, чтобы ответить «где мой заказ». Роутер определяет сложность и отправляет вопрос подходящей модели:
Есть нюансы. Роутер сам стоит денег и добавляет задержку, хотя обычно мизерные. Он иногда ошибается: отправит сложный вопрос на лёгкую модель, и ответ выйдет слабым. Поэтому качество роутера проверяют на размеченных примерах, а для рискованных тем (деньги, юридические вопросы, здоровье) задают жёсткие правила: такие вопросы сразу идут к сильной модели или к человеку.
Остальные рычаги
Симулятор: уложитесь в бюджет
Теперь соберите всё вместе. Ассистент получает 600 000 обращений в месяц, бюджет 250 000 ₽, качество ответов должно быть не ниже 80%. Начальная конфигурация (флагман, длинный промпт, много фрагментов) стоит миллионы. Двигайте всё, что можно.
Что обычно выясняется. Ни одна «простая» крайность не работает: на самой дорогой модели бюджет улетает, на самой дешёвой качество проседает. Решает комбинация: роутер разводит запросы по моделям, кэш снимает цену с повторяющейся части, а аккуратный контекст не платит за лишнее. Заметьте и обратное: пять-шесть точных фрагментов базы знаний лучше, чем десять размытых.
Пересчитываем «Лавку»
Вернёмся к нашему магазину: 600 000 обращений в месяц, бюджет 250 000 ₽, качество ответов не ниже 80%. Начальная конфигурация (флагман, длинный промпт, восемь фрагментов) стоила миллионы. Вот как выглядит один из рабочих вариантов, к которому приводит симулятор ниже:
- Роутер включён. Семь запросов из десяти идут на лёгкую модель, остальные на среднюю.
- Кэш включён. Неизменная часть промпта читается дешевле.
- Системный промпт сокращён с 6 000 до 1 000 токенов: лишнее вынесено в базу знаний, подтягиваемую по необходимости.
- Фрагментов базы знаний пять, а не восемь: они точнее и не размывают внимание.
- Ответ ограничен примерно четырьмя сотнями токенов.
Итог в нашей условной модели: порядка 170 тысяч рублей в месяц при качестве около 82%. То есть в сорок с лишним раз дешевле начальной конфигурации, при том что качество упало с 94% всего на двенадцать пунктов. Это и есть «хорошая инженерия»: она не ищет волшебной модели, а убирает лишнее.
А нужен ли ИИ вообще
Прежде чем оптимизировать счёт, задайте вопрос на шаг раньше: сколько стоит та же работа без ИИ? Если обращения клиентов разбирают три сотрудника, то их месячная стоимость известна. Сравните её не с «разработкой», а с суммой разработки (разово), эксплуатации (ежемесячно), проверки качества и доработки базы знаний. ИИ выгоден там, где поток большой, вопросы повторяются, а ошибка дёшева. Если поток небольшой или цена ошибки высока, человек часто оказывается и дешевле, и надёжнее. Это не недостаток подхода, а нормальная арифметика.
Три места, где расчёт обычно врёт
История диалога. В чате с ассистентом каждый следующий ответ модель получает вместе со всей прошлой перепиской. Первое сообщение стоит копейки, двадцатое уже в десятки раз больше, потому что в него входят девятнадцать предыдущих. Если вы считали стоимость по «средней фразе», а люди ведут длинные диалоги, реальный расход будет выше. Лечится сжатием истории и ограничением длины диалога.
Агенты. Это самая большая неожиданность. Обычный ассистент делает один вызов модели на вопрос. Агент, который решает задачу сам, может сделать десятки вызовов: подумал, поискал, открыл файл, подумал снова, вызвал инструмент, проверил результат. И контекст на каждом шаге растёт. Одна «простая» задача агента может стоить как сотня вопросов в чате. Поэтому для агентов нужен потолок: максимум шагов и максимум расходов на задачу.
Повторы и ошибки. Сервис недоступен, ответ не прошёл проверку, модель выдала мусор: система пробует ещё раз. Каждая попытка оплачивается. В нормальный день это единицы процентов, а во время сбоя автоматические повторы способны удвоить счёт за час.
Что не входит в счёт за токены
Токены главная, но не единственная статья расходов. Вокруг неё живёт всё остальное. Это сервер, на котором работает ваш код. Поиск по базе знаний и хранение документов в удобном для поиска виде. Мониторинг и журнал запросов (его нужно хранить, а он содержит много текста). Оценка качества: чтобы понимать, что ассистент отвечает хорошо, нужны размеченные примеры и время человека на проверку. И поддержка: кто-то должен следить за тем, как система ведёт себя в жизни, и править базу знаний.
Опытные команды закладывают на эти статьи отдельный бюджет и не удивляются, что стоимость владения выше, чем «токены, умноженные на запросы».
Как говорить с подрядчиком про эксплуатацию
Если ИИ-функцию вам делает подрядчик, не ограничивайтесь вопросом «сколько стоит разработка». Спросите четыре вещи:
- Какая модель и почему? Если ответ «самая мощная», уточните, пробовали ли более лёгкие на ваших данных.
- Какие меры экономии заложены? Кэш, роутинг, ограничения на длину. Если ничего, это сигнал.
- Какой потолок расходов? Можно ли поставить лимит на ключе и получить уведомление при росте.
- Что будет, когда выйдет новая модель? Должна быть возможность сменить модель без переписывания продукта.
Ответы на эти четыре вопроса говорят о зрелости команды больше любых презентаций.
Что считать при планировании
Перед запуском прикиньте пять чисел. Сколько обращений в месяц будет (и что, если трафик вырастет вдвое). Какой средний размер входа и выхода (это не гадают, а измеряют на сотне реальных запросов). Какая доля запросов простая. Какое качество вам нужно и как его мерить (не на ощущениях, а на выборке вопросов с известными верными ответами). Сколько стоит ошибка: для поддержки интернет-магазина она дешевле, чем для финансового советника.
Отдельный совет про эксплуатацию. Модели меняются быстро: появляются новые, цены корректируются. Поэтому закладывайте в архитектуру возможность сменить модель без переписывания продукта. Тогда дешёвая альтернатива, которая появится через полгода, просто сэкономит вам деньги.
А про то, какие обращения вообще стоит отдавать боту, а какие нельзя, читайте в разборе ИИ-агента в поддержке. Общую арифметику вопроса «нанять, отдать на подряд или обойтись ИИ» мы раскладывали в этом материале.
Источники и что почитать
- Anthropic: Prompt caching — как устроено кэширование и сколько стоит чтение из кэша.
- OpenAI: Batch API — отложенная пакетная обработка по сниженной цене.
- Прайсы провайдеров меняются часто, поэтому перед расчётами сверяйтесь с актуальными страницами тарифов.
Пишу из практики студии MKDGRUPP: перед запуском ИИ-функции считаем стоимость эксплуатации на вашем трафике и закладываем роутинг, кэш и мониторинг расходов. Подробнее: mkdgrupp.ru/uslugi/ai.
Частые вопросы
- Из чего складывается стоимость ИИ-ассистента?
- Из оплаты токенов на входе и на выходе (выход обычно дороже), выбранной модели, длины контекста и числа запросов. Плюс инфраструктура, поиск по базе знаний и поддержка.
- Как снизить расходы на LLM без потери качества?
- Кэшировать повторяющуюся часть промпта, не отправлять в модель лишнее, развести простые и сложные запросы по разным моделям и использовать отложенную обработку там, где не нужен мгновенный ответ.
- Зачем нужен роутер запросов?
- Большая часть запросов простая. Лёгкая модель отвечает на них за малую долю цены, а сложные уходят на сильную. Качество почти не страдает, счёт падает в разы.



