MKDGRUPPMKDGRUPP

Мы используем строго необходимые cookie и — с вашего согласия — аналитические (Яндекс.Метрика). Подробнее в политике конфиденциальности.

Сколько стоит ИИ-функция в продукте: токены, кэш и счёт, который удивляет

·7 мин чтения
Сколько стоит ИИ-функция в продукте: токены, кэш и счёт, который удивляет

«Лавка чая» запустила на сайте ИИ-консультанта. Он отвечает покупателям про сорта, заказы, доставку и подбирает подарки. Тестировали на двадцати вопросах: всё работало, расходы на тесты составили несколько рублей. Запустили на весь трафик: двадцать тысяч обращений в день. Через неделю бухгалтер спросил у директора, почему в статье расходов «ИИ» несколько миллионов.

Никто не воровал, и ошибки не было. Просто стоимость ИИ-функции масштабируется вместе с использованием, а не вместе со сложностью разработки. Это принципиально иная экономика, чем у обычного кода. Разберём её на графиках, а в конце сами попробуем уложиться в бюджет.

Из чего состоит цена одного запроса

Сначала немного арифметики. Модели считают в токенах (о том, что это такое, мы говорили в статье про окно контекста), и платят отдельно за входные и выходные. Цена запроса получается простая: токены на входе умножить на цену входа, плюс токены на выходе умножить на цену выхода. Умножьте на число запросов, и получите месяц.

Самое неожиданное начинается, когда смотришь, из чего состоит вход. Человек пишет один короткий вопрос, но к нему приклеивается всё остальное:

Обратите внимание на пропорции. Вопрос покупателя, то есть единственное, что есть в запросе от живого человека, стоит копейки. Основные деньги уходят на то, что «едет» в каждом запросе одинаково: длинную инструкцию и подтянутые фрагменты базы знаний. И на ответ, который дороже входа.

Класс модели решает больше всего

Второй рычаг, который никто не ожидает, это модель. Разница между лёгкой и флагманской может составлять десятки раз. Посмотрите на тот же самый запрос на трёх классах:

Отсюда простой, но неудобный вывод: выбор модели это бизнес-решение, а не техническое. «Возьмём самую умную, чтобы не париться» превращает функцию в статью расходов, которая может обогнать пользу. Как выбирать модель под требования закона и под задачу, мы разбирали в статье про российские и зарубежные нейросети.

Рычаг первый: кэш

Теперь про то, как снижать. Начнём с самого дешёвого по усилиям. Большая часть запроса консультанта не меняется: инструкции, описание магазина, правила ответа. Если провайдер поддерживает кэширование промпта, он может хранить такую часть и читать её потом заметно дешевле. Попробуйте оценить эффект сами:

Что стоит запомнить про кэш. Он выгоден, когда общая часть большая и стабильная: у консультанта с длинной инструкцией это так. Кэш живёт ограниченное время, поэтому он работает при частых запросах и почти бесполезен, если запросы редкие. И устроен он по-разному у разных провайдеров, поэтому перед внедрением нужно открыть их документацию, а не полагаться на общие слова.

Рычаг второй: роутер

Если выбирать только один приём, то это роутер. Идея в том, что вопросы бывают разной сложности. В поддержке и консультировании огромная доля обращений типовые, и совсем не нужна сильная модель, чтобы ответить «где мой заказ». Роутер определяет сложность и отправляет вопрос подходящей модели:

Есть нюансы. Роутер сам стоит денег и добавляет задержку, хотя обычно мизерные. Он иногда ошибается: отправит сложный вопрос на лёгкую модель, и ответ выйдет слабым. Поэтому качество роутера проверяют на размеченных примерах, а для рискованных тем (деньги, юридические вопросы, здоровье) задают жёсткие правила: такие вопросы сразу идут к сильной модели или к человеку.

Остальные рычаги

Симулятор: уложитесь в бюджет

Теперь соберите всё вместе. Ассистент получает 600 000 обращений в месяц, бюджет 250 000 ₽, качество ответов должно быть не ниже 80%. Начальная конфигурация (флагман, длинный промпт, много фрагментов) стоит миллионы. Двигайте всё, что можно.

Что обычно выясняется. Ни одна «простая» крайность не работает: на самой дорогой модели бюджет улетает, на самой дешёвой качество проседает. Решает комбинация: роутер разводит запросы по моделям, кэш снимает цену с повторяющейся части, а аккуратный контекст не платит за лишнее. Заметьте и обратное: пять-шесть точных фрагментов базы знаний лучше, чем десять размытых.

Пересчитываем «Лавку»

Вернёмся к нашему магазину: 600 000 обращений в месяц, бюджет 250 000 ₽, качество ответов не ниже 80%. Начальная конфигурация (флагман, длинный промпт, восемь фрагментов) стоила миллионы. Вот как выглядит один из рабочих вариантов, к которому приводит симулятор ниже:

  1. Роутер включён. Семь запросов из десяти идут на лёгкую модель, остальные на среднюю.
  2. Кэш включён. Неизменная часть промпта читается дешевле.
  3. Системный промпт сокращён с 6 000 до 1 000 токенов: лишнее вынесено в базу знаний, подтягиваемую по необходимости.
  4. Фрагментов базы знаний пять, а не восемь: они точнее и не размывают внимание.
  5. Ответ ограничен примерно четырьмя сотнями токенов.

Итог в нашей условной модели: порядка 170 тысяч рублей в месяц при качестве около 82%. То есть в сорок с лишним раз дешевле начальной конфигурации, при том что качество упало с 94% всего на двенадцать пунктов. Это и есть «хорошая инженерия»: она не ищет волшебной модели, а убирает лишнее.

А нужен ли ИИ вообще

Прежде чем оптимизировать счёт, задайте вопрос на шаг раньше: сколько стоит та же работа без ИИ? Если обращения клиентов разбирают три сотрудника, то их месячная стоимость известна. Сравните её не с «разработкой», а с суммой разработки (разово), эксплуатации (ежемесячно), проверки качества и доработки базы знаний. ИИ выгоден там, где поток большой, вопросы повторяются, а ошибка дёшева. Если поток небольшой или цена ошибки высока, человек часто оказывается и дешевле, и надёжнее. Это не недостаток подхода, а нормальная арифметика.

Три места, где расчёт обычно врёт

История диалога. В чате с ассистентом каждый следующий ответ модель получает вместе со всей прошлой перепиской. Первое сообщение стоит копейки, двадцатое уже в десятки раз больше, потому что в него входят девятнадцать предыдущих. Если вы считали стоимость по «средней фразе», а люди ведут длинные диалоги, реальный расход будет выше. Лечится сжатием истории и ограничением длины диалога.

Агенты. Это самая большая неожиданность. Обычный ассистент делает один вызов модели на вопрос. Агент, который решает задачу сам, может сделать десятки вызовов: подумал, поискал, открыл файл, подумал снова, вызвал инструмент, проверил результат. И контекст на каждом шаге растёт. Одна «простая» задача агента может стоить как сотня вопросов в чате. Поэтому для агентов нужен потолок: максимум шагов и максимум расходов на задачу.

Повторы и ошибки. Сервис недоступен, ответ не прошёл проверку, модель выдала мусор: система пробует ещё раз. Каждая попытка оплачивается. В нормальный день это единицы процентов, а во время сбоя автоматические повторы способны удвоить счёт за час.

Что не входит в счёт за токены

Токены главная, но не единственная статья расходов. Вокруг неё живёт всё остальное. Это сервер, на котором работает ваш код. Поиск по базе знаний и хранение документов в удобном для поиска виде. Мониторинг и журнал запросов (его нужно хранить, а он содержит много текста). Оценка качества: чтобы понимать, что ассистент отвечает хорошо, нужны размеченные примеры и время человека на проверку. И поддержка: кто-то должен следить за тем, как система ведёт себя в жизни, и править базу знаний.

Опытные команды закладывают на эти статьи отдельный бюджет и не удивляются, что стоимость владения выше, чем «токены, умноженные на запросы».

Как говорить с подрядчиком про эксплуатацию

Если ИИ-функцию вам делает подрядчик, не ограничивайтесь вопросом «сколько стоит разработка». Спросите четыре вещи:

  1. Какая модель и почему? Если ответ «самая мощная», уточните, пробовали ли более лёгкие на ваших данных.
  2. Какие меры экономии заложены? Кэш, роутинг, ограничения на длину. Если ничего, это сигнал.
  3. Какой потолок расходов? Можно ли поставить лимит на ключе и получить уведомление при росте.
  4. Что будет, когда выйдет новая модель? Должна быть возможность сменить модель без переписывания продукта.

Ответы на эти четыре вопроса говорят о зрелости команды больше любых презентаций.

Что считать при планировании

Перед запуском прикиньте пять чисел. Сколько обращений в месяц будет (и что, если трафик вырастет вдвое). Какой средний размер входа и выхода (это не гадают, а измеряют на сотне реальных запросов). Какая доля запросов простая. Какое качество вам нужно и как его мерить (не на ощущениях, а на выборке вопросов с известными верными ответами). Сколько стоит ошибка: для поддержки интернет-магазина она дешевле, чем для финансового советника.

Отдельный совет про эксплуатацию. Модели меняются быстро: появляются новые, цены корректируются. Поэтому закладывайте в архитектуру возможность сменить модель без переписывания продукта. Тогда дешёвая альтернатива, которая появится через полгода, просто сэкономит вам деньги.

А про то, какие обращения вообще стоит отдавать боту, а какие нельзя, читайте в разборе ИИ-агента в поддержке. Общую арифметику вопроса «нанять, отдать на подряд или обойтись ИИ» мы раскладывали в этом материале.

Источники и что почитать

  • Anthropic: Prompt caching — как устроено кэширование и сколько стоит чтение из кэша.
  • OpenAI: Batch API — отложенная пакетная обработка по сниженной цене.
  • Прайсы провайдеров меняются часто, поэтому перед расчётами сверяйтесь с актуальными страницами тарифов.

Пишу из практики студии MKDGRUPP: перед запуском ИИ-функции считаем стоимость эксплуатации на вашем трафике и закладываем роутинг, кэш и мониторинг расходов. Подробнее: mkdgrupp.ru/uslugi/ai.

Частые вопросы

Из чего складывается стоимость ИИ-ассистента?
Из оплаты токенов на входе и на выходе (выход обычно дороже), выбранной модели, длины контекста и числа запросов. Плюс инфраструктура, поиск по базе знаний и поддержка.
Как снизить расходы на LLM без потери качества?
Кэшировать повторяющуюся часть промпта, не отправлять в модель лишнее, развести простые и сложные запросы по разным моделям и использовать отложенную обработку там, где не нужен мгновенный ответ.
Зачем нужен роутер запросов?
Большая часть запросов простая. Лёгкая модель отвечает на них за малую долю цены, а сложные уходят на сильную. Качество почти не страдает, счёт падает в разы.

Читайте также

Российские нейросети или зарубежные: как выбирать под задачу
Программирование

Российские нейросети или зарубежные: как выбирать под задачу

«Возьмём GigaChat, он наш» и «возьмём Claude, он умнее» — обе позиции одинаково плохи, потому что обе выбирают модель до того, как сформулирована задача. Разберём, по каким критериям это решается на практике.

3 мин чтения
Контекст-инжиниринг: агенту нужен не идеальный промпт, а правильно собранное окно
Программирование

Контекст-инжиниринг: агенту нужен не идеальный промпт, а правильно собранное окно

Мы привыкли шлифовать формулировки промптов. Но у агента, который работает с кодом, решает другое: что именно лежит в его окне контекста. Разбираем на живых демо, из чего оно состоит, почему «больше» не значит «лучше» и как собрать его правильно.

7 мин чтения
Нанять разработчика, отдать на подряд или обойтись ИИ: как считать по-честному
Клиенты

Нанять разработчика, отдать на подряд или обойтись ИИ: как считать по-честному

Задача есть, бюджет ограничен, вариантов три. Обычно сравнивают оклад разработчика со сметой студии, получают, что нанять «дешевле», и на этом останавливаются. Сравнение некорректное — ниже разбор, что нужно включать в расчёт, чтобы решение было осмысленным.

3 мин чтения
ИИ-агент в поддержке: какие обращения автоматизировать, а какие нельзя
Клиенты

ИИ-агент в поддержке: какие обращения автоматизировать, а какие нельзя

«Бот закроет 80% обращений» — красивая цифра из презентаций. Реальная доля зависит от вашего потока, и главное не процент, а то, какие обращения бот закрывать не должен. Разбираем маршрутизацию на схемах и даём тренажёр на скорость.

7 мин чтения

Обсудим ваш проект?

Пришлём КП с дизайн-концептом и оценкой стоимости за 1 час. Бесплатно и ни к чему не обязывает.