ГлавнаяБлог → Сколько стоит один разговор с ИИ-асси…
Экономика ИИ · Ассистенты

Сколько стоит один разговор с ИИ-ассистентом

Экономика ИИ-ассистента на реальных данных: из чего складывается цена ответа, как она растёт с длиной диалога, кто тратит бюджет и какие механики в коде держат её в копейках

29 июня 2026 · Анжелика Матушкина · 9 мин чтения

Один из самых частых вопросов, которые мне задают предприниматели: сколько стоит бот с ИИ в месяц. Спрашивают на консультациях, на стратегических сессиях, в личке. И почти всегда ожидают услышать сумму подписки. А сумма подписки это последнее, что имеет значение, потому что настоящая стоимость ассистента складывается из токенов, которые он тратит на каждый ответ, и эта цифра у всех разная.

Эта статья про экономику. Не про качество ответов, не про настройку характера, а про рубли и копейки за один разговор. Я провела анализ на данных платформы «ИИ, расскажи», где предприниматели собирают ИИ-ассистентов без кода: несколько сотен ботов, несколько тысяч реальных диалогов с клиентами, и по каждому ответу модели в базе записано, сколько токенов он стоил. Ниже метод, цифры, механики в коде, которые снижают расход, и таблица в рублях по классам моделей и каналам доступа.

Что происходит, когда клиент пишет боту

Клиент пишет боту салона: «Сколько стоит массаж?» Шесть слов. Бот отвечает двумя строчками с ценой и предложением записаться.

В модель при этом улетело около восьми тысяч токенов. Вот из чего они собраны, в том порядке, в каком код склеивает системный промпт:

[префикс безопасности]
[ядро: имя бота, характер, базовые правила]        ~100-150 токенов
[бизнес-контекст: описание, продукт, FAQ,
 кастомная инструкция владельца]                    от 200 до 10 000+ токенов
[правила платформы: «не выдумывай», «предложи менеджера»]
[блок сбора заявок, если включён]                   ~1 000 токенов
[имя клиента, если уже известно]
[история: последние N пар «вопрос-ответ»]          N зависит от тарифа
[текущее сообщение клиента]                         6 слов

Ответ бота из этих восьми тысяч занял две-три сотни токенов. Всё остальное это вход, и модель берёт за него деньги на каждом сообщении заново, потому что между запросами она ничего не помнит.

Токен это примерно два-два с половиной символа русского текста. Инструкция на пять тысяч символов весит около двух тысяч токенов и уходит в модель с каждым сообщением клиента.

Как считала

В базе платформы каждое сообщение хранится с полем tokens_used, куда пишется usage.total_tokens из ответа API, то есть вход плюс выход за один вызов. Реплики клиента и ответы по кнопкам без вызова модели записаны с нулём. Я взяла все ответы модели, отсекла 16 записей с заведомо битым значением ровно 200 000 токенов на ответ длиной в сто символов, это артефакт одного дня, когда в поле писался лимит контекста вместо расхода, и дальше считала:

распределение токенов на ответ: среднее, медиана, 90-й процентиль;

позицию ответа внутри диалога через row_number() over (partition by dialog_id order by id) и среднюю стоимость по корзинам позиций;

распределение диалогов по числу сообщений и долю токенов, которая приходится на каждую корзину;

зависимость стоимости первого ответа от длины инструкции бота в символах;

долю ответов по каждой из механик экономии, о них ниже.

Выход в этих данных ограничен параметром max_tokens=1000, по факту ответы укладываются в две-четыре сотни. Это меньше 5% от счёта. Остальные 95% вход. Когда говорят «оптимизируйте промпты, чтобы модель отвечала короче», говорят про пять процентов.

Из чего складывается цена одного ответа

Первый ответ в диалоге, когда истории ещё нет, стоит в среднем 8 250 токенов, медиана около 5 500. Разброс большой, и объясняется он длиной инструкции, которую написал создатель бота.

Боты с инструкцией короче 500 символов тратят около 2 200 токенов на ответ. Боты с инструкцией 5–10 тысяч символов тратят около 14 800. Разница почти в семь раз, и она не зависит от того, о чём разговор. Клиент спросил про массаж, а модель прочитала весь прайс, все правила и весь FAQ, потому что они лежат в одном блоке.

Внутри блока есть части, о которых создатель обычно не думает. Если у бота включён сбор заявок, к промпту добавляется инструкция про формат заявки с примерами и правилами, когда её ставить. Это ещё около тысячи токенов на каждый ответ, а нужны они в одном ответе из пятидесяти.

Вы платите не за ответ. Вы платите за то, что бот каждый раз заново читает свою инструкцию.

Как цена растёт с длиной разговора

История хранится в Redis по ключу «бот плюс клиент», в ней держится limit × 2 последних сообщений, где limit это число пар «вопрос-ответ» по тарифу владельца. Старые сообщения выпадают.

Рост в данных выглядит так: первый ответ 8 250 токенов, ответы с шестого по десятый около 11 000, с одиннадцатого по двадцатый около 14 000, после пятидесятого около 17 800. Длинный разговор дороже короткого примерно в два раза, и дальше рост останавливается.

На тарифе с памятью в 50 пар ответы в глубине разговора стоят 16 тысяч при 8 тысячах на старте. Без лимита к пятидесятому сообщению счёт ушёл бы за сотню тысяч токенов на один ответ.

Опасение «длинные диалоги разорят» данными не подтверждается, пока память ограничена. Если она не ограничена, опасение становится правдой.

Кто на самом деле тратит бюджет

Диалоги, в которых больше пятидесяти сообщений, это 5% всех диалогов и половина всех токенов. Диалоги от двадцати сообщений это 17% диалогов и 72% токенов. Короткие разговоры до пяти сообщений, а их больше трети, съедают 5% бюджета.

Бюджет ассистента определяется не количеством клиентов, а десятком самых разговорчивых. Один клиент, который три часа обсуждал с ботом свою ситуацию, стоит как сотня клиентов, которые спросили цену и ушли. Планировать надо хвост распределения, а не среднего клиента.

Пять механик в коде, которые снижают расход

Каждую я проверила по данным, чтобы понимать реальный эффект, а не ожидаемый.

Два уровня промпта. Перед вызовом модели сообщение клиента проходит классификатор. Если это «привет», «спасибо», «понял» и подобное, в модель уходит только ядро: имя бота, характер и базовые правила. Бизнес-контекст, FAQ и блок заявок не подаются. Такой ответ стоит около 900 токенов вместо 12 200, в тринадцать раз дешевле. Сейчас ядро срабатывает на 5% ответов, потому что классификатор работает по списку точных совпадений. Фраза «спасибо, поняла, тогда завтра напишу» в список не попадает и идёт по полному тарифу. Здесь резерв: классификация по смыслу вместо списка поднимет долю лёгких ответов в несколько раз.

Лимит памяти. Число пар в истории привязано к тарифу и не бывает бесконечным. Эффект измерен выше: рост в два раза вместо линейного.

Подмена истории веб-контекстом. Когда боту нужны свежие данные с сайта владельца, страница целиком вставляется в системный промпт как блок знаний, а история разговора в этот вызов не подаётся, memory_limit принудительно ставится в ноль. Ответы с веб-данными стоят 13 900 токенов против 11 500 у обычных, на 21% дороже, хотя внутри целая страница. Если бы подавалось и то и другое, вышло бы около 20 тысяч.

Сценарии без модели. Владелец может повесить на кнопки готовые тексты: описание курса, документы, условия, подарок. По нажатию модель не вызывается, ответ стоит ноль и записывается с tokens_used = 0. Доля таких ответов зависит от того, как настроен бот: от 2% в одни месяцы до 27% в другие. В лучший месяц каждый четвёртый ответ клиенту ушёл без единого токена. Из пяти механик эта самая сильная, и она целиком в руках владельца.

Предел длины ответа. max_tokens=1000 держит выходную часть счёта в пределах 5% и не даёт боту писать простыни, которые в мессенджере никто не читает.

Все пять вместе меняют цену на десятки процентов. Дальше про то, что меняет её в разы.

Класс модели и канал доступа

Платформа работает на gpt-4o-mini. Тот же разговор на модели классом выше, gpt-4o, стоит в 17 раз дороже по прайсу OpenAI. Если ходить к модели не по своему ключу, а через российский сервис-посредник, к этому добавляется ещё от полутора до трёх с лишним раз в зависимости от сервиса и его курса.

Таблица в рублях. Курс средний за июнь-август 2026 по ЦБ, 78 рублей за доллар; сентябрьский уже около 87, при нём долларовые строки выше на 11%. Для посредников взяты открытые прайсы двух российских сервисов на сентябрь 2026, обозначены как А и Б. Соотношение входа и выхода 95 к 5, как в данных.

mini, свой ключmini, сервис Аmini, сервис Б4o, свой ключ4o, сервис А4o, сервис Б
один ответ, 11,6 тыс. токенов0,16 ₽0,24 ₽0,52 ₽2,6 ₽4,0 ₽8,6 ₽
типичный диалог, 22 тыс.0,30 ₽0,46 ₽0,99 ₽4,9 ₽7,5 ₽16 ₽
средний диалог, 76 тыс.1,0 ₽1,6 ₽3,4 ₽17 ₽26 ₽56 ₽
длинный диалог, 680 тыс.9 ₽14 ₽30 ₽153 ₽233 ₽504 ₽
тысяча средних диалогов1 030 ₽1 570 ₽3 400 ₽17 100 ₽26 100 ₽56 400 ₽

На mini через свой ключ тысяча диалогов с клиентами стоит как один обед. На связке «gpt-4o через сервис Б» та же тысяча стоит как месячная зарплата менеджера. Между этими двумя клетками таблицы разница в 55 раз при одинаковых диалогах и одинаковой инструкции.

Пять механик из прошлого раздела на mini экономят копейки, и это нормально. Они нужны не для того, чтобы удешевить дешёвое. Они нужны в момент, когда задача требует модель классом выше: там каждая лишняя тысяча токенов это уже рубли, и тот же лимит памяти или те же кнопки без модели превращаются из аккуратности в деньги.

Отсюда порядок работы над стоимостью. Сначала модель и канал: здесь разница между вариантами в разы, от 1,5 до 55. Потом инструкция, память и кнопки: здесь разница в десятки процентов. Большинство делает наоборот и неделю ужимает промпт на модели, которая для задачи избыточна в семнадцать раз.

Чек-лист для своего ассистента

Какая модель под ботом и через какой канал. Свой ключ против посредника это до трёх раз, класс модели до семнадцати.

Сколько весит инструкция в символах и какие её части уходят в каждый запрос, хотя нужны в одном из пятидесяти.

Есть ли лёгкий режим для «привет-спасибо-понял» и по какому правилу он срабатывает.

Какие ответы можно отдать кнопками без модели: условия, документы, расписание, базовые цены.

Ограничена ли память и каким числом пар. Если нет, один длинный клиент стоит как сто коротких.

Ограничена ли длина ответа.

Кто ваши 5% самых длинных диалогов и во что они обходятся. Бюджет считается по ним.

Пройдите по этому списку со своим ботом. Обычно закрыты два-три пункта, и первый из открытых, модель и канал, стоит дороже всех остальных вместе взятых.

Про экономику ассистентов на сильных моделях, где токены уже не копейки и механики другие, будет отдельная статья.

Анжелика Матушкина - автор книги «Как войти в эпоху ИИ», основатель агентства NeyroVerse, выпускница НИЯУ МИФИ, кафедра «Управляющие интеллектуальные системы». Четвёртый год проектирует агентские системы и RAG-контуры для бизнеса. Платформа «ИИ, расскажи» - конструктор ИИ-ассистентов без кода: ии-расскажи.рф

У вас похожая ситуация?

Расскажите, где в вашем отделе продаж теряются деньги. Разберём, что покажет аналитика именно вашей CRM

Обсудить задачу
← Все статьи