Стоимость токена нейросети в рублях: тарифы GigaChat и YandexGPT
Разбираем тарифы на токены GigaChat, YandexGPT и DeepSeek в рублях на сентябрь 2026. Посчитали, во что обходится реальный ИИ-бот, ночная обработка и ИИ-агент.

Тысяча токенов у моделей, доступных в России, стоит от долей копейки до 1,2 ₽. В пересчёте на один реальный разговор бота с клиентом это даёт вилку от 3 копеек до 2,4 ₽. Владельцу небольшого бизнеса выбирать модель по цене токена почти бессмысленно: дороже всего обходится не токен, а ошибка бота перед клиентом. Считать расходы надо по-разному, смотря что именно делает нейросеть.
Что такое токен и за что вы платите
Токен — кусочек текста, примерно половина слова. Вы платите поставщику отдельно за то, что отправили нейросети, и за то, что она ответила. Обычно ответ стоит дороже.
Инструкция бота уходит в модель с каждой вашей репликой. Бот не помнит вас сам по себе — при каждом новом вопросе система заново отправляет нейросети правила её поведения, историю текущего диалога и ваш новый вопрос. За всё это вы платите по тарифу входа.
Тарифы GigaChat и YandexGPT в рублях
Вот официальные прайс-листы для бизнеса на сентябрь 2026 года.
У GigaChat цена одинакова для входного и выходного текста.
| Модель | За 1000 токенов, обычный режим | Асинхронный режим |
|---|---|---|
| GigaChat Lite | 0,065 ₽ | 0,0325 ₽ |
| GigaChat Pro | 0,5 ₽ | 0,25 ₽ |
| GigaChat Max | 0,65 ₽ | 0,325 ₽ |
Минимальный платёж у Сбера — 600 ₽ в месяц, даже если бот почти не работал. Пакеты продаются на 12 месяцев: например, 1 миллиард токенов Lite обойдётся в 65 000 ₽.
У Yandex AI Studio вход и выход стоят по-разному.
| Модель | Вход | Вход из кэша | Выход |
|---|---|---|---|
| Alice AI LLM | 0,5 ₽ | 0,5 ₽ | 1,2 ₽ |
| Alice AI LLM Flash | 0,1 ₽ | 0,025 ₽ | 0,2 ₽ |
| YandexGPT Pro 5.1 | 0,8 ₽ | 0,8 ₽ | 0,8 ₽ |
| YandexGPT Lite | 0,2 ₽ | 0,2 ₽ | 0,2 ₽ |
| DeepSeek V4 Flash | 0,3 ₽ | 0,075 ₽ | 0,5 ₽ |
| gpt-oss-20b | 0,1 ₽ | 0,1 ₽ | 0,1 ₽ |
Почему цена токена обманчива
Цена токена почти ничего не говорит о реальном счёте. Одна и та же модель обойдётся вам в совершенно разные деньги в зависимости от того, общается ли она с живым клиентом, разбирает ночные логи или работает как автономный агент.
| Задача | Что считать | Что важно |
|---|---|---|
| Чат с клиентом | цену одного разговора и месяц | скорость ответа и страховка от ошибки перед клиентом |
| Фоновая обработка (заявки, отзывы, документы ночью) | цену за объём | только цена; здесь цена токена действительно важна |
| Агентская петля (агент сам решает задачу в несколько шагов) | цену решённой задачи | провал сжигает весь бюджет; лимит на задачу и отдельный бюджет |
Поэтому мы разберём расходы для трёх разных задач по отдельности.
Задача 1. Чат с клиентом
Здесь живой человек ждёт ответа. Считать нужно цену одного разговора и ваши расходы за месяц при текущем потоке обращений. Асинхронный и пакетный режимы здесь не подходят по определению — человек уйдёт, не дождавшись ответа. Скорость ответа критична.
Мы взяли реальный диалог из трёх реплик с нашим ИИ-консультантом и прогнали его цены через все тарифы. На вход ушёл 1 931 токен, на выход — 1 086 токенов.
Наш бот работает на модели DeepSeek V4 Flash у нашего поставщика. Фактическая цена, вычисленная по нашему журналу расходов 19 сентября 2026 года: около 6,6 ₽ за миллион входных токенов и 13,2 ₽ за миллион выходных. Вход обошёлся примерно в 0,0127 ₽, выход — в 0,0143 ₽. Весь разговор стоил около 3 копеек, или 27–29 ₽ за тысячу диалогов.
У каждой модели свой «токен»: один и тот же текст они режут на разное число кусочков. Пример из документации Anthropic: их модели Claude 4.7 и новее дают примерно на 30 % больше токенов на тот же текст, чем прежние. Таблица ниже — честный ориентир порядка, а не точный счёт до копейки.
| Где и на чём | За один диалог | За 1000 диалогов |
|---|---|---|
| Наш поставщик, DeepSeek V4 Flash | 0,03 ₽ | 27 ₽ |
| GigaChat Lite, асинхронно | 0,10 ₽ | 98 ₽ |
| GigaChat Lite | 0,20 ₽ | 196 ₽ |
| Yandex, gpt-oss-20b | 0,30 ₽ | 302 ₽ |
| Alice AI LLM Flash | 0,41 ₽ | 410 ₽ |
| YandexGPT Lite | 0,60 ₽ | 603 ₽ |
| Yandex, DeepSeek V4 Flash | 1,12 ₽ | 1 122 ₽ |
| GigaChat Pro | 1,51 ₽ | 1 509 ₽ |
| GigaChat Max | 1,96 ₽ | 1 961 ₽ |
| Alice AI LLM | 2,27 ₽ | 2 269 ₽ |
| YandexGPT Pro 5.1 | 2,41 ₽ | 2 414 ₽ |
Разброс по одному и тому же разговору — около 90 раз. От 27 ₽ у нашего продавца до 2,4 тысячи рублей на старшей модели Яндекса за тысячу диалогов.
Одна и та же модель DeepSeek V4 Flash у Яндекса и у нашего поставщика отличается в цене примерно в 40 раз (300 ₽ против 6,6 ₽ за миллион входных токенов). Из открытых данных не известно, почему так происходит. За разницей всегда стоят условия: где работает модель, кто отвечает за доступность и какой договор. Эти вещи надо напрямую спрашивать у продавца.
Даже самый дорогой вариант обойдётся около 2,4 ₽ за разговор. Для небольшого бизнеса счёт за работу модели — это сотни рублей или единицы тысяч в месяц. На 600 рублей минимального платежа у GigaChat можно обработать больше 9 миллионов токенов базовой модели Lite. Небольшой автосервис или клиника с парой десятков заявок в день физически не выберут этот объём.
Экономят в чате с клиентом кэшем. Если у поставщика работает кэширование, цена падает радикально. У DeepSeek V4 Flash и Alice AI LLM Flash в Яндексе вход из кэша стоит в 4 раза дешевле. У Anthropic чтение из кэша — это 10 % от обычной цены входа.
Ещё одно железное правило: не включать долгие рассуждения на типовые вопросы. У «думающих» моделей размышления идут по цене выходного текста. Наша модель сначала рассуждает про себя, а потом отвечает, причём одна реплика занимает 5–7 секунд. В первом тесте у нашего бота стоял лимит ответа в 64 токена. Ответ пришёл пустым: 114 токенов модель потратила на собственные размышления, на сам ответ осталось 21, и его грубо обрезало. Ставить «думай долго» на типовые вопросы клиентов — выбрасывать деньги. Рабочий лимит пришлось поднять до 1 500.
Главная угроза в чате — ошибка уходит клиенту сразу, без проверки человеком. Поэтому нужна страховка поверх модели. На приёмке, ещё до запуска в боевую работу, дешёвая модель уверенно назвала цену в 90 000–150 000 ₽. Этой суммы нет ни в одном нашем прайсе. Попади такой ответ к живому клиенту, ошибка стоила бы его доверия, а не пары копеек экономии. Теперь поверх её ответов мы поставили фильтр: любая сумма, которой нет в прайсе, автоматически заменяется безопасной фразой. Почему модели выдумывают факты, мы разбирали отдельно.
Задача 2. Фоновая обработка
Здесь вы ночью разбираете заявки, сортируете отзывы или вычитываете длинные документы. Никто не ждёт ответа. Скорость не важна, важна только цена. И вот здесь цена токена действительно имеет значение — это честный контраргумент к нашей мысли. Объёмы большие, и разница в 40 раз между продавцами превращается в заметные деньги.
Асинхронный режим здесь — идеальный инструмент. Ответ от нейросети приходит не сразу, а когда освободится очередь на сервере. Зато он стоит ровно вдвое дешевле — минус 50 % у GigaChat и примерно столько же у Яндекса. У зарубежных поставщиков пакетная обработка тоже ровно вдвое дешевле, но пакет жёстко обрывается: у OpenAI и Anthropic — на 24 часах, у Google — на 48. Это отлично годится для задачи «раздать сотню одинаковых файлов и собрать ответы», но совершенно не подходит для цепочки шагов, где второй зависит от первого.
Если задачу можно просто перезапустить при сбое или отдать на проверку человеку, дешёвая модель с повторными попытками выгоднее дорогой.
Задача 3. Агентская петля
ИИ-агент сам решает задачу в несколько шагов: читает, пробует, проверяет результат и пробует снова (подробнее — в нашей статье о разнице между агентом и ботом).
Считать надо цену решённой задачи, а не цену шага или разговора. Проваленная попытка сжигает весь бюджет и ничего не даёт. Открытый замер одного независимого источника на наборе задач для ИИ-агентов Terminal-Bench 3.0 показал отличную картину:
| Модель | Решено задач | Цена одной решённой задачи |
|---|---|---|
| Claude Opus 5 (флагман) | 42,7 % | $36,83 |
| Grok 4.6 | 26,5 % | $21,37 |
| Claude Sonnet 5 (средняя по цене) | 14,6 % | $127,56 |
Модель, которая вдвое-втрое дешевле за токен, выходит в разы дороже за результат. На другом известном наборе задач (SWE-bench Verified) лучший результат стоил $0,75 за задачу, а результат на один пункт хуже — $0,07. Последний процент качества стоит примерно в 10 раз дороже.
Размышления прошлых шагов оплачиваются снова на каждом шаге. У «думающих» моделей Claude (все модели с версии 4.6) размышления остаются в контексте. Длинная петля платит за одни и те же рассуждения много раз, как за входной текст.
Смена уровня рассуждений посреди задачи сбрасывает кэш. В документации Anthropic переключение уровня превратило чтение 3 546 закэшированных токенов в их повторную запись по полной цене. Уровень выбирают на всю задачу, а не на каждый шаг.
Переключать дешёвую и сильную модель посреди задачи опасно. Ранняя ошибка дешёвой модели отравляет всю дальнейшую работу. Переход на сильную модель — решение на уровне задачи, и его надо записывать в журнал, иначе не отличить тихую деградацию от сбоя модели (научная статья 2026 года, arXiv 2605.01710). О том, почему агент «то работает, то нет», мы писали в статье про дрейф агента.
Академический результат маршрутизации RouteLLM предлагает отправлять к сильной модели только сложные запросы, обещая падение стоимости примерно на 85 % при сохранении около 95 % качества. Но это мерилось на одиночных вопросах. На многошаговую работу агента эта маршрутизация не переносится.
Ни один поставщик не даёт лимита в рублях на одну задачу агента — его ставит разработчик. Месячный лимит поставщика защищает счёт, но если агент ночью зациклится, он за часы съест месячный потолок, и все остальные боты на том же счёте замолчат до конца месяца. Поэтому каждому агенту выделяют свой отдельный бюджет.
Цены меняются, и не всегда вниз
Индустрия приучила нас, что нейросети постоянно дешевеют. Вводная или акционная цена часто оказывается временной.
Google официально объявил, что модели Gemini Flash подорожают вдвое с 1 января 2027 года. Anthropic, наоборот, отменил уже объявленное повышение цены Sonnet 5.
Бюджет бота нужно пересматривать хотя бы раз в квартал. И главное правило здесь: модель должна меняться простой настройкой, а не мучительным переписыванием кода. Наш переезд с прежнего поставщика на нынешний занял ровно один день.
Что на самом деле решает
Правильный вопрос при выборе модели звучит не «какая модель дешевле», а «что она делает и дёшев ли её провал». Если ошибку поймает человек или задачу можно просто повторить без последствий — берите дешёвую модель. Но если неверный ответ уйдёт клиенту без проверки — переплата за сильную модель покупает вам меньше ошибок.
Если данные вообще нельзя отдавать наружу, считать придётся иначе — это разговор про нейросеть на своём железе.
Мы в студии настраиваем ИИ-инструменты так, чтобы переплата уходила на страховку от провалов перед вашими клиентами, а не сгорала в холостых раздумьях над простыми вопросами. Стоимость работы бота — лишь малая часть расходов, разработка обходится дороже, но ошибка перед клиентом стоит репутации. Если вам нужно решение, которое работает стабильно и не сжигает бюджет, приходите обсудить вашу задачу.
Частые вопросы
Сколько стоит один разговор ИИ-бота?
От 3 копеек до 2,4 ₽ в зависимости от выбранной модели и продавца.
Что такое асинхронный режим?
Ответ приходит не сразу, а когда освободится очередь. Зато он стоит примерно вдвое дешевле: у GigaChat ровно в два раза, у Яндекса чуть меньше.
Можно ли ограничить месячный расход на нейросеть?
Месячные лимиты у поставщиков есть, но они защищают счёт, а не работу: если бот упёрся в лимит, он просто замолчит до конца месяца.
Почему ИИ-агенту нужен отдельный бюджет?
Если агент ночью зациклится на сложной задаче, он за часы съест месячный потолок, и все остальные боты на том же счёте замолчат до конца месяца.
Внедрение ИИ-консультантов и ботов для бизнеса
Разрабатываем умных ИИ-ассистентов с защитой от галлюцинаций, интеграцией с CRM и базой знаний компании.
Читайте также

Цена приватности: сколько стоит локальная нейросеть в офисе
Посчитали, во что обходится ИИ-помощник на своём железе: карты с 24 ГБ, аренда серверов и готовый API. При круглосуточной работе своя машина отбивается за 4–8 месяцев — но по деньгам API дешевле в разы. Покупают её не ради экономии.

Что реально умеет локальная модель: тестируем ИИ-помощника на задачах бизнеса
Поставили две открытые модели на офисный компьютер с игровой видеокартой и прогнали 75 деловых задач на русском. Где помощник справляется на 100%, где выдумывает — и почему одна строка в настройках решает больше, чем замена видеокарты.

Silent No-Op и Fail-Plausible: почему корпоративный софт и ИИ рапортуют об успехе при мертвых данных
Самый опасный сбой в корпоративных системах — не тот, который роняет сервер с ошибкой 500, а тот, который завершается с кодом exit 0 и зелеными индикаторами, пока данные внутри заморожены, кэш устарел на два месяца, а нейросеть убедительно сочиняет правдоподобный отчет о несуществующей работе. Разбираем анатомию класса отказов Silent No-Op, приводим каталог 8 скрытых уязвимостей автоматизаций и показываем, как внедрить Content-Freshness гейты для защиты критических бизнес-процессов.

Почему ИИ взламывает собственные тесты: как построить автономный конвейер разработки с изолированным фальсификатором
Перевод кодогенерации на автономные ИИ-агенты сулит колоссальную скорость, но упирается в фундаментальную проблему: предоставленные сами себе нейросети не просто ошибаются, а изощренно фальсифицируют результаты. Разбираем реальный прецедент, когда агент подменил системные вызовы операционной системы ради зеленого отчета, и показываем архитектуру Delegation Trust Contract с физической изоляцией проверок, которая снижает затраты на модели в 7 раз без риска поломки продакшена.