Цены на API нейросетей в 2026: как устроена токен-экономика и сколько стоит запрос

Когда вы обращаетесь к нейросети через API, счёт складывается из трёх частей: за то, что вы отправили, за то, что она ответила, и — обычно дешевле — за то, что уже обрабатывалось раньше.
Когда вы обращаетесь к нейросети через API, счёт складывается из трёх частей: за то, что вы отправили, за то, что она ответила, и — обычно дешевле — за то, что уже обрабатывалось раньше.
Считают не в символах, а в токенах — кусочках слов. Поэтому итог зависит и от длины запроса, и от объёма ответа, и от того, насколько удачно переиспользуется повторяющийся текст.
Ниже — что такое токен и из чего складывается счёт, почему ответ дороже запроса, зачем нужна скидка на повторы, почему цены скачут, какие расходы не видны в прайсе, как закладывать это в смету клиенту и как удержать бюджет.
Все цены — со ссылкой на первоисточник по состоянию на 16 августа 2026 года. Тарифы меняются, поэтому актуальную цифру всегда сверяйте у провайдера.
Это живой гайд: ежедневные AI-дайджесты обновляют его по мере изменения цен.
---
Коротко, если нет времени
Токен — это кусочек слова. Платите и за отправленное, и за полученное.
Ответ дороже запроса — часто в 2–5 раз. Просить отвечать короче — прямая экономия.
Повторяющийся текст стоит кратно дешевле. У некоторых моделей скидка доходит до 98%.
Правильный вопрос — не «сколько стоит подписка», а «во что мне обошёлся этот заказ».
В прайсе видно не всё. Скрытые рассуждения, повторные попытки и неудачные генерации в таблицу цен не входят.
Для фрилансера главное: расход на генерации закладывается в смету клиенту так же, как у типографии закладывается бумага.
---
Часть 1. Что такое токен и из чего складывается счёт
Токен — единица текста, которой оперирует модель: примерно часть слова. В среднем один токен это 3–4 символа латиницы; у кириллицы токенов на то же число символов обычно больше.
Счёт складывается из трёх частей:
Входные — всё, что вы отправили: сам вопрос, системная инструкция, история переписки, приложенные документы.
Выходные — то, что модель написала в ответ.
Кешированные — часть входа, которую провайдер уже обрабатывал раньше и хранит.
Цены указывают отдельно по каждой части, потому что стоят они по-разному.
Почему ответ дороже запроса
Выходные токены почти всегда дороже входных, часто в 2–5 раз.
Причина техническая: прочитать ваш запрос модель может целиком и сразу, а вот каждое слово ответа считается последовательно, одно за другим.
Практический вывод: длинный ответ дороже длинного запроса. Там, где можно, просите отвечать короче и структурнее — это прямая экономия.
И отдельно: у моделей, которые «рассуждают» перед ответом, к выходу добавляются скрытые токены рассуждения. Вы их не видите, но оплачиваете по цене выхода.
Зачем нужна скидка на повторы
Если вы шлёте в каждом запросе одну и ту же системную инструкцию или один и тот же длинный документ, провайдеру не нужно обрабатывать этот кусок заново. Поэтому он стоит кратно дешевле.
В агентных сценариях экономия огромна: там до 97% входа — это повторяющийся текст, и без скидки вы платили бы за него на каждом шаге по полной.
Практический приём: держите неизменную часть в начале запроса — её запомнят, — а меняющуюся в конце.
---
Часть 2. Сколько стоят API сейчас
Ориентировочные цены за миллион токенов на 16 августа 2026 года, каждая со ссылкой на источник. Тарифы быстро меняются, поэтому это снимок момента.
| Модель | Вход ($/1M) | Выход ($/1M) | Примечание |
|---|---|---|---|
| DeepSeek V4-Flash 0731 | $0,14 | $0,28 | скидка на повторы 98% (Artificial Analysis) |
| DeepSeek V4 Pro | см. прайс | см. прайс | тарифы повышены с 16 августа (прайс DeepSeek) |
| Gemini 3.7 Flash | $0,75 | $3,75 | вводная скидка 50% до конца года, далее $1,50 / $7,50 (Google) |
| Qwen 3.8 Max | $2 | $6 | повторы — $0,25 (Alibaba Qwen) |
| Grok 4.6 | $2 | $6 | по независимому замеру (Artificial Analysis) |
Отдельно стоит отметить механику: у DeepSeek V4-Flash повтор снижает цену входа на 98%. Это не маркетинг, а следствие того, что переиспользуемый кусок провайдеру почти ничего не стоит.
Точные текущие цифры по DeepSeek смотрите на официальной странице тарифов — там опубликовано повышение от 16 августа 2026 года.
---
Часть 3. Почему цены скачут
Цены не константа: они и падают под конкуренцию, и растут под нагрузку, иногда на одной неделе.
Пример снижения. 14 августа 2026 года Google выпустила Gemini 3.7 Flash с вводной скидкой 50% — $0,75 за миллион входных и $3,75 за миллион выходных до конца года, потом $1,50 и $7,50.
Пример повышения. DeepSeek объявила новый прайс с 16 августа 2026 года: выход V4 Pro поднимается заметно, повторы дорожают в разы, плюс вводится двойной тариф в пиковые часы (официальный прайс).
Вывод для планирования: закладывайте, что цена может измениться, и не привязывайте экономику к одному провайдеру без запасного варианта.
Пик и не-пик
Некоторые провайдеры вводят разные тарифы для загруженных и свободных часов: днём дороже, ночью дешевле.
Это способ управлять нагрузкой, а не только зарабатывать. Если ваши задачи не требуют мгновенного ответа — ночная генерация отчётов, массовая обработка, — проверьте, есть ли такой тариф и когда он действует для вашего часового пояса.
---
Часть 4. Две модели оплаты
Кроме поштучной оплаты за текст есть вторая — за время работы. Она характерна для генерации изображений, видео и звука.
Для текстовых моделей почти всегда считают за токены. Для медиа — часто за секунды генерации или за готовый результат, потому что токенов там в привычном смысле нет.
Разница важна при планировании. Токенную цену легко предсказать по длине текста. Посекундную — сложнее: она зависит от разрешения, длительности и модели.
Поэтому для медиа особенно ценно, когда платформа показывает смету до запуска, а не после.
---
Часть 5. Расходы, которых нет в прайсе
Итоговый счёт часто оказывается больше ожидаемого. Четыре причины.
Скрытые рассуждения. У «думающих» моделей к видимому ответу добавляется поток рассуждений, который оплачивается по цене выхода, хотя вы его не видите.
Вызовы инструментов. В агентных сценариях каждый шаг тащит за собой историю прошлых, поэтому длинная цепочка стоит непропорционально дорого.
Повторные попытки. Ретраи при сбоях внешних сервисов множат расход, если их не считать.
Неудачные генерации. Сцена или ответ не подошли, вы перегенерировали — платить приходится за каждый прогон, а не только за удачный.
Практический вывод: планируя бюджет, закладывайте не только идеальный запрос, но и рассуждения, повторы и переделки.
Именно поэтому важна прозрачная механика: чтобы было видно, за что списаны деньги, и чтобы неудачная генерация возвращалась, а не молча списывалась.
Где эти расходы возникают чаще всего
Второй пункт из четырёх — самый дорогой. Агентные цепочки съедают бюджет быстрее всего, потому что каждый шаг тащит за собой историю предыдущих: пятый шаг стоит дороже первого, десятый — дороже пятого.
И вот что важно: дело не в том, что агенты дорогие сами по себе. Дело в том, что плохо собранная цепочка крутится вхолостую — делает лишние шаги, переспрашивает, повторяет уже сделанное.
Разница между аккуратной и расточительной цепочкой на одной и той же задаче — разы, а не проценты.
Если вы собираете агентов и хотите, чтобы они не жгли деньги: экспресс-курс «AI-Агенты: эпоха электрификации рутины» — от первого автоматического агента до связок, работающих круглосуточно. Внутри 20 готовых проектов под реальные задачи и четыре рабочие платформы: Make, n8n, Relevance, Lindy.
Готовый проект тем и ценен, что в нём цепочка уже выстроена — вы не платите за собственные эксперименты с лишними шагами.
$9, входит в тарифы Make и Team. В три бесплатных дня Basic не входит: получить можно разовой покупкой, тарифом или за 1 000 очков опыта.
---
Часть 6. Как посчитать бюджет проекта
Формула простая:
число запросов × (средний вход + средний выход в токенах) × цена за токен
Порядок действий:
1. Прикиньте, сколько запросов в месяц делает ваш продукт
2. Измерьте на нескольких реальных примерах средний размер входа и выхода
3. Умножьте на цену соответствующей части из таблицы провайдера
Для агентных сценариев добавьте множитель на число шагов и на повторяющийся текст — здесь спасает кэш, который срезает цену неизменной части.
Полученную цифру стоит сравнить с ценой собственного запуска открытой модели: на больших и предсказуемых объёмах он нередко выигрывает.
И заложите запас на изменение цен. Как показал август 2026 года, тариф может и упасть, и вырасти. Здоровый бюджет — не одна цифра по текущему прайсу, а вилка с запасным провайдером.
Пример расчёта
Цифры — иллюстрация метода, а не тариф конкретного провайдера.
Допустим, ассистент обрабатывает 10 000 запросов в месяц. Средний запрос — 1500 входных токенов (системная инструкция плюс вопрос и контекст) и 500 выходных.
При цене условно $0,75 за миллион входных и $3,75 за миллион выходных один запрос стоит:
1500 × $0,75/1 000 000 + 500 × $3,75/1 000 000 ≈ $0,0011 + $0,0019 ≈ $0,003
На 10 000 запросов — около $30 в месяц.
Теперь включаем кэш: если системная инструкция (скажем, 1000 из 1500 входных токенов) неизменна и запоминается, вход дешевеет в разы, и месячный счёт заметно падает без потери качества.
Что этот расчёт показывает:
Выход дороже входа. 500 выходных токенов стоят больше, чем 1000 обычных входных. Просить отвечать короче — прямая экономия.
Кэш неизменной части — самый простой рычаг. Не требует смены модели и срезает основную долю входа в стабильных сценариях.
Для агентных задач умножьте на число шагов. Там расход растёт быстрее всего.
---
Часть 7. Как удержать расходы
Пять приёмов, которые работают независимо от провайдера.
Кэшируйте неизменную часть. Системную инструкцию и постоянный контекст держите в начале запроса.
Просите ответ короче. Выход дороже входа; для «рассуждающих» моделей ограничивайте объём рассуждений там, где он не нужен.
Ставьте дешёвую модель по умолчанию. Направляйте на дорогую только сложные шаги — по опыту команд это даёт основную долю экономии.
Считайте стоимость за успех, а не за токен. В агентных цепочках важна цена за решённую задачу; вычищайте лишние шаги. Подробнее — в хабе ИИ-агенты.
Рассмотрите собственный запуск. За большие объёмы открытая модель на своём железе часто выходит дешевле и не зависит от чужих повышений — сравнение в хабе Лучшие открытые LLM 2026.
Отложенная обработка
Если ответ не нужен сию секунду, стоимость можно ощутимо снизить.
Не-пик — сниженный тариф в свободные часы. Массовую обработку и генерацию отчётов удобно ставить туда.
Пакетный режим — асинхронная обработка большого объёма разом, которую часто тарифицируют дешевле обычного вызова, потому что она лучше загружает железо провайдера.
Практический вывод: разделите задачи на срочные (обычный вызов) и отложенные (пакет и не-пик). Это само по себе срезает счёт, ничего не меняя в качестве.
---
Часть 8. Три стратегии оплаты
Свести всё вместе помогает простое разделение.
Обычный API поштучно. Выгоден при небольших и нерегулярных объёмах, когда держать своё железо нет смысла, а важна скорость запуска.
API в пакетном и не-пиковом режиме. Тот же провайдер, но отложенная обработка по сниженной цене. Выгоден для больших регулярных объёмов, где ответ не нужен сразу.
Собственный запуск открытой модели. Выгоден при больших и предсказуемых объёмах, когда экономия перекрывает стоимость железа, а заодно даёт независимость от чужих повышений.
Большинство зрелых продуктов комбинируют все три: срочное через обычный API, массовое и отложенное пакетом, самое объёмное и стабильное — на своём железе.
Отправная точка выбора — профиль вашей нагрузки (объём, срочность, чувствительность данных), а не «самый дешёвый прайс на бумаге».
---
Часть 9. Открытые альтернативы
Снизить зависимость от цены API помогает переход на открытые модели: их можно запустить у себя, и тогда цена перестаёт зависеть от чужих тарифов.
Текущее поколение конкурентно по качеству: DeepSeek V4 под MIT, Qwen 3.8, GLM-5.2, Muse Glimmer 30B под Apache 2.0. Веса под свободными лицензиями можно использовать коммерчески — подробное сравнение и требования к железу в хабе Лучшие открытые LLM 2026.
Важный нюанс: открытые веса не значит бесплатно. Вы не платите за токены, но платите за железо и обслуживание, поэтому выигрыш появляется на больших объёмах.
Ещё один путь удешевления — открытые инструменты вокруг моделей, собранные в разделе Open Source: они снимают часть инфраструктурных расходов.
Свой оператор вместо вкладки в браузере
Отдельный случай, который стоит знать, если расходы на токены вас всерьёз беспокоят.
Обычные помощники живут во вкладке: закрыли — забыли вас, а каждое обращение тарифицируется. Есть другой подход — фоновый сервис на своём железе: он работает постоянно, помнит вас между сессиями и не выставляет счёт за каждый запрос.
Плюс два свойства, которых у вкладки нет в принципе: он сам инициирует контакт, когда наступило событие, и подключается туда, где вы уже есть, — в мессенджеры.
Экспресс-курс «OpenClaw: не помощник в браузере, а свой AI-оператор» — про развёртывание такого сервиса. На выходе: работающий оператор на вашем железе с подключением к WhatsApp, Telegram, Discord, iMessage и Slack, библиотека из 50+ навыков и настроенная система памяти.
Кому это действительно нужно: тем, у кого большой поток однотипных запросов, тем, у кого есть данные, которые нельзя выносить наружу, и тем, кто устал платить за каждое обращение.
Кому не нужно: если задачи разовые и объём небольшой — обычные инструменты закроют то же самое дешевле и без настройки железа.
$9, входит в тарифы Make и Team. В три бесплатных дня Basic не входит.
---
Часть 10. Как это касается вас, если вы берёте заказы
Раздел, которого в обзорах цен обычно нет. А для фрилансера он важнее всей остальной статьи.
Главная ошибка: считать месяц вместо заказа
Расход размазан: подписка списалась месяц назад, генерации идут фоном, прибыль считается как «сколько пришло на карту».
Так работают в минус и не замечают этого месяцами.
Правильный вопрос: во что мне обошёлся этот заказ.
Заказ принёс $40, расход составил $3 — семь процентов, нормально. Потратили $20 — дело не в ценах моделей, а в процессе.
Закладывайте расход в смету
Стоимость генераций входит в цену клиенту так же, как у типографии входит бумага.
Ни один заказчик не спрашивает у типографии, сколько стоила бумага. Он платит за напечатанный тираж.
Способ прикинуть: оцените расход на задачу, умножьте на два — на промахи и правки — и заложите. Если получилось больше пяти-семи процентов чека, у вас либо слишком дешёвый заказ, либо слишком расточительный процесс.
Чего не делать: выставлять расход отдельной строкой в счёте. Заказчик начнёт обсуждать не результат, а стоимость генераций, и вы окажетесь в разговоре, в котором нечего выигрывать.
С чем сравнивать: что платят за работу
Из выгрузки на 848 объявлений о заказах за 24 дня: медиана разовой работы — $30–75. Короткий ролик — $18–45. Логотип — $25–90. Многостраничный сайт — $245–730. Система или конвейер — $490–1 460.
Оговорка: явный бюджет указан в 6% объявлений, по категориям от двух до пятнадцати наблюдений.
Что это значит для расчётов. При поштучной оплате стоимость операции измеряется центами и единицами долларов. То есть первый же выполненный заказ покрывает расходы на несколько десятков попыток.
Вся проблема — в порядке. Подписка требует денег до первого заказа. Оплата по факту позволяет начать с суммы, которую не жалко, и дальше платить из заработанного.
Три вещи, которые ломают экономику
Генерация «на авось». Двадцать попыток вместо четырёх, потому что задача не сформулирована. Точное описание — прямая экономия.
Дорогая модель на черновиках. Разброс по видео — от $0,22 до $11,95 за генерацию, то есть в пятьдесят раз. Черновики гоняйте на дешёвой, финал на нужной.
Правки без границы. Для генеративного видео правка часто означает перегенерацию, то есть новую стоимость. Два круга в смете — нормально, «правим, пока не понравится» — открытый счёт за ваш счёт.
---
Часть 11. Как это устроено у нас
На платформе цена запроса — не кредиты вслепую, а фактическая себестоимость токенов с фиксированной наценкой.
Генератор промптов и чат-надстройка считают реальный расход по факту — вход, выход, чтение и запись кэша — и берут его с коэффициентом 1.2. То есть наценка ровно 20%, а не абстрактный тариф.
Что это даёт на практике:
Смета видна до нажатия. Вы видите цену операции до запуска, а не после.
При сбое до ответа деньги возвращаются.
Повторные запросы дешевеют за счёт запомненного контекста.
Это прямое следствие той самой токен-экономики, о которой весь гайд: мы платим провайдеру за токены — и ровно это, плюс 20%, видит пользователь.
Кошелёк вместо подписки
Отдельно про модель оплаты, потому что она снимает главное возражение.
Из моего опроса аудитории дословно: *«большая стоимость нейросетей, подписки очень дорогие, нет возможности экспериментов»*.
Человек прав. Чтобы попробовать три модели под разные задачи, нужны три подписки, каждая списывается целиком независимо от того, работали вы в этом месяце или нет.
Кошелёк устроен иначе: списывается за сделанное. Не открывали неделю — не потратили ничего. Месяц без работы стоит ноль. Порог входа маленький: начать можно с суммы, которую не жалко.
Возможность экспериментировать появляется ровно тогда, когда эксперимент перестаёт стоить как месячная подписка.
---
Часть 12. Что открывать под свою задачу
Кошелёк с оплатой по факту — доступен на любом уровне, включая бесплатную регистрацию.
Готовые ассистенты — больше 140 в 14 категориях. Часто искать инструмент вообще не нужно: готовый помощник под задачу закрывает её без сравнения сервисов. Тариф Basic.
Энциклопедия из более 190 проверенных сервисов — справочник для поиска по задаче, а не для чтения подряд. Входит в Basic.
Промпт-инжиниринг — базовый курс с картой ландшафта моделей: какая под что. Помогает не платить за подписку на инструмент, который вам не нужен. $9, входит в Basic.
AI Workflow — если задача повторяется: цепочка, где смета считается до запуска и списание идёт по фактически выполненным шагам, а за несделанное деньги возвращаются.
Экспресс-курс «AI-Агенты» — если строите цепочки и хотите, чтобы они не крутились вхолостую. 20 готовых проектов, четыре платформы. $9, тарифы Make и Team.
Экспресс-курс «OpenClaw» — если хотите перестать платить за каждый запрос: свой фоновый оператор на своём железе с локальной памятью и подключением к мессенджерам, 50+ навыков. $9, тарифы Make и Team.
Оба в три бесплатных дня Basic не входят — разовая покупка, соответствующий тариф или 1 000 очков опыта.
---
Хроника цен
Цены двигаются почти каждую неделю: кто-то снижает под конкуренцию, кто-то поднимает под нагрузку, третьи вводят вводные скидки.
За август 2026 года Google уронил цену Gemini 3.7 Flash вдвое на старте, а DeepSeek поднял тарифы V4 Pro с 16 августа.
Отслеживаем изменения в ежедневных AI-дайджестах. За устройством агентов и стоимостью их хода — хаб ИИ-агенты, за вариантом «свой запуск вместо API» — хаб Лучшие открытые LLM 2026.
---
FAQ
Почему ответ дороже запроса?
Потому что генерация требует больше вычислений, чем чтение. Ваш запрос модель обрабатывает целиком и сразу, а каждое слово ответа считает последовательно.
Отсюда разница в цене, часто в 2–5 раз. Практический вывод: длинный ответ дороже длинного запроса, поэтому просите отвечать короче там, где это возможно.
У «рассуждающих» моделей к выходу добавляются оплачиваемые скрытые рассуждения.
Что такое кешированные токены и почему они дешевле?
Это часть входа, которую провайдер уже обрабатывал и хранит: неизменная системная инструкция или документ, который вы шлёте в каждом запросе.
Пересчитывать заново не нужно, поэтому он стоит кратно дешевле обычного входа — у некоторых моделей скидка достигает 98%. В агентных диалогах, где до 97% входа это повторяющийся текст, кэш экономит основную часть счёта.
Держите неизменную часть в начале, чтобы её запомнили.
Что дешевле — API или свой запуск?
Зависит от объёма.
Для небольших и непостоянных нагрузок API обычно выгоднее: не нужно держать железо. Для больших и предсказуемых объёмов собственный запуск часто выходит дешевле, а цена становится предсказуемой и не зависит от чужих повышений.
Плюс независимость: открытые веса нельзя отозвать. Сравнение моделей и требований к железу — в хабе Лучшие открытые LLM 2026.
Как быстро меняются цены?
Быстро — иногда несколько раз в месяц. Провайдеры снижают под конкуренцию, поднимают под нагрузку, вводят скидки и пиковые тарифы.
Поэтому любую конкретную цифру, включая приведённые здесь на 16 августа 2026, сверяйте на официальной странице тарифов перед внедрением. И не привязывайте экономику продукта к одному провайдеру без запасного варианта.
Что такое не-пик и пакетный режим простыми словами?
Два способа заплатить меньше, если ответ не нужен сию секунду.
Не-пик — сниженный тариф в свободные часы: провайдеру проще обслуживать нагрузку, поэтому те же токены стоят дешевле.
Пакетный режим — обработка большого объёма разом, которую тарифицируют дешевле, потому что она лучше загружает железо.
Разделите задачи на срочные и отложенные — это само по себе срезает счёт без потери качества.
Сколько закладывать на генерации, если я беру заказы?
Правило: расход входит в цену клиенту так же, как у типографии входит бумага.
Прикиньте расход на задачу, умножьте на два на промахи и правки, заложите в смету. Если вышло больше пяти-семи процентов чека — либо заказ слишком дешёвый, либо процесс расточительный.
Для ориентира: медиана разовой работы по рынку — $30–75, а стоимость операции при поштучной оплате измеряется центами и единицами долларов. Первый же выполненный заказ покрывает расходы на несколько десятков попыток.
Отдельной строкой в счёте расход не выставляйте — заказчик начнёт обсуждать стоимость генераций вместо результата.
---
Попробуйте
Регистрация бесплатная и открывает три дня доступа к тарифу Basic целиком — все 140+ ассистентов, энциклопедия из более 190 сервисов, тексты промптов, файлы скиллов, модуль продаж из десяти уроков и шесть базовых курсов.
Три дня — способ проверить не инструменты, а себя: пройти цепочку до конца и посмотреть на собственный результат, ничего не заплатив.
Одно действие прямо сейчас. Откройте список своих подписок и посчитайте, сколько раз за последний месяц вы открывали каждую.
Обычно выясняется, что деньги уходят за две-три, а работа делается в одной. Это и есть ваша экономия — без всякого выбора тарифа.
Что почитать дальше
Сколько стоит попробовать — кошелёк вместо подписки и цены по режимам.
Какой тариф выбрать — точный состав каждого из шести.
Было дорого — стало $9 — что открыто бесплатно прямо сейчас.
Что есть на платформе — четырнадцать разделов в трёх частях.
Себестоимость ролика — вторая половина уравнения для исполнителя.
Локальные нейросети для чувствительных данных — когда своё железо дешевле.
Витрина рынка: 848 заказов — с чем сравнивать расходы.
Прайс-лист исполнителя на ИИ — сколько брать за работу.
Что вы сможете через месяц — ради чего это оплачивается.
Собрал один раз — работает всегда — смета цепочки видна до запуска.
Шаблоны автоматизаций n8n и Make — где расход растёт быстрее всего.
Скиллы для Claude Code — как устроены цепочки и их стоимость.