
OpenAI снизила цены на GPT-5.6 API: что изменилось, почему и как получить
- qwenНОВИНКАQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 за 1 млн токенов · 55 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Flash 07312026-07-3150Интеллект69Кодинг
- qwenНОВИНКАQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 206 tok/s
- orcaНОВИНКАOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicНОВИНКАAnthropic: Claude Opus 52026-07-2461Интеллект78Кодинг
- googleНОВИНКАGoogle: Gemini 3.6 Flash2026-07-2150Интеллект69Кодинг
- googleНОВИНКАGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1651Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1557Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0854Интеллект72Кодинг
- tencentTencent: Hy32026-07-0641Интеллект59Кодинг
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Интеллект42Кодинг
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Интеллект39Кодинг
- anthropicAnthropic: Claude Sonnet 52026-06-3053Интеллект72Кодинг
- klingKling: Kling 3.0 Turbo2026-06-1757Интеллект52Кодинг57Математика
- z-aiZ.ai: GLM 5.22026-06-1651Интеллект69Кодинг60Математика
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Интеллект61Кодинг61Математика
30 июля 2026 года OpenAI снизила цены на API для двух своих более дешевых моделей GPT-5.6 — резко урезав самый дешевый тариф и немного умерив средний, оставив флагманскую модель нетронутой. Это заметный шаг в усиливающейся ценовой войне, и он немедленно отразился в опубликованном прайс-листе. В этой статье объясняется, что именно изменилось, какие инженерные решения за этим стоят, как новые цены выглядят на фоне конкурентов, на какие скрытые затраты обратить внимание, как еще больше сократить счет — и как новые цены уже доступны на OrcaRouter с нулевой наценкой.
Каждая цифра ниже имеет указание на источник. Цены указаны за миллион токенов (ввод/вывод) и соответствуют тарифной карте OpenAI от 30 июля 2026 года, по данным таких изданий, как Unite.AI, а также страницам моделей OrcaRouter с прямым прохождением цен; данные о конкурентах приведены с атрибуцией. Цены меняются — проверяйте перед разработкой.
TL;DR. OpenAI снизила цены на GPT-5.6 Luna до $0,20 / $1,20 (с $1 / $6, примерно на 80% дешевле) и на GPT-5.6 Terra до $2 / $12 (с $2,50 / $15, примерно на 20% дешевле), в то время как GPT-5.6 Sol остаётся на уровне $5 / $30. Два достижения в эффективности окупили это снижение: переписанные GPU-ядра (примерно на 20% ниже стоимость обслуживания) и переработанная модель-черновик для спекулятивного декодирования (более чем на 15% быстрее генерация токенов). Снижение цен ставит Luna ниже Haiku 4.5 от Anthropic и приближает её к дешёвой планке открытых моделей, заданной DeepSeek и GLM. Если вы используете независимый от вендоров эндпоинт с нулевой наценкой, такой как OrcaRouter, новые тарифы уже действуют — та же цена, один API, совместимый с OpenAI, а рядом все конкурирующие модели для сравнения и маршрутизации.
Основные выводы
• GPT-5.6 Luna: теперь $0.20 / $1.20 за 1 млн токенов, вместо $1 / $6 — снижение примерно на 80%.
• GPT-5.6 Terra: теперь $2 / $12, снижение с $2.50 / $15 — примерно на 20%.
• GPT-5.6 Sol (флагман): без изменений — $5 / $30.
• Почему: переписанные продакшн-GPU-ядра (стоимость обслуживания ниже примерно на 20%) плюс редизайн модели-черновика для спекулятивного декодирования (эффективность генерации токенов выше на 15%+), согласно инженерному посту OpenAI от 29 июля.
• Как получить: скидка уже учтена на OrcaRouter (0% наценки) — Luna по $0.20 / $1.20 — через один OpenAI-совместимый endpoint.
Что именно изменилось?
Семейство моделей OpenAI GPT-5.6 работает как лестница уровней: Luna (быстрая, самая дешёвая), Terra (средняя) и Sol (флагманская). Снижение цен 30 июля затронуло два более дешёвых уровня. Согласно опубликованному прайс-листу, GPT-5.6 Luna подешевела с $1 / $6 до $0,20 / $1,20 за миллион токенов на входе/выходе — примерно на 80% как для входных, так и для выходных токенов — а GPT-5.6 Terra — с $2,50 / $15 до $2 / $12, примерно на 20%. GPT-5.6 Sol, флагманская модель, созданная для самых сложных рассуждений и агентного программирования, осталась на уровне $5 / $30. Объёмные уровни стали значительно дешевле; топовый уровень не изменился.
Базовая ставка за токен — это ещё не вся история. В ценообразовании GPT-5.6 также есть уровни в зависимости от длины ввода (очень длинные контексты переходят на более высокую ставку), скидка на кэширование промптов (кэшированный ввод обходится гораздо дешевле, чем свежий) и пакетный вариант (асинхронные задания со скидкой). Все три фактора сохраняются и после снижения цен, так что эффективная цена для рабочей нагрузки с интенсивным использованием кэша или пакетов может быть ещё ниже. Однако следите за уровнем длинного контекста и в другую сторону: очень большие промпты могут перевести вас на уровень выше.

Две оптимизации за катом
Это не было работой в убыток ради привлечения клиентов — OpenAI преподнёс это как дивиденд от эффективности. В инженерном посте от 29 июля 2026 года сотрудники технического отдела OpenAI описали оптимизации в инференсе и агентской обвязке, лежащих в основе Codex и ChatGPT Work. Две особенно примечательны. Во-первых, переписывание GPU-ядер во всей продакшн-инфраструктуре — с помощью Sol, работающего внутри Codex, для переписывания собственных ядер компании, — которое, по словам OpenAI, сократило сквозные затраты на сервинг примерно на 20%. Во-вторых, переработанная черновая модель спекулятивного декодирования, которая, как сообщается, повысила эффективность генерации токенов более чем на 15%. Снижение стоимости сервинга, переданное клиентам в виде более низких цен на тарифах с высокими объёмами, — вот суть, и это проблеск петли обратной связи, за которой гонится вся индустрия: использование фронтирных моделей для оптимизации самой инфраструктуры, которая их обслуживает.
Как соотносятся новые цены
Это снижение цен нацелено прямо на конкурентов. Согласно отчету Unite.AI, новая цена Luna (0,20 долл. / 1,20 долл.) примерно в 5 раз ниже на входе и в 4 раза на выходе, чем у Anthropic Haiku 4.5, а новая цена Terra (2 долл. / 12 долл.) ниже стандартной цены Claude Sonnet 5 (по данным, 3 долл. / 15 долл., вступает в силу после 31 августа 2026 года). Среди моделей с открытыми весами Luna теперь находится близко к нижней границе недорогого инференса, установленной линейкой DeepSeek V4 и Zhipu GLM-5.2 (примерно 1,20 долл. / 4,10 долл.), при этом уровни Alibaba Qwen и Google Gemini Flash находятся в том же диапазоне. Другими словами, OpenAI опустила свои тарифы для больших объемов до уровня, где уже живут самые дешевые производительные модели, — сократив ценовой штраф за выбор проприетарной модели вместо открытой.
Инференс становится всё дешевле
Если посмотреть шире, это снижение цен вписывается в многолетний тренд: стоимость заданного уровня производительности резко падает из поколения в поколение, поскольку лаборатории выжимают всё большую пропускную способность из того же оборудования. Более старые тарифы самой OpenAI иллюстрируют это постепенное удешевление, и каждый прорыв в эффективности — лучшие ядра, спекулятивное декодирование, более дешёвое внимание — обычно превращается в снижение цен в течение нескольких месяцев. Для покупателей практический вывод — проектировать архитектуру под мир, где инференс дешевеет по предсказуемому графику: не привязывайтесь к ценам одной модели и сохраняйте возможность дешёвого переключения.
Скрытая стоимость, на которую стоит обратить внимание: токены рассуждений
Модели GPT-5.6 — это модели рассуждений, и это влияет на реальные расходы. Когда рассуждение включено, модель генерирует внутренние токены рассуждений, которые тарифицируются как выходные данные, — поэтому ваша эффективная стоимость вывода может быть выше, чем предполагает наивная оценка «слов в ответе», особенно на сложных запросах с высоким уровнем рассуждения. Решение — настраивать уровень рассуждения под задачу (низкий или выключенный для простых вызовов), ограничивать вывод там, где можно, и измерять фактическое использование токенов, а не предполагать. Более низкая цена за токен помогает, но контроль над количеством генерируемых токенов помогает больше.
Что это значит для разработчиков
Если вы используете GPT-5.6 Luna или Terra для высоконагруженных задач — классификации, извлечения данных, маршрутизации, лёгких агентов, чатов — ваш счёт только что снизился, в некоторых случаях почти полностью, без необходимости менять код. Это делает объёмные тарифы ещё более привлекательными для чувствительных к стоимости нагрузок и сокращает разрыв в цене с дешёвыми открытыми моделями. Математика флагмана не изменилась: Sol по $5 / $30 по-прежнему остаётся премиальным выбором для самых сложных задач. Выигрышная схема — маршрутизация по сложности: дешёвые тарифы (или дешёвые открытые модели) для лёгких 80%, а флагман — только там, где он оправдывает свою цену.
Как еще больше сократить ваши счета
Снижение цены — это фундамент для развития, а не финишная черта. Крупнейшие дополнительные рычаги: кэширование промптов (повторно используйте стабильный системный промпт или длинный контекст и платите гораздо более низкую ставку за кэшированный ввод); пакетный режим (выполняйте несрочные задания асинхронно со скидкой); маршрутизация по уровням и моделям (отправляйте каждый запрос самой дешёвой модели, которая с ним справится, включая открытые модели); и управление рассуждениями (не платите за глубокие рассуждения на тривиальных запросах). В совокупности эти меры регулярно сокращают реальные счета гораздо сильнее, чем любое отдельное изменение тарифов. В качестве конкретного ориентира: при 10 миллионах токенов в месяц с 70% долей ввода новые тарифы Luna составляют примерно $5 в месяц (около $4.37 с кэшированием); тот же объём на Sol — около $125 в месяц — самый наглядный аргумент в пользу маршрутизации по сложности.
Как сразу зафиксировать более низкие цены
Вот та часть, которая связывает всё воедино. a href="https://www.orcarouter.ai/">OrcaRouter/a> не взимает наценку и передаёт цены провайдеров напрямую, так что тарифы OpenAI уже доступны на OrcaRouter: GPT-5.6 Luna показывает $0.20 / $1.20, а Terra — $2 / $12 на страницах моделей прямо сейчас — те же ставки, что и в собственном прайс-листе OpenAI, доступные через единую OpenAI-совместимую конечную точку наряду с более чем 185 другими моделями. Вы получаете эти тарифы без миграции и можете сравнить цены Luna и Terra с DeepSeek, GLM, Qwen, Gemini и Claude в одном месте, а затем направлять каждый запрос туда, где это будет дешевле всего для конкретной задачи. Также есть бесплатный тариф и страница Offers для дополнительной экономии.

Снижение уже активно на OrcaRouter: GPT-5.6 Luna по $0.20 / $1.20 за 1M токенов, пропускается с нулевой наценкой.
Прокладывайте маршрут по сложности, чтобы сэкономить ещё больше.
Самый дешёвый счёт — это не одна модель, а правильная модель под каждый запрос. Поскольку OrcaRouter открывает всё поле моделей через одну конечную точку, вы можете отправлять простые высоконагруженные запросы в Luna или дешёвую открытую модель, а Sol или другой флагман приберечь для сложных, переключаясь через изменение конфигурации, а не повторную интеграцию. Снижение цены на Luna делает эту стратегию маршрутизации по сложности ещё дешевле — без необходимости что-либо перенастраивать.

Часто задаваемые вопросы
Насколько OpenAI снизила цены на GPT-5.6?
GPT-5.6 Luna упал с $1 / $6 до $0,20 / $1,20 за миллион токенов (примерно на 80%), а GPT-5.6 Terra — с $2,50 / $15 до $2 / $12 (примерно на 20%). GPT-5.6 Sol остался на уровне $5 / $30.
Когда вступило в силу снижение цен?
30 июля 2026 года, зафиксировано в журнале изменений API OpenAI и доступно в опубликованном прайс-листе.
Почему OpenAI снизил цены?
OpenAI объясняет это оптимизациями инференса — переписанными производственными GPU-ядрами (примерно на 20% ниже стоимость обслуживания) и переработанной моделью черновика для спекулятивного декодирования (эффективность генерации токенов +15%) — согласно инженерному сообщению от 29 июля 2026 года.
Флагман (Sol) подешевел?
Нет. GPT-5.6 Sol остается $5 / $30 за миллион токенов. Снижены были только два более дешёвых тарифа, Luna и Terra.
Как новые цены соотносятся с ценами Anthropic и открытых моделей?
Согласно сообщениям, Luna теперь предлагает цены примерно в 5 раз ниже на ввод и в 4 раза ниже на вывод, чем Haiku 4.5 от Anthropic, а Terra опускается ниже стандартных цен Claude Sonnet 5 ($3 / $15). Luna также находится рядом с нижней границей цен дешёвых открытых моделей, заданной DeepSeek и GLM-5.2.
В чём подвох с токенами рассуждения?
GPT-5.6 — это модели рассуждений; внутренние токены рассуждений тарифицируются как выходные данные, поэтому эффективная стоимость вывода может превышать наивную оценку. Настройте усилия рассуждений и ограничьте вывод, чтобы это контролировать.
Как получить новые более низкие цены?
Они уже доступны на API OpenAI и, с нулевой наценкой, на OrcaRouter — где GPT-5.6 Luna показывает $0.20 / $1.20 — через один совместимый с OpenAI эндпоинт, без изменения кода.
Суть
Снижение цен OpenAI от 30 июля делает GPT-5.6 Luna и Terra значительно дешевле для высоконагруженных задач — это дивиденд эффективности от переписывания ядра и прироста за счёт спекулятивного декодирования, а также чёткий ответ на реальную ценовую войну, которая теперь демпингует более дешёвые тарифы Anthropic и приближается к нижней границе цен открытых моделей. Флагман Sol не изменился, поэтому маршрутизируйте запросы по сложности, полагайтесь на кэширование и пакетную обработку и контролируйте токены рассуждений, чтобы сэкономить максимум. А поскольку OrcaRouter передаёт цены провайдеров с нулевой наценкой, сниженные ставки уже доступны там — та же цена, одна совместимая с OpenAI конечная точка и всё поле моделей в одном месте. Получите скидку, не меняя ни строчки кода, и позвольте каждому запросу выбирать самую дешёвую модель, которая справится с задачей.
