
GPT-6 Astra Ultrafast на скорости 6x: во что вам на самом деле обходится опубликованный прайс-лист
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 349 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 210 tok/s
- OrcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- xAISpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
GPT-6 Astra Ultrafast перестал быть листом ожидания 29 сентября 2026 года. Теперь это доступный для покупки уровень обслуживания с опубликованной ценой, и эта цена ровно в шесть раз превышает стандартную по каждой отдельной строке. Сама модель — GPT-6 Astra, флагман компании, выпущенная 3 сентября 2026 года, — не изменилась; что изменилось на DevDay, так это то, что скоростной канал для неё стал общедоступным, а в документации API компании теперь прямо сказано, что Ultrafast «широко доступен для GPT-6 Astra, с предварительным доступом для GPT-5.6 Sol». Впервые этот уровень можно заложить в бюджетную строку, и число, которое туда следует вписать, — $60.00 за миллион входных токенов и $300.00 за миллион выходных токенов, как указано на собственной странице цен компании 30 сентября 2026 года.
Это превращает вопрос в совсем другой по сравнению с тем, на который ответил материал о запуске. Интересный факт этой недели не в том, что такой тариф существует, — preview анонсировали 13 августа 2026 года и освещали до потери пульса. Интересный факт в том, что тариф, у которого не было цены, теперь её имеет, а арифметика, из этого следующая, неприглядна — конкретно и измеримо. Шестикратная разница — это не надбавка, которую проглатывают с пожатием плеч; это надбавка, которую нужно отбить за меньшее число ходов, и получится ли это у вас — свойство вашей рабочей нагрузки, а не модели.
Множественные удержания на каждой линии, и это первое, что нужно понять.
Если посмотреть на страницу цен OpenAI 30 сентября 2026 года, в колонке Ultrafast для GPT-6 Astra указано ровно 6x от колонки Standard, а не наценка, которая есть на одних строках и отсутствует на других. Это важно, потому что означает: вы не сможете обойти это с помощью оптимизации, меняя форму своих запросов.
• GPT-6 Astra, стандартный сервис, запросы объёмом до 272 000 входных токенов — $10.00 за входные данные, $1.00 за кэшированные входные данные, $12.50 за запись в кэш, $50.00 за выходные данные, за 1 млн токенов.
• GPT-6 Astra Ultrafast, тот же порог — $60.00 за входные данные, $6.00 за кэшированные входные данные, $75.00 за запись в кэш, $300.00 за выходные данные, за 1 млн токенов. Ровно в 6 раз больше по всем четырём позициям.
• Свыше 272 000 входных токенов весь запрос пересчитывается — Standard переходит на $20.00 / $2.00 / $25.00 / $75.00, Ultrafast — на $120.00 / $12.00 / $150.00 / $450.00. Всё ещё 6x. Правило длинного контекста, которое OpenAI указывает в документации для GPT-6 Astra, — это 2x для входных данных и тарифов кэша с 1.5x для выходных данных на весь запрос, как только вы пересечёте порог, и оно применяется одинаково к обоим уровням.
• Остальные уровни на той же карточке — Batch и Flex составляют 50% от Standard, а режим Fast — 2x от Standard. Так что лестница множителей для этой одной модели идёт 0,5x, 1x, 2x, 6x, без промежуточной ступени между последними двумя.
У Ultrafast нет аналога Batch. Batch и Flex — это скидки, которые вы покупаете за более свободное планирование на стандартной линии; у быстрой линии нет медленно-дешёвой версии. Если вам нужна скорость, вы платите 6x за каждый отправленный токен и каждый полученный токен, и никакое сочетание кэшированного и свежего ввода не улучшает это соотношение.

Сколько на самом деле стоит один звонок
Абстракцию становится легче анализировать с двумя конкретными запросами. Оба используют опубликованные OpenAI тарифы за миллион; расчёты наши.
Одиночный вызов с 20 000 входных токенов и ответом на 2 000 токенов обходится в $0.30 на Standard — 20 000 токенов по $10 за миллион — это $0.20, плюс 2 000 по $50 за миллион — это $0.10. Тот же вызов на Ultrafast обходится в $1.80. Ровно в шесть раз, как и заявлено.
Теперь случай, который действительно описывает цикл агента: разговор на 200 000 токенов, где 190 000 токенов — это кэшированный префикс, а свежих только 10 000, что даёт шаг в 1 000 токенов. Standard начисляет $0,19 за чтение из кэша, $0,10 за свежий ввод и $0,05 за вывод — $0,34 за шаг. Ultrafast начисляет $1,14, $0,60 и $0,30 — $2,04 за шаг. Снова 6×, но посмотрите, что дало это сочетание: кэширование — самый эффективный рычаг затрат на этой модели, и на стандартном тарифе оно всё равно ровно в 6 раз дешевле, так что агент с сильным кэшированием не получает пропорционального выигрыша от быстрого тарифа, и это также не смягчает надбавку.
Следствие — это то, что стоит усвоить. Поскольку множитель фиксированный, точка безубыточности вообще не зависит от структуры ваших токенов. Она целиком определяется количеством ходов. Ultrafast окупает себя в рабочей нагрузке только тогда, когда его запуск сокращает количество тарифицируемых ходов примерно в шесть раз — либо за счёт свёртывания цикла повторных попыток в один проход, либо за счёт замены последовательности коротких уточняющих вызовов одним более быстрым интерактивным сеансом. Если ваша рабочая нагрузка выполняет столько же ходов, сколько и раньше, только быстрее, вы покупаете снижение задержки ровно в 6 раз дороже и ничего больше.
Лимиты запросов и география — это неафишируемые потолки
Два ограничения находятся вне цены, и их легко упустить из виду, когда вы читаете тарифную сетку.
Первый — пропускная способность. Ultrafast для GPT-6 Astra доступен всем пользователям API, но изначально с низкими лимитами скорости: OpenAI указывает 500 000 токенов в минуту для уровней 1–3, 1 000 000 для уровня 4 и 5 000 000 для уровня 5. Для уровня, который продаётся за скорость, это реальный потолок — контекст агента в 200 000 токенов при 500 000 токенов в минуту — это два с половиной запроса в минуту на низком уровне. Собственные рекомендации OpenAI указывают на ту же проблему с другой стороны, настоятельно рекомендуя WebSockets именно потому, что сетевые накладные расходы на запрос могут съесть задержку, за которую платит уровень.
Второе — это резидентность данных. Ultrafast поддерживает только резидентность данных в США и глобальную обработку. Он не поддерживает эндпойнты обработки в ЕС или других регионах за пределами США. Если ваше развёртывание зависит от эндпойнта резидентности в ЕС для GPT-6 Astra, этот уровень недоступен вам ни за какую цену, и это жёсткая граница, а не выбор конфигурации. Также учтите, что эндпойнты резидентности включают надбавку 10% для моделей, выпущенных 5 марта 2026 года или позднее, к которым относится и GPT-6 Astra.
Ключевой показатель скорости снизился с 14x до 8x
Об этом стоит сказать аккуратно, потому что число, фигурирующее в большинстве публикаций, устарело. На странице документации OpenAI об Ultrafast, в том виде, в каком она опубликована сегодня, есть строка: «наш самый быстрый уровень обслуживания API — до 8 раз быстрее, чем режим Standard». В анонсе предварительной версии GPT-5.6 Sol от 13 августа 2026 года обещалась «до 14 раз быстрее, чем обработка Standard», а также до 750 выходных токенов в секунду на оборудовании Cerebras.
Это не одно и то же утверждение, и разница здесь не столько отказ от прежних слов, сколько смена темы. Показатель 14x был измерен на GPT-5.6 Sol в рамках ограниченного превью; показатель 8x — это то, что OpenAI публикует для текущего уровня тарифа, где GPT-6 Astra является широкодоступной моделью. Тот, кто планирует бюджет исходя из 14x на Astra, планирует исходя из цифры, которую OpenAI для Astra не публиковала. Честное прочтение таково: обе цифры — это заявленные вендором потолки пропускной способности вывода, ни одна из них не является гарантией задержки для вашей нагрузки, а сквозное время всё равно включает обработку входных данных, вызовы инструментов и вашу собственную оркестрацию. Берите 8x как цифру для планирования, а всё лучшее считайте бонусом, который вы проверяете на своём собственном трафике, а не принимаете на веру.
Что делать с этим в понедельник
Правило принятия решений, вытекающее из арифметики, уже, чем подразумевает маркетинг, и его стоит записать, прежде чем кто-нибудь предложит включить Ultrafast в масштабе всего парка.
Включайте его там, где рабочая нагрузка ограничена задержкой и интерактивна, и там, где ждёт человек. Триаж инцидентов, эскалация в службу поддержки в реальном времени, исследовательский цикл, в котором аналитик перебирает варианты в рамках одного сеанса — это те случаи, когда ценность ответа, приходящего сейчас, а не через четыре минуты, не пропорциональна цене токенов, и когда счёт, в 6 раз больший на небольшом числе ходов, ничтожно меньше стоимости ожидания человека. Собственные примеры OpenAI в анонсе предварительной версии были ровно такими: чтение логов, пока разворачивается сбой, сжатие ночного исследовательского цикла до рабочего сеанса.
Оставьте его выключенным там, где рабочая нагрузка ограничена пропускной способностью или имеет пакетный характер. Ночная переиндексация, массовый прогон классификации, отчёт по расписанию, бэкфилл — ни одна из них не заботится о фактической задержке, все они определяются количеством токенов, и у всех есть вариант с 0,5x прямо здесь же, на той же тарифной карте в Batch и Flex. Платить в 12 раз больше пакетного тарифа, чтобы завершить раньше, — самый очевидный способ выбросить деньги в этой таблице.
Неловкая середина — это агентный цикл программирования, и именно там арифметика числа ходов всё решает. Если скорость действительно устраняет повторные попытки — если первая попытка модели при многофайловом изменении удаётся чаще, потому что она не борется с тайм-аутом, — тогда Ultrafast может быть дешевле в расчёте на завершённую задачу, несмотря на 6-кратную цену за токен. Это измеримое утверждение о ваших собственных трассировках, а не общее, и измерение обходится дёшево: посчитайте оплачиваемые ходы на завершённую задачу на обоих уровнях и умножьте на тариф. Если соотношение не близко к шести, быстрый уровень — это покупка низкой задержки, и оправдывать её следует именно так.
Уровень оценён; маршруты вокруг него — не тот же вопрос.
Одно практическое замечание о том, как это использовать. GPT-6 Astra в стандартном варианте обслуживания уже доступна на OrcaRouter как openai/gpt-6-astra по собственной ставке провайдера — $10.00 за вход и $50.00 за выход за миллион токенов, а при длинном контексте 272K — $20.00 / $75.00 — предоставляется с наценкой 0%, то есть прейскурантная цена провайдера передаётся напрямую, и любое изменение со стороны поставщика попадает в ваш счёт в тот же день, когда оно появляется в тарифной сетке OpenAI, а не при следующем продлении контракта. Один и тот же ключ открывает доступ более чем к 200 моделям, поэтому стандартный уровень может находиться за тем же клиентом, что и дешёвый уровень или модель конкурента, без второй интеграции.
Чего мы не делаем — так это не обслуживаем уровень Ultrafast. Это флаг уровня обслуживания в аккаунте OpenAI, а не отдельно маршрутизируемая модель — вы задаёте service_tier: "ultrafast" в запросе к gpt-6-astra — и OpenAI выставляет за него счёт на ваш собственный аккаунт по указанным выше тарифам. Если вы его включите, он будет работать в вашей прямой интеграции с OpenAI, а OrcaRouter — подходящее место для трафика стандартного уровня, который вы направляете наряду с ним. Сказать это прямо полезнее, чем подразумевать возможность, которой у нас нет.

Правило принятия решения, в одном абзаце
Шестикратная цена — это цена тарифного уровня, а не модели: веса, контекстное окно в 1 050 000 токенов, потолок вывода в 128 000 токенов и ответы полностью совпадают со стандартной GPT-6 Astra. Вы покупаете до 8-кратно более высокую пропускную способность вывода по тарифной сетке, где каждая позиция в 6 раз дороже, при низких начальных лимитах скорости и ограничении на резидентство в США, которое полностью исключает ЕС. Эта сделка очевидно оправданна для человека, ожидающего ответа, очевидно неверна для планового пакетного задания, для которого доступен маршрут за полцены, и по-настоящему неоднозначна для агентных циклов, где всё зависит от того, устраняет ли скорость лишние ходы. Измерьте число ходов на собственных трассировках, прежде чем брать обязательства, а остальное направляйте по прейскурантной цене.

Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
