Сгенерированная титульная карточка с заголовком «GPT-6 Astra Ultrafast работает на Blackwell», подзаголовком «NVIDIA называет аппаратное обеспечение, обеспечивающее 8-кратный прирост», и три карточки с надписями «Аппаратное обеспечение: GPU Blackwell», «Кратность цены: 6,00x от стандартного тарифа» и «Заявленная скорость: до 8x», а внизу — нижний колонтитул с текстом «Публикация NVIDIA, 1 октября 2026 г. — данные со слов производителя».
Guides & Insights

GPT-6 Astra Ultrafast работает на Blackwell: NVIDIA называет оборудование, обеспечивающее 8-кратный прирост

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

1 октября 2026 года NVIDIA опубликовала пост Диона Харриса под заголовком «Как GPU NVIDIA помогают ускорять OpenAI GPT-6 Astra Ultrafast», и предложение в его центре — это первый случай, когда любая из компаний сказала, на чём работает этот тариф: «GPT-6 Astra Ultrafast, работающий на GPU NVIDIA Blackwell, уже доступен в API OpenAI и для подходящих пользователей ChatGPT Work и Codex». Это и есть новость, и она уже́, чем предполагает заголовок. GPT-6 Astra, сама модель, была выпущена 3 сентября 2026 года. Уровень обслуживания Ultrafast поверх неё стал широко доступен 29 сентября 2026 года. Заявление о скорости — до 8 раз более быстрая генерация токенов, чем в стандартном режиме Astra, — было уже двухдневной давности, когда NVIDIA его повторила.

Что подводит к вопросу, на который на самом деле отвечает этот пост: не «насколько он быстр», а «чей это кремний».

A screenshot of OpenAI's Ultrafast mode documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the note that Ultrafast for GPT-6 Astra is currently available to all API users at low rate limits with higher limits or Sol preview access requestable through an OpenAI account team, the recommendation to use WebSockets because without a persistent connection network overhead can reduce the latency gains, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

Три вещи, которые пост на самом деле добавил

Если убрать повтор, пост от 1 октября добавляет три факта.

• Аппаратное обеспечение — Blackwell. Собственная документация OpenAI по Ultrafast, опубликованная 30 сентября, описывает скорость этого уровня, его конфигурацию и лимиты запросов и не называет ни одного GPU. Так что указание на конкретный чип опирается на единственный источник — производителя оборудования. Это не делает его ложным; это делает его заявлением производителя о собственном оборудовании, и его стоит помечать именно так.

• Два инженера, названные по имени — Филипп Тилле, руководитель направления инференса в OpenAI, и Удай Раддарраджу, технический директор OpenAI по вычислительным ресурсам, — оба официально прокомментировали, чем было вызвано это ускорение.

• Аудитория — «пользователи ChatGPT Work и Codex, соответствующие критериям доступа», что шире, чем ориентированная исключительно на API формулировка, с которой запускался этот уровень. В собственной документации OpenAI по-прежнему указано, что Ultrafast для GPT-6 Astra «доступен всем пользователям API при низких лимитах запросов», и эта оговорка о низких лимитах официально так и не была снята.

Две цитаты, и почему они — интересная часть

Вклад Тийе — это цикл, а не бенчмарк. Инвестиции NVIDIA в инструментарий и документацию, по его словам, «позволили нам сделать наши модели исключительно хорошими в программировании», а Astra затем может «превратить эти знания в высокопроизводительные ядра, которые делают оборудование NVIDIA привлекательным». Руддарраджу более прямолинеен относительно направления работы: «Мы использовали наши внутренние модели, чтобы оптимизировать инференс на GPU NVIDIA».

Если читать это вместе, перед нами утверждение о развёртывании, а не о возможностях: передовые модели OpenAI теперь настолько хорошо пишут ядра GPU, что OpenAI использует их для оптимизации собственного стека обслуживания. Это также согласуется с тем единственным разделом публикации NVIDIA, который вообще не посвящён неделе запуска, — с заголовком «Постоянное повышение производительности», где утверждается, что развёрнутый инференс со временем становится быстрее, потому что OpenAI продолжает нацеливать свои модели на программное обеспечение NVIDIA, на котором работает сама.

Ничто из этого не является измерением. Это два инженера, описывающие процесс, опубликованный компанией, которая продала эти GPU. Честное прочтение таково: процесс правдоподобен, в него ничего не стоит поверить, и его невозможно опровергнуть извне — и то же самое верно для каждой цифры скорости в этой истории.

Blackwell здесь, Cerebras там

Самое полезное, что делает этот пост, — обнажает раскол, который никто не объяснил. {{1}}13 августа 2026 года{{/1}} OpenAI представила быстрый уровень на базе другой модели — {{2}}GPT-5.6 Sol{{/2}}, работающей «до {{3}}14×{{/3}}» быстрее, — и назвала {{4}}Cerebras{{/4}} партнёром, стоящим за этим, описав аппаратное обеспечение масштаба пластины, генерирующее до {{5}}750 выходных токенов в секунду{{/5}}. Семь недель спустя быстрый уровень на {{6}}Astra{{/6}} работает на {{7}}Blackwell{{/7}}, и показатель — {{8}}8x{{/8}}.

Два быстрых уровня, два аппаратных ответа: один — специализированный партнёр, другой — крупнейший поставщик самой компании. Ни один из поставщиков не опубликовал сравнение двух путей обслуживания, и ни один независимый оценщик не проводил измерений ни по одному из них. Обратите также внимание, как в посте NVIDIA используется второе название: «Rubin» встречается один раз — внутри цитаты Тиллета о моделях, пишущих ядра для «графических процессоров Blackwell и Rubin». Это утверждение о том, что могут программировать модели OpenAI, а не утверждение, что сегодня что-либо обслуживается на Rubin.

Число, которое NVIDIA не напечатала

В этой истории есть цифра, которую ни одна из компаний не поставила рядом с 8x, и именно она решает, включает ли команда этот тариф. В опубликованном прайс-листе Ultrafast от OpenAI указана gpt-6-astra по цене $60.00 за миллион входных токенов, $6.00 за кэшированный ввод, $75.00 за запись в кэш и $300.00 за вывод. Та же модель на стандартном тарифе стоит $10.00 и $50.00, при этом кэшированный ввод — $1.00, а запись в кэш — $12.50. Каждый столбец ровно в шесть раз превышает стандартный тариф.

• Множитель — 6,00x на вход, выход, кэшированный ввод и запись в кэш. Не «до». Шесть.

• Потолок — 8x, цифра, которую оба поставщика приводят с оговоркой «до» и без указания условий.

• Что это значит — ценовой мультипликатор находится ниже лучшего сценария, заявленного самим тарифом. На верхней границе сделка выгодна; при любом значении ниже 6x на вашем трафике вы платите больше за единицу сэкономленного времени, чем предполагает маркетинг. Поэтому единственная значимая проверка этого тарифа — измерение на ваших собственных запросах.

• Ступень для длинного контекста — свыше 272 000 входных токенов тарифы Ultrafast составляют $120.00 за вход и $450.00 за выход, что в шесть раз превышает собственные ступенчатые тарифы стандартного уровня.

• Операционные детали — OpenAI документирует градацию Ultrafast по токенам в минуту: 500 000 для уровней использования с 1 по 3, 1 000 000 для уровня 4 и 5 000 000 для уровня 5; Ultrafast поддерживает только резидентность данных в США и глобальную обработку, без региональной конечной точки обработки для ЕС или других регионов за пределами США; а документация рекомендует WebSockets для Ultrafast, «особенно для агентных приложений, которые совершают множество вызовов инструментов подряд», предупреждая, что «без постоянного соединения сетевые накладные расходы могут снизить выигрыш в задержке».

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing the gpt-6-astra row at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that regional processing endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP endpoints carry a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

Именно на последнем пункте и нужно действовать. Команда, которая включает этот уровень и оставляет под ним HTTP на каждый запрос, заплатила в шесть раз больше, чтобы вернуть часть ускорения обратно на установку соединений — задокументированный, предотвратимый способ впустую потратить деньги.

Как это выглядит с одного эндпоинта

GPT-6 Astra доступна на OrcaRouter как openai/gpt-6-astra: контекстное окно размером 1 050 000 токенов, до 128 000 выходных токенов, ввод текста, изображений и файлов, а цена OpenAI из прайс-листа передаётся напрямую — $10.00 за входные и $50.00 за выходные за миллион токенов, с повышением до $20.00 и $75.00 при превышении 272 000 входных токенов. Её ключевой бенчмарк в каталоге — 96,1 на GPQA Diamond.

Тариф Ultrafast отсутствует на OrcaRouter — и не может там быть: это не идентификатор модели, а атрибут аккаунта OpenAI с контролем доступа, поэтому openai/gpt-6-astra-ultrafast возвращает «модель не найдена». Если вы включите этот тариф, он будет жить в вашей прямой интеграции с OpenAI. А что эндпоинт с более чем 200 моделями с 0% наценки даёт вам в этой ситуации — так это не быстрый путь, а контроль. Поскольку прайс-лист провайдера передаётся как есть, без наценки, изменение тарифов OpenAI отражается на нашей стороне в тот же день, что и на их стороне, а поскольку стандартный канал Astra уже доступен, эксперимент, который решит этот вопрос, — это одна строка конфигурации: тот же промпт, стандартный тариф и модель подешевле рядом, на том же ключе. Это самое близкое к тесту задержки, что большинство команд когда-либо запустит, и настройка не стоит ничего.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1,050,000-token context window, 128k maximum output, text, image and file input, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure and 155.1M tokens of traffic, with an OpenAI-compatible Python code sample and the EN language toggle in the header.

Что до сих пор не измерено?

Сегодня можно проверить три вещи. Этот тариф существует, он указан в прайс-листе ровно по шестикратной стандартной ставке, и с 1 октября он публично приписывается GPU NVIDIA Blackwell.

Одно — это не множитель вашего трафика. Ни один вендор не опубликовал распределение задержек для этого уровня при заявленном уровне параллелизма, и ни одна третья сторона не воспроизвела восьмикратный результат. Также нет сравнения Astra в режиме Ultrafast с Astra в стандартном режиме — и лестного сравнения быть не должно: это один и тот же чекпоинт на более быстром пути, поэтому при одинаковых настройках должны получаться одинаковые ответы, различаться может только скорость. Если две ваши линии расходятся на одних и тех же промптах, у вас баг-репорт, а не фича.

Итак, полезная суть от 1 октября скромнее, чем звучит анонс. Это тот же уровень по той же цене с тем же непроверенным потолком скорости, только теперь с ярлыком оборудования. Этот ярлык важен — он говорит, на какой линейке ускорителей OpenAI масштабирует всё это, и говорит о том, что история быстрого уровня перешла от узкоспециализированного партнёра к крупнейшему поставщику GPU в отрасли меньше чем за два месяца. Просто он ничего не говорит о вашем собственном бюджете задержки, и никакой пост об этом не расскажет.