
GPT-6 Astra Ultrafast работает на Blackwell: NVIDIA называет оборудование, обеспечивающее 8-кратный прирост
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 223 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
1 октября 2026 года NVIDIA опубликовала пост Диона Харриса под заголовком «Как GPU NVIDIA помогают ускорять OpenAI GPT-6 Astra Ultrafast», и предложение в его центре — это первый случай, когда любая из компаний сказала, на чём работает этот тариф: «GPT-6 Astra Ultrafast, работающий на GPU NVIDIA Blackwell, уже доступен в API OpenAI и для подходящих пользователей ChatGPT Work и Codex». Это и есть новость, и она уже́, чем предполагает заголовок. GPT-6 Astra, сама модель, была выпущена 3 сентября 2026 года. Уровень обслуживания Ultrafast поверх неё стал широко доступен 29 сентября 2026 года. Заявление о скорости — до 8 раз более быстрая генерация токенов, чем в стандартном режиме Astra, — было уже двухдневной давности, когда NVIDIA его повторила.
Что подводит к вопросу, на который на самом деле отвечает этот пост: не «насколько он быстр», а «чей это кремний».

Три вещи, которые пост на самом деле добавил
Если убрать повтор, пост от 1 октября добавляет три факта.
• Аппаратное обеспечение — Blackwell. Собственная документация OpenAI по Ultrafast, опубликованная 30 сентября, описывает скорость этого уровня, его конфигурацию и лимиты запросов и не называет ни одного GPU. Так что указание на конкретный чип опирается на единственный источник — производителя оборудования. Это не делает его ложным; это делает его заявлением производителя о собственном оборудовании, и его стоит помечать именно так.
• Два инженера, названные по имени — Филипп Тилле, руководитель направления инференса в OpenAI, и Удай Раддарраджу, технический директор OpenAI по вычислительным ресурсам, — оба официально прокомментировали, чем было вызвано это ускорение.
• Аудитория — «пользователи ChatGPT Work и Codex, соответствующие критериям доступа», что шире, чем ориентированная исключительно на API формулировка, с которой запускался этот уровень. В собственной документации OpenAI по-прежнему указано, что Ultrafast для GPT-6 Astra «доступен всем пользователям API при низких лимитах запросов», и эта оговорка о низких лимитах официально так и не была снята.
Две цитаты, и почему они — интересная часть
Вклад Тийе — это цикл, а не бенчмарк. Инвестиции NVIDIA в инструментарий и документацию, по его словам, «позволили нам сделать наши модели исключительно хорошими в программировании», а Astra затем может «превратить эти знания в высокопроизводительные ядра, которые делают оборудование NVIDIA привлекательным». Руддарраджу более прямолинеен относительно направления работы: «Мы использовали наши внутренние модели, чтобы оптимизировать инференс на GPU NVIDIA».
Если читать это вместе, перед нами утверждение о развёртывании, а не о возможностях: передовые модели OpenAI теперь настолько хорошо пишут ядра GPU, что OpenAI использует их для оптимизации собственного стека обслуживания. Это также согласуется с тем единственным разделом публикации NVIDIA, который вообще не посвящён неделе запуска, — с заголовком «Постоянное повышение производительности», где утверждается, что развёрнутый инференс со временем становится быстрее, потому что OpenAI продолжает нацеливать свои модели на программное обеспечение NVIDIA, на котором работает сама.
Ничто из этого не является измерением. Это два инженера, описывающие процесс, опубликованный компанией, которая продала эти GPU. Честное прочтение таково: процесс правдоподобен, в него ничего не стоит поверить, и его невозможно опровергнуть извне — и то же самое верно для каждой цифры скорости в этой истории.
Blackwell здесь, Cerebras там
Самое полезное, что делает этот пост, — обнажает раскол, который никто не объяснил. {{1}}13 августа 2026 года{{/1}} OpenAI представила быстрый уровень на базе другой модели — {{2}}GPT-5.6 Sol{{/2}}, работающей «до {{3}}14×{{/3}}» быстрее, — и назвала {{4}}Cerebras{{/4}} партнёром, стоящим за этим, описав аппаратное обеспечение масштаба пластины, генерирующее до {{5}}750 выходных токенов в секунду{{/5}}. Семь недель спустя быстрый уровень на {{6}}Astra{{/6}} работает на {{7}}Blackwell{{/7}}, и показатель — {{8}}8x{{/8}}.
Два быстрых уровня, два аппаратных ответа: один — специализированный партнёр, другой — крупнейший поставщик самой компании. Ни один из поставщиков не опубликовал сравнение двух путей обслуживания, и ни один независимый оценщик не проводил измерений ни по одному из них. Обратите также внимание, как в посте NVIDIA используется второе название: «Rubin» встречается один раз — внутри цитаты Тиллета о моделях, пишущих ядра для «графических процессоров Blackwell и Rubin». Это утверждение о том, что могут программировать модели OpenAI, а не утверждение, что сегодня что-либо обслуживается на Rubin.
Число, которое NVIDIA не напечатала
В этой истории есть цифра, которую ни одна из компаний не поставила рядом с 8x, и именно она решает, включает ли команда этот тариф. В опубликованном прайс-листе Ultrafast от OpenAI указана gpt-6-astra по цене $60.00 за миллион входных токенов, $6.00 за кэшированный ввод, $75.00 за запись в кэш и $300.00 за вывод. Та же модель на стандартном тарифе стоит $10.00 и $50.00, при этом кэшированный ввод — $1.00, а запись в кэш — $12.50. Каждый столбец ровно в шесть раз превышает стандартный тариф.
• Множитель — 6,00x на вход, выход, кэшированный ввод и запись в кэш. Не «до». Шесть.
• Потолок — 8x, цифра, которую оба поставщика приводят с оговоркой «до» и без указания условий.
• Что это значит — ценовой мультипликатор находится ниже лучшего сценария, заявленного самим тарифом. На верхней границе сделка выгодна; при любом значении ниже 6x на вашем трафике вы платите больше за единицу сэкономленного времени, чем предполагает маркетинг. Поэтому единственная значимая проверка этого тарифа — измерение на ваших собственных запросах.
• Ступень для длинного контекста — свыше 272 000 входных токенов тарифы Ultrafast составляют $120.00 за вход и $450.00 за выход, что в шесть раз превышает собственные ступенчатые тарифы стандартного уровня.
• Операционные детали — OpenAI документирует градацию Ultrafast по токенам в минуту: 500 000 для уровней использования с 1 по 3, 1 000 000 для уровня 4 и 5 000 000 для уровня 5; Ultrafast поддерживает только резидентность данных в США и глобальную обработку, без региональной конечной точки обработки для ЕС или других регионов за пределами США; а документация рекомендует WebSockets для Ultrafast, «особенно для агентных приложений, которые совершают множество вызовов инструментов подряд», предупреждая, что «без постоянного соединения сетевые накладные расходы могут снизить выигрыш в задержке».

Именно на последнем пункте и нужно действовать. Команда, которая включает этот уровень и оставляет под ним HTTP на каждый запрос, заплатила в шесть раз больше, чтобы вернуть часть ускорения обратно на установку соединений — задокументированный, предотвратимый способ впустую потратить деньги.
Как это выглядит с одного эндпоинта
GPT-6 Astra доступна на OrcaRouter как openai/gpt-6-astra: контекстное окно размером 1 050 000 токенов, до 128 000 выходных токенов, ввод текста, изображений и файлов, а цена OpenAI из прайс-листа передаётся напрямую — $10.00 за входные и $50.00 за выходные за миллион токенов, с повышением до $20.00 и $75.00 при превышении 272 000 входных токенов. Её ключевой бенчмарк в каталоге — 96,1 на GPQA Diamond.
Тариф Ultrafast отсутствует на OrcaRouter — и не может там быть: это не идентификатор модели, а атрибут аккаунта OpenAI с контролем доступа, поэтому openai/gpt-6-astra-ultrafast возвращает «модель не найдена». Если вы включите этот тариф, он будет жить в вашей прямой интеграции с OpenAI. А что эндпоинт с более чем 200 моделями с 0% наценки даёт вам в этой ситуации — так это не быстрый путь, а контроль. Поскольку прайс-лист провайдера передаётся как есть, без наценки, изменение тарифов OpenAI отражается на нашей стороне в тот же день, что и на их стороне, а поскольку стандартный канал Astra уже доступен, эксперимент, который решит этот вопрос, — это одна строка конфигурации: тот же промпт, стандартный тариф и модель подешевле рядом, на том же ключе. Это самое близкое к тесту задержки, что большинство команд когда-либо запустит, и настройка не стоит ничего.

Что до сих пор не измерено?
Сегодня можно проверить три вещи. Этот тариф существует, он указан в прайс-листе ровно по шестикратной стандартной ставке, и с 1 октября он публично приписывается GPU NVIDIA Blackwell.
Одно — это не множитель вашего трафика. Ни один вендор не опубликовал распределение задержек для этого уровня при заявленном уровне параллелизма, и ни одна третья сторона не воспроизвела восьмикратный результат. Также нет сравнения Astra в режиме Ultrafast с Astra в стандартном режиме — и лестного сравнения быть не должно: это один и тот же чекпоинт на более быстром пути, поэтому при одинаковых настройках должны получаться одинаковые ответы, различаться может только скорость. Если две ваши линии расходятся на одних и тех же промптах, у вас баг-репорт, а не фича.
Итак, полезная суть от 1 октября скромнее, чем звучит анонс. Это тот же уровень по той же цене с тем же непроверенным потолком скорости, только теперь с ярлыком оборудования. Этот ярлык важен — он говорит, на какой линейке ускорителей OpenAI масштабирует всё это, и говорит о том, что история быстрого уровня перешла от узкоспециализированного партнёра к крупнейшему поставщику GPU в отрасли меньше чем за два месяца. Просто он ничего не говорит о вашем собственном бюджете задержки, и никакой пост об этом не расскажет.
