Сгенерированная hero-карточка заголовка для «GPT-5.6 Sol Ultrafast vs GPT-5.6 Sol» с надзаголовком «Одинаковые веса. Другой уровень обслуживания.» и двумя карточками: слева «GPT-5.6 Sol Ultrafast» со списком: Оборудование: пластины Cerebras, Скорость: до 750 ток/с, Цена: пока не опубликована; справа «GPT-5.6 Sol» со списком: Оборудование: кластеры GPU, Скорость: стандартная, Цена: $4.00 / $20.00; в нижнем колонтитуле «Обе версии используют идентичный чекпоинт GPT-5.6 Sol.» Логотип OrcaRouter в правом нижнем углу.
Guides & Insights

GPT-5.6 Sol Ultrafast против GPT-5.6 Sol: те же веса, другой уровень обслуживания

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

GPT-5.6 Sol Ultrafast — это не новая модель, и это не история о запуске. 13 августа 2026 года поставщик объявил об этом режиме, и в тот же день значение ultrafast появилось в публичной схеме OpenAPI компании — в описании ServiceTierResponses спецификации, которое, судя по его собственной формулировке, ограничивает этот уровень эндпоинтом gpt-5.6-sol и помечает его как доступный по разрешению. Что вернуло эту страницу в нашу очередь — нечто меньшее и более конкретное: 25 сентября 2026 года коммит fe4f7a1 добавил это значение ещё в два перечисления — параметр service-tier на уровне запроса и поле политики service-tier агента. Спустя шесть недель после объявления этот уровень всё ещё в списке ожидания, у него всё ещё нет опубликованной цены, и теперь он подключён к большей части поверхности API, чем может реально обслуживать. GPT-5.6 Sol Ultrafast и GPT-5.6 Sol — одна и та же модель; единственное, что может решить это сравнение, — кто управляет указателем и кто сообщил вам о стоимости.

Итак, пара, вынесенная в заголовок, необычна. GPT-5.6 Sol Ultrafast и GPT-5.6 Sol — это одна и та же модель. Те же веса, тот же чекпойнт, то же поведение при рассуждениях, то же контекстное окно на 1,05 млн токенов, тот же максимальный объём вывода 128K, те же ответы. Собственная формулировка OpenAI — «больше полезной работы в секунду», а не «более умная модель». Единственное, что отличается между двумя колонками этого сравнения, — это то, как создаются токены, и то, как называется уровень в теле вашего запроса. Это делает его самым чистым контрольным экспериментом в текущей линейке и одновременно самым сложным для выбора, потому что у одного из двух уровней вообще нет опубликованной цены.

Что на самом деле изменилось на этой неделе?

Доказательством сентябрьского изменения служит коммит, а не пост в блоге. OpenAI поддерживает openai-openapi — репозиторий, который публикует машиночитаемую схему для своего API, — и коммит fe4f7a1 от 2026-09-25 добавляет ultrafast в два перечисления: политику уровня обслуживания, привязанную к агентам, и поле уровня запроса, которое спецификация описывает как «уровень обслуживания, используемый для запросов к модели». Это расширение, а не дебют: до этого коммита в этих двух списках значились auto, default, flex, priority, fast, а сам уровень уже присутствовал в схеме с 13 августа. Этот коммит заслуживает внимания из-за того, до какого поля он добрался, — поля политики, с которым настраивается агент, а это другая поверхность, нежели переопределение на уровне отдельного запроса.

Описание, которое имеет значение, относится к коммиту от 13 августа, а не к этому, и это самое конкретное заявление OpenAI об этом уровне, опубликованное где-либо. Наряду с новым значением в спецификации говорится: «Если установлено значение 'ultrafast', запрос будет обработан с использованием уровня обслуживания Ultrafast Processing с контролем доступа. Сейчас этот уровень доступен для gpt-5.6-sol; в ответе, полученном через него, будет указано service_tier=ultrafast».

Перечитайте это предложение дважды, потому что оно снимает два вопроса, которые иначе пришлось бы обходить с оговорками на этой странице сравнения. Этот уровень ограничен одной моделью — флагманом GPT-5.6 Sol и ничем больше в линейке — и доступ к нему контролируется, а не открыт, что совпадает с формулировкой OpenAI о предварительном просмотре с листом ожидания. Оно также подсказывает, как понять, что вы его получили: ответ возвращает сведения о том, какой уровень фактически обслужил запрос, так что откат к стандартной обработке виден в теле ответа, а не требует догадок по задержке. Это же описание присутствует в обеих схемах Responses — стандартной и Beta — и сохраняется с 13 августа.

A screenshot of the GitHub commit page for openai/openai-openapi commit fe4f7a1 by openai-openapi-publisher[bot], titled "Add 'ultrafast' service tier option to improve request speed", showing the diff adding "ultrafast" to the enum lists after "fast" and a new x-enumDescription reading "Uses the ultrafast service tier."

Второй, более слабый сигнал поступил на следующий день. В отчёте от 26 сентября описывается новый селектор Speed — Fast, Standard и Ultrafast — который появится в Responses API Playground, при этом более широкое распространение Ultrafast ожидается после конференции разработчиков DevDay от OpenAI. Мы сами не видели этот селектор, и OpenAI не публиковала заметку о развёртывании, так что относитесь к этому как к отчёту из одного источника, а не как к уже выпущенной функции. Что можно проверить сегодня — это два места в публичной схеме и тот факт, что для этого уровня не появилось тарифной сетки.

То, что не изменилось, не менее важно. Цены Ultrafast по-прежнему нет. На странице цен OpenAI, прочитанной 27 сентября, есть те же четыре вкладки, что и раньше, — Standard, Batch, Flex и Fast, — а строка «ultrafast» нигде на ней не встречается. Доступ по-прежнему описывается как ограниченное превью для избранных клиентов, которое расширяется по мере роста мощностей. Этот тариф одновременно есть в контракте и отсутствует в прайс-листе, и это честное положение вещей.

Два уровня рядом

Поскольку ни одна возможность не отличает эти две, сравнение почти полностью сводится к обслуживанию и биллингу. Каждая строка ниже объединяет обе стороны в одной строке.

• Модель — GPT-5.6 Sol Ultrafast работает на том же самом чекпойнте GPT-5.6 Sol, что и стандартная обработка GPT-5.6 Sol: тот же чекпойнт, без дистилляции, без уменьшения размера.

• Пропускная способность вывода — до 750 выходных токенов в секунду, до 14× относительно стандартной, согласно объявлению OpenAI от 13 августа, по сравнению со стандартной обработкой GPT-5.6 Sol на кластерах GPU; именно относительно этого показателя измеряется 14×.

• Аппаратное обеспечение — чипы Cerebras масштаба пластины, веса хранятся во встроенной SRAM на чипе, первый продукт январского партнёрства OpenAI и Cerebras 2026 года в сфере вычислений, оцениваемого примерно в $10 млрд за три года, по сравнению с традиционным инференсом на GPU, где большая часть времени уходит на перемещение весов между памятью и вычислительными блоками.

• Цена — не опубликована по состоянию на 27 сентября 2026 года, в отличие от текущего промо-тарифа OpenAI: $4,00 за входные данные / $20,00 за выходные данные за миллион токенов плюс $0,40 за миллион за кэшированный ввод.

• Доступность — ограниченное превью по списку ожидания для отдельных клиентов против стандартного канала, вызываемого любым обладателем API-ключа.

• Ответы, которые вы получаете, — идентичные в принципе vs идентичные в принципе; если они расходятся на одном и том же промпте, это находка, а не особенность.

A generated two-column scoreboard titled 'GPT-5.6 Sol Ultrafast vs GPT-5.6 Sol — the scoreboard'. Left column 'GPT-5.6 Sol Ultrafast': Checkpoint same as Sol, Serving hardware Cerebras wafers, Output speed up to 750 tok/s, Speed vs standard up to 14x, Price not published, Access waitlisted preview. Right column 'GPT-5.6 Sol': Checkpoint same as Sol, Serving hardware GPU clusters, Output speed standard processing, Speed vs standard 1x baseline, Price $4.00 / $20.00, Access open to any API key. Footer sourcing line; OrcaRouter logo bottom-right.

Заявка о скорости и потолок для неё

Цифра в заголовке — 14×, и она заслуживает такого же внимания, как и остальная часть этой страницы. OpenAI заявляет до 750 выходных токенов в секунду по сравнению со стандартной обработкой — это показатель пропускной способности для выходных токенов, а не утверждение, что каждый запрос завершается в 14 раз быстрее. Сквозное время также включает обработку входных данных и собственные рассуждения модели, и ни то, ни другое аппаратное обеспечение масштаба пластины не сжимает в той же пропорции. Именно поэтому компания называет 14× максимумом, а не измерением.

Опубликованные сравнения основаны на данных производителей с обеих сторон таблицы, и одно из них охватывает стеки двух вендоров. Прогон Humanity's Last Exam из 2 500 вопросов, как сообщается, завершился за 11 часов 11 минут на Ultrafast против 78 часов 27 минут для Claude Fable 5, при сопоставимой точности — то есть OpenAI и Cerebras рассказывают нам о бенчмарке, включающем модель конкурента, а независимые материалы о запуске приводили более узкое сравнение скорости генерации примерно в 11× на том же прогоне, тогда как собственные цифры Cerebras подразумевают около 7× для общего времени тестирования. Разрыв между 14×, 11× и 7× не является противоречием; это то, что происходит, когда три стороны измеряют разные части одной рабочей нагрузки. Cerebras отдельно сообщает о 5,6× сквозного ускорения на GDP-Val без измеримых потерь качества. Ничего из этого не было воспроизведено третьей стороной.

В прайс-листе есть дыра

Вот где два уровня перестают быть симметричными. У GPT-5.6 Sol есть четыре опубликованные тарифные карты, и Ultrafast не входит в их число.

• Standard GPT-5.6 Sol — $4,00 / $20,00 за миллион токенов, при этом кэшированный ввод стоит $0,40, а уровень для длинного контекста — $8,00 / $30,00, когда ввод превышает примерно 272 тыс. токенов.

• Быстрый режим — $8,00 / $40,00, ровно вдвое больше стандартного тарифа. Это уровень, который 30 июля 2026 года был переименован из Priority processing, и API принимает либо service_tier: "priority", либо service_tier: "fast". Он обеспечивает до примерно 2,5× скорости вывода.

• Batch и Flex — $2.00 / $10.00, ровно 50% скидки от стандартной цены в обмен на более свободный график.

• Ultrafast — нет тарифной карты. Не пробел, который мы заполнили догадкой; пробел, который оставила OpenAI.

Эта строка Fast-mode — единственный реальный ориентир, с которым можно сопоставлять цену Ultrafast, и для любого, кто планирует бюджет, он отрезвляющий: единственный скоростной тариф, по которому OpenAI действительно назвала цифру, стоит ровно вдвое дороже стандартного тарифа, обеспечивая в два с половиной раза большую скорость. Ultrafast — это более масштабное заявление о скорости, опирающееся на более дефицитное оборудование, — производственные мощности Cerebras по выпуску пластин не являются массовым товаром, — поэтому направление будущей наценки сомнений не вызывает. А вот её размер. Пока не появится тарифная сетка, любая цифра «цены GPT-5.6 Sol Ultrafast», которую вы где-либо увидите, — это чьё-то умозаключение, включая любое наше.

Как бы вы это на самом деле назвали?

Изменение схемы подсказывает, как будет выглядеть итоговый вызов. Если этот уровень следует шаблону остальных, он приходит как дополнительное поле в запросе, который вы и так уже делаете: вы сохраняете модель gpt-5.6-sol, сохраняете свой промпт и добавляете селектор уровня — точно так же, как сегодня выбирается режим Fast, заменой priority на fast. В разборе ответа ничего не меняется, потому что ничего не меняется в самой модели. В этом вся привлекательность уровня обслуживания по сравнению с заменой модели — и причина, по которой на такой странице сравнения, как эта, сравнивать почти нечего.

Чего вы не можете сделать сегодня — так это вызвать его. Значение перечисления существует; а вот мощностей за ним у большинства аккаунтов нет. Поэтому практический вопрос на ближайшие несколько недель не в том, какой из двух уровней выбрать, — а в том, что запускать, пока этот выбор недоступен.

На это лучше отвечает шлюз, чем лист ожидания. Стандартный тариф модели уже доступен на OrcaRouter как openai/gpt-5.6-sol, обслуживается по собственной ставке провайдера с нулевой наценкой на токены, через OpenAI-совместимый эндпоинт по адресу api.orcarouter.ai/v1 — так что промо-цены OpenAI $4 / $20 и его ступень для длинного контекста $8 / $30 передаются напрямую, а не переоцениваются нами, и изменение в них появляется у нас в тот же день, когда оно появляется у OpenAI. Тот же ключ обслуживает 200+ моделей, и здесь это значит больше, чем обычно: поскольку вы не можете задать service_tier: "ultrafast" и получить ответ, способ купить низкую задержку сегодня — маршрутизировать работу иначе: отправляйте интерактивные вызовы той модели в каталоге, которая быстрее всех проходит вашу планку качества, а ночные пакеты держите на самом дешёвом канале, который её проходит. Когда этот тариф всё же откроется, именно в роутере вы бы переключили тумблер, а до тех пор это разница между листом ожидания и планом.

A screenshot of OrcaRouter's own model page for OpenAI GPT-5.6 Sol at /models/openai/gpt-5.6-sol, showing the live catalogue entry with the openai/gpt-5.6-sol identifier, Vision, Tools, JSON and Reasoning capabilities, the byline 'by OpenAI - 2026-07-09', code samples, pricing, performance and public benchmark sections listed on-page.

Какой из них должен использоваться в production?

Проигнорируйте на мгновение слово «versus», потому что здесь не нужно принимать никакого решения по качеству. Если вы оптимизируете стоимость за токен, ответ — стандартный GPT-5.6 Sol, а для всего, что может подождать, ответ — Batch-направление со скидкой 50%. Если вы оптимизируете то, как долго человек сидит перед индикатором загрузки, ответ — Ultrafast, как только вы сможете его получить, — и рабочие нагрузки, которые OpenAI называет для предпросмотра, наглядно показывают, почему именно: реагирование на инциденты с открытыми логами и диффами при активном сбое, проверки на мошенничество по изменяющимся данным, диалоги поддержки, где полсекунды тишины воспринимаются как сломанный продукт, и исследовательские циклы, которые раньше выполнялись за ночь, сжимаются в одну рабочую сессию.

Выдающий признак — это форма вашего графа запросов, а не размер вашего промпта. Одна длинная генерация на бумаге даёт выигрыш 14×, а на практике — заметно меньше, потому что обработка входных данных и рассуждения не сжимаются в такой пропорции. Сорок последовательных вызовов инструментов за одним видимым пользователю действием дают результат, гораздо более близкий к полному множителю, потому что каждый из этих циклов обмена — это задержка, которую пользователь пережидает. Если ваша нагрузка похожа на второй случай, этот уровень предназначен для вас; если на первый — стандартного пути вам и так всегда хватало.

За двумя вещами стоит следить, и ни одна из них — не слух, который мы могли бы здесь подтвердить или опровергнуть. Во-первых, тарифная сетка: премиальный уровень без цены невозможно заложить в бюджет, а прецедент Fast-mode подсказывает, что она не будет маленькой. Во-вторых, действительно ли список ожидания снимут к DevDay, как сообщается, — потому что значение service_tier, которое большинство аккаунтов не может использовать, — это документация, а не доступность, и разница между ними — это разница между планом и обещанием.