Редакционная плоская векторная иллюстрация для главного баннера технологического блога о сверхбыстром инференсе ИИ: {{1}}большой скруглённый чип модели глубокого синего цвета с мягким голубым свечением на светлом фоне, {{2}}стилизованная молния и шкала скорости со стрелкой на максимуме рядом с ним, {{3}}быстрые потоки токенов, мчащиеся по горизонтальной линии скорости с линиями движения, и маленький секундомер.{{/3}} {{/2}} {{/1}} Белый фон с мягкими сине-голубыми градиентными акцентами и одним тонким тёплым бликом; минималистичные плоские линейные иконки; чистая современная геометрическая типографика без засечек; без читаемого текста, без букв, без слов, без водяных знаков, без сторонних логотипов; композиция 16:9.
Guides & Insights

GPT-5.6 Sol Ultrafast: скорость 14×, 750 ток/с — CS-4, по сообщениям, ~1300, цены пока нет

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

GPT-5.6 Sol Ultrafast mode — это аппаратно-ускоренный уровень обслуживания для флагманской модели: та же полная модель GPT-5.6 Sol, работающая на чипах Cerebras wafer-scale вместо GPU-кластеров, обеспечивающая до 14× скорости стандартной обработки и до 750 выходных токенов в секунду на уровне, который OpenAI анонсировала в августе. 2026-08-18 компания Cerebras представила систему следующего поколения CS-4, на которую опирается этот уровень, и ранний неподтверждённый отчёт утверждает, что GPT-5.6 Sol на CS-4 уже выдаёт примерно 1 300 токенов в секунду. Это не уменьшенная модель и не дистилляция: изменились только аппаратное обеспечение и планирование, а интеллект сохранён. Чего у него пока нет — так это цены: по состоянию на 2026-08-19 Ultrafast — это ограниченная API-превью-версия без опубликованного прайс-листа, поэтому единственная цифра, на которую вы можете реально опираться сегодня при составлении бюджета, — это стандартный уровень на действующей странице модели GPT-5.6 Sol: $5 за миллион входных токенов и $30 за миллион выходных, без какой-либо наценки. В этой статье рассказывается о том, что это за режим, насколько быстры цифры на самом деле — включая новое аппаратное обеспечение CS-4 и то, что ещё не подтверждено — сколько это стоит (включая честный ответ «цены пока нет»), и что делать, пока он не станет общедоступным.

Что такое режим Ultrafast на самом деле

Ultrafast — это уровень обслуживания, а не новая модель. OpenAI анонсировала его 13 августа 2026 года как первый продукт своего партнёрства по вычислительным мощностям с производителем чипов Cerebras, заключённого в январе 2026 года, — сделки, которую оценивают примерно в 10 миллиардов долларов за три года. В то время как стандартный инференс GPT-5.6 Sol выполняется на GPU-кластерах и тратит значительную часть времени на перемещение весов между памятью и вычислительными блоками, Ultrafast загружает веса модели в 44 ГБ встроенной SRAM-памяти на чипах Cerebras в масштабе пластины; модель размером с Sol занимает несколько пластин, уложенных слоями, поэтому веса находятся там же, где и вычисления. В результате потолок пропускной способности задаётся кремнием, а не пропускной способностью памяти.

Аппаратная история продолжилась 2026-08-18. На мероприятии Supernova компания Cerebras представила CS-4 — систему следующего поколения уровня стойки, построенную на собственной платформе Nexus: три чипа Wafer-Scale Engine на стойку, до 2× скорости генерации токенов по сравнению с предыдущей CS-3 и, по данным Cerebras, более 1000 токенов в секунду на моделях с более чем 10 триллионами параметров. Это заявления Cerebras о системе в раннем доступе, которая ещё не является общедоступной. С момента презентации единственный пост в X утверждает, что CS-4 уже обслуживает GPT-5.6 Sol со скоростью примерно 1300 токенов в секунду — это согласуется по направлению с собственными показателями Cerebras, но пока никем не подтверждено. Относитесь к этому как к раннему сигналу: правдоподобно, неподтверждённо, и стоит перепроверить, прежде чем планировать мощности на его основе.

Что важно для вашего кода: идентификатор модели, веса, характер рассуждений и выходные данные идентичны стандартной GPT-5.6 Sol. OpenAI позиционирует Ultrafast как «больше полезной работы в секунду», а не как уровень качества, и предварительная версия использует полноценную флагманскую модель — скорость обеспечивается не заменой на более дешёвую модель. Меняется лишь скорость, с которой выводятся токены.

Не путайте Ultrafast с существующим быстрым режимом. Быстрый режим — это отдельный платный тариф на стандартном оборудовании: примерно до 2,5× скорости вывода с надбавкой 2× за токен ($10 вход / $60 выход за 1M), без изменения качества. Ultrafast — совсем другое дело: оборудование Cerebras, до 14×, и пока вообще без цены.

Как быстро — цифры, которые имеют значение.

Speed card titled 'GPT-5.6 Sol Ultrafast — how fast', sourced to the OpenAI announcement of 2026-08-13 with all speed figures vendor-reported. Three highlight cells read Up to 14x max speedup vs standard, 750 output tokens per second max, and 11h 11m for 2,500 HLE questions. Rows list standard GPT-5.6 Sol as the 1x baseline, fast mode up to ~2.5x at 2x price, Claude Fable 5 on the same HLE set at 78h 27m, GDP-Val end-to-end at 5.6x faster, and 'same model, same quality — hardware only'. Footer: 14x is a maximum, not a guarantee, and none of the speed figures are independently verified yet.

Главный показатель — 14×, и он требует определения. OpenAI утверждает, что Ultrafast генерирует до 750 выходных токенов в секунду по сравнению со стандартной обработкой GPT-5.6 Sol. Это показатель пропускной способности для выходных токенов, а не безоговорочное утверждение, что «всё работает в 14 раз быстрее» — время обработки запроса от начала до конца также включает обработку ввода и собственные рассуждения модели, поэтому 14× указано как максимальное значение.

Максимальная пропускная способность вывода — до 750 выходных токенов в секунду, согласно объявлению OpenAI (2026-08-13).

По сравнению со стандартной обработкой — до 14× быстрее, согласно тому же анонсу; фактический выигрыш зависит от длины входных данных и типа задачи.

Humanity's Last Exam, 2 500 вопросов — OpenAI/Cerebras сообщают, что GPT-5.6 Sol Ultrafast прошёл тест за 11 часов 11 минут, а Claude Fable 5 — за 78 часов 27 минут, при сопоставимой точности. Данные предоставлены вендорами, и сравнение охватывает аппаратные стеки двух вендоров — воспринимайте это как ориентир, а не как вердикт.

GDP-Val, сквозной — Cerebras сообщает, что в целом скорость выше в 5,6 раза без измеримой потери качества. Также указано вендором.

Базовый уровень быстрого режима — существующий приобретаемый уровень скорости достигает максимума примерно 2,5× выходной скорости при 2× наценке к цене.

• CS-4, следующее аппаратное обеспечение — Cerebras утверждает, что стойка CS-4 выдаёт более 1 000 токенов в секунду на моделях с более чем 10 триллионами параметров, что до 2× превосходит генерацию токенов CS-3. Неподтверждённое сообщение сообщества оценивает GPT-5.6 Sol на CS-4 примерно в 1 300 токенов в секунду — то же направление, но пока не подтверждено ни OpenAI, ни Cerebras.

Одна оговорка, прежде чем вы процитируете 14×: независимое освещение запуска приводит сравнение ~11× по скорости генерации с Claude Fable 5, тогда как собственные данные Cerebras подразумевают ~7× для общего времени теста в том же прогоне — разница в том, какую часть рабочей нагрузки вы измеряете. Та же дисциплина применима к показателю скорости CS-4: цифра ~1300 токенов/с появилась из одного поста в X, и ни OpenAI, ни Cerebras её не подтвердили. Всё это цифры от вендоров или сообщества, объявленные на этой неделе, и ни одна из них ещё не проверена независимо. Относитесь к ним как к заявлениям, а не как к результатам бенчмарков.

Сколько это стоит — и честный разрыв

Price card titled 'What GPT-5.6 Sol costs today — 2026-08-18', listing published input/output rates per 1M tokens. Three highlight cells read Standard $5.00 / $30.00, Fast mode $10.00 / $60.00, and Ultrafast price TBD in preview. Rows list prompt cache read $0.50, cache write $6.25, long-context over ~272K $10.00 / $45.00, batch API $2.50 / $15.00, and context window ~1.05M with 128K max output. Footer: Ultrafast has no published price as of 2026-08-18 — standard and fast mode are what you can buy today.

Вот состояние вопроса о цене на 2026-08-19, изложенное прямо: у Ultrafast нет опубликованной цены. OpenAI не объявляла её, и превью отсутствует в каком-либо публичном прайс-листе. Сообщения о том, что ранние слоты доступа входят в пакет или бесплатны, — это спекуляции, а не политика компании. И пока OpenAI не установит цену на этот тариф, любая цифра «стоимости GPT-5.6 Sol Ultrafast», которую вы найдёте где-либо ещё, — это догадка.

Что можно оценить сегодня, так это остальную часть линейки GPT-5.6 Sol, сверенную с опубликованными тарифами OpenAI на 2026-08-18:

Standard GPT-5.6 Sol — $5.00 за 1M входных токенов / $30.00 за 1M выходных токенов. Базовая модель, которую можно вызвать прямо сейчас.

Быстрый режим — $10.00 / $60.00, наценка 2× за примерно 2.5× скорости вывода. Это самое близкое к уровню скорости, который вы действительно можете купить.

Чтение кэша промптов — $0.50 за 1M (скидка 90% по сравнению со свежим вводом); запись в кэш тарифицируется по $6.25 за 1M.

Тариф с длинным контекстом — входные данные, превышающие примерно 272K токенов, тарифицируются по $10.00 / $45.00.

Batch API — $2.50 / $15.00, фиксированная скидка 50%, срок выполнения — примерно 24 часа.

Для контекста о наценке, которую стоит ожидать: быстрый режим задал прецедент — 2× от стандартной ставки за 2.5× скорости. Если Ultrafast пойдёт по аналогичной кривой, он окажется значительно выше стандартных $5 / $30 — и комментарии к предварительной версии ожидают именно этого, поскольку производственные мощности пластин Cerebras ограничены и дороги. Но ожидаемая наценка — это не цена. Планируйте, исходя из стандартного Sol или быстрого режима, пока не появится тарифная сетка.

Как это использовать — реальность предпросмотра

Доступ — это второй честный пробел. Ultrafast доступен через OpenAI API ограниченной группе клиентов в порядке очереди, анонсировано 13 августа 2026 года, при этом OpenAI заявляет, что доступ будет расширяться «по мере роста мощностей». Даты общего доступа нет. Объявленные предварительные группы — программирование, коммерция, финансовые исследования, поддержка и другие интерактивные нагрузки — команды, чьи агенты совершают множество вызовов на один запрос и где задержка ответа является узким местом. Среди названных ранних тестировщиков — Jane Street, Rogo и Podium.

Паттерн использования, под который он спроектирован: реагирование на инциденты (чтение логов, трейсов и диффов, пока идет сбой), финансовые исследования и обнаружение мошенничества на потоковых данных, поддержка клиентов в реальном времени и голосовые сценарии (где полсекунды тишины воспринимаются как поломка), оформление заказов в электронной коммерции, а также сжатие ночных исследовательских батчей в интерактивные сессии. Если ваша нагрузка — это одноразовый чат, фактор 14× значит гораздо меньше, чем для 40-шагового цикла агента.

Что вы можете сделать сегодня — практический ответ

The OrcaRouter model page for openai/gpt-5.6-sol, showing the $5.00 per million input and $30.00 per million output pricing, the ~1.05M-token context window, 128K max output, and the vision, tools and JSON badges.

Пока Ultrafast находится в предварительном доступе, полная версия GPT-5.6 Sol уже доступна — и на OrcaRouter стандартный тариф обслуживается по цене провайдера с нулевой наценкой за токен, под идентификатором модели openai/gpt-5.6-sol через совместимый с OpenAI endpoint по адресу api.orcarouter.ai/v1. Если у вас уже есть OpenAI-клиент, миграция — это смена базового URL и идентификатора модели; больше ничего. Тот же ключ и endpoint поддерживают более 200 моделей, так что Sol соседствует с GPT-5.6 Terra, GPT-5.6 Luna, Claude Opus 5 и моделями с открытым весом, с которыми вы бы его сравнили, — и вы можете маршрутизировать по сложности, а не интегрировать каждую отдельно.

Две особенности OrcaRouter стоит упомянуть на странице скорости. BYOK: используйте свой ключ OpenAI, и OpenAI выставит вам счёт напрямую по своим тарифам — OrcaRouter добавляет $0 за токен и сохраняет ваши лимиты и кредиты провайдера без изменений. Guardrails: PII Shield и контентная политика работают до выставления счёта, поэтому заблокированный запрос возвращает чистый 400 и никогда не тарифицируется, а Agent Firewall оценивает вызовы инструментов и MCP до их выполнения. Когда — и если — Ultrafast станет общедоступным по маршрутизируемой цене, подключение его к той же конечной точке — это смена model-id; настройка, которую вы создаёте сегодня, сохранится.

Честная граница — когда Ultrafast не является ответом

Четыре момента, в которых история про 14× не работает, так что не стоит проектировать архитектуру или планировать бюджет, отталкиваясь от не устоявшегося числа:

14× — это максимум, а не гарантия. Это потолок выходной пропускной способности на оборудовании Cerebras; сквозная задержка по-прежнему включает обработку ввода, время рассуждения модели и вашу собственную сеть. Запрос с интенсивными рассуждениями может тратить большую часть реального времени на размышления, где заявленное ускорение уменьшается.

У него нет цены и даты GA. По состоянию на 2026-08-19 нельзя купить Ultrafast — можно только запросить предварительный доступ, а аппаратное обеспечение CS-4, стоящее за ним, находится в раннем доступе, а не в общем доступе. Рассчитывайте бюджет исходя из стандартного Sol ($5 / $30) или быстрого режима ($10 / $60) и относитесь к любой цене Ultrafast в интернете как к неподтверждённой.

Бенчмарки заявлены производителями. 11-часовой прогон HLE и показатель 5.6× GDP-Val — это цифры OpenAI/Cerebras из анонса; независимые оценки варьируются примерно от 7× до 11× в зависимости от того, что именно измеряется. Добавьте к этому списку и сигнал о скорости CS-4: цифра ~1300 токенов/с для GPT-5.6 Sol на CS-4 взята из одного поста в X и не имеет независимого подтверждения. Ни одна из этих цифр пока независимо не подтверждена.

Это не исправит узкое место, которого у вас нет. Если ваши агенты работают медленно из-за вашей собственной оркестрации, задержек инструментов или больших входных промптов, более быстрый путь вывода лишь немного сдвигает хвост. Решение о выборе уровня — GPT-5.6 Sol за $5/$30 против GPT-5.6 Terra за $2/$12 против GPT-5.6 Luna за $0.20/$1.20 — по-прежнему влияет на ваш счёт сильнее, чем любой уровень скорости.

Суть. GPT-5.6 Sol Ultrafast — это самый быстрый тарифный уровень, который OpenAI выпустила для своего флагмана: те же веса на оборудовании Cerebras, до 14× пропускной способности и 750 выходных токенов в секунду на анонсированном тарифе. Новый CS-4 от Cerebras (представлен 2026-08-18), по сообщениям, разгоняет GPT-5.6 Sol до ~1300 токенов в секунду, но эта цифра взята из единственного непроверенного поста в X. По состоянию на 2026-08-19 Ultrafast — это превью с доступом по списку ожидания без публичной цены. Если вы ищете цифру, на которую можно опереться при планировании бюджета, честный ответ — её пока нет. Стандартный GPT-5.6 Sol за $5 / $30 — это то, что вы можете вызывать уже сегодня, быстрый режим за $10 / $60 — это скоростной тариф, доступный для покупки, а OrcaRouter пропускает оба без наценки на вашем собственном ключе. Настройте маршрутизацию сейчас — и когда у Ultrafast появятся цена и дата, до него останется одно изменение model-id.

Пока Ultrafast не получит цену, полная версия GPT-5.6 Sol доступна на GPT-5.6 Sol на OrcaRouter по цене $5 / $30 за миллион токенов, без наценки, готово для вашего собственного ключа.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube