
GPT-5.6 Sol Ultrafast: скорость 14×, 750 ток/с — CS-4, по сообщениям, ~1300, цены пока нет
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B Uncensored (Aggressive)2026-08-1552Интеллект68Кодинг
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-1341 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaНОВИНКАMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 237 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0856Интеллект72Кодинг
GPT-5.6 Sol Ultrafast mode — это аппаратно-ускоренный уровень обслуживания для флагманской модели: та же полная модель GPT-5.6 Sol, работающая на чипах Cerebras wafer-scale вместо GPU-кластеров, обеспечивающая до 14× скорости стандартной обработки и до 750 выходных токенов в секунду на уровне, который OpenAI анонсировала в августе. 2026-08-18 компания Cerebras представила систему следующего поколения CS-4, на которую опирается этот уровень, и ранний неподтверждённый отчёт утверждает, что GPT-5.6 Sol на CS-4 уже выдаёт примерно 1 300 токенов в секунду. Это не уменьшенная модель и не дистилляция: изменились только аппаратное обеспечение и планирование, а интеллект сохранён. Чего у него пока нет — так это цены: по состоянию на 2026-08-19 Ultrafast — это ограниченная API-превью-версия без опубликованного прайс-листа, поэтому единственная цифра, на которую вы можете реально опираться сегодня при составлении бюджета, — это стандартный уровень на действующей странице модели GPT-5.6 Sol: $5 за миллион входных токенов и $30 за миллион выходных, без какой-либо наценки. В этой статье рассказывается о том, что это за режим, насколько быстры цифры на самом деле — включая новое аппаратное обеспечение CS-4 и то, что ещё не подтверждено — сколько это стоит (включая честный ответ «цены пока нет»), и что делать, пока он не станет общедоступным.
Что такое режим Ultrafast на самом деле
Ultrafast — это уровень обслуживания, а не новая модель. OpenAI анонсировала его 13 августа 2026 года как первый продукт своего партнёрства по вычислительным мощностям с производителем чипов Cerebras, заключённого в январе 2026 года, — сделки, которую оценивают примерно в 10 миллиардов долларов за три года. В то время как стандартный инференс GPT-5.6 Sol выполняется на GPU-кластерах и тратит значительную часть времени на перемещение весов между памятью и вычислительными блоками, Ultrafast загружает веса модели в 44 ГБ встроенной SRAM-памяти на чипах Cerebras в масштабе пластины; модель размером с Sol занимает несколько пластин, уложенных слоями, поэтому веса находятся там же, где и вычисления. В результате потолок пропускной способности задаётся кремнием, а не пропускной способностью памяти.
Аппаратная история продолжилась 2026-08-18. На мероприятии Supernova компания Cerebras представила CS-4 — систему следующего поколения уровня стойки, построенную на собственной платформе Nexus: три чипа Wafer-Scale Engine на стойку, до 2× скорости генерации токенов по сравнению с предыдущей CS-3 и, по данным Cerebras, более 1000 токенов в секунду на моделях с более чем 10 триллионами параметров. Это заявления Cerebras о системе в раннем доступе, которая ещё не является общедоступной. С момента презентации единственный пост в X утверждает, что CS-4 уже обслуживает GPT-5.6 Sol со скоростью примерно 1300 токенов в секунду — это согласуется по направлению с собственными показателями Cerebras, но пока никем не подтверждено. Относитесь к этому как к раннему сигналу: правдоподобно, неподтверждённо, и стоит перепроверить, прежде чем планировать мощности на его основе.
Что важно для вашего кода: идентификатор модели, веса, характер рассуждений и выходные данные идентичны стандартной GPT-5.6 Sol. OpenAI позиционирует Ultrafast как «больше полезной работы в секунду», а не как уровень качества, и предварительная версия использует полноценную флагманскую модель — скорость обеспечивается не заменой на более дешёвую модель. Меняется лишь скорость, с которой выводятся токены.
Не путайте Ultrafast с существующим быстрым режимом. Быстрый режим — это отдельный платный тариф на стандартном оборудовании: примерно до 2,5× скорости вывода с надбавкой 2× за токен ($10 вход / $60 выход за 1M), без изменения качества. Ultrafast — совсем другое дело: оборудование Cerebras, до 14×, и пока вообще без цены.
Как быстро — цифры, которые имеют значение.

Главный показатель — 14×, и он требует определения. OpenAI утверждает, что Ultrafast генерирует до 750 выходных токенов в секунду по сравнению со стандартной обработкой GPT-5.6 Sol. Это показатель пропускной способности для выходных токенов, а не безоговорочное утверждение, что «всё работает в 14 раз быстрее» — время обработки запроса от начала до конца также включает обработку ввода и собственные рассуждения модели, поэтому 14× указано как максимальное значение.
• Максимальная пропускная способность вывода — до 750 выходных токенов в секунду, согласно объявлению OpenAI (2026-08-13).
• По сравнению со стандартной обработкой — до 14× быстрее, согласно тому же анонсу; фактический выигрыш зависит от длины входных данных и типа задачи.
• Humanity's Last Exam, 2 500 вопросов — OpenAI/Cerebras сообщают, что GPT-5.6 Sol Ultrafast прошёл тест за 11 часов 11 минут, а Claude Fable 5 — за 78 часов 27 минут, при сопоставимой точности. Данные предоставлены вендорами, и сравнение охватывает аппаратные стеки двух вендоров — воспринимайте это как ориентир, а не как вердикт.
• GDP-Val, сквозной — Cerebras сообщает, что в целом скорость выше в 5,6 раза без измеримой потери качества. Также указано вендором.
• Базовый уровень быстрого режима — существующий приобретаемый уровень скорости достигает максимума примерно 2,5× выходной скорости при 2× наценке к цене.
• CS-4, следующее аппаратное обеспечение — Cerebras утверждает, что стойка CS-4 выдаёт более 1 000 токенов в секунду на моделях с более чем 10 триллионами параметров, что до 2× превосходит генерацию токенов CS-3. Неподтверждённое сообщение сообщества оценивает GPT-5.6 Sol на CS-4 примерно в 1 300 токенов в секунду — то же направление, но пока не подтверждено ни OpenAI, ни Cerebras.
Одна оговорка, прежде чем вы процитируете 14×: независимое освещение запуска приводит сравнение ~11× по скорости генерации с Claude Fable 5, тогда как собственные данные Cerebras подразумевают ~7× для общего времени теста в том же прогоне — разница в том, какую часть рабочей нагрузки вы измеряете. Та же дисциплина применима к показателю скорости CS-4: цифра ~1300 токенов/с появилась из одного поста в X, и ни OpenAI, ни Cerebras её не подтвердили. Всё это цифры от вендоров или сообщества, объявленные на этой неделе, и ни одна из них ещё не проверена независимо. Относитесь к ним как к заявлениям, а не как к результатам бенчмарков.
Сколько это стоит — и честный разрыв

Вот состояние вопроса о цене на 2026-08-19, изложенное прямо: у Ultrafast нет опубликованной цены. OpenAI не объявляла её, и превью отсутствует в каком-либо публичном прайс-листе. Сообщения о том, что ранние слоты доступа входят в пакет или бесплатны, — это спекуляции, а не политика компании. И пока OpenAI не установит цену на этот тариф, любая цифра «стоимости GPT-5.6 Sol Ultrafast», которую вы найдёте где-либо ещё, — это догадка.
Что можно оценить сегодня, так это остальную часть линейки GPT-5.6 Sol, сверенную с опубликованными тарифами OpenAI на 2026-08-18:
• Standard GPT-5.6 Sol — $5.00 за 1M входных токенов / $30.00 за 1M выходных токенов. Базовая модель, которую можно вызвать прямо сейчас.
• Быстрый режим — $10.00 / $60.00, наценка 2× за примерно 2.5× скорости вывода. Это самое близкое к уровню скорости, который вы действительно можете купить.
• Чтение кэша промптов — $0.50 за 1M (скидка 90% по сравнению со свежим вводом); запись в кэш тарифицируется по $6.25 за 1M.
• Тариф с длинным контекстом — входные данные, превышающие примерно 272K токенов, тарифицируются по $10.00 / $45.00.
• Batch API — $2.50 / $15.00, фиксированная скидка 50%, срок выполнения — примерно 24 часа.
Для контекста о наценке, которую стоит ожидать: быстрый режим задал прецедент — 2× от стандартной ставки за 2.5× скорости. Если Ultrafast пойдёт по аналогичной кривой, он окажется значительно выше стандартных $5 / $30 — и комментарии к предварительной версии ожидают именно этого, поскольку производственные мощности пластин Cerebras ограничены и дороги. Но ожидаемая наценка — это не цена. Планируйте, исходя из стандартного Sol или быстрого режима, пока не появится тарифная сетка.
Как это использовать — реальность предпросмотра
Доступ — это второй честный пробел. Ultrafast доступен через OpenAI API ограниченной группе клиентов в порядке очереди, анонсировано 13 августа 2026 года, при этом OpenAI заявляет, что доступ будет расширяться «по мере роста мощностей». Даты общего доступа нет. Объявленные предварительные группы — программирование, коммерция, финансовые исследования, поддержка и другие интерактивные нагрузки — команды, чьи агенты совершают множество вызовов на один запрос и где задержка ответа является узким местом. Среди названных ранних тестировщиков — Jane Street, Rogo и Podium.
Паттерн использования, под который он спроектирован: реагирование на инциденты (чтение логов, трейсов и диффов, пока идет сбой), финансовые исследования и обнаружение мошенничества на потоковых данных, поддержка клиентов в реальном времени и голосовые сценарии (где полсекунды тишины воспринимаются как поломка), оформление заказов в электронной коммерции, а также сжатие ночных исследовательских батчей в интерактивные сессии. Если ваша нагрузка — это одноразовый чат, фактор 14× значит гораздо меньше, чем для 40-шагового цикла агента.
Что вы можете сделать сегодня — практический ответ

Пока Ultrafast находится в предварительном доступе, полная версия GPT-5.6 Sol уже доступна — и на OrcaRouter стандартный тариф обслуживается по цене провайдера с нулевой наценкой за токен, под идентификатором модели openai/gpt-5.6-sol через совместимый с OpenAI endpoint по адресу api.orcarouter.ai/v1. Если у вас уже есть OpenAI-клиент, миграция — это смена базового URL и идентификатора модели; больше ничего. Тот же ключ и endpoint поддерживают более 200 моделей, так что Sol соседствует с GPT-5.6 Terra, GPT-5.6 Luna, Claude Opus 5 и моделями с открытым весом, с которыми вы бы его сравнили, — и вы можете маршрутизировать по сложности, а не интегрировать каждую отдельно.
Две особенности OrcaRouter стоит упомянуть на странице скорости. BYOK: используйте свой ключ OpenAI, и OpenAI выставит вам счёт напрямую по своим тарифам — OrcaRouter добавляет $0 за токен и сохраняет ваши лимиты и кредиты провайдера без изменений. Guardrails: PII Shield и контентная политика работают до выставления счёта, поэтому заблокированный запрос возвращает чистый 400 и никогда не тарифицируется, а Agent Firewall оценивает вызовы инструментов и MCP до их выполнения. Когда — и если — Ultrafast станет общедоступным по маршрутизируемой цене, подключение его к той же конечной точке — это смена model-id; настройка, которую вы создаёте сегодня, сохранится.
Честная граница — когда Ultrafast не является ответом
Четыре момента, в которых история про 14× не работает, так что не стоит проектировать архитектуру или планировать бюджет, отталкиваясь от не устоявшегося числа:
14× — это максимум, а не гарантия. Это потолок выходной пропускной способности на оборудовании Cerebras; сквозная задержка по-прежнему включает обработку ввода, время рассуждения модели и вашу собственную сеть. Запрос с интенсивными рассуждениями может тратить большую часть реального времени на размышления, где заявленное ускорение уменьшается.
У него нет цены и даты GA. По состоянию на 2026-08-19 нельзя купить Ultrafast — можно только запросить предварительный доступ, а аппаратное обеспечение CS-4, стоящее за ним, находится в раннем доступе, а не в общем доступе. Рассчитывайте бюджет исходя из стандартного Sol ($5 / $30) или быстрого режима ($10 / $60) и относитесь к любой цене Ultrafast в интернете как к неподтверждённой.
Бенчмарки заявлены производителями. 11-часовой прогон HLE и показатель 5.6× GDP-Val — это цифры OpenAI/Cerebras из анонса; независимые оценки варьируются примерно от 7× до 11× в зависимости от того, что именно измеряется. Добавьте к этому списку и сигнал о скорости CS-4: цифра ~1300 токенов/с для GPT-5.6 Sol на CS-4 взята из одного поста в X и не имеет независимого подтверждения. Ни одна из этих цифр пока независимо не подтверждена.
Это не исправит узкое место, которого у вас нет. Если ваши агенты работают медленно из-за вашей собственной оркестрации, задержек инструментов или больших входных промптов, более быстрый путь вывода лишь немного сдвигает хвост. Решение о выборе уровня — GPT-5.6 Sol за $5/$30 против GPT-5.6 Terra за $2/$12 против GPT-5.6 Luna за $0.20/$1.20 — по-прежнему влияет на ваш счёт сильнее, чем любой уровень скорости.
Суть. GPT-5.6 Sol Ultrafast — это самый быстрый тарифный уровень, который OpenAI выпустила для своего флагмана: те же веса на оборудовании Cerebras, до 14× пропускной способности и 750 выходных токенов в секунду на анонсированном тарифе. Новый CS-4 от Cerebras (представлен 2026-08-18), по сообщениям, разгоняет GPT-5.6 Sol до ~1300 токенов в секунду, но эта цифра взята из единственного непроверенного поста в X. По состоянию на 2026-08-19 Ultrafast — это превью с доступом по списку ожидания без публичной цены. Если вы ищете цифру, на которую можно опереться при планировании бюджета, честный ответ — её пока нет. Стандартный GPT-5.6 Sol за $5 / $30 — это то, что вы можете вызывать уже сегодня, быстрый режим за $10 / $60 — это скоростной тариф, доступный для покупки, а OrcaRouter пропускает оба без наценки на вашем собственном ключе. Настройте маршрутизацию сейчас — и когда у Ultrafast появятся цена и дата, до него останется одно изменение model-id.
Пока Ultrafast не получит цену, полная версия GPT-5.6 Sol доступна на GPT-5.6 Sol на OrcaRouter по цене $5 / $30 за миллион токенов, без наценки, готово для вашего собственного ключа.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
