
GPT-6.1 Ultrafast vs GPT-6.1 Sol: три задачи — по одному вердикту на каждую
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Когда спрашиваешь, стоит ли GPT-6.1 Ultrafast своих денег — а он в шесть раз дороже GPT-6.1 Sol — честный ответ таков: две из трёх ваших задач должны остаться ровно там, где они есть. Интерактивному агенту для программирования стоит переехать. Ночному прогону оценок — нет, и пакетному суммаризатору тоже нет, и причина не в том, что тариф завышен, а в том, что они никогда не покупали то, что он продаёт. GPT-6.1 Sol вышел 29 сентября 2026 года, а Ultrafast появился как режим поверх него 8 октября 2026 года: тот же чекпойнт, то же контекстное окно на 1 050 000 токенов, тот же потолок вывода на 128 000 токенов, та же дата отсечки знаний — 30 апреля 2026 года, те же ответы, при $12,00 за миллион входных токенов и $60,00 за миллион выходных против $2,00 и $10,00. Тариф за скорость — это покупка реального времени, а реальное время стоит денег только для той работы, где кто-то ждёт.
Эта переформулировка — и есть вся статья. Остальное — арифметика, которая показывает, какая из ваших работ относится к типу «ожидание», и две издержки, которые приходят вместе с мультипликатором, независимо от того, планировали вы их или нет.
Что на самом деле отличается: одно поле запроса и один счёт
Нет никакого чекпоинта Ultrafast, нет отдельного ограничения контекста, нет альтернативной даты отсечки знаний, и нечего закреплять. Вы отправляете тот же идентификатор модели с установленным полем уровня обслуживания, и OpenAI планирует запрос иначе; отправьте его без этого поля — и вы на уровне Standard. Всё, на что разработчик опирается в коде, идентично, и стоит подойти к списку механически, потому что длина списка и есть аргумент.
• ID модели — один и тот же идентификатор в обоих, один снимок по умолчанию, никакой датированной версии для закрепления.
• Контекст — окно в 1 050 000 токенов, максимальный ввод — 922 000 токенов, максимальный вывод — 128 000 токенов у обоих.
• Лестница рассуждений — low, medium (по умолчанию), high, xhigh и max в обоих, при этом none и minimal не поддерживаются в обоих.
• Набор инструментов — веб-поиск, поиск по файлам, генерация изображений, интерпретатор кода, хостируемая оболочка, применение патча, навыки, использование компьютера, MCP и поиск по инструментам, через Responses API, на обеих.
• Цена — $2,00 за ввод / $0,10 за кэшированные / $2,50 за запись в кэш / $10,00 за вывод за миллион токенов на Standard, против $12,00 / $0,60 / $15,00 / $60,00 на Ultrafast.
• Свыше 272 000 входных токенов — весь запрос пересчитывается с коэффициентом 2 для тарифов на вход и кэш и с коэффициентом 1,5 для выхода в обоих случаях, в результате чего цена для Ultrafast long-context составляет $24.00 / $1.20 / $30.00 / $90.00.
• Скорость — Standard по определению служит базовым уровнем; Ultrafast — верхняя ступень, и единственный привязанный к конкретной модели множитель, который публикует OpenAI, принадлежит GPT-6 Astra, а не этой модели.
Эта последняя строка — оговорка, которая лежит в основе всего остального, и ей отведён отдельный раздел ниже. Сначала — работы.
Задача первая: интерактивный агент. Это тот, который движется.
Цикл агента, который подряд делает сорок вызовов инструментов, — это тот покупатель, для которого был создан этот тариф, потому что время генерации на каждом ходу ограничивает следующий ход, а пользователь наблюдает. Возьмём сессию, которая отправляет 30 000 входных токенов и получает 1 500 выходных токенов за ход на протяжении 40 ходов — в сумме 1 200 000 входных токенов и 60 000 выходных токенов, причём каждый запрос значительно ниже порога пересмотра цены в 272 000 токенов.
• Стандарт — 1,2 млн входных токенов по $2,00 — это $2,40; 60 000 выходных токенов по $10,00 — это $0,60. Три доллара за запуск.
• Ultrafast — 1,2 млн входных токенов по $12,00 — это $14,40; 60 000 выходных токенов по $60,00 — это $3,60. Восемнадцать долларов за запуск.
• Дельта — $15.00, чтобы убрать большую часть задержки генерации у задания, результат которого в остальном идентичен.
Дешево ли $15.00 — это вопрос о минутах, а не о токенах. Если сессия занимает двадцать минут на Standard и четыре минуты на Ultrafast, вы купили шестнадцать минут за пятнадцать долларов — около $0.94 в минуту — и важное сравнение — это с тем, во что эти шестнадцать минут вам обошлись. Разработчик при полной ставке стоит больше доллара в минуту, так что для сценария с участием человека в контуре ответ не близок. Агент, ожидающий в очереди на проверку человеком, не стоит ничего в минуту, и там те же шестнадцать минут — бесплатные шестнадцать минут, а этот тариф — пустая трата.
Вот тест, который нужно применить, и он не имеет никакого отношения к модели. На чьих часах оказывается время генерации, и сколько стоят эти часы? Если ответ — «человека, и много», Ultrafast — самая дешёвая позиция в вашем счёте. Если ответ — «планировщика, и ничего», это самая дорогая.

Задача вторая: ночной прогон оценки. Это — нет.
Прогон оценки пропускает через модель несколько тысяч запросов, записывает результаты в объектное хранилище, а утром человек читает таблицу. Его бюджет задержки — не минуты, а ночь. Ничто в конвейере не ждёт модель, кроме следующего запроса в очереди.
Ultrafast не отменяет плату за реальное время прогона, потому что эта плата — ваше решение о планировании, а не проблема задержки, которая у вас есть. Что он делает — умножает счёт на шесть и переводит задачу на бюджет с собственными ограничениями скорости для каждой организации — а это реальный риск в пакетном режиме без присмотра, потому что потолок ограничения скорости — это ровно тот режим отказа, в который упирается большой прогон, а страница тарифа не публикует это число.
И на той же тарифной сетке есть позиция, тарифицированная для этой задачи и тарифицированная в противоположном направлении. Batch и Flex стоят вдвое дешевле Standard, а обработка Batch в API рассчитана ровно на такой профиль: большие объёмы, без интерактивного дедлайна, результаты возвращаются асинхронно. По приведённым выше цифрам тот же суммарный объём токенов за 40 ходов стоит $1.50 в Batch против $18.00 в Ultrafast. Это 12-кратный разброс для задачи, которая не чувствует разницы.
Ошибка, которой нужно избежать, — воспринимать Ultrafast как универсальный апгрейд. Это вершина лестницы: Batch и Flex — на 0,5, Standard — на 1, Fast — на 2, Ultrafast — на 6. А лестница — не меню из улучшенных версий. Выбор неверной ступени стоит дороже, чем выбор неверной модели.
Задача третья: суммаризатор пакетов. Тоже нет, но по другой причине.
Предположим, рабочая нагрузка — это ночной прогон по хранилищу документов: длинные входные данные, короткие выходные данные, без участия человека и с SLA, измеряемым в часах. Именно здесь соотношение токенов работает против Ultrafast, а не в его пользу.
Причина — порог в 272 000 токенов. На любом из тарифов один запрос, пересёкший этот порог, приводит к пересчёту цены всего запроса — каждого входного токена, каждого чтения из кеша, каждого выходного токена — по удвоенному тарифу на входные токены и кеш и в 1,5 раза на выходные. Поэтому Ultrafast в режиме длинного контекста стоит $24.00 за миллион входных токенов и $90.00 за миллион выходных, причём пересчёт цены запускает сам запрос, а не та его часть, что превышает порог. Сервис суммаризации документов, который время от времени отправляет запрос на 300 000 входных токенов, платит по тарифу длинного контекста за все 300 000.
Поведение кэша это усугубляет. Кэшированные чтения — самые дешёвые токены в этой модели и самый эффективный рычаг затрат, и они масштабируются вместе с тарифом, а не поглощаются им — $0.10 за миллион кэшированного ввода на Standard, $0.60 на Ultrafast, оба — 5% от ставки за некэшированный ввод. Никакая смесь кэшированных и свежих токенов не смягчает этот множитель, поэтому даже резко оптимизированный конвейер с кэшированием не получает скидку от быстрого тарифа. Он просто платит в шесть раз больше, но с меньшей базы.
Сложите эти два факта вместе — и суммаризатор окажется тем случаем, где надбавка за Ultrafast максимальна в абсолютном выражении, а выгода от него минимальна. Если документы действительно длинные, а срок действительно измеряется часами, правильная конфигурация — Batch или обычный Standard, а правильное применение Ultrafast — это цикл в середине разработки, когда вы итеративно дорабатываете промпт и человек ждёт каждой правки.
Две затраты, которые появляются вместе с кратным
Шестикратная ставка — это видимая часть цены. Две невидимые части важнее в производстве.
Первый — это бюджет ограничений скорости. Ultrafast работает на собственных лимитах, отдельно от бюджетов Standard и Fast, и OpenAI устанавливает их для каждой организации, а не публикует их на странице тарифного уровня; рекомендуется проверять лимиты вашей организации перед увеличением трафика и связаться с командой аккаунта, если их нужно поднять. Таким образом, переключение рабочей нагрузки на Ultrafast делает две вещи одновременно: оно умножает счёт и переводит рабочую нагрузку на потолок, который вы, возможно, не сможете прочитать. Для автономного агента потолок срабатывает первым.
Второй момент — это структура экономии. Ultrafast сокращает время между токенами, а не время до первого токена и не фазу обдумывания. Запрос, который тратит большую часть реального времени на размышления, прежде чем что-либо выдать, можно переключить на Ultrafast, и он всё равно будет ощущаться медленным, потому что этот уровень ускоряет ту часть запроса, которая никогда не была узким местом. Это тот сценарий отказа, который порождает отчёты в духе «мы заплатили в шесть раз больше, а скорость та же»: он измеряет приложение, задержка которого находится там, куда этот уровень не достаёт. Прежде чем делать выбор, измерьте, куда на самом деле уходят секунды — время до первого токена против времени между токенами, — потому что этот уровень отвечает только за одно из них.
Почему «быстрее» — это пока ещё не то число, которым можно призвать OpenAI к ответу
Ultrafast продаётся с заявлением «до 8x», и измерение, стоящее за этой фразой, относится к другой модели. Опубликованная формулировка говорит о том, что GPT-6 Astra Ultrafast генерирует токены до 8 раз быстрее, чем GPT-6 Astra в стандартном режиме в Codex. Для GPT-6.1 Sol нет эквивалентного опубликованного множителя, и ни одна независимая сторона также не публиковала показатель количества токенов в секунду для варианта Sol. Документация для этого тарифа описывает его как сокращающий время между генерируемыми выходными токенами и указывает на тарифную карту.
Разумно априори предполагать, что этот множитель сохраняется — обе модели работают на одном и том же стеке обслуживания, и механизм уровня один и тот же, — но «до» в этом предложении играет важную роль, а заявленный вендором потолок, измеренный на родственной модели в другом клиенте, — это не то число, которое увидит ваша рабочая нагрузка. То же верно и для более старой ступени: Ultrafast поверх GPT-5.6 Sol был анонсирован в августе 2026 года как «до 14 раз быстрее, чем Standard processing» в ограниченном предварительном доступе, и в документации по-прежнему указан предварительный доступ, при этом таблица тарифов Ultrafast содержит ровно две строки.
Что вы можете требовать от OpenAI — так это цену, потому что цена опубликована и применяется к каждому токену. А значит, решение, которому посвящена эта страница, — это решение о вашем собственном бюджете задержки, а не о заявленной поставщиком скорости.

Тестирую это без коммита и переключаюсь обратно
Этот уровень доступен всем пользователям API, поэтому дешёвый способ ответить на вопрос о реальном времени — дважды прогнать один и тот же набор запросов с включённым и выключенным полем и сравнить количество токенов и тайминги. В этом тесте нужно следить за двумя вещами: пересекают ли ваши запросы отметку в 272 000 токенов и доминирует ли время до первого токена над временем между токенами. Любое из этого может создать впечатление нулевого результата, хотя уровень работает ровно так, как заявлено.
Переключение обратно — это поле запроса, а не миграция, и стандартный канал обслуживается по собственному прайс-листу вендора через OrcaRouter как openai/gpt-6.1-sol — $2.00 за миллион входных токенов и $10.00 за миллион выходных токенов, 0% наценки, цена провайдера передаётся напрямую, так что изменение цены вендором становится актуальным у нас в тот же день. Сам Ultrafast мы не продаём; это флаг уровня обслуживания, оплачиваемый с вашего собственного аккаунта OpenAI, и сказать об этом прямо полезнее, чем подразумевать обратное. А вот что один ключ действительно даёт — это стандартный канал плюс остальной каталог за одним OpenAI-совместимым эндпоинтом, и автоматическое переключение при сбое между провайдерами, что стоит иметь, если вы собираетесь поставить дорогой уровень перед продакшн-агентом и хотите, чтобы стандартный канал был решением по маршрутизации, а не изменением кода.

Одно практическое замечание о быстром тарифе, не применимое к дешёвому: WebSockets. O\penAI рекомендует постоянное WebSocket-соединение для Ultrafast — правильный вариант для агента, выполняющего множество последовательных вызовов, и неправильный — для пакетного скрипта с одним запросом на процесс. Если ваш клиент относится ко второму типу, то рекомендуемый самим тарифом транспорт — ещё одна причина, по которой ночная задача должна выполняться в другом месте.
Когда вердикт меняется
Три нововведения позволили бы вывести задачи из списка «stay». Опубликованный лимит скорости Ultrafast для GPT-6.1 Sol устранил бы риск потолка в пакетном сценарии. Опубликованное или независимо воспроизведённое измерение скорости для уровня Sol позволило бы планировать экономию реального времени, а не предполагать её. А ступень со скидкой на быстром треке — Ultrafast-эквивалент Batch, где уровень всё ещё быстрый, но не в шесть раз дороже, — изменила бы экономику каждой задачи в середине лестницы.
Ничего из этого сегодня не существует. Существует тариф, который в точности соответствует своему названию: тот же GPT-6.1 Sol, с другим расписанием, в шесть раз дороже по каждой строке. Перенесите интерактивного агента, оставьте два других без изменений и измерьте, куда на самом деле уходят ваши секунды, прежде чем решать, какой из них ваш.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
