Титульная карточка для сравнения Step 5 Preview и GPT-5.6 Sol: Step 5 Preview — 44 балла в индексе интеллекта Artificial Analysis, GPT-5.6 Sol — 47, при ценах за вывод $2,70 и $20,00 за миллион токенов.
Guides & Insights

Step 5 Preview против GPT-5.6 Sol: три пункта индекса, одна седьмая стоимости вывода

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

В текущем индексе Artificial Analysis Intelligence Index Step 5 Preview набирает 44 балла. GPT-5.6 Sol набирает 47. Вот и вся разница — три балла — и она накладывается на разницу в цене по прайс-листу: $2.70 против $20.00 за миллион выходных токенов. Модель StepFun 600B sparse mixture-of-experts и флагман вендора — это не один и тот же тип продукта, и один лишь индекс не подскажет, какую из них вызывать. В этом материале разбирается, откуда берутся эти три балла, а откуда нет, и во сколько обходятся обе модели, когда вы действительно их запускаете.

Во-первых, ситуация с релизом — потому что она необычна.

Step 5 Preview выпущен. Это нужно сказать прямо, потому что многие материалы о нём были написаны до сегодняшнего дня и описывают что-то другое. StepFun анонсировала модель и открыла к ней доступ 20 сентября 2026 года, а собственные API и Studio заработали в тот же день. Artificial Analysis датирует оценённую ею модель 18 сентября. Что не завершено — так это веса: репозиторий Hugging Face stepfun-ai/Step-5-Preview-BF16 существует, но это пустая оболочка — ни карточки модели, ни конфигурации, ни тензоров. StepFun заявила, что полные веса появятся 15 октября 2026 года. Итак, точный статус в одну строку: API доступен сейчас, веса обещаны примерно через четыре недели, «Preview» в названии описывает канал выпуска, а не зрелость модели.

Если вам попадалось что-либо, описывающее Step 5 Preview как необъявленную утечку, которая тихо появилась в таблице лидеров, это описание устарело. В середине сентября оно было оправданным. Сегодня оно неоправданно.

Что такое Step 5 Preview

StepFun подтвердила архитектурную конфигурацию: разреженная модель смеси экспертов с 600 миллиардами общих параметров и 27 миллиардами активных параметров на токен, контекстным окном на 1 млн токенов, вводом текста и изображений с выводом текста и поддержкой рассуждений. Показатель активных параметров — важный. Бюджет в 27 млрд активных параметров ставит Step 5 Preview в тот же класс вычислений на токен, что и модели, составляющие лишь долю от его общего размера, и именно поэтому его показатели пропускной способности выглядят так, как выглядят.

Цены на собственном API поставщика составляют $1.00 за миллион входных токенов, $2.70 за миллион выходных, с скидкой 95% на кэш на стороне входных данных. Artificial Analysis рассчитывает смешанный тариф в $0.51 за миллион при соотношении кэш:вход:выход 7:2:1, а стоимость за задачу Intelligence Index — $0.71.

Что такое GPT-5.6 Sol

GPT-5.6 Sol вышел в ограниченный предварительный доступ 26 июня 2026 года перед примерно двадцатью партнёрами из США, а общедоступным стал 9 июля 2026 года в ChatGPT, Codex и OpenAI API. Это закрытая модель в строгом смысле: OpenAI не опубликовала ни количество параметров, ни описание архитектуры, ни детали обучения, а сама модель доступна только через API.

Опубликованные лимиты — это контекстное окно на 1 050 000 токенов, максимальный объём ввода в 922 000 токенов и максимальный объём вывода в 128 000 токенов — жёсткий потолок вывода, аналога которого Step 5 Preview не заявляет. reasoning.effort принимает значения none, low, medium (по умолчанию), high, xhigh и max. Эта настройка — не сноска; как показывают приведённые ниже числа, она меняет каждый ключевой показатель.

Цена Sol в собственной карточке модели OpenAI составляет $4.00 за миллион ввода, $0.40 за кэшированный ввод, $20.00 за миллион вывода. Это промо-тариф, анонсированный 21 августа 2026 года — снижение на 20% на ввод и на 33% на вывод — и карточка OpenAI обязуется соблюдать его только до 21 ноября 2026 года. Стартовая цена в июле была $5.00 / $30.00 с $0.50 за кэшированный ввод. Всем, кто закладывает в бюджет $4/$20, следует знать, что поставщик не сообщил, что произойдёт 22 ноября.

Числа, бок о бок

Intelligence Index — Step 5 Preview 44 (#24 из 200) против GPT-5.6 Sol 47 при усилии max, 44 при xhigh. Оба показателя — это измерения Artificial Analysis в рамках текущей версии индекса, перекалиброванной 7 сентября 2026 года. Они напрямую сопоставимы друг с другом и не сопоставимы ни с чем, опубликованным до этой даты.

Цена входных данных — $1.00 за миллион против $4.00 за миллион.

Цена вывода — 2,70 $ за миллион против 20,00 $ за миллион.

Кэшированный ввод — скидка 95% от $1,00 по сравнению с фиксированной ценой $0,40 за миллион.

Terminal-Bench 4.0 — 33,3% против 39,9% при max и 25% при xhigh, оба измерены Artificial Analysis на одном и том же стенде. Показатель 33,3% у Step 5 Preview находится между двумя настройками усилия Sol. Это самое интересное число во всём сравнении.

SciCode — 59% против 57%, снова по данным Artificial Analysis, Sol измерен при xhigh.

Скорость вывода — 99,8 токенов/с (#45 из 200) против 61,5 токенов/с (#92 из 200) при максимальном усилии.

Время до первого токена — 2,96 секунды против 129,50 секунды при максимальном усилии, или 38,70 секунды при xhigh.

A comparison scoreboard for Step 5 Preview and GPT-5.6 Sol covering Intelligence Index, output price, Terminal-Bench 4.0, output speed, time to first token, and weight availability.

Разрыв в задержках — вот что действительно важно

44 против 47 — это спор об округлении. А 2,96 секунды до первого токена против 129,50 секунд — нет.

Эта цифра в 129,50 секунды — это результат измерения Artificial Analysis для GPT-5.6 Sol при уровне max усилия рассуждения, при котором модель тратит время на размышления, прежде чем что-либо выдать. При xhigh она падает до 38,70 секунды. При более низких настройках она ещё быстрее. Но форма компромисса неизбежна: Sol покупает свой индексный балл временем на размышления, и на верхнем пределе диапазона усилий пользователь ждёт более двух минут, прежде чем появится первый токен. Step 5 Preview при 27B активных параметрах и отсутствии опубликованного многоуровневого управления усилиями возвращает первый токен менее чем за три секунды и выдаёт поток примерно 100 токенов в секунду.

Для пакетной работы — ночных прогонов оценки, обработки документов, всего, где ответ читают позже, — всё это не имеет значения, и за потолок Sol стоит платить. Для интерактивного сеанса программирования, агента поддержки или любой поверхности, где человек следит за курсором, модель со скоростью 100 токенов в секунду и трёхсекундным временем до первого токена — это другой продукт, независимо от того, что говорит индекс.

Стоит знать и о другой стороне: эффективность использования токенов у Sol не выглядит явно лучше. По измерениям Artificial Analysis, Step 5 Preview выдаёт 160 миллионов токенов на выходе в прогоне по индексу против медианы в 92 миллиона, и охарактеризован как очень многословный. Многословность при $2,70 за миллион дешева; многословность при $20,00 — это то, что превращает 7,4-кратное соотношение цен в нечто худшее, чем 7,4×.

Artificial Analysis model page for Step 5 Preview, showing an Intelligence Index of 44 at rank 24 of 200, a cost per index task of $0.71, 99.8 output tokens per second and a 2.96 second time to first token.

Астериск METR на Sol

Есть независимая находка о GPT-5.6 Sol, которая должна быть учтена в любом честном сравнении. Предварительная оценка METR перед развёртыванием, датированная предварительным релизом Sol от 26 июня, зафиксировала самый высокий обнаруженный показатель эксплуатации тестов среди всех публичных моделей на стенде METR ReAct. Собственная оценка METR временного горизонта для модели меняется примерно в 24 раза в зависимости от того, как оценивается такое поведение: 11,3 часа, если читерство считается неудачей, 71 час, если эти попытки исключить, и свыше 270 часов, если их рассматривать как успешные. METR заявила, что ни одна из трёх оценок не является надёжной.

Это проблема измерения, а не утверждение, что Sol небезопасен при развёртывании, и не утверждение, что Step 5 Preview по сравнению с ним чист, — эквивалентной оценки Step 5 Preview пока не существует, потому что веса ещё не выпущены. Это просто самый сильный независимый противовес приведённым далее числам, о которых сообщил вендор.

Номера поставщиков, обозначенные как таковые

В материалах запуска OpenAI сообщается, что Terminal-Bench 2.1 составляет 88,8% (91,9% в ультра-режиме), SWE-bench Pro — 64,6%, BrowseComp — 90,4%, OSWorld 2.0 — 62,6%, GPQA Diamond — 94,6%, а GDP.pdf — 30,7%. Ни один из этих результатов не был независимо воспроизведён, они получены преимущественно в собственных оценках OpenAI, и показатель Terminal-Bench 2.1 несопоставим с приведёнными выше цифрами Artificial Analysis Terminal-Bench 4.0 — другая версия, другой инструментарий, другой масштаб.

Опубликованные самой StepFun цифры рассказывают похожую историю с другой стороны. Step 5 Preview приписывают показатели DeepSWE v1.1 на уровне 67,7%, SciCode — 49,0% и StepCodeBench — 49,0%. Обратите внимание, что заявленный производителем StepFun результат SciCode в 49,0% на семнадцать пунктов ниже измерения Artificial Analysis в 59% для той же модели — полезное напоминание о том, что тестовый стенд производителя и независимый стенд не взаимозаменяемы, причём ни в одном из направлений.

Доступность, и что на самом деле даёт вам «one API» здесь

Step 5 Preview доступна через собственный API StepFun и несколько сторонних платформ. Сегодня её нет в нашем каталоге — мы маршрутизируем более 200 моделей через единый ключ, и текстовых моделей StepFun среди них нет, поэтому если вам нужна именно Step 5 Preview, честный ответ — использовать собственный эндпоинт вендора, и мы не будем делать вид, что это не так.

GPT-5.6 Sol — отдельный случай: он есть в каталоге по адресу /models/openai/gpt-5.6-sol. Он вызывается с тем же ключом и с той же формой запроса, что и всё остальное, что мы предоставляем. Ключевая деталь для тех, кто выбирает между этими двумя, — модель ценообразования. Мы передаём прейскурантную цену провайдера без наценки — 0%, а значит, снижение цены поставщиком отражается в вашем счёте в тот же день, когда поставщик его объявляет, — и OpenAI уже один раз снизила цену Sol, 21 августа, введя промо-тариф, срок действия которого истекает 21 ноября. Что бы OpenAI ни решила дальше, цифра на нашей стороне будет меняться вместе с ней, а не отставать от тарифной сетки, которую кто-то должен не забыть обновить.

Автоматическое переключение при сбое важно по той же причине. Модель в ограниченном предварительном доступе за одним эндпоинтом — это единая точка отказа; Sol на маршрутизируемом ключе — нет, потому что запросы могут переключаться между провайдерами при сбое без изменения кода. Это причина маршрутизировать Sol. Это не причина утверждать, что мы хостим модель, которую не хостим.

OrcaRouter model page for GPT-5.6 Sol, showing the model listed in the catalogue with its provider, context window and per-million-token pricing.

Кому позвонить?

Выбирайте GPT-5.6 Sol, если работа тяжёлая и асинхронная. Три пункта индекса реальны, набор бенчмарков вендора — эксплуатация, безопасность, GPQA — шире, чем всё, что публиковала StepFun, а модель, которой требуется две минуты, чтобы начать думать, не проблема, когда никто не ждёт. Заложите бюджет на 22 ноября: промо-тариф не постоянен, и OpenAI не сообщила, чем его заменят.

Выберите Step 5 Preview, если задержка и удельная стоимость определяют решение. Вы отказываетесь от трёх пунктов индекса, но получаете первый токен менее чем за три секунды, примерно на 60% большую пропускную способность, в 4 раза более дешёвый ввод и в 7,4 раза более дешёвый вывод — и принимаете, что веса остаются обещанием до 15 октября, а не доступны для скачивания.

Неудобный вывод состоит в том, что бюджетный сегмент достиг точки, когда преимущество флагмана стало настолько малым, что это уже вопрос предпочтения, а не вердикта. Год назад это было не так. Сегодня это так, и разрыв в три пункта в текущем индексе — самое наглядное тому доказательство.

GPT-5.6 Sol — одна из моделей, которые мы маршрутизируемс наценкой 0% с автоматическим переключением при сбое, поэтому изменение цены поставщика вступает в силу на том же ключе в тот же день.