
Step 5 Preview против Claude Opus 5: семь пунктов индекса за семикратный счёт
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
В презентационных материалах StepFun для Step 5 Preview во главе стоит одно сравнительное утверждение: одна задача на нём стоит одну восьмую от той же задачи на Claude Opus 5. Теперь обе модели находятся на одном и том же независимом табло, так что это утверждение можно проверить, а не спорить о нём. Artificial Analysis прогнала каждую через Intelligence Index v4.3.2 — десять оценок — и опубликовала, сколько стоил каждый прогон, причём Claude Opus 5 оценивалась при её собственной максимальной настройке усилия рассуждения. Step 5 Preview: 44 в индексе, $922.84 за полный прогон. Claude Opus 5: 51 в индексе, $7,274.74. Это в 7,9 раза больше денег за 7 пунктов оценки, и указанное StepFun соотношение оказывается точным. Самое интересное — то, что скрывает это соотношение, потому что разрыв в основном не ценовой. Это разрыв в многословности, одетый в одежду ценового разрыва, и разделение этих двух вещей меняет, какую модель следует ставить перед какой рабочей нагрузкой.
Две стоимости запуска, одна плата и то, что на самом деле внутри них
Общая стоимость прогона — это самое чистое единичное сравнение, доступное здесь, потому что обе модели отвечали на одни и те же вопросы в рамках одного и того же стенда, и ни один поставщик не предоставил эту цифру. Это также показатель, который чаще всего могут неправильно истолковать, поэтому его стоит разобрать подробнее.
• Оценка по индексу — Step 5 Preview 44 против Claude Opus 5 51, Claude Opus 5 набрал баллы при максимальной настройке усилия рассуждений
• Общая стоимость завершения индекса — Step 5 Preview $922,84 против Claude Opus 5 $7 274,74
• Смешанная цена при соотношении попаданий в кэш / входных / выходных данных 7:2:1 — Step 5 Preview $0.51 за 1 млн токенов против Claude Opus 5 $3.85
• Токены вывода, сгенерированные во время запуска индекса — Step 5 Preview 160M против Claude Opus 5 140M
• Цена по прайс-листу — Step 5 Preview: $1.00 за вход / $2.70 за выход против Claude Opus 5: $5.00 за вход / $25.00 за выход
Посмотрите на строки три и пять вместе, и арифметика перестаёт быть простым сравнением цен. Смешанная ставка Step 5 Preview в 7,5 раза дешевле, а ставка по прайс-листу в 5 раз дешевле на входе и в 9,3 раза дешевле на выходе — так что смешанная ставка делает то, чего не делает цена на входе. Это потому, что смешанная ставка смещена в сторону вывода, а вывод — это то, где две модели расходятся больше всего. Claude Opus 5 взимает в 9,3 раза больше, чем Step 5 Preview за вывод, и обе модели пишут очень много: 140 млн выходных токенов у Claude Opus 5 против медианы в 92 млн по всем моделям, которые оценивает индекс, и 160 млн у Step 5 Preview против той же медианы в 92 млн.
Итак, честное прочтение уже, чем «дешёвая модель — это выгодная покупка». Step 5 Preview дешевле по всем параметрам, и это не экономная модель — она выдаёт на 74% больше текста, чем медианная модель, с которой её сравнивают, а это ровно то поведение, которое цена и должна наказывать. Claude Opus 5 выдаёт на 52% больше медианной модели и берёт в 9,3 раза больше за каждый из этих токенов. У того, кто ограничивает длину вывода, соотношение получится иным, чем у того, кто этого не делает.
Вопрос не в том, что лучше, а в том, где находится точка перехода.
Предположим, индекс — разумный прокси для работы, которую вы фактически отправляете: долгосрочные агентные задачи, код, многошаговое использование инструментов. Тогда точку перехода просто сформулировать: Claude Opus 5 должен быть как минимум в 7,9 раза полезнее на задачу, прежде чем оправдает свою стоимость, а по индексу он на 7 пунктов лучше по 100-балльной шкале. Эти два факта не обязаны указывать в одну сторону, потому что разрыв в 7 пунктов по индексу — это не на 16% лучше во всём. Это агрегат десяти оценок, и состав важнее общей суммы.
Вот аргумент в пользу того, чтобы обращать внимание на форму двух оценок, а не на заголовок. Показатель Step 5 Preview в Terminal-Bench 4.0 составляет 33,3% — настоящий агентный результат, опережающий DeepSeek V4.1 Flash с 26,8%, — но ничто в опубликованных данных пока не показывает, что он идёт наравне с Claude Opus 5 в долгосрочных оценках, где модель Anthropic сильнее всего. В собственных материалах StepFun это признаётся формулировкой: на ALE-CLI, FrontierFinance и DRACO компания ставит Step 5 Preview на второе место — позади либо GPT-6 Astra, либо Claude Opus 5 — и впереди других открытых моделей в сравнении. Второе место при цене в пять раз ниже — это действительно хороший результат. Это также не первое место, а задачи, где модель финиширует второй, обычно как раз те, где требовалось первое место.
Другая асимметрия — это то, что происходит при неудачном вызове. Неверный ответ дешёвой модели, который занял четыре секунды и 2000 токенов, стоит вам повторной попытки; тот же неверный ответ от Claude Opus 5 при цене 25 долларов за миллион выходных токенов стоит вам повторной попытки плюс размышлений. Если ваш конвейер повторяет попытку при сбое — большинство агентных циклов так и делает, — эффективная стоимость в расчёте на успешную задачу — это число, которое имеет значение, и это соотношение не такое же, как у прейскурантной цены, потому что две модели не будут ошибаться с одинаковой частотой. Пока никто не опубликовал это число для Step 5 Preview.

Сопоставление спецификаций, измерение за измерением
• Оценка по индексу — Step 5 Preview 44 против Claude Opus 5 51, оба в Intelligence Index v4.3.2, Claude Opus 5 при максимальном значении параметра усилия рассуждения
• Цена за 1 млн токенов — Step 5 Preview: $1.00 за вход / $2.70 за выход против Claude Opus 5: $5.00 за вход / $25.00 за выход
• Скидка на кэш — Step 5 Preview 95% против Claude Opus 5 90%
• Контекст — у обоих 1M токенов; StepFun не опубликовал предельный объём вывода, а у Anthropic он составляет 128K
• Ввод — оба принимают текст и изображения; оба выводят только текст
• Скорость вывода — Step 5 Preview 99,8 токенов/сек против Claude Opus 5 55,3 токенов/сек
• Панель управления — Step 5 Preview открывает доступ к расширенному мышлению; Claude Opus 5 заменяет temperature и top_p адаптивным регулятором усилия рассуждения
• Веса — Step 5 Preview закрыт сегодня, контрольная точка BF16 запланирована на 15 октября; Claude Opus 5 — проприетарный на всём протяжении
• Независимое подтверждение — оба оценены Artificial Analysis; строки агентных бенчмарков StepFun проведены вендором и не воспроизведены
Две строки заслуживают отдельного примечания. Разрыв в скорости реален и на практике больше, чем следует из таблицы: 99,8 токенов в секунду против 55,3 — это модель, которая завершает работу примерно вдвое быстрее при том же выводе, а время до первого токена у Step 5 Preview в 2,96 секунды против 56,84 секунды у Claude Opus 5 в том же рейтинге — это уже нечто иного порядка, хотя вторая цифра измеряет конфигурацию рассуждений с максимальным усилием, где модель размышляет, прежде чем что-либо выдать. Это не та задержка, которую видит продакшен-запрос. Для стандартного эндпоинта наш собственный каталог сообщает p50 времени до первого токена в 6,73 секунды для Claude Opus 5 — именно на это число стоит ориентироваться, если вы не запрашиваете намеренно максимальное обдумывание.
Строка скидки за кэш — это та, что тихо решает судьбу повторяющихся рабочих нагрузок, и она отдаёт предпочтение Step 5 Preview: 95% против 90%. Цикл агента, который при каждом вызове заново отправляет один и тот же системный промпт и контекст репозитория, почти полностью живёт за счёт этой скидки, поэтому разница в пять пунктов накапливается за долгую сессию.

Где Claude Opus 5 всё ещё остаётся единственным ответом
Ничто из вышесказанного не говорит против модели Anthropic. Она стоит столько, сколько стоит, потому что делает именно то, что пытается измерить индекс, и делает это почти на вершине таблицы — 51 балл в Intelligence Index v4.3.2, на семь пунктов опережая Step 5 Preview и вплотную приблизившись к лидерам текущего поколения. Нагрузки, для которых совокупный разрыв в 7 пунктов преуменьшает разницу, — это те, что не терпят ответа, занявшего второе место: многочасовой рефакторинг, где режим отказа — незаметное изменение поведения, финансовая модель, где цепочка рассуждений должна поддаваться аудиту, миграция, где неверное решение обнаруживается лишь неделю спустя. В таких случаях повторная попытка недёшева, а обдумывание — это и есть продукт.
Рабочие нагрузки, в которых этот разрыв не имеет значения, — это те, что складываются из множества мелких решений: шагов классификации и маршрутизации, извлечения, суммаризации, тестовой обвязки, тысячи вызовов, которые агент совершает между двумя вызовами, действительно имеющими значение. В таких случаях модель с результатом 44, отвечающая вдвое быстрее при цене за входные данные в пять раз ниже, — не компромисс. Это правильный вариант по умолчанию, а дорогая модель приберегается для шага, который обязан быть верным.
Запуск разделения без запуска двух интеграций
Практическая версия этого сравнения — это многоуровневый конвейер, и причина, по которой команды его не строят, кроется в закупках, а не в инженерии — два поставщика, два контракта, два SDK, два ключа, которые нужно ротировать. Claude Opus 5 есть в нашем каталоге по цене $5.00 и $25.00, а более дешёвые текстовые модели, которые вы поставили бы перед ней, — в том же каталоге, всё за одним ключом для более чем 200 моделей, при этом прайс-листовая цена провайдера передаётся без наценки — 0%. Step 5 Preview в этот список не входит — она работает на собственном API StepFun, и пока веса не выложены в открытый доступ, это единственное место, где она работает. Выстраивание такой многоуровневой схемы между моделями, которые мы действительно маршрутизируем, — это выражение на DSL маршрутизации, а не изменение кода: направьте рутинные вызовы к небольшой модели, переключайтесь на дорогую по условию уверенности или сложности и держите оба плеча за одной и той же конечной точкой.
Автоматическое переключение при отказе имеет здесь значение по конкретной причине, а не как универсальная функция. Step 5 Preview открыл свой API в день анонса без опубликованных весов и без раскрытого парка серверов; это preview-эндпоинт, которому всего несколько дней, и preview-эндпоинты ограничены по ёмкости так, как зрелые — нет. Claude Opus 5 обслуживается многими независимыми провайдерами, что даёт ту избыточность, которую preview предложить не может. Сохранение проверенной модели в качестве резервного звена — с нашей стороны это означает production-модель из каталога, а не preview — это способ получить реальный сигнал о качестве на вашей собственной рабочей нагрузке, не делая ваш production-путь зависимым от парка, который всё ещё определяется по размеру.

Решающее правило
Если ваша нагрузка — это небольшое количество очень сложных задач, Claude Opus 5 — не дорогой вариант, а дешёвый, потому что второй по качеству ответ стоит дороже, чем эта разница. Если ваша нагрузка — это большое количество обычных задач с небольшим числом сложных среди них, Step 5 Preview по цене $1.00 и $2.70 со скидкой 95% на кэш — лучший выбор по умолчанию, а разрыв в 7 пунктов — в основном погрешность округления на работе, которой он не был нужен.
Изменить этот расчёт могли бы независимые данные о частоте отказов и о долгосрочных агентных строках. Собственные цифры StepFun ставят модель на второе место в оценках, вокруг которых строился её запуск, и ни одна третья сторона их не воспроизвела. В чекпойнте от 15 октября обратите внимание на две вещи: разрешает ли лицензия дообучение, которое позволило бы вам закрыть разрыв в 7 пунктов на ваших собственных данных, и сохранится ли многословность, когда исчезнет суффикс preview. Первое изменило бы соотношение; второе уже однажды сдвинуло его.
