Сгенерирована титульная карточка с заголовком 'Step 5 Preview против Claude Opus 5 — разрыв в цене' с двумя столбцами: Step 5 Preview при AA Index 44, цена $1.00 за вход / $2.70 за выход, стоимость прогона индекса $922.84 и скорость вывода 99.8 токенов/сек; Claude Opus 5 при AA Index 51, цена $5.00 за вход / $25.00 за выход, стоимость прогона индекса $7,274.74 и скорость вывода 55.3 токенов/сек. В нижнем колонтитуле написано: 'В 7.9 раза больше затрат за 7 пунктов индекса. Оба согласно Artificial Analysis Intelligence Index v4.3.2 при максимальном усилии рассуждения.'
Guides & Insights

Step 5 Preview против Claude Opus 5: семь пунктов индекса за семикратный счёт

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

В презентационных материалах StepFun для Step 5 Preview во главе стоит одно сравнительное утверждение: одна задача на нём стоит одну восьмую от той же задачи на Claude Opus 5. Теперь обе модели находятся на одном и том же независимом табло, так что это утверждение можно проверить, а не спорить о нём. Artificial Analysis прогнала каждую через Intelligence Index v4.3.2 — десять оценок — и опубликовала, сколько стоил каждый прогон, причём Claude Opus 5 оценивалась при её собственной максимальной настройке усилия рассуждения. Step 5 Preview: 44 в индексе, $922.84 за полный прогон. Claude Opus 5: 51 в индексе, $7,274.74. Это в 7,9 раза больше денег за 7 пунктов оценки, и указанное StepFun соотношение оказывается точным. Самое интересное — то, что скрывает это соотношение, потому что разрыв в основном не ценовой. Это разрыв в многословности, одетый в одежду ценового разрыва, и разделение этих двух вещей меняет, какую модель следует ставить перед какой рабочей нагрузкой.

Две стоимости запуска, одна плата и то, что на самом деле внутри них

Общая стоимость прогона — это самое чистое единичное сравнение, доступное здесь, потому что обе модели отвечали на одни и те же вопросы в рамках одного и того же стенда, и ни один поставщик не предоставил эту цифру. Это также показатель, который чаще всего могут неправильно истолковать, поэтому его стоит разобрать подробнее.

• Оценка по индексу — Step 5 Preview 44 против Claude Opus 5 51, Claude Opus 5 набрал баллы при максимальной настройке усилия рассуждений

• Общая стоимость завершения индекса — Step 5 Preview $922,84 против Claude Opus 5 $7 274,74

• Смешанная цена при соотношении попаданий в кэш / входных / выходных данных 7:2:1 — Step 5 Preview $0.51 за 1 млн токенов против Claude Opus 5 $3.85

• Токены вывода, сгенерированные во время запуска индекса — Step 5 Preview 160M против Claude Opus 5 140M

• Цена по прайс-листу — Step 5 Preview: $1.00 за вход / $2.70 за выход против Claude Opus 5: $5.00 за вход / $25.00 за выход

Посмотрите на строки три и пять вместе, и арифметика перестаёт быть простым сравнением цен. Смешанная ставка Step 5 Preview в 7,5 раза дешевле, а ставка по прайс-листу в 5 раз дешевле на входе и в 9,3 раза дешевле на выходе — так что смешанная ставка делает то, чего не делает цена на входе. Это потому, что смешанная ставка смещена в сторону вывода, а вывод — это то, где две модели расходятся больше всего. Claude Opus 5 взимает в 9,3 раза больше, чем Step 5 Preview за вывод, и обе модели пишут очень много: 140 млн выходных токенов у Claude Opus 5 против медианы в 92 млн по всем моделям, которые оценивает индекс, и 160 млн у Step 5 Preview против той же медианы в 92 млн.

Итак, честное прочтение уже, чем «дешёвая модель — это выгодная покупка». Step 5 Preview дешевле по всем параметрам, и это не экономная модель — она выдаёт на 74% больше текста, чем медианная модель, с которой её сравнивают, а это ровно то поведение, которое цена и должна наказывать. Claude Opus 5 выдаёт на 52% больше медианной модели и берёт в 9,3 раза больше за каждый из этих токенов. У того, кто ограничивает длину вывода, соотношение получится иным, чем у того, кто этого не делает.

Вопрос не в том, что лучше, а в том, где находится точка перехода.

Предположим, индекс — разумный прокси для работы, которую вы фактически отправляете: долгосрочные агентные задачи, код, многошаговое использование инструментов. Тогда точку перехода просто сформулировать: Claude Opus 5 должен быть как минимум в 7,9 раза полезнее на задачу, прежде чем оправдает свою стоимость, а по индексу он на 7 пунктов лучше по 100-балльной шкале. Эти два факта не обязаны указывать в одну сторону, потому что разрыв в 7 пунктов по индексу — это не на 16% лучше во всём. Это агрегат десяти оценок, и состав важнее общей суммы.

Вот аргумент в пользу того, чтобы обращать внимание на форму двух оценок, а не на заголовок. Показатель Step 5 Preview в Terminal-Bench 4.0 составляет 33,3% — настоящий агентный результат, опережающий DeepSeek V4.1 Flash с 26,8%, — но ничто в опубликованных данных пока не показывает, что он идёт наравне с Claude Opus 5 в долгосрочных оценках, где модель Anthropic сильнее всего. В собственных материалах StepFun это признаётся формулировкой: на ALE-CLI, FrontierFinance и DRACO компания ставит Step 5 Preview на второе место — позади либо GPT-6 Astra, либо Claude Opus 5 — и впереди других открытых моделей в сравнении. Второе место при цене в пять раз ниже — это действительно хороший результат. Это также не первое место, а задачи, где модель финиширует второй, обычно как раз те, где требовалось первое место.

Другая асимметрия — это то, что происходит при неудачном вызове. Неверный ответ дешёвой модели, который занял четыре секунды и 2000 токенов, стоит вам повторной попытки; тот же неверный ответ от Claude Opus 5 при цене 25 долларов за миллион выходных токенов стоит вам повторной попытки плюс размышлений. Если ваш конвейер повторяет попытку при сбое — большинство агентных циклов так и делает, — эффективная стоимость в расчёте на успешную задачу — это число, которое имеет значение, и это соотношение не такое же, как у прейскурантной цены, потому что две модели не будут ошибаться с одинаковой частотой. Пока никто не опубликовал это число для Step 5 Preview.

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second, cost per Intelligence Index task $0.71, verbosity 160M output tokens, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

Сопоставление спецификаций, измерение за измерением

• Оценка по индексу — Step 5 Preview 44 против Claude Opus 5 51, оба в Intelligence Index v4.3.2, Claude Opus 5 при максимальном значении параметра усилия рассуждения

• Цена за 1 млн токенов — Step 5 Preview: $1.00 за вход / $2.70 за выход против Claude Opus 5: $5.00 за вход / $25.00 за выход

• Скидка на кэш — Step 5 Preview 95% против Claude Opus 5 90%

• Контекст — у обоих 1M токенов; StepFun не опубликовал предельный объём вывода, а у Anthropic он составляет 128K

• Ввод — оба принимают текст и изображения; оба выводят только текст

• Скорость вывода — Step 5 Preview 99,8 токенов/сек против Claude Opus 5 55,3 токенов/сек

• Панель управления — Step 5 Preview открывает доступ к расширенному мышлению; Claude Opus 5 заменяет temperature и top_p адаптивным регулятором усилия рассуждения

• Веса — Step 5 Preview закрыт сегодня, контрольная точка BF16 запланирована на 15 октября; Claude Opus 5 — проприетарный на всём протяжении

• Независимое подтверждение — оба оценены Artificial Analysis; строки агентных бенчмарков StepFun проведены вендором и не воспроизведены

Две строки заслуживают отдельного примечания. Разрыв в скорости реален и на практике больше, чем следует из таблицы: 99,8 токенов в секунду против 55,3 — это модель, которая завершает работу примерно вдвое быстрее при том же выводе, а время до первого токена у Step 5 Preview в 2,96 секунды против 56,84 секунды у Claude Opus 5 в том же рейтинге — это уже нечто иного порядка, хотя вторая цифра измеряет конфигурацию рассуждений с максимальным усилием, где модель размышляет, прежде чем что-либо выдать. Это не та задержка, которую видит продакшен-запрос. Для стандартного эндпоинта наш собственный каталог сообщает p50 времени до первого токена в 6,73 секунды для Claude Opus 5 — именно на это число стоит ориентироваться, если вы не запрашиваете намеренно максимальное обдумывание.

Строка скидки за кэш — это та, что тихо решает судьбу повторяющихся рабочих нагрузок, и она отдаёт предпочтение Step 5 Preview: 95% против 90%. Цикл агента, который при каждом вызове заново отправляет один и тот же системный промпт и контекст репозитория, почти полностью живёт за счёт этой скидки, поэтому разница в пять пунктов накапливается за долгую сессию.

Generated two-column comparison scoreboard titled 'Step 5 Preview vs Claude Opus 5 — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, price $1.00 / $2.70, cache discount 95%, output speed 99.8 tokens/sec, context 1M tokens, and weights due October 15. The right column gives Claude Opus 5 the rows AA Index 51, price $5.00 / $25.00, cache discount 90%, output speed 55.3 tokens/sec, context 1M tokens, and weights proprietary. A footer reads 'Both per Artificial Analysis Intelligence Index v4.3.2 at maximum reasoning effort. StepFun agentic rows are vendor-run.'

Где Claude Opus 5 всё ещё остаётся единственным ответом

Ничто из вышесказанного не говорит против модели Anthropic. Она стоит столько, сколько стоит, потому что делает именно то, что пытается измерить индекс, и делает это почти на вершине таблицы — 51 балл в Intelligence Index v4.3.2, на семь пунктов опережая Step 5 Preview и вплотную приблизившись к лидерам текущего поколения. Нагрузки, для которых совокупный разрыв в 7 пунктов преуменьшает разницу, — это те, что не терпят ответа, занявшего второе место: многочасовой рефакторинг, где режим отказа — незаметное изменение поведения, финансовая модель, где цепочка рассуждений должна поддаваться аудиту, миграция, где неверное решение обнаруживается лишь неделю спустя. В таких случаях повторная попытка недёшева, а обдумывание — это и есть продукт.

Рабочие нагрузки, в которых этот разрыв не имеет значения, — это те, что складываются из множества мелких решений: шагов классификации и маршрутизации, извлечения, суммаризации, тестовой обвязки, тысячи вызовов, которые агент совершает между двумя вызовами, действительно имеющими значение. В таких случаях модель с результатом 44, отвечающая вдвое быстрее при цене за входные данные в пять раз ниже, — не компромисс. Это правильный вариант по умолчанию, а дорогая модель приберегается для шага, который обязан быть верным.

Запуск разделения без запуска двух интеграций

Практическая версия этого сравнения — это многоуровневый конвейер, и причина, по которой команды его не строят, кроется в закупках, а не в инженерии — два поставщика, два контракта, два SDK, два ключа, которые нужно ротировать. Claude Opus 5 есть в нашем каталоге по цене $5.00 и $25.00, а более дешёвые текстовые модели, которые вы поставили бы перед ней, — в том же каталоге, всё за одним ключом для более чем 200 моделей, при этом прайс-листовая цена провайдера передаётся без наценки — 0%. Step 5 Preview в этот список не входит — она работает на собственном API StepFun, и пока веса не выложены в открытый доступ, это единственное место, где она работает. Выстраивание такой многоуровневой схемы между моделями, которые мы действительно маршрутизируем, — это выражение на DSL маршрутизации, а не изменение кода: направьте рутинные вызовы к небольшой модели, переключайтесь на дорогую по условию уверенности или сложности и держите оба плеча за одной и той же конечной точкой.

Автоматическое переключение при отказе имеет здесь значение по конкретной причине, а не как универсальная функция. Step 5 Preview открыл свой API в день анонса без опубликованных весов и без раскрытого парка серверов; это preview-эндпоинт, которому всего несколько дней, и preview-эндпоинты ограничены по ёмкости так, как зрелые — нет. Claude Opus 5 обслуживается многими независимыми провайдерами, что даёт ту избыточность, которую preview предложить не может. Сохранение проверенной модели в качестве резервного звена — с нашей стороны это означает production-модель из каталога, а не preview — это способ получить реальный сигнал о качестве на вашей собственной рабочей нагрузке, не делая ваш production-путь зависимым от парка, который всё ещё определяется по размеру.

Screenshot of the OrcaRouter model page for Claude Opus 5 at www.orcarouter.ai/models/anthropic/claude-opus-5, showing the model id anthropic/claude-opus-5, the max output and context figures of 128K and 1M tokens, input pricing of $5.00 and output pricing of $25.00 per million tokens, a p50 time to first token of 6.73 seconds, 59.7M tokens of traffic over seven days, and the endpoints and SDK snippets behind the OrcaRouter API.

Решающее правило

Если ваша нагрузка — это небольшое количество очень сложных задач, Claude Opus 5 — не дорогой вариант, а дешёвый, потому что второй по качеству ответ стоит дороже, чем эта разница. Если ваша нагрузка — это большое количество обычных задач с небольшим числом сложных среди них, Step 5 Preview по цене $1.00 и $2.70 со скидкой 95% на кэш — лучший выбор по умолчанию, а разрыв в 7 пунктов — в основном погрешность округления на работе, которой он не был нужен.

Изменить этот расчёт могли бы независимые данные о частоте отказов и о долгосрочных агентных строках. Собственные цифры StepFun ставят модель на второе место в оценках, вокруг которых строился её запуск, и ни одна третья сторона их не воспроизвела. В чекпойнте от 15 октября обратите внимание на две вещи: разрешает ли лицензия дообучение, которое позволило бы вам закрыть разрыв в 7 пунктов на ваших собственных данных, и сохранится ли многословность, когда исчезнет суффикс preview. Первое изменило бы соотношение; второе уже однажды сдвинуло его.