Сгенерированная титульная карточка под названием «Step 5 Preview vs Gemini 3.1 Pro — две предварительные версии с разницей в семь месяцев», с временной шкалой, на которой отмечены Gemini 3.1 Pro Preview на 19 февраля 2026 года — всё ещё предварительная версия — и Step 5 Preview на 20 сентября 2026 года, веса ожидаются 15 октября. Ниже — две карточки: Step 5 Preview с AA Index 44, входными данными в виде текста и изображения и временем до первого токена 2,96 с; Gemini 3.1 Pro Preview с AA Index 30, входными данными в виде текста, изображения, аудио, видео и файла и временем до первого токена 35,72 с. В нижнем колонтитуле указано: «Оба показателя приведены согласно Artificial Analysis Intelligence Index v4.3.2».
Guides & Insights

Step 5 Preview vs Gemini 3.1 Pro: две модели под названием Preview, вышедшие с разницей в семь месяцев

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

И Step 5 Preview, и Gemini 3.1 Pro несут в своём названии слово preview, и в обоих случаях это слово означает не одно и то же. StepFun анонсировала Step 5 Preview 20 сентября 2026 года: API открыт, веса запланированы на 15 октября, а репозиторий BF16 на Hugging Face содержит лишь .gitattributes. Второй поставляется как gemini-3.1-pro-preview в API и как «Gemini 3.1 Pro Preview» во всех лидербордах с 19 февраля 2026 года, обслуживая рабочий трафик уже семь месяцев, и ярлык за это время так и не сняли. Один — это настоящий предпросмотр чего-то незавершённого. Другой — это соглашение об именовании, прикреплённое к готовому продукту. Сравнивать их по одной оси означает решать, что именно из этих двух вещей вы на самом деле покупаете, и ответ второго порядка — то, что модель, которую спустя семь месяцев всё ещё называют предпросмотром, как раз и является более предсказуемой из двух — это то, что стоит учитывать при принятии решения о закупке.

Что говорит та же самая доска

Artificial Analysis оценивает оба по Intelligence Index v4.3.2 — десяти оценкам. Это единственное место, где их обоих измеряли одной и той же рукой, и разрыв между результатами оказался больше, чем можно было бы предположить по материалам вендоров с обеих сторон.

• Intelligence Index — Step 5 Preview 44 против Gemini 3.1 Pro Preview 30

• Ранг — Step 5 Preview: 24-е из 200 моделей против Gemini 3.1 Pro Preview: 69-е из 200

• Цена за 1 млн токенов — Step 5 Preview: $1,00 за ввод / $2,70 за вывод против Gemini 3.1 Pro: $2,00 за ввод / $12,00 за вывод

• Скидка на кэш — Step 5 Preview 95% против Gemini 3.1 Pro 90%

• Скорость вывода — Step 5 Preview 99,8 токенов/с против Gemini 3.1 Pro 118,9 токенов/с

• Время до первого токена — Step 5 Preview 2,96 с против Gemini 3.1 Pro 35,72 с

• Контекст — у обоих 1M токенов; в нашем каталоге Gemini 3.1 Pro указан с потолком вывода 65K, а StepFun его не опубликовал

• Входные модальности — Step 5 Preview: текст и изображение. Gemini 3.1 Pro: текст, изображение, аудио, видео и файл. Оба выводят только текст

• Веса — Step 5 Preview закрыт сегодня, чекпоинт BF16 запланирован на 15 октября; Gemini 3.1 Pro остаётся проприетарным на всём протяжении

Разрыв в 14 пунктов на шкале, где верхняя позиция в таблице находится на отметке 53, — это большой разрыв, и о нём следует сообщать рядом с тем, что делает его странным: опубликованные самим Google оценочные показатели для этой модели превосходны. Поставщик сообщает 77,1% на ARC-AGI-2, 82,8% на своём мультимодальном наборе, 94,1 на GPQA Diamond и 47,0 на Humanity's Last Exam. Это не слабые цифры. Они также принадлежат самому Google, получены на его стендах, и они измеряют конкретные возможности, а не агрегированный показатель, который оценивает индекс. Оба набора чисел могут быть верны одновременно. Когда главная оценка поставщика и независимый составной показатель расходятся настолько резко, именно составной показатель стоит брать за основу при планировании рабочей нагрузки в продакшене, потому что именно он штрафует модель за те аспекты, которые поставщик не выбрал измерять.

Две строки с показателями скорости стоит рассматривать вместе, а не по отдельности. Gemini 3.1 Pro генерирует токены на 19% быстрее после запуска — 118,9 против 99,8 — и тратит 35,72 секунды на запуск, против 2,96 у Step 5 Preview. Это профиль модели, которая размышляет, прежде чем выдать результат. Для пакетной задачи, где человек не ждёт, более быстрый генератор выигрывает по пропускной способности. Для цикла агента, выполняющего десятки зависимых вызовов, двенадцатикратная разница во времени до первого токена — это разница между интерактивным инструментом и очередью.

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second, cost per Intelligence Index task $0.71, verbosity 160M output tokens, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

Единственная ось, на которой Gemini безоговорочно побеждает

Модальность в этом сравнении — не сноска. Gemini 3.1 Pro принимает текст, изображения, аудио, видео и произвольные файлы, а Step 5 Preview — текст и изображения. Если ваш пайплайн включает запись экрана, запись звонка, набор PDF-файлов или видеопоток, только одна из этих двух моделей вообще способна принять такой ввод, а разрыв в 14 пунктов индекса не имеет значения, потому что другая модель не может ответить на вопрос.

Эта асимметрия определяет больше реальных рабочих нагрузок, чем таблицы бенчмарков. Обзор видео, анализ встреч, транскрипция аудио вместе с рассуждениями и документные рабочие процессы на основе отсканированных файлов — всё это случаи, где широта возможностей Gemini 3.1 Pro делает её единственным кандидатом на этой странице. Это также причина, по которой модель остаётся в продакшене уже семь месяцев под ярлыком preview: рабочие нагрузки, которые она выдерживает, — это те, где более новая модель для работы с текстом и изображениями не может её вытеснить.

Для работы с текстом и изображениями расчёт меняется на противоположный. Step 5 Preview опережает на 14 пунктов по совокупному показателю, примерно вдвое быстрее по цене ввода и в 4,4 раза дешевле по цене вывода, а отвечает в двенадцать раз быстрее. При нагрузке вроде извлечения документов или чата по скриншотам нет причин переплачивать и ждать лишние одиннадцать секунд на обдумывание.

Где ценообразование не такое плоское, как кажется

Заявленные цены преуменьшают разницу, и причина в границе тарифного уровня, а не в ставке.

Тарифы Gemini 3.1 Pro — $2,00 и $12,00 — действуют до 200 000 входных токенов. Выше этого порога обе ставки повышаются до $4,00 и $18,00 — рост на 50% для выходных данных применяется ко всему запросу, а не только к части, превышающей границу. У Step 5 Preview тарифы $1,00 и $2,70 не имеют опубликованного уровня; цена остаётся неизменной при любой длине, которую допускает контекстное окно.

Обе модели заявляют о контексте в 1 млн токенов, поэтому обе побуждают вас строить пайплайны с длинным контекстом. На одной из них запрос на 300 000 токенов стоит вдвое дороже, чем указано в прайс-листе; на другой — нет. Это структурное преимущество Step 5 Preview именно в той категории, для которой StepFun его создавала — долгосрочная агентная работа с большим контекстом, к которому многократно обращаются, — и оно усиливается скидкой за кэширование: 95% у Step 5 Preview против 90% у Gemini 3.1 Pro ещё сильнее увеличивают разрыв при паттерне повторяющегося префикса, который порождает агентный цикл.

Грубо подсчитано и обозначено как арифметическая оценка, а не цитируемая цифра: агентный цикл, который отправляет контекст в 250 000 токенов на каждом из сорока ходов, — это десять миллионов входных токенов. При ставке Gemini 3.1 Pro для контекста свыше 200 тыс. токенов, когда кэш поглощает повторяющийся префикс, это заметно больше того, что подразумевает ставка $2.00 по прайс-листу. При фиксированной ставке Step 5 Preview $1.00 с более глубокой скидкой за кэш тот же цикл стоит меньше и, что важнее, стоит столько, сколько можно предсказать по прайс-листу, не читая сначала таблицу уровней.

Generated two-column comparison scoreboard titled 'Step 5 Preview vs Gemini 3.1 Pro — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, price $1.00 / $2.70, cache discount 95%, time to first token 2.96s, context 1M tokens with no published output cap, and input text and image. The right column gives Gemini 3.1 Pro Preview the rows AA Index 30, price $2.00 / $12.00, $4.00 / $18.00 above 200K input, cache discount 90%, time to first token 35.72s, context 1M tokens with a max output of 65K, and input text, image, audio, video and file. A footer reads 'Both per Artificial Analysis Intelligence Index v4.3.2; Gemini ARC-AGI-2 and multimodal figures are vendor-reported.'

Доступность — это тихое отличие

Gemini 3.1 Pro можно вызывать уже семь месяцев через API Google и, что более полезно для планирования, через несколько независимых провайдеров — именно это делает показатель p50-задержки осмысленным, а не основанным на единичных наблюдениях. Step 5 Preview открыл свой API 20 сентября и имеет ровно один источник. Одноисточниковый эндпоинт, которому всего несколько дней, — это наименее предсказуемый компонент, который только можно поставить на продакшн-путь, не потому, что модель плоха, а потому, что никто ещё не знает её кривую пропускной способности.

Вот аргумент в пользу маршрутизации, а не выбора. Gemini 3.1 Pro Preview есть в нашем каталоге по цене $2.00 и $12.00 при этом тарифная ступень передаётся без изменений, а модели, с которыми его сравнивают, стоят рядом с ним, за одним ключом — более 200 моделей, при этом цена из прайс-листа провайдера передаётся без наценки (0%). Step 5 Preview отсутствует в этом списке — она работает на собственном API StepFun, и пока веса не появятся, это единственное место, где она работает. Автоматическое переключение при сбое — вот что позволяет безопасно тестировать preview, которому всего несколько дней, а не делать ставку: оставьте production-путь на модели с подтверждённой историей, отправьте основной объём текста и изображений в Step 5 Preview, пока оцениваете её на своём трафике, и пусть резервный вариант держит нагрузку, когда preview-эндпоинт деградирует. Для моделей, которые мы маршрутизируем, нет второго договора и отдельного SDK, поэтому изменение цен Google отражается в вашем счёте как текущая цифра, а не при продлении.

Screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview at www.orcarouter.ai/models/google/gemini-3.1-pro-preview, showing the model id google/gemini-3.1-pro-preview with Vision, Audio, Tools, JSON and Reasoning tags, a 1M-token context, a 65K max output and text output, input pricing of $2.00 and output pricing of $12.00 per million tokens, a p50 time to first token of 10.00 seconds, 109.7M tokens of traffic over seven days, and the endpoints and SDK snippets behind the OrcaRouter API.

Какой из них вы на самом деле покупаете?

Если ваша работа поступает в виде видео, аудио или файлов, Gemini 3.1 Pro — единственная модель на этой странице, которая может её принять, и разрыв в индексе не учитывается при принятии решения. Семь месяцев в продакшене с всё ещё стоящей меткой preview — это сигнал стабильности, а не предупреждение: соглашение об именовании сохраняется, потому что Google никогда не нужно было его менять, и модель ведёт себя как рабочая лошадка продакшена, которой она и является.

Если ваша работа — это текст и изображения в больших объёмах с крупным повторяющимся контекстом, Step 5 Preview опережает по всем важным метрикам — 14 пунктов индекса, половина цены за ввод, в 4,4 раза более дешёвый тариф за вывод, отсутствие резкого скачка между тарифами, более глубокая скидка на кэш и время до первого токена, измеряемое секундами, а не половиной минуты. То, что вы там покупаете, — это появившийся всего несколько дней назад endpoint из единственного источника без опубликованной лицензии и без опубликованного потолка вывода, что является реальным риском, но риском ограниченным.

Следить нужно не за индексом. А за тем, публикует ли StepFun потолок вывода вместе с контекстным окном в 1M токенов, потому что в анонсе производителя об этом не сказано, а отдельная сторонняя конфигурация, распространявшаяся во время утечки, указывала контекст 350 000 с лимитом вывода 64 000 — это существенно другой продукт по сравнению с тем, что указан в прайс-листе. Потолок Gemini 3.1 Pro в 65K, как он указан в нашем каталоге, тоже не щедрый, но он заявлен, а заявленный лимит — это тот, который можно учесть при проектировании.