Wygenerowano kartę tytułową zatytułowaną „Step 5 Preview vs Gemini 3.1 Pro — dwie wersje zapoznawcze, siedem miesięcy od siebie”, z osią czasu oznaczającą Gemini 3.1 Pro Preview na 19 lutego 2026, wciąż wersja zapoznawcza, oraz Step 5 Preview na 20 września 2026, wagi spodziewane 15 października. Poniżej dwie karty: Step 5 Preview z AA Index 44, wejściowy tekst i obraz, oraz czas do pierwszego tokenu 2,96 s; Gemini 3.1 Pro Preview z AA Index 30, wejściowy tekst, obraz, audio, wideo i plik, oraz czas do pierwszego tokenu 35,72 s. Stopka brzmi: „Oba według Artificial Analysis Intelligence Index v4.3.2.”
Guides & Insights

Step 5 Preview vs Gemini 3.1 Pro: Dwa modele o nazwie Preview, siedem miesięcy od siebie

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Zarówno Step 5 Preview, jak i Gemini 3.1 Pro mają w nazwie słowo preview, a słowo to nie znaczy tego samego w żadnym z nich. StepFun ogłosił Step 5 Preview 20 września 2026 r., API było otwarte, wagi zaplanowano na 15 października, a repozytorium BF16 na Hugging Face zawierało tylko plik .gitattributes. Ten drugi jest udostępniany jako gemini-3.1-pro-preview w API i jako „Gemini 3.1 Pro Preview” na każdej liście rankingowej od 19 lutego 2026 r., obsługując ruch produkcyjny przez siedem miesięcy, a etykieta nigdy nie została zdjęta. Jeden to prawdziwa wersja zapoznawcza czegoś niedokończonego. Drugi to konwencja nazewnicza przypięta do gotowego produktu. Porównywanie ich na tej samej osi oznacza ustalenie, którą z tych dwóch rzeczy faktycznie kupujesz, a odpowiedź drugiego rzędu — że model wciąż nazywany preview po siedmiu miesiącach jest bardziej przewidywalny z tych dwóch — to część warta przeniesienia do decyzji zakupowej.

Co mówi ta sama tablica

Artificial Analysis ocenia oba według Intelligence Index v4.3.2, dziesięciu ewaluacji. To jedyne miejsce, w którym te dwa zostały zmierzone przez tę samą rękę, a wynik jest bardziej rozbieżny, niż sugerowałyby materiały dostawców po obu stronach.

• Indeks Inteligencji — Step 5 Preview 44 vs. Gemini 3.1 Pro Preview 30

• Miejsce — Step 5 Preview 24. z 200 modeli vs Gemini 3.1 Pro Preview 69. z 200

• Cena za 1 mln tokenów — Step 5 Preview 1,00 USD za wejście / 2,70 USD za wyjście vs Gemini 3.1 Pro 2,00 USD za wejście / 12,00 USD za wyjście

• Zniżka za pamięć podręczną — Step 5 Preview 95% vs Gemini 3.1 Pro 90%

• Szybkość generowania — Step 5 Preview 99,8 tokenów/s vs Gemini 3.1 Pro 118,9 tokenów/s

• Czas do pierwszego tokenu — Step 5 Preview 2,96 s vs Gemini 3.1 Pro 35,72 s

• Kontekst — w obu przypadkach 1 mln tokenów; nasz katalog podaje Gemini 3.1 Pro z limitem wyjściowym 65K, a StepFun nie opublikował takiego.

• Modalności wejściowe — Step 5 Preview: tekst i obraz. Gemini 3.1 Pro: tekst, obraz, dźwięk, wideo i plik. Oba zwracają wyłącznie tekst.

• Wagi — Step 5 Preview zamknięte dzisiaj, punkt kontrolny BF16 zaplanowany na 15 października; Gemini 3.1 Pro w całości zastrzeżony

Różnica 14 punktów w skali, w której szczyt tabeli wyników znajduje się na poziomie 53, jest duża i należy ją podawać obok tego, co czyni ją dziwną: opublikowane przez samego Google wyniki oceny tego modelu są doskonałe. Dostawca podaje 77,1% w ARC-AGI-2, 82,8% w swoim zestawie multimodalnym, 94,1 w GPQA Diamond i 47,0 w Humanity's Last Exam. To nie są słabe wyniki. Są to również wyniki samego Google, uzyskane w środowiskach testowych Google, i mierzą konkretne możliwości, a nie zagregowany wynik, który ocenia ten indeks. Oba zestawy liczb mogą być jednocześnie prawdziwe. Gdy flagowa ocena dostawcy i niezależny wskaźnik złożony różnią się tak znacząco, to na wskaźniku złożonym należy opierać planowanie obciążenia produkcyjnego, ponieważ to on karze model za rzeczy, których dostawca nie zdecydował się mierzyć.

Te dwa wiersze szybkości warto czytać razem, a nie osobno. Gemini 3.1 Pro generuje tokeny o 19% szybciej, gdy już ruszy — 118,9 wobec 99,8 — a jego uruchomienie zajmuje 35,72 sekundy wobec 2,96 w Step 5 Preview. To profil modelu, który najpierw deliberuje, zanim zacznie emitować. W zadaniu wsadowym, w którym człowiek nie czeka, szybszy generator wygrywa pod względem przepustowości. W pętli agenta wykonującej dziesiątki zależnych wywołań dwunastokrotna różnica w czasie do pierwszego tokena to różnica między narzędziem interaktywnym a kolejką.

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second, cost per Intelligence Index task $0.71, verbosity 160M output tokens, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

Jedyny wymiar, w którym Gemini wygrywa bezapelacyjnie

Modalność nie jest przypisem w tym porównaniu. Gemini 3.1 Pro przyjmuje tekst, obrazy, dźwięk, wideo i dowolne pliki, a Step 5 Preview przyjmuje tekst i obrazy. Jeśli Twój potok obejmuje nagranie ekranu, nagranie rozmowy, pakiet PDF lub strumień wideo, tylko jeden z tych dwóch modeli może w ogóle przyjąć dane wejściowe, a 14-punktowa różnica w indeksie jest nieistotna, ponieważ drugi model nie może odpowiedzieć na pytanie.

Ta asymetria przesądza o większej liczbie rzeczywistych obciążeń niż tabele benchmarków. Przegląd wideo, analiza spotkań, transkrypcja audio wraz z rozumowaniem oraz przepływy pracy z dokumentami oparte na zeskanowanych plikach to przypadki, w których wszechstronność Gemini 3.1 Pro czyni go jedynym kandydatem na tej stronie. To także dlatego model pozostaje w produkcji od siedmiu miesięcy pod etykietą wersji zapoznawczej: obciążenia, które obsługuje, to te, w których nowszy model tekstowo-obrazowy nie może go wyprzeć.

W przypadku pracy z tekstem i obrazami rachunek się odwraca. Step 5 Preview ma 14 punktów przewagi w agregacie, jest około dwukrotnie szybszy pod względem ceny wejścia i 4,4 razy tańszy pod względem wyjścia, a odpowiada w jednej dwunastej czasu. W przypadku zadania polegającego na ekstrakcji dokumentów lub czacie na zrzutach ekranu nie ma powodu płacić wyższej ceny i czekać dodatkowych jedenastu sekund namysłu.

Gdzie ceny stają się mniej płaskie, niż to wygląda

Ceny podawane w nagłówkach nie oddają w pełni tej różnicy, a jej przyczyną jest granica progu, a nie stawka.

Stawki $2.00 i $12.00 modelu Gemini 3.1 Pro obowiązują do 200 000 tokenów wejściowych. Powyżej tej wartości obie stawki rosną do $4.00 i $18.00 — wzrost o 50% na wyjściu, który obejmuje całe żądanie, a nie tylko część przekraczającą granicę. Stawki $1.00 i $2.70 modelu Step 5 Preview nie mają opublikowanego progu; cena jest taka sama przy dowolnej długości, na jaką pozwala okno kontekstu.

Oba modele reklamują kontekst o rozmiarze 1 mln tokenów, więc oba zachęcają do budowania potoków długiego kontekstu. W przypadku jednego z nich żądanie o rozmiarze 300 000 tokenów kosztuje dwa razy więcej, niż sugeruje cennik; w przypadku drugiego nie. To przewaga strukturalna Step 5 Preview dokładnie w tej kategorii, dla której StepFun go stworzył — długoterminowej pracy agentowej z dużym, wielokrotnie przywoływanym kontekstem — a dodatkowo wzmacnia ją zniżka za pamięć podręczną, gdzie 95% dla Step 5 Preview w porównaniu z 90% dla Gemini 3.1 Pro jeszcze bardziej zwiększa różnicę w przypadku wzorca powtarzanego prefiksu, który produkuje pętla agentowa.

Obliczone z grubsza i oznaczone jako wartość wyliczona, a nie cytowana liczba: pętla agenta, która wysyła kontekst o rozmiarze 250 000 tokenów w każdej z czterdziestu tur, to dziesięć milionów tokenów wejściowych. Przy stawce Gemini 3.1 Pro dla kontekstu powyżej 200 tys. tokenów, gdy pamięć podręczna wchłania powtarzający się prefiks, to znaczący wzrost w stosunku do tego, co sugeruje stawka katalogowa 2,00 USD. W przypadku Step 5 Preview z jednolitą stawką 1,00 USD i głębszym rabatem na pamięć podręczną ta sama pętla kosztuje mniej i, co ważniejsze, kosztuje coś, co można przewidzieć z cennika bez uprzedniego czytania tabeli poziomów.

Generated two-column comparison scoreboard titled 'Step 5 Preview vs Gemini 3.1 Pro — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, price $1.00 / $2.70, cache discount 95%, time to first token 2.96s, context 1M tokens with no published output cap, and input text and image. The right column gives Gemini 3.1 Pro Preview the rows AA Index 30, price $2.00 / $12.00, $4.00 / $18.00 above 200K input, cache discount 90%, time to first token 35.72s, context 1M tokens with a max output of 65K, and input text, image, audio, video and file. A footer reads 'Both per Artificial Analysis Intelligence Index v4.3.2; Gemini ARC-AGI-2 and multimodal figures are vendor-reported.'

Dostępność to cicha różnica

Gemini 3.1 Pro można wywoływać od siedmiu miesięcy przez API Google, a co bardziej przydatne w planowaniu, przez wielu niezależnych dostawców — to właśnie sprawia, że wartość opóźnienia p50 jest znacząca, a nie anegdotyczna. Step 5 Preview otworzył swoje API 20 września i ma dokładnie jedno źródło. Endpoint oparty na jednym źródle, który istnieje od kilku dni, jest najmniej przewidywalnym komponentem, jaki można umieścić na ścieżce produkcyjnej — nie dlatego, że model jest zły, ale dlatego, że nikt jeszcze nie zna jego krzywej wydajności.

To jest argument za routingiem, a nie za wybieraniem. Gemini 3.1 Pro Preview jest w naszym katalogu w cenie 2,00 USD i 12,00 USD z progiem cenowym przekazanym bez zmian, a modele, z którymi jest porównywany, stoją obok niego, za jednym kluczem dla ponad 200 modeli, z cenami katalogowymi dostawców przekazywanymi bez marży (0%). Step 5 Preview nie ma na tej liście — działa na własnym API StepFun i dopóki wagi nie zostaną udostępnione, to jedyne miejsce, w którym działa. Automatyczne przełączanie awaryjne sprawia, że kilkudniowe preview można bezpiecznie wypróbować, a nie stawiać na nie jak na zakład: utrzymaj ścieżkę produkcyjną na modelu z ugruntowaną pozycją, kieruj masowe przetwarzanie tekstu i obrazów do Step 5 Preview, oceniając go na własnym ruchu, i pozwól, by fallback zadziałał, gdy endpoint preview zacznie działać gorzej. Dla modeli, które routujemy, nie ma drugiej umowy ani osobnego SDK, więc zmiana ceny Google pojawi się na Twoim rachunku jako aktualna kwota, a nie dopiero przy odnowieniu.

Screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview at www.orcarouter.ai/models/google/gemini-3.1-pro-preview, showing the model id google/gemini-3.1-pro-preview with Vision, Audio, Tools, JSON and Reasoning tags, a 1M-token context, a 65K max output and text output, input pricing of $2.00 and output pricing of $12.00 per million tokens, a p50 time to first token of 10.00 seconds, 109.7M tokens of traffic over seven days, and the endpoints and SDK snippets behind the OrcaRouter API.

Który tak naprawdę kupujesz?

Jeśli Twoja praca przychodzi w postaci wideo, audio lub plików, Gemini 3.1 Pro to jedyny model na tej stronie, który może je przyjąć, a luka w indeksie nie wchodzi w rachubę przy podejmowaniu decyzji. Siedem miesięcy w produkcji z wciąż dołączoną etykietą wersji zapoznawczej to sygnał stabilności, a nie ostrzeżenie: konwencja nazewnictwa się utrzymuje, ponieważ Google nigdy nie musiało jej zmieniać, a model zachowuje się jak produkcyjny koń roboczy, którym jest.

Jeśli Twoja praca to tekst i obrazy w dużej ilości, z dużym, powtarzającym się kontekstem, Step 5 Preview ma przewagę w każdym wskaźniku, który ma znaczenie — 14 punktów indeksu, połowa ceny wejścia, 4,4x tańsza stawka za wyjście, brak progu między poziomami, głębszy rabat na pamięć podręczną i czas do pierwszego tokenu mierzony w sekundach, a nie w pół minuty. To, co tam kupujesz, to kilkudniowy endpoint oparty na jednym źródle, bez opublikowanej licencji i bez opublikowanego limitu wyjściowego, co jest realnym, ale ograniczonym ryzykiem.

Nie indeks jest tu tym, na co trzeba uważać. Chodzi o to, czy StepFun opublikuje limit wyjściowy obok okna kontekstowego o rozmiarze 1 mln tokenów, bo ogłoszenie dostawcy milczy na ten temat, a osobna konfiguracja firm trzecich, która krążyła w czasie wycieku, wymieniała kontekst 350 000 przy limicie wyjściowym 64 000 — czyli produkt zasadniczo inny od tego z cennika. Pułap 65 tys. w Gemini 3.1 Pro, tak jak figuruje w naszym katalogu, też nie jest hojny, ale jest podany, a podany limit to taki, wokół którego można projektować.