
Step 5 Preview kontra Intern-S2 Mobius: Czy potrzebujesz flagowego modelu 600B, czy szybkiego modelu rozumującego 35B?
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 za 1 mln tokenów
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
Szczery powód, by porównywać Step 5 Preview z Intern-S2 Mobius nie polega na tym, że są podobne. Polega na tym, że są odpowiedziami na dwa różne pytania tego samego nabywcy — zespołu, który ma obciążenie związane z rozumowaniem do uruchomienia i nie ma ochoty kupować klastra. Należący do StepFun Step 5 Preview, ogłoszony 20 września 2026 roku, jest dużą odpowiedzią: około 600 miliardów parametrów łącznie, z czego 27 miliardów aktywnych, kontekst 1M tokenów, niezależnie zmierzony wynik Artificial Analysis Intelligence Index na poziomie 44 oraz opublikowana cena 1,00 USD za milion tokenów wejściowych i 2,70 USD za milion tokenów wyjściowych. Należący do InternLM Intern-S2 Mobius, wydany 29 lipca 2026 roku, jest małą odpowiedzią: model o 35 miliardach parametrów z otwartymi wagami, zbudowany na architekturze Mobius-v0, poddany ciągłemu pretreningowi z Qwen3.5-35B, którego głównym twierdzeniem nie jest zdolność, lecz szybkość — około 4x przyspieszenie end-to-end na benchmarkach rozumowania względem modelu bazowego, z którego był trenowany, bez jakiegokolwiek niezależnego wyniku benchmarkowego. Jeden to flagowiec, który wynajmujesz; drugi to mały model, który uruchamiasz. Porównanie tak naprawdę dotyczy tego, czy obciążenie, które masz przed sobą, w ogóle uzasadnia flagowca.
Jedna sprawa porządkowa przed liczbami, bo kosztuje ludzi realny czas: InternLM wydał kilka modeli pod szyldem Intern-S2 i nie są tym samym. Intern-S2-397B to naukowy multimodalny flagowiec; Intern-S2 Mobius to omawiany tutaj wydajny model rozumujący 35B; wcześniejsze wydanie Intern-S2 to znowu osobny model. Jeśli szukasz „Intern-S2” i trafiasz na tabele benchmarków dla modelu 397B, czytasz o innym checkpointcie.
Co każdy model faktycznie twierdzi
Deklaracje Step 5 Preview są typowe dla flagowca z 2026 roku, a jedna z nich została niezależnie zweryfikowana. StepFun podaje około 600 mld parametrów łącznie, z 27 mld aktywnych, wejście tekstowe i obrazowe, okno kontekstowe o rozmiarze 1 mln tokenów oraz cenę 1,00 USD/2,70 USD za milion tokenów wejściowych i wyjściowych. Artificial Analysis mierzy go na 44 w swoim Intelligence Index, powyżej mediany 26 dla porównywalnych modeli, z przepustowością wyjściową 87 tokenów na sekundę wobec średniej 78 oraz około 160 mln tokenów wyjściowych wygenerowanych w całym zestawie zadań indeksu wobec mediany 82 mln — mniej więcej dwukrotnie więcej niż typowy rozwlekły ślad, co ma znaczenie w modelu rozliczanym za tokeny wyjściowe.
Twierdzenie Intern-S2 Mobius ma charakter architektoniczny i jest węższe. Jego konstrukcja oddziela wiedzę od obliczeń: globalnie współdzielona Pamięć przechowuje wektory wiedzy, a wiele Rozumujących iteracyjnie odpytuje ją i dopracowuje stany ukryte względem niej, zamiast wiązać przechowywanie i obliczenia warstwa po warstwie, tak jak robi to konwencjonalny transformer. Deklarowaną korzyścią InternLM jest około 4-krotne przyspieszenie end-to-end w benchmarkach rozumowania w porównaniu z Qwen3.5-35B, od którego się wywodzi, przy porównywalnych lub lepszych wynikach rozumowania oraz krótszych widocznych łańcuchach myśli. Model jest na licencji Apache 2.0, przyjmuje tekst i obrazy na wejściu, i można go pobrać.
• Skala — Step 5 Preview: około 600B łącznie, 27B aktywnych według StepFun vs Intern-S2 Mobius: 35B łącznie.
• Niezależny wynik — Step 5 Preview: 44 w Artificial Analysis Intelligence Index w porównaniu z Intern-S2 Mobius: żaden nie został opublikowany przez żadną stronę trzecią.
• Szybkość — Step 5 Preview: 87 tokenów wyjściowych na sekundę wobec średniej 78, mierzone przez tablicę indeksu w porównaniu z Intern-S2 Mobius: „prawie 4x” względem własnego baseline’u Qwen3.5-35B, raportowane przez dostawcę i nieodtworzone.
• Okno kontekstowe — Step 5 Preview: 1 mln tokenów według StepFun vs Intern-S2 Mobius: nie opublikowano niezależnej wartości kontekstu.
• Cena — Step 5 Preview: 1,00 USD za wejście / 2,70 USD za wyjście za milion tokenów vs Intern-S2 Mobius: brak ceny API; płacisz za sprzęt.
• Licencja i dostęp — Step 5 Preview: zamknięta wersja podglądowa przez API dostawcy, wagi BF16 obiecane na 15 października 2026 r. vs Intern-S2 Mobius: wagi na licencji Apache 2.0 dostępne już teraz.
• Gadatliwość — Step 5 Preview: około 160 mln tokenów wyjściowych w całym zestawie indeksów wobec mediany 82 mln, zgodnie z tablicą indeksów w porównaniu z Intern-S2 Mobius: krótsze widoczne ślady rozumowania deklarowane przez InternLM, niezmierzone przez nikogo innego.
Twierdzenie o 4x i dlaczego jest to tutaj interesująca liczba
Przeczytaj liczby obu dostawców obok siebie, a rozbieżność jest oczywista: nagłówek StepFun to wynik w zakresie możliwości, a InternLM to mnożnik przepustowości. To nie przypadek i to najcenniejsza rzecz w tym porównaniu. Czterokrotne przyspieszenie end-to-end w zadaniach rozumowania, jeśli przetrwa zetknięcie z cudzym harnessem, jest warte więcej dla wdrożenia o dużym wolumenie niż kilka punktów w indeksie — zmienia arytmetykę uruchamiania tego obciążenia w ogóle. Intern-S2 Mobius celuje w zespoły, których wąskim gardłem jest liczba tokenów na sekundę na dolara, a nie szczytowe możliwości.
Zastrzeżenie jest takie, że mnożnik jest mierzony względem Qwen3.5-35B, modelu, na podstawie którego Intern-S2 Mobius był poddawany ciągłemu pretreningowi, a który nigdy nie przechodził treningu Mobius. To porównanie z jego własnym punktem wyjścia, a nie z konkurentem. Nie ma niezależnego odtworzenia twierdzenia o przepustowości, wyniku w indeksie stron trzecich ani opublikowanego okna kontekstowego od nikogo innego niż dostawca. Traktuj „prawie 4x” jako ciekawy sygnał architektoniczny i hipotezę do sprawdzenia na własnym stanowisku testowym, a nie jako specyfikację.
Step 5 Preview ma odwrotny profil dowodowy. Jego wskaźnik możliwości jest mierzony niezależnie; słabym ogniwem jest opowieść o wydajności. Odczyt gadatliwości z tablicy indeksu — około 160 milionów tokenów wyjściowych, podczas gdy model medianowy generuje około 82 milionów — to uczciwa przeciwwaga dla ceny wyjścia wynoszącej 2,70 dolara, a to oznacza, że obciążenie opierające się na długich, ustrukturyzowanych generacjach pochłonie istotnie więcej, niż sugeruje cena katalogowa. To, co jednak ma, a czego Intern-S2 Mobius nie ma, to w ogóle opublikowana cena API, i właśnie to czyni go w ogóle porównywalnym.
Repozytorium Hugging Face dla obiecanego builda dostawcy opowiada drugą połowę historii: tak wygląda wydanie open-weight, które zostało ogłoszone, ale jeszcze nie zostało dostarczone.

Gdzie kwestia śladu naprawdę daje się we znaki
Prawdziwą przewagą Intern-S2 Mobius nie jest jego wynik, którego nikt nie zmierzył, lecz to, ile kosztuje pomyłka na jego temat. Trzydzieści pięć miliardów parametrów to rozmiar, który zespół może obsłużyć na sprzęcie, który już posiada, ocenić bez zamówienia zakupu i porzucić bez odpisywania czegokolwiek. To przewaga strukturalna, której flagowiec nie może dorównać, niezależnie od tego, ile punktów zdobędzie, i właśnie dlatego to porównanie warto przeprowadzić, zamiast odrzucać je jako niedopasowanie.

Przewaga flagowca jest lustrzanym odbiciem. Kontekst 1M tokenów, wejście obrazowe i zmierzona zdolność do ogólnego rozumowania w Step 5 Preview obsługują zadania, których model 35B prawdopodobnie nie obsłuży dobrze, a wypróbowanie go przez cały czas trwania darmowego okna nic nie kosztuje — w październiku model był darmowy w trzech odrębnych środowiskach dla deweloperów. Żaden z tych faktów nie występuje w przypadku modelu hostowanego samodzielnie: nie ma darmowego tygodnia na uruchamianie własnych GPU i nie ma cennika, który zamieniłby tę decyzję w pozycję kosztową.
Jeśli chcesz, aby porównanie przetrwało poza okno promocyjne, tym, co należy zbudować, jest harness, a nie preferencja. OrcaRouter kieruje ponad 200 modelami za jednym kluczem API i jednym rachunkiem przy 0% marży, z przekazywaną dalej ceną katalogową dostawcy, z automatycznym przełączaniem awaryjnym oraz DSL routingu do sterowania ruchem według kosztu, opóźnienia lub możliwości. Ani Step 5 Preview, ani Intern-S2 Mobius nie znajdują się w tym katalogu — flagowy model StepFun nie jest przez nas kierowany, a Intern-S2 Mobius to model do samodzielnego hostowania — więc wartość tutaj nie polega na dostępie do któregokolwiek z nich. Polega ona na tym, że modele, z którymi będziesz je porównywać, są w zasięgu jednego klucza, a decyzja podjęta na podstawie pomiarów podąża za dowodami, a nie za wpisem na blogu o premierze.

Jak podjąć decyzję
Jeśli Twoje obciążenie jest agentowe, multimodalne, długokontekstowe lub otwarte — takie, w którym nie możesz z góry wyliczyć zadań — flagowy model jest odpowiedzią, a Step 5 Preview to rozsądna jego instancja: mierzalna, wyceniona, tania w pilotażu i odwracalna za token. Po prostu zaplanuj budżet na rozwlekłość, a nie na stawkę nagłówkową.
Jeśli Twoje obciążenie to wąskie, powtarzalne, masowe wnioskowanie na danych, które muszą pozostać w obrębie Twojego perymetru, mały model jest odpowiedzią, a Intern-S2 Mobius jest autentycznym kandydatem właśnie dlatego, że jest mały: działa na sprzęcie, który masz, jest na licencji Apache 2.0, a twierdzenie o szybkości, jeśli się potwierdzi, jest tym rodzajem rzeczy, który rozstrzyga kwestię ekonomiki jednostkowej. Przystępuj do tego ze świadomością, że testujesz twierdzenie dostawcy, a nie przejmujesz cudzy werdykt.
Błędem jest traktowanie tego wyboru jako trwałego. Najpierw kup ewaluację małego modelu, bo to tani eksperyment; wynajmij model flagowy do zadań, z którymi mały model sobie nie radzi, bo to tania naprawa. Zespoły, które utrzymują obie opcje na tym samym kluczu i w tym samym harnessie, podejmują tę decyzję na podstawie własnych danych — i to jedyna wersja tej decyzji, która się broni, gdy którykolwiek z dostawców wypuści następcę.
