
Steg 5 Preview vs Intern-S2 Mobius: Behöver du en 600B flaggskeppsmodell, eller en snabb 35B-resonemangsmotor?
- OrcaNYOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1M tokens
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
Det ärliga skälet att jämföra Step 5 Preview med Intern-S2 Mobius är inte att de är lika. Det är att de är svar på två olika frågor från samma köpare – teamet som behöver köra en arbetsbelastning för resonemang och inte har någon lust att köpa ett kluster. StepFuns Step 5 Preview, som tillkännagavs den 20 september 2026, är det stora svaret: ungefär 600 miljarder totala parametrar med 27 miljarder aktiva, en kontext på 1M tokens, en oberoende uppmätt poäng på 44 i Artificial Analysis Intelligence Index och ett publicerat pris på 1,00 USD per miljon indata-tokens och 2,70 USD per miljon utdata-tokens. InternLMs Intern-S2 Mobius, som släpptes den 29 juli 2026, är det lilla svaret: en modell med öppna vikter på 35 miljarder parametrar byggd på Mobius-v0-arkitekturen, kontinuerligt förtränad från Qwen3.5-35B, vars centrala påstående inte är kapacitet utan hastighet – ungefär 4x snabbare från början till slut på benchmarks för resonemang jämfört med baslinjen den tränades från, utan någon som helst oberoende benchmarkpoäng. Den ena är ett flaggskepp du hyr; den andra är en liten modell du kör. Jämförelsen handlar egentligen om huruvida arbetsbelastningen framför dig över huvud taget motiverar flaggskeppet.
En praktisk detalj före siffrorna, eftersom det kostar folk verklig tid: InternLM har släppt flera modeller under Intern-S2-paraplyet, och de är inte samma sak. Intern-S2-397B är det vetenskapliga multimodala flaggskeppet; Intern-S2 Mobius är den effektiva 35B-resoneraren som diskuteras här; en tidigare Intern-S2-utgåva är återigen en separat modell. Om du söker efter "Intern-S2" och hamnar på benchmark-tabeller för en 397B-modell, läser du om en annan checkpoint.
Vad varje modell faktiskt påstår
Step 5 Previews påståenden är de konventionella för en flaggskeppsmodell från 2026, och ett av dem är oberoende verifierat. StepFun anger cirka 600B totala parametrar varav 27B aktiva, text- och bildinmatning, ett kontextfönster på 1M tokens och ett pris på 1,00 $/2,70 $ per miljon in- och uttoken. Artificial Analysis mäter den till 44 på sitt Intelligence Index, över medianen på 26 för jämförbara modeller, med utdata på 87 tokens per sekund mot ett genomsnitt på 78 och omkring 160 miljoner genererade uttoken över indexets uppgiftssvit mot en median på 82 miljoner – ungefär dubbelt så mycket som den typiska ordrika omfattningen, vilket har betydelse för en modell som faktureras per utdata.
Intern-S2 Mobius påstående är arkitektoniskt och snävare. Dess design separerar kunskap från beräkning: ett globalt delat Memory håller kunskapsvektorer, och flera Reasoners frågar och förfinar iterativt dolda tillstånd mot det, i stället för att binda lagring och beräkning lager för lager så som en konventionell transformer gör. InternLM:s angivna vinst är ungefär 4x snabbare end-to-end på resonemangsbenchmarks jämfört med Qwen3.5-35B som den härstammar från, med jämförbara eller starkare resonemangspoäng, plus kortare synliga tankekedjor. Modellen är Apache 2.0, text- och bildinmatning, och den går att ladda ner.
• Skala — Step 5 Preview: cirka 600B totalt, 27B aktiva per StepFun mot Intern-S2 Mobius: 35B totalt.
Oberoende poäng — Step 5 Preview: 44 i Artificial Analysis Intelligence Index jämfört med Intern-S2 Mobius: ingen har publicerats av någon tredje part.
• Hastighet – Steg 5-förhandsvisning: 87 utdatatoken per sekund mot ett genomsnitt på 78, mätt av index-tavlan jämfört med Intern-S2 Mobius: "nästan 4x" mot dess egen Qwen3.5-35B-baslinje, leverantörsrapporterat och oreproducerat.
• Kontextfönster — Step 5 Preview: 1M tokens enligt StepFun jämfört med Intern-S2 Mobius: ingen oberoende kontextsiffra publicerad.
• Pris — Step 5 Preview: $1,00 in / $2,70 ut per miljon tokens jämfört med Intern-S2 Mobius: inget API-pris; du betalar för hårdvaran.
• Licens och åtkomst — Step 5 Preview: stängd förhandsversion via leverantörens API, BF16-vikter utlovade till 15 oktober 2026 mot Intern-S2 Mobius: Apache 2.0-vikter tillgängliga nu.
• Verbositet — Steg 5-förhandsvisning: cirka 160M utdatatoken i indexsviten mot en median på 82M, enligt indexpanelen vs Intern-S2 Mobius: kortare synliga resonemangsspår som InternLM hävdar, ej uppmätta av någon annan.
4x-påståendet, och varför det är det intressanta talet här
Läs de två leverantörernas siffror sida vid sida, och missmatchningen är uppenbar: StepFuns huvudsiffra är en kapacitetspoäng, InternLMs är en genomströmningsmultiplikator. Det är ingen slump, och det är det mest användbara i den här jämförelsen. En 4x end-to-end-snabbhetsökning på resonemangsuppgifter, om den överlever mötet med någon annans testramverk, är värd mer för en driftsättning i hög volym än några poäng på ett index – den förändrar kalkylen för att alls köra arbetsbelastningen. Intern-S2 Mobius riktar sig till team vars flaskhals är tokens per sekund per dollar, inte kapacitetstaket.
Förbehållet är att multiplikatorn mäts mot Qwen3.5-35B, modellen som Intern-S2 Mobius kontinuerligt förtränades utifrån och som aldrig fick Mobius-träningen. Det är en jämförelse mot dess egen utgångspunkt snarare än mot en rival. Det finns ingen oberoende reproduktion av genomströmningspåståendet, ingen poäng från tredjepartsindex och inget publicerat kontextfönster från någon annan än leverantören. Behandla "nästan 4x" som en intressant arkitektonisk signal och en hypotes att testa i din egen testmiljö, inte som en specifikation.
Step 5 Preview har den motsatta bevisprofilen. Dess kapacitetssiffra mäts oberoende; dess effektivitetsberättelse är den svaga delen. Indexbrädans verbositetsmätning – omkring 160 miljoner utdatatokens där medianmodellen genererar omkring 82 miljoner – är den ärliga motvikten till ett utpris på 2,70 dollar, och det innebär att en arbetsbelastning som lutar sig mot långa strukturerade genereringar kommer att kosta väsentligt mer än vad prislappen antyder. Det den däremot har som Intern-S2 Mobius inte har är ett publicerat API-pris överhuvudtaget, vilket är det som gör den jämförbar från första början.
Hugging Face-repot för det utlovade leverantörsbygget berättar den andra halvan av historien: så här ser ett släpp med öppna vikter ut när det har annonserats men ännu inte levererats.

Där fotavtrycksfrågan faktiskt biter
Intern-S2 Mobius verkliga fördel är inte dess poäng, som ingen har mätt, utan vad det kostar att ha fel om. Trettiofem miljarder parametrar är en storlek som ett team kan köra på hårdvara det redan äger, utvärdera utan en inköpsorder och överge utan att skriva av något. Det är en strukturell fördel som flaggskeppet inte kan matcha oavsett hur många poäng det får, och det är anledningen till att den här jämförelsen är värd att göra i stället för att avfärda som en ojämn matchning.

Flaggskeppets fördel är spegelbilden. Step 5 Previews 1M-tokenkontext, bildinmatning och uppmätta generella resonemangsförmåga täcker arbete som en 35B-modell sannolikt inte klarar av väl, och det kostar inget att prova under en gratisperiod – modellen har varit gratis i tre separata utvecklarytor under oktober. Inget av dessa fakta är tillgängliga för en självhostad modell: det finns ingen gratisvecka för att köra dina egna GPU:er, och det finns ingen prislista som omvandlar beslutet till en kostnadsrad.
Om du vill att jämförelsen ska överleva förbi kampanjperioden är det du bör bygga en testrigg snarare än en preferens. OrcaRouter routar fler än 200 modeller bakom en enda API-nyckel och en enda faktura till 0 % påslag, med leverantörens listpris vidarefakturerat, med automatisk failover och en routing-DSL för att styra trafik efter kostnad, latens eller kapacitet. Varken Step 5 Preview eller Intern-S2 Mobius finns i den katalogen — StepFuns flaggskepp routas inte av oss och Intern-S2 Mobius är en nedladdning för självhosting — så värdet här är inte åtkomst till någon av dem. Det är att modellerna som du kommer att benchmarka dem mot är bara en nyckel bort, och ett beslut fattat utifrån mätning rör sig med bevisen i stället för med ett lanseringsblogginlägg.

Hur man bestämmer
Om din arbetsbelastning är agentisk, multimodal, långkontextuell eller öppen – den typ där du inte kan räkna upp uppgifterna i förväg – är flaggskeppet svaret, och Step 5 Preview är en rimlig instans av det: avvägd, prissatt, billig att pilottesta och reversibel per token. Budgetera bara för ordrikedomen i stället för det annonserade priset.
Om din arbetsbelastning utgörs av smalt, repetitivt resonemang i hög volym om data som måste stanna inom din perimeter, är den lilla modellen svaret, och Intern-S2 Mobius är en genuin kandidat just för att den är liten: den körs på hårdvara du har, den är Apache 2.0, och hastighetspåståendet, om det håller, är den typ av sak som avgör en fråga om enhetskonomi. Gå in med vetskapen att du testar leverantörens påstående i stället för att ärva någon annans utlåtande.
Misstaget är att behandla valet som permanent. Köp först utvärderingen av den lilla modellen, eftersom det är det billiga experimentet; hyr flaggskeppsmodellen för de uppgifter där den lilla modellen misslyckas, eftersom det är den billiga reparationen. Team som håller båda alternativen vid liv på samma nyckel och i samma testrigg fattar till slut det här beslutet utifrån sina egna data, och det är den enda versionen av det som håller när någon av leverantörerna släpper en efterträdare.
