
Step 5 Preview vs Intern-S2 Mobius: Heb je een 600B-vlaggenschip nodig, of een snelle 35B-reasoner?
- OrcaNIEUWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 mln tokens
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
De eerlijke reden om Step 5 Previewmet Intern-S2 Mobiuste vergelijken is niet dat ze op elkaar lijken. Het is dat ze antwoorden zijn op twee verschillende vragen van dezelfde koper — het team dat een reasoningworkload moet draaien en geen behoefte heeft om een cluster te kopen. StepFuns Step 5 Preview, aangekondigd op 20 september 2026, is het grote antwoord: ongeveer 600 miljard totale parameters met 27 miljard actieve, een context van 1M tokens, een onafhankelijk gemeten score van 44 op de Artificial Analysis Intelligence Index, en een gepubliceerde prijs van $1,00 per miljoen inputtokens en $2,70 per miljoen outputtokens. InternLMs Intern-S2 Mobius, uitgebracht op 29 juli 2026, is het kleine antwoord: een open-weight model met 35 miljard parameters, gebouwd op de Mobius-v0-architectuur, continu voorgetraind vanaf Qwen3.5-35B, waarvan de centrale claim niet capaciteit maar snelheid is — ruwweg een 4x end-to-end speedup op reasoningbenchmarks ten opzichte van de baseline waarop het is getraind, zonder enige onafhankelijke benchmarkscore van welke aard dan ook. Het ene is een vlaggenschip dat je huurt; het andere is een klein model dat je draait. De vergelijking draait er echt om of de workload die voor je ligt het vlaggenschip überhaupt rechtvaardigt.
Eerst nog een huishoudelijke mededeling voordat we bij de cijfers komen, want het kost mensen echt tijd: InternLM heeft meerdere modellen uitgebracht onder de noemer Intern-S2, en die zijn niet hetzelfde. Intern-S2-397B is het wetenschappelijke multimodale vlaggenschip; Intern-S2 Mobius is het efficiënte 35B-redeneermodel dat hier wordt besproken; een eerdere Intern-S2-release is weer een apart model. Als je zoekt naar "Intern-S2" en terechtkomt bij benchmarktabellen voor een 397B-model, dan lees je over een andere checkpoint.
Wat elk model daadwerkelijk beweert
De claims van Step 5 Preview zijn de conventionele claims voor een 2026-flagship, en één ervan wordt onafhankelijk gecontroleerd. StepFun vermeldt ongeveer 600B totale parameters met 27B actief, tekst- en beeldinvoer, een contextvenster van 1M tokens en een prijs van $1,00/$2,70 per miljoen invoer- en uitvoertokens. Artificial Analysis meet het op 44 op zijn Intelligence Index, boven een mediaan van 26 voor vergelijkbare modellen, met uitvoer van 87 tokens per seconde tegen een gemiddelde van 78 en ongeveer 160 miljoen gegenereerde uitvoertokens over de index-taaksuite tegen een mediaan van 82 miljoen — ruwweg het dubbele van de typische uitvoerige voetafdruk, wat van belang is bij een model dat per uitvoer wordt gefactureerd.
De bewering van Intern-S2 Mobius is architecturaal en beperkter. Het ontwerp scheidt kennis van berekening: een globaal gedeeld Memory bevat kennisvectoren, en meerdere Reasoners bevragen deze iteratief en verfijnen verborgen toestanden ertegen, in plaats van opslag en berekening laag voor laag te binden zoals een conventionele transformer doet. Het door InternLM genoemde voordeel is een ruwweg 4x end-to-end versnelling op redeneerbenchmarks ten opzichte van de Qwen3.5-35B waarvan het afstamt, met vergelijkbare of sterkere redeneerscores, plus kortere zichtbare gedachteketens. Het model is Apache 2.0, tekst- en beeldinvoer, en het is te downloaden.
• Schaal — Step 5 Preview: ongeveer 600 miljard totaal, 27 miljard actief per StepFun vs Intern-S2 Mobius: 35 miljard totaal.
• Onafhankelijke score — Step 5 Preview: 44 op de Artificial Analysis Intelligence Index versus Intern-S2 Mobius: geen enkele door een derde partij gepubliceerd.
• Snelheid — Step 5 Preview: 87 outputtokens per seconde tegen een gemiddelde van 78, gemeten door de index board vs Intern-S2 Mobius: "bijna 4x" tegen zijn eigen Qwen3.5-35B-baseline, door de leverancier gerapporteerd en niet gereproduceerd.
• Contextvenster — Step 5 Preview: 1 miljoen tokens per StepFun vs Intern-S2 Mobius: geen onafhankelijk cijfer voor het contextvenster gepubliceerd.
• Prijs — Step 5 Preview: $1,00 in / $2,70 uit per miljoen tokens vs Intern-S2 Mobius: geen API-prijs; je betaalt voor de hardware.
• Licentie en toegang — Step 5 Preview: besloten preview via de API van de leverancier, BF16-gewichten beloofd voor 15 oktober 2026 vs. Intern-S2 Mobius: Apache 2.0-gewichten nu beschikbaar.
• Uitvoerigheid — Step 5 Preview: ongeveer 160M outputtokens in de hele indexsuite tegenover een mediaan van 82M, volgens het indexboard versus Intern-S2 Mobius: kortere zichtbare redeneersporen geclaimd door InternLM, door niemand anders gemeten.
De 4x-bewering, en waarom dat hier het interessante getal is
Lees de cijfers van de twee leveranciers naast elkaar en de mismatch is overduidelijk: het cijfer dat StepFun vooraan zet, is een capaciteitsscore; dat van InternLM is een doorvoervermenigvuldiger. Dat is geen toeval, en het is het nuttigste gegeven in deze vergelijking. Een 4x end-to-end versnelling bij redeneertaken is, als die contact met het testharnas van iemand anders overleeft, voor een deployment met een hoog volume meer waard dan een paar punten op een index — het verandert de rekensom van het überhaupt draaien van de workload. Intern-S2 Mobius richt zich op teams voor wie de bottleneck tokens per seconde per dollar is, niet het capaciteitsplafond.
De kanttekening is dat de vermenigvuldigingsfactor wordt gemeten ten opzichte van Qwen3.5-35B, het model waarop Intern-S2 Mobius continu is voorgetraind en dat nooit de Mobius-training heeft ondergaan. Dat is een vergelijking met zijn eigen startpunt in plaats van met een concurrent. Er is geen onafhankelijke reproductie van de doorvoerclaim, geen indexscore van derden, en geen gepubliceerd contextvenster van iemand anders dan de leverancier. Beschouw "bijna 4x" als een interessant architectonisch signaal en een hypothese om op je eigen testomgeving te testen, niet als een specificatie.
Step 5 Preview heeft het tegenovergestelde bewijsprofiel. Het capaciteitsgetal is onafhankelijk gemeten; het efficiëntieverhaal is het zwakke punt. De verbositeitsmeting van het indexbord — ongeveer 160 miljoen outputtokens, waar het mediane model ongeveer 82 miljoen produceert — is het eerlijke tegenwicht voor een outputprijs van $2,70, en het betekent dat een workload die leunt op lange gestructureerde generaties aanzienlijk meer zal uitgeven dan het prijskaartje suggereert. Wat het wel heeft en Intern-S2 Mobius niet, is überhaupt een gepubliceerde API-prijs, en dat is juist wat het in de eerste plaats vergelijkbaar maakt.
De Hugging Face-repository voor de beloofde leveranciersbuild vertelt de andere helft van het verhaal: dit is hoe een open-weight release eruitziet wanneer die is aangekondigd maar nog niet is uitgebracht.

Waar de voetafdrukvraag echt pijn doet
Het echte voordeel van Intern-S2 Mobius is niet zijn score, die niemand heeft gemeten, maar wat het kost om ernaast te zitten. Vijfendertig miljard parameters is een omvang die een team kan serveren op hardware die het al bezit, kan evalueren zonder een inkooporder, en kan laten varen zonder iets af te schrijven. Dat is een structureel voordeel dat het vlaggenschip niet kan evenaren, ongeacht hoeveel punten het scoort, en het is de reden dat deze vergelijking de moeite waard is, in plaats van haar als een mismatch af te doen.

Het voordeel van het vlaggenschip is het spiegelbeeld. De 1M-token context, beeldinvoer en gemeten algemene redeneervermogen van Step 5 Preview bestrijken werk dat een 35B-model waarschijnlijk niet goed aankan, en het kost niets om het te proberen gedurende een gratis venster — het model was in oktober gratis in drie afzonderlijke ontwikkelaarsomgevingen. Geen van die feiten geldt voor een zelfgehost model: er is geen gratis week voor het draaien van je eigen GPU's, en er is geen prijslijst die de beslissing omzet in een regelitem.
Als je wilt dat de vergelijking voorbij het promotievenster blijft bestaan, is wat je moet bouwen een testharnas in plaats van een voorkeur. OrcaRouter routeert meer dan 200 modellen achter één API-sleutel en één factuur met 0% opslag, waarbij de lijstprijs van de provider wordt doorgegeven, met automatische failover en een routerings-DSL om verkeer te sturen op kosten, latentie of capaciteit. Noch Step 5 Preview noch Intern-S2 Mobius staat in die catalogus — het vlaggenschip van StepFun wordt niet door ons gerouteerd en Intern-S2 Mobius is een self-hostdownload — dus de waarde hier is niet toegang tot een van beide. Het is dat de modellen waarmee je ze gaat benchmarken op één sleutel afstand staan, en dat een beslissing die op meting is gebaseerd meebeweegt met het bewijs in plaats van met een lanceringsblogpost.

Hoe te beslissen
Als je workload agentisch, multimodaal, long-context of open-ended is — het soort waarbij je de taken niet vooraf kunt opsommen — dan is het vlaggenschip het antwoord, en Step 5 Preview is een redelijk voorbeeld daarvan: afgewogen, geprijsd, goedkoop om te piloten, en per token omkeerbaar. Reken gewoon op de breedsprakigheid in plaats van op het geadverteerde tarief.
Als je workload bestaat uit beperkt, repetitief redeneerwerk met een hoog volume op data die binnen je perimeter moet blijven, dan is het kleine model het antwoord, en Intern-S2 Mobius is een echte kandidaat, juist omdat het klein is: het draait op hardware die je al hebt, het is Apache 2.0, en de snelheidsclaim is, als die standhoudt, precies het soort ding dat een vraag over unit economics beslecht. Ga er met de wetenschap in dat je de claim van de leverancier test in plaats van het oordeel van iemand anders over te nemen.
De fout is de keuze als permanent te behandelen. Koop eerst de evaluatie van het kleine model, want dat is het goedkope experiment; huur het topmodel voor de taken waarin het kleine model faalt, want dat is de goedkope reparatie. Teams die beide opties levend houden op dezelfde sleutel en hetzelfde harnas, nemen deze beslissing uiteindelijk met hun eigen data, en dat is de enige versie ervan die standhoudt wanneer een van beide leveranciers een opvolger uitbrengt.
