
Intern-S2-397B vs Grok 4.6: Wie mag er aan de knoppen draaien?
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Intern-S2-397B en Grok 4.6 werden ongeveer een maand na elkaar uitgebracht en beantwoorden dezelfde onderliggende vraag op tegengestelde manieren: wie mag het redeneren aansturen. Grok 4.6, het xAI-vlaggenschip dat op 12 augustus 2026 live ging, verkoopt je een draaiknop — een configureerbare regeling voor redeneerinspanning op een gesloten API met een prijs van $2,00 per miljoen invoertokens en $6,00 per miljoen uitvoertokens, met een venster van 500.000 tokens en xAI's server-side tools die apart worden gefactureerd. Intern-S2-397B, het wetenschappelijke multimodale model met 403 miljard parameters dat het InternLM-team van Shanghai AI Laboratory op 13 september onder Apache-2.0 uitbracht, geeft je de hele machine — gewichten, denkschakelaar, visiepad, time-series-head — en verwacht dat je die zelf draait. De een huur je met knoppen; de ander is volledig eigendom. De vergelijking die hier telt is niet welke hoger scoort op een benchmarktabel; het is welk soort controle je workload echt nodig heeft, en wat elk soort kost.
Twee verschillende wijzerplaten
De duidelijkste manier om deze twee uit elkaar te houden, is kijken naar waar de redeneerinstellingen zitten. Grok 4.6 biedt via de API van xAI een instelling voor redeneerinspanning, en daaromheen zit een suite van server-side tools — functieaanroepen, webzoekopdrachten, X-zoekopdrachten, code-uitvoering — die xAI beheert en afzonderlijk factureert. Je stemt de inspanning af, je schakelt de tools die het je geeft aaneen, en je raakt nooit een gewicht aan. Het gedrag van het model is eigendom van xAI en xAI's probleem; jouw hefboom is een parameter in de request.
Intern-S2-397B geeft je een andere set hendels, en ze zitten lager in de stack. Redeneren staat standaard aan en je schakelt het per verzoek uit met enable_thinking=False. Omdat het model onder Apache-2.0 valt, kun je ook de gewichten nemen en het redeneergedrag zelf fine-tunen op je eigen data, en het resultaat vervolgens serveren op LMDeploy, vLLM of SGLang. Het invoeroppervlak is breder dan dat van een tekst-en-afbeeldings-API: het accepteert tijdreekssignalen en produceert voorspellingen, een mogelijkheid die momenteel alleen via LMDeploy beschikbaar is, en het is getraind voor langdurig agentwerk in sandboxomgevingen. De afweging is even duidelijk — dat niveau van controle is alleen zinvol als je bereid bent de hardware en de servingstack die daarbij horen te beheren.
• Redeneerbeheersing — Grok 4.6: regelaar voor redeneerinspanning op een gesloten API vs Intern-S2-397B: enable_thinking-schakelaar plus volledige controle op gewichtsniveau onder Apache-2.0.
• Tools — Grok 4.6: xAI's zoekopdracht op het web aan de serverzijde, X-zoekopdracht en code-uitvoering, afzonderlijk gefactureerd vs Intern-S2-397B: tool calling die je zelf aansluit, plus een route voor tijdreeksvoorspelling via LMDeploy.
• Invoer — Grok 4.6: tekst, afbeelding, bestand vs Intern-S2-397B: tekst, afbeelding, tijdreeksen.
• Context — Grok 4.6: 500.000 tokens vs Intern-S2-397B: 256K tekstredenering, 64K multimodaal, beide cijfers uit de modelkaart.
• Prijs — Grok 4.6: $2,00 / $6,00 per 1M, met staffeling naar $4,00 / $12,00 boven 200K tokens vs. Intern-S2-397B: geen tariefkaart; zelf hosten of de officiële Intern API.
Wat de cijfers daadwerkelijk omvatten
Elke Intern-S2-397B-score hieronder is van InternLM zelf, uitgevoerd via OpenCompass, VLMEvalKit en AgentCompass en samen met de gewichten gepubliceerd zonder onafhankelijke reproductie. De cijfers van Grok 4.6 zijn iets anders: ze zijn verzameld via de publieke arena en Artificial Analysis nadat het model live ging, dus ze dragen een label van een derde partij.
Aan de onafhankelijk gemeten kant staat Grok 4.6 op 44 in de huidige Artificial Analysis Intelligence Index, met een GPQA Diamond van 94,9, een Humanity's Last Exam van 61,0 en een codeerscore van 76,8, en Artificial Analysis schat zijn TerminalBench 2.1-cijfer op bijna 80,3. Aan de leverancierskant rapporteert de kaart van Intern-S2-397B 89,77 op MMLU Pro, 93,56 op HMMT-2026, 81,68 op MMMU Pro en 68,54 op SWE-bench-Pro, naast wetenschappelijke rijen waarin het op een andere soort lijkt: 55,71 op Biology-Instructions, 63,28 op SciReasoner 1.5, 53,95 op Mol-Instructions, 62,35 op MolecularIQ. Het ene cijfer in de leverancierstabel dat een agentbouwer zou moeten laten terugschrikken, is TerminalBench 2.1 met 64,04 — een cijfer waarvan de makers van het model zelf melden dat het met een ruime marge verliest van een oudere gesloten generatie, precies het terminal-werkdomein waarin een gehuurd frontier-model als Grok 4.6 het sterkst is.
Lees die splitsing als een portret, niet als een rangschikking. Intern-S2-397B is een wetenschappelijke specialist die een competente generalist is; Grok 4.6 is een generalist met een oppervlakkige belangstelling voor wetenschap. Dat de wetenschappelijke rijen scheef uitvallen, is te verwachten — geen enkel generalist-vlaggenschip is vooraf getraind op ruwe pagina's wetenschappelijke literatuur met figuren, lay-out en symbolische notatie tegelijk, en dat is precies het paradigma waarop Intern-S2-397B is gebouwd. Niets in de ene of de andere bewijsbasis ondersteunt "Intern-S2-397B is net zo goed als Grok 4.6 in willekeurig redeneren", en niets in het bewijs voor Grok 4.6 wijst erop dat het is afgestemd op multi-omics-sequentieanalyse.
De prijs van controle
Grok 4.6 heeft een prijs die je in een spreadsheet kunt zetten: $2,00 per miljoen inputtokens en $6,00 per miljoen output, waarbij het tarief stijgt naar $4,00 / $12,00 zodra een prompt 200.000 tokens overschrijdt, plus een optionele prioriteitslaag voor snellere reacties. Het is beschikbaar via OrcaRouter tegen xAI's lijstprijs, doorgegeven met 0% opslag, dus een tariefwijziging bij xAI komt hier dezelfde dag door zonder tussenpersoonmarge — de knop die je huurt blijft geprijsd zoals de leverancier hem prijst.
Intern-S2-397B heeft helemaal geen gepubliceerd tarief per token. De modelkaart verwijst naar een officiële Intern API, maar de economie die men eigenlijk wil vergelijken, is die van self-hosting: een checkpoint van 403B parameters, ongeveer 807 GB aan gewichten verdeeld over 188 shards in BF16, dus een serieuze multi-GPU-node, waarbij de FP8-build de voetafdruk ruwweg halveert. Als je die capaciteit al bezit, naderen de marginale kosten van de volgende wetenschappelijke query de elektriciteitskosten, en dat is precies het hele punt van de Apache-2.0-positie. Als je die niet bezit, is het "gratis" model een pilot voor kapitaaluitgaven, geen regelpost.
Wat een router in deze specifieke match-up oplevert, is de naad, niet de prijs. Grok 4.6 draait op de sleutel die je al hebt voor algemeen productieverkeer; Intern-S2-397B wordt niet via OrcaRouter gerouteerd — het is een gloednieuw checkpoint, en je pad ernaartoe is de eigen API van de leverancier of een self-hosted deployment. Leid het algemene, latentiegevoelige redeneerwerk naar het model met verbruiksmetering, houd het wetenschappelijke batchwerk op het model dat je zelf draait, en laat automatische failover je opvangen wanneer de endpoint aan een van beide kanten ongezond is. De grens tussen beide wordt een routeringsregel in plaats van een tweede integratie.

Welke moet je kiezen?
Kies Grok 4.6 wanneer de taak algemeen is, de redenering snel en correct moet terugkomen, en je geen eigenaar wilt zijn van de stack die dat produceert. Het 500K-venster, de gemeten GPQA Diamond van 94,9 en de toolsuite zijn kenmerken voor productie, en de $2/$6-meter is wat je betaalt omdat je niets zelf hoeft te draaien.
Kies Intern-S2-397B wanneer de invoer wetenschappelijk is — een artikel met veel figuren, een molecuuldiagram, een tijdreekssignaal — en wanneer het redeneren moet gebeuren op data die je omgeving niet kunnen verlaten, of op gedrag dat je zelf wilt fine-tunen. Apache-2.0 maakt dat mogelijk; geen enkele gehuurde API doet dat. Begroot de hardware, verwacht voorlopig geen onafhankelijk scorebord, en behandel elk getal op zijn kaart als een bewering totdat iemand buiten InternLM er een reproduceert.


