
Intern-S2-397B vs Grok 4.6: Vem får skruva på knopparna
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Intern-S2-397B och Grok 4.6 släpptes ungefär en månad isär och besvarar samma underliggande fråga på motsatta sätt: vem som får styra resonemanget. Grok 4.6, xAI:s flaggskepp som lanserades den 12 augusti 2026, säljer dig en ratt – en konfigurerbar kontroll för resonemangsansträngning i ett slutet API prissatt till $2.00 per miljon indatatokens och $6.00 per miljon utdatatokens, med ett fönster på 500 000 tokens och xAI:s verktyg på serversidan som debiteras utöver det. Intern-S2-397B, den 403 miljarder parametrar stora vetenskapliga multimodala modellen som Shanghai AI Laboratorys InternLM-team släppte under Apache-2.0 den 13 september, ger dig hela maskinen – vikter, tänkande-reglage, visionsväg, tidsseriehuvud – och förväntar sig att du kör den själv. Den ena hyrs med rattar; den andra ägs helt och hållet. Jämförelsen som spelar roll här är inte vilken som får högre poäng i en benchmarktabell; det är vilken typ av kontroll din arbetsbelastning faktiskt behöver, och vad varje typ kostar.
Två olika urtavlor
Det tydligaste sättet att skilja dessa två åt är att titta på var resonemangskontrollerna finns. Grok 4.6 exponerar en inställning för resonemangsansträngning via xAI:s API, och runt den finns en uppsättning verktyg på serversidan – funktionsanrop, webbsökning, X-sökning, kodkörning – som xAI driver och fakturerar separat. Du justerar ansträngningen, du kedjar samman verktygen den ger dig, och du rör aldrig en vikt. Modellens beteende är xAI:s egendom och xAI:s problem; din spak är en parameter i begäran.
Intern-S2-397B ger dig en annan uppsättning reglage, och de ligger längre ned i stacken. Tänkandet är aktiverat som standard och du stänger av det per begäran med enable_thinking=False. Eftersom modellen är Apache-2.0 kan du också ta vikterna och finjustera själva resonemangsbeteendet på dina egna data och sedan servera resultatet på LMDeploy, vLLM eller SGLang. Dess indatayta är bredare än ett text-och-bild-API: den tar emot tidsseriesignaler och producerar prognoser, en kapacitet som för närvarande endast är kopplad via LMDeploy, och den tränades för långsiktigt agentarbete i sandlådemiljöer. Avvägningen är lika tydlig – den nivån av kontroll är bara meningsfull om du är beredd att driva hårdvaran och serveringsstacken som följer med den.
• Styrning av resonemang — Grok 4.6: reglage för resonemangsansträngning i ett slutet API mot Intern-S2-397B: enable_thinking-växling plus full kontroll på viktnivå under Apache-2.0.
• Verktyg — Grok 4.6: xAIs webbsökning på serversidan, X-sökning och kodexekvering, faktureras separat jämfört med Intern-S2-397B: verktygsanrop som du själv kopplar upp, plus en väg för tidsserieprognoser via LMDeploy.
• Indata — Grok 4.6: text, bild, fil mot Intern-S2-397B: text, bild, tidsserie.
• Kontext — Grok 4.6: 500 000 tokens vs Intern-S2-397B: 256K textresonemang, 64K multimodalt, båda siffrorna från modellkortet.
• Pris — Grok 4.6: $2.00 / $6.00 per 1M, med trappstegsprissättning till $4.00 / $12.00 efter 200K tokens mot Intern-S2-397B: ingen prislista; självhosta eller det officiella Intern-API:et.
Vad siffrorna faktiskt täcker
Varje siffra för Intern-S2-397B nedan är InternLMs egen, körd genom OpenCompass, VLMEvalKit och AgentCompass och publicerad tillsammans med vikterna utan någon oberoende reproduktion. Grok 4.6:s siffror är en annan sorts sak: de ackumulerades genom den offentliga arenan och Artificial Analysis efter att modellen lanserades, så de bär en tredjepartsetikett.
På den oberoende mätta sidan ligger Grok 4.6 på 44 i det aktuella Artificial Analysis Intelligence Index, med 94,9 på GPQA Diamond, 61,0 på Humanity's Last Exam och en kodningspoäng på 76,8, och Artificial Analysis anger dess siffra för TerminalBench 2.1 till nära 80,3. På leverantörssidan rapporterar Intern-S2-397B:s kort 89,77 på MMLU Pro, 93,56 på HMMT-2026, 81,68 på MMMU Pro och 68,54 på SWE-bench-Pro, vid sidan av vetenskapliga rader där den ser ut som en annan art: 55,71 på Biology-Instructions, 63,28 på SciReasoner 1.5, 53,95 på Mol-Instructions, 62,35 på MolecularIQ. Den enda siffran i leverantörstabellen som borde få en agentbyggare att rygga tillbaka är TerminalBench 2.1 på 64,04 – en siffra där modellens egna skapare rapporterar att modellen förlorar mot en äldre sluten generation med bred marginal, i exakt den terminalarbetsbana där en hyrd frontier-modell som Grok 4.6 är starkast.
Läs den uppdelningen som ett porträtt, inte som en rangordning. Intern-S2-397B är en vetenskaplig specialist som är en kompetent generell modell; Grok 4.6 är en generalist som har ett flyktigt intresse för vetenskap. Att de vetenskapliga raderna är sneda är väntat – inget generalistiskt flaggskepp har förtränats på råa sidor ur vetenskaplig litteratur med figurer, layout och symbolisk notation tillsammans, och det är just det paradigm som Intern-S2-397B är byggd kring. Inget i någon av bevisbaserna stöder "Intern-S2-397B är lika bra som Grok 4.6 på godtycklig resonemangsförmåga", och inget i Grok 4.6:s bevis tyder på att den har finjusterats för multi-omics-sekvensanalys.
Priset för kontroll
Grok 4.6 har ett pris du kan lägga in i ett kalkylblad: 2,00 USD per miljon indatatokens och 6,00 USD per miljon utdatatokens, med en taxa som stiger till 4,00 / 12,00 USD när en prompt passerar 200 000 tokens, och en valfri prioritetsnivå för snabbare svar. Den finns tillgänglig via OrcaRouter till xAI:s listpris vidarebefordrat med 0 % påslag, så en prisändring hos xAI slår igenom här samma dag utan mellanhandsdifferens — ratten du hyr förblir prissatt precis som leverantören prissätter den.
Intern-S2-397B har ingen publicerad pris per token överhuvudtaget. Modellkortet hänvisar till ett officiellt Intern-API, men den ekonomi folk faktiskt vill jämföra är de egenhostade: en checkpoint med 403B parametrar, ungefär 807 GB vikter fördelade över 188 shards i BF16, alltså en seriös multi-GPU-nod, där FP8-bygget ungefär halverar utrymmesbehovet. Om du redan äger den kapaciteten närmar sig marginalkostnaden för nästa vetenskapliga fråga elräkningen, och det är hela poängen med Apache-2.0-positionen. Om du inte äger den är den "gratis" modellen en kapitalutgiftspilot, inte en budgetpost.
Vad en router ger i den här specifika matchningen är skarven snarare än priset. Grok 4.6 ligger på den nyckel du redan har för allmän produktionstrafik; Intern-S2-397B routas inte på OrcaRouter – det är en helt ny checkpoint, och din väg till den är leverantörens eget API eller en självhostad driftsättning. Routa det allmänna, latenskänsliga resonemanget till den användningsdebiterade modellen, behåll det vetenskapliga batcharbetet på modellen du kör, och låt automatisk failover täcka dig när endera sidans slutpunkt är ohälsosam. Gränsen mellan dem blir en routningsregel i stället för en andra integration.

Vilken ska man välja?
Välj Grok 4.6 när uppgiften är allmän, när resonemanget måste komma tillbaka snabbt och korrekt, och när du inte vill äga stacken som producerar det. Dess 500K-fönster, dess uppmätta GPQA Diamond på 94,9 och dess verktygssvit är produktionsfunktioner, och $2/$6-mätaren är vad du betalar för att inte driva någonting.
Välj Intern-S2-397B när indata är av vetenskaplig karaktär – en figurrik artikel, ett molekylärt diagram, en tidsseriesignal – och när resonemanget måste ske på data som inte kan lämna din miljö, eller på ett beteende som du själv vill finjustera. Apache-2.0 gör det möjligt; inget hyrt API gör det. Budgetera för hårdvaran, förvänta dig ingen oberoende resultattavla på ett tag, och behandla varje siffra på dess kort som ett påstående tills någon utanför InternLM reproducerar en.


