Una hero card generata che confronta Intern-S2-397B e Grok 4.6, mostrando a sinistra un modello scientifico open-weights con un interruttore di ragionamento etichettato enable_thinking e una forma d'onda di serie temporali, e a destra un endpoint cloud chiuso con una manopola dell'effort di ragionamento e icone di strumenti lato server, etichettata con il contrasto tra il controllo self-hosted di Apache-2.0 e un'API a consumo da $2 / $6, con il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Intern-S2-397B vs Grok 4.6: chi può girare le manopole

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Intern-S2-397B e Grok 4.6 sono stati rilasciati a circa un mese di distanza e rispondono alla stessa domanda di fondo in modi opposti: chi ha il controllo del ragionamento. Grok 4.6, il fiore all'occhiello di x​AI andato online il 12 agosto 2026, ti vende una manopola — un controllo configurabile dello sforzo di ragionamento su un'API chiusa al prezzo di $2,00 per milione di token in input e $6,00 per milione di token in output, con una finestra di 500.000 token e gli strumenti lato server di x​AI fatturati a parte. Intern-S2-397B, il modello scientifico multimodale da 403 miliardi di parametri che il team InternLM dello Shanghai AI Laboratory ha rilasciato sotto Apache-2.0 il 13 settembre, ti consegna l'intera macchina — pesi, interruttore del pensiero, percorso di visione, testa per serie temporali — e si aspetta che tu la esegua da solo. Uno è noleggiato con le manopole; l'altro è posseduto in pieno. Il confronto che conta qui non è quale ottiene un punteggio più alto in una tabella di benchmark; è quale tipo di controllo il tuo carico di lavoro richiede effettivamente, e quanto costa ciascun tipo.

Due quadranti diversi

Il modo più pulito per distinguere questi due è guardare dove risiedono i controlli del ragionamento. Grok 4.6 espone un'impostazione dello sforzo di ragionamento tramite l'API di x​AI, e attorno a essa si trova una suite di strumenti lato server — chiamata di funzioni, ricerca web, ricerca su X, esecuzione di codice — che x​AI gestisce e fattura separatamente. Tu regoli lo sforzo, concateni gli strumenti che ti fornisce e non tocchi mai un peso. Il comportamento del modello è proprietà di x​AI e un problema di x​AI; la tua leva è un parametro nella richiesta.

Intern-S2-397B ti offre un diverso set di leve, e si trovano più in basso nello stack. Il thinking è attivo per impostazione predefinita e lo disattivi per singola richiesta con enable_thinking=False. Poiché il modello è Apache-2.0, puoi anche prendere i pesi ed eseguire il fine-tuning del comportamento di ragionamento stesso sui tuoi dati, per poi servire il risultato su LMDeploy, vLLM o SGLang. La sua superficie di input è più ampia di quella di un'API testo-e-immagini: accetta segnali di serie temporali e produce previsioni, una capacità attualmente collegata solo tramite LMDeploy, ed è stato addestrato per il lavoro agentico a lungo orizzonte in ambienti sandbox. Il compromesso è altrettanto chiaro — quel livello di controllo ha senso solo se sei pronto a gestire l'hardware e lo stack di serving che ne derivano.

• Controllo del ragionamento — Grok 4.6: selettore dell'impegno di ragionamento su un'API chiusa vs Intern-S2-397B: toggle enable_thinking più controllo completo a livello di pesi sotto Apache-2.0.

• Strumenti — Grok 4.6: ricerca web lato server di xAI, ricerca su X ed esecuzione di codice, fatturati separatamente rispetto a Intern-S2-397B: invocazione di tool che configuri tu stesso, più un percorso di previsione di serie temporali tramite LMDeploy.

• Input — Grok 4.6: testo, immagine, file vs Intern-S2-397B: testo, immagine, serie temporali.

• Contesto — Grok 4.6: 500.000 token rispetto a Intern-S2-397B: 256K di ragionamento testuale, 64K multimodale, entrambi i valori tratti dalla scheda del modello.

• Prezzo — Grok 4.6: $2.00 / $6.00 per 1M, con scaglionamento a $4.00 / $12.00 oltre 200K token rispetto a Intern-S2-397B: nessuna tabella tariffaria; self-host o l'API Intern ufficiale.

Che cosa coprono effettivamente i numeri

Ogni valore di Intern-S2-397B riportato di seguito è di InternLM stesso, eseguito tramite OpenCompass, VLMEvalKit e AgentCompass e pubblicato insieme ai pesi senza alcuna riproduzione indipendente. I numeri di Grok 4.6 sono un'altra cosa: si sono accumulati attraverso l'arena pubblica e Artificial Analysis dopo il lancio del modello, quindi portano un'etichetta di terze parti.

Sul fronte delle misurazioni indipendenti, Grok 4.6 si posiziona a 44 sull'attuale Artificial Analysis Intelligence Index, con un GPQA Diamond di 94.9, un Humanity's Last Exam di 61.0 e un punteggio di coding di 76.8, e Artificial Analysis colloca il suo valore TerminalBench 2.1 vicino a 80.3. Sul fronte del fornitore, la scheda di Intern-S2-397B riporta 89.77 su MMLU Pro, 93.56 su HMMT-2026, 81.68 su MMMU Pro e 68.54 su SWE-bench-Pro, accanto a righe scientifiche in cui sembra una specie diversa: 55.71 su Biology-Instructions, 63.28 su SciReasoner 1.5, 53.95 su Mol-Instructions, 62.35 su MolecularIQ. L'unico numero nella tabella del fornitore che dovrebbe far rabbrividire un costruttore di agenti è TerminalBench 2.1 a 64.04 — una cifra che gli stessi creatori del modello dichiarano di perdere contro una generazione chiusa più vecchia con un ampio margine, proprio nel settore del lavoro da terminale in cui un modello frontier noleggiato come Grok 4.6 è più forte.

Leggi quella divisione come un ritratto, non come una classifica. Intern-S2-397B è uno specialista scientifico che è anche un modello generalista competente; Grok 4.6 è un generalista che ha un interesse marginale per la scienza. Che le righe scientifiche siano sbilanciate è prevedibile: nessun flagship generalista è stato pre-addestrato su pagine grezze di letteratura scientifica con figure, impaginazione e notazione simbolica insieme, ed è esattamente il paradigma su cui è costruito Intern-S2-397B. Nulla in nessuna delle due basi di evidenza sostiene che "Intern-S2-397B sia bravo quanto Grok 4.6 nel ragionamento arbitrario", e nulla nelle evidenze di Grok 4.6 suggerisce che sia stato ottimizzato per l'analisi di sequenze multi-omiche.

Il prezzo del controllo

Grok 4.6 ha un prezzo che puoi mettere in un foglio di calcolo: 2,00 $ per milione di token in input e 6,00 $ per milione in output, con la tariffa che sale a 4,00 $ / 12,00 $ una volta che un prompt supera i 200.000 token, più un livello prioritario opzionale per risposte più rapide. È disponibile tramite OrcaRouter al prezzo di listino di x​AI, trasferito con uno 0% di ricarico, così una variazione di tariffa presso x​AI arriva qui lo stesso giorno senza alcun delta dell'intermediario — il quadrante che noleggi resta al prezzo deciso dal fornitore.

Intern-S2-397B non ha alcuna tariffa per token pubblicata. La model card fa riferimento a un'API Intern ufficiale, ma l'economia che le persone vogliono effettivamente confrontare è quella del self-hosting: un checkpoint da 403B parametri, circa 807 GB di pesi distribuiti su 188 shard in BF16, quindi un serio nodo multi-GPU, con la build FP8 che dimezza all'incirca l'ingombro. Se possiedi già quella capacità, il costo marginale della prossima query scientifica si avvicina a quello dell'elettricità, e questo è l'intero punto della posizione Apache-2.0. Se non la possiedi, il modello "gratuito" è un progetto pilota di spesa in conto capitale, non una voce di bilancio.

Ciò che un router offre in questo specifico confronto è la giunzione, non il prezzo. Grok 4.6 si trova sulla chiave che già possiedi per il traffico di produzione generale; Intern-S2-397B non è instradato su OrcaRouter — è un checkpoint nuovo di zecca, e il tuo percorso per raggiungerlo è l'API del fornitore stesso o un deployment self-hosted. Instrada il ragionamento generale e sensibile alla latenza verso il modello a consumo, mantieni il lavoro batch scientifico sul modello che esegui e lascia che il failover automatico ti protegga quando l'endpoint di una delle due parti non è integro. Il confine tra loro diventa una regola di routing invece di una seconda integrazione.

A generated two-column scoreboard titled Intern-S2-397B vs Grok 4.6 — the scoreboard. Left column Intern-S2-397B: Weights Apache-2.0 open; Reasoning control toggle plus full weight control; Inputs text, image, time series; Context 256K text / 64K multimodal; Independent score none yet; TerminalBench 2.1 64.04 vendor-reported. Right column Grok 4.6: Weights closed API only; Reasoning control effort dial; Inputs text, image, file; Context 500K tokens; Independent score AA Index 44, GPQA 94.9; TerminalBench 2.1 80.3 per Artificial Analysis. Footer reads Intern-S2-397B figures are InternLM's own, unreproduced; Grok 4.6 figures per Artificial Analysis and the vendor.

Quale scegliere?

Scegli Grok 4.6 quando il lavoro è generico, il ragionamento deve tornare rapido e corretto e non vuoi possedere lo stack che lo produce. La sua finestra da 500K, il suo GPQA Diamond misurato a 94,9 e la sua suite di strumenti sono funzionalità di produzione, e il contatore $2/$6 è ciò che paghi per non gestire nulla.

Scegli Intern-S2-397B quando l'input è scientifico — un articolo ricco di figure, un diagramma molecolare, un segnale di serie temporale — e quando il ragionamento deve avvenire su dati che non possono lasciare il tuo ambiente, o su un comportamento che vuoi mettere a punto tu stesso. Apache-2.0 lo rende possibile; nessuna API a noleggio lo fa. Prevedi un budget per l'hardware, non aspettarti alcuna classifica indipendente per un po', e considera ogni numero sulla sua scheda come un'affermazione finché qualcuno al di fuori di InternLM non ne riproduca uno.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the note that text reasoning benchmarks use a 256K inference length while multimodal benchmarks use 64K.A screenshot of the OrcaRouter model page for Grok 4.6 at orcarouter.ai/models/grok/grok-4.6, captured September 13, 2026, showing the model listing with its provider SpaceXAI, 500,000-token context window, and $2.00 / $6.00 per-million-token pricing displayed alongside the surrounding catalogue.