Una hero card generata che confronta Intern-S2-397B e Kimi K3, mostrando a sinistra una pagina di letteratura scientifica con un diagramma molecolare che alimenta una card open-weights da 403 miliardi di parametri, e a destra un lungo nastro di documento che alimenta un flagship da 2,8 trilioni di parametri con un misuratore di contesto da 1M, con il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Intern-S2-397B vs Kimi K3: il modello scientifico da 397B e il gigante del ragionamento da 2,8T

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Intern-S2-397B e Kimi K3 si collocano su lati opposti della linea dei pesi aperti che definirà il resto del 2026: lo specialista scientifico scaricabile contro il generalista a contesto lungo dimostrato in modo indipendente. Intern-S2-397B è il modello scientifico multimodale da 403 miliardi di parametri che InternLM ha rilasciato con licenza Apache-2.0 il 13 settembre 2026 — nessun listino prezzi, nessun punteggio indipendente e un percorso di visione addestrato su pagine grezze di letteratura scientifica. Kimi K3 è il flagship mixture-of-experts da 2,8 trilioni di parametri di Moonshot AI, lanciato a luglio 2026 a 3,00 $ per milione di token di input e 15,00 $ per milione di token di output, che ha aperto i suoi pesi il 27 luglio con una licenza MIT modificata ed è passato attraverso sei settimane di valutazione indipendente. La cosa insolita di questo confronto è che entrambi i modelli hanno la stessa ambizione a lungo orizzonte — continuare a lavorare su un compito grande e disordinato — e la risolvono in direzioni opposte.

Entrambi ambiziosi, meccanismi opposti

L'ambizione è condivisa: ogni modello vuole essere la cosa che continua ad andare avanti quando il compito è lungo. La raggiungono in modo diverso, e la differenza è architetturale.

La risposta di Kimi K3 è il contesto. Una finestra di 1.048.576 token sia in input sia in output significa che un intero repository, un'intera data room o un ciclo di agente di cinquanta passaggi possono vivere in un'unica conversazione. Lo stack di inferenza Mooncake di Moonshot, secondo quanto riportato, mantiene tassi di cache hit superiori al 90% sui carichi di lavoro di coding, ed è così che un prezzo dell'output di 15 $ per milione diventa sostenibile nella pratica. Kimi K3 espone un controllo reasoning_effort di primo livello e non accetta parametri di campionamento, ragiona alla massima profondità per impostazione predefinita e richiede che tu riproduca alla lettera i precedenti reasoning_content e tool_calls nei cicli di tool multi-turno, altrimenti la qualità peggiora.

La risposta di Intern-S2-397B è la specializzazione più il controllo a livello di pesi. Il suo contesto — 256K di ragionamento testuale e 64K multimodale, entrambi valori provenienti dalla scheda del modello — è una categoria di finestra diversa, sufficiente per un articolo sostanzioso o una lunga sessione di ricerca ma non per un working set da un milione di token. Ciò che offre invece è un percorso visivo che legge nativamente la letteratura scientifica — figure, layout, notazione simbolica e prosa insieme — e un input di serie temporali che produce previsioni, oltre a una modalità di pensiero attiva per impostazione predefinita e commutabile su richiesta. Se la tua attività lunga è scientifica, il modello è stato addestrato esattamente per questo; se la tua attività lunga è una codebase, questo non è il modello con la finestra da un milione di token per farlo.

• Contesto — Kimi K3: 1.048.576 token in input e output vs Intern-S2-397B: 256K testo / 64K multimodale.

• Scala — Kimi K3: 2,8T totali, ~104B attivi per token vs Intern-S2-397B: 403B totali, 512 esperti / 10 attivi.

• Superficie di controllo — Kimi K3: selettore reasoning_effort, nessun parametro di campionamento vs Intern-S2-397B: toggle enable_thinking più controllo completo a livello di pesi con licenza Apache-2.0.

• Input — Kimi K3: testo, immagine vs Intern-S2-397B: testo, immagine, serie temporali.

• Pesi — Kimi K3: aperto con licenza Modified MIT (27 luglio) vs Intern-S2-397B: aperto con licenza Apache-2.0 (13 settembre).

• Prove indipendenti — Kimi K3: sei settimane di punteggi di terze parti vs Intern-S2-397B: nessuno finora.

L'asimmetria delle prove è la vera differenza

Kimi K3 è stato sottoposto al vaglio indipendente e ne è uscito con punteggi su cui puoi fare affidamento. Artificial Analysis lo colloca nella fascia media dei 40 sul suo attuale Intelligence Index, con un GPQA Diamond nella fascia bassa dei 90, un HLE nella fascia media dei 40, un recall su contesto lungo misurato in modo indipendente pari a 88,7 e un punteggio di coding nella fascia media dei 70. Detiene il primo posto nella Frontend Code Arena (Elo intorno ai 1670) e ha ottenuto 91,2 su BrowseComp, il valore più alto su quel benchmark di retrieval a lungo orizzonte — sebbene la stessa Moonshot avverta che K3 "è ancora indietro rispetto ai modelli proprietari più potenti", e diverse delle sue voci del giorno di lancio restino riportate dal fornitore.

Le prove di Intern-S2-397B sono la sua stessa tabella di lancio, eseguita tramite OpenCompass, VLMEvalKit e AgentCompass, pubblicata poche ore prima che tu legga questo. Ogni numero è del fornitore stesso e non è stato riprodotto: MMLU Pro 89,77, MMMU Pro 81,68, HMMT-2026 93,56, SWE-bench-Pro 68,54 e TerminalBench 2.1 a 64,04 — un valore che, secondo la scheda, perde contro una generazione chiusa più vecchia con un ampio margine. Le sue righe scientifiche sono i numeri che sostengono la tesi di uno specialista: 55,71 su Biology-Instructions, 63,28 su SciReasoner 1.5, 53,95 su Mol-Instructions, 62,35 su MolecularIQ. Le due basi di prove non si intersecano, ed è per questo che l'inquadramento onesto di questo confronto non è "chi vince" ma "quale tipo di prove richiede il tuo carico di lavoro".

A generated two-column scoreboard titled 'Intern-S2-397B vs Kimi K3 — the scoreboard.' Left column 'Intern-S2-397B': Weights Apache-2.0 open; Scale 403B total MoE; Context 256K text / 64K multimodal; Inputs text, image, time series; Independent score none yet; Biology-Instructions 55.71 vendor-reported. Right column 'Kimi K3': Weights Modified MIT open; Scale 2.8T total, ~104B active; Context 1M tokens in and out; Inputs text, image; Independent score AA Index mid-40s, long-context recall 88.7; Price .00 / 5.00 per 1M. Footer reads 'Intern-S2-397B figures are InternLM's own, unreproduced; Kimi K3 figures per Artificial Analysis and Moonshot AI.'

Quanto costa ciascuno, edizione open-weights

Entrambi i modelli sono open weights, il che sposta la questione dei costi dalla solita storia a consumo contro gratis a un confronto tra due proposte di hosting. Kimi K3 ha un prezzo API pubblicato — 3,00 / 15,00 $ per milione di token secondo il listino di Moonshot, riportato su OrcaRouter con 0% di ricarico, con in più il prezzo di lettura della cache — ed è anche scaricabile: un rilascio open-weights da 96 shard che richiede hardware di classe supernode, 64 o più acceleratori, per essere servito. Il pubblico pratico per un K3 self-hosted sono i team con budget da datacenter. Intern-S2-397B non ha alcun prezzo API pubblicato; la model card rimanda all'API Intern ufficiale, e l'economia reale è quella del self-hosting: circa 807 GB di pesi distribuiti su 188 shard in BF16, un serio nodo multi-GPU, con una build FP8 che riduce l'ingombro di circa la metà.

Entrambi i modelli sono richiamabili attraverso la stessa interfaccia se configuri il routing: Kimi K3 è su OrcaRouter al prezzo di listino di Moonshot con 0% di ricarico, mentre Intern-S2-397B non è instradato — un checkpoint Apache-2.0 nuovissimo, il tuo percorso verso di esso è l'API del fornitore stesso o un deployment self-hosted. Il valore del routing in questo confronto sta nel mantenere il traffico generalista a contesto lungo sulla chiave che già possiedi e il lavoro batch scientifico sul modello che esegui, con failover automatico tra i due. Il DSL rende quel confine una configurazione anziché una seconda integrazione.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the note that text reasoning benchmarks use a 256K inference length while multimodal benchmarks use 64K.

Il verdetto

Scegli Kimi K3 quando il lavoro è generalista a contesto lungo — coding su repository interi, cicli di agenti prolungati, lavoro di conoscenza che necessita di un milione di token di memoria di lavoro — e vuoi una classifica indipendente a supporto. È il modello con le prove più solide in ogni senso, i suoi pesi aperti sono reali (Modified MIT, 27 luglio), e se stai già gestendo un'infrastruttura di classe supernode, l'economia per token con il caching è favorevole.

Scegli Intern-S2-397B quando il compito è scientifico: articoli ricchi di figure, diagrammi molecolari, letteratura scansionata, segnali di serie temporali e dati che devono rimanere all'interno del tuo perimetro o pesi che vuoi mettere a punto su risultati proprietari. Apache-2.0 lo rende possibile, nessuna API a noleggio lo fa, e le righe scientifiche nella scheda sono una specie diversa da ciò per cui un generalista sia mai stato messo a punto. Prevedi un budget per l'hardware, esegui la tua valutazione e considera ogni numero pubblicato al riguardo come un'affermazione finché qualcuno al di fuori di InternLM non ne riproduca uno.

A screenshot of the OrcaRouter model page for Kimi K3 at orcarouter.ai/models/kimi/kimi-k3, captured September 13, 2026, showing the model listing with its provider MoonshotAI, 1,048,576-token context window, and .00 / 5.00 per-million-token pricing displayed alongside the surrounding catalogue.