Una scheda hero generata che confronta Intern-S2-397B e Qwen3.8-Max, mostrando a sinistra un checkpoint scientifico aperto con un input a pagina di figura e un badge Apache-2.0, e a destra un endpoint flagship a consumo con una tessera tariffaria che riporta $2 / $6 e un misuratore di contesto da 1M di token, con il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Intern-S2-397B vs Qwen3.8-Max: due flagship cinesi, scommesse economiche opposte

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Intern-S2-397B e Qwen3.8-Max sono i due lanci cinesi di punta di maggiore impatto all'inizio di settembre 2026, e hanno fatto scommesse economiche opposte. Intern-S2-397B, il modello multimodale scientifico da 403 miliardi di parametri che il team InternLM dello Shanghai AI Laboratory ha rilasciato con licenza Apache-2.0 il 13 settembre, scommette che i pesi aperti siano il modo per conquistare carichi di lavoro scientifici e agentici: nessun prezzo per token, pesi su Hugging Face e il proprio hardware come metro. Qwen3.8-Max, il modello di punta da 2,4 trilioni di parametri di Alibaba che è passato in disponibilità generale (GA) il 3 agosto ed è stato aggiornato il 2 settembre, scommette su un'API a pagamento a 2,00 $ per milione di token di input e 6,00 $ per milione di token di output su un contesto da 1M token, con i pesi aperti disponibili una settimana dopo la GA e un punteggio indipendente di Artificial Analysis già in classifica. Il confronto tra loro riguarda meno quali benchmark vincano e più quale scommessa — la proprietà o un endpoint a consumo — si adatta alla forma del tuo carico di lavoro.

Due ammiraglie, due scommesse

Qwen3.8-Max è il tier di massima capacità di Alibaba nella linea Qwen, un modello sparse mixture-of-experts con 2,4 trilioni di parametri totali e circa 95 miliardi attivati per token, distribuiti su 512 esperti di cui 10 attivi più uno condiviso. Dispone di una finestra di contesto da 1M di token (983.616 token con il thinking abilitato nell'API hosted), di un tetto di output di 131.072 token, di input testuale, immagini e video, ed è servito tramite un endpoint compatibile con OpenAI. La sua mossa di pricing più distintiva è una tariffa fissa: gli stessi $2.00 / $6.00 sia che il prompt sia di 5.000 token sia di 900.000, con l'input in cache a un prezzo inferiore — nessun sovrapprezzo per il contesto lungo, che è esattamente la leva che la maggior parte dei concorrenti fa ancora pagare. Alibaba lo posiziona direttamente contro GPT-5.5, Claude Opus 4.7 e Gemini 3.1 Pro nella propria guida alla migrazione.

Intern-S2-397B è un modello di punta dal profilo diverso. È un modello mixture-of-experts con 60 layer e 512 esperti (10 attivi per token), un contesto di ragionamento testuale da 256K e multimodale da 64K, una superficie di input composta da testo, immagini e serie temporali, e un paradigma di pre-addestramento che legge pagine grezze di letteratura scientifica — figure, layout, notazione simbolica e prosa — anziché estrarne prima il testo. Il suo apprendimento per rinforzo copre più di venti domini scientifici ed è stato addestrato per attività di agenti a lungo orizzonte in ambienti sandbox. Il suo prezzo non è un listino, ma l'assenza di un listino: fai self-hosting dei pesi Apache-2.0, oppure richiedi l'accesso all'API ufficiale Intern.

• Prezzo — Intern-S2-397B: nessun listino prezzi; self-host o Intern API vs Qwen3.8-Max: $2,00 / $6,00 per 1M, tariffa fissa, input in cache inferiore.

• Scala — Intern-S2-397B: 403B totali, 512 esperti / 10 attivi vs Qwen3.8-Max: 2.4T totali, 95B attivi, 512 esperti / 10 + 1 condiviso.

• Contesto — Intern-S2-397B: 256K di testo / 64K multimodale vs Qwen3.8-Max: 1M di token, a tariffa fissa.

• Input — Intern-S2-397B: testo, immagine, serie temporali vs Qwen3.8-Max: testo, immagine, video.

• Pesi — Intern-S2-397B: Apache-2.0, aperti il giorno del rilascio vs Qwen3.8-Max: licenza Qwen3.8-Max personalizzata, aperto il 12 agosto dopo la GA.

• Punteggio indipendente — Intern-S2-397B: nessuno ancora vs Qwen3.8-Max: AA Intelligence Index 40, GPQA Diamond 92.7.

Entrambe le tabelle sono tabelle dei fornitori, e solo una ha un arbitro

Entrambi i modelli sono stati lanciati con tabelle di benchmark gestite dai fornitori, il che rende identica la disciplina delle fonti e diverso il track record. I numeri indipendenti di Qwen3.8-Max si sono nel frattempo accumulati: Artificial Analysis lo colloca a 40 sul suo attuale Intelligence Index con un GPQA Diamond di 92,7, un HLE di 43,0 e un punteggio di coding indipendente di 71,8, a un costo di circa 2,67 $ per attività dell'indice sulla scala attuale. Questi sono numeri misurati da un tracker di terze parti — il primo vero arbitro che ciascuno di questi due flagship abbia mai avuto.

L'evidenza di Intern-S2-397B è la sua stessa scheda, eseguita attraverso OpenCompass, VLMEvalKit e AgentCompass, pubblicata insieme ai pesi: MMLU Pro 89.77, MMMU Pro 81.68, HMMT-2026 93.56, SWE-bench-Pro 68.54 e TerminalBench 2.1 a 64.04, un valore che la scheda stessa mostra perdere contro una generazione chiusa più vecchia. Le sue righe scientifiche sono la ragione per cui esiste il caso dello specialista: Biology-Instructions 55.71, SciReasoner 1.5 63.28, Mol-Instructions 53.95, MolecularIQ 62.35. Ognuna di queste è di InternLM stesso, non riprodotta. Messe a confronto, le due basi di evidenza raccontano la stessa storia da direzioni opposte: un modello è uno specialista con righe generali rispettabili e nessuna misurazione esterna, l'altro è un generalista con un punteggio indipendente e nessuna messa a punto scientifica.

A generated two-column scoreboard titled 'Intern-S2-397B vs Qwen3.8-Max — the scoreboard.' Left column 'Intern-S2-397B': Weights Apache-2.0 open; Scale 403B total MoE; Context 256K text / 64K multimodal; Inputs text, image, time series; Independent score none yet; Price self-host or Intern API. Right column 'Qwen3.8-Max': Weights custom Qwen3.8-Max licence, opened Aug 12; Scale 2.4T total, 95B active; Context 1M flat-rate tokens; Inputs text, image, video; Independent score AA Index 40, GPQA 92.7; Price $2.00 / $6.00 per 1M. Footer reads 'Intern-S2-397B figures are InternLM's own, unreproduced; Qwen3.8-Max figures per Artificial Analysis and Alibaba.'

Cosa comprano effettivamente le cifre di denaro

Il prezzo fisso di $2 / $6 è la mossa distintiva di Qwen3.8-Max, e vale la pena spiegare cosa comporta. Un agente di analisi dei repository che fa passare 200.000 token di input di contesto di codice in una singola chiamata paga la stessa tariffa per token di una chat breve — nessun sovrapprezzo per prompt lunghi — e con la cache, un contesto di codice stabile riduce drasticamente il prezzo effettivo di input sul traffico ripetuto. Il modello è anche invocabile come pesi aperti sotto la licenza personalizzata di Alibaba, che consente l'uso commerciale con attribuzione, più soglie basate sulla scala oltre 100 milioni di MAU o 20 milioni di dollari di ricavi mensili, e un accordo separato per le grandi aziende di model-as-a-service.

L'economia di Intern-S2-397B è l'inverso: nessun contatore, ma una spesa in conto capitale. I pesi sono circa 807 GB in BF16 su 188 shard — un nodo multi-GPU di tutto rispetto — con una build FP8 che riduce l'ingombro di circa la metà. Se possiedi già quella capacità, il costo marginale della prossima query scientifica si avvicina a quello dell'elettricità, ed è questa la scommessa: la proprietà rende lo specialista economico al margine. Se non possiedi l'hardware, il modello "gratuito" è un progetto pilota, e l'API ufficiale di Intern è l'unica alternativa a consumo.

I due flagship possono condividere un'unica giunzione se usi il routing. Qwen3.8-Max è su OrcaRouter al prezzo di listino di Ali​baba, trasferito con markup 0%, quindi la tariffa fissa di $2 / $6 e qualsiasi futuro taglio di prezzo arrivano qui lo stesso giorno. Intern-S2-397B non è instradato — è un checkpoint nuovissimo, e il tuo percorso per arrivarci è l'API dello stesso fornitore o un deployment self-hosted. Invia il traffico generico, con capacità video e contesto lungo, al modello a consumo sulla chiave che già possiedi; mantieni il lavoro batch scientifico sul modello che gestisci; lascia che il failover automatico ti copra quando l'endpoint di una delle due parti non è integro. Il confine è una regola di routing più che una seconda integrazione.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the feature blocks covering scientific-literature pre-training and multi-domain scientific reinforcement learning.

Il verdetto

Scegli Qwen3.8-Max per il ragionamento generale e per lavori di produzione con capacità video, dove una tariffa fissa su un milione di token batte qualsiasi cosa facciano pagare i suoi concorrenti, e dove una classifica indipendente riduce il rischio di costruirci sopra. I suoi pesi sono abbastanza aperti da contare, sotto una licenza entro i cui confini si trova già la maggior parte dei team, e il suo contatore da $2 / $6 è il prezzo più aggressivo sul tabellone tra i flagship di frontiera.

Scegli Intern-S2-397B per carichi di lavoro scientifici — articoli ricchi di figure, diagrammi molecolari, segnali di serie temporali — dove l'input è multimodale in un modo per cui un generalista non è mai stato ottimizzato, e dove la residenza dei dati o il fine-tuning su risultati proprietari rende Apache-2.0 la proprietà decisiva. Prevedi un budget per l'hardware, esegui una tua valutazione e considera i suoi numeri come semplici dichiarazioni finché non compare un arbitro indipendente.

Il riassunto onesto è che questi due flagship non sono davvero sostituti. Uno è uno strumento scientifico di proprietà con una rispettabile capacità generale; l'altro è un generalista a noleggio, valutato in modo indipendente, con una tariffa fissa e un interesse passeggero per la scienza. I team che hanno bisogno di entrambi dovrebbero trattare il confine come una decisione di routing — e dovrebbero rieseguire le proprie eval su Intern-S2-397B prima di credere a qualsiasi numero sulle slide di uno dei due fornitori.

A screenshot of the OrcaRouter model page for Qwen3.8-Max at orcarouter.ai/models/qwen/qwen3.8-max, captured September 13, 2026, showing the model listing with its provider Qwen, 1M-token context window, and $2.00 / $6.00 per-million-token pricing displayed alongside the surrounding catalogue.