Generata una scheda di confronto a due colonne intitolata "Step 5 Preview vs Intern-S2 Mobius" con il sottotitolo "Un flagship da 600B che noleggi, o un reasoner da 35B che esegui". La scheda di sinistra "Step 5 Preview" riporta: AA Index 44 (misurato); circa 600B totali / 27B attivi; contesto 1M token; $1.00 in / $2.70 out per 1M; API di anteprima chiusa; pesi promessi per il 15 ottobre 2026. La scheda di destra "Intern-S2 Mobius" riporta: nessun punteggio indipendente; 35B parametri; contesto non pubblicato; nessun prezzo API, self-host; Apache 2.0 disponibile ora; accelerazione dichiarata di circa 4x, non riprodotta. Un piè di pagina riporta: "I dati di Step 5 Preview secondo StepFun e Artificial Analysis; i dati di Intern-S2 Mobius sono dichiarazioni di InternLM, non riprodotte."
Engineering & Research

Step 5 Preview vs Intern-S2 Mobius: Ti serve un modello di punta da 600B, o un ragionatore veloce da 35B?

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il vero motivo per confrontare Step 5 Preview con Intern-S2 Mobius non è che siano simili. È che sono risposte a due domande diverse dello stesso acquirente — il team che ha un carico di lavoro di ragionamento da eseguire e nessuna voglia di comprare un cluster. Lo Step 5 Preview di StepFun, annunciato il 20 settembre 2026, è la risposta grande: circa 600 miliardi di parametri totali con 27 miliardi attivi, un contesto da 1M token, un punteggio dell'Artificial Analysis Intelligence Index misurato in modo indipendente pari a 44, e un prezzo pubblicato di 1,00 $ per milione di token di input e 2,70 $ per milione di token di output. L'Intern-S2 Mobius di InternLM, rilasciato il 29 luglio 2026, è la risposta piccola: un modello open-weight da 35 miliardi di parametri costruito sull'architettura Mobius-v0, pre-addestrato in modo continuativo a partire da Qwen3.5-35B, la cui affermazione centrale non è la capacità ma la velocità — un'accelerazione end-to-end di circa 4x sui benchmark di ragionamento rispetto alla baseline da cui è stato addestrato, senza alcun punteggio di benchmark indipendente di alcun tipo. Uno è un flagship che si noleggia; l'altro è un modello piccolo che si esegue. Il confronto riguarda in realtà se il carico di lavoro che si ha davanti giustifichi affatto il flagship.

Una precisazione prima dei numeri, perché fa perdere tempo reale: InternLM ha rilasciato diversi modelli sotto il marchio Intern-S2, e non sono la stessa cosa. Intern-S2-397B è l'ammiraglia scientifica multimodale; Intern-S2 Mobius è il ragionatore efficiente da 35B di cui si parla qui; una release precedente di Intern-S2 è a sua volta un modello separato. Se cerchi "Intern-S2" e finisci su tabelle di benchmark per un modello da 397B, stai leggendo di un checkpoint diverso.

Ciò che ogni modello sostiene effettivamente

Le dichiarazioni di Step 5 Preview sono quelle convenzionali per un flagship del 2026, e una di esse è verificata in modo indipendente. StepFun elenca circa 600B parametri totali con 27B attivi, input di testo e immagini, una finestra di contesto da 1M token e un prezzo di $1.00/$2.70 per milione di token di input e output. Artificial Analysis lo misura a 44 sul suo Intelligence Index, al di sopra di una mediana di 26 per modelli comparabili, con output a 87 token al secondo rispetto a una media di 78 e circa 160 milioni di token di output generati attraverso la suite di compiti dell'indice rispetto a una mediana di 82 milioni — circa il doppio dell'impronta verbosa tipica, il che conta per un modello con fatturazione basata sull'output.

La tesi di Intern-S2 Mobius è architetturale e più circoscritta. Il suo design separa la conoscenza dal calcolo: una Memoria condivisa a livello globale contiene vettori di conoscenza, e molteplici Reasoner interrogano e affinano iterativamente gli stati nascosti rispetto a essa, invece di vincolare archiviazione e calcolo strato per strato come fa un transformer convenzionale. Il vantaggio dichiarato da InternLM è una velocità end-to-end circa 4 volte superiore sui benchmark di ragionamento rispetto al Qwen3.5-35B da cui deriva, con punteggi di ragionamento comparabili o migliori, oltre a catene di pensiero visibili più brevi. Il modello è Apache 2.0, accetta input testuali e di immagini, ed è scaricabile.

• Scala — Step 5 Preview: circa 600B totali, 27B attivi secondo StepFun vs Intern-S2 Mobius: 35B totali.

• Punteggio indipendente — Step 5 Preview: 44 sull'Artificial Analysis Intelligence Index contro Intern-S2 Mobius: nessuno pubblicato da terzi.

• Velocità — Step 5 Preview: 87 token di output rispetto a una media di 78, misurati dalla index board contro Intern-S2 Mobius: "quasi 4 volte" rispetto alla sua stessa baseline Qwen3.5-35B, dato riportato dal fornitore e non riprodotto.

• Finestra di contesto — Step 5 Preview: 1M token per StepFun vs Intern-S2 Mobius: nessuna cifra di contesto indipendente pubblicata.

• Prezzo — Step 5 Preview: $1,00 in ingresso / $2,70 in uscita per milione di token rispetto a Intern-S2 Mobius: nessun prezzo API; paghi l'hardware.

• Licenza e accesso — Step 5 Preview: anteprima chiusa tramite l'API del fornitore, pesi BF16 promessi per il 15 ottobre 2026 vs Intern-S2 Mobius: pesi Apache 2.0 disponibili ora.

• Verbosità — Anteprima dello Step 5: circa 160M token di output su tutta la suite di indici rispetto a una mediana di 82M, secondo la classifica degli indici rispetto a Intern-S2 Mobius: tracce di ragionamento visibili più brevi dichiarate da InternLM, non misurate da nessun altro.

L'affermazione del 4x, e perché è il numero interessante qui

Leggi i numeri dei due fornitori a confronto e la discrepanza è evidente: il dato principale di StepFun è un punteggio di capacità, quello di InternLM è un moltiplicatore di throughput. Non è una coincidenza, ed è la cosa più utile in questo confronto. Un'accelerazione end-to-end di 4x su compiti di ragionamento, se sopravvive al contatto con l'harness di qualcun altro, vale più per una distribuzione ad alto volume di qualche punto su un indice — cambia l'aritmetica dell'esecuzione del carico di lavoro. Intern-S2 Mobius punta a team il cui collo di bottiglia sono i token al secondo per dollaro, non la capacità massima.

Il caveat è che il moltiplicatore è misurato rispetto a Qwen3-35B, il modello da cui Intern-S2 Mobius è stato pre-addestrato in modo continuativo, che non ha mai avuto l'addestramento Mobius. Si tratta di un confronto con il suo stesso punto di partenza, non con un rivale. Non esiste alcuna riproduzione indipendente dell'affermazione sul throughput, nessun punteggio di indice di terze parti e nessuna finestra di contesto pubblicata da soggetti diversi dal fornitore. Considera "quasi 4x" un interessante segnale architetturale e un'ipotesi da testare sul tuo harness, non come una specifica.

Step 5 Preview ha il profilo probatorio opposto. Il suo numero di capacità è misurato in modo indipendente; la sua storia di efficienza è la parte debole. La misura di verbosità della classifica dell'indice — circa 160 milioni di token di output, mentre il modello mediano ne emette circa 82 milioni — è l'onesto contrappeso a un prezzo di output di 2,70 $, e significa che un carico di lavoro che si basa su lunghe generazioni strutturate spenderà sostanzialmente più di quanto suggerisca il prezzo di listino. Quello che ha, che Intern-S2 Mobius non ha, è un prezzo API pubblicato, ed è proprio questo che lo rende confrontabile in primo luogo.

Il repository Hugging Face della build promessa dal fornitore racconta l'altra metà della storia: ecco come appare un rilascio open-weight quando è stato annunciato ma non ancora distribuito.

Generated two-column scoreboard card titled 'Step 5 Preview vs Intern-S2 Mobius - the scoreboard'. The left column gives Step 5 Preview a speed of 87 output tokens per second against a 78 average, about 160M output tokens against an 82M median, text and image input, closed preview weights, and best-for open-ended, long-context and multimodal work. The right column gives Intern-S2 Mobius a claimed speed of about 4x faster than its own Qwen3.5-35B baseline, shorter reasoning traces claimed, text and image input, Apache 2.0 weights, and best-for narrow high-volume reasoning inside your own perimeter. A footer reads 'Speed and verbosity on the left are third-party measurements; every figure on the right is the vendor's own and unreproduced.'

Dove la questione dell'impronta si fa davvero sentire

Il vero vantaggio di Intern-S2 Mobius non è il suo punteggio, che nessuno ha misurato, ma quanto costa sbagliarsi sul suo conto. Trentacinque miliardi di parametri sono una dimensione che un team può servire su hardware che già possiede, valutare senza un ordine d'acquisto e abbandonare senza dover svalutare nulla. È un vantaggio strutturale che l'ammiraglia non può eguagliare, non importa quanti punti totalizzi, ed è il motivo per cui questo confronto vale la pena di essere fatto invece di liquidarlo come un confronto impari.

Screenshot of the Hugging Face repository page for stepfun-ai/Step-5-Preview-BF16, the vendor placeholder for the promised open-weight build of Step 5 Preview, showing the repository shell with no model card, no configuration, no licence terms and no tensor files.

Il vantaggio del modello di punta è l'immagine speculare. Il contesto da 1M di token di Step 5 Preview, l'input di immagini e la capacità di ragionamento generale misurata coprono un lavoro che è improbabile che un modello da 35B riesca a coprire bene, e non costa nulla provarlo per la durata di una finestra gratuita — il modello è stato gratuito in tre diverse superfici per sviluppatori durante ottobre. Nessuno di questi fatti è disponibile per un modello self-hosted: non esiste una settimana gratuita per far girare le proprie GPU, e non esiste un listino prezzi che converta la decisione in una voce di costo.

Se vuoi che il confronto sopravviva alla finestra promozionale, la cosa da costruire è un banco di prova anziché una preferenza. OrcaRouter instrada più di 200 modelli dietro un'unica chiave API e un'unica fattura, con 0% di ricarico e il prezzo di listino del provider passato tal quale, con failover automatico e un DSL di routing per indirizzare il traffico in base a costo, latenza o capacità. Né Step 5 Preview né Intern-S2 Mobius sono in quel catalogo — il flagship di StepFun non è instradato da noi e Intern-S2 Mobius è un download self-host — quindi il valore qui non è l'accesso all'uno o all'altro. È che i modelli con cui li confronterai sono a una chiave di distanza, e una decisione presa sulla base di misurazioni si muove con le prove invece che con un post di lancio sul blog.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

Come decidere

Se il tuo carico di lavoro è agentico, multimodale, a contesto lungo o aperto — del tipo in cui non puoi enumerare in anticipo i compiti — il modello di punta è la risposta, e Step 5 Preview ne è un'istanza ragionevole: misurato, con un prezzo definito, economico da provare e reversibile token per token. Prevedi semplicemente a budget la verbosità, non la tariffa di facciata.

Se il tuo carico di lavoro è ristretto, ripetitivo e ad alto volume di ragionamento su dati che devono rimanere all'interno del tuo perimetro, il modello piccolo è la risposta, e Intern-S2 Mobius è un candidato autentico proprio perché è piccolo: gira su hardware che già possiedi, è Apache 2.0, e la promessa di velocità, se regge, è il tipo di cosa che decide una questione di economia unitaria. Entra sapendo che stai mettendo alla prova l'affermazione del fornitore anziché ereditare il verdetto di qualcun altro.

L'errore è considerare la scelta permanente. Acquista prima la valutazione del modello piccolo, perché è l'esperimento a basso costo; noleggia il modello di punta per le attività in cui il modello piccolo fallisce, perché è la riparazione a basso costo. I team che mantengono entrambe le opzioni attive sulla stessa chiave e sulla stessa infrastruttura di test finiscono per prendere questa decisione con i propri dati, e questa è l'unica versione che regge quando uno dei due fornitori rilascia un successore.