
Step 5 Preview vs MiniMax M3: più economico per token, più costoso per punto
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Il prezzo unitario favorisce MiniMax M3 con un ampio margine. A 0,30 $ per milione di token in input e 1,20 $ per milione in output, il modello sparse da 428B del fornitore batte i 1,00 $ e i 2,70 $ di Step 5 Preview di più di un fattore due su entrambi i fronti. Ma il prezzo unitario è il denominatore sbagliato per un modello che usi per rispondere a domande, e una volta che dividi per ciò che ciascun modello offre realmente, la classifica si capovolge. Step 5 Preview costa 0,71 $ per attività dell'Intelligence Index con un punteggio di 44. MiniMax M3 costa 0,51 $ per attività dell'indice con un punteggio di 29. Per punto di capacità misurata, il modello con il prezzo di listino più alto è quello più economico — e il motivo è un divario di quindici punti nell'indice che nessuno sconto riesce a colmare.
Due tipi molto diversi di "disponibile"
MiniMax M3 è disponibile a livello generale dal 1º giugno 2026, quando MiniMax l'ha reso accessibile tramite MiniMax Code, il suo Token Plan e l'API — nessuna etichetta di anteprima in tutto il lancio. I pesi sono arrivati l'12 giugno, undici giorni dopo, come promesso. Il repository MiniMaxAI/MiniMax-M3 conta circa 428 miliardi di parametri totali con circa 23 miliardi attivi per token, basato su MiniMax Sparse Attention, insieme a una release separata quantizzata in MXFP8.
Step 5 Preview ha aperto la sua API il 20 settembre 2026. I suoi pesi non sono stati pubblicati — il repository Hugging Face stepfun-ai/Step-5-Preview-BF16 è un guscio vuoto — e StepFun si è impegnata per una data del 15 ottobre 2026. Quindi la differenza pratica è che M3 è un modello che puoi scaricare, auto-ospitare e ispezionare, mentre Step 5 Preview è un endpoint ospitato con un'intenzione pubblicata.
Da segnalare: la pagina del modello di MiniMax stessa continua a dire che M3 «sarà presto reso completamente open source», il che contraddice il repository pubblicato a giugno. Considerala una pagina del fornitore non aggiornata, non una prova del fatto che i pesi manchino.
La storia del prezzo non è la storia del costo
Artificial Analysis calcola un valore di costo per attività indice eseguendo lo stesso set di valutazione su ciascun modello e sommando quanto costano i token. È la cosa più vicina che il settore abbia a un numero di costo totale di proprietà per una quantità fissa di lavoro, e incorpora i due effetti che i prezzi dei token nascondono: quanto è verboso un modello e quanto ragiona.
Step 5 Preview si attesta a 0,71 $ per attività di indicizzazione, con un costo totale di esecuzione dell'indice di 922,84 $. MiniMax M3 si attesta a 0,51 $, con un costo totale di esecuzione di 537,98 $. In termini di throughput grezzo delle attività, M3 costa circa il 28% in meno. Dividi per il punteggio dell'indice — 44 contro 29 — e Step 5 Preview arriva a circa 1,6 centesimi per punto indice contro gli 1,8 centesimi di M3.
Una precisazione è d'obbligo proprio qui: si tratta di una singola esecuzione dell'indice per modello, e un'esecuzione dell'indice è un campione piccolo. L'aritmetica per punto è un controllo di plausibilità sulla cifra per attività, non un benchmark a sé stante. Ma la direzione è coerente con i numeri per attività, e quelle sono le cifre che i listini prezzi dei due fornitori non possono mostrare.
• Intelligence Index — Step 5 Preview 44 (#24 di 200) vs MiniMax M3 29 (#15 di 113), entrambi sulla versione attuale dell'indice
• Prezzo di input — $1,00 per milione vs $0,30 per milione
• Prezzo di output — $2,70 per milione vs $1,20 per milione
• Costo per attività di indicizzazione — $0,71 vs $0,51
• Parametri attivi — 27B vs 23B
• Finestra di contesto — 1M token vs 1M token
• Velocità di output — 99,8 token/s vs 210,4 token/s
• Pesi — promessi il 15 ottobre 2026 vs disponibili dal 12 giugno 2026

La trappola della versione dell'indice che rende tutto questo confuso
C'è un rischio concreto nel leggere i numeri di M3, e merita un paragrafo perché fa inciampare quasi tutte le pagine di confronto di terze parti. Artificial Analysis ha ricalibrato il suo Intelligence Index il 7 settembre 2026, e la ricalibrazione ha compresso i punteggi su tutta la linea. Secondo la scala attuale M3 misura 29. Secondo la scala precedente a settembre misurava da 44 a 45 — e diversi tracker continuano a pubblicare 44,4 o 45,4 per esso.
Questa collisione conta più del solito qui, perché anche il punteggio attuale di Step 5 Preview è 44. Una pagina che mette un dato M3 obsoleto accanto a un dato attuale di Step 5 Preview sembra mostrare due modelli in parità, quando il divario attuale è di quindici punti. Entrambi i dati in questo articolo provengono dalla versione attuale dell'indice e sono confrontabili tra loro; qualsiasi cosa pubblicata prima del 7 settembre non lo è.
Dove MiniMax M3 è davvero difficile da battere
Due cose riguardo a M3 non sono affatto vicine. La prima è la velocità: 210,4 token di output al secondo, il quarto valore più veloce dei 113 modelli monitorati da Artificial Analysis, rispetto a una mediana di 76,3. I 99,8 token al secondo di Step 5 Preview sono rispettabili e rappresentano meno della metà. Anche il tempo al primo token di M3, pari a 1,01 secondi, è il dato più rapido rispetto a 2,96 secondi.
Il secondo è la modalità di input. M3 accetta testo, immagini e video e restituisce testo, e MiniMax documenta le operazioni desktop e di computer-use. Step 5 Preview accetta testo e immagini. Se la tua pipeline invia registrazioni dello schermo o fotogrammi video a un modello, non è una preferenza — è una differenza di capacità.
Il divario di prezzo rafforza entrambi. A $0,30 e $1,20 con uno sconto permanente del 50% applicato a un listino di $0,60 e $2,40, e uno sconto dell'80% sulla cache che porta le letture dalla cache a $0,06 per milione, M3 è uno dei modi più economici per far passare un grande volume di token attraverso un modello capace. Nota la struttura a livelli: un input superiore a 512K token raddoppia l'intera richiesta, e il livello di servizio prioritario costa 1,5×.
Dove si sfalda
Il set di valutazione di MiniMax per M3 è solido e va letto come dati dichiarati dal fornitore: SWE-bench Verified all'80,5%, SWE-bench Pro al 59,0%, Terminal-Bench 2.1 al 66,0%, MCP Atlas al 74,2%, BrowseComp a 83,5 e OSWorld-Verified a 70,06%. MiniMax li ha eseguiti sulla propria infrastruttura usando Claude Code come scaffolding, con una media su quattro esecuzioni, e la configurazione di valutazione non è pubblica — quindi, allo stato attuale, non sono riproducibili da terze parti.
Il quadro misurato in modo indipendente è molto più severo sul lavoro agentico. Artificial Analysis ha registrato Terminal-Bench 4.0 al 2% per M3 — una versione diversa del benchmark rispetto al valore Terminal-Bench 2.1 del fornitore, e non comparabile con esso, ma comunque netto. SciCode si è attestato al 47%, AutomationBench-AA al 21% e CritPt al 4%. I risultati indipendenti più forti di M3 riguardano contesti lunghi e lavoro basato sulla conoscenza: AA-LCR v1.1 all'83%, Humanity's Last Exam al 39%.
Passo 5 L'anteprima inverte quel profilo. Terminal-Bench 4.0 al 33,3% sullo stesso harness dove M3 ottiene il 2%, SciCode al 59% contro il 47%. Se il lavoro è di tipo agentico o orientato al codice, non è un confronto serrato e il vantaggio di prezzo non lo compensa.

La clausola di licenza che la maggior parte dei confronti salta
MiniMax M3 è a pesi aperti, ma non è open source nel senso OSI, e i termini sono più restrittivi di quanto suggerisca l'espressione "pesi aperti". Il repository adotta la MiniMax Community License: gratuita per uso non commerciale, con l'uso commerciale subordinato all'esposizione ben visibile di "Built with MiniMax M3" — e qualsiasi prodotto con un fatturato annuo superiore a 20 milioni di USD richiede previa autorizzazione scritta da MiniMax. Non è MIT, non è Apache, e non è il tipo di licenza che un team legale approva senza problemi.
Step 5 Preview non può ancora essere valutato affatto su questo asse, perché non c'è una licenza da leggere. StepFun si è impegnata a rilasciare i pesi il 15 ottobre e non ha pubblicato i termini che lo governeranno. Chiunque intenda costruirci sopra dovrebbe considerare la licenza una questione aperta anziché presumere che assomiglierà a quella di Moonshot o DeepSeek.
Questa è l'onesta asimmetria tra i due: i termini di M3 sono restrittivi ma noti; quelli di Step 5 Preview sono sconosciuti. Una licenza restrittiva di cui puoi tenere conto è meglio di una non annunciata di cui non puoi.
Chiamare uno dei due
MiniMax M3 è nel nostro catalogo su /models/minimax/minimax-m3, raggiungibile con la stessa chiave e la stessa forma di richiesta del resto degli oltre 200 modelli che instradiamo, con il prezzo di listino del fornitore passato a un markup dello 0% — quindi lo sconto permanente del 50% applicato da MiniMax è il prezzo che vedi, e cambia il giorno in cui MiniMax lo cambia. Il failover automatico è l'altra metà della questione: M3 a 210 token al secondo è interessante per i lavori ad alto volume, e il lavoro ad alto volume è esattamente dove un singolo endpoint degradato fa più male.
Step 5 Preview non è nel nostro catalogo. I modelli di testo di StepFun non sono tra quelli che serviamo, quindi è disponibile tramite l'API di StepFun stessa e diverse piattaforme di terze parti — e non è raggiungibile con la chiave che useresti per M3.

Il verdetto
Scegli MiniMax M3 quando il volume, la latenza o l'input video sono il vincolo, quando vuoi un modello che puoi scaricare oggi e quando puoi convivere con la licenza community — compresa la soglia di fatturato di 20 milioni di dollari. Accetta che i punteggi agentici indipendenti lo collocano molto indietro e che i suoi benchmark del fornitore non sono stati riprodotti al di fuori dell'infrastruttura di MiniMax stessa.
Scegli Step 5 Preview quando il lavoro è agentico o molto incentrato sul codice, quando vuoi la capacità per dollaro anziché il token per dollaro e quando ti senti a tuo agio a essere un cliente precoce di un endpoint ospitato i cui pesi arrivano il mese prossimo. Accetta di non poter verificare la licenza prima di costruire, e che un divario del 2% rispetto al 33,3% su Terminal-Bench 4.0 è il tipo di scarto che decide un progetto.
Lo sconto è reale. Solo che non è ciò che viene acquistato.
MiniMax M3 è uno dei modelli che instradiamo a 0% di markup con failover automatico, quindi una variazione di prezzo del fornitore è attiva sulla stessa chiave lo stesso giorno.
