
Step 5 Preview vs Qwen 3.8 Max Prime: un punto dell'indice, quattro dollari e trentotto centesimi
- OrcaNUOVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1M di token
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
Comincia da ciò che una casella di ricerca non ti dirà. Qwen 3.8 Max Prime non è un modello. È una corsia di servizio — gli stessi pesi Qwen3.8-Max che il fornitore ha portato alla disponibilità generale il 3 agosto 2026, venduti con un secondo ID di modello a esattamente il doppio del listino internazionale. Step 5 Preview, il flagship chiuso di StepFun, ha aperto la sua API il 20 settembre 2026 ed è un modello nel senso ordinario: un endpoint, un prezzo, un insieme di pesi che non puoi possedere. Quindi la versione onesta di questo confronto mette un modello misurato contro un tier non misurato, e l'aritmetica che ne risulta è più brutale di quanto qualunque fornitore metterebbe su una slide. Sull'indipendente Artificial Analysis Intelligence Index i due distano un punto, 44 contro 45, e su quanto costa un compito completato stanno a 1,03 $ contro 5,41 $. Un punto, quattro dollari e trentotto centesimi, per compito — e questo prima ancora di aver pagato nulla della velocità per cui Prime fa effettivamente pagare.
Quel che segue è quel numero scomposto: da dove viene, perché il Qwen ID standard è già la metà più costosa del confronto prima che Prime raddoppi qualsiasi cosa, e cosa comprano e cosa non comprano i quattro dollari extra per attività.
Il nome sta facendo il lavoro che il prodotto non fa
Alibaba ha annunciato Prime — 优速模式, modalità veloce — alla Yunqi Conference del 22 settembre 2026 e l'ha pubblicato come voce nel listino prezzi di Model Studio. La documentazione di Alibaba stessa non lascia dubbi su cosa cambia: la velocità di output sale a 1,5–2 volte quella dell'API standard e, per usare le parole del fornitore, le capacità e le restrizioni d'uso sono identiche al modello originale. Nessun nuovo numero di parametri, nessun nuovo contratto dell'endpoint, nessuna capacità che l'ID standard non abbia. Cambi il nome del modello nel corpo della richiesta e sei sulla corsia veloce.

Questo rende il termine di ricerca una trappola. Chi cerca un flagship Qwen più recente di Qwen3.8-Max trova "Prime" e lo interpreta come un numero di versione. È un prezzo. Tutto ciò che il nome implica in termini di capacità è fornito da Qwen3.8-Max stesso: un modello sparse mixture-of-experts da 2,4 trilioni di parametri con circa 95 miliardi di parametri attivi per token, 512 esperti per layer, e un contesto di 983.616 token sulla configurazione testata dal comitato indipendente.
Step 5 Preview non presenta un'ambiguità equivalente e ha il problema opposto. StepFun lo elenca a circa 600 miliardi di parametri totali con 27 miliardi attivi, input di testo, immagini e video, una finestra di contesto di 1 milione di token e un tetto di output documentato di 64.000 token, con sforzo di ragionamento selezionabile tra basso, medio o alto. È proprietario. Un checkpoint BF16 è stato promesso per il 15 ottobre 2026 e non è stato distribuito; copie mirror della community di una build BF16 circolano su Hugging Face dal giorno in cui è stata aperta l'API, ma i re-upload non sono un rilascio e StepFun non ha pubblicato alcun annuncio di pesi aperti.
Quindi la coppia è davvero sbilanciata prima ancora che arrivi un singolo benchmark: un modello in anteprima che potrebbe diventare un download, contro un livello di servizio con prezzo rivisto di un modello che non lo diventerà.
Quanto costa un punto dell'indice
Entrambi i modelli sono stati eseguiti dallo stesso valutatore indipendente, ed è qui che il confronto si fa scomodo per la storia del costo inferiore per token. Continua a leggere il 10 ottobre 2026:
• Indice — Step 5 Preview 44, ben al di sopra di una mediana di 26 per modelli comparabili. Qwen3.8-Max sulla build 0902, 45. Un punto.
• Costo per attività di indicizzazione completata — 1,03 $ contro 5,41 $. Migliore di oltre cinque volte.
• Prezzo di output — $2,70 rispetto a $6,00 per milione di token sull'ID standard, che diventa $9,902 una volta passati a Prime. Step 5 Preview è 2,2 volte più economico dello standard e 3,7 volte più economico di Prime.
• Prezzo di input — $1,00 contro $2,00 standard e $3,301 su Prime. L'immagine speculare della colonna di output, e quella che conta di più una volta letto il dettaglio dei costi qui sotto.
• Cache hit — $0,10 per milione di token su Step 5 Preview, uno sconto del 90 percento; $0,25 su Qwen3.8-Max, uno sconto dell'87,5 percento che la pagina stessa del fornitore arrotonda all'88 percento.
• Token di output al secondo — 87 contro 35,4. Qui Qwen è quello lento, e di un fattore di circa due e mezzo.
Le colonne per token e la colonna per attività non concordano, e la colonna per attività è quella di cui fidarsi, per un motivo che emerge solo se si guarda la ripartizione dei costi. Nell'esecuzione dell'indice di Step 5 Preview, 0,85 $ di 1,03 $ riguardano l'input e 0,17 $ l'output. In quella di Qwen3.8-Max, 4,76 $ di 5,41 $ riguardano l'input e 0,65 $ l'output. I prezzi di listino differiscono all'incirca di un fattore due; i costi per attività differiscono di un fattore cinque, perché l'esecuzione di Qwen ha fatto passare circa 9,9 miliardi di token di input attraverso l'harness, contro i 5,5 miliardi di Step 5 Preview, e perché gran parte di quel volume è traffico di cache riletto a qualunque sconto conceda il fornitore, anziché alla tariffa di listino.
Step 5 Preview è descritto dalla board come molto verboso, con circa 160 milioni di token di output sull'intera suite rispetto a una mediana di 82 milioni — e Qwen3.8-Max è descritto esattamente con le stesse parole, a circa 190 milioni rispetto alla stessa mediana. Nessuno dei due è un modello che risponde brevemente. Se la lunghezza dell'output è ciò che speravi di ottimizzare, nessuna delle due colonne ti aiuta.

Il confronto ha un buco, e ha la forma di Prime
Ogni valore nella sezione precedente è stato misurato sull'ID standard Qwen3.8-Max. Nessuno di essi è stato misurato su Prime.
Non è un tecnicismo. L'intera proposta di Prime è che i token arrivino più velocemente, e l'unico dato di velocità della classifica per questa famiglia è quello dell'ID standard: 35,4 token di output al secondo — il più lento dei tre ID discussi qui, e di gran lunga, nonché l'unica riga in cui Qwen3.8-Max non è soltanto costoso ma visibilmente sottoperformante. Se Prime raggiunge il limite superiore dell'intervallo dichiarato da Alibaba, quel 35,4 diventa qualcosa come 70, ancora sotto l'87 di Step 5 Preview, pur costando 3,7 volte tanto per token di output. Se raggiunge il limite inferiore dell'intervallo, diventa all'incirca 53.
Quelle sono stime basate su un moltiplicatore dichiarato dal fornitore, non misurazioni, e dovrebbero essere etichettate come tali. Nessuno che siamo riusciti a trovare ha pubblicato un test indipendente di throughput della modalità Prime. Il valore di 1,5-2× è di Alibaba stesso, ed è l'unica affermazione portante alla base dell'intero livello.
L'unico dettaglio strutturale che gioca a favore di Prime è la regola di throttling, ed è facile trascurarlo scorrendo. La documentazione di Alibaba afferma che con Prime, quando il volume di chiamate raggiunge il limite di frequenza, se la piattaforma ha ancora risorse disponibili la richiesta non viene limitata, quindi il throughput a tua disposizione non scende al di sotto del limite dichiarato. Si tratta di un tetto morbido con un pavimento rigido: in condizioni di contesa ottieni il limite, con capacità inattiva puoi ottenere di più. Per un ciclo di agente che effettua decine di chiamate sequenziali conta più della mediana, perché la chiamata più lenta decide quando il ciclo termina. È anche la spiegazione più chiara del perché Prime esista come prodotto. Alibaba vende la posizione in coda sulla capacità che ha già costruito, e fa pagare il doppio per il diritto a essere serviti per primi.
Cosa dicono le due tariffe quando le metti fianco a fianco
Alibaba pubblica le sue righe Qwen una accanto all'altra, il che rende l'aritmetica del tier insolitamente pulita. Nella pagina internazionale la riga Prime riporta $3.301 di input e $9.902 di output per milione di token, contro $1.65 e $4.951 per l'ID standard e per il suo pin 0902. È esattamente 2,0 su entrambe le colonne — non un'approssimazione arrotondata ma il rapporto letterale dei numeri pubblicati. La pagina dei prezzi in inglese di StepFun elenca Step 5 Preview a $1.00 di input, $0.10 in caso di cache hit e $2.70 di output, con l'input in caso di cache miss che include il costo di scrittura di nuovi contenuti nella cache. Il dato pubblicato dal fornitore per il cache hit è uno sconto del 90 percento; il board indipendente registra il 95 percento dagli stessi materiali, e vale la pena sapere rispetto a quale dei due si sta modellando.
Metti le tre card in una sola colonna e il quadro è chiaro. Output di Prime, $9,902. Output di Qwen standard, $6,00 sul record della classifica e $4,951 sulla pagina internazionale di Alibaba stessa. Output di Step 5 Preview, $2,70. E sulla corsia economica che nessuno pubblicizza, la lettura della cache di Step 5 Preview è $0,10 contro i $0,25 di Qwen — il che conta più della colonna dell'output per qualsiasi carico di lavoro che ripete il proprio prefisso.
Un avvertimento sui numeri non aggiornati, perché questa famiglia ha subito più di una revisione di prezzo in sette settimane. I tanto citati $2 per input e $6 per output di Qwen3.8-Max sono il prezzo di punta del lancio di agosto, ed è ancora quello che mostra la scheda Singapore di Alibaba. Le righe internazionali e globali ora riportano $1,65 e $4,951. Se stai calcolando la spesa, usa il listino prezzi della tua regione e rileggilo il giorno in cui ti impegni.
Due modi per leggere il 2×
Poiché Prime è lo stesso modello al doppio del prezzo dello standard ID, il sovrapprezzo è facile da prezzare e difficile da giustificare. Nel segmento alto della gamma di Alibaba paghi 2× per 2× la velocità, il che è a costo neutro per ogni secondo di latenza rimosso. Nel segmento basso paghi 2× per 1,5×, un sovrapprezzo del 33% per ogni secondo risparmiato. Nessuno dei due estremi è irragionevole per il lavoro interattivo; nessuno dei due è difendibile per un batch notturno. Ecco perché il consiglio standard sulla fascia — chiamate sensibili alla latenza su Prime, tutto il resto sullo standard ID — è anche il consiglio corretto.
Il confronto con Step 5 Preview è il punto in cui il ragionamento cambia forma, ed è questa la parte che l'inquadramento "vs" rende visibile. Prime non compete affatto con Step 5 Preview sul prezzo. L'ID standard è già più costoso per token di output di quanto non lo sia Step 5 Preview, cinque volte più costoso per attività completata, e ottiene un punto in più. Prime moltiplica il lato dei costi di un'equazione che stava già perdendo e ricompra velocità di cui Step 5 Preview ha di più gratis. Se la velocità è ciò di cui hai bisogno da questa famiglia, l'affermazione onesta è che il modello dall'altra parte di questa pagina ti dà 87 token al secondo a $2,70 per milione di token di output, e la corsia veloce ti dà un intervallo che, secondo i numeri di Alibaba stessa, arriva al massimo a circa 70 a $9,902.
Questo non è un argomento secondo cui Step 5 Preview vince. È un argomento secondo cui il valore di Prime è interamente interno alla linea di prodotti di Alibaba stessa, e che la tesi a suo favore si basa su carichi di lavoro in cui il vantaggio di un punto nell'indice di Qwen3.8-Max, il suo contesto da 983.616 token o il suo diverso profilo di attività svolgono un lavoro che un contesto da 1M token di Step 5 Preview non svolge. Il che è il confronto che nessuno può ancora eseguire, perché la riga Prime non esiste su nessuna classifica indipendente.

Dove questo si traduce per un acquirente
Nessuno di questi due è su OrcaRouter. Step 5 Preview è raggiungibile tramite l'API di StepFun e una manciata di piattaforme di terze parti; Prime è un livello di Alibaba Cloud Model Studio servito su un endpoint con ambito di workspace; e puoi verificare entrambe le affermazioni sul nostro catalogo nello stesso minuto in cui le leggi, il che è un test migliore che fidarsi della nostra parola.
Quello che instradiamo è un prodotto diverso all'interno della stessa famiglia, e guarda caso è proprio quello a cui l'aritmetica di questo articolo continua a rimandare. Il Qwen3.8-Max standard e il suo pin datato Qwen3.8-Max-0902 si trovano nel catalogo sulla stessa chiave dei loro fratelli Qwen3.8-Max-Preview, Qwen3.8-Flash e Qwen3.8-27B, insieme ad oltre 200 altri modelli, con il prezzo di listino del provider trasferito con un ricarico dello 0 percento. Da ciò conseguono due cose, ed entrambe hanno un peso sulla decisione di cui sopra. La prima è che una modifica del listino prezzi di Alibaba compare dalla nostra parte lo stesso giorno in cui Alibaba la pubblica — esattamente la proprietà che si desidera da un fornitore che ha già riprezzato questa famiglia due volte in sette settimane. La seconda è che la tua baseline smette di essere una scommessa su un singolo fornitore: l'ID standard è il tier che con maggiore probabilità manterrai sul tuo percorso predefinito, e tenerlo dietro uno strato di routing anziché un'integrazione diretta è ciò che rende la decisione su Prime reversibile per endpoint invece che per contratto.
Se stai scegliendo tra i due nomi nel titolo di questo articolo, la scelta è semplice. Scegli Step 5 Preview quando vuoi il punteggio, l'input video e immagini e lo sconto del 90 per cento sulla cache, e accetta che stai noleggiando un'anteprima il cui checkpoint è una promessa per il 15 ottobre anziché una licenza. Scegli Qwen 3.8 Max Prime solo se hai già scelto Qwen3.8-Max e hai misurato, sui tuoi prompt, che i 35 token al secondo dell'ID standard sono ciò che ti sta costando denaro — e valuta quella decisione rispetto al 2× anziché all'1.5×, perché il vertice della gamma di un fornitore non è il numero che vedrai in produzione.
La misurazione che risolverebbe la questione non esiste, e vale la pena dirlo chiaramente invece di abbellirlo. Qualcuno deve far girare Prime attraverso un harness che faccia girare anche Step 5 Preview, pubblicare una distribuzione di throughput invece di un moltiplicatore, e mettere il costo per attività accanto al punto di indice che acquista. Fino ad allora gli unici numeri che entrambe le parti condividono sono le due schede tariffarie, e dicono la stessa cosa da direzioni opposte: la corsia veloce è il modo più costoso di acquistare un token Qwen3.8-Max, e il modo più lento di acquistare un secondo di tempo reale rispetto a quanto l'alternativa fa pagare per lo stesso secondo.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
