Card del titolo hero per Qwen3.8 Max Prime, il tier di servizio di Alibaba con throughput 1,5-2x per il flagship Qwen3.8-Max, con chip delle specifiche che riportano gli stessi 2,4T totali e ~95B attivi, Prime a $3,30{{1}}/$9,90{{2}}, standard a $1,65/$4,95{{1}}.
Guides & Insights

Qwen3.8 Max Prime: Alibaba affianca un secondo listino prezzi al suo prodotto di punta

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il 22 settembre 2026, alla Yunqi Conference di Hangzhou, la divisione MaaS di Alibaba ha annunciato un livello di servizio che chiama modalità Prime — 优速模式 — e ha inserito nel suo listino prezzi un nuovo ID di modello: qwen3.8-max-prime. Quell'ID non è un nuovo modello. È Qwen3.8-Max, il modello di punta sparse mixture-of-experts da 2,4 trilioni di parametri diventato disponibile in via generale il 3 agosto 2026, erogato attraverso una corsia più veloce. Qwen3.8 Max Prime porta gli stessi pesi, la stessa finestra di contesto, gli stessi strumenti e gli stessi limiti di utilizzo del modello base. Ciò che cambia è il throughput e il prezzo, e il prezzo raddoppia all'incirca.

È la seconda volta in sette settimane che Aliba​ba cambia il modo in cui viene venduto Qwen3.8-Max senza cambiarne la sostanza. Il 2 settembre l'azienda ha rilasciato un aggiornamento post-addestramento etichettato come Qwen3.8-Max-0902, incentrato sul coding e sul lavoro agentico, solo tramite API. Il 22 settembre ha aggiunto il livello di velocità. Nessuno dei due è stato un lancio, e interpretare l'uno o l'altro come tale ti costerà dei soldi.

Scoreboard infographic for Qwen3.8 Max Prime: underlying model Qwen3.8-Max GA August 3 2026, 2.4T total and ~95B active parameters, throughput 1.5-2x standard, Prime price $3.301/$9.902, standard price $1.65/$4.951, no independent Prime score yet.

Cos'è effettivamente la modalità Prime

La documentazione di Alibaba descrive la modalità Prime come un canale per "scenari sensibili alla velocità di output" — assistenti di programmazione AI, ragionamento multi-step degli agenti, conversazione in tempo reale — e ne indica chiaramente il vantaggio: i TPS vengono portati a da 1,5 a 2 volte quelli dell'API standard. Non c'è alcun nuovo parametro da impostare. Si passa il valore di model all'ID Prime e si è sulla corsia veloce.

La documentazione è altrettanto esplicita su ciò che non cambia: «Le capacità supportate dal modello e le restrizioni d'uso sono le stesse del modello originale». Quindi non c'è un contesto più ampio, né una modalità di ragionamento migliore, né una superficie di strumenti aggiuntiva. È lo stesso stack di serving, solo con più margine alle spalle.

The endpoint shape is worth noting because it tells you who this is for. Prime requests go to a workspace-scoped Beijing address of the form https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, on the OpenAI-compatible path. This is a production traffic decision, not an experiment.

Il tariffario, leggi con attenzione.

La pagina internazionale dei prezzi di Aliba​ba elenca i due ID affiancati, il che rende il confronto insolitamente chiaro. Per milione di token:

• Input — qwen3.8-max-prime $3.301 vs qwen3.8-max $1.65

• Output — qwen3.8-max-prime $9,902 vs qwen3.8-max $4,951

• Cache hit — qwen3.8-max-prime $0.413 rispetto a una tariffa di lettura cache sull'ID standard che la stessa pagina riporta come riga di sconto

• Rapporto — 2,0× sia in input sia in output, non un'approssimazione arrotondata ma l'aritmetica letterale dei numeri pubblicati

Nel tariffario cinese lo stesso 2× vale in yuan: ¥24 in input e ¥72 in output per milione per il Prime ID, contro ¥12 e ¥36 per quello standard, con hit di cache a ¥3.

La cifra di lancio ampiamente citata per Qwen3.8-Max è di $2 per l'input e $6 per l'output per milione. Questo è il titolo con cui è uscita la copertura di agosto, e non è il numero presente oggi sul listino prezzi internazionale. Se stai modellando la spesa, usa il listino prezzi della tua regione invece del titolo di lancio, e controllalo di nuovo prima di impegnarti — Aliba​ba ha revisionato questa pagina due volte dal 2 settembre.

Screenshot of Alibaba Cloud's international Model Studio pricing page listing the qwen3.8-max-prime and qwen3.8-max model IDs side by side, with Prime at $3.301 per million input tokens and $9.902 per million output tokens against $1.65 and $4.951 for the standard ID.

La regola di limitazione è la vera funzionalità

La riga che la maggior parte delle persone trascura è quella che conta di più in produzione. La documentazione di Alibaba Prime afferma che quando il tuo utilizzo raggiunge il limite di frequenza, se la piattaforma dispone ancora di risorse libere, non verrai limitato, quindi la capacità effettiva a tua disposizione non scenderà al di sotto del limite dichiarato.

Quello è un soffitto morbido con un pavimento rigido, che è una forma diversa da un limite di fascia standard. Significa che il valore 1,5–2× è una promessa riguardo al pavimento, non un tetto massimo per il soffitto: in condizioni di contesa ottieni il limite, e in condizioni di capacità inutilizzata puoi ottenere di più. Per un ciclo di agenti che effettua decine di chiamate sequenziali, quell'asimmetria vale più del moltiplicatore TPS grezzo, perché è la latenza di coda sulla chiamata più lenta che determina se il tuo flusso di lavoro si completa.

I limiti TPM dinamici dei modelli standard sono suddivisi in livelli in base alla spesa mensile per Model Studio — la stessa famiglia di documentazione mostra l'ID base qwen3.8-max a 5.000.000, 10.000.000 e 20.000.000 TPM tra i livelli, con aggiornamento mensile. Prime non rimuove quella struttura; ne cambia il modo in cui morde.

Screenshot of the Artificial Analysis model page for Qwen3.8-Max on the 0902 build, showing an Intelligence Index of 45 and a measured cost per task of $5.41 on the standard ID.

Ciò che nessuno ha ancora misurato

Ecco il divario onesto. Il numero di 1,5–2× è dichiarato dal fornitore. Non esiste una misurazione indipendente del throughput in modalità Prime che riusciamo a trovare, e questo conta perché i numeri indipendenti della build standard stessa non sono lusinghieri quanto a velocità.

Artificial Analysis, che valuta i modelli con il proprio harness, attualmente assegna a Qwen3.8-Max sulla build 0902 un Intelligence Index di 45, con GPQA Diamond al 92,8%, Terminal-Bench Hard al 38,9% e Humanity's Last Exam al 43,1% — e stima il costo misurato per attività in 5,41 $. Si tratta di cifre indipendenti sullo SKU standard, rilevate il 24-09-2026. Sono anche un promemoria del fatto che l'indice è stato rivisto dopo la copertura del lancio di agosto, quindi non accostare un valore di indice più vecchio a uno attuale e chiamarlo tendenza.

Ciò che AA non ha è una riga Prime. Finché qualcuno non lo misura, l'affermazione sulla velocità resta appannaggio esclusivo di Alibaba, e l'atteggiamento corretto è testarlo sul proprio carico di lavoro invece di dare per scontato il top di gamma.

Dove questo lascia la decisione di routing

Prime è un livello che Aliba​ba vende sulla propria API, ed è l'unico posto dove ottenerlo. Noi non ospitiamo qwen3.8-max-prime qui. Ciò che OrcaRouter instrada è la versione standard Qwen3.8-Max e il suo pin datato Qwen3.8-Max-0902, entrambi sulla stessa chiave del resto della famiglia Qwen3.8 — Qwen3.8, Qwen3.8-Flash, Qwen3.8-27B — insieme a oltre 200 altri modelli, con il prezzo di listino del provider trasferito tal quale con markup 0%. Quest'ultima parte è il motivo per cui l'aggiornamento del 2 settembre e qualsiasi futura variazione della tariffa di Max arrivano da noi lo stesso giorno in cui arrivano su quella di Aliba​ba.

La suddivisione pratica è questa. Instrada il traffico predefinito sull'ID standard tramite un router, dove il failover ti protegge se il percorso di un singolo provider si degrada. Sposta le chiamate specifiche in cui la latenza effettiva è il prodotto — il completamento interattivo, lo step critico dell'agente — su Prime, e valuta quella decisione rispetto al 2× anziché all'1,5×.

Chi dovrebbe passare, e chi dovrebbe aspettare

Passa a Prime se i tuoi utenti sono in attesa di token: un autocomplete, un turno di chat, un ciclo di modifica del codice a cui un essere umano sta assistendo. All'estremo superiore dell'intervallo di velocità, Prime è a costo neutro per ogni secondo di latenza rimosso — paghi esattamente il doppio per esattamente la metà del tempo. All'estremo inferiore dell'intervallo paghi 2× per 1,5×, il che equivale a un sovrapprezzo del 33% per ogni secondo risparmiato. Se il tuo carico di lavoro è un job batch che viene eseguito durante la notte, quel sovrapprezzo non ti dà nulla di cui avevi bisogno.

Attenzione se il tuo modello di costo è basato sul prezzo di lancio di $2/$6, o se le tue richieste sono a prevalenza di input. La dichiarazione di velocità del fornitore riguarda i TPS — token di output al secondo — e il prefill è una fase diversa della pipeline. Una richiesta a contesto lungo paga il doppio sui token di input, indipendentemente dal fatto che l'output arrivi più velocemente. Misura quel caso prima di migrarlo.

E controlla la data sul tuo tariffario. Qwen3.8-Max è sul mercato dal 3 agosto, è stato aggiornato una volta e riconfezionato una volta, e ha ancora sette settimane di vita. La notizia è il tier; il modello no.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno