Una card con titolo hero per 'Qwen3.8-Max vs Qwen3.7-Max' con il sottotitolo 'Due livelli Max, 16 punti indice e una promo che inverte il prezzo', e un footer che segnala che i dati di Qwen3.8-Max provengono dalla disclosure di Alibaba del 22 settembre 2026 e da Artificial Analysis, mentre i dati di Qwen3.7-Max provengono da Artificial Analysis.
Guides & Insights

Qwen3.8-Max vs Qwen3.7-Max: due livelli Max, 16 punti indice e una promo che inverte il prezzo

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Quattro giorni fa, il fornitore ci ha detto che Qwen3.8-Max non è il modello che ha distribuito in agosto. In un comunicato stampa datato 22 settembre 2026, dalla Apsara Conference di Hangzhou, l'azienda ha rivelato che il suo modello di punta ha completato 33 cicli iterativi di lavoro di training e post-training completamente automatizzato nell'arco di oltre un mese, e che la build risultante ha portato il suo Artificial Analysis Intelligence Index da 40 a 45. L'ID del modello non è mai cambiato. Il numero che c'è dietro, invece, sì.

Questo conta soprattutto in un punto specifico: il confronto tra Qwen3.8-Max e Qwen3.7-Max, il tier Max che ha sostituito. Qwen3.8-Max ha raggiunto la disponibilità generale il 3 agosto 2026; Qwen3.7-Max è stato rilasciato a maggio. Sulla carta sembra una facile scelta generazionale — nuovo flagship, punteggio più alto, passiamo oltre. I numeri dicono qualcosa di più scomodo. Il tier più vecchio è da tre a quattro volte più veloce, circa cinque volte più economico per attività completata, e identico a quello più recente sui benchmark di pura conoscenza. Il tier più recente è multimodale, drasticamente migliore nel lavoro agentico, e più economico sul listino internazionale. Quale dovresti chiamare dipende da una domanda che la maggior parte dei confronti salta: se stai comprando conoscenza o comprando chiamate agli strumenti.

Che cosa sostiene effettivamente l'informativa di Apsara

La divulgazione è una dichiarazione di un fornitore, pubblicata da Alibaba sul proprio sito stampa, e va letta come tale. Ciò che afferma è specifico: nell'arco di oltre un mese di esecuzioni completamente automatizzate che coprono progettazione della pipeline, validazione dei dati, sperimentazione iterativa e diagnosi degli errori, Qwen3.8-Max ha completato 33 cicli, e l'ottimizzazione autonoma dell'addestramento più le tecniche di post-addestramento hanno prodotto la variazione del punteggio. Alibaba ha anche descritto un secondo esperimento nella progettazione di chip, in cui il modello ha eseguito più di 60 ore di auto-miglioramento lungo un ciclo di vita di progettazione, ha effettuato oltre 10.000 chiamate a strumenti EDA e ha prodotto moduli bus per chip di livello produttivo, riducendo l'area del chip del 42% senza alcun compromesso dichiarato sulle prestazioni. Tutto questo è il resoconto di Alibaba sul proprio modello, non riprodotto da nessuno al di fuori dell'azienda.

Il movimento del punteggio in sé, però, non è un'affermazione di un fornitore. L'Indice è di Artificial Analysis, e il 45 si trova sulla pagina di Qwen3.8 Max (0902) di quella terza parte. Il 40 da cui è passato si trova sulla pagina della stessa organizzazione per la build del 3 agosto, ora contrassegnata come deprecata e che rimanda a quella attuale. Quindi il delta è una causa riportata dal fornitore associata a un effetto valutato in modo indipendente, il che è una posizione più solida di ciascuna delle due metà da sola. È anche, al momento in cui scriviamo, la prova pubblica più concreta che chiunque abbia del fatto che un laboratorio di frontiera abbia spostato la capacità misurata del suo flagship senza rilasciare un nuovo numero di versione.

Altre due cose riguardo al rilascio sono facili da lasciarsi sfuggire ed entrambe hanno un peso determinante. In primo luogo, Alibaba ha confermato che Qwen 4 è in addestramento, con le serie Qwen 4.5 e Qwen 5 previste per scalare fino a 5–10 trilioni di parametri. In secondo luogo, c'è uno snapshot datato del modello aggiornato. Alibaba ha fissato la build post-addestrata come qwen3.8-max-0902 il 2 settembre, ed è instradabile separatamente. Quel pin è la risposta pratica a tutto ciò che la divulgazione RSI implica, e ci torneremo.

Il tabellone

Sei dimensioni, entrambi i lati, con la disciplina delle fonti mantenuta esplicita perché le due colonne non sono verificate allo stesso modo.

• Finestra di contesto — Qwen3.8-Max 1.000.000 di token vs Qwen3.7-Max 1.000.000 di token (identica)

• Output massimo — 131.072 token vs 131.072 token secondo le pagine dei modelli di Alibaba stesso (identici; si noti che la nostra pagina di catalogo per Qwen3.7-Max riporta 64.000, una discrepanza che segnaliamo invece di nascondere)

• Modalità di input — testo, immagine e video rispetto al solo testo

• Prezzo di listino internazionale per 1 milione di token — 2,00 $ in / 6,00 $ out rispetto a 2,50 $ in / 7,50 $ out; lo stesso listino applica già a entrambi i modelli 1,65 $ / 4,951 $ a Pechino, Francoforte e Virginia

• Artificial Analysis Intelligence Index — 45 contro 29

• Velocità di output indipendente — 39,7 token/sec vs 211,3 token/sec, misurata rispetto alla stessa classe di confronto di 211 modelli, in cui Artificial Analysis valuta la fascia più recente come notevolmente lenta e quella più vecchia come notevolmente veloce

Le ultime due righe sono l'intero articolo. Sulla stessa famiglia di indici, il livello più recente è avanti di 16 punti. Sulla velocità, è indietro di oltre cinque volte.

A two-column comparison scoreboard: left column 'Qwen3.8-Max' lists Context window 1,000,000 tokens, Max output 131,072 tokens, Input text / image / video, International price per 1M $2.00 / $6.00, AA Intelligence Index 45 and Output speed 39.7 tok/s; right column 'Qwen3.7-Max' lists Context window 1,000,000 tokens, Max output 131,072 tokens, Input text only, International price per 1M $2.50 / $7.50, AA Intelligence Index 29 and Output speed 211.3 tok/s; a footer credits Alibaba's 22 Sep 2026 disclosure and Artificial Analysis.

Da dove vengono i 16 punti — e da dove no

Scomponi Index nelle sue parti e la forma dell'upgrade diventa chiara, e non è la forma che il marketing suggerisce.

Sul piano delle conoscenze e del ragionamento, i due modelli sono di fatto alla pari. GPQA Diamond: 92,8 vs 92,3. Humanity's Last Exam: 43,1 vs 40,5. Richiamo su contesto lungo: 80,33 vs 79. SciCode: 52,1 vs 49,5. Se il tuo carico di lavoro consiste nel rispondere a domande su un ampio corpus, il salto generazionale è un errore di arrotondamento. Pagare un multiplo per averlo sarebbe difficile da giustificare.

Sul lavoro agentico e di coding, il divario si apre nettamente. Terminal-Bench 2.1: 88,76 vs 74,53. L'indice di coding di Artificial Analysis: 76,2 vs 66. E la divergenza più ampia del set è il compito bancario di uso degli strumenti, dove Qwen3.8-Max registra 47,84 contro il valore di Qwen3.7-Max: 11,75 — un divario di quattro volte esattamente nella capacità che la descrizione RSI afferma che i cicli automatizzati stavano ottimizzando: progettazione di pipeline, validazione dei dati, sperimentazione iterativa, diagnosi degli errori. Un modello che passa un mese a migliorare il proprio ciclo di addestramento è un modello che è migliorato nei cicli.

Una onesta avvertenza su quelle singole righe. Entrambe le pagine dei modelli appartengono alla stessa famiglia di revisione dell'Intelligence Index (v4.3 e v4.3.2), il che rende equo il confronto principale 45 contro 29. Le righe per singolo benchmark non sono della stessa coorte: i valori a livello di task di Qwen3.7-Max risalgono alla finestra di valutazione di maggio, mentre quelli di Qwen3.8-Max provengono dalla serie di settembre. Leggere la direzione di marcia, non la terza cifra significativa.

La questione del prezzo sono due domande

Nel listino prezzi internazionale di Alibaba, il Max più recente costa meno di quello che ha sostituito: $2.00 / $6.00 per Qwen3.8-Max rispetto a $2.50 / $7.50 per Qwen3.7-Max, per milione di token. Un taglio del 20% in entrambe le direzioni con l'avanzare delle generazioni è insolito e vale la pena segnalarlo di per sé. Anche l'economia della cache favorisce il livello più recente — cache implicita a $0.25 contro $0.50, lettura della cache esplicita a $0.17 contro $0.25.

Questa è la prima domanda, e ha una risposta regionale che gran parte della copertura appiattisce. Alibaba applica a entrambi i modelli $1.65 input / $4.951 outputa Pechino, Francoforte e Virginia. Il divario del 20% esiste solo sulla carta internazionale di Singapore. Se il tuo traffico arriva nelle altre tre regioni, i token di input e di output costano lo stesso per entrambi i livelli Max oggi, e la decisione si riduce alla pura capacità — a quel punto il modello più recente vince su tutto tranne che sul throughput, e non resta più alcun calcolo da fare.

La seconda domanda è la trappola. Attualmente Qwen3.7-Max non costa $2,50 / $7,50. Viene offerto a $1,25 / $3,75 — metà del listino, una tariffa promozionale. Questo rende il livello della generazione precedente l'opzione più economica oggi, con un ampio margine. Significa anche che il prezzo che puoi misurare questa settimana non è il prezzo al quale ti impegneresti. La stessa pagina del modello di Alibaba afferma chiaramente che la tabella pubblicata mostra i prezzi originali "escludendo eventuali promozioni a tempo limitato" e rimanda alla console per le offerte attuali. Una promozione è, per costruzione, una tariffa che può terminare. Se ciò accade, Qwen3.7-Max non diventa semplicemente più costoso di quanto lo sia oggi; diventa il 25% più costoso del modello che lo batte.

Trasmettiamo la tariffa del fornitore senza alcun ricarico, allo 0% di markup, quindi sia il prezzo di listino sia la promozione sono attivi dalla nostra parte lo stesso giorno in cui cambiano — il che è comodo per un confronto e poco utile se stai cercando di impostare un budget. Costruisci il modello sul listino e considera la tariffa promozionale come un valore aggiunto.

A screenshot of Alibaba Cloud Model Studio's 'Recommended models' documentation overview page, showing the console navigation on the left, the line 'Alibaba Cloud Model Studio offers Qwen and third-party models for text, image, audio, and video.', an 'Updated at: 2026-09-24 20:17:58' stamp, and category cards covering Text generation (listing qwen3.8-max and qwen3.7), Image & video, World models, and Audio & speech.

Il numero che ribalta l'argomentazione sui costi

Il prezzo dei token non è quanto costa un task. Artificial Analysis pubblica un valore di costo per task che incorpora l'economia della cache, il volume di ragionamento e la lunghezza della risposta, e su questa misura la classifica si capovolge completamente: 5,41 $ per task dell'Intelligence Index per Qwen3.8-Max contro 1,15 $ per Qwen3.7-Max. Un premio di 4,7×, rispetto a una tariffa per token che è o del 20% più economica o identica a seconda della tua regione.

Il divario è in gran parte una questione di verbosità. Nella stessa valutazione il modello più recente ha generato 190M token in output rispetto ai 120M del modello precedente, e ragiona a lungo per arrivare alle sue risposte. Se paghi per token di output per un carico di lavoro ad alto volume e moderatamente difficile, il nuovo Max non è il modello più economico a nessun prezzo per token su nessuno dei due listini. È quello più costoso, e il prezzo di listino per token è lo strumento sbagliato per deciderlo.

La velocità, e ciò che mostra il nostro stesso traffico

Il divario di throughput è abbastanza ampio da cambiare le architetture. Artificial Analysis colloca Qwen3.8-Max a 39,7 token al secondo — il suo riepilogo definisce il modello notevolmente lento — contro 211,3 per Qwen3.7-Max, che definisce notevolmente veloce. Questa è la differenza tra un modello che metti dietro una superficie interattiva e uno che metti dietro una coda — e su Qwen3.8-Max è la prima cosa che il nostro pannello di ordinamento ti mostra.

Le nostre stesse telemetrie del playground nei sette giorni fino al 25 settembre raccontano una storia leggermente più sfumata sulla latenza, e comportano un avvertimento: si tratta delle nostre misurazioni sul nostro routing, non di un benchmark controllato. Qwen3.8-Max ha mostrato una mediana di 2.611 ms al primo response a 54,7 token al secondo con un tasso di errore del 2,45%; la build 0902 pinnata ha mostrato una mediana di 3.360 ms a 46,2 token al secondo con un tasso di errore decisamente più pulito dello 0,66%. Qwen3.7-Max si è attestato su una mediana di 4.509 ms ma con 169,8 token al secondo e un tasso di errore del 3,80%. Quindi il tier più vecchio risponde più lentamente in avvio e poi trasmette in streaming tre volte più velocemente, fallendo però più spesso. Se il vostro carico di lavoro è a raffiche, quella differenza nel tasso di errore merita più attenzione della mediana.

Entrambi i livelli sono attivi su un'unica chiave OrcaRouter insieme allo snapshot bloccato, con failover automatico tra provider. Per un confronto come questo, il punto pratico è questo: misurare i tuoi prompt rispetto a entrambe le generazioni Max è una modifica di configurazione, non un secondo contratto.

A screenshot of OrcaRouter's own model page for Qwen3.7-Max (models/qwen/qwen3.7-max) in the dark theme, showing the Qwen3.7-Max heading, its model description, and the stat and price panel for the tier.

La riproducibilità è ormai il fattore decisivo

Ecco la parte della disclosure di Apsara che nessuno ha prezzato. Un ID di modello live la cui capacità misurata è passata da 40 a 45 nell'arco di un mese, senza alcun cambio di versione e senza alcun annuncio al momento, è un rischio per la riproducibilità. Se il comportamento del tuo prodotto è funzione di un ID in movimento, hai un modello che può migliorare — o spostarsi — sotto una suite di valutazione congelata, una libreria di prompt in cache, o un set di regressione approvato.

Entrambe le generazioni offrono snapshot datati, e questa è la mitigazione. Qwen3.7-Max è documentato da Alibaba come funzionalmente equivalente a qwen3.7-max-2026-05-20, con ulteriori build datate al 2026-05-17 e 2026-06-08. Qwen3.8-Max ha qwen3.8-max-0902, la build di settembre post-addestrata, ed è a questa che si riferisce il 45. Se distribuisci qualcosa che deve essere riproducibile, fissa l'ID datato e considera quello fluttuante come un target di staging. I cicli RSI sono una caratteristica dell'ID fluttuante; il pin è il modo in cui scegli di escluderli.

Un dettaglio di denominazione che vale la pena conoscere per non interpretare male il catalogo. Alibaba elenca una terza forma datata, qwen3.8-max-2026-09-02, accanto all'alias 0902; si riferiscono alla stessa build. La release originale del 3 agosto non è più instradabile dalla nostra parte — serviamo Qwen3.8-Max, il suo pin 0902, e Qwen3.7-Max.

Chi dovrebbe scegliere cosa

La decisione non si divide su quale modello sia migliore. Si divide su ciò che stai acquistando.

Resta su Qwen3.7-Max se il tuo carico di lavoro è solo testuale, più orientato alla conoscenza che agli strumenti e sensibile al throughput — classificazione ad alto volume, estrazione, recupero su contesti lunghi, riepilogo in batch. Su GPQA Diamond e sul richiamo su contesti lunghi è a un punto dal modello più recente, genera in streaming tre o quattro volte più velocemente e costa $1,15 per attività rispetto a $5,41. È anche la risposta giusta per chiunque voglia un secondo parere a basso costo in una configurazione di fusione o di routing, perché alla sua tariffa promozionale è di una classe di prezzo completamente diversa. Due avvertenze: la promozione è una promozione, e Artificial Analysis ha già segnalato il modello come deprecato, superato da Qwen3.8-Max. Non avviare un impegno pluriennale su di esso.

Passa a Qwen3.8-Max se è vera una di queste condizioni: hai bisogno di input immagini o video, che Qwen3.7-Max non accetta affatto; il tuo carico di lavoro è agentico, con lunghe catene di chiamate a strumenti o cicli di codifica a più passaggi, dove 88,76 contro 74,53 su Terminal-Bench 2.1 e il divario quadruplo nell'uso degli strumenti sono la differenza tra rilasciare e non farlo; oppure scrivi secondo il listino internazionale di Singapore, dove il modello più recente è semplicemente il 20% più economico e non c'è alcun compromesso da valutare. Fissa qwen3.8-max-0902 se hai bisogno che il comportamento rimanga stabile.

Se ti trovi a Pechino, Francoforte o in Virginia, la scelta è più netta di quanto qualsiasi confronto suggerisca: entrambi i tier Max costano $1.65 / $4.951 per milione di token. Identici. A queste tariffe, non pagare nulla in più per l'input multimodale, un Index superiore di 16 punti e un punteggio di tool-use quattro volte migliore non è una decisione, è gratis — e l'unico motivo per restare su Qwen3.7-Max diventa il throughput grezzo.

Due domande a cui vale la pena rispondere direttamente

Il run di addestramento da 33 cicli significa che il modello è cambiato sotto il traffico API esistente? È ciò che implica la comunicazione, ed è il motivo per cui esiste il pin datato. Alibaba descrive il modello migliorato come «il Qwen3.8-Max aggiornato», che è l'ID fluttuante, non un nuovo ID. Se avevi carichi di lavoro sull'ID fluttuante fino a settembre, sono stati serviti da un modello la cui capacità misurata è cambiata durante quella finestra. Alibaba non ha pubblicato un changelog per le build intermedie, quindi l'unico modo affidabile per sapere quale comportamento hai è fare il pin.

La rivendicazione RSI è verificata in modo indipendente? Il punteggio che ha prodotto lo è — l'Indice è di Artificial Analysis, e il 45 si trova sulla loro pagina. Il meccanismo alla base è la descrizione di Alibaba del proprio processo di addestramento, senza replicazione esterna, nessun protocollo di valutazione pubblicato e nessuna terza parte che osservi i 33 cicli. Considera "33 cicli iterativi" come un'affermazione del fornitore e "45 dopo 40" come una coppia misurata. Non sono lo stesso tipo di affermazione, e la differenza è il motivo per cui il titolo vale la pena di essere letto con attenzione anziché ripetuto.

La prossima cosa da tenere d'occhio non è Qwen 4. È se la promozione a metà prezzo di Qwen3.7-Max sopravviverà all'arrivo del modello che dovrebbe sostituirlo. Se non lo farà, moltissimi team scopriranno che stavano confrontando un prezzo di listino con uno sconto, e che il più vecchio dei due fratelli era in realtà quello più costoso fin dall'inizio.