
Boreal vs Qwen3.8 Max: La riga che ogni fornitore spera che tu salti
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Ogni lancio di modello pubblica una scheda di numeri, e ogni scheda ha una riga sulla quale il fornitore preferirebbe che non vi soffermiate. Per Qwen3.8 Max, rilasciato il 3 agosto 2026, le righe lusinghiere sono facili da trovare: ha conquistato il primo posto nella classifica front-end di CodeArena con 1.691 punti, ha raggiunto un Artificial Analysis Agentic Index di 58, eguagliando Claude Opus 5 ad alto sforzo — il più vicino che un laboratorio cinese fosse mai arrivato alla vetta di quella classifica — e ha ottenuto un punteggio GDPval-AA di 1.739 Elo, davanti a GPT-5.6 Sol. La riga sotto di esse è più difficile da leggere. Nella stessa suite del valutatore, l'allucinazione misurata è salita dal 23% della generazione precedente al 40%, e il punteggio di recupero su contesto lungo del modello è calato di due punti. Boreal, il modello di video pubblicitari di Creatify, lanciato il 15 settembre 2026 a un centesimo al secondo, ha una riga dello stesso tipo sulla propria scheda — ed è più specifica, perché il fornitore l'ha pubblicata.
Nessuna delle due righe è squalificante. Entrambe sono più informative dei punteggi principali, ed è per questo che vale la pena affiancarle invece di confrontare i banner.
Ciò in cui Qwen3.8 Max è davvero il migliore
Le vittorie sono reali e non sono piccole.
Qwen3.8 Max è un modello mixture-of-experts da 2,4 trilioni di parametri con circa 95 miliardi di parametri attivi per token, ed è il primo Qwen della classe Max che Alibaba ha dichiarato verrà rilasciato con pesi aperti — annunciato per la settimana del 10 agosto 2026 senza licenza né data definitiva, un dettaglio degno di nota perché l'annuncio non è il rilascio. Ha una finestra di contesto di 1M token con un limite di output di 131.072 token, e accetta testo, immagini e video come input. Quest'ultimo punto merita enfasi in questo particolare confronto: dei quattro modelli testuali di frontiera che questa serie contrappone a Boreal, Qwen3.8 Max è uno dei soli due a cui si può consegnare una clip video finita e porre una domanda al riguardo.
Il prezzo è aggressivo in un modo che ha rimodellato il segmento. A 2,00 $ per milione di input e 6,00 $ per milione di output, con le letture dalla cache a 0,25 $, batte la generazione precedente di circa il 20% pur raddoppiando la lunghezza massima dell'output. Nella nostra tabella questo si attesta a 2,00 $ e 6,00 $, un contesto di 1M token, un p50 del tempo al primo token di 10,00 secondi — il tetto riportato dalla nostra strumentazione, quindi va letto come "lento" più che come un valore preciso — e 183,0 milioni di token di traffico negli ultimi sette giorni.
E la riga sottostante
Ecco la parte che non finisce nel titolo del post di lancio.
La valutazione indipendente di Artificial Analysis ha registrato due regressioni tra Qwen3.7-Max e Qwen3.8 Max. La sua misura di recupero su contesto lungo è scesa di due punti. La sua misura di onniscienza è calata di dieci, e il tasso di allucinazioni misurato dal valutatore è salito dal 23% al 40%. Allo stesso tempo, il costo per attività del modello sull'indice di intelligenza è aumentato da 0,53 $ a 1,14 $ — ha richiesto circa 64 turni per attività, mentre il suo predecessore ne richiedeva 14.
Leggendoli insieme, emerge un quadro coerente. Qwen3.8 Max è un modello che è migliorato nelle cose che i benchmark con un'unica risposta corretta possono misurare — codice, completamento di compiti agentici, risoluzione strutturata di problemi — ed è peggiorato in ciò che è più difficile da valutare: sapere quando non sa. Un modello che delibera di più e allucina di più non si contraddice. Tracce di ragionamento più lunghe creano più occasioni di cadere in una risposta sbagliata e sicura di sé, e un benchmark che premia il completamento di un compito non penalizza questo finché il compito non ha un invariante nascosto da violare.
Per un acquirente, la conseguenza pratica è limitata e specifica. Se il tuo utilizzo del modello è la generazione di codice o un flusso di lavoro agentico in cui una risposta sbagliata fallisce in modo evidente — un test fallisce, una build si rompe — le regressioni sono in gran parte invisibili e i guadagni sono tutto ciò che conta. Se il tuo utilizzo è il recupero di informazioni, il riassunto, o qualsiasi cosa in cui una risposta sbagliata ma fluente raggiunge un essere umano senza un controllo, il salto da 23 a 40 è il numero che dovrebbe decidere la tua valutazione, non il posizionamento su CodeArena.
La riga peggiore della stessa Boreal, pubblicata dal fornitore
Il contrasto che rende utile questo accostamento è che Creatify ha fatto qualcosa che la maggior parte dei fornitori non fa: ha messo il suo risultato più debole nello stesso post di quello più forte.
Boreal è stato testato in cieco contro il suo stesso modello base non modificato, con prompt, risoluzione, numero di fotogrammi e seed mantenuti fissi, su 40 casi di produzione. Creatify riporta una preferenza dell'81% per Boreal — 25 a 6 con 9 pareggi, test del segno p<0,001 — e poi scompone quella media. Annunci di prodotto: 83%. Scene creator e UGC: 85%. Clip con una sola persona che parla: 60%.
Quell'ultima cifra è la riga. I talking heads sono tra i formati più comuni nella pubblicità direct-response, ed è il formato in cui il vantaggio del modello rispetto alla propria base è più esile — appena meglio del lancio di una monetina rispetto a un modello che nessuno avrebbe mai rilasciato. Il rendering è dichiarato a 1:1 con il tempo reale in classe 720p, e la conservazione dei dettagli fini è migliorata dell'11,3% con p=0,004, quindi il quadro d'insieme è davvero positivo. La suddivisione ti dice semplicemente per quale metà della categoria è stato ottimizzato questo modello, e non è la metà con una persona che parla in camera.
Nota anche che tipo di prova costituisca ciascuna di queste righe. La regressione di Qwen3.8 Max è stata rilevata da un valutatore indipendente che eseguiva il proprio sistema di test. La riga debole di Boreal è stata divulgata dal fornitore, in un test progettato ed eseguito dal fornitore stesso. La seconda è più affidabile come affermazione di fatto e meno informativa come confronto, perché non c'è alcun numero indipendente da nessuna parte nel file di Boreal.

Il contrasto delle specifiche
• Output — Boreal: video renderizzato, classe 720p, da testo a video e da immagine a video. Qwen3.8 Max: solo testo, fino a 131.072 token.
• Input — Boreal: un prompt testuale o un'immagine statica. Qwen3.8 Max: testo, immagini e video.
• Prezzo — Boreal: 0,01 $ al secondo di video finito. Qwen3.8 Max: 2,00 $ per 1M di input / 6,00 $ per 1M di output, letture dalla cache a 0,25 $.
• Contesto — Boreal: non pubblicato. Qwen3.8 Max: 1M token in ingresso, 131K in uscita.
• Latenza — Boreal: dichiarata a 1:1 con il tempo reale. Qwen3.8 Max: tempo p50 al primo token di 10,00 secondi sulla nostra scheda.
• Pesi — Boreal: proprietari, di proprietà di Creatify e da essa erogati. Qwen3.8 Max: proprietario al lancio; Alibaba ha annunciato un rilascio a pesi aperti per il primo Qwen di classe Max, senza licenza né data confermate.
• Prove — Boreal: test in cieco su 40 casi condotto dal fornitore, nessuna valutazione indipendente. Qwen3.8 Max: copertura di benchmark indipendente che include due regressioni misurate, insieme a righe del fornitore di 86,1 su OSWorld-Verified e 86,6 su Terminal-Bench 2.1.
Quanto vale una regressione per chi acquista
Le regressioni nelle classifiche di solito vengono considerate quisquilie. Sono più vicine a essere la cosa più rilevante per le decisioni che un benchmark pubblica, perché sono le uniche righe che ti dicono a cosa un fornitore ha rinunciato.
La mossa utile non è leggere l'una o l'altra scheda, ma eseguire entrambi i modelli sul proprio traffico — e l'ostacolo pratico è che di norma questo comporta due contratti, due SDK e due rapporti di fatturazione, una frizione sufficiente a far sì che la maggior parte dei team salti il test e acquisti invece in base al punteggio principale.
Quell'attrito è la parte che un livello di routing elimina. Qwen3.8 Max è nel nostro catalogo accanto alla generazione precedente, quindi confrontarli sul tuo set di valutazione è una modifica di una riga alla stringa del modello anziché un ciclo di approvvigionamento, e la stessa chiave raggiunge il resto del catalogo quando il confronto indica che vuoi un modello diverso per una fase diversa della pipeline. Si colloca a tariffa di listino del provider con 0% di markup, il che qui conta per un motivo specifico: Qwen3.8 Max è arrivato circa il 20% più economico della generazione che ha sostituito, e un ricalcolo dei prezzi da parte del fornitore di questo tipo è il genere di cosa che dovrebbe arrivare sulla tua fattura quando accade, anziché al rinnovo successivo.
Boreal non è nel nostro catalogo. OrcaRouter non fornisce modelli di generazione video, e nulla di quanto qui scritto deve essere interpretato come un'affermazione contraria. Ciò che forniamo è il livello che sta sopra — i testi, le varianti, la verifica di conformità, l'analisi di ciò che ha performato — e a due dei modelli di questa serie, tra cui Qwen3.8 Max, si può affidare la clip finita da rivedere.

Come leggere una delle due carte
Qwen3.8 Max è l'acquisto migliore se il tuo lavoro è codice, agenti o ragionamento strutturato, a un prezzo inferiore a quello del suo stesso predecessore, e le due regressioni indipendenti sono il motivo per testarlo sul tuo traffico di recupero e riepilogo prima di instradarvi la produzione. Il dato del 40% di allucinazioni non è un motivo per evitare il modello; è un motivo per sapere quali dei tuoi carichi di lavoro possono tollerarlo.
Boreal è l'unico dei due a produrre l'artefatto di cui questo confronto si occupa nominalmente, ed è l'opzione credibile meno costosa sulle tariffe pubblicate per i video pubblicitari in formato breve. Il suo limite è specifico del formato ed è dichiarato dal suo stesso fornitore: preferenza del 60% sulle clip parlanti con una sola persona. Testa quel formato prima degli annunci di prodotto, perché è lì che il margine di miglioramento è più ridotto.
Due cose potrebbero cambiare le cose. Se Alibaba distribuisce i pesi aperti che ha annunciato per Qwen3.8 Max, cambiano sia il prezzo sia la durabilità del modello, e la licenza con cui arriva conterà più della data. E per Boreal, la prima valutazione indipendente — di qualsiasi tipo, da parte di chiunque — sostituirebbe un test del fornitore su 40 casi che attualmente si fa carico dell'intero onere probatorio per un modello venduto in un formato in cui i brand sono insolitamente sensibili a come appare il loro prodotto.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
