Una card del titolo generata che riporta «Boreal vs Qwen3.8 Max» con il sottotitolo «La riga che ogni fornitore spera che tu salti», icone a linea piatta di un riquadro di riproduzione video, una scheda dei punteggi con una riga evidenziata e una lente d'ingrandimento, con il logo OrcaRouter sovrapposto in basso a destra.
Guides & Insights

Boreal vs Qwen3.8 Max: La riga che ogni fornitore spera che tu salti

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Ogni lancio di modello pubblica una scheda di numeri, e ogni scheda ha una riga sulla quale il fornitore preferirebbe che non vi soffermiate. Per Qwen3.8 Max, rilasciato il 3 agosto 2026, le righe lusinghiere sono facili da trovare: ha conquistato il primo posto nella classifica front-end di CodeArena con 1.691 punti, ha raggiunto un Artificial Analysis Agentic Index di 58, eguagliando Claude Opus 5 ad alto sforzo — il più vicino che un laboratorio cinese fosse mai arrivato alla vetta di quella classifica — e ha ottenuto un punteggio GDPval-AA di 1.739 Elo, davanti a GPT-5.6 Sol. La riga sotto di esse è più difficile da leggere. Nella stessa suite del valutatore, l'allucinazione misurata è salita dal 23% della generazione precedente al 40%, e il punteggio di recupero su contesto lungo del modello è calato di due punti. Boreal, il modello di video pubblicitari di Creatify, lanciato il 15 settembre 2026 a un centesimo al secondo, ha una riga dello stesso tipo sulla propria scheda — ed è più specifica, perché il fornitore l'ha pubblicata.

Nessuna delle due righe è squalificante. Entrambe sono più informative dei punteggi principali, ed è per questo che vale la pena affiancarle invece di confrontare i banner.

Ciò in cui Qwen3.8 Max è davvero il migliore

Le vittorie sono reali e non sono piccole.

Qwen3.8 Max è un modello mixture-of-experts da 2,4 trilioni di parametri con circa 95 miliardi di parametri attivi per token, ed è il primo Qwen della classe Max che Alibaba ha dichiarato verrà rilasciato con pesi aperti — annunciato per la settimana del 10 agosto 2026 senza licenza né data definitiva, un dettaglio degno di nota perché l'annuncio non è il rilascio. Ha una finestra di contesto di 1M token con un limite di output di 131.072 token, e accetta testo, immagini e video come input. Quest'ultimo punto merita enfasi in questo particolare confronto: dei quattro modelli testuali di frontiera che questa serie contrappone a Boreal, Qwen3.8 Max è uno dei soli due a cui si può consegnare una clip video finita e porre una domanda al riguardo.

Il prezzo è aggressivo in un modo che ha rimodellato il segmento. A 2,00 $ per milione di input e 6,00 $ per milione di output, con le letture dalla cache a 0,25 $, batte la generazione precedente di circa il 20% pur raddoppiando la lunghezza massima dell'output. Nella nostra tabella questo si attesta a 2,00 $ e 6,00 $, un contesto di 1M token, un p50 del tempo al primo token di 10,00 secondi — il tetto riportato dalla nostra strumentazione, quindi va letto come "lento" più che come un valore preciso — e 183,0 milioni di token di traffico negli ultimi sette giorni.

E la riga sottostante

Ecco la parte che non finisce nel titolo del post di lancio.

La valutazione indipendente di Artificial Analysis ha registrato due regressioni tra Qwen3.7-Max e Qwen3.8 Max. La sua misura di recupero su contesto lungo è scesa di due punti. La sua misura di onniscienza è calata di dieci, e il tasso di allucinazioni misurato dal valutatore è salito dal 23% al 40%. Allo stesso tempo, il costo per attività del modello sull'indice di intelligenza è aumentato da 0,53 $ a 1,14 $ — ha richiesto circa 64 turni per attività, mentre il suo predecessore ne richiedeva 14.

Leggendoli insieme, emerge un quadro coerente. Qwen3.8 Max è un modello che è migliorato nelle cose che i benchmark con un'unica risposta corretta possono misurare — codice, completamento di compiti agentici, risoluzione strutturata di problemi — ed è peggiorato in ciò che è più difficile da valutare: sapere quando non sa. Un modello che delibera di più e allucina di più non si contraddice. Tracce di ragionamento più lunghe creano più occasioni di cadere in una risposta sbagliata e sicura di sé, e un benchmark che premia il completamento di un compito non penalizza questo finché il compito non ha un invariante nascosto da violare.

Per un acquirente, la conseguenza pratica è limitata e specifica. Se il tuo utilizzo del modello è la generazione di codice o un flusso di lavoro agentico in cui una risposta sbagliata fallisce in modo evidente — un test fallisce, una build si rompe — le regressioni sono in gran parte invisibili e i guadagni sono tutto ciò che conta. Se il tuo utilizzo è il recupero di informazioni, il riassunto, o qualsiasi cosa in cui una risposta sbagliata ma fluente raggiunge un essere umano senza un controllo, il salto da 23 a 40 è il numero che dovrebbe decidere la tua valutazione, non il posizionamento su CodeArena.

La riga peggiore della stessa Boreal, pubblicata dal fornitore

Il contrasto che rende utile questo accostamento è che Creatify ha fatto qualcosa che la maggior parte dei fornitori non fa: ha messo il suo risultato più debole nello stesso post di quello più forte.

Boreal è stato testato in cieco contro il suo stesso modello base non modificato, con prompt, risoluzione, numero di fotogrammi e seed mantenuti fissi, su 40 casi di produzione. Creatify riporta una preferenza dell'81% per Boreal — 25 a 6 con 9 pareggi, test del segno p<0,001 — e poi scompone quella media. Annunci di prodotto: 83%. Scene creator e UGC: 85%. Clip con una sola persona che parla: 60%.

Quell'ultima cifra è la riga. I talking heads sono tra i formati più comuni nella pubblicità direct-response, ed è il formato in cui il vantaggio del modello rispetto alla propria base è più esile — appena meglio del lancio di una monetina rispetto a un modello che nessuno avrebbe mai rilasciato. Il rendering è dichiarato a 1:1 con il tempo reale in classe 720p, e la conservazione dei dettagli fini è migliorata dell'11,3% con p=0,004, quindi il quadro d'insieme è davvero positivo. La suddivisione ti dice semplicemente per quale metà della categoria è stato ottimizzato questo modello, e non è la metà con una persona che parla in camera.

Nota anche che tipo di prova costituisca ciascuna di queste righe. La regressione di Qwen3.8 Max è stata rilevata da un valutatore indipendente che eseguiva il proprio sistema di test. La riga debole di Boreal è stata divulgata dal fornitore, in un test progettato ed eseguito dal fornitore stesso. La seconda è più affidabile come affermazione di fatto e meno informativa come confronto, perché non c'è alcun numero indipendente da nessuna parte nel file di Boreal.

A generated two-column scoreboard for Boreal vs Qwen3.8 Max sharing six dimension labels. Boreal reads output rendered video, input text or one image, meter $0.01 per second, context not published, latency 1:1 realtime, independent score none yet. Qwen3.8 Max reads output text 131K max, input text image video, meter $2 / $6 per 1M, context 1M tokens, latency p50 10.00s TTFT, independent score AA Index 58 with 2 regressions. Footer reads "Boreal figures vendor-run and unreproduced; Qwen3.8 Max per our catalogue and Artificial Analysis."

Il contrasto delle specifiche

• Output — Boreal: video renderizzato, classe 720p, da testo a video e da immagine a video. Qwen3.8 Max: solo testo, fino a 131.072 token.

• Input — Boreal: un prompt testuale o un'immagine statica. Qwen3.8 Max: testo, immagini e video.

• Prezzo — Boreal: 0,01 $ al secondo di video finito. Qwen3.8 Max: 2,00 $ per 1M di input / 6,00 $ per 1M di output, letture dalla cache a 0,25 $.

• Contesto — Boreal: non pubblicato. Qwen3.8 Max: 1M token in ingresso, 131K in uscita.

• Latenza — Boreal: dichiarata a 1:1 con il tempo reale. Qwen3.8 Max: tempo p50 al primo token di 10,00 secondi sulla nostra scheda.

• Pesi — Boreal: proprietari, di proprietà di Creatify e da essa erogati. Qwen3.8 Max: proprietario al lancio; Alibaba ha annunciato un rilascio a pesi aperti per il primo Qwen di classe Max, senza licenza né data confermate.

• Prove — Boreal: test in cieco su 40 casi condotto dal fornitore, nessuna valutazione indipendente. Qwen3.8 Max: copertura di benchmark indipendente che include due regressioni misurate, insieme a righe del fornitore di 86,1 su OSWorld-Verified e 86,6 su Terminal-Bench 2.1.

Quanto vale una regressione per chi acquista

Le regressioni nelle classifiche di solito vengono considerate quisquilie. Sono più vicine a essere la cosa più rilevante per le decisioni che un benchmark pubblica, perché sono le uniche righe che ti dicono a cosa un fornitore ha rinunciato.

La mossa utile non è leggere l'una o l'altra scheda, ma eseguire entrambi i modelli sul proprio traffico — e l'ostacolo pratico è che di norma questo comporta due contratti, due SDK e due rapporti di fatturazione, una frizione sufficiente a far sì che la maggior parte dei team salti il test e acquisti invece in base al punteggio principale.

Quell'attrito è la parte che un livello di routing elimina. Qwen3.8 Max è nel nostro catalogo accanto alla generazione precedente, quindi confrontarli sul tuo set di valutazione è una modifica di una riga alla stringa del modello anziché un ciclo di approvvigionamento, e la stessa chiave raggiunge il resto del catalogo quando il confronto indica che vuoi un modello diverso per una fase diversa della pipeline. Si colloca a tariffa di listino del provider con 0% di markup, il che qui conta per un motivo specifico: Qwen3.8 Max è arrivato circa il 20% più economico della generazione che ha sostituito, e un ricalcolo dei prezzi da parte del fornitore di questo tipo è il genere di cosa che dovrebbe arrivare sulla tua fattura quando accade, anziché al rinnovo successivo.

Boreal non è nel nostro catalogo. OrcaRouter non fornisce modelli di generazione video, e nulla di quanto qui scritto deve essere interpretato come un'affermazione contraria. Ciò che forniamo è il livello che sta sopra — i testi, le varianti, la verifica di conformità, l'analisi di ciò che ha performato — e a due dei modelli di questa serie, tra cui Qwen3.8 Max, si può affidare la clip finita da rivedere.

A screenshot of Creatify's own launch post for Boreal, dated September 15 2026 and headed "Introducing Boreal: frontier-quality AI video at a cent a second", showing the Boreal by Creatify Labs logo card and the opening paragraph stating that Boreal generates text-to-video and image-to-video at one cent per second, about $0.05 for a five-second clip, and renders in realtime.

Come leggere una delle due carte

Qwen3.8 Max è l'acquisto migliore se il tuo lavoro è codice, agenti o ragionamento strutturato, a un prezzo inferiore a quello del suo stesso predecessore, e le due regressioni indipendenti sono il motivo per testarlo sul tuo traffico di recupero e riepilogo prima di instradarvi la produzione. Il dato del 40% di allucinazioni non è un motivo per evitare il modello; è un motivo per sapere quali dei tuoi carichi di lavoro possono tollerarlo.

Boreal è l'unico dei due a produrre l'artefatto di cui questo confronto si occupa nominalmente, ed è l'opzione credibile meno costosa sulle tariffe pubblicate per i video pubblicitari in formato breve. Il suo limite è specifico del formato ed è dichiarato dal suo stesso fornitore: preferenza del 60% sulle clip parlanti con una sola persona. Testa quel formato prima degli annunci di prodotto, perché è lì che il margine di miglioramento è più ridotto.

Due cose potrebbero cambiare le cose. Se Alibaba distribuisce i pesi aperti che ha annunciato per Qwen3.8 Max, cambiano sia il prezzo sia la durabilità del modello, e la licenza con cui arriva conterà più della data. E per Boreal, la prima valutazione indipendente — di qualsiasi tipo, da parte di chiunque — sostituirebbe un test del fornitore su 40 casi che attualmente si fa carico dell'intero onere probatorio per un modello venduto in un formato in cui i brand sono insolitamente sensibili a come appare il loro prodotto.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing Qwen3.8 Max by Qwen dated 2026-08-03 marked Featured, a 1M-token context, text + image + video input with text output, a p50 time to first token of 10.00 seconds, input $2.00 and output $6.00 per 1M tokens, and 183.0M tokens of traffic in the last 7 days.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno