Qwen 3.8 vs Claude Fable 5: l'ammiraglia da 2.4T di Alibaba ha finalmente un prezzo
Guides & Insights

Qwen 3.8 vs Claude Fable 5: l'ammiraglia da 2.4T di Alibaba ha finalmente un prezzo

Autore

jinhao song

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Quando Alibaba ha presentato in anteprima Qwen3.8-Max a Shanghai il 19 luglio 2026, ha fatto un'affermazione più forte di tutte le altre: questo modello da 2,4 trilioni di parametri è vicino al livello frontier e dietro solo a Claude Fable 5. All'epoca era impossibile valutarla. Non c'erano listini prezzi, né tabelle di benchmark, né licenze: solo una dichiarazione di posizionamento.

Il 3 agosto 2026, Qwen3.8-Max è diventato generalmente disponibile, e il confronto finalmente ha sostanza da entrambe le parti. Alibaba ha pubblicato prezzi di $2 / $6 per milione di token e una tabella di benchmark con numeri reali. Fable 5 è ancora in cima all'indipendente Artificial Analysis Intelligence Index con un 95,0% certificato su SWE-bench Verified. Quindi la domanda si fa più netta: ora che Qwen ha mostrato i suoi numeri, "secondo solo a Fable 5" regge?

Una nota per gli sviluppatori — il modo più rapido per risolvere una questione come questa è eseguire entrambi i modelli sui tuoi prompt. OrcaRouter mette a disposizione oltre 200 modelli dietro un unico endpoint compatibile con OpenAI, così puoi mettere a confronto Qwen 3.8 Max con Fable 5 sullo stesso compito senza dover configurare due SDK.

Verdetto TL;DR. Qwen3.8-Max alla GA è un contendente molto più forte di quanto suggerisse la sua anteprima — e drammaticamente più economico. A $2 / $6 fissi per 1M di token batte i $10 / $50 di Fable 5 di circa 5× in input e 8× in output, e i suoi numeri auto-dichiarati sono da frontiera (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, FrontierSWE 73.5 contro il 40.7 del predecessore). Ma Fable 5 mantiene la corona per una ragione che non è cambiata da luglio: è l'unico dei due ad avere un arbitro. L'Intelligence Index di Fable, pari a ~60, e il 95.0% su SWE-bench sono stati verificati da terze parti; ogni dato di Qwen è di Alibaba stessa, e né Artificial Analysis né LMArena hanno pubblicato un punteggio per Qwen3.8-Max. Fable 5 vince sul piano delle prove; Qwen 3.8 vince nettamente sul prezzo e, una volta che i pesi saranno rilasciati, sull'apertura.

Punti chiave

Qwen3.8-Max è in GA dal 3 agosto 2026 — non più in anteprima. Pubblicati listino prezzi, API compatibile con OpenAI e DashScope, tabella dei benchmark dei vendor.

Il divario di prezzo è enorme: Qwen a $2 / $6 per 1M contro Fable 5 a $10 / $50. Ciò significa ~5× in input e ~8× in output, e la tariffa di Qwen è fissa su tutto il contesto di 1M di token, senza sovrapprezzo per i prompt lunghi.

Fable 5 rimane l'unica parte sottoposta a audit. ~60 sull'Artificial Analysis Intelligence Index (#1) e 95.0% su SWE-bench Verified, contro Qwen3.8-Max ancora non valutato da nessun valutatore indipendente.

I numeri auto-dichiarati di Qwen sono davvero forti: GPQA Diamond 92.6, PaperBench 93.0, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 — ma sono prodotti dal fornitore, e i laboratori pubblicano i benchmark in cui vincono.

Alibaba non ha mai pubblicato un numero di parametri attivi, quindi il titolo 2.4T dice molto poco sul costo reale di servizio. Anche l'architettura di Fable 5 non è stata divulgata — sulla trasparenza, nessuna delle due parti è irreprensibile.

I pesi aperti sono promessi entro la settimana, più un Qwen3.8-27B che a quanto riferito gira in ~17GB di VRAM. Fable 5 è chiuso e solo API, permanentemente.

Nota sull'accuratezza: tutti i dati di qualità di {{1}}Qwen3.8-Max{{/1}} sono riportati da Alibaba e non sono stati replicati in modo indipendente. I dati di {{2}}Fable 5{{/2}} provengono da Artificial Analysis e Anthropic e possono differire tra i vari tracker. Il prezzo di Qwen è quello della scheda tariffaria GA di Alibaba Model Studio e non è più lo sconto temporaneo di anteprima applicato a luglio.

Specifiche e prezzo, fianco a fianco

Ecco i dati concreti, con ogni cifra attribuita alla sua fonte.

• Produttore / stato — Qwen3.8-Max: Alibaba; GA (3 agosto 2026); Claude Fable 5: Anthropic; ammiraglia GA

• Architettura — Qwen3.8-Max: ~2.4T totali, MoE sparsa (parametri attivi ancora non divulgati); Fable 5: chiuso; architettura non divulgata

• Finestra di contesto — Qwen3.8-Max: 1M token (983.616 con ragionamento; output massimo 131.072); Fable 5: ammiraglia a contesto lungo

• AA Intelligence Index — Qwen3.8-Max: Ancora senza punteggio; Fable 5: ~60 — #1 (Artificial Analysis)

• SWE-bench Verified — Qwen3.8-Max: Non riportato (Alibaba riporta invece FrontierSWE 73.5); Fable 5: 95.0% (Anthropic / buildfastwithai)

• Punti di forza dichiarati dal fornitore — Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, PaperBench 93.0, OSWorld-Verified 86.1 (tutti dichiarati da Alibaba); Fable 5: verificato #1 assoluto

• Prezzi (in / out) — Qwen3.8-Max: $2.00 / $6.00 per 1M, fisso su 1M di contesto; input in cache $0.25; Fable 5: $10 / $50 per 1M

• Pesi aperti — Qwen3.8-Max: Promesso entro la settimana (ancora nessuna licenza); Fable 5: No — chiuso / solo API

• Multimodalità — Qwen3.8-Max: testo, immagine, video in input → testo in output; Fable 5: modello di punta multimodale

Due cose inquadrano l'intero confronto, ed entrambe sono cambiate il 3 agosto.

Prima, la colonna dei prezzi è ora l'elemento più vistoso della pagina. A luglio, il vantaggio di costo di Qwen era un coupon di sconto: 90% di sconto sui crediti, temporaneo, senza una tariffa per token su cui pianificare. Ora è un tariffario, e il divario è strutturale, non promozionale. Con un output a 6 $ contro i 50 $ di Fable, puoi effettuare circa otto chiamate Qwen al prezzo di una chiamata Fable. Per qualsiasi carico di lavoro in cui si paga per il volume anziché per la singola risposta più difficile, quel rapporto cambia l'architettura di ciò che costruisci.

In secondo luogo, la colonna dei benchmark non è più vuota — ma non è nemmeno comparabile. Questa è la sottigliezza che conta di più. Questi sono benchmark diversi con curve di difficoltà diverse, e confrontare 73.5 con 95.0 come se misurassero la stessa cosa sarebbe chiaramente fuorviante. Quello che possiamo dire è più limitato e più onesto: il punteggio di Fable 5 è stato prodotto da una terza parte in condizioni che altri possono verificare, e quello di Qwen è stato prodotto da Alibaba su un'infrastruttura che nessun altro ha eseguito. Finché Artificial Analysis o LMArena non pubblicano un punteggio per Qwen3.8-Max, la lettura corretta è invariata da luglio — plausibilmente vicino, ma ancora non dimostrato.

Cosa ti dà realmente la differenza di prezzo

Gli esempi astratti sono meno utili di un esempio svolto, quindi eccone uno. Prendete un agente di revisione del codice che invia 150.000 token di contesto del repository e genera 6.000 token di revisione per chiamata.

Qwen3.8-Max: 0,15M × $2 = $0,30, più 0,006M × $6 = $0,036. ≈ $0,34 per chiamata.

Claude Fable 5: 0.15M × $10 = $1.50, più 0.006M × $50 = $0.30. ≈ $1.80 per chiamata.

• A 2.000 chiamate/giorno: Qwen ≈ $672 al giorno; Fable ≈ $3.600 al giorno. In un mese, ciò equivale a circa $20.000 contro $108.000.

• Con la cache di prompt su un contesto di repository stabile, l'input nella cache di Qwen a $0.25/1M riduce il lato input da $0.30 a meno di $0.04, portando la chiamata a ≈ $0.08 — circa 22 volte più economico di Fable per chiamata.

Non è un risparmio marginale; è la differenza tra far girare un revisore su ogni pull request e farlo girare solo su quelle rischiose. E il contesto a tariffa fissa di Qwen rafforza questo effetto man mano che i prompt crescono: poiché Alibaba non applica alcun sovrapprezzo per prompt lunghi, inviare un contesto da 900.000 token costa lo stesso per token di uno da 5.000 token.

Il giusto contrappeso è che il prezzo per token non è il prezzo per compito risolto. Se Fable 5 risolve un problema in un'unica passata dove un modello più economico richiede tre tentativi più correzione umana, il modello più economico potrebbe costare di più in aggregato — e sui compiti di ragionamento più difficili, il ranking #1 certificato di Fable è la migliore evidenza disponibile che risolve di più in un'unica passata. L'argomento del costo a favore di Qwen è più forte su carichi di lavoro ad alto volume e tolleranti, e più debole su quelli a basso volume e ad alta posta in gioco.

Prova, e perché decide ancora questo matchup

Le prove pratiche più citate per Qwen3.8-Max provengono da una recensione del periodo di anteprima (thomas-wiegold.com) che ha sottoposto il modello a quattro build reali. I risultati sono stati davvero impressionanti: Qwen ha risolto al primo colpo una simulazione di poker Go — solo il terzo modello in assoluto a superare quel prompt in un'unica passata, insieme a Fable 5 e Grok 4.5 — e su un prompt per un sito web di torrefazione ha prodotto il miglior output che il recensore avesse mai visto da quel test, aggiungendo un carrello non richiesto, una sezione all'ingrosso e l'integrazione con Instagram per pura meticolosità.

Il problema era la velocità: 30+ minuti sul sito web e 1 ora e 20 minuti sulla simulazione di poker, il che lo rendeva il modello più lento che quel recensore avesse mai usato. Questa constatazione richiede una precisazione che a luglio non era necessaria. È stata misurata su infrastruttura di anteprima, da un singolo recensore, su esecuzioni agentiche insolitamente lunghe. Il serving GA è un sistema diverso. Per quel che vale, la telemetria a 7 giorni di OrcaRouter attualmente mostra un p50 time-to-first-token di 1,64 secondi per Qwen3.8-Max — una misurazione di prima parte, anche se TTFT e throughput end-to-end su build di un'ora sono quantità diverse. La posizione onesta è che il rilievo di lentezza in anteprima andrebbe ritestato piuttosto che ripetuto come dato attuale.

Ciò che non è cambiato è l'asimmetria delle prove. La tabella dei benchmark GA di Alibaba è un reale miglioramento rispetto a non pubblicare nulla, ma è comunque un artefatto del fornitore: i laboratori scelgono quali benchmark riportare, e il numero più debole riportato da Alibaba stesso — IFBench 82.8, instruction-following — capita di allinearsi esattamente con la lamentela dell'anteprima secondo cui il modello fornisce più del richiesto e ignora l'ambito. Fable 5, invece, viene valutato da un valutatore che non ha alcun interesse nell'esito. Sulla questione "quale modello gestirà un lavoro che non posso permettermi di sbagliare", questa differenza non è un dettaglio tecnico. È la base stessa della scelta.

Apertura: l'asse su cui Qwen potrebbe vincere in modo permanente.

Fable 5 non sarà mai auto-ospitabile. Qwen3.8-Max potrebbe esserlo, e Alibaba ora dice che i pesi arriveranno entro la settimana. Ma due avvertenze meritano pari peso.

Il primo è di natura legale: non c'è ancora alcun testo di licenza né una model card. "Open weights coming" non è una concessione di diritti commerciali finché non esiste un documento da leggere, e sarà la licenza a decidere se il rilascio sia utilizzabile o meno in un prodotto.

Il secondo è fisico. Un modello da 2.4T equivale a circa 1.2TB con quantizzazione a 4 bit, contro circa 141GB per H200 — otto o più acceleratori di fascia alta prima di servire un token. E poiché Alibaba non ha ancora divulgato il numero di parametri attivi, non puoi nemmeno stimare il throughput che quell'esborso comprerebbe. Per quasi ogni team, l'hosting autonomo del modello di punta non è una vera opzione.

Il che rende Qwen3.8-27B — annunciato in contemporanea, anch'esso open-weight, che secondo quanto riportato gira con ~17GB di VRAM — la release più importante dal punto di vista pratico. Se il motivo per cui preferisci Qwen a Fable 5 è la residenza dei dati o il controllo on-premise piuttosto che la capacità grezza, il 27B è il modello che lo offre davvero. Confrontare il modello di punta da 2.4T con Fable 5 in termini di apertura è per lo più teorico; confrontare il 27B in termini di apertura è concreto.

Domande frequenti

Qwen 3.8 è migliore di Claude Fable 5?

Non sulla base delle prove esistenti. La tabella dei benchmark GA di Alibaba è solida (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6), ma ogni numero è auto-dichiarato e nessun ente indipendente ha valutato il modello. Fable 5 detiene un Intelligence Index di ~60 certificato (#1) e il 95.0% SWE-bench Verified. Fable 5 è in testa per le prove; Qwen 3.8 domina nettamente sul prezzo.

È vera l'affermazione "dietro solo a Fable 5"?

Rimane il posizionamento di Alibaba stesso. GA ha portato una tabella di benchmark ma non una verifica di terze parti — Artificial Analysis e LMArena sono entrambi ancora non valutati. Per riferimento, il predecessore Qwen3.7-Max ha ottenuto 46 sull'AA Intelligence Index contro i ~60 di Fable 5, quindi l'affermazione richiede un salto generazionale molto ampio per essere letteralmente vera.

Quanto è più economico Qwen 3.8 rispetto a Fable 5?

Sostanzialmente, ed è ora una tariffa reale piuttosto che uno sconto. Qwen3.8-Max costa $2 / $6 per 1M di token contro i $10 / $50 di Fable 5 — circa 5× più economico in input e 8× in output. La tariffa di Qwen è anche piatta su tutto il contesto di 1M, e l'input in cache a $0,25/1M rende i carichi di lavoro con contesto ripetuto ancora più convenienti.

Qwen 3.8 Max è uscito dall'anteprima?

Sì. Ha raggiunto la disponibilità generale il 3 agosto 2026 con un listino prezzi pubblicato e un endpoint compatibile con OpenAI e DashScope. La campagna crediti Qoder e la presentazione dell'anteprima con sconto del 90% circolate a luglio non descrivono più come viene venduto il modello.

Qwen 3.8 è ancora il modello più lento, come dicevano le prime recensioni?

Questo risultato è emerso da un revisore su un'infrastruttura di anteprima che eseguiva build agentiche di un'ora, e dovrebbe essere ritestato contro il servizio GA piuttosto che essere trattato come un fatto attuale. La telemetria di OrcaRouter su 7 giorni mostra un p50 del tempo al primo token di 1,64 secondi, sebbene ciò misuri la latenza del primo token e non la produttività su build molto lunghe.

Posso auto-ospitare Qwen 3.8 invece di pagare per Fable 5?

Non ancora, e probabilmente non il modello di punta. I pesi sono promessi entro la settimana, ma non c'è ancora una licenza; e con ~1,2 TB in 4 bit servirebbero otto o più GPU di classe H200. Il contemporaneamente annunciato Qwen3.8-27B, con circa 17 GB di VRAM, è il percorso realistico per l'hosting autonomo. Fable 5 è chiuso definitivamente.

Quale dovrei usare oggi?

Fable 5 per lavori in cui una risposta sbagliata è costosa e serve un'affidabilità verificata — ragionamento complesso, percorsi di produzione ad alto rischio. Qwen3.8-Max per lavoro ad alto volume in cui il vantaggio del prezzo di output 8× si accumula: revisione di codice in blocco, analisi di documenti lunghi, qualsiasi cosa in cui puoi tollerare la verifica. Molti team dovrebbero usare entrambi e instradare in base al valore dell'attività.

Il risultato finale

Qwen 3.8 vs Claude Fable 5 è un confronto sostanzialmente diverso da quello di due settimane fa. Qwen3.8-Max non è più un'anteprima con un coupon — è un modello generalmente disponibile, con un listino prezzi che sottocosta Fable 5 di 5× in input e 8× in output, piatto su un milione di token, con numeri auto-dichiarati che sembrano da frontiera e un balzo nel coding rispetto al suo predecessore che sarebbe notevole se si replicasse.

Ma Fable 5 mantiene la corona, e per esattamente la stessa ragione per cui la manteneva a luglio: è il lato con un arbitro. Un #1 Intelligence Index sottoposto a verifica e un 95,0% su SWE-bench Verified sono affermazioni controllate da qualcun altro. La tabella di Alibaba, per quanto solida, è di Alibaba. Osservate due eventi: il primo punteggio Intelligence Index indipendente per Qwen3.8-Max e il rilascio dei pesi con una licenza allegata. Se entrambi andranno a favore di Qwen, "dietro solo a Fable 5" smetterà di essere marketing. Fino ad allora, la risposta sensata non è scegliere un vincitore, ma dividere in base alla posta in gioco — Fable dove non puoi sbagliare, Qwen dove non puoi permetterti di essere costoso — e testare entrambi sui tuoi stessi prompt.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

Contattaci

Unisciti alla community

DiscordEmailXGitHubYouTube