
Ling-3.1-flash vs Qwen3.8-Flash: due modi per costruire un tier veloce, e solo uno dei due viene rilasciato
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 262 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- xAISpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
Due laboratori cinesi hanno esaminato lo stesso problema quest'autunno — come si costruisce un modello economico e veloce che sia abbastanza buono da stare dentro un ciclo di agenti — e sono arrivati a risposte opposte. Ling-3.1-flash, annunciato da Ant Group il 30 settembre 2026, è un mixture-of-experts da circa 560 miliardi di parametri che attiva circa 25 miliardi di parametri per token, con una finestra di contesto dichiarata fino a 1 milione di token e l'intenzione dichiarata di rendere open source "presto". Qwen3.8-Flash, rilasciato dal team Alibas Qwen il 26 agosto 2026, è un mixture-of-experts multimodale da 125 miliardi di parametri che attiva circa 6 miliardi di parametri per token, con pesi già su Hugging Face con il nome Qwen3.8-Flash-Next, un modello di produzione attivo sull'API QwenCloud a $0,15 per milione di token di input e $0,47 per milione di output, e supporto day-0 in SGLang. Un laboratorio ha scalato verso l'alto e ha annunciato. L'altro si è ridotto e ha spedito. Questa differenza è più istruttiva di qualsiasi benchmark pubblicato da entrambi i laboratori.
È anche il motivo per cui questa comparazione va letta con attenzione. Ling-3.1-flash non ha pesi, né licenza, né model card, né prezzo API, né valutazione indipendente; l'intero resoconto pubblicato è un post di annuncio, una tabella di benchmark del fornitore e uno slot nel prodotto Ling Studio di Ant. Qwen3.8-Flash ha tutte queste cose e un vantaggio di quattro settimane nell'essere eseguito da persone che non lavorano per Alibaba. Confrontare una scelta architetturale è equo. Confrontare le capacità non lo è, non ancora.
Le due decisioni progettuali, e perché divergono
La scommessa di Qwen è che il livello veloce debba essere strutturalmente diverso dal modello di punta, non semplicemente più piccolo. Qwen3.8-Flash attiva 6 miliardi dei suoi 125 miliardi di parametri — una sparsità di circa il 95% — e trae le sue capacità da dove viene indirizzata la potenza di calcolo, piuttosto che dall'ampiezza grezza. Alibaba è stata esplicita: l'architettura sottostante, che abbina Gated DeltaNet a Qwen Sparse Attention e a una tabella di embedding N-gram, è un'anteprima della generazione Qwen4, pubblicata in anticipo di proposito affinché motori di inferenza, strumenti di quantizzazione e pattern di deployment possano maturare attorno a essa prima che i modelli costosi vengano costruiti su di essa. Il risultato è un modello economico per token per costruzione: circa 6 miliardi di parametri di lavoro su ogni token, a un prezzo che Alibaba ha fissato a 0,15 $ in input e 0,47 $ in output per milione di token.
La scommessa di Ant, per quanto l'annuncio lascia intendere, è più vicina a uno scaling convenzionale con un contesto molto lungo. Ling-3.1-flash mantiene una grande frazione attiva — circa 25 miliardi di parametri per token su 560 miliardi, quindi circa uno su ventidue — e dichiara una finestra fino a 1 milione di token, quattro volte quella servita dalla precedente generazione di Ling. L'app Ling Studio lo descrive come pensato per «agenti generici, ricerca, lavoro d'ufficio di routine e sviluppo di software/codice», un posizionamento di fascia rapida, ma l'economia dei parametri è quella di un modello molto più pesante. A parità di input, un token che attraversa 25B parametri attivi costa circa quattro volte il calcolo di uno che ne attraversa 6B, prima ancora che entri in gioco qualsiasi decisione sui prezzi.
Nessuno dei due approcci è sbagliato, ed entrambi sono risposte difendibili alla domanda «che cosa limita un modello economico». Qwen scommette che la sparsità e un nuovo stack di attenzione siano il tetto. Ant scommette che il tetto siano il contesto e la conoscenza del mondo, e che possa permettersi la potenza di calcolo. Ciò che li distingue per un lettore non è la filosofia progettuale, ma la distribuzione: un progetto che puoi scaricare e misurare contrapposto a un progetto di cui puoi solo leggere.

Quanto ti costa ciascuno, e cosa significa in pratica
Il divario di prezzo non è sottile e non è esiguo. Qwen3.8-Flash è pubblicato a $0,15 per milione di token di input, $0,47 per milione di output e $0,018 per milione sulle letture dalla cache — gli stessi numeri sull'annuncio di Alibaba, sulla model card di produzione del fornitore e sulla pagina del modello instradato che serviamo, che è ciò che appare un pass-through a markup 0% quando lo si verifica rispetto a tre fonti. Ant non ha pubblicato alcuna tariffa per Ling-3.1-flash — nessun prezzo API, nessuno sconto cache, nulla di comparabile. L'unica cifra pubblicata per la linea Ling è quella della generazione precedente, che è listata a $0,075 in input e $0,22 in output per milione, all'incirca la metà della tariffa di input di Qwen e meno della metà della sua tariffa di output. Se il nuovo tier Ling viene prezzato vicino a dove si trovava quello vecchio, batterebbe Qwen3.8-Flash sulla carta; se viene prezzato anche solo lontanamente vicino al calcolo che i suoi 25B parametri attivi implicano, non lo farà. In ogni caso è una supposizione, perché il numero non esiste.
Il contesto è l'ambito in cui la dichiarazione di Ling è realmente più ampia. Ant dichiara fino a 1 milione di token per Ling-3.1-flash; Qwen3.8-Flash viene fornito con un contesto predefinito da 1M token sull'API di produzione e una finestra nativa da 262.144 token sui pesi aperti, estendibile. Due riserve gravano sul dato di Ling e nessuna delle due è chiusa. In primo luogo, "fino a 1M" è una specifica, non una misurazione: nessuno ha pubblicato il comportamento di recupero su contesto lungo per un modello che nessuno al di fuori di Ant può chiamare. In secondo luogo, la generazione precedente di Ling presentava esattamente lo stesso divario tra la finestra pubblicizzata e la storia architetturale che ne stava alla base, e la risposta è arrivata solo quando i pesi, il formato e i limiti di contesto sono stati finalmente pubblicati. Il 1M in evidenza è una promessa. Il 1M di Qwen3.8-Flash è un valore predefinito servito con cui puoi confrontare la dichiarazione di Ant.
Perché "preview" è la parola onesta da un lato di questo
Il modo in cui Alibaba stessa presenta Qwen3.8-Flash è quello di un'anteprima architetturale distribuita sotto un nome di produzione — i pesi aperti portano il suffisso "Next" proprio perché nessuno confonda il prototipo con il modello di serving ottimizzato. Quella impostazione è stata validata dai fatti più che dal marketing: SGLang ha reso disponibile il supporto day-0 per Qwen3.8-Flash-Next il giorno del rilascio, con il modello configurato anche per Transformers, vLLM e TokenSpeed, e da allora i pesi sono stati adottati dalle comunità di quantizzazione. Le versioni sono rapidamente diventate ordinarie, che è l'aspetto che ha un modello ormai distribuito.
L'annuncio di Ant ha la stessa forma un passo prima: una pubblicazione di specifiche in anticipo rispetto al rilascio, con l'esplicita dichiarazione che il modello sarà reso open source a breve. Questo è un modo legittimo di lanciare — Ling-3.0-flash ha seguito esattamente quel percorso a luglio, e i pesi sono stati pubblicati con licenza MIT il 7 agosto, circa due settimane dopo. Ma lo stato dei due progetti oggi non è paragonabile, e non c'è lettura di grafici che possa colmare il divario. Vale la pena essere specifici su ciò che un esterno può apportare a ciascuno.
Che cosa è verificabile in modo indipendente per Ling-3.1-flash oggi: che l'annuncio esiste ed è datato 30 settembre; che i valori di parametri, parametri attivi e contesto sono di Ant; che il modello compare nel prodotto Ling Studio di Ant; e che non sono stati pubblicati pesi, licenza o scheda del modello. Che cosa è verificabile in modo indipendente per Qwen3.8-Flash: che i pesi sono scaricabili in BF16 e FP8; che i termini della licenza sono leggibili; che il prezzo dell'API è pubblicato; e che le dichiarazioni di benchmark di Alibaba sono aperte alla riproduzione da fine agosto. La seconda lista è più lunga, e questo è l'intero confronto in miniatura.

Come i due verrebbero effettivamente valutati
Ant ha pubblicato una scheda di benchmark con Ling-3.1-flash che lo mette a confronto con GPT-5.6 Sol, Claude Opus 5, Kimi K3, due varianti GLM e DeepSeek-V4.1-Flash, con cifre di punta di 1.673 Elo su GDPVal-AA v2.1, 75,16 su FrontierSWE e 65,35 su HealthBench Professional. Due problemi sono presenti su quella scheda prima ancora che qualcuno discuta i numeri. Il primo è l'insieme di confronto: entrambi i modelli di frontiera scelti da Ant sono indietro di una generazione, dato che Claude Opus 5.5 e GPT-6 Sol sono diventati disponibili il 22 settembre 2026 e ora sono instradabili, il che significa che la scheda mette a confronto un modello di ottobre con la frontiera di luglio invece di quella attuale. Il secondo è una nota a piè di pagina sulla scheda stessa, che afferma che il risultato di HealthBench Professional proviene dall'"ambiente AQ" e che le capacità sanitarie del modello possono attualmente essere sperimentate solo in AQ — un ambiente che nessuna documentazione pubblica definisce. Un punteggio di punta il cui ambiente di valutazione non è nominato non è riproducibile nemmeno in linea di principio.
Le affermazioni comparabili di Qwen3.8-Flash, al contrario, sono state fatte quando i pesi erano già stati rilasciati, e Alibaba ha puntato il proprio posizionamento su un'affermazione che chiunque può mettere alla prova: che la capacità nasce dal rapporto di sparsità, non dal numero di parametri. Quattro settimane di utilizzo non sono un verdetto, ma sono abbastanza lunghe perché le affermazioni abbiano smesso di essere incontestate — che è lo stato utile per un modello.
Cosa fare davvero con questo, oggi
Per chi costruisce, la separazione pratica è semplice. Ling-3.1-flash non è un componente che si può adottare questa settimana: non c'è un endpoint da chiamare, né pesi da ospitare, né una licenza da verificare, né un prezzo su cui basare il budget. Qualunque cosa si riveli essere il modello finale, la mossa utile in questo momento è impostare un trigger — pesi pubblicati, licenza permissiva, un punteggio indipendente su FrontierSWE che sia vicino a 75.16 — e tornarci sopra. La storia stessa della generazione precedente mostra che i pesi possono arrivare due settimane dopo l'annuncio, quindi quel trigger potrebbe scattare rapidamente.
Qwen3.8-Flash è già un componente. È attivo nel nostro catalogo come modello instradato al prezzo di listino del provider, senza alcun ricarico — la scheda del modello instradato riporta $0.15 in ingresso, $0.47 in uscita e $0.018 per milione di letture in cache, gli stessi valori che Alibaba pubblica, ovvero ciò che una politica di ricarico dello 0% significa nella pratica anziché in una slide. Dietro un'unica chiave si trova accanto a Claude Opus 5, GPT-5.6 Sol e DeepSeek-V4.1-Flash, così il confronto che Ant sta invitando a fare — un candidato contro la frontiera attuale — può essere eseguito puntando una configurazione su due route anziché mantenere due integrazioni, con il failover automatico che gestisce il weekend in cui un provider vacilla. Questa è la differenza tra una discussione di architettura e un esperimento.
Il verdetto, per quanto se ne possa dare uno: Qwen ha fatto la scommessa architetturale più audace e ha avuto la sicurezza di pubblicarla presto e lasciare che la gente la smontasse. Ant ha fatto la scommessa più pesante — più parametri, più calcolo attivo per token, più contesto — e finora ha pubblicato un grafico invece di un modello. Il grafico sembra buono. Il grafico è anche l'unica cosa che chiunque abbia.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
