
Ling-3.1-flash raggiunge 41 sull'Artificial Analysis Intelligence Index: il MoE da 560B raddoppia il suo predecessore
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Ling-3.1-flash, il mixture-of-experts da 560 miliardi di parametri di Ant Group, ora porta un numero che il suo stesso laboratorio non ha scritto: 41 sull'Artificial Analysis Intelligence Index. L'indice è gestito dal valutatore indipendente, su hardware che il valutatore controlla, contro una suite fissa — e colloca il modello 21 punti sopra il suo diretto predecessore, Ling-3.0-flash, che sullo stesso indice resta a 20. Ant ha annunciato Ling-3.1-flash alla fine di settembre 2026, Artificial Analysis data il rilascio al 1° ottobre, ed è tre mesi più giovane del modello di cui raddoppia il punteggio.
Quel divario è la storia. Un movimento di 21 punti su un indice composito alimentato da dieci valutazioni diverse non è il tipo di cosa che un grafico di un fornitore possa falsificare, e non è il tipo di cosa di cui questo blog avrebbe potuto scrivere due settimane fa, quando l'unica misura esistente di Ling-3.1-flash era la scheda di benchmark della stessa Ant: 1.673 Elo su GDPval-AA v2.1, 75,16 su FrontierSWE, 65,35 su HealthBench Professional. Quei numeri erano affermazioni reali fatte da un laboratorio reale, ma non riprodotte. Il 41 è di natura diversa. È il primo dato, in questa release, a cui una terza parte possa essere chiamata a rispondere.
Cosa misura davvero il 41
L'Artificial Analysis Intelligence Index v4.3.2 è un composito ponderato di dieci valutazioni: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience e AA-LCR v1.1. Leggere un composito in isolamento è un errore, quindi le righe per singola valutazione contano più del dato principale:
• GDPval-AA — 1.621,75 per Ling-3.1-flash contro 948,35 per Ling-3.0-flash. Questo è il salto singolo più ampio dell'insieme ed è quello su cui si basa gran parte della variazione dell'indice.
• GDP.pdf — 0,100 all-pass, in crescita da 0,054. Ancora basso in termini assoluti, ma quasi un raddoppio.
• Ragionamento su contesti lunghi di AA-LCR v1.1 — 0,83 contro 0,73 del predecessore, e alla pari di DeepSeek V4.1 Flash (Max) a 0,84.
• SciCode — 0,541 contro 0,420. Un guadagno nella scienza della programmazione, non un guadagno nella qualità della chat.
• CritPt ragionamento fisico — 0,180, rispetto a 0,017 precedente. Dieci volte il predecessore su una base ridotta.
• AA-Omniscience — +2,22, contro −17,88 per Ling-3.0-flash. Questo è discusso di seguito, perché va contro il risultato principale.
Ling-3.0-flash non si è limitato a perdere contro Ling-3.1-flash su queste righe; è crollato su due di esse. Ha ottenuto 0,032 su AutomationBench-AA e esattamente 0,000 su Terminal-Bench 4.0. Questo è il contesto in cui va letto il 41: il predecessore era un modello efficiente, economico e a pesi aperti che non aveva praticamente alcuna capacità agentica da terminale.

Da dove è venuto il guadagno: lavoro agentico, non conversazione
Confronta i contributi all'indice di Ling-3.1-flash con quelli dei due modelli di fascia Flash con cui viene più spesso affiancato, ed emerge uno schema che l'aggregato nasconde. DeepSeek V4.1 Flash (Max) totalizza 39 sullo stesso indice e GLM 5.3 Flash ne totalizza 42, quindi tutti e tre rientrano in una fascia di tre punti. Ma ci arrivano da punti diversi.
• Lavoro agentico al terminale — Ling-3.1-flash 0.333 su Terminal-Bench 4.0, DeepSeek V4.1 Flash (Max) 0.268, GLM 5.3 Flash 0.328.
• Lavoro agentico nel mondo reale — Ling-3.1-flash 1.621,75 Elo su GDPval-AA, DeepSeek V4.1 Flash (Max) 1.600, GLM 5.3 Flash 1.646,86.
• AutomationBench-AA — Ling-3.1-flash 0,617, DeepSeek V4.1 Flash (Max) 0,689, GLM 5.3 Flash 0,604.
• Scienza della programmazione — Ling-3.1-flash 0.541 su SciCode, DeepSeek V4.1 Flash (Max) 0.519, GLM 5.3 Flash 0.516.
La lettura in senso stretto è che Ling-3.1-flash è competitivo sui benchmark agentici e leggermente avanti su SciCode. La lettura utile è che è il più forte dei tre sulle due misure agentiche-terminali a cui la maggior parte delle persone pensa quando dice «riesce a gestire un ciclo di strumenti» — ed è indietro rispetto a entrambi sulla misura di affidabilità della conoscenza. Questa è una forma specifica, non una vittoria generale, e vale la pena nominarla prima che qualcuno acquisti un carico di lavoro basandosi solo sul numero dell'indice.
Il conto che arriva con un modello più grande
Ling-3.0-flash era prezzato a $0,07 per milione di token di input e $0,22 per milione di token di output sull'API di Ant stessa, ed era a pesi aperti con licenza MIT. Ling-3.1-flash non è ancora nessuna delle due cose. Artificial Analysis registra il suo costo operativo a $0,30 per milione di input e $0,90 per milione di output — con una tariffa di cache hit di $0,06, uno sconto dell'80% sull'input — misurato rispetto all'API di InclusionAI stessa come fornitore di servizio. Si tratta di un aumento di circa quattro volte del prezzo dell'input rispetto al modello che sostituisce, per un guadagno di 21 punti nell'indice.
Se questo scambio sia vantaggioso dipende interamente dal carico di lavoro, e l'indice stesso può quantificarlo: eseguire tutte e dieci le valutazioni dell'Intelligence Index su Ling-3.1-flash costa circa $960 a quelle tariffe, contro circa $477 per DeepSeek V4.1 Flash (Max) e $280 per GLM 5.3 Flash. Il motivo non è solo il listino prezzi. Ling-3.1-flash è un ragionatore molto loquace — ha bruciato 220 milioni di token di output lavorando sull'indice, ben al di sopra della mediana per la sua fascia di prezzo, e le sue esecuzioni di valutazione durano in media circa 357 secondi per attività, contro 285 secondi per DeepSeek V4.1 Flash (Max) e 979 secondi per GLM 5.3 Flash. Su base per attività, Ling-3.1-flash costa circa $0.99 contro $0.27 di DeepSeek e $0.25 di GLM 5.3 Flash.
Niente di tutto questo è visibile dal 41, e tutto quanto finisce sulla fattura. Un modello può vincere un indice e perdere un budget.
I due numeri che contraddicono il titolo
Il primo è l'affidabilità delle conoscenze. Ling-3.1-flash ottiene +2,22 su AA-Omniscience, che misura se un modello sa ciò che sa: le risposte corrette guadagnano punti, le allucinazioni costano punti e i rifiuti non costano nulla. Il suo tasso di accuratezza è del 29,1% e il suo tasso di allucinazione è del 37,9%. Confrontato con i suoi compagni di scuderia, è il profilo più debole del gruppo: GLM 5.3 Flash ottiene +7,47 con un tasso di allucinazione del 27,6%, e DeepSeek V4.1 Flash (Max) ottiene −5,30 con uno sbalorditivo tasso di allucinazione del 96,5% tra le domande a cui ha risposto. Il punteggio composito premia Ling-3.1-flash per la capacità che dimostra, non per l'affidabilità con cui la dimostra, e un modello che inventa un terzo di ciò che afferma ha bisogno di retrieval attorno a sé in produzione.
Il secondo è il contesto. Artificial Analysis elenca Ling-3.1-flash con una finestra di contesto di 1.000.000 di token. Anche il materiale di rilascio di Ant cita 1M come obiettivo. Ma la documentazione per sviluppatori di Ant, che enumera le finestre della famiglia modello per modello, assegna a Ling-3.0-flash una finestra nativa di 256K estendibile a 1M e non riporta ancora alcuna voce per Ling-3.1-flash. La caratteristica riga distintiva sul contesto lungo che è stata effettivamente misurata — AA-LCR a 0,83 — è un punteggio di ragionamento su contesto lungo, non una misurazione della finestra servita. Considera 1M come il tetto dichiarato e convalida la finestra effettivamente fornita con una tua richiesta a contesto lungo prima di progettare su di essa.
Come si confronta sulla scheda tecnica
Il quadro dimensione per dimensione, con il soggetto per primo, su ogni riga:
• Parametri totali — Ling-3.1-flash 560B vs DeepSeek V4.1 Flash (Max) 552B vs GLM 5.3 Flash 320B.
• Parametri attivi per token — Ling-3.1-flash 25B vs DeepSeek V4.1 Flash (Max) 16B vs GLM 5.3 Flash 18B. Ling-3.1-flash è quello che ne attiva di più, ed è una delle ragioni per cui il suo costo di serving si colloca dove si colloca.
• Pesi e licenza — Ling-3.1-flash non pubblicato (proprietario, nessun testo di licenza) vs DeepSeek V4.1 Flash (Max) aperto con licenza MIT vs GLM 5.3 Flash aperto con licenza MIT.
• Contesto dichiarato — Ling-3.1-flash 1M vs DeepSeek V4.1 Flash (Max) 1M vs GLM 5.3 Flash 1M. Tutti e tre dichiarano lo stesso tetto massimo; solo due di essi hanno un checkpoint scaricabile rispetto al quale potresti verificarlo.
• Modalità — Ling-3.1-flash input testo, output testo vs DeepSeek V4.1 Flash (Max) input testo e immagini vs GLM 5.3 Flash input testo, immagini e video. Questo è l'unico asse in cui Ling-3.1-flash è semplicemente indietro, e nessuna riga di benchmark lo compensa.
• Prezzo sull'API del fornitore — Ling-3.1-flash 0,30 $ / 0,90 $ per milione di input / output vs DeepSeek V4.1 Flash (Max) 0,30 $ / 1,20 $ vs GLM 5.3 Flash 0,15 $ / 0,50 $.
• Punteggio dell'indice — 41 vs 39 vs 42. Tre punti di scarto in un confronto a tre non sono una classifica; è un pareggio, risolto dalla valutazione a cui il carico di lavoro del lettore assomiglia di più.
Dove puoi chiamarlo
Ling-3.1-flash oggi non è nel catalogo di OrcaRouter — una ricerca tramite la nostra API pubblica dei modelli per il modello di InclusionAI restituisce not-found, e non intendiamo lasciar intendere il contrario. Attualmente viene eseguito sull'API proprietaria di Ant e su piattaforme di terze parti che distribuiscono la release, che è l'effettiva portata della sua disponibilità. Ciò che vale la pena notare per chiunque stia confrontando i tre modelli sopra è che gli altri due sono instradabili in questo momento: DeepSeek V4.1 Flash e GLM 5.3 Flash si trovano entrambi nel catalogo di OrcaRouter ai prezzi di listino dei rispettivi provider con zero ricarico, dietro un'unica chiave API, con failover automatico tra loro. Se il confronto sopra indica che il tuo carico di lavoro tiene più all'affidabilità delle conoscenze che al lavoro agentico da terminale, GLM 5.3 Flash è quello da provare — e puoi provarlo contro DeepSeek V4.1 Flash sulla stessa chiave senza un secondo contratto o una riga di nuovo codice client.
Cosa cambia il 41, e cosa no
Ciò che cambia è la posizione della release. Ling-3.1-flash non è più una specifica con un grafico del fornitore allegato; è un modello con una posizione misurata in modo indipendente, e quella posizione è un autentico salto generazionale nelle capacità agentiche rispetto a Ling-3.0-flash — il tipo di balzo che deriva da un cambiamento di design anziché da più potenza di calcolo sulla stessa ricetta. Ciò che non cambia è ogni aspetto dell'approvvigionamento. I pesi sono ancora chiusi, la licenza non è ancora scritta, la modalità è ancora solo testuale, e il prezzo è circa quattro volte quello del suo predecessore per un guadagno concentrato nei compiti di agenti e terminale.
Se il tuo lavoro consiste in cicli di agenti, guida degli strumenti e lunghe catene di strumenti, il 41 è il numero più significativo pubblicato finora su questo modello e merita un’attenzione seria mentre la disponibilità è ancora in espansione. Se il tuo lavoro è multimodale, o riguarda risposte a domande in cui la conoscenza è cruciale, o inferenza ad alto volume e sensibile ai costi, il 41 non raggiunge il tuo problema — e GLM 5.3 Flash, già instradabile e già aperto con licenza MIT a metà del prezzo di output, è il modello meglio posizionato dei tre. L’indice ti dice dove si colloca Ling-3.1-flash. Non ti dice se dovresti interessartene, e a quella domanda risponde ciò che stai costruendo.


Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
