
Claude Haiku 5.5 vs Ling 3.0 Flash: Uno di questi modelli ha già un successore
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Parti dal fatto curioso, perché è quello che dovrebbe orientare la decisione. Ling 3.0 Flash — modello open-weight da 124 miliardi di parametri di Ant Group, rilasciato in agosto 2026 con licenza MIT — è ora segnalato come deprecato, con Ling 3.1 Flash indicato come suo sostituto. Claude Haiku 5.5 è arrivato il 7 ottobre 2026, due giorni prima di questa stesura, e Anthropic si è impegnata a non dismetterlo prima di ottobre 2027. Due modelli nella stessa fascia di prezzo, e uno dei due è già indirizzato verso il proprio successore.
Quell'asimmetria non è un verdetto sulla qualità. Ling 3.0 Flash è un modello davvero veloce, con pesi aperti e un'architettura insolita, e su diversi assi batte nettamente la fascia di Anthropic. Ma significa che questo confronto ha una data di scadenza, e qualsiasi articolo che li tratti come ugualmente durevoli ti sta vendendo la parte che scade.
Due rilasci, due epoche molto diverse
I dati indipendenti qui riportati provengono da Artificial Analysis; le dichiarazioni specifiche dei fornitori provengono dalle schede dei modelli e dalla documentazione, e sono etichettate.
• Rilascio — Ling 3.0 Flash il 4 agosto 2026, con il repository Hugging Face datato 2 agosto. Claude Haiku 5.5 il 7 ottobre 2026.
• Licenza — MIT per Ling 3.0 Flash, che è quanto di più permissivo si possa ottenere con pesi aperti. Claude Haiku 5.5 è proprietario, disponibile solo tramite API.
• Stato — Ling 3.0 Flash presenta un flag di deprecazione che punta a Ling 3.1 Flash. Claude Haiku 5.5 è attuale, con l'impegno a non dismetterlo fino a ottobre 2027.
• Adozione — il repository Ling 3.0 Flash ha totalizzato 11.797 download e 427 like. Si tratta di un'impronta reale ma modesta, ed è un proxy ragionevole di quanto sia cresciuto il tooling di terze parti attorno al modello.
Il divario di età conta più di quanto le sei settimane suggeriscano. Ling 3.0 Flash è stato rilasciato in un periodo in cui la sua stessa famiglia era già in movimento; Claude Haiku 5.5 è stato rilasciato come il membro più recente di una linea che non ha un successore annunciato.
L'architettura è la parte che vale la pena leggere due volte

Ling 3.0 Flash è un modello mixture-of-experts con 124 miliardi di parametri totali e 5,1 miliardi attivi per token. È questo rapporto il cuore dell’argomento economico: si riesce a contenere l’occupazione di memoria di un modello grande pagando la potenza di calcolo di uno piccolo. La configurazione pubblicata è specifica, e non è un semplice restyling di un transformer standard:
• Stratificazione — 35 layer KDA con 7 layer Gated MLA in un rapporto 5:1, più 2 layer densi. La ricetta di addestramento pubblicata sposta la finestra di contesto da 8K a 32K a 256K per fasi, anziché addestrare la finestra lunga da zero.
• Esperti — 512 esperti instradati con un esperto condiviso, 8 attivati per token, su una dimensione nascosta di 2.560, una dimensione intermedia dell'esperto di 768 e una dimensione intermedia densa di 6.144. Il vocabolario è di 157.184 token.
• Serving — il deployment di riferimento della scheda utilizza SGLang con --context-length 262144, e riporta che HiCache con la cache Mooncake riduce il tempo al primo token del 60–80% o più su input lunghi. Si tratta di un dato dichiarato dal fornitore ed è presentato come tale.
Niente di tutto questo è un espediente. Un footprint attivo di 5,1B è il motivo per cui Ling 3.0 Flash può essere servito al throughput che raggiunge, e il lavoro di caching è il motivo per cui la sua latenza del primo token su prompt lunghi rimane utilizzabile. L'approccio di Claude Haiku 5.5 è l'opposto: un unico modello denso proprietario dietro un'API, con una finestra da 1.000.000 di token e un pensiero adattivo che decide, per ogni richiesta, quanto lavoro svolgere. Due risposte coerenti alla stessa domanda sui costi.
I numeri, fianco a fianco

• Punteggio indipendente — Claude Haiku 5.5 a 43 sull'Intelligence Index, secondo su 182. Ling 3.0 Flash a 20, terzo su 65 nella sua categoria.
• Prezzo di input per milione di token — Claude Haiku 5.5 $0.10 fino a 100.000 token, $0.50 oltre. Ling 3.0 Flash $0.075, con uno sconto dell'80% sulla cache.
• Prezzo di output per milione di token — Claude Haiku 5.5 $0.50 fino a 100.000 token, $2.50 oltre. Ling 3.0 Flash $0.22.
• Costo combinato — $0,05 per milione di token per Ling 3.0 Flash, contro $0,08 per Claude Haiku 5.5 secondo il blending proprio della board.
• Velocità — 333,6 token di output al secondo per Ling 3.0 Flash, primo su 65 nella sua categoria, contro 240,4 per Claude Haiku 5.5. Il tempo al primo token è quasi un pareggio: 2,50 secondi contro la misurazione della board per il modello Anthropic.
• Contesto — 262.000 token per Ling 3.0 Flash; 1.000.000 per Claude Haiku 5.5.
• Modalità di input — solo testo per Ling 3.0 Flash. Testo e immagini per Claude Haiku 5.5.
• Pesi — MIT e scaricabili per Ling 3.0 Flash. Proprietari per Claude Haiku 5.5.
Il caso di Ling è velocità e prezzo, non profondità
Il divario di 23 punti nell'Indice tra 43 e 20 è la notizia principale, e punta nella stessa direzione di ogni confronto di questo tipo: Claude Haiku 5.5 è il modello più forte, e il divario non è piccolo. Ma la colonna Ling vince nettamente su due righe, ed entrambe sono del tipo che compare in una fattura o in un budget di latenza.
Primo, il throughput. 333,6 token al secondo è il più veloce della sua categoria sul mercato, circa il 39% in più di Claude Haiku 5.5, e combinato con un costo misto inferiore significa che la generazione in blocco — sweep di classificazione, etichettatura dei dati, estrazione strutturata ad alto volume — è misurabilmente più economica da eseguire su Ling 3.0 Flash. Quando il compito è ben specificato e la modalità di errore è ovvia, un modello 23 punti Index indietro può comunque essere quello giusto.
Secondo, lo sconto dell'80% sulla cache. Per un carico di lavoro con un prefisso stabile di grandi dimensioni e una coda variabile ridotta, la tariffa effettiva di input su Ling 3.0 Flash scende ben al di sotto del prezzo di listino, e la progettazione della cache nella scheda del modello punta esattamente a quel pattern. La tariffa di lettura della cache di Claude Haiku 5.5, pari a $0,01, è più economica in termini assoluti, ma la sua scrittura della cache costa $0,125 e il modello è prezzato con uno scaglione a 100.000 token di input che Ling non ha.
Il contrappeso è la verbosità, ed è lo stesso che vale per il modello Anthropic. Artificial Analysis ha registrato 260 milioni di token di output eseguendo l'Index su Ling 3.0 Flash rispetto a una mediana di 100 milioni, e lo segnala come verboso. Su un modello con tariffazione per token, questo erode il vantaggio di prezzo: una tariffa di output inferiore di 2,3 volte, in parte consumata da un modello che scrive più token, è un vantaggio minore di quanto suggerisca la scheda.
Cosa affermano i benchmark dei fornitori, e cosa non affermano
La scheda di Ling 3.0 Flash riporta un set di risultati solidi: MathArena AIME 2026 a 93,2, HMMT febbraio 2026 a 87, SWE-Bench Pro a 56,6, SWE-Bench Multilingual Resolved a 72,4 e Humanity's Last Exam a 22,7. Ognuno di questi è dichiarato dal fornitore e nessuno è stato riprodotto in modo indipendente qui. Inoltre, non sono misurati rispetto a Claude Haiku 5.5 sullo stesso harness — Anthropic pubblica il proprio set (GDPval-AA v2.1 a 1620, OSWorld 2.1 al 72,4%, Terminal-Bench 4.0 al 39,2%) e i due fornitori hanno eseguito suite diverse. L'unica misurazione condivisa è quella della classifica indipendente, e lì la risposta è inequivocabile.
Da notare accanto ai punteggi di matematica: quel valore HLE di 22,7 si colloca ben al di sotto del 45,9 senza strumenti che Anthropic riporta per Claude Haiku 5.5. Harness diversi, quindi non è un confronto diretto, ma non è nemmeno un divario che la scelta dell'harness possa spiegare.

Il problema del successore
Questa è la parte che decide il confronto per chiunque pianifichi oltre il trimestre corrente, e non ha nulla a che fare con i benchmark.
Ling 3.0 Flash è deprecato a favore di Ling 3.1 Flash. Questo non significa che smetta di funzionare — i pesi aperti non scadono e le licenze MIT non possono essere revocate. Significa però che l'ecosistema che vi ruota attorno prenderà un'altra direzione: il supporto nei framework di inferenza, le release di quantizzazione, le correzioni di bug e gli strumenti della community seguono tutti il modello attuale, e un modello deprecato riceve solo la coda di quell'attenzione. Se oggi costruisci su Ling 3.0 Flash, stai costruendo su pesi congelati e definitivi, il che va bene per un carico di lavoro stabile ma è scomodo per qualunque cosa di cui ti aspetti un miglioramento.
Claude Haiku 5.5 presenta l'insieme di garanzie speculare: non ottieni i pesi, ma ottieni un fornitore il cui interesse commerciale è mantenere il modello veloce, aggiornato ed erogato, oltre a un impegno a non dismetterlo fino a ottobre 2027 e a un percorso di migrazione pubblicato per quando tale impegno terminerà.
Entrambi i lati di questo percorso, attraverso una sola chiave
La dichiarazione onesta sulla disponibilità: OrcaRouter non include Ling 3.0 Flash, e non include neanche Claude Haiku 5.5. Ling 3.0 Flash è erogato tramite la distribuzione proprietaria del fornitore e diverse piattaforme di terze parti; Claude Haiku 5.5 è sull'API di Anthropic e sulle principali piattaforme cloud.
Ciò che resta è la questione di routing che entrambi i modelli sollevano. Claude Haiku 5.5 a 43 e con una finestra da 1M è un naturale bersaglio di escalation; Ling 3.0 Flash a 333 token al secondo è una naturale gamba per i grandi volumi. Una rotta che invia lavoro ad alto volume e ben specificato a un livello veloce e che fa escalation verso uno più potente di qualsiasi cosa non superi un controllo di lunghezza o qualità è esattamente la configurazione che un router compone — su OrcaRouter, Claude Haiku 4.5, Claude Sonnet 5.5 e Claude Opus 5.5 di Anthropic sono già oggi nel catalogo, accanto a grandi opzioni open-weight come DeepSeek V4.1 Flash e GLM 5.3 Flash, così sia la gamba di escalation sia quella per i grandi volumi possono essere costruite e testate sotto carico fin da ora. Una sola chiave, failover automatico al di sotto, prezzi di listino dei provider passati con 0% di markup, così un cambio di prezzo è attivo lo stesso giorno.
Quale dei due, e per quanto tempo
Scegli Claude Haiku 5.5 se il lavoro è aperto, se ti servono immagini o una finestra da un milione di token, se vuoi un fornitore che risponda dell’uptime, o se stai pianificando oltre il prossimo trimestre. È avanti di 23 punti Index, è attuale anziché deprecato, e la differenza di prezzo è abbastanza contenuta da far dominare il divario nel punteggio.
Scegli Ling 3.0 Flash se il carico di lavoro è massivo, ben specificato e sensibile alla latenza, se la licenza MIT o i pesi aperti sono ciò che conta, o se uno sconto dell'80% sulla cache per un prefisso stabile è dove si concentra davvero la tua spesa. È il modello più veloce e quello più economico per token, ed è davvero valido nei compiti che un modello 20-Index può gestire. Sappi solo che stai adottando un modello finito anziché uno mantenuto, e che il successore a cui punta esiste già.
