Una hero card generata per 'Claude Haiku 5.5 vs Ling 3.0 Flash' con due pannelli divisi da una sottile linea divisoria: quello sinistro etichettato 'Claude Haiku 5.5' con 'Indice 43' e 'Attuale', quello destro etichettato 'Ling 3.0 Flash' con 'Indice 20' e 'Deprecato'. Una riga a piè di pagina recita 'Punteggi secondo Artificial Analysis.' Il logo OrcaRouter è sovrapposto nell'angolo in basso a destra.
Engineering & Research

Claude Haiku 5.5 vs Ling 3.0 Flash: Uno di questi modelli ha già un successore

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Parti dal fatto curioso, perché è quello che dovrebbe orientare la decisione. Ling 3.0 Flash — modello open-weight da 124 miliardi di parametri di Ant Group, rilasciato in agosto 2026 con licenza MIT — è ora segnalato come deprecato, con Ling 3.1 Flash indicato come suo sostituto. Claude Haiku 5.5 è arrivato il 7 ottobre 2026, due giorni prima di questa stesura, e Anthropic si è impegnata a non dismetterlo prima di ottobre 2027. Due modelli nella stessa fascia di prezzo, e uno dei due è già indirizzato verso il proprio successore.

Quell'asimmetria non è un verdetto sulla qualità. Ling 3.0 Flash è un modello davvero veloce, con pesi aperti e un'architettura insolita, e su diversi assi batte nettamente la fascia di Anthropic. Ma significa che questo confronto ha una data di scadenza, e qualsiasi articolo che li tratti come ugualmente durevoli ti sta vendendo la parte che scade.

Due rilasci, due epoche molto diverse

I dati indipendenti qui riportati provengono da Artificial Analysis; le dichiarazioni specifiche dei fornitori provengono dalle schede dei modelli e dalla documentazione, e sono etichettate.

• Rilascio — Ling 3.0 Flash il 4 agosto 2026, con il repository Hugging Face datato 2 agosto. Claude Haiku 5.5 il 7 ottobre 2026.

• Licenza — MIT per Ling 3.0 Flash, che è quanto di più permissivo si possa ottenere con pesi aperti. Claude Haiku 5.5 è proprietario, disponibile solo tramite API.

• Stato — Ling 3.0 Flash presenta un flag di deprecazione che punta a Ling 3.1 Flash. Claude Haiku 5.5 è attuale, con l'impegno a non dismetterlo fino a ottobre 2027.

• Adozione — il repository Ling 3.0 Flash ha totalizzato 11.797 download e 427 like. Si tratta di un'impronta reale ma modesta, ed è un proxy ragionevole di quanto sia cresciuto il tooling di terze parti attorno al modello.

Il divario di età conta più di quanto le sei settimane suggeriscano. Ling 3.0 Flash è stato rilasciato in un periodo in cui la sua stessa famiglia era già in movimento; Claude Haiku 5.5 è stato rilasciato come il membro più recente di una linea che non ha un successore annunciato.

L'architettura è la parte che vale la pena leggere due volte

A screenshot of the Hugging Face model card for inclusionAI/Ling-3.0-flash, showing 427 likes, the 'TextGeneration', 'Safetensors', 'conversational' and 'custom_code' tags, and the introduction text describing the model as a native hybrid reasoning model operating with 124B total and 5.1B active parameters (about 12.4% and 8.1% of the previous 1T-class flagship Ring-2.6-1T) built on a native hybrid linear attention architecture.

Ling 3.0 Flash è un modello mixture-of-experts con 124 miliardi di parametri totali e 5,1 miliardi attivi per token. È questo rapporto il cuore dell’argomento economico: si riesce a contenere l’occupazione di memoria di un modello grande pagando la potenza di calcolo di uno piccolo. La configurazione pubblicata è specifica, e non è un semplice restyling di un transformer standard:

• Stratificazione — 35 layer KDA con 7 layer Gated MLA in un rapporto 5:1, più 2 layer densi. La ricetta di addestramento pubblicata sposta la finestra di contesto da 8K a 32K a 256K per fasi, anziché addestrare la finestra lunga da zero.

• Esperti — 512 esperti instradati con un esperto condiviso, 8 attivati per token, su una dimensione nascosta di 2.560, una dimensione intermedia dell'esperto di 768 e una dimensione intermedia densa di 6.144. Il vocabolario è di 157.184 token.

• Serving — il deployment di riferimento della scheda utilizza SGLang con --context-length 262144, e riporta che HiCache con la cache Mooncake riduce il tempo al primo token del 60–80% o più su input lunghi. Si tratta di un dato dichiarato dal fornitore ed è presentato come tale.

Niente di tutto questo è un espediente. Un footprint attivo di 5,1B è il motivo per cui Ling 3.0 Flash può essere servito al throughput che raggiunge, e il lavoro di caching è il motivo per cui la sua latenza del primo token su prompt lunghi rimane utilizzabile. L'approccio di Claude Haiku 5.5 è l'opposto: un unico modello denso proprietario dietro un'API, con una finestra da 1.000.000 di token e un pensiero adattivo che decide, per ogni richiesta, quanto lavoro svolgere. Due risposte coerenti alla stessa domanda sui costi.

I numeri, fianco a fianco

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Ling 3.0 Flash - the scoreboard'. The Claude Haiku 5.5 column reads independent score 43 (AA, #2 of 182), weights Proprietary API, context 1,000,000 tokens, input price $0.10 / 1M, output price $0.50 / 1M and throughput 240.4 tok/s. The Ling 3.0 Flash column reads independent score 20 (AA, #3 of 65), weights MIT open weights, context 262,000 tokens, input price $0.075 / 1M, output price $0.22 / 1M and throughput 333.6 tok/s. A footer line reads 'Independent figures per Artificial Analysis; pricing per each vendor.'

• Punteggio indipendente — Claude Haiku 5.5 a 43 sull'Intelligence Index, secondo su 182. Ling 3.0 Flash a 20, terzo su 65 nella sua categoria.

• Prezzo di input per milione di token — Claude Haiku 5.5 $0.10 fino a 100.000 token, $0.50 oltre. Ling 3.0 Flash $0.075, con uno sconto dell'80% sulla cache.

• Prezzo di output per milione di token — Claude Haiku 5.5 $0.50 fino a 100.000 token, $2.50 oltre. Ling 3.0 Flash $0.22.

• Costo combinato — $0,05 per milione di token per Ling 3.0 Flash, contro $0,08 per Claude Haiku 5.5 secondo il blending proprio della board.

• Velocità — 333,6 token di output al secondo per Ling 3.0 Flash, primo su 65 nella sua categoria, contro 240,4 per Claude Haiku 5.5. Il tempo al primo token è quasi un pareggio: 2,50 secondi contro la misurazione della board per il modello Anthropic.

• Contesto — 262.000 token per Ling 3.0 Flash; 1.000.000 per Claude Haiku 5.5.

• Modalità di input — solo testo per Ling 3.0 Flash. Testo e immagini per Claude Haiku 5.5.

• Pesi — MIT e scaricabili per Ling 3.0 Flash. Proprietari per Claude Haiku 5.5.

Il caso di Ling è velocità e prezzo, non profondità

Il divario di 23 punti nell'Indice tra 43 e 20 è la notizia principale, e punta nella stessa direzione di ogni confronto di questo tipo: Claude Haiku 5.5 è il modello più forte, e il divario non è piccolo. Ma la colonna Ling vince nettamente su due righe, ed entrambe sono del tipo che compare in una fattura o in un budget di latenza.

Primo, il throughput. 333,6 token al secondo è il più veloce della sua categoria sul mercato, circa il 39% in più di Claude Haiku 5.5, e combinato con un costo misto inferiore significa che la generazione in blocco — sweep di classificazione, etichettatura dei dati, estrazione strutturata ad alto volume — è misurabilmente più economica da eseguire su Ling 3.0 Flash. Quando il compito è ben specificato e la modalità di errore è ovvia, un modello 23 punti Index indietro può comunque essere quello giusto.

Secondo, lo sconto dell'80% sulla cache. Per un carico di lavoro con un prefisso stabile di grandi dimensioni e una coda variabile ridotta, la tariffa effettiva di input su Ling 3.0 Flash scende ben al di sotto del prezzo di listino, e la progettazione della cache nella scheda del modello punta esattamente a quel pattern. La tariffa di lettura della cache di Claude Haiku 5.5, pari a $0,01, è più economica in termini assoluti, ma la sua scrittura della cache costa $0,125 e il modello è prezzato con uno scaglione a 100.000 token di input che Ling non ha.

Il contrappeso è la verbosità, ed è lo stesso che vale per il modello A​nthropic. Artificial Analysis ha registrato 260 milioni di token di output eseguendo l'Index su Ling 3.0 Flash rispetto a una mediana di 100 milioni, e lo segnala come verboso. Su un modello con tariffazione per token, questo erode il vantaggio di prezzo: una tariffa di output inferiore di 2,3 volte, in parte consumata da un modello che scrive più token, è un vantaggio minore di quanto suggerisca la scheda.

Cosa affermano i benchmark dei fornitori, e cosa non affermano

La scheda di Ling 3.0 Flash riporta un set di risultati solidi: MathArena AIME 2026 a 93,2, HMMT febbraio 2026 a 87, SWE-Bench Pro a 56,6, SWE-Bench Multilingual Resolved a 72,4 e Humanity's Last Exam a 22,7. Ognuno di questi è dichiarato dal fornitore e nessuno è stato riprodotto in modo indipendente qui. Inoltre, non sono misurati rispetto a Claude Haiku 5.5 sullo stesso harness — A​nthropic pubblica il proprio set (GDPval-AA v2.1 a 1620, OSWorld 2.1 al 72,4%, Terminal-Bench 4.0 al 39,2%) e i due fornitori hanno eseguito suite diverse. L'unica misurazione condivisa è quella della classifica indipendente, e lì la risposta è inequivocabile.

Da notare accanto ai punteggi di matematica: quel valore HLE di 22,7 si colloca ben al di sotto del 45,9 senza strumenti che Anthropic riporta per Claude Haiku 5.5. Harness diversi, quindi non è un confronto diretto, ma non è nemmeno un divario che la scelta dell'harness possa spiegare.

A screenshot of the Artificial Analysis page for Ling 3.0 Flash carrying a deprecation notice that the model is deprecated and that only the default 10k-input-token workload is still benchmarked, and that InclusionAI has launched a newer release, Ling 3.1 Flash, which it suggests considering instead. Beneath the notice the page shows the model as an open-weights release from August 2026 with an Intelligence rank of 3 of 65 and a speed rank of 1 of 65.

Il problema del successore

Questa è la parte che decide il confronto per chiunque pianifichi oltre il trimestre corrente, e non ha nulla a che fare con i benchmark.

Ling 3.0 Flash è deprecato a favore di Ling 3.1 Flash. Questo non significa che smetta di funzionare — i pesi aperti non scadono e le licenze MIT non possono essere revocate. Significa però che l'ecosistema che vi ruota attorno prenderà un'altra direzione: il supporto nei framework di inferenza, le release di quantizzazione, le correzioni di bug e gli strumenti della community seguono tutti il modello attuale, e un modello deprecato riceve solo la coda di quell'attenzione. Se oggi costruisci su Ling 3.0 Flash, stai costruendo su pesi congelati e definitivi, il che va bene per un carico di lavoro stabile ma è scomodo per qualunque cosa di cui ti aspetti un miglioramento.

Claude Haiku 5.5 presenta l'insieme di garanzie speculare: non ottieni i pesi, ma ottieni un fornitore il cui interesse commerciale è mantenere il modello veloce, aggiornato ed erogato, oltre a un impegno a non dismetterlo fino a ottobre 2027 e a un percorso di migrazione pubblicato per quando tale impegno terminerà.

Entrambi i lati di questo percorso, attraverso una sola chiave

La dichiarazione onesta sulla disponibilità: OrcaRouter non include Ling 3.0 Flash, e non include neanche Claude Haiku 5.5. Ling 3.0 Flash è erogato tramite la distribuzione proprietaria del fornitore e diverse piattaforme di terze parti; Claude Haiku 5.5 è sull'API di A​nthropic e sulle principali piattaforme cloud.

Ciò che resta è la questione di routing che entrambi i modelli sollevano. Claude Haiku 5.5 a 43 e con una finestra da 1M è un naturale bersaglio di escalation; Ling 3.0 Flash a 333 token al secondo è una naturale gamba per i grandi volumi. Una rotta che invia lavoro ad alto volume e ben specificato a un livello veloce e che fa escalation verso uno più potente di qualsiasi cosa non superi un controllo di lunghezza o qualità è esattamente la configurazione che un router compone — su OrcaRouter, Claude Haiku 4.5, Claude Sonnet 5.5 e Claude Opus 5.5 di Anthropic sono già oggi nel catalogo, accanto a grandi opzioni open-weight come DeepSeek V4.1 Flash e GLM 5.3 Flash, così sia la gamba di escalation sia quella per i grandi volumi possono essere costruite e testate sotto carico fin da ora. Una sola chiave, failover automatico al di sotto, prezzi di listino dei provider passati con 0% di markup, così un cambio di prezzo è attivo lo stesso giorno.

Quale dei due, e per quanto tempo

Scegli Claude Haiku 5.5 se il lavoro è aperto, se ti servono immagini o una finestra da un milione di token, se vuoi un fornitore che risponda dell’uptime, o se stai pianificando oltre il prossimo trimestre. È avanti di 23 punti Index, è attuale anziché deprecato, e la differenza di prezzo è abbastanza contenuta da far dominare il divario nel punteggio.

Scegli Ling 3.0 Flash se il carico di lavoro è massivo, ben specificato e sensibile alla latenza, se la licenza MIT o i pesi aperti sono ciò che conta, o se uno sconto dell'80% sulla cache per un prefisso stabile è dove si concentra davvero la tua spesa. È il modello più veloce e quello più economico per token, ed è davvero valido nei compiti che un modello 20-Index può gestire. Sappi solo che stai adottando un modello finito anziché uno mantenuto, e che il successore a cui punta esiste già.