Una hero card intitolata 'Claude Haiku 5.5 vs Ling 3.1 Flash' e sormontata dalla riga '560 miliardi di parametri, nessun peso', con un contrasto Index contro AutomationBench pari a 0,3541 contro 0,6174, una riga di costo pari a $0,21 per attività contro $0,99 per attività e una riga di tempo pari a 424,6 s per attività contro 360,4 s per attività.
Engineering & Research

Claude Haiku 5.5 vs Ling 3.1 Flash: un modello da 560 miliardi di parametri che costa quattro volte di più per risposta

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Sei giorni li separano. InclusionAI ha rilasciato Ling 3.1 Flash il 1° ottobre 2026; il fornitore ha rilasciato Claude Haiku 5.5 il 7 ottobre. Entrambi sono venduti come modelli di fascia flash, entrambi hanno una finestra di contesto da un milione di token, e sulle righe di ragionamento dell'unica classifica indipendente che li ha eseguiti entrambi sono così vicini che la differenza rientra nel rumore. Poi si arriva alla riga che misura se un agente completa davvero il lavoro, e sono a 26 punti di distanza — e alla riga che misura quanto costa un lavoro completato, dove il modello con 560 miliardi di parametri costa quattro volte e mezzo il prezzo di quello di cui nessuno ha pubblicato il numero di parametri.

Nessuno dei due listini prezzi lo prevede. Ling 3.1 Flash ha un prezzo di listino di 0,30 $ per milione di token di input e 0,90 $ per milione di token di output. Claude Haiku 5.5 ha un prezzo di listino di 0,10 $ e 0,50 $ per prompt fino a 100.000 token, passando a 0,50 $ e 2,50 $ oltre tale soglia. Letto come prezzo per token, Ling costa il triplo sull'input e poco meno del doppio sull'output, il genere di divario che chiude un confronto in una riga.

Non è questo a chiudere la questione, perché il listino prezzi è prezzato per token e la decisione è prezzata per attività. Quei due numeri escono da questo confronto con segni opposti, e il motivo non è la verbosità.

Quanto costa un'attività completata, non quanto costa un token

Su Artificial Analysis Intelligence Index v4.3.2, il costo misurato per completare un'intera attività dell'indice è di 0,21 $ per Claude Haiku 5.5 e di 0,99 $ per Ling 3.1 Flash. Si tratta di un divario di 4,6× — più ampio del rapporto di 3× sugli input, e nella stessa direzione.

La spiegazione ovvia — che il modello costoso parla di più — è quella sbagliata. Ling 3.1 Flash ha generato 100.671 token di output per attività di indicizzazione; Claude Haiku 5.5 ne ha generati 162.164. Il modello più economico è quello più chiacchierone, di oltre il 60%. Quindi il denaro non va nemmeno dove suggerisce il listino prezzi.

Scomponi il costo per attività e scopri dove la metodologia dell'indice lo spende davvero. Dei 0,21 $ di Claude Haiku 5.5, circa il 62% è sul lato input; dei 0,99 $ di Ling 3.1 Flash, circa il 91%. Si tratta di esecuzioni di ragionamento con forte uso della cache, e i due fornitori prezzano un token di input in cache in modo molto diverso: 0,01 $ per milione per Claude Haiku 5.5 contro 0,06 $ per milione per Ling 3.1 Flash — una differenza di 6× sull'unica voce che domina la fattura. Il listino pubblicato mette a confronto 0,10 $ e 0,30 $. La voce che decide la fattura confronta 0,01 $ e 0,06 $.

Il nostro catalogo riporta i prezzi di listino dei fornitori con 0% di ricarico, ed è così che puoi distinguere le due situazioni su una fattura reale anziché su una simulata. Ling 3.1 Flash non è presente nel catalogo con nessuna grafia del percorso del suo fornitore che siamo riusciti a risolvere — non sotto InclusionAI, non sotto Ling, non sotto nessuna delle otto forme che abbiamo provato — quindi i $0,30 e $0,90 qui sopra sono le tariffe pubblicate dal fornitore stesso e nulla che possiamo instradare per te oggi. Anche Claude Haiku 5.5 non è nel catalogo; gira tramite l'API di Anthropic. Ciò che il catalogo offre invece nelle vicinanze di questo confronto è GLM 5.3 Flash, DeepSeek V4.1 Flash, Qwen3.8 Flash e Gemini 3.8 Flash, ciascuno al prezzo di listino del fornitore con 0% di ricarico, così una variazione delle tariffe del fornitore arriva dalla nostra parte lo stesso giorno in cui arriva dalla loro. Se la conclusione qui sotto è che il profilo agentico di Ling 3.1 Flash è ciò di cui ha bisogno il tuo carico di lavoro, il prossimo passo concreto è un confronto diretto con i modelli con capacità agentiche che instradiamo noi, su un'unica chiave con failover automatico al di sotto e il DSL di routing quando il tetto di costo deve stare nella route anziché nel codice dell'applicazione.

A two-column scoreboard titled 'Claude Haiku 5.5 vs Ling 3.1 Flash - the scoreboard' with rows Index v4.3.2 43.40 against 41.09, cost per task $0.21 against $0.99, time per task 424.6s against 360.4s, Terminal Bench 4.0 0.3283 against 0.3333, AutomationBench 0.3541 against 0.6174 and output tokens per task 162,164 against 100,671, footed 'All figures per Artificial Analysis Intelligence Index v4.3.2.'

Sette righe in cui entrambi sono stati misurati

Artificial Analysis è l'unica classifica che ha eseguito entrambi i modelli, e la sovrapposizione è limitata ma informativa. Le righe non concordano tra loro, e la direzione del disaccordo non è casuale.

• Indice di Intelligenza v4.3.2 — 43,40 per Claude Haiku 5.5 (Max) contro 41,09 per Ling 3.1 Flash. Un vantaggio di 2,31 punti per Anthropic.

• Costo per attività Index completata — 0,21 $ contro 0,99 $ sulla stessa board.

• Tempo per attività Index — 424,6 secondi per Claude Haiku 5.5 contro 360,4 secondi per Ling 3.1 Flash. Questa è la riga in cui l'aspettativa viene smentita: il modello da 560 miliardi di parametri è il più veloce dei due su tutto l'indice, di circa il 15%.

Terminal Bench 4.0 — 0,3283 contro 0,3333. Ling 3.1 Flash è avanti di mezzo punto, il che, su un benchmark che entrambi i fornitori citano, è un pareggio.

• SciCode — 0,5498 contro 0,5405. Claude Haiku 5.5 di 0,9 punti. Anche un pareggio.

• Humanity's Last Exam, senza strumenti — 0,4439 contro 0,3943. Claude Haiku 5.5 avanti di 5 punti, la prima vera separazione.

• AutomationBench, punteggio parziale — 0.3544 ... 0.6174. Ling 3.1 con 26 punti di vantaggio, e con un margine più ampio rispetto a tutte le altre differenze di questo elenco messe insieme.

Esistono altre due righe al di fuori di quell'insieme condiviso e vale la pena riportarle, perché sono quelle che gli acquirenti notano di più. Su GDPval-AA, che Artificial Analysis esegue su 44 occupazioni, le due sono 1620,05 e 1621,75 — un perfetto pareggio statistico. Su AA-Briefcase v1.1, una valutazione di lavori professionali a formato lungo con punteggio Elo, Claude Haiku 5.5 totalizza 1577,72 contro i 1400,35 di Ling 3.1 Flash, un divario di 177 punti a favore di Anthropic. È la più ampia separazione non agentica tra loro in qualsiasi punto della classifica.

L'unica riga che dovrebbe decidere la maggior parte di queste conversazioni

Le medie a livello di indice nascondono dove sono andati effettivamente tempo e denaro, e questa coppia è il caso più chiaro di ciò nel lotto. I numeri per singola valutazione su Terminal Bench 4.0 non sono vicini in nessuna dimensione tranne che nel punteggio.

• Terminal Bench 4.0, Ling 3.1 Flash — 0,3333 a 5,49 $ per attività e 1.283 secondi per attività.

• Terminal Bench 4.0, Claude Haiku 5.5 — 0,3283 a 0,65 $ per attività e 908 secondi per attività.

Cinque millesimi di punto nel punteggio li separano. Il costo è 8,4× e il tempo reale è 1,4×. Un team che legge la tabella di benchmark e sceglie il modello che ottiene 0,3333 ha, secondo i calcoli della stessa Artificial Analysis, scelto di pagare otto volte tanto per arrivare un terzo di minuto più tardi con la stessa risposta.

Questa non è una tesi secondo cui il punteggio sia privo di significato; è una tesi secondo cui un punteggio è un rapporto tra lavoro svolto e lavoro tentato, e non dice nulla sulle risorse consumate per arrivarci. I benchmark di completamento agentico sono esattamente il contesto in cui questa distinzione pesa di più, perché un agente che riprova è un agente che paga il prezzo pieno a ogni tentativo, e un modello che costa otto volte tanto per tentativo trasforma un ciclo di tentativi in una voce di budget.

A capture of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing its standing chips of Intelligence #21/182, Speed #91/182, Cost #46/182 and Verbosity #62/182, the rates $0.10 in and $0.50 out with a 90% cache discount, a cost of $0.21 per task, 440M generated tokens, and the summary line that Claude Haiku 5.5 scores 43 on the Intelligence Index against a median of 13.

I 560 miliardi di parametri senza nulla da scaricare

Ecco la parte della scheda tecnica di Ling 3.1 Flash che è davvero insolita, e non è la dimensione.

Ling 3.1 Flash è un modello sparse mixture-of-experts — 560 miliardi di parametri totali, 25 miliardi attivi per token — e Artificial Analysis lo classifica come proprietario. Non ci sono pesi, né file di licenza, né repository. Un grande modello sparse di questa forma arriverebbe normalmente come rilascio aperto, perché è ciò che fa il resto di questo livello: GLM 5.3 Flash distribuisce pesi MIT con 320 miliardi totali e 18 miliardi attivi, e DeepSeek V4.1 Flash distribuisce pesi MIT con 552 miliardi totali e 16 miliardi attivi. Ling 3.1 Flash è la stessa classe di architettura allo stesso ordine di scala, pubblicato solo come API.

Quella scelta ha una conseguenza che le righe del benchmark non mostrano. Un modello con 25 miliardi di parametri attivi deve essere servito da qualche parte, e se non puoi mantenere il checkpoint, non puoi scegliere dove né con quale margine — affitti il serving del fornitore. Il prezzo di 5,49 $ del task Terminal Bench sopra non è principalmente un artefatto della tariffa per token; è quanto costa affittare un modello sparse di grandi dimensioni dall'unica parte in grado di eseguirlo. I modelli fratelli open-weights in questa fascia ti danno l'opzione di spostare quel numero da solo.

Vale anche nel senso opposto, e la stessa onestà si applica. Un rilascio aperto non è automaticamente il prodotto migliore: insieme ai pesi erediti il carico di servizio, le scelte di quantizzazione e la corsa obbligata agli aggiornamenti, e un file di licenza non è un contratto di supporto. Anthropic pubblica per Claude Haiku 5.5 un impegno di dismissione non prima del 7 ottobre 2027, su un'API first-party con una system card. Quale di questi due assetti desideri è una questione che riguarda il tuo team, non l'uno o l'altro modello.

A cosa serve Ling 3.1 Flash

Leggi il profilo per intero: descrive un prodotto coerente anziché compromesso, un modello grande, sparso e a contesto lungo che completa flussi di lavoro autonomi a più passaggi meglio di qualsiasi altra cosa misurata in questa fascia di prezzo, non si distingue nel ragionamento complesso in un unico passaggio e lo fa a tariffa fissa, senza crolli legati alla lunghezza del prompt. Su AutomationBench è avanti di 26 punti rispetto a Claude Haiku 5.5, e il suo punteggio AA-Briefcase è l'unico punto di questo confronto in cui si colloca dietro la metà del gruppo anziché davanti.

Questa è una descrizione difendibile di un worker agentico batch: puntalo su una coda di job strutturati che devono essere completati ciascuno, accetta che il task si misuri in minuti, mantieni il prompt abbastanza lungo da rendere punitivo uno step di soglia, e dai più valore all'affidabilità al traguardo che al costo di un singolo token. Ciò per cui non è adatto è proprio quello per cui i modelli di fascia flash vengono di solito acquistati. Accetta solo testo — nessun input di immagini, mentre Claude Haiku 5.5 accetta testo e immagini. Il suo tempo per l'index task è più breve, ma il suo tempo per il task su Terminal Bench è più lungo, e a $0,99 per index task completato contro $0,21 spende quattro volte e mezzo tanto per arrivare a un composito quasi uguale.

A capture of InclusionAI's Ling Studio playground with the model selector reading Ling-3.1-flash, a Model Settings panel showing temperature 0.6, top_k 20 and Thinking enabled, tabs for Chat, Prompt, Agent, explore and Tools, and tool toggles for Web Search, Time Query and Weather Query.

Quale dei due, sulla base delle prove esistenti

Se il tuo lavoro è testo in ingresso, testo in uscita, con prezzo per token su grandi volumi, Claude Haiku 5.5 vince questo confronto su ogni voce che arriva in fattura: costo per attività dell'indice più basso, costo reale per attività più basso sul benchmark che conta di più per gli agenti, punteggio composito più alto, punteggi migliori nei lavori professionali long-form, fedeltà migliore e input di immagini che l'altro modello non offre affatto.

Se il tuo lavoro consiste in un agente non presidiato che deve completare un flusso di lavoro a più passaggi, Ling 3.1 Flash totalizza 26 punti in più rispetto a Claude Haiku 5.5 sull'unico benchmark condiviso che misura esattamente questo, e vale la pena testarlo invece di scartarlo in base al prezzo. Testalo sulla tua traccia, non su questa tabella — e calcola il costo del test per lavoro completato, perché è il numero che cambia quando un agente riprova.

Se hai bisogno di disporre dei pesi, nessuno di questi due è il modello che fa per te. Ling 3.1 Flash è proprietario con 560 miliardi di parametri; Claude Haiku 5.5 è proprietario senza un conteggio pubblicato. I rilasci open di questa fascia sono altrove sulla board, e quel confronto parte da un insieme di righe del tutto diverso.

Il composito dice 2,31 punti. Il benchmark agentico dice 26 nella direzione opposta. Il tariffario dice 3× sull'input; il costo per attività completata dice 4,6× nella stessa direzione del tariffario. Quattro numeri, due direzioni — ecco perché l'unico modo affidabile per risolvere la questione è eseguire entrambi su una traccia del tuo lavoro e leggere il costo dai lavori completati anziché dai token.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno