Ett genererat hero-kort för 'Claude Haiku 5.5 vs Ling 3.0 Flash' med två paneler åtskilda av en tunn linje: den vänstra märkt 'Claude Haiku 5.5' med 'Index 43' och 'Aktuell', den högra märkt 'Ling 3.0 Flash' med 'Index 20' och 'Föråldrad'. En sidfotsrad lyder 'Poäng enligt Artificial Analysis.' OrcaRouter-logotypen är komponerad i det nedre högra hörnet.
Engineering & Research

Claude Haiku 5.5 vs Ling 3.0 Flash: En av dessa modeller har redan en efterträdare

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Börja med det märkliga faktumet, för det är det som bör styra beslutet. Ling 3.0 Flash – Ant Groups modell med öppna vikter och 124 miljarder parametrar, släppt i augusti 2026 under MIT – är nu flaggad som föråldrad, med Ling 3.1 Flash utpekad som ersättare. Claude Haiku 5.5 kom den 7 oktober 2026, två dagar innan detta skrivs, och A​nthropic har förbundit sig att inte avveckla den före oktober 2027. Två modeller i samma prisklass, och en av dem pekas redan mot sin egen efterträdare.

Den asymmetrin är inte ett omdöme om kvalitet. Ling 3.0 Flash är en genuint snabb modell med öppna vikter och en ovanlig arkitektur, och i flera avseenden slår den Anthropic-nivån rent ut. Men det innebär att den här jämförelsen har ett bäst-före-datum, och varje artikel som behandlar de två som lika hållbara säljer den del som löper ut till dig.

Två släpp, två väldigt olika åldrar

De oberoende siffrorna här kommer från Artificial Analysis; de leverantörsspecifika påståendena kommer från modellkorten och dokumentationen och är märkta.

• Lansering — Ling 3.0 Flash den 4 augusti 2026, med Hugging Face-repositoriet daterat 2 augusti. Claude Haiku 5.5 den 7 oktober 2026.

• Licens — MIT för Ling 3.0 Flash, vilket är ungefär så tillåtande som öppna vikter kan bli. Claude Haiku 5.5 är proprietär och endast via API.

• Status — Ling 3.0 Flash har en avvecklingsflagga som pekar på Ling 3.1 Flash. Claude Haiku 5.5 är aktuell, med ett åtagande om att inte avvecklas fram till oktober 2027.

• Användning – Ling 3.0 Flash-repositoriet har fått 11 797 nedladdningar och 427 gillamarkeringar. Det är ett reellt men blygsamt avtryck, och det är en rimlig indikator på hur mycket tredjepartsverktyg som har vuxit fram runt modellen.

Åldersskillnaden spelar större roll än vad de sex veckorna antyder. Ling 3.0 Flash släpptes under en period då dess egen familj redan var i rörelse; Claude Haiku 5.5 släpptes som den nyaste medlemmen i en serie som inte har någon aviserad efterträdare.

Arkitekturen är den del som är värd att läsa två gånger

A screenshot of the Hugging Face model card for inclusionAI/Ling-3.0-flash, showing 427 likes, the 'TextGeneration', 'Safetensors', 'conversational' and 'custom_code' tags, and the introduction text describing the model as a native hybrid reasoning model operating with 124B total and 5.1B active parameters (about 12.4% and 8.1% of the previous 1T-class flagship Ring-2.6-1T) built on a native hybrid linear attention architecture.

Ling 3.0 Flash är en mixture-of-experts-modell med 124 miljarder parametrar totalt och 5,1 miljarder aktiva per token. Den kvoten är hela den ekonomiska argumentationen: du får in minnesavtrycket från en stor modell och betalar beräkningskostnaden för en liten. Den publicerade konfigurationen är specifik, och det är inte en omklädd version av en standardtransformer:

• Lageruppbyggnad – 35 KDA-lager med 7 Gated MLA-lager i förhållandet 5:1, plus 2 densa lager. Det publicerade träningsreceptet flyttar kontextfönstret från 8K till 32K till 256K i etapper i stället för att träna det långa fönstret från grunden.

• Experter — 512 routade experter med en delad expert, 8 aktiverade per token, med en dold storlek på 2 560, en expert-mellanstorlek på 768 och en dense-mellanstorlek på 6 144. Ordförrådet är 157 184 token.

• Serving — kortets referensdistribution använder SGLang med --context-length 262144, och rapporterar att HiCache med Mooncake-cachning minskar tiden till första token med 60–80 % eller mer vid långa indata. Det är en leverantörsrapporterad siffra och den anges som en sådan.

Inget av detta är ett trick. En aktiv parameterstorlek på 5,1B är anledningen till att Ling 3.0 Flash kan serveras med den genomströmning den når, och cachelagringsarbetet är anledningen till att dess latens för första token vid långa prompter förblir användbar. Claude Haiku 5.5:s angreppssätt är det motsatta: en enda tät, proprietär modell bakom ett API, med ett fönster på 1 000 000 token och ett adaptivt tänkande som per begäran avgör hur mycket arbete som ska utföras. Två sammanhängande svar på samma kostnadsfråga.

Siffrorna, sida vid sida

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Ling 3.0 Flash - the scoreboard'. The Claude Haiku 5.5 column reads independent score 43 (AA, #2 of 182), weights Proprietary API, context 1,000,000 tokens, input price $0.10 / 1M, output price $0.50 / 1M and throughput 240.4 tok/s. The Ling 3.0 Flash column reads independent score 20 (AA, #3 of 65), weights MIT open weights, context 262,000 tokens, input price $0.075 / 1M, output price $0.22 / 1M and throughput 333.6 tok/s. A footer line reads 'Independent figures per Artificial Analysis; pricing per each vendor.'

• Oberoende poäng — Claude Haiku 5.5 på 43 på Intelligence Index, tvåa av 182. Ling 3.0 Flash på 20, trea av 65 i sin egen klass.

• Indatapris per miljon tokens – Claude Haiku 5.5: 0,10 $ upp till 100 000 tokens, 0,50 $ däröver. Ling 3.0 Flash: 0,075 $, med 80 % cacherabatt.

• Pris för utdata per miljon tokens — Claude Haiku 5.5 $0.50 upp till 100 000 tokens, $2.50 däröver. Ling 3.0 Flash $0.22.

• Sammanvägd kostnad — $0,05 per miljon tokens för Ling 3.0 Flash, mot $0,08 för Claude Haiku 5.5 enligt styrelsens egen sammanvägning.

• Hastighet — 333,6 utdatatokens per sekund för Ling 3.0 Flash, först av 65 i sin klass, mot 240,4 för Claude Haiku 5.5. Tiden till första token är nästan lika: 2,50 sekunder mot tavlans mätning för Anthropic-modellen.

• Kontext — 262 000 tokens för Ling 3.0 Flash; 1 000 000 för Claude Haiku 5.5.

• Indatamodalitet — endast text för Ling 3.0 Flash. Text och bilder för Claude Haiku 5.5.

• Vikter — MIT och nedladdningsbara för Ling 3.0 Flash. Proprietära för Claude Haiku 5.5.

Lings argument är snabbhet och pris, inte djup

Index-gapet på 23 punkter mellan 43 och 20 är huvudnyheten, och det pekar i samma riktning som i varje jämförelse av det här slaget: Claude Haiku 5.5 är den starkare modellen, och gapet är inte litet. Men Ling-kolumnen vinner två rader rent, och båda är av det slag som dyker upp på en faktura eller i en latensbudget.

Först, genomströmning. 333,6 tokens per sekund är snabbast i sin klass på resultattavlan, cirka 39 % före Claude Haiku 5.5, och i kombination med en lägre sammanvägd kostnad innebär det att massgenerering – klassificeringssvep, datamärkning, strukturerad extrahering i hög volym – är mätbart billigare att köra på Ling 3.0 Flash. När uppgiften är väl specificerad och felläget är uppenbart kan en modell som ligger 23 indexpoäng bakom fortfarande vara den rätta.

För det andra: cacherabatten på 80 %. För en arbetsbelastning med ett stort stabilt prefix och en liten varierande svans sjunker den effektiva indatatakten för Ling 3.0 Flash långt under listpriset, och modellkortets cacheutformning riktar sig precis mot det mönstret. Claude Haiku 5.5:s cache-läsningspris på $0.01 är billigare i absoluta tal, men dess cache-skrivning kostar $0.125 och modellen är prissatt med ett steg vid 100 000 indata-tokens som Ling inte har.

Motvikten är mångordighet, och det är samma som gäller för A​nthropic-modellen. Artificial Analysis registrerade 260 miljoner utdatatokens när man körde Index på Ling 3.0 Flash, mot en median på 100 miljoner, och flaggar det som mångordigt. På en modell med prissättning per token urholkar det prisfördelen — en 2,3 gånger billigare utdatatakt som delvis konsumeras av en modell som skriver fler tokens är en mindre fördel än kortet antyder.

Vad leverantörernas benchmarkar påstår – och vad de inte påstår

Ling 3.0 Flash:s eget modellkort rapporterar en stark uppsättning: MathArena AIME 2026 på 93,2, HMMT February 2026 på 87, SWE-Bench Pro på 56,6, SWE-Bench Multilingual Resolved på 72,4 och Humanity's Last Exam på 22,7. Vart och ett av dessa är leverantörsrapporterat och inget av dem har oberoende reproducerats här. De är inte heller uppmätta mot Claude Haiku 5.5 i samma testrigg – Anthropic publicerar sin egen uppsättning (GDPval-AA v2.1 på 1620, OSWorld 2.1 på 72,4 %, Terminal-Bench 4.0 på 39,2 %) och de två leverantörerna körde olika testsviter. Det enda gemensamma måttet är den oberoende resultattavlan, och där är svaret entydigt.

Värt att notera vid sidan av matematikpoängen: att HLE-siffran på 22,7 ligger klart under 45,9 utan verktyg som A​nthropic rapporterar för Claude Haiku 5.5. Olika testramar, så det är inte en direkt jämförelse, men inte heller en skillnad som valet av testram bortförklarar.

A screenshot of the Artificial Analysis page for Ling 3.0 Flash carrying a deprecation notice that the model is deprecated and that only the default 10k-input-token workload is still benchmarked, and that InclusionAI has launched a newer release, Ling 3.1 Flash, which it suggests considering instead. Beneath the notice the page shows the model as an open-weights release from August 2026 with an Intelligence rank of 3 of 65 and a speed rank of 1 of 65.

Efterträdarproblemet

Det här är delen som avgör jämförelsen för alla som planerar bortom det innevarande kvartalet, och den har ingenting med benchmarks att göra.

Ling 3.0 Flash är föråldrad till förmån för Ling 3.1 Flash. Det betyder inte att den slutar fungera – öppna vikter upphör inte att gälla, och MIT-licenser kan inte återkallas. Men det betyder att ekosystemet runt den kommer att förändras gradvis: stöd för inferensramverk, kvantiseringsversioner, buggfixar och community-verktyg följer alla den aktuella modellen, och en föråldrad sådan får resten av den uppmärksamheten. Om du bygger på Ling 3.0 Flash idag bygger du på vikter som är frysta och färdiga, vilket är okej för en stabil arbetsbelastning och besvärligt för allt du förväntar dig ska förbättras.

Claude Haiku 5.5 har en spegelvänd uppsättning garantier: du får inte vikterna, men du får en leverantör vars kommersiella intresse är att hålla modellen snabb, patchad och i drift, plus ett åtagande om att inte avveckla den till och med oktober 2027 och en publicerad migreringsväg närhelst det tar slut.

Båda sidorna av denna rutt, genom en enda nyckel

Den ärliga tillgänglighetsraden: OrcaRouter tillhandahåller inte Ling 3.0 Flash, och inte heller Claude Haiku 5.5. Ling 3.0 Flash tillhandahålls via leverantörens egen distribution och flera tredjepartsplattformar; Claude Haiku 5.5 finns på A​nthropics API och de stora molnplattformarna.

Vad som återstår är den routingfråga som båda modellerna väcker. Claude Haiku 5.5 för 43 och ett 1M-fönster är ett naturligt mål för eskalering; Ling 3.0 Flash med 333 tokens per sekund är en naturlig bulkdel. En route som skickar högvolymarbete med tydlig specifikation till en snabb nivå och eskalerar allt som inte klarar en längd- eller kvalitetskontroll till en starkare nivå är precis den uppsättning som en router komponerar – på OrcaRouter finns Anthropics Claude Haiku 4.5, Claude Sonnet 5.5 och Claude Opus 5.5 i katalogen i dag, tillsammans med stora alternativ med öppna vikter som DeepSeek V4.1 Flash och GLM 5.3 Flash, så både eskalerings- och bulkdelen kan byggas och lasttestas redan nu. En nyckel, automatisk failover under huven, leverantörernas listpriser vidarebefordras med 0 % påslag så att en prisändring slår igenom samma dag.

Vilken av de två, och hur länge?

Ta Claude Haiku 5.5 om arbetet är öppet, om du behöver bilder eller ett fönster på en miljon token, om du vill att en leverantör ska ansvara för drifttiden, eller om du planerar längre än till nästa kvartal. Det ligger 23 indexpoäng före, det är aktuellt snarare än utfasad, och prisskillnaden är tillräckligt liten för att poänggapet ska dominera.

Välj Ling 3.0 Flash om arbetsbelastningen är bulkbetonad, väl specificerad och latenskänslig, om MIT-licensen eller de öppna vikterna är själva poängen, eller om en cacherabatt på 80 % för ett stabilt prefix är där din räkning faktiskt ligger. Det är den snabbare modellen och den billigare per token, och den är verkligen bra på de uppgifter som en 20-Index-modell klarar. Gå bara in i det med vetskapen om att du adopterar en färdig modell snarare än en underhållen sådan, och att efterträdaren som den pekar på redan existerar.