
Claude Haiku 5.5 vs Ling 3.1 Flash: En modell med 560 miljarder parametrar som kostar fyra gånger mer per svar
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Sex dagar skiljer dem åt. InclusionAI släppte Ling 3.1 Flash den 1 oktober 2026; leverantören släppte Claude Haiku 5.5 den 7 oktober. Båda säljs som modeller i flash-klassen, båda har ett kontextfönster på en miljon token, och på resonemangsraderna hos den enda oberoende resultattavla som har kört båda är de så nära varandra att skillnaden ligger inom bruset. Sedan kommer man till raden som mäter huruvida en agent faktiskt slutför jobbet, och de skiljer sig med 26 punkter — och till raden som mäter vad ett slutfört jobb kostar, där modellen med 560 miljarder parametrar kostar fyra och en halv gånger så mycket som den vars parametrantal ingen har publicerat.
Ingen av prislistorna förutspår det. Ling 3.1 Flash har ett listpris på $0,30 per miljon token för indata och $0,90 per miljon token för utdata. Claude Haiku 5.5 har ett listpris på $0,10 och $0,50 för prompter upp till 100 000 token, och stiger till $0,50 och $2,50 däröver. Räknat som ett pris per token är Ling tre gånger så dyrt för indata och strax under dubbelt så dyrt för utdata, vilket är en sådan klyfta som gör att jämförelsen kan avslutas på en rad.
Det gör inte slut på den här, eftersom prislistan är prissatt per token och beslutet är prissatt per uppgift. De två talen kommer ut ur den här duellen med motsatta tecken, och orsaken är inte mångordighet.
Vad en slutförd uppgift kostar, inte vad en token kostar
På Artificial Analysis Intelligence Index v4.3.2 är den uppmätta kostnaden för att slutföra en fullständig indexuppgift 0,21 USD för Claude Haiku 5.5 och 0,99 USD för Ling 3.1 Flash. Det är en skillnad på 4,6× – större än indataförhållandet på 3×, och i samma riktning.
Den uppenbara förklaringen – att den dyra modellen pratar mer – är fel. Ling 3.1 Flash genererade 100 671 utdatatoken per indexuppgift; Claude Haiku 5.5 genererade 162 164. Den billigare modellen är den pratsammare, med mer än 60 %. Så pengarna går inte heller dit prislistan antyder.
Dela upp kostnaden per uppgift, så landar den där indexmetodiken faktiskt gör av med den. Av Claude Haiku 5.5:s $0.21 är ungefär 62 % på indatasidan; av Ling 3.1 Flashs $0.99 är ungefär 91 % det. Det här är cache-tunga resonemangskörningar, och de två leverantörerna prissätter en cachad indatatoken mycket olika: $0.01 per miljon för Claude Haiku 5.5 mot $0.06 per miljon för Ling 3.1 Flash – en spridning på 6× på den enda rad som dominerar fakturan. Den publicerade prislistan jämför $0.10 med $0.30. Raden som avgör fakturan jämför $0.01 med $0.06.
Vår egen katalog förmedlar leverantörernas listpriser vidare med 0 % påslag, vilket är hur du kan skilja de två situationerna åt på en verklig faktura snarare än en modellerad. Ling 3.1 Flash finns inte i katalogen under någon stavning av dess leverantörssökväg som vi kunde lösa upp — inte under InclusionAI, inte under Ling, inte under någon av de åtta former vi provade — så $0,30 och $0,90 ovan är leverantörens egna publicerade priser och inget vi kan routa åt dig i dag. Claude Haiku 5.5 finns inte heller i katalogen; den körs via Anthropics eget API. Vad katalogen däremot har från den här jämförelsens närområde är GLM 5.3 Flash, DeepSeek V4.1 Flash, Qwen3.8 Flash och Gemini 3.8 Flash, var och en till leverantörens listpris med 0 % påslag, så en ändring av leverantörens pris når vår sida samma dag som den når deras. Om slutsatsen nedan är att Ling 3.1 Flashs agentiska profil är vad din arbetsbelastning behöver, är nästa praktiska steg en direkt jämförelse mot de agentiskt kapabla modeller som vi faktiskt routar, på en enda nyckel med automatisk failover under, och routing-DSL:en när kostnadstaket hör hemma i routen snarare än i applikationskoden.

Sju rader där båda mättes
Artificial Analysis är den enda resultattavlan som har kört båda modellerna, och överlappningen är smal men informativ. Raderna stämmer inte överens med varandra, och riktningen på oenigheten är inte slumpmässig.
• Intelligence Index v4.3.2 — 43,40 för Claude Haiku 5.5 (Max) mot 41,09 för Ling 3.1 Flash. En ledning på 2,31 punkter för Anthropic.
• Kostnad per slutförd Index-uppgift – 0,21 $ mot 0,99 $ på samma tavla.
• Tid per Index-uppgift — 424,6 sekunder för Claude Haiku 5.5 mot 360,4 sekunder för Ling 3.1 Flash. Detta är raden där förväntningen bryts: modellen med 560 miljarder parametrar är den snabbare av de två över indexet i sin helhet, med omkring 15 %.
• Terminal Bench 4.0 — 0,3283 mot 0,3333. Ling 3.1 Flash ligger en halv poäng före, vilket på ett benchmark som båda leverantörerna åberopar är ett oavgjort resultat.
• SciCode — 0,5498 mot 0,5405. Claude Haiku 5.5 med 0,9 poäng. Även oavgjort.
• Humanity's Last Exam, utan verktyg – 0,4439 mot 0,3943. Claude Haiku 5.5 med 5 poängs marginal, den första verkliga åtskillnaden.
• AutomationBench, delpoäng — 0,3541 mot 0,6174. Ling 3.1 Flash med 26 poäng, och med en större marginal än alla andra gap på den här listan tillsammans.
Två ytterligare rader finns utanför den gemensamma uppsättningen och är värda att ta med, eftersom det är dem köparna lägger märke till mest. I GDPval-AA, som Artificial Analysis kör över 44 yrken, ligger de två på 1620.05 och 1621.75 – ett statistiskt dött lopp. I AA-Briefcase v1.1, en Elo-klassad utvärdering av långformat professionellt arbete, ligger Claude Haiku 5.5 på 1577.72 mot Ling 3.1 Flashs 1400.35, en skillnad på 177 punkter till Anthropics fördel. Det är den största icke-agentiska skillnaden mellan dem någonstans på resultattavlan.
Den enda raden som borde avgöra de flesta av dessa konversationer
Medelvärden på indexnivå döljer vart tiden och pengarna faktiskt tog vägen, och det här paret är det tydligaste exemplet på det i batchen. Siffrorna per utvärdering på Terminal Bench 4.0 ligger inte nära varandra i någon dimension utom poängen.
• Terminal Bench 4.0, Ling 3.1 Flash — 0,3333 till $5,49 per uppgift och 1 283 sekunder per uppgift.
• Terminal Bench 4.0, Claude Haiku 5.5 — 0,3283 vid $0,65 per uppgift och 908 sekunder per uppgift.
Fem tusendelar av en poäng skiljer dem åt. Kostnaden är 8,4× och väggklockstiden är 1,4×. Ett team som läser benchmarktabellen och väljer modellen som får poängen 0,3333 har, enligt Artificial Analysiss egen redovisning, valt att betala åtta gånger så mycket för att komma fram en tredjedels minut senare med samma svar.
Det här är inte ett argument för att poängen är meningslös; det är ett argument för att en poäng är ett förhållande mellan utfört arbete och försökt arbete, och den säger ingenting om de resurser som förbrukats på vägen dit. Benchmarks för agentiskt slutförande är precis den situation där den distinktionen biter hårdast, eftersom en agent som försöker igen är en agent som betalar fullt pris vid varje nytt försök, och en modell som kostar åtta gånger så mycket per försök förvandlar en omförsöksloop till en budgetpost.

De 560 miljarder parametrarna utan något att ladda ner
Här är den del av specifikationsbladet för Ling 3.1 Flash som verkligen är ovanlig, och det är inte storleken.
Ling 3.1 Flash är en gles mixture-of-experts-modell – 560 miljarder parametrar totalt, 25 miljarder aktiva per token – och Artificial Analysis klassificerar den som proprietär. Det finns inga vikter, ingen licensfil och inget kodförråd. En stor gles modell av den formen skulle normalt släppas öppet, eftersom det är vad resten av den här nivån gör: GLM 5.3 Flash levereras med MIT-vikter på 320 miljarder totalt och 18 miljarder aktiva, och DeepSeek V4.1 Flash levereras med MIT-vikter på 552 miljarder totalt och 16 miljarder aktiva. Ling 3.1 Flash är samma klass av arkitektur i samma storleksordning, endast publicerad som ett API.
Det valet har en konsekvens som benchmarkraderna inte visar. En modell med 25 miljarder aktiva parametrar måste betjänas någonstans, och om du inte kan hålla checkpointen kan du inte välja var eller med vilken marginal — du hyr leverantörens serving av den. Priset på 5,49 $ per Terminal Bench-uppgift ovan är inte i första hand en artefakt av tokenkostnaden; det är vad det kostar att hyra en stor gles modell från den enda part som kan köra den. Syskonmodellerna med öppna vikter i den här nivån ger dig möjligheten att flytta den siffran själv.
Det skär åt andra hållet också, och samma ärlighet gäller. En öppen release är inte automatiskt den bättre produkten: du ärver driftbördan, kvantiseringsvalen och uppgraderingskarusellen tillsammans med vikterna, och en licensfil är inte ett supportavtal. Anthropic publicerar ett utfasningsåtagande för Claude Haiku 5.5 om tidigast den 7 oktober 2027, på ett förstaparts-API med ett systemkort. Vilket av dessa två upplägg du vill ha är en fråga om ditt team, inte om någon av modellerna.
Vad {{1}}Ling 3.1 Flash{{/1}} är till för
Läs profilen i sin helhet, och den beskriver en sammanhängande produkt snarare än en kompromissad sådan: en stor, gles modell med lång kontext som slutför autonoma flerstegsarbetsflöden bättre än något annat som mätts i detta prisintervall, är föga anmärkningsvärd när det gäller svåra resonemang i ett enda steg, och gör det till ett fast pris utan något stup vid promptlängd. På AutomationBench är den 26 poäng före Claude Haiku 5.5, och dess AA-Briefcase-poäng är den enda punkten i denna jämförelse där den hamnar bakom mitten av fältet i stället för i täten av det.
Det är en försvarbar beskrivning av en agentisk batcharbetare: rikta den mot en kö av strukturerade jobb som var och en måste slutföras, acceptera att uppgiften mäts i minuter, håll prompten tillräckligt lång för att ett tröskelsteg skulle bli bestraffande, och värdera tillförlitlighet vid mållinjen högre än kostnaden för varje enskild token. Vad den inte är bra för är det som modeller i flash-klassen vanligtvis köps in för. Den tar bara emot text – ingen bildinmatning alls, medan Claude Haiku 5.5 tar text och bilder. Dess indexuppgiftstid är kortare, men dess Terminal Bench-uppgiftstid är längre, och med $0,99 per slutförd indexuppgift mot $0,21 spenderar den fyra och en halv gånger så mycket för att landa på nästan samma sammansatta poäng.

Vilken av de två, utifrån den bevisning som finns
Om ditt arbete är text in, text ut, prissatt per token i volym, vinner Claude Haiku 5.5 denna jämförelse på varje rad som når en faktura: lägre indexuppgiftskostnad, lägre verklig uppgiftskostnad på det benchmark som betyder mest för agenter, högre komposit, bättre poäng för långformat professionellt arbete, bättre trohet, och bildinmatning som den andra modellen inte erbjuder alls.
Om ditt arbete är en oövervakad agent som måste slutföra ett flerstegsarbetsflöde, ligger Ling 3.1 Flash 26 poäng över Claude Haiku 5.5 på det enda gemensamma benchmark som mäter exakt detta, och det är värt att testa i stället för att avfärda på grund av priset. Testa det på din egen trace, inte i den här tabellen — och prissätt testet per slutfört jobb, eftersom det är siffran som ändras när en agent gör ett nytt försök.
Om du behöver tillgång till vikterna är ingen av dessa två din modell. Ling 3.1 Flash är proprietär med 560 miljarder parametrar; Claude Haiku 5.5 är proprietär utan offentliggjort antal. De öppna släppen i den här nivån finns någon annanstans på resultattavlan, och den jämförelsen utgår från en helt annan uppsättning rader.
Det sammansatta måttet säger 2,31 poäng. Det agentiska benchmarket säger 26 åt andra hållet. Priskortet säger 3× på indata; kostnaden per slutförd uppgift säger 4,6× i samma riktning som kortet. Fyra tal, två riktningar – vilket är anledningen till att det enda tillförlitliga sättet att avgöra detta är att köra båda mot ett spår av ditt eget arbete och läsa av kostnaden från de slutförda jobben i stället för tokens.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
