
Claude Haiku 5.5 vs Qwen3.8-Flash-Next: Modellen med öppna vikter är inte den billiga
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Instinkten är att en öppenviktsmodell från Alibabas flash-nivå kommer att underbjuda en sluten liten Anthropic-modell i pris, och på de två prislappssiffrorna gör den det: Qwen3.8-Flash-Next erbjuds för 0,15 USD per miljon indatatokens och 0,47 USD per miljon utgående tokens via Alibabas egen API, mot 0,10 och 0,50 USD för Claude Haiku 5.5. Kör man båda mot samma benchmark-svit vänder dock ordningen. Artificial Analysis mäter Claude Haiku 5.5 vid Max effort till 0,21 USD per slutförd Intelligence Index-uppgift; Qwen3.8-Flash-Next kostar 0,37 USD vid samma mätning, för en poäng tre punkter lägre. Den billigare prislappen tillhör modellen med den större räkningen, och orsaken är densamma som avgör de flesta av dessa jämförelser: prislistan är inte priset, och öppenviktsmodellen förtjänar sitt uppehälle någon annanstans än på en förvaltad API-räkning. Det där "någon annanstans" är det egentliga ämnet för den här jämförelsen.
Vad var och en är
De två landade med sex veckors mellanrum och de är inte samma typ av artefakt.
• Claude Haiku 5.5 – en modell med slutna vikter som släpptes den 7 oktober 2026, på Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry och Claude Platform on AWS. 1M-tokenkontext, upp till 128 000 utdatatokens i det synkrona Messages API, adaptivt tänkande med ett ansträngningsreglage från Low till Max och standardvärdet medium, en kunskapsgräns från juni 2026 och en prislista som trappas vid 100 000 tokens.
• Qwen3.8-Flash-Next – en öppen viktmodell av typen mixture-of-experts som släpptes den 26 augusti 2026 under licensen qwen-community-1.0, beskriven av Alibaba som en experimentell förhandsvisning av arkitekturen som kommer att ligga till grund för Qwen4. Den lagrar 125B parametrar i huvudmodellen plus en separat n-gram-inbäddningstabell på 51B – ungefär 176B innan en 4B-modul för förutsägelse av flera token – och aktiverar 6B per token, med 512 experter, top-10-routing och 48 lager. Den har inbyggt 262 144 tokens kontext, utökningsbart till 1M med YaRN, och tar emot text-, bild- och videoindata.
• Qwen3.8-Flash — den levererade kommersiella motsvarigheten, också live sedan 26 augusti 2026 på Alibabas QwenCloud för 0,16 USD per miljon indata-token och 0,47 USD per miljon utdata-token med en standardkontext på 1 miljon token. Värt att hålla åtskild från Flash-Next: den ena är en checkpoint du kan ladda ner och granska, den andra är en prissatt hanterad endpoint.
Skillnaden mellan de två sista är hela anledningen till att den här jämförelsen är intressant. Claude Haiku 5.5 och Qwen3.8-Flash-Next konkurrerar om väldigt lite, eftersom bara en av dem kan köras på din egen hårdvara.
Den uppmätta näbben, som pekar åt andra hållet
Alla följande oberoende siffror kommer från Artificial Analysis och avser Intelligence Index v4.3.2. Anthropics och Alibabas prislistor är leverantörernas egna publicerade priser.
• Intelligensindex — Claude Haiku 5.5 med Max-ansträngning 43, tvåa av 182 modeller. Qwen3.8-Flash-Next 40, sexa av 117 i sin klass. Tre poängs skillnad, till Anthropics fördel.
• Kostnad per uppgift — $0,21 mot $0,37. Modellen som är dyrare per token är 43 % billigare per slutförd uppgift.
• Utdata-tokens i Index-körningen — 440 miljoner för Claude Haiku 5.5 och 240 miljoner för Qwen3.8-Flash-Next, båda mot en median på 100 miljoner. Qwen-modellen är den effektivare skribenten och ändå den dyrare uppgiften, vilket säger att gapet inte är enbart tokenvolym utan mixen av indata och den värdering som utvärderaren tillämpar.
• Utdatningshastighet — 241,9 tokens per sekund mot 56,0. Claude Haiku 5.5 är mer än fyra gånger snabbare vid samma mätning, och dess tid till första token på 295 sekunder i den körningen är en artefakt av att tänka med Max effort snarare än en nätverkssiffra; tiden till första token för Qwen3.8-Flash-Next är 2,53 sekunder.
• Prislistans utformning — Claude Haiku 5.5 trappar från $0.10 och $0.50 till $0.50 och $2.50 vid 100 000 tokens. Qwen3.8-Flash ligger oförändrat på $0.16 och $0.47 oavsett längd, vilket är en verklig fördel vid långa prompter och den enda platsen där prislappsargumentet överlever kontakten med ett långt dokument.
• Tokeniserare — Claude Haiku 5.5 använder den nyare tokeniseraren som delas med Claude 4.7 och senare, så samma text räknas som ungefär 30 % fler tokens än på den tidigare Haiku. Det blåser upp prompter mot 100 000-tokensteget; det är Anthropics egen dokumentation, och det talar emot modellen i precis det fall med långa prompter där Qwens enhetliga taxa ser bäst ut.
Så här ser avvägningen ut: betala mer per token och få ett snabbare, något smartare svar som kostar mindre per slutförd uppgift, med en prisklippa att se upp för vid långa indata. Eller betala mindre per token och få en långsammare modell som kostar mer per slutförd uppgift, med en fast taxa och ett inbyggt fönster på 262 144 token.


Där öppna vikter faktiskt förändrar kalkylen
Allt ovan jämför två hanterade API:er, och det är en jämförelse som Qwen3.8-Flash-Next inte var designad för att vinna. Dess argument är att den inte behöver hyras.
• Serveringsstöd från dag noll. SGLang har släppt en cookbook-sida och en dedikerad avbildning; vLLM har en build för den medan pull requesten för arkitekturstöd fortfarande är öppen. NVIDIA validerade båda plus TensorRT LLM på ett GB300 NVL72-rack, och NeMo täcker finjustering.
• Hårdvarugolvet är lågt för en 176B-checkpoint.N-gram-inbäddningstabellen på 51B kan ligga i värdminnet i stället för VRAM, eftersom dess uppslagsadresser är kända i förväg och kan förhämtas. Det är vad som gör att modellen kan köras på DGX Spark-kluster och 4×RTX PRO 6000-arbetsstationer, och dagsfärska community-kvantiseringar — 1-bitarsbyggen som får plats i 75 GB RAM med ungefär 80 % av full noggrannhet — gör att den kan köras på hårdvara som ett litet team äger.
• Finjustering är tillgänglig. Inte i betydelsen av ett hostat finjusterings-API: vikterna är dina, under en community-licens med de vanliga villkoren, och arkitekturen dokumenteras i en teknisk rapport som publicerar ablationerna och de negativa resultaten.
• Fönstret är mindre än det ser ut. 262 144 tokens nativt, utökningsbart till 1M med YaRN – jämfört med 1M nativt på Claude Haiku 5.5, utan något förbehåll om rope-skalning. På långdokument-arbetsbelastningar, där Qwens platta taxa ser mest attraktiv ut, är modellen som faktiskt kan hålla dokumentet den andra.
• Benchmarkresultaten är rapporterade av leverantören. Alibabas egen tabell placerar Flash-Next före DeepSeek-V4-Flash-0731 på DeepSWE 1.1 (58,7 mot 54,4), SWE-bench Pro (62,5 mot 56,0) och GPQA Diamond (91,7 mot 90,8), och efter den på NL2Repo-Bench (48,1 mot 54,2) — kodgenerering på repositorienivå, den enda agentiska dimensionen där den mindre modellen inte hänger med. Inget av det har reproducerats av en tredje part, och modellen är sex veckor gammal.
Det är den ärliga gränsen mellan de två. Claude Haiku 5.5 är en mätbaserad tjänst med ett fast kvalitetstak och ingen operativ yta. Qwen3.8-Flash-Next är en artefakt vars kostnadskurva böjer sig nedåt mot elpriset och vars kvalitetstak är vad du än kan servera, plus risken för en icke reproducerad benchmarktabell och en arkitektur som fortfarande håller på att absorberas av runtime-miljöerna.
Det realistiska sättet att besluta
Tre frågor avgör saken, och bara den första handlar om benchmarks.
Har du, eller vill du ha, GPU:er? Om inte är fallet med egen drift teoretiskt och jämförelsen med hanterade tjänster ovan är hela bilden – och den går till Claude Haiku 5.5 vad gäller kostnad per uppgift, hastighet och poäng, med förbehållet att dess 100 000-tokensteg straffar långa prompter. Om du faktiskt har acceleratorer som ligger under ett utnyttjandemål är Qwen3.8-Flash-Next en av få öppna modeller där en avkodning med 6B aktiva parametrar är genuint billig att köra i stor skala, och siffran $0,37 per uppgift slutar vara det relevanta numret.
Hur lång är en genomsnittlig prompt? Det här är den enda platsen där prislappsargumentet håller. Under 100 000 tokens – efter en tokeniserare som blåser upp antalet med ungefär 30 % – är Claude Haiku 5.5 billigare på varje mätare. Över den är de fasta $0,16 och $0,47 det bättre kortet, och dess fördel ökar med längden ända upp till det inbyggda fönstret på 262 144 tokens, bortom vilket YaRN-förlängning är ett annat ingenjörsproblem.
Hur stor tolerans har arbetsbelastningen för varians i latens? 241,9 utdatatoken per sekund mot 56,0 är en stor skillnad, och en egenhostad driftsättning lägger till köbildning ovanpå det. En live-support- eller webbläsarstyrande agent – de arbetsbelastningar som Anthropic nämner för den här nivån – kommer att märka skillnaden.
För alla som vill besvara den andra och tredje frågan i stället för att resonera kring dem, är det billigaste instrumentet en delad slutpunkt. Qwen3.8-Flash-Next finns ännu inte i OrcaRouters katalog, och inte heller Claude Haiku 5.5; den Qwen-syskonmodell vi faktiskt dirigerar är Qwen3.8-Flash, till leverantörens listpris med 0 % påslag som förs vidare, vilket är den närmaste motsvarigheten som erbjuds till modellen i denna jämförelse och rätt baslinje för ett kostnadstest för långa prompter. På Anthropic-sidan är Claude Haiku 4.5, Claude Sonnet 5.5 och Claude Opus 5.5 alla anropbara med samma nyckel idag, så ett prisexperiment över två generationer är en konfiguration snarare än ett andra avtal — och eftersom prissättningen är vidarefakturerad snarare än sammanvägd, syns en leverantörssänkning på endera delen hos oss samma dag som den tillkännages. Automatisk växling är det som gör experimentet säkert att köra på verklig trafik: en förhandsvisningsmodell eller en icke reproducerad benchmark-tabell är precis fallet för att rikta en rutt mot något nytt medan en betrodd modell ligger bakom.
Vad skulle ändra svaret
Två saker, båda kontrollerbara. Den första är oberoende utvärdering av Qwen3.8-Flash-Next i ett testramverk som också kör Claude Haiku 5.5 — leverantörens tabell är mot DeepSeek, och den oberoende resultattavlans 40 är en enda placering. Ett kodningsbetyg på repositorienivå är raden att hålla koll på, eftersom NL2Repo är där modellen redan har visat sig ligga efter. Den andra är huruvida runtime-arbetet landar: vLLM-stödet håller fortfarande på att slås samman via öppna pull requests, och tills det gör det är självhosting av denna arkitektur en övning för team som gillar sådant snarare än en väg som stöds.
Fram till dess är sammanfattningen kort. Qwen3.8-Flash-Next är den mer intressanta modellen att äga och den dyrare att hyra. Claude Haiku 5.5 är den billigare, snabbare och högre poängsatta hanterade slutpunkten, med en prislista som straffar allt som är långt. Välj utifrån om du köper tokens eller köper en checkpoint – och om du köper tokens, notera att modellen med öppna vikter inte är den rabatt du antog.

