
Claude Haiku 5.5 vs Qwen3.8 27B: En ren utklassning på API:et, och varför de öppna vikterna fortfarande finns
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
De flesta jämförelserna i den här serien kokar ner till en avvägning. Den här gör det inte, och avsaknaden av en avvägning är själva fyndet. Claude Haiku 5.5, som släpptes den 7 oktober 2026, slår Qwen3.8 27B, den täta 27B-modellen med öppna vikter från den 14 augusti 2026, på den sammansatta intelligenspoängen, på kostnaden per token, på kostnaden per slutförd uppgift, på kontextfönstret, på svarstaket, på agentisk kodning och på raderna för vetenskapligt resonemang — och det gör den via ett enda proprietärt API som inte kräver någon hårdvara. Den enda rad där Qwen3.8 27B vinner ohotat är videoinmatning, och den andra är en licens.
Det är inte ett skäl att avfärda modellen, för en Apache-2.0-licens och en videomodaliitet är inga tröstpriser. Det är ett skäl att vara precis om varför någon skulle välja open-weights-sidan, och att sluta låtsas att argumentet handlar om benchmarks.
Siffrorna som båda modellerna faktiskt kördes på
Per miljon tokens i US-dollar. Leverantörens priser kommer från dess egen prisdokumentation; de gemensamma mätningarna är Artificial Analysis Intelligence Index v4.3.2, avlästa 2026-10-08, båda i deras högsta publicerade ansträngningskonfiguration.

• Indata — Claude Haiku 5.5 $0.10 upp till 100 000 token och $0.50 däröver; Qwen3.8 27B $0.50 enligt styrelsens registrerade tredjepartstaxa.
• Utdata — Claude Haiku 5.5 $0.50 upp till 100 000 tokens och $2.50 däröver; Qwen3.8 27B $3.00.
• Cachad indata — Claude Haiku 5.5 $0.01 och $0.05, en rabatt på 90 %; Qwen3.8 27B $0.10, en rabatt på 80 %.
• Oberoende poäng — 43,40 för Claude Haiku 5.5 (Max) mot 33,70 för Qwen3.8 27B (Xhigh). Ett gap på 9,70 poäng, det största i denna omgång.
• Kostnad per slutförd uppgift – 0,21 USD mot 1,01 USD, i samma utvärderingskörning. En skillnad på 4,7x, också den största här.
• Kontext och utdata — 1M token och ett svarstak på 128 000 token för Claude Haiku 5.5; en kontext på 256K token för Qwen3.8 27B.
• Modalitet – båda tar emot text och bilder och returnerar text. Qwen3.8 27B lägger till videoinmatning; Claude Haiku 5.5 gör det inte.
• Vikter — Qwen3.8 27B är 27B täta parametrar under Apache 2.0 och kan laddas ned. Claude Haiku 5.5 är proprietär och endast tillgänglig via API.

Varför gapet per uppgift är fyra gånger gapet per token
Prislistan visar redan ett 5x gap i indata och ett 6x gap i utdata till leverantörens fördel, så riktningen är inte ifrågasatt. Det som är värt att läsa är att siffran per uppgift är mindre än siffran per token, vilket är motsatsen till vad som hände i den här batchens andra matchningar, och anledningen är lärorik.
Claude Haiku 5.5 genererar 162 164 utdatatoken per uppgift i Intelligence Index – 129 047 för resonemang och 33 118 för svar. Qwen3.8 27B genererar 66 797, uppdelat på 47 711 för resonemang och 19 087 för svar. Leverantörens modell gör av med 2,4 gånger så många token per uppgift, så dess 6x-fördel i utdatahastighet komprimeras till en 4,7x-fördel per uppgift. Den är fortfarande enorm. Det är bara inte siffran som prislistan annonserar.
Blandningsmatematiken är ett renare sätt att se formen på det. I en indatatung 7:2:1-blandning – den vikt som den mesta produktionstrafiken faktiskt har – hamnar Claude Haiku 5.5 på $0,077 per miljon tokens mot $0,470 för Qwen3.8 27B. I en balanserad 1:1-blandning är det $0,30 mot $1,75. Leverantörens 100 000-tokenklippa är det enda som någonsin stänger detta: bortom den blir Claude Haiku 5.5:s prismätare $0,50 och $2,50 för hela begäran, och de två modellerna möts på ungefär samma pris – då betalar du en premie på 9,7 poäng i betyg för ingenting.
Där leverantörskortet och den oberoende styrelsen inte stämmer överens
Det här är raduppsättningen som är värd att stanna upp vid, för Qwen3.8 27B:s eget modellkort framställer modellen som betydligt starkare än de oberoende mätningarna gör, och skillnaden är hela anledningen till att ett påstående om "en 27B-modell som mäter sig med mycket större" behöver en andra källa.
Leverantörens egna publicerade siffror, så som de återges på vår katalogsida för modellen, omfattar 90,3 på LiveCodeBench v6, 89,2 på GPQA Diamond, 84,3 på OSWorld-Verified och 79,0 på QwenSWEBench. Dessa är leverantörsrapporterade och inte reproducerade, och de beskriver en modell som är konkurrenskraftig långt över sin viktklass.
I den oberoende körningen från Artificial Analysis uppnår Qwen3.8 27B 0,0556 på Terminal-Bench 4.0, 0,4664 på SciCode, 0,3392 på Humanity's Last Exam och 1423,21 på GDPval-AA v2.1. Sätt 0,0556 bredvid 84,3 som leverantörskortet anger för OSWorld, och formen på oenigheten är tydlig: inom agentiskt arbete med datorer och terminaler placerar den oberoende resultattavlan den här modellen ungefär där en tät 27B-modell hör hemma, och det gör inte leverantörskortet.
Två rader drar åt andra hållet, och de är värda att nämna av samma anledning. Qwen3.8 27B får 0.4824 på AutomationBench mot Claude Haiku 5.5:s 0.3541 — en oberoende vinst på 12,8 punkter på det närmaste någon av resultattavlorna har till ett benchmark för affärsautomation. Det är en riktig siffra från samma körning, på den rad som ligger närmast det som folk faktiskt driftsätter små modeller för.
Den ärliga tolkningen är inte ”leverantören överdrev allt”. Det är att ett modellkort mäter de uppgifter som dess författare valde, den oberoende nämnden mäter en fast uppsättning, och Qwen3.8 27B:s styrkor finns på leverantörens lista och inte på nämndens.
Ekonomin förändras när du äger hårdvaran
Varje pris som anges ovan är ett API-pris, och för Qwen3.8 27B är det en felaktig referensram.
Detta är en 27B tät modell under Apache 2.0. Den får plats på en enda modern accelerator vid den kvantisering som de flesta team skulle acceptera, vilket innebär att marginalkostnaden för en token slutar vara en leverantörs mätare och blir din egen utnyttjandegrad. Det är därför priset för att anropa den varierar beroende på värd på ett sätt som ingen av de proprietära modellerna i denna jämförelse någonsin skulle kunna: tavlan registrerar ett tredjepartspris på 0,50 dollar in och 3,00 dollar ut, och OrcaRouter-katalogen listar den till 0,33 dollar in och 2,40 dollar ut utan någon cache-läsningsrad alls, eftersom vi kör vikterna på vår egen infrastruktur i stället för att återförsälja någon annans slutpunkt.
För ett team som redan betalar för GPU:er är jämförelsen inte $0,21 mot $1,01 per uppgift. Det är leverantörens fakturerade taxa mot marginalkostnaden för en begäran på hårdvara som ni äger, och det är olika siffror. Det är argumentet för open-weights-sidan, och det är det enda som håller när det ställs mot benchmark-tabellen.
Det finns en andra, mindre uppenbar konsekvens av att licensen är Apache 2.0: modellen kan levereras inuti en produkt, finjusteras på din egen trafik, låsas vid en specifik revision och granskas ända ned till vikterna. Inget av detta är tillgängligt till något pris från en proprietär API-only-modell, och för reglerade arbetsbelastningar är det ofta den avgörande begränsningen snarare än en preferens.

Att ringa någon av dem
Qwen3.8 27B is on the OrcaRouter catalogue as qwen/qwen3.8-27b at $0.33 and $2.40 per million tokens, self-hosted on our own infrastructure, with the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1. Run against our own traffic over the last week it returns a median 1,837 ms to first token at 319 output tokens per second — a fast model, measured on our playground rather than a standardised harness, so treat that as a serving figure and not a benchmark. Video, image and text input, 262K-token context, native tool calling, structured outputs and a reasoning mode are all supported on the same key as everything else on the catalogue.
Claude Haiku 5.5 finns inte i katalogen. Den är nåbar via leverantörens API direkt och via AWS, Azure och de stora molnplattformarna, och det är det korrekta påståendet. Vad katalogen däremot innehåller från leverantörens sortiment är Claude Sonnet 5.5 och Claude Opus 5.5, vilket gör att eskaleringen från en självhostad liten modell till en hostad agentisk mellanklassmodell blir en routingändring snarare än en andra integration — automatisk failover ligger under det oavsett.
Domen, som är ovanligt ensidig
Som ett API-anrop på text eller bilder vinner Claude Haiku 5.5 den här jämförelsen på varje rad som inte handlar om licensiering. Nio komma sju indexpunkter, 4,7x billigare per slutförd uppgift, fyra gånger så stort kontextfönster, dubbelt så högt svarstak och en fem till sex gånger lägre prislapp i regimen för korta prompter. Det finns inget argument om arbetsbelastningens form som räddar Qwen3.8 27B på pris, eftersom leverantörens nackdel — tung användning av utdata-tokens — är värd långt mindre än dess prisfördel.
Det som räddar det är allt som API-priset inte fångar: en licens som tillåter vidaredistribution, vikter som kan hållas och fästas, videoinmatning, och en självhostad väg där kostnaden per token är din egen hårdvara i stället för en leverantörs kort. Om du letar efter det billigaste sättet att klassificera, extrahera, sammanfatta och dirigera text är Claude Haiku 5.5 svaret, och gapet är inte litet. Om du letar efter en modell som du kan sätta in i din egen produkt, på din egen hårdvara, under din egen granskning, slutade benchmarkgapet att vara frågan för flera stycken sedan.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
