Ett genererat hero-kort med rubriken ”Claude Haiku 5.5 vs Qwen3.8 27B” och kickern ”ÖPPNA VIKTER MOT API:ET”, som visar Claude Haiku 5.5 med indata $0,10, utdata $0,50 och index 43,40 mot Qwen3.8 27B med indata $0,50, utdata $3,00 och index 33,70, över en stapel med texten ”Kostnad per slutförd uppgift $0,21 mot $1,01”.
Engineering & Research

Claude Haiku 5.5 vs Qwen3.8 27B: En ren utklassning på API:et, och varför de öppna vikterna fortfarande finns

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

De flesta jämförelserna i den här serien kokar ner till en avvägning. Den här gör det inte, och avsaknaden av en avvägning är själva fyndet. Claude Haiku 5.5, som släpptes den 7 oktober 2026, slår Qwen3.8 27B, den täta 27B-modellen med öppna vikter från den 14 augusti 2026, på den sammansatta intelligenspoängen, på kostnaden per token, på kostnaden per slutförd uppgift, på kontextfönstret, på svarstaket, på agentisk kodning och på raderna för vetenskapligt resonemang — och det gör den via ett enda proprietärt API som inte kräver någon hårdvara. Den enda rad där Qwen3.8 27B vinner ohotat är videoinmatning, och den andra är en licens.

Det är inte ett skäl att avfärda modellen, för en Apache-2.0-licens och en videomodaliitet är inga tröstpriser. Det är ett skäl att vara precis om varför någon skulle välja open-weights-sidan, och att sluta låtsas att argumentet handlar om benchmarks.

Siffrorna som båda modellerna faktiskt kördes på

Per miljon tokens i US-dollar. Leverantörens priser kommer från dess egen prisdokumentation; de gemensamma mätningarna är Artificial Analysis Intelligence Index v4.3.2, avlästa 2026-10-08, båda i deras högsta publicerade ansträngningskonfiguration.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8 27B — the scoreboard' with rows Index v4.3.2 43.40 against 33.70, cost per task $0.21 against $1.01, input price $0.10 against $0.50, context window 1M tokens against 256K tokens, AutomationBench 0.3541 against 0.4824 and weights 'proprietary' against 'open, Apache 2.0', footed 'All figures per Artificial Analysis Intelligence Index v4.3.2; Qwen vendor-card scores are unreproduced by the board.'

• Indata — Claude Haiku 5.5 $0.10 upp till 100 000 token och $0.50 däröver; Qwen3.8 27B $0.50 enligt styrelsens registrerade tredjepartstaxa.

• Utdata — Claude Haiku 5.5 $0.50 upp till 100 000 tokens och $2.50 däröver; Qwen3.8 27B $3.00.

• Cachad indata — Claude Haiku 5.5 $0.01 och $0.05, en rabatt på 90 %; Qwen3.8 27B $0.10, en rabatt på 80 %.

• Oberoende poäng — 43,40 för Claude Haiku 5.5 (Max) mot 33,70 för Qwen3.8 27B (Xhigh). Ett gap på 9,70 poäng, det största i denna omgång.

• Kostnad per slutförd uppgift – 0,21 USD mot 1,01 USD, i samma utvärderingskörning. En skillnad på 4,7x, också den största här.

• Kontext och utdata — 1M token och ett svarstak på 128 000 token för Claude Haiku 5.5; en kontext på 256K token för Qwen3.8 27B.

• Modalitet – båda tar emot text och bilder och returnerar text. Qwen3.8 27B lägger till videoinmatning; Claude Haiku 5.5 gör det inte.

• Vikter — Qwen3.8 27B är 27B täta parametrar under Apache 2.0 och kan laddas ned. Claude Haiku 5.5 är proprietär och endast tillgänglig via API.

A capture of Anthropic's Claude Platform models documentation showing the Claude model comparison table — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 'This model', the latter reading 1M context, 128K max output, 'From $0.10/$0.50', latency 'Fastest', default effort medium — above the Claude Haiku 5.5 specifications block with model ids claude-haiku-5-5, the two-tier pricing lines and 'Released October 7, 2026'.

Varför gapet per uppgift är fyra gånger gapet per token

Prislistan visar redan ett 5x gap i indata och ett 6x gap i utdata till leverantörens fördel, så riktningen är inte ifrågasatt. Det som är värt att läsa är att siffran per uppgift är mindre än siffran per token, vilket är motsatsen till vad som hände i den här batchens andra matchningar, och anledningen är lärorik.

Claude Haiku 5.5 genererar 162 164 utdatatoken per uppgift i Intelligence Index – 129 047 för resonemang och 33 118 för svar. Qwen3.8 27B genererar 66 797, uppdelat på 47 711 för resonemang och 19 087 för svar. Leverantörens modell gör av med 2,4 gånger så många token per uppgift, så dess 6x-fördel i utdatahastighet komprimeras till en 4,7x-fördel per uppgift. Den är fortfarande enorm. Det är bara inte siffran som prislistan annonserar.

Blandningsmatematiken är ett renare sätt att se formen på det. I en indatatung 7:2:1-blandning – den vikt som den mesta produktionstrafiken faktiskt har – hamnar Claude Haiku 5.5 på $0,077 per miljon tokens mot $0,470 för Qwen3.8 27B. I en balanserad 1:1-blandning är det $0,30 mot $1,75. Leverantörens 100 000-tokenklippa är det enda som någonsin stänger detta: bortom den blir Claude Haiku 5.5:s prismätare $0,50 och $2,50 för hela begäran, och de två modellerna möts på ungefär samma pris – då betalar du en premie på 9,7 poäng i betyg för ingenting.

Där leverantörskortet och den oberoende styrelsen inte stämmer överens

Det här är raduppsättningen som är värd att stanna upp vid, för Qwen3.8 27B:s eget modellkort framställer modellen som betydligt starkare än de oberoende mätningarna gör, och skillnaden är hela anledningen till att ett påstående om "en 27B-modell som mäter sig med mycket större" behöver en andra källa.

Leverantörens egna publicerade siffror, så som de återges på vår katalogsida för modellen, omfattar 90,3 på LiveCodeBench v6, 89,2 på GPQA Diamond, 84,3 på OSWorld-Verified och 79,0 på QwenSWEBench. Dessa är leverantörsrapporterade och inte reproducerade, och de beskriver en modell som är konkurrenskraftig långt över sin viktklass.

I den oberoende körningen från Artificial Analysis uppnår Qwen3.8 27B 0,0556 på Terminal-Bench 4.0, 0,4664 på SciCode, 0,3392 på Humanity's Last Exam och 1423,21 på GDPval-AA v2.1. Sätt 0,0556 bredvid 84,3 som leverantörskortet anger för OSWorld, och formen på oenigheten är tydlig: inom agentiskt arbete med datorer och terminaler placerar den oberoende resultattavlan den här modellen ungefär där en tät 27B-modell hör hemma, och det gör inte leverantörskortet.

Två rader drar åt andra hållet, och de är värda att nämna av samma anledning. Qwen3.8 27B får 0.4824 på AutomationBench mot Claude Haiku 5.5:s 0.3541 — en oberoende vinst på 12,8 punkter på det närmaste någon av resultattavlorna har till ett benchmark för affärsautomation. Det är en riktig siffra från samma körning, på den rad som ligger närmast det som folk faktiskt driftsätter små modeller för.

Den ärliga tolkningen är inte ”leverantören överdrev allt”. Det är att ett modellkort mäter de uppgifter som dess författare valde, den oberoende nämnden mäter en fast uppsättning, och Qwen3.8 27B:s styrkor finns på leverantörens lista och inte på nämndens.

Ekonomin förändras när du äger hårdvaran

Varje pris som anges ovan är ett API-pris, och för Qwen3.8 27B är det en felaktig referensram.

Detta är en 27B tät modell under Apache 2.0. Den får plats på en enda modern accelerator vid den kvantisering som de flesta team skulle acceptera, vilket innebär att marginalkostnaden för en token slutar vara en leverantörs mätare och blir din egen utnyttjandegrad. Det är därför priset för att anropa den varierar beroende på värd på ett sätt som ingen av de proprietära modellerna i denna jämförelse någonsin skulle kunna: tavlan registrerar ett tredjepartspris på 0,50 dollar in och 3,00 dollar ut, och OrcaRouter-katalogen listar den till 0,33 dollar in och 2,40 dollar ut utan någon cache-läsningsrad alls, eftersom vi kör vikterna på vår egen infrastruktur i stället för att återförsälja någon annans slutpunkt.

För ett team som redan betalar för GPU:er är jämförelsen inte $0,21 mot $1,01 per uppgift. Det är leverantörens fakturerade taxa mot marginalkostnaden för en begäran på hårdvara som ni äger, och det är olika siffror. Det är argumentet för open-weights-sidan, och det är det enda som håller när det ställs mot benchmark-tabellen.

Det finns en andra, mindre uppenbar konsekvens av att licensen är Apache 2.0: modellen kan levereras inuti en produkt, finjusteras på din egen trafik, låsas vid en specifik revision och granskas ända ned till vikterna. Inget av detta är tillgängligt till något pris från en proprietär API-only-modell, och för reglerade arbetsbelastningar är det ofta den avgörande begränsningen snarare än en preferens.

A capture of the OrcaRouter model page for Qwen3.8 27B under qwen/qwen3.8-27b, showing a 262K-token context chip, text, image and video input, text output, a p50 time to first token of 1.84 seconds, public benchmarks by Qwen dated 2026-08-15, and the page's own description of the model as Alibaba's open-weight 27B dense multimodal model released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure.

Att ringa någon av dem

Qwen3.8 27B is on the OrcaRouter catalogue as qwen/qwen3.8-27b at $0.33 and $2.40 per million tokens, self-hosted on our own infrastructure, with the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1. Run against our own traffic over the last week it returns a median 1,837 ms to first token at 319 output tokens per second — a fast model, measured on our playground rather than a standardised harness, so treat that as a serving figure and not a benchmark. Video, image and text input, 262K-token context, native tool calling, structured outputs and a reasoning mode are all supported on the same key as everything else on the catalogue.

Claude Haiku 5.5 finns inte i katalogen. Den är nåbar via leverantörens API direkt och via AWS, Azure och de stora molnplattformarna, och det är det korrekta påståendet. Vad katalogen däremot innehåller från leverantörens sortiment är Claude Sonnet 5.5 och Claude Opus 5.5, vilket gör att eskaleringen från en självhostad liten modell till en hostad agentisk mellanklassmodell blir en routingändring snarare än en andra integration — automatisk failover ligger under det oavsett.

Domen, som är ovanligt ensidig

Som ett API-anrop på text eller bilder vinner Claude Haiku 5.5 den här jämförelsen på varje rad som inte handlar om licensiering. Nio komma sju indexpunkter, 4,7x billigare per slutförd uppgift, fyra gånger så stort kontextfönster, dubbelt så högt svarstak och en fem till sex gånger lägre prislapp i regimen för korta prompter. Det finns inget argument om arbetsbelastningens form som räddar Qwen3.8 27B på pris, eftersom leverantörens nackdel — tung användning av utdata-tokens — är värd långt mindre än dess prisfördel.

Det som räddar det är allt som API-priset inte fångar: en licens som tillåter vidaredistribution, vikter som kan hållas och fästas, videoinmatning, och en självhostad väg där kostnaden per token är din egen hårdvara i stället för en leverantörs kort. Om du letar efter det billigaste sättet att klassificera, extrahera, sammanfatta och dirigera text är Claude Haiku 5.5 svaret, och gapet är inte litet. Om du letar efter en modell som du kan sätta in i din egen produkt, på din egen hårdvara, under din egen granskning, slutade benchmarkgapet att vara frågan för flera stycken sedan.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen