Genererat hero-kort för Kolibri vs Qwen 3.8, med rubriken ”Kolibri vs Qwen 3.8” och underraden ”suverän tysk serving mot en öppen kinesisk familj”, en kolibriikon till vänster och en molnkontur till höger på varsin sida om en tunn avdelare. OrcaRouter-logotypen sitter i remsan under konstverket.
Guides & Insights

Kolibri vs Qwen 3.8: den tyska modellen förlorar i sin egen tabell – och det är själva poängen

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Börja med meningen som de flesta lanseringstexterna om Kolibri utelämnade. I benchmarktabellen som Aleph Alpha publicerade med sin egen modell den 3 oktober 2026 är den modell som den oftast mäts mot varken en europeisk eller en amerikansk rival. Det är Qwen3.8 27B, leverantörens öppenviktsnivå i den generationen, släppt den 13 augusti 2026 — och enligt Aleph Alphas egna siffror vinner den. Qwen3.8 27B får 80,2 på det engelska genomsnittet och 79,9 på det tyska genomsnittet i samma utvärderingssvit som ger Kolibri 75,5 och 70,8. Den leder på GPQA Diamond, 89,2 mot 84,3. Den leder på LiveCodeBench v6, 93,8 mot 85,9. Den leder på SWE-Bench Verified, 72,6 mot 66,4, och på båda långkontext-benchmarkarna, 76,9 mot 64,5 på LongBench Pro och 81,3 mot 68,3 på AA-LCR. En tät kinesisk modell med 27 miljarder parametrar, utvärderad av ett tyskt labb, slår labbets flaggskepp med 78 miljarder parametrar på större delen av dess egen tabell. Det är inte en skandal. Det är det mest användbara faktumet i lanseringen, eftersom det tvingar fram frågan om vad Kolibri egentligen är till för.

Ett förtydligande innan jämförelsen går längre, eftersom "Qwen 3.8" betecknar en familj snarare än en modell och skillnaderna spelar roll här. Qwen3.8-Max är Alibabas värdbaserade flaggskepp, i drift sedan 3 augusti 2026 med ett kontextfönster på 1M tokens till $2,00 per miljon indatatokens och $6,00 för utdata. Qwen3.8-27B är nivån med öppna vikter, släppt 13 augusti 2026 med ett fönster på 262 144 tokens. Qwen3.8-Flash är volymnivån, släppt 26 augusti 2026 med 1M-tokensfönstret och mycket lägre priser. Och vanliga Qwen3.8 – tillkännagiven den 19 juli 2026 som ett flaggskepp med öppna vikter och 2,4 biljoner parametrar – är inte släppt; den finns som en katalogsida för spårning och ett tillkännagivande. Allt nedan handlar om den med vikter som du kan ladda ner och köra, det vill säga 27B.

Där Kolibri faktiskt vinner, avläs från samma tabell

Raderna där Kolibri ligger före Qwen3.8 27B är inte slumpmässigt utspridda. De klustrar sig, och klustret är produkten.

• Avstående — på RGB Negative får Kolibri 85,6 mot 70,6. När kontexten inte innehåller svaret säger Kolibri det mycket oftare.

• Verktygsanrop under begränsning — på τ²-bench telekom, 94,7 mot 82,5; på den vertikala sviten för fordonsleverantörer, 99,0 mot 97,3.

• Mycket lång kontext — på SealQA utan distraktorer över 24k tokens, 100,0 mot 94,4.

• Tysk serving-ekonomi — en tvåspråkig tokenizer på 4,90 genomsnittliga byte per token på tysk webbtext, mot 4,17 för Qwen3.5–3.8-familjen enligt Aleph Alphas egen mätning. Färre tokens per tyskt dokument är en direkt minskning av inferenskostnaden som syns på en faktura och inte i någon benchmark-rad.

Tre av de fyra handlar om beteende snarare än förmåga. Att avstå från att svara, begränsade verktygsanrop och förankrad hämtning i långa kontexter är vad du behöver från en modell som läser din organisations eget material och förväntas erkänna när materialet inte besvarar frågan. Aleph Alpha byggde hela lanseringen kring den satsningen, och tabellen visar att satsningen går hem.

Generated two-column scoreboard for Kolibri and Qwen3.8 27B. Left column Kolibri: English average 75.5, German average 70.8, abstention 85.6, GPQA Diamond 84.3, SWE-Bench Verified 66.4, licence Apache 2.0. Right column Qwen3.8 27B: English average 80.2, German average 79.9, abstention 70.6, GPQA Diamond 89.2, SWE-Bench Verified 72.6, licence Apache 2.0. The footer reads 'Both columns from Aleph Alpha's published table, vendor harness; no independent reproduction.'

De rader där Qwen3.8 27B vinner handlar om bredd: kunskap på båda språken, naturvetenskapliga frågor på avancerad nivå, tävlingsprogrammering, programvaruutveckling på repositorienivå, förståelse av långa dokument. Om ditt krav är en stark allmän modell till ett lågt pris per token med öppna vikter, är Qwen3.8 27B den bättre modellen och tabellen säger det med leverantörens eget bläck.

Den tolkningen styrks, medan Kolibris inte gör det. Artificial Analysis har mätt Qwen3.8 27B oberoende, i dess Xhigh-resonemangskonfiguration, och rapporterar ett Intelligence Index på 34, på första plats av de 142 modellerna i den jämförelsen, 45,4 output-tokens per sekund, en kontext på 256 000 tokens och en Apache 2.0-licens. Deras notering är osmickrande på ett välbekant sätt – mycket ordrik med 200 miljoner genererade tokens under indexutvärderingen, mot en median på 82 miljoner, och långsam – men själva poängen är en tredjepartsmätning av motståndaren. Kolibri har ingen Artificial Analysis-sida alls. Så den starkaste modellen i den här jämförelsen har verifierats oberoende, och den svagare är leverantörens ord, vilket är motsatsen till hur ett europeiskt flaggskepp i första generationen vanligtvis framställs.

Två typer av påståenden om leveranskedjan, riktade i motsatta riktningar

Båda dessa utgåvor är argument om varifrån en modell kommer, och argumenten är spegelbilder av varandra.

Aleph Alphas fall är proveniens som en funktion. Kolibri tränades av tyska team på infrastruktur i Tyskland och Finland, enligt EU-lagstiftning och tysk lag. Kortet redovisar förträningsmixen – 20 biljoner tokens vid ungefär 62,5 procent engelska, 23,9 procent tyska och 13,6 procent kod – budgetarna för mellanträning och lång kontext, den exakta beräkningskraften: 768 NVIDIA B200:or fördelade på 96 HGX-noder i 21 dagar, och en uppskattad energianvändning på 9,5×10² MWh inklusive datacentrets overhead. Det anger träningsmetoden ända ned till lagret: en 50-lagers mixture-of-experts-transformer med en 4:1-uppdelning mellan sliding-window-attention och grouped-query-attention, Muon och Exact Quantile Balancing över 384 experter med 1 delad och 6 routade. Tolv tusen ord av upplysningar kopplade till en nedladdning på 78 GB, och en uttalad ståndpunkt som undertecknare om EU:s uppförandekod för AI-modeller för allmänna ändamål.

Alibabas fall är av ett annat slag: inte "vi kan redogöra för varje beslut" utan "här är vikterna, ta dem". Apache-licensierade öppna vikter i en skala och kvalitet som gjorde Qwen till det faktiska standardvalet i hela världen, en vokabulär på 248 077 token som täcker långt över hundra språk, och ett serveringsekosystem som har optimerats kring dessa checkpoints länge nog för att nästan varje inferensstack ska stödja dem direkt. Suveränitetsargumentet i det fallet handlar om tillgänglighet: ingen leverantör kan dra tillbaka modellen, eftersom du redan har filen.

Båda påståendena är ärliga och de svarar på olika farhågor. En inköpare inom offentlig sektor i Baden-Württemberg är orolig för jurisdiktion och granskningsbarhet, och Kolibri riktar sig till den oron. En forskargrupp i Nairobi eller São Paulo är orolig för att en modell är låst bakom ett kreditkort i en valuta de inte kan betala i, och öppna Qwen-vikter riktar sig till den. Det som inte är ärligt är att låtsas att något av dem är en kapacitetsjämförelse, eftersom kapacitetstabellen redan har gett sitt svar.

Screenshot of the Artificial Analysis model page for Qwen3.8 27B (Xhigh), marked 'Open weights model, Released August 2026', showing an Intelligence Index of 34 against a median of 8, a #1/142 intelligence rank, a #55/142 speed rank at 45 tokens per second against a 91-token median, input pricing $0.50 per million tokens against a $0.03 median and output pricing $3.00 against a $0.15 median, an average cost of $1.01 per task on the Intelligence Index, a verbosity rank of #22/142 having generated 200M tokens during the index evaluation against a median of 82M, a 256k-token context window, and the Apache 2.0 licence badge.

Licensgapet är verkligt men snävare än det låter

Kolibri är Apache 2.0. Qwen3.8 27B är Apache-licensierade öppna vikter. Båda levereras utan tilläggsklausul om godtagbar användning, utan tröskel för månatligt aktiva användare och utan separata kommersiella villkor — vilket placerar dem i en liten grupp och innebär att ingen av dem kräver en juridisk granskning före kommersiell användning.

Det som skiljer dem åt är allt som följer på licensen. Kolibri levereras med ett vLLM-plugin och parserpaket från leverantören, en containeravbild, fyra nivåer för resonemangsansträngning som kan konfigureras via chattmallen, ett explicit avståendebeteende och en rekommenderad samplingskonfiguration. Qwen3.8 27B levereras som vikter som Transformers, vLLM och SGLang redan vet hur man servar, med ett verktygsanropsformat som det bredare ekosystemet har haft månader på sig att anpassa sig till.

Driftsättningshårdvaran skiljer sig på samma sätt. Kolibris FP8-vikter har ett minnesavtryck på ~78 GB med ett minimikrav på två A100 80 GB-kort, två H100 SXM5, en H200, en B200 eller en B300. Qwen3.8 27B i bfloat16 är ungefär 54 GB vikter, vilket innebär en enda 80 GB-accelerator vid full precision eller en kvantiserad version på betydligt mindre hårdvara. Den tyska modellen kräver mer hårdvara och ger lägre benchmark för det. Det är bara en dålig affär om du köpte benchmark.

Vad prislapparna säger och inte säger dig

Kolibri har inget pris, eftersom Aleph Alpha inte säljer inferens för Kolibri. Släppet består av vikter, en teknisk rapport och ett kort; det finns ingen hostad SKU. Varje kostnadssiffra för Kolibri är en hårdvaruavskrivningsberäkning som du gör själv.

Qwen3.8 prissätts offentligt i tre nivåer, och den mellersta är den som spelar roll för ett team som jämför egen drift med att hyra.

• Qwen3.8-Max — 2,00 USD per miljon indatatoken och 6,00 USD för utdata, kontext på 1 miljon token, cacheläsningar för 0,25 USD, släpptes 3 augusti 2026.

• Qwen3.8-27B — 0,33 USD för input och 2,40 USD för output, kontext på 262 144 token, släppt 13 augusti 2026. Det här är de öppna vikterna, så det här priset är vad du betalar om du hellre låter bli att köra dem.

• Qwen3.8-Flash — 0,15 $ för indata och 0,47 $ för utdata med 1M-tokenfönstret, släppt 26 augusti 2026.

Det där är leverantörernas listpriser på OrcaRouter, vidarebefordrade utan något påslag per token, vilket är den användbara egenskapen när frågan är om en självhostad driftsättning betalar sig: du kan mäta din verkliga tokenvolym på de hostade nivåerna innan du satsar på hårdvara. Vi lägger inte på någon marginal, så en leverantörs prissänkning slår igenom hos oss samma dag. Alla tre Qwen3.8-nivåerna kan routas idag med en enda OpenAI-kompatibel nyckel med automatisk failover mellan leverantörer, och den kommande Qwen3.8 med 2,4 biljoner parametrar har en katalogsida som väntar på vikterna i stället för en platshållare som låtsas betjäna dem.

Kolibri är inte routbar. Vi har sökt igenom katalogen under varje leverantörs- och modellstavning och den finns inte med — så det enda sättet att anropa den är nedladdningen på 78 GB. Om du vill veta vad den tyska modellen skulle kosta din arbetsbelastning är svaret ett rack och en person som kan köra vLLM, och ingen tredje part kan för närvarande lämna något annat pris.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the 1M-token context badge, text, image and video input with text output, the Vision, Tools, JSON and Reasoning capability tags, a p50 time-to-first-token of 2.35 seconds, the attribution 'Public benchmarks by Qwen - 2026-08-03', the description as Alibaba's newest flagship in the Qwen line positioned against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, the pricing tiles $2.00 and $6.00, and the OpenAI-compatible and Anthropic-compatible base URLs at https://api.orcarouter.ai/v1 and https://api.orcarouter.ai.

Vem ska köpa vilken

Beslutet hänger inte på kvaliteten, eftersom den frågan har avgjorts av leverantörens egen tabell till Alibabas fördel. Det hänger på vilken risk du köper försäkring mot.

• Välj Kolibri om den bindande begränsningen är jurisdiktion, härkomstdokumentation eller granskningsbarhet — om du behöver kunna svara på var träningsdatan kom ifrån, var beräkningen kördes och under vilken lag, och om arbetsbelastningen består av tyska och engelska dokument som bearbetas inom din egen perimeter. Du betalar en kapacitetspremie för det, och premien syns i tabellen ovan.

• Välj Qwen3.8 27B om den bindande begränsningen är kapacitet per dollar, språkbredd eller ekosystemstöd. Det är den starkare modellen i Aleph Alphas egen utvärdering, den är Apache-licensierad, den körs på en accelerator, och de hostade nivåerna börjar på $0,33 per miljon indatatokens om du helst inte vill köra den själv.

• Överväg båda i samma arkitektur om arbetsbelastningen har en reglerad kärna och en allmän periferi. Dokumenten som inte får lämna byggnaden går till en självhostad Kolibri-endpunkt; sammanfattnings-, översättnings- och kodarbetet går till en routad Qwen3.8-nivå till en tredjedels cent per tusen token. En API-nyckel, en routingregel, leverantörens listpriser som förs vidare, och redundansväxlingen hanteras åt dig – vilket är ett betydligt mer användbart upplägg än att välja en av dessa två och låtsas att den andra inte finns.