Gegenereerde hero-kaart voor Kolibri vs Qwen 3.8, getiteld 'Kolibri vs Qwen 3.8', met de subregel 'soevereine Duitse serving tegenover een open Chinese familie', een kolibrie-icoon links en een wolkenomtrek rechts aan weerszijden van een dunne scheidingslijn. Het OrcaRouter-logo staat in de strook onder de illustratie.
Guides & Insights

Kolibri vs Qwen 3.8: het Duitse model verliest op eigen terrein, en dat is juist het punt

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Begin met de zin die de meeste verslaggeving over de lancering van Kolibri wegliet. Op de benchmarktabel die Aleph Alpha op 3 oktober 2026 samen met zijn eigen model publiceerde, is het model waarmee het het vaakst wordt vergeleken geen Europese rivaal en ook geen Amerikaanse. Het is Qwen3.8 27B, de open-weightvariant van die generatie van de leverancier, uitgebracht op 13 augustus 2026 — en volgens Aleph Alpha's eigen cijfers wint die. Qwen3.8 27B scoort 80,2 op het Engelse gemiddelde en 79,9 op het Duitse gemiddelde van dezelfde evaluatiesuite die Kolibri 75,5 en 70,8 geeft. Het gaat aan kop op GPQA Diamond, 89,2 tegen 84,3. Het gaat aan kop op LiveCodeBench v6, 93,8 tegen 85,9. Het gaat aan kop op SWE-Bench Verified, 72,6 tegen 66,4, en op beide long-contextbenchmarks, 76,9 tegen 64,5 op LongBench Pro en 81,3 tegen 68,3 op AA-LCR. Een dense Chinees model met 27 miljard parameters, geëvalueerd door een Duits lab, verslaat de vlaggendrager met 78 miljard parameters van dat lab op het grootste deel van zijn eigen tabel. Dat is geen schandaal. Het is het nuttigste feit in de release, want het dwingt de vraag af waarvoor Kolibri eigenlijk dient.

Eén verduidelijking voordat de vergelijking verdergaat, want "Qwen 3.8" is de naam van een familie en niet van één model, en die verschillen zijn hier van belang. Qwen3.8-Max is het gehoste vlaggenschip van Alibaba, live sinds 3 augustus 2026, met een contextvenster van 1M tokens voor $2,00 per miljoen inputtokens en $6,00 voor output. Qwen3.8-27B is de open-weights-tier, uitgebracht op 13 augustus 2026 met een venster van 262.144 tokens. Qwen3.8-Flash is de tier voor grote volumes, uitgebracht op 26 augustus 2026 met het venster van 1M tokens en veel lagere prijzen. En het gewone Qwen3.8 — aangekondigd op 19 juli 2026 als een open-weight vlaggenschip met 2,4 biljoen parameters — is niet uitgebracht; het bestaat als een catalogusvolgpagina en een aankondiging. Alles hieronder gaat over degene met gewichten die je kunt downloaden en uitvoeren, namelijk de 27B.

Waar Kolibri echt wint, af te lezen uit dezelfde tabel

De rijen waarin Kolibri beter presteert dan Qwen3.8 27B zijn niet willekeurig verspreid. Ze clusteren, en dat cluster is het product.

• Onthouding — op RGB Negative scoort Kolibri 85,6 tegenover 70,6. Wanneer de context het antwoord niet bevat, zegt Kolibri dat veel vaker.

• Het aanroepen van tools onder beperking — op τ²-bench telecom, 94,7 tegen 82,5; op de verticale suite voor automotive-leveranciers, 99,0 tegen 97,3.

• Zeer lange context — op SealQA zonder afleiders boven 24k tokens, 100,0 tegenover 94,4.

• Duitse serving-economie — een tweetalige tokenizer met gemiddeld 4,90 bytes per token op Duitse webtekst, tegenover 4,17 voor de Qwen3.5–3.8-familie volgens Aleph Alpha's eigen meting. Minder tokens per Duits document is een directe verlaging van de inferentiekosten die op een factuur terug te zien is en in geen enkele benchmarkrij.

Drie van die vier gaan over gedrag in plaats van capaciteit. Onthouding, beperkte tool-calling en gegronde long-context-retrieval zijn wat je nodig hebt van een model dat de eigen materialen van je organisatie leest en geacht wordt toe te geven wanneer het materiaal de vraag niet beantwoordt. Aleph Alpha bouwde de hele release rond die gok, en de tabel laat zien dat de gok aanslaat.

Generated two-column scoreboard for Kolibri and Qwen3.8 27B. Left column Kolibri: English average 75.5, German average 70.8, abstention 85.6, GPQA Diamond 84.3, SWE-Bench Verified 66.4, licence Apache 2.0. Right column Qwen3.8 27B: English average 80.2, German average 79.9, abstention 70.6, GPQA Diamond 89.2, SWE-Bench Verified 72.6, licence Apache 2.0. The footer reads 'Both columns from Aleph Alpha's published table, vendor harness; no independent reproduction.'

De rijen waarin Qwen3.8 27B wint, gaan over breedte: kennis in beide talen, wetenschapsvragen op masterniveau, competitief programmeren, software-engineering op repositoryniveau, begrip van lange documenten. Als je behoefte een sterk algemeen model is tegen een lage prijs per token met open gewichten, dan is Qwen3.8 27B het betere model, en dat zegt de tabel in de eigen inkt van de leverancier.

Die lezing wordt bevestigd waar die van Kolibri dat niet wordt. Artificial Analysis heeft Qwen3.8 27B onafhankelijk gemeten, in de Xhigh-redeneerconfiguratie, en rapporteert: een Intelligence Index van 34 op #1 van de 142 modellen in die vergelijking, 45,4 outputtokens per seconde, een context van 256.000 tokens en een Apache 2.0-licentie. Hun opmerking is op bekende wijze onflatteus — zeer verbose met 200 miljoen gegenereerde tokens tijdens de indexevaluatie tegenover een mediaan van 82 miljoen, en traag — maar de score zelf is een meting door een derde partij van de tegenstander. Kolibri heeft helemaal geen Artificial Analysis-pagina. Dus het sterkste model in deze vergelijking is onafhankelijk geverifieerd en het zwakkere is het woord van de leverancier, wat het omgekeerde is van hoe een Europees vlaggenschip van de eerste generatie gewoonlijk wordt gepresenteerd.

Twee soorten supplychainbeweringen, in tegengestelde richtingen wijzend

Beide releases zijn argumenten over waar een model vandaan komt, en de argumenten zijn spiegelbeelden van elkaar.

De casus van Aleph Alpha is herkomst als functie. Kolibri werd getraind door Duitse teams op infrastructuur in Duitsland en Finland, onder EU- en Duits recht. De kaart onthult de pre-trainingsmix — 20 biljoen tokens met ongeveer 62,5 procent Engels, 23,9 procent Duits en 13,6 procent code — de budgetten voor mid-training en lange context, de exacte compute: 768 NVIDIA B200's verdeeld over 96 HGX-nodes gedurende 21 dagen, en naar schatting 9,5×10² MWh aan energie, inclusief datacenteroverhead. Het vermeldt de trainingsmethode tot op de laag: een 50-laagse mixture-of-experts-transformer met een 4:1-opsplitsing tussen sliding-window- en grouped-query-attention, Muon en Exact Quantile Balancing over 384 experts met 1 gedeelde en 6 gerouteerde experts. Twaalfduizend woorden aan openbaarmakingen gehecht aan een download van 78 GB, en een vermelde positie als ondertekenaar over de General-Purpose AI Code of Practice van de EU.

Het geval van Alibaba is van een andere aard: niet "we kunnen elke beslissing verantwoorden", maar "hier zijn de gewichten, neem ze". Apache-gelicentieerde open gewichten op een schaal en met een kwaliteit die Qwen wereldwijd tot de feitelijke standaard maakten, een vocabulaire van 248.077 tokens dat ruimschoots meer dan honderd talen bestrijkt, en een serving-ecosysteem dat al zo lang rond die checkpoints is afgestemd dat bijna elke inference-stack ze out of the box ondersteunt. Het soevereiniteitsargument daar draait om beschikbaarheid: geen enkele leverancier kan het model terugtrekken, omdat je het bestand al hebt.

Beide beweringen zijn eerlijk en ze beantwoorden verschillende angsten. Een inkoper in de publieke sector in Baden-Württemberg maakt zich zorgen over jurisdictie en auditeerbaarheid, en Kolibri is op die zorg gericht. Een onderzoeksgroep in Nairobi of São Paulo maakt zich zorgen over een model waarvoor een creditcard vereist is, in een valuta waarin ze niet kunnen betalen, en open Qwen-gewichten zijn op die laatste gericht. Wat niet eerlijk is, is doen alsof een van beide een capaciteitsvergelijking is, want de capaciteitentabel heeft zijn antwoord al gegeven.

Screenshot of the Artificial Analysis model page for Qwen3.8 27B (Xhigh), marked 'Open weights model, Released August 2026', showing an Intelligence Index of 34 against a median of 8, a #1/142 intelligence rank, a #55/142 speed rank at 45 tokens per second against a 91-token median, input pricing $0.50 per million tokens against a $0.03 median and output pricing $3.00 against a $0.15 median, an average cost of $1.01 per task on the Intelligence Index, a verbosity rank of #22/142 having generated 200M tokens during the index evaluation against a median of 82M, a 256k-token context window, and the Apache 2.0 licence badge.

De licentiekloof is reëel, maar kleiner dan het klinkt.

Kolibri is Apache 2.0. Qwen3.8 27B heeft open gewichten onder de Apache-licentie. Beide komen zonder aanvullende clausule voor aanvaardbaar gebruik, zonder drempel voor maandelijks actieve gebruikers en zonder afzonderlijke commerciële voorwaarden — wat ze in een kleine groep plaatst en betekent dat geen van beide een juridische toetsing vereist voordat ze commercieel worden gebruikt.

Wat hen onderscheidt, is alles wat op de licentie volgt. Kolibri wordt geleverd met een vLLM-plugin en parserpakket van de leverancier, een containerimage, vier niveaus van redeneerinspanning die via de chat-template kunnen worden geconfigureerd, een expliciet abstentiegedrag en een aanbevolen samplingconfiguratie. Qwen3.8 27B komt als gewichten die Transformers, vLLM en SGLang al weten te serveren, met een tool-callingformaat waar het bredere ecosysteem al maanden de tijd heeft gehad om zich eraan aan te passen.

Deploymenthardware verschilt op dezelfde manier. De FP8-gewichten van Kolibri hebben een omvang van ~78 GB, met een minimum van twee A100 80GB-kaarten, twee H100 SXM5's, één H200, één B200 of één B300. Qwen3.8 27B in bfloat16 is ongeveer 54 GB aan gewichten, wat bij volledige precisie één enkele 80GB-accelerator is, of een gekwantiseerde build op aanzienlijk minder. Het Duitse model kost meer hardware en levert daar minder benchmark voor terug. Dat is alleen een slechte ruil als je benchmark wilde kopen.

Wat prijskaartjes je wel en niet vertellen

Kolibri heeft geen prijs, omdat Aleph Alpha er geen inferentie voor verkoopt. De release bestaat uit weights, een technisch rapport en een modelkaart; er is geen gehoste SKU. Elk kostencijfer voor Kolibri is een hardware-afschrijvingsberekening die je zelf maakt.

Qwen3.8 heeft openbaar drie prijsklassen, en de middelste is degene die van belang is voor een team dat zelf hosten vergelijkt met huren.

• Qwen3.8-Max — $2,00 per miljoen invoertokens en $6,00 voor uitvoer, context van 1M tokens, cachereads tegen $0,25, uitgebracht op 3 augustus 2026.

• Qwen3.8-27B — $0,33 input en $2,40 output, context van 262.144 tokens, uitgebracht op 13 augustus 2026. Dit zijn de open gewichten, dus dit is de prijs die je betaalt als je ze liever niet zelf draait.

• Qwen3.8-Flash — $0,15 voor invoer en $0,47 voor uitvoer met het 1M-tokenvenster, uitgebracht op 26 augustus 2026.

Dat zijn de lijstprijzen van de provider op OrcaRouter, één-op-één doorgegeven zonder iets per token toe te voegen, wat de nuttige eigenschap is wanneer de vraag is of een self-hosted deployment zichzelf terugverdient: je kunt je werkelijke tokenvolume meten op de hosted tiers voordat je je aan hardware vastlegt. Wij rekenen geen marge, dus een prijsverlaging van een leverancier is dezelfde dag bij ons live. Alle drie de Qwen3.8-tiers zijn vandaag routeerbaar op één OpenAI-compatibele sleutel met automatische failover tussen providers, en de aankomende Qwen3.8 met 2,4 biljoen parameters heeft een cataloguspagina die op de weights wacht in plaats van een tijdelijke aanduiding die doet alsof die ze al serveert.

Kolibri is niet routeerbaar. We hebben de catalogus doorzocht op elke spelling van leverancier en model, en het staat er niet in — dus de enige manier om het aan te roepen is de download van 78 GB. Als je wilt weten wat het Duitse model je workload zou kosten, is het antwoord een rack en iemand die vLLM kan draaien, en geen enkele derde partij kan je momenteel iets anders offreren.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the 1M-token context badge, text, image and video input with text output, the Vision, Tools, JSON and Reasoning capability tags, a p50 time-to-first-token of 2.35 seconds, the attribution 'Public benchmarks by Qwen - 2026-08-03', the description as Alibaba's newest flagship in the Qwen line positioned against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, the pricing tiles $2.00 and $6.00, and the OpenAI-compatible and Anthropic-compatible base URLs at https://api.orcarouter.ai/v1 and https://api.orcarouter.ai.

Wie moet wat kopen

De beslissing draait niet om kwaliteit, want die kwestie is door de eigen tabel van de leverancier in het voordeel van Alibaba beslecht. Ze draait om de vraag tegen welk risico je je verzekert.

• Kies Kolibri als de beperkende factor jurisdictie, herkomstdocumentatie of auditeerbaarheid is — als u moet kunnen beantwoorden waar de trainingsdata vandaan komen, waar de compute heeft gedraaid en onder welke wetgeving, en als de workload Duitse en Engelse documenten betreft die binnen uw eigen perimeter worden verwerkt. Daarvoor betaalt u een meerprijs voor de geboden capaciteiten, en die meerprijs is zichtbaar in de tabel hierboven.

• Kies Qwen3.8 27B als de beperkende factor capaciteit per dollar, breedte van de taalondersteuning of ecosysteemondersteuning is. Het is het sterkere model volgens de eigen evaluatie van Aleph Alpha, het valt onder de Apache-licentie, het draait op één accelerator, en de gehoste niveaus beginnen bij $0,33 per miljoen inputtokens als je het liever helemaal niet zelf wilt draaien.

• Overweeg beide in dezelfde architectuur als de workload een gereguleerde kern en een algemene periferie heeft. De documenten die het gebouw niet mogen verlaten, gaan naar een zelfgehoste Kolibri-endpoint; het samenvattings-, vertaal- en codewerk gaat naar een gerouteerde Qwen3.8-tier voor een derde cent per duizend tokens. Eén API-sleutel, één routeringsregel, lijstprijzen van de provider doorgegeven, en de failover voor je geregeld — wat een aanzienlijk nuttiger regeling is dan een van deze twee kiezen en doen alsof de andere niet bestaat.