
Kolibri vs. Intern-Decision 4B: De een schrijft documenten, de ander weigert ook maar iets te schrijven.
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 217 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Het nuttigste om op te merken over Kolibri en Intern-Decision-4B is dat ze niet hetzelfde soort object zijn, en dat het behandelen hiervan als een model-tegen-modelvergelijking een categoriefout zou zijn. Kolibri is Aleph Alpha's mixture-of-experts-taalmodel met 78,1 miljard parameters, uitgebracht op 3 oktober 2026, dat 3,46 miljard parameters per token activeert en Duitse en Engelse tekst schrijft. Intern-Decision-4B is een multimodaal gestructureerd beslissingsmodel met 4,54 miljard parameters van het InternLM-team, op 26 september 2026 naar Hugging Face geüpload, waarvan de kaart duidelijk stelt dat het 'helemaal geen generate() aanroept of vrije tekst samplet'. De ene produceert proza. De andere produceert een kansverdeling over opties die je aanlevert, in één forward pass, en is niet in staat een zin te schrijven. Ze worden pas concurrenten in één nauwe situatie, en precies weten welke situatie dat is, blijkt het nuttigste in beide releases te zijn.
Twee releases, twee totaal verschillende beknopte claims
De kaart van Kolibri is een specificatie van een groot sparse taalmodel: 50 lagen, allemaal mixture-of-experts, 384 experts per laag, waarvan één gedeeld en zes gerouteerd, een native context van 262.144 tokens, gevalideerd tot 1.048.576, vier niveaus van redeneerinspanning, Hermes-achtige tool calling met een meegeleverde vLLM-parser, FP8-gewichten in blokken van 128×128, en Apache 2.0-voorwaarden. De training ervan verwerkte 20 biljoen tokens op 768 NVIDIA B200's gedurende 21 dagen — 392.000 GPU-uren bij een gerapporteerde 6,4×10²³ FLOPs en een geschatte 9,5×10² MWh, inclusief datacenteroverhead, exclusief supervised fine-tuning en reinforcement learning. De minimale serveerconfiguratie van de kaart is twee A100 80 GB-kaarten, twee H100 SXM5's, één H200, één B200 of één B300, en de FP8-voetafdruk is ongeveer 78 GB. Het is een serieus stuk infrastructuur, en het beantwoordt vragen door tekst te genereren.
Intern-Decision-4B is het tegenovergestelde soort object en de modelkaart is verfrissend bot daarover. Het is een fine-tune van Qwen3.5-4B waarin de vision-toren en projector bevroren zijn en alleen de taal-backbone wordt getraind. Je geeft het een state, een schema van benoemde vragen, en optioneel tot acht afbeeldingen, en het retourneert in één keer een verdeling over de kandidaatantwoorden voor elke vraag. Het mechanisme is ongewoon en het is de moeite waard het precies te formuleren: opties worden toegewezen aan symbolen van één token, van A tot Z, a tot z en 0 tot 9 — 62 kandidaten, dus maximaal 62 opties per vraag — de prompt wordt gerenderd met één placeholder per veld, en het model leest de logits op de positie direct vóór elke placeholder. Softmax wordt alleen uitgevoerd over de toegestane symbool-logits van dat veld, een checkpoint-specifieke temperatuur kalibreert het resultaat, en de symbolen worden terugvertaald naar je oorspronkelijke optiewaarden als getypte JSON. Er is geen decoderingslus, geen sampling en geen proza.
• Uitvoer — Kolibri: vrij gegenereerde Duitse of Engelse tekst, tool-aanroepen, redeneersporen. Intern-Decision-4B: getypeerde JSON-antwoorden met een waarschijnlijkheid per optie.
• Parameters — Kolibri: 78.103.074.560 totaal, 3.457.573.120 actief. Intern-Decision-4B: 4,54 miljard verdeeld over vier safetensors-shards in bfloat16, met een bevroren vision tower.
• Invoer — Kolibri: alleen tekst. Intern-Decision-4B: tekst plus maximaal acht afbeeldingen.
• Vraagcapaciteit — Intern-Decision-4B: tot 62 opties per veld, in één forward pass, met de vraagtypes 'choice', 'score' en 'noul' (ja/nee). Kolibri: in principe onbegrensd, in de praktijk één token per keer.
• Taal — Kolibri: Duits en Engels per constructie. Intern-Decision-4B: wat Qwen3.5-4B ook meebrengt, met alle gepubliceerde evaluatiesuites in het Engels.
• Latentie — Intern-Decision-4B: 44,16 ms gemiddeld, 44,03 ms mediaan en 44,60 ms P95 per query op een enkele RTX 4090, volgens zijn eigen meting. Kolibri: helemaal geen gepubliceerd cijfer per query.
• Licentie — beide Apache 2.0; Intern-Decision-4B wordt geleverd met het Qwen-licentiebestand dat daarnaast bewaard blijft.

Waarom er überhaupt een 4B-scorer bestaat
Het pleidooi voor Intern-Decision-4B is niet dat het klein is. Het is dat het vragen van een waarschijnlijkheid aan een groot generatief model niet hetzelfde is als het meten ervan, en het verschil is meetbaar.
De eigen benchmarktabel van de kaart maakt het argument met een ongebruikelijke mate van openheid over zichzelf. Over zeven nauwkeurigheidssuites scoort Intern-Decision-4B gemiddeld 90,02 — tegenover 88,74 voor de sterkste baseline waarmee het zich vergelijkt, een model genaamd Jev. Maar nauwkeurigheid is de oninteressante helft. De tabel rapporteert ook Brier-score en verwachte kalibratiefout, en daar is het beeld strenger. De 4B noteert een Brier van 0,347 en een ECE van 0,065, tegenover 0,358 en 0,095 van Jev. De kleinere broertjes zijn waar het kalibratieverhaal pas echt informatief wordt. Intern-Decision-2B scoort gemiddeld 84,68, ruim voor op de 0.8B met 79,38 — en toch is de ECE van 0,100 slechter dan de 0,066 van de 0.8B en slechter dan de 0,065 van de 4B, met een Brier van 0,437 tegenover de 0,530 van de 0.8B. Het nauwkeurigste van de twee kleine modellen is het minst eerlijk over zijn eigen zekerheid. Als je had aangenomen dat kalibratie verbetert met nauwkeurigheid, of met het aantal parameters, dan is die tabel op beide punten het tegenvoorbeeld.
Een tweede, aparte diagnostische test omvat 96 gevallen die zijn opgebouwd met exacte referentieverdelingen in plaats van gesamplede harde labels — willekeurige trekkingen, samengestelde gebeurtenissen, conditionele geschiedenis, waarschijnlijkheidspuzzels. De fout van het 4B-model op die pilot daalde van 0,628 naar 0,550 op de gerapporteerde metriek, terwijl het vergelijkingsmodel op 0,595 stond. De kaart vermeldt expliciet dat deze pilot niet is gebruikt om de gepubliceerde temperatuur te fitten of te selecteren; de temperatuur van 1,992418 van het 4B-model werd apart op een kalibratieset gefit. Het InternLM-team heeft ook de benchmark zelf in de GitHub-repository gezet — de deterministische generator, de referenties en de offline scorer — wat betekent dat de kalibratieclaim van het zeldzame soort is dat een derde partij daadwerkelijk opnieuw kan uitvoeren in plaats van op goed vertrouwen aan te nemen.
Niets in de release van Kolibri biedt een equivalent. De vergelijkingstabel ervan rapporteert taaknauwkeurigheid over veertien modellen op één harness van één leverancier, en nauwkeurigheid is wat je aan een generatief model kunt meten. Nergens in het materiaal staat een calibratiecijfer of een Brier- of ECE-waarde, en er is geen manier om er "de waarschijnlijkheid dat deze contractclausule afdwingbaar is" op te vragen die niet het samplen en lezen van een zin inhoudt.
De enige naad waar ze elkaar daadwerkelijk ontmoeten
Zet de twee naast elkaar in een echte pipeline en de vormen worden duidelijk. Een Duitse documentworkflow heeft beide helften nodig, en geen van beide tools dekt de helft van de andere.
Kolibri is de helft die leest en schrijft. Een team met Duitse contracten of technische documentatie krijgt een native venster van 262.144 tokens, een FP8 KV-cache, een tweetalige tokenizer waarvan Aleph Alpha meldt dat deze 4,90 gemiddelde bytes per token haalt op Duitse webtekst, en Hermes tool calling — dat wil zeggen, een model dat een dossier kan samenvatten, een antwoord kan opstellen en een tool-loop kan aansturen. Wat het niet kan, is je zijn eigen vertrouwen meedelen op een manier die je kunt auditen, omdat alles wat het produceert een gesampelde string is.
Intern-Decision-4B is de helft die beslist. Gegeven een pagina Duitse tekst en een vaste set opties retourneert het een gekalibreerde verdeling in 44 milliseconden op één consumenten-GPU, zonder generatiestap en dus helemaal geen samplingvariantie. Wat het niet kan, is de Duitse tekst überhaupt produceren, en de gepubliceerde evaluatiesuites zijn Engelstalig — het Duitse gedrag is geërfd van de Qwen3.5-4B-basis in plaats van dat het daarvoor is getraind, wat een echte beperking is voor een Duitstalige deployment en een die niemand heeft geëvalueerd.
Het eerlijke technische antwoord voor een gereguleerde Duitstalige workflow is dus dat dit twee fasen van één pijplijn zijn, niet twee kandidaten voor één plek. De praktische vraag is waar elk van de twee draait. Kolibri heeft twee H100s of een B200 nodig en ongeveer 78 GB. Intern-Decision-4B heeft één RTX 4090 nodig en verwerkt een query in minder dan 45 milliseconden. De kostenasymmetrie bedraagt qua hardware ruwweg twee ordes van grootte, en die wijst op een ontwerp waarin een kleine scorer continu op elke zaak draait en de grote generator alleen wordt ingeschakeld wanneer een zaak daadwerkelijk proza nodig heeft. Dat is een goedkopere en auditvriendelijkere opzet dan elke zaak via het 78B-model te leiden om een antwoord te krijgen dat je vervolgens moet interpreteren.

De hostingrealiteit voor beide, en waarvoor de laag dient
Geen van beide modellen is beschikbaar als gehoste API, en we hebben het gecontroleerd in plaats van aangenomen. Intern-Decision-4B heeft geen vendor-endpoint; de release bestaat uit gewichten, een GitHub-repository en een Hugging Face Space. De download- en like-aantallen zijn sinds halverwege de week veranderd, wat aangeeft dat mensen het oppikken, maar er is nog steeds nergens een betaalde aanroepbare route die wij zouden noemen.
Kolibri heeft evenmin een Aleph Alpha API-SKU — de release bestaat uit gewichten, een technisch rapport en een containerimage op ghcr.io/aleph-alpha/aleph-alpha-inference. En het staat niet op OrcaRouter: we hebben de catalogus bij elke spelling van de leveranciersprefix en de modelnaam doorzocht, en het levert 'not found' op, wat we liever zeggen dan iets anders te suggereren.
Wat een routeringslaag hier verandert, is niet de toegang tot deze twee modellen, maar de economie van de beslissing of je voor een van beide de hardware moet kopen. De eerlijke test vóór aankoop voor het generatieve deel is om de workload te draaien tegen een kleine mixture-of-experts-tier die al gerouteerd is — de Gemma 4 26B-A4B-variant voor $0,06 per miljoen inputtokens en $0,33 per miljoen output, met een venster van 262.144 tokens en tekst-, beeld- en video-invoer — op één OpenAI-compatibele sleutel tegen de lijstprijs van de provider zonder iets extra's, en te kijken of de Duitse documentworkload echt 78 miljard parameters nodig heeft voordat de GPU's worden besteld. Het beslissingsdeel heeft zo'n sluiproute niet, want het gekalibreerde-distributiegedrag is juist het hele punt van het model en geen enkele gerouteerde tier doet dat. Maar dat is op zichzelf de bevinding: het vertelt je dat de 4B-scorer het deel is dat je echt zelf zult hosten, en dat de generator het deel is dat het waard is om opnieuw te testen tegen iets dat je vanmiddag kunt huren.
Wat zou het beslechten?
Twee metingen, en geen van beide bestaat nog.
Het eerste is Intern-Decision-4B op Duitse input. Elke gepubliceerde suite is Engelstalig en het model is een fine-tune van een meertalige basis, dus de Duitse kalibratie ervan is onbekend — en kalibratie is precies de eigenschap die niet gratis van taal naar taal overdraagt. Een Duitse versie van de distributiepilot met 96 cases zou het allerinformatiefste artefact zijn dat iemand over dit model zou kunnen publiceren.
Het tweede is de kosten per beslissing van Kolibri. De bewering over de serveereconomie is een Pareto-frontier van kwaliteit tegen gedecodeerde tokens per seconde per GPU, en er is geen Artificial Analysis-pagina voor Kolibri en geen replicatie van het testharnas door derden. Totdat iemand het uitvoert, is "78 miljard parameters" een specificatie in plaats van een kostenpost, en blijft het argument om een scorer van 44 milliseconden ervoor te houden een ontwerpargument in plaats van een gemeten argument.
Tot die tijd is de juiste manier om deze combinatie te lezen niet als een wedstrijd. Intern-Decision-4B is de technisch interessantste release van de twee, omdat kalibratiebewuste gestructureerde output een capaciteit is die bijna geen enkel generatief model biedt en de modelkaart ervan je de bewering laat controleren. Kolibri is de ingrijpendere release, omdat een Europees lab dat een Apache 2.0-model met 78 miljard parameters uitbrengt, met de datapijplijn die er tegelijk mee wordt gepubliceerd, een gebeurtenis in de toeleveringsketen is in plaats van een modelgebeurtenis. Geen van beide vervangt de andere. Teams die beide nodig hebben, moeten voor beide plannen en de hardware daarop dimensioneren, en de harness eromheen is waar de engineeringinspanning daadwerkelijk naartoe gaat.

