
Kolibri vs Intern-Decision 4B: Den ena skriver dokument, den andra vägrar skriva något alls
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 217 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Det mest användbara att lägga märke till med Kolibri och Intern-Decision-4B är att de inte är samma typ av objekt, och att behandla detta som en jämförelse mellan modeller vore ett kategorifel. Kolibri är Aleph Alphas språkmodell med 78,1 miljarder parametrar av typen mixture-of-experts, släppt den 3 oktober 2026, som aktiverar 3,46 miljarder parametrar per token och skriver text på tyska och engelska. Intern-Decision-4B är en multimodal strukturerad beslutsmodell med 4,54 miljarder parametrar från InternLM-teamet, uppladdad till Hugging Face den 26 september 2026, vars kort tydligt anger att den "inte anropar generate() eller samplar fritext" alls. Den ena producerar prosa. Den andra producerar en sannolikhetsfördelning över alternativ du anger, i en enda framåtpassning, och har ingen förmåga att skriva en mening. De blir bara konkurrenter i en enda snäv situation, och att veta exakt vilken situation det är råkar vara det mest användbara i båda släppen.
Två utgåvor, två helt olika kortfattade påståenden
Kolibris kort är en specifikation av en stor gles språkmodell: 50 lager, var och en en mixture-of-experts, 384 experter per lager med en delad och sex routade, en inbyggd kontext på 262 144 tokens validerad till 1 048 576, fyra nivåer av resonemangsansträngning, Hermes-liknande verktygsanrop med en medföljande vLLM-parser, FP8-vikter i 128×128-block och Apache 2.0-villkor. Dess träning körde 20 biljoner tokens på 768 NVIDIA B200 under 21 dagar — 392 000 GPU-timmar vid en rapporterad 6,4×10²³ FLOPs och en uppskattad 9,5×10² MWh inklusive datacenter-overhead, exklusive övervakad finjustering och förstärkningsinlärning. Kortets minsta serveringskonfiguration är två A100 80 GB-kort, två H100 SXM5, en H200, en B200 eller en B300, och FP8-avtrycket är cirka 78 GB. Det är en seriös infrastrukturdel, och den besvarar frågor genom att generera text.
Intern-Decision-4B är den motsatta typen av objekt och kortet är uppfriskande rakt på sak om det. Det är en finjustering av Qwen3.5-4B där visionstornet och projektorn är frysta och endast språkryggraden tränas. Du ger den ett tillstånd, ett schema med namngivna frågor och valfritt upp till åtta bilder, och den returnerar en fördelning över kandidatsvaren för varje fråga på en gång. Mekanismen är ovanlig och värd att beskriva exakt: alternativ mappas till symboler med en enda token som sträcker sig från A till Z, a till z och 0 till 9 — 62 kandidater, så maximalt 62 alternativ per fråga — prompten renderas med en platshållare per fält, och modellen läser logits vid positionen omedelbart före varje platshållare. Softmax körs endast över det fältets tillåtna symbol-logits, en kontrollpunktsspecifik temperatur kalibrerar resultatet, och symbolerna mappas tillbaka till dina ursprungliga alternativvärden som typad JSON. Det finns ingen avkodningsloop, ingen sampling och ingen prosa.
• Utdata — Kolibri: fritt genererad tysk eller engelsk text, verktygsanrop, resonemangsspår. Intern-Decision-4B: typade JSON-svar med en sannolikhet per alternativ.
• Parametrar — Kolibri: 78 103 074 totalt, 3 573 120 aktiva. 4B: 4,54 miljarder fördelade på fyra safetensors-shards i bfloat16, med ett fryst visionstorn.
• Indata — Kolibri: endast text. Intern-Decision-4B: text plus upp till åtta bilder.
• Frågekapacitet — Intern-Decision-4B: upp till 62 alternativ per fält, i en enda framåtpassning, med frågetyperna "choice", "score" och "noul" (ja/nej). Kolibri: obegränsat i princip, en token i taget i praktiken.
• Språk — Kolibri: tyska och engelska per konstruktion. Intern-Decision-4B: vad Qwen3.5-4B än har, med alla publicerade utvärderingssviter på engelska.
• Latens — Intern-Decision-4B: 44,16 ms medelvärde, 44,03 ms median och 44,60 ms P95 per fråga på ett enda RTX 4090, enligt dess egen mätning. Kolibri: ingen publicerad siffra per fråga alls.
• Licens — båda Apache 2.0; Intern-Decision-4B levereras tillsammans med den bevarade Qwen-licensfilen.

Varför det överhuvudtaget finns en 4B-bedömare
Argumentet för Intern-Decision-4B är inte att den är liten. Det är att be en stor generativ modell om en sannolikhet inte är samma sak som att mäta en, och skillnaden är mätbar.
Modellkortets egen benchmarktabell driver argumentet med en ovanligt stor dos självutlämnande. Över sju noggrannhetssviter ligger Intern-Decision-4B i genomsnitt på 90,02 — mot 88,74 för den starkaste baslinje den jämför sig med, en modell som heter Jev. Men noggrannhet är den ointressanta halvan. Tabellen rapporterar också Brier-poäng och förväntat kalibreringsfel, och där är bilden mer krävande. 4B redovisar en Brier på 0,347 och ett ECE på 0,065, mot Jevs 0,358 och 0,095. Det är hos de mindre syskonen som kalibreringshistorien blir genuint informativ. Intern-Decision-2B får i genomsnitt 84,68, klart före 0,8B på 79,38 — och ändå är dess ECE på 0,100 sämre än 0,8B:s 0,066 och sämre än 4B:s 0,065, med en Brier på 0,437 mot 0,8B:s 0,530. Den mest noggranna av de två små modellerna är den minst ärliga om sin egen konfidens. Om du hade antagit att kalibrering förbättras med noggrannhet, eller med parameterantal, är den tabellen motexemplet på båda punkterna.
Ett andra, separat diagnostiskt test omfattar 96 fall som byggts med exakta referensfördelningar i stället för samplade hårda etiketter – slumpmässiga dragningar, sammansatta händelser, betingad historik, sannolikhetspussel. 4B-modellens fel på den piloten sjönk från 0,628 till 0,550 i den rapporterade metriken, medan jämförelsemodellen låg på 0,595. I kortet står det uttryckligen att denna pilot inte användes för att anpassa eller välja den publicerade temperaturen; 4B:ans temperatur på 1,992418 anpassades separat på en kalibreringsuppsättning. InternLM-teamet släppte också själva benchmarken i GitHub-repositoriet – den deterministiska generatorn, referenserna och offline-scoraren – vilket innebär att kalibreringspåståendet är av det sällsynta slag som en tredje part faktiskt kan köra om i stället för att lita på det i blindo.
Inget i Kolibris lansering erbjuder en motsvarighet. Dess jämförelsetabell rapporterar uppgiftsnoggrannhet för fjorton modeller i en och samma utvärderingsram, och noggrannhet är vad en generativ modell kan mätas med. Det finns ingen kalibreringssiffra, Brier eller ECE någonstans i materialet, och inget sätt att be den om "sannolikheten att denna avtalsklausul är verkställbar" som inte innebär att man samplar en mening och läser den.
Den enda sömmen där de faktiskt möts
Ställ de två sida vid sida i en riktig pipeline och formerna blir uppenbara. Ett tyskt dokumentarbetsflöde behöver båda halvorna, och inget av verktygen täcker den andras halva.
Kolibri är halvan som läser och skriver. Ett team med tyska kontrakt eller teknisk dokumentation får ett inbyggt fönster på 262 144 token, en FP8-KV-cache, en tvåspråkig tokeniserare som Aleph Alpha uppger ligger på i genomsnitt 4,90 byte per token på tysk webbtext, och Hermes-verktygsanrop – det vill säga en modell som kan sammanfatta ett svar och köra en verktygsloop. Vad den inte kan göra är att berätta om sin egen konfidens på ett sätt som du kan granska, eftersom allt den ger ifrån sig är en samplad sträng.
Intern-Decision-4B är den halva som fattar besluten. Givet en sida tysk text och en uppsättning alternativ returnerar den en fördelning på 44 millisekunder på en enda GPU, utan något genereringssteg och därför ingen samplingsvarians alls. Det den inte kan göra är att producera den tyska texten från början, och dess publicerade utvärderingssviter är på engelska – dess tyska beteende är ärvt från Qwen3.5-4B-basen snarare än framtränat, vilket är en verklig begränsning för en tyskspråkig driftsättning och en som ingen har utvärderat.
Så det ärliga ingenjörssvaret för ett reglerat tyskspråkigt arbetsflöde är att dessa är två steg i en pipeline, inte två kandidater för en plats. Den praktiska frågan är var och en av dem körs. Kolibri behöver två H100 eller en B200 och cirka 78 GB. Intern-Decision-4B behöver en RTX 4090 och kör en fråga på under 45 millisekunder. Kostnadsasymmetrin är ungefär två storleksordningar när det gäller hårdvara, och den pekar mot en design där en liten scorer körs kontinuerligt för varje ärende och den stora generatorn anropas bara när ett ärende faktiskt behöver prosa. Det är en billigare och mer granskningsvänlig form än att skicka varje ärende genom 78B-modellen för att få ett svar som du sedan måste tolka.

Hosting-verkligheten för båda, och vad lagret är till för
Ingen av modellerna är tillgänglig som ett hostat API, och vi kontrollerade i stället för att anta. Intern-Decision-4B har ingen leverantörsslutpunkt; släppet är vikter, ett GitHub-repositorium och ett Hugging Face Space. Dess antal nedladdningar och gillamarkeringar har förändrats sedan mitten av veckan, vilket visar att folk nappar på den, men det finns fortfarande ingen betald anropbar väg någonstans som vi skulle nämna.
Kolibri har likaså ingen Aleph Alpha API-SKU — släppet är vikter, en teknisk rapport och en containeravbild på ghcr.io/aleph-alpha/aleph-alpha-inference. Och den finns inte på OrcaRouter: vi sökte igenom katalogen under varje stavning av leverantörsprefixet och modellnamnet, och den returnerar "not found", vilket vi hellre säger rakt ut än antyder något annat.
Vad ett routningslager förändrar här är inte åtkomsten till dessa två modeller, det är ekonomin i att avgöra om man ska köpa hårdvaran för någon av dem. Det ärliga testet före köp för den generativa halvan är att köra arbetsbelastningen mot en liten mixture-of-experts-nivå som redan är routad — varianten Gemma 4 26B-A4B till $0,06 per miljon indatatokens och $0,33 per miljon utdatatokens med ett fönster på 262 144 tokens och text-, bild- och videoinmatning — på en OpenAI-kompatibel nyckel till leverantörens listpris utan något tillagt, och se om arbetsbelastningen för tyska dokument faktiskt behöver 78 miljarder parametrar innan GPU:erna beställs. Beslutshalvan har ingen sådan genväg, eftersom det kalibrerade distributionsbeteendet är hela poängen med modellen och ingen routad nivå gör det. Men det är i sig självt fyndet: det säger att 4B-scorern är den del du verkligen kommer att självhosta, och generatorn är den del som är värd att testa om mot något du kan hyra i eftermiddag.
Vad skulle avgöra det?
Två mätningar, och ingen av dem finns ännu.
Den första är Intern-Decision-4B på tyska indata. Varje publicerad svit är på engelska och modellen är en finjustering av en flerspråkig bas, så dess tyska kalibrering är okänd — och kalibrering är precis den egenskap som inte överförs gratis mellan språk. En tysk version av distributionspiloten med 96 fall skulle vara den enskilt mest informativa artefakten som vem som helst skulle kunna publicera om den här modellen.
Det andra är Kolibris kostnad per beslut. Dess servingekonomiska påstående är en Pareto-front av kvalitet mot avkodade tokens per sekund per GPU, och det finns ingen Artificial Analysis-sida för Kolibri och ingen tredjepartsreplikering av utvärderingsramverket. Tills någon kör det är "78 miljarder parametrar" en specifikation snarare än en kostnad, och argumentet för att behålla en 44-millisekunders scorer framför den förblir ett designargument snarare än ett uppmätt.
Fram till dess är det rätta sättet att läsa detta par inte som en tävling. Intern-Decision-4B är det tekniskt sett mer intressanta släppet av de två, eftersom kalibreringsmedveten strukturerad utdata är en förmåga som nästan ingen generativ modell erbjuder och dess modellkort låter dig kontrollera påståendet. Kolibri är det mer betydelsefulla släppet, eftersom ett europeiskt labb som släpper en Apache 2.0-modell med 78 miljarder parametrar med datapipelinen publicerad vid sidan av är en händelse i leveranskedjan snarare än en modellhändelse. Ingen av dem ersätter den andra. Team som behöver båda bör planera för båda och dimensionera hårdvaran därefter, och testramverket runt dem är där ingenjörsarbetet faktiskt läggs.

