Titelkaart met de tekst “Kolibri vs Solar Mini 4” en de ondertitel “Hetzelfde actieve budget van 3B, twee heel verschillende gokken”, en twee regels kleine letters met “Kolibri — 78,1B totaal, Apache 2.0-gewichten, zelfgehost” en “Solar Mini 4 — 35B totaal, gesloten, gehoste API”, geplaatst op een witte achtergrond met zachte accenten met een blauw-cyaangradiënt en het OrcaRouter-logo rechtsonder.
Guides & Insights

Kolibri vs Solar Mini 4: Hetzelfde 3B-actieve budget, twee heel verschillende gokken

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Twee modellen die zeventien dagen na elkaar werden uitgebracht, beide afgestemd om per token ongeveer drie miljard actieve parameters te verbruiken, en wat daadwerkelijke adoptie betreft konden ze nauwelijks minder op elkaar lijken. Aleph Alpha's Kolibri is 78,1 miljard parameters aan Apache-2.0-gewichten die je zelf downloadt en host: er bestaat geen gehost endpoint, en tot op de dag van vandaag is er nergens ook maar één onafhankelijke beoordeling van te vinden. Upstage's Solar Mini 4 is 35 miljard parameters die je helemaal niet kunt downloaden — het bestaat alleen als een endpoint dat per verbruik wordt afgerekend, en het heeft al een Artificial Analysis Intelligence Index van 24,05. Het aantal actieve parameters vertelt je wat elk model kost om te draaien. Niets anders aan dat getal vertelt je wat het je kost om te beginnen.

De reden dat de totalen zo ver uiteenlopen — 78,1B tegen 35B met vrijwel hetzelfde actieve deel — is dat beide sparse mixture-of-experts-ontwerpen zijn, en de twee labs tegenovergestelde keuzes hebben gemaakt over hoeveel expertcapaciteit ze in reserve houden. Kolibri heeft 384 experts en routeert per token naar 1 gedeelde plus 6 daarvan. Solar Mini 4 maakt een 35B/3B-splitsing bekend en niets over het aantal experts. Wanneer twee modellen met hetzelfde actieve aantal worden aangeprezen, is het totale aantal parameters, niet het actieve aantal, bepalend voor je hardwarerekening — en hier is het een verschil van 2,2× bij hetzelfde opgegeven compute-budget.

Wat elk ervan eigenlijk is

• Totaal aantal parameters — Kolibri 78.10B vs Solar Mini 4 35B

• Actieve parameters per token — Kolibri 3.46B vs Solar Mini 4 3B

• Gewichten — Kolibri Apache 2.0, volledige gewichten op Hugging Face vs. Solar Mini 4 gesloten; alleen API

• Context — Kolibri 1.048.576 tokens gevalideerd vs. Solar Mini 4 512K volgens de documentatie van Upstage, 1.048.576 volgens de modelkaart van Artificial Analysis

• Maximale output — Kolibri niet beperkt door de leverancier vs Solar Mini 4 128.000 tokens

• Talen — Kolibri Duits en Engels vs Solar Mini 4 Engels, Koreaans en Japans

• Kennisafsluitdatum — Kolibri 18 juni 2026 vs. Solar Mini 4 februari 2026

• Levering — Kolibri zelfgehost (vLLM) vs Solar Mini 4 gehost op Upstage's Console, Playground en on-premises

• Onafhankelijke evaluatie — Kolibri: niets gepubliceerd vs Solar Mini 4 AA Intelligence Index 24.05

Kolibri: 78 miljard parameters, en niemand buiten het lab heeft het beoordeeld

Aleph Alpha publiceerde Kolibri op 3 oktober 2026, bewust op de Dag van de Duitse Hereniging, als de eerste van een nieuwe familie en de opvolger van Kolibri Origin. De modelkaart is ongewoon openhartig over wat erin is gestopt: 20 biljoen tokens aan voortraining, 3,44 biljoen aan tussentijdse training en 201 miljard aan training met lange context, uitgevoerd op 768 B200-GPU's in 21 dagen, goed voor ongeveer 6,4×10²³ FLOPs en ongeveer 950 MWh. De leverancier noemt ook uit eigen beweging het aantal storingen — 38 ongeplande onderbrekingen, ongeveer één per 10.000 GPU-uren — het soort cijfer dat labs gewoonlijk achterwege laten.

Screenshot of Aleph Alpha's newsroom post “Kolibri Has Landed”, showing the 03/10/2026 release date, the line about releasing on the Day of German Reunification, and the architecture comparison table between Kolibri and Kolibri Origin.

De architectuur is een strak sparse-MoE-verhaal. Vijftig lagen met een 4:1-verhouding tussen sliding-window attention (vensters van 512 tokens) en globale attention, die alleen op elke vijfde laag wordt geactiveerd. FP8-gewichten met 128×128-blokschaling en een FP8-KV-cache. Kolibri Origin gebruikte ter vergelijking 128 experts met routering over 8, een expert-hidden-dimensie van 768 en volledige attention op elke laag, op Engelse data met een afsluitdatum in september 2024. Kolibri stapt over op 384 experts met routering over 6 en een hidden-dimensie van 512, en verschuift beide taalafsluitdatums naar 18 juni 2026.

De Duitse pipeline is het onderdeel dat je echt niet ergens anders kunt kopen. Aleph Alpha heeft zijn eigen UniBPE-tokenizer getraind en meldt voor Duitse tekst 4,90 bytes per token, tegenover 4,35 voor GPT-5, 4,17 voor Qwen3.5 en 4,13 voor Gemini. Dat is een tokenizer die claimt betere Duitse compressie te bieden dan welk van de frontier meertalige modellen dan ook, en het is het concrete mechanisme achter de pitch voor soevereine implementatie: minder tokens per Duits document betekent minder gefactureerde tokens en een langer effectief venster op dezelfde hardware.

Elk prestatiecijfer dat voor Kolibri bestaat, komt uit de eigen modelkaart van Aleph Alpha, en zo moet het ook worden gelezen. De door de leverancier gerapporteerde tabel zet Kolibri op een algemene score van 75,5 op Engelse evals en 70,8 op Duitse, 84,3 GPQA Diamond in het Engels tegenover 81,3 in het Duits, 21,5 op Humanity's Last Exam in het Engels tegenover 15,9 in het Duits, 66,4 op SWE-Bench Verified, 85,9 op LiveCodeBench v6 en 68,3 op AA-LCR. Dit zijn niet-geauditeerde cijfers. Er is geen Artificial Analysis-pagina voor Kolibri — de model-URL van de tracker geeft een 404 — dus niets in die tabel is onafhankelijk gereproduceerd, en het artikel dat u leest kan het niet steviger maken dan het is.

Wat de kaart wel solide maakt, is het servingverhaal. De hardwareondergrens is twee A100 80GB's, of twee H100 SXM5's, of één H200, B200 of B300. Een gepubliceerd vLLM-recept draait het met --kv-cache-dtype fp8 en speciale parsers voor reasoning en tool-calls, bij temperature 1.0, top-p 0.97 en top-k 128, met een reasoning_effort-draaiknop die none, low, medium en high omvat. Eén B300 die een 78B-model serveert bij een gevalideerde context van 1M tokens is de concrete vorm van het aanbod: je koopt de doos, en daarna ben je eigenaar van de marginale kosten van elke token.

Solar Mini 4: je huurt de actieve 3B-slice in plaats van deze te kopen

Solar Mini 4 verscheen op 22 september 2026 — snapshot solar-mini4-260922, alias solar-mini4 — als het agentgerichte kleine model van Upstage: 35B totaal, 3B actief, een kennisafsluitdatum van februari 2026, Engels, Koreaans en Japans, met modi voor chat, redeneren, gestructureerde output en tool-calling. Het is beschikbaar via de Console en Playground van Upstage, en voor on-premises-implementatie, maar er is geen download van gewichten en geen licentie om in te zien. De documentatie van Upstage vermeldt ook "Data not collected" voor dit model, wat de compliance-regel is die ertoe doet als je het voor echt verkeer inzet.

Screenshot of Upstage's Console documentation page for Solar Mini 4, showing the snapshot identifier solar-mini4-260922, the release date 2026-09-22, 35B total and 3B active parameters, a 512K context window with 128K maximum output, the list price of $0.10 per million input, $0.40 per million output and $0.01 per million cached, and the note “Data not collected”.

Anders dan Kolibri is Solar Mini 4 door een onafhankelijke harness gegaan. Artificial Analysis plaatst het op een Intelligence Index van 24,05, met een gemeten 1,01% op Terminal-Bench 4.0, 47,6% op SciCode, 83,3% op AA-LCR en 25,8% op Humanity's Last Exam. De lanceringspost van Upstage positioneert de 24,1 als de hoogste Index onder modellen met 3B actieve parameters, vóór Qwen3.6 35B A3B met 18 en Nemotron 3.5 Lightning met 13 — een framing die eerlijk is voor zover ze gaat, en die, wat het vermelden waard is, precies zo nauw is als ze klinkt, aangezien het een claim is over de 3B-actieve klasse en niet over kleine modellen in het algemeen.

De meting die bepalend zou moeten zijn voor hoe je ervoor budgetteert, is niet de Index. De kostenopsplitsing per taak van Artificial Analysis zet Solar Mini 4 op ongeveer $0,36 per Intelligence-Index-taak, en ongeveer $0,30 daarvan — zo'n 82% — betreft prompt-cache-schrijfacties. Cache-leesbewerkingen kosten $0,03 en gegenereerde output slechts $0,035. Het model produceert ongeveer 88.300 outputtokens per taak, waarvan zo'n 71.600 reasoningtokens zijn. Met andere woorden: dit is een goedkoop model waarvan de rekening wordt gedomineerd door het herschrijven van een lange context, niet door de tokens die het terugschrijft. De kosten per evaluatie lopen uiteen van $1,63 voor Terminal-Bench 4.0 tot $0,95 voor AA-Briefcase. De mediane outputsnelheid is 198 tokens per seconde bij een tijd tot de eerste chunk van 1,58 seconde.

De prijs van elk pad

Solar Mini 4 wordt vandaag niet tegen de lijstprijs aangeboden. De eigen prijzenpagina van Upstage hanteert ervoor een datumgebonden staffel: $0,03 per miljoen input, $0,003 gecacht en $0,12 output — een introductiekorting van 70% — tot en met 10 oktober 2026 UTC, daarna $0,05 / $0,005 / $0,20 vanaf 11 oktober, en ten slotte de lijstprijs van $0,10 / $0,01 / $0,40 vanaf 23 oktober. Het lanceringsbericht van Upstage beschrijft de korting in lossere bewoordingen dan het eigen schema van de prijzenpagina doet; de bovenstaande staffel is de versie met datums erbij, en dat is de versie waarop u zich bij uw planning het beste kunt baseren. Let op waar de steilste korting zit: gecachte input daalt naar een tiende van het inputtarief, wat precies de workload met langdurig stabiele context beloont waarvoor het hierboven beschreven kostenprofiel voor cache-writes juist kosten in rekening brengt.

De prijs van Kolibri is een inkooporder. Er is geen tarief per miljoen tokens om te vergelijken, want er is geen gehoste meter — je betaalt voor GPU's en elektriciteit, en het enige publieke kostensignaal van de leverancier is de training zelf: ongeveer 950 MWh om het model te produceren. Als je al inferentiecapaciteit bezit, nadert de marginale kosten per token van Kolibri de kosten van de elektriciteit; als je die niet bezit, is het toegangsbewijs een machine met twee A100's of beter. Dat is een fundamenteel andere vorm van verbintenis dan een model dat je per miljoen tokens kunt aanroepen en morgen niet meer hoeft aan te roepen, en het is de werkelijke beslissing die de twee opties voorleggen.

Waar ze overlappen, en waar de vergelijking stukloopt

• Actieve compute — vrijwel identiek: 3,46B tegen 3B per token

• Alles wat daaruit volgt — niet vergelijkbaar, omdat slechts een van de twee enig geverifieerd bewijs heeft

• Beste gemeten score — Solar Mini 4 heeft een geauditeerde Index van 24,05; Kolibri heeft een leverancierstabel en helemaal geen geauditeerde score

• Duits — Kolibri is de enige van de twee die ervoor is getraind, met 4,90 bytes per token; Solar Mini 4 vermeldt het niet

• Koreaans en Japans — Solar Mini 4 vermeldt beide; Kolibri vermeldt geen van beide

• Lange context — Kolibri valideert een volledige 1.048.576 tokens; de eigen documentatie van Solar Mini 4 zegt 512K, terwijl de kaart van Artificial Analysis 1M aangeeft, dus beschouw het plafond als leveranciersafhankelijk

• Tijd tot het eerste token — Solar Mini 4 duurt minuten, omdat je je aanmeldt; Kolibri duurt dagen, omdat je een box in een rack monteert

• Kostenmodel — per token, dalend volgens de kortingsladder, afgezet tegen kapitaal plus vermogen

De eerlijke samenvatting is dat dit geen confrontatie is die je op een ranglijst beslecht. De leverancierstabel van Kolibri bevat zelfs zijn eigen vergelijkingsset — GLM-4.7 Flash 30B-A3B met 64,7 algemeen Engels, Nemotron 3 Nano 30B-A3B met 65,6, Qwen3.5 35B-A3B met 74,7, Qwen3.6 35B-A3B met 71,4, Gemma 4 26B-A4B IT met 71,9, allemaal tegenover Kolibri's eigen 75,5 — en elk van die rijen is Aleph Alpha's eigen cijfer, gedraaid door hetzelfde lab op zijn eigen harness. Het is een nuttige kaart van de 3B-actieve omgeving. Het is geen onafhankelijke rangschikking.

Als wat je wilt vandaag een 3B-actieve MoE op een toets is

Geen van beide modellen in deze vergelijking staat op OrcaRouter, en het is de moeite waard om precies te zijn over waarom. Kolibri heeft nog helemaal geen gehoste inferentie van welke aard dan ook — het is gewichten en een vLLM-recept, dus er is niets waar een router naar kan verwijzen. Solar Mini 4 wordt aangeboden door Upstage en via Upstage's eigen on-premises kanaal; wij routeren het niet, en wij routeren geen enkel Upstage-model. Als je een van beide wilt, krijg je het van de leveranciers zelf.

De route die wij aanbieden is de omringende klasse — het sparse small-MoE-segment waarbinnen beide modellen met elkaar concurreren. Gemma 4 26B-A4B IT staat in de catalogus voor $0,06 in en $0,33 uit per miljoen tokens met een contextvenster van 262.144 tokens. Qwen3.5 35B-A3B staat op $0,057 / $0,459 en Qwen3.6 35B-A3B op $0,248 / $1,485 met een contextvenster van 262.144 tokens en 65.536 tokens maximale uitvoer. Dat is dezelfde afweging die de twee bovenstaande modellen maken — een actief deel van 3B tot 4B gekocht voor de prijs van een klein model — beschikbaar via één API-sleutel met de lijstprijs van de provider doorgegeven tegen 0% opslag, zodat een prijswijziging van een leverancier dezelfde dag op je factuur terechtkomt als dat die wordt aangekondigd, in plaats van bij de volgende contractverlenging. Automatische failover is hier belangrijker dan gewoonlijk: wanneer je een onbewezen sparse model evalueert, is een tweede route achter dezelfde sleutel wat voorkomt dat een slechte middag een storing wordt.

A two-column comparison scoreboard titled “Kolibri vs Solar Mini 4 — the scoreboard”. The Kolibri column lists total parameters 78.1B, 3.46B active per token, Apache 2.0 downloadable weights, 1,048,576-token context, German and English, and no independent score published. The Solar Mini 4 column lists total parameters 35B, 3B active per token, closed API-only weights, a 512K-per-docs / 1M-per-Artificial-Analysis context, English, Korean and Japanese, and an Artificial Analysis Intelligence Index of 24.05. A footer line reads “Kolibri figures are Aleph Alpha's own, unaudited; Solar Mini 4 figures per Artificial Analysis and Upstage.”

Wat te doen, en waar op te letten

Kies Kolibri als Duits of Engels je workload is, als de data je eigen rack niet mag verlaten, en als je de GPU's hebt — of bereid bent ze te kopen — om 78B op FP8 te serveren. In die configuratie is het het enige van deze twee modellen dat zelfs maar een optie is, en de gevalideerde context van 1M tokens met een Duitse tokenizer van 4,90 bytes per token is een reëel, zij het door de leverancier gemeten, voordeel. Kies Solar Mini 4 als je deze week in productie wilt gaan, als Koreaans of Japans op de roadmap staat, en als je workload een lange stabiele context is die de cachekorting beloont; begroot voor cache-writes, niet voor outputtokens.

De open vraag is voor beide dezelfde, en het is een bewijsvraag, niet een capaciteitsvraag. De 75,5 en 84,3 van Kolibri zijn de eigen cijfers van Aleph Alpha op de eigen testomgeving van Aleph Alpha, en totdat een onafhankelijke tracker het uitvoert, citeert wie ze ook aanhaalt het lab. De 24,05 van Solar Mini 4 is echt en gereproduceerd, maar de Index is een momentopname van een model dat zich nog midden in de kortingsladder bevindt, waarbij de lijstprijzen pas op 23 oktober komen. Houd de eerste onafhankelijke evaluatie van Kolibri in de gaten, en houd in de gaten wat Solar Mini 4 werkelijk kost zodra de ladder afloopt — want tegen $0,10 / $0,40 ziet de economie van het huren van de 3B-slice er anders uit dan de $0,03 / $0,12 die je vandaag worden geoffreerd.