
Kolibri vs Solar Mini 4: Samma 3B-budget för aktiva parametrar, två väldigt olika satsningar
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 217 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Två modeller släpptes med sjutton dagars mellanrum, båda trimmade att göra av med ungefär tre miljarder aktiva parametrar per token, och vad gäller att faktiskt ta dem i bruk kunde de knappast vara mindre lika. Aleph Alphas Kolibri är 78,1 miljarder parametrar i Apache-2.0-vikter som du laddar ner och serverar själv: det finns ingen hostad slutpunkt, och i dag finns det inte ett enda oberoende resultat för den någonstans. Upstages Solar Mini 4 är 35 miljarder parametrar som du inte kan ladda ner alls – den finns bara som en mätarbaserad slutpunkt, och den har redan ett Artificial Analysis Intelligence Index på 24,05. Antalet aktiva parametrar talar om vad var och en kostar att köra. Inget annat i den siffran talar om vad det kostar dig att komma igång.
Anledningen till att totalsummorna skiljer sig så mycket – 78,1B mot 35B med nästan samma aktiva andel – är att båda är glesa mixture-of-experts-konstruktioner, och de två labben fattade motsatta beslut om hur mycket expertkapacitet som ska hållas i reserv. Kolibri har 384 experter och dirigerar till 1 delad plus 6 av dem per token. Solar Mini 4 avslöjar en 35B/3B-uppdelning och inget om sitt antal experter. När två modeller annonseras med samma aktiva siffra är det det totala antalet parametrar, inte den aktiva siffran, som avgör din hårdvarukostnad – och här är det en 2,2× skillnad på samma angivna beräkningsbudget.
Vad var och en faktiskt är
• Totala parametrar — Kolibri 78,10B vs Solar Mini 4 35B
• Aktiva parametrar per token – Kolibri 3,46B vs Solar Mini 4 3B
• Vikter — Kolibri Apache 2.0, fullständiga vikter på Hugging Face vs Solar Mini 4 stängd; endast API
• Kontext — Kolibri 1 048 576 tokens validerade mot Solar Mini 4 512 enligt Upstages dokumentation, 1 048 576 enligt Artificial Analysiss modellkort
• Maximal utdata — Kolibri begränsas inte av leverantören jämfört med Solar Mini 4 128 000 tokens
• Språk — Kolibri tyska och engelska vs Solar Mini 4 engelska, koreanska och japanska
• Kunskapsgräns — Kolibri 18 juni 2026 vs Solar Mini 4 februari 2026
• Leverans — Kolibri självhostad (vLLM) vs Solar Mini 4 hostad på Upstages Console, Playground och lokalt
• Oberoende utvärdering — Kolibri: inga publicerade vs Solar Mini 4 AA Intelligence Index 24.05
Kolibri: 78 miljarder parametrar, och ingen utanför labbet har poängsatt den
Aleph Alpha publicerade Kolibri den 3 oktober 2026, medvetet på Tyska återföreningsdagen, som den första i en ny familj och efterträdaren till Kolibri Origin. Modellkortet är ovanligt öppenhjärtigt om vad som ingick: 20 biljoner token för förträning, 3,44 biljoner för mellanträning och 201 miljarder för långkontextträning, kört över 768 B200-GPU:er under 21 dagar för cirka 6,4×10²³ FLOP och omkring 950 MWh. Leverantören redovisar också frivilligt antalet fel – 38 oplanerade avbrott, ungefär ett per 10 000 GPU-timmar – vilket är den typ av siffra som labb vanligtvis utelämnar.

Arkitekturen är en ren sparse-MoE-historia. Femtio lager med ett förhållande på 4:1 mellan sliding-window-attention (fönster på 512 token) och global attention, som bara aktiveras i vart femte lager. FP8-vikter med 128×128-blockskalning och en FP8-KV-cache. Som jämförelse använde Kolibri Origin 128 experter med 8-vägs routing, en dold expertdimension på 768 och full attention i varje lager, på engelska data med slut i september 2024. Kolibri går över till 384 experter med 6-vägs routing, en dold dimension på 512, och flyttar fram båda språkens cutoff-datum till den 18 juni 2026.
Den tyska pipelinen är den del som verkligen är svår att köpa någon annanstans. Aleph Alpha tränade sin egen UniBPE-tokenizer och rapporterar tysk text vid 4,90 byte per token, mot 4,35 för GPT-5, 4,17 för Qwen3.5 och 4,13 för Gemini. Det är en tokenizer som hävdar bättre tysk komprimering än någon av de främsta flerspråkiga modellerna, och det är den konkreta mekanismen bakom säljargumentet för suverän driftsättning: färre tokens per tyskt dokument innebär färre fakturerade tokens och ett längre effektivt fönster på samma hårdvara.
Varje prestandasiffra som finns för Kolibri kommer från Aleph Alphas eget modellkort, och det är så den bör läsas. Den leverantörsrapporterade tabellen har Kolibri på totalt 75,5 på engelska utvärderingar och 70,8 på tyska, 84,3 GPQA Diamond på engelska mot 81,3 på tyska, 21,5 på Humanity's Last Exam på engelska mot 15,9 på tyska, 66,4 på SWE-Bench Verified, 85,9 på LiveCodeBench v6 och 68,3 på AA-LCR. Det är ogranskade siffror. Det finns ingen Artificial Analysis-sida för Kolibri — modellens URL returnerar 404 — så inget i den tabellen har reproducerats oberoende, och artikeln du läser kan inte göra den mer solid än den är.
Det som kortet verkligen befäster är serving-storyn. Hårdvarugolvet är två A100 80GB, eller två H100 SXM5, eller en enda H200, B200 eller B300. Ett publicerat vLLM-recept kör det med --kv-cache-dtype fp8 och dedikerade parsers för reasoning och tool calls, vid temperatur 1.0, top-p 0.97 och top-k 128, med en reasoning_effort-ratt som spänner över none, low, medium och high. En enda B300 som servar en 78B-modell vid en validerad kontext på 1M tokens är erbjudandets konkreta form: du köper boxen, och sedan äger du marginalkostnaden för varje token.
Solar Mini 4: du hyr den aktiva 3B-delen istället för att köpa den
Solar Mini 4 lanserades den 22 september 2026 – snapshot solar-mini4-260922, alias solar-mini4 – som Upstages agentorienterade lilla modell: 35B totalt, 3B aktiva, en kunskapsgräns i februari 2026, engelska, koreanska och japanska, med lägena chatt, resonemang, strukturerad utdata och verktygsanrop. Den är tillgänglig via Upstages Console och Playground, och för driftsättning på plats, men det finns ingen nedladdning av vikter och ingen licens att granska. Upstages dokumentation anger också "Inga data samlas in" för den, vilket är den efterlevnadsrad som spelar roll om du sätter den framför verklig trafik.

Till skillnad från Kolibri har Solar Mini 4 genomgått ett oberoende testramverk. Artificial Analysis placerar den på ett Intelligence Index på 24,05, med uppmätta 1,01 % på Terminal-Bench 4.0, 47,6 % på SciCode, 83,3 % på AA-LCR och 25,8 % på Humanity's Last Exam. Upstages lanseringsinlägg ramar in 24,1 som det högsta indexet bland modeller med 3B aktiva parametrar, före Qwen3.6 35B A3B på 18 och Nemotron 3.5 Lightning på 13 – en inramning som är rättvis så långt den räcker, och det är värt att notera att den är precis så snäv som den låter, eftersom det är ett påstående om klassen med 3B aktiva parametrar snarare än om små modeller i allmänhet.
Det mått som bör forma hur du budgeterar för det är inte Index. Kostnadsuppdelningen per uppgift från Artificial Analysis placerar Solar Mini 4 på ungefär $0,36 per Intelligence-Index-uppgift, och omkring $0,30 av det – cirka 82 % – är prompt-cache-skrivningar. Cache-läsningar kostar $0,03 och genererad utdata är bara $0,035. Modellen avger ungefär 88 300 utdatatokens per uppgift, varav omkring 71 600 är resonemangstokens. Med andra ord: detta är en billig modell vars nota domineras av att skriva om en lång kontext, inte av de tokens den skriver tillbaka. Kostnader per utvärdering sträcker sig från $1,63 för Terminal-Bench 4.0 ner till $0,95 för AA-Briefcase. Medianhastigheten för utdata är 198 tokens per sekund vid en tid till första chunk på 1,58 sekunder.
Priset för varje väg
Solar Mini 4 prissätts inte till listpris i dag. Upstages egen prissida har en daterad pristrappa för den: $0.03 per miljon indata, $0.003 cachad och $0.12 utdata – en lanseringsrabatt på 70 % – till och med 10 oktober 2026 UTC, sedan $0.05 / $0.005 / $0.20 från 11 oktober, och slutligen listpriset $0.10 / $0.01 / $0.40 från 23 oktober. Upstages lanseringsinlägg beskriver rabatten mer oprecist än prissidans eget schema gör; pristrappan ovan är versionen med datum på, och det är den man bör planera efter. Notera var den brantaste rabatten ligger: cachad indata faller till en tiondel av indata-priset, vilket belönar exakt den arbetsbelastning med långvarigt stabil kontext som kostnadsprofilen för cacheskrivningar ovan tar betalt för.
Kolibris pris är en inköpsorder. Det finns ingen kostnad per miljon token att jämföra med, eftersom det inte finns någon hostad mätare – du betalar för GPU:er och el, och leverantörens enda offentliga kostnadssignal är själva träningskörningen: cirka 950 MWh för att producera modellen. Om du redan äger inferensskapacitet närmar sig Kolibris marginalkostnad per token elkostnaden; om du inte gör det är inträdesbiljetten en box med två A100 eller bättre. Det är en fundamentalt annan form av åtagande än en modell som du kan anropa per miljon token och sluta anropa i morgon, och det är det faktiska beslut som de två alternativen ställer dig inför.
Där de överlappar, och där jämförelsen brister
• Aktiv beräkning — nästan identisk: 3,46B mot 3B per token
• Allt som följer av det — inte jämförbart, eftersom endast en av de två har några verifierade bevis
• Bästa uppmätta poäng — Solar Mini 4 har ett granskat index på 24,05; Kolibri har en leverantörstabell och ingen granskad poäng alls
• Tyska – Kolibri är den enda av de två som är tränad för det, med 4,90 byte per token; Solar Mini 4 listar det inte
• Koreanska och japanska — Solar Mini 4 listar båda; Kolibri listar ingen av dem
• Lång kontext — Kolibri validerar fullt 1 048 576 tokens; Solar Mini 4:s egen dokumentation anger 512K medan dess Artificial Analysis-kort anger 1M, så behandla taket som leverantörsberoende
• Tid till första token — Solar Mini 4 tar minuter, eftersom du registrerar dig; Kolibri tar dagar, eftersom du sätter in en låda i ett rack
• Kostnadsmodell — per token, sjunkande med rabattrappan, mot kapital plus kraft
Den ärliga sammanfattningen är att detta inte är en matchning man avgör på en resultattavla. Kolibris leverantörstabell innehåller till och med sin egen jämförelseuppsättning – GLM-4.7 Flash 30B-A3B på 64,7 totalt för engelska, Nemotron 3 Nano 30B-A3B på 65,6, Qwen3.5 35B-A3B på 74,7, Qwen3.6 35B-A3B på 71,4, Gemma 4 26B-A4B IT på 71,9, alla mot Kolibris egen 75,5 – och var och en av dessa rader är Aleph Alphas egen siffra, framtagen av samma labb i sin egen testbänk. Det är en användbar karta över grannskapet kring 3B-aktiva. Det är inte en oberoende rangordning.
Om det du vill ha är en 3B-aktiv MoE på en nyckel idag
Ingen av modellerna i den här jämförelsen finns på OrcaRouter, och det är värt att vara precis om varför. Kolibri har ännu ingen hostad inferens av något slag – det är vikter och ett vLLM-recept, så det finns inget för en router att peka på. Solar Mini 4 serveras av Upstage och av Upstages egen on-premises-kanal; vi routar den inte, och vi routar inte någon Upstage-modell. Om du vill ha någon av dem får du den från leverantörerna själva.
Rutten vi erbjuder är den omgivande klassen – den glesa small-MoE-kategorin som båda dessa modeller tävlar inom. Gemma 4 26B-A4B IT finns i katalogen för $0,06 in och $0,33 ut per miljon tokens med ett fönster på 262 144 tokens. Qwen3.5 35B-A3B ligger på $0,057 / $0,459 och Qwen3.6 35B-A3B på $0,248 / $1,485 med ett fönster på 262 144 tokens och en maximal utdata på 65 536 tokens. Det är samma avvägning som de två modellerna ovan gör – en aktiv del på 3B till 4B köpt för priset av en liten modell – tillgänglig via en API-nyckel med leverantörens listpris vidarebefordrat med 0 % påslag, så en ändring av leverantörspriset hamnar på din faktura samma dag som den aviseras i stället för vid nästa avtalsförnyelse. Automatisk redundansväxling är viktigare här än vanligt: när du utvärderar en oprövad gles modell är en andra rutt bakom samma nyckel det som hindrar en dålig eftermiddag från att bli ett avbrott.

Vad man ska göra och vad man ska titta på
Välj Kolibri om tyska eller engelska är din arbetsbelastning, om data inte får lämna ditt eget rack, och om du har – eller är beredd att köpa – GPU:erna för att betjäna 78B i FP8. I den konfigurationen är det den enda av dessa två modeller som ens är ett alternativ, och den validerade kontexten på 1M token med en tysk tokeniserare på 4,90 byte per token är en verklig, om än leverantörsmätt, fördel. Välj Solar Mini 4 om du vill vara i produktion den här veckan, om koreanska eller japanska finns på färdplanen, och om din arbetsbelastning är en lång stabil kontext som cacherabatten belönar; budgetera för cache-skrivningar, inte för utdatatoken.
Den öppna frågan är densamma för båda, och det är en fråga om bevis snarare än om förmåga. Kolibris 75,5 och 84,3 är Aleph Alphas egna siffror på Aleph Alphas egen testbänk, och tills en oberoende tracker kör den, citerar den som citerar dem labbet. Solar Mini 4:s 24,05 är verkligt och reproducerat, men Index är en ögonblicksbild av en modell som fortfarande befinner sig mitt i en rabattstege, där listprissättningen inte kommer förrän den 23 oktober. Håll utkik efter Kolibris första oberoende utvärdering, och håll koll på vad Solar Mini 4 faktiskt kostar när rabattstegen tar slut — för vid $0,10 / $0,40 ser ekonomin i att hyra 3B-delen annorlunda ut än det pris på $0,03 / $0,12 som du erbjuds idag.
