Titelkarte mit der Aufschrift „Kolibri vs Solar Mini 4“ und dem Untertitel „Dasselbe aktive 3B-Budget, zwei sehr unterschiedliche Wetten“ sowie zwei Zeilen im Kleingedruckten mit der Aufschrift „Kolibri — 78,1B insgesamt, Apache-2.0-Gewichte, selbst gehostet“ und „Solar Mini 4 — 35B insgesamt, geschlossen, gehostete API“, auf weißem Hintergrund mit weichen blau- und cyanfarbenen Verlaufsakzenten und dem OrcaRouter-Logo unten rechts.
Guides & Insights

Kolibri vs. Solar Mini 4: Das gleiche 3B-Aktiv-Budget, zwei sehr unterschiedliche Wetten

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Zwei Modelle wurden mit siebzehn Tagen Abstand veröffentlicht, beide darauf ausgelegt, pro Token ungefähr drei Milliarden aktive Parameter zu verbrauchen, und sie könnten kaum unterschiedlicher sein, was den tatsächlichen Einsatz angeht. Aleph Alphas Kolibri besteht aus 78,1 Milliarden Parametern mit Apache-2.0-Gewichten, die Sie selbst herunterladen und betreiben: Es gibt keinen gehosteten Endpunkt, und Stand heute gibt es nirgendwo eine einzige unabhängige Bewertung davon. Upstages Solar Mini 4 besteht aus 35 Milliarden Parametern, die Sie überhaupt nicht herunterladen können – es existiert nur als nutzungsabhängig abgerechneter Endpunkt, und es hat bereits einen Artificial Analysis Intelligence Index von 24,05. Die Anzahl der aktiven Parameter sagt Ihnen, was der Betrieb des jeweiligen Modells kostet. Sonst verrät Ihnen diese Zahl nichts darüber, was es Sie kostet, einzusteigen.

Der Grund, warum die Gesamtsummen so stark auseinandergehen – 78,1B gegenüber 35B bei nahezu identischem aktivem Anteil –, ist, dass es sich bei beiden um sparse Mixture-of-Experts-Designs handelt und die beiden Labore gegensätzliche Entscheidungen darüber getroffen haben, wie viel Expertenkapazität in Reserve gehalten werden soll. Kolibri umfasst 384 Experten und routet pro Token zu 1 gemeinsam genutzten plus 6 davon. Solar Mini 4 gibt eine 35B/3B-Aufteilung bekannt und nichts zu seiner Expertenanzahl. Wenn zwei Modelle mit derselben aktiven Zahl beworben werden, entscheidet die Gesamtparameterzahl, nicht die aktive Zahl, über Ihre Hardware-Rechnung – und hier ist es ein Unterschied von 2,2× bei demselben angegebenen Compute-Budget.

Was jedes einzelne tatsächlich ist

• Gesamtparameter — Kolibri 78.10B vs. Solar Mini 4 35B

• Aktive Parameter pro Token — Kolibri 3.46B vs Solar Mini 4 3B

• Gewichte — Kolibri Apache 2.0, vollständige Gewichte auf Hugging Face vs. Solar Mini 4 geschlossen; nur API

• Kontext — Kolibri mit 1.048.576 Token validiert vs. Solar Mini 4 mit 512K laut Upstage-Dokumentation, 1.048.576 laut der Modellkarte von Artificial Analysis

• Maximale Ausgabe — Kolibri nicht vom Anbieter begrenzt vs. Solar Mini 4 128.000 Token

• Sprachen — Kolibri Deutsch und Englisch vs. Solar Mini 4 Englisch, Koreanisch und Japanisch

• Wissensstichtag — Kolibri 18. Juni 2026 vs. Solar Mini 4. Februar 2026

• Bereitstellung — Kolibri selbstgehostet (vLLM) vs. Solar Mini 4, gehostet in Upstages Console, Playground und On-Premises

• Unabhängige Bewertung — Kolibri: keine veröffentlicht vs. Solar Mini 4 AA Intelligence Index 24.05

Kolibri: 78 Milliarden Parameter, und niemand außerhalb des Labors hat es bewertet

Aleph Alpha veröffentlichte Kolibri am 3. Oktober 2026, bewusst am Tag der Deutschen Einheit, als erstes Modell einer neuen Familie und als Nachfolger von Kolibri Origin. Die Modellkarte ist ungewöhnlich auskunftsfreudig darüber, was in das Modell eingeflossen ist: 20 Billionen Token im Pre-Training, 3,44 Billionen im Mid-Training und 201 Milliarden im Long-Context-Training, trainiert auf 768 B200 GPUs in 21 Tagen für rund 6,4×10²³ FLOPs und etwa 950 MWh. Der Anbieter gibt außerdem unaufgefordert die Ausfallzahl an – 38 ungeplante Unterbrechungen, etwa eine pro 10.000 GPU-Stunden –, eine Art von Zahl, die Labore üblicherweise weglassen.

Screenshot of Aleph Alpha's newsroom post “Kolibri Has Landed”, showing the 03/10/2026 release date, the line about releasing on the Day of German Reunification, and the architecture comparison table between Kolibri and Kolibri Origin.

Die Architektur ist eine saubere Sparse-MoE-Story. Fünfzig Schichten mit einem Verhältnis von 4:1 zwischen Sliding-Window-Attention (512-Token-Fenster) und globaler Attention, die nur auf jeder fünften Schicht aktiv wird. FP8-Gewichte mit 128×128-Block-Skalierung und ein FP8-KV-Cache. Kolibri Origin verwendete zum Vergleich 128 Experten, 8-fach geroutet, eine 768 breite Experten-Hidden-Dimension und vollständige Attention auf jeder Schicht, auf englischen Daten mit Stichtag September 2024. Kolibri wechselt zu 384 Experten, 6-fach geroutet, mit einer 512 breiten Hidden-Dimension und verschiebt beide Sprach-Cutoffs auf den 18. Juni 2026.

Die deutsche Pipeline ist der Teil, den man anderswo wirklich kaum kaufen kann. Aleph Alpha hat seinen eigenen UniBPE-Tokenizer trainiert und gibt für deutschen Text 4,90 Bytes pro Token an, gegenüber 4,35 für GPT-5, 4,17 für Qwen3.5 und 4,13 für Gemini. Das ist ein Tokenizer, der eine bessere deutsche Kompression beansprucht als jedes der führenden mehrsprachigen Modelle, und er ist der konkrete Mechanismus hinter dem Pitch für souveräne Bereitstellung: weniger Token pro deutschem Dokument bedeuten weniger abgerechnete Token und ein längeres effektives Fenster auf derselben Hardware.

Jede Leistungskennzahl, die für Kolibri existiert, stammt aus Aleph Alphas eigener Modellkarte, und genau so sollte sie gelesen werden. Die vom Anbieter angegebene Tabelle führt Kolibri mit insgesamt 75,5 bei englischen Evals und 70,8 bei deutschen, 84,3 bei GPQA Diamond auf Englisch gegenüber 81,3 auf Deutsch, 21,5 bei Humanity's Last Exam auf Englisch gegenüber 15,9 auf Deutsch, 66,4 bei SWE-Bench Verified, 85,9 bei LiveCodeBench v6 und 68,3 bei AA-LCR. Das sind nicht auditierte Zahlen. Es gibt keine Artificial Analysis-Seite für Kolibri – die Modell-URL des Trackers liefert einen 404 –, daher wurde nichts in dieser Tabelle unabhängig reproduziert, und der Artikel, den Sie gerade lesen, kann sie nicht belastbarer machen, als sie ist.

Was die Karte wirklich solide macht, ist die Serving-Story. Die Hardware-Mindestausstattung besteht aus zwei A100 80GB, zwei H100 SXM5 oder einer einzelnen H200, B200 oder B300. Ein veröffentlichtes vLLM-Rezept betreibt es mit --kv-cache-dtype fp8 und dedizierten Reasoning- und Tool-Call-Parsern, bei Temperatur 1,0, Top-p 0,97 und Top-k 128, mit einem reasoning_effort-Regler, der none, low, medium und high umfasst. Ein einzelner B300, der ein 78B-Modell mit einem validierten Kontext von 1M Token bedient, ist die konkrete Form des Angebots: Sie kaufen die Box, und danach tragen Sie die Grenzkosten für jedes Token.

Solar Mini 4: Du mietest den aktiven 3B-Slice, anstatt ihn zu kaufen.

Solar Mini 4 erschien am 22. September 2026 — Snapshot solar-mini4-260922, Alias solar-mini4 — als agentenorientiertes kleines Modell von Upstage: 35B insgesamt, 3B aktiv, ein Cutoff vom Februar 2026, Englisch, Koreanisch und Japanisch, mit Chat-, Reasoning-, Structured-Output- und Tool-Calling-Modi. Es ist über Upstages Console und Playground sowie für On-Premises-Deployment verfügbar, aber es gibt keinen Gewichts-Download und keine Lizenz zur Einsicht. In der Upstage-Dokumentation wird außerdem „Data not collected“ dafür vermerkt, die Compliance-Zeile, auf die es ankommt, wenn man es vor echten Traffic setzt.

Screenshot of Upstage's Console documentation page for Solar Mini 4, showing the snapshot identifier solar-mini4-260922, the release date 2026-09-22, 35B total and 3B active parameters, a 512K context window with 128K maximum output, the list price of $0.10 per million input, $0.40 per million output and $0.01 per million cached, and the note “Data not collected”.

Anders als Kolibri hat Solar Mini 4 ein unabhängiges Test-Harness durchlaufen. Artificial Analysis ordnet es mit einem Intelligence Index von 24,05 ein, mit gemessenen 1,01 % bei Terminal-Bench 4.0, 47,6 % bei SciCode, 83,3 % bei AA-LCR und 25,8 % bei Humanity's Last Exam. In Upstages Launch-Post wird die 24,1 als der höchste Index unter Modellen mit 3B-aktiven Parametern dargestellt, vor Qwen3.6 35B A3B mit 18 und Nemotron 3.5 Lightning mit 13 – eine Einordnung, die, soweit sie geht, fair ist und – wohlgemerkt – genau so eng ist, wie sie klingt, denn sie ist eine Aussage über die Klasse der 3B-aktiven Modelle und nicht über kleine Modelle allgemein.

Die Messgröße, an der sich Ihre Budgetierung dafür orientieren sollte, ist nicht der Index. Die Kostenaufschlüsselung pro Aufgabe von Artificial Analysis veranschlagt Solar Mini 4 auf etwa 0,36 $ pro Intelligence-Index-Aufgabe, und davon entfallen etwa 0,30 $ – rund 82 % – auf Prompt-Cache-Schreibvorgänge. Cache-Lesevorgänge kosten 0,03 $, und die generierte Ausgabe kostet nur 0,035 $. Das Modell gibt pro Aufgabe etwa 88.300 Ausgabe-Token aus, von denen rund 71.600 Reasoning-Token sind. Mit anderen Worten: Dies ist ein günstiges Modell, dessen Abrechnung von dem Neuschreiben eines langen Kontexts dominiert wird, nicht von den Token, die es zurückschreibt. Die Kosten pro Eval reichen von 1,63 $ für Terminal-Bench 4.0 bis hinunter zu 0,95 $ für AA-Briefcase. Die mediane Ausgabegeschwindigkeit beträgt 198 Token pro Sekunde bei einer Zeit bis zum ersten Chunk von 1,58 Sekunden.

Der Preis jedes Weges

Solar Mini 4 wird derzeit nicht zum Listenpreis angeboten. Upstages eigene Preisseite führt dafür eine datierte Preisstaffel auf: 0,03 $ pro Million Input, 0,003 $ gecacht und 0,12 $ Output – ein Launch-Rabatt von 70 % – bis einschließlich 10. Oktober 2026 UTC, dann 0,05 $ / 0,005 $ / 0,20 $ ab dem 11. Oktober und schließlich der Listenpreis von 0,10 $ / 0,01 $ / 0,40 $ ab dem 23. Oktober. Upstages Launch-Beitrag beschreibt den Rabatt weniger präzise als der eigene Zeitplan der Preisseite; die obige Staffel ist die Version mit Datumsangaben, und sie ist diejenige, mit der man planen sollte. Beachten Sie, wo der steilste Rabatt liegt: Gecachter Input fällt auf ein Zehntel des Input-Tarifs, was genau die Workload mit langem, stabilem Kontext belohnt, für die das obige Cache-Schreibkostenprofil Gebühren berechnet.

Kolibri ist ein Kauf. Es gibt keinen Pro-Token-Tarif zum Abrechnen – Sie zahlen den Strom, und das einzige öffentliche Kostensignal ist der Trainingslauf selbst: etwa 450 MWh, um das Modell zu erzeugen. Wenn Sie bereits über Inferenzkapazität verfügen, nähern sich die Grenzkosten von Kolibri pro Token den Stromkosten an; wenn nicht, ist der Einstieg eine Zwei-A100-Box oder besser. Das ist eine grundlegend andere Art der Bindung als bei einem Modell, das Sie millionenfach per Token aufrufen und morgen nicht mehr aufrufen können, und genau diese Entscheidung legen die beiden Optionen dar.

Wo sie sich überschneiden und wo der Vergleich auseinanderbricht

• Aktive Rechenleistung — nahezu identisch: 3,46B gegenüber 3B pro Token

• Alles, was daraus folgt — nicht vergleichbar, weil nur eine der beiden überhaupt verifizierte Belege hat

• Beste gemessene Punktzahl — Solar Mini 4 hat einen auditierten Index von 24,05; Kolibri hat eine Anbietertabelle und überhaupt keinen auditierten Wert

• Deutsch — Kolibri ist der einzige der beiden, der dafür trainiert wurde, mit 4,90 Bytes pro Token; Solar Mini 4 listet es nicht auf

• Koreanisch und Japanisch — Solar Mini 4 listet beide auf; Kolibri listet keines von beiden auf

• Langkontext — Kolibri validiert volle 1.048.576 Token; die eigene Dokumentation von Solar Mini 4 sagt 512K, während seine Artificial Analysis-Karte 1M sagt, also behandle die Obergrenze als anbieterabhängig

• Zeit bis zum ersten Token — Solar Mini 4: Minuten, weil man sich anmeldet; Kolibri: Tage, weil man eine Box ins Rack einbaut

• Kostenmodell — pro Token, sinkend mit der Rabattstaffel, gegenüber Kapital plus Strom

Die ehrliche Zusammenfassung lautet: Dies ist kein Duell, das sich auf einer Bestenliste entscheiden lässt. Die Anbietertabelle von Kolibri enthält sogar die eigene Vergleichsgruppe — GLM-4.7 Flash 30B-A3B mit 64,7 im englischen Gesamtwert, Nemotron 3 Nano 30B-A3B mit 65,6, Qwen3.5 35B-A3B mit 74,7, Qwen3.6 35B-A3B mit 71,4, Gemma 4 26B-A4B IT mit 71,9, alle gegenüber Kolibris eigenen 75,5 — und jede dieser Zeilen ist Aleph Alphas eigene Zahl, erhoben vom selben Labor mit seiner eigenen Testumgebung. Es ist eine nützliche Karte des 3B-aktiven Umfelds. Es ist kein unabhängiges Ranking.

Wenn du heute ein MoE mit 3B aktiven Parametern auf einer Taste willst

Keines der beiden Modelle in diesem Vergleich ist auf OrcaRouter, und es lohnt sich, genau zu sein, warum. Kolibri hat noch keinerlei gehostete Inferenz – es sind Gewichte und ein vLLM-Rezept, also gibt es nichts, worauf ein Router zeigen könnte. Solar Mini 4 wird von Upstage und über Upstages eigenen On-Premises-Kanal bereitgestellt; wir routen es nicht, und wir routen kein Upstage-Modell. Wenn Sie eines der beiden möchten, erhalten Sie es direkt von den Anbietern.

Was wir routen, ist die umgebende Klasse — die spärliche Small-MoE-Klammer, innerhalb derer beide dieser Modelle konkurrieren. Gemma 4 26B-A4B IT steht im Katalog mit $0.06 Input und $0.33 Output pro Million Token bei einem Fenster von 262.144 Token. Qwen3.5 35B-A3B liegt bei $0.057 / $0.459 und Qwen3.6 35B-A3B bei $0.248 / $1.485 mit einem 262.144-Token-Fenster und maximal 65.536 Token Output. Das ist derselbe Trade-off, den die beiden oben genannten Modelle eingehen — ein aktiver Ausschnitt von 3B bis 4B zum Preis eines kleinen Modells — verfügbar über einen einzigen API-Schlüssel zum Listenpreis des Anbieters mit 0 % Aufschlag, sodass eine Preisänderung des Anbieters noch am Tag ihrer Ankündigung auf Ihrer Rechnung landet und nicht erst bei der nächsten Vertragsverlängerung. Automatisches Failover ist hier wichtiger als sonst: Wenn Sie ein unerprobtes spärliches Modell evaluieren, ist eine zweite Route hinter demselben Schlüssel das, was verhindert, dass ein schlechter Nachmittag zu einem Ausfall wird.

A two-column comparison scoreboard titled “Kolibri vs Solar Mini 4 — the scoreboard”. The Kolibri column lists total parameters 78.1B, 3.46B active per token, Apache 2.0 downloadable weights, 1,048,576-token context, German and English, and no independent score published. The Solar Mini 4 column lists total parameters 35B, 3B active per token, closed API-only weights, a 512K-per-docs / 1M-per-Artificial-Analysis context, English, Korean and Japanese, and an Artificial Analysis Intelligence Index of 24.05. A footer line reads “Kolibri figures are Aleph Alpha's own, unaudited; Solar Mini 4 figures per Artificial Analysis and Upstage.”

Was zu tun ist und worauf zu achten ist

Wählen Sie Kolibri, wenn Deutsch oder Englisch Ihre Workload ist, wenn die Daten Ihr eigenes Rack nicht verlassen dürfen und wenn Sie die GPUs haben – oder bereit sind, sie zu kaufen –, um 78B mit FP8 zu bedienen. In dieser Konfiguration ist es das einzige dieser beiden Modelle, das überhaupt eine Option ist, und der 1M-Token-validierte Kontext mit einem deutschen Tokenizer mit 4,90 Byte pro Token ist ein echter – wenn auch vom Anbieter gemessener – Vorteil. Wählen Sie Solar Mini 4, wenn Sie diese Woche in Produktion gehen wollen, wenn Koreanisch oder Japanisch auf der Roadmap steht und wenn Ihre Workload ein langer, stabiler Kontext ist, den der Cache-Rabatt belohnt; planen Sie Cache-Schreibvorgänge ein, nicht Ausgabe-Tokens.

Die offene Frage ist für beide dieselbe, und es ist eine Frage der Evidenz, nicht der Fähigkeit. Kolibris 75,5 und 84,3 sind Aleph Alphas eigene Zahlen auf Aleph Alphas eigener Testumgebung, und solange kein unabhängiger Tracker diese ausführt, zitiert jeder, der sie zitiert, das Labor. Die 24,05 von Solar Mini 4 ist real und reproduziert, aber der Index ist eine Momentaufnahme eines Modells, das sich noch mitten in der Rabattstaffel befindet, wobei die Listenpreise erst am 23. Oktober kommen. Achten Sie auf Kolibris erste unabhängige Evaluierung und darauf, was Solar Mini 4 tatsächlich kostet, sobald die Staffel ausläuft – denn bei $0,10 / $0,40 sieht die Wirtschaftlichkeit des Mietens des 3B-Slice anders aus als bei den $0,03 / $0,12, die Ihnen heute genannt werden.