
Kolibri vs Gemma 4 12B: 78 Milliarden Parameter gegen 12, und nur einer von ihnen hat eine Punktzahl
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 218 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Kolibri und Gemma 4 12B sind die beiden Enden eines Spektrums, bei dem Open-Weight-Veröffentlichungen normalerweise keinen Vergleich zu gleichen Bedingungen zulassen. Aleph Alphas Kolibri erschien am 3. Oktober 2026: 78,1 Milliarden Gesamtparameter, 3,46 Milliarden aktive pro Token, ein validiertes 1.048.576-Token-Kontextfenster, nur Deutsch und Englisch, Apache 2.0. Gemma 4 12B erschien am 3. Juni 2026: 11,95 Milliarden dichte Parameter, ein 262.144-Token-Kontextfenster, Text-, Bild-, Audio- und Videoeingabe, Apache 2.0. Eines von ihnen hat eine unabhängige, öffentlich reproduzierbare Bewertung. Das andere hat eine Benchmark-Tabelle des Anbieters. Diese Asymmetrie ist keine Fußnote zu diesem Vergleich; sie ist der Vergleich, denn alles andere, was einen Käufer interessiert – Kosten pro Aufgabe, Qualität pro Watt, ob es mit Ihren Dokumenten funktioniert –, geht durch sie hindurch.
Wir sollten ebenso direkt über die Form des Vergleichs sprechen, denn eine Schlagzeile, die ein 78B-Modell einem 12B-Modell gegenüberstellt, verleitet zu der falschen Schlussfolgerung. Diese beiden sind keine Konkurrenten. Das eine ist ein 78-GB-Deployment für Dokumentenarbeit im deutschen öffentlichen Sektor und in der Industrie auf Racks, die der Kunde selbst besitzt; das andere ist ein einheitliches multimodales Modell mit 12 Milliarden Parametern, das auf einem Laptop läuft und einen unabhängigen Index von 14 aufweist. Was folgt, ist eine Darstellung davon, wofür jedes tatsächlich gedacht ist, wo die veröffentlichten Zahlen es zulassen, sie einzustufen, und wo nicht, und was es kostet, keinen unabhängigen Score zu haben.
Die eine Zahl, der Sie hier vertrauen können, und die eine, der Sie nicht vertrauen können.
Artificial Analysis hat Gemma 4 12B in seiner Reasoning-Konfiguration gemessen. Die Ergebnisse, wie sie auf ihrer Modellseite veröffentlicht wurden, sind die Grundlage, von der auszugehen ist:
• Intelligenz — ein Artificial Analysis Intelligence Index von 14, was es in die Spitzenklasse mit einer #21-Position unter den 142 Modellen dieses Vergleichs einordnet, gegenüber einem Median von 8 für vergleichbare Modelle.
• Geschwindigkeit — 112,5 Ausgabe-Token pro Sekunde, Nr. 21 von 142 in der Geschwindigkeitsansicht und über dem Median von 91 Token für vergleichbare Modelle.
• Preis — 0,10 $ pro Million Eingabe-Tokens und 0,30 $ pro Million Ausgabe-Tokens, was ihre Seite im Vergleich zu einem Median von 0,03 $ und 0,15 $ für Modelle ähnlicher Größe und Klasse als etwas teuer kennzeichnet.
• Spezifikation — 262.144-Token-Kontext, 12 Mrd. Parameter insgesamt, Apache 2.0, Text-, Bild-, Sprach- und Videoeingabe, Textausgabe.
Das eigene zusammenfassende Urteil von Artificial Analysis ist für eine Bestenlisten-Seite ungewöhnlich deutlich – und es lohnt sich, es zu wiederholen: Gemma 4 12B gehört bei der Intelligenz zu den führenden Modellen, ist aber im Vergleich zu anderen Open-Weight-Modellen ähnlicher Größe etwas teuer. Das ist eine echte, unabhängige, reproduzierbare Bewertung von einem Dritten, der kein Eigeninteresse an einem der beiden Anbieter hat.
Kolibri hat nichts Vergleichbares. Es gibt keine Modellseite bei Artificial Analysis dafür, und zum Zeitpunkt des Verfassens hat kein Drittanbieter die Eval-Suite reproduziert. Was existiert, ist die eigene Vergleichstabelle von Aleph Alpha, auf der Kolibri über seine Task-Suite hinweg im englischen Durchschnitt 75,5 und im deutschen Durchschnitt 70,8 erreicht. Das sind ungewichtete Prozentdurchschnitte über einen Benchmark-Mix, den der Anbieter ausgewählt hat, auf einer Testumgebung, die der Anbieter geschrieben hat, bei hohem Reasoning-Aufwand. Sie sind kein Intelligence Index, und die beiden Zahlen lassen sich nicht ineinander umrechnen oder nebeneinanderstellen. Wer „Kolibri 75,5 versus Gemma 14“ als Ranking präsentiert, vergleicht einen Prozentwert auf der einen Skala mit einem Score auf einer anderen. Die ehrliche Position ist, dass die Qualität von Gemma 4 12B gemessen ist und die von Kolibri behauptet wird.
Was die Anbietertabelle Ihnen ermöglicht, ist das Lesen über Zeilen hinweg. Gemma 4 26B-A4B IT, Googles eigenes Mixture-of-Experts-Geschwistermodell zum 12B, erscheint in Aleph Alphas Tabelle mit 71,9 Englisch und 66,3 Deutsch, bei beiden unter Kolibri. Das ist das Nächstliegende zu einer verfügbaren Gegenprüfung, und es bringt denselben Vorbehalt mit: Anbieter-Harness, Anbieter-Zahlen. Es ist ein schwaches Signal, kein Beweis.

Dichtes 12B gegen dünnbesetztes 78B ist nicht das Missverhältnis, das es zu sein scheint.
Die Architekturlücke ist größer als die Parameterlücke, sobald man berücksichtigt, was tatsächlich pro Token berechnet wird.
• Berechnung pro Token — Gemma 4 12B aktiviert bei jedem Token alle 11,95 Milliarden Parameter. Kolibri aktiviert 3.457.573.120 von seinen 78.103.074.560 Parametern, etwa ein Zweiundzwanzigstel des Modells, mit einem geteilten Experten und sechs gerouteten Experten pro Schicht aus insgesamt 384.
• Speicher — der Trade-off verläuft in die entgegengesetzte Richtung und ist brutal. Gemma 4 12B in bfloat16 liegt in der Größenordnung von 24 GB an Gewichten. Kolibris Karte gibt die FP8-Gewichte mit rund 78 GB an, wobei mindestens zwei A100-80-GB-Karten, zwei H100 SXM5, eine H200, eine B200 oder eine B300 erforderlich sind.
• Achtung — Gemma 4 verwendet einen Hybrid aus lokaler Sliding-Window-Attention und vollständiger globaler Attention, wobei die letzte Schicht immer global ist. Kolibri verwendet eine 4:1-Aufteilung von Sliding-Window- zu Grouped-Query-Attention über 50 All-MoE-Schichten.
• Kontext — 262.144 Token für Gemma 4 12B; 262.144 nativ für Kolibri, validiert bis 1.048.576 ohne Positionsskalierung.
Die ehrliche Einordnung von „78B gegen 12B“ ist, dass Kolibri bei den Aktivierungskosten gewinnt und beim Gewichts-Footprint verliert, und keiner der beiden Vorteile ist umsonst. Ein spärliches Modell, das pro Token 3,46 Milliarden Parameter aktiviert, muss trotzdem alle 78 Milliarden im Speicher halten, weshalb die Deployment-Untergrenze ein Paar 80-GB-Beschleuniger statt einer einzigen Consumer-Karte ist. Gemma 4 12B geht den umgekehrten Kompromiss ein: Ein größerer Anteil des Modells wird bei jedem Token aktiviert, aber es passt auf Hardware, die man kaufen kann.
Auf der Kolibri-Seite gibt es eine Besonderheit speziell für das Deutsche, die eher die Rechnung als das Ranking verändert. Ihr Tokenizer erreicht nach Aleph Alphas eigenen Messungen im Schnitt 4,90 Bytes pro Token bei deutschem Webtext, gegenüber 4,13 für Gemini, 4,17 für die Qwen3.5–3.8-Familie und 4,35 für GPT-5. Weniger Tokens pro deutschem Dokument bedeuten eine direkte Senkung der Inferenzkosten, und bei einer Arbeitslast, bei der es sich millionenfach um deutsche Verwaltungstexte handelt, kann dieser Effekt mehr wert sein als ein paar Indexpunkte. Außerdem handelt es sich ausschließlich um Angaben des Anbieters.

Was jeder Einzelne tatsächlich sehen kann
Hier ist der Punkt, an dem der Vergleich nicht mehr knapp ist, und dies ist eine Tatsache der Spezifikation, keine Qualitätsaussage. Gemma 4 12B ist ein einheitliches multimodales Modell: Seine Modellkarte beschreibt eine encoderfreie Architektur, die rohe Bild-Patches und Audio-Wellenformen direkt in den Embedding-Raum des Sprachmodells projiziert, mit Text, Bild, Sprache und Video als Eingabe und Text als Ausgabe. Es ist dafür gebaut, auf Consumer-Geräten zu laufen, ohne separate Encoder bereitstellen zu müssen.
Kolibri liest Text, in zwei Sprachen, und sonst nichts. Aleph Alpha rahmt das bewusst als Tiefe statt Breite: zwei Sprachen, stark kuratiert, statt eines breiten mehrsprachigen Mixes. Es gibt keinen Vision-Tower, keinen Audiopfad, kein Video. Wenn zu Ihrem Workload gescannte Formulare, aufgezeichnete Anrufe oder Fotos von Geräten gehören, ist Gemma 4 12B ein Kandidat und Kolibri nicht, egal, was die Benchmark-Zeilen sagen. Wenn Ihr Workload ein Korpus deutscher und englischer Dokumente ist, das niemals das Gebäude verlassen darf, ist das Gegenteil eher zutreffend – aber beachten Sie, dass die Anforderung „das Gebäude nie verlässt“ auch von Gemma 4 12B erfüllt wird, da die Gewichte unter Apache 2.0 stehen und herunterladbar sind.
Was günstiger ist, hängt davon ab, was man kauft.
Die beiden Modelle sind in Währungen bepreist, die sich nicht ineinander umrechnen lassen. Gemma 4 12B hat einen Marktpreis: 0,10 $ und 0,30 $ pro Million Token, gemessen über Anbieter hinweg von Artificial Analysis, und günstiger auf der MoE-Ebene bei gerouteten Endpunkten. Kolibri hat überhaupt keinen Preis, weil Aleph Alpha keine Inferenz dafür verkauft – die Veröffentlichung besteht aus Gewichten, einem technischen Bericht und einer Modellkarte.
• Gemma 4 12B auf einer gehosteten Route — 0,10 $ pro Million Input-Token und 0,30 $ pro Million Output-Token laut den Zahlen von Artificial Analysis. In unserem eigenen Katalog ist das MoE-Schwestermodell Gemma 4 26B-A4B IT mit 0,06 $ für Input und 0,33 $ für Output bei einem 262.144-Token-Fenster gelistet, und das größere dichte Gemma 4 31B IT mit 0,13 $ und 0,38 $; dabei handelt es sich um durchgereichte Listenpreise der Anbieter, die einzige Zahl, zu der wir nichts hinzufügen.
• Kolibri auf eigener Hardware — 78 GB Gewichte, ein vLLM-Plugin aus dem aleph-alpha-inference-Paket des Anbieters und mindestens ein H200 oder B200 oder ein Paar H100 SXM5s. Die Kosten sind eine Kapitalanschaffung, ein Rack-Slot und eine Person, die ein vLLM-Deployment betreiben kann, amortisiert über so viele Tokens, wie Sie generieren.
Das sind nicht dieselben Anschaffungen, und der Vergleich lautet nicht „was billiger ist“. Es geht darum, ob die Workload eine Form hat, die den Besitz der Hardware rechtfertigt. Ein Team, das einen festen, sensiblen Dokumentenkorpus in hohem Volumen verarbeitet, kann auf der Selbsthosting-Seite deutlich besser abschneiden. Ein Team, das eine Produktfunktion entwickelt, die ein Modell ein paar Millionen Tokens pro Tag aufruft, tut das fast nie.
Ein praktischer Mittelweg: Die Gemma-Stufe läuft heute auf OrcaRouter, auf demselben OpenAI-kompatiblen Endpunkt wie alles andere, mit Failover über Anbieter hinweg und dem Listenpreis des Anbieters, der ohne Aufschlag pro Token durchgereicht wird. Das macht es zu einer günstigen Möglichkeit, Ihr tatsächliches Token-Volumen auf einer gehosteten Route zu messen, bevor Sie entscheiden, ob eine souveräne Bereitstellung mit 78 GB gerechtfertigt ist. Es lohnt sich, klar zu sagen, was es nicht ist: Wir routen Kolibri nicht. Wir haben den Katalog unter jeder Schreibweise des Anbieter- und Modellnamens durchsucht, und es ist nicht dort. Self-Hosting ist derzeit die einzige Möglichkeit, es aufzurufen.

Wer sollte welche auswählen?
Die Entscheidungsregel ist kurz genug, um in drei Zeilen formuliert zu werden.
Wählen Sie Gemma 4 12B, wenn Sie etwas anderes als deutschen und englischen Text benötigen, wenn Sie eine gemessene Qualitätskennzahl brauchen, bevor Sie sich festlegen, wenn das Modell auf Hardware laufen muss, die Sie bereits haben, oder wenn Sie lieber Tokens mieten als ein Rack zu besitzen. Es ist das einzige der beiden mit einer unabhängigen Bewertung, einer veröffentlichten Geschwindigkeit und einem Marktpreis.
Wählen Sie Kolibri, wenn Ihre Anforderung ein Reasoning-Modell mit 78 Milliarden Parametern ist, dessen Gewichte, Herkunft der Trainingsdaten, Energieverbrauch und Lizenz alle dokumentiert sind, das innerhalb Ihres eigenen Perimeters eingesetzt wird, mit einem Tokenizer, der für deutsche Verwaltungssprache entwickelt wurde, und einem Enthaltungsverhalten, auf das sich ein regulierter Workflow verlassen kann. Das ist ein enges Ziel, und Aleph Alpha hat bewusst darauf abgezielt.
Wähle keines von beiden aufgrund einer Benchmark-Zeile, die du in einem Launch-Post gesehen hast. Die 14 von Gemma 4 12B ist eine Messung, die jemand anderes vorgenommen hat und die du überprüfen kannst. Kolibris 75,5 ist eine Behauptung, die sein Autor aufgestellt hat, und die einzige Person, die sie derzeit widerlegen kann, ist ein Kunde mit zwei H100s und einem Dokumentenkorpus.
