Eine Hero-Titelkarte mit der Aufschrift 'Kolibri vs MiniCPM5 2B' in großer, fetter Schrift, mit einer einzigen kleineren Zeile darunter, die 'ein servertaugliches Modell gegen einen On-Device-Agenten' lautet, und zwei kleinen flachen Linien-Icons nebeneinander — links ein Kolibri und rechts die Umrisszeichnung eines kleinen Mobilchips — getrennt durch einen dünnen vertikalen Trenner, auf einem weißen Hintergrund mit sanften blau-cyanfarbenen Gradientakzenten und dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Kolibri vs. MiniCPM5-2B: 78 Milliarden Parameter gegen 2,5, und warum das kleine Modell nicht die günstige Option ist

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Setze Kolibrineben MiniCPM5-2Bdie intuitive Lesart ist, dass dies ein Größenvergleich ist und dass das Modell mit 2,5 Milliarden Parametern die wirtschaftliche Wahl ist. Diese Lesart ist auf lehrreiche Weise falsch. Kolibri ist Aleph Alphas Mixture-of-Experts-Modell mit 78,1 Milliarden Parametern, veröffentlicht am 3. Oktober 2026, das pro Token 3,46 Milliarden aktiviert, mit einem FP8-Footprint von etwa 78 GB und einer minimalen Serving-Konfiguration von zwei A100 80 GB Karten. MiniCPM5-2B ist ModelBest und OpenBMBs dichtes Modell mit 2,52 Milliarden Parametern, vorgestellt auf der World Artificial Intelligence Conference am 19. Juli 2026, wobei die Gewichte am 6. September auf Hugging Face veröffentlicht wurden. MiniCPM5-2B ist gemessen an der Parameterzahl einunddreißigmal kleiner. Es ist auch dasjenige, das ein Evaluierungsbudget erfordert, bevor man ihm vertraut, weil seine meistzitierten Zahlen vom Anbieter stammen und nicht reproduziert sind — was genau das Gegenteil dessen ist, was „kleines Modell“ normalerweise in Bezug auf Risiko impliziert.

Beide wurden still und leise veröffentlicht; nur eines davon erst kürzlich

Sie haben ähnliche Entstehungsgeschichten und sehr unterschiedliche Alter, und die Alter sind wichtig. Das Repository von Aleph Alpha für Kolibri wurde am 2. Oktober 2026 erstellt, mit einem angegebenen Veröffentlichungsdatum vom 3. Oktober, und die eigene Newsroom-Ankündigung des Anbieters ging an jenem Morgen raus, am Tag der Deutschen Einheit. Die allgemeine KI-Presse verpasste es am Tag selbst weitgehend, daher stammt die Einordnung als „stille Veröffentlichung“, aber eine Modellkarte, ein technischer Bericht und ein Anbieterbeitrag sind kein stiller Release. MiniCPM5-2B war tatsächlich leiser: Die WAIC-Ankündigung im Juli war eine auf einer Konferenz erfolgte Enthüllung eines Pitches und von Spezifikationen, und die tatsächlichen Gewichte erschienen erst am 6. September, veröffentlicht ohne Launch-Event, zusammen mit GGUF-, MLX-, GPTQ-, Base-, SFT- und Draft-Checkpoints und den dahinterstehenden Trainingskorpora.

Diese fünfwöchige Lücke zwischen Ankündigung und Gewichten sollte man sich merken, denn sie ist der Grund, warum für dieses Modell zwei verschiedene Zahlen kursieren. Das Material vom Juli pries ein 512K-Token-Kontextfenster an. Die ausgelieferte Konfiguration legt 131,072 fest. Das veröffentlichte Artefakt ist das, was zählt.

Wofür jedes Modell eigentlich gedacht ist

Kolibri ist für die Arbeit mit deutschen und englischen Dokumenten gebaut, und Aleph Alpha ist ungewöhnlich genau darin, warum das echte Ingenieursarbeit erforderte. Kleine Experimente mit Proxy-Modellen legten ein Ziel von ungefähr 20 Prozent Deutsch im Trainingsmix fest, was für einen Lauf mit 20 Billionen Token bedeutete, 4 Billionen deutsche Token zu finden. Deduplizierte und gefilterte offene deutsche Datensätze ergaben 390 Milliarden – eine Größenordnung zu wenig –, weshalb das Labor einen Common-Crawl-Filter speziell für Deutsch nachjustierte, was 1,3 Billionen einzigartige organische Token hervorbrachte, und vorhandene deutsche Dokumente in Enzyklopädie-Einträge, Dialoge und Passagen umformulierte, für etwa eine weitere Billion, was zur größten einzelnen deutschen Quelle wurde. Die Übersetzung, die für den Vorgänger Kolibri Origin verwendet wurde, wurde für Kolibri fallengelassen. Das Filterdetail ist das, was man sich merken sollte: Eine Standard-Sprachdaten-Pipeline verwirft Dokumente mit zu vielen langen Wörtern, und deutsche Verwaltungsprosa überschreitet routinemäßig die englische Grenze für die durchschnittliche Wortlänge, sodass Standardeinstellungen still und leise das Sprachregister löschen, in dem die öffentliche Verwaltung schreibt.

MiniCPM5-2B wurde für das andere Ende entwickelt – einen On-Device-Agenten. Die Modellkarte beschreibt einen dichten Transformer mit insgesamt 2,52 Milliarden Parametern, davon 1,98 Milliarden Nicht-Embedding-Parameter, 42 Schichten bei Hidden-Size 2048, Grouped-Query-Attention mit 16 Query-Heads und 2 KV-Heads sowie eine Standard-LlamaForCausalLM-Architektur ohne benutzerdefinierte Kernel. Die Trainingspipeline ist stark agentisch ausgerichtet: Agenten-Midtraining im 200-Milliarden-Maßstab, ein großes Agent-SFT-Set, Agenten-RL-Alignment und eine abschließende On-Policy-Distillation-Stufe, die sechzehn RL-Expertenmodelle wieder in ein kleines dichtes Netzwerk zusammenführt. Das Modell wird mit XML-artigen Tool-Aufrufen und einem integrierten SGLang-Parser ausgeliefert, und seine Konfiguration setzt ein Kontextfenster von 131.072 Token.

• Parameter — Kolibri: 78.103.074.560 gesamt, 3.457.573.120 aktiv, 22,6:1 Sparsity. MiniCPM5-2B: 2.516.756.480 gesamt, 1,98B ohne Embeddings, dense.

• Veröffentlicht — Kolibri: 3. Oktober 2026. MiniCPM5-2B: angekündigt am 19. Juli 2026, Gewichte am 6. September 2026.

• Kontext — Kolibri: 16.384 trainiert, 65.536 mitteltrainiert, 262.144 nativ, 1.048.576 validiert. MiniCPM5-2B: 131.072 in der ausgelieferten Konfiguration; die 512K-Angabe vom Juli ist nicht darin enthalten.

• Footprint — Kolibri: etwa 78 GB in FP8; mindestens zwei A100 80 GB, zwei H100 SXM5, eine H200, eine B200 oder eine B300. MiniCPM5-2B: ein einzelner BF16-Shard, Laptop-Klasse.

• Sprachen — Kolibri: Deutsch und Englisch, bewusst und nichts anderes. MiniCPM5-2B: Englisch und Chinesisch, mit allen veröffentlichten Evaluations-Suites auf Englisch.

• Tool-Aufruf — Kolibri: Hermes-Stil mit einem mitgelieferten vLLM-Parser. MiniCPM5-2B: XML-Stil mit einem SGLang-Parser.

• Lizenz — beide Apache 2.0, beide ohne eine Zusatzklausel zur akzeptablen Nutzung.

A two-column comparison scoreboard titled 'Kolibri vs MiniCPM5 2B'. Left column Kolibri: Parameters 78.1B MoE / 3.46B active, Context 262,144 native / 1M validated, Footprint about 78 GB in FP8, Languages German and English, Tool calling Hermes-style with a vLLM parser, Licence Apache 2.0. Right column MiniCPM5 2B: Parameters 2.52B total / 1.98B non-embedding, Context 131,072 in the shipped config, Footprint a single BF16 shard, laptop-class, Languages English and Chinese, Tool calling XML-style with an SGLang parser, Licence Apache 2.0. A footer line reads 'Kolibri figures vendor-reported; MiniCPM5 2B figures per its model card.' with the OrcaRouter logo in the bottom-right corner.

Die Scoreboards und die dahinter stehende Beschaffung

Für dieses Duo gibt es nirgends eine direkte Vergleichszahl – weder in den Unterlagen des einen noch des anderen Anbieters –, und wir werden nicht aus zwei verschiedenen Testumgebungen eine zusammenbasteln und das dann einen Vergleich nennen. Was die eine und die andere Seite veröffentlichen, sollte sorgfältig getrennt betrachtet werden, weil die beiden Zahlenwerke sehr unterschiedlich viel Beweiskraft haben.

Kolibris Zahlen stammen aus Aleph Alphas eigener Vierzehn-Modell-Vergleichstabelle, ausgeführt auf einem einzigen Harness mit Kolibri bei Reasoning-Aufwand hoch: 75,5 beim englischen Durchschnitt, 70,8 beim deutschen Durchschnitt. Diese Tabelle schmeichelt ihrem Gegenstand nicht — Qwen3.8 27B erzielt 80,2 und 79,9 bei denselben beiden Durchschnitten und führt bei GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified sowie beiden Long-Context-Benchmarks, während es ungefähr ein Achtel von Kolibris Parametern aktiviert. Die Einordnung des Anbieters für diese Lücke ist eine Pareto-Front aus Qualität gegen dekodierte Token pro Sekunde pro GPU, die keines der verglichenen Modelle schlägt. Es ist ein Argument der Serving-Ökonomie, kein Fähigkeitsargument, und kein Dritter hat es gemessen: Es gibt keinen Artificial-Analysis-Eintrag für Kolibri und keine Replikation des Harness.

Die Zahlen von MiniCPM5-2B stammen aus seiner eigenen Karte: ein interner Durchschnitt von 53,9 über ein vom Anbieter ausgewähltes Vergleichsset, AIME 2025/2026 bei 86,5, MATH-500 bei 94,6 und ein vom Anbieter durchgeführter Wert von 46,4 bei SWE-bench Verified, der für ein dichtes Modell mit 2,5 Milliarden Parametern bemerkenswert wäre, wenn es unabhängige Tests übersteht. Auf dieser Karte liegt das Granite 4.2 3B von IBM bei 42,7 gegenüber den 53,9 von MiniCPM5-2B — ein Anbieter, der beide Modelle auf einer von ihm gewählten Suite laufen lässt. Unterschiedliche Suiten, unterschiedliche Test-Harnesses, unterschiedliche Anbieter. Nichts davon ist ein Urteil über diese Paarung.

Was aufseiten von MiniCPM5-2B wirklich nützlich ist, ist die Offenlegung. OpenBMB veröffentlichte die UltraData-Trainingskorpora zusammen mit den Gewichten — Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, die Agenten-SFT- und RL-Sets — alle unter Apache 2.0, was eine Blackbox in ein Rezept verwandelt, das man einsehen und mit dem man auf der eigenen Domäne weitermachen kann. Das Modell wird außerdem mit Day-Zero-Anpassung über neun Chip-Familien hinweg über ModelBests FlagOS-Community ausgeliefert, von Huawei Ascend bis NVIDIA und ARM, was eher eine Deployment- als eine Benchmark-Aussage ist. Demgegenüber veröffentlichte IBM die Gewichte von Granite 4.2 3B und einen detaillierten technischen Bericht über den Aufbau, aber nicht seine Trainingsdaten, und Aleph Alpha veröffentlichte Kolibris Datenpipeline und Energiebilanz — 20 Billionen Pre-Training-Tokens, 9,5×10² MWh einschließlich Rechenzentrums-Overhead und unter Ausschluss von überwachtem Fine-Tuning und Reinforcement Learning —, aber nicht den Korpus selbst.

Wo sich die Größendifferenz tatsächlich zeigt

Die nützlichste Art, diese beiden nebeneinanderzustellen, ist entlang der zwei Achsen, die einen tatsächlichen Einsatz entscheiden: was im Raum vorhanden sein muss und was passiert, wenn das Modell falschliegt.

Auf Hardware gewinnt MiniCPM5-2B – und das mit großem Abstand. Ein dichtes Modell mit 2,52 Milliarden Parametern in einem einzigen BF16-Shard läuft auf einem Laptop, einer Edge-Box oder einer einzelnen Consumer-GPU, und die FlagOS-Unterstützung über neun Chip-Familien bedeutet, dass es auf Hardware läuft, bei der es sich überhaupt nicht um einen NVIDIA-Beschleuniger handelt. Kolibris Mindestanforderung sind zwei A100-80-GB-Karten oder eine B200, rund 78 GB FP8-Gewichte, bereitgestellt über das aleph-alpha-inference-vLLM-Plugin oder den veröffentlichten Container. Für einen Smart-Cockpit- oder telefonnahen Workload ist das 2B das einzige der beiden, das infrage kommt, und Kolibri wurde nie dafür entwickelt, dort zu konkurrieren.

Was die Verifizierbarkeit angeht, gewinnt Kolibri aus einem subtileren Grund. Seine meistzitierte Behauptung – die Serving-Ökonomie – ist ungetestet, aber seine Qualitätswerte werden zumindest gegen dreizehn namentlich genannte Wettbewerber auf einem einzigen Harness veröffentlicht, wobei die Einstellungen offengelegt sind, und die Tabelle des Anbieters selbst überlässt einem Konkurrenten in den meisten Zeilen den Sieg. Die Schlagzeilenwerte von MiniCPM5-2B stammen vom Anbieter und aus der Suite des Anbieters, ohne offengelegten Vergleichs-Harness, und das Modell trägt die zusätzliche Unsicherheit eines Checkpoints, der Wochen statt Tage alt ist. Keines der beiden Modelle wurde unabhängig gebenchmarkt. Der Unterschied ist, dass der eine Anbieter einen Vergleich niedergeschrieben hat, bei dem sein eigenes Modell verliert, und der andere einen, bei dem sein eigenes Modell mit großem Vorsprung gewinnt.

Absichtlich gibt es überhaupt keinen Wettbewerb. Kolibri existiert für die Verarbeitung deutschsprachiger Dokumente im eigenen Haus, mit einem bilingualen Tokenizer, den Aleph Alpha auf deutschem Webtext mit durchschnittlich 4,90 Bytes pro Token angibt – gegenüber 4,35 bei GPT-5 und 3,28 bei Kimi K3 –, alles vom Anbieter gemessen und ein Kosten effekt pro Token statt einer Qualitätsaussage. MiniCPM5-2B existiert für Tool-Calling-Agenten in Englisch und Chinesisch auf leistungsbeschränkter Hardware. Ein Team mit deutschen Verträgen und einer Compliance-Anforderung wählt nicht zwischen ihnen.

A screenshot of the Hugging Face model card for openbmb/MiniCPM5-2B, showing the card header with the OpenBMB organisation and its like count, the TextGeneration, Transformers and Safetensors tags, the English and Chinese language tags, the on-device and tool-calling tags, the Apache 2.0 licence, and the model-size line reading 3B parameters in BF16 tensor type.

Die Routing-Realität und das Experiment, das es wert ist, durchgeführt zu werden

Keines der beiden Modelle steht heute in einem gehosteten Katalog, und wir haben beide überprüft, statt es einfach anzunehmen. Kolibri hat keine Vendor-API-SKU – das Release besteht aus Gewichten, einem technischen Bericht und einem Container-Image – und es ist nicht auf OrcaRouter: Wir haben den Katalog unter jeder Schreibweise des Vendor-Präfixes und des Modellnamens abgefragt, und er liefert „not found“. MiniCPM5-2B hat ebenfalls keinen gehosteten Endpoint von ModelBest, und es ist bei uns nicht geroutet. Beides sind Self-Hosting-Optionen, und wir sagen das lieber, als zu implizieren, dass wir eines von beiden anbieten.

Interessant wird es beim Experiment. Ein agentisches Modell mit 2,5 Milliarden Parametern und ein Dokumentmodell mit 78 Milliarden Parametern lösen unterschiedliche Probleme, und die einzige Möglichkeit herauszufinden, welche Ihre Workload braucht, ist, beide dagegen laufen zu lassen – genau die Situation, für die eine Routing-Schicht gebaut ist, selbst wenn sie keines der beiden Modelle führt. Richten Sie einen Testpfad auf einen selbst gehosteten Build von MiniCPM5-2B über einen OpenAI-kompatiblen Endpunkt mit automatischem Failover, während die Produktion auf einem bewährten gerouteten Modell bleibt, und der neue Stack kann ins Stocken geraten oder Unsinn produzieren, ohne dass dadurch etwas ausfällt. Die Listenpreise der Anbieter für die Modelle, mit denen Sie vergleichen, werden durchgereicht ohne Aufschlag, sodass das A/B günstig und umkehrbar bleibt. Und wenn das Experiment tatsächlich zeigt, dass Ihre deutsche Workload keines der selbst gehosteten Modelle benötigt, erreicht derselbe Schlüssel eine kleine Mixture-of-Experts-Stufe, die bereits geroutet wird – die Variante Gemma 4 26B-A4B zu 0,06 $ pro Million Input-Tokens und 0,33 $ pro Million Output-Tokens, mit einem 262.144-Token-Fenster und Text-, Bild- und Videoeingabe – was der günstigste Weg ist, das herauszufinden, bevor Sie zwei GPUs kaufen.

Welche(r/s), und was würde die Antwort ändern?

Führe MiniCPM5-2B aus, wenn die Einschränkung das Gerät ist. Mit 2,52 Milliarden Parametern ist es das einzige der beiden, das auf einen Laptop, ein Cockpit oder eine Edge-Box passt, und wenn deine Arbeitslast ein interaktiver Tool-Calling-Agent in Englisch oder Chinesisch ist, dann ist das genau das Modell, auf das sie abzielt. Plane Zeit ein, um seine Zahlen zuerst zu reproduzieren – der Durchschnitt von 53,9 und die SWE-bench-Angabe von 46,4 stammen allein von ModelBest, und die Tatsache, dass die Trainingskorpora offen sind, macht diese Reproduktion wirklich möglich statt nur theoretisch.

Verwenden Sie Kolibri, wenn das Korpus deutsch ist, die Hardware vorhanden ist und die Gewichte das Gebäude nicht verlassen dürfen. Ein natives Fenster von 262.144 Token, ein FP8-KV-Cache, vier Stufen des Reasoning-Aufwands und Hermes-Tool-Aufrufe sind die richtige Form für regulierte Dokumentenarbeit, und die Apache-2.0-Bedingungen plus die veröffentlichte Datenpipeline sind der Teil, der eine Beschaffungsprüfung übersteht.

Zwei Dinge würden dies schneller klären als jede Argumentation. Ein unabhängiger SWE-bench-Verified-Durchlauf auf MiniCPM5-2B würde die mit Abstand überraschendste Behauptung, die eine der beiden Modellkarten erhebt, bestätigen oder zu Fall bringen. Und eine unabhängige Durchsatzmessung von Kolibri in seiner empfohlenen Zwei-H100-Konfiguration — oder ein Eintrag bei Artificial Analysis, den es heute nicht gibt — würde „78 Milliarden Parameter“ von einer Spezifikation in eine Kostenangabe verwandeln, und zwar in die Zahl, nach der jeder, der diesen Vergleich gegen Hardware abwägt, tatsächlich sucht. Bis dahin ist der Größenunterschied real, der Unterschied beim Einsatzzweck größer, und die auf den ersten Blick günstige Option ist diejenige, die die unbestätigte Behauptung trägt.

A screenshot of the OrcaRouter model page for google/gemma-4-26b-a4b-it, showing the model header under Google, the 262K-token context badge, the input line reading text plus image plus video, and the community description noting 25.2B total parameters with 3.8B activated per token during inference.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert