Eine Hero-Titelkarte mit der Aufschrift ‚Kolibri vs Intern-Decision 4B‘ in großer fetter Schrift, mit einer einzelnen kleineren Zeile darunter mit der Aufschrift ‚generierter Text gegen eine kalibrierte Wahrscheinlichkeitsverteilung‘ und zwei kleinen flachen Linien-Icons nebeneinander – links ein Kolibri und rechts ein kleines Glockenkurven-Diagramm – getrennt durch einen dünnen vertikalen Trenner, auf weißem Hintergrund mit weichen blau- und cyanfarbenen Farbverlaufsakzenten und dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Kolibri vs. Intern-Decision 4B: Der eine schreibt Dokumente, der andere weigert sich, überhaupt etwas zu schreiben

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Das Nützlichste, was es an Kolibri und Intern-Decision-4B zu bemerken gibt, ist, dass sie nicht dieselbe Art von Objekt sind und dass es ein Kategorienfehler wäre, dies als Modell-gegen-Modell-Vergleich zu behandeln. Kolibri ist das Mixture-of-Experts-Sprachmodell von Aleph Alpha mit 78,1 Milliarden Parametern, veröffentlicht am 3. Oktober 2026, das pro Token 3,46 Milliarden Parameter aktiviert und deutsche und englische Texte schreibt. Intern-Decision-4B ist ein multimodales strukturiertes Entscheidungsmodell mit 4,54 Milliarden Parametern vom InternLM-Team, das am 26. September 2026 auf Hugging Face hochgeladen wurde und dessen Modellkarte unmissverständlich angibt, dass es "weder generate() aufruft noch Freitext sampelt" – und zwar überhaupt nicht. Das eine erzeugt Prosa. Das andere erzeugt in einem einzigen Forward-Pass eine Wahrscheinlichkeitsverteilung über die Optionen, die Sie vorgeben, und ist nicht in der Lage, einen Satz zu schreiben. Sie werden nur in einer einzigen eng gefassten Situation zu Konkurrenten, und genau zu wissen, welche Situation das ist, ist zufällig das Nützlichste in beiden Veröffentlichungen.

Zwei Releases, zwei völlig unterschiedliche lapidare Aussagen

Kolibris Karte ist eine Spezifikation eines großen sparse Sprachmodells: 50 Schichten, jede davon ein Mixture-of-Experts, 384 Experten pro Schicht, einer geteilt und sechs geroutet, ein nativer Kontext von 262.144 Tokens, validiert bis 1.048.576, vier Stufen des Reasoning-Aufwands, Tool-Aufrufe im Hermes-Stil mit einem mitgelieferten vLLM-Parser, FP8-Gewichte in 128×128-Blöcken und Apache-2.0-Bedingungen. Sein Training lief über 20 Billionen Tokens auf 768 NVIDIA B200s verteilt über 21 Tage – 392.000 GPU-Stunden bei berichteten 6,4×10²³ FLOPs und geschätzten 9,5×10² MWh einschließlich Rechenzentrums-Overhead, ohne Supervised Fine-Tuning und Reinforcement Learning. Die minimale Serving-Konfiguration der Karte besteht aus zwei A100-80-GB-Karten, zwei H100 SXM5, einer H200, einer B200 oder einer B300, und der FP8-Fußabdruck beträgt etwa 78 GB. Es ist ein ernstzunehmendes Stück Infrastruktur und beantwortet Fragen, indem es Text generiert.

Intern-Decision-4B ist die entgegengesetzte Art von Objekt, und die Karte ist erfrischend unverblümt darüber. Es ist ein Fine-Tune von Qwen3.5-4B, bei dem der Vision-Tower und der Projektor eingefroren sind und nur das Sprach-Backbone trainiert wird. Man übergibt ihm einen Zustand, ein Schema benannter Fragen und optional bis zu acht Bilder, und es gibt eine Verteilung über die Kandidatenantworten für jede Frage auf einmal zurück. Der Mechanismus ist ungewöhnlich und es lohnt sich, ihn präzise zu benennen: Optionen werden auf Einzel-Token-Symbole abgebildet, die A bis Z, a bis z und 0 bis 9 umfassen — 62 Kandidaten, also maximal 62 Optionen pro Frage —, der Prompt wird mit einem Platzhalter pro Feld gerendert, und das Modell liest Logits an der Position unmittelbar vor jedem Platzhalter. Softmax läuft nur über die erlaubten Symbol-Logits dieses Feldes, eine checkpoint-spezifische Temperatur kalibriert das Ergebnis, und die Symbole werden zurück auf Ihre ursprünglichen Optionswerte als typisiertes JSON abgebildet. Es gibt keine Decodierungsschleife, kein Sampling und keine Prosa.

• Ausgabe — Kolibri: frei generierter deutscher oder englischer Text, Tool-Aufrufe, Reasoning-Traces. Intern-Decision-4B: typisierte JSON-Antworten mit einer Wahrscheinlichkeit pro Option.

• Parameter — Kolibri: 78.103.074.560 insgesamt, 3.457.573.120 aktiv. Intern-Decision-4B: 4,54 Milliarden verteilt auf vier Safetensors-Shards in bfloat16, mit einem eingefrorenen Vision-Tower.

• Eingabe — Kolibri: nur Text. Intern-Decision-4B: Text plus bis zu acht Bilder.

• Fragenkapazität — Intern-Decision-4B: bis zu 62 Optionen pro Feld, in einem einzigen Vorwärtsdurchlauf, mit den Fragetypen 'choice', 'score' und 'noul' (Ja/Nein). Kolibri: im Prinzip unbegrenzt, in der Praxis ein Token nach dem anderen.

• Sprache — Kolibri: Deutsch und Englisch konstruktionsbedingt. Intern-Decision-4B: was auch immer Qwen3.5-4B mitbringt, mit allen veröffentlichten Evaluations-Suites auf Englisch.

• Latenz — Intern-Decision-4B: 44,16 ms Mittelwert, 44,03 ms Median und 44,60 ms P95 pro Query auf einer einzelnen RTX 4090, laut eigener Messung. Kolibri: überhaupt keine veröffentlichte Angabe pro Query.

• Lizenz — beide Apache 2.0; Intern-Decision-4B wird zusammen mit der beibehaltenen Qwen-Lizenzdatei ausgeliefert.

A two-column comparison scoreboard titled 'Kolibri vs Intern-Decision 4B'. Left column Kolibri: Output freely generated text, Parameters 78.1B MoE / 3.46B active, Input text only, Context 262,144 native / 1M validated, Latency none published, Licence Apache 2.0. Right column Intern-Decision 4B: Output typed JSON with a probability per option, Parameters 4.54B bfloat16 with a frozen vision tower, Input text plus up to eight images, Options up to 62 per field in one forward pass, Latency 44.16 ms mean on one RTX 4090, Licence Apache 2.0. A footer line reads 'Kolibri figures vendor-reported; Intern-Decision 4B figures per its model card.' with the OrcaRouter logo in the bottom-right corner.

Warum es überhaupt einen 4B-Scorer gibt

Das Argument für Intern-Decision-4B ist nicht, dass es klein ist. Es ist, dass es nicht dasselbe ist, ein großes generatives Modell nach einer Wahrscheinlichkeit zu fragen, wie eine zu messen, und der Unterschied ist messbar.

Die Benchmark-Tabelle der Modellkarte selbst untermauert das Argument mit einem ungewöhnlich hohen Maß an Selbstauskunft. Über sieben Genauigkeits-Suites hinweg erreicht Intern-Decision-4B einen Durchschnitt von 90,02 – gegenüber 88,74 für die stärkste Baseline, mit der es sich vergleicht, ein Modell namens Jev. Doch die Genauigkeit ist die uninteressante Hälfte. Die Tabelle weist außerdem den Brier-Score und den Expected Calibration Error aus, und dort ist das Bild strenger. Intern-Decision-4B verzeichnet einen Brier-Wert von 0,347 und einen ECE von 0,065 – gegenüber 0,358 und 0,095 bei Jev. Bei den kleineren Geschwistern wird die Kalibrierungsgeschichte erst wirklich aufschlussreich. Intern-Decision-2B erzielt im Durchschnitt 84,68 und liegt damit deutlich vor dem 0,8B-Modell mit 79,38 – und dennoch ist sein ECE von 0,100 schlechter als der 0,066 des 0,8B-Modells und schlechter als der 0,065 des 4B-Modells, bei einem Brier-Wert von 0,437 gegenüber 0,530 beim 0,8B-Modell. Das genauere der beiden kleinen Modelle ist am wenigsten ehrlich, was sein eigenes Vertrauen angeht. Wenn man angenommen hätte, dass sich die Kalibrierung mit der Genauigkeit oder mit der Parameterzahl verbessert, dann ist diese Tabelle in beiderlei Hinsicht das Gegenbeispiel.

Ein zweites, separates Diagnoseverfahren umfasst 96 Fälle, die mit exakten Referenzverteilungen statt mit gesampelten harten Labels konstruiert wurden – Zufallsziehungen, zusammengesetzte Ereignisse, bedingte Historie, Wahrscheinlichkeitsrätsel. Der Fehler des 4B-Modells in diesem Pilotversuch sank bei der berichteten Metrik von 0,628 auf 0,550, während das Vergleichsmodell bei 0,595 lag. Die Modellkarte stellt ausdrücklich klar, dass dieser Pilotversuch nicht dazu verwendet wurde, die veröffentlichte Temperatur zu fitten oder auszuwählen; die Temperatur des 4B-Modells von 1,992418 wurde separat auf einem Kalibrierungssatz gefittet. Das InternLM-Team hat außerdem den Benchmark selbst in das GitHub-Repository eingestellt – den deterministischen Generator, die Referenzen und den Offline-Scorer –, was bedeutet, dass die Kalibrierungsbehauptung zu der seltenen Sorte gehört, die ein Dritter tatsächlich erneut ausführen kann, statt sie einfach zu glauben.

Nichts im Release von Kolibri bietet ein Äquivalent. Die darin enthaltene Vergleichstabelle gibt die Aufgaben-Genauigkeit über vierzehn Modelle auf einem einzigen Anbieter-Harness an, und Genauigkeit ist das, woran ein generatives Modell gemessen werden kann. Es gibt keinen Kalibrierungswert, keinen Brier- oder ECE-Wert irgendwo im Material, und keine Möglichkeit, es nach „der Wahrscheinlichkeit, dass diese Vertragsklausel durchsetzbar ist“ zu fragen, ohne einen Satz zu samplen und ihn zu lesen.

Die eine Naht, an der sie tatsächlich aufeinandertreffen

Stellen Sie die beiden in einer echten Pipeline nebeneinander, und die Formen werden offensichtlich. Ein deutscher Dokumenten-Workflow braucht beide Hälften, und keines der Werkzeuge deckt die Hälfte des anderen ab.

Kolibri ist die Hälfte, die liest und schreibt. Ein Team mit deutschen Verträgen oder technischer Dokumentation bekommt ein natives Fenster von 262.144 Token, einen FP8-KV-Cache, einen bilingualen Tokenizer, für den Aleph Alpha 4,90 durchschnittliche Bytes pro Token auf deutschem Webtext angibt, und Hermes-Tool-Aufrufe – will sagen: ein Modell, das eine Akte zusammenfassen, eine Antwort entwerfen und eine Tool-Schleife steuern kann. Was es nicht kann, ist, Ihnen sein eigenes Vertrauen auf eine Weise mitzuteilen, die sich überprüfen lässt, denn alles, was es ausgibt, ist eine gesampelte Zeichenkette.

Intern-Decision-4B ist die Hälfte, die entscheidet. Ausgehend von einer Seite deutschen Textes und einer festen Menge von Optionen liefert es eine kalibrierte Verteilung in 44 Millisekunden auf einer einzigen Consumer-GPU, ohne Generierungsschritt und daher ganz ohne Sampling-Varianz. Was es nicht kann, ist, den deutschen Text überhaupt erst zu erzeugen, und seine veröffentlichten Evaluations-Suites sind englisch — sein deutsches Verhalten ist vom Qwen3.5-4B-Basismodell geerbt, statt dafür trainiert zu sein, was eine echte Einschränkung für einen deutschsprachigen Einsatz darstellt und eine, die niemand evaluiert hat.

Die ehrliche technische Antwort für einen regulierten deutschsprachigen Workflow ist, dass es sich um zwei Stufen einer Pipeline handelt, nicht um zwei Kandidaten für einen Platz. Die praktische Frage ist, wo jede einzelne läuft. Kolibri braucht zwei H100s oder eine B200 und etwa 78 GB. Intern-Decision-4B braucht eine RTX 4090 und beantwortet eine Anfrage in unter 45 Millisekunden. Die Kostenasymmetrie beträgt bei der Hardware grob zwei Größenordnungen, und sie deutet auf ein Design hin, bei dem ein kleiner Scorer kontinuierlich bei jedem Fall läuft und der große Generator nur dann aufgerufen wird, wenn ein Fall tatsächlich Prosa benötigt. Das ist eine günstigere und auditfreundlichere Form, als jeden Fall durch das 78B-Modell zu leiten, um eine Antwort zu bekommen, die man anschließend interpretieren muss.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-4B, showing the card header, the description of it as a multimodal structured decision model fine-tuned from Qwen3.5-4B that returns an answer distribution in one forward pass, and the numbered 'How inference works' steps mapping each question's options to single-token symbols.

Die Hosting-Realität für beide und was die Ebene ist

Keines der beiden Modelle ist als gehostete API verfügbar, und wir haben nachgeprüft, statt es anzunehmen. Intern-Decision-4B hat keinen Anbieter-Endpunkt; das Release umfasst Gewichte, ein GitHub-Repository und einen Hugging Face Space. Seine Download- und Like-Zahlen haben sich seit Mitte der Woche verändert, was zeigt, dass Leute es aufgreifen, aber es gibt weiterhin keine kostenpflichtige aufrufbare Route an einer Stelle, die wir nennen würden.

Kolibri hat ebenfalls keine SKU für die Aleph Alpha API – das Release besteht aus Gewichten, einem technischen Bericht und einem Container-Image unter ghcr.io/aleph-alpha/aleph-alpha-inference. Und es ist nicht auf OrcaRouter zu finden: Wir haben den Katalog unter jeder Schreibweise des Herstellerpräfixes und des Modellnamens durchsucht, und er meldet „not found“ zurück, was wir lieber sagen, als etwas anderes anzudeuten.

Was eine Routing-Schicht hier ändert, ist nicht der Zugang zu diesen beiden Modellen, sondern die Wirtschaftlichkeit der Entscheidung, ob man für eines von beiden die Hardware kauft. Der ehrliche Test vor dem Kauf für die generative Hälfte besteht darin, die Workload gegen eine kleine Mixture-of-Experts-Stufe laufen zu lassen, die bereits geroutet wird – die Variante Gemma 4 26B-A4B zu 0,06 $ pro Million Input-Tokens und 0,33 $ pro Million Output bei einem Fenster von 262.144 Tokens und Text-, Bild- und Videoeingabe – über einen OpenAI-kompatiblen Schlüssel zum Listenpreis des Anbieters ohne Aufschlag, und zu sehen, ob die Workload mit deutschen Dokumenten wirklich 78 Milliarden Parameter braucht, bevor die GPUs bestellt werden. Für die Entscheidungshälfte gibt es keine solche Abkürzung, denn das kalibrierte Verteilungsverhalten ist der ganze Sinn des Modells, und keine geroutete Stufe leistet das. Aber genau das ist der Befund: Er sagt Ihnen, dass der 4B-Scorer der Teil ist, den Sie wirklich selbst hosten werden, und der Generator der Teil, den es sich lohnt, gegen etwas zu testen, das Sie heute Nachmittag mieten können.

Was würde es klären

Zwei Messungen, und keine von beiden existiert bisher.

Das erste ist Intern-Decision-4B bei deutscher Eingabe. Jede veröffentlichte Suite ist englisch, und das Modell ist ein Fine-Tuning eines mehrsprachigen Basismodells, daher ist seine deutsche Kalibrierung unbekannt – und Kalibrierung ist genau die Eigenschaft, die sich nicht von selbst über Sprachen hinweg überträgt. Eine deutsche Version des Verteilungs-Piloten mit 96 Fällen wäre das informativste Artefakt, das jemand über dieses Modell veröffentlichen könnte.

Der zweite Punkt sind Kolibris Kosten pro Entscheidung. Seine Behauptung zur Serving-Ökonomie ist eine Pareto-Front von Qualität gegenüber dekodierten Tokens pro Sekunde pro GPU, und es gibt weder eine Artificial-Analysis-Seite für Kolibri noch eine Replikation des Harness durch Dritte. Bis jemand es laufen lässt, sind „78 Milliarden Parameter“ eine Spezifikation statt eines Kostenwerts, und die Begründung dafür, einen 44-Millisekunden-Scorer davor zu behalten, bleibt eine Design-Überlegung statt einer gemessenen Überlegung.

Bis dahin sollte man diese Paarung nicht als Wettstreit lesen. Intern-Decision-4B ist die technisch interessantere der beiden Veröffentlichungen, denn kalibrierungsbewusste strukturierte Ausgabe ist eine Fähigkeit, die fast kein generatives Modell bietet, und die zugehörige Modellkarte erlaubt es, die Behauptung zu überprüfen. Kolibri ist die folgenreichere Veröffentlichung, denn dass ein europäisches Labor ein Modell unter Apache 2.0 mit 78 Milliarden Parametern ausliefert und die Datenpipeline daneben veröffentlicht, ist ein Ereignis für die Lieferkette und nicht bloß ein Modellereignis. Keines ersetzt das andere. Teams, die beides brauchen, sollten beides einplanen und die Hardware entsprechend dimensionieren, und die Testumgebung um sie herum ist der Punkt, an dem die eigentliche Ingenieursarbeit steckt.

A screenshot of the InternLM 'Intern Large Models' organisation page on Hugging Face, showing the organisation header, its stated affiliation with Shanghai AI Laboratory, and a recent-activity feed listing models published within the last hour.