Eine Hero-Titelkarte mit der Aufschrift „Intern-Decision-0.8B vs Gemma 4 12B“ und dem Untertitel „Einer schreibt eine Antwort, der andere bewertet sie“, versehen mit den Badges „0,8B Scoring-Head, keine Output-Tokens“ und „11,95B multimodaler Generalist“, mit dem in die Ecke eingefügten OrcaRouter-Logo.
Guides & Insights

Intern-Decision-0.8B vs. Gemma 4 12B: Ein Bewertungskopf gegen einen multimodalen Generalisten

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Der günstigste Weg zu erkennen, was Intern-Decision-0.8B ist – und was es nicht ist –, besteht darin, es neben Gemma 4 12B zu stellen und dann festzustellen, dass es bei diesem Vergleich fast ausschließlich darum geht, was jedes Modell mit seiner Ausgabeschicht macht. Gemma 4 12B, DeepMinds encoderfreies multimodales Modell mit 11,95 Milliarden Parametern, das am 3. Juni 2026 unter Apache 2.0 veröffentlicht wurde, ist ein generativer Generalist: Man gibt ihm Text, Bilder, Audio oder Video, und es schreibt eine Antwort. Intern-Decision-0.8B, am 26. September 2026 ohne Ankündigung still von InternLM auf Hugging Face hochgeladen, ist ein Fine-Tuning des viel kleineren Qwen3.5-0.8B, das überhaupt keinen Text erzeugt – es nimmt einen Zustand, ein Schema benannter Fragen und bis zu acht Bilder entgegen und liefert nach einem einzigen Forward-Pass eine kalibrierte Wahrscheinlichkeitsverteilung für jede Frage. Das eine schreibt. Das andere bewertet. Alles Folgende ergibt sich daraus.

Das macht dieses Aufeinandertreffen zu einem seltsamen Duell, wenn man es als Wettstreit darstellen will, und es lohnt sich, vor den Spec-Zeilen klar zu sagen: Diese beiden sind keine Substitute füreinander, und wer zwischen ihnen wählt, hat das Problem bereits falsch formuliert. Gemma 4 12B beantwortet die Frage „Wie sollte die Antwort lauten?“ Intern-Decision-0.8B beantwortet die Frage „Welche dieser sechzehn Optionen ist es, und wie sicher bist du?“ – und beantwortet sie ohne Decoder-Schleife, woraus die Unterschiede bei Latenz und Kosten stammen. Der nützliche Vergleich dreht sich daher darum, wie man jede in einen Workflow einbindet, nicht darum, welche gewinnt.

Der größte einzelne Unterschied ist die Ausgabeseite der Rechnung

Gemma 4 12B wird wie jedes generative Modell abgerechnet: Eingabe-Tokens und Ausgabe-Tokens, beides. Wenn man es um strukturiertes JSON bittet, wird jedes einzelne dieser Tokens generiert, gesampelt und abgerechnet, und je länger und tiefer verschachtelt das Schema ist, desto mehr davon fallen an. Das ist keine Kritik am Modell – es ist das, was ein Decoder tut –, aber es ist der Rechnungsposten, den Decision-Heads beseitigen sollen. Intern-Decision-0.8B hat keine Ausgabe-Tokens. Seine Modellkarte sagt explizit, warum: Der Inferenzpfad ruft nie generate()/, liest Logits an den Positionen unmittelbar vor jedem <decision>/ Platzhalter in einem vorgerenderten Skelett und führt ein Softmax nur über die zulässigen Kandidatensymbole für dieses Feld durch. Der Nutzungszähler namens output_tokens/ zählt bewertete Felder, nicht Text.

Die Konsequenz potenziert sich im großen Maßstab. Eine Pipeline, die zehntausend Datensätze mit Gemma 4 12B labelt, bezahlt für zehntausend JSON-Dokumente; dieselbe Pipeline auf Intern-Decision-0.8B bezahlt für die Prompts und sonst nichts. Ob die absolute Zahl groß ist, hängt ganz von Ihrem Volumen und Schema ab, und wer ein Budget pro Token hat, kann das in zehn Minuten in einer Tabellenkalkulation ausrechnen. Aber die Richtung ist unstrittig, und sie ist der Grund, warum überhaupt eine Kategorie kleiner Entscheidungsmodelle entstanden ist.

Latenz und warum die Parameterlücke irreführend ist

• Durchsatzmodell — Intern-Decision-0.8B: ein Vorwärtsdurchlauf, keine Decodierungsschleife. Gemma 4 12B: autoregressive Generierung, ein Token nach dem anderen.

• Gemessene Latenz — Intern-Decision-0.8B: 33,98 ms Mittelwert / 37,50 ms p95 auf einer einzelnen RTX 4090 über den lokalen Hugging-Face-Pfad, laut InternLMs eigener Messung. Gemma 4 12B: Es gibt keinen vergleichbaren Single-Pass-Wert, da es keinen einzelnen Durchlauf zu messen gibt.

• Speicherbedarf — Intern-Decision-0.8B: etwa 1,73 GB Repository-Speicher, 852.985.920 Parameter verteilt auf einen 1,50 GB großen Sprach-Shard, einen 176 MB großen Vision-Shard und einen 25 MB großen Projektor. Gemma 4 12B: Googles Launch-Materialien geben 16 GB VRAM oder Unified Memory an.

• Determinismus der Ausgabe — Intern-Decision-0.8B: Argmax über Kandidaten-Logits, sodass dieselbe Eingabe jedes Mal dasselbe Label liefert. Gemma 4 12B: Sampling, es sei denn, Sie setzen die Temperatur auf null fest, und selbst dann kommt das Label als Text an, den Sie parsen müssen.

Die 14-fache Parameterlücke zwischen diesen beiden Modellen schlägt sich keineswegs in einer 14-fachen Laufzeitlücke bei einer Entscheidungsaufgabe nieder, denn die Arbeit ist grundlegend anderer Art. Intern-Decision-0.8B verbringt seinen einen Durchlauf damit, den Prompt zu lesen — den State, das Schema, die Optionsbeschreibungen — und hört dann auf. Gemma 4 12B verbringt dasselbe Prompt-Lesen und hängt dann jedes Token der Antwort obendrauf. Bei einem Schema mit sechzehn Feldern und beschreibenden Optionsbezeichnungen ist der Generierungsteil kein Rundungsfehler; er macht den Großteil der Wall-Clock-Zeit aus. InternLMs eigene Tabelle belegt das versehentlich: Der 2B-Ableger erzielt einen Mittelwert von 33,28 ms und ist damit geringfügig schneller als die 33,98 ms des 0.8B. Wenn die Prompt-Verarbeitung dominiert, ist die Parameteranzahl nicht mehr der Hebel.img src="2.png">

A two-column scoreboard comparing Intern-Decision-0.8B with Gemma 4 12B on six shared rows: parameters 852,985,920 against 11.95B, output tokens none because logits are read rather than generated against every token generated and billed, latency 33.98 ms mean and 37.50 ms p95 against no comparable single-pass figure, input surface text plus up to eight images under an 8,192-token ceiling against text, image, audio and video with a 256K context, published evidence a vendor table unreproduced against Google's own evaluation card, and licence Apache 2.0 plus LICENSE-QWEN against Apache 2.0 under Gemma 4 terms.

Wo Gemma 4 12B einfach eine andere Kategorie ist.

Es wäre unehrlich, das Datenblatt bei der Rahmung als Entscheidungsaufgabe zu belassen, denn außerhalb dieser Rahmung ist Gemma 4 12B nicht nur voraus – es spielt in einer anderen Sportart.

Intern-Decision-0.8B akzeptiert Text plus bis zu acht Bilder, und das ist die gesamte Eingabeoberfläche. Seine standardmäßige Eingabeobergrenze liegt bei 8.192 Tokens, die eher zurückgewiesen als abgeschnitten werden, was deutlich unter der maximalen Positions-Embedding von 262.144 liegt, die seine Konfiguration angibt — die Obergrenze, nicht die Architektur, ist das praktische Fenster. Gemma 4 12B nimmt Text, Bild, Audio und Video nativ über ein encoderfreies Design auf, das rohe Patches und Wellenformen direkt in den Embedding-Raum projiziert, hält ein Kontextfenster von 256K und gibt Text zurück. Googles veröffentlichte Karte bewertet es mit 77,2 % auf MMLU Pro, 77,5 % auf AIME 2026 ohne Werkzeuge, 72,0 % auf LiveCodeBench v6, 78,8 % auf GPQA Diamond, 69,1 % auf MMMU Pro und 79,7 % auf MATH-Vision. Das sind Herstellerangaben aus Googles eigener Evaluierungskarte, und anders als die Tabelle von Intern-Decision-0.8B haben sie ein Jahr der Nutzung durch Dritte hinter sich, weil Gemma 4 von Anfang an in ein Ökosystem ausgeliefert wurde — LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang, Unsloth.

Die Releases sehen ebenfalls völlig unterschiedlich aus, und der Kontrast ist lehrreich. Gemma 4 12B hatte am Tag seines Erscheinens einen Launch-Blog, einen technischen Bericht auf arXiv, eine Seite für die Modellfamilie mit fünf Modellen, eine Evaluation Card und einen Download-Link. Intern-Decision-0.8B hatte eine Model Card mit einer GitHub-URL, die 404 zurückgibt, und einem Demo-Space, der 401 zurückgibt, und es erschien innerhalb von vierzig Sekunden nach zwei größeren Geschwistermodellen, die ebenso undokumentiert sind. Eines davon ist ein Produkt. Das andere ist ein Checkpoint, den jemand beschlossen hat, ins Internet zu stellen.

Beide sind Apache 2.0, und das ist keine triviale gemeinsame Zeile.

Die einzige Dimension, in der sich die beiden wirklich treffen, ist die Lizenzierung, und sie ist einen Absatz wert, denn hier ändert sich die Entscheidung für kommerzielle Nutzer. Beide stehen unter Apache 2.0. Gemma 4 12B wird unter den bei Google gehosteten Lizenzbedingungen von Gemma 4 ausgeliefert, die die Modellkarte als Apache 2.0 ausweist; Intern-Decision-0.8B führt Apache-2.0 zusammen mit einer zweiten LICENSE-QWEN/ Datei, was der korrekte Umgang für ein von Qwen-Gewichten abgeleitetes Modell ist und ein Signal dafür, dass InternLM die Formalitäten erledigt hat – selbst für eine Veröffentlichung, die es nicht angekündigt hat.

Das unterscheidet beide von der LFM2.5-Familie von Liquid AI, deren LFM Open License v1.0 die kommerziellen Rechte daran knüpft, dass Ihre juristische Person unter einer jährlichen Umsatzschwelle von 10 Millionen US-Dollar bleibt – eine echte Einschränkung, die ein Käufer von Entscheidungsmodellen, der Optionen vergleicht, lesen sollte, bevor er annimmt, dass „offene Gewichte“ überall dasselbe bedeuten. Wenn Ihr Anwendungsfall kommerziell ist und Ihr Umsatz diese Grenze überschreitet, sind Apache 2.0 und die LFM-Lizenz nicht austauschbar, und weder Gemma 4 12B noch Intern-Decision-0.8B unterliegen dieser Einschränkung.

Die ehrliche Bilanz zu den Zahlen von Intern-Decision-0.8B

Alle Leistungsangaben zu Intern-Decision-0.8B stammen vom Anbieter und wurden nicht reproduziert. Das ist keine Formsache – es ist der aktuelle Stand der Belege, und er sollte bestimmen, wie viel Gewicht die Tabelle haben darf. InternLM hat die Benchmarks ausgewählt, die Konkurrenten ausgewählt, die Evaluierungen durchgeführt und die Ergebnisse veröffentlicht, und es gibt keinen unabhängigen Durchlauf auf irgendeinem öffentlichen Leaderboard. Eine Abfrage bei Artificial Analysis zu dem Modell liefert gar nichts.img src="3.png">

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

Mit diesem Label versehen, ist die Form des Ergebnisses noch immer aussagekräftig. Das 0.8B erzielt 77,35 im Typed-Decision-Benchmark von TypeSafe gegenüber 73,35 für Jev 1.13 – das Modell, nach dem der Benchmark benannt ist – und 94,52 bei ToolACE gegenüber 91,29. Im Durchschnitt erreicht es 79,38 über die Suite hinweg, während seine eigenen 2B- und 4B-Geschwister bei 84,68 und 90,02 liegen. Die Spalte, die einen Käufer stutzig machen sollte, ist WildJailBreak, wo es 64,48 gegenüber Jevs 96,29 erzielt: Eine derart große Lücke bei der Verweigerungsrobustheit ist eine Eigenschaft des Fine-Tunings, und ob sie vom Qwen3.5-0.8B-Basismodell, vom Decision-Tuning-Ziel oder von der Parameteranzahl herrührt, ist nirgends dokumentiert. Sein Kalibrierungsprofil ist die interessantere Lesart – ein Brier-Wert von 0,530 und ein erwarteter Kalibrierungsfehler von 0,066 gegenüber Jevs 0,358 und 0,095 –, was bedeutet, dass es insgesamt weniger genau ist, seine angegebenen Konfidenzen aber enger mit seiner Genauigkeit übereinstimmen. Für einen schwellenwertbasierten Workflow ist dieser Unterschied wichtiger als die reine Genauigkeit, und es ist die Art von Sache, zu deren Veröffentlichung InternLM keinen Anreiz hatte.

Dem steht gegenüber, dass auch die Evaluationskarte von Gemma 4 12B vom Anbieter stammt – Google hat diese Benchmarks ebenfalls durchgeführt –, doch sie ist seit Juni öffentlich verfügbar, wurde über jede wichtige lokale Runtime bereitgestellt, und jede Abweichung wäre ans Licht gekommen. Die Beweislücke zwischen „eine Woche lang nicht reproduziert“ und „vier Monate lang nicht reproduziert, und niemand hat dem widersprochen“ ist der eigentliche Unterschied zwischen diesen beiden Spalten.

Wie Sie sie tatsächlich kombinieren würden

Das Muster, das Sinn ergibt, ist keine Wahl. Ein Decision Head übernimmt die strukturierten Aufrufe – Routing, Triage, Klassifizierung, Bewertung anhand eines Rubrics –, bei denen die Antwortmenge geschlossen ist, Latenz zählt und Output-Tokens reiner Overhead sind. Ein Generalist übernimmt alles, was Prosa, Code, Synthese oder langen Kontext erfordert: die Eskalationszusammenfassung, die Erklärung, warum das Ticket an die Abrechnung ging, den Entwurf, den ein Mensch bearbeitet.

Wenn Sie herausfinden wollen, wo die Grenze liegt, ist das günstigste Experiment, beide Hälften hinter einen einzigen Endpunkt zu stellen. OrcaRouter leitet über 200 Modelle über eine einzige OpenAI-kompatible API mit automatischem Failover und durchgereichter Anbieterliste ohne Aufschlag, was bedeutet, dass das Testen eines gehosteten Entscheidungsmodells und eines gehosteten Generalisten im selben Skript nur einen Schlüssel und einen Nachmittag kostet. An dieser Stelle lohnt es sich, präzise zu sein: Intern-Decision-0.8B ist keines von unseren – es ist ein Apache-2.0-Checkpoint, den Sie selbst herunterladen und ausführen, und der ganze Grund, ein 1,73 GB großes Modell zu wählen, ist, dass es dort lebt, wo Ihre Daten bereits sind. Die generative Hälfte des Musters ist der Teil, der nur eine Zeile entfernt ist. Was speziell Gemma 4 12B betrifft, ist es ebenfalls nicht in unserem Katalog; die Gemma-4-Größen, die wir anbieten, sind 31B und 26B A4B, und das 12B ist ein lokaler Download. img src="4.png">

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

Das Urteil ist somit kein Sieger. Intern-Decision-0.8B ist ein billiger, schneller, deterministischer Scoring-Head aus einem Labor, das ihn noch nicht erklärt hat, mit einer Benchmark-Tabelle, die niemand reproduziert hat, und einer Spalte zur Ablehnungsrobustheit, die getestet werden sollte, bevor er in die Nähe nicht vertrauenswürdiger Eingaben gerät. Gemma 4 12B ist ein ausgereifter multimodaler Open-Weights-Generalist mit einer veröffentlichten Modellkarte, einem technischen Bericht und vierzehnmal so vielen Parametern, und es ist das falsche Werkzeug für einen Klassifizierungsaufruf mit sechzehn Feldern – nicht weil es schlechter ist, sondern weil eine Antwort auf eine Frage zu generieren, deren Antwortmenge man bereits aufgeschrieben hat, eine teure Art ist, ein Label zu bekommen.