Eine generierte Titelkarte mit der Aufschrift „Intern-Decision-2B vs Gemma 4 12B", untertitelt mit „8.192 Token gegen 256.000", mit den Badges „ein Scorer, der sich weigert" und „ein Generalist, der schreibt", mit dem in die Ecke eingefügten OrcaRouter-Logo.
Guides & Insights

Intern-Decision-2B vs. Gemma 4 12B: Eine 8.192-Token-Obergrenze gegenüber einem 256K-Fenster

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Angenommen, die Sache, die beurteilt werden soll, ist eine vierzigseitige Akte zu einem Versicherungsanspruch. internlm/Intern-Decision-2B wird sie ablehnen. Nicht abschneiden, nicht zusammenfassen – ablehnen, weil die mitgelieferte Inferenz-Engine DecisionEngine(max_length=8192) deklariert und die Modellkarte in klaren Worten sagt, dass übergroße Eingaben „ohne Kürzung zurückgewiesen" werden. google/gemma-4-12B-it – Gemma 4 12B Unified – nimmt dasselbe Dokument, dazu die daran gehefteten eingescannten Fotos und den aufgezeichneten Telefonanruf, und schreibt Ihnen eine Antwort. Dieser Gegensatz ist der ganze Vergleich, und er hat fast nichts mit den Parameterzahlen zu tun – 2.213.241.664 gegenüber 11.959.730.224 –, die eine Lektüre des Datenblatts an die erste Stelle setzen würde.

Intern-Decision-2B ist der mittlere von drei Entscheidungs-Checkpoints, die InternLM am 26. September 2026 ohne Ankündigung auf Hugging Face hochgeladen hat, feinabgestimmt aus Qwen/Qwen3.5-2B und unter Apache-2.0 lizenziert, wobei die Qwen-Bedingungen daneben beibehalten wurden. Gemma 4 12B Unified ist Google DeepMinds encoderfreies multimodales Modell vom Mai 2026, ein Any-to-Any-System, das Text, Bild, Audio und Video entgegennimmt und Text über ein Fenster von 256.000 Token in über 140 Sprachen generiert. Eines davon ist ein Scorer. Das andere ist ein Generalist, der zufällig schlecht bewerten kann, wenn man ihn sorgfältig promptet. Die Entscheidung zwischen ihnen ist weniger eine Benchmark-Frage als eine Frage danach, welche Form deine Antwort bereits hat.

Wo die beiden nicht wirklich vergleichbar sind

Es ist angebracht, dies vor den Zahlen unverblümt zu sagen, denn die Paarung verleitet zu einer falschen Symmetrie.

Intern-Decision-2B erzeugt keine Tokens. Es nimmt einen Zustand, ein bis sechzehn benannte Fragen mit jeweils bis zu 62 Optionen und optional bis zu acht Bilder entgegen; rendert ein Assistant-JSON-Skelett mit einem <decision>-Platzhalter pro Feld; führt einen einzelnen kausalen Forward-Pass aus; liest Logits an der Position unmittelbar vor jedem Platzhalter aus; wendet Softmax ausschließlich auf die zulässigen Symbole des jeweiligen Felds an; und wendet eine angepasste Temperatur von 2,100509348278 an. Die Ausgabe ist eine kalibrierte Verteilung und ein Argmax pro Feld. Die Karte benennt das Negative unmissverständlich: „Diese API führt strukturierte Kandidatenbewertung durch. Sie ruft generate() nicht auf und sampelt keinen frei formulierten Text.“

Gemma 4 12B generiert. Alles, was es tut – Reasoning mit konfigurierbarem Denken, Funktionsaufrufe, OCR, Diagrammverständnis, Spracherkennung, Abdeckung von 140 Sprachen – läuft über eine Dekodierungsschleife über ein Vokabular mit 262.144 Einträgen. Bittet man es um eine Routing-Entscheidung mit Wahrscheinlichkeiten, erhält man Prosa, die eine Zahl enthält, und die Zahl ist das, was der Sampler erzeugt hat, nicht ein Softmax über die eigene Optionsmenge.

Die praktische Frage ist also nicht „Welches ist genauer?“, sondern „Ist meine Antwort bereits eine geschlossene Menge?“ Wenn ja, ist das 12B eine verschwenderische Art, aus einer Liste auszuwählen. Wenn nicht, kann Intern-Decision-2B Ihnen überhaupt nicht helfen – unabhängig von der Genauigkeit.

Die Eingabeobergrenze ist die schärfste Trennlinie zwischen ihnen.

Hier ist die Dimension, die über allen anderen abzuwägen ist, denn sie erzeugt harte Fehler und nicht bloß degradierte.

• Eingabelänge — Intern-Decision-2B akzeptiert 8.192 Token und lehnt alles Längere lautstark ab; Gemma 4 12B akzeptiert 256.000 Token und erzielt auf Googles eigener Modellkarte 43,4 % bei MRCR v2 Eight-Needle bei 128k.

• Bilder — bis zu acht für Intern-Decision-2B, und sie werden auf dasselbe 8.192-Token-Budget angerechnet; variable Seitenverhältnisse und Auflösungen für Gemma 4 12B, mit verschachtelter Text- und Bildeingabe in beliebiger Reihenfolge.

• Eingangsmodalitäten — Text und Bild für das eine; Text, Bild, Audio und Video für das andere.

• Sprache — in der Intern-Decision-Dokumentation wird nirgends ein Anspruch auf Mehrsprachigkeit erhoben; Gemma 4 deckt über 140 vortrainierte Sprachen ab und erzielt mit der 12B-Version einen bewerteten Mehrsprachigkeitswert von 83,4 auf MMMLU.

• Ausgabe — eine typisierte JSON-Antwortverteilung für das eine; generierter Text für das andere.

Das Limit von 8.192 ist nicht willkürlich, und genau das macht es schwer, es zu umgehen. Das Entscheidungsziel liest ein Logit an einer festen Position pro Feld, daher muss der Prompt den Zustand, das Schema und das vollständige Gerüst in einem Durchgang enthalten; es gibt keine Chunking-Strategie, die den Vertrag wahrt. Ein Ticket, eine E-Mail, ein kurzer JSON-Zustand, ein oder zwei Screenshots – das ist das Designzentrum. Ein Dokument, das Retrieval benötigt, ist ein Dokument, für das dieses Modell nicht gedacht ist.

Was dich jedes einzelne kostet, ehrlich gerechnet

Intern-Decision-2B hat keinen gehosteten Endpoint und keinen Anbieter. OrcaRouters Modellseite dafür liefert einen 404 zurück, und nichts in diesem Artikel ist eine Verfügbarkeitsaussage. Es aufzurufen bedeutet, ungefähr 4,46 GB Repository herunterzuladen – einen 3,76 GB großen Sprach-Shard, einen 612,5 MB großen Vision-Tower, einen 50,3 MB großen Projektor – und inference.py neben den Gewichten in einer Python-3.12-Umgebung mit torch 2.9.1 und transformers 5.14.1 auszuführen, auf einer GPU, für die du bezahlst, ob sie nun Entscheidungen bewertet oder nicht.

Das ist nicht in jedem Fall ein Nachteil, und es lohnt sich, die Rechnung durchzuführen, statt es anzunehmen. Bei durchschnittlich 33,28 ms pro Anfrage auf einer einzelnen RTX 4090 – nach InternLMs eigener Messung – fallen bei einem lokal gehosteten Intern-Decision-2B keine Kosten pro Entscheidung an. Ein gehosteter Generalist rechnet pro Token ab, auch für die Token, die er für das Nachdenken vor seiner Antwort aufwendet. Bei hohem Volumen ist ein Scorer, den Sie bereits besitzen, das günstigere Instrument – die Kosten liegen bei der GPU und der Entwicklungsarbeit, nicht beim Aufruf.

Gemma 4 12B Unified ist ebenfalls nicht in unserem Katalog; wenn Sie es wollen, laden Sie 11,96 Milliarden Parameter in BF16 herunter und stellen es selbst bereit. Echte Gemma-4-Routen gibt es in unserem Katalog dagegen für die anderen beiden Größen, und sie sind günstig: Gemma 4 26B A4B für 0,06 $ pro Million Eingabe-Token und 0,33 $ pro Million Ausgabe-Token sowie Gemma 4 31B für 0,13 $ und 0,38 $, beide mit 262.144-Token-Kontexten und einer P50-Zeit bis zum ersten Token aufgeführt, die der Katalog mit 1,73 Sekunden angibt. Wenn sich Ihr Problem als allgemeines Reasoning statt als Entscheidung mit geschlossenem Antwortraum erweist, ist das der Punkt, den Sie mit einem lokal betriebenen Scorer vergleichen sollten – zwei weitere Modelle auf einem Schlüssel, Anbieter-Listenpreis ohne Aufschlag durchgereicht, und automatisches Failover damit ein Modell, das Sie noch evaluieren, nie zu einem Single Point of Failure in einem Produktionspfad wird.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 input and $0.38 output per million tokens, and a P50 time to first token of 1.73 seconds.

Anzeigetafel, mit den beigefügten Vorbehalten

• Parameter — Intern-Decision-2B 2.213.241.664 in BF16 plus einen Vision-Tower und Projektor; Gemma 4 12B Unified 11.959.730.224 in BF16.

• Kontext — 8.192 Token, oben abgelehnt, im Vergleich zu 256.000 Token.

• Ausgabe — kalibrierte Wahrscheinlichkeiten und ein Argmax, kein Text; generierter Text, ein Token nach dem anderen.

• Modalität — Text plus bis zu acht Bilder gegenüber Text, Bild, Audio und Video als Eingabe, Text als Ausgabe.

• Veröffentlichte Belege – eine Anbietertabelle mit sieben Suiten und einem Durchschnitt von 84,68, einem Brier-Score von 0,437 und ECE 0,100, die von niemandem außerhalb des Labors reproduziert wurde; eine Google-Evaluierungskarte mit MMLU Pro 77,2 %, GPQA Diamond 78,8 %, AIME 2026 ohne Werkzeuge 77,5 % und LiveCodeBench v6 72,0, plus ein unabhängiger Eintrag mit einem Artificial-Analysis-Intelligence-Index von 14,2.

• Adoption — ein Like und null Downloads beim 2B-Checkpoint gegenüber einer Familie, die seit Mai im Umlauf ist, mit Quantisierungen, Fine-Tunes und Derivaten, deren Zahl in die Hunderte geht.

Lies die Evidenzzeilen asymmetrisch, denn genau das sind sie. Googles Zahlen wurden unabhängig von Dritten indexiert und reproduziert; die von InternLM wurden von niemandem außerhalb des Labors durchlaufen, und gerade die Kalibrierungszahl sollte als gut dokumentierte Absicht gelten, bis sie auf einen fremden Testdatensatz trifft. Die ehrliche Zusammenfassung lautet nicht, dass die Anbietertabelle falsch ist. Sie lautet, dass die beiden Spalten nicht dasselbe Beweisgewicht tragen, und ein Vergleich, der 84,68 neben 77,2 druckt, ohne das zu sagen, führt seine Leserschaft in die Irre.

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Gemma 4 12B'. The left column reads: Parameters 2.21B BF16 plus vision tower; Context 8,192 tokens, refused above; Output probabilities and an argmax, no text; Input text plus up to 8 images; Published evidence vendor table, unreproduced; Licence Apache 2.0 plus LICENSE-QWEN. The right column reads: Parameters 11.96B BF16; Context 256,000 tokens; Output generated text, token by token; Input text, image, audio and video; Published evidence Google card, AA Index 14.2; Licence Apache 2.0, Gemma 4 terms. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the Gemma 4 12B figures come from Google's own card plus an independent Artificial Analysis index.

Was soll man damit machen?

Wähle Intern-Decision-2B, wenn die Entscheidung wirklich abgeschlossen ist, der Zustand bequem in achttausend Tokens passt, du eine Wahrscheinlichkeit willst, die du über einen Schwellenwert auswerten kannst, statt eines Absatzes, den du erst parsen musst, und du sowohl die Hardware als auch die Lust hast, einen Checkpoint zu betreiben, den noch niemand unterstützt. Speziell die mittlere Größe weist die schwächste veröffentlichte Kalibrierung der drei auf, die InternLM ausgeliefert hat — ECE 0,100 gegenüber 0,066 für das Modell mit der halben Größe und 0,065 für das nahezu doppelt so große —, wenn du also innerhalb dieser Familie auswählst, ist das 2B dasjenige, auf das du deine eigene Temperatur anpassen solltest, nicht dasjenige, dem du ab Werk vertrauen solltest.

Wählen Sie Gemma 4 12B – oder, praktischer gesagt, eine der beiden Gemma-4-Größen, die wir tatsächlich routen –, wenn die Eingabe länger als eine Seite ist, wenn Audio oder Video oder eine andere Sprache als Englisch im Spiel ist, wenn die Antwort erklärt und nicht nur ausgewählt werden muss oder wenn Sie den Inferenz-Stack nicht selbst betreiben möchten. Das 12B ist das kleinste der Gemma-4-Modelle mit nativem Audio; das 26B A4B aktiviert etwa vier Milliarden Parameter pro Token und ist der günstigste Einstieg in die Familie.

Und wenn es sich bei dem, was Sie tatsächlich haben, um ein Bewertungsproblem mit einem langen Dokument im Anhang handelt, ist keines von beiden das richtige Instrument: Das ist ein Retrieval-Problem in den Kleidern eines Vergleichsartikels.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.