
Intern-Decision-4B vs. Laya: Zwei Modelle, die sich weigern, eine Antwort zu schreiben, und in ihrer Größe um den Faktor zehn auseinanderliegen
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 592 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 187 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
In der Modellkarte von Intern-Decision-4B gibt es eine Zeile, die „Laya — 57.77“ lautet. Wer Layas eigene Dokumentation gelesen hat, erkennt die Bedeutung dieser Zahl: convaiinnovations/laya ist ein nicht-autoregressives Entscheidungsmodell mit 421 Millionen Parametern, und 57,77 ist der Durchschnittswert, den es erzielt, wenn es Zero-Shot auf dem Benchmark eines anderen eingesetzt wird. Seine eigene Modellkarte sagt dasselbe unverblümter – die Basis-Checkpoints liegen unter der Majority-Class-Baseline beim Typed-Decisions-Benchmark, bei 0,362 gegenüber 0,461. Währenddessen internlm/Intern-Decision-4B ist ein Modell mit 4,54 Milliarden Parametern, das für genau dieselbe Aufgabe gebaut wurde: einen Zustand und eine Reihe typisierter Fragen nehmen, einen einzigen Forward-Pass ausführen, kalibrierte Wahrscheinlichkeiten zurückgeben, niemals ein Token generieren. Dieselbe architektonische Wette, dieselbe Ausgabeform, dieselbe Apache-2.0-Lizenz, zehnmal so viele Parameter – und eines davon ist eine Basis zum Fine-Tuning, während das andere behauptet, eine fertige Zero-Shot-Engine zu sein.
Sie sind sich in der Prämisse einig, was das Seltene daran ist.
Beide Karten führen dasselbe Argument an, und es ist erwähnenswert, weil der Großteil der Branche das Gegenteil argumentiert. Wenn Ihr Problem darin besteht, aus einer bekannten Menge von Antworten auszuwählen, ist das Generieren von Prosa die falsche Operation: Sie zahlen für Tokens, die Sie wegwerfen, Sie brauchen einen Parser, und Sie erhalten eine Erklärung, nach der Sie nicht gefragt haben, statt einer Wahrscheinlichkeit, die Sie mit einem Schwellenwert filtern können. Layas Karte formuliert es so: "Es generiert nie Text, also gibt es nichts zu parsen und nichts zu halluzinieren." Die Karte von Intern-Decision-4B besagt, dass ihre API "eine strukturierte Kandidatenbewertung durchführt. Sie ruft weder generate() auf noch sampelt sie Freitext."
Die Mechanismen unterscheiden sich auf lehrreiche Weise. Laya speist typisierte Fragen in einen Klassifikator-Head ein und liefert typisierte Antworten mit kalibrierten Wahrscheinlichkeiten in einem einzigen Vorwärtsdurchlauf zurück, mit einer Routing-Schicht, die Schrift und Sprache in weniger als einer halben Millisekunde vor dem Durchlauf erkennt. Intern-Decision-4B bildet die Optionen jeder Frage auf Einzel-Token-Symbole ab, rendert ein Assistenten-JSON-Skelett mit einem Platzhalter pro Feld, liest die Logits unmittelbar vor jedem Platzhalter und wendet Softmax nur über die erlaubten Symbole dieses Feldes an. Layas ist ein Klassifikationsproblem; InternLMs ist ein Nächste-Token-Problem, das es nicht zulässt, zu einem Generierungsproblem zu werden.

Die Größenlücke – und was sie bringt
Bittet man zwei Modelle, dieselbe Aufgabe mit 421M bzw. 4,54B Parametern zu erledigen, kommt das Ergebnis heraus, das man erwarten würde – und dann eine Überraschung.
Der vorhergesagte Teil ist die Fähigkeit bei schwierigen Fragen. Intern-Decision-4B erreicht im Durchschnitt 90,02 über sieben Evaluierungssets, mit einem Brier-Score von 0,347 und einem erwarteten Kalibrierungsfehler von 0,065 in InternLMs eigener Messung, und es läuft mit durchschnittlich 44,16 ms pro Abfrage auf einer einzelnen RTX 4090. Layas englischer Basis-Checkpoint erzielt 0,362 Genauigkeit auf dem Typed-Decisions-Benchmark mit 2.000 Entscheidungen, die seine eigene Modellkarte als unter der 0,461-Mehrheitsklassen-Schwelle und kaum über der 0,318-Zufalls-Basislinie liegend kennzeichnet. Wenn derselbe Checkpoint auf dem eigenen Trainingssplit dieses Benchmarks feinabgestimmt wird, springt die Zahl auf 0,766. Layas Modellkarte zieht selbst die Schlussfolgerung: „Laya ist eine schnelle Basis zum Spezialisieren, keine Zero-Shot-Entscheidungsengine.“
Die Überraschung ist, dass das kleinere Modell in zwei Dimensionen klar gewinnt. Geschwindigkeit: Laya beantwortet 103 bis 332 Fragen pro Sekunde gebatcht auf einer einzelnen T4, und seine Modellkarte gibt an, dass es bei dem unabhängig gemessenen p50-Wert von 236–276 ms, der dort zitiert wird, etwa sechs- bis achtmal schneller ist als TypeSafe Jev. Zehnmal so viele Parameter erkaufen nicht zehnmal so viel Durchsatz in der Gegenrichtung — Intern-Decision-4Bs 44,16 ms gelten pro Anfrage auf einer 4090, ohne veröffentlichte Batching-Story. Und Sprache: Laya meldet 45 von 51 gebenchmarkten Sprachen als bei mehr als dem Dreifachen des Zufallsniveaus nutzbar, mit einem gerouteten 0,451 bei MASSIVE-Intent in dreizehn nicht englischen Sprachen gegenüber 0,306 für seinen rein englischen Checkpoint. Intern-Decision-4B erhebt überhaupt keinen Mehrsprachigkeitsanspruch.
Anzeigetafel
• Parameter — 4,54 Mrd. BF16 für Intern-Decision-4B, Text-Turm plus Vision-Turm plus Projektor; 421 Mio. für Laya, einen einzelnen kompakten Stack der Encoder-Klasse.
• Eingabeobergrenze — 8.192 Token für beide, und beide lehnen ab, statt zu kürzen; beachte, dass Layas 8.192 für den mehrsprachigen Checkpoint gilt, dessen mitgelieferter Standardwert 1.024 beträgt.
• Multiplizität — Intern-Decision-4B verarbeitet 1 bis 16 Fragen mit bis zu 62 Optionen pro Frage, und 62 ist nicht willkürlich: Es ist genau die Anzahl der Single-Token-Symbole, die sein Inferenzvertrag adressieren kann. Auch Laya verarbeitet mehrere typisierte Fragen, aber seine Model Card dokumentiert einen scharfen Einbruch ab etwa 50 Optionen, wobei eine Frage mit 77 Labels nur drei oder vier Token-Budget pro Label erhält und die Genauigkeit auf 0,425 fällt.
• Bilder — bis zu acht für Intern-Decision-4B, angerechnet auf das 8.192-Token-Budget; kein multimodaler Pfad für Laya.
• Kalibrierung — Intern-Decision-4B wird mit einer angepassten Temperatur von 1,99241824 ausgeliefert, die durch NLL-Minimierung über 1.728 Fälle ausgewählt wurde, und meldet ECE 0,065 in seiner eigenen Testsuite; Laya wird überkonfident ausgeliefert, und in seiner Modellkarte steht, dass das erneute Anpassen jeweils einer Temperatur pro Fragetyp und Optionsanzahl den mittleren ECE-Wert von 0,466 auf 0,081 verschiebt.
• Zero-Shot-Haltung — ein fertiger Checkpoint, der einen Durchschnitt von 90,02 angibt, gegenüber einer dokumentierten Basis, die unter der Majority-Class-Linie liegt.
• Latenz — 44,16 ms Mittelwert, 44,03 ms Median auf einer RTX 4090 gegenüber 103 bis 332 Fragen pro Sekunde im Batch auf einer T4.
• Sprachen — keine veröffentlichte Behauptung gegen 45 von 51 Sprachen, die beim Routing verwendbar sind.
• Lizenz — Apache-2.0, wobei die Upstream-Qwen-Lizenz gegenüber Apache-2.0 erhalten bleibt, das ausdrücklich für die kommerzielle Nutzung gekennzeichnet ist.

Zwei Karten, zwei sehr unterschiedliche Vorstellungen von Offenlegung
Hier hört der Vergleich auf, ein Datenblatt zu sein, und wird zur Ermessenssache, denn die beiden Anbieter dokumentieren ihre Modelle in gegensätzlichen Stilen.
Layas Karte veröffentlicht ihre eigenen Fehler detailliert. Sie berichtet, dass der englische Checkpoint auf Khmer eine Genauigkeit von 0,000 bei einer Konfidenz von 0,952 erreicht – zuversichtlich, obwohl falsch, was Konfidenz-Gating dort nutzlos macht. Sie berichtet, dass action.act_probability kein nutzbares Signal trägt, bei fast jeder Eingabe 1,0 anzeigt, mit einer AUROC von 0,30 bei 396 gelabelten Entscheidungen, und rät Ihnen, stattdessen auf die Konfidenz zu gaten, die bei denselben Elementen 0,77 erreicht. Sie bezeichnet Ordinal-Score-Fragen als „das schwächste Primitiv“ und verweist auf 0,372 bei SST-5. Eine Karte, die Ihnen sagt, welche ihrer eigenen Ausgaben Sie ignorieren sollen, tut etwas, das die meisten Anbieter nicht versuchen.
Die Model Card von Intern-Decision-4B veröffentlicht eine saubere Tabelle und keine Fehlerfälle. Seine Vorbehalte sind real und tragend — der Kalibrierungsabschnitt ist ungewöhnlich explizit, dass die „before“-Spalte in seiner Pilotstudie nicht das ist, was kein Nutzer sehen würde, und dass Test-Suite-Labels nicht zur Auswahl der Temperatur verwendet wurden —, aber der Evaluierungsabschnitt besteht aus sieben Siegen und keinen Eingeständnissen. Es enthält außerdem Zeilen für fünf konkurrierende Systeme, die InternLM auf dem Harness von InternLM ausgeführt hat, einschließlich der Laya-Zeile, mit der dieser Artikel beginnt. Das sind nicht die eigenen Zahlen dieser Projekte, und sie als solche zu lesen, wäre ein Fehler.
Also ist die Quellenlage für dieses Duell in einer Weise asymmetrisch, die das kleinere Modell begünstigt: Layas Belege umfassen Fehler, die es selbst dokumentiert hat, und die Belege von Intern-Decision-4B sind noch nie auf einen Testsatz getroffen, den seine Autoren nicht selbst ausgewählt haben.
Zu welcher Problemform jede einzelne passt
Angesichts eines kurzen, strukturierten Zustands in Englisch, einer geschlossenen Antwortmenge und des Bedarfs an einer vertrauenswürdigen Wahrscheinlichkeit ist Intern-Decision-4B das leistungsfähigere Objekt auf dem Papier und das teurere in der Praxis – vier safetensors-Shards, PyTorch 2.9.1 und Transformers 5.14.1 unter Python 3.12, eine residente Engine und ein Wrapper, den Sie selbst schreiben, wenn Sie einen HTTP-Endpunkt möchten. Angesichts einer hochvolumigen Routing- oder Guardrail-Entscheidung über Dutzende Sprachen hinweg, bei der der Durchsatz die bindende Einschränkung ist, ist Laya die bessere Form: pip install laya, ein 421M-Modell und eine Model Card, die Ihnen bereits gesagt hat, dass Sie feinabstimmen sollten, bevor Sie den Wahrscheinlichkeiten vertrauen.
Das Einzige, worin beide Karten übereinstimmen, ist, dass man keinem der beiden Modelle zero-shot vertrauen sollte, ohne die Kalibrierung an den eigenen Daten zu prüfen — Laya, weil seine Basis-Checkpoints bei ungewohnten Entscheidungstypen nahe am Zufallsniveau liegen, Intern-Decision-4B, weil sein ECE von 0,065 aus einer Suite stammt, die seine eigenen Autoren zusammengestellt haben.
Was ein Router hier verändert und was nicht
Keines dieser beiden Modelle ist im OrcaRouter-Katalog enthalten, und es ist besser, das klar zu sagen, statt etwas anderes anzudeuten: Unsere Modellseiten liefern für Intern-Decision-4B und Laya beide einen 404, und keines von beiden ist eine Route, die man heute aufrufen kann. Was das für die beiden Projekte bedeutet, ist nicht dasselbe. Layas Apache-2.0-Lizenz mit einer Kennzeichnung für kommerzielle Nutzung bedeutet, dass das Hindernis rein die Paketierung ist – es ist ein lokales Python-Paket mit geringem Platzbedarf, also genau die Art von Sache, die sich plausibel bereitstellen ließe. Das Hindernis bei Intern-Decision-4B ist ebenfalls die Paketierung, aber seine 4,54B-BF16-Gewichte und die Obergrenze von 8.192 Token für Verweigerungen machen es eher zu einer Komponente als zu einem Dienst.
Wo OrcaRouter tatsächlich hilft, ist auf der anderen Seite der Entscheidung. Wenn sich herausstellt, dass Ihr Problem mit strukturierten Entscheidungen doch noch einen Reasoning-Schritt benötigt, erreichen Sie die allgemeinen Modelle, die dazu in der Lage sind,mit einem Schlüssel über 200+ Modelle hinweg, wobei der Listenpreis des Anbieters zu 0 % Aufschlag durchgereicht wird und automatisches Failover zwischen Anbietern – das Modell, das Sie mit einem Scorer kombinieren, ist also nur einen Endpunkt entfernt, nicht einen zweiten Vertrag.
Die Kurzfassung
Diese beiden Projekte kamen zu derselben Schlussfolgerung darüber, wie Entscheidungen getroffen werden sollten, und unterschieden sich dann in fast allem anderen. Laya setzt darauf, dass 421 M Parameter, striktes Sprachrouting und gnadenlose Ehrlichkeit über die eigenen Mängel eine schnelle Basis bilden, die man spezialisiert. Intern-Decision-4B setzt darauf, dass zehnmal so viele Parameter und ein sorgfältig konstruierter Single-Token-Bewertungsvertrag eine fertige Zero-Shot-Engine ergeben. Das entscheidende Experiment ist eines, das keiner von beiden öffentlich durchgeführt hat: Nehmen Sie eine Reihe von Entscheidungen mit berechenbaren Antworten, führen Sie beide aus und prüfen Sie, ob die Wahrscheinlichkeiten etwas bedeuten. Laya hat dieses Experiment halb veröffentlicht und Ihnen gezeigt, wo es scheitert. Intern-Decision-4B hat es überhaupt nicht veröffentlicht.

