
Intern-Decision-2B vs. Laya: 2,2 Milliarden Parameter gegen 421 Millionen, beide weigern sich, eine Antwort zu schreiben
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 584 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 187 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
internlm/Intern-Decision-2B und convaiinnovations/laya sind die beiden ähnlichsten Modelle in der Nische der kleinen Entscheidungsmodelle, und die nützlichste Tatsache über den Vergleich ist, dass sie auf entgegengesetzten Wegen dorthin gelangen. InternLMs Checkpoint mit 2.213.241.664 Parametern liest den Logit an einer festen Position vor einem Platzhalter und ruft niemals generate() auf. Convais Checkpoint mit 421 Millionen Parametern speist eingegebene Fragen in einen Entscheidungskopf auf einem ModernBERT-large-Backbone ein und liefert kalibrierte Wahrscheinlichkeiten in einem einzigen Vorwärtsdurchlauf zurück. Keiner schreibt ein Token, beide versprechen Wahrscheinlichkeiten, beide sind auf etwa achttausend Token Eingabe begrenzt, und der kleinere ist fünfmal kleiner und grob tausendmal beliebter. Was sie trennt, ist weniger die Fähigkeit als vielmehr das Packaging, und die Packaging-Lücke entscheidet für die meisten Leser über den Kauf.
Intern-Decision-2B erschien am 26. September 2026 um 05:36 UTC auf Hugging Face, die mittlere von drei Größen, die InternLM innerhalb von vierzig Sekunden ohne Ankündigung hochlud, feinabgestimmt von Qwen/Qwen3.5-2B unter Apache-2.0. Laya wurde erstmals am 18. September 2026 veröffentlicht und hat seitdem rund 3.700 Likes, ein pip-Paket, einen Jev-kompatiblen HTTP-Server, ONNX- und LangChain-Integrationen sowie ein Fine-Tuning-Notebook angesammelt. Der Kontrast in der Reife ist der Artikel.
Die Prämisse, die sie teilen, und die Mechanismen, die sich unterscheiden
Beide Karten argumentieren, dass, wenn Ihr Problem darin besteht, aus bekannten Antworten auszuwählen, das Erzeugen von Prosa die falsche Operation ist. Laya formuliert es so: „Es generiert niemals Text, also gibt es nichts zu parsen und nichts zu halluzinieren.“ Intern-Decision-2B sagt, seine API „führt strukturierte Kandidatenbewertung durch. Sie ruft generate() nicht auf und erzeugt keinen Freitext durch Sampling.“
Die Mechanismen sind der Punkt, an dem sie sich trennen.
Laya ist ein Klassifikator. Ein ModernBERT-large-Encoder (395M, bidirektional, vollständig feinabgestimmt) speist einen von Grund auf trainierten Entscheidungs-Head — zwei Transformer-Schichten, einen Option-Marker-Scorer und einen Act/Escalate-Head — für insgesamt 421M. Optionen teilen sich ein festes Token-Budget (head_max_len, 192 Token im englischen Checkpoint, 256 im mehrsprachigen), und der Router erkennt Schrift und Sprache in unter einer halben Millisekunde vor dem Durchlauf.
Intern-Decision-2B ist ein Next-Token-Modell, dem verboten wurde, ein Generator zu werden. Es bildet die Optionen jeder Frage auf Single-Token-Symbole A–Z, a–z, 0–9 ab; rendert ein vollständiges Assistenten-JSON-Gerüst mit einem <decision>-Platzhalter pro Feld; führt einen kausalen Vorwärtsdurchlauf aus; liest Logits unmittelbar vor jedem Platzhalter; wendet Softmax über die zulässigen Symbole dieses Felds an; und wendet eine angepasste Temperatur von 2,100509348278 an. Darunter befindet sich eine standardmäßige Qwen3_5ForConditionalGeneration — 24 Schichten, drei Linear-Attention-Schichten auf eine Full-Attention-Schicht, eine beibehaltene Multi-Token-Prediction-Schicht, eine Einbettungsobergrenze von 262.144 Positionen — plus einen Vision-Turm und Projektor.
Die praktische Konsequenz des Unterschieds ist die Optionskapazität. Layas festes Budget pro Option bricht bei breiten Label-Räumen zusammen; seine eigene Karte dokumentiert eine Frage mit 77 Labels, die 0,425 erzielt, gegenüber TypeSafe Jevs 0,870 bei derselben Aufgabe, weil 77 Optionen jeweils etwa drei oder vier Tokens erhalten. Intern-Decision-2B nimmt bis zu 62 Optionen pro Frage und bis zu sechzehn Fragen, und 62 ist keine Präferenz, sondern die genaue Anzahl der Single-Token-Symbole, die sein Kontrakt adressieren kann. Keines von beiden ist jenseits von ein paar Dutzend Optionen komfortabel; die Fehlerformen unterscheiden sich.

Anzeigetafel

• Parameter — Intern-Decision-2B 2.213.241.664 in BF16 plus einen Vision-Tower und einen Projektor, etwa 4,46 GB auf der Festplatte; Laya 421M, eine einzelne 842 MB große safetensors-Datei, mit einem separaten 644 MB großen mehrsprachigen Checkpoint.
• Eingabe-Obergrenze — 8.192 Token für beide, beide verweigern statt zu kürzen; beachten Sie, dass Layas 8.192 für laya-multilingual gilt und max_len=8192 erfordert, da der mitgelieferte Standardwert 1.024 beträgt.
• Bilder — bis zu acht für Intern-Decision-2B, die auf dasselbe Token-Budget angerechnet werden; kein Multimodal-Pfad für Laya.
• Geschwindigkeit — 33,28 ms Mittelwert, 33,15 ms P50, 33,55 ms P95 pro Anfrage auf einer RTX 4090 für Intern-Decision-2B; Laya meldet ungefähr 33 ms pro Anfrage und 103–332 Fragen pro Sekunde im Batch-Betrieb auf einer einzelnen T4.
• Sprachen — Intern-Decision-2B erhebt überhaupt keinen Anspruch auf Mehrsprachigkeit; Laya routet über 100+ Sprachen und berichtet, dass 45 von 51 getesteten Sprachen mit mehr als der dreifachen Zufallsleistung nutzbar sind, sowie 0,451 bei MASSIVE-Intent über dreizehn nichtenglische Sprachen gegenüber 0,306 für seinen nur englischsprachigen Checkpoint.
• Zero-Shot-Genauigkeit – Intern-Decision-2B erzielt 84,68 im Mittel über sieben Anbieter-Suiten, mit Brier 0,437 und ECE 0,100, allesamt nicht reproduziert; Layas englischer Basis-Checkpoint erreicht 0,362 im Typed-Decisions-Benchmark mit 2.000 Entscheidungen, den seine eigene Modellkarte als unterhalb der 0,461-Mehrheitsklassen-Grenze liegend ausweist.
• Paketierung — ein Checkpoint, eine inference.py und ein neu öffentlich gemachtes GitHub-Repository mit Trainings- und Evaluierungscode, gegenüber pip install laya, einem Jev-kompatiblen HTTP-Server, ONNX Runtime- und TileLang-Fast-Paths, MCP- und LangChain-Integrationen sowie einem Fine-Tuning-Notebook, das auf Free-Tier-GPUs läuft.
Der fairste Vergleich ist nicht derjenige, den das Datenblatt vorgibt
84,68 neben 0,362 zu stellen grenzt an Unehrlichkeit, und es lohnt sich zu sagen, warum, statt die Zahlen einfach stehen zu lassen.
Layas 0,362 ist ein Basis-Checkpoint, der im Zero-Shot-Verfahren auf einem Benchmark gemessen wurde, für den er nicht optimiert wurde. Die eigene Modellkarte zieht ausdrücklich die Schlussfolgerung: „Laya ist eine schnelle Basis zum Spezialisieren, keine Zero-Shot-Entscheidungsengine.“ Feinabgestimmt auf den eigenen Trainingssplit jenes Benchmarks erreicht es 0,766, überschreitet damit die Teacher-Obergrenze von 0,735 und schlägt TypeSafe Jevs veröffentlichte 0,727 bei denselben Entscheidungen. Der Wert 84,68 von Intern-Decision-2B hingegen ist ein Anbieterdurchschnitt über sieben Suiten, dessen Testsets nicht diejenigen sind, die Laya angibt, erzeugt von dem Labor, das das Modell gebaut hat, wobei kein Dritter es ausgeführt hat – der Checkpoint zeigt ein Like und null Downloads. Ein feinabgestimmtes Ergebnis mit einem Zero-Shot-Ergebnis zu vergleichen – oder einen Anbieterdurchschnitt mit einer unabhängigen Bestenliste – ist kein Vergleich. Es sind zwei verschiedene Messungen, die sich dieselbe Schriftart teilen.
Was wirklich vergleichbar ist: Beide sind klein, beide sind günstig im Betrieb, und beide lassen sich nicht auf Ihre Domäne feinabstimmen. Das Repository, das InternLM heute Morgen veröffentlicht hat, macht den letzten Punkt wesentlich einfacher als noch gestern, denn es enthält den Trainings-Launcher, das Masked-Next-Token-Ziel, ein hash-verifiziertes Paket mit 10.751 Testzeilen über sieben Suiten sowie die Skripte zur Temperaturanpassung und zum Replay. Ein Labor, das einen deterministischen Kalibrierungsgenerator ausliefert und behauptet, dass Replay null Entscheidungen ändert, lädt genau zu der Art von Anpassung ein, die Layas Karte empfiehlt.
Wie du eine der beiden tatsächlich nennen würdest
Keines der beiden Modelle ist auf OrcaRouter. OrcaRouters Modellseite für Intern-Decision-2B gibt 404 zurück, und es gibt auch keine Laya-Route; nichts hiervon ist eine Verfügbarkeitsaussage. Intern-Decision-2B bedeutet, den Checkpoint herunterzuladen und die mitgelieferte Engine auf der eigenen GPU auszuführen. Laya bedeutet pip install laya und, wenn Sie die Jev-kompatible Oberfläche möchten, laya-serve auf POST /v1/systemone.
Die dahinterliegende Frage im Orchestrator-Stil ist, ob Sie eine zweite operative Oberfläche für einen Scorer wollen. Laya ist darauf ausgelegt, eingebettet zu werden – dieselbe Request- und Response-Form wie TypeSafe Jev, sodass ein bestehender Client lediglich eine Base-URL ändert und sonst nichts. Intern-Decision-2B ist darauf ausgelegt, reproduziert zu werden, und heute bedeutet es ungefähr einen Tag Umgebungsarbeit, bevor die erste Entscheidung zurückkommt. Wenn die Closed-Set-Entscheidung, die Sie treffen, in ihrer Form einer dieser beiden ähnelt, ist die gehostete Alternative, gegen die beide Karten benchmarken, TypeSafe Jev 1.13, für die es tatsächlich einen Weg gibt: 0,042 $ pro Million Input-Tokens, ein 65K-Kontext und eine P50-Zeit bis zum ersten Token von 178 ms, erreichbar über denselben Schlüssel wie mehr als 200 andere Modelle, wobei der Anbieter-Listenpreis ohne Aufschlag (0 % Markup) durchgereicht wird.

Wo jedes einzelne gewinnt
Laya gewinnt bei allem Operativen. Ein pip-Paket gegen einen Checkpoint-Download. Ein Router über mehr als hundert Sprachen gegen keinerlei Anspruch auf Mehrsprachigkeit. Gebündelter Durchsatz, gemessen in Hunderten von Fragen pro Sekunde, gegen einen Pro-Anfrage-Wert ohne Batching-Story. Zwei Jahre Ökosystem-Muskel – ONNX, TileLang, LangChain, MCP – gegen ein Repository, das seit zwei Stunden öffentlich ist.
Intern-Decision-2B gewinnt bei drei eng gefassten Punkten. Es verarbeitet Bilder, was Laya nicht tut. Es trägt keine Fine-Tuning-Altlast: Seine 84,68 sind eine Zero-Shot-Angabe des Anbieters, während Layas Schlagzeilenwert von 0,766 zu einem Checkpoint gehört, der auf dem eigenen Trainings-Split des Benchmarks feinabgestimmt wurde. Und es ist mit einem Reproduktionskit dokumentiert — einem verifizierbaren Evaluationspaket und einem öffentlichen Trainings-Stack —, was für jeden, der das Modell gegenüber anderen rechtfertigen muss, mehr wert ist als eine Zeile in einem Leaderboard.
Der Gleichstand ist die Prämisse. Beide verweigern die Generierung, beide liefern Ihnen Wahrscheinlichkeiten, die Sie mit einem Schwellenwert versehen können, und beide liegen unter der Eingabelänge, in der die meisten echten Dokumente liegen. Wenn Ihr State ein Ticket, eine E-Mail oder ein Formular ist, reicht beides aus, und mit Laya sind Sie schneller dort. Wenn an Ihrem State ein Screenshot angehängt ist oder Ihre Organisation die Reproduktion auditierbar braucht, ist InternLMs mittlerer Checkpoint derjenige, der diesen spezifischen Einwand beantwortet – und nach InternLMs eigenen Zahlen ist er der am schlechtesten kalibrierte seiner drei Geschwister, mit ECE 0,100 gegenüber 0,066 und 0,065, passen Sie also Ihre eigene Temperatur an, bevor Sie der Konfidenz vertrauen, die er meldet.
