
Laya vs. Decider: Ein 421M-Encoder gegen eine 35B-Mischung
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
Laya und Decider sind beides Open-Weight-, nicht-autoregressive Entscheidungsmodelle, die typisierte Fragen beantworten – eine Auswahl aus einer vorgegebenen Liste, eine Punktzahl auf einem geordneten Bewertungsraster, eine Ja/Nein-Wahrscheinlichkeit – in einem einzigen Vorwärtsdurchlauf, und sie liegen an entgegengesetzten Enden des Größenspektrums. Convai Innovations veröffentlichte Laya am 18. September 2026 unter Apache 2.0: einen 421M-ModernBERT-large-Encoder für Englisch mit einem 512-Token-Fenster, einen mehrsprachigen 322M-mmBERT-base-Checkpoint mit einem 1.024-Token-Fenster, der über 100 Sprachen abdeckt, und einen Router, der das Schriftsystem erkennt und an den richtigen weiterleitet. Mapikas Decider-Familie reicht von decider-0.8b und decider-2b auf kleinen generativen Basen bis hin zu decider-35b-a3b, einem 35B-Mixture-of-Experts mit ungefähr 3B aktiven Parametern. Beide sind kostenlos herunterladbar und beide geben Wahrscheinlichkeiten statt Text zurück. Der Grund, warum sie nicht austauschbar sind, ist nicht die Genauigkeitszahl, mit der die meisten Berichte aufmachen.
Zwei Familien, eine architektonische Wette

Die gemeinsame Wette ist, dass eine Entscheidung keine Decodierungsschleife benötigt. Ein generatives Modell, das gefragt wird „Ist dieses Ticket eine Rückerstattungsanfrage?“, muss Tokens ausgeben, und in dem Moment, in dem es Tokens ausgibt, liegen Parsing, Schema-Validierung und ein Wiederholungspfad für das eine Mal unter zweihundert bei Ihnen, in dem es eine geschweifte Klammer vergisst. Laya und Decider überspringen das beide, indem sie die Antwort direkt aus einem einzigen Forward-Pass auslesen – Laya aus einem bidirektionalen Encoder, Decider aus den Logits von mit Buchstaben versehenen Options-Tokens an einem dedizierten Antwort-Slot im Prompt.
Dort endet die Ähnlichkeit. Laya besteht aus zwei kleinen Encodern hinter einem Sprachrouter, was Laya ein englisches 512-Token-Fenster und ein mehrsprachiges 1.024-Token-Fenster bei 421M bzw. 322M Parametern verschafft. Decider behält ein generatives Backbone bei und ergänzt es obendrauf um ein Readout: decider-2b ist ein überwachtes Fine-Tuning von Qwen3.5-2B-Base, gefolgt von einem kalibrierungsbewussten Reinforcement-Durchlauf auf Live-Browser-Aufgaben und exakten Spielen, während decider-35b-a3b die gerouteten Experten einfriert und Blockmatrizen mit Muon trainiert. Die praktische Konsequenz ist, dass Decider das Weltwissen eines Sprachmodells erbt und Laya nicht. Die andere Konsequenz ist, dass Decider den Footprint eines Sprachmodells erbt.

Mapikas eigene Dokumentation gibt decider-2b mit 18 ms Median pro Entscheidung auf einer B300 in bf16 an, Batch-Größe eins, ohne CUDA-Graphen oder Kompilierung, und decider-35b-a3b mit 41 ms im selben Setup. Auf einer GH200 mit Support-Ticket-Kontexten von ungefähr 230 Tokens und drei bis fünf eingegebenen Fragen meldet dasselbe Projekt 49 ms im Eager-Modus, 4,0 ms mit CUDA-Graphen und torch.compile sowie etwa 1.370 Entscheidungen pro Sekunde bei Batch 32. Das sind vom Anbieter veröffentlichte Zahlen aus der eigenen Projektbeschreibung, keine unabhängige Messung. Layas Schlagzeile ist ebenfalls vom Anbieter veröffentlicht: 32,8 ms p50 pro Entscheidung auf einer Tesla T4 und 7,2 ms pro Frage bei Batch-Größe 10.
Die Kalibrierungsfrage, die die beiden Projekte in unterschiedlichem Maßstab beantworten
Kalibrierung ist die Zahl, die bei einem Entscheidungsmodell am meisten zählt, denn der ganze Sinn der Rückgabe einer Wahrscheinlichkeit besteht darin, dass jemand nachgelagert einen Schwellenwert darauf setzt. Genau hier wird ein direkter Vergleich von Laya und Decider Sie auch in die Irre führen.
Laya wird mit einem erwarteten Kalibrierungsfehler von 0,466 auf der eigenen Modellkarte ausgeliefert, und die Karte gibt unverblümt an, dass das Neuanpassen einer Temperatur pro Fragetyp diesen auf 0,081 verschiebt. Das ist eine ungewöhnlich ehrliche Offenlegung, und es bedeutet auch, dass der ausgelieferte Checkpoint nicht das kalibrierte Artefakt ist. Die Zahl, die man ohne weitere Anpassung erhält, ist die 0,466.
Decider wird auf einem völlig anderen Instrument ausgewiesen. Der Decision Index – ein offenes Leaderboard, das jede offene Reproduktion von Jev über 132.422 Anfragen laufen ließ – platziert decider-35b-a3b insgesamt auf Platz vier mit 54,3 hinter Jevs 59,5 und meldet es als das am besten kalibrierte der 32 Einträge mit einem Kalibrierungsfehler von 3,1 Punkten und 0,4 % falschen Antworten bei angegebener Konfidenz von 95 %+. decider-2b meldet 8,8 Punkte und 0,9 %. Das sind vom Leaderboard veröffentlichte Zahlen, und 3,1 Punkte auf dem Zehn-Bin-ECE des Index sind nicht dieselbe Messung wie Layas 0,466 im eigenen Eval. Sie in einer Tabelle nebeneinanderzustellen wäre ein Äpfel-mit-Birnen-Fehler im Gewand der Strenge. Was man sagen kann, ist, dass der Autor von Decider sich dafür entschieden hat, auf einem Leaderboard eines Dritten gemessen zu werden, und der Autor von Laya sich dafür entschieden hat, die schwächste Kalibrierungszahl von Laya selbst zu veröffentlichen; weder das eine noch das andere wurde vom Harness des jeweils anderen geprüft.
Wo jeder gewinnt – Dimension für Dimension
• Backbone — Laya: ModernBERT-large 421M Encoder, bidirektional. Decider: Qwen3.5 generative Basismodelle, 0,8B bis 35B-A3B.
• Sprachen — Laya: 100+ über einen mehrsprachigen 322M-Checkpoint hinter einem Router. Decider: nur Englisch, als Einschränkung angegeben.
• Kontextfenster — Laya: 512 Token Englisch, 1.024 mehrsprachig. Decider: Eingaben bis 32k akzeptiert, auf 16k für die v6-Generation trainiert, bis 30k getestet.
• Obergrenze für Optionssätze — Laya: verschlechtert sich ab etwa 20 Optionen stark, 0,425 bei Banking77 gegenüber 0,870 von Jev. Decider: Choice über 2 bis 255 benannte Optionen, Score über 2 bis 10 beschriebene Stufen.
• Zero-Shot-Genauigkeit — Laya: 0,362 im typed-decisions-Benchmark, unter der Mehrheitsklassen-Baseline von 0,461. Decider: nicht als Zero-Shot-Zahl veröffentlicht; das Projekt berichtet stattdessen aufgabenspezifische Ergebnisse.
• Kalibrierung — Laya: ECE 0,466 im Auslieferungszustand, 0,081 nach erneutem Temperatur-Refitting pro Fragetyp. Decider: 3,1 Punkte im Decision Index für den 35B, Bestwert unter 32 Einträgen.
• Schlussfolgern — Laya: keines, konstruktionsbedingt. Entscheider: keiner, ausdrücklich angegeben — es ist eine Musterabgleich-Auslesung, kein Schlussfolgerer.
• Lizenz — Apache 2.0 für beide.
Ein weiteres Decider-Detail, das man kennen sollte, bevor man es auswählt: Das Projekt warnt davor, dass das Herauspicken eines Datensatzes aus einem langen JSON-Array anhand seiner Position ein schwacher Anwendungsfall ist, und empfiehlt, Datensätze über einen Schlüssel anzusprechen. Das ist die Art von Einschränkung, die man erst beim Ausführen bemerkt.
Was es Sie kostet, eines von beiden zu betreiben
Layas Kostenprofil ist ein Fine-Tuning-Projekt. Das Modell ist klein genug, um für Arbeit mit geringem Durchsatz auf einer Laptop-CPU zu laufen, doch der Zero-Shot-Score des mitgelieferten englischen Checkpoints liegt unter der trivialen Baseline, was bedeutet: Laya zu übernehmen heißt, die Aufgabe zu übernehmen, ein gelabeltes Set aufzubauen, ein Fine-Tuning durchzuführen und die Temperatur pro Fragetyp neu anzupassen. Der Lohn dafür ist, dass das Artefakt, wenn man das einmal erledigt hat, 421 Mio. Parameter groß ist und auf einer T4 in Zehnermillisekunden antwortet. Conva vielmehr eigenes feinabgestimmtes laya-typed-decisions-Checkpoint erreicht 0,766 auf dem Trainings-Split des Benchmarks – eine Zahl, die mehr über das Fine-Tuning als über das Basismodell aussagt, und die Model Card sagt das auch.
Das Kostenprofil von Decider ist eine Serving-Entscheidung. Sie wählen, wie viel GPU Sie mieten, und die Familie gibt Ihnen einen echten Regler: 18 ms bei einem 2B gegenüber 41 ms bei einem 35B-A3B, wobei das größere Modell Wissens- und Reasoning-Spielraum bei GPQA, GSM8K, CRUXEval und MMLU erkauft, den die kleinen nicht haben. Wenn Ihre Aufgabe eng begrenzt ist und Ihre Labels feststehen, ist decider-2b die günstigere Maschine. Wenn Ihre Aufgabe erfordert, dass das Modell Dinge weiß, zahlen Sie für die Mischung.
Wo OrcaRouter passt — und wo nicht
Weder Laya noch Decider ist ein gehostetes Modell auf OrcaRouter. Sie laden die Gewichte herunter und betreiben sie selbst, und daran ändert sich hier nichts. Was sich jedoch ändert, ist die andere Hälfte des Musters. Ein typisiertes Entscheidungsmodell ist fast nie die gesamte Anwendung: Irgendetwas muss das Ticket lesen, den Thread zusammenfassen oder die Antwort entwerfen, die die Entscheidung freigibt. Diese Hälfte ist ein generativer Aufruf, und genau dafür ist OrcaRouter gebaut – über 200 Modelle hinter einem einzigen OpenAI-kompatiblen Schlüssel zumAnbieter-Listenpreis, ohne Aufschlag durchgereicht, sodass eine Preissenkung des Anbieters noch am selben Tag auf Ihrer Rechnung landet und nicht erst bei der nächsten Vertragsverlängerung. Wenn Sie einen Laya-Checkpoint gegen die Ausgaben eines Frontier-Modells feinabstimmen oder zwischen decider-2b für das Triage und einem großen Modell für die schwierigen 4 % routen, bedeutet die generative Seite an einem einzigen Endpunkt, dass die Entscheidungsseite und die Generierungsseite keine zwei Verträge und zwei SDKs benötigen. Automatisches Failover deckt den Fall ab, in dem das große Modell der Teil ist, der ausfällt.
Welches soll man wählen?
Wähle Laya, wenn deine Eingaben mehrsprachig sind, deine Labels wenige sind, dein Latenzbudget auf bescheidener Hardware im Bereich von Zehnmillisekunden liegt und du bereit bist, feinabzustimmen – denn das wirst du müssen. Wähle Decider, wenn deine Eingaben Englisch sind, das Modell etwas Weltwissen in die Entscheidung einbringen soll und du lieber eine Modellgröße wählst, als eine Trainingspipeline zu betreiben. Wenn deine Optionsmengen über zwanzig Labels hinausgehen, lies Layas Banking77-Zahl, bevor du dich festlegst; wenn deine Eingaben lange JSON-Dokumente sind, die du über die Position ansprichst, lies Deciders genannte Einschränkung, bevor du dich festlegst.
Der Vergleich, der das tatsächlich entscheiden würde – beide Modelle mit byte-identischen Eingaben, denselben Prompts, derselben Optionsreihenfolge, demselben Schwellenwert-Sweep – existiert noch nicht. Bis dahin ist die ehrliche Position, dass Laya die bessere Kostenkurve und Decider die bessere Kalibrierungsevidenz hat, und dass beide früh genug sind, dass die Evaluation, die du auf deinen eigenen Daten aufbaust, mehr wert sein wird als die veröffentlichten Zahlen beider Projekte.

