
Microsoft-Decision-1 vs. Laya: 25 Sprachen hinter einer API, 100+ hinter einem 322MB-Download
- OrcaNEUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 pro 1 Mio. Tokens
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
Zählt man die Sprachen, scheint der Vergleich entschieden. Microsoft-Decision-1, seit dem 8. Oktober 2026 allgemein verfügbar auf Microsoft Foundry, führt 25 unterstützte Sprachen auf und stellt unumwunden fest, dass Abdeckung, Qualität und Kalibrierung „je nach Sprache variieren können“, wobei nicht-englische und insbesondere ressourcenärmere Sprachen als Bereich der Minderleistung genannt werden. Laya, veröffentlicht von Convai Innovations am 18. September 2026 unter Apache 2.0, beschreibt sich selbst als mehrsprachig für mehr als 100 Sprachen und berichtet, dass 45 von 51 getesteten Sprachen mit Routing nutzbar bleiben, gegenüber 23 von 51 bei seinem rein englischsprachigen Geschwistermodell. Das eine ist ein 9B-Modell hinter einem Azure-Endpunkt mit einem Kontext von 32.768 Token; das andere ist ein Klassifikator mit 421 Millionen Parametern, der mit 32,8 Millisekunden pro Entscheidung auf einer einzigen Tesla T4 kostenlos läuft. Beide weigern sich, ein Token zu schreiben, und beide liefern Wahrscheinlichkeiten über von Ihnen definierte Optionen zurück.
Doch liest man die beiden Modellkarten vollständig, ist die Sprachenzahl nicht mehr die interessante Zahl. Es ist die Kalibrierungsgeschichte dahinter, und die beiden Projekte erzählen diese Geschichte in entgegengesetzte Richtungen.
Laya veröffentlicht die Zahl, die das eigene Marketing in Verlegenheit bringt.
Die Laya-Modellkarte gibt in ihrem eigenen Limits-Abschnitt an, dass die Basis-Checkpoints 0,362 Zero-Shot im typed-decisions Benchmark erzielen — unter der 0,461 Mehrheitsklassen-Baseline. Das ist eine Karte, die Ihnen sagt, dass ihr Modell schlechter ist als das Raten der "häufigsten Antwort" in diesem Test. Sie gibt auch an, dass die Basis-Checkpoints nahe am Zufall Zero-Shot liegen, dass die Schlagzeile 0,766 typed-decisions Zahl Fine-Tuning auf dem eigenen Split dieses Benchmarks erfordert, dass ordinale Score Fragen das schwächste Primitiv sind (SST-5 0,372), dass Auswahlfragen mit hoher Kardinalität darunter leiden, weil 77 Optionen jeweils nur etwa drei oder vier Tokens übrig lassen, dass noul seinen eigenen Labels folgen kann, und dass das action.act_probability Feld "trägt noch kein nutzbares Signal" bei AUROC 0,30. Convais eigener Zusammenfassungssatz ist derjenige, der in jede Bewertung mitgenommen werden sollte: Laya ist eine schnelle Basis zum Spezialisieren, keine Zero-Shot-Entscheidungs-Engine.
Diese Offenheit ist wertvoller, als sie klingt, denn sie sagt Ihnen genau, wofür Laya gedacht ist. Es ist ein Encoder, den Sie mit Ihren eigenen Labels feinabstimmen – die gesamte Architektur ist so gebaut, dass neue Schemas kein Retraining benötigen, gute Leistung bei einer Aufgabe aber schon. So eingesetzt sind die veröffentlichten Werte stark: 0,766 gegenüber Jevs 0,727 bei typisierten Entscheidungen nach dem Fine-Tuning, AG News 0,950 gegenüber 0,910, DAIR Emotion 0,595 gegenüber 0,480 und ECE 0,081 gegenüber Jevs 0,246 – mit dem ehrlichen Hinweis, dass es zu selbstsicher ausgeliefert wird und eine Temperatur-Neuanpassung braucht, wodurch sich der mittlere ECE von 0,466 auf 0,081 verschiebt.
Microsoft veröffentlicht die Methodik und hält das Ergebnis zurück.
Die Foundry-Seite von Microsoft-Decision-1 führt dieselbe Übung in die andere Richtung durch. Sie beschreibt die Evaluierung ausführlich – öffentliche und gemeinschaftliche Entscheidungs-Benchmarks sowie zurückgehaltene interne Datensätze, Metriken einschließlich Genauigkeit und Kalibrierungsfehler, variierte Optionsreihenfolge, gepaarte statistische Tests, identische Testumgebung für verglichene Modelle – und berichtet, dass das Modell "auf Augenhöhe mit führenden Entscheidungsmodellen und vor anderen offenen Entscheidungsmodellen abschneidet, die mit derselben Methodik evaluiert wurden." Es nennt seine Stärken (Schlussfolgern, Regelanwendung, Robustheit gegenüber Prompt-Formatierung) und seine Schwächen (spezialisiertes Domänenwissen, nicht-englische Sprachen).
Und dann gibt es nichts aus. Kein Genauigkeitswert, kein Kalibrierungsfehler, keine Tabelle pro Benchmark. Die selbstberichteten Einschränkungen sind real und nützlich — Ergebnisse verschieben sich mit Formulierung und Optionsreihenfolge, eine schlecht formulierte Frage liefert immer noch eine Punktzahl, die Kalibrierung ist am stärksten bei vertrauten Aufgabentypen, es werden keine Erklärungen erzeugt — aber eine Liste von Einschränkungen ist keine Messung. Der Deal ist also ungewöhnlich klar: Laya gibt Ihnen Zahlen, die Sie mit Ihren eigenen Daten zu falsifizieren versuchen können, und Microsoft gibt Ihnen eine Compliance-Haltung und einen 32K-Kontext, in den Sie ein langes Dokument hineinlegen können.

Was der Größenunterschied tatsächlich bringt
Layas geringe Größe ist hier kein Kompromiss, sondern das Design. Weil jede Option an ihrem eigenen [MASK]-Token bewertet und über die Optionen dieser Frage softmax-normalisiert wird, wird der Antwortraum zur Anfragezeit zusammengesetzt, statt in einen Vokabular-Head eingebacken zu sein — weshalb ein Schema, das Sie heute Nachmittag erfinden, kein Retraining benötigt, und weshalb das Modell in 322 bis 421 Millionen Parameter passt. Der mehrsprachige Checkpoint läuft etwa 2,2-mal schneller als der englische, der Router erkennt das Schriftsystem in unter einer halben Millisekunde, und der Batch-Durchsatz erreicht 103 bis 332 Fragen pro Sekunde auf einer T4. Für eine Arbeitslast, die jedes Ticket, jedes abgerufene Dokument oder jede vorgeschlagene Aktion bewertet, ist dieser Durchsatz das Entscheidende, nicht die Parameteranzahl.
Die Kosten dieses Designs sind ebenso konkret und es lohnt sich, sie gegenüber Microsofts Alternative zu nennen. Der englische Checkpoint nutzt ein 512-Token-Fenster; der mehrsprachige 1.024, erweiterbar in Richtung 8K. Microsoft-Decision-1 nutzt 32.768. Ein langer Support-Thread, ein vollständiger Vertrag oder ein mehrseitiges Richtliniendokument passt überhaupt nicht in Layas Fenster, und keine noch so hohe Geschwindigkeit wiegt die Trunkierung auf. Laya beantwortet ein Fragenset pro Forward-Pass mit einem dokumentierten Token-Budget pro Option; Microsoft dokumentiert einen einzelnen Aufruf über bis zu 32K Token ohne Obergrenze pro Frage. Und Layas wettbewerbsrelevante Schwachstelle als Klassifikator sollte man kennen: Laya erzielt 0,425 bei Banking77 gegenüber Jevs 0,870, was die Art von feingranularem Intent-Problem mit hoher Kardinalität ist, bei dem ein Spezialisierungslauf am meisten zählt.

Der Kostenvergleich, der nicht pro Token erfolgt
Laya ist bei der Nutzung kostenlos – selbst gehostet, Apache 2.0, mit einem angegebenen Selbsthosting-Preis von „$0“ – und sein wahrer Preis ist der Fine-Tuning-Lauf, den man ihm schuldet, bevor es für Ihre Aufgabe gut ist. Microsoft-Decision-1 ist eine gehostete Foundry-API mit einem Pro-Token-Tarif, der nicht auf der Modellseite steht, keinen Gewichten zum Herunterladen, keinem Fine-Tuning-Pfad und deaktivierter Batch-Inferenz. Das eine ist ein im Voraus durchzuführendes Data-Labeling-Projekt, das andere ein nach Verbrauch abgerechneter Aufruf. Was günstiger ist, hängt ganz vom Volumen ab, und der Übergangspunkt liegt hoch: Ein 421M-Encoder, der auf einer gemieteten T4 300 Elemente pro Sekunde bewertet, ist pro Entscheidung kaum zu schlagen, sobald er trainiert wurde.
Hier verdient OrcaRouter seinen Platz in einer Pipeline, die auf einem der beiden Modelle aufbaut, und zwar ausschließlich auf der generativen Seite. Wir hosten weder Microsoft-Decision-1 noch Laya: Beide liefern Wahrscheinlichkeiten statt Text, keines steht in unserem Katalog, und ein Scoring-Endpunkt ist kein Chat-Completions-Ziel. Was wir bereitstellen, ist das Modell, das das zu bewertende Objekt erzeugt – die Entwurfsantwort, den vorgeschlagenen Tool-Aufruf, die Kandidatenantwort, die Layas feinabgestimmter Head anschließend beurteilt. Das sind mehr als 200 Modelle hinter einem einzigen OpenAI-kompatiblen Schlüssel zum Listenpreis des Anbieters, durchgereicht mit 0 % Aufschlag, mit automatischem Failover, wenn ein Serving-Pfad beeinträchtigt wird. In einer Schleife, die alles bewertet, was sie erzeugt, ist der Generierungsaufruf der Teil, der ausfallen kann, und Failover hält die Bewertungswarteschlange am Laufen.

Welches soll man wählen?
Nimm Laya, wenn deine Entscheidungen in vielen Sprachen eintreffen, wenn dein Volumen hoch genug ist, dass die Preisgestaltung pro Token eine Rolle spielt, wenn du Labels und eine Woche zum Fine-Tuning hast, oder wenn du Scoring auf Hardware innerhalb deiner eigenen Grenze ausführen musst. Akzeptiere das Fenster von 512 bis 1.024 Token und die Tatsache, dass der Basis-Checkpoint nahe am Zufall liegen wird, bis du ihn spezialisierst, und du bekommst ein Entscheidungsmodell, das ehrlich dazu steht, ein Ausgangspunkt zu sein.
Wählen Sie Microsoft-Decision-1, wenn es bei Ihren Eingaben um lange Dokumente statt um Tickets geht, wenn Ihr Deployment-Gate Azure-Authentifizierung, einheitliche Abrechnung und ein Responsible-AI-Paket statt eines Downloads ist, wenn 25 Sprachen Ihren Traffic abdecken, oder wenn Sie das Modell lieber gar nicht selbst besitzen möchten. Akzeptieren Sie, dass Sie seine erste Kalibrierungskurve selbst zeichnen werden, und planen Sie einen Nachmittag mit einer gelabelten Stichprobe dafür ein – denn anders als Laya wird Ihnen dieses hier kein ECE liefern, über das Sie streiten können.
