
Laya vs von: Wenn der Anbieter-Benchmark nicht übertragbar ist
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
Eine Aufgabe zur Klassifizierung von Commit-Typen mit sechs möglichen Labels, bei der Raten 8,3 % bringt und von 26,7 % erzielt. Eine Datei-Routing-Aufgabe, bei der dasselbe Modell 8,8 % erreicht, kaum über dem Zufall. Eine binäre Aufgabe zur Änderungsbreite mit einer AUC von 0,513, was einem Münzwurf gleichkommt. Diese Zahlen stammen aus einer Drittanbieter-Evaluierung von von – dem quelloffenen System One-Modell von wfzyx, einem 395M-ModernBERT-Large-Encoder, veröffentlicht unter Apache 2.0 am 18. September 2026, am selben Tag wie Laya von Convai Innovations. Auf vons eigenem jabr v2 Benchmark ist das Bild das Gegenteil: 71,5 % Makro-Genauigkeit über 49 Aufgaben und 869 Fälle, Choice-Routing bei 83,4 % und ein ViZDoom-Ergebnis von 9,38 durchschnittlichen Kills bei unter 18 ms gegenüber Jev von TypeSafe AI mit 5,62 Kills und ungefähr 115 ms. Beide Zahlensätze sind echt. Der Abstand zwischen ihnen ist das Nützlichste, was je über diese Modellkategorie veröffentlicht wurde, und er gilt auch für Laya.
Zwei Modelle, zwei Backbones, ein gemeinsamer Fehlermodus
von und Laya sind architektonisch nahe Nachbarn, weshalb das Transferproblem die richtige Linse für ihren Vergleich ist. Beide sind nicht-autoregressive Encoder auf Basis von ModernBERT: von mit 395 Mio. Parametern, Layas englischer Checkpoint mit 421 Mio. Beide stellen dieselben drei Primitive bereit — choice aus einer vorgegebenen Liste, score auf einem geordneten Bewertungsraster, noul als kalibrierte Ja-Wahrscheinlichkeit — und beide implementieren das /v1/systemone Wire-Format, sodass ein für TypeSafe's Jev geschriebener Client stattdessen auf einen lokalen Server zeigen kann. Beide sind Apache 2.0. Beide liefern Wahrscheinlichkeiten statt Text zurück, und keiner hat eine Decodierungsschleife, in der halluziniert werden könnte.

Die Unterschiede liegen in der Trainingsgeschichte. von wurde auf 2 Billionen Token aus allgemeinem Webtext, technischer Literatur und Code vortrainiert und anschließend auf einem ausgewogenen Multi-Domain-Korpus mit rund 290.000 Beispielen feinabgestimmt, der operative und Unternehmensworkflows, Sicherheit und DevOps, Safety- und Policy-Moderation, Linguistik, Triage und adversarielles Reasoning umfasst. Das Post-Training nutzte Reinforcement Learning with Calibration Distribution, wobei eine Kombination aus Cross-Entropy und Brier-Score mit lambda bei 0,5 minimiert wurde; Temperature Scaling konvergierte bei T=1,1692. Layas englischer Checkpoint ist ModernBERT-large, feinabgestimmt auf die typed-decision-Form, mit einem 512-Token-Fenster, zusammen mit einem mehrsprachigen 322M-mmBERT-base-Checkpoint, der hinter einem Router 100+ Sprachen abdeckt, sowie einer veröffentlichten p50 von 32,8 ms pro Entscheidung auf einer Tesla T4.
Der gemeinsame Fehlermodus ist, dass beide keine Reasoner, sondern Encoder sind, die darauf trainiert wurden, einen Readout zu erzeugen. In vons eigenem README steht ausdrücklich, dass es auf latenzempfindliche Pipelines abzielt, in denen autoregressive Modelle 500–2.000 ms Verzögerung und nichtdeterministische Schema-Parsing-Fehler verursachen. Diese Einordnung sagt Ihnen, wofür es gedacht ist: schnelle, deterministische, statistisch kalibrierte Klassifikation. Sie sagt Ihnen nicht, dass es für Ihre Klassifikation funktionieren wird, und der unabhängige Benchmark ist das, was passiert, wenn jemand nachprüft.
Vons eigenen Benchmark ehrlich lesen
Die jabr v2-Ergebnisse sind vom Eigentümer veröffentlicht und wurden nicht unabhängig geprüft, und die Form des Benchmarks ist ebenso wichtig wie die Punktzahl. Neunundvierzig Aufgaben und 869 Fälle sind eine angemessene Breite für eine Entscheidungsmodell-Evaluierung, und 71,5 % Makro-Genauigkeit sind eine starke Zahl für einen 395M-Encoder. Die Aufschlüsselung nach Domänen ist, wo es informativ wird: Symptom-Triage bei 100,0 %, Home Services bei 95,7 %, City Routing bei 94,7 %, Choice Routing insgesamt bei 83,4 %. Das sind die Aufgaben, um die herum der Trainingskorpus aufgebaut wurde – die README beschreibt die Fine-Tuning-Daten als operative und Unternehmens-Workflows, Sicherheit und DevOps, Sicherheit und Policy-Moderation, Linguistik, Triage und adversariales Reasoning. Eine hohe Punktzahl bei der Symptom-Triage ist eine Aussage, dass das Modell die Triage-Domäne gelernt hat, nicht dass es gelernt hat zu klassifizieren.

Das ViZDoom-Ergebnis ist dasjenige, das am häufigsten zitiert wird, und es verdient eine sorgfältige Lektüre. Durchschnittlich 9,38 Kills in „Defend the Center“, acht Seeds, Zero-Shot aus strukturiertem Szenentext, bei einer Latenz von unter 18 ms, gegenüber Jevs 5,62 Kills bei rund 115 ms — eine Verbesserung von +66,9 %. Es ist ein beeindruckendes Ergebnis, und es ist zugleich eine von strukturiertem Text gesteuerte Spielumgebung, in der eine schnelle reflexive Policy genau die richtige Form hat. Die Einordnung des System-One-Paradigmas durch das Projekt — reflexiv, parallel, deterministisch, statistisch kalibriert — ist eine zutreffende Beschreibung dessen, was diese Aufgabe belohnt.
Dann führte die Drittanbieter-Evaluation eine Bewertung von Commit-Typ-Klassifikation, Datei-Routing, Feature-Erkennung und Change-Breadth-Scoring durch, und bei einigen davon verlor sie gegen Keyword- und Regex-Baselines. Ein AUC von 0,513 bei der binären Aufgabe ist die deutlichste Zahl: ein Münzwurf, von einem Modell, dessen Kalibrierung auf T=1,1692 abgestimmt wurde und dessen README einen nahezu idealen erwarteten Kalibrierungsfehler behauptet. Beides kann gleichzeitig stimmen. Ein Modell kann auf der Verteilung, auf der es trainiert wurde, gut kalibriert und auf einer Verteilung, die es noch nie gesehen hat, nutzlos sein – und tatsächlich ist eine gute Kalibrierung auf der falschen Verteilung schlimmer als eine offensichtlich schlechte Kalibrierung, weil die Konfidenzwerte vertrauenswürdig aussehen.
Derselbe Test auf Laya angewendet
Laya wurde einer Version dieser Behandlung unterzogen, und die Ergebnisse stimmen mit denen von von überein. Beim typed-decisions-Benchmark von TypeSafe erzielt Laya 0,362 Zero-Shot gegenüber 0,318 für Zufall und 0,461 für die Mehrheitsklassen-Baseline – näher am Zufall als an der trivialen Antwort. In der eigenen Modellkarte steht die Schlussfolgerung: „Laya ist eine schnelle Basis zum Spezialisieren, keine Zero-Shot-Entscheidungsengine.“ Ab etwa zwanzig Optionen verschlechtert sie sich stark und erzielt 0,425 bei Banking77 gegenüber Jevs 0,870. Bei 100 Mars-base-Dringlichkeitsnachrichten in einem Drittanbietertest erzielte Jev 100/100 und Laya 53/100. In einem Browser-Agent-Benchmark erledigte sie 0 von 50 Aufgaben und erklärte in 33 Versuchen vorzeitig den Abschluss, 17 davon, bevor sie irgendeine Aktion unternahm – obwohl die Benchmark-Autoren anmerken, dass sie für Beurteilungsarbeit wie Support-Tickets und Rechnungen trainiert wurde, nicht für Navigation, was eine Aussage zum Anwendungsbereich statt eines Urteils ist.
Der Unterschied zwischen Laya und von liegt darin, was Laya für sich selbst beansprucht. Convai veröffentlichte die wenig schmeichelhafte Zero-Shot-Zahl und den erwarteten Kalibrierungsfehler von 0,466 auf der Modellkarte, neben dem Wert von 0,081, den das Temperatur-Refitting pro Fragetyp erzeugt. vons README veröffentlicht die schmeichelhafte Zahl von jabr v2 und den ViZDoom-Sieg. Beide Projekte sind ehrlich darüber, was sie getan haben; nur eines von ihnen stellt einen Benchmark voran, bei dem das Modell schlecht abschneidet. Das ist eine Beobachtung zur Quellenlage, keine Anschuldigung — aber wenn Sie anhand der veröffentlichten Belege zwischen den beiden wählen, bedenken Sie, dass Sie ein Projekt, das Ihnen seine schwache Zahl gezeigt hat, mit einem vergleichen, dessen schwache Zahl Sie anderswo finden mussten.
Der Spezifikationskontrast, Dimension für Dimension
• Backbone — Laya: ModernBERT-large 421M Englisch, mmBERT-base 322M mehrsprachig. Von: ModernBERT-Large 395M.
• Sprachen — Laya: 100+ über den mehrsprachigen Checkpoint und einen Router. von: Englisch, ohne veröffentlichten mehrsprachigen Checkpoint.
• Kontextfenster — Laya: 512 Tokens Englisch, 1.024 mehrsprachig. von: nicht zu denselben Bedingungen veröffentlicht; die jabr v2-Fälle sind kurze strukturierte Entscheidungen.
• Latenz — Laya: 32,8 ms p50 auf einer T4, 7,2 ms pro Frage bei Batch-Größe 10. von: angeblich unter 15 ms bis unter 25 ms, unter 18 ms im ViZDoom-Lauf.
• Angegebene Genauigkeit — Laya: 0,362 Zero-Shot, 0,766 feinabgestimmt auf dem eigenen Split des Benchmarks, 0,425 auf Banking77. von: 71,5 % Makro über die 49 Aufgaben von jabr v2, 83,4 % Choice-Routing und 26,7 % beim Commit-Typ in einem unabhängigen Test.
• Kalibrierung — Laya: ECE 0,466 im Auslieferungszustand, 0,081 nach erneutem Temperatur-Fitting pro Fragetyp. von: Temperatur während des RLCD-Nachtrainings auf T=1,1692 skaliert, behauptete nahezu ideales ECE auf der eigenen Verteilung.
• Serving — Laya: pip install laya, plus ONNX-, Go- und Apple-MLX-Community-Ports. von: Python- und TypeScript-SDKs, ein HTTP-Server via von serve, vorkonfigurierte Presets für Ticket-Triage, E-Mail-Sicherheit, Moderation und Triage von Sicherheitsereignissen.
• Hardware — Laya: CPU, CUDA und Apple MPS. von: NVIDIA CUDA, AMD ROCm, Apple Silicon MPS und Multithread-CPU.
• Lizenz — Apache 2.0 für beide.
Der Teil von „von“, der wirklich unverwechselbar ist
vons komponierbare Muster sind das am wenigsten diskutierte Thema in seinem Repository. Confidence-Gating, Route Dispatch, Composite Scoring und Two-Stage-Routing werden als benannte Muster zusammen mit den Presets ausgeliefert — Ticket-Triage, E-Mail-Sicherheit, Moderation, Triage von Sicherheitsereignissen — und sie kodieren die Architektur, die ein Entscheidungsmodell in der Produktion tatsächlich braucht. Ein einzelner choice-Aufruf ist selten das ganze System; die nützliche Form ist ein günstiger Router der ersten Stufe, der an eine spezialisierte zweite Stufe weiterleitet, mit einem Confidence Gate, das die unsicheren Fälle eskaliert. von liefert das als dokumentiertes Muster, anstatt es Ihnen zu überlassen.
Das passt sauber zu dem, was OrcaRouter auf der generativen Seite macht, was man klar sagen sollte, weil die beiden Hälften des Musters normalerweise von verschiedenen Teams gebaut werden. Weder von noch Laya wird auf OrcaRouter gehostet – beides sind Gewichte, die man herunterlädt und selbst ausführt – und nichts hier sollte als Behauptung gelesen werden, dass wir sie bereitstellen. Auf unserer Liste steht die andere Hälfte: 200+ generative Modelle hinter einem OpenAI-kompatiblen Schlüssel zum Anbieter-Listenpreis, durchgereicht mit 0 % Aufschlag, sodass eine Preissenkung eines Anbieters noch am selben Tag auf Ihrer Rechnung ankommt und nicht erst bei der Verlängerung. Wenn vons Confidence-Gate entscheidet, dass 4 % der Anfragen ein Frontier-Modell benötigen, ist die Routing-DSL das, was diese Entscheidung zu einem einzigen Aufruf zusammensetzt, statt zu zwei Verträgen und zwei SDKs, und automatisches Failover sorgt dafür, dass der teure Zweig kein Single Point of Failure ist.
Was tun mit zwei Modellen, die beide außerhalb ihrer Trainingsverteilung versagen?
Die praktische Schlussfolgerung aus der von-Evaluation ist nicht, dass von ein schlechtes Modell ist. Sie lautet vielmehr, dass die veröffentlichte Genauigkeit eines Entscheidungsmodells eine Aussage über seine Trainingsverteilung ist und dass die einzige Möglichkeit herauszufinden, ob das eigene Problem innerhalb dieser Verteilung liegt, darin besteht, es zu testen. vons eigene Benchmark-Tabelle in der README vergleicht sich selbst mit GLiNER2, einem feinabgestimmten Qwen3.5 4B, Laya und TypeSafe Jev hinsichtlich Größe, Genauigkeit, Latenz und Hosting — eine nützliche Tabelle, und zugleich eine Tabelle, in der jeder Genauigkeitswert außer einem aus dem eigenen Harness des Autors stammt.
Zwischen den beiden: Nimm von, wenn du eine breitere Auswahl veröffentlichter Domains willst, einen etwas kleineren Footprint, vorgefertigte Serving-Muster für Triage und Moderation und die ViZDoom-Belege, dass es schnelle Entscheidungen auf strukturiertem Text gut bewältigt. Nimm Laya, wenn du mehrsprachige Eingaben brauchst — von hat keinen mehrsprachigen Checkpoint und Layas 322M-mmBERT-Variante deckt über 100 Sprachen ab — oder wenn eine T4-Zahl von 32,8 ms und ein englisches 512-Token-Fenster zu deiner Workload passen. Nimm keines von beiden, ohne einen Nachmittag damit zu verbringen, ein paar Hundert Beispiele aus deinem eigenen Traffic zu labeln und beide dagegen laufen zu lassen. Die Dokumentation beider Projekte selbst weist dich auf dieses Experiment hin, und das Drittanbieter-Ergebnis zu von ist das, was passiert, wenn es niemand durchführt.
Das Einzige, was diesen Vergleich ändern würde, ist eine gepaarte Evaluation auf identischen Eingaben mit einem Reliabilitätsdiagramm für jedes Modell. Sie existiert nicht. Solange sie nicht existiert, ist die ehrliche Rangfolge nach Evidenzqualität statt nach Punktzahl: Laya hat seinen schlechtesten Wert veröffentlicht, und von hat seinen besten veröffentlicht, und der unabhängige Test, den von durchlaufen hat, ist für beide das, was einer externen Überprüfung am nächsten kommt.

