Eine generierte Titelkarte mit der Aufschrift „Jev vs Laya“ über dem Untertitel „33 Millisekunden auf einer T4 und eine zufällige Baseline“, die Jev (geschlossen, gehostet, Zero-Shot-Entscheidungsengine, 0,727) gegen Laya (Apache 2.0, 421M ModernBERT, läuft lokal, 0,362 Zero-Shot) gegenüberstellt.
Engineering & Research

Jev vs. Laya: 33 Millisekunden auf einer T4 und eine zufällige Baseline

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Layas Model Card enthält den Satz, der diesen Vergleich entscheidet, und er wurde von den Leuten geschrieben, die Laya entwickelt haben. „Laya ist eine schnelle Basis zum Spezialisieren, keine Zero-Shot-Entscheidungs-Engine.“ Convai Innovations veröffentlichte Laya am 18. September 2026, drei Tage nachdem TypeSafe AI Jev gestartet hatte, unter Apache 2.0, mit Gewichten auf Hugging Face und einem pip install laya-Einstiegspunkt. Laya beantwortet typisierte Fragen in einem einzigen Vorwärtsdurchlauf, ohne Token-für-Token-Dekodierung, was dieselbe architektonische Wette ist, die Jev eingeht. Die plakative Behauptung ist eine p50-Latenz von 32,8 Millisekunden pro Entscheidung auf einer Tesla T4, dargestellt als ungefähr 7,8-mal schneller als Jevs veröffentlichte p50 von 236–276 ms über seine gehostete API. Die Behauptung stimmt, und sie vergleicht außerdem zwei verschiedene Dinge – eine lokale GPU mit einem Netzwerkaufruf –, und das Genauigkeitsbild darunter ist der Teil, der bestimmen sollte, ob Sie es herunterladen. Im Zero-Shot-Modus erreicht Laya 0,362 im Typed-Decisions-Benchmark von TypeSafe. Zufälliges Raten erreicht 0,318. Die Majority-Class-Baseline erreicht 0,461. Laya liegt ab Werk näher am Zufall als an der trivialen Baseline.

Was Laya eigentlich ist

A screenshot of the TypeSafe AI documentation for Jev, showing the typed Choice, Score and Noul primitives, the calibrated probability per answer, free output, and the roughly 32,000-token request budget.

Laya wird als zwei Checkpoints hinter einem integrierten Router ausgeliefert, der jede Eingabe an den richtigen weiterleitet. Der englische Checkpoint ist ModernBERT-large mit 421 Mio. Parametern und einem Kontext von 512 Token. Die mehrsprachige Variante ist mmBERT-base mit 322 Mio. Parametern und einem Fenster von 1.024 Token über mehr als 100 Sprachen. Beide sind nicht-autoregressiv: Ein einzelner Vorwärtsdurchlauf liefert die Antwort, es gibt also keine Decodierungsschleife, kein JSON zum Parsen und keinen Raum, um Text außerhalb des deklarierten Typs auszugeben. Diese letzte Eigenschaft ist dieselbe strukturelle Garantie, die Jev bietet, nur aus einer anderen Richtung erreicht, und sie ist wirklich wertvoll für alle, die Wiederholungslogik um ein Modell herum geschrieben haben, das gelegentlich vergisst, eine geschweifte Klammer zu schließen.

Jev ist das geschlossene Gegenstück: das erste System-One-Modell von TypeSafe AI, eingeführt am 15. September 2026, gehostet und im Early Access, mit drei typisierten Primitiven – Choice aus einer von Ihnen bereitgestellten Liste, Score anhand eines geordneten Bewertungsrasters und Noul, eine Ja/Nein-Aussage mit kalibrierter Wahrscheinlichkeit. Alle Fragen werden parallel gegen einen gemeinsamen Lesezugriff auf den Zustand ausgewertet, die Ausgabe ist kostenlos, da es keine Ausgabe-Tokens gibt, und die Eingabe kostet 0,042 $ pro Million Tokens. Architektur, Parameteranzahl und Trainings-Compute werden nicht offengelegt, und TypeSafe hat erklärt, dass die Details unter Verschluss gehalten werden, wobei möglicherweise später ein Paper folgt.

Die Latenzbehauptung, korrekt gemessen

Layas 32,8 ms p50 auf einer T4 sind eine echte Zahl – und eine gute. Der 7,8-fache Vergleich mit Jevs 236–276 ms ist der Punkt, an dem Vorsicht nötig ist, und Layas eigene Karte ist ungewöhnlich ehrlich darüber, warum: Die Jev-Werte sind von Dritten veröffentlichte Zahlen, die Convai nie selbst gemessen hat, und der Vergleich stellt einen lokalen GPU-Forward-Pass einem gehosteten API-Aufruf gegenüber, der Netzwerk-Roundtrip und Warteschlangen einschließt. Rechnet man das Netzwerk heraus, steht beim architektonischen Vergleich ein Single-Pass-Modell mit 421 Mio. Parametern einem anderen mit einer nicht offengelegten Größe gegenüber, die TypeSafe nie veröffentlicht hat.

Es gibt außerdem eine Batch-Kennzahl, die man kennen sollte: Bei einem Batch von zehn meldet Laya 7,2 ms pro Frage. Das ist die Form des Produkts. Laya ist darauf ausgelegt, lokal in großem Umfang ausgeführt zu werden, und On-Device-Community-Ports wie laya-mlx erweitern das auf Apple Silicon. Virale Behauptungen, „50-mal schneller als Jev“ zu sein, werden durch die vom Projekt selbst veröffentlichten Benchmarks nicht gestützt, und die ehrliche Einordnung ist eine große Kluft zwischen lokalem Betrieb und Cloud, die teils architektonisch bedingt und teils einfach der Unterschied zwischen der eigenen GPU und der API von jemand anderem ist.

Was die Genauigkeitszahlen in der Reihenfolge aussagen

Hier hört der Vergleich auf, schmeichelhaft zu sein, und es lohnt sich, ihn der Reihe nach darzulegen, weil die Reihenfolge wichtig ist.

• Zero-Shot auf dem typed-decisions-Benchmark von TypeSafe — Laya 0,362, Zufall 0,318, Mehrheitsklasse 0,461, Jev 0,727. Laya liegt über dem Zufallsniveau und unter der trivialen Baseline.

• Feinabgestimmt auf dem eigenen Trainings-Split des Benchmarks — Laya 0.766 gegenüber Jevs 0.727. Laya gewinnt, und der Sieg stammt von einem Checkpoint, der die Trainingsdaten des Benchmarks gesehen hat, was es zu einer Aussage über das Fine-Tuning macht, nicht über das Basismodell.

• Banking77-Intent-Klassifizierung, bei der die Optionsmenge groß ist — Laya 0,425 gegenüber Jevs 0,870. Laya verschlechtert sich stark jenseits von etwa 20 Optionen, und Jevs Choice-Felder sind dafür dokumentiert, bis zu 255 zu verarbeiten, bevor das zweistufige Scoring-Muster benötigt wird.

• Kalibrierung — Laya kommt mit einem mittleren erwarteten Kalibrierungsfehler von 0,466, der sich erst nach einer Temperatur-Neuanpassung pro Fragetyp auf 0,081 verbessert. Jev wird mit einer Methode trainiert, die TypeSafe RLCD nennt, Reinforcement Learning for Calibrated Decisions, und liefert zu jeder Antwort eine Wahrscheinlichkeitsverteilung — allerdings rät TypeSafe Nutzern auch, Schwellenwerte anhand ihrer eigenen gelabelten Daten zu validieren, und ein unabhängiges Audit ergab, dass Jevs Kalibrierung je nach Aufgabe stark schwankt.

Das Muster ist eindeutig. Laya ist eine starke Basis zum Fine-Tuning und eine schwache Zero-Shot-Entscheidungsengine, und das sagt sie selbst. Jev ist eine starke Zero-Shot-Entscheidungsengine, deren Kalibrierung für jede Bereitstellung noch überprüft werden muss. Das sind unterschiedliche Produkte mit unterschiedlichen Preisstrukturen, und die Wahl zwischen ihnen ist hauptsächlich eine Frage dessen, ob man gelabelte Daten und eine Trainingsschleife hat.

Die Kostenarithmetik hat nicht dieselbe Form wie die von Jev.

Jev kostet $0,042 pro Million Eingabe-Tokens, wobei die Ausgabe kostenlos ist, was $42 pro Milliarde entspricht, und ein Aufruf maximaler Größe bei dem dokumentierten Anfragebudget von ca. 32.000 Tokens kostet deutlich unter einem Cent. Der unabhängige Test von Every bezifferte 777 Beurteilungen über 37 Dokumente hinweg auf rund einen Viertelcent.

Die Kosten pro Aufruf von Laya sind marginal null und aggregiert nicht null, und die Summe ist nicht klein. Ein Modell mit 421 Mio. Parametern auf einer T4 ist günstig im Betrieb und belegt trotzdem eine GPU, und der Fine-Tuning-Schritt, der Laya wettbewerbsfähig macht, ist der Punkt, an dem die eigentlichen Ausgaben anfallen – die Datenkennzeichnung, der Trainingslauf, der Evaluierungs-Harness und die Neuanpassung der Temperatur pro Fragetyp, die ihren Kalibrierungsfehler von 0,466 auf 0,081 senkt. Bei einer festen Taxonomie, die sich nie ändert, sind das einmalige Kosten, die sich bei Volumen amortisieren. Bei einer Taxonomie, die driftet, sind sie wiederkehrend, und Jevs Zero-Shot-Baseline von 0,727 wird zu einem deutlich besseren Geschäft.

Es gibt einen dritten Kostenfaktor, der leicht übersehen wird: Layas englischer Checkpoint hat ein Kontextfenster von 512 Tokens. Das ist kein Entscheidungsmodell mit einem kleinen Kontextbudget – es ist ein Entscheidungsmodell, das für einen Absatz dimensioniert ist. Jevs Anfragebudget von etwa 32.000 Tokens ist sechzigmal so groß, und selbst das liegt um eine Größenordnung unter den generativen Modellen, gegen die beide bepreist werden. Wenn dein Zustand ein Support-Thread und nicht eine einzelne Support-Nachricht ist, ist keines der Fenster der beiden Modelle die Einschränkung, gegen die du optimieren solltest.

Die Frage der Bereitstellung ist der eigentliche Unterschied

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window and the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 on a T4, and the pip install entry point.

Layas stärkstes Argument ist nicht die Latenz. Es ist, dass Apache-2.0-Gewichte auf Hugging Face bedeuten, dass die Entscheidung niemals Ihre Infrastruktur verlässt und der Endpunkt niemals ein Rate-Limit hat. Für eine Routing-Entscheidung, die auf einer Patientenakte, einem Rechtsdokument oder der Kontohistorie eines Kunden basiert, ist das keine Präferenz – es ist der ausschlaggebende Faktor, und kein gehosteter Endpunkt kann dieses Argument zu irgendeinem Preis für sich entscheiden. Jev von TypeSafe befindet sich im Early Access und auf der Warteliste, und die eigene Dokumentation weist darauf hin, dass sich Rate-Limits ohne Vorankündigung ändern können.

Das Gegenargument ist, was man dafür aufgibt. Jevs nicht offengelegte größere Architektur leistet die Arbeit, die Layas 421 M Parameter nicht leisten können: Die Zero-Shot-Lücke von 0,727 gegenüber 0,362 und die Banking77-Lücke von 0,870 gegenüber 0,425 sind beides Maße dafür, wie viel Wissen im Modell steckt, bevor man es trainiert. Layas Antwort ist, dass man dieses Wissen selbst durch Fine-Tuning bereitstellt, und in einer eng begrenzten, festen Domäne funktioniert diese Antwort — das feinabgestimmte Ergebnis von 0,766 ist der Beweis.

Wo die Entscheidungsschicht in einem echten Stack sitzt

Keines der beiden Modelle erzeugt Text, daher ist keines für sich genommen der gesamte Workflow. Das Muster, für das beide konzipiert sind, besteht aus zwei Modellen: einer Entscheidungsschicht, die den typisierten Aufruf ausführt, und einem generativen Modell, das den Teil übernimmt, für den Prosa, Code oder eine Erklärung nötig ist. OrcaRouter bedient weder Jev noch Laya — Jev ist der Early-Access-Endpunkt von TypeSafe und Laya sind Gewichte, die Sie selbst betreiben —, aber die generative Hälfte dieses Musters ist genau das, was wir abdecken: über 200 Modelle hinter einem einzigen OpenAI-kompatiblen Schlüssel zum Listenpreis des Anbieters, ohne Aufschlag weitergegeben, sodass eine Preisänderung eines Anbieters bei uns noch am selben Tag live ist. Die Zwei-Modell-Architektur ist ohne einen zweiten Anbietervertrag testbar, und dank automatischem Failover wird der generative Pfad nicht zum Single Point of Failure, während Sie entscheiden, ob die günstige Entscheidungsschicht gut genug kalibriert ist, um darauf zu automatisieren.

Das Urteil

Wenn Sie eine feste, enge Taxonomie, gelabelte Beispiele und eine Datenschutz- oder Latenzanforderung haben, die eine gehostete API ausschließt, ist Laya die verteidigungsfähigere Wahl, und die Fine-Tuning-Zahlen stützen sie. Wenn die Entscheidung out of the box funktionieren muss, wenn Ihre Optionssätze über zwanzig Kategorien hinausgehen oder wenn der Zustand länger als ein Absatz ist, sagt Ihnen Layas eigene Modellkarte, dass es nicht das Produkt für diese Aufgabe ist — und der Zero-Shot-Score von 0,362 gegenüber einer Mehrheitsbaseline von 0,461 ist die Zahl, die Sie im Auge behalten sollten, wenn jemand Ihnen gegenüber die 7,8-fache Latenzzahl anführt.

Was die beiden gemeinsam haben, ist nützlicher als das, was sie trennt. Beide beseitigen die Fehlerklasse, die aus der Ausgabeformatierung entsteht, und tun nichts gegen die Klasse, die aus dem Urteilsvermögen entsteht. Beide liefern Wahrscheinlichkeiten mit, und keines hat ein veröffentlichtes Reliabilitätsdiagramm, dem man ohne Prüfung vertrauen kann. Testen Sie die Kalibrierung an Ihren eigenen gelabelten Fällen, bevor Sie gegen eines der beiden automatisieren — die Latenz ist bereits zur Ware geworden, und der Konfidenzwert ist der Teil, der pro Deployment verdient werden muss.

A generated two-column scoreboard comparing Jev and Laya across the same six labelled dimensions, with a footer reading "Laya zero-shot vs random 0.318 and majority baseline 0.461; per Laya's own model card."