Eine generierte Titelkarte für den Vergleich Laya gegen Nimble, die den eigenen Untertitel dieses Artikels trägt sowie eine Fußzeile, die angibt, welche Seite ihre Zahlen vom Anbieter gemeldet hat und welche von Drittanbietern stammen.
Engineering & Research

Laya vs. Nimble: Kontrastive Daten versus einen schnelleren Encoder

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Laya und Nimble sind die beiden Open-Weight-Entscheidungsmodelle, deren Autoren am meisten dazu erklärt haben, wie sie gebaut wurden, und ihre Erklärungen widersprechen sich darin, wo die Schwierigkeit sitzt. Convai Innovations veröffentlichte Laya am 18. September 2026 unter Apache 2.0 – einen englischen 421M-ModernBERT-large-Checkpoint, einen mehrsprachigen 322M-mmBERT-base-Checkpoint, der über 100 Sprachen abdeckt, einen Sub-Millisekunden-Router zwischen ihnen und eine veröffentlichte p50 von 32,8 ms pro Entscheidung auf einer Tesla T4. Bespoke Labs baute Nimble als LoRA-Fine-Tuning auf Qwen3.5-9B, Apache 2.0, und beschreibt es als „das Open-Source-Jev“ – inspiriert von TypeSafe AIs Jev, aber weder dessen Gewichte noch dessen Architektur noch eine Destillation seiner Ausgaben verwendend. Convais Antwort auf das Genauigkeitsproblem sind Geschwindigkeit und eine feinabstimmbare Basis. Bespokes Antwort sind die Trainingsdaten. Dieser Unterschied verdient mehr Aufmerksamkeit als die Drei-Punkte-Genauigkeitslücke, die in den Schlagzeilen-Tabellen auftaucht.

Die Behauptung, die jedes Projekt tatsächlich aufstellt

Layas Behauptung ist architektonischer Natur. Sie ist nicht-autoregressiv im strengen Sinne – ein bidirektionaler Encoder, keine Dekodierschleife, kein JSON zum Parsen, kein Raum, um Text außerhalb des deklarierten Typs auszugeben. Diese strukturelle Garantie ist dieselbe, die Jev bietet, aus einer anderen Richtung erreicht, und sie ist wirklich wertvoll für jeden, der schon einmal Retry-Logik um ein Modell herum geschrieben hat, das gelegentlich vergisst, eine geschweifte Klammer zu schließen. Der Preis dafür ist, dass ein 421-M-Encoder mit einem 512-Token-Fenster und ohne generatives Vortraining dahinter nicht sehr viel weiß. Convai sagt das auf der Modellkarte: „Laya ist eine schnelle Basis zum Spezialisieren, keine Zero-Shot-Entscheidungs-Engine.“

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.A screenshot of the Nimble repository on GitHub, showing the description "Local typed decisions, contrastive data curation, and model evaluation", the README heading "Bespoke Nimble - Data, Model, Recipe for an open Jev", the contrastive example where changing one fact flips the correct answer, and the 2,676-example training split against the frozen 324 held-out set.

Nimbles Behauptung betrifft die Daten. Bespokes Methode ist kontrastive Kuratierung, adaptiert aus der früheren Bespoke-MiniCheck-Arbeit des Teams: Schreibe zwei nahezu identische Beispiele, die sich in einem „Fokus-Fakt“ unterscheiden, sodass das korrekte Label umkippt. Die Pipeline hat vier angegebene Schritte – prüfe, ob die Entscheidungsregeln tatsächlich zu unterschiedlichen Antworten führen könnten, baue das Paar, indem du höchstens acht Wörter änderst, verifiziere beide Beispiele mit separaten Modellaufrufen plus einer Prüfung, bei der jeder Satz entfernt wird, und generiere Labels im Code, während nur die Paare behalten werden, deren Labels sich tatsächlich unterscheiden. Das Ziel sind nicht mehr Beispiele, sondern schärfere: Zwinge das Modell zu lernen, welche Evidenz die Entscheidung ändern sollte. Das ist eine andere Theorie dafür, warum kleine Entscheidungsmodelle scheitern, und sie ist interessanter als ein weiterer Genauigkeitspunkt.

Was die veröffentlichten Zahlen tatsächlich stützen

Nimble berichtet 90,12 % Übereinstimmung mit Referenzlabels bei 324 zurückgehaltenen Stichproben, gegenüber 93,21 % für Jev, 66,36 % für die ungetunte Qwen3.5-9B-Basis und 84,88 % für ein ungetuntes 27B Qwen3.8. Es berichtet ungefähr 106 ms Median auf einer H100 und 444 ms Median auf einem M5 Pro mit 64 GB. Das sind Bespokes eigene Harness-Zahlen. Das Evaluierungsset mit 324 Stichproben ist der Teil, der sorgfältig abgewogen werden muss, und das Projekt sagt selbst, warum: Die Stichproben umfassen sechs der zehn Trainingsquellenfamilien, sie wurden von Modellen ohne menschliche Überprüfung generiert und validiert, und die Generalisierung auf ungesehene Kategorien ist daher unbewiesen. Wenn ein Modell mit einer Datenkuratierungsmethode trainiert und dann auf einem Hold-out-Split derselben kuratierten Verteilung evaluiert wird, ist die Genauigkeitszahl eine Aussage über die interne Konsistenz der Methode, nicht über Ihren Traffic.

Layas Zahlen kommen vom anderen Ende. Beim TypeSafe-Benchmark für typisierte Entscheidungen erreicht es 0.362 Zero-Shot – Zufall liegt bei 0.318, die Mehrheitsklassen-Baseline bei 0.461 – und 0.766, wenn es auf dem eigenen Trainings-Split des Benchmarks feinabgestimmt wird. Bei Banking77, 77 Labels, erreicht es 0.425 gegenüber Jevs 0.870, was die schärfste Illustration seiner Obergrenze bei vielen Optionen ist. Bei AG News mit vier Labels erreicht es 0.950 gegenüber Jevs 0.910; bei DAIR Emotion mit sechs Labels 0.595 gegenüber 0.480. Sein Kalibrierungsfehler liegt ab Werk bei 0.466 und fällt auf 0.081 nach einer Temperatur-Neuanpassung je Fragetyp. Ein Test eines Drittanbieters mit 100 Mars-base-Dringlichkeitsnachrichten ergab Jev bei 100/100 und Laya bei 53/100. Und in einer unabhängigen Evaluierung von Agent-Tool-Calls erzielte Laya 100 % Ablehnungs-Recall bei gefährlichen Aufrufen, aber nur, indem alles geflaggt wurde – was ein Präzisionsfehler ist, der als Sicherheitsgewinn getarnt ist.

Setze die beiden Zahlenreihen nebeneinander, und die ehrliche Lesart ist, dass sie an unterschiedlichen Dingen gemessen wurden. Nimbles 90,12 % geben die Übereinstimmung mit den eigenen kuratierten Referenzlabels an. Layas 0,362 ist ein Benchmark, den Laya nicht selbst erstellt hat. Keine der beiden Zahlen ist übertragbar.

Kalibrierung: die einzige Stelle, an der beide Projekte ungewöhnlich offen sind

Hier sind sich die beiden Projekte im Geiste am nächsten und im Ergebnis am weitesten voneinander entfernt.

Bespokes README warnt ausdrücklich davor, dass Nimbles Wahrscheinlichkeiten softmax-normalisierte Logits über die bereitgestellten Kandidaten sind, keine kalibrierten Korrektheitsraten – eine 0,9 bedeutet nicht 90 % korrekt. Es empfiehlt, eine Option „keine der oben genannten“ hinzuzufügen, denn wenn die richtige Antwort nicht unter den Kandidaten ist, gewinnt trotzdem einer von ihnen. Bei einer neueren Evaluierung mit 3.880 Datensätzen über 13 Teilmengen hatte Jev in 11 von 13 Teilmengen einen niedrigeren berichteten Kalibrierungsfehler und in 10 von 13 einen niedrigeren Brier-Score. Ähnliche Label-Übereinstimmung impliziert also keine ähnliche Wahrscheinlichkeitsqualität, und Bespoke sagt das auch.

Die Offenlegung von Convai ist das Spiegelbild: Der erwartete Kalibrierungsfehler von 0,466 steht auf der Karte, direkt neben den 0,081, die eine Temperatur-Neuanpassung pro Fragetyp erzeugt. Keines der beiden Projekte liefert ein Modell, auf dessen Konfidenz man ohne Arbeit handeln kann. Beide sagen Ihnen das schriftlich. Wenn Sie einen Konfidenzschwellenwert aufbauen — automatische Freigabe oberhalb von 0,95, Eskalation unterhalb von 0,7 —, sagen Ihnen die Dokumentationen beider Autoren dasselbe: Legen Sie den Schwellenwert zuerst anhand Ihrer eigenen gelabelten Daten fest.

Der Vergleich, Dimension für Dimension

• Backbone — Laya: ModernBERT-large 421M-Encoder, bidirektional, kein generatives Pretraining. Nimble: Qwen3.5-9B mit einem LoRA-Fine-Tuning, generative Basis beibehalten.

• Sprachen — Laya: 100+ über den mehrsprachigen 322M-Checkpoint. Nimble: Englisch.

• Prompt-Budget — Laya: 512 Tokens Englisch, 1.024 mehrsprachig. Nimble: maximal 2.048 Tokens pro Prompt, nur flache Schemas, Enums auf 26 Optionen pro Feld begrenzt.

• Geschwindigkeit — Laya: 32,8 ms p50 auf einer T4, 7,2 ms pro Frage in Batches von 10. Nimble: etwa 106 ms Median auf einer H100, 444 ms auf einem M5 Pro 64GB.

• Hardware — Laya: CPU, CUDA und Apple MPS; unter einem Gigabyte resident auf dem MLX-Port. Nimble: BF16-CUDA-GPU für die angegebenen Werte, mit Unterstützung für MLX- und CUDA-Pfade.

• Angegebene Genauigkeit — Laya: 0,362 Zero-Shot, 0,766 feinabgestimmt, 0,425 auf Banking77. Nimble: 90,12 % bei 324 kuratierten Hold-out-Stichproben gegenüber Jevs 93,21 %.

• Methode — Laya: Architektur zuerst, Feinabstimmung pro Deployment. Nimble: kontrastive Datenkuration, als Rezept veröffentlicht.

• Lizenz — Apache 2.0 für beide.

Zwei Einschränkungen in dieser Liste verdienen es, zweimal gelesen zu werden, bevor Sie sich festlegen. Nimbles Obergrenze von 26 Optionen pro Enum und die Prompt-Obergrenze von 2.048 Token sind harte Schema-Grenzen, keine Leistungseinbußen – wenn Ihre Taxonomie vierzig Labels hat oder Ihr Prompt ein langes Dokument enthält, ist Nimble das falsche Tool, unabhängig von seiner Genauigkeit. Und Nimble bewertet jedes Feld unabhängig, daher muss jede feldübergreifende Konsistenzregel – „wenn A wahr ist, dann muss B falsch sein“ – in Ihrem Code stehen, nicht im Modell.

Warum das Datenrezept das portablere Artefakt ist

Hier ist das Argument für Nimble, das die Genauigkeitstabellen übersehen. Bespoke hat die Curation-Pipeline veröffentlicht, nicht nur die Gewichte. Wenn dein Entscheidungsproblem eine feste Taxonomie hat und du die Regeln aufschreiben kannst, ist die kontrastive Methode etwas, das du auf deinen eigenen Daten mit deinen eigenen Fokus-Fakten ausführen kannst, auf dem Basismodell deiner Wahl. Das 9B LoRA ist genauso eine Demonstration der Methode wie ein Produkt.

Layas Portabilität ist anders und komplementär. Weil es klein ist, weil es auf der CPU läuft und weil die ONNX- und MLX-Ports existieren, ist Laya das Modell, das man in einen Prozess einbetten kann, der weder GPU noch Netzwerk hat. In einem Browser-Agent-Benchmark eines Drittanbieters erledigte Laya 0 von 50 Aufgaben und erklärte in 33 Versuchen vorzeitig den Abschluss – doch die Autoren des Benchmarks merken an, dass es für Beurteilungsarbeiten wie Support-Tickets, Rechnungen und die Prüfung von Agent-Traces trainiert wurde, nicht für Navigation. Lies dieses Ergebnis als Aussage zum Anwendungsbereich, nicht als Urteil; und es deckt sich mit der Ausrichtung beider Projekte: Dies sind Komponenten für eine bestimmte Klasse von Entscheidungen, nicht allgemeine Agenten.

Weder Laya noch Nimble ist ein gehostetes Modell auf OrcaRouter. Beide sind Gewichte, die Sie selbst betreiben, und nichts in diesem Beitrag sollte als Behauptung gelesen werden, dass wir sie bereitstellen. Der Grund, warum das Routing-Produkt überhaupt zur Sprache kommt, ist derselbe wie in jeder Entscheidungsmodell-Architektur: Das Entscheidungsmodell beantwortet einen Aufruf, und die Anwendung darum herum braucht trotzdem Prosa. Eine Pipeline, die Nimble verwendet, um zu bewerten, ob ein Entwurf konform ist, und Laya, um die Ausnahme weiterzuleiten, wird trotzdem ein generatives Modell benötigen, um den Entwurf zu schreiben. Die generative Hälfte auf einem einzigen OpenAI-kompatiblen Endpunkt zu halten – 200+ Modelle, Listenpreis des Anbieters mit 0 % Aufschlag durchgereicht sodass eine Preissenkung eines Anbieters noch am selben Tag wirksam ist, automatisches Failover über Anbieter hinweg – bedeutet, dass die Entscheidungsschicht ausgetauscht werden kann, ohne den Vertrag der generativen Schicht anzutasten.

Das Urteil – und das Experiment, das es verändern würde

Wählen Sie Nimble, wenn Ihre Taxonomie fest und eng gefasst ist, Ihre Eingaben englisch und kurz sind, Sie über eine GPU verfügen und Ihnen das Datenrezept genauso wichtig ist wie das Modell. Wählen Sie Laya, wenn Sie mehrsprachige Eingaben, ein Budget von unter 40 ms oder einen Prozess ganz ohne GPU benötigen – und kalkulieren Sie das Fine-Tuning von Anfang an ein, denn der Zero-Shot-Checkpoint liegt unter der trivialen Baseline, und die Modellkarte sagt das auch.

Das Experiment, das dies klären würde, ist eine gepaarte Evaluation auf echtem Traffic: gleiche Eingaben, gleiche Optionssätze, gleiche Konfidenzschwellen, bewertet anhand menschlicher Labels, jeweils mit einem Reliabilitätsdiagramm. Nimbles eigene Dokumentation warnt davor, dass seine Wahrscheinlichkeiten keine Korrektheitsraten sind, und Layas Karte meldet einen Kalibrierungsfehler von 0,466 vor dem Refitting, sodass dieses Diagramm das Artefakt ist, das Ihnen tatsächlich sagen würde, welches Modell Sie vor die Produktion schalten sollten. Keines der beiden Projekte hat eines veröffentlicht, und keines hat das des anderen veröffentlicht. Erstellen Sie es auf Ihren eigenen Daten, bevor Sie einen Schwellenwert festlegen.

A generated two-column scoreboard comparing Laya and Nimble across backbone, languages, prompt budget, label agreement, latency and licence, with a footer reading "Nimble's 90.12% is agreement with its own curated labels; Laya figures per its model card."