
Laya vs. Kev: Zwei Rezepte für ein lokales Entscheidungsmodell
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
Die nützlichste Zahl im Vergleich Laya gegen Kev ist ein Beleg. Jared Palmer trainierte die Kev-Familie für rund 95 $ an H100-Zeit auf Modal, plus etwa drei Cent für API-Aufrufe für Evaluierungsdaten und veröffentlichte das Rezept zusammen mit den Gewichten. Convai Innovations ging bei Laya den anderen Weg: veröffentlicht am 18. September 2026, drei Tage nach dem Jev von TypeSafe AI, Apache 2.0, Gewichte auf Hugging Face, einen pip install laya-Einstiegspunkt und keine Trainingspipeline – einen englischen 421M-Checkpoint ModernBERT-large, einen mehrsprachigen 322M-Checkpoint mmBERT-base und einen Router, der zwischen beiden auswählt. Kev ist eine Familie aus drei kleinen Modellen mit 0,8B, 4B und 9B, jeweils eine eingefrorene Basis plus einen Rank-16-LoRA-Adapter und einen kleinen Pointer-Head. Beide beantworten typisierte Fragen in einem Forward-Pass und keines von beiden generiert Text. Die Entscheidung zwischen ihnen ist wirklich eine Entscheidung darüber, welches Artefakt man besitzen möchte: einen Checkpoint oder ein Rezept.
Was jedes Projekt tatsächlich ausliefert
Laya bringt Inferenz mit. Der englische Checkpoint ist ein bidirektionaler Encoder mit einem 512-Token-Fenster; der mehrsprachige deckt über 100 Sprachen mit einem 1.024-Token-Fenster ab und läuft etwa doppelt so schnell; der Router erkennt das Schriftsystem in unter einer halben Millisekunde. Er beantwortet choice, score und noul — eine Auswahl aus einer Liste, ein erwartetes Niveau auf einem geordneten Bewertungsraster und eine kalibrierte Wahrscheinlichkeit, dass eine Behauptung wahr ist. Es gibt einen dritten Checkpoint, laya-typed-decisions, bei dem es sich um dasselbe 421M-Backbone handelt, das auf dem Trainingssplit des Typed-Decisions-Benchmarks feinabgestimmt wurde. Die eigene Modellkarte von Convai enthält den Satz, der bestimmen sollte, wie Sie jede Laya-Zahl lesen: „Laya ist eine schnelle Basis zum Spezialisieren, keine Zero-Shot-Entscheidungsengine.“


Kev liefert eine Methode. Das Repository dokumentiert decision-v7: zwei Epochen über 10.000 Beispiele aus zehn öffentlichen Datensätzen, 896 generierte Policy-Beispiele und 1.680 Beispiele, die aus 60 generierten Regelstrukturen erstellt wurden. Der Head bewertet jede bereitgestellte Option gegen den decide-Token der Frage und wendet Softmax auf das Ergebnis an. Da die Qwen3.5-Checkpoints Attention mit rekurrenten Gated-DeltaNet-Schichten mischen, die Attention-Masken ignorieren, läuft jede Frage als eigene Zeile, wobei der gemeinsame Zustand einmal berechnet und zwischengespeichert wird – so hält das Modell Fragen voneinander isoliert, ohne für jede Frage einen frischen Prefill zu bezahlen. Kev spiegelt TypeSafes öffentlichen /v1/systemone-Vertrag wider, sodass ein vorhandener TypeSafe-SDK-Client durch Ändern der Basis-URL auf einen lokalen Kev-Server zeigen kann. Die README gibt an, dass keine Jev-Ausgaben im Training verwendet wurden.
Die beiden Fehlermodi sind unterschiedlich, und das ist die eigentliche Geschichte.
Beide Modelle verlieren gegen Jev bei den Aufgaben, die Wissen erfordern, doch sie verlieren auf Weisen, die unterschiedliche Gegenmaßnahmen erfordern.
Layas veröffentlichte Schwächen betreffen die Form der Eingabe. Im Typed-Decisions-Benchmark von TypeSafe erzielt es zero-shot 0,362, gegenüber 0,318 für zufälliges Raten und 0,461 für die Mehrheitsklassen-Baseline – näher am Zufall als an der trivialen Antwort. Jenseits von ungefähr zwanzig Optionen bricht es zusammen: 0,425 bei Banking77 gegenüber Jevs 0,870. Es ist so reihenfolgeempfindlich, dass eine reine Umkehrung der Optionsreihenfolge in einem Test eines Drittanbieters die Genauigkeit um 13,75 Punkte senkte und eine Quote identischer Antworten von 42,5 % hinterließ. Und die ausgelieferten Checkpoints kommen mit ungültigen Temperaturen – die Bibliothek warnt beim Import, was bedeutet, dass die Kalibrierungsangabe auf der Modellkarte, ein erwarteter Kalibrierungsfehler von 0,466, die Zahl ist, die man tatsächlich erhält, bevor man neu fittet. Ein erneutes Fitten pro Fragetyp bringt ihn auf 0,081, aber das ist Arbeit, die man selbst erledigt, nicht Arbeit, die der Download erledigt. Es gibt einen veröffentlichten mehrsprachigen Fehler, den man vollständig lesen sollte: Bei nicht-lateinischen Schriften ist der englische Checkpoint katastrophal überkonfident, wobei ein Khmer-Beispiel 0,000 Genauigkeit bei 0,952 durchschnittlicher Konfidenz zeigt.
Kevs veröffentlichte Schwächen betreffen Wissen und Arithmetik. Kev-9B erzielt 0,837 in seinem eigenen gesperrten Neuquellen-Test — 0,832 für das 4B und 0,668 für das 0,8B — und etwa 0,822 Out-of-Domain auf dem Dev-Split gegenüber Jevs 0,857. Die Lücke öffnet sich dort, wo Weltwissen erforderlich ist: MMLU etwa 70 % gegenüber Jevs 90 %, MMLU-Pro 0,515 gegenüber 0,840 und tagesgenaue Datumsarithmetik 60 % gegenüber 93 %. Auf einem engen Routingsatz mit festen Labels gewinnt es — eine Support-Ticket-Routing-Bewertung ergab für Kev-9B 0,952 gegenüber Jevs 0,897 — aber der Autor stellt ausdrücklich klar, dass dies sein eigener Testaufbau ist, dass Jevs Trainingsdaten nicht offengelegt sind und dass daher kein kontrollierter Vergleich konstruierbar ist. Kev bleibt außerdem bei neuen Quellen übermäßig selbstsicher; das Setzen von KEV_TEMPERATURE=2.0 reduzierte in den eigenen Tests des Projekts selbstsichere Fehler von 8,7 % auf 4,4 %, was zeigt, dass die Standardeinstellung nicht die sichere Einstellung ist.
Die praktische Übersetzung: Layas Fehlerfall wird durch dein Optionsset und deine Prompt-Formatierung ausgelöst, und du behebst ihn durch Fine-Tuning und Refitting. Kevs Fehlerfall wird durch Fragen ausgelöst, die Fakten benötigen, und du behebst ihn, indem du das Modell auf Routing und Klassifizierung beschränkst und die wissensabhängigen Aufrufe an anderer Stelle belässt. Keine der beiden Behebungen ist ein Konfigurationsflag.
Was es braucht, um sie zu bedienen
• Hardware — Laya: 421M/322M-Encoder, auf der CPU für niedrigen Durchsatz glaubwürdig und für den MLX-Port auf Apple Silicon unter einem Gigabyte resident. Kev: 0,8B bis 9B, wobei für das 9B eine BF16-CUDA-GPU benötigt wird und die Qwen3.5-Architektur flash-linear-attention unter CUDA und ROCm erfordert.
• Latenz — Laya: 32,8 ms p50 pro Entscheidung auf einer Tesla T4, 7,2 ms pro Frage bei Batch 10. Kev: etwa 300 ms für fünf getippte Fragen von einem 4B-Modell auf einem Mac mit 32 GB in bf16, grob 40 ms auf einer H100.
• Obergrenzen — Laya: 512-Token-Fenster für Englisch, 1.024 für Mehrsprachigkeit. Kev: Auswahl über 1–255 Optionen, Score über 2–255 Stufen, 384 Trainingszustands-Tokens mit 8.192 beim Serving.
• Server — Laya: In-Process-Python, plus Community-Ports für ONNX, Go und Apple MLX. Kev: ein lokaler Server, an 127.0.0.1 gebunden, ohne Authentifizierung, ein npm-SDK sowie Adapter für LangChain und LlamaIndex.
• Lizenz — Apache 2.0 für beide.
Zwei operative Hinweise, die nicht in den Schlagzeilen-Zahlen auftauchen. Kevs Server verarbeitet by design nur einzelne Anfragen und ist nicht authentifiziert – er ist ein lokaler Sidecar, nichts, das man öffentlich zugänglich macht. Und die Latenz von Kevs Mac ist deutlich schlechter als seine H100-Latenz, weil die schnellen DeltaNet-Kernel für MLX noch nicht existieren; genau solche Details machen aus der Aussage „läuft lokal“ die Aussage „läuft lokal auf der richtigen Hardware“.
Die generative Hälfte des Musters
Beide dieser Modelle existieren, um einen ganz bestimmten Aufruf zu ersetzen: die LLM-Invokation, die Sie ausschließlich durchgeführt haben, um ein Label oder eine Wahrscheinlichkeit zurückzubekommen. Sie ersetzen nicht die Aufrufe, bei denen Sie tatsächlich Fließtext benötigen. Ein Support-System, das Kev-9B verwendet, um ein Ticket zu routen, benötigt weiterhin ein Modell, um den Thread zusammenzufassen und die Antwort zu entwerfen, und dieses Modell wird kein 9B-LoRA mit einem Pointer-Head sein.
Das ist die Nahtstelle, in der OrcaRouter sitzt, und nicht die Behauptung, einen dieser beiden zu hosten. Weder Laya noch Kev stehen auf unserer Modellliste – sie sind Gewichte, die man herunterlädt – und der Artikel wäre irreführend, wenn er etwas anderes suggerierte. Auf der Liste stehen die 200+ generativen Modelle hinter einem OpenAI-kompatiblen Schlüssel zu Listenpreis des Anbieters, durchgereicht mit 0 % Aufschlag. Wenn Sie Kev verwenden, um zu entscheiden, in welche von drei Zusammenfassungsstufen eine Anfrage gehört, oder Laya verwenden, um zu bewerten, ob ein Antwortentwurf akzeptabel ist, ist die generative Seite beider Schleifen ein Endpunkt mit automatischem Failover statt eines zweiten Vertrags und eines zweiten SDK. Die Routing-DSL ist der Teil, der am natürlichsten zu einer Entscheidungsmodell-Architektur passt: Kombinieren Sie ein günstiges Modell und ein teures Modell in einem einzigen Aufruf und lassen Sie die Ausgabe des Entscheidungsmodells den Zweig auswählen.
Was als Nächstes ansehen
Die Lücke in der Evidenz ist bei beiden dieselbe, und sie wird von keinem der beiden Projekte geschlossen werden. Niemand hat Laya und Kev mit byte-identischen Eingaben, denselben Prompts, derselben Optionsreihenfolge und demselben Konfidenzschwellen-Sweep laufen lassen. Layas vielbeachtete Siege stammen aus seinem eigenen Harness; Kevs Behauptungen nahezu gleicher Leistung stammen aus dem Harness seines Autors; das Kalibrierungsaudit, das ergab, dass Jevs Kalibrierung je nach Aufgabe stark schwankte – 44,7 % Genauigkeit und 0,325 erwarteter Kalibrierungsfehler bei einer Prioritätsaufgabe mit versteckter Policy –, stammte von einem Dritten, und weder Laya noch Kev wurde diese Behandlung zuteil. Bis jemand das tut, sind die oben genannten Zahlen die besten verfügbaren, und sie sind nicht miteinander vergleichbar.
Wenn Sie sich heute entscheiden: Nehmen Sie Kev, wenn Sie diese Woche ein funktionierendes Routing-Modell auf einer GPU haben wollen, die Sie bereits mieten, und akzeptieren Sie, dass es Dinge nicht wissen wird. Nehmen Sie Laya, wenn Ihre Eingaben mehrsprachig sind oder Ihr Hardware-Budget ein Laptop ist, und planen Sie das Fine-Tuning als Teil des Projekts ein statt als spätere Optimierung. Messen Sie in jedem Fall auf Ihren eigenen gelabelten Daten, bevor Sie einen Konfidenzschwellenwert vor den Produktionsverkehr setzen — beide Projekte sagen Ihnen in ihrer eigenen Dokumentation, dass Sie das tun sollen.

