Eine generierte Titelkarte mit der Aufschrift „Jev vs Kev“ über dem Untertitel „Ein $95-Fine-Tuning, das Jev bei Support-Tickets schlägt“, die Jev (geschlossen, gehostet, nicht offengelegte Architektur, $0,042 pro Million Input-Tokens, Output kostenlos) Kev (Apache 2.0, Qwen3.5-Basis, 0,8B bis 9B, etwa $95 an H100-Zeit) gegenüberstellt.
Engineering & Research

Jev vs. Kev: Ein 95-Dollar-Fine-Tuning, das Jev bei Support-Tickets schlägt

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Jared Palmer veröffentlichte Kev am 20. September 2026, fünf Tage nachdem TypeSafe AI Jev auf den Markt gebracht hatte, und die wichtige Zahl steht nicht in der Benchmark-Tabelle. Sie steht im README: Das Ganze kostete etwa 95 US-Dollar an H100-Zeit auf Modal, plus drei Cent für Jev-API-Aufrufe, die zur Generierung von Evaluationsdaten verwendet wurden. Kev ist Apache-2.0, selbst hostbar und kommt in drei Größen, die auf den Qwen3.5-Basisgewichten aufbauen – ungefähr 0,8B, 4B und 9B –, mit einem Rang-16-LoRA-Adapter und einem Pointer-Head, der auf eine eingefrorene Basis aufgesetzt ist, statt auf ein von Grund auf neu entwickeltes Entscheidungsmodell. Es bildet Jevs API für typisierte Entscheidungen exakt nach: Choice, Score und Noul – nahe genug, um mit TypeSafes eigenem Python-SDK kompatibel zu sein. Jev wiederum wurde am 15. September 2026 als TypeSafe AIs geschlossenes, gehostetes System-One-Modell eingeführt, liefert typisierte Antworten mit kalibrierter Konfidenz und überhaupt keinen Text und hat niemals seine Architektur, Parameteranzahl, Trainingsrechenleistung oder Gewichte veröffentlicht. Der Vergleich ist daher nicht wirklich ein Modellvergleich. Er ist ein Test, wie viel von Jevs Wert überlebt, wenn er an einem Nachmittag für den Preis eines gebrauchten Laptops reproduziert wird.

Was die Benchmarks tatsächlich aussagen

A screenshot of the TypeSafe AI documentation for Jev, showing the typed Choice, Score and Noul primitives, the calibrated probability returned with every answer, free output, and the roughly 32,000-token request budget with a 255-option Choice cap.

Die Schlagzeile ist, dass Kev nah herankommt und bei einer einzelnen, eng umrissenen Aufgabe gewinnt. Auf Kevs gesperrtem Testset für neue Quellen erzielte Kev-9B 0,837 gegenüber Jevs 0,857. Beim Routing von Support-Tickets über 900 Tickets – dem scienthoon-Set – erzielte Kev-9B 0,952 gegenüber Jevs 0,897; das ist das einzige veröffentlichte Ergebnis, bei dem die offene Reproduktion das Modell schlägt, das sie reproduziert. Kev liegt außerdem bei einigen Aufgaben zur Logikererkennung leicht vorn. Bei SemiF-Entscheidungssets, einem strukturierten Set aus 144 Fragen, gewinnt Jev mit 0,965 gegenüber Kev-9Bs 0,917.

Wo Kev verliert, verliert es deutlich. Out-of-Domain-Genauigkeit: Kev-8B bei 79,6 % gegenüber 85,7 % von Jev. MMLU: 70 % gegenüber 90 %. MMLU-Pro: 0,515 gegenüber 0,840. Datumsarithmetik mit Tagesgenauigkeit: 60 % gegenüber 93 %. Das Muster ist konsistent – Kev ist wettbewerbsfähig bei schmalem Routing und schmaler Klassifikation, wo die Labelmenge klein und die Domäne fest ist, und es bricht bei allem zusammen, was Weltwissen oder mehrstufige Arithmetik erfordert, weil ein Rang-16-Adapter auf einem eingefrorenen kleinen Basismodell nicht der Ort ist, an dem Weltwissen lebt.

Jede dieser Zahlen stammt aus Kevs eigenem Harness oder von Drittanbieter-Trackern, und Palmers README sagt unmissverständlich, dass es sich nicht um einen kontrollierten Vergleich handelt – Jevs Trainingsdaten sind nicht offengelegt, sodass sich kein solcher erstellen lässt. Das README stellt außerdem fest, dass keine Jev-Ausgaben für das Training verwendet wurden. Beide Disclaimer sind von der Art, die die Zahlen vertrauenswürdiger macht, nicht weniger: Die Person, die den Vergleich veröffentlicht, ist diejenige, die dir sagt, was er nicht beweisen kann.

Was Sie für $95 bekommen, was Sie von Jev um keinen Preis bekommen können

A screenshot of the Kev repository page for jaredpalmer/kev, showing the Apache-2.0 licence, the Qwen3.5 base weights, the rank-16 LoRA and pointer-head recipe, the about-$95 H100 training cost, and the README statement that no Jev outputs were used for training.

Der Kostenvergleich ist der Punkt, an dem die beiden Produkte aufhören, überhaupt vergleichbar zu sein. Jev kostet 0,042 $ pro Million Eingabe-Tokens, wobei die Ausgabe kostenlos ist – das ist auf eine Weise günstig, die pro Aufruf wirklich kaum zu unterbieten ist –, aber es ist eine gehostete Early-Access-API mit Warteliste, und TypeSafe hat gesagt, dass sich die Ratenlimits ohne Vorankündigung ändern können. Bei Kev handelt es sich um Gewichte, die Sie herunterladen. Die Grenzkosten der zehnmillionsten Klassifizierung sind der Strom, den Sie selbst verbrauchen.

Daraus folgen vier Dinge, und keines davon betrifft Benchmark-Ergebnisse.

Keine Daten verlassen Ihre Infrastruktur. Jev ist ein gehosteter Endpunkt; jeder Zustand, den Sie ihm senden – das Support-Ticket, die Logzeile, die Krankenakte – geht an TypeSafe. Kev läuft auf Ihrer eigenen GPU, was für regulierte Workloads nicht eine Präferenz, sondern der ausschlaggebende Faktor ist.

• Keine Ratenlimits, keine Warteliste, kein Veraltungsrisiko. In der eigenen Dokumentation von TypeSafe heißt es, dass sich Ratenlimits ohne Vorankündigung ändern können. Ein lokaler Checkpoint hat keine derartige Klausel.

• Du kannst es feinabstimmen. Kev ist eine Basis zum Spezialisieren, und das LoRA-Rezept, das es hervorgebracht hat, ist öffentlich. Wenn deine Routing-Taxonomie 40 Klassen umfasst, die kein allgemeines Modell gut bewältigt, kannst du auf deinen eigenen Labels trainieren – genau das hat Palmer getan, zu Kosten, die in zig Dollar statt in einem ML-Team gemessen werden.

• Die Kontextobergrenze kannst du ändern. Jevs dokumentiertes Anfragebudget beträgt ungefähr 32.000 Tokens, und Choice-Felder sind auf 255 Optionen begrenzt. Kev erbt das Fenster von Qwen3.5, das deutlich größer ist, und die Optionsobergrenze ist eher ein Implementierungsdetail deines eigenen Serving-Stacks als ein Anbieterlimit.

Was Jev noch hat, das Kev nicht hat

Die Kalibrierungsaussage ist diejenige, die sich nicht sauber übertragen lässt, und sie ist das Herzstück von TypeSafes Pitch. Jev wird mit einer Methode trainiert, die TypeSafe RLCD nennt – Reinforcement Learning for Calibrated Decisions –, die darauf optimiert, dass der Konfidenzwert ehrlich ist, statt darauf, dass die Antwort bevorzugt wird. Jede Antwort von Jev wird mit einer Wahrscheinlichkeitsverteilung über die Optionen ausgeliefert, sodass dein Code Schwellenwerte festlegen kann: im oberen Bereich automatisch handeln, im mittleren kennzeichnen, im unteren eskalieren.

Kev erzeugt dieselbe typisierte Form und dieselben Wahrscheinlichkeitsausgaben, da die API bewusst kompatibel ist. Ob diese Wahrscheinlichkeiten kalibriert sind, ist eine andere Frage, und die ehrliche Antwort ist, dass niemand ein Zuverlässigkeitsdiagramm für eines der beiden Modelle veröffentlicht hat. Ein separates Kalibrierungsaudit berichtete, dass Jev bei einer Priorisierungsaufgabe mit verdeckter Richtlinie eine Genauigkeit von 44,7 % und einen erwarteten Kalibrierungsfehler von 0,325 erzielte, was darauf hindeutet, dass die Kalibrierung von Jev je nach Aufgabe stark variiert und keine universelle Eigenschaft ist – und TypeSafe selbst rät Nutzern, Konfidenzschwellen anhand ihrer eigenen gelabelten Beispiele zu testen, statt dem veröffentlichten Verhalten zu vertrauen.

Das andere, was Jev hat, ist, dass es nicht auf Qwen3.5 trainiert wurde. Ein 9B-Modell mit einem Rang-16-Adapter hat eine Wissensgrenze, und der MMLU-Pro-Abstand von 0,515 gegenüber 0,840 ist das Sichtbarwerden dieser Grenze. Wenn Ihre Routing-Entscheidung gelegentlich erfordert, zu wissen, was eine Sache ist, leistet Jevs größere, nicht offengelegte Architektur Arbeit, die Kevs Adapter nicht leisten kann.

Latenz und die Deployment-Form

Die dokumentierte End-to-End-Latenz von Jev beträgt 70–500 ms gegenüber 3–329 Sekunden für Aufrufe von Frontier-LLMs in TypeSafes eigenem Vergleich, und das Hinzufügen von Fragen zu einem Aufruf verändert sie kaum, weil jede Frage parallel gegen einen einzigen gemeinsamen Lesezugriff auf den Zustand ausgewertet wird. Kev-9B auf einer H100 wird für einen einzelnen Forward-Pass in derselben Größenordnung liegen, aber der Vergleich hinkt in beide Richtungen: Ein selbst gehostetes 9B-Modell auf einer geteilten GPU unter Last hat nicht dieselbe Latenz wie ein gehosteter Endpunkt, und ein gehosteter Endpunkt ist nicht dasselbe wie eine Maschine in Ihrem eigenen Rack. Was sich ohne Wenn und Aber sagen lässt, ist, dass beide schnell genug für die Nutzung pro Turn in einem Agenten-Loop sind und dass Kevs Latenz eine Funktion der Hardware ist, die Sie kontrollieren, und nicht eines Service-Levels, das Ihnen versprochen wird.

Die ehrliche Einschätzung zur Reproduktion

Die bloße Tatsache, dass Kev überhaupt existiert, ist ein Hinweis auf Jev, und es lohnt sich, das zu benennen. Ein geschlossenes Modell, dessen Verhalten in fünf Tagen für 95 $ von einer Person auf öffentlichen Basisgewichten approximiert werden kann, sagt Ihnen etwas darüber, wie viel seines Vorteils Architektur ist und wie viel Trainingsdaten und Serving. Daraus folgt nicht, dass Jev einfach zu bauen ist – die API-Oberfläche lässt sich leicht kopieren, die Kalibrierung nicht. Aber es bedeutet, dass der Burggraben nicht die Schnittstelle ist, und alle, die Jev für einen Produktionsweg evaluieren, sollten die Möglichkeit einpreisen, dass ein Fine-Tuning eines offenen Basismodells sie den Großteil des Weges für einen Bruchteil des Aufwands bringt.

Was zugleich das Argument dafür ist, noch keinen Produktionspfad auf eines der beiden zu setzen. Wenn Sie Jev evaluieren, ist die vernünftige Haltung, es auszuprobieren, ohne sich darauf festzulegen — und OrcaRouter bedient Jev nicht, weil TypeSafes Modell sich im Early Access befindet und sein eigenes Request-Format spricht. Was wir abdecken, ist die generative Hälfte des Workflows, in dem diese Entscheidungsmodelle sitzen: 200+ Modelle hinter einem einzigen OpenAI-kompatiblen Key zum Listenpreis des Anbieters, durchgereicht mit 0 % Aufschlag, mit automatischem Failover. Eine Zwei-Modell-Architektur, bei der eine günstige Entscheidungsschicht den Traffic sortiert und ein generatives Modell den Rest übernimmt, lässt sich auf unserer Seite ohne einen zweiten Anbietervertrag testen, und sollte sich die Entscheidungskomponente auf Ihren Daten als schlecht kalibriert erweisen, ist der Failover-Pfad das, was verhindert, dass daraus ein Incident wird.

Das Urteil

Wenn Ihre Entscheidungsaufgabe eng gefasst, auf eine feste Domäne beschränkt, hochvolumig und datenschutzsensibel ist, ist Kev heute die besser zu verteidigende Wahl, und es ist kein knappes Rennen — Ihnen gehören die Gewichte, Sie kontrollieren den Datenpfad, Sie können mit Ihren eigenen Labels feinabstimmen, und beim Support-Ticket-Routing schlägt der 9B-Checkpoint Jev bereits bei dessen eigenen veröffentlichten Zahlen. Wenn Ihre Entscheidungsaufgabe Weltwissen, mehrstufige Arithmetik oder einen Konfidenzwert erfordert, den Sie zur Automatisierung nutzen wollen, leisten Jevs größeres, nicht offengelegtes Modell und sein RLCD-Training echte Arbeit, und Kevs Adapter ist kein Ersatz für eines von beiden.

Das Einzige, was keiner der beiden Vergleiche klärt, ist die Kalibrierung, denn für keines der beiden Modelle wurde ein Reliabilitätsdiagramm veröffentlicht. Testen Sie das an Ihren eigenen gelabelten Fällen, bevor Sie mit einem der beiden automatisieren – der Konfidenzwert ist der Teil beider Produkte, der pro Bereitstellung erst verdient werden muss, und die Geschwindigkeit ist der Teil, der bereits zur Massenware geworden ist.

A generated two-column scoreboard comparing Jev and Kev across the same six labelled dimensions, with a footer reading "Kev figures per its own README and harness; not a controlled comparison."