
Wo Jev 1.13 bricht: TypeSafes eigene Grenzenliste
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 349 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 208 tok/s
- OrcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- xAISpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Jev 1.13 (typesafe/jev-1.13) wurde am 15. September 2026 veröffentlicht, womit es zwei Wochen außerhalb der letzten sieben Tage liegt, sodass seine Veröffentlichung nicht die eigentliche Geschichte ist. Das datierte Ereignis ist der 24. September 2026: An diesem Tag hat OrcaRouter typesafe/jev-1.13 in seinen Katalog aufgenommen und eine Modellkarte dafür geöffnet — die erste Serving-Unterstützung für Jev in einem Drittanbieter-Gateway, nach zwei Wochen, in denen die einzige Möglichkeit, es aufzurufen, TypeSafes eigener Endpunkt war. Das ist hier aus einem bestimmten Grund wichtig. Jev ist insofern ungewöhnlich, als sein Anbieter eine Liste der Arten veröffentlicht, wie es fehlschlägt, und eine Liste, die man nur lesen kann, lässt sich viel leichter überspringen als ein Modell, das man tatsächlich aufrufen kann.
Diese Seite ist diese Liste, beschränkt auf das, was TypeSafe selbst sagt, plus die Betriebsgrenzen und die Rechnung.
TypeSafe veröffentlicht seine eigene Jaggedness-Liste

docs.typesafe.ai enthält eine Seite mit dem Titel Jev 1.13 Unebenheiten. Es gilt ausdrücklich für jev-1.13, weist ein Überprüfungsdatum von 2026-09-17 auf und beginnt mit der eigenen Darstellung des Anbieters: "Jev ist nicht perfekt. Hier sind einige Unebenheiten, die uns bei jev-1.13 bekannt sind. Viele davon werden in späteren Versionen behoben." Es folgen neun benannte Modi, jeder mit einem konkreten Fall und einer "Stattdessen:"-Abhilfe. Nichts im Folgenden ist abgeleitet, und nichts wird abgeschwächt — der Wortlaut stammt von TypeSafe, und wo das Unternehmen sein eigenes Beispiel anführt, stammen die darin genannten Zahlen von ihm.
Wörtliche Lesart: Sie beantwortet die Frage, die du geschrieben hast
Abgrenzende Wörter, Verneinungen und implizite Bedingungen werden wörtlich genommen. Eine Frage wird anhand der Wörter in der Anweisung beantwortet, „wohingegen eine Person die Absicht hinter den Anweisungen herausgelesen haben könnte.“
Die Diagnose des Anbieters ist der nützliche Teil: Wenn man sich eine falsche Antwort ansieht und sich dabei erklärt, was man eigentlich gemeint hat, dann ist diese Erklärung die fehlende Hälfte der Anweisung. Die Abhilfen bestehen darin, die genaue Bedingung in den Anweisungen anzugeben, Grenzfälle in die Kriterien aufzunehmen und dort, wo Interpretation wirklich unvermeidlich ist, die Frage in zwei wörtliche Fragen aufzuteilen und sie im Code zu kombinieren.
Mathe und Zahlen: Es ist kein Taschenrechner
TypeSafe sagt unmissverständlich, dass mathematische Logik im Code umgesetzt werden sollte. Darunter liegen drei konkrete Fehlschläge:
• Das Zählen ist unzuverlässig. Das betrifft Zeichen in einem Wort, Vorkommen eines Begriffs in einem Textabschnitt und Einträge in einer langen Liste. "Das Modell erkennt die Form einer Antwort, anstatt zu zählen, und der Fehler wächst mit der Größe des Gezählten." Der eigene Test des Anbieters dafür, ob man überhaupt fragen sollte: Wenn ein regulärer Ausdruck oder ein Parser die Einheit finden kann, gehört das Zählen in den Code, und das Modell fügt nichts hinzu.
• Numerische Darstellungen schneiden schlechter ab als semantische. Fragen zu Farben, die Hex-Werte verwenden, sind schlechter als dieselben Fragen mit englischen Farbnamen; angesichts von RGB-Tripeln oder Hex kann Jev nicht zuverlässig beurteilen, ob zwei Werte nahe beieinanderliegen. Dieselbe Lücke zeigt sich bei niedrigstufigem Code – Assembler oder binär kodierten Anweisungen – gegenüber höherstufigen Sprachen. Konvertiere oder gruppiere im Code und behalte das Modell für den Teil, der tatsächlich eine Beurteilung ist.
• Score-Ausgaben vermitteln keine exakten Größen. Der Anbieter gibt an, dass Jev's Score-Stufen hinsichtlich der numerischen Kalibrierung schwach sind. Ein Erwartungswert kann genutzt werden, um zu testen, ob etwas eine Schwelle überschreitet; er kann nicht genutzt werden, um die Zahl durch Interpolation zwischen den beiden nächstgelegenen Stufen zu rekonstruieren. Das ist ein klares Nein zu einer ganzen Klasse von Missbrauch — einen Score als Messung zu lesen.
Datum und Uhrzeit: Datumsangaben werden als Text gelesen, nicht als Mengen
Das Ordnen zweier Datumsangaben, das Messen des Abstands zwischen ihnen oder die Entscheidung, ob eine davon in ein Fenster fällt, ist unzuverlässig und verschlechtert sich weiter bei gemischten Formaten, relativen Referenzen und Domänengrenzen wie Quartalen, Abrechnungsfenstern und Abgrenzungsperioden.
Die empfohlene Aufteilung ist sauber. Die Extraktion ist eine Ermessenssache, also überlassen Sie sie dem Modell. Jeder Bestandteil eines Datums ist eine kleine geschlossene Menge – zwölf Monate, einunddreißig mögliche Tage, ein begrenzter Bereich von Jahren –, wodurch die Extraktion zu einer Auswahl aus aufgezählten Optionen statt zu freiem Parsing wird und Ihnen eine Möglichkeit gibt, ein ausdrückliches „nicht angegeben“ zu platzieren, sodass ein fehlender Teil gemeldet und nicht geraten wird. Der Code setzt die Teile zusammen und übernimmt alles danach, einschließlich Reihenfolge, Dauer, Offset und Wochentag.
Indirektion: Doppelte Verneinungen und zusätzliche Umwege kosten Genauigkeit
Anweisungen mit doppelten Verneinungen oder mehrschichtiger Indirektion werden weniger zuverlässig beantwortet. Eine Frage nach einer Eigenschaft einer Eigenschaft oder eine, die mehrere Schritte des Schlussfolgerns erfordert, geht zulasten der Genauigkeit. Das Gegenmittel besteht darin, Anweisungen so direkt wie möglich zu formulieren und die relevanten Teile des Zustands zu benennen, statt sie zu beschreiben.
Ein großer Zustand voller irrelevanter Details kostet Genauigkeit.
Die Genauigkeit nimmt ab, wenn der Zustand durch Inhalte wächst, die nichts mit der Entscheidung zu tun haben. Nicht zugehörige Details wirken als Ablenkung, und ein großer Zustand macht es schwieriger zu erkennen, welcher Teil der Eingabe eine falsche Antwort erzeugt hat. TypeSafes eigene Erinnerung in der Schlussnotiz ist unverblümt: „Jev leidet unter Kontextverfall, daher kostet nicht zugehöriges Material im Zustand Ihre Genauigkeit.“
Rufen Sie zuerst im Code ab und filtern Sie, und senden Sie nur die Felder, die die Frage benötigt. Wo eine Filterung vor der Anfrage nicht möglich ist, empfiehlt der Anbieter, ein noul zu verwenden, um nach Relevanz zu filtern und dann die verbleibenden Ergebnisse zu beurteilen.
Adversarischer Inhalt im Zustand verschiebt die Antwort
Zustand ist Daten, und jev-1.13 behandelt ihn standardmäßig nicht als feindselig. Eine eingeschleuste Anweisung, eine bewusst irreführende Formulierung oder ein Text, der für seine eigene Klassifizierung argumentiert, kann das Ergebnis verschieben. Dies ist der einzige Modus, in dem der Anbieter die Behebung ausdrücklich als zukünftige Arbeit darstellt – „Wir erwarten, dies in Zukunft zu verbessern“ – und die vorläufige Empfehlung lautet, in den Kriterien explizit zu sein und die Integration gründlich zu testen, bevor man sie vielen Nutzern vorlegt.
Widersprüchliche Anweisungen und Kriterien verwirren es.
Wenn die Anweisungen und die Kriterien unterschiedliche Dinge verlangen, kann das Modell verwirrt werden. TypeSafes Beispiel ist ein noul, bei dem true auf nein und false auf ja abbildet, was schlechter abschneidet als dieselbe Frage in konsistenter Formulierung. Die Anweisung lautet, die Kriterien als Erweiterung der Anweisung zu behandeln und beide in einer Sprache aufeinander abzustimmen, die ein durchschnittlicher Mensch lesen und verstehen kann.
Strukturelle Invarianten, die es nicht garantiert
Dies ist der Modus, der am wahrscheinlichsten ein System zerbricht, das auf einer Annahme aufgebaut wurde, die niemand aufgeschrieben hat. Jev ist im gewöhnlichen Sinne äußerst konsistent – semantisch ähnliche Eingaben erzeugen quantitativ ähnliche Ausgaben –, doch strukturelle Identitäten, von denen man erwarten könnte, dass sie gelten, sind nicht garantiert. Der Hersteller veröffentlicht zwei ausgearbeitete Fälle.
• Eine Frage, zwei Fragetypen. „Fragt der Kunde nach einer Rückerstattung?“ als noul gestellt und als Ja/Nein-Auswahl gestellt, ergibt auf dem Ticket „Ich bin mit der Passform nicht zufrieden. Welche Möglichkeiten habe ich hier?“ ein noul von 0,22 und eine Auswahl von Ja 0,01, Nein 0,99, Konfidenz 0,97. Das sind Antworten auf dieselbe Frage.
• Eine Frage und ihre Negation. „Bittet der Kunde um eine Rückerstattung?“ und „Bittet der Kunde um etwas anderes als eine Rückerstattung?“, als zwei nouls zum Ticket „Mir wurde dieselbe Bestellung zweimal in Rechnung gestellt. Kann sich das jemand ansehen?“ gestellt, liefern 0,72 und 0,47. Sie summieren sich zu 1,19.
Die Abhilfemaßnahmen sind operativ, nicht rhetorisch: Verlassen Sie sich nicht auf erwartete strukturelle Invarianz, übertragen Sie keinen auf Noul abgestimmten Schwellenwert auf eine Wahl und halten Sie das Modell nicht an arithmetischen Identitäten zwischen getrennten Fragen fest. Der Grund ist, dass eine Wahl relativ ist – sie legt fest, welche Option –, während jeder Noul absolut ist und bei allen niedrig ausfallen kann.
Generierung: Es wurde nicht darauf trainiert zu schreiben
jev-1.13 ist nicht darauf trainiert, Text zu generieren. Man kann die Ausgabe erzwingen, indem man Auswahlmöglichkeiten verkettet, und TypeSafe sagt direkt, dass dies „nicht gut funktionieren und sehr langsam sein wird“. Für die Extraktion lautet die Empfehlung, Kandidatenwerte mit einem regulären Ausdruck oder einem generativen Modell herauszuziehen und Jev den richtigen auswählen zu lassen, oder – wenn der Antwortraum begrenzt ist – die Extraktion in eine Auswahl zwischen den Optionen umzuwandeln, statt nach dem Wert selbst zu fragen.
Die Obergrenze von 255 Optionen bei Auswahlfragen

Eine Auswahlfrage: Eine Jev-Integration ist keine gezackte Kante, sie ist die Form des Produkts. Es lohnt sich, sie getrennt zu betrachten, denn kein noch so großer Aufwand an Prompt-Arbeit ändert etwas daran:
• Keine Textgenerierung. Es gibt eine Entscheidung zurück, keinen Prosatext. Das ist Absicht, kein Fehler.
• Keine Konversation. Jev ist ein strukturiertes Entscheidungsmodell und kein Chat-Modell. Du sendest einen Zustand und eine Reihe benannter Fragen; es gibt pro Frage eine strukturierte Antwort zurück. Es gibt keinen Sprecherwechsel, um den herum man entwerfen müsste.
• Keine multimodale Eingabe. Die Eingabe ist ausschließlich Text – Zeichenkette, JSON-Objekt oder Array von Textwerten –, ohne Bild, Audio oder Video. Nicht-Text-Material muss zu Text oder strukturierten Feldern vorverarbeitet werden, bevor es Teil des Zustands wird.
• Nicht-streamende Antworten. Es gibt eine einzelne strukturierte Antwort und keinen Streaming-Modus. Der Grund, warum dieser Fall keine Rolle spielt, ist derselbe, aus dem es sich lohnt, ihn zu erwähnen: Es gibt nichts zu streamen. Eine typisierte Entscheidung – ein boolescher Wert mit einer Wahrscheinlichkeit, ein Label aus einer Menge oder eine Stufe auf einer Skala – hat keine Teilform, die es wert wäre, Token für Token offenzulegen.
• Englisch ist die primäre Sprache. Andere Sprachen, einschließlich CJK-Schriften, werden unterstützt, aber nicht gleich gut. Die Empfehlung von TypeSafe lautet, eigene Inhalte zu testen, bevor Sie sich bei einer nicht-englischsprachigen Workload auf Jev verlassen, und beim Routing auf die Konfidenz zu setzen.
Die Obergrenze von 255 Optionen bei Auswahlfragen
Eine Auswahlfrage wählt eine von bis zu 255 beschrifteten Optionen aus, und diese Obergrenze ist hart. TypeSafe erklärt außerdem, warum große Auswahlmengen langsamer laufen, mit den Worten des Anbieters selbst: „Bei Auswahlmöglichkeiten mit höherer Kardinalität verwenden wir ein zweistufiges System, bei dem zunächst unabhängig bewertet und dann eine explizite Auswahl getroffen wird, daher die gelegentliche Verlangsamung.“ Die Latenzkosten einer großen Optionsmenge sind also struktureller Natur und nicht beiläufig, und es ist der Anbieter, der Ihnen sagt, woher sie stammen.
Unser eigenes Serving-Fenster für typesafe/jev-1.13, ausgelesen aus der Modellkarte am 30.09.2026, zeigt, wie das in der Praxis über sieben Tage unseres eigenen Traffics aussieht: ein Median von 151 ms und ein p95 von 247 ms, 348 Ausgabe-Tokens pro Sekunde und eine Fehlerrate von 0,49 % bei 76,2 Millionen bereitgestellten Tokens. Die Tagesmediane bewegen sich in einem engen Band – 175, 170, 163, 161, 170, 147 und 143 ms vom 24.09.2026 bis zum 30.09.2026 –, doch der tägliche p95 für den 28.09.2026 liegt bei 2.448 ms, ungefähr zehnmal so hoch wie an den Tagen davor und danach. Wir können diesen Eintages-Ausreißer nicht auf die Auswahlkardinalität zurückführen und werden das auch nicht tun; die ehrliche Lesart ist, dass der Tail existiert, und ein latenzempfindlicher Workflow sollte gegen den Tail und nicht gegen den Median ausgelegt werden.
Die eingegebene Rechnung ist die gesamte Rechnung.
Die Ausgabe wird bei Jev mit null abgerechnet, was manchmal als „Jev ist kostenlos“ gelesen wird. Das ist nicht der Fall, denn die Eingabe wird abgerechnet, und ein großer Zustand ist nicht schon deshalb kostenlos, weil auf der Ausgabeseite nichts steht. Der Anbieterpreis beträgt 0,042 $ pro Million Eingabe-Tokens – dieselbe Zahl, die TypeSafe als 42 $ pro Milliarde angibt – und OrcaRouter reicht den Listenpreis des Anbieters mit 0 % Aufschlag durch, sodass eine Preissenkung des Anbieters hier am selben Tag ankommt.
Hier ist, was das mit einer realistischen Form macht, wenn man die vom Anbieter selbst angegebene Rate verwendet:
• Eine kleine Bitte. Ein Support-Ticket mit 1.200 Tokens plus etwa 300 Tokens für Bewertungsraster und Fragen macht 1.500 Eingabe-Tokens aus, was 0,000063 $ pro Aufruf entspricht.
• Eine große Anfrage. Ein 55.000-Token-Vertrag plus Fragen, die die Anfrage auf 60.000 Token bringen, ergibt 40-mal so viele Token, also $0,0025 pro Aufruf – pro Aufruf immer noch klein und 40-mal größer als im ersten Fall für dieselbe eine Antwort.
Bei diesem Volumen. 60.000 Tokens pro Aufruf und 10.000 Aufrufe pro Tag sind 600 Millionen Input-Tokens pro Tag, also 0,6 Milliarden, das sind 25,20 $ pro Tag und etwa 756 $ in einem 30-Tage-Monat. Dieselbe Anzahl an Aufrufen bei der Anfrage mit 1.500 Tokens ergibt 15 Millionen Tokens pro Tag: 0,63 $ pro Tag, etwa 18,90 $ pro Monat.
Die Lücke zwischen den letzten beiden Zeilen ist kein Preistrick, sondern der abgerechnete Zustand. Deshalb ist die Filterempfehlung im Abschnitt zu Context-Rot nicht nur eine Genauigkeitsmaßnahme – das Kürzen des Zustands ist auch der einzige Hebel, der die Rechnung bewegt.
Die veröffentlichten Betriebsgrenzen, damit niemand raten muss

Die Modelle-Seite von TypeSafe veröffentlicht konkrete Zahlen, sodass ein Planer sie nicht ableiten muss:
• Durchsatz und Rate. 100K Token pro Sekunde und 40 Anfragen pro Sekunde, laut docs.typesafe.ai/models.md. Eine Anfrage, die eines der beiden Limits überschreitet, gibt 429 Too Many Requests zurück; die Client-SDKs des Anbieters versuchen es standardmäßig mit Backoff erneut und beachten den retry-after-Header, wenn die Antwort einen enthält.
• Die Limits verschieben sich. Der Anbieter gibt an, dass Rate-Limits dynamisch angepasst werden und sich „ohne Vorankündigung ändern können“, sobald Kapazität verfügbar wird; höhere Limits sind in individuellen und Enterprise-Tarifen verfügbar. Betrachten Sie 100K/40 als den heutigen Wert und nicht als vertragliche Zusage.
• Kontextbudget. Das Anfragebudget beträgt ungefähr 64.000 Token über den kombinierten Zustand und alle Fragen hinweg – die Modellkarte gibt 65.536 an – und die Modellseite des Anbieters begrenzt separat den Zustand plus die einzelne längste Frage auf 32.000 Token. Diese zweite Zahl ist das Zustandsbudget, nicht eine kleinere Version der ersten; beide sind real, und keine widerspricht der anderen.
• Aliase verschieben sich unter Ihnen. jev-latest und jev-preview verweisen heute beide auf jev-1.13.0, und der Anbieter merkt an, dass derzeit kein Preview-Build verfügbar ist. Ein Alias ändert sich, sobald eine neue Version veröffentlicht wird. Wenn Sie also Konfidenzschwellen auf eine bestimmte Version abgestimmt haben, pinnen Sie die versionierte ID und wechseln Sie nach Ihrem eigenen Zeitplan.
Wie Ihr Anwendungsfall aussehen muss
Von Anfang bis Ende gelesen beschreibt die Liste des Anbieters selbst ein eng umgrenztes, nützliches Werkzeug. Jev eignet sich, wenn das Urteil begrenzt und die Arithmetik nicht Aufgabe des Modells ist: Ist dieser Datensatz richtlinienkonform, welche dieser vierzig Labels trifft zu, wie liest sich das auf einer fünfstufigen Skala – abgefragt über einen Zustand, den Sie selbst gefiltert haben, mit einer wörtlichen Anweisung und Kriterien, die damit übereinstimmen, und wobei jede Zählung, jeder Vergleich und jede Datumsmessung im Code darum herum erfolgt.
Es passt nicht, wenn die Aufgabe Zählen, Sortieren oder Datumsarithmetik erfordert, wenn sie mehrere Schritte des Schlussfolgerns braucht, wenn das Eingangsmaterial kein Text ist, wenn der Zustand ein Heuhaufen und die Frage eine Nadel ist oder wenn irgendetwas an der Quelle feindselig ist. Das sind keine Lücken in einem Prompt; es sind Stellen, an denen das Modell nicht funktioniert, und TypeSafe ist die Instanz, die das sagt.
Noch etwas, das Sie wissen sollten, bevor Sie es einbinden: der ehrliche Unterschied dabei, wie Jev aufgerufen wird. Auf OrcaRouter erreicht der Katalog Jev über den dedizierten systemone-Endpunkt, POST /v1/systemone, statt über die OpenAI-Chat-Completions-Form. Das ist ein echter Unterschied in der Anfrage, die Sie schreiben, und es ist die korrekte Version der älteren Behauptung, dass Jev „seine eigene Anfrageform spricht“. Alles andere ist wie bei jedem anderen Modell im Konto — ein Schlüssel für 200+ Modelle, keine Gebühren pro Token von uns und automatisches Failover, wenn eine Route ausfällt. TypeSafe hat die Warteliste am 21.09.2026 entfernt; die Homepage des Anbieters selbst beschreibt Jev weiterhin als Early Access, und seine eigene Benchmark-Seite ist weiterhin als ausstehend markiert, sodass die einzigen Leistungszahlen auf dieser Seite die Serving-Zahlen sind, die wir selbst gemessen haben, und die Behauptungen des Anbieters, die als seine gekennzeichnet sind.
