Eine generierte Hero-Karte für den Artikel 'Jev 1.13 Explained', Eyebrow 'TYPESAFE SYSTEM ONE', Untertitel 'Warum das Modell in Labels statt in Sätzen antwortet', mit drei Karten rechts, auf denen steht 'Nur typisierte Antworten - kein generierter Text', 'Keine Output-Tokens, also nichts abzurechnen' und '0,042 $ pro Million Input-Tokens', sowie einer Fußzeile mit dem Text 'Aufrufbar als typesafe/jev-1.13'.
Guides & Insights

Jev 1.13 erklärt: Warum das Modell in Labels statt in Sätzen antwortet

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Jev 1.13 (typesafe/jev-1.13) ist kein Chat-Modell, und der schnellste Weg, es zu verstehen, ist, aufzuhören, sein Datenblatt so zu lesen, wie man jedes andere liest. TypeSafe hat es am 15. September 2026 als erstes Mitglied einer Klasse herausgebracht, die das Unternehmen „System One“-Modelle nennt: Man übergibt ihm einen Zustand und eine Reihe benannter Fragen, und es liefert pro Frage eine typisierte Antwort zurück – ein Label aus einer von Ihnen bereitgestellten Liste, eine Stufe auf einer von Ihnen definierten Skala oder ein Wahr/Falsch mit angehängter Wahrscheinlichkeit. Keine Prosa, kein Code, keine Erklärung. Dies ist kein Launch-Beitrag. Das Modell selbst stammt vom 15. September 2026, ist fünfzehn Tage alt und liegt außerhalb des Sieben-Tage-Fensters, auf das dieser Blog ausgerichtet ist, daher verdient es keinen eigenen Artikel zu seiner Veröffentlichung. Was innerhalb des Fensters geschah, ist, dass OrcaRouter typesafe/jev-1.13 am 24. September 2026 in seinen eigenen Katalog aufnahm und die Modellkarte für Jev 1.13 unter https://www.orcarouter.ai/models/typesafe/jev-1.13 öffnete – das erste Mal, dass Jev über ein Drittanbieter-Gateway statt nur über TypeSafes eigenen Endpunkt aufrufbar war, und die ersten Live-Serving-Daten, die jemand außerhalb von TypeSafe dazu veröffentlicht hat. Das ist die Veränderung, über die es sich zu lesen lohnt: Das Modell wurde dort ausführbar, wo es das nicht war.

Die praktische Ausprägung dieser Änderung ist klein und konkret. Vor dem 2026-09-24 bedeutete die Einführung von Jev eine zweite Anbieterbeziehung – ein TypeSafe-Konto, ein TypeSafe-Schlüssel, eine TypeSafe-Rechnung und ein maßgeschneidertes Anfrageformat, gegen das man schreiben musste. Danach sitzt Jev auf demselben Schlüssel wie der Rest eines Stacks: eine API für über 200 Modelle, 0 % Aufschlag (Listenpreis des Anbieters wird durchgereicht, sodass Preissenkungen von Anbietern hier noch am selben Tag wirksam sind), und das Modell unter typesafe/jev-1.13 über POST /v1/systemone erreichbar. Sie rufen es weiterhin in seinem eigenen Format auf – der Endpunkt ist nicht die OpenAI-Chat-Completions-Route, und so zu tun, als wäre es anders, würde eher zu einem 404 als zu einer Entscheidung führen –, aber der Vertrag, den Sie unterzeichnen, und der Schlüssel, den Sie rotieren, sind dieselben, die Sie bereits haben.

Was für ein Modell Jev ist

TypeSafes Launch-Post sagt es in einem Satz: „Unser erstes öffentliches Modell ist Jev, ab heute im Early Access verfügbar." Der Beitrag beschreibt das Modell dann als „einen Frontier-Intelligenz-Funktionsaufruf: unstrukturierter Zustand hinein, typisierte probabilistische Entscheidungen hinaus." Das ist eine faire und wichtige Beschreibung der Schnittstelle, denn fast jede falsche Erwartung an Jev entsteht daraus, dass man es als kleines Sprachmodell bewertet. Es ist kein kleines Sprachmodell. Es ist ein Entscheidungsmodell mit einer festen Ausgabegrammatik, und die Grammatik ist das Produkt.

Die Schnittstelle hat genau zwei Eingaben. Der Zustand ist das zu bewertende Material: eine E-Mail, ein Support-Ticket, eine Logzeile, ein JSON-Datensatz, ein Array aus Spielkoordinaten. Die Fragen sind eine Map benannter Elemente, von denen jedes einen Typ, eigene Anweisungen und – für die beiden strukturierten Typen – seine Kriterien trägt. Jede Frage wird gegen denselben Zustand ausgewertet, und die Antworten kommen als eine strukturierte JSON-Nutzlast zurück. Die TypeSafe-Dokumentation beschreibt die Fragen als nebenläufig und unabhängig laufend und stellt zwei Behauptungen auf, die sich aus diesem Design ergeben und nicht aus Tuning: Das Hinzufügen von Fragen verändert die Antwortzeit kaum, und das Hinzufügen von Fragen erzeugt keinen Context Rot, weil jede Frage isoliert beurteilt wird und nicht den vorherigen nachgelagert.

TypeSafes eigene Design-Leitlinie verdient es, wiederholt zu werden, denn sie ist die klarste Aussage darüber, wofür das Modell gedacht ist. Halte jede Frage atomar und klar abgegrenzt – „die Art von Einschätzung, die eine sehr sachkundige Person in ein paar Sekunden treffen könnte“. Wenn eine Entscheidung ausführliches Nachdenken erfordert oder wirklich mehrere unabhängige Faktoren miteinander verbindet, teile sie in separate Fragen auf und setze sie in deinem eigenen Code wieder zusammen. Ihr Beispiel: Statt eines einzigen Prompts „Bewerte diesen Startup-Pitch“ frage separat nach Marktgröße, technischer Machbarkeit und Differenzierung und wende dann deine eigene Gewichtung an. Das ist deshalb wichtig, weil die Gewichtung dann in einem Koeffizienten steckt, den du ändern kannst, statt in einem Prompt, den du neu schreiben musst.

Das Modell ist in jeder Hinsicht geschlossen, die für einen Ingenieur, der Risiken abwägt, von Bedeutung ist. Jevs Architektur, Parameteranzahl, Trainings-Compute und Gewichte sind unveröffentlicht. In der TypeSafe-GitHub-Organisation gibt es kein Repository für Gewichte — die elf öffentlichen Repositories dort sind Tooling, SDKs, Workflows und drei nicht damit zusammenhängende Forks, und keines davon ist das Modell.

„Typed“ ist das ganze Produkt.

Die OrcaRouter-Modellkarte veröffentlicht die drei Primitive und, wichtig, die Grenzen für jedes einzelne. Jede Frage, die du Jev stellst, hat genau eine von drei Formen:

• noul — ein Wahr/Falsch-Urteil, das mit einer kalibrierten Wahrscheinlichkeit statt eines bloßen booleschen Werts zurückgegeben wird, sodass „wahrscheinlich wahr“ und „sicherlich wahr“ unterscheidbare Werte sind.

• Auswahl — wählen Sie eine von bis zu 255 beschrifteten Optionen aus, wobei jede Option ihren eigenen Kriterientext enthält, damit das Modell weiß, wodurch sich Ihre Labels unterscheiden.

• score — Bewertung auf einer geordneten Skala von 2–10 Stufen, wobei die Stufendefinitionen als Kriterien vorgegeben werden.

Die Konsequenz dieser Einschränkung ist, dass es nichts gibt, was aus Prosa herausgeparst werden könnte, und nichts, was gegen ein Schema validiert werden könnte, von dem Sie gehofft hatten, dass das Modell es befolgt. TypeSafes Launch-Post ist ungewöhnlich direkt, was die Garantie angeht: Die „0 %“-Schema-Mismatch-Zahl in seinen Diagrammen „ist nicht empirisch. Schema-Matching ist garantiert, daher können wir getrost 0 % in die Diagramme aufnehmen.“ Wenn Ihr Antwortraum eine geschlossene Menge ist, die Sie vorgegeben haben, dann ist ein zurückgegebener Wert entweder in der Menge enthalten, oder er stammt nicht vom Modell – es gibt kein drittes Ergebnis, bei dem das Modell etwas Plausibles in der falschen Form schrieb und Ihre Regex es stillschweigend akzeptierte.

Die drei Typen sind auch der Grund, warum ein Reviewer Jev nicht so bewerten kann, wie er ein Chat-Modell bewertet. Es gibt keinen MMLU-Pro-Wert zum Vergleichen, keine Schreibprobe zum Lesen, keinen Reasoning-Trace zum Untersuchen. Die einzige Frage, die etwas bedeutet, ist, ob die typisierte Antwort richtig ist und ob die ihr beigefügte Wahrscheinlichkeit ehrlich ist. Beides ist messbar, aber nur anhand deiner Daten und deiner Labels.

Ein dokumentierter Unterschied sollte eher markiert als aufgelöst werden: Die eigene Dokumentation von TypeSafe zeigt ein Score-Beispiel, das bei null indiziert ist, während die OrcaRouter-Karte die Skala als 2–10 Stufen angibt. Der Anbieter dokumentiert Stufen; unsere Karte gibt 2–10 an. Wenn Sie ein Bewertungsraster auf Basis von Score erstellen, lesen Sie die Stufendefinitionen in Ihrer eigenen Antwort, anstatt einen Index anzunehmen.

Warum es keine Output-Tokens zum Abrechnen gibt

Die Preisgestaltung ist der klarste Ausdruck der Architektur. Jev kostet 0,042 $ pro Million Eingabe-Tokens auf OrcaRouter, und der Ausgabentarif beträgt 0,000000 $ pro Million — kein Rabatt, keine Einführungsaktion, sondern das Fehlen einer messbaren Größe. Bei einem generativen Modell wird der Text, den es schreibt, in Rechnung gestellt; Jev schreibt keinen Text. Es liefert ein Label, eine Stufe und eine Wahrscheinlichkeit zurück. Auf der Ausgabeseite gibt es nichts zu zählen, also wird dort nichts in Rechnung gestellt.

TypeSafe gibt auf seiner Homepage dieselbe Zahl aus der anderen Richtung an – „42 US-Dollar pro Milliarde Eingabe-Token“ – und verknüpft damit eine Vergleichsaussage: „238-fach niedrigerer Eingabepreis als Claude Fable 5.1“. Dieser Vergleich ist, wie alles andere auf der Homepage, der des Anbieters selbst und von niemandem unabhängig reproduziert. Doch die Arithmetik, auf der er beruht, kann ein Leser leicht anhand seiner eigenen Rechnung überprüfen, und das ist der nützliche Teil. Das Volumen einer Entscheidungs-Workload wird fast ausschließlich dadurch bestimmt, wie viel State man hineinschiebt, und State ist auf eine Weise günstig, wie generierte Token es nicht sind.

Die Schlagzeilen-Zahlen des Anbieters sind größer als die Preiszeile und verdienen dieselbe Kennzeichnung. TypeSafe bewirbt „193,6x schneller, 444,6x günstiger“ mit einer Fußnote, die dies auf „Workflows für System-One-Aufgaben“ beschränkt, und veröffentlicht darunter ein durchgerechnetes Beispiel: TypeSafe AI erreichte bei Kosten von 0,000081 $ eine Abschlusszeit von 0,114 s, verglichen mit LLMs, die bei 0,013880 $ eine Abschlusszeit von 8,566 s erreichten. Der Launch-Post selbst räumt das Darstellungsrisiko ein — die 193,6x und 444,6x werden als wahrscheinlich „am oberen Ende der realen Zugewinne“ liegend beschrieben — und merkt an, dass die Side-by-Side-Demo eine „stark vereinfachte“ Abfrage mit menschenlesbaren Schlüsseln verwendete, die der Anbieter ausgewählt hat, um „unser Modell in einem vorteilhaften Licht darzustellen“. Keine dieser Zahlen wurde unabhängig repliziert, und die eigene Benchmark-Karte des Anbieters ist nach wie vor als ausstehend gekennzeichnet.

Was „kalibriert“ bedeutet und was RLCD ist

TypeSafe gibt seinem Trainingsverfahren selbst den Namen „Reinforcement Learning for Calibrated Decisions (RLCD)“. RLCD ist ein eigener Begriff von TypeSafe, kein allgemeines Machine-Learning-Akronym, das schon vor dem Unternehmen existierte, und sein Optimierungsziel wird in der Vergleichstabelle des Launch-Posts angegeben als „kalibrierte Entscheidungen: Antworten mit epistemisch ehrlichen Wahrscheinlichkeiten bei System-One-Aufgaben“. Der Kontrast, den dieselbe Tabelle zieht, ist der zu RLHF, das auf menschliche Präferenz optimiert — Beiträge und Chat-Antworten, die Bewerter mögen —, und RLVR, das auf Ausgaben optimiert, die programmatisch verifiziert werden können. RLCD optimiert auf ein Drittes: die Wahrscheinlichkeit, die einer Antwort dafür zugeordnet wird, dass sie eine akkurate Aussage über die eigene Unsicherheit des Modells ist.

Praktisch gesprochen ist „kalibriert“ eine Aussage über die Konfidenzwerte, keine Garantie, dass die Antworten richtig sind. Ein kalibriertes Modell, das bei einer Reihe von Fragen 0,8 angibt, sollte über diese Reihe hinweg in etwa 80 % der Fälle richtigliegen; bei jeder einzelnen kann es trotzdem falschliegen. Dieser Unterschied ist die ehrliche Art, die Zeile auf TypeSafes Startseite zu lesen: „Null Halluzinationen — Jede Jev-Entscheidung geht mit einer Konfidenzschätzung einher, sodass Ihre Software handeln kann, wenn die Konfidenz hoch ist, und eskalieren kann, wenn sie nicht hoch ist.“ Es ist eine Aussage über eine Konfidenzschätzung, kein Beweis für null Fehler, und das Gegengewicht sind unsere eigenen Daten: In den sieben Tagen bis zum 30.09.2026 misst unsere Karte eine Fehlerrate von 0,49 % bei Jev-Traffic über OrcaRouter — eine Zahl, die früher im selben Zeitfenster 0,57 % betrug, weil sie über rollierende sieben Tage Live-Playground-Traffic berechnet wird statt über einen festen Testsatz. Beide Fakten gehören in denselben Absatz: Die Konfidenzwerte sind der Kern des Modells, und das Modell versagt bei unserem Traffic immer noch bei ungefähr einem von zweihundert Aufrufen.

Die Kalibrierungsgeschichte erklärt auch ein Latenzverhalten, das ansonsten wie ein Bug aussehen würde. Im Launch-Post von TypeSafe heißt es: „Bei Auswahlmöglichkeiten mit höherer Kardinalität nutzen wir ein 2-stufiges System, bei dem unabhängig bewertet und dann eine explizite Auswahl getroffen wird, daher die gelegentliche Verlangsamung.“ Eine Auswahl mit 255 Optionen ist nicht ein einziger Vorwärtsvergleich; der Anbieter bewertet und wählt dann aus. Wenn eine Anfrage gegen ein großes Label-Set deutlich länger dauert als ein noul, ist das der dokumentierte Mechanismus, keine Überlastung.

Wie du es heute nennst

A screenshot of the OrcaRouter model card for TypeSafe: Jev 1.13 at orcarouter.ai/models/typesafe/jev-1.13, showing the slug typesafe/jev-1.13, the byline 'by TypeSafe · 2026-09-24', the list price of $0.042 per million input tokens with output at $0.000000, a 65,536-token context and the single supported endpoint type systemone.

Auf OrcaRouter ist das Modell typesafe/jev-1.13, im Katalog benannt als „TypeSafe: Jev 1.13“, mit einer context_length von 65.536 Tokens und genau einem unterstützten Endpoint-Typ: systemone. Du rufst es mit POST /v1/systemone über deinen OrcaRouter-Schlüssel auf und sendest dabei ein model-Feld, ein state-Feld (String, Objekt oder Array) sowie eine questions-Map, bei der jeder Eintrag einen type (noul, choice oder score), seine instructions und seine criteria enthält. Antworten sind eine einzige strukturierte JSON-Nutzlast und werden nicht gestreamt – es gibt keinen Streaming-Modus, den man aktivieren könnte.

Der eigene Wortlaut der Karte für den Vertrag lautet „Text rein, strukturiertes JSON raus“, und die veröffentlichten Limits sind die maßgeblichen Designvorgaben: kein Streaming, bis zu etwa 64K Input-Tokens über den kombinierten Zustand und die Fragen hinweg, wobei Anfragen, die dieses Limit überschreiten, abgelehnt werden, bevor sie das Modell erreichen. Der Katalogeintrag führt den Listenpreis mit 0,042 $ pro Million Input-Tokens auf und gibt die Completion-Rate als null an. Das sind die unverändert durchgereichten Zahlen des Anbieters – die proportionale Form unserer Preisgestaltung: 0 % Aufschlag auf die Listenpreise der Anbieter.

Für dieses Modell sind zwei Token-Budgets im Umlauf, und sie stehen nicht im Widerspruch zueinander, also halten Sie sie getrennt. Die Zahl 65.536 ist der context_length der Karte und ist als ungefähr 64K Eingabe dokumentiert, wenn man State und Fragen zusammennimmt. Die „ungefähr 32.000 Token“, die frühere OrcaRouter-Artikel zitieren, sind allein das State-Budget – der Platz, den Ihr Material bekommt, bevor die Fragen ihren Anteil beanspruchen. Wenn Sie für eine Anfrage das Budget festlegen, ist das State-Budget die Zahl, die die von Ihnen erstellte Nutzlast begrenzt; die kombinierte Zahl ist die Obergrenze für den gesamten Aufruf.

Was Jev nicht kann, klar gesagt

Es kann weder Prosa schreiben noch zusammenfassen, übersetzen oder sich unterhalten. Das ist Absicht, keine Einschränkung, für die man sich entschuldigen müsste: Im Launch-Post heißt es, Jev „gibt die String-Generierung auf“, und auf TypeSafes eigener Jaggedness-Seite wird „Generation“ als benannter Fehlermodus aufgeführt, daneben die Anweisung „Verwenden Sie ein generatives Modell“. Erzwungene Generierung ist langsam und schlecht. Wenn Ihre Pipeline eine schriftliche Zusammenfassung braucht, ist Jev die falsche Komponente, und daran ändert auch die beste Prompt-Gestaltung nichts.

Es ist kein Ersatz für ein generatives Modell. Der Workflow, zu dem Jev gehört, beinhaltet zwei Modelle: ein generatives, das Text liest, schreibt und darin schlussfolgert, und Jev, das daneben sitzt und die typisierten Aufrufe in Millisekunden ausführt. Das ist die ehrliche Darstellung jedes Kostenvergleichs auf der Homepage des Anbieters – die Spalte „LLMs“ ist kein verdrängter Wettbewerber, sondern die andere Hälfte desselben Systems, und der Grund, warum die Paarung interessant ist, ist, dass die Entscheidungshälfte jetzt auf demselben Schlüssel liegt wie die generative Hälfte, statt hinter einem eigenen Vertrag.

Und „kalibriert“ bedeutet nicht korrekt. Es bedeutet, dass die einer Antwort beigefügte Zahl als Wahrscheinlichkeit lesbar sein soll. Eine 0,62 auf einem noul ist das Modell, das Ihnen sagt, dass es sich nicht sicher ist, was nützliche Information ist, die ein bloßes Ja/Nein zerstört hätte – und es ist kein Versprechen, dass das Ja richtig ist. Eskalationslogik, die auf der Konfidenz aufbaut, ist das beabsichtigte Muster; die Antwort als Grundwahrheit zu behandeln ist es nicht.

Die Zahlen ehrlich lesen

A generated figures card titled 'Jev 1.13 - the numbers we measured' with six rows: median time to first token 151 ms; p95 time to first token 247 ms; output throughput about 349 tokens/second; error rate over the window 0.49%; tokens served over the window 76.2 million; daily median 175, 170, 163, 161, 170, 147, 143 ms. The footer reads 'OrcaRouter Playground, seven days ending 2026-09-30. TypeSafe's own multipliers are vendor-reported and unreplicated.'

Jede auf unserer Karte angegebene Serving-Kennzahl stammt aus unserem eigenen Datenverkehr durch den Playground von OrcaRouter über ein rollierendes Sieben-Tage-Fenster, nicht aus dem Benchmark des Anbieters, und das Fenster hat sich verschoben, während dieser Beitrag geschrieben wurde – betrachten Sie es als Momentaufnahme, nicht als Spezifikation. Für die sieben Tage bis einschließlich 2026-09-30: Median-Zeit bis zum ersten Token 151 ms, p95 247 ms, Ausgabedurchsatz rund 349 Token pro Sekunde, Fehlerrate 0,49 % und 76,2 Millionen ausgelieferte Token. Die täglichen p50-Werte über das Fenster liegen bei 175, 170, 163, 161, 170, 147 und 143 ms – eine sich sanft verbessernde Linie. Der p95-Wert vom 28.09. mit 2.448 ms ist ein echter Ein-Tages-Ausreißer in dieser Reihe, und ihn als Norm zu zitieren wäre genauso falsch, wie es unehrlich wäre, ihn ganz wegzulassen.

Ein weiterer Vorbehalt zur Traffic-Zahl: Eine Rate von 349 Ausgabe-Tokens pro Sekunde klingt nach dem Durchsatz eines generativen Modells – bis man bedenkt, dass Jev keinen generierten Text erzeugt. Das Messgerät misst, was auch immer unser Playground auf der Antwortseite für eine strukturierte Nutzlast zählt, und es ist nützlich, um Verschlechterungen von Tag zu Tag zu erkennen, statt Jev mit einem Chat-Modell zu vergleichen.

Das sind unsere Zahlen. Die Zahlen des Anbieters sind der 193,6-fache Wert, der 444,6-fache Wert, das durchgerechnete Beispiel mit 0,000081 $ und der 238-fache Vergleich mit Claude Fable 5.1 – alle von TypeSafe selbst, keine unabhängig repliziert, alle durch ihre eigenen Fußnoten ausdrücklich auf System-One-Task-Workflows beschränkt. Die eine Leistungsbehauptung, die TypeSafe aufstellt und die überhaupt kein Benchmark ist und mehr wert ist als die Multiplikatoren, ist eine strukturelle: Weil die Antworten typisiert sind, hat die Integration keinen Parsing-Schritt und keinen Schema-Validierungsschritt, und das ist ein Kostenpunkt, der in keiner Latenztabelle auftaucht.

Was ist offen und was nicht

Geprüft am 30.09.2026: Die TypeSafe-GitHub-Organisation hat elf Repositories veröffentlicht. Keines enthält Jev. Diejenigen, die für einen Entwickler, der das Modell integriert, relevant sind, stehen alle unter MIT oder Apache-2.0: skills (MIT), system-one-adapter-python (MIT, beschrieben als „Drop-in-Ersatz für TypeSafeClient, unterstützt durch LLM-APIs“), typesafe-sdk-js (MIT), typesafe-sdk-python (MIT), daggerverse (Apache-2.0), WorkflowEvals (Apache-2.0, wobei der Workflow-Code unter evals.typesafe.ai veröffentlicht ist), n8n-nodes-typesafe-ai (MIT), typesafe-ai.github.io und pulumi-clickhouse. Anzahl der Stars und Push-Daten ändern sich, wenn du das später liest, prüfe daher lieber erneut nach, statt dich auf die Liste zu verlassen.

Drei der elf sind Forks nicht verwandter Projekte und beweisen nichts darüber, wie Jev funktioniert: ein vLLM-Fork, der zuletzt im Mai 2025 gepusht wurde, ein LLaDA-Fork vom Juni 2025 – LLaDA ist eine nicht damit zusammenhängende Veröffentlichung eines Diffusions-Sprachmodells – und ein Pulumi-Provider für ClickHouse Cloud. Es ist verlockend, aus einer Fork-Liste eine Architektur herauszulesen. Tun Sie das nicht: Nichts über Jevs Design ergibt sich aus diesen dreien, und insbesondere ist Jev kein Diffusionsmodell, so sehr die Anwesenheit eines LLaDA-Forks dies auch nahelegen mag.

Die ehrliche Ein-Satz-Antwort auf „Ist Jev Open Source?“ lautet, dass das Tooling offen und das Modell nicht offen ist. Das ist eine normale Regelung für ein gehostetes Frontier-Modell, und es ist die Regelung, die Sie annehmen sollten, wenn Sie rund um Jev planen: eine API mit einem veröffentlichten Preis, einem dokumentierten Vertrag und einer nicht veröffentlichten Parameteranzahl.

Wo der Anbieter sagt, Jev sei unzuverlässig

TypeSafe veröffentlicht eine eigene Jaggedness-Seite für jev-1.13, zuletzt geprüft am 2026-09-17, die benennt, wo das Modell versagt. Sie ist ungewöhnlich offen und der richtige Ort, um einen Abschnitt zu Einschränkungen zu beginnen, weil sie die Liste des Anbieters selbst und nicht die eines Wettbewerbers ist:

• Wörtliche Lesart — sie nimmt Formulierungen beim Wort. Einschränkende Wörter, Verneinungen und implizite Bedingungen werden nicht erschlossen; sie „beantwortet die Frage, die Sie geschrieben haben, nicht die, die Sie gemeint haben.“ Die Lösung des Anbieters besteht darin, die genaue Bedingung und die Kriterien für jede Option aufzuschreiben.

• Mathematik und Zahlen — es ist kein Taschenrechner und zählt nicht zuverlässig. Arithmetik gehört in den Code.

• Datums- und Zeitvergleich — Datumsangaben werden als Text gelesen, nicht als geordnete Größen, daher sind Reihenfolge, Lücken und Zeitfenster unzuverlässig – bei gemischten Formaten noch schlimmer.

• Indirektion – doppelte Verneinungen und mehrstufige Schlussfolgerungen verringern die Genauigkeit. Reduzieren Sie die Anzahl der Zwischenschritte und verweisen Sie direkt auf den relevanten Zustand.

• Großer Zustand voller irrelevanter Details – zusammenhanglose Inhalte wirken als Ablenkung, und die Genauigkeit sinkt, je weiter der Zustand wächst. Erst filtern.

• Gegnerische Inhalte – der Zustand wird nicht als feindselig behandelt, sodass eingeschleuste Anweisungen oder irreführende Formulierungen Antworten verändern können.

• Widersprüchliche Anweisungen und Kriterien — wenn die beiden Unterschiedliches verlangen, könnte das Modell „verwirrt werden“.

• Strukturelle Invarianten des gesunden Menschenverstands — P(noul) und 1 − P(nicht noul) sind nicht garantiert konsistent. Frage jede Entscheidung nur in eine Richtung ab und erzwinge Identitäten im Code.

• Generierung – bereits behandelt, und die Empfehlung des Anbieters selbst ist, ein generatives Modell zu verwenden.

Zwei davon verdienen besondere Betonung. Der adversarische Punkt ist wichtig, weil Jevs gesamtes Wertversprechen darin besteht, nicht vertrauenswürdiges Material zu beurteilen, und ein Zustand, der Anweisungen enthält, eine Antwort beeinflussen kann; wenn dein Zustand von Nutzern stammt, ist das eine Prompt-Injection-Oberfläche mit derselben Form wie jede andere. Der Punkt mit den Struktur-Invarianten ist wichtig, weil ein „kalibriertes“ Modell einen dazu einlädt, mit seinen Wahrscheinlichkeiten zu rechnen, und der Anbieter sagt dir, du sollst nicht annehmen, dass die Rechnung aufgeht.

Wozu sich der Launch-Post verpflichtet – und wozu nicht.

A screenshot of TypeSafe's own launch post, headed 'Introducing System One Models & Jev' and dated Sep 15, bylined 'Diogo Almeida, founder, TypeSafe', showing the opening paragraphs that frame the model as a frontier-intelligence function call taking unstructured state in and returning typed probabilistic decisions out.

Nahezu jede in diesem Beitrag zitierte Anbieteraussage lässt sich auf eine einzige Seite zurückverfolgen: TypeSafes eigene Ankündigung, eingestellt unter Unternehmensnachrichten und datiert auf den 15.09.2026, unterzeichnet vom Gründer Diogo Almeida. Es ist die zwei Minuten wert, sie direkt zu lesen, denn die Formulierung einer einzigen Zeile setzt die Bedingungen für alles seither. „Unser erstes öffentliches Modell ist Jev, ab heute im Early Access verfügbar.“ Early Access ist die eigene Beschreibung des Anbieters für die Verfügbarkeit auf der anbietereigenen Plattform, und sie ist eine engere Aussage, als es den Anschein hat – sie verpflichtet TypeSafe dazu, das Modell zugelassenen Nutzern bereitzustellen, und sagt nichts darüber aus, wer es sonst bereitstellen darf. Genau diese Lücke hat die Katalogergänzung vom 24.09.2026 geschlossen, und deshalb ist die Modellkarte für alle, die Jev heute bewerten, wichtiger als der Beitrag.

Dieselbe Seite ist ebenso klar über ihre eigenen Grenzen, weshalb sie oben zitiert statt paraphrasiert wird. Sie veröffentlicht keine Parameteranzahl, keine Architekturbeschreibung über „eine neue Modellarchitektur“ hinaus, keine Trainingsrechenleistung und kein Gewichte-Repository, und sie nennt kein Datum und keine Bedingungen für die allgemeine Verfügbarkeit. Diese Abwesenheiten sind die Planungsbeschränkungen: eine API mit einem veröffentlichten Preis auf der einen Seite und ein Stack, dessen Interna man nicht einsehen kann, auf der anderen. Der Beitrag beschreibt das Modell außerdem ehrlich genug, um als Spezifikation nützlich zu sein – „ein Frontier-Intelligence-Funktionsaufruf: unstrukturierter Zustand hinein, typisierte probabilistische Entscheidungen heraus“ –, was der eine Satz darin ist, der die Schnittstelle statt der Ambition beschreibt.

Fragen, die diese Schnittstelle aufwirft

Was passiert, wenn ein Auswahlsatz mehr als 255 Optionen umfasst? Er wird begrenzt – 255 beschriftete Optionen sind die Obergrenze für eine Auswahlfrage, und der zweistufige Ansatz des Anbieters – erst bewerten, dann auswählen – ist das, was zum Einsatz kommt, wenn die Kardinalität steigt, was auch die dokumentierte Ursache für gelegentliche Verlangsamungen bei großen Label-Sets ist. Wenn Ihre Taxonomie größer als das ist, besteht die Design-Antwort darin, sie in mehrere Fragen zu zerlegen und im Code wieder zusammenzuführen, was derselbe Ratschlag ist, den TypeSafe für zusammengesetzte Urteile gibt.

Bedeutet der 65.536-Token-Kontext, dass 65.536 Token auf den Zustand entfallen? Nein. Das veröffentlichte Budget beträgt ungefähr 64K Token über den kombinierten Zustand und alle Fragen hinweg, und die Zahl „ungefähr 32.000 Token“, die in älteren Berichten auftaucht, ist allein das Budget für den Zustand. Budgetieren Sie Ihr Payload anhand der Zustandszahl, nicht anhand der kombinierten Zahl, und denken Sie daran, dass Anfragen über dem Limit abgelehnt werden, bevor das Modell erreicht wird.

Was soll man damit machen?

Jev 1.13 ist einen Blick wert, und zwar aus einem ganz bestimmten Grund und nicht aus einem allgemeinen. Wenn Sie in Ihrer Pipeline einen Schritt haben, bei dem derzeit ein Chat-Modell gebeten wird, ein Label zurückzugeben, und dem zugetraut wird, es in der richtigen Form zurückzugeben – ein Router, ein Grader, eine Policy-Prüfung, eine Rubrikbewertung, die auf Tausende Datensätze angewendet wird –, dann ist genau dieser Schritt der, den dieses Modell ersetzt, für 0,042 $ pro Million Eingabe-Tokens, wobei auf der Ausgabeseite nichts abgerechnet wird. Wenn Sie einen Schritt haben, der eine schriftliche Antwort benötigt, ist Jev nicht das richtige Werkzeug, und der Anbieter selbst sagt das.

Was sich in der letzten Woche geändert hat, ist nicht das Modell. Es ist, dass der Versuch, es auszuprobieren, keine zweite Anbieterbeziehung mehr erforderte. Vor acht Tagen bedeutete eine Jev-Evaluierung ein separates Konto und eine separate Integration; heute ist es eine Modell-ID auf einem Schlüssel, der bereits 200+ Modelle erreicht, wobei der Listenpreis des Anbieters unverändert weitergegeben wird und die typisierten Antworten von derselben Stelle wie alles andere zurückkommen. Für ein so ungewöhnliches Modell ist die Möglichkeit, es anhand Ihrer eigenen Labels zu testen, ohne sich auf einen neuen Vertrag festzulegen, der größte Teil der Entscheidung.