
„System One" als Modellkategorie: Wo Jev 1.13 darin einzuordnen ist
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 349 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 208 tok/s
- OrcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- xAISpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
„System One“ ist der Kategoriebegriff, den TypeSafe für seine Aufteilung zwischen einem Modell, das entscheidet, und einem Modell, das schreibt, verwendet, und Jev 1.13 (typesafe/jev-1.13) ist sein erstes Mitglied – ein Modell, das typisierte Antworten statt Sätze zurückgibt. Es ist kein neues Modell. TypeSafe lieferte Jev am 2026-09-15 aus, und diese Seite ist kein Launch-Beitrag: Das Modell ist fünfzehn Tage alt und außerhalb des Sieben-Tage-Fensters, für das dieser Blog schreibt. Was innerhalb des Fensters geschah, ist, dass OrcaRouter das Modell am 2026-09-24 in seinen Katalog aufnahm und die Modellkarte für Jev 1.13 unter https://www.orcarouter.ai/models/typesafe/jev-1.13 öffnete — das erste Mal, dass es über ein Gateway eines Drittanbieters aufrufbar ist statt nur über TypeSafes eigenen Endpunkt. Die Kategorieidee ist der Grund, warum diese Seite existiert; die Serving-Änderung ist der Grund, warum sie auf heute datiert ist.
Die schlichte Version der Kategorie: Ein LLM wird gefragt und schreibt eine Antwort, die ein Mensch liest. Ein System-One-Modell wird gefragt und gibt einen Wert zurück, auf den ein Programm verzweigen kann. TypeSafes eigene Formulierung lautet, dass „LLMs Wörter für Menschen erzeugen“, während „Jev typisierte Entscheidungen erzeugt und eher wie Code ist: zuverlässig, schnell, selbstkonsistent und typsicher“. Dieser Satz ist die ganze Kategorie, komprimiert in einen einzigen Teilsatz, und es lohnt sich, ihn langsam zu entpacken, denn die vier Adjektive leisten unterschiedlich viel Arbeit, und eines von ihnen leistet mehr als die anderen.
Was „eher wie Code“ tatsächlich behauptet
Nimm die vier Behauptungen der Reihe nach, denn sie sind nicht vier Neuformulierungen von „es ist besser“.
• Zuverlässig — die Form der Ausgabe steht im Voraus fest. Sie deklarieren die Frage; die Antwort kann nur als einer der Werte zurückkommen, die Sie zugelassen haben. TypeSafe erklärt unmissverständlich, dass „das Modell niemals Typfehler macht“, und merkt an, dass dies die einzige ihrer Behauptungen ist, die „mathematisch unmöglich“ durch ein Gegenbeispiel zu widerlegen ist, weil ein Wert, der nicht in Ihrer deklarierten Menge enthalten ist, kein Wert ist, den das Modell ausgeben kann.
• Schnell — alle Antworten werden in einem einzigen Durchlauf erzeugt statt Token für Token nacheinander. Der Launch-Beitrag von TypeSafe formuliert es so: „Jev gibt alle Wahrscheinlichkeiten parallel aus, anstatt autoregressiv Token für Token zu generieren.“ In unserem eigenen siebentägigen Serving-Fenster, das am 30.09.2026 endet, beträgt die mediane Zeit bis zum ersten Token bei typesafe/jev-1.13 151 ms und die p95 247 ms.
• Selbstkonsistent — derselbe Zustand mit denselben Fragen neigt dazu, dieselben Antworten hervorzubringen. Eine Programmier-Analogie macht dies nachvollziehbar, aber sie ist auch der Punkt, an dem die Analogie aufhört, ein Beweis zu sein: Der Determinismus eines Compilers ist eine Eigenschaft seiner Konstruktion, während dies eine Aussage über ein Verhalten ist. Unsere eigenen Messungen sind die ehrliche Einschätzung dazu — die Fehlerrate in unserem Playground-Traffic über dasselbe Sieben-Tage-Fenster beträgt 0,49 %, also ist es selbstkonsistent, so wie eine gute Funktion selbstkonsistent ist, nicht so wie Arithmetik.
• Typsicher — und das ist der Punkt mit dem größten Gewicht. „Typsicher“ ist hier kein Qualitätsadjektiv; es ist eine Aussage darüber, wo das Modell im Verhältnis zu einem Type-Checker steht. In einer gewöhnlichen generativen Pipeline beginnt das Typsystem erst, nachdem das Modell fertig ist: Das Modell schreibt Text, ein Parser errät die Form, ein Validator prüft sie, und ein Fehlerpfad behandelt die Fälle, in denen die Vermutung falsch war. Ein System One-Modell verlegt die Typdeklaration vor den Aufruf. Die drei Primitive, die unsere Karte dokumentiert, sind das Typsystem: noul, ein Wahr/Falsch-Urteil, das mit einer kalibrierten Wahrscheinlichkeit zurückgegeben wird; choice, ein Label, das aus bis zu 255 beschrifteten Optionen ausgewählt wird; und score, eine Bewertung auf einer geordneten Skala von 2 bis 10 Stufen. Du wählst das Primitiv, du gibst die Labels oder die Kriterien an, und der Wert, der zurückkommt, stammt aus dieser Menge.
TypeSafe veröffentlicht tatsächlich einen Unterschied zwischen den eigenen Docs und unseren, den man erwähnen sollte, anstatt ihn aufzulösen: Die Dokumentation des Anbieters zeigt ein nullindiziertes Score-Beispiel, während unsere Karte die Skala als 2 bis 10 Stufen dokumentiert. Beide beschreiben dasselbe Primitiv. Wenn du einen Schwellenwert baust, lies die Seite des Anbieters, um die genaue Indizierung zu erfahren, auf der dein SDK basiert.
Die zwei Fehlermodi, die aufhören zu existieren
Die interessante Konsequenz von „no prose“ ist nicht ästhetischer Natur. Sie besteht darin, dass die beiden Fehler, die generative Produktionspipelines dominieren, in diesem Design fehlen, statt durch es abgemildert zu werden.
Format-Drift steht an erster Stelle. Ein LLM, dem gesagt wird, es solle JSON zurückgeben, gibt meistens JSON zurück und in der übrigen Zeit etwas, das an JSON angrenzt – ein nachgestellter Kommentar, ein Markdown-Fence, ein in ein Synonym umbenanntes Feld, ein verschachteltes Objekt, wo das Schema eine Zeichenkette verlangte. Die Korrekturen auf Prompt-Ebene (strengere Anweisungen, Few-Shot-Beispiele, ein Schema in der Systemnachricht) sind alles Versuche, eine Form festzuhalten, die das Modell verlassen darf, weil die Form eine Anfrage und keine Vorgabe ist. TypeSafes Darstellung macht den Kontrast explizit: Bei Strings werden „mögliche Ausgaben und Struktur“ angefordert und Antworten „müssen geparst + validiert werden“, wobei „immer ein Risiko besteht, dass die KI entgleist“. Wenn die möglichen Ausgaben im Voraus deklariert werden, kann die Drift nirgendwohin.
Nicht parsbare Ausgabe ist die zweite, und sie ist wirklich derselbe Fehler zu einem ungünstigeren Zeitpunkt – nicht ein Feld, das leicht falsch zurückkam, sondern eine Antwort, die der Parser überhaupt nicht lesen kann und die an der ungünstigsten Stelle in einem Workflow eintrifft. Ein Modell, das einen typisierten Wert ausgibt, hat keinen solchen Zustand.
Dies ist ein strukturelles Argument, und es sollte als solches formuliert werden. Es sagt nichts darüber aus, ob eine einzelne Antwort korrekt ist — eine Auswahlfrage kann das falsche Label auswählen, und ein Noul kann wahr mit hoher Konfidenz zurückgeben, wenn die ehrliche Antwort falsch ist. Was verschwindet, ist die Kategorie von Fehlern, die ein Parser abgefangen hätte. Das ist eine echte und nützliche Reduktion, und es ist nicht dieselbe Aussage wie „die Antworten sind richtig“.
Warum der Preis eine Form und kein Rabatt ist
Das Modell kostet $0.042 pro Million Input-Tokens, wobei Output mit null abgerechnet wird – und diese Null ist kein Aktionspreis, sondern ein Artefakt des Designs. Ein Modell, das drei Tokens einer strukturierten Antwort ausgibt, hat kein Output-Volumen, das man messen könnte, also hat eine Preisgestaltung pro Output-Token nichts, woran sie ansetzen könnte. Die Abrechnungsform ist eine Gebühr pro Input-Token und eine Entscheidung. Unser Katalog gibt den Listenpreis des Anbieters mit 0 % Aufschlag weiter, daher ist der $0.042 eine Zahl von TypeSafe und nicht eine Zahl, die wir festlegen, und eine Preisänderung des Anbieters wäre noch am selben Tag live.
Stellen Sie die beiden Formen nebeneinander, und der Unterschied ist keine Prozentzahl. Die Kosten einer generativen Pipeline skalieren damit, wie viel das Modell sagt: Eine ausführliche Antwort kostet mehr als eine knappe für dieselbe Entscheidung, und ein Chain-of-Thought-Reasoning-Modell stellt die Tokens in Rechnung, die es vor der Antwort mit Nachdenken verbringt, unabhängig davon, ob die Antwort besser wird. Die Kosten eines System-One-Aufrufs skalieren damit, wie viel Sie ihm zeigen – den Zustand und die Fragen. Stellen Sie eine Frage zu einem langen Dokument, zahlen Sie für das Dokument. Richten Sie vierzig Fragen an denselben Zustand (das Eingabebudget auf unserer Karte beträgt 65.536 Tokens über den kombinierten Zustand und die Fragen hinweg, ungefähr 64K; wenn Sie in früheren OrcaRouter-Artikeln ein „ungefähr 32.000“ gesehen haben, ist das nur das Zustandsbudget, keine konkurrierende Gesamtsumme) und Sie zahlen einmal für das Dokument und bekommen vierzig Entscheidungen zurück.
Deshalb sind die Kosten pro Entscheidung und nicht die Kosten pro Token die richtige Einheit für diese Klasse – und deshalb läuft der Zähler entgegengesetzt zu dem, was die meisten Teams erwarten. Der typische Zug zur Kostensenkung bei generativen Modellen lautet: „Lass das Modell weniger sagen.“ Hier gibt es nichts, wovon es weniger sagen könnte.

TypeSafes eigene Zahlen, die vom Anbieter angegeben und nicht unabhängig repliziert wurden, zielen genau auf diesen Vergleich ab: „193,6x schneller, 444,6x günstiger“, mit der Fußnote „basierend auf Workflows für System One-Aufgaben (Nachweis)“ und einem durchgerechneten Beispiel: „TypeSafe AI Kosten 0,000081 $, abgeschlossen in 0,114 s / LLMs Kosten 0,013880 $, abgeschlossen in 8,566 s.“ Die Startseite listet außerdem „$42 pro Milliarde Eingabe-Token“ gegenüber „238x niedrigerer Eingabepreis als Claude Fable 5.1“. Betrachten Sie all dies als das Argument des Anbieters, nicht als gemessenes Ergebnis: Der Startbeitrag räumt ein, dass „unsere veröffentlichten Evals in der Regel von unseren Laptops an der Westküste aus ausgeführt werden“ und dass „wir nicht beweisen können, dass es nicht subventioniert ist; wir werden den langfristigen Zeitraum brauchen, um die Nachhaltigkeit unserer Preisgestaltung zu beweisen (von der wir erwarten, dass sie sinkt, nicht steigt).“ Diese beiden Zugeständnisse stammen vom Anbieter selbst, und sie sind der richtige Rahmen für jeden Multiplikator auf der Seite.
Kalibrierung ist die zweite Hälfte der Idee
Wäre die Kategorie nur „strukturierte Ausgabe“, würde sie Funktionsaufrufe mit zusätzlichen Schritten beschreiben. Der Teil, der sie zu einer eigenständigen Sache macht, ist, dass jede Antwort mit einer Wahrscheinlichkeit eintrifft und die Wahrscheinlichkeiten das Trainingsziel sind. TypeSafe nennt die Methode Reinforcement Learning for Calibrated Decisions (RLCD) – ihr Begriff, kein generisches Akronym –, und die Vergleichstabelle im Launch-Post stellt sie neben RLHF und RLVR: RLHF optimiert darauf, was menschliche Bewerter bevorzugen, RLVR auf Ausgaben, die programmatisch überprüft werden können, und RLCD auf „Antworten mit epistemisch ehrlichen Wahrscheinlichkeiten bei System-1-Aufgaben“.
Der praktische Unterschied besteht darin, wofür die Wahrscheinlichkeit steht. In einer generativen Pipeline ist die Konfidenzschätzung ein zweiter Generierungsschritt: Man fragt das Modell, wie sicher es ist, und es schreibt eine Zahl, die selbst Prosa ist – mit denselben Fehlerarten. Hier kommt die Wahrscheinlichkeit zusammen mit der Entscheidung zurück, im selben Durchlauf, und sie ist der Wert, anhand dessen man verzweigt. TypeSafes eigene Darstellung des Nutzens lautet: Ein Modell, das eine Aufgabe 95 % der Zeit erledigen kann, aber „nicht sagt, wann es zu den 5 % gehört“, kann nicht zur Automatisierung der Aufgabe eingesetzt werden; die Konfidenz gibt einem eine Stelle, an der man die Eskalation unterbringen kann – an eine Person oder an ein Reasoning-Modell.
Die Homepage von TypeSafe bezeichnet dies als „Zero Hallucinations“ und erklärt dazu, dass jede Entscheidung eine Konfidenzschätzung mit sich führt, sodass Software „handeln kann, wenn die Konfidenz hoch ist, und eskalieren kann, wenn sie es nicht ist“. Lesen Sie das sorgfältig: Es ist eine Aussage über Konfidenzschätzungen, nicht die Behauptung, dass nie eine Antwort falsch ist. Unsere eigene Karte ist das Gegengewicht – eine Fehlerquote von 0,49 % über die sieben Tage bis zum 30.09.2026, auf unserem Traffic, von uns gemessen. Diese Zahl ist ein rollierendes Fenster, kein festes Testset: Vor ein paar Tagen lag sie im selben Fenster bei 0,57 %, und sie wird sich erneut verschieben.
Wo System One neben System Two angeordnet ist
Das Begriffspaar „schnell/langsam“ ist viel älter als TypeSafe. Es stammt aus Kahnemans Schnelles Denken, langsames Denken, und es wurde von KI-Forschern schon Jahre zuvor übernommen — das Label „System 2“ wurde auf Chain-of-Thought- und deliberative Reasoning-Modelle angewendet, lange bevor TypeSafe existierte, und TypeSafe behauptet nicht, einen der beiden Begriffe geprägt zu haben. Was sie getan haben, ist, die Unterscheidung auf eine Produktgrenze statt auf einen Prompting-Modus anzuwenden.
• Ein System-2-Reasoning-Modell wendet mehr Rechenleistung auf, bevor es antwortet, und wird bei Problemen besser, die dies erfordern. Seine Ausgabe ist weiterhin Prosa, und die zusätzliche Rechenleistung wird als Output-Tokens abgerechnet.
• Ein System-1-Modell im Sinne von TypeSafe denkt nicht länger nach, um besser zu antworten. Es antwortet in einem Durchgang, und was es für die Geschwindigkeit aufgibt, ist die Fähigkeit, etwas anderes als einen typisierten Wert zu erzeugen.
• Die beiden sind Komplemente in einem Workflow, keine Rivalen in einem Vergleich. Ein Aufruf von System One erledigt die Entscheidungen, die schnell, günstig und nachvollziehbar sein müssen; das Reasoning-Modell bekommt die Fälle, die der Konfidenzwert als unsicher gekennzeichnet hat. Der typisierte Output ist es, der die Übergabe sauber macht – Sie übergeben einen Wert und eine Wahrscheinlichkeit an die nächste Stufe, keinen Satz, der erneut geparst werden muss.
Rutschig wird die Terminologie dort, wo man „System One-Modell“ als etablierte Kategorie behandelt, die andere Anbieter übernommen haben. Dafür gibt es keine Belege, und diese Seite sollte nicht so gelesen werden, als würde sie das behaupten. TypeSafe verwendet den Begriff für seine eigene Modellklasse; der Disclaimer in unserer eigenen Karte sagt durch Auslassung dasselbe, indem er einen einzigen Endpoint-Typ für ein einziges Modell aufführt. Wenn ein anderes Labor beginnt, den Ausdruck für dieselbe Architektur zu verwenden, wäre das eine berichtenswerte Tatsache, und für einen Bericht darüber wären seine eigenen Worte nötig.

Unsere Karte führt außerdem Zackigkeit als Teil der ehrlichen Grenze auf und nicht als Überraschung: neun benannte Fehlermodi. Die Einträge zu wörtlicher Lesart und Indirektheit sind diejenigen, die direkt aus der Analogie „eher wie Code“ folgen – ein Modell, das die Frage beantwortet, die Sie geschrieben haben, statt die, die Sie gemeint haben, verhält sich wie eine Funktion, die genau das getan hat, was im Code stand. Der Eintrag zum Zählen hingegen nicht. Ein Modell, das „die Form einer Antwort erkennt, statt zusammenzuzählen“, ist überhaupt nicht codeartig, weshalb TypeSafe selbst empfiehlt, im Code zu zählen und, wo wirklich eine Einschätzung nötig ist, eine Frage pro Element zu stellen und die Antworten selbst zusammenzuzählen.
Zwei Grenzen, die das Design prägen, nicht die Punktzahl
Beides kommt vom selben Ort: Keine Strings bedeutet, dass es nichts zu streamen und nichts stückweise zu senden gibt.
• Nicht-Streaming — die erste Ausgabe ist die fertige Antwort, daher ist ein System-Eins-Aufruf eine einzelne Antwort und kein Stream. Die Frage ist nicht, ob es streamen kann, sondern was streamen würde.
• Eine Anfrageform — das Modell wird in unserem Katalog über POST /v1/systemone bereitgestellt und nicht über die chat-completions-Form, und das ist die ehrliche Version einer älteren Behauptung, dass es „seine eigene Anfrageform spricht“. Es ist ein echter Unterschied darin, wie man es aufruft: Ein Zustandsobjekt und eine Map mit benannten Fragen gehen hinein; eine strukturierte Antwort pro Frage kommt heraus. Sie werden einen Mapper dafür schreiben, und weil die Ausgabe typisiert ist, ist der Mapper die gesamte Integration — darunter gibt es keine defensive Parsing-Schicht.
Wissenswert, bevor Sie einen Lasttest durchführen: Die Latenz ist nicht über alle Fragetypen hinweg gleich. TypeSafe erklärt warum – mit eigenen Worten: „Bei Auswahlmöglichkeiten mit höherer Kardinalität verwenden wir ein zweistufiges System, bei dem erst unabhängig bewertet und dann eine explizite Auswahl getroffen wird; daher die gelegentliche Verlangsamung.“ Eine Routing-Entscheidung mit 4 Optionen und eine Klassifizierung mit 200 Optionen sind auf dem Papier dasselbe Grundelement und in der Praxis unterschiedlich viel Arbeit. Unsere Tagesmediane in den sieben Tagen bis einschließlich 2026-09-30 liegen bei 175, 170, 163, 161, 170, 147, 143 ms. Ein Tag in dieser Reihe, 2026-09-28, hatte einen p95 von 2.448 ms – ein echter Ausreißer an einem einzelnen Tag, der ehrlicherweise in der Reihe steht, aber nicht die Gestalt des Dienstes ist.

Das andere, was man vor einer ersten Integration wissen sollte, ist, womit man sich verbindet. Das Tooling rund um Jev ist Open Source unter MIT- und Apache-2.0-Lizenzen — die Python- und JavaScript-SDKs, ein Adapter, der denselben Client mit gewöhnlichen LLM-APIs als Backend bereitstellt, der workflow-evals-Code und eine Reihe von Agent-Skills, alles in den öffentlichen Repositories von TypeSafe, mit Star-Zahlen und Push-Daten, die sich noch am 2026-09-26 und 2026-09-29 geändert haben. Das Modell ist es nicht. Es gibt kein Repository mit Gewichten: Jevs Architektur, Parameteranzahl, Trainingsrechenleistung und Gewichte sind unveröffentlicht, und wer das überprüft, sollte sich nicht von den drei Repositories in dieser Organisation täuschen lassen, bei denen es sich um Forks unzusammenhängender Projekte handelt — ein vLLM-Fork, ein Diffusions-Sprachmodell-Release aus 2025 und ein Pulumi-Provider. Keines davon sagt etwas darüber aus, wie Jev gebaut ist. Die Antwort in einem Satz lautet: Das Tooling ist offen, und das Modell ist es nicht.
Es heute auszuführen – und was sich für einen Leser ändert
Jev 1.13 ist auf OrcaRouter als typesafe/jev-1.13 verfügbar, über denselben Schlüssel wie 200+ andere Modelle erreichbar, wobei der Listenpreis des Anbieters mit 0 % Aufschlag durchgereicht wird. Der praktische Nutzen davon auf einer Seite über eine Kategorie ist begrenzt und es lohnt sich, ihn genau zu benennen: Ein Modell von System One auszuprobieren erfordert nicht länger ein separates Konto, einen separaten Schlüssel und eine separate Rechnung für ein Modell, von dem Sie vielleicht noch nicht wissen, dass Sie es wollen. Es steht neben der generativen Hälfte desselben Workflows – der Klassifizierer und der Writer auf einer einzigen Anmeldeinformation, an einem Ort, mit den Zählwerten dessen, was Sie tatsächlich aufgerufen haben.
Nichts hiervon ändert etwas daran, was das Modell ist. Es wurde am 15. September 2026 eingeführt, und TypeSafe bezeichnet es weiterhin als Early Access; daran, was es ist, hat sich seitdem nichts geändert. Was sich am 24. September 2026 geändert hat, ist, dass Lesende jetzt herausfinden können, was es sie in der Praxis kostet, ohne sich zuerst auf eine zweite Anbieterbeziehung einzulassen. Wenn Sie darauf gewartet haben, zu sehen, ob die Kategorie einen Prototyp wert ist, dann ist das der Punkt, der sich verändert hat.
