Eine generierte Hero-Karte mit dem Titel „Was ist TypeSafe AI?“ und dem Untertitel „Das Labor hinter Jev 1.13 – typisierte Entscheidungen, nicht Prosa“, über drei beschrifteten Zeilen: „Unternehmen: TypeSafe AI, San Francisco“, „Modell: Jev 1.13 (typesafe/jev-1.13), veröffentlicht am 2026-09-15“ und „Seit 2026-09-24 über OrcaRouter geroutet“. Das OrcaRouter-Logo ist in der unteren rechten Ecke eingeblendet.
Guides & Insights

Was ist TypeSafe AI? Das Labor hinter Jev 1.13 trifft Entscheidungen, nicht Sätze

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

TypeSafe AI ist ein kleines Labor in San Francisco, das ein Modell verkauft, das keinen Satz schreiben kann, und Jev 1.13 (typesafe/jev-1.13) ist das besagte Modell. Es nimmt ein Stück Zustand – eine E-Mail, eine Logzeile, ein Support-Ticket, ein JSON-Blob – plus eine Reihe benannter Fragen und gibt pro Frage eine typisierte Antwort zurück, jede mit ihrem eigenen Konfidenzwert. Keine Prosa, kein Code, keine Erklärung und keine Chat-Box. Das Modell selbst wurde am 2026-09-15 veröffentlicht, ist also nicht neu, und nichts hier ist eine Launch-Story: Diese Seite existiert wegen einer kleineren, datierbaren Änderung. Am 2026-09-24 nahm OrcaRouter typesafe/jev-1.13 in seinen Katalog auf und öffnete die Modellkarte unter einer eigenen Adresse, was das erste Mal war, dass Jev über ein Drittanbieter-Gateway aufgerufen werden konnte und nicht nur über den eigenen Endpunkt von TypeSafe. Das ist das Ereignis, es ist mit Stand vom 2026-09-30 sechs Tage alt, und es ist der Grund, warum ein Leser, der noch keinen TypeSafe-Vertrag hat, jetzt ein System One-Modell auf denselben Schlüssel wie die generativen Modelle setzen kann, neben denen es sitzen soll. Alles andere auf dieser Seite ist Hintergrund zum Unternehmen, das es entwickelt hat.

Die ehrliche Einordnung des Zeitpunkts, denn es ist wichtig dafür, wie viel davon verifiziert ist: Jev ist vor mehr als zwei Wochen gestartet und seit 2026-09-21 allgemein verfügbar, als TypeSafe seine Warteliste entfernt hat. Was innerhalb des Sieben-Tage-Fensters liegt, ist die Routing-Änderung, nicht das Modell. Wenn Sie hier eine Launch-Review erwartet haben: Der Launch hat bereits stattgefunden, und eine Handvoll anderer Beiträge hat darüber berichtet.

Eine Unternehmensseite mit einem Manifest und ohne Architekturdiagramm.

TypeSafe beschreibt sich selbst in seiner eigenen Meta-Beschreibung als „ein KI-Labor, das maschinennative Intelligenzinfrastruktur für Automatisierung baut“, mit Systemen, die „darauf ausgelegt sind, Entscheidungen innerhalb von Software zu treffen“. Seine Homepage trägt den Stempel Version 0.01 und im Footer steht „Made in SF“. Es gibt ein Manifest, das argumentiert, dass der kürzeste Weg zu einem KI-förmigen wirtschaftlichen Wandel über die Komponierbarkeit von Intelligenz führt, sodass Software semantisches Urteilsvermögen so aufrufen kann, wie sie eine Funktion aufruft; die eigene Zusammenfassung des Unternehmens zu seinem Plan lautet: die Form maschinennativer komponierbarer KI ausliefern, sie dann zuverlässig genug für echte Automatisierung machen und dann Abstraktionen höherer Ebene anbieten, die stabil genug sind, um darauf aufzusetzen. Sein Slogan lautet: „Wir bauen Prod, nicht Gott.“ Die Teamseite nennt drei Gründer — Diogo Almeida als CEO, Sasha Sheng als COO und Erik Gafni als CTO. Das ist alles, was das Unternehmen über sich selbst sagt: eine Position, ein Produkt, drei Namen und keine Zahlen über das Unternehmen selbst.

Was die Website nicht bietet, ist genau das, wonach ein Ingenieur, der eine neue Abhängigkeit bewertet, zuerst greift. Es gibt keine Architekturseite, keine Parameteranzahl, keine Offenlegung des Trainings-Compute und keine Modellkarte im akademischen Sinne. Das eigene Benchmark-Dashboard von TypeSafe ist weiterhin als ausstehend markiert. Für ein Unternehmen, dessen Pitch auf Zuverlässigkeit beruht, ist die Offenlegung dünn, und das ist eine Tatsache darüber, was veröffentlicht wurde, nicht der Vorwurf, dass etwas verborgen wird.

A headless-browser capture of the TypeSafe AI homepage as it stood on 2026-09-30. A navigation bar reads 'TypeSafe AI | Manifesto | Our Team | Docs | Sign In'. Under it a banner announces 'NO MORE WAITLIST / TypeSafe is now open to everyone' above a 'Create your account' button, next to a blog teaser reading 'TypeSafe announces System One models and Jev' with a 'Read more' link. Lower down, a section headed 'Introducing Jev - the First Public System One Model: Jev Gives AI The Properties Of Code' appears beside a 'Join Discord' button and the tagline fragment 'Intelligence beyond chat'.

System One: die Kategorie und warum der Name entlehnt wurde

Jev ist das erste von dem, was TypeSafe System-One-Modelle nennt. Der Name stammt aus Daniel Kahnemans Unterscheidung zwischen schnellem, intuitivem System-1-Denken und langsamem, überlegtem System-2-Schlussfolgern, und im Launch-Post des Unternehmens steht das direkt so — er räumt außerdem ein, dass „System-1-Denken“ einen Beiklang von Fehleranfälligkeit gehabt habe, und argumentiert, dass diese Modelle zuverlässiger gemacht werden können als die Alternativen. TypeSafe hat den Begriff nicht geprägt und besitzt ihn nicht.

Der praktische Inhalt der Kategorie ist eine bewusste Arbeitsteilung: ein Modell, das entscheidet, und ein Modell, das schreibt. Du sollst Arithmetik, Datumsreihenfolge, Zählung und String-Vergleich in gewöhnlichem Code belassen, wo sie exakt sind, und die semantische Beurteilung an Jev übergeben. Drei Fragetypen kann es beantworten:

• noul — ein Wahr/Falsch-Urteil, das mit einer kalibrierten Wahrscheinlichkeit zurückgegeben wird

• Auswahl — wählen Sie eine von bis zu 255 beschrifteten Optionen

• score — auf einer geordneten Skala bewerten; unsere Karte veröffentlicht 2-10 Stufen, und TypeSafes eigene Dokumentation zeigt ein 0-indiziertes Beispiel, also behandle die Stufen des Anbieters als die Definition und die 2-10 als das, was die Karte veröffentlicht

Jede Frage hat ihre eigenen Anweisungen und für Auswahl und Bewertung ihre eigenen Kriterien. Anfragen über ungefähr 64K Eingabe-Token werden abgelehnt, bevor sie das Modell erreichen, und Antworten werden nicht gestreamt. Der Anbieter dokumentiert das Zustandsbudget – Zustand plus die einzelne längste Frage – separat mit 32K Token, was ein engerer Wert ist als der 65.536-Token-Kontext auf der Karte und kein Widerspruch dazu.

Ihre These, in ihren eigenen Worten

TypeSafe formuliert dies besser, als es jede Zusammenfassung könnte, deshalb hier wörtlich: „TypeSafe erzeugt Wörter für Menschen. Jev produziert und ist eher wie Code: zuverlässig, schnell, selbstsynchron und typsicher.“ Die dahinterstehende Trainingsmethode stammt ebenfalls von ihnen, und es ist ein Begriff, der präzise zugeschrieben werden sollte, gerade weil er andernorts aufgegriffen wurde, als wäre er generisch. TypeSafe nennt es Reinforcement Learning for Calibrated Decisions oder RLCD und stellt es RLHF und RLVR gegenüber: Während diese menschliche Präferenz oder programmatisch verifizierbare Belohnungen optimieren, zielt RLCD – in der Formulierung des Unternehmens – auf „Antworten mit epistemisch ehrlichen Wahrscheinlichkeiten bei System-One-Aufgaben“ ab. Behandle RLCD als eigene Wortschöpfung von TypeSafe, nicht als etabliertes Akronym in der Literatur.

Die Zahlen, mit denen sie aufwarten, und wer die Arbeitsbelastung gewählt hat

Die Startseite führt mit „193,6x schneller, 444,6x günstiger“ und verweist per Fußnote auf Workflows für System-One-Aufgaben. Darunter steht ein durchgerechnetes Beispiel: TypeSafe AI bei 0,000081 $ und 0,114 Sekunden gegenüber LLMs bei 0,013880 $ und 8,566 Sekunden. Weiter unten: „42 $ pro Milliarde Input-Tokens. 238x niedrigerer Input-Preis als Claude Fable 5.1.“ Und ein Abschnitt mit der Überschrift „Zero Hallucinations“, der bei näherer Betrachtung eher eine Aussage über Konfidenzschätzungen als ein Beweis für null Fehler ist: Jede Jev-Entscheidung enthält eine Konfidenzschätzung, sodass Software handeln kann, wenn die Konfidenz hoch ist, und eskalieren kann, wenn sie es nicht ist. Alle vier sind Zahlen von TypeSafe, auf Workloads, die TypeSafe ausgewählt hat, und keine davon wurde unabhängig repliziert. Der Launch-Post selbst sagt, das Team erwarte, dass seine 193,6x und 444,6x am oberen Ende der realen Zugewinne liegen, und merkt an, dass die Workflows von seinem eigenen Capabilities-Team erstellt wurden, wobei Referenzantworten von konkurrierenden Modellen erzeugt wurden. Unsere eigenen Serving-Daten über sieben Tage zum selben Modell beziffern die Fehlerrate auf 0,49 %, was eine andere Messung auf einem anderen Workload ist und das ehrliche Gegengewicht dazu darstellt, „null“ als absolut zu lesen.

Was sie nicht veröffentlicht haben

Jevs Architektur, Parameteranzahl, Trainings-Compute und Gewichte sind unveröffentlicht, und es gibt kein Gewichte-Repository in der GitHub-Organisation des Unternehmens. Bei Prüfung am 30.09.2026 hatte diese Organisation elf öffentliche Repositories; die substanziellen sind Tooling, alle MIT oder Apache-2.0 – ein Agent-Skills-Repo, ein Python-SDK, ein TypeScript-SDK, ein Drop-in-Client-Adapter, der auf anderen LLM-APIs aufsetzt, eine Dagger-Modulsammlung, etwas veröffentlichter Workflow-Eval-Code, ein n8n-Node und die eigene Website der Organisation. Star-Zahlen und Push-Daten ändern sich, also lies sie am jeweiligen Tag nach, statt sie von dieser Seite abzulesen.

Drei der elf sind Forks von Projekten, die nichts miteinander zu tun haben: vLLM, LLaDA und ein Pulumi-Provider für ClickHouse Cloud. Sie sind Forks fremder Arbeit und sagen nichts darüber aus, wie Jev aufgebaut ist – insbesondere nichts darüber, dass Jev diffusionsbasiert ist. Die Antwort in einem Satz auf die Frage, ob Jev Open Source ist, lautet, dass das Tooling offen ist und das Modell nicht.

Was sie sich selbst zugestehen

Zwei Eingeständnisse aus dem Launch-Post sind mehr wert als die meisten Anbieter-Vorbehalte, weil sie genau die Stellen benennen, an denen die Beweislage schwach ist. Zum Preis: „Wir können nicht beweisen, dass es nicht subventioniert ist; wir brauchen den langfristigen Verlauf, um die Nachhaltigkeit unserer Preisgestaltung zu belegen (von der wir erwarten, dass sie sinkt, nicht steigt).“ Zur Geschwindigkeit: „Unsere veröffentlichten Evals laufen in der Regel von unseren Laptops an der Westküste aus (dort ist unser Dienst derzeit beheimatet).“ Es gibt ein drittes, nützlicheres für alle, die darauf aufbauen: Bei Choice-Sets mit hoher Kardinalität betreibt Jev ein zweistufiges System, das unabhängig bewertet und dann eine explizite Wahl trifft, „daher die gelegentliche Verlangsamung“. Das ist der Anbieter, der erklärt, warum die Latenz nicht über alle Fragetypen hinweg gleich ist, und es ist die Art von Sache, die man normalerweise aus einem Support-Thread erfährt.

Wo Sie es tatsächlich anrufen können, Stand heute

Über die eigene API von TypeSafe, bei der das Modell allgemein verfügbar ist und die Startseite noch die eigene Formulierung des Anbieters „early access“ verwendet – diese Formulierung ist aktuell und sollte beibehalten werden, während „waitlisted“ nicht mehr verwendet wird: Die Dokumentation veröffentlicht konkrete Betriebsgrenzen (100K Token pro Sekunde, 40 Anfragen pro Sekunde, 429 mit SDK-Backoff bei Überschreitung eines der beiden Werte) und enthält keinerlei Wartelisten-Formulierungen. Und seit dem 24. September 2026 über OrcaRouter.

Was wir anbieten, sollte man präzise benennen, denn die Aufrufform ist der Teil, der sich unterscheidet. Der Katalogeintrag lautet typesafe/jev-1.13, benannt TypeSafe: Jev 1.13, mit unterstütztem Endpoint-Typ „systemone" — er wird also über POST /v1/systemone erreicht und nicht über die OpenAI-Chat-Completions-Form, ohne Streaming, Text hinein und strukturiertes JSON heraus, bis zu etwa 64K Input-Tokens für Status und Fragen zusammen. Der Input kostet $0,042 pro Million Tokens, und der Output wird mit null abgerechnet, denn es gibt keine Output-Tokens zu messen: eine typisierte Entscheidung ist keine Prosa. Das ist der Listpreis des Anbieters, durchgereicht, mit 0 % Aufschlag, auf demselben Schlüssel wie bei den anderen 200+ Modellen im Katalog — eine API für 200+ Modelle, 0 % Aufschlag (Anbieter-Listpreis durchgereicht, Preissenkungen der Anbieter sind hier also am selben Tag live). Wenn der Grund, warum Sie über TypeSafe AI lesen, der ist, dass Sie herausfinden möchten, ob Jevs Kalibrierung Ihren eigenen Daten standhält, bevor Sie einen Produktionspfad darauf festlegen, dann ist es der günstige Weg, sie neben einem generativen Modell laufen zu lassen, dem Sie bereits vertrauen; auf dieses Modell auszuweichen, wenn Jevs Konfidenz niedrig zurückkommt, ist der günstige Weg, es auszuliefern.

Unsere eigenen Sieben-Tage-Serving-Kennzahlen für den Zeitraum bis zum 30.09.2026, also unsere Zahlen aus unserem eigenen Traffic und nicht der Benchmark des Anbieters: p50 151 ms, p95 247 ms, etwa 349 Ausgabe-Tokens pro Sekunde, eine Fehlerrate von 0,49 % und 76,2 Mio. bereitgestellte Tokens. Der tägliche p50 über diesen Zeitraum lag bei 175, 170, 163, 161, 170, 147, 143 ms, der Median ist also leicht nach unten gedriftet. Ein Tag in der Reihe, der 28.09., hat einen p95 von 2.448 ms – ein echter Ausreißer in den Daten, nicht die Norm und keine Zahl, auf die man ein Latenzbudget stützen sollte. Diese werden täglich aktualisiert; die Karte ist die Quelle.

A generated two-column figure card titled 'Jev 1.13 - the scoreboard', with the OrcaRouter logo composited in the bottom-right corner. The left column, headed 'LATENCY & RELIABILITY', lists 'p50 151 ms', 'p95 247 ms' and 'Error rate (7d) 0.49%'. The right column, headed 'PRICE & CONTEXT', lists 'Price $42 per billion input tokens', 'Context 65,536 tokens (32K state budget)' and 'Architecture & weights Unpublished'. A footer line reads 'Vendor figures unaudited; latency and error rate are OrcaRouter serving data, 7 days to 2026-09-30.'

Wo das Modell laut TypeSafe schwach ist

Der Anbieter veröffentlicht eine Jaggedness-Seite für Jev 1.13, zuletzt überprüft am 2026-09-17, die die Fehlermodi offener benennt als die meisten Markteinführungsmaterialien. Sie ist die richtige Seite zum Lesen, bevor man auf dem Modell aufbaut, und ihre eigene Liste liest sich so. Jev beantwortet die Frage, die Sie geschrieben haben, statt der, die Sie gemeint haben, daher müssen einschränkende Wörter, Negationen und implizite Bedingungen ausdrücklich ausformuliert werden. Es ist kein Taschenrechner: Bei mathematischen Fragen schneidet es schlechter ab als bei semantischen. Es liest Datumsangaben als Text statt als geordnete Größen, daher sind Reihenfolge, Lücken und Fensterzugehörigkeit unzuverlässig, und bei gemischten Formaten noch schlechter. Doppelte Verneinungen und mehrstufige Indirektionen kosten Genauigkeit. Die Genauigkeit sinkt, wenn der Zustand mit irrelevanten Details wächst – die Seite sagt, es leide unter „context rot“ –, daher ist Filtern im Code zuerst die Lösung. Der Zustand wird als Daten behandelt, nicht standardmäßig als feindselig, daher können injizierte Anweisungen Antworten verändern. Nicht übereinstimmende Anweisungen und Kriterien verwirren es. Strukturelle Invarianten sind nicht garantiert: Eine Noul- und eine Choice-Ausgabe müssen nicht übereinstimmen, und eine Frage plus ihre Negation muss nicht eins ergeben, daher sollten Schwellenwerte nicht zwischen den beiden übertragen werden. Und es ist nicht darauf trainiert, Text zu generieren – es durch verkettete Auswahlmöglichkeiten zu zwingen, „wird nicht gut funktionieren und wird sehr langsam sein“.

A headless-browser capture of the TypeSafe model-jaggedness page for Jev 1.13, headed '# Jev 1.13 jaggedness' with the line 'Jev isn't perfect. Here are some jagged edges we are aware of with jev-1.13. Many of these will be fixed in later versions.' and the note 'Applies to jev-1.13 - Last reviewed 2026-09-17'. Below sits a table of nine documented failure modes - literal reading, math and numbers, date and time comparison, indirection, large state full of irrelevant detail, adversarial content, contradictory instructions and criteria, common-sense structural invariants, and generation - followed by explanatory body text on literal reading, counting and math.

Wie TypeSafe AI sechs Tage nach der Routing-Änderung zu lesen ist

Das Unternehmen stellt eine starke, konkrete, falsifizierbare Behauptung auf: dass ein eng gefasstes Entscheidungsmodell auf der Teilmenge von Arbeit, bei der man ein Urteil statt eines Absatzes braucht, schneller, günstiger und vertrauenswürdiger sein kann als ein allgemeines. Die Behauptung ist plausibel und teilweise durch sich selbst belegt – die Konfidenzschätzungen sind ein echter Designunterschied, der Preis ist echt, und die Latenz, die wir in unserem eigenen Traffic messen, liegt in derselben Größenordnung wie die des Anbieters. Was fehlt, ist der Teil, der es einem Außenstehenden ermöglichen würde, den Rest zu überprüfen: keine Architektur, keine Parameter, keine Gewichte, kein unabhängiger Benchmark und ein Preis, von dem das Unternehmen selbst sagt, es könne nicht beweisen, dass er nachhaltig ist. Die Fehlermodi sind dokumentiert, was mehr ist, als die meisten Labore tun, und der beste einzelne Grund, das Modell ernst zu nehmen.

Wenn Sie entscheiden, ob Sie darauf achten sollten: Führen Sie Jev mit Eingaben aus, die Sie bereits gelabelt haben, wobei die Labels ausgeblendet sind, und schauen Sie, ob seine Konfidenzwerte die Fälle, die es richtig einordnet, von denen trennen, die es falsch einordnet. Dieser Test kostet fast nichts bei 0,042 US-Dollar pro Million Eingabe-Tokens und ist der einzige, der die Frage beantwortet, die Sie tatsächlich haben. Wenn Sie entscheiden, ob Sie dem Unternehmen vertrauen sollten: Die Offenlegungen sind, was sie sind, und die ehrliche Antwort ist, dass die Beweislage derzeit das Wort des Anbieters ist plus das, was Sie selbst generieren.