Eine generierte Titelkarte mit der Aufschrift „Jev vs DeepSeek V4.1 Flash“ über dem Untertitel „Acht Cent pro Tausend sind kein Burggraben“, die Jev (getippte Entscheidungen, kalibrierte Konfidenz, 0,042 $ pro Million Input, Output kostenlos) DeepSeek V4.1 Flash (generativ, 1M Kontext, 0,30 $ / 1,20 $ pro Million zu Spitzenzeiten) gegenüberstellt.
Guides & Insights

Jev vs. DeepSeek V4.1 Flash: Acht Cent pro Tausend sind kein Burggraben

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Der Vergleich, der die Jev-Frage entscheidet, richtet sich nicht gegen ein Frontier-Modell. Er richtet sich gegen DeepSeek V4.1 Flash, veröffentlicht am 10. September 2026 – fünf Tage, bevor TypeSafe AI Jev auf den Markt brachte –, weil DeepSeek V4.1 Flash ein generatives Modell ist, das wirklich günstig ist, und es das Günstigste im Raum ist, das fast alles kann, was Jev kann. Ein im September 2026 veröffentlichter unabhängiger Test ließ 77 Beispiele aus BANKING77, dem Standarddatensatz zur Intent-Klassifikation, durch beide laufen: Jev kam auf 7 Cent pro 1.000 Klassifikationen bei 75 % Genauigkeit. DeepSeek V4.1 Flash kam auf 8 Cent pro 1.000 bei 79 % Genauigkeit. Derselbe Test setzte GPT-5.6 Luna bei 12 Cent und 83 % an. Ein generatives Modell mit einem Kontextfenster von einer Million Token, nativem Tool-Calling und Bildeingabe landete einen Cent pro tausend Klassifikationen hinter einem zweckgebauten Entscheidungsmodell – und vier Punkte vorne bei der Genauigkeit. Das ist die unbequeme Tatsache im Zentrum dieses Vergleichs, und sie ordnet neu ein, was Jev tatsächlich verkauft.

Was jedes Modell macht

A screenshot of the TypeSafe AI documentation for Jev, showing the typed Choice, Score and Noul primitives, parallel evaluation against one shared read of the state, free output, and the roughly 32,000-token request budget.

Jev ist ein System-One-Entscheidungsmodell: Es gibt überhaupt keinen Text zurück. Sie senden einen Zustand plus typisierte Fragen – Choice aus einer von Ihnen vorgegebenen Liste, Score anhand eines geordneten Bewertungsrasters oder Noul (eine Ja/Nein-Behauptung mit kalibrierter Wahrscheinlichkeit) – und es liefert typisierte Antworten mit Konfidenzwerten zurück. Alle Fragen werden parallel anhand einer gemeinsamen Auslesung des Zustands ausgewertet, weshalb das Hinzufügen von Fragen die Antwortzeit kaum verändert und weshalb die Ausgabe nichts kostet: Es gibt keine Ausgabe-Tokens, die gemessen werden müssten. Die Eingabe kostet 0,042 $ pro Million Tokens, die Ausgabe ist kostenlos, und das Anfragebudget beträgt etwa 32.000 Tokens. Es wurde am 15. September 2026 von TypeSafe AI auf den Markt gebracht – gegründet von Diogo Almeida mit einer 40-Millionen-Dollar-Seed-Runde unter der Leitung von DCVC.

DeepSeek V4.1 Flash ist ein konventionelles generatives Modell und tut nicht so, als wäre es anders. Es wurde am 10. September 2026 mit einer API-ID von deepseek-flash veröffentlicht, konzipiert als Mixture-of-Experts mit 552 Mrd. Parametern und asymmetrischer Aktivierung bei 8B/16B, einem Kontextfenster von 1 Mio. Token sowie Text- und Bildeingabe. Es generiert Text Token für Token, und genau diese Eigenschaft macht es pro Aufruf teurer und pro Aufruf leistungsfähiger. Es läuft mit 208,3 Token pro Sekunde bei einer Zeit bis zum ersten Token von 1,13 Sekunden und kostet 0,30 $/1,20 $ pro Million Token zu Spitzenzeiten und 0,15 $/0,60 $ außerhalb der Spitzenzeiten. Bei Artificial Analysis liegt es bei einem Index von 40 — Mittelklasse, nicht Frontier.

Warum die Mathematik pro Klassifizierung dort landet, wo sie landet

Die Ein-Cent-Lücke ist kein Zufall, und sie ist nicht stabil. Sie ergibt sich daraus, wie jedes Modell abrechnet.

• Jevs Kosten pro Entscheidung sind im Wesentlichen fest — Sie zahlen für einen einzigen Durchlauf über die Eingabe, bei 0,042 $ pro Million Tokens, und die Anzahl der Fragen, die Sie stellen, ändert daran kaum etwas. Eine Klassifizierung, die ein Label benötigt, und eine Klassifizierung, die zwanzig Labels benötigt, kosten nahezu dasselbe.

• Die Kosten pro Entscheidung bei DeepSeek V4.1 Flash skalieren mit dem Output. Die Klassifizierung in ein kurzes Label ist günstig; dieselbe Aufgabe, bei der man eine Begründung, eine Konfidenz und eine strukturierte JSON-Hülle anfordert, verursacht ein Vielfaches an Output-Tokens und damit ein Vielfaches des Preises.

• Peak statt Off-Peak verdoppelt DeepSeeks Eingabepreis und verdoppelt seinen Ausgabepreis. Führen Sie einen Klassifizierungsjob zur falschen Stunde im Batch aus, und die Ein-Cent-Lücke wird zu einer völlig anderen Zahl.

Deshalb weichen unabhängige Schätzungen der Lücke so stark voneinander ab. Der BANKING77-Test mit 77 Beispielen ergab 7¢ gegenüber 8¢. Ein separates zusammengesetztes Benchmark, JevBench, bezifferte Jev mit $0.041 pro 1.000 und DeepSeek V4.1 Flash mit $0.579 pro 1.000 — eine vierzehnfache Lücke. Ein dritter Test mit 83 Verkaufskontakten ergab für DeepSeek V4.1 Flash $0.183 pro Durchlauf gegenüber Jevs $0.0055, eine 33-fache Lücke. Der Grund, warum diese Zahlen sich über zwei Größenordnungen erstrecken, ist, dass jede einen anderen Prompt, eine andere Ausgabeform und eine andere Tageszeit annahm. Wer eine einzelne Zahl pro Klassifizierung anführt, als wäre sie eine Eigenschaft des Modells statt des Testaufbaus, will etwas verkaufen.

Was dir Jevs Struktur gibt, was ein generatives Modell nicht kann

Das Unterscheidungsmerkmal ist nicht der Preis. Es ist der Vertrag. Jevs Ausgabe ist schemafixiert: Weil jede mögliche Antwort vor dem Modelllauf aufgezählt wird – Sie haben die Auswahlliste, das Bewertungsschema oder die Wahr-/Falsch-Aussage vorgegeben –, gibt es keinen Raum, einen Wert außerhalb des deklarierten Typs auszugeben. Eine fehlerhafte Antwort kann Jev nicht erzeugen. DeepSeek V4.1 Flash lässt sich mit einem Schema auf strukturierte Ausgabe beschränken und hält sich in der Praxis meist daran, doch die Garantie ist ein starker Prior statt einer strukturellen Eigenschaft. Wenn Ihre Pipeline monatlich zehn Millionen Klassifizierungen ausführt, sind „meist“ und „immer“ unterschiedliche Posten in einem Incident-Report.

Die zweite Eigenschaft ist die Kalibrierung. Jev wird mit einer Methode trainiert, die TypeSafe RLCD nennt – Reinforcement Learning for Calibrated Decisions – und jede Antwort trägt eine Wahrscheinlichkeitsverteilung, sodass dein Code Schwellenwerte festlegen kann: oberhalb automatisch akzeptieren, im mittleren Bereich markieren, unterhalb eskalieren. DeepSeek V4.1 Flash gibt eine Konfidenzzahl aus, wenn du danach fragst, aber sie ist ein generiertes Token, keine kalibrierte Ausgabe, und eine generierte Konfidenz ist eine Behauptung über sich selbst statt einer Messung. Dieser Unterschied ist der eigentliche Grund, für ein Entscheidungsmodell zu bezahlen, und es ist das Eine, das ein billiges generatives Modell strukturell nicht erreichen kann.

Der dritte Punkt ist die Latenzform. Die dokumentierte End-to-End-Latenz von Jev beträgt 70–500 ms, unabhängig davon, wie viele Fragen angehängt werden, gegenüber 3–329 Sekunden für Frontier-LLM-Aufrufe im eigenen Vergleich von TypeSafe. Die 1,13 Sekunden TTFT und der Durchsatz von 208 Tokens/Sekunde von DeepSeek V4.1 Flash sind hervorragend für ein generatives Modell, und das ist der Maßstab, an dem es gemessen werden sollte – doch bei ein paar hundert Millisekunden generierter Ausgabe plus First-Token-Latenz sind es Sekunden pro Entscheidung, nicht Bruchteile davon. Auf dem internen Workflow-Dashboard von TypeSafe gewinnt Jev in den Spalten Kosten und Latenz und verliert in der Spalte Genauigkeit, mit 61,8 % gegenüber 79,1 % bei der Rechnungsverarbeitung und 76,0 % gegenüber 78,3 % beim Kundenservice. Die Referenzantworten des Dashboards sind gemittelte Modellbewertungen und nicht die Ground Truth, und das Dashboard selbst weist auf einen möglichen Harness-Bias hin.

Die Kontextlücke ist real und einseitig

Eine Dimension ist hier nicht annähernd vergleichbar und keine Frage der Darstellung. DeepSeek V4.1 Flash verfügt über ein Kontextfenster von einer Million Token; Jevs Anfragebudget beträgt ungefähr 32.000 Token. Wenn Ihre Klassifizierung davon abhängt, einen ganzen Vertrag, einen langen Support-Thread oder eine große Codedatei zu lesen, kann DeepSeek V4.1 Flash das sehen und Jev nicht – keine noch so große Kostengünstigkeit pro Entscheidung behebt einen Zustand, der nicht passt. Jev nimmt zum Marktstart außerdem keine Bild- oder Audioeingaben entgegen, während DeepSeek V4.1 Flash Bilder akzeptiert.

Die Kehrseite ist, dass das enge Fenster von Jev so bewertet wird, als wäre es eine Belastung statt einer Einschränkung, und das zweistufige Muster in der eigenen Dokumentation von TypeSafe ist der Workaround: Für Choice-Felder jenseits der Obergrenze von 255 Optionen werden Kandidaten in Stapeln bewertet und dann über die Bewertungen hinweg ausgewählt. Das funktioniert, wenn der Zustand klein und die Optionsmenge groß ist. Es funktioniert nicht, wenn der Zustand groß ist.

Wohin jeder gehört

Greife zu Jev, wenn die Entscheidung tatsächlich in geschlossener Form vorliegt, der Zustand in 32K Tokens passt, das Volumen hoch genug ist, dass Sekunden pro Aufruf echte Kosten darstellen, und die Pipeline einen Konfidenzwert benötigt, auf den sie verzweigen kann. Guardrail-Prüfungen, Verifizierung pro Turn innerhalb einer Agent-Schleife, Routing mit hohem Volumen und die parallele Bewertung großer Dokumentenmengen sind die dokumentierten Einsatzbereiche.

Greifen Sie zu DeepSeek V4.1 Flash, wenn die Aufgabe darin besteht, etwas Langes zu lesen, wenn sie eine Begründung zusammen mit dem Label liefern muss, wenn sie ein Bild sehen muss oder wenn die Klassifizierung ein Schritt in einem längeren generativen Workflow ist und ihre Auslagerung an einen zweiten Anbieter einen zusätzlichen Sprung für eine Ersparnis von einem Cent bedeuten würde, die ein schlechter Prompt zunichtemachen könnte. Und beachten Sie, dass „ein generatives Modell kann es auch“ die korrekte Beschreibung der Aufgabe ist, nicht ein Versagen von Jev – die interessante Frage ist, ob Sie den Konfidenzwert benötigen, denn das ist der einzige Posten im Vergleich, den ein generatives Modell zu keinem Preis bieten kann.

Die Entscheidungsschicht und die generative Schicht mit einem Schlüssel betreiben

A screenshot of the OrcaRouter model page for DeepSeek V4.1 Flash, showing the model routed through the unified API with provider list price passed through at 0% markup, plus the routing-details and failover panels.

DeepSeek V4.1 Flash ist eines der Modelle, die OrcaRouter routet – zum Listenpreis des Anbieters, durchgereicht mit 0 % Aufschlag. So ist die Off-Peak-Reduzierung am selben Tag, an dem DeepSeek sie einführt, auch bei uns live, und du musst nicht zwei Preislisten nachverfolgen. Jev selbst bieten wir nicht an: Das Modell von TypeSafe befindet sich im Early Access und spricht sein eigenes Anfrageformat. Die Architektur, auf die dieser Vergleich hindeutet, ist die Zwei-Modell-Architektur – Jev entscheidet, DeepSeek V4.1 Flash generiert – und OrcaRouter deckt die generative Hälfte hinter einem einzigen OpenAI-kompatiblen Endpunkt ab, mit automatischem Failover, damit eine noch nicht bewährte Entscheidungskomponente nie zum Single Point of Failure wird. 200+ Modelle, ein Schlüssel, eine Rechnung.

Das Urteil

Wenn Sie hierhergekommen sind in der Erwartung, dass Jev dramatisch günstiger als ein generatives Modell sei, dann ist die ehrliche Antwort, dass es gegenüber DeepSeek V4.1 Flash normalerweise nicht so ist, und in diesem speziellen Test mit 77 Beispielen war es einen Cent günstiger und vier Punkte weniger genau. Was Jev verkauft, ist nicht der Preis pro Klassifikation. Es ist eine strukturelle Garantie, dass die Ausgabe nicht fehlerhaft sein kann, ein kalibrierter Konfidenzwert, anhand dessen Ihr Code verzweigen kann, und eine Latenzuntergrenze, die in Millisekunden statt Sekunden gemessen wird. Diese drei Dinge sind es wert, dafür zu bezahlen in einer Pipeline, die oft genug läuft, als dass es darauf ankommt — und sie sind überhaupt nichts wert, wenn Ihre Aufgabe darin besteht, ein 400-seitiges Dokument zu lesen und eine Zusammenfassung davon zu schreiben, was die Aufgabe von DeepSeek V4.1 Flash ist und niemals die von Jev war.

A generated two-column scoreboard comparing Jev and DeepSeek V4.1 Flash across the same six labelled dimensions, with a footer reading "Per-classification figures from a 77-example test; not a controlled comparison."