Generierte Titelkarte für RSI-Jev vs. Jev 1.13 mit der Aufschrift „Eins zum Herunterladen. Eins zum Aufrufen.“, mit einer linken Karte, beschriftet mit „RSI-Jev v6.1-VL 4B“, die ein Download-Tray-Symbol und die Zeile „Apache-2.0-Gewichte, 4,69B“ trägt, einer rechten Karte, beschriftet mit „Jev 1.13“, die ein Cloud-Endpunkt-Symbol und die Zeile „Gehostete API, 0,042 $ / 1 Mio. Eingaben“ trägt, einer Verbindungslinie zwischen den beiden Karten und der Bildunterschrift „Gleiches Wire-Format, anderer Vertrag“. Das OrcaRouter-Logo ist in die untere rechte Ecke eingefügt.
Guides & Insights

RSI-Jev vs. Jev 1.13: Eines lädt man herunter, das andere ruft man auf

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Stellt man RSI-Jev v6.1-VL 4B und Jev 1.13 nebeneinander, fällt einem Aufrufer als Erstes auf, dass es sich um dieselbe Anfrage handelt. Gibt man einem der beiden einen Zustand und eine Reihe typisierter Fragen – ein Ja/Nein, eine Auswahl aus k Optionen, eine Bewertung nach einem Raster –, liefern beide für jede Option eine kalibrierte Wahrscheinlichkeit, in einem einzigen Vorwärtsdurchlauf, ohne generierten Text auswerten zu müssen. Das ist kein Zufall: RSI-Jev ist absichtlich so gebaut, dass es Jevs Wire-Format spricht, sodass ein Client, der für TypeSafes API geschrieben wurde, dagegen läuft, indem man eine Basis-URL ändert. Nicht identisch ist alles rund um den Aufruf. Jev 1.13 ist TypeSafes geschlossenes kommerzielles Modell, das von einem Endpunkt bereitgestellt wird, dessen Nutzung Sie abrechnen; RSI-Jev v6.1-VL ist ein Checkpoint mit 4,69 Milliarden Parametern unter Apache-2.0-Gewichten, den Sie herunterladen und auf Ihrer eigenen Hardware bereitstellen. Keines von beiden ist ein Rebranding des anderen, kein Anbieter befürwortet den anderen, und fast jede Zahl in diesem Vergleich stammt von der Partei, die sie erstellt hat.

Das Datum des Subjekts ist wichtig, denn dieses Projekt veröffentlicht ungefähr jeden Tag ein Release. RSI-Jev v6.1-VL 4B wurde am 2026-10-07 vom Drittanbieter Shanghua-Gao/RSI-Jev Projekt veröffentlicht — einem selbstverbessernden Forschungskreislauf, der Entscheidungsmodelle im Jev-Stil trainiert und jeden Arm veröffentlicht, der gescheitert ist, zusammen mit denen, die gewonnen haben. Es ist das achte Release innerhalb von dreizehn Tagen auf dieser Linie, und es ist ein gewichteter Durchschnitt des vorherigen Releases mit einem zweiten Fine-Tuning desselben Qwen3.5-4B-Base. Jev 1.13 ist das Modell von TypeSafe AI, gestartet am 2026-09-15 und seit 2026-09-24 in unserem eigenen Katalog geführt. Beide Daten sind unten wichtig, denn ein Vergleich mit einem Projekt, das sich täglich weiterentwickelt, hat eine Haltbarkeit, die in Tagen gemessen wird.

Was die beiden eigentlich sind, jeweils in einer Zeile

Jev 1.13 ist ein gehostetes Entscheidungsmodell hinter einem dedizierten Endpunkt – POST /v1/systemone, ohne Streaming, mit einem Eingabebudget von ungefähr 64.000 Token, das den Zustand und alle Ihre Fragen zusammen umfasst, bepreist mit 0,042 US-Dollar pro Million Eingabe-Token, wobei die Ausgabe mit null abgerechnet wird, da es keine Ausgabe-Token gibt. Seine Architektur, Parameteranzahl und Trainings-Compute sind nicht offengelegt; TypeSafe hat gesagt, dass die Details zurückgehalten werden und möglicherweise ein Paper folgt. Sie führen es nicht aus. Sie rufen es auf, und jeder Aufruf ist eine abgerechnete Netzwerkanfrage.

RSI-Jev v6.1-VL ist die andere vollständige Variante. Es ist ein Qwen3.5-4B-Base-Turm, der End-to-End feinabgestimmt wurde, mit Entscheidungsköpfen auf den Schichten 16, 20 und 32, bereitgestellt aus einem Checkpoint, der eigenständig und in bf16 9,7 GB groß ist. Die Parameterzahl beträgt 4,69 Mrd., und es lohnt sich zu wissen, wohin sie gehen: 3,57 Mrd. in den 32 Decoder-Schichten, 0,64 Mrd. in den Token-Embeddings, 0,33 Mrd. im Vision-Turm, 0,05 Mrd. im Hauptentscheidungskopf und 0,10 Mrd. in den beiden Early-Exit-Köpfen. Es gibt weder ein Mixture-of-Experts noch ein zweites Modell. Sie installieren es mit einem pip-Befehl aus dem Repository, starten seinen Server, und ab diesem Zeitpunkt verlässt die Entscheidung niemals Ihre Infrastruktur.

• Wer es betreibt — ein abgerechneter gehosteter Endpunkt, den Sie nicht kontrollieren, vs. ein 9,7 GB großer Checkpoint auf Ihrer eigenen GPU, Apple Silicon oder CPU.

• Preisstruktur — 0,042 $ pro Million Input-Tokens, Output kostenlos, pro Aufruf bezahlt vs. null an der Marge plus die Kosten für Maschine und Betrieb.

• Eingabe-Budget — etwa 64.000 Token pro Anfrage auf dem gehosteten Modell im Vergleich zu 32.768 Text-Token plus einem Bild-Budget beim Checkpoint, wobei alles Längere abgelehnt statt abgeschnitten wird.

• Gewichte und Lizenz — geschlossen, nicht offengelegte Größe vs. Apache-2.0-Gewichte, MIT-Code, 4,69 Mrd. Parameter.

• Modalität — Text für Jevs Vertrag im Vergleich zu Text plus bis zu vier Bildern pro Anfrage bei den RSI-Jev-Vision-Releases.

• Eigentümerschaft — das kommerzielle Modell von TypeSafe AI gegenüber einem Forschungsprojekt Dritter, das in seiner eigenen Lizenzzeile angibt, „nicht mit TypeSafe AI verbunden" zu sein.

Der Punktestand auf RSI-Jevs eigenem Board – und warum er nur ein halber Vergleich ist

Die Zahl, mit der das Projekt wirbt, ist der Wert des Decision Index 0.3: 50,98 für v6.1-VL 4B, gegenüber 46,23 für die vorherige Veröffentlichung. Das ist ein vollständiger Durchlauf der Standardkonfiguration – 140.178 Anfragen, Abdeckung 1,0 – und auf dem eigenen öffentlichen Board des Projekts, datiert auf den 6. Oktober 2026, liegt es gleichauf mit dem besten 4B-Modell auf diesem Board (50,98 gegenüber 50,82 von ezjev 4B s2, was das Kit als Gleichstand bei 0,25 wertet) und belegt insgesamt Platz 27 von 113. Auf dem älteren Decision Index 0.2.1 steht es bei 50,74 gegenüber 46,24 von v6.0-VL. Seine Suite aus fünfzehn Benchmarks, ausgewiesen ohne die open_jev_ood Aufgabe, die sich als überlappend mit Trainingszeilen erwies, beträgt 0,793, und sein Hold-out-Set beträgt 0,729.

Jede einzelne dieser Zahlen stammt von RSI-Jev selbst, gemessen in RSI-Jevs Testumgebung. Der Decision Index ist ein öffentliches Benchmark-Board, aber es gibt dort keinen Messwert für Jev 1.13, weil die Suite des Projekts dafür gebaut wurde, offene Decision-Checkpoints zu bewerten, und Jev ein geschlossener Endpunkt ist. Die Versuchung, 50,98 gegen Jevs 0,727 im Typed-Decisions-Benchmark zu setzen und einen Sieger zu küren, ist also genau der Fehler, den man vermeiden sollte: Diese beiden Zahlen stammen aus unterschiedlichen Testumgebungen, unterschiedlichen Stichprobengrößen und unterschiedlichen Daten, und niemand hat ein und dieselbe Testumgebung auf beide Modelle angewendet.

Headless Chromium capture of the GitHub repository page for Shanghua-Gao/RSI-Jev: the repository header with the Public badge and the counters Fork 5 and Star 80, the repository description about typed-decision models (noul / choice / score) trained by a self-improving loop of AI agents with the checkpoints, the code that produced them and every version that failed, a commit list headed by the merge commit 'Merge pull request #35 from Shanghua-Gao/copy-no-ranking', the file rows for the v6.1-VL weight-averaging work and the v5.0-VL 3B quickstart, the counters 202 commits, 8 tags and 8 releases, the MIT license line, and the topic tags decision-model, jev, lm, system-one and typed-decisions.

Das einzige direkte Duell, das es gibt, ist das von Laya, nicht das von RSI-Jev.

Es gibt einen veröffentlichten Vergleich, der tatsächlich eine Jev-Zahl neben einem offenen Checkpoint aufführt, und er wurde von keiner der beiden hiesigen Parteien durchgeführt. Convai Innovations, die Macher des Laya-Entscheidungsmodells, haben TypeSafes veröffentlichte Jev-1.13.0-Zahlen ihren eigenen gegenübergestellt und die Einschränkungen selbst gekennzeichnet: Die Jev-Zahlen sind von Dritter Seite veröffentlicht und wurden nie von Convai gemessen, die Stichprobengrößen und Prompts unterscheiden sich, und der Anbieter führt seine eigenen Benchmarks für das Modell nicht auf. Diese Tabelle ist zur Kalibrierung lesenswert, nicht für ein Urteil – und sie enthält RSI-Jev überhaupt nicht, weil RSI-Jev zum Zeitpunkt ihrer Veröffentlichung noch nicht existierte.

Was es aber zeigt, ist die Gestalt der Frage „gehostet versus offen“, die ein Leser tatsächlich abwägt. Das gehostete Modell führt dort, wo der Möglichkeitsraum groß ist und das Modell ein breites Antwortspektrum stabil halten muss; die offenen Modelle gewinnen bei der reinen Latenz pro Aufruf, weil kein Netzwerk im Pfad liegt. Nichts an diesem Muster sagt Ihnen, welches dieser beiden konkreten Modelle für Ihre Aufgabe besser ist, und ehrlicherweise muss man sagen: Die Antwort darauf gibt es öffentlich noch nicht.

Was der Checkpoint ermöglicht, was der Endpoint nicht kann

Das stärkste Argument für RSI-Jev ist keine Punktzahl. Es ist, dass die Gewichte auf Ihrer Festplatte liegen. Bei einer Routing-Entscheidung, die auf Basis einer Patientenakte, eines Rechtsdokuments oder der Kontohistorie eines Kunden getroffen wird, ist „die Daten verlassen niemals das Gebäude“ keine Präferenz, die man gegen einen Benchmark-Punkt abwägt – sie ist eine harte Anforderung, und kein gehosteter Endpunkt, zu welchem Preis auch immer, erfüllt sie. Dieselbe Eigenschaft beseitigt das Ratenlimit: Die eigene Dokumentation des Anbieters für das gehostete Modell weist darauf hin, dass seine Limits dynamisch angepasst werden und sich ohne Vorankündigung ändern können, und ein selbst gehosteter Checkpoint hat keine solche Obergrenze, außer der, die Ihre Hardware vorgibt.

Die zweite Sache, die der Checkpoint einbringt, ist Tiefenkontrolle, und die ist ungewöhnlich. Weil die Entscheidungsköpfe auf drei Tiefen sitzen, wählt eine effort-Einstellung, wie viele Schichten eine Anfrage verwenden darf: low stoppt bei Schicht 16 bei etwa 23 ms im Median, medium bei 20 bei 27 ms, high bei 32 bei etwa 40 ms, und auto antwortet beim ersten Exit, der sicher genug ist, und nutzt im Durchschnitt 19,5 von 32 Schichten in der Suite des Projekts. Diese Latenzwerte sind die eigenen Zahlen des Projekts, gemessen auf einem einzigen H200 in bf16, und sollten nicht mit irgendeinem Hosted-Wert vermengt werden – ein lokaler Forward-Pass und ein abgerechneter API-Aufruf sind nicht dieselbe Messung, und RSI-Jevs eigene Dokumentation stellt ausdrücklich klar, dass sein früherer Vergleich mit Jevs veröffentlichter Latenz lokale GPU-Arbeit gegen einen Netzwerk-Roundtrip stellte.

Der dritte Punkt sind die Bilder. Jevs Vertrag ist: Text rein, strukturiertes JSON raus. Die RSI-Jev-Vision-Releases nehmen ein bis vier Bilder pro Anfrage als Base64-Daten-URLs entgegen, wobei der Zustand mithilfe eines Markers auf jedes verweist, und v6.1-VL erreicht 0,834 auf dem zurückgehaltenen Bildsatz des Projekts. Wenn Ihre Entscheidung „Zeigt das Foto sichtbare Schäden?“ lautet, dann ist das eine Fähigkeit, die der gehostete Vertrag überhaupt nicht bietet.

Was man aufgibt, ist ebenfalls real, und das Projekt veröffentlicht es. Die Kalibrierung wurde in dieser Version schlechter, nicht besser: Der endgültige erwartete Kalibrierungsfehler liegt bei 0,048 in Schicht 32 und 0,055 mit auto, gegenüber 0,036 und 0,024 in der vorherigen Version. Der standardmäßige einzelne Schwellenwert von 0,95 wird ausdrücklich unbestätigt ausgeliefert — er ist der Fallback einer Auswahlregel, deren eigene Wahl, 0,85, die Tiefenobergrenze des Projekts bei der Hälfte seiner Entwicklungsdaten verfehlte. Die frühen Ausstiege lesen nur Text, daher durchläuft jede Frage mit einem Bild alle 32 Schichten, unabhängig vom Aufwand. Und fünf der Bild-Trainingsquellen sind nichtkommerziell oder nur für Forschungszwecke, wobei das Projekt klarstellt, dass nicht geklärt ist, ob auf nichtkommerziellen Daten trainierte Gewichte diese Bedingungen erben.

Wo man die gehostete aufrufen sollte – und wo nicht

Dies ist der Teil des Vergleichs, bei dem wir ein eigenes Interesse haben, also lohnt es sich, präzise zu sein. Wir bedienen das kommerzielle Modell von TypeSafe als typesafe/jev-1.13 auf dem dedizierten systemone-Endpunkt — ein POST an /v1/systemone statt der OpenAI-Chat-Completions-Form, ohne Streaming, gegen den 65.536-Token-Kontext, den unser Katalog aufführt. Es ist dasselbe Anfrage- und Antwortformat, das RSI-Jev implementiert, von dem Modell, dessen Vertrag das Projekt kopiert. RSI-Jev selbst hosten wir nicht; es gibt keine rsi-jev-ID und keine shgao-ID in unserem Katalog, und wer dieses Modell möchte, lädt es herunter.

Der Grund, warum diese Unterscheidung hier relevant ist, ist eng umgrenzt und konkret. Eine Entscheidungsschicht ist selten der gesamte Workflow – sie steht meist neben einem generativen Modell, das die Antwort, die Zusammenfassung oder den Code schreibt. Historisch bedeutete das zwei Verträge. Für die gehostete Hälfte muss das nicht mehr so sein: Jev 1.13 läuft auf demselben Schlüssel wie 200+ andere Modelle zum Listenpreis des Anbieters mit 0 % Aufschlag weitergegeben, wenn TypeSafe also einen Tarif ändert, ist die Änderung bei uns noch am selben Tag live und nicht erst im nächsten Abrechnungszyklus. Die selbst gehostete Hälfte hatte dieses Problem nie, denn da sind Sie der Anbieter. Der saubere Weg, sich zwischen beiden zu entscheiden, ist, den kommerziellen Vertrag zuerst an einer Handvoll eigener gelabelter Fälle auszuprobieren, zu sehen, ob das Verhalten out of the box gut genug ist, um darauf zu automatisieren, und erst dann zu klären, ob es den Betrieb wert ist, einen 4,69B-Checkpoint selbst zu betreiben.

Headless Chromium capture of OrcaRouter's own model page for typesafe/jev-1.13: the breadcrumb 'Home / Models / TypeSafe', the page title Jev 1.13 above the slug typesafe/jev-1.13, the line 'by TypeSafe - 2026-09-24', the description that it is TypeSafe's structured decision and evaluation model taking noul / choice / score questions and returning a structured answer for each, the note 'POST /v1/systemone; non-streaming; up to ~64K input tokens; text in, structured JSON out.', the endpoint panel reading /v1/systemone with the price $0.04, our p50 TTFT of 161 ms, 363 ms and 58.9M, and the buttons 'Get the Jev 1.13 API', 'Try in playground' and 'Use via API'.

Welche du tatsächlich wählen solltest

Wählen Sie RSI-Jev v6.1-VL 4B, wenn die Entscheidung innerhalb Ihres Perimeters bleiben muss, wenn Sie eine Entscheidung sowohl zu einem Bild als auch zu Text benötigen, wenn Ihre Optionssätze in die Hunderte gehen (der Checkpoint lässt bis zu 5.120 Optionen pro Frage zu) oder wenn Sie Tiefe und Latenz pro Anfrage abstimmen möchten. Gehen Sie mit dem Wissen hinein, dass Sie ein Projekt übernehmen, das sich in dreizehn Tagen achtmal geändert hat, dass seine neueste Version Kalibrierung gegen Genauigkeit eingetauscht hat und dass seine eigene Karte die Teile der Ausstiegsrichtlinie benennt, die sie nicht bestätigen konnte.

Wählen Sie Jev 1.13, wenn Sie möchten, dass die Entscheidung ohne einen Serving-Stack auskommt, wenn Ihnen ein Endpunkt wichtig ist, den jemand anderes am Laufen hält, und wenn der Preis von $0.042 pro Million Eingabe-Tokens – ohne Ausgabe-Tokens, die abgerechnet werden müssen – im Vergleich zu Ihrem Aufrufvolumen günstig ist. Bedenken Sie dabei: Sie rufen ein geschlossenes Modell auf, dessen Größe nicht offengelegt wird, dessen Ratenlimits sich ohne Vorankündigung ändern können und dessen veröffentlichte Benchmarks Sie nicht selbst erneut ausführen können.

Das, was beide gemeinsam haben, ist nützlicher als das, was sie unterscheidet, und es ist der Grund, warum ein Vergleich wie dieser überhaupt wert ist, geschrieben zu werden. Keines der Modelle erzeugt Text, also bringt keines die Fehlerklasse mit sich, die von einem Modell stammt, das vergisst, eine geschweifte Klammer zu schließen, oder ein Feld erfindet. Beide geben Wahrscheinlichkeiten zurück, und in beiden Fällen ist die Wahrscheinlichkeit der Teil, den du an deinen eigenen gelabelten Daten validieren musst, bevor du darauf automatisierst – die Latenz ist bereits zur Ware geworden, und der Konfidenzwert ist das, was du dir pro Deployment erst erarbeiten musst. Egal, auf welcher Seite der Linie zwischen Download und Aufruf du landest, teste zuerst die Kalibrierung.

A generated two-column scoreboard titled 'RSI-Jev v6.1-VL 4B vs Jev 1.13 - the scoreboard', six rows across both columns: who runs it, 'You, on your own GPU' against "TypeSafe's hosted endpoint"; weights, 'Apache-2.0, 4.69B' against 'Closed, undisclosed'; input budget, '32,768 tokens' against 'About 64,000 tokens'; price, 'Free at the margin' against '$0.042 per 1M input'; modality, 'Text + up to 4 images' against 'Text only'; and latency, 'Local pass, ~23-40 ms' against 'Metered network call'. A footer reads 'RSI-Jev figures vendor-reported; Jev 1.13 pricing per our catalogue.'