Een gegenereerde titelkaart met als kop 'Wat is RSI-Jev?' en als ondertitel 'Een zelfverbeterende onderzoekslus die Jev-achtige beslissingsmodellen bouwt', boven een rij van drie afgeronde mijlpaalkaarten met de tekst '4,69 miljard parameters - Qwen3.5-4B-Base-toren', 'Drie uitgangen - lagen 16 / 20 / 32' en 'Besteedt diepte, geen tokens'; een voettekst luidt 'Elk cijfer op de pagina is van het project zelf, gelezen op 2026-10-07.', met minimale platte lijniconen en het OrcaRouter-logo samengevoegd in de rechteronderhoek.
Guides & Insights

Wat is RSI-Jev? Een zelfverbeterende lus die beslissingsmodellen in Jev-stijl bouwt

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

RSI-Jev is een open onderzoeksproject van derden dat Jev-achtige System One-beslissingsmodellen bouwt, en het model waar deze pagina over gaat is de 4B-release, RSI-Jev v6.0-VL, gedateerd 2026-10-06. Het is geschreven door Shanghua Gao (@gasvn), met Sufian (@SufianTA) vermeld in de dankbetuigingen van de repository, en het is niet TypeSafe's Jev en niet verbonden aan TypeSafe AI — de licentieregel van het project zelf zegt precies dat. Het idee eronder is smal genoeg om in één zin te zeggen: stel een getypeerde vraag over een document, een chat of een afbeelding — ja/nee, kies-één-uit-k, beoordeel-op-een-rubric — en één forward pass retourneert een gekalibreerde waarschijnlijkheid voor elke optie. Er wordt niets gegenereerd, dus er zijn geen reasoning-tokens om te verbruiken, en er worden er ook geen verbruikt. v6.0-VL is niet de eerste release van het project; het is de zevende in twaalf dagen, wat het allerbelangrijkste is om erover te begrijpen, want de nuttige informatie zit hier in de vorm van de lijn en niet in een afzonderlijk checkpoint.

Eén ding moet gezegd worden vóór alle cijfers, want het dateert ze allemaal. v6.0-VL stond precies één dag aan kop. Op 2026-10-07 om 07:56 UTC — vanmorgen — publiceerde het project RSI-Jev v6.1-VL, dat het gemiddelde is van v6.0-VL, met een gewicht van 0,5 voor elk, met een tweede fine-tune van hetzelfde Qwen3.5-4B-Base dat op andere data is getraind, en dat 50,98 scoort op de Decision Index 0.3-kit van het project tegenover 46,23 van v6.0-VL op diezelfde kit. Na het gemiddelde is er niets meer getraind. De kalibratie is slechter dan die van v6.0-VL, en dat staat ook op zijn eigen kaart. Die release is echt en actueel; deze pagina gaat er niet over. Elk cijfer hieronder komt uit het release-record van v6.0-VL, gedateerd 2026-10-06, en waar een telling sindsdien is veranderd — de release-telling, de experimenttelling — geeft deze pagina zowel het cijfer zoals het stond voor v6.0-VL als het cijfer zoals het er vandaag uitziet.

Wat RSI-Jev niet is, is ook het vermelden vroeg waard, want twee van de drie voor de hand liggende aannames zijn onjuist. Het is geen gehost product dat je vandaag via een algemene API kunt aanroepen, en het wordt niet geserveerd door OrcaRouter — onze catalogus bevat geen rsi-jev-id, geen shgao-id en geen modelkaart ervoor. Het enige dat we wél hebben, is het model waarvan dit project het HTTP-contract kopieert: de commerciële Jev van TypeSafe, die we als typesafe/jev-1.13 op het systemone-endpoint serveren. Een van die twee roep je aan, en de andere download en serveer je zelf. Alles hieronder komt uit de eigen repository, releasecards en servingdocumentatie van het project, gelezen op 2026-10-07, en waar een cijfer van het project zelf is in plaats van een externe meting, vermeldt deze pagina van wie het is.

A screenshot of the subject project's own GitHub repository page, Shanghua-Gao / RSI-Jev, showing the repository description 'Typed-decision models (noul / choice / score) trained by a self-improving loop of AI agents - checkpoints, the code that produced them, and every version that failed', the sidebar counters 73 stars, 5 forks and 1 watching, 198 commits and 8 releases, the newest release headed 'RSI-Jev v6.1-VL 4B' dated 14 minutes before the capture, an MIT license line, the topic tags ai-agents, autonomous-research, decision-model, jev, recursive-self-improvement, system-one and typed-decisions, and the merge commit 'Merge pull request #33 from Shanghua-Gao/release-v6.1-vl' at the top of the commit list.

Wat het ding eigenlijk doet

Het project beschrijft zichzelf in één regel als "een recursief zelfverbeterend onderzoekssysteem dat Jev-stijl System One-modellen bouwt," en de artefacten die het voortbrengt zijn beslissers in plaats van generatoren. Je geeft het een toestand — een document, een chattranscript, een transactie, en in de vision-releases maximaal vier afbeeldingen — en een of meer getypeerde vragen met benoemde criteria. Het retourneert, voor elke vraag, een waarschijnlijkheid voor elke optie. Drie vraagtypen bestrijken het spectrum, en het zijn de types die de API van TypeSafe definieert:

• noul — een waar/onwaar-oordeel, teruggegeven als één enkele waarschijnlijkheid, zonder verdeling en zonder betrouwbaarheidswaarde, exact overeenkomend met de antwoordvorm van de referentie.

• keuze — kies een van een reeks gelabelde opties, geretourneerd met de volledige kansverdeling en een betrouwbaarheidsstatistiek.

• score — beoordeel aan de hand van een geordende rubric, teruggegeven als een waarschijnlijkheidsgewogen, op nul gebaseerde index in de niveaus, plus de legenda en de verdeling.

Omdat er geen generatiestap is, is er geen tweede modelaanroep en geen sampling. Een beslissing over een document dat het model al heeft gelezen, is per constructie een goedkope operatie, en de eigen formulering van het project voor die kosten — "ongeveer 10 ms" — hoort bij zijn 2B-tijdperk, niet bij de huidige release; de gemeten cijfers voor v6.0-VL staan verderop.

Twee feiten over eigendom zijn belangrijker dan al het andere op deze pagina. RSI-Jev is niet het werk van TypeSafe en TypeSafe heeft het niet onderschreven. De licentieregel, volledig geciteerd: "Code: MIT. Gewichten: Apache-2.0, volgens het basismodel; sommige bronnen voor beeldtraining zijn niet-commercieel, vermeld op elke modelkaart. Niet verbonden aan TypeSafe AI." En de relatie is eenrichtingsverkeer: het project kopieert het wire-formaat van Jev bewust, en zegt dat ook, omdat een compatibele server het doel is. "Jev-style" is de eigen term van het project voor het soort model dat het bouwt. Jev van TypeSafe is een ander, gesloten, commercieel model, en de twee zijn niet hetzelfde onder een kortere naam.

Binnen het huidige model: een 4B Qwen-toren met drie uitgangen

RSI-Jev v6.0-VL is een Qwen3.5-4B-Base-toren waarbij de toren is fine-getuned en er een getraind beslissingshoofd bovenop staat. Dat is de hele architectuur — er is geen mixture of experts, geen router en geen tweede model. Het draait het volledige basismodel, en daarom is het parameteraantal 4,69 miljard en niet iets kleiners: 3,57 miljard zit in de 32 decoderlagen, 0,64 miljard in de token-embeddings, 0,33 miljard in de vision-toren, 0,05 miljard in het belangrijkste beslissingshoofd en 0,10 miljard in de twee early-exit-hoofden. De vrijgegeven checkpoint is op zichzelf staand en 9,7 GB in bf16.

Drie beslissingshoofden zijn aangehecht, op lagen 16, 20 en 32 van de base, en zij vormen het mechanisme achter alles waarvoor de huidige release bekendstaat. Een vierde exit op laag 12 werd gebouwd, gemeten en geschrapt — "De exit op laag 12 verloor in elke vergelijking van de cascade vanaf 16 en zit niet in het pakket" — dus drie worden uitgebracht en vier niet. De exits lezen een losgekoppelde kopie van hun laag, een detail dat het project op de harde manier ontdekte: het opnieuw tunen van hoofden op een trunk waarvan de exits tijdens de training waren aangehecht, had de nauwkeurigheid van de diepe lagen niet hersteld, dus het loskoppelen ervan is wat de diepte herstelde.

Eén getal hier is de gemakkelijkste manier om het project verkeerd te lezen. Alles tot en met v3.0 was een 2B-model op Qwen3.5-2B-Base, en dat is de afstammingslijn, niet het huidige model. v4.0-VL was 2B, v5.0-VL bracht een model terug tot 3B, en v6.0-VL is 4B. Een pagina die het huidige RSI-Jev-model 2B noemt, loopt drie releases achter.

De lus is het eigenlijke project

De modellen zijn de output; wat wordt gebouwd is het proces. Het project stelt dat "de loop die het onderzoek uitvoert de volgende versie van AutoScientists is", het zelforganiserende agent-teamsysteem dat is gepubliceerd door het Zitnik-lab aan Harvard, en het werkt zoals die zin impliceert. AI-agenten stellen hypotheses voor, registreren hun voorspellingen voordat ze GPU-tijd uitgeven, voeren de experimenten uit en trekken hun eigen kampioenen terug wanneer het bewijs daarop wijst. Twee aantallen maken dat concreet. Gelezen op 2026-10-07 luidt de kop van de repository: acht releases in dertien dagen, van v1.0 tot v6.1-VL; voor de eigen release van v6.0-VL op 2026-10-06 stond er zeven releases in twaalf dagen, elk getraind, geëvalueerd en gedocumenteerd door de loop. En het aantal experimenten, dat op 471 stond toen de release van deze pagina uitkwam, staat vandaag op 496 — elk ervan beschreven, inclusief mislukkingen. Beide aantallen zijn van het project zelf, en beide bewegen.

De discipline is wat die cijfers betekenis geeft, en het project vermeldt die zonder omhaal. Nulvloeren worden gemeten in plaats van aangenomen — armen die aantoonbaar identiek zijn aan de controle, geverifieerd via objectidentiteit vóór enige GPU-tijd, zodat de spreiding tussen hen gelijk is aan de ruisvloer en een verschil kleiner dan die spreiding geen resultaat is. Voorspellingen worden vóór de run geregistreerd, zodat een versie die zijn eigen lat niet haalt als een mislukking wordt uitgebracht in plaats van stilletjes opnieuw te worden bijgeschaafd. Artefacten worden geverifieerd: een checkpoint wordt opnieuw van schijf geladen en opnieuw gescoord, en alleen gepubliceerd als het de voorspellingen per vraag van de trainingsrun reproduceert, wat beide v1.0-checkpoints doen met 1,0000. Contaminatie wordt 'gecontroleerd in plaats van beweerd'. En mislukkingen worden uitgebracht, inclusief degenen die de eigen kampioen van het project hebben geveld.

Wat een bijdrage is, in de eigen woorden van het project uit zijn bijdragehandleiding: "Een bijdrage hier is meestal een meting, geen patch." Het uitgebrachte record wordt als een keten bewaard in plaats van als een momentopname — "versions/ bewaart één kaart per release, allemaal, voor altijd op main… Die keten IS het project" — daarom kunnen de cijfers van een oude release later worden gecontroleerd tegen wat het project erover zegt, en daarom is de ene correctie die hieronder wordt besproken zichtbaar in plaats van stil.

Wat v6.0-VL heeft veranderd: het verbruikt diepte in plaats van tokens

Het mechanisme van de huidige release is een instelling genaamd effort, en die bestuurt iets ongewoons: hoeveel lagen van het model een request mag gebruiken. Omdat de heads op drie dieptes zitten, kan een makkelijke vraag op laag 16 worden beantwoord en kan een moeilijke vraag alle 32 doorlopen. low stopt bij laag 16, medium bij 20, high bij 32, en auto antwoordt bij de eerste exit waarvan de gekalibreerde waarschijnlijkheid de drempel van die exit overschrijdt. Mediane latency per request op de Decision Index-steekproef, gemeten op één H200 in bf16: 23 ms bij low, 27 ms bij medium, 40 ms bij high, en 40 ms voor de niet-ingestelde standaard. Dit zijn de eigen metingen van het project op zijn eigen hardware en ze mogen niet worden vermengd met de GB10-cijfers uit de servingdocumentatie, die van een andere machine afkomstig zijn.

Het gemeten gedrag van auto is het interessante deel: in de suite met vijftien benchmarks van het project stopt 20% van de vragen bij laag 16, 46% bij laag 20 en 34% loopt door tot laag 32, wat gemiddeld neerkomt op 23,3 van de 32 lagen. Een enkele vaste drempel komt gemiddeld op 20,9 uit, en te vroeg stoppen is wat een enkele drempel je oplevert. auto is geen compromis op het gebied van kwaliteit, wat het vermelden waard is, want meestal is dat precies wat een adaptieve instelling is: het levert de beste suite-rij van alle instellingen op (0,771 tegen 0,770 voor de standaard), de beste MMLU-Pro-rij (0,444 tegen 0,440) en de beste uiteindelijke kalibratie (ECE 0,024 tegen 0,036). De enige plek waar high wint, is de held-outset, met 0,702 tegen auto. Sommige taken worden meetbaar slechter met meer diepte — BANKING77 met 0,035, het matchen van New Yorker-onderschriften met 0,060 — en daarom is het inspanningsniveau een keuze van de aanroeper en niet een regel die de server oplegt.

Het resultaat dat dit een release maakte in plaats van een experiment staat op de publieke Decision Index 0.2.1 van het project, waar de score in één release van 38,38 voor v5.0-VL naar 46,24 voor v6.0-VL ging. Op het publieke scorebord van 2026-09-28 is dat de hoogste score onder 4B-modellen en alles wat kleiner is, en de 14e van 71 in totaal; de volgende vermelding bij die grootte is JPT-4B met 43,04. De eerdere releases op deze lijn vormen de afstammingslijn en zijn niet het huidige model: v5.0-VL (2026-10-02) bracht het model terug tot de eerste 20 van 32 lagen en liet het "unknown" zeggen wanneer een vraag geen antwoord heeft; v4.0-VL (2026-10-01) was de eerste die afbeeldingen leest; en v3.0 (2026-09-28) is de release waarin reinforcement learning voor het eerst hielp, via een listwise-rankingbeloning — NDCG@5 over 16 kandidaten — die reranking R@1 verhoogde van 0,192 naar 0,308 ten opzichte van zijn gesuperviseerde ouder tegen een kostenpost van 0,0028 op de suite. Daar begint het RL-verhaal van het project, en dat is nu drie releases terug.

A generated single-column scoreboard headed 'RSI-Jev v6.0-VL - the scoreboard', with six rows reading 'Decision Index: 46.24 on its own public board', '15-benchmark suite: 0.770 without open_jev_ood', 'Held-out set: 0.698', 'MMLU-Pro: 0.440', 'Final ECE: 0.024 with effort auto' and 'Depth: layers 16 / 20 / 32 at 23 / 27 / 40 ms'; a footer reads 'All figures RSI-Jev's own release record, 2026-10-06; the Decision Index is its own public board, not a third-party result.'

De cijfers, met de kanttekeningen die daarmee gepaard gaan.

De hoofduitkomst van Decision Index 0.2.1 voor v6.0-VL is 46,24, bij een volledige run waarin alle 150.759 verzoeken van de suite werden beantwoord: kennis 28,8, taal 46,2, retrieval 55,5, tools 65,8, kunsten 37,1. De suite van vijftien benchmarks komt uit op 0,770, de hold-outset op 0,698, MMLU-Pro op 0,440, en de uiteindelijke ECE op 0,024 met auto. Twee kanttekeningen moeten in één adem met die cijfers worden genoemd, want zonder die kanttekeningen zijn de cijfers misleidend.

De eerste is een schrapping in de suite. De interne suitetaak open_jev_ood overlapte met 579 trainingsrijen, dus het cijfer werd met een onbekende hoeveelheid opgeblazen; vanaf v6.0-VL rapporteert het project de suite zonder deze, op 0,770. De 0,764 van v5.0-VL was inclusief deze, en de kaart van v6.0-VL herformuleert die release als 0,763 zonder deze. De twee cijfers zijn niet vergelijkbaar, en als je ze toch vergelijkt, moet je de herziene 0,763 gebruiken en zeggen dat je dat doet. De held-outset, MMLU-Pro en BBH hebben geen overlap en zijn niet getroffen. Een gerelateerde audit vond ongeveer 1.000 items van de testrijen van de Decision Index-kit in de trainingscorpora — ANLI 274, RouterBench-GSM8K 90, ARC 5, en BRIGHT/ToolRet-querytekst zonder labels, ongeveer 0,3% van de rijen van de kit — en het opnieuw scoren zonder deze verschuift de index met hoogstens 0,04 op de steekproef van het project. Dat is een correctie op het record van v5.0-VL, gepubliceerd in de kaart van v6.0-VL, en het is de eigen contaminatieregel van het project die het een cijfer kost.

Het tweede is van wie deze benchmark is. De Decision Index is RSI-Jevs eigen openbare scorebord, geen beoordeling door een derde partij, en 46,24 is een score op dat bord. Het is niet vergelijkbaar met wat TypeSafe ook heeft gepubliceerd, omdat de twee getallen niet uit dezelfde harness komen, en niemand heeft een onafhankelijke rechtstreekse vergelijking tussen RSI-Jev en Jev 1.13 uitgevoerd. Wat gezegd kan worden, is veeleer structureel dan numeriek: het ene is een gehost commercieel model op het endpoint van een leverancier, en het andere is een checkpoint dat je zelf downloadt en serveert.

Bij de set horen nog twee stukken context. Het project stelt expliciet dat "tien van de vijftien benchmarks in een of andere vorm trainingsdata leveren, dus geen van deze cijfers is zero-shot"; de held-outset is de vergelijking die wordt achtergehouden, en zelfs die "wordt achtergehouden voor de training, niet afgeschermd van de zoektocht." En v6.0-VL draaide 97 armen op zijn eigen lijn — 93 als de vier data-audits buiten beschouwing worden gelaten — wat de schaal van de zoektocht is die een sprong van 7,86 punt op die index opleverde.

Het spreekt Jev's wire-formaat, met vier verschillen die een aanroeper moet kennen

Het compatibiliteitsoppervlak is de reden dat dit project in deze vorm bestaat. Dezelfde requestvorm ({state, model, questions}), dezelfde drie vraagtypes met dezelfde criteriavormen, dezelfde antwoordvormen, dezelfde 1 tot 64 vragen per request, dezelfde fout-enveloppen, en dezelfde betrouwbaarheidsstatistiek — de piek, (K · p_max − 1) / (K − 1), begrensd op 0..1. De eigen bewering van het project over dat oppervlak is dat "alles wat tegen Jev is geschreven, hier zonder wijzigingen tegen werkt," en de server documenteert wat wel en wat niet wordt gekopieerd, wat nuttiger is dan de bewering.

• De prompt en de readout zijn van het model zelf. RSI-Jev is een basismodel met een getraind readout-hoofd, geserveerd met de engine waarmee het is getraind, omdat het gebruik van de prompt van de referentie "het model buiten zijn trainingsdistributie zou brengen." Het wire-contract is de compatibiliteit; de prompt niet.

• Optiesleutels zijn zichtbaar voor het model. De referentie verbergt ze, dus het hernoemen van een sleutel kan daar aantoonbaar geen antwoord veranderen. Hier kan dat wel, en de server rapporteert dit naar waarheid als option_keys_visible_to_model: true.

• Criteria moeten strings of null zijn. Een gestructureerd criterium — een object — wordt afgewezen met een 422, omdat er geen release op is getraind. Dit is de enige plek waar een verzoek dat de referentie accepteert, hier niet zal werken.

• Er wordt niets afgekapt. Bij het serveren is er ruimte voor maximaal 32.768 teksttokens plus het afbeeldingsbudget, en een langer verzoek wordt geweigerd met een 422 die dat meldt in plaats van stilzwijgend te worden afgekapt. Het getal van 2.048 tokens dat in de oudere kaarten voorkomt, is de lengte waarop de modellen werden getraind, geen serverlimiet, en het beschrijven van een stilzwijgende afkapping naar 2.048 als huidig gedrag is onjuist.

Het aantal opties verschilt enorm in het voordeel van serving: tot 5.120 opties per vraag (RSIJEV_MAX_ANSWERS), tegenover 160 in training en 64 die de referentie toestaat. Noem 160 niet als de serving-limiet. Eén ding is nieuw in de antwoorden van v6.0-VL en niet overgenomen: elk antwoord meldt welke laag heeft geantwoord, in usage.depth, naast de gekalibreerde betrouwbaarheid, zodat een adaptieve beslissing achteraf kan worden gecontroleerd. Afbeeldingen zijn een uitbreiding die de referentie niet heeft — één tot vier per verzoek, als base64-data-URL's, waarbij de state naar elk verwijst met een letterlijke marker.

Waar een lezer het daadwerkelijk kan uitvoeren, en waar niet.

RSI-Jev is een download. Het project levert zijn eigen server mee, die die Jev-compatibele API spreekt, en de gedocumenteerde route is een pip install vanuit de repository, gevolgd door het serve-commando met de checkpoint-alias en een effort-instelling. De gewichten staan op Hugging Face onder de organisatie shgao, uitgebracht onder Apache-2.0, in navolging van het basismodel, met één open vraag die het project zelf noemt: vijf van de beeldtrainingsbronnen zijn niet-commercieel of alleen voor onderzoek, en "of gewichten die op niet-commerciële data zijn getraind die voorwaarden erven, is niet beslecht." De code is MIT.

Hardware is niet de beperking. Het project ontwikkelt op een HP ZGX Nano, een NVIDIA GB10-machine waarvoor het HP en NVIDIA dankt, en de server draait op elke CUDA-GPU, op Apple Silicon of op een gewone CPU — waarvan de documentatie de laatste begroot op 733 ms voor een enkele vraag op de eigen Arm-CPU van de GB10, dus bruikbaar in plaats van snel.

Wat het niet doet, is opduiken in een algemene modelcatalogus, en hier moeten we precies zijn over onze eigen positie. RSI-Jev staat niet op OrcaRouter en er is geen modelkaart waar het naartoe kan routeren. Wat wij aanbieden is de commerciële Jev van TypeSafe, typesafe/jev-1.13, op het toegewijde systemone-endpoint, bereikt met een POST naar /v1/systemone in plaats van de OpenAI chat-completions-vorm — dezelfde request- en antwoordvormen die dit project implementeert, afkomstig van het model waarvan het het contract overneemt. Dat is de hele relatie: de twee spreken hetzelfde protocol, wij serveren er één en de andere draai je zelf. Als je al een sleutel bij ons hebt, is de aanroepvorm van Jev 1.13 een eersteklas route op één API voor 200+ modellen met 0% opslag (de lijstprijs van de provider wordt doorgegeven, dus prijsverlagingen van leveranciers zijn hier dezelfde dag live) — wat op één specifieke manier van belang is voor de vergelijking. Op een pagina als deze is het goedkoop om actie te ondernemen als je eerst het commerciële contract kunt uitproberen en pas daarna beslist of het zelf draaien van een open 4B-checkpoint het operationele werk waard is.

A screenshot of OrcaRouter's own model page for Jev 1.13 showing the breadcrumb 'Home / Models / TypeSafe', the title 'Jev 1.13', the slug typesafe/jev-1.13, 'by TypeSafe - 2026-09-24', the description that it is TypeSafe's structured decision and evaluation model taking noul / choice / score questions, the line 'POST /v1/systemone; non-streaming; up to ~64K input tokens; text in, structured JSON out.', the price $0.04, our p50 TTFT of 149 ms, and the buttons 'Get the Jev 1.13 API', 'Try in playground' and 'Use via API'.

Hoe je RSI-Jev leest op 2026-10-07

De zwakke punten die het project publiceert, zijn even specifiek als zijn resultaten, en de datums doen ertoe. Uit extern testen van v2.1 bleek dat het model bij geordende keuzes en rubricscores neigt naar de strengere of duurdere optie, zelden "unknown" kiest wanneer het document het antwoord niet kan geven, en een vraag en de ontkenning ervan inconsistent beantwoordt. Latere releases richtten de data op het "unknown"-geval — KoBBQ unknown-when-ambiguous kwam op 0,891 bij v4.0-VL, 0,932 bij v5.0-VL en 0,918 / 0,939 bij v6.0-VL — en de modelkaart van v6.0-VL is openhartig dat de winst uit data kwam en niet uit diepte, en dat de 10% van de vragen die naar laag 32 zouden gaan en bij 16 of 20 stoppen, precies is waar het dieptebeleid nog gist. Reranking heeft nog een weg te gaan: de eigen ophaalvolgorde van hippo-memory scoort 0,484 R@1 en blijft voor op de 0,308 die het model bij v3.0 bereikte, een cijfer dat het project sindsdien niet naar eigen zeggen heeft ingelopen. Het RL-bewijs is één seed, en v3.0 "heeft zelf geen gematchte SFT-controle". De trainingscorpora en de ontwikkelsets voor het beleid zijn niet openbaar, dus de fasen kunnen niet louter vanuit de repository opnieuw worden uitgevoerd, en de bouwer van het reranking-corpus — ongeveer 96 GB geheugen — is niet van begin tot eind opnieuw gedraaid.

Tractie, op dezelfde dag afgelezen: 73 sterren, 5 forks, 0 open issues, 7 GitHub-releases. Die veranderen dagelijks, en een repository van drie weken oud is geen gevestigd project, ongeacht de releasecadans. De eerlijke samenvatting is dat RSI-Jev een van de beter te volgen onderzoeksinspanningen in deze uithoek van het vakgebied is — een reeks gedateerde, gemeten, soms verliezende releases waarbij de zoektocht samen met de scores is gepubliceerd — en een van de minst onafhankelijk geverifieerde, aangezien bijna elk cijfer op deze pagina van het project zelf afkomstig is en geen enkele buitenstaander het heeft gebenchmarkt tegen het commerciële model waarmee het compatibel is.

Wat je in de gaten moet houden is niet de volgende release, want bij dit tempo komt die binnen enkele dagen; het is of iets buiten het project begint te meten. De twee dingen die het beeld zouden veranderen zijn een onafhankelijke benchmarkrun op de gepubliceerde checkpoints, en een vergelijking van beslissingsmodellen die zowel de open 4B als het gehoste model van TypeSafe door één testharnas haalt. Geen van beide bestaat vandaag. Totdat een van beide bestaat, is de bruikbare manier om een score zoals 46.24 te lezen: als een goed gedocumenteerde claim van een project dat zijn voorspellingen vooraf registreert en de armen die faalden publiceert — wat een sterker bewijsspoor is dan de meeste, en nog steeds geen resultaat van een derde partij.