Een gegenereerde titelkaart voor Decision 3.0 met als ondertitel 'zes open multimodale beslissingsmodellen, 0,6B tot 27B', met chips met de tekst 'gewichten Apache-2.0', 'afbeeldingen en video', 'nog geen lanceringsbericht', en een voettekst met de tekst 'Alle cijfers in dit artikel zijn van vLLM-SR zelf; niets hier is onafhankelijk gereproduceerd.' Het OrcaRouter-logo is in de rechteronderhoek verwerkt.
Engineering & Research

Decision 3.0 staat op Hugging Face: zes open multimodale beslissingsmodellen, alleen op X aangekondigd

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Decision 3.0 bestaat in een vorm die je nu kunt downloaden, en bijna niemand heeft het opgeschreven. Zes checkpoints — d3, d3-flash, d3-mini, d3-nano, d3-lite en d3-edge — zijn op 10 oktober 2026 verschenen in de vllm-sr-organisatie op Hugging Face, nieuwste eerst, beginnend om 09:38 UTC en eindigend met d3-edge om 23:49 UTC. Ze zijn Apache-2.0, ze zijn gebouwd op Qwen3.5- en Qwen3.8-backbones, ze beantwoorden keuze-, ja/nee- en scorevragen met een waarschijnlijkheid per optie in plaats van een token te genereren, en vijf van de zes lezen nu afbeeldingen en video. Elke modelkaart beschrijft zichzelf als "het 27B multimodale fundament-beslissingsmodel van Decision 3.0, de beslissingsmodellen van vLLM Semantic Router," dat de open beslissingslaag van het vLLM-project is.

Wat ontbreekt, is de aankondiging. Het X-account van het vLLM-project feliciteerde het vLLM-SR-team met de release op 11 oktober, met een citaat uit de eigen introductiethread van de maintainer — dat is het volledige publieke verslag. De blogindex van het project eindigt nog steeds op 10 oktober met een bericht over modellen voor routeringsbeslissingen, niet over deze. De GitHub-releasespagina voor vllm-project/semantic-router eindigt nog steeds bij v0.4.0 van 27 september. De gewichten zijn uitgeleverd; de lanceringsnotitie nog niet.

Dat onderscheid is van belang voor hoe je alles hieronder leest. Elk prestatiecijfer in dit artikel komt uit de eigen modelkaarten van vLLM-SR, gemeten met hun eigen meetopstelling op hun eigen hardware. Niets hiervan is door een externe partij gereproduceerd, en het leaderboard waarop ze publiceren, beheren ze zelf. Dit is een vroege, eerlijke lezing van een artefact dat echt is en een claim die nog niet is geauditeerd.

Wat staat er eigenlijk op Hugging Face?

De zes repositories zijn eenvoudig, compleet en consistent met elkaar. Elk bevat safetensors-gewichten, een chatsjabloon, een decision_config.json die de revisie van het basismodel vastlegt, aangepaste modelleercode (modeling_d3.py, d3_engine.py, d3_server.py), een readout-head in zijn eigen readout.safetensors, en een MODEL_MANIFEST.json met een SHA-256 per bestand. Een zevende repository, de verzamelpagina, vermeldt alle zes.

De familie, in de volgorde waarin de maten vallen:

• d3 — 26,09 miljard parameters, waaronder een vision-encoder van 0,46 miljard, gebouwd op Qwen/Qwen3.8-27B. Geüpload op 10 oktober, 09:38 UTC.

• d3-flash — 8,39B, inclusief een vision-encoder van 0,46B, gebouwd op Qwen/Qwen3.5-9B.

• d3-mini — 4,54B inclusief een 0,33B vision-encoder, gebouwd op Qwen/Qwen3.5-4B.

• d3-nano — 2,21 miljard, inclusief een vision-encoder van 0,33 miljard, gebouwd op Qwen/Qwen3.5-2B.

• d3-lite — 0,85B, inclusief een 0,10B vision-encoder, gebouwd op Qwen/Qwen3.5-0.8B.

• d3-edge — 0,59B inclusief een 0,10B vision-encoder, ook gebouwd op Qwen/Qwen3.5-0.8B. Als laatste geüpload, 23:49 UTC.

Alle zes hebben hetzelfde aanvraagcontract: een state (tekst of JSON, optioneel met afbeeldingen en video's) plus een woordenboek met benoemde vragen, en een respons van getypeerde kansverdelingen. Er bestaan drie soorten vragen — Choice, Noul (ja/nee), Score — en het model beantwoordt ze allemaal in één aanroep door één forward pass per vraag over dezelfde input uit te voeren, zonder ergens een decoderingslus.

A screenshot of the vLLM-SR collection page on Hugging Face, headed Decision 3.0 with the subtitle 'Towards Open Multimodal Foundation Decision Models' and marked as updated about 15 hours ago with 25 upvotes. It lists six repositories, each tagged Zero-Shot Classification: vllm-sr/d3 at 26B with 130 downloads and 18 likes, vllm-sr/d3-flash at 8B with 69 downloads, vllm-sr/d3-mini at 5B with 62, vllm-sr/d3-nano at 2B with 82, vllm-sr/d3-lite at 0.9B with 83, and vllm-sr/d3-edge at 0.6B with 33. The left sidebar lists the organisation's other collections: Vela 2.0, Decision 2.0, Decision 1.0, Vela 1.0, MoM 1.0 and MoM Nano.

De nummers, en van wie ze zijn

vLLM-SR publiceert een ranglijst die het de Jev Decision Index 0.3.1 noemt en zet d3 bovenaan. De kopregels, allemaal door leveranciers gerapporteerd:

• d3 — Index 64,7, openbare suite 65,5, tests voor dezelfde vaardigheid 62,8, taken in nieuwe domeinen 56,6.

• Perplexity Decider v1.1 (27B) — 62.8, 62.3, 61.1, 55.6.

• Fastino GLiDE no-thinking (28B) — 60,2, 59,1, 59,5, 52,9.

• Jev — 60.1, 58.0, 58.0, 55.0.

• Torchcast Decision 27B — 59.9, 65.1, 58.1, 50.8.

• Decision 2.0 (27B), de vorige generatie — 55,9, 57,0, 55,7, 47,9.

Een voetnoot op de kaart van d3 zegt ronduit dat de eigen rij van d3 een interne evaluatie is, terwijl de vergelijkingsrijen live boardgegevens zijn die op 10 oktober zijn uitgelezen. Dat is een terechte bekendmaking, en het is de moeite waard die twee keer te lezen: de cijfers van de concurrenten zijn van een board gehaald, en het cijfer voor de onderzochte partij is geproduceerd door het team dat het model heeft gebouwd. De kaart beweert ook dat alle 140.178 openbare verzoeken zijn beantwoord, zonder dat er één onondersteund was — een dekkingsclaim, geen nauwkeurigheidsclaim, en een ongebruikelijke claim om te publiceren.

A screenshot of the vllm-sr/d3 model card on Hugging Face. The header shows 18 likes, the vLLM Semantic Router organisation, and tags for Transformers, Safetensors, qwen3_5, feature-extraction, decision-model, classification, system-one, multimodal, vision, video, custom_code and an Apache-2.0 licence, with the model size listed as 26B parameters in BF16. The card graphic reads 'Decision 3.0 / d3 27B'. A specification panel gives Parameters as 26.09B including the 0.46B vision encoder, Inputs as 'Text or JSON, plus images and videos (several per request)', Decision types as 'Choice - Yes / No - Score' and License as Apache-2.0. The Highlights section states a Jev Decision Index 0.3 public suite score of 65.45 measured with the official 0.3 kit on the released weights, all 140,178 public requests answered and none unsupported, and +8.5 on the public suite over Decision 2.0. The sidebar shows 130 downloads last month, a model tree pinned to Qwen/Qwen3.8-27B, and two Spaces using the model.

De kleinere checkpoints rapporteren dat ze in de pas lopen. Elke kaart geeft een public-suite-score en een delta ten opzichte van de equivalente grootte in Decision 2.0: d3-flash 57,79, een stijging van 11,0 ten opzichte van de vorige 9B; d3-mini 54,90, een stijging van 10,7; d3-nano 42,22, een stijging van 12,2; d3-lite 36,93, een stijging van 16,4; d3-edge 28,82, een stijging van 12,1. De relatieve winsten zijn het grootst aan de onderkant van het bereik, wat je zou verwachten als het multimodale pretrainingsrecept meer werk doet voor kleine modellen dan voor grote — en ook wat je zou krijgen door de kleine modellen het hardst te finetunen. Van buitenaf is niet te zeggen welke van de twee.

Het multimodale deel is de echte verandering

De modellen van Decision 2.0 lezen tekst. Die van Decision 3.0 lezen tekst, afbeeldingen en video, en dat is het wezenlijke verschil tussen de generaties — niet de indexverschuiving. Elke kaart vermeldt beeldinvoer als PNG, JPEG of WebP, aangeleverd als paden, URL's, PIL-afbeeldingen of base64-data-URL's, met meerdere per verzoek van elk maximaal 1,6 megapixel; en video als MP4, WebM, MOV of MKV, of als arrays van frames, gelezen met 2 frames per seconde, met hoogstens 32 frames verdeeld over de hele clip en elk frame van maximaal 0,2 megapixel. Elke vraag in een verzoek ziet elke afbeelding en elke video die eraan zijn gekoppeld.

Het ondersteunende bewijs voor video is een Perception Test-resultaat op alle 19.140 validatievragen: d3 op 77,4, d3-flash 73,3, d3-mini 70,3, d3-nano 63,5, d3-lite 59,3, d3-edge 46,6, tegen een gedocumenteerde ondergrens van 33,3 bij vragen met drie opties. vLLM-SR bestempelt dit als een interne evaluatie. d3 heeft ook een vision board waarop het op 71,6 overall staat, vóór Perplexity Decider v1.1 op 70,6 en JEV-27B-VL op 69,6, waarbij de vergelijkingsrijen opnieuw uit boardgegevens zijn gehaald in plaats van door de auteurs te zijn gedraaid.

De doorvoercijfers zijn voor één aanvraag, één GPU, en dat is ook zo vermeld: d3 beantwoordt een tekstverzoek in een mediane 55 ms, een verzoek met een afbeelding in 273 ms, en een verzoek met een video van tien seconden in 553 ms, op één AMD Instinct MI325X. d3-edge doet hetzelfde in 6,7 ms, 41,9 ms en 308,3 ms. Dat zijn medianen per vraag bij een model dat is ontworpen om vele keren binnen één workflow te worden aangeroepen, en dat is het getal dat ertoe doet voor de architectuur waarvoor deze modellen zijn gebouwd — twintig opeenvolgende beslissingen met elk 100 ms extra kosten twee seconden, zoals Microsoft deze maand hetzelfde punt maakte over zijn eigen beslissingsmodel.

Wat de repositories niet zeggen

Drie hiaten verdienen het om benoemd te worden voordat iemand hieromheen plannen maakt.

Het eerste is het invoerbudget. decision_config.json voor de grootste modelsets max_length op null, en geen enkele kaart vermeldt een tokenplafond voor status plus vragen plus optiebeschrijvingen. De kaarten van Decision 1.0 publiceerden expliciete budgetten — 1.024 tokens voor de encoder-tak, 16.384 voor de decoder-tak — en die getallen zijn een echte planningsbeperking. Hun afwezigheid hier is opvallend, en het is het meest nuttige ding dat een vervolgcommit zou kunnen toevoegen.

Het tweede is kalibratie. Het belangrijkste getal van een beslissingsmodel is niet de nauwkeurigheid, maar of een geretourneerde 0,9 betekent dat het in negen van de tien gevallen klopt. De beeld- en tekstindexen zeggen daar niets over. Er staat geen Brier-score, geen waarde voor de verwachte kalibratiefout en geen temperatuur in geen van de zes kaarten. InternLM publiceerde beide in september voor zijn eigen beslissingsmodel; vLLM-SR heeft dat voor geen enkel lid van deze familie gedaan.

Het derde is onafhankelijkheid. De modellen van Decision 2.0 worden al twee weken extern gebruikt; die van Decision 3.0 pas een paar uur. De downloadaantallen op 11 oktober — 130 voor d3, 83 voor d3-lite, 82 voor d3-nano — zijn de voetafdruk van een upload, niet van adoptie. Beschouw elk indexcijfer hierboven als een hypothese met een repository eraan vast.

Waar dit zich bevindt in een stack die je vandaag kunt aanroepen

De praktische vraag bij een beslissingsmodel is of het in een al bestaande pipeline kan worden ingepast, en hier is het ecosysteem verder gevorderd dan de modellen. Het System One-aanvraagformaat dat deze modellen gebruiken is niet exclusief voor vLLM-SR: het is hetzelfde contract met state en benoemde vragen waarmee de gehoste Jev-modellen worden aangeroepen, en daarom komt "Jev" voor als de naam van de index in de modelkaart van d3 én als een rij op zijn leaderboard.

OrcaRouter neemt die kant van de familie voor zijn rekening. typesafe/jev-1.13 staat in onze catalogus en wordt aangeboden via POST /v1/systemone — hetzelfde contract, tegen $0.042 per miljoen invoertokens, zonder kosten voor completion omdat er geen completion is, tot ongeveer 64K invoertokens, tekst erin en gestructureerde JSON eruit, niet-streaming. Het is het soort model dat een beslissingslaag vandaag aanroept. Twee dingen beweren we niet: d3 en de rest van Decision 3.0 staan niet in onze catalogus, en het lokale inferentiepad van Decision 3.0 is een Python-klasse in een Hugging Face-repository, geen endpoint dat we zouden kunnen routeren, zelfs als we dat wilden. Wat een router je hier wél oplevert, zit aan de andere kant van de lus — het generatieve model dat op basis van een beslissing handelt, via één sleutel gerouteerd over meer dan 200 modellen, met automatische failover wanneer een provider hapert, zodat het toevoegen van een scoringsstap vóór een workflow niet ook betekent dat er een tweede leveranciersrelatie bij komt.

Wat zou deze afbeelding veranderen?

Vier dingen, in grofweg de volgorde van hoeveel ze je zouden vertellen. Een blogpost van het project waarin het inputbudget en de beoogde deploymentvorm worden gegeven, wat zou bevestigen dat dit een release is in plaats van een push. Een Brier-score of een ECE-waarde op één enkel checkpoint. Een derde partij die de openbare suite op de vrijgegeven gewichten draait in plaats van de index te lezen. En een runtime — in de semantic-router-repository zijn op 11 oktober twee commits geland die d3 en d3-edge in de modelruntime ervan integreren, inclusief video-invoer, wat erop wijst dat het servingverhaal nu wordt gebouwd en het ding zal zijn dat deze modellen goedkoop maakt om te proberen.

Tot ten minste de eerste daarvan arriveert, is de eerlijke samenvatting deze: er staat een complete, Apache-2.0, echt multimodale beslissingsmodel-familie op Hugging Face, van 0,6B tot 27B, gepubliceerd met een ongewoon goede herkomst — bestandshashes, vastgezette basisrevisies, een vermeld hardware-doel — en met ongewoon weinig van de omliggende documentatie waarmee je zou kunnen beslissen of je het moet gebruiken. Het downloaden kost niets. Het vertrouwen op de index moet wachten.

A generated six-row scoreboard titled 'Decision 3.0 - the scoreboard', listing the family from largest to smallest with each checkpoint's parameter count and its vLLM-SR-reported Jev Decision Index 0.3 public-suite figure: d3 26.09B and 65.5, d3-flash 8.39B and 57.79, d3-mini 4.54B and 54.90, d3-nano 2.21B and 42.22, d3-lite 0.85B and 36.93, d3-edge 0.59B and 28.82, with a footer reading 'All figures are vLLM-SR's own; nothing here is independently reproduced.'