Ett genererat titelkort för Decision 3.0 med undertexten ’sex öppna multimodala beslutsmodeller, 0,6B till 27B’, med chips som det står ’vikter Apache-2.0’, ’bilder och video’, ’inget lanseringsinlägg ännu’ på, och en sidfot där det står ’Alla siffror i den här artikeln är vLLM-SR:s egna; inget här är oberoende reproducerat.’ OrcaRouter-logotypen är komponerad i det nedre högra hörnet.
Engineering & Research

Decision 3.0 finns på Hugging Face: Sex öppna multimodala beslutsmodeller, tillkännagavs endast på X

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Decision 3.0 finns i en form du kan ladda ner just nu, och nästan ingen har skrivit ner det. Sex checkpoints — d3, d3-flash, d3-mini, d3-nano, d3-lite och d3-edge — landade i vllm-sr organisationen på Hugging Face den 10 oktober 2026, med de nyaste först med start kl. 09:38 UTC och avslutades med d3-edge kl. 23:49 UTC. De är Apache-2.0, de är byggda på Qwen3.5- och Qwen3.8-backbones, de svarar på val-, ja/nej- och poängfrågor med en sannolikhet per alternativ istället för att generera en token, och fem av sex läser nu bilder och video. Varje modellkort beskriver sig självt som "den 27B multimodala grundbeslutsmodellen för Decision 3.0, beslutsmodellerna för vLLM Semantic Router," vilket är vLLM-projektets öppna besluts lager.

Det som saknas är tillkännagivandet. vLLM-projektets X-konto gratulerade vLLM-SR-teamet för släppet den 11 oktober och citerade maintainerns egen introduktionstråd – det är hela det offentliga underlaget. Projektets bloggindex slutar fortfarande den 10 oktober med ett inlägg om modeller för routingbeslut, inte om dessa. GitHubs releases-sida för vllm-project/semantic-router går fortfarande inte längre än till v0.4.0 från den 27 september. Vikterna har släppts; lanseringsmeddelandet har inte.

Den distinktionen spelar roll för hur du läser allt nedan. Varje prestandasiffra i den här artikeln kommer från vLLM-SR:s egna modellkort, mätta med deras eget testramverk på deras egen hårdvara. Inget här har reproducerats av en utomstående part, och resultattavlan de publicerar på är en de själva underhåller. Detta är en tidig, ärlig läsning av en artefakt som är verklig och ett påstående som ännu inte har granskats.

Vad finns det egentligen på Hugging Face?

De sex repositorierna är enkla, kompletta och konsekventa med varandra. Vart och ett innehåller safetensors-vikter, en chattmall, en decision_config.json som låser basmodellens revision, anpassad modelleringskod (modeling_d3.py, d3_engine.py, d3_server.py), ett readout-huvud i sitt eget readout.safetensors, och en MODEL_MANIFEST.json med en SHA-256 per fil. Ett sjunde repositorium, samlingssidan, listar alla sex.

Familjen, i den ordning storlekarna faller:

• d3 — 26,09B parametrar inklusive en 0,46B visionskodare, byggd på Qwen/Qwen3.8-27B. Uppladdad 10 oktober, 09:38 UTC.

• d3-flash — 8,39B inklusive en visionsencoder på 0,46B, byggd på Qwen/Qwen3.5-9B.

• d3-mini — 4,54B inklusive en 0,33B visionskodare, byggd på Qwen/Qwen3.5-4B.

• d3-nano — 2,21B inklusive en 0,33B visionskodare, byggd på Qwen/Qwen3.5-2B.

• d3-lite — 0,85B inklusive en visionskodare på 0,10B, byggd på Qwen/Qwen3.5-0.8B.

• d3-edge — 0,59B inklusive en 0,10B visionskodare, även byggd på Qwen/Qwen3.5-0.8B. Laddades upp sist, 23:49 UTC.

Alla sex har samma förfrågningskontrakt: ett tillstånd (text eller JSON, eventuellt med bilder och videor) plus en ordbok med namngivna frågor, och ett svar av typade sannolikhetsfördelningar. Tre frågetyper finns – Choice, Noul (ja/nej), Score – och modellen besvarar alla i ett enda anrop genom att köra en framåtpassning per fråga över samma indata, utan någon avkodningsloop någonstans.

A screenshot of the vLLM-SR collection page on Hugging Face, headed Decision 3.0 with the subtitle 'Towards Open Multimodal Foundation Decision Models' and marked as updated about 15 hours ago with 25 upvotes. It lists six repositories, each tagged Zero-Shot Classification: vllm-sr/d3 at 26B with 130 downloads and 18 likes, vllm-sr/d3-flash at 8B with 69 downloads, vllm-sr/d3-mini at 5B with 62, vllm-sr/d3-nano at 2B with 82, vllm-sr/d3-lite at 0.9B with 83, and vllm-sr/d3-edge at 0.6B with 33. The left sidebar lists the organisation's other collections: Vela 2.0, Decision 2.0, Decision 1.0, Vela 1.0, MoM 1.0 and MoM Nano.

Siffrorna, och vems de är

vLLM-SR publicerar en resultattavla som den kallar Jev Decision Index 0.3.1 och placerar d3 högst upp på den. Huvudraderna, alla leverantörsrapporterade:

• d3 — Index 64,7, offentlig svit 65,5, tester inom samma färdighet 62,8, uppgifter inom nya domäner 56,6.

• Perplexity Decider v1.1 (27B) — 62,8, 62,3, 61,1, 55,6.

• Fastino GLiDE no-thinking (28B) – 60,2, 59,1, 59,5, 52,9.

• Jev — 60,1, 58,0, 58,0, 55,0.

• Torchcast Decision 27B — 59,9, 65,1, 58,1, 50,8.

• Decision 2.0 (27B), den tidigare generationen — 55,9, 57,0, 55,7, 47,9.

En fotnot på d3:s kort säger klart och tydligt att d3:s egen rad är en intern utvärdering medan jämförelseraderna är livedata från tavlan lästa den 10 oktober. Det är rätt upplysning att göra och den är värd att läsa två gånger: konkurrenternas siffror hämtades från en tavla, och subjektets siffra producerades av teamet som byggde modellen. Kortet hävdar också att alla 140 178 offentliga förfrågningar besvarades utan att någon saknade stöd — ett täckningsanspråk, inte ett riktighetsanspråk, och ett ovanligt sådant att publicera.

A screenshot of the vllm-sr/d3 model card on Hugging Face. The header shows 18 likes, the vLLM Semantic Router organisation, and tags for Transformers, Safetensors, qwen3_5, feature-extraction, decision-model, classification, system-one, multimodal, vision, video, custom_code and an Apache-2.0 licence, with the model size listed as 26B parameters in BF16. The card graphic reads 'Decision 3.0 / d3 27B'. A specification panel gives Parameters as 26.09B including the 0.46B vision encoder, Inputs as 'Text or JSON, plus images and videos (several per request)', Decision types as 'Choice - Yes / No - Score' and License as Apache-2.0. The Highlights section states a Jev Decision Index 0.3 public suite score of 65.45 measured with the official 0.3 kit on the released weights, all 140,178 public requests answered and none unsupported, and +8.5 on the public suite over Decision 2.0. The sidebar shows 130 downloads last month, a model tree pinned to Qwen/Qwen3.8-27B, and two Spaces using the model.

De mindre checkpoints rapporterar att de marscherar i takt. Varje kort ger en siffra för den offentliga testsviten och en delta mot motsvarande storlek i Decision 2.0: d3-flash 57,79, upp 11,0 jämfört med den tidigare 9B; d3-mini 54,90, upp 10,7; d3-nano 42,22, upp 12,2; d3-lite 36,93, upp 16,4; d3-edge 28,82, upp 12,1. De relativa vinsterna är störst i den nedre delen av intervallet, vilket är vad man skulle förvänta sig om det multimodala förträningsreceptet gör mer arbete för små modeller än för stora – och också vad man skulle få genom att finjustera de små modellerna hårdast. Det går inte att avgöra vilket utifrån.

Den multimodala delen är den verkliga förändringen

Decision 2.0:s modeller läser text. Decision 3.0:s läser text, bilder och video, och det är den väsentliga skillnaden mellan generationerna – inte indexförflyttningen. Varje kort listar bildinmatning som PNG, JPEG eller WebP, angiven som sökvägar, URL:er, PIL-bilder eller base64-data-URL:er, med flera per begäran på upp till 1,6 megapixlar vardera; och video som MP4, WebM, MOV eller MKV, eller som arrayer av bildrutor, som läses med 2 bildrutor per sekund, med högst 32 bildrutor fördelade över hela klippet, och där varje bildruta är på upp till 0,2 megapixlar. Varje fråga i en begäran ser varje bild och varje video som är bifogad till den.

Det stödjande underlaget för video är ett Perception Test-resultat på alla 19 140 valideringsfrågor: d3 på 77,4, d3-flash 73,3, d3-mini 70,3, d3-nano 63,5, d3-lite 59,3, d3-edge 46,6, mot ett dokumenterat slumpgolv på 33,3 för frågor med tre svarsalternativ. vLLM-SR betecknar detta som en intern utvärdering. d3 har också en vision board som placerar den på 71,6 totalt, före Perplexity Decider v1.1 på 70,6 och JEV-27B-VL på 69,6, med jämförelseraderna återigen hämtade från board-data snarare än körda av författarna.

Genomströmningssiffrorna avser en enskild begäran och en enskild GPU och anges som sådana: d3 besvarar en textbegäran på 55 ms i median, en begäran med en bild på 273 ms och en begäran med en tio sekunder lång video på 553 ms, på en AMD Instinct MI325X. d3-edge gör samma sak på 6,7 ms, 41,9 ms och 308,3 ms. Detta är medianer per fråga för en modell som är utformad för att anropas många gånger i ett och samma arbetsflöde, vilket är siffran som spelar roll för den arkitektur som dessa modeller är byggda för – tjugo sekventiella beslut med ytterligare 100 ms vardera kostar två sekunder, vilket Microsoft också framhöll om sin egen beslutsmodell den här månaden.

Vad repositorierna inte säger

Tre luckor är värda att namnge innan någon planerar utifrån detta.

Det första är indatabudgeten. decision_config.json för de största modelluppsättningarna sätter max_length till null, och inget kort anger ett tak för antal tokens för tillstånd plus frågor plus alternativbeskrivningar. Decision 1.0:s kort publicerade explicita budgetar – 1 024 tokens för encodergrenen, 16 384 för decodergrenen – och dessa siffror är en verklig planeringsbegränsning. Deras frånvaro här är anmärkningsvärd, och det är det enskilt mest användbara som en uppföljande commit skulle kunna lägga till.

Det andra är kalibrering. Det viktigaste talet för en beslutsmodell är inte träffsäkerhet, utan huruvida ett returnerat 0,9 betyder nio gånger av tio. Indexen för vision och text säger ingenting om det. Det finns ingen Brier-poäng, ingen siffra för förväntat kalibreringsfel och ingen temperatur i något av de sex korten. InternLM publicerade båda för sin egen beslutsmodell i september; vLLM-SR har inte gjort det, för någon medlem i den här familjen.

Den tredje är oberoende. Decision 2.0:s modeller har varit i extern användning i två veckor; Decision 3.0:s har funnits i timmar. Nedladdningssiffrorna den 11 oktober – 130 för d3, 83 för d3-lite, 82 för d3-nano – är avtrycket av en uppladdning, inte av ett anammande. Betrakta varje indexsiffra ovan som en hypotes med ett repositorium kopplat till sig.

Var detta passar in i en stack du kan anropa idag

Den praktiska frågan om en beslutsmodell är huruvida den passar in i en pipeline som redan finns, och här har ekosystemet kommit längre än modellerna. Det System One-begäranformat som dessa modeller använder är inte proprietärt för vLLM-SR: det är samma kontrakt för tillstånd och namngivna frågor som de hostade Jev-modellerna anropas med, vilket är anledningen till att "Jev" förekommer både som namnet på indexet i d3:s modellkort och som en rad på dess resultattavla.

OrcaRouter står för den sidan av familjen. typesafe/jev-1.13 finns i vår katalog och tillhandahålls via POST /v1/systemone — samma kontrakt, till $0.042 per miljon indatatokens utan avgift för completion eftersom det inte finns någon completion, upp till ungefär 64K indatatokens, text in och strukturerad JSON ut, icke-strömmande. Det är den typ av modell som ett beslutsfattande lager anropar idag. Två saker gör vi inte anspråk på: d3 och resten av Decision 3.0 finns inte i vår katalog, och Decision 3.0:s lokala inferensväg är en Python-klass i ett Hugging Face-repositorium, inte en endpoint som vi skulle kunna routa ens om vi ville. Vad en router faktiskt ger dig här finns på andra sidan av loopen — den generativa modellen som agerar på ett beslut, routad genom en nyckel över 200+ modeller med automatisk failover när en leverantör vacklar, så att ett poängsättningssteg framför ett arbetsflöde inte också innebär att man lägger till en andra leverantörsrelation.

Vad skulle förändra den här bilden?

Fyra saker, i grov ordning efter hur mycket de skulle säga dig. Ett blogginlägg från projektet som anger indatabudgeten och den avsedda driftsättningsformen, vilket skulle bekräfta att detta är en release snarare än en push. En Brier-poäng eller ett ECE-värde på vilken enskild checkpoint som helst. En tredje part som kör den offentliga sviten på de släppta vikterna i stället för att läsa indexet. Och en runtime — semantic-router-förvaret landade två commits den 11 oktober som kopplar in d3 och d3-edge i dess modellruntime, inklusive videoindata, vilket tyder på att serving-historien byggs nu och kommer att vara det som gör dessa modeller billiga att prova.

Tills åtminstone den första av dem har landat är den ärliga sammanfattningen denna: det finns en komplett, Apache-2.0-licensierad, genuin beslutsmodell som ligger på Hugging Face från 0.6B till 27B, publicerad med ovanligt god proveniens – filhashvärden, pinnade basrevisioner, ett angivet hårdvarumål – och med ovanligt lite av den omkringliggande dokumentationen som skulle låta dig avgöra om du ska använda den. Att ladda ner den kostar ingenting. Att tro på indexet bör vänta.

A generated six-row scoreboard titled 'Decision 3.0 - the scoreboard', listing the family from largest to smallest with each checkpoint's parameter count and its vLLM-SR-reported Jev Decision Index 0.3 public-suite figure: d3 26.09B and 65.5, d3-flash 8.39B and 57.79, d3-mini 4.54B and 54.90, d3-nano 2.21B and 42.22, d3-lite 0.85B and 36.93, d3-edge 0.59B and 28.82, with a footer reading 'All figures are vLLM-SR's own; nothing here is independently reproduced.'