
Decision 3.0 finns på Hugging Face: Sex öppna multimodala beslutsmodeller, tillkännagavs endast på X
- OrcaNYOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1M tokens · 71 tok/s
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
Decision 3.0 finns i en form du kan ladda ner just nu, och nästan ingen har skrivit ner det. Sex checkpoints — d3, d3-flash, d3-mini, d3-nano, d3-lite och d3-edge — landade i vllm-sr organisationen på Hugging Face den 10 oktober 2026, med de nyaste först med start kl. 09:38 UTC och avslutades med d3-edge kl. 23:49 UTC. De är Apache-2.0, de är byggda på Qwen3.5- och Qwen3.8-backbones, de svarar på val-, ja/nej- och poängfrågor med en sannolikhet per alternativ istället för att generera en token, och fem av sex läser nu bilder och video. Varje modellkort beskriver sig självt som "den 27B multimodala grundbeslutsmodellen för Decision 3.0, beslutsmodellerna för vLLM Semantic Router," vilket är vLLM-projektets öppna besluts lager.
Det som saknas är tillkännagivandet. vLLM-projektets X-konto gratulerade vLLM-SR-teamet för släppet den 11 oktober och citerade maintainerns egen introduktionstråd – det är hela det offentliga underlaget. Projektets bloggindex slutar fortfarande den 10 oktober med ett inlägg om modeller för routingbeslut, inte om dessa. GitHubs releases-sida för vllm-project/semantic-router går fortfarande inte längre än till v0.4.0 från den 27 september. Vikterna har släppts; lanseringsmeddelandet har inte.
Den distinktionen spelar roll för hur du läser allt nedan. Varje prestandasiffra i den här artikeln kommer från vLLM-SR:s egna modellkort, mätta med deras eget testramverk på deras egen hårdvara. Inget här har reproducerats av en utomstående part, och resultattavlan de publicerar på är en de själva underhåller. Detta är en tidig, ärlig läsning av en artefakt som är verklig och ett påstående som ännu inte har granskats.
Vad finns det egentligen på Hugging Face?
De sex repositorierna är enkla, kompletta och konsekventa med varandra. Vart och ett innehåller safetensors-vikter, en chattmall, en decision_config.json som låser basmodellens revision, anpassad modelleringskod (modeling_d3.py, d3_engine.py, d3_server.py), ett readout-huvud i sitt eget readout.safetensors, och en MODEL_MANIFEST.json med en SHA-256 per fil. Ett sjunde repositorium, samlingssidan, listar alla sex.
Familjen, i den ordning storlekarna faller:
• d3 — 26,09B parametrar inklusive en 0,46B visionskodare, byggd på Qwen/Qwen3.8-27B. Uppladdad 10 oktober, 09:38 UTC.
• d3-flash — 8,39B inklusive en visionsencoder på 0,46B, byggd på Qwen/Qwen3.5-9B.
• d3-mini — 4,54B inklusive en 0,33B visionskodare, byggd på Qwen/Qwen3.5-4B.
• d3-nano — 2,21B inklusive en 0,33B visionskodare, byggd på Qwen/Qwen3.5-2B.
• d3-lite — 0,85B inklusive en visionskodare på 0,10B, byggd på Qwen/Qwen3.5-0.8B.
• d3-edge — 0,59B inklusive en 0,10B visionskodare, även byggd på Qwen/Qwen3.5-0.8B. Laddades upp sist, 23:49 UTC.
Alla sex har samma förfrågningskontrakt: ett tillstånd (text eller JSON, eventuellt med bilder och videor) plus en ordbok med namngivna frågor, och ett svar av typade sannolikhetsfördelningar. Tre frågetyper finns – Choice, Noul (ja/nej), Score – och modellen besvarar alla i ett enda anrop genom att köra en framåtpassning per fråga över samma indata, utan någon avkodningsloop någonstans.

Siffrorna, och vems de är
vLLM-SR publicerar en resultattavla som den kallar Jev Decision Index 0.3.1 och placerar d3 högst upp på den. Huvudraderna, alla leverantörsrapporterade:
• d3 — Index 64,7, offentlig svit 65,5, tester inom samma färdighet 62,8, uppgifter inom nya domäner 56,6.
• Perplexity Decider v1.1 (27B) — 62,8, 62,3, 61,1, 55,6.
• Fastino GLiDE no-thinking (28B) – 60,2, 59,1, 59,5, 52,9.
• Jev — 60,1, 58,0, 58,0, 55,0.
• Torchcast Decision 27B — 59,9, 65,1, 58,1, 50,8.
• Decision 2.0 (27B), den tidigare generationen — 55,9, 57,0, 55,7, 47,9.
En fotnot på d3:s kort säger klart och tydligt att d3:s egen rad är en intern utvärdering medan jämförelseraderna är livedata från tavlan lästa den 10 oktober. Det är rätt upplysning att göra och den är värd att läsa två gånger: konkurrenternas siffror hämtades från en tavla, och subjektets siffra producerades av teamet som byggde modellen. Kortet hävdar också att alla 140 178 offentliga förfrågningar besvarades utan att någon saknade stöd — ett täckningsanspråk, inte ett riktighetsanspråk, och ett ovanligt sådant att publicera.

De mindre checkpoints rapporterar att de marscherar i takt. Varje kort ger en siffra för den offentliga testsviten och en delta mot motsvarande storlek i Decision 2.0: d3-flash 57,79, upp 11,0 jämfört med den tidigare 9B; d3-mini 54,90, upp 10,7; d3-nano 42,22, upp 12,2; d3-lite 36,93, upp 16,4; d3-edge 28,82, upp 12,1. De relativa vinsterna är störst i den nedre delen av intervallet, vilket är vad man skulle förvänta sig om det multimodala förträningsreceptet gör mer arbete för små modeller än för stora – och också vad man skulle få genom att finjustera de små modellerna hårdast. Det går inte att avgöra vilket utifrån.
Den multimodala delen är den verkliga förändringen
Decision 2.0:s modeller läser text. Decision 3.0:s läser text, bilder och video, och det är den väsentliga skillnaden mellan generationerna – inte indexförflyttningen. Varje kort listar bildinmatning som PNG, JPEG eller WebP, angiven som sökvägar, URL:er, PIL-bilder eller base64-data-URL:er, med flera per begäran på upp till 1,6 megapixlar vardera; och video som MP4, WebM, MOV eller MKV, eller som arrayer av bildrutor, som läses med 2 bildrutor per sekund, med högst 32 bildrutor fördelade över hela klippet, och där varje bildruta är på upp till 0,2 megapixlar. Varje fråga i en begäran ser varje bild och varje video som är bifogad till den.
Det stödjande underlaget för video är ett Perception Test-resultat på alla 19 140 valideringsfrågor: d3 på 77,4, d3-flash 73,3, d3-mini 70,3, d3-nano 63,5, d3-lite 59,3, d3-edge 46,6, mot ett dokumenterat slumpgolv på 33,3 för frågor med tre svarsalternativ. vLLM-SR betecknar detta som en intern utvärdering. d3 har också en vision board som placerar den på 71,6 totalt, före Perplexity Decider v1.1 på 70,6 och JEV-27B-VL på 69,6, med jämförelseraderna återigen hämtade från board-data snarare än körda av författarna.
Genomströmningssiffrorna avser en enskild begäran och en enskild GPU och anges som sådana: d3 besvarar en textbegäran på 55 ms i median, en begäran med en bild på 273 ms och en begäran med en tio sekunder lång video på 553 ms, på en AMD Instinct MI325X. d3-edge gör samma sak på 6,7 ms, 41,9 ms och 308,3 ms. Detta är medianer per fråga för en modell som är utformad för att anropas många gånger i ett och samma arbetsflöde, vilket är siffran som spelar roll för den arkitektur som dessa modeller är byggda för – tjugo sekventiella beslut med ytterligare 100 ms vardera kostar två sekunder, vilket Microsoft också framhöll om sin egen beslutsmodell den här månaden.
Vad repositorierna inte säger
Tre luckor är värda att namnge innan någon planerar utifrån detta.
Det första är indatabudgeten. decision_config.json för de största modelluppsättningarna sätter max_length till null, och inget kort anger ett tak för antal tokens för tillstånd plus frågor plus alternativbeskrivningar. Decision 1.0:s kort publicerade explicita budgetar – 1 024 tokens för encodergrenen, 16 384 för decodergrenen – och dessa siffror är en verklig planeringsbegränsning. Deras frånvaro här är anmärkningsvärd, och det är det enskilt mest användbara som en uppföljande commit skulle kunna lägga till.
Det andra är kalibrering. Det viktigaste talet för en beslutsmodell är inte träffsäkerhet, utan huruvida ett returnerat 0,9 betyder nio gånger av tio. Indexen för vision och text säger ingenting om det. Det finns ingen Brier-poäng, ingen siffra för förväntat kalibreringsfel och ingen temperatur i något av de sex korten. InternLM publicerade båda för sin egen beslutsmodell i september; vLLM-SR har inte gjort det, för någon medlem i den här familjen.
Den tredje är oberoende. Decision 2.0:s modeller har varit i extern användning i två veckor; Decision 3.0:s har funnits i timmar. Nedladdningssiffrorna den 11 oktober – 130 för d3, 83 för d3-lite, 82 för d3-nano – är avtrycket av en uppladdning, inte av ett anammande. Betrakta varje indexsiffra ovan som en hypotes med ett repositorium kopplat till sig.
Var detta passar in i en stack du kan anropa idag
Den praktiska frågan om en beslutsmodell är huruvida den passar in i en pipeline som redan finns, och här har ekosystemet kommit längre än modellerna. Det System One-begäranformat som dessa modeller använder är inte proprietärt för vLLM-SR: det är samma kontrakt för tillstånd och namngivna frågor som de hostade Jev-modellerna anropas med, vilket är anledningen till att "Jev" förekommer både som namnet på indexet i d3:s modellkort och som en rad på dess resultattavla.
OrcaRouter står för den sidan av familjen. typesafe/jev-1.13 finns i vår katalog och tillhandahålls via POST /v1/systemone — samma kontrakt, till $0.042 per miljon indatatokens utan avgift för completion eftersom det inte finns någon completion, upp till ungefär 64K indatatokens, text in och strukturerad JSON ut, icke-strömmande. Det är den typ av modell som ett beslutsfattande lager anropar idag. Två saker gör vi inte anspråk på: d3 och resten av Decision 3.0 finns inte i vår katalog, och Decision 3.0:s lokala inferensväg är en Python-klass i ett Hugging Face-repositorium, inte en endpoint som vi skulle kunna routa ens om vi ville. Vad en router faktiskt ger dig här finns på andra sidan av loopen — den generativa modellen som agerar på ett beslut, routad genom en nyckel över 200+ modeller med automatisk failover när en leverantör vacklar, så att ett poängsättningssteg framför ett arbetsflöde inte också innebär att man lägger till en andra leverantörsrelation.
Vad skulle förändra den här bilden?
Fyra saker, i grov ordning efter hur mycket de skulle säga dig. Ett blogginlägg från projektet som anger indatabudgeten och den avsedda driftsättningsformen, vilket skulle bekräfta att detta är en release snarare än en push. En Brier-poäng eller ett ECE-värde på vilken enskild checkpoint som helst. En tredje part som kör den offentliga sviten på de släppta vikterna i stället för att läsa indexet. Och en runtime — semantic-router-förvaret landade två commits den 11 oktober som kopplar in d3 och d3-edge i dess modellruntime, inklusive videoindata, vilket tyder på att serving-historien byggs nu och kommer att vara det som gör dessa modeller billiga att prova.
Tills åtminstone den första av dem har landat är den ärliga sammanfattningen denna: det finns en komplett, Apache-2.0-licensierad, genuin beslutsmodell som ligger på Hugging Face från 0.6B till 27B, publicerad med ovanligt god proveniens – filhashvärden, pinnade basrevisioner, ett angivet hårdvarumål – och med ovanligt lite av den omkringliggande dokumentationen som skulle låta dig avgöra om du ska använda den. Att ladda ner den kostar ingenting. Att tro på indexet bör vänta.

