Wygenerowana karta tytułowa dla Decision 3.0 z podtytułem „sześć otwartych multimodalnych modeli decyzyjnych, od 0,6B do 27B”, z plakietkami o treści „wagi Apache-2.0”, „obrazy i wideo”, „brak jeszcze wpisu o premierze” oraz stopką o treści „Wszystkie dane liczbowe w tym artykule należą do vLLM-SR; nic tutaj nie zostało niezależnie odtworzone.” Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Engineering & Research

Decision 3.0 jest dostępny na Hugging Face: sześć otwartych multimodalnych modeli decyzyjnych, ogłoszonych wyłącznie na X

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Decision 3.0 istnieje w formie, którą możesz pobrać już teraz, i prawie nikt tego nie zapisał. Sześć checkpointów — d3, d3-flash, d3-mini, d3-nano, d3-lite i d3-edge — pojawiło się w organizacji vllm-sr na Hugging Face 10 października 2026, od najnowszego, począwszy od 09:38 UTC, a kończąc na d3-edge o 23:49 UTC. Są na licencji Apache-2.0, są zbudowane na backbone'ach Qwen3.5 i Qwen3.8, odpowiadają na pytania wyboru, tak/nie i punktowe, podając prawdopodobieństwo dla każdej opcji zamiast generować token, a pięć z sześciu odczytuje teraz obrazy i wideo. Każda karta modelu opisuje siebie jako „27B multimodalny fundacyjny model decyzyjny Decision 3.0, modele decyzyjne vLLM Semantic Router”, czyli otwarta warstwa decyzyjna projektu vLLM.

Brakuje ogłoszenia. Konto X projektu vLLM pogratulowało zespołowi vLLM-SR wydania 11 października, cytując własny wątek wprowadzający opiekuna projektu — to cały publiczny ślad. Indeks bloga projektu wciąż urywa się na 10 października wpisem o modelach decyzyjnych routingu, a nie o tych. Strona wydań na GitHubie dla vllm-project/semantic-router wciąż kończy się na v0.4.0 z 27 września. Wagi trafiły do obiegu; noty o premierze wciąż nie.

To rozróżnienie ma znaczenie dla tego, jak odczytujesz wszystko poniżej. Każda wartość wydajności w tym artykule pochodzi z własnych kart modeli vLLM-SR, zmierzonych przy użyciu ich własnego harnessu na ich własnym sprzęcie. Nic tutaj nie zostało odtworzone przez stronę trzecią, a tablica wyników, na której publikują, jest prowadzona przez nich samych. To wczesny, uczciwy odczyt artefaktu, który jest realny, oraz twierdzenia, które nie zostało jeszcze poddane audytowi.

Co właściwie znajduje się na Hugging Face

Sześć repozytoriów jest prostych, kompletnych i wzajemnie spójnych. Każde zawiera wagi safetensors, szablon czatu oraz plik decision_config.json, który ustala wersję modelu bazowego, niestandardowy kod modelowania (modeling_d3.py, d3_engine.py, d3_server.py), głowicę odczytu we własnym pliku readout.safetensors, oraz plik MODEL_MANIFEST.json z sumą SHA-256 dla każdego pliku. Siódme repozytorium, strona kolekcji, wymienia wszystkie sześć.

Rodzina, w kolejności, w jakiej występują rozmiary:

• d3 — 26,09 mld parametrów, w tym 0,46 mld enkodera wizyjnego, zbudowany na Qwen/Qwen3.8-27B. Przesłano 10 października, 09:38 UTC.

• d3-flash — 8,39 mld, w tym koder wizyjny o wielkości 0,46 mld, oparty na Qwen/Qwen3.5-9B.

• d3-mini — 4,54 mld, w tym koder wizyjny o 0,33 mld, zbudowany na Qwen/Qwen3.5-4B.

• d3-nano — 2,21 mld, w tym 0,33-miliardowy koder wizyjny, zbudowany na Qwen/Qwen3.5-2B.

• d3-lite — 0,85 mld, w tym 0,10 mld na koder wizyjny, zbudowany na Qwen/Qwen3.5-0.8B.

• d3-edge — 0,59B, w tym 0,10B enkodera wizyjnego, również zbudowany na Qwen/Qwen3.5-0.8B. Przesłany jako ostatni, 23:49 UTC.

Wszystkie sześć mają ten sam kontrakt żądania: stan (tekst lub JSON, opcjonalnie z obrazami i wideo) oraz słownik nazwanych pytań, a odpowiedzią są typowane rozkłady prawdopodobieństwa. Istnieją trzy rodzaje pytań — Choice, Noul (tak/nie), Score — a model odpowiada na wszystkie w jednym wywołaniu, wykonując jeden przebieg w przód dla każdego pytania na tym samym wejściu, bez żadnej pętli dekodowania.

A screenshot of the vLLM-SR collection page on Hugging Face, headed Decision 3.0 with the subtitle 'Towards Open Multimodal Foundation Decision Models' and marked as updated about 15 hours ago with 25 upvotes. It lists six repositories, each tagged Zero-Shot Classification: vllm-sr/d3 at 26B with 130 downloads and 18 likes, vllm-sr/d3-flash at 8B with 69 downloads, vllm-sr/d3-mini at 5B with 62, vllm-sr/d3-nano at 2B with 82, vllm-sr/d3-lite at 0.9B with 83, and vllm-sr/d3-edge at 0.6B with 33. The left sidebar lists the organisation's other collections: Vela 2.0, Decision 2.0, Decision 1.0, Vela 1.0, MoM 1.0 and MoM Nano.

Liczby i do kogo należą

vLLM-SR publikuje ranking, który nazywa Jev Decision Index 0.3.1, i umieszcza d3 na jego szczycie. Wiersze z czołówki, wszystkie zgłoszone przez dostawców:

• d3 — Indeks 64.7, zestaw publiczny 65.5, testy tych samych umiejętności 62.8, zadania z nowej dziedziny 56.6.

• Perplexity Decider v1.1 (27B) — 62,8, 62,3, 61,1, 55,6.

• Fastino GLiDE bez myślenia (28B) — 60,2, 59,1, 59,5, 52,9.

• Jev — 60.1, 58.0, 58.0, 55.0.

• Torchcast Decision 27B — 59,9, 65,1, 58,1, 50,8.

• Decision 2.0 (27B), poprzednia generacja — 55,9, 57,0, 55,7, 47,9.

Przypis na karcie d3 stwierdza wprost, że wiersz samego d3 to ocena wewnętrzna, podczas gdy wiersze porównawcze to dane z tablicy na żywo odczytane 10 października. To właściwe ujawnienie i warto je przeczytać dwa razy: liczby konkurentów pobrano z tablicy, a liczba podmiotu została wygenerowana przez zespół, który zbudował model. Karta twierdzi także, że na wszystkie 140 178 publicznych żądań odpowiedziano, a żadne nie było nieobsługiwane — to twierdzenie o pokryciu, a nie o dokładności, i nietypowe do opublikowania.

A screenshot of the vllm-sr/d3 model card on Hugging Face. The header shows 18 likes, the vLLM Semantic Router organisation, and tags for Transformers, Safetensors, qwen3_5, feature-extraction, decision-model, classification, system-one, multimodal, vision, video, custom_code and an Apache-2.0 licence, with the model size listed as 26B parameters in BF16. The card graphic reads 'Decision 3.0 / d3 27B'. A specification panel gives Parameters as 26.09B including the 0.46B vision encoder, Inputs as 'Text or JSON, plus images and videos (several per request)', Decision types as 'Choice - Yes / No - Score' and License as Apache-2.0. The Highlights section states a Jev Decision Index 0.3 public suite score of 65.45 measured with the official 0.3 kit on the released weights, all 140,178 public requests answered and none unsupported, and +8.5 on the public suite over Decision 2.0. The sidebar shows 130 downloads last month, a model tree pinned to Qwen/Qwen3.8-27B, and two Spaces using the model.

Mniejsze checkpointy deklarują, że idą równym krokiem. Każda karta podaje wynik publicznego zestawu testów i deltę względem modelu o odpowiadającym rozmiarze w Decision 2.0: d3-flash: 57,79, wzrost o 11,0 względem poprzedniego 9B; d3-mini: 54,90, wzrost o 10,7; d3-nano: 42,22, wzrost o 12,2; d3-lite: 36,93, wzrost o 16,4; d3-edge: 28,82, wzrost o 12,1. Względne zyski są największe na dole zakresu, co jest tym, czego można by oczekiwać, gdyby multimodalna recepta pretreningowa wykonywała więcej pracy dla małych modeli niż dla dużych — a także tym, co uzyskałoby się, dostrajając małe modele najintensywniej. Z zewnątrz nie da się stwierdzić, o który z tych przypadków chodzi.

Multimodalna część to prawdziwa zmiana

Modele Decision 2.0 odczytują tekst. Decision 3.0 odczytują tekst, obrazy i wideo, i to jest zasadnicza różnica między generacjami — nie ruch indeksu. Każda karta wymienia dane wejściowe obrazu jako PNG, JPEG lub WebP, dostarczane jako ścieżki, adresy URL, obrazy PIL lub adresy URL danych base64, z kilkoma na żądanie, każdy o rozdzielczości do 1,6 megapiksela; oraz wideo jako MP4, WebM, MOV lub MKV, albo jako tablice klatek, odczytywane z szybkością 2 klatek na sekundę, przy czym maksymalnie 32 klatki rozmieszczone w całym klipie, a każda klatka o rozdzielczości do 0,2 megapiksela. Każde pytanie w żądaniu widzi każdy obraz i każde wideo do niego dołączone.

Dowodem potwierdzającym dla wideo jest wynik Perception Test na wszystkich 19 140 pytaniach walidacyjnych: d3 – 77,4, d3-flash – 73,3, d3-mini – 70,3, d3-nano – 63,5, d3-lite – 59,3, d3-edge – 46,6, w zestawieniu z udokumentowanym progiem losowym wynoszącym 33,3 w pytaniach z trzema opcjami. vLLM-SR określa to jako ocenę wewnętrzną. d3 ma również tablicę wyników wizyjnych, która plasuje go na poziomie 71,6 ogółem, przed Perplexity Decider v1.1 z 70,6 i JEV-27B-VL z 69,6, przy czym wiersze porównawcze ponownie pochodzą z danych tablicy, a nie zostały uruchomione przez autorów.

Wskaźniki przepustowości dotyczą pojedynczego żądania i pojedynczego GPU i zostały podane jako takie: d3 odpowiada na żądanie tekstowe w medianie 55 ms, na żądanie zawierające obraz w 273 ms, a na żądanie zawierające dziesięciosekundowe wideo w 553 ms, na jednym AMD Instinct MI325X. d3-edge robi to samo w 6,7 ms, 41,9 ms i 308,3 ms. To mediany na pytanie w modelu zaprojektowanym do wywoływania wiele razy w ramach jednego przepływu pracy — a to właśnie ta liczba ma znaczenie dla architektury, dla której te modele są tworzone: dwadzieścia kolejnych decyzji przy dodatkowych 100 ms każda kosztuje dwie sekundy, jak Microsoft zauważył w tym miesiącu w odniesieniu do swojego własnego modelu decyzyjnego.

Czego nie mówią repozytoria

Warto nazwać trzy luki, zanim ktokolwiek zacznie planować wokół tego.

Pierwszy to budżet wejściowy. decision_config.json dla największego modelu ustawia max_length na null, a żadna karta nie podaje limitu tokenów dla stanu plus pytań plus opisów opcji. Karty Decision 1.0 publikowały jawne budżety — 1024 tokeny dla gałęzi enkodera, 16 384 dla gałęzi dekodera — i te liczby są realnym ograniczeniem planistycznym. Ich brak tutaj rzuca się w oczy i jest pojedynczą najbardziej użyteczną rzeczą, jaką mógłby dodać kolejny commit.

Druga kwestia to kalibracja. Najważniejszą liczbą w modelu decyzyjnym nie jest dokładność, lecz to, czy zwrócona wartość 0,9 oznacza dziewięć przypadków na dziesięć. Indeksy wizji i tekstu nie mówią o tym nic. Nie ma wyniku Briera, nie ma wartości oczekiwanego błędu kalibracji ani temperatury w żadnej z sześciu kart. InternLM opublikował oba dla swojego modelu decyzyjnego we wrześniu; vLLM-SR nie opublikował ich dla żadnego członka tej rodziny.

Trzecia kwestia to niezależność. Modele Decision 2.0 mają za sobą dwa tygodnie użytkowania zewnętrznego; modele Decision 3.0 – godziny. Liczby pobrań z 11 października — 130 dla d3, 83 dla d3-lite, 82 dla d3-nano — to ślad po wgraniu, a nie dowód przyjęcia. Każdą powyższą wartość indeksu traktuj jako hipotezę z dołączonym repozytorium.

Gdzie to się znajduje w stosie, który możesz wywołać już dziś

Praktyczne pytanie dotyczące modelu decyzyjnego brzmi, czy wpasowuje się w już istniejący potok, a tutaj ekosystem jest dalej posunięty niż same modele. Format żądań System One używany przez te modele nie jest własnością vLLM-SR: to ten sam kontrakt stanu i nazwanych pytań, za pomocą którego wywoływane są hostowane modele Jev, dlatego „Jev” występuje zarówno jako nazwa indeksu w karcie modelu d3, jak i jako wiersz w jego rankingu.

OrcaRouter obsługuje tę część rodziny. typesafe/jev-1.13 znajduje się w naszym katalogu i jest obsługiwany przez POST /v1/systemone — ten sam kontrakt, w cenie 0,042 USD za milion tokenów wejściowych, bez opłaty za uzupełnienie, ponieważ nie ma uzupełnienia, do około 64 tys. tokenów wejściowych, tekst na wejściu i ustrukturyzowany JSON na wyjściu, bez strumieniowania. To model, jaki warstwa decyzyjna wywołuje dzisiaj. Nie twierdzimy dwóch rzeczy: d3 i reszta Decision 3.0 nie znajdują się w naszym katalogu, a lokalna ścieżka wnioskowania Decision 3.0 to klasa Pythona w repozytorium Hugging Face, a nie punkt końcowy, który moglibyśmy kierować, nawet gdybyśmy chcieli. To, co router rzeczywiście ci tutaj daje, znajduje się po drugiej stronie pętli — model generatywny, który działa na podstawie decyzji, kierowany przez jeden klucz do ponad 200 modeli, z automatycznym przełączaniem awaryjnym, gdy dostawca szwankuje, dzięki czemu dodanie kroku scoringowego przed przepływem pracy nie oznacza też dodania drugiej relacji z dostawcą.

Co zmieniłoby ten obraz

Cztery rzeczy, w przybliżonej kolejności od najbardziej do najmniej pouczających. Wpis na blogu projektu podający budżet wejściowy i zamierzony kształt wdrożenia, co potwierdziłoby, że to wydanie, a nie push. Wynik Brier lub wartość ECE dla dowolnego checkpointu. Podmiot trzeci uruchamiający publiczny zestaw testów na udostępnionych wagach, zamiast czytać indeks. I środowisko uruchomieniowe — w repozytorium semantic-router pojawiły się dwa commity 11 października, które podłączają d3 i d3-edge do jego środowiska uruchomieniowego modeli, w tym wejście wideo, co sugeruje, że sposób serwowania jest teraz budowany i będzie tym, co sprawi, że te modele będzie można tanio wypróbować.

Dopóki przynajmniej pierwszy z nich się nie pojawi, uczciwe podsumowanie jest takie: na Hugging Face znajduje się kompletna, objęta licencją Apache-2.0, prawdziwie multimodalna rodzina modeli decyzyjnych od 0,6B do 27B, opublikowana z wyjątkowo dobrze udokumentowanym pochodzeniem — skróty plików, przypięte rewizje bazowe, podany docelowy sprzęt — oraz z wyjątkowo małą ilością dokumentacji towarzyszącej, która pozwoliłaby ci zdecydować, czy jej użyć. Pobranie jej nic nie kosztuje. Wiara w indeks powinna poczekać.

A generated six-row scoreboard titled 'Decision 3.0 - the scoreboard', listing the family from largest to smallest with each checkpoint's parameter count and its vLLM-SR-reported Jev Decision Index 0.3 public-suite figure: d3 26.09B and 65.5, d3-flash 8.39B and 57.79, d3-mini 4.54B and 54.90, d3-nano 2.21B and 42.22, d3-lite 0.85B and 36.93, d3-edge 0.59B and 28.82, with a footer reading 'All figures are vLLM-SR's own; nothing here is independently reproduced.'

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie