
Decision 3.0 ist auf Hugging Face: Sechs offene multimodale Entscheidungsmodelle, nur auf X angekündigt
- OrcaNEUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 pro 1 Mio. Tokens · 71 tok/s
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
Decision 3.0 existiert in einer Form, die man jetzt herunterladen kann, und fast niemand hat es aufgeschrieben. Sechs Checkpoints — d3, d3-flash, d3-mini, d3-nano, d3-lite und d3-edge — sind in der vllm-sr-Organisation auf Hugging Face am 10. Oktober 2026 gelandet, neueste zuerst, beginnend um 09:38 UTC und endend mit d3-edge um 23:49 UTC. Sie stehen unter Apache-2.0, sie basieren auf den Qwen3.5- und Qwen3.8-Backbones, sie beantworten Auswahl-, Ja/Nein- und Bewertungsfragen mit einer Wahrscheinlichkeit pro Option, anstatt ein Token zu generieren, und fünf der sechs lesen jetzt Bilder und Videos. Jede Modellkarte beschreibt sich selbst als „das multimodale 27B-Foundation-Entscheidungsmodell von Decision 3.0, die Entscheidungsmodelle von vLLM Semantic Router“, wobei es sich um die offene Entscheidungsschicht des vLLM-Projekts handelt.
Was fehlt, ist die Ankündigung. Der X-Account des vLLM-Projekts gratulierte dem vLLM-SR-Team am 11. Oktober zur Veröffentlichung und zitierte dabei den einleitenden Thread des Maintainers selbst — das ist der gesamte öffentliche Beleg. Der Blog-Index des Projekts endet weiterhin am 10. Oktober mit einem Beitrag über Routing-Entscheidungsmodelle, nicht über diese hier. Die GitHub-Releases-Seite für vllm-project/semantic-router geht weiterhin nicht über v0.4.0 vom 27. September hinaus. Gewichte wurden ausgeliefert; die Launch-Notiz nicht.
Diese Unterscheidung ist entscheidend dafür, wie Sie alles Folgende lesen. Jede Leistungskennzahl in diesem Artikel stammt aus den eigenen Model Cards von vLLM-SR, gemessen mit deren eigenem Harness auf deren eigener Hardware. Nichts hier wurde von einer außenstehenden Partei reproduziert, und das Board, auf dem sie veröffentlichen, ist eines, das sie selbst betreiben. Dies ist eine frühe, ehrliche Einschätzung eines Artefakts, das real ist, und einer Behauptung, die noch nicht auditiert wurde.
Was ist eigentlich auf Hugging Face?
Die sechs Repositories sind einfach, vollständig und miteinander konsistent. Jedes enthält safetensors-Gewichte, ein Chat-Template, eine decision_config.json, die die Basis-Modell-Revision fixiert, benutzerdefinierten Modellierungscode (modeling_d3.py, d3_engine.py, d3_server.py), einen Readout-Head in einer eigenen readout.safetensors und eine MODEL_MANIFEST.json mit einem SHA-256 pro Datei. Ein siebtes Repository, die Sammlungsseite, listet alle sechs auf.
Die Familie, in der Reihenfolge, in der die Größen fallen:
• d3 — 26,09B Parameter, einschließlich eines 0,46B Vision-Encoders, basierend auf Qwen/Qwen3.8-27B. Hochgeladen am 10. Oktober, 09:38 UTC.
• d3-flash — 8,39B einschließlich eines 0,46B großen Vision-Encoders, aufgebaut auf Qwen/Qwen3.5-9B.
• d3-mini — 4,54B einschließlich eines 0,33B Vision-Encoders, basierend auf Qwen/Qwen3.5-4B.
• d3-nano — 2,21 Mrd. einschließlich eines 0,33 Mrd. großen Vision-Encoders, aufgebaut auf Qwen/Qwen3.5-2B.
• d3-lite — 0,85B einschließlich eines 0,10B Vision-Encoders, basierend auf Qwen/Qwen3.5-0.8B.
• d3-edge — 0,59B einschließlich eines 0,10B-Vision-Encoders, ebenfalls aufgebaut auf Qwen/Qwen3.5-0.8B. Zuletzt hochgeladen, 23:49 UTC.
Alle sechs haben denselben Anfragevertrag: einen Zustand (Text oder JSON, optional mit Bildern und Videos) plus ein Wörterbuch benannter Fragen und eine Antwort aus typisierten Wahrscheinlichkeitsverteilungen. Es gibt drei Arten von Fragen — Choice, Noul (Ja/Nein), Score — und das Modell beantwortet alle in einem Aufruf, indem es einen Forward-Pass pro Frage über dieselbe Eingabe ausführt, ohne irgendwo eine Decodierungsschleife.

Die Zahlen – und wem sie gehören
vLLM-SR veröffentlicht eine Rangliste, die es Jev Decision Index 0.3.1 nennt, und setzt d3 an ihre Spitze. Die wichtigsten Zeilen, alle vom Anbieter gemeldet:
• d3 — Index 64,7, öffentliche Testreihe 65,5, Tests im selben Fähigkeitsbereich 62,8, Aufgaben in neuen Domänen 56,6.
• Perplexity Decider v1.1 (27B) — 62,8, 62,3, 61,1, 55,6.
• Fastino GLiDE no-thinking (28B) — 60.2, 59.1, 59.5, 52.9.
• Jev — 60,1, 58,0, 58,0, 55,0.
• Torchcast Decision 27B — 59,9, 65,1, 58,1, 50,8.
• Decision 2.0 (27B), die vorherige Generation — 55,9, 57,0, 55,7, 47,9.
Eine Fußnote auf der Karte von d3 stellt unmissverständlich klar, dass die eigene Zeile von d3 eine interne Bewertung ist, während die Vergleichszeilen Live-Board-Daten sind, die am 10. Oktober ausgelesen wurden. Das ist die richtige Offenlegung, und es lohnt sich, sie zweimal zu lesen: Die Konkurrenzzahlen wurden von einem Board abgerufen, und die Zahl für das untersuchte Modell wurde von dem Team erzeugt, das das Modell gebaut hat. Die Karte behauptet außerdem, dass alle 140.178 öffentlichen Anfragen beantwortet wurden, ohne dass eine unbelegt blieb – eine Abdeckungsaussage, keine Genauigkeitsaussage, und eine ungewöhnliche, die man veröffentlicht.

Die kleineren Checkpoints geben an, im Gleichschritt zu marschieren. Jede Karte liefert einen Public-Suite-Wert und ein Delta gegenüber der entsprechenden Größe in Decision 2.0: d3-flash 57,79, plus 11,0 gegenüber dem vorherigen 9B; d3-mini 54,90, plus 10,7; d3-nano 42,22, plus 12,2; d3-lite 36,93, plus 16,4; d3-edge 28,82, plus 12,1. Die relativen Zugewinne sind am unteren Ende des Größenbereichs am größten, was man erwarten würde, wenn das multimodale Vortrainingsrezept bei kleinen Modellen mehr Arbeit leistet als bei großen — und ebenso das, was man erhalten würde, wenn man die kleinen Modelle am intensivsten tunen würde. Von außen lässt sich nicht feststellen, welches von beidem der Fall ist.
Der multimodale Teil ist der eigentliche Durchbruch.
Die Modelle von Decision 2.0 lesen Text. Die von Decision 3.0 lesen Text, Bilder und Videos, und das ist der wesentliche Unterschied zwischen den Generationen – nicht die Indexverschiebung. Jede Karte führt Bildeingaben als PNG, JPEG oder WebP auf, angegeben als Pfade, URLs, PIL-Bilder oder Base64-Daten-URLs, wobei mehrere pro Anfrage mit bis zu 1,6 Megapixeln pro Bild möglich sind; und Video als MP4, WebM, MOV oder MKV oder als Frame-Arrays, gelesen mit 2 Bildern pro Sekunde, wobei höchstens 32 Einzelbilder über den gesamten Clip verteilt und jedes Einzelbild bis zu 0,2 Megapixel groß ist. Jede Frage in einer Anfrage sieht jedes Bild und jedes Video, die an sie angehängt sind.
Die unterstützenden Belege für Video sind ein Perception-Test-Ergebnis auf allen 19.140 Validierungsfragen: d3 bei 77,4, d3-flash 73,3, d3-mini 70,3, d3-nano 63,5, d3-lite 59,3, d3-edge 46,6, gegenüber einer dokumentierten Zufallsuntergrenze von 33,3 bei Drei-Optionen-Fragen. vLLM-SR bezeichnet dies als interne Evaluierung. d3 verfügt außerdem über ein Vision-Board, das es insgesamt bei 71,6 einordnet, vor Perplexity Decider v1.1 mit 70,6 und JEV-27B-VL mit 69,6, wobei die Vergleichszeilen erneut aus Board-Daten stammen und nicht von den Autoren durchgeführt wurden.
Die Durchsatzwerte gelten für eine einzelne Anfrage auf einer einzelnen GPU und sind als solche ausgewiesen: d3 beantwortet eine Textanfrage im Median in 55 ms, eine Anfrage mit einem Bild in 273 ms und eine Anfrage mit einem zehnsekündigen Video in 553 ms auf einer AMD Instinct MI325X. d3-edge erledigt dasselbe in 6,7 ms, 41,9 ms und 308,3 ms. Dabei handelt es sich um Mediane pro Frage bei einem Modell, das dafür ausgelegt ist, innerhalb eines Workflows viele Male aufgerufen zu werden – und das ist die Zahl, die für die Architektur zählt, für die diese Modelle gebaut sind: Zwanzig aufeinanderfolgende Entscheidungen mit jeweils 100 ms zusätzlich kosten zwei Sekunden, wie Microsoft diesen Monat denselben Punkt zu seinem eigenen Entscheidungsmodell angeführt hat.
Was die Repositories nicht sagen
Drei Lücken sollte man benennen, bevor irgendjemand darauf aufbaut.
Das erste ist das Eingabebudget. decision_config.json für die größten Modellsätze max_length auf null, und keine Karte gibt eine Token-Obergrenze für Status plus Fragen plus Optionsbeschreibungen an. Die Karten von Decision 1.0 veröffentlichten explizite Budgets – 1.024 Token für den Encoder-Zweig, 16.384 für den Decoder-Zweig – und diese Zahlen sind eine echte Planungsvorgabe. Ihr Fehlen hier ist auffällig, und es ist die einzige nützlichste Sache, die ein Folge-Commit hinzufügen könnte.
Das Zweite ist die Kalibrierung. Die wichtigste Zahl eines Entscheidungsmodells ist nicht die Genauigkeit, sondern ob eine zurückgegebene 0,9 bedeutet, dass sie in neun von zehn Fällen zutrifft. Die Vision- und Textindizes sagen nichts darüber aus. Es gibt weder einen Brier-Score noch eine Angabe zum erwarteten Kalibrierungsfehler noch eine Temperatur in einer der sechs Karten. InternLM veröffentlichte beides zu seinem eigenen Entscheidungsmodell im September; vLLM-SR hat das nicht getan, für kein Mitglied dieser Familie.
Der dritte Punkt ist Unabhängigkeit. Die Modelle von Decision 2.0 werden seit zwei Wochen extern genutzt; die von Decision 3.0 erst seit Stunden. Die Downloadzahlen vom 11. Oktober – 130 für d3, 83 für d3-lite, 82 für d3-nano – sind die Spur eines Uploads, nicht einer Adoption. Behandle jeden oben genannten Indexwert als Hypothese mit einem angehängten Repository.
Wo dies in einem Stack steht, den Sie heute aufrufen können
Die praktische Frage bei einem Entscheidungsmodell ist, ob es sich in eine bereits existierende Pipeline einfügen lässt, und hier ist das Ökosystem weiter fortgeschritten als die Modelle. Das System-One-Anfrageformat, das diese Modelle verwenden, ist nicht proprietär für vLLM-SR: Es ist derselbe Vertrag aus Zustand und benannten Fragen, mit dem die gehosteten Jev-Modelle aufgerufen werden, weshalb „Jev“ sowohl als Name des Index in der Modellkarte von d3 als auch als Zeile auf dessen Leaderboard auftaucht.
OrcaRouter deckt diesen Teil der Familie ab. typesafe/jev-1.13 ist in unserem Katalog und läuft über POST /v1/systemone — derselbe Vertrag, zu 0,042 $ pro Million Eingabe-Tokens ohne Completion-Gebühr, da es keine Completion gibt, bis zu ungefähr 64K Eingabe-Tokens, Text rein und strukturiertes JSON raus, ohne Streaming. Es ist die Art von Modell, die eine Entscheidungsschicht heute aufruft. Zwei Dinge behaupten wir nicht: d3 und der Rest von Decision 3.0 sind nicht in unserem Katalog, und der lokale Inferenzpfad von Decision 3.0 ist eine Python-Klasse in einem Hugging-Face-Repository, kein Endpunkt, den wir routen könnten, selbst wenn wir es wollten. Was ein Router Ihnen hier tatsächlich bringt, liegt auf der anderen Seite der Schleife — das generative Modell, das auf eine Entscheidung reagiert, über einen einzigen Schlüssel für 200+ Modelle geroutet, mit automatischem Failover, wenn ein Anbieter wackelt, sodass das Hinzufügen eines Scoring-Schritts vor einem Workflow nicht auch das Hinzufügen einer zweiten Anbieterbeziehung bedeutet.
Was würde dieses Bild verändern?
Vier Dinge, grob geordnet danach, wie viel sie einem verraten würden. Ein Blogbeitrag des Projekts, der das Input-Budget und die beabsichtigte Deployment-Form nennt, was bestätigen würde, dass dies ein Release und kein Push ist. Ein Brier-Score oder ein ECE-Wert für irgendeinen einzelnen Checkpoint. Ein Dritter, der die öffentliche Suite auf den veröffentlichten Gewichten laufen lässt, statt den Index zu lesen. Und eine Runtime — das Repository semantic-router hat am 11. Oktober zwei Commits erhalten, die d3 und d3-edge in seine Modell-Runtime einbinden, einschließlich Videoeingabe, was nahelegt, dass die Serving-Story gerade entsteht und das sein wird, was diese Modelle günstig zum Ausprobieren macht.
Bis mindestens das erste davon erscheint, lautet die ehrliche Zusammenfassung so: Es gibt eine vollständige, Apache-2.0-lizenzierte, wirklich multimodale Familie von Entscheidungsmodellen auf Hugging Face von 0,6B bis 27B, veröffentlicht mit ungewöhnlich guter Provenienz – Datei-Hashes, festgeschriebene Basis-Revisionen, ein angegebenes Hardware-Ziel – und mit ungewöhnlich wenig begleitender Dokumentation, anhand derer man entscheiden könnte, ob man sie verwenden sollte. Der Download kostet nichts. Der Glaube an den Index sollte warten.

