Sebuah kartu judul yang dihasilkan untuk Decision 3.0 dengan subjudul 'enam model keputusan multimodal terbuka, 0,6B hingga 27B', dengan chip yang bertuliskan 'bobot Apache-2.0', 'gambar dan video', 'belum ada postingan peluncuran', dan footer bertuliskan 'Semua angka dalam artikel ini adalah milik vLLM-SR sendiri; tidak ada apa pun di sini yang direproduksi secara independen.' Logo OrcaRouter dikompositkan di sudut kanan bawah.
Engineering & Research

Decision 3.0 Ada di Hugging Face: Enam Model Decision Multimodal Terbuka, Diumumkan Hanya di X

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Decision 3.0 ada dalam bentuk yang dapat Anda unduh sekarang, dan hampir tidak ada yang menuliskannya. Enam checkpoint — d3, d3-flash, d3-mini, d3-nano, d3-lite dan d3-edge — mendarat di vllm-sr organisasi di Hugging Face pada 10 Oktober 2026, terbaru lebih dulu mulai pukul 09:38 UTC dan berakhir dengan d3-edge pada 23:49 UTC. Mereka adalah Apache-2.0, dibangun di atas tulang punggung Qwen3.5 dan Qwen3.8, mereka menjawab pertanyaan pilihan, ya/tidak, dan skor dengan probabilitas per opsi alih-alih menghasilkan token, dan lima dari enam sekarang membaca gambar dan video. Setiap kartu model mendeskripsikan dirinya sebagai "model keputusan fondasi multimodal 27B dari Decision 3.0, model-model keputusan dari vLLM Semantic Router," yang merupakan lapisan keputusan terbuka proyek vLLM.

Yang hilang adalah pengumumannya. Akun X proyek vLLM memberi selamat kepada tim vLLM-SR atas rilis pada 11 Oktober, mengutip utas perkenalan dari maintainer sendiri — itulah keseluruhan catatan publiknya. Indeks blog proyek itu masih berakhir pada 10 Oktober dengan pos tentang model keputusan perutean, bukan tentang model-model ini. Halaman rilis GitHub untuk vllm-project/semantic-router masih berhenti di v0.4.0 dari 27 September. Bobotnya sudah dikirim; catatan peluncurannya belum.

Perbedaan itu penting untuk cara Anda membaca semua yang ada di bawah ini. Setiap angka performa dalam artikel ini berasal dari kartu model milik vLLM-SR sendiri, diukur dengan harness mereka sendiri di perangkat keras mereka sendiri. Tidak ada apa pun di sini yang telah direproduksi oleh pihak luar, dan papan tempat mereka mempublikasikannya adalah papan yang mereka kelola sendiri. Ini adalah pembacaan awal yang jujur terhadap artefak yang nyata dan klaim yang belum diaudit.

Apa sebenarnya yang ada di Hugging Face

Keenam repositori tersebut sederhana, lengkap, dan konsisten satu sama lain. Masing-masing membawa bobot safetensors, templat obrolan, sebuah decision_config.json yang menetapkan revisi model dasar, kode pemodelan khusus (modeling_d3.py, d3_engine.py, d3_server.py), sebuah head readout di dalam readout.safetensors-nya sendiri, dan sebuah MODEL_MANIFEST.json dengan SHA-256 per file. Repositori ketujuh, halaman koleksi, mencantumkan keenamnya.

Keluarga, dalam urutan ukuran yang menurun:

• d3 — 26,09B parameter termasuk encoder visi 0,46B, dibangun di atas Qwen/Qwen3.8-27B. Diunggah 10 Oktober, 09.38 UTC.

• d3-flash — 8.39B termasuk encoder visi 0.46B, dibangun di atas Qwen/Qwen3.5-9B.

• d3-mini — 4,54B termasuk encoder visi 0,33B, dibangun di atas Qwen/Qwen3.5-4B.

• d3-nano — 2.21B termasuk encoder visi 0.33B, dibangun di atas Qwen/Qwen3.5-2B.

• d3-lite — 0,85B termasuk encoder visi 0,10B, dibangun di atas Qwen/Qwen3.5-0.8B.

• d3-edge — 0,59B termasuk encoder visi 0,10B, juga dibangun di atas Qwen/Qwen3.5-0.8B. Diunggah terakhir, 23:49 UTC.

Keenamnya membawa kontrak permintaan yang sama: sebuah state (teks atau JSON, opsional dengan gambar dan video) plus kamus pertanyaan bernama, dan respons berupa distribusi probabilitas bertipe. Ada tiga jenis pertanyaan — Choice, Noul (ya/tidak), Score — dan model menjawab semuanya dalam satu panggilan dengan menjalankan satu forward pass per pertanyaan atas input yang sama, tanpa loop decoding di mana pun.

A screenshot of the vLLM-SR collection page on Hugging Face, headed Decision 3.0 with the subtitle 'Towards Open Multimodal Foundation Decision Models' and marked as updated about 15 hours ago with 25 upvotes. It lists six repositories, each tagged Zero-Shot Classification: vllm-sr/d3 at 26B with 130 downloads and 18 likes, vllm-sr/d3-flash at 8B with 69 downloads, vllm-sr/d3-mini at 5B with 62, vllm-sr/d3-nano at 2B with 82, vllm-sr/d3-lite at 0.9B with 83, and vllm-sr/d3-edge at 0.6B with 33. The left sidebar lists the organisation's other collections: Vela 2.0, Decision 2.0, Decision 1.0, Vela 1.0, MoM 1.0 and MoM Nano.

Angka-angkanya, dan milik siapa angka itu

vLLM-SR menerbitkan papan peringkat yang disebutnya Jev Decision Index 0.3.1 dan menempatkan d3 di puncaknya. Baris-baris utama, semuanya dilaporkan vendor:

• d3 — Indeks 64,7, suite publik 65,5, tes keterampilan sama 62,8, tugas domain baru 56,6.

• Perplexity Decider v1.1 (27B) — 62.8, 62.3, 61.1, 55.6.

• Fastino GLiDE no-thinking (28B) — 60,2, 59,1, 59,5, 52,9.

• Jev — 60,1, 58,0, 58,0, 55,0.

• Torchcast Decision 27B — 59,9, 65,1, 58,1, 50,8.

• Decision 2.0 (27B), generasi sebelumnya — 55.9, 57.0, 55.7, 47.9.

Catatan kaki pada kartu d3 menyatakan secara gamblang bahwa baris d3 sendiri adalah evaluasi internal, sedangkan baris-baris pembandingnya adalah data papan peringkat langsung yang dibaca pada 10 Oktober. Itu adalah pengungkapan yang tepat untuk dilakukan dan layak dibaca dua kali: angka pesaing diambil dari sebuah papan peringkat, dan angka subjek dihasilkan oleh tim yang membangun model tersebut. Kartu itu juga mengklaim semua 140.178 permintaan publik telah dijawab tanpa satu pun yang tidak didukung — klaim cakupan, bukan klaim akurasi, dan klaim yang tidak biasa untuk dipublikasikan.

A screenshot of the vllm-sr/d3 model card on Hugging Face. The header shows 18 likes, the vLLM Semantic Router organisation, and tags for Transformers, Safetensors, qwen3_5, feature-extraction, decision-model, classification, system-one, multimodal, vision, video, custom_code and an Apache-2.0 licence, with the model size listed as 26B parameters in BF16. The card graphic reads 'Decision 3.0 / d3 27B'. A specification panel gives Parameters as 26.09B including the 0.46B vision encoder, Inputs as 'Text or JSON, plus images and videos (several per request)', Decision types as 'Choice - Yes / No - Score' and License as Apache-2.0. The Highlights section states a Jev Decision Index 0.3 public suite score of 65.45 measured with the official 0.3 kit on the released weights, all 140,178 public requests answered and none unsupported, and +8.5 on the public suite over Decision 2.0. The sidebar shows 130 downloads last month, a model tree pinned to Qwen/Qwen3.8-27B, and two Spaces using the model.

Checkpoint yang lebih kecil melaporkan diri mereka berbaris seirama. Setiap kartu memberikan angka suite publik dan delta terhadap ukuran setara di Decision 2.0: d3-flash 57,79, naik 11,0 dari 9B sebelumnya; d3-mini 54,90, naik 10,7; d3-nano 42,22, naik 12,2; d3-lite 36,93, naik 16,4; d3-edge 28,82, naik 12,1. Keuntungan relatifnya paling besar di ujung bawah rentang, yang merupakan hal yang Anda perkirakan jika resep prapelatihan multimodal bekerja lebih keras untuk model kecil daripada model besar — dan juga hal yang akan Anda hasilkan dengan menyetel model kecil paling keras. Tidak ada cara untuk mengetahui yang mana dari luar.

Bagian multimodal itulah perubahan yang sesungguhnya

Model-model Decision 2.0 membaca teks. Model-model Decision 3.0 membaca teks, gambar, dan video, dan itulah perbedaan substantif antara generasi-generasi tersebut — bukan pergeseran indeksnya. Setiap kartu mencantumkan input gambar sebagai PNG, JPEG, atau WebP, yang diberikan sebagai path, URL, gambar PIL, atau URL data base64, dengan beberapa gambar per permintaan, masing-masing hingga 1,6 megapiksel; dan video sebagai MP4, WebM, MOV, atau MKV, atau sebagai larik frame, dibaca pada 2 frame per detik dengan paling banyak 32 frame yang tersebar di sepanjang klip dan setiap frame hingga 0,2 megapiksel. Setiap pertanyaan dalam suatu permintaan melihat setiap gambar dan setiap video yang dilampirkan padanya.

Bukti pendukung untuk video adalah hasil Perception Test pada semua 19.140 pertanyaan validasi: d3 pada 77,4, d3-flash 73,3, d3-mini 70,3, d3-nano 63,5, d3-lite 59,3, d3-edge 46,6, dibandingkan dengan batas kebetulan yang terdokumentasi sebesar 33,3 pada pertanyaan tiga opsi. vLLM-SR melabeli ini sebagai evaluasi internal. d3 juga membawa vision board yang menempatkannya pada 71,6 secara keseluruhan, di depan Perplexity Decider v1.1 pada 70,6 dan JEV-27B-VL pada 69,6, dengan baris perbandingan yang sekali lagi diambil dari data board alih-alih dijalankan oleh para penulis.

Angka throughput ini adalah untuk permintaan tunggal, GPU tunggal, dan dinyatakan demikian: d3 menjawab permintaan teks dalam median 55 ms, permintaan yang membawa gambar dalam 273 ms, dan permintaan yang membawa video berdurasi sepuluh detik dalam 553 ms, pada satu AMD Instinct MI325X. d3-edge melakukan hal yang sama dalam 6,7 ms, 41,9 ms, dan 308,3 ms. Itu adalah median per pertanyaan pada model yang dirancang untuk dipanggil berkali-kali di dalam satu alur kerja, yang merupakan angka yang penting bagi arsitektur yang menjadi tujuan model-model ini dibangun — dua puluh keputusan berurutan dengan tambahan 100 ms per keputusan memakan waktu dua detik, sebagaimana Microsoft menyampaikan poin yang sama tentang model keputusannya sendiri bulan ini.

Apa yang tidak dikatakan oleh repositori

Ada tiga celah yang layak disebutkan sebelum siapa pun membuat rencana berdasarkan hal ini.

Yang pertama adalah anggaran input. decision_config.json untuk kumpulan model terbesar menetapkan max_length ke null, dan tidak ada kartu yang menyatakan batas token untuk status ditambah pertanyaan ditambah deskripsi opsi. Kartu Decision 1.0 menerbitkan anggaran eksplisit — 1.024 token untuk cabang encoder, 16.384 untuk cabang decoder — dan angka-angka itu merupakan kendala perencanaan yang nyata. Ketiadaannya di sini mencolok, dan itu adalah hal paling berguna yang dapat ditambahkan oleh commit lanjutan.

Yang kedua adalah kalibrasi. Angka terpenting sebuah model keputusan bukanlah akurasi, melainkan apakah nilai 0,9 yang dikembalikan berarti sembilan dari sepuluh kali. Indeks visi dan teks tidak mengatakan apa pun tentang itu. Tidak ada skor Brier, tidak ada angka expected-calibration-error, dan tidak ada temperature dalam keenam kartu tersebut. InternLM menerbitkan keduanya untuk model keputusannya sendiri pada bulan September; vLLM-SR belum, untuk anggota mana pun dari keluarga ini.

Yang ketiga adalah independensi. Model Decision 2.0 telah digunakan dari luar selama dua minggu; milik Decision 3.0 baru beberapa jam. Jumlah unduhan pada 11 Oktober — 130 untuk d3, 83 untuk d3-lite, 82 untuk d3-nano — adalah jejak sebuah unggahan, bukan adopsi. Anggap setiap angka indeks di atas sebagai hipotesis dengan repositori yang melekat.

Di mana ini berada dalam stack yang bisa Anda panggil hari ini

Pertanyaan praktis tentang model keputusan adalah apakah model itu dapat langsung masuk ke pipeline yang sudah ada, dan di sini ekosistemnya lebih maju daripada model-modelnya. Format permintaan System One yang digunakan model-model ini bukan milik eksklusif vLLM-SR: format itu adalah kontrak state-dan-pertanyaan-bernama yang sama dengan yang dipakai untuk memanggil model Jev yang dihosting, itulah sebabnya "Jev" muncul baik sebagai nama indeks di kartu model d3 maupun sebagai baris di papan peringkatnya.

OrcaRouter membawa sisi keluarga itu. typesafe/jev-1.13 ada di katalog kami dan dilayani melalui POST /v1/systemone — kontrak yang sama, dengan $0.042 per juta token input tanpa biaya completion karena memang tidak ada completion, hingga sekitar 64K token input, teks masuk dan JSON terstruktur keluar, non-streaming. Inilah jenis model yang dipanggil lapisan keputusan saat ini. Ada dua hal yang tidak kami klaim: d3 dan sisa Decision 3.0 tidak ada di katalog kami, dan jalur inferensi lokal Decision 3.0 adalah sebuah kelas Python di repositori Hugging Face, bukan endpoint yang bisa kami rutekan bahkan jika kami ingin. Yang benar-benar Anda dapatkan dari router di sini ada di sisi lain dari loop — model generatif yang bertindak atas suatu keputusan, dirutekan melalui satu kunci ke lebih dari 200 model dengan failover otomatis saat penyedia bermasalah, sehingga menambahkan langkah penilaian di depan alur kerja tidak berarti juga menambah hubungan vendor kedua.

Apa yang akan mengubah gambaran ini?

Empat hal, dalam urutan kasar berdasarkan seberapa banyak informasi yang dapat diberikannya. Postingan blog dari proyek tersebut yang menyebutkan anggaran input dan bentuk deployment yang dimaksudkan, yang akan mengonfirmasi bahwa ini adalah rilis, bukan sekadar push. Skor Brier atau angka ECE pada salah satu checkpoint. Pihak ketiga yang menjalankan suite publik pada bobot yang dirilis, bukan hanya membaca indeksnya. Dan sebuah runtime — repositori semantic-router menerima dua commit pada 11 Oktober yang menghubungkan d3 dan d3-edge ke runtime modelnya, termasuk input video, yang menunjukkan bahwa strategi serving sedang dibangun sekarang dan akan menjadi hal yang membuat model-model ini murah untuk dicoba.

Setidaknya sampai yang pertama dari hal-hal itu hadir, ringkasan jujurnya adalah ini: ada keluarga model keputusan yang lengkap, berlisensi Apache-2.0, benar-benar multimodal, berada di Hugging Face dari 0.6B hingga 27B, diterbitkan dengan provenans yang luar biasa baik — hash berkas, revisi dasar yang dipatok, target perangkat keras yang dinyatakan — dan dengan sangat sedikit dokumentasi pendukung yang memungkinkan Anda memutuskan apakah akan menggunakannya. Mengunduhnya tidak memakan biaya. Mempercayai indeks tersebut sebaiknya ditunda.

A generated six-row scoreboard titled 'Decision 3.0 - the scoreboard', listing the family from largest to smallest with each checkpoint's parameter count and its vLLM-SR-reported Jev Decision Index 0.3 public-suite figure: d3 26.09B and 65.5, d3-flash 8.39B and 57.79, d3-mini 4.54B and 54.90, d3-nano 2.21B and 42.22, d3-lite 0.85B and 36.93, d3-edge 0.59B and 28.82, with a footer reading 'All figures are vLLM-SR's own; nothing here is independently reproduced.'

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari