การ์ดชื่อเรื่องที่สร้างขึ้นสำหรับ Decision 3.0 คำบรรยายย่อย 'โมเดลการตัดสินใจแบบมัลติโมดัลแบบเปิดหกโมเดล ขนาด 0.6B ถึง 27B' พร้อมชิปที่ระบุข้อความ 'น้ำหนัก Apache-2.0' 'รูปภาพและวิดีโอ' 'ยังไม่มีโพสต์เปิดตัว' และส่วนท้ายที่ระบุข้อความ 'ตัวเลขทั้งหมดในบทความนี้เป็นของ vLLM-SR เอง ไม่มีสิ่งใดในที่นี้ที่ถูกทำซ้ำอย่างเป็นอิสระ' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Engineering & Research

Decision 3.0 อยู่บน Hugging Face แล้ว: โมเดลการตัดสินใจแบบมัลติโมดัลโอเพน 6 ตัว ประกาศเฉพาะบน X

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Decision 3.0 มีอยู่ในรูปแบบที่คุณดาวน์โหลดได้ทันที และแทบไม่มีใครเคยบันทึกเรื่องนี้ไว้เลย มีเช็กพอยต์หกรายการ — d3, d3-flash, d3-mini, d3-nano, d3-lite และ d3-edge — เปิดตัวในvllm-sr ออร์แกไนเซชันบน Hugging Face เมื่อวันที่ 10 ตุลาคม 2026 โดยเรียงจากใหม่สุดก่อน เริ่มเวลา 09:38 UTC และสิ้นสุดที่ d3-edge เมื่อ 23:49 UTC ทั้งหมดใช้สัญญาอนุญาต Apache-2.0 สร้างบนโครงหลัก Qwen3.5 และ Qwen3.8 ตอบคำถามแบบเลือกตอบ ใช่/ไม่ใช่ และให้คะแนน ด้วยความน่าจะเป็นต่อตัวเลือกแทนการสร้างโทเคน และปัจจุบันห้าในหกรุ่นอ่านภาพและวิดีโอได้แล้ว การ์ดโมเดลทุกใบบรรยายตัวเองว่า "โมเดลพื้นฐานการตัดสินใจแบบมัลติโมดัลขนาด 27B ของ Decision 3.0 โมเดลการตัดสินใจของ vLLM Semantic Router" ซึ่งเป็นเลเยอร์การตัดสินใจแบบเปิดของโปรเจกต์ vLLM

สิ่งที่ขาดหายไปคือประกาศอย่างเป็นทางการ บัญชี X ของโปรเจกต์ vLLM ได้แสดงความยินดีกับทีม vLLM-SR เนื่องในโอกาสเปิดตัวเมื่อวันที่ 11 ตุลาคม โดยอ้างอิงเธรดแนะนำตัวของผู้ดูแลเอง — นั่นคือบันทึกสาธารณะทั้งหมด ดัชนีบล็อกของโปรเจกต์ยังคงสิ้นสุดที่วันที่ 10 ตุลาคม ด้วยโพสต์เกี่ยวกับโมเดลการตัดสินใจด้านการกำหนดเส้นทาง ไม่ใช่เกี่ยวกับโมเดลเหล่านี้ หน้า GitHub releases สำหรับ vllm-project/semantic-routerยังสูงสุดที่ v0.4.0 จากวันที่ 27 กันยายน เวทถูกปล่อยออกแล้ว แต่บันทึกการเปิดตัวยังไม่ถูกปล่อย

ความแตกต่างนั้นสำคัญต่อวิธีที่คุณอ่านทุกสิ่งด้านล่างนี้ ตัวเลขประสิทธิภาพทุกตัวในบทความนี้มาจากการ์ดโมเดลของ vLLM-SR เอง ซึ่งวัดด้วยชุดทดสอบของพวกเขาเองบนฮาร์ดแวร์ของพวกเขาเอง ไม่มีสิ่งใดที่นี่ได้รับการทำซ้ำโดยบุคคลภายนอก และบอร์ดที่พวกเขาเผยแพร่ก็เป็นบอร์ดที่พวกเขาดูแลเอง นี่คือการตีความเบื้องต้นอย่างตรงไปตรงมาต่อผลงานที่เกิดขึ้นจริง และคำกล่าวอ้างที่ยังไม่ผ่านการตรวจสอบ

จริง ๆ แล้วบน Hugging Face มีอะไรบ้าง

รีโพซิทอรีทั้งหกนั้นเรียบง่าย ครบถ้วน และสอดคล้องกัน แต่ละรีโพซิทอรีมีค่าน้ำหนัก safetensors เทมเพลตแชท และ decision_config.json ที่ตรึงรีวิชันของโมเดลฐาน โค้ดการสร้างโมเดลแบบกำหนดเอง (modeling_d3.py, d3_engine.py, d3_server.py), หัวอ่านของตัวเองใน readout.safetensors และ MODEL_MANIFEST.json พร้อม SHA-256 ต่อไฟล์ รีโพซิทอรีที่เจ็ด ซึ่งเป็นหน้าคอลเลกชัน แสดงรายการทั้งหก

ตระกูลนี้ เรียงตามลำดับที่ขนาดไล่ลงมา:

• d3 — พารามิเตอร์ 26.09B รวมเอนโคดเดอร์วิชัน 0.46B สร้างขึ้นบน Qwen/Qwen3.8-27B อัปโหลดเมื่อ 10 ตุลาคม 09:38 UTC

• d3-flash — 8.39B รวมตัวเข้ารหัสภาพขนาด 0.46B สร้างขึ้นบนพื้นฐานของ Qwen/Qwen3.5-9B.

•d3-mini — 4.54B รวมตัวเข้ารหัสภาพขนาด 0.33B สร้างขึ้นบนพื้นฐานของ Qwen/Qwen.5-4B.

• d3-nano — 2.21B รวมตัวเข้ารหัสภาพขนาด 0.33B สร้างขึ้นบนพื้นฐานของ Qwen/Qwen3.5-2B

• d3-lite — 0.85B ซึ่งรวมตัวเข้ารหัสภาพขนาด 0.10B สร้างขึ้นบน Qwen/Qwen3.5-0.8B

• d3-edge — 0.59B รวมตัวเข้ารหัสภาพขนาด 0.10B และสร้างขึ้นบน Qwen/Qwen3.5-0.8Bอัปโหลดเป็นรายการสุดท้ายเมื่อ 23:49 UTC

ทั้งหกมีสัญญาการร้องขอเดียวกัน: สถานะ (ข้อความหรือ JSON อาจมีรูปภาพและวิดีโอ) บวกกับพจนานุกรมของคำถามที่ตั้งชื่อไว้ และการตอบกลับเป็นการแจกแจงความน่าจะเป็นแบบมีชนิด มีคำถามสามประเภท — Choice, Noul (ใช่/ไม่ใช่), Score — และโมเดลตอบทั้งหมดในครั้งเดียวโดยการรัน forward pass หนึ่งครั้งต่อคำถามบนอินพุตเดียวกัน โดยไม่มีลูปการถอดรหัสที่ใดเลย

A screenshot of the vLLM-SR collection page on Hugging Face, headed Decision 3.0 with the subtitle 'Towards Open Multimodal Foundation Decision Models' and marked as updated about 15 hours ago with 25 upvotes. It lists six repositories, each tagged Zero-Shot Classification: vllm-sr/d3 at 26B with 130 downloads and 18 likes, vllm-sr/d3-flash at 8B with 69 downloads, vllm-sr/d3-mini at 5B with 62, vllm-sr/d3-nano at 2B with 82, vllm-sr/d3-lite at 0.9B with 83, and vllm-sr/d3-edge at 0.6B with 33. The left sidebar lists the organisation's other collections: Vela 2.0, Decision 2.0, Decision 1.0, Vela 1.0, MoM 1.0 and MoM Nano.

ตัวเลข และของใคร

vLLM-SR เผยแพร่กระดานจัดอันดับที่เรียกว่า Jev Decision Index 0.3.1 และจัดให้ d3 อยู่บนสุดของกระดานนั้น แถวพาดหัวซึ่งเป็นข้อมูลที่ผู้ขายรายงานเองทั้งหมด:

• d3 — ดัชนี 64.7, ชุดทดสอบสาธารณะ 65.5, การทดสอบทักษะเดียวกัน 62.8, งานในโดเมนใหม่ 56.6

• Perplexity Decider v1.1 (27B) — 62.8, 62.3, 61.1, 55.6

• Fastino GLiDE no-thinking (28B) — 60.2, 59.1, 59.5, 52.9

• Jev — 60.1, 58.0, 58.0, 55.0.

• Torchcast Decision 27B — 59.9, 65.1, 58.1, 50.8.

• Decision 2.0 (27B) ซึ่งเป็นรุ่นก่อนหน้า — 55.9, 57.0, 55.7, 47.9

เชิงอรรถบนการ์ดของ d3 ระบุอย่างชัดเจนว่าแถวของ d3 เองเป็นการประเมินภายใน ขณะที่แถวเปรียบเทียบเป็นข้อมูลจากกระดานคะแนนสดที่อ่านเมื่อวันที่ 10 ตุลาคม นั่นคือการเปิดเผยที่ถูกต้องและคุ้มค่าที่จะอ่านสองครั้ง: ตัวเลขของคู่แข่งถูกดึงมาจากกระดานคะแนน และตัวเลขของสิ่งที่ถูกประเมินนั้นผลิตโดยทีมที่สร้างโมเดลขึ้นมา การ์ดยังอ้างด้วยว่าคำขอสาธารณะทั้งหมด 140,178 รายการได้รับคำตอบ โดยไม่มีรายการใดที่ไม่ได้รับการสนับสนุน — เป็นการอ้างเรื่องความครอบคลุม ไม่ใช่การอ้างความแม่นยำ และเป็นเรื่องผิดปกติที่จะเผยแพร่

A screenshot of the vllm-sr/d3 model card on Hugging Face. The header shows 18 likes, the vLLM Semantic Router organisation, and tags for Transformers, Safetensors, qwen3_5, feature-extraction, decision-model, classification, system-one, multimodal, vision, video, custom_code and an Apache-2.0 licence, with the model size listed as 26B parameters in BF16. The card graphic reads 'Decision 3.0 / d3 27B'. A specification panel gives Parameters as 26.09B including the 0.46B vision encoder, Inputs as 'Text or JSON, plus images and videos (several per request)', Decision types as 'Choice - Yes / No - Score' and License as Apache-2.0. The Highlights section states a Jev Decision Index 0.3 public suite score of 65.45 measured with the official 0.3 kit on the released weights, all 140,178 public requests answered and none unsupported, and +8.5 on the public suite over Decision 2.0. The sidebar shows 130 downloads last month, a model tree pinned to Qwen/Qwen3.8-27B, and two Spaces using the model.

เช็กพอยต์ขนาดเล็กกว่ารายงานว่าตนเองก้าวไปพร้อมเพรียงกัน แต่ละการ์ดให้ตัวเลขจากชุดทดสอบสาธารณะและค่าเดลต้าเมื่อเทียบกับขนาดที่เทียบเท่าใน Decision 2.0: d3-flash 57.79 เพิ่มขึ้น 11.0 จาก 9B ก่อนหน้า; d3-mini 54.90 เพิ่มขึ้น 10.7; d3-nano 42.22 เพิ่มขึ้น 12.2; d3-lite 36.93 เพิ่มขึ้น 16.4; d3-edge 28.82 เพิ่มขึ้น 12.1 ผลตอบแทนสัมพัทธ์สูงที่สุดที่ช่วงล่างของช่วงขนาด ซึ่งเป็นสิ่งที่คุณคาดหวังได้หากสูตรการพรีเทรนแบบมัลติโมดัลทำงานกับโมเดลเล็กมากกว่าโมเดลใหญ่ — และยังเป็นสิ่งที่คุณจะได้จากการปรับจูนโมเดลเล็กให้หนักที่สุดด้วย ไม่มีทางบอกได้จากภายนอกว่าเป็นเพราะสาเหตุใด

ส่วนมัลติโหมดคือการเปลี่ยนแปลงที่แท้จริง

โมเดลของ Decision 2.0 อ่านข้อความ ส่วนของ Decision 3.0 อ่านข้อความ รูปภาพ และวิดีโอ และนั่นคือความแตกต่างที่มีนัยสำคัญระหว่างรุ่นเหล่านี้ ไม่ใช่การขยับดัชนี การ์ดแต่ละใบระบุอินพุตรูปภาพเป็น PNG, JPEG หรือ WebP โดยส่งมาเป็นพาธ, URL, อิมเมจ PIL หรือ data URL แบบ base64 โดยมีได้หลายรายการต่อคำขอ สูงสุด 1.6 เมกะพิกเซลต่อรายการ และวิดีโอเป็น MP4, WebM, MOV หรือ MKV หรือเป็นอาร์เรย์ของเฟรม อ่านที่ 2 เฟรมต่อวินาที โดยมีเฟรมได้ไม่เกิน 32 เฟรมกระจายทั่วทั้งคลิป และแต่ละเฟรมสูงสุด 0.2 เมกะพิกเซล ทุกคำถามในคำขอจะเห็นรูปภาพทุกภาพและวิดีโอทุกวิดีโอที่แนบมากับคำขอนั้น

หลักฐานสนับสนุนสำหรับวิดีโอคือผลลัพธ์ Perception Test บนคำถาม validation ทั้งหมด 19,140 ข้อ: d3 ที่ 77.4, d3-flash 73.3, d3-mini 70.3, d3-nano 63.5, d3-lite 59.3, d3-edge 46.6 เทียบกับค่าพื้นโอกาสเดาสุ่มที่บันทึกไว้ที่ 33.3 สำหรับคำถามแบบสามตัวเลือก vLLM-SR ระบุว่านี่เป็นการประเมินภายใน d3 ยังมีบอร์ดวิสัยทัศน์ที่จัดให้อยู่ที่ 71.6 โดยรวม นำหน้า Perplexity Decider v1.1 ที่ 70.6 และ JEV-27B-VL ที่ 69.6 โดยแถวเปรียบเทียบนั้นดึงมาจากข้อมูลบอร์ดอีกครั้ง แทนที่จะรันโดยผู้เขียนเอง

ตัวเลขปริมาณงานเป็นแบบคำขอเดียว, GPU เดียว และระบุไว้เช่นนั้น: d3 ตอบคำขอข้อความด้วยเวลามัธยฐาน 55 มิลลิวินาที คำขอที่มีรูปภาพใน 273 มิลลิวินาที และคำขอที่มีวิดีโอความยาวสิบวินาทีใน 553 มิลลิวินาที บน AMD Instinct MI325X หนึ่งตัว d3-edge ทำได้เช่นเดียวกันใน 6.7 มิลลิวินาที, 41.9 มิลลิวินาที และ 308.3 มิลลิวินาที ค่าเหล่านี้เป็นค่ามัธยฐานต่อคำถามบนโมเดลที่ออกแบบมาให้ถูกเรียกใช้หลายครั้งภายในเวิร์กโฟลว์เดียว ซึ่งเป็นตัวเลขที่สำคัญสำหรับสถาปัตยกรรมที่โมเดลเหล่านี้ถูกสร้างขึ้นมา — การตัดสินใจตามลำดับยี่สิบครั้งโดยมีค่าใช้จ่ายเพิ่ม 100 มิลลิวินาทีต่อครั้ง คิดเป็นสองวินาที เช่นเดียวกับที่ Microsoft ได้ให้ประเด็นเดียวกันเกี่ยวกับโมเดลการตัดสินใจของบริษัทเองในเดือนนี้

สิ่งที่รีโพซิทอรีไม่ได้บอก

มีช่องว่างสามข้อที่ควรเอ่ยถึงก่อนที่ใครจะวางแผนโดยอิงกับเรื่องนี้

อย่างแรกคืองบประมาณอินพุต decision_config.json สำหรับชุดโมเดลที่ใหญ่ที่สุด max_lengthเป็น null และไม่มีการ์ดใดระบุเพดานโทเคนสำหรับสถานะบวกคำถามบวกคำอธิบายตัวเลือก การ์ดของ Decision 1.0 เผยแพร่งบประมาณที่ชัดเจน — 1,024 โทเคนสำหรับสาขาเอนโคเดอร์ และ 16,384 สำหรับสาขาดีโคเดอร์ — และตัวเลขเหล่านั้นเป็นข้อจำกัดในการวางแผนที่แท้จริง การที่ไม่มีสิ่งเหล่านี้ที่นี่จึงเป็นเรื่องที่สังเกตได้ชัดเจน และมันเป็นสิ่งที่มีประโยชน์ที่สุดเพียงอย่างเดียวที่คอมมิตตามหลังจะเพิ่มได้

ข้อที่สองคือการสอบเทียบ (calibration) ตัวเลขที่สำคัญที่สุดของโมเดลตัดสินใจไม่ใช่ความแม่นยำ แต่คือการที่เมื่อมันคืนค่า 0.9 แล้วหมายถึงเก้าครั้งจากสิบหรือไม่ ดัชนีด้านภาพและข้อความไม่ได้บอกอะไรเกี่ยวกับเรื่องนั้น ไม่มี Brier score ไม่มีตัวเลข expected calibration error และไม่มี temperature ในทั้งหกการ์ดใด ๆ InternLM เผยแพร่ทั้งสองอย่างสำหรับโมเดลตัดสินใจของตัวเองในเดือนกันยายน ส่วน vLLM-SR ยังไม่ได้เผยแพร่ สำหรับสมาชิกใด ๆ ในตระกูลนี้

ประการที่สามคือความเป็นอิสระ โมเดลของ Decision 2.0 มีการใช้งานจากภายนอกมาสองสัปดาห์ ส่วนของ Decision 3.0 ยังไม่มี ยอดดาวน์โหลดเมื่อวันที่ 11 ตุลาคม — 300 สำหรับ d3, 83 สำหรับ d3-lite, 82 สำหรับ d3-nano — เป็นร่องรอยของการอัปโหลด ไม่ใช่ของการนำไปใช้ ให้ถือว่าตัวเลขดัชนีทุกตัวข้างต้นเป็นสมมติฐานที่มีรีโพซิทอรีแนบมาด้วย

ตำแหน่งที่สิ่งนี้อยู่ภายในสแต็กที่คุณเรียกใช้ได้วันนี้

คำถามเชิงปฏิบัติเกี่ยวกับโมเดลการตัดสินใจคือว่ามันสามารถเสียบเข้าไปในไปป์ไลน์ที่มีอยู่แล้วได้หรือไม่ และในที่นี้ ระบบนิเวศก้าวหน้าไปไกลกว่าโมเดลเสียอีก รูปแบบคำขอ System One ที่โมเดลเหล่านี้ใช้ไม่ได้เป็นกรรมสิทธิ์เฉพาะของ vLLM-SR: มันเป็นสัญญาแบบ state-and-named-questions เดียวกันกับที่โมเดล Jev ที่โฮสต์ไว้ถูกเรียกใช้ด้วย ซึ่งเป็นเหตุผลว่าทำไม "Jev" จึงปรากฏทั้งในฐานะชื่อของดัชนีในโมเดลการ์ดของ d3 และในฐานะแถวบนลีดเดอร์บอร์ดของมัน

OrcaRouter ดูแลฝั่งนั้นของตระกูลนี้ typesafe/jev-1.13อยู่ในแคตตาล็อกของเรา และให้บริการผ่านPOST /v1/systemone — สัญญาเดียวกัน ที่0.042 ดอลลาร์ต่อโทเค็นอินพุตหนึ่งล้านโทเค็น โดยไม่มีค่าคอมพลีชันเพราะไม่มีคอมพลีชัน รองรับอินพุตได้ถึงประมาณ 64K โทเค็น รับข้อความเข้าและส่งออกเป็น JSON ที่มีโครงสร้าง ไม่สตรีม เป็นโมเดลแบบที่เลเยอร์ตัดสินใจเรียกใช้กันในปัจจุบัน มีสองสิ่งที่เราไม่กล่าวอ้าง: d3 และส่วนที่เหลือของ Decision 3.0 ไม่ได้อยู่ในแคตตาล็อกของเรา และเส้นทางการอนุมานภายในเครื่องของ Decision 3.0 เป็นคลาส Python ในที่เก็บ Hugging Face ไม่ใช่ปลายทางที่เราเราเตอร์ไปได้แม้อยากจะทำก็ตาม สิ่งที่เราเตอร์ให้คุณได้จริงในจุดนี้อยู่ที่อีกฝั่งของลูป — โมเดลภาษาเชิงสร้างที่ลงมือทำตามการตัดสินใจ จัดเส้นทางผ่านคีย์เดียวครอบคลุมกว่า 200 โมเดล พร้อมการสลับไปใช้ตัวสำรองอัตโนมัติเมื่อผู้ให้บริการสะดุด ดังนั้นการเพิ่มขั้นตอนการให้คะแนนไว้ข้างหน้าเวิร์กโฟลว์จึงไม่ได้หมายความว่าต้องเพิ่มความสัมพันธ์กับผู้ขายอีกรายหนึ่งด้วย

อะไรจะเปลี่ยนแปลงภาพนี้

สี่สิ่ง เรียงตามคร่าว ๆ ว่าสิ่งเหล่านี้จะบอกคุณได้มากแค่ไหน โพสต์บล็อกจากโปรเจกต์ที่ระบุงบประมาณอินพุตและรูปแบบการดีพลอยที่ตั้งใจไว้ ซึ่งจะยืนยันว่านี่เป็นการเปิดตัว (release) มากกว่าการ push คะแนน Brier หรือค่าตัวเลข ECE บนเช็กพอยต์ใด ๆ หนึ่งรายการ บุคคลที่สามที่รันชุดทดสอบสาธารณะบนเวตที่เปิดตัวแล้ว แทนที่จะอ่านดัชนี และรันไทม์ — รีโป semantic-router มีสองคอมมิตที่ถูก merge เข้าเมื่อวันที่ 11 ตุลาคม ซึ่งเชื่อม d3 และ d3-edge เข้ากับโมเดลรันไทม์ของมัน รวมถึงอินพุตวิดีโอ ซึ่งบ่งชี้ว่าแนวทางการให้บริการกำลังถูกสร้างขึ้นตอนนี้ และจะเป็นสิ่งที่ทำให้โมเดลเหล่านี้ลองได้ในราคาถูก

จนกว่าอย่างน้อยสิ่งแรกในนั้นจะเกิดขึ้น สรุปตามตรงก็คือ: มีตระกูลโมเดลการตัดสินใจแบบหลายรูปแบบอย่างแท้จริงที่สมบูรณ์ ภายใต้สัญญาอนุญาต Apache-2.0 ตั้งอยู่บน Hugging Face ตั้งแต่ 0.6B ถึง 27B เผยแพร่พร้อมแหล่งที่มาที่ดีเป็นพิเศษ — แฮชไฟล์, เวอร์ชันฐานที่ปักหมุดไว้, เป้าหมายฮาร์ดแวร์ที่ระบุไว้ — และมีเอกสารประกอบโดยรอบน้อยเป็นพิเศษที่จะให้คุณตัดสินใจว่าจะใช้มันหรือไม่ การดาวน์โหลดไม่มีค่าใช้จ่าย การเชื่อในดัชนีนั้นควรรอก่อน

A generated six-row scoreboard titled 'Decision 3.0 - the scoreboard', listing the family from largest to smallest with each checkpoint's parameter count and its vLLM-SR-reported Jev Decision Index 0.3 public-suite figure: d3 26.09B and 65.5, d3-flash 8.39B and 57.79, d3-mini 4.54B and 54.90, d3-nano 2.21B and 42.22, d3-lite 0.85B and 36.93, d3-edge 0.59B and 28.82, with a footer reading 'All figures are vLLM-SR's own; nothing here is independently reproduced.'

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube