
Decision 3.0 อยู่บน Hugging Face แล้ว: โมเดลการตัดสินใจแบบมัลติโมดัลโอเพน 6 ตัว ประกาศเฉพาะบน X
- Orcaใหม่Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 71 tok/s
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
Decision 3.0 มีอยู่ในรูปแบบที่คุณดาวน์โหลดได้ทันที และแทบไม่มีใครเคยบันทึกเรื่องนี้ไว้เลย มีเช็กพอยต์หกรายการ — d3, d3-flash, d3-mini, d3-nano, d3-lite และ d3-edge — เปิดตัวในvllm-sr ออร์แกไนเซชันบน Hugging Face เมื่อวันที่ 10 ตุลาคม 2026 โดยเรียงจากใหม่สุดก่อน เริ่มเวลา 09:38 UTC และสิ้นสุดที่ d3-edge เมื่อ 23:49 UTC ทั้งหมดใช้สัญญาอนุญาต Apache-2.0 สร้างบนโครงหลัก Qwen3.5 และ Qwen3.8 ตอบคำถามแบบเลือกตอบ ใช่/ไม่ใช่ และให้คะแนน ด้วยความน่าจะเป็นต่อตัวเลือกแทนการสร้างโทเคน และปัจจุบันห้าในหกรุ่นอ่านภาพและวิดีโอได้แล้ว การ์ดโมเดลทุกใบบรรยายตัวเองว่า "โมเดลพื้นฐานการตัดสินใจแบบมัลติโมดัลขนาด 27B ของ Decision 3.0 โมเดลการตัดสินใจของ vLLM Semantic Router" ซึ่งเป็นเลเยอร์การตัดสินใจแบบเปิดของโปรเจกต์ vLLM
สิ่งที่ขาดหายไปคือประกาศอย่างเป็นทางการ บัญชี X ของโปรเจกต์ vLLM ได้แสดงความยินดีกับทีม vLLM-SR เนื่องในโอกาสเปิดตัวเมื่อวันที่ 11 ตุลาคม โดยอ้างอิงเธรดแนะนำตัวของผู้ดูแลเอง — นั่นคือบันทึกสาธารณะทั้งหมด ดัชนีบล็อกของโปรเจกต์ยังคงสิ้นสุดที่วันที่ 10 ตุลาคม ด้วยโพสต์เกี่ยวกับโมเดลการตัดสินใจด้านการกำหนดเส้นทาง ไม่ใช่เกี่ยวกับโมเดลเหล่านี้ หน้า GitHub releases สำหรับ vllm-project/semantic-routerยังสูงสุดที่ v0.4.0 จากวันที่ 27 กันยายน เวทถูกปล่อยออกแล้ว แต่บันทึกการเปิดตัวยังไม่ถูกปล่อย
ความแตกต่างนั้นสำคัญต่อวิธีที่คุณอ่านทุกสิ่งด้านล่างนี้ ตัวเลขประสิทธิภาพทุกตัวในบทความนี้มาจากการ์ดโมเดลของ vLLM-SR เอง ซึ่งวัดด้วยชุดทดสอบของพวกเขาเองบนฮาร์ดแวร์ของพวกเขาเอง ไม่มีสิ่งใดที่นี่ได้รับการทำซ้ำโดยบุคคลภายนอก และบอร์ดที่พวกเขาเผยแพร่ก็เป็นบอร์ดที่พวกเขาดูแลเอง นี่คือการตีความเบื้องต้นอย่างตรงไปตรงมาต่อผลงานที่เกิดขึ้นจริง และคำกล่าวอ้างที่ยังไม่ผ่านการตรวจสอบ
จริง ๆ แล้วบน Hugging Face มีอะไรบ้าง
รีโพซิทอรีทั้งหกนั้นเรียบง่าย ครบถ้วน และสอดคล้องกัน แต่ละรีโพซิทอรีมีค่าน้ำหนัก safetensors เทมเพลตแชท และ decision_config.json ที่ตรึงรีวิชันของโมเดลฐาน โค้ดการสร้างโมเดลแบบกำหนดเอง (modeling_d3.py, d3_engine.py, d3_server.py), หัวอ่านของตัวเองใน readout.safetensors และ MODEL_MANIFEST.json พร้อม SHA-256 ต่อไฟล์ รีโพซิทอรีที่เจ็ด ซึ่งเป็นหน้าคอลเลกชัน แสดงรายการทั้งหก
ตระกูลนี้ เรียงตามลำดับที่ขนาดไล่ลงมา:
• d3 — พารามิเตอร์ 26.09B รวมเอนโคดเดอร์วิชัน 0.46B สร้างขึ้นบน Qwen/Qwen3.8-27B อัปโหลดเมื่อ 10 ตุลาคม 09:38 UTC
• d3-flash — 8.39B รวมตัวเข้ารหัสภาพขนาด 0.46B สร้างขึ้นบนพื้นฐานของ Qwen/Qwen3.5-9B.
•d3-mini — 4.54B รวมตัวเข้ารหัสภาพขนาด 0.33B สร้างขึ้นบนพื้นฐานของ Qwen/Qwen.5-4B.
• d3-nano — 2.21B รวมตัวเข้ารหัสภาพขนาด 0.33B สร้างขึ้นบนพื้นฐานของ Qwen/Qwen3.5-2B
• d3-lite — 0.85B ซึ่งรวมตัวเข้ารหัสภาพขนาด 0.10B สร้างขึ้นบน Qwen/Qwen3.5-0.8B
• d3-edge — 0.59B รวมตัวเข้ารหัสภาพขนาด 0.10B และสร้างขึ้นบน Qwen/Qwen3.5-0.8Bอัปโหลดเป็นรายการสุดท้ายเมื่อ 23:49 UTC
ทั้งหกมีสัญญาการร้องขอเดียวกัน: สถานะ (ข้อความหรือ JSON อาจมีรูปภาพและวิดีโอ) บวกกับพจนานุกรมของคำถามที่ตั้งชื่อไว้ และการตอบกลับเป็นการแจกแจงความน่าจะเป็นแบบมีชนิด มีคำถามสามประเภท — Choice, Noul (ใช่/ไม่ใช่), Score — และโมเดลตอบทั้งหมดในครั้งเดียวโดยการรัน forward pass หนึ่งครั้งต่อคำถามบนอินพุตเดียวกัน โดยไม่มีลูปการถอดรหัสที่ใดเลย

ตัวเลข และของใคร
vLLM-SR เผยแพร่กระดานจัดอันดับที่เรียกว่า Jev Decision Index 0.3.1 และจัดให้ d3 อยู่บนสุดของกระดานนั้น แถวพาดหัวซึ่งเป็นข้อมูลที่ผู้ขายรายงานเองทั้งหมด:
• d3 — ดัชนี 64.7, ชุดทดสอบสาธารณะ 65.5, การทดสอบทักษะเดียวกัน 62.8, งานในโดเมนใหม่ 56.6
• Perplexity Decider v1.1 (27B) — 62.8, 62.3, 61.1, 55.6
• Fastino GLiDE no-thinking (28B) — 60.2, 59.1, 59.5, 52.9
• Jev — 60.1, 58.0, 58.0, 55.0.
• Torchcast Decision 27B — 59.9, 65.1, 58.1, 50.8.
• Decision 2.0 (27B) ซึ่งเป็นรุ่นก่อนหน้า — 55.9, 57.0, 55.7, 47.9
เชิงอรรถบนการ์ดของ d3 ระบุอย่างชัดเจนว่าแถวของ d3 เองเป็นการประเมินภายใน ขณะที่แถวเปรียบเทียบเป็นข้อมูลจากกระดานคะแนนสดที่อ่านเมื่อวันที่ 10 ตุลาคม นั่นคือการเปิดเผยที่ถูกต้องและคุ้มค่าที่จะอ่านสองครั้ง: ตัวเลขของคู่แข่งถูกดึงมาจากกระดานคะแนน และตัวเลขของสิ่งที่ถูกประเมินนั้นผลิตโดยทีมที่สร้างโมเดลขึ้นมา การ์ดยังอ้างด้วยว่าคำขอสาธารณะทั้งหมด 140,178 รายการได้รับคำตอบ โดยไม่มีรายการใดที่ไม่ได้รับการสนับสนุน — เป็นการอ้างเรื่องความครอบคลุม ไม่ใช่การอ้างความแม่นยำ และเป็นเรื่องผิดปกติที่จะเผยแพร่

เช็กพอยต์ขนาดเล็กกว่ารายงานว่าตนเองก้าวไปพร้อมเพรียงกัน แต่ละการ์ดให้ตัวเลขจากชุดทดสอบสาธารณะและค่าเดลต้าเมื่อเทียบกับขนาดที่เทียบเท่าใน Decision 2.0: d3-flash 57.79 เพิ่มขึ้น 11.0 จาก 9B ก่อนหน้า; d3-mini 54.90 เพิ่มขึ้น 10.7; d3-nano 42.22 เพิ่มขึ้น 12.2; d3-lite 36.93 เพิ่มขึ้น 16.4; d3-edge 28.82 เพิ่มขึ้น 12.1 ผลตอบแทนสัมพัทธ์สูงที่สุดที่ช่วงล่างของช่วงขนาด ซึ่งเป็นสิ่งที่คุณคาดหวังได้หากสูตรการพรีเทรนแบบมัลติโมดัลทำงานกับโมเดลเล็กมากกว่าโมเดลใหญ่ — และยังเป็นสิ่งที่คุณจะได้จากการปรับจูนโมเดลเล็กให้หนักที่สุดด้วย ไม่มีทางบอกได้จากภายนอกว่าเป็นเพราะสาเหตุใด
ส่วนมัลติโหมดคือการเปลี่ยนแปลงที่แท้จริง
โมเดลของ Decision 2.0 อ่านข้อความ ส่วนของ Decision 3.0 อ่านข้อความ รูปภาพ และวิดีโอ และนั่นคือความแตกต่างที่มีนัยสำคัญระหว่างรุ่นเหล่านี้ ไม่ใช่การขยับดัชนี การ์ดแต่ละใบระบุอินพุตรูปภาพเป็น PNG, JPEG หรือ WebP โดยส่งมาเป็นพาธ, URL, อิมเมจ PIL หรือ data URL แบบ base64 โดยมีได้หลายรายการต่อคำขอ สูงสุด 1.6 เมกะพิกเซลต่อรายการ และวิดีโอเป็น MP4, WebM, MOV หรือ MKV หรือเป็นอาร์เรย์ของเฟรม อ่านที่ 2 เฟรมต่อวินาที โดยมีเฟรมได้ไม่เกิน 32 เฟรมกระจายทั่วทั้งคลิป และแต่ละเฟรมสูงสุด 0.2 เมกะพิกเซล ทุกคำถามในคำขอจะเห็นรูปภาพทุกภาพและวิดีโอทุกวิดีโอที่แนบมากับคำขอนั้น
หลักฐานสนับสนุนสำหรับวิดีโอคือผลลัพธ์ Perception Test บนคำถาม validation ทั้งหมด 19,140 ข้อ: d3 ที่ 77.4, d3-flash 73.3, d3-mini 70.3, d3-nano 63.5, d3-lite 59.3, d3-edge 46.6 เทียบกับค่าพื้นโอกาสเดาสุ่มที่บันทึกไว้ที่ 33.3 สำหรับคำถามแบบสามตัวเลือก vLLM-SR ระบุว่านี่เป็นการประเมินภายใน d3 ยังมีบอร์ดวิสัยทัศน์ที่จัดให้อยู่ที่ 71.6 โดยรวม นำหน้า Perplexity Decider v1.1 ที่ 70.6 และ JEV-27B-VL ที่ 69.6 โดยแถวเปรียบเทียบนั้นดึงมาจากข้อมูลบอร์ดอีกครั้ง แทนที่จะรันโดยผู้เขียนเอง
ตัวเลขปริมาณงานเป็นแบบคำขอเดียว, GPU เดียว และระบุไว้เช่นนั้น: d3 ตอบคำขอข้อความด้วยเวลามัธยฐาน 55 มิลลิวินาที คำขอที่มีรูปภาพใน 273 มิลลิวินาที และคำขอที่มีวิดีโอความยาวสิบวินาทีใน 553 มิลลิวินาที บน AMD Instinct MI325X หนึ่งตัว d3-edge ทำได้เช่นเดียวกันใน 6.7 มิลลิวินาที, 41.9 มิลลิวินาที และ 308.3 มิลลิวินาที ค่าเหล่านี้เป็นค่ามัธยฐานต่อคำถามบนโมเดลที่ออกแบบมาให้ถูกเรียกใช้หลายครั้งภายในเวิร์กโฟลว์เดียว ซึ่งเป็นตัวเลขที่สำคัญสำหรับสถาปัตยกรรมที่โมเดลเหล่านี้ถูกสร้างขึ้นมา — การตัดสินใจตามลำดับยี่สิบครั้งโดยมีค่าใช้จ่ายเพิ่ม 100 มิลลิวินาทีต่อครั้ง คิดเป็นสองวินาที เช่นเดียวกับที่ Microsoft ได้ให้ประเด็นเดียวกันเกี่ยวกับโมเดลการตัดสินใจของบริษัทเองในเดือนนี้
สิ่งที่รีโพซิทอรีไม่ได้บอก
มีช่องว่างสามข้อที่ควรเอ่ยถึงก่อนที่ใครจะวางแผนโดยอิงกับเรื่องนี้
อย่างแรกคืองบประมาณอินพุต decision_config.json สำหรับชุดโมเดลที่ใหญ่ที่สุด max_lengthเป็น null และไม่มีการ์ดใดระบุเพดานโทเคนสำหรับสถานะบวกคำถามบวกคำอธิบายตัวเลือก การ์ดของ Decision 1.0 เผยแพร่งบประมาณที่ชัดเจน — 1,024 โทเคนสำหรับสาขาเอนโคเดอร์ และ 16,384 สำหรับสาขาดีโคเดอร์ — และตัวเลขเหล่านั้นเป็นข้อจำกัดในการวางแผนที่แท้จริง การที่ไม่มีสิ่งเหล่านี้ที่นี่จึงเป็นเรื่องที่สังเกตได้ชัดเจน และมันเป็นสิ่งที่มีประโยชน์ที่สุดเพียงอย่างเดียวที่คอมมิตตามหลังจะเพิ่มได้
ข้อที่สองคือการสอบเทียบ (calibration) ตัวเลขที่สำคัญที่สุดของโมเดลตัดสินใจไม่ใช่ความแม่นยำ แต่คือการที่เมื่อมันคืนค่า 0.9 แล้วหมายถึงเก้าครั้งจากสิบหรือไม่ ดัชนีด้านภาพและข้อความไม่ได้บอกอะไรเกี่ยวกับเรื่องนั้น ไม่มี Brier score ไม่มีตัวเลข expected calibration error และไม่มี temperature ในทั้งหกการ์ดใด ๆ InternLM เผยแพร่ทั้งสองอย่างสำหรับโมเดลตัดสินใจของตัวเองในเดือนกันยายน ส่วน vLLM-SR ยังไม่ได้เผยแพร่ สำหรับสมาชิกใด ๆ ในตระกูลนี้
ประการที่สามคือความเป็นอิสระ โมเดลของ Decision 2.0 มีการใช้งานจากภายนอกมาสองสัปดาห์ ส่วนของ Decision 3.0 ยังไม่มี ยอดดาวน์โหลดเมื่อวันที่ 11 ตุลาคม — 300 สำหรับ d3, 83 สำหรับ d3-lite, 82 สำหรับ d3-nano — เป็นร่องรอยของการอัปโหลด ไม่ใช่ของการนำไปใช้ ให้ถือว่าตัวเลขดัชนีทุกตัวข้างต้นเป็นสมมติฐานที่มีรีโพซิทอรีแนบมาด้วย
ตำแหน่งที่สิ่งนี้อยู่ภายในสแต็กที่คุณเรียกใช้ได้วันนี้
คำถามเชิงปฏิบัติเกี่ยวกับโมเดลการตัดสินใจคือว่ามันสามารถเสียบเข้าไปในไปป์ไลน์ที่มีอยู่แล้วได้หรือไม่ และในที่นี้ ระบบนิเวศก้าวหน้าไปไกลกว่าโมเดลเสียอีก รูปแบบคำขอ System One ที่โมเดลเหล่านี้ใช้ไม่ได้เป็นกรรมสิทธิ์เฉพาะของ vLLM-SR: มันเป็นสัญญาแบบ state-and-named-questions เดียวกันกับที่โมเดล Jev ที่โฮสต์ไว้ถูกเรียกใช้ด้วย ซึ่งเป็นเหตุผลว่าทำไม "Jev" จึงปรากฏทั้งในฐานะชื่อของดัชนีในโมเดลการ์ดของ d3 และในฐานะแถวบนลีดเดอร์บอร์ดของมัน
OrcaRouter ดูแลฝั่งนั้นของตระกูลนี้ typesafe/jev-1.13อยู่ในแคตตาล็อกของเรา และให้บริการผ่านPOST /v1/systemone — สัญญาเดียวกัน ที่0.042 ดอลลาร์ต่อโทเค็นอินพุตหนึ่งล้านโทเค็น โดยไม่มีค่าคอมพลีชันเพราะไม่มีคอมพลีชัน รองรับอินพุตได้ถึงประมาณ 64K โทเค็น รับข้อความเข้าและส่งออกเป็น JSON ที่มีโครงสร้าง ไม่สตรีม เป็นโมเดลแบบที่เลเยอร์ตัดสินใจเรียกใช้กันในปัจจุบัน มีสองสิ่งที่เราไม่กล่าวอ้าง: d3 และส่วนที่เหลือของ Decision 3.0 ไม่ได้อยู่ในแคตตาล็อกของเรา และเส้นทางการอนุมานภายในเครื่องของ Decision 3.0 เป็นคลาส Python ในที่เก็บ Hugging Face ไม่ใช่ปลายทางที่เราเราเตอร์ไปได้แม้อยากจะทำก็ตาม สิ่งที่เราเตอร์ให้คุณได้จริงในจุดนี้อยู่ที่อีกฝั่งของลูป — โมเดลภาษาเชิงสร้างที่ลงมือทำตามการตัดสินใจ จัดเส้นทางผ่านคีย์เดียวครอบคลุมกว่า 200 โมเดล พร้อมการสลับไปใช้ตัวสำรองอัตโนมัติเมื่อผู้ให้บริการสะดุด ดังนั้นการเพิ่มขั้นตอนการให้คะแนนไว้ข้างหน้าเวิร์กโฟลว์จึงไม่ได้หมายความว่าต้องเพิ่มความสัมพันธ์กับผู้ขายอีกรายหนึ่งด้วย
อะไรจะเปลี่ยนแปลงภาพนี้
สี่สิ่ง เรียงตามคร่าว ๆ ว่าสิ่งเหล่านี้จะบอกคุณได้มากแค่ไหน โพสต์บล็อกจากโปรเจกต์ที่ระบุงบประมาณอินพุตและรูปแบบการดีพลอยที่ตั้งใจไว้ ซึ่งจะยืนยันว่านี่เป็นการเปิดตัว (release) มากกว่าการ push คะแนน Brier หรือค่าตัวเลข ECE บนเช็กพอยต์ใด ๆ หนึ่งรายการ บุคคลที่สามที่รันชุดทดสอบสาธารณะบนเวตที่เปิดตัวแล้ว แทนที่จะอ่านดัชนี และรันไทม์ — รีโป semantic-router มีสองคอมมิตที่ถูก merge เข้าเมื่อวันที่ 11 ตุลาคม ซึ่งเชื่อม d3 และ d3-edge เข้ากับโมเดลรันไทม์ของมัน รวมถึงอินพุตวิดีโอ ซึ่งบ่งชี้ว่าแนวทางการให้บริการกำลังถูกสร้างขึ้นตอนนี้ และจะเป็นสิ่งที่ทำให้โมเดลเหล่านี้ลองได้ในราคาถูก
จนกว่าอย่างน้อยสิ่งแรกในนั้นจะเกิดขึ้น สรุปตามตรงก็คือ: มีตระกูลโมเดลการตัดสินใจแบบหลายรูปแบบอย่างแท้จริงที่สมบูรณ์ ภายใต้สัญญาอนุญาต Apache-2.0 ตั้งอยู่บน Hugging Face ตั้งแต่ 0.6B ถึง 27B เผยแพร่พร้อมแหล่งที่มาที่ดีเป็นพิเศษ — แฮชไฟล์, เวอร์ชันฐานที่ปักหมุดไว้, เป้าหมายฮาร์ดแวร์ที่ระบุไว้ — และมีเอกสารประกอบโดยรอบน้อยเป็นพิเศษที่จะให้คุณตัดสินใจว่าจะใช้มันหรือไม่ การดาวน์โหลดไม่มีค่าใช้จ่าย การเชื่อในดัชนีนั้นควรรอก่อน

การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
