
Decision 3.0 đã có trên Hugging Face: Sáu mô hình quyết định đa phương thức mở, chỉ được công bố trên X
- OrcaMỚIOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 trên 1 triệu token · 71 tok/s
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
Decision 3.0 tồn tại ở dạng bạn có thể tải xuống ngay bây giờ, và gần như không ai đã ghi lại điều đó. Sáu checkpoint — d3, d3-flash, d3-mini, d3-nano, d3-lite và d3-edge — đã xuất hiện trong tổ chức vllm-sr trên Hugging Face vào ngày 10 tháng 10 năm 2026, mới nhất xếp trước, bắt đầu từ 09:38 UTC và kết thúc bằng d3-edge lúc 23:49 UTC. Chúng theo giấy phép Apache-2.0, được xây dựng trên nền tảng Qwen3.5 và Qwen3.8, chúng trả lời các câu hỏi lựa chọn, có/không và cho điểm bằng xác suất cho từng phương án thay vì sinh ra một token, và năm trong số sáu mô hình hiện đã đọc được hình ảnh và video. Mỗi thẻ mô hình tự mô tả mình là "mô hình quyết định nền tảng đa phương thức 27B của Decision 3.0, các mô hình quyết định của vLLM Semantic Router," tức lớp quyết định mở của dự án vLLM.
Điều còn thiếu là thông báo ra mắt. Tài khoản X của dự án vLLM đã chúc mừng nhóm vLLM-SR về bản phát hành ngày 11 tháng 10, dẫn lại chính chuỗi giới thiệu của người bảo trì — đó là toàn bộ hồ sơ công khai. Mục lục blog của dự án vẫn dừng ở ngày 10 tháng 10 với một bài về các mô hình quyết định định tuyến, chứ không phải về những cái này. Trang phát hành GitHub của vllm-project/semantic-router vẫn chỉ dừng ở v0.4.0 từ ngày 27 tháng 9. Trọng số đã phát hành; còn ghi chú ra mắt thì chưa.
Sự phân biệt đó quan trọng đối với cách bạn đọc mọi thứ dưới đây. Mọi số liệu hiệu năng trong bài viết này đều đến từ chính các model card của vLLM-SR, được đo bằng harness của chính họ trên phần cứng của chính họ. Không có nội dung nào ở đây được một bên bên ngoài tái lập, và bảng xếp hạng mà họ công bố là bảng do chính họ duy trì. Đây là một đánh giá sớm và trung thực về một sản phẩm có thật cùng một tuyên bố chưa được kiểm toán.
Thực sự thì có gì trên Hugging Face?
Sáu kho lưu trữ đều đơn giản, hoàn chỉnh và nhất quán với nhau. Mỗi kho đều chứa trọng số safetensors, một mẫu chat, một decision_config.json để ghim bản sửa đổi của mô hình cơ sở, mã mô hình hóa tùy chỉnh (modeling_d3.py, d3_engine.py, d3_server.py), một đầu đọc nằm trong tệp riêng readout.safetensors, và một MODEL_MANIFEST.json kèm SHA-256 cho mỗi tệp. Kho lưu trữ thứ bảy, trang bộ sưu tập, liệt kê cả sáu.
Gia đình, theo thứ tự kích thước giảm dần:
• d3 — 26,09 tỷ tham số, bao gồm một bộ mã hóa thị giác 0,46 tỷ, được xây dựng trên Qwen/Qwen3.8-27B. Được tải lên ngày 10 tháng 10, 09:38 UTC.
• d3-flash — 8,39B bao gồm bộ mã hóa thị giác 0,46B, được xây dựng trên Qwen/Qwen3.5-9B.
• d3-mini — 4,54B bao gồm một bộ mã hóa thị giác 0,33B, được xây dựng trên Qwen/Qwen3.5-4B.
• d3-nano — 2,21B bao gồm một bộ mã hóa thị giác 0,33B, được xây dựng trên Qwen/Qwen3.5-2B.
• d3-lite — 0,85B bao gồm một bộ mã hóa thị giác 0,10B, được xây dựng trên Qwen/Qwen3.5-0.8B.
• d3-edge — 0,59 tỷ, bao gồm một bộ mã hóa thị giác 0,10 tỷ, cũng được xây dựng trên Qwen/Qwen3.5-0.8B. Được tải lên sau cùng, 23:49 UTC.
Tất cả sáu đều mang cùng một hợp đồng yêu cầu: một trạng thái (văn bản hoặc JSON, tùy chọn kèm hình ảnh và video) cùng một từ điển các câu hỏi được đặt tên, và một phản hồi gồm các phân phối xác suất có kiểu. Có ba loại câu hỏi — Lựa chọn, Noul (có/không), Điểm — và mô hình trả lời tất cả chúng trong một lần gọi bằng cách chạy một lượt truyền xuôi cho mỗi câu hỏi trên cùng một đầu vào, không có vòng lặp giải mã nào ở bất kỳ đâu.

Những con số, và chúng thuộc về ai
vLLM-SR công bố một bảng xếp hạng mà nó gọi là Jev Decision Index 0.3.1 và đặt d3 ở vị trí đầu bảng. Các dòng tiêu đề, tất cả đều do nhà cung cấp báo cáo:
• d3 — Chỉ số 64,7; bộ kiểm thử công khai 65,5; bài kiểm tra cùng kỹ năng 62,8; tác vụ miền mới 56,6.
• Perplexity Decider v1.1 (27B) — 62,8, 62,3, 61,1, 55,6.
• Fastino GLiDE không suy nghĩ (28B) — 60,2, 59,1, 59,5, 52,9.
• Jev — 60,1; 58,0; 58,0; 55,0.
• Torchcast Decision 27B — 59,9, 65,1, 58,1, 50,8.
• Decision 2.0 (27B), thế hệ trước — 55.9, 57.0, 55.7, 47.9.
Một chú thích trên thẻ của d3 ghi rõ rằng hàng của chính d3 là một đánh giá nội bộ, trong khi các hàng so sánh là dữ liệu bảng trực tiếp được đọc vào ngày 10 tháng 10. Đó là thông tin công bố đúng đắn và đáng đọc lại hai lần: các con số của đối thủ được lấy từ một bảng, còn con số của đối tượng được tạo ra bởi chính nhóm đã xây dựng mô hình. Thẻ cũng tuyên bố rằng tất cả 140.178 yêu cầu công khai đều đã được trả lời, không có yêu cầu nào không được hỗ trợ — một tuyên bố về độ bao phủ, không phải tuyên bố về độ chính xác, và là một tuyên bố hiếm thấy được công bố.

Các checkpoint nhỏ hơn tự nhận là đang bước đều nhau. Mỗi thẻ đưa ra một chỉ số trên bộ đánh giá công khai và mức chênh lệch so với kích thước tương đương trong Decision 2.0: d3-flash 57.79, tăng 11.0 so với 9B trước đó; d3-mini 54.90, tăng 10.7; d3-nano 42.22, tăng 12.2; d3-lite 36.93, tăng 16.4; d3-edge 28.82, tăng 12.1. Mức tăng tương đối lớn nhất nằm ở đáy của dải, đúng như bạn sẽ kỳ vọng nếu công thức tiền huấn luyện đa phương thức đang phát huy tác dụng nhiều hơn đối với các mô hình nhỏ so với các mô hình lớn — và cũng là kết quả mà bạn sẽ tạo ra nếu tinh chỉnh các mô hình nhỏ kỹ lưỡng nhất. Không có cách nào để biết là trường hợp nào nếu chỉ nhìn từ bên ngoài.
Phần đa phương thức mới là thay đổi thực sự.
Các mô hình của Decision 2.0 đọc văn bản. Decision 3.0 đọc văn bản, hình ảnh và video, và đó chính là khác biệt thực chất giữa các thế hệ — không phải sự thay đổi chỉ số. Mỗi thẻ liệt kê đầu vào hình ảnh dưới dạng PNG, JPEG hoặc WebP, được cung cấp dưới dạng đường dẫn, URL, ảnh PIL hoặc URL dữ liệu base64, với nhiều ảnh mỗi yêu cầu, mỗi ảnh tối đa 1,6 megapixel; và video dưới dạng MP4, WebM, MOV hoặc MKV, hoặc dưới dạng mảng khung hình, được đọc ở tốc độ 2 khung hình mỗi giây với tối đa 32 khung hình trải khắp toàn bộ clip và mỗi khung hình tối đa 0,2 megapixel. Mỗi câu hỏi trong một yêu cầu đều thấy mọi hình ảnh và mọi video được đính kèm với yêu cầu đó.
Bằng chứng hỗ trợ cho video là kết quả Perception Test trên toàn bộ 19.140 câu hỏi xác thực: d3 đạt 77,4, d3-flash 73,3, d3-mini 70,3, d3-nano 63,5, d3-lite 59,3, d3-edge 46,6, so với mức sàn ngẫu nhiên được ghi nhận là 33,3 ở các câu hỏi ba lựa chọn. vLLM-SR gọi đây là một đánh giá nội bộ. d3 cũng có một bảng xếp hạng thị giác đặt nó ở mức 71,6 tổng thể, xếp trên Perplexity Decider v1.1 ở 70,6 và JEV-27B-VL ở 69,6, với các hàng so sánh lại một lần nữa được lấy từ dữ liệu bảng xếp hạng thay vì do các tác giả chạy.
Các số liệu thông lượng là cho một yêu cầu đơn, một GPU đơn, và được nêu rõ như vậy: d3 trả lời một yêu cầu văn bản trong trung vị 55 ms, một yêu cầu mang hình ảnh trong 273 ms, và một yêu cầu mang video mười giây trong 553 ms, trên một AMD Instinct MI325X. d3-edge làm điều tương tự trong 6.7 ms, 41.9 ms và 308.3 ms. Đó là các trung vị trên mỗi câu hỏi trên một mô hình được thiết kế để được gọi nhiều lần trong một quy trình làm việc, và đó là con số quan trọng đối với kiến trúc mà những mô hình này được xây dựng cho — hai mươi quyết định tuần tự với thêm 100 ms mỗi lần tốn hai giây, như Microsoft đã nêu cùng quan điểm về mô hình quyết định của chính họ trong tháng này.
Những gì các kho lưu trữ không làm
Có ba khoảng trống đáng để nêu tên trước khi bất cứ ai lập kế hoạch dựa trên điều này.
Đầu tiên là ngân sách đầu vào. decision_config.jsoncho các bộ mô hình lớn nhấtmax_lengthvà không có thẻ nào nêu mức trần token cho trạng thái cộng với câu hỏi cộng với phần mô tả lựa chọn. Các thẻ của Decision 1.0 đã công bố ngân sách rõ ràng — 1.024 token cho nhánh encoder, 16.384 cho nhánh decoder — và những con số đó là một ràng buộc lập kế hoạch thực sự. Việc chúng vắng mặt ở đây rất đáng chú ý, và đó là điều hữu ích nhất mà một commit tiếp theo có thể bổ sung.
Điều thứ hai là hiệu chỉnh. Con số quan trọng nhất của một mô hình ra quyết định không phải là độ chính xác, mà là liệu một giá trị 0.9 được trả về có nghĩa là chín trên mười lần hay không. Các chỉ số thị giác và văn bản không nói gì về điều đó. Không có điểm Brier, không có con số lỗi hiệu chỉnh kỳ vọng nào, và không có nhiệt độ trong bất kỳ thẻ nào trong sáu thẻ. InternLM đã công bố cả hai chỉ số đó trên mô hình ra quyết định của riêng mình vào tháng 9; vLLM-SR thì chưa, đối với bất kỳ thành viên nào của dòng này.
Điểm thứ ba là tính độc lập. Các mô hình của Decision 2.0 đã có hai tuần được sử dụng bên ngoài; còn các mô hình của Decision 3.0 mới chỉ có vài giờ. Số lượt tải xuống ngày 11 tháng 10 — 130 cho d3, 83 cho d3-lite, 82 cho d3-nano — là dấu vết của một lần tải lên, không phải của việc được đón nhận. Hãy coi mọi chỉ số ở trên là một giả thuyết gắn với một kho lưu trữ.
Vị trí của thứ này trong một stack mà bạn có thể gọi ngay hôm nay
Câu hỏi thực tế về một mô hình ra quyết định là liệu nó có thể được đưa thẳng vào một pipeline đã tồn tại hay không, và ở đây hệ sinh thái đã tiến xa hơn so với chính các mô hình. Định dạng yêu cầu System One mà các mô hình này sử dụng không phải là độc quyền của vLLM-SR: nó chính là cùng một hợp đồng trạng thái-và-câu-hỏi-được-đặt-tên mà các mô hình Jev được lưu trữ được gọi bằng, đó là lý do "Jev" xuất hiện cả với tư cách là tên của chỉ mục trong model card của d3 và như một dòng trên bảng xếp hạng của nó.
OrcaRouter đảm nhận phía đó của gia đình. typesafe/jev-1.13 có trong danh mục của chúng tôi và được phục vụ qua POST /v1/systemone — cùng một hợp đồng, ở mức $0,042 cho mỗi triệu token đầu vào, không tính phí hoàn tất vì không có phần hoàn tất, tối đa khoảng 64K token đầu vào, đầu vào là văn bản và đầu ra là JSON có cấu trúc, không streaming. Đó là kiểu mô hình mà một lớp ra quyết định gọi đến ngày nay. Hai điều chúng tôi không tuyên bố: d3 và phần còn lại của Decision 3.0 không có trong danh mục của chúng tôi, và đường suy luận cục bộ của Decision 3.0 là một lớp Python trong kho Hugging Face, không phải một điểm cuối mà chúng tôi có thể định tuyến dù có muốn. Điều mà một bộ định tuyến thực sự mang lại cho bạn ở đây nằm ở phía bên kia của vòng lặp — mô hình sinh vốn hành động dựa trên một quyết định, được định tuyến qua một khóa trên hơn 200 mô hình với khả năng chuyển đổi dự phòng tự động khi một nhà cung cấp gặp trục trặc, để việc thêm một bước tính điểm trước một quy trình làm việc không đồng nghĩa với việc thêm một mối quan hệ nhà cung cấp thứ hai.
Điều gì sẽ thay đổi bức tranh này
Bốn điều, theo thứ tự đại khái về mức độ chúng sẽ cho bạn biết. Một bài đăng blog từ dự án nêu ngân sách đầu vào và hình dạng triển khai dự kiến, điều này sẽ xác nhận đây là một bản phát hành chứ không phải chỉ một lần đẩy lên. Điểm Brier hoặc một con số ECE trên bất kỳ checkpoint nào. Một bên thứ ba chạy bộ kiểm thử công khai trên các trọng số đã phát hành thay vì chỉ đọc chỉ mục. Và một runtime — kho semantic-router đã hợp nhất hai commit vào ngày 11 tháng 10 để kết nối d3 và d3-edge vào runtime mô hình của nó, bao gồm cả đầu vào video, điều này gợi ý rằng câu chuyện phục vụ đang được xây dựng ngay lúc này và sẽ là thứ khiến việc thử những mô hình này trở nên rẻ.
Cho đến khi ít nhất điều đầu tiên trong số đó thành hiện thực, thì tóm tắt trung thực là thế này: có một họ mô hình quyết định đa phương thức thực sự, hoàn chỉnh, theo Apache-2.0, đang nằm trên Hugging Face từ 0.6B đến 27B, được công bố với nguồn gốc tốt một cách bất thường — mã băm tệp, các bản sửa đổi cơ sở được ghim, một mục tiêu phần cứng được nêu rõ — và với quá ít tài liệu xung quanh, ít một cách bất thường, thứ lẽ ra sẽ giúp bạn quyết định có nên dùng nó hay không. Tải nó xuống chẳng tốn gì. Còn tin vào chỉ mục thì nên chờ đã.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
