Thẻ tiêu đề được tạo cho Decision 3.0 và Microsoft-Decision-1, với phụ đề 'cùng xương sống Qwen3.5-9B, hai cách mua trái ngược nhau', cùng các chip ghi 'trọng số Apache-2.0 so với chỉ bản hosted', 'hình ảnh và video so với chỉ văn bản', 'công bố ngày 10 tháng 10 so với GA ngày 8 tháng 10', và dòng chân trang ghi 'số liệu của Decision 3.0 là của chính vLLM-SR; số liệu của Microsoft-Decision-1 là của chính Microsoft; không bên nào được tái lập độc lập.' Logo OrcaRouter được ghép vào góc dưới bên phải.
Engineering & Research

Decision 3.0 so với Microsoft-Decision-1: Một cái là bản tải xuống, cái kia là SKU

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Phân khúc 9B của Decision 3.0 và Microsoft-Decision-1 xét trên giấy tờ là cùng một sản phẩm. Cả hai đều hậu huấn luyện Qwen3.5-9B thành một bộ chấm điểm trả lời một tập hợp cố định các đáp án ứng viên bằng một xác suất đã hiệu chỉnh cho mỗi đáp án, mà không bao giờ sinh ra token nào. Cả hai đều nhắm đến cùng những công việc — định tuyến một yêu cầu, chấm điểm một đầu ra theo một bảng tiêu chí, gác cổng một hành động của tác nhân, phân loại ưu tiên một hàng đợi. Cả hai ra mắt chỉ cách nhau trong vòng một tuần: Microsoft-Decision-1 được phát hành chính thức trên Microsoft Foundry vào ngày 8 tháng 10 năm 2026 và được công bố vào ngày hôm sau, và d3-flash đã được đẩy lên Hugging Face lúc 17:23 UTC ngày 10 tháng 10 năm 2026.

Sự khác biệt không nằm ở mô hình. Mà ở việc bạn được phép làm gì với nó. d3-flash là một checkpoint Apache-2.0 8,39 tỷ tham số mà bạn tải về và chạy, đứng thứ ba trong một dòng mô hình bắt đầu từ 0,59 tỷ và đạt mức cao nhất 26,09 tỷ. Microsoft-Decision-1 là một endpoint được lưu trữ trên Foundry, với các trọng số hoàn toàn không được phân phối, nằm trong một dòng mà Microsoft nói rằng sau này sẽ chuyển nền tảng sang các mô hình MAI của riêng mình. Một trong hai là một tạo tác; cái còn lại là một dịch vụ. Gần như mọi câu hỏi thực tế về cặp này đều suy ra từ sự thật duy nhất đó, kể cả những câu hỏi trông như thể chúng nói về các bài benchmark.

Hai quyết định về mục đích của một mô hình quyết định

Bài đăng của Microsoft nói rõ về phạm vi theo cách mà các model card hiếm khi làm. Các dạng câu hỏi được hỗ trợ là có/không, trắc nghiệm, cho điểm, phân loại và chấm điểm dựa trên rubric. Các trường hợp loại trừ cũng được liệt kê rõ ràng không kém: không được thiết kế để tạo văn bản, trả lời câu hỏi mở, hội thoại, dịch thuật hay tóm tắt, và không nhằm dùng cho các tác vụ đòi hỏi kiến thức không có trong đầu vào. Nó chạy một lượt qua tối đa 32.768 token và phát ra 0 token đầu ra vì không có vòng lặp giải mã. Microsoft cũng hỗ trợ một tùy chọn không trả lời, chẳng hạn như "không thể xác định", khi bằng chứng được cung cấp là không đủ; đây chính là chi tiết khiến việc đặt ngưỡng trên đầu ra trở nên có ý nghĩa.

d3-flash nằm trong cùng một khung khái niệm — các câu hỏi Choice, Noul (có/không) và Score, một lượt lan truyền xuôi cho mỗi câu hỏi, một xác suất cho mỗi lựa chọn, không sinh — rồi sau đó mở rộng phía đầu vào. Trong khi Microsoft-Decision-1 chỉ dùng văn bản theo thiết kế, d3-flash chấp nhận văn bản hoặc JSON, nhiều hình ảnh mỗi yêu cầu với tối đa 1,6 megapixel mỗi ảnh, và nhiều video được đọc ở 2 khung hình mỗi giây. Mỗi câu hỏi trong một yêu cầu đều thấy mọi hình ảnh và video được đính kèm với nó. Đây là một mô hình nhỏ hơn nhưng làm được nhiều hơn với đầu vào mà nó được cung cấp.

Đó là sự chia tách thực sự đầu tiên, và nó không phải là vấn đề thị hiếu. Nếu quyết định bạn cần đưa ra liên quan đến ảnh chụp màn hình, hóa đơn, biểu đồ hay một đoạn clip từ camera, thì Microsoft-Decision-1 không thể đưa ra quyết định đó. Đó là ranh giới về năng lực, không phải khoảng cách về chất lượng, và không lượng công việc cải thiện độ chính xác nào có thể khép lại nó.

Mỗi cái xuất bản những gì, và bằng cách nào

Ở đây, hai bản phát hành đang thực hiện những dạng bằng chứng thực sự khác biệt, và đáng để tách chúng ra thay vì so sánh các con số với nhau.

Microsoft đã chạy một so sánh 36 bài kiểm chuẩn trải rộng gần 150.000 câu hỏi được giữ kín khỏi quá trình huấn luyện, bao gồm định tuyến, xếp hạng, ngữ cảnh dài, đa ngôn ngữ và các tác vụ ngoài phân phối, suy luận và an toàn, và tuyên bố mô hình của mình đứng đầu trên các bộ đó. Công ty báo cáo độ trễ dưới dạng tỷ lệ thay vì một con số — p50 nhanh hơn khoảng 35 lần so với GPT-6 Sol, và nhanh hơn 2,5 lần so với H2O-Lightning-4B v1.1, mô hình mà họ gọi là á quân. Họ ghi lại độ bền vững như một quy trình: cùng một yêu cầu bị nhiễu theo tám cách, tỷ lệ đảo quyết định trung bình 1,3%, và không có lần đảo nào khi mô tả lựa chọn được diễn đạt lại hoặc các lựa chọn bị đảo ngược hay xáo trộn. Họ kiểm tra an toàn trên 5.250 yêu cầu thuộc 11 bài kiểm chuẩn bao gồm nội dung có hại, phá vỡ rào cản (jailbreaking) và tiêm nhiễm lệnh (prompt injection). Họ nêu rõ tiêu chuẩn hiệu chuẩn mà họ tự đặt ra cho mình — một dự đoán 90% phải đúng khoảng chín trên mười lần trong các trường hợp đại diện.

vLLM-SR đã công bố một chỉ số. Jiffy Index 0.3.1 xếp d3 ở 64,7 với d3-flash đạt 57,79 ở public-suite, mức tăng 11,0 so với 9B của Decision 2.0 ở 46,76. Nó cũng tuyên bố rằng tất cả 140.178 yêu cầu công khai đều được trả lời và không có yêu cầu nào không được hỗ trợ, đây là một tuyên bố về độ bao phủ chứ không phải là tuyên bố về tính đúng đắn. Thẻ tiết lộ rằng hàng của chính d3 là đánh giá nội bộ, trong khi phần so sánh bên cạnh nó — Perplexity Decider v1.1, Fastino GLiN, Torch Decision 27B — là dữ liệu bảng trực tiếp. Và về mặt đa phương thức, các mô hình thuộc dòng d3 báo cáo điểm Perception Test trên toàn bộ 19.140 câu hỏi xác thực, với d3-flash đạt 73,3 so với mức sàn ngẫu nhiên ba lựa chọn là 33,3.

Vậy là: Microsoft công bố một tuyên bố về độ bao phủ với một phương pháp có tài liệu và một con số độ bền vững, còn vLLM-SR công bố một vị trí trên bảng xếp hạng với khoảng trống nguồn gốc được nêu rõ giữa hàng của chính nó và các hàng khác, cùng một kết quả video, và cả hai đều không có con số hiệu chuẩn nào. Không thẻ nào mang điểm Brier hay một con số sai số hiệu chuẩn kỳ vọng cho mô hình mà nó mô tả. Với hai sản phẩm mà toàn bộ đề xuất giá trị của chúng là con số được trả về có ý nghĩa, đó là lỗ hổng chung, và đó là thứ hữu ích nhất mà một trong hai nhà cung cấp có thể tung ra tiếp theo.

A generated two-column scoreboard headed 'Decision 3.0 d3-flash vs Microsoft-Decision-1 - the scoreboard'. The left column for d3-flash reads: base model Qwen3.5-9B fine-tuned, 8.39B parameters; distribution Apache-2.0 weights on Hugging Face from 10 October 2026; input text, images and video; context budget not stated on the card; reported accuracy Jev Decision Index 0.3 public suite 57.79, an internal evaluation; latency median 19.1 ms text, 149.4 ms image and 407.6 ms video. The right column for Microsoft-Decision-1 reads: base model Qwen3.5-9B post-trained, weights not distributed; distribution hosted on Microsoft Foundry, generally available 8 October 2026; input text only; context budget 32,768 tokens; reported accuracy best of 36 benchmarks covering nearly 150,000 blind questions; latency p50 around 35 times faster than GPT-6 Sol. A footer reads 'd3-flash figures are vLLM-SR's own internal evaluation; Microsoft-Decision-1 figures are Microsoft's own; neither is independently reproduced.'

Phân phối quyết định nhiều hơn bảng thông số kỹ thuật

Đây là lúc sự so sánh không còn là về các mô hình nữa.

Với d3-flash bạn nhận được trọng số, một decision_config.json ghim bản sửa đổi cơ sở, một manifest SHA-256 cho từng tệp, mã mô hình hóa tùy chỉnh, một readout head, và một tập phụ thuộc được ghi tài liệu bao gồm transformers==5.17.0 và một gói kernel CUDA tùy chọn cho các lớp linear-attention. Bạn có thể chạy nó trên phần cứng của riêng mình, tinh chỉnh nó, lượng tử hóa nó, cách ly mạng nó. Bạn cũng đang đảm nhận phần công việc vận hành: một lớp Python không phải là một endpoint, và card không nêu ngân sách token cho trạng thái cộng với câu hỏi cộng với mô tả ứng viên — max_length là null trong cấu hình đi kèm, vậy mức trần đó là do bạn tự khám phá.

Với Microsoft-Decision-1, bạn có một endpoint nằm trong tài khoản cloud sẵn có, cùng với cơ chế xác thực, mức sẵn sàng theo khu vực và các kiểm soát cấp phát đi kèm, và bạn không phải làm chút công việc vận hành nào. Đổi lại, bạn cũng chẳng có chút quyền kiểm soát nào. Không có repository để tải về, không có lộ trình fine-tuning, và không có tùy chọn tự host; vòng đời của model do Microsoft nắm giữ, không phải bạn, và một thông báo ngừng hỗ trợ hay một lần rebase sang backbone khác là thay đổi bạn phải chấp nhận chứ không phải thứ bạn chủ động lên lịch. Microsoft đã nói rằng một cuộc rebase sang các model MAI của riêng họ đang đến, đó là lộ trình hợp lý cho một model mà toàn bộ mục đích là chấm điểm nhanh trong một lượt, đồng thời cũng có nghĩa là checkpoint cụ thể mà bạn đã benchmark chưa chắc là thứ bạn sẽ gọi đến sau một năm nữa.

Câu chuyện về độ trễ cũng cần được đọc một cách kỹ lưỡng. Con số tiêu đề của Microsoft là một tỷ lệ so với một mô hình đa dụng lớn hơn nhiều, và đó là phép so sánh đúng cho lập luận của họ — nhiệm vụ của một mô hình quyết định là thay thế một lệnh gọi sinh tốn kém bằng một lệnh gọi chấm điểm rẻ, và con số 35x so với GPT-6 Sol ở p50 chính là hình hài của lập luận đó khi nó thành công. Còn các con số của vLLM-SR là con số tuyệt đối, cho một yêu cầu đơn lẻ và một GPU đơn lẻ, và chúng cho thấy rõ ràng cái "thuế phương thức": trên một chiếc AMD Instinct MI325X, một yêu cầu văn bản gửi tới d3-flash mất trung vị 19,1 ms, cùng yêu cầu đó kèm một hình ảnh mất 149,4 ms, và với một video mười giây là 407,6 ms. Cả hai bộ số liệu đều do nhà cung cấp báo cáo, trên những cấu hình phần cứng khác nhau, và chưa bộ nào được tái lập bên ngoài phòng thí nghiệm đã tạo ra chúng.

A screenshot of the vllm-sr/d3 model card on Hugging Face, the flagship checkpoint of the Decision 3.0 family that d3-flash belongs to. The header shows 18 likes, the vLLM Semantic Router organisation, and tags for Transformers, Safetensors, qwen3_5, feature-extraction, decision-model, classification, system-one, multimodal, vision, video, custom_code and an Apache-2.0 licence, with the model size listed as 26B parameters in BF16. The card graphic reads 'Decision 3.0 / d3 27B'. A specification panel gives Parameters as 26.09B including the 0.46B vision encoder, Inputs as 'Text or JSON, plus images and videos (several per request)', Decision types as 'Choice - Yes / No - Score' and License as Apache-2.0. The sidebar shows 130 downloads last month, the model tree pinned to Qwen/Qwen3.8-27B, and a collection entry listing 6 items.

Cách chọn

Quy tắc quyết định ngắn gọn, một dấu hiệu tốt cho thấy hai sản phẩm thực sự không cạnh tranh cho cùng một vị trí.

Chọn Microsoft-Decision-1 nếu quyết định chỉ liên quan đến văn bản, nếu bạn đã vận hành trên Foundry, và nếu việc đây là một lệnh gọi chứ không phải một triển khai chính là điểm mấu chốt — không phải mua GPU, không phải vận hành container, không phải tự quản lý vòng đời mô hình. Tài liệu hỗ trợ của Microsoft cũng là bộ dễ dùng hơn trong hai bộ đối với một đội nền tảng: các phép nhiễu, số lượng kiểm thử an toàn và tuyên bố rằng có hỗ trợ tùy chọn từ chối trả lời chính là những thứ bạn cần để viết một chính sách ngưỡng, và giới hạn 32.768 token được nêu rõ thay vì để trống.

Hãy chọn Decision 3.0 — thực tế là d3-flash hoặc d3-mini — nếu bất kỳ phần nào của quyết định phụ thuộc vào một hình ảnh hoặc một clip, nếu bạn cần chạy nó ở một nơi mà API được lưu trữ không thể với tới, hoặc nếu bạn muốn tinh chỉnh bộ chấm điểm trên các trường hợp có nhãn của riêng bạn. Giấy phép Apache-2.0 và bảng kê hash cấp tệp khiến đó trở thành một lựa chọn thực sự chứ không chỉ là lý thuyết. Đổi lại, bạn chấp nhận một ngân sách đầu vào không được nêu rõ, không có hiệu chuẩn được công bố, và việc dòng này mới chỉ vài ngày tuổi với hầu như không có mức sử dụng bên ngoài nào đằng sau nó.

Nếu bạn cần cả hai — một bộ chấm điểm chạy trên dịch vụ lưu trữ cho luồng văn bản thông thường và một bộ tự vận hành cho các trường hợp đa phương thức hoặc air-gapped, được gọi qua cùng một giao diện — thì quan điểm trung thực là hiện không có nhà cung cấp nào đáp ứng được điều đó cho bạn, và hai định dạng yêu cầu đủ gần nhau để hợp nhất nhưng không giống hệt nhau.

OrcaRouter nằm ở đâu, và ở đâu thì không

typesafe/jev-1.13 là mô hình quyết định trong danh mục của chúng tôi, được cung cấp qua POST /v1/systemone với cùng hợp đồng trạng thái và câu hỏi được đặt tên mà cả hai mô hình ở trên đều triển khai: văn bản vào, JSON có cấu trúc ra, tối đa khoảng 64K token đầu vào, không streaming, $0.042 cho mỗi triệu token đầu vào, không tính phí completion vì nó không bao giờ tạo ra completion. Đáng chú ý, câu hỏi về ngân sách token kiểu Android mà cả hai thẻ ở trên đều không trả lời đầy đủ lại được trả lời ở đây.

Chúng tôi không cung cấp mô hình nào trong hai mô hình thuộc so sánh này. Các checkpoint của Decision 3.0 được phát hành dưới dạng một đường suy luận cục bộ trong kho lưu trữ Hugging Face chứ không phải một endpoint có thể định tuyến, và Microsoft-Decision-1 được phân phối qua nền tảng của chính Microsoft cùng một số nền tảng bên thứ ba — không phải qua chúng tôi. Không nội dung nào ở đây nên được hiểu là tuyên bố về tính khả dụng đối với bất kỳ mô hình nào trong hai.

Điều mà lớp định tuyến thực sự đáng giá trong quyết định này nằm ở nửa còn lại của vòng lặp. Một bộ chấm điểm vốn rẻ một cách đương nhiên; nhưng mô hình hành động dựa trên kết quả đầu ra của nó thì không, và việc ghép một mô hình ra quyết định với một mô hình sinh thường đồng nghĩa với hai tích hợp, hai mối quan hệ thanh toán và hai kiểu lỗi. Gọi cả hai qua một khóa duy nhất trên hơn 200 mô hình — với tính năng tự động chuyển đổi dự phòng khi một nhà cung cấp gặp trục trặc, và giá niêm yết của nhà cung cấp được chuyển qua với mức chênh lệch 0% để thay đổi giá từ nhà cung cấp có hiệu lực ngay trong cùng ngày — nghĩa là bạn có thể thay bộ chấm điểm mà không cần đụng đến điểm gọi. Điều đó ở đây quan trọng hơn mức thông thường, bởi cả hai mô hình này đều còn quá mới, đến mức quyết định bạn đưa ra tuần này là quyết định mà tháng sau bạn nên có khả năng đảo ngược.

A screenshot of the OrcaRouter models catalogue, headed 'Models - 207 models - 16 providers - one API key, one bill'. Filter tabs read All 207, Text 172, Image 10, Embeddings 5, Video 10 and TTS 10. A panel titled 'How to call any model' lists three steps - copy the model ID from any card, paste it into the model field, POST to our OpenAI-compatible endpoint - beside a code block showing POST https://api.orcarouter.ai/v1/chat/completions. Model cards below include OpenAI: GPT-6.1 Sol and Anthropic: Claude Sonnet 5.5 at $2.00 per million input tokens and $10.00 output, and TypeSafe: Jev 1.13 at 65K context with $0.042 per million input tokens and $0.042 per million output tokens. A credit panel above shows monthly plans from $50 to $1,000.

Câu hỏi sẽ quyết định điều này trong sáu tháng tới

Hai nhóm đã huấn luyện hậu kỳ cùng một checkpoint cơ sở thành cùng một dạng sản phẩm trong cùng một tuần và rút ra những kết luận trái ngược về cách nó nên đến tay khách hàng. Đó không hẳn là sự trùng hợp về thời điểm mà đúng hơn là một ngã rẽ trong cách danh mục này đang được bán: dưới dạng trọng số hay dưới dạng dịch vụ, như một thứ bạn sở hữu hay một thứ bạn gọi.

Hãy theo dõi ba tín hiệu. Liệu việc Microsoft chuyển nền tảng sang MAI hay sang các mô hình của chính mình có làm thay đổi hành vi về độ chính xác và độ trễ mà hãng đang bán hiện nay hay không — và khách hàng được thông báo trước bao lâu. Liệu vLLM-SR có công bố ngân sách đầu vào và một con số hiệu chuẩn cho Decision 3.0 hay không, qua đó thu hẹp khoảng cách khiến chỉ số của nó chưa thể hành động được. Và liệu có ai ngoài cả hai phòng thí nghiệm chạy bộ kiểm thử công khai trên các trọng số d3 đã phát hành hay không, bởi vì hiện tại con số duy nhất có thể phân định dứt khoát phép so sánh này lại chính là con số mà cả hai nhà cung cấp đều chưa đưa ra.