
Microsoft-Decision-1: Mô hình trả lời bằng một con số thay vì một câu
- OrcaMỚIOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 trên 1 triệu token · 79 tok/s
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 355 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
Microsoft-Decision-1 có một dòng trong thẻ mô hình của nó mà chưa từng có mô hình Microsoft nào khác mang: không được thiết kế để tạo văn bản. Mô hình đã chính thức ra mắt trên Microsoft Foundry vào ngày 8 tháng 10 năm 2026, và đó là sự thu hẹp có chủ đích mục đích của một mô hình ngôn ngữ. Bạn đưa cho nó một tình huống và một câu hỏi với danh sách câu trả lời cố định — có/không, một bộ trắc nghiệm, thang đánh giá, một bảng tiêu chí — và nó trả về xác suất đã hiệu chỉnh cho từng lựa chọn. Không có văn xuôi. Không có giải thích. Không có trường lý do. Đầu ra là các con số JSON và không gì khác. Nó được xây dựng trên mô hình trọng số mở Qwen3.5-9B, được Microsoft hậu huấn luyện, và Microsoft cho biết họ sẽ tái nền mô hình trên các backbone khác sau này, nêu tên MAI và các mô hình đối tác khác.
Đó là một sản phẩm kỳ lạ hơn so với vẻ ngoài ban đầu của nó. Vị thế cạnh tranh của Microsoft vào năm 2026 dựa trên các mô hình trò chuyện tiên tiến và trên Copilot, còn Microsoft-Decision-1 thì ngược lại với cả hai: một bộ chấm điểm cỡ trung, đơn mục đích, mà toàn bộ công việc của nó là cho ứng dụng biết lựa chọn nào trong số các lựa chọn của chính bạn có khả năng đúng nhất, và mức độ tự tin của nó. Câu hỏi thú vị không phải là liệu nó có viết tốt hay không — nó dứt khoát viết kém và cũng chẳng cố gắng làm điều đó — mà là liệu một phân phối xác suất trên các lựa chọn có phải là một nguyên thủy hữu ích hơn cho những khối lượng công việc mà doanh nghiệp thực sự vận hành so với một mô hình đa dụng khác có chế độ JSON hay không.
Chính xác thì nó làm gì
Hợp đồng là một cuộc gọi vào, một phân phối ra. Microsoft liệt kê các định dạng câu hỏi được hỗ trợ bao gồm có/không, trắc nghiệm, đánh giá, phân loại và dựa trên rubric. Mỗi lựa chọn đều nhận được một điểm số. Mô hình chạy trong một lần gọi duy nhất trên các đầu vào lên đến 32K token — 32.768 là cửa sổ ngữ cảnh được công bố — và giới hạn thực tế là đầu vào cộng với tập lựa chọn, không phải ngân sách sinh, vì không có sinh.
Các trường hợp sử dụng được công bố là những trường hợp mà một đội ngũ nền tảng sẽ nhận ra ngay lập tức:
• Đánh giá đầu ra AI — chấm điểm một phản hồi được tạo ra theo bộ tiêu chí được cung cấp, hoặc quyết định xem phản hồi đó có căn cứ vào bằng chứng mà nó được cung cấp hay không.
• Phân loại và định tuyến — phân loại một yêu cầu, đánh giá mức độ liên quan, sàng lọc hàng đợi, chọn nhánh quy trình làm việc.
• Agent guardrails — chấm điểm một lệnh gọi công cụ hoặc hành động của agent được đề xuất trước khi ứng dụng tích hợp cho phép thực thi.
• Sàng lọc an toàn nội dung — gắn cờ nội dung dựa trên các ngưỡng do ứng dụng xác định, thay vì chính sách cố định của nhà cung cấp.
• Tìm kiếm và mức độ liên quan của tài liệu — đánh giá liệu một tài liệu được truy xuất có trả lời câu hỏi được cung cấp hay không.
• Tự động hóa dựa trên độ tin cậy — tự động chấp nhận các kết quả có độ tin cậy cao và chuyển phần còn lại cho con người xử lý.
Điểm đáng chú ý nằm ở tùy chọn không đưa ra kết luận. Microsoft hỗ trợ rõ ràng các tùy chọn như "không thể xác định" khi bằng chứng được cung cấp không đủ, và đó chính là khác biệt giữa một bộ chấm điểm đã được hiệu chỉnh với một bộ chỉ đơn thuần là tự tin. Và vì điểm số được trả về dưới dạng số, ngưỡng chuyển cấp là quyết định thuộc về bạn — bạn đặt mức mà 0,7 sẽ gửi thứ gì đó cho một người còn 0,95 thì không.
Những gì nó sẽ không làm
Microsoft đặc biệt rõ ràng về các trường hợp loại trừ, và chúng quan trọng hơn danh sách tính năng đối với bất kỳ ai đang cân nhắc điều này cho một pipeline thực tế. Microsoft-Decision-1 không được thiết kế cho việc tạo văn bản, trả lời câu hỏi mở, hội thoại, dịch thuật hoặc tóm tắt. Nó không nhằm dùng cho các tác vụ không có câu hỏi đóng và một tập lựa chọn câu trả lời xác định, hoặc cho các tác vụ yêu cầu kiến thức không có trong đầu vào. Nó chỉ xử lý văn bản: không có hình ảnh, âm thanh hay video đầu vào, và cũng không có đầu ra. Nó không cung cấp giải thích hay lý do.
Đọc những điều đó cùng nhau, và một ranh giới hiện ra rất dễ bị vượt qua. Đây không phải là một chatbot mà bạn có thể yêu cầu phân loại mọi thứ, và cũng không phải là một công cụ tóm tắt mà bạn có thể gắn thêm điểm số vào. Nó là một hàm tính điểm với một ngân sách token. Cách chính đội ngũ tự định hình — rằng nó không nên là bên tự động duy nhất ra quyết định trong những quyết định hệ trọng về con người, và không nên là cơ sở duy nhất cho các quyết định liên quan đến tín dụng, việc làm, nhà ở, bảo hiểm, giáo dục, chăm sóc sức khỏe, quyền pháp lý “hoặc các lĩnh vực có hệ quả tương tự” — cũng chỉ về cùng một hướng. Nó được thiết kế để đứng bên cạnh một quyết định, chứ không phải để trở thành chính quyết định đó.

Tình hình benchmark là câu chuyện không ai muốn in.
Không có con số nào. Trang danh mục Microsoft Foundry cho Microsoft-Decision-1 có một tab Benchmarks, và tab này không có số liệu nào. Thay vào đó, nó chứa một đoạn phương pháp luận và một tuyên bố định tính: mô hình đã được “đánh giá trên các benchmark quyết định công khai và cộng đồng cũng như trên các tập kiểm thử nội bộ được giữ riêng không dùng để huấn luyện,” Microsoft báo cáo rằng mô hình “hoạt động ngang ngửa với các mô hình quyết định hàng đầu và vượt trội so với các mô hình quyết định mở khác được đánh giá bằng cùng phương pháp luận,” và các chỉ số được sử dụng là độ chính xác, sai số hiệu chuẩn, độ thu hồi an toàn, tỷ lệ dương tính giả và tính nhất quán về công bằng, với thứ tự lựa chọn được thay đổi và áp dụng các kiểm định thống kê theo cặp.

Đó là một bản mô tả phương pháp luận nghiêm túc nhưng đi kèm với không một kết quả nào được công bố. Điều đó có nghĩa là mọi tuyên bố về hiệu năng đối với Microsoft-Decision-1 hiện nay đều do nhà cung cấp tự báo cáo và chưa được tái lập, và lập trường trung thực dành cho bất kỳ ai đang đánh giá nó là: độ hiệu chỉnh — thuộc tính duy nhất khiến một xác suất trở nên hữu ích — vẫn chưa được kiểm chứng bên ngoài Microsoft. Công ty có nêu rõ những chỗ họ cho rằng mô hình mạnh nhất và yếu nhất, điều này hữu ích hơn một con điểm tiêu đề: mạnh nhất ở suy luận, áp dụng quy tắc và khả năng chống chịu trước cách định dạng câu lệnh; cạnh tranh ở phân loại, truy xuất, công bằng, sử dụng công cụ và hầu hết các tác vụ đa ngôn ngữ; yếu hơn ở các tác vụ kiến thức chuyên ngành.
Những hạn chế do chính hệ thống tự báo cáo là phần đáng đọc trước danh sách tính năng. Điểm số có thể thay đổi tùy theo cách diễn đạt và thứ tự lựa chọn, và một câu hỏi được đặt vấn đề kém vẫn trả về điểm. Độ hiệu chuẩn mạnh nhất ở các loại tác vụ quen thuộc. Nó có thể dựa trên kiến thức lỗi thời và không đưa ra giải thích. Về phạm vi hỗ trợ đa ngôn ngữ: có 25 ngôn ngữ được liệt kê là được hỗ trợ, bao gồm tiếng Nhật, Hàn, Ả Rập, Việt, Thái, Thổ Nhĩ Kỳ, Hindi, Bengal, Swahili, Hebrew, Ba Tư và Ukraina, nhưng Microsoft tuyên bố rằng phạm vi bao phủ, chất lượng và độ hiệu chuẩn “có thể thay đổi tùy theo ngôn ngữ”, đồng thời liệt kê các ngôn ngữ không phải tiếng Anh — đặc biệt là những ngôn ngữ ít tài nguyên — là một lĩnh vực hoạt động kém. Mô hình nền tảng Qwen3.5-9B hỗ trợ hơn 200 ngôn ngữ; mô hình hậu huấn luyện chỉ hỗ trợ một phần tư con số đó.
Cách bạn có được nó và nó tốn bao nhiêu
Microsoft-Decision-1 được phân phối dưới dạng API lưu trữ trong Microsoft Foundry thuộc danh mục "Direct from Azure". Trọng số mô hình không được phân phối — đây không phải là bản phát hành trọng số mở và không có kho Hugging Face nào để tải xuống. Bất kỳ ứng dụng nào có thể gửi yêu cầu HTTPS đều có thể tích hợp bằng các endpoint Foundry và xác thực Azure tiêu chuẩn. Danh sách triển khai hiển thị các tùy chọn serverless và unified-endpoint trên hình thức trả theo mức sử dụng hoặc thông lượng được cấp dành riêng, SKU tiêu chuẩn, với suy luận theo lô bị tắt, và công bố huấn luyện cho biết bộ dữ liệu huấn luyện được sử dụng lần đầu vào tháng 9 năm 2026 với quá trình thu thập vẫn đang tiếp diễn.
Giá không được công bố trên trang của mô hình. Trường giá của danh mục liên kết ra trang định giá mô hình của Microsoft thay vì in ra mức giá đầu vào và đầu ra, vì vậy chi phí trên mỗi token của một lệnh gọi Decision-1 là thứ bạn phải tra cứu trong giao diện định giá Azure hoặc đọc từ hóa đơn. Đó là một khoảng trống thực sự đối với bất kỳ ai đang cố mô hình hóa chi phí cho mỗi quyết định ở quy mô lớn, và điều đó đáng được nói thẳng ra thay vì ước tính. Hai điều đáng biết khi bạn định giá nó: 0% chi phí là token đầu ra, vì không có token đầu ra nào, và suy luận theo lô bị tắt, nên bạn không thể phân bổ chi phí một lượt chấm điểm hàng loạt qua kênh theo lô theo cách bạn vẫn làm với mô hình tạo sinh.
Vị trí của OrcaRouter trong bức tranh này nằm ở phía bên kia của cuộc gọi. Chúng tôi không vận hành Microsoft-Decision-1, và nó cũng không nằm trong danh mục của chúng tôi — một mô hình trả về xác suất thay vì văn bản thì không phải là mô hình mà bạn định tuyến các chat completion tới. Thứ chúng tôi cung cấp là nửa còn lại của mô hình đó, phần thực sự tạo sinh: những mô hình viết rubric, phác thảo các phản hồi ứng viên, hoặc tạo ra lệnh gọi công cụ mà sau đó Decision-1 chấm điểm. Những mô hình này nằm sau một khóa tương thích OpenAI với hơn 200 mô hình, ở mức giá niêm yết của nhà cung cấp được chuyển nguyên với 0% markup, vì vậy khi nhà cung cấp giảm giá một mô hình giám khảo thì phía chúng tôi sẽ áp dụng ngay trong cùng ngày. Nếu bạn đang xây dựng một vòng lặp đánh giá trong đó một mô hình viết và một mô hình khác chấm điểm, thì lệnh gọi chấm điểm sẽ đi tới Microsoft còn lệnh gọi tạo sinh có thể đi bất cứ đâu — kể cả qua routing DSL, thứ kết hợp nhiều mô hình vào một lệnh gọi duy nhất khi bạn muốn một hội đồng thay vì một giám khảo đơn lẻ.

Vì sao một scorer là một canh bạc khác so với một chatbot tốt hơn
Mô thức mà Microsoft đang bán ở đây vốn đã tồn tại công khai. Intern-Decision-4B của InternLM, d1-3B của Liquid AI, Laya của Convai Innovations và dòng Kev của Jared Palmer đều trả về các phân phối đã hiệu chỉnh trên những lựa chọn được cung cấp mà không sinh văn bản, và hầu hết trong số đó là trọng số Apache-2.0 mà bạn có thể chạy trên phần cứng của riêng mình miễn phí. Sản phẩm của Microsoft khác biệt ở ba điểm không phụ thuộc vào benchmark: nó là một API được quản lý với xác thực, thanh toán và quản trị của Azure đi kèm, nên nó phù hợp với quy trình mua sắm doanh nghiệp mà một bản tải xuống từ Hugging Face thì không; mô hình nền của nó là mô hình 9B, lớn hơn phần lớn các mô hình trong lĩnh vực đó; và nó đi kèm với đánh giá Responsible AI cùng một phương pháp đánh giá được tài liệu hóa, thứ thường là yêu cầu gating thực sự cho một triển khai chịu quản lý.
Điều mà nó không đi kèm là một con số. So với các đối thủ mở, những bên công bố điểm Brier và sai số hiệu chuẩn kỳ vọng — hai chỉ số cho bạn biết liệu 0,8 có thực sự nghĩa là 0,8 — Microsoft chỉ công bố phương pháp luận và không có kết quả. Cho đến khi có kiểm thử hiệu chuẩn độc lập, cách sử dụng Microsoft-Decision-1 có thể biện minh được chính là cách mà tài liệu của chính nó khuyến nghị: kiểm định trên dữ liệu đại diện cho trường hợp sử dụng của bạn, đặt ngưỡng dựa trên chi phí sai sót của bạn, luôn bao gồm một tùy chọn không trả lời, ngẫu nhiên hóa thứ tự các lựa chọn khi việc sắp thứ tự có thể làm lệch câu trả lời, và duy trì con người trong vòng kiểm soát đối với bất kỳ việc gì hệ trọng. Đó là lời khuyên tốt cho bất kỳ công cụ chấm điểm nào. Và đặc biệt là lời khuyên tốt cho một công cụ mà chưa ai ngoài công ty từng đo hiệu chuẩn của nó.
