Thẻ tiêu đề được tạo cho Microsoft-Decision-1 đấu với Kev, với phụ đề 'một bộ chấm điểm được host đối đầu với một recipe bạn có thể huấn luyện lại', cùng các chip ghi 9B hosted API đối đầu với một base đóng băng cộng với một adapter LoRA rank-16 33,8M, không có benchmark nào được công bố đối đầu với ECE 0,017 trên transfer-v4, không phân phối trọng số đối đầu với Apache-2.0, và phần chân trang ghi nguồn lưu ý rằng cả hai bộ số liệu đều do tự báo cáo.
Engineering & Research

Microsoft-Decision-1 vs Kev: Mua một điểm số, hay sở hữu công thức tạo ra nó

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Jared Palmer đặt một tấm biên lai bên cạnh mô hình của mình. Gia đình Kev — Kev-0.8B, Kev-4B và Kev-9B, được xây dựng trên các checkpoint cơ sở trọng số mở đóng băng với một bộ điều hợp LoRA hạng 16 và một đầu con trỏ nhỏ — ra mắt ngày 24 tháng 9 năm 2026 cùng với công thức huấn luyện, số lượng dữ liệu theo từng giai đoạn và các con số đánh giá của nó đều được công bố, và tiêu đề trung thực dành cho bất kỳ ai so sánh nó với Microsoft-Decision-1 là Kev cho bạn biết nhiều hơn hẳn về cách tái tạo chính nó. Bộ chấm điểm của Microsoft đã ra mắt chính thức trên Microsoft Foundry vào ngày 8 tháng 10 năm 2026: một mô hình cơ sở Qwen3.5-9B được Microsoft huấn luyện hậu kỳ, ngữ cảnh 32.768 token, chỉ xử lý văn bản, không phân phối trọng số, có công bố phương pháp đánh giá nhưng không công bố kết quả. Cả hai đều nhận một trạng thái và một tập câu hỏi có kiểu, rồi trả về một phân phối đã hiệu chỉnh thay vì văn bản được sinh ra. Một cái là dịch vụ, cái kia là một phương pháp bạn có thể chạy trong notebook ngay tối nay.

Lý do khiến sự khác biệt đó quyết định cuộc so tài này chứ không phải năng lực là: Kev-4B báo cáo ECE 0.017 trên bài kiểm tra khóa ngoài miền của nó, còn Microsoft-Decision-1 không báo cáo gì, nên lập luận hiệu chuẩn vốn thường phân định một so sánh giữa hai bên chấm điểm chỉ có một bên trình bày lập trường của mình.

Kev thực sự xuất bản những gì

Thẻ của Kev-4B đặc biệt cụ thể một cách bất thường, và chính sự cụ thể đó là điểm mấu chốt. Backbone là Qwen3.5-4B-Base, được đóng băng tại một revision được nêu tên, với 24 lớp attention tuyến tính Gated DeltaNet và 8 lớp full-attention ở kích thước ẩn 2.560. Bên trên nó là một bộ điều hợp LoRA hạng 16 — 33,8 triệu tham số có thể huấn luyện, được áp dụng cho attention, MLP và các phép chiếu DeltaNet — cùng một pointer head chấm điểm token kết thúc của từng lựa chọn so với token cuối cùng của câu hỏi rồi áp dụng softmax. Một nhiệt độ duy nhất, T = 2,41, được lưu trong tệp head và được áp dụng khi tải, và thẻ đưa ra giá trị khớp cùng hash của tệp. Huấn luyện diễn ra theo từng giai đoạn với số lượng bản ghi được công bố: một công thức cơ sở gồm 12.576 bản ghi, 1.425 bản ghi cho ngày tháng và bằng chứng còn thiếu, 5.219 tường thuật khiếu nại CFPB thực tế, 6.000 bản ghi kỹ năng và 5.320 bản ghi công cụ dành cho nhà phát triển, với các giai đoạn sau phát lại các giai đoạn trước. Thẻ cũng nêu rõ những gì không được sử dụng: “Không có đầu ra nào của Jev (mô hình quyết định được lưu trữ của TypeSafe) được sử dụng.”

Bảng benchmark được nêu trên cùng trang, và nó đi kèm với các trường hợp thất bại được đính kèm, điều hiếm gặp hơn so với các trường hợp thành công. Bài kiểm thử out-of-domain bị khóa của Transfer-v4: độ chính xác 0,838, Brier 0,224, ECE 0,017. Breadth-v1 trên 14 bộ dữ liệu giữ riêng và 3.089 câu hỏi: độ chính xác 0,690, ECE 0,029. Bài kiểm thử Hard-v1: 0,803. Bài kiểm thử Documents-v1: 0,903. MMLU-Pro với mười phương án: 0,565. Số học ngày tháng: 0,65, được tác giả nêu tên là lĩnh vực yếu nhất, với một cờ tiền xử lý được đưa ra như một giải pháp khắc phục một phần và một ghi chú rõ ràng rằng nó chưa được đo lại. Phần hạn chế bổ sung rằng việc hiệu chuẩn chỉ là một nhiệt độ in-distribution duy nhất nên độ bao phủ suy giảm ngoài miền, rằng thứ tự phương án có thể làm đảo ngược một đáp án, và rằng các độ dài vượt quá 8.192 token vẫn được phục vụ nhưng chưa được xác thực. Số liệu phục vụ cũng được công bố: 18,1 ms cho sáu câu hỏi trên một trạng thái ngắn trên H100, 12,9 ms khi đã cache, 14,3 GB bộ nhớ GPU thường trú.

A generated two-column scoreboard for Microsoft-Decision-1 and Kev across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus a frozen Qwen3.5-4B-Base with a 33.8M rank-16 LoRA adapter and pointer head; weights not distributed versus Apache-2.0 download; context 32,768 tokens versus 8,192 validated and 65,536 served; published scores none versus vendor-reported ECE 0.017 on transfer-v4 with Brier 0.224; tuning not available versus the full training recipe published with per-stage record counts; and price a Foundry per-token rate versus free to self-host. A footer reads that both sets of figures are self-reported by their publishers.

Những gì Microsoft xuất bản thay vào đó

Microsoft-Decision-1 bao quát phần lớn những nội dung tương tự với một tư thế khác. Nó chấm điểm các câu hỏi có/không, trắc nghiệm, đánh giá, phân loại và rubric, hỗ trợ các tùy chọn từ chối trả lời rõ ràng như "không thể nói," trả về xác suất JSON, và chạy trong một lần gọi trên tối đa 32K token — gấp bốn lần ngữ cảnh mà Kev xác thực. Nó được phân phối dưới dạng API được lưu trữ trong Microsoft Foundry thuộc danh mục Direct from Azure, với triển khai không máy chủ và điểm cuối hợp nhất, SKU tiêu chuẩn, xác thực Azure và một đường dẫn thanh toán hợp nhất. Suy luận theo lô bị vô hiệu hóa, và không có tải trọng số xuống cũng như không có đường dẫn tinh chỉnh.

Phần đánh giá mô tả các bộ chuẩn đánh giá quyết định công khai và cộng đồng cùng các tập nội bộ được giữ riêng, các chỉ số bao gồm độ chính xác và sai số hiệu chuẩn, thứ tự lựa chọn được thay đổi, các kiểm định thống kê theo cặp, và một tuyên bố rằng mô hình "hoạt động ngang bằng với các mô hình ra quyết định hàng đầu và vượt trội so với các mô hình ra quyết định mở khác được đánh giá bằng cùng phương pháp luận." Không có bảng nào. Thẻ mô hình nêu trung thực các giới hạn của chính nó — điểm số thay đổi theo cách diễn đạt và thứ tự lựa chọn, hiệu chuẩn mạnh nhất ở các loại tác vụ quen thuộc, không tạo ra lời giải thích, và độ bao phủ phi tiếng Anh là yếu nhất — nhưng danh sách giới hạn không phải là phép đo hiệu chuẩn; bất kỳ ai đặt ngưỡng tự động chấp nhận 0,9 trên Microsoft-Decision-1 đều đang đặt ngưỡng đó bằng niềm tin và điều chỉnh nó trong môi trường sản xuất.

A screenshot of the Kev-4B model card on Hugging Face, read 10 October 2026, showing the jaredpalmer organisation, 114 likes, an apache-2.0 licence label, and the Model card, Files and versions and Community tabs above the Kev-4B heading and a Model summary section.

Phần tốn tiền của sự so sánh

Tính kinh tế của Kev là lý do cuộc so tài này thực sự sát nút. Công thức là một base đóng băng cộng với một adapter 33,8M, nghĩa là mô hình cận biên bạn huấn luyện tốn khối lượng tính toán cỡ adapter, chứ không phải cỡ mô hình nền tảng. Bạn có thể giữ base trong bộ nhớ một lần và nạp nhiều adapter — mỗi miền quyết định một cái — một hình thái triển khai mà API được lưu trữ của Microsoft hoàn toàn không thể diễn đạt được. Nếu các quy tắc định tuyến của bạn khác với quy tắc của một giám khảo tổng quát, Kev cho phép bạn huấn luyện phần khác biệt; Microsoft-Decision-1 cho phép bạn viết một prompt tốt hơn và hy vọng.

Đổi lại, API được lưu trữ không mang theo gánh nặng vận hành nào. Không có adapter nào để theo dõi, không có ngăn xếp phục vụ nào phải giữ nóng, không có khoảng cách ngữ cảnh giữa đã kiểm định và đang phục vụ để phải cân nhắc, và không có rủi ro rằng một temperature được khớp trên một bộ dữ liệu lại hành xử khác trên bộ dữ liệu của bạn. Với một nhóm có khối lượng quyết định khiêm tốn, dịch vụ là sản phẩm rẻ hơn về giờ kỹ thuật kể cả khi token tốn tiền; với một nhóm chấm điểm hàng triệu mục mỗi ngày, adapter tự lưu trữ thắng về chi phí đơn vị ngay khi GPU đã được trả tiền.

Có một con đường thứ ba không dùng mô hình nào cho phần mà nó yếu nhất, và đó chính là nơi OrcaRouter ngự trị. Chúng tôi không lưu trữ Microsoft-Decision-1 hay Kev — một mô hình trả về xác suất không phải là đích đến của chat-completions và cả hai mô hình đều không có trong danh mục của chúng tôi. Phần sinh tạo của một pipeline ra quyết định mới là thứ chúng tôi cung cấp: mô hình phác thảo câu trả lời ứng viên, viết rubric, hoặc phát ra lệnh gọi công cụ để được chấm điểm. Tất cả những thứ đó nằm sau một khóa tương thích OpenAI với hơn 200 mô hình trên đó ở mức giá niêm yết của nhà cung cấp được chuyển tiếp với 0% phụ phí, nên khi nhà cung cấp thay đổi giá thì phía chúng tôi cập nhật ngay trong cùng ngày. Nếu bạn đang xây dựng một vòng lặp chấm điểm hoặc phân loại, lệnh gọi viết thì có thể định tuyến còn lệnh gọi chấm điểm thì không, và việc giữ ranh giới đó thật rõ ràng chính là điều ngăn một pipeline chấm điểm âm thầm biến thành một pipeline trò chuyện.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither Kev nor Microsoft-Decision-1 appears, because neither is a chat-completions target.

Cách quyết định

Chọn Kev khi bạn cần số liệu trước khi phát hành, khi bạn muốn tinh chỉnh trên nhãn quyết định của riêng mình, khi bạn muốn chạy chấm điểm bên trong ranh giới của riêng bạn với chi phí cận biên bằng không, hoặc khi bạn muốn nhiều miền quyết định cùng chia sẻ một mô hình nền thường trú. Các chỉ số ECE đã công bố của nó vẫn là đo lường của chính tác giả trên harness của chính tác giả — hãy coi đó là đánh giá tự thân đáng tin cậy, chứ không phải kết quả đã được kiểm toán của bên thứ ba — nhưng ít nhất chúng là một thang đo được nêu rõ mà bạn có thể thử tái tạo, và công thức nằm ngay đó để bạn tái tạo chúng.

Hãy chọn Microsoft-Decision-1khi rào cản nằm ở khâu mua sắm hoặc độ dài ngữ cảnh: một endpoint Azure được quản lý với hóa đơn hợp nhất và gói Responsible AI, 32K đầu vào cho các tài liệu dài, cùng một nhà cung cấp để bạn leo thang khi cần. Việc nó thiếu bảng benchmark không phải là một vụ bê bối — rất nhiều mô hình được lưu trữ ra mắt mà chẳng có bảng nào — nhưng điều đó quả thực có nghĩa là đường cong hiệu chuẩn đầu tiên cho mô hình này sẽ do chính người dùng của nó vẽ nên, và bạn nên lên kế hoạch trở thành một trong số họ, trên dữ liệu đã dán nhãn của chính bạn, trước khi bạn áp một ngưỡng vận hành lên nó.