Thẻ tiêu đề được tạo cho Microsoft-Decision-1 so với Intern-Decision-4B với phụ đề 'hai bộ chấm điểm, một bộ có số liệu và một bộ không có', cùng các chip ghi 9B so với 4B, API được lưu trữ so với trọng số mở, không có điểm chuẩn nào được công bố so với Brier 0.347 và ECE 0.065, và một chân trang ghi nguồn lưu ý rằng số liệu của Microsoft chưa được tái lập còn số liệu của InternLM là do nhà cung cấp báo cáo.
Guides & Insights

Microsoft-Decision-1 vs Intern-Decision-4B: Một bên công bố hiệu chuẩn, bên kia công bố phương pháp luận

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đặt Microsoft-Decision-1 bên cạnh Intern-Decision-4B và bạn có một so sánh được quyết định không phải bởi năng lực mà bởi việc mỗi nhà cung cấp sẵn lòng công bố những gì. Mô hình của Microsoft đạt mức khả dụng chung trên Microsoft Foundry vào ngày 8 tháng 10 năm 2026: nền tảng Qwen3.5-9B, được Microsoft huấn luyện hậu kỳ, chỉ văn bản, ngữ cảnh 32.768 token, không phân phối trọng số, một phương pháp đánh giá mô tả độ chính xác, sai số hiệu chỉnh và các kiểm định thống kê theo cặp — và không có lấy một kết quả. Intern-Decision-4B của InternLM được đăng lên Hugging Face vào ngày 26 tháng 9 năm 2026 lúc 05:36:37 UTC mà không có thông báo nào kèm theo, được tinh chỉnh từ Qwen3.5-4B, tiếp nhận cả hình ảnh lẫn văn bản, chạy trong 44 mili giây trên một RTX 4090 duy nhất, và in ra một bảng đầy đủ các con số Brier và sai số hiệu chỉnh kỳ vọng. Cả hai đều trả về một phân phối xác suất trên các lựa chọn bạn đưa vào. Chỉ một trong hai cho bạn biết nó làm việc đó tốt đến đâu.

Sự đảo ngược đó — mô hình lớn hơn, được cấp vốn tốt hơn lại là bên kém minh bạch — chính là toàn bộ cục diện của màn đối đầu này, và nó quyết định lựa chọn của hầu hết các đội nhanh hơn bất kỳ dòng thông số kỹ thuật nào.

Con số duy nhất phân biệt họ

InternLM báo cáo Brier 0.347 và ECE 0.065 cho Intern-Decision-4B trên toàn bộ bộ benchmark của nó, với điểm trung bình là 90.02 trên Jevbench-Easy (100.00), Jevbench-Original (98.61), Jevbench-Hard (73.87), Typed Decision (80.55), ToolACE (96.45), AG News (90.82) và WildJailBreak (89.86). Đó là những số liệu do nhà cung cấp tự báo cáo trên bộ khung đánh giá của chính họ, và đặc biệt các dòng Jevbench là họ benchmark của chính dự án — hãy đọc chúng như một sự tự đánh giá, chứ không phải kiểm chứng độc lập. Nhưng chúng là những con số với thang đo được nêu rõ, và ECE nói riêng chính là chỉ số cho bạn biết liệu một giá trị 0.8 được trả về có đáng để hành động dựa trên đó hay không.

Microsoft không công bố thông tin tương đương. Tab Benchmarks trên trang danh mục Microsoft-Decision-1 mô tả những gì đã được đo lường và tuyên bố rằng mô hình "hoạt động ngang tầm với các mô hình ra quyết định hàng đầu và vượt trội so với các mô hình ra quyết định mở khác được đánh giá bằng cùng một phương pháp," với các lĩnh vực mạnh nhất được nêu là suy luận, áp dụng quy tắc và độ bền vững với định dạng prompt, còn lĩnh vực yếu nhất là kiến thức miền chuyên biệt. Không có Brier, không có ECE, không có bảng độ chính xác. Nếu quyết định áp dụng của bạn cần một con số hiệu chuẩn trước khi bạn có thể xác định ngưỡng leo thang, một trong hai mô hình này đưa nó cho bạn và mô hình kia yêu cầu bạn tự đo lấy.

A generated two-column scoreboard for Microsoft-Decision-1 and Intern-Decision-4B across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus Qwen3.5-4B fine-tuned by InternLM; weights hosted API only versus Apache-2.0 download; modality text only versus text plus up to eight images; context 32,768 tokens versus per-call limits of one to sixteen questions and up to 62 options each; published scores none versus a vendor-reported average of 90.02 with Brier 0.347 and ECE 0.065; and latency not published versus 44.16 ms mean on an RTX 4090. A footer notes Microsoft figures are unreproduced and InternLM figures vendor-reported.

Nơi mà hai hợp đồng thực sự khác nhau

Thoạt nhìn, những mô hình này nhận cùng một lệnh gọi. Bạn cung cấp một trạng thái, một schema gồm các câu hỏi có tên, và một tập tùy chọn cố định; bạn nhận lại xác suất cho mỗi tùy chọn mà không có một token văn bản được sinh ra nào. Những khác biệt lộ ra ở rìa của hợp đồng đó.

• Phương thức — Microsoft-Decision-1 hoàn toàn chỉ hỗ trợ văn bản và không nhận hoặc tạo ra nội dung hình ảnh, âm thanh hay video. Intern-Decision-4B chấp nhận hình ảnh tùy chọn cùng với trạng thái, tối đa tám hình ảnh mỗi lần gọi, và chính điều này khiến nó trở thành ứng viên cho việc phân loại ảnh chụp màn hình, kiểm tra bố cục tài liệu và định tuyến QA trực quan.

• Số lượng câu hỏi — InternLM ghi nhận 1 đến 16 câu hỏi mỗi lần gọi, tối đa 62 tùy chọn mỗi câu, trên ba loại trường (choice, score, noul). Microsoft ghi nhận các định dạng — có/không, trắc nghiệm, đánh giá, phân loại, rubric — và một lần gọi duy nhất trên tối đa 32K token, nhưng không có giới hạn số câu hỏi mỗi lần gọi.

• Ngữ cảnh — Microsoft cho biết 32.768 token. Thẻ Intern-Decision-4B nêu các giới hạn của mình theo số câu hỏi, số lựa chọn và số hình ảnh, thay vì một con số ngữ cảnh duy nhất, nên bạn không thể đối chiếu hai bên dựa trên một con số duy nhất.

• Phân phối — Microsoft-Decision-1 là một API Foundry được lưu trữ; trọng số mô hình không được phân phối và không có bản tải xuống. Intern-Decision-4B là Apache-2.0 trên Hugging Face với giấy phép Qwen thượng nguồn được giữ nguyên dưới dạng LICENSE-QWEN, nghĩa là phải giữ lại giấy phép đó và các thông báo thượng nguồn nếu bạn phân phối lại.

• Cấu trúc chi phí — Trọng số của InternLM không tốn gì để chạy và được báo ở mức trung bình 44,16 ms, P95 44,60 ms, trên một RTX 4090. Giá theo token của Microsoft hoàn toàn không được in trên trang mô hình.

• Quản trị — Microsoft cung cấp một bản đánh giá AI có trách nhiệm, các thực hành triển khai được ghi chép lại, và những loại trừ rõ ràng (không dùng cho tạo văn bản, hỏi đáp mở, hội thoại, dịch thuật hay tóm tắt; không được là tác nhân ra quyết định tự động duy nhất trong những quyết định hệ trọng liên quan đến con người). InternLM cung cấp một model card thẳng thắn về nguồn gốc — trọng số "được sửa đổi bằng decision tuning" — và không có gì giống một gói tuân thủ.

A screenshot of the Intern-Decision-4B model card on Hugging Face, read 10 October 2026, showing the internlm organisation, 83 likes, the Image-Text-to-Text pipeline tag, Transformers and Safetensors badges, and qwen3_5 and decision-making as the listed tags alongside the model card heading.

Hai lý do rất khác nhau khiến các số liệu độ trễ khó so sánh

Decision-1 không công bố chỉ số độ trễ, nên không có gì để đặt bên cạnh mức trung bình 44.16 ms của InternLM. Đó không phải là một thiếu sót nhỏ đối với khối lượng công việc này. Những mô hình này tồn tại để được gọi nhiều lần bên trong một pipeline — mỗi lần cho một tài liệu được truy xuất, mỗi lần cho một lệnh gọi công cụ được đề xuất, mỗi lần cho một phản hồi đang được chấm điểm — và sự khác biệt giữa bốn quyết định mỗi giây với bốn mươi quyết định mỗi giây chính là sự khác biệt giữa việc chấm điểm một mẫu và chấm điểm mọi thứ. Con số của InternLM có thể đạt được ngay hôm nay trên phần cứng mà bạn có thể thuê theo giờ; còn con số của Microsoft phải được đo thông qua triển khai Foundry của chính bạn, và hình thức triển khai mà bạn chọn (serverless trả theo mức sử dụng so với provisioned throughput) sẽ thay đổi nó nhiều hơn cả bản thân mô hình.

Đây cũng là chỗ nửa phần của mô hình thuộc về OrcaRouter trở nên liên quan, và đó chỉ là nửa mang tính tạo sinh. Chúng tôi không lưu trữ Microsoft-Decision-1 hay Intern-Decision-4B — một mô hình trả về xác suất thay vì văn bản thì không phải thứ bạn dùng để định tuyến các chat completion, và cả hai đều không xuất hiện trong danh mục của chúng tôi. Thứ nằm đằng sau một khóa tương thích OpenAI duy nhất của chúng tôi là bể hơn 200 mô hình đảm nhiệm phần viết lách: prompt cho giám khảo do một mô hình soạn, các câu trả lời ứng viên do hai mô hình khác tạo ra, lệnh gọi công cụ được chấm điểm trước khi nó chạy.Giá niêm yết của nhà cung cấp được chuyển tiếp với mức đánh dấu 0%, nên việc giảm giá trên một mô hình tạo sinh có hiệu lực ngay bên phía chúng tôi trong cùng ngày, và tính năng chuyển đổi dự phòng tự động giữ cho phía tạo sinh của vòng lặp chấm điểm luôn hoạt động khi một nhà cung cấp đơn lẻ bị suy giảm — điều này ở đây quan trọng hơn mức bình thường, bởi vì một pipeline chấm điểm mọi thứ nó thấy không có dư địa để thử lại một lệnh gọi bị đình trệ.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

Ai nên lấy cái nào

Hãy chọn Intern-Decision-4B nếu bất kỳ điều nào sau đây đúng: bạn cần chấm điểm cả hình ảnh lẫn văn bản, bạn cần một con số hiệu chuẩn trước khi có thể phát hành, bạn muốn có tùy chọn chạy mô hình trên phần cứng của riêng mình trong một ranh giới do bạn kiểm soát, hoặc bạn muốn tinh chỉnh nó. Điểm cuối cùng đáng được nhấn mạnh — một bộ chấm điểm trọng số mở 4B với wrapper đã được ghi tài liệu là mô hình mà bạn có thể điều chỉnh theo nhãn của riêng mình, còn Microsoft-Decision-1 là một API được lưu trữ, không có đường dẫn tinh chỉnh và không có trọng số để điều chỉnh.

Hãy chọn Microsoft-Decision-1 nếu rào cản nằm ở khâu mua sắm chứ không phải hiệu năng: bạn cần xác thực Azure, hóa đơn hợp nhất, quản trị và đánh giá Responsible AI của nhà cung cấp trước khi bất cứ thứ gì được đưa vào môi trường production, và bạn cần ngữ cảnh 32K cho các tài liệu dài — điều mà những giới hạn theo từng lần gọi của mô hình 4B khiến trở nên phức tạp. Việc thiếu các benchmark được công bố là một cái giá thực sự, nhưng đó là cái giá bạn có thể gạt bỏ trong một buổi chiều bằng cách đưa bộ dữ liệu gán nhãn của riêng bạn chạy qua cả hai mô hình và so sánh ECE — việc mà dù sao bạn cũng sẽ làm trước khi tin vào bảng kết quả của bất kỳ nhà cung cấp nào.

Câu trả lời khó chịu là cả hai đều đủ rẻ để kiểm chứng đến mức cuộc tranh luận gần như không đáng để diễn ra. Intern-Decision-4B cần một GPU mà bạn có lẽ đã có sẵn. Microsoft-Decision-1 cần một triển khai Foundry và một mẫu các quyết định đã được dán nhãn của chính bạn. Hãy chạy dữ liệu của bạn qua cả hai, tính hiệu chuẩn trên tập con quan trọng với bạn, và để các con số quyết định — và điều đó, một cách thích hợp, chính xác là mục đích của những mô hình này.