
Microsoft-Decision-1 vs Intern-Decision-4B: Một bên công bố hiệu chuẩn, bên kia công bố phương pháp luận
- OrcaMỚIOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 trên 1 triệu token
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
Đặt Microsoft-Decision-1 bên cạnh Intern-Decision-4B và bạn có một so sánh được quyết định không phải bởi năng lực mà bởi việc mỗi nhà cung cấp sẵn lòng công bố những gì. Mô hình của Microsoft đạt mức khả dụng chung trên Microsoft Foundry vào ngày 8 tháng 10 năm 2026: nền tảng Qwen3.5-9B, được Microsoft huấn luyện hậu kỳ, chỉ văn bản, ngữ cảnh 32.768 token, không phân phối trọng số, một phương pháp đánh giá mô tả độ chính xác, sai số hiệu chỉnh và các kiểm định thống kê theo cặp — và không có lấy một kết quả. Intern-Decision-4B của InternLM được đăng lên Hugging Face vào ngày 26 tháng 9 năm 2026 lúc 05:36:37 UTC mà không có thông báo nào kèm theo, được tinh chỉnh từ Qwen3.5-4B, tiếp nhận cả hình ảnh lẫn văn bản, chạy trong 44 mili giây trên một RTX 4090 duy nhất, và in ra một bảng đầy đủ các con số Brier và sai số hiệu chỉnh kỳ vọng. Cả hai đều trả về một phân phối xác suất trên các lựa chọn bạn đưa vào. Chỉ một trong hai cho bạn biết nó làm việc đó tốt đến đâu.
Sự đảo ngược đó — mô hình lớn hơn, được cấp vốn tốt hơn lại là bên kém minh bạch — chính là toàn bộ cục diện của màn đối đầu này, và nó quyết định lựa chọn của hầu hết các đội nhanh hơn bất kỳ dòng thông số kỹ thuật nào.
Con số duy nhất phân biệt họ
InternLM báo cáo Brier 0.347 và ECE 0.065 cho Intern-Decision-4B trên toàn bộ bộ benchmark của nó, với điểm trung bình là 90.02 trên Jevbench-Easy (100.00), Jevbench-Original (98.61), Jevbench-Hard (73.87), Typed Decision (80.55), ToolACE (96.45), AG News (90.82) và WildJailBreak (89.86). Đó là những số liệu do nhà cung cấp tự báo cáo trên bộ khung đánh giá của chính họ, và đặc biệt các dòng Jevbench là họ benchmark của chính dự án — hãy đọc chúng như một sự tự đánh giá, chứ không phải kiểm chứng độc lập. Nhưng chúng là những con số với thang đo được nêu rõ, và ECE nói riêng chính là chỉ số cho bạn biết liệu một giá trị 0.8 được trả về có đáng để hành động dựa trên đó hay không.
Microsoft không công bố thông tin tương đương. Tab Benchmarks trên trang danh mục Microsoft-Decision-1 mô tả những gì đã được đo lường và tuyên bố rằng mô hình "hoạt động ngang tầm với các mô hình ra quyết định hàng đầu và vượt trội so với các mô hình ra quyết định mở khác được đánh giá bằng cùng một phương pháp," với các lĩnh vực mạnh nhất được nêu là suy luận, áp dụng quy tắc và độ bền vững với định dạng prompt, còn lĩnh vực yếu nhất là kiến thức miền chuyên biệt. Không có Brier, không có ECE, không có bảng độ chính xác. Nếu quyết định áp dụng của bạn cần một con số hiệu chuẩn trước khi bạn có thể xác định ngưỡng leo thang, một trong hai mô hình này đưa nó cho bạn và mô hình kia yêu cầu bạn tự đo lấy.

Nơi mà hai hợp đồng thực sự khác nhau
Thoạt nhìn, những mô hình này nhận cùng một lệnh gọi. Bạn cung cấp một trạng thái, một schema gồm các câu hỏi có tên, và một tập tùy chọn cố định; bạn nhận lại xác suất cho mỗi tùy chọn mà không có một token văn bản được sinh ra nào. Những khác biệt lộ ra ở rìa của hợp đồng đó.
• Phương thức — Microsoft-Decision-1 hoàn toàn chỉ hỗ trợ văn bản và không nhận hoặc tạo ra nội dung hình ảnh, âm thanh hay video. Intern-Decision-4B chấp nhận hình ảnh tùy chọn cùng với trạng thái, tối đa tám hình ảnh mỗi lần gọi, và chính điều này khiến nó trở thành ứng viên cho việc phân loại ảnh chụp màn hình, kiểm tra bố cục tài liệu và định tuyến QA trực quan.
• Số lượng câu hỏi — InternLM ghi nhận 1 đến 16 câu hỏi mỗi lần gọi, tối đa 62 tùy chọn mỗi câu, trên ba loại trường (choice, score, noul). Microsoft ghi nhận các định dạng — có/không, trắc nghiệm, đánh giá, phân loại, rubric — và một lần gọi duy nhất trên tối đa 32K token, nhưng không có giới hạn số câu hỏi mỗi lần gọi.
• Ngữ cảnh — Microsoft cho biết 32.768 token. Thẻ Intern-Decision-4B nêu các giới hạn của mình theo số câu hỏi, số lựa chọn và số hình ảnh, thay vì một con số ngữ cảnh duy nhất, nên bạn không thể đối chiếu hai bên dựa trên một con số duy nhất.
• Phân phối — Microsoft-Decision-1 là một API Foundry được lưu trữ; trọng số mô hình không được phân phối và không có bản tải xuống. Intern-Decision-4B là Apache-2.0 trên Hugging Face với giấy phép Qwen thượng nguồn được giữ nguyên dưới dạng LICENSE-QWEN, nghĩa là phải giữ lại giấy phép đó và các thông báo thượng nguồn nếu bạn phân phối lại.
• Cấu trúc chi phí — Trọng số của InternLM không tốn gì để chạy và được báo ở mức trung bình 44,16 ms, P95 44,60 ms, trên một RTX 4090. Giá theo token của Microsoft hoàn toàn không được in trên trang mô hình.
• Quản trị — Microsoft cung cấp một bản đánh giá AI có trách nhiệm, các thực hành triển khai được ghi chép lại, và những loại trừ rõ ràng (không dùng cho tạo văn bản, hỏi đáp mở, hội thoại, dịch thuật hay tóm tắt; không được là tác nhân ra quyết định tự động duy nhất trong những quyết định hệ trọng liên quan đến con người). InternLM cung cấp một model card thẳng thắn về nguồn gốc — trọng số "được sửa đổi bằng decision tuning" — và không có gì giống một gói tuân thủ.

Hai lý do rất khác nhau khiến các số liệu độ trễ khó so sánh
Decision-1 không công bố chỉ số độ trễ, nên không có gì để đặt bên cạnh mức trung bình 44.16 ms của InternLM. Đó không phải là một thiếu sót nhỏ đối với khối lượng công việc này. Những mô hình này tồn tại để được gọi nhiều lần bên trong một pipeline — mỗi lần cho một tài liệu được truy xuất, mỗi lần cho một lệnh gọi công cụ được đề xuất, mỗi lần cho một phản hồi đang được chấm điểm — và sự khác biệt giữa bốn quyết định mỗi giây với bốn mươi quyết định mỗi giây chính là sự khác biệt giữa việc chấm điểm một mẫu và chấm điểm mọi thứ. Con số của InternLM có thể đạt được ngay hôm nay trên phần cứng mà bạn có thể thuê theo giờ; còn con số của Microsoft phải được đo thông qua triển khai Foundry của chính bạn, và hình thức triển khai mà bạn chọn (serverless trả theo mức sử dụng so với provisioned throughput) sẽ thay đổi nó nhiều hơn cả bản thân mô hình.
Đây cũng là chỗ nửa phần của mô hình thuộc về OrcaRouter trở nên liên quan, và đó chỉ là nửa mang tính tạo sinh. Chúng tôi không lưu trữ Microsoft-Decision-1 hay Intern-Decision-4B — một mô hình trả về xác suất thay vì văn bản thì không phải thứ bạn dùng để định tuyến các chat completion, và cả hai đều không xuất hiện trong danh mục của chúng tôi. Thứ nằm đằng sau một khóa tương thích OpenAI duy nhất của chúng tôi là bể hơn 200 mô hình đảm nhiệm phần viết lách: prompt cho giám khảo do một mô hình soạn, các câu trả lời ứng viên do hai mô hình khác tạo ra, lệnh gọi công cụ được chấm điểm trước khi nó chạy.Giá niêm yết của nhà cung cấp được chuyển tiếp với mức đánh dấu 0%, nên việc giảm giá trên một mô hình tạo sinh có hiệu lực ngay bên phía chúng tôi trong cùng ngày, và tính năng chuyển đổi dự phòng tự động giữ cho phía tạo sinh của vòng lặp chấm điểm luôn hoạt động khi một nhà cung cấp đơn lẻ bị suy giảm — điều này ở đây quan trọng hơn mức bình thường, bởi vì một pipeline chấm điểm mọi thứ nó thấy không có dư địa để thử lại một lệnh gọi bị đình trệ.

Ai nên lấy cái nào
Hãy chọn Intern-Decision-4B nếu bất kỳ điều nào sau đây đúng: bạn cần chấm điểm cả hình ảnh lẫn văn bản, bạn cần một con số hiệu chuẩn trước khi có thể phát hành, bạn muốn có tùy chọn chạy mô hình trên phần cứng của riêng mình trong một ranh giới do bạn kiểm soát, hoặc bạn muốn tinh chỉnh nó. Điểm cuối cùng đáng được nhấn mạnh — một bộ chấm điểm trọng số mở 4B với wrapper đã được ghi tài liệu là mô hình mà bạn có thể điều chỉnh theo nhãn của riêng mình, còn Microsoft-Decision-1 là một API được lưu trữ, không có đường dẫn tinh chỉnh và không có trọng số để điều chỉnh.
Hãy chọn Microsoft-Decision-1 nếu rào cản nằm ở khâu mua sắm chứ không phải hiệu năng: bạn cần xác thực Azure, hóa đơn hợp nhất, quản trị và đánh giá Responsible AI của nhà cung cấp trước khi bất cứ thứ gì được đưa vào môi trường production, và bạn cần ngữ cảnh 32K cho các tài liệu dài — điều mà những giới hạn theo từng lần gọi của mô hình 4B khiến trở nên phức tạp. Việc thiếu các benchmark được công bố là một cái giá thực sự, nhưng đó là cái giá bạn có thể gạt bỏ trong một buổi chiều bằng cách đưa bộ dữ liệu gán nhãn của riêng bạn chạy qua cả hai mô hình và so sánh ECE — việc mà dù sao bạn cũng sẽ làm trước khi tin vào bảng kết quả của bất kỳ nhà cung cấp nào.
Câu trả lời khó chịu là cả hai đều đủ rẻ để kiểm chứng đến mức cuộc tranh luận gần như không đáng để diễn ra. Intern-Decision-4B cần một GPU mà bạn có lẽ đã có sẵn. Microsoft-Decision-1 cần một triển khai Foundry và một mẫu các quyết định đã được dán nhãn của chính bạn. Hãy chạy dữ liệu của bạn qua cả hai, tính hiệu chuẩn trên tập con quan trọng với bạn, và để các con số quyết định — và điều đó, một cách thích hợp, chính xác là mục đích của những mô hình này.
