
Microsoft-Decision-1 đấu với Intern-Decision-0.8B: Nửa ounce rắc rối jailbreak chống lại một bản trống được host
- OrcaMỚIOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 trên 1 triệu token · 55 tok/s
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 369 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
Hãy bắt đầu với cột mà một bài đăng ra mắt hẳn sẽ bỏ qua. Intern-Decision-0.8B — mô hình quyết định 852.985.920 tham số của InternLM, được tinh chỉnh từ Qwen3.5-0.8B và tải lên Hugging Face vào ngày 26 tháng 9 năm 2026 mà không có thông báo, không có bài báo, cùng một liên kết GitHub vẫn còn lỗi 404 — được đo ở mức 64.48 trên WildJailBreak so với mức tham chiếu 96.29 của Jev 1.13 đến từ TypeSafe. Đó không phải là một khác biệt do làm tròn. Đó là một sự sụp đổ về độ bền từ chối ở một mô hình mà toàn bộ công việc là phán xét đầu vào, được công bố ngay trên card của chính nhà cung cấp, trong một bảng mà benchmark thuộc về một đối thủ cạnh tranh. Đặt điều đó bên cạnh Microsoft-Decision-1, vốn đã được phát hành rộng rãi trên Microsoft Foundry vào ngày 8 tháng 10 năm 2026 dưới dạng một bộ chấm điểm chỉ dùng văn bản, được hậu huấn luyện trên Qwen3.5-9B với một phương pháp đánh giá được ghi chép đầy đủ và không một kết quả nào được in bên dưới nó, thì bạn đã thấy được hình dạng thực sự của màn đối đầu này. Một trong hai mô hình này sẽ cho bạn một con số khiến nó trông thật tệ. Mô hình kia sẽ cho bạn biết nó đã định dùng những chỉ số nào.
Sự đảo ngược đó đáng giá hơn cả bảng thông số kỹ thuật. Cả hai mô hình đều nhận một trạng thái và một tập câu hỏi có giới hạn, rồi trả về xác suất trên các lựa chọn của bạn — không mô hình nào sinh văn bản, và trên trục đó, chúng là cùng một loại công cụ. Những khác biệt đáng kể là ai vận hành nó, nó lớn đến mức nào, bạn có thể xác minh được bao nhiêu, và một cột an toàn mà mô hình nhỏ hơn, kín tiếng hơn, có thể tải xuống hoàn toàn vẫn chọn công bố.
Mỗi thứ thực sự trả lại những gì
Microsoft-Decision-1 là một API được lưu trữ, và đó là khác biệt cấu trúc đầu tiên. Trọng số không được phân phối — không tải xuống, không kho lưu trữ, không có lộ trình tinh chỉnh — và việc tích hợp nghĩa là triển khai Foundry với xác thực, thanh toán và quản trị Azure đi kèm. Nó chạy một lượt trên tối đa 32.768 token, hỗ trợ câu hỏi dạng có/không, trắc nghiệm, đánh giá, phân loại và theo rubric, và chỉ nhận đầu vào văn bản cùng đầu ra là số. Nó hỗ trợ rõ ràng một tùy chọn bỏ qua như "không thể xác định" khi bằng chứng không đủ, đó là điều khiến một ngưỡng trở nên có ý nghĩa.
Intern-Decision-0.8B là sự sắp đặt ngược lại. Đây là các trọng số Apache 2.0 với giấy phép Qwen thượng nguồn được giữ nguyên bên cạnh chúng dưới tên LICENSE-QWEN, khoảng 1,73 GB kho lưu trữ trải trên ba phân đoạn — một phân đoạn ngôn ngữ 1,50 GB, một phân đoạn thị giác 176 MB và một projector 25 MB — vừa đủ cho một GPU tiêu dùng đơn lẻ hoặc một laptop được trang bị tốt. Nó chấp nhận một trạng thái, một lược đồ gồm từ một đến mười sáu câu hỏi có tên với tối đa 62 tùy chọn mỗi câu, và tùy chọn tối đa tám hình ảnh, và tệp inference.py đi kèm của nó ghi lại hợp đồng chi tiết hơn mức mà hầu hết các mô hình đã ra mắt chịu bận tâm tới: các tùy chọn được ánh xạ lên các ký hiệu đơn token A–Z, rồi a–z, rồi 0–9; logits được đọc tại vị trí ngay trước mỗi <decision> trình giữ chỗ trong một bộ khung được kết xuất trước; một softmax được thực hiện chỉ trên các ứng viên hợp lệ của trường đó; một nhiệt độ đã được khớp được áp dụng.
Hai giấy phép không phải là cùng một giao dịch mua. Microsoft-Decision-1 mang lại cho bạn một endpoint được quản lý và không có sản phẩm nào bạn sở hữu. Intern-Decision-0.8B mang lại cho bạn một sản phẩm bạn sở hữu, không có endpoint, không có hợp đồng hỗ trợ và không có tài liệu nào ngoài chính kho lưu trữ.

Mức trần, và khả năng hiệu chuẩn mà bạn có thể kiểm chứng
Hai con số quyết định phần lớn các tích hợp thực tế, và cả hai đều thuộc về mô hình nhỏ.
Đầu tiên là 8.192 token. Engine suy luận của Intern-Decision-0.8B từ chối đầu vào quá khổ thay vì cắt bớt nó, đây là hành vi đúng đắn đối với một bộ chấm điểm và cũng là một bức tường cứng: không có chiến lược chia nhỏ nào bảo toàn được giao kèo, bởi vì trạng thái, lược đồ và khung xương đều phải nằm trong cùng một lượt. Trần của Microsoft-Decision-1 cao gấp bốn lần, ở mức 32.768, và đó là một giới hạn do dịch vụ lưu trữ đặt ra mà bạn có thể nâng lên bằng cách cấp phát tài nguyên theo cách khác, chứ không phải một hằng số nằm trong tệp Python.
Thứ hai là hiệu chỉnh, và ở đây hướng đảo ngược. InternLM công bố nhiệt độ đã khớp là 2.747760550703 cho 0.8B, được chọn bằng tối thiểu hóa NLL trên 1,728 trường hợp hiệu chỉnh được chỉ định với 1,693 trường hợp được giữ để kiểm định, với thẻ nêu rõ rằng nhãn của bộ kiểm thử đã không được dùng để chọn nó. Phép biến đổi được áp dụng là một softmax trên các logit ứng viên của trường, tiếp theo là một softmax thứ hai trên log của phân phối đó chia cho nhiệt độ. Vì phép biến đổi chạy sau softmax đầu tiên và bảo toàn thứ tự, nó hoàn toàn không thể thay đổi argmax — nó dịch chuyển độ tin cậy, xác suất yes và giá trị kỳ vọng của một câu hỏi điểm, đồng thời giữ nguyên nhãn. Nếu pipeline của bạn đọc nhãn, nhiệt độ không có tác dụng gì. Nếu nó đọc xác suất, đặt ngưỡng cho nó, hoặc đưa nó vào một phép tính giá trị kỳ vọng, thì nhiệt độ là sự khác biệt giữa một con số có ý nghĩa và một con số không có ý nghĩa. Việc truyền temperature=1 trả về phân phối chưa hiệu chỉnh nếu bạn muốn tự khớp phân phối của riêng mình.
Microsoft-Decision-1 không có tạo tác tương đương. Tab Benchmarks của nó nêu rằng độ chính xác, sai số hiệu chuẩn, recall an toàn, tỷ lệ dương tính giả và tính nhất quán về công bằng đã được đo trên các benchmark quyết định công khai và cộng đồng cùng với các tập kiểm thử nội bộ được giữ riêng, rằng thứ tự tùy chọn đã được thay đổi, rằng các kiểm định thống kê theo cặp đã được áp dụng, và rằng mô hình "hoạt động ngang bằng với các mô hình quyết định hàng đầu và vượt trội so với các mô hình quyết định mở khác được đánh giá bằng cùng phương pháp luận." Không có sai số hiệu chuẩn nào được in ra, không có temperature để kiểm tra, và không có phân chia validation nào được mô tả. Thuộc tính duy nhất khiến một xác suất trở nên hữu ích — liệu 0,8 có nghĩa là 0,8 hay không — được khẳng định mà không được định lượng.
Đọc hai đoạn đó đối chiếu với nhau và cuộc so sánh không còn xoay quanh kích thước. Một checkpoint 0,8 tỷ tham số mà bạn có thể kiểm tra hiệu chuẩn và có thể chạy phần mềm của nó, đối với một nhóm đánh giá, là một đối tượng dễ xử lý hơn một API được lưu trữ mà thông tin hiệu chuẩn chỉ là một câu. Mô hình nhỏ cũng có một con số độ trễ được ghi nhận — trung bình 33,98 ms, trung vị 33,44 ms, p95 37,50 ms mỗi truy vấn trên một RTX 4090 duy nhất thông qua đường dẫn Hugging Face cục bộ, theo đo lường của chính InternLM — trong khi của Microsoft là thứ bạn phải đo qua triển khai của riêng mình, nơi lựa chọn giữa serverless và thông lượng được cấp phát sẽ làm con số dịch chuyển nhiều hơn cả bản thân mô hình.

Nơi mô hình nhỏ thua kém
Không có điều nào ở trên khiến Intern-Decision-0.8B trở thành lựa chọn an toàn, và chính bảng được công bố đó nói rõ vì sao. WildJailBreak ở mức 64.48 so với 96.29 của Jev là khoảng cách về độ vững trước việc từ chối lên tới ba mươi điểm, đúng ở hạng mục mà một bộ chấm điểm gặp phải đầu vào không đáng tin cậy. Một mô hình ra quyết định thường là thành phần quyết định liệu một hành động được đề xuất có được phép hay không; một mô hình dễ bị nói lách qua là một mối nguy ở vị trí đó. Việc mức thiếu hụt này bắt nguồn từ nền tảng Qwen3.5-0.8B, từ mục tiêu tinh chỉnh ra quyết định hay từ số lượng tham số nhỏ không phải là điều mà kho lưu trữ cho bạn biết, và cũng không có bài báo nào, không có công thức huấn luyện nào và không có công bố dữ liệu nào làm được điều đó.
Phần còn lại trong bảng của chính InternLM còn tâng bốc hơn cột đó và vẫn khá khiêm tốn. Trung bình trên bảy bộ kiểm thử là 79.38 đối với 0.8B, so với 84.68 của phiên bản 2B cùng dòng và 90.02 của 4B — họ mô hình này tăng dốc theo kích thước, một tín hiệu nhẹ cho thấy bảng này không được thiết kế ngược để tâng bốc mô hình chủ lực. AG News đạt 88.61 so với 89.57 của Jev, gần như ngang bằng ở bài toán phân loại chủ đề bốn lớp. Về hiệu chuẩn, 0.8B báo cáo Brier là 0.530 và sai số hiệu chuẩn kỳ vọng là 0.066, so với 0.358 và 0.095 của Jev — ECE tốt hơn, độ chính xác kém hơn đáng kể. Đó là một hồ sơ hợp lý cho một mô hình nhỏ với temperature được fit có chủ đích, và đó không phải là tổ hợp mà một đội marketing sẽ vô tình chọn công bố.
Cũng không có ngày phát hành, không có thông báo, không có bộ sưu tập tổng hợp ba checkpoint, không có endpoint nào được host ở đâu cả, và không có bất kỳ đánh giá độc lập nào. Space demo phản hồi 401. Mô tả đúng về Intern-Decision-0.8B là một checkpoint đã phát hành với những tuyên bố chưa được kiểm chứng — tình huống này tốt hơn so với một API nằm trong danh sách chờ, vì bạn có thể đo lường nó trong một buổi chiều, nhưng điều đó có nghĩa toàn bộ gánh nặng xác thực thuộc về bạn.
Lựa chọn, và OrcaRouter nằm ở đâu
Chọn Microsoft-Decision-1 nếu rào cản là mua sắm hoặc quy mô: bạn cần xác thực Azure, hóa đơn hợp nhất và đánh giá Responsible AI trước khi bất cứ thứ gì được đưa vào sản xuất; bạn cần ngữ cảnh 32K; bạn cần một điểm cuối mà bạn không vận hành; hoặc bạn cần đường dẫn từ chối (abstention path) được thiết kế sẵn thay vì tự làm thủ công. Chấp nhận đổi lại rằng bạn không thể chạy nó, không thể tinh chỉnh nó, không thể kiểm tra hiệu chuẩn của nó, và sẽ phải tự đo lường tuyên bố cốt lõi của nó.
Chọn Intern-Decision-0.8B nếu rào cản là chi phí, bộ nhớ hay quyền kiểm soát: bạn muốn một bộ chấm điểm theo giấy phép Apache-2.0 vừa vặn trong 1,73 GB, chạy trên phần cứng bạn đã có sẵn, luôn cho ra cùng một nhãn mỗi lần chạy, và có thể đổi sang phiên bản anh em 2B hoặc 4B chỉ bằng cách thay đường dẫn checkpoint. Đổi lại, hãy chấp nhận bức tường 8.192 token, cột WildJailBreak, và việc không ai ngoài InternLM từng tái lập được bất cứ điều gì trên thẻ mô hình.
Lời khuyên thẳng thắn là hãy làm cả hai, vì chúng đủ rẻ để việc tranh cãi gần như không đáng bàn. Bản thân lời gọi chấm điểm không phải thứ chúng tôi định tuyến — một mô hình trả về xác suất thay vì văn bản thì không phải là chat completion, và cả hai đều không nằm trong danh mục của chúng tôi. Thứ OrcaRouter mang lại là nửa còn lại của vòng lặp: hơn 200 mô hình phía sau một khóa tương thích OpenAI để soạn thảo tiêu chí, tạo ra các câu trả lời ứng viên, hoặc phát ra lời gọi công cụ mà bộ chấm điểm của bạn sắp chấm, với mức giá niêm yết của nhà cung cấp được chuyển nguyên với 0% phí gia tăng, nên khi nhà cung cấp giảm giá một mô hình tạo sinh thì bên chúng tôi cập nhật ngay trong cùng ngày. Tự động chuyển đổi dự phòng ở đây quan trọng hơn bình thường, vì một pipeline chấm điểm mọi thứ nó thấy không có dư địa để thử lại một lời gọi bị treo, và DSL định tuyến cho phép bạn gửi một prompt giám khảo đến nhiều mô hình viết rồi hợp nhất mức đồng thuận của chúng thay vì tin vào chỉ một mô hình.

Điểm mấu chốt
Microsoft-Decision-1 đạt trạng thái phát hành chính thức trên Microsoft Foundry vào ngày 8 tháng 10 năm 2026: được lưu trữ, chỉ hỗ trợ văn bản, 32.768 token, xây dựng trên Qwen3.5-9B, với một đoạn phương pháp luận thay cho bảng đánh giá chuẩn. Intern-Decision-0.8B là một checkpoint Apache-2.0 dung lượng 1,73 GB được tải lên vào ngày 26 tháng 9 năm 2026, công bố chỉ số Brier 0,530, ECE 0,066, temperature fit 2,747760550703, 33,98 ms trên 4090 — và điểm WildJailBreak 64,48 mà không ai yêu cầu nó in ra. Nếu bạn chỉ có thể xác thực một điều trước khi áp dụng một trong hai, hãy xác thực hiệu chuẩn trên các trường hợp đã được gán nhãn của chính bạn; đó là con số mà cả hai nhà cung cấp để lại cho bạn tự tìm.
