Một thẻ tiêu đề được tạo cho Microsoft-Decision-1 vs Intern-Decision-0.8B có phụ đề 'một trình chấm điểm được host không có số liệu so với một checkpoint 1.73 GB với một con số không mấy tốt đẹp', với các chip ghi một điểm cuối Foundry so với 852,985,920 tham số, một đoạn phương pháp luận so với điểm WildJailBreak 64.48, và 32,768 token so với giới hạn 8,192.
Guides & Insights

Microsoft-Decision-1 đấu với Intern-Decision-0.8B: Nửa ounce rắc rối jailbreak chống lại một bản trống được host

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hãy bắt đầu với cột mà một bài đăng ra mắt hẳn sẽ bỏ qua. Intern-Decision-0.8B — mô hình quyết định 852.985.920 tham số của InternLM, được tinh chỉnh từ Qwen3.5-0.8B và tải lên Hugging Face vào ngày 26 tháng 9 năm 2026 mà không có thông báo, không có bài báo, cùng một liên kết GitHub vẫn còn lỗi 404 — được đo ở mức 64.48 trên WildJailBreak so với mức tham chiếu 96.29 của Jev 1.13 đến từ TypeSafe. Đó không phải là một khác biệt do làm tròn. Đó là một sự sụp đổ về độ bền từ chối ở một mô hình mà toàn bộ công việc là phán xét đầu vào, được công bố ngay trên card của chính nhà cung cấp, trong một bảng mà benchmark thuộc về một đối thủ cạnh tranh. Đặt điều đó bên cạnh Microsoft-Decision-1, vốn đã được phát hành rộng rãi trên Microsoft Foundry vào ngày 8 tháng 10 năm 2026 dưới dạng một bộ chấm điểm chỉ dùng văn bản, được hậu huấn luyện trên Qwen3.5-9B với một phương pháp đánh giá được ghi chép đầy đủ và không một kết quả nào được in bên dưới nó, thì bạn đã thấy được hình dạng thực sự của màn đối đầu này. Một trong hai mô hình này sẽ cho bạn một con số khiến nó trông thật tệ. Mô hình kia sẽ cho bạn biết nó đã định dùng những chỉ số nào.

Sự đảo ngược đó đáng giá hơn cả bảng thông số kỹ thuật. Cả hai mô hình đều nhận một trạng thái và một tập câu hỏi có giới hạn, rồi trả về xác suất trên các lựa chọn của bạn — không mô hình nào sinh văn bản, và trên trục đó, chúng là cùng một loại công cụ. Những khác biệt đáng kể là ai vận hành nó, nó lớn đến mức nào, bạn có thể xác minh được bao nhiêu, và một cột an toàn mà mô hình nhỏ hơn, kín tiếng hơn, có thể tải xuống hoàn toàn vẫn chọn công bố.

Mỗi thứ thực sự trả lại những gì

Microsoft-Decision-1 là một API được lưu trữ, và đó là khác biệt cấu trúc đầu tiên. Trọng số không được phân phối — không tải xuống, không kho lưu trữ, không có lộ trình tinh chỉnh — và việc tích hợp nghĩa là triển khai Foundry với xác thực, thanh toán và quản trị Azure đi kèm. Nó chạy một lượt trên tối đa 32.768 token, hỗ trợ câu hỏi dạng có/không, trắc nghiệm, đánh giá, phân loại và theo rubric, và chỉ nhận đầu vào văn bản cùng đầu ra là số. Nó hỗ trợ rõ ràng một tùy chọn bỏ qua như "không thể xác định" khi bằng chứng không đủ, đó là điều khiến một ngưỡng trở nên có ý nghĩa.

Intern-Decision-0.8B là sự sắp đặt ngược lại. Đây là các trọng số Apache 2.0 với giấy phép Qwen thượng nguồn được giữ nguyên bên cạnh chúng dưới tên LICENSE-QWEN, khoảng 1,73 GB kho lưu trữ trải trên ba phân đoạn — một phân đoạn ngôn ngữ 1,50 GB, một phân đoạn thị giác 176 MB và một projector 25 MB — vừa đủ cho một GPU tiêu dùng đơn lẻ hoặc một laptop được trang bị tốt. Nó chấp nhận một trạng thái, một lược đồ gồm từ một đến mười sáu câu hỏi có tên với tối đa 62 tùy chọn mỗi câu, và tùy chọn tối đa tám hình ảnh, và tệp inference.py đi kèm của nó ghi lại hợp đồng chi tiết hơn mức mà hầu hết các mô hình đã ra mắt chịu bận tâm tới: các tùy chọn được ánh xạ lên các ký hiệu đơn token A–Z, rồi a–z, rồi 0–9; logits được đọc tại vị trí ngay trước mỗi <decision> trình giữ chỗ trong một bộ khung được kết xuất trước; một softmax được thực hiện chỉ trên các ứng viên hợp lệ của trường đó; một nhiệt độ đã được khớp được áp dụng.

Hai giấy phép không phải là cùng một giao dịch mua. Microsoft-Decision-1 mang lại cho bạn một endpoint được quản lý và không có sản phẩm nào bạn sở hữu. Intern-Decision-0.8B mang lại cho bạn một sản phẩm bạn sở hữu, không có endpoint, không có hợp đồng hỗ trợ và không có tài liệu nào ngoài chính kho lưu trữ.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

Mức trần, và khả năng hiệu chuẩn mà bạn có thể kiểm chứng

Hai con số quyết định phần lớn các tích hợp thực tế, và cả hai đều thuộc về mô hình nhỏ.

Đầu tiên là 8.192 token. Engine suy luận của Intern-Decision-0.8B từ chối đầu vào quá khổ thay vì cắt bớt nó, đây là hành vi đúng đắn đối với một bộ chấm điểm và cũng là một bức tường cứng: không có chiến lược chia nhỏ nào bảo toàn được giao kèo, bởi vì trạng thái, lược đồ và khung xương đều phải nằm trong cùng một lượt. Trần của Microsoft-Decision-1 cao gấp bốn lần, ở mức 32.768, và đó là một giới hạn do dịch vụ lưu trữ đặt ra mà bạn có thể nâng lên bằng cách cấp phát tài nguyên theo cách khác, chứ không phải một hằng số nằm trong tệp Python.

Thứ hai là hiệu chỉnh, và ở đây hướng đảo ngược. InternLM công bố nhiệt độ đã khớp là 2.747760550703 cho 0.8B, được chọn bằng tối thiểu hóa NLL trên 1,728 trường hợp hiệu chỉnh được chỉ định với 1,693 trường hợp được giữ để kiểm định, với thẻ nêu rõ rằng nhãn của bộ kiểm thử đã không được dùng để chọn nó. Phép biến đổi được áp dụng là một softmax trên các logit ứng viên của trường, tiếp theo là một softmax thứ hai trên log của phân phối đó chia cho nhiệt độ. Vì phép biến đổi chạy sau softmax đầu tiên và bảo toàn thứ tự, nó hoàn toàn không thể thay đổi argmax — nó dịch chuyển độ tin cậy, xác suất yes và giá trị kỳ vọng của một câu hỏi điểm, đồng thời giữ nguyên nhãn. Nếu pipeline của bạn đọc nhãn, nhiệt độ không có tác dụng gì. Nếu nó đọc xác suất, đặt ngưỡng cho nó, hoặc đưa nó vào một phép tính giá trị kỳ vọng, thì nhiệt độ là sự khác biệt giữa một con số có ý nghĩa và một con số không có ý nghĩa. Việc truyền temperature=1 trả về phân phối chưa hiệu chỉnh nếu bạn muốn tự khớp phân phối của riêng mình.

Microsoft-Decision-1 không có tạo tác tương đương. Tab Benchmarks của nó nêu rằng độ chính xác, sai số hiệu chuẩn, recall an toàn, tỷ lệ dương tính giả và tính nhất quán về công bằng đã được đo trên các benchmark quyết định công khai và cộng đồng cùng với các tập kiểm thử nội bộ được giữ riêng, rằng thứ tự tùy chọn đã được thay đổi, rằng các kiểm định thống kê theo cặp đã được áp dụng, và rằng mô hình "hoạt động ngang bằng với các mô hình quyết định hàng đầu và vượt trội so với các mô hình quyết định mở khác được đánh giá bằng cùng phương pháp luận." Không có sai số hiệu chuẩn nào được in ra, không có temperature để kiểm tra, và không có phân chia validation nào được mô tả. Thuộc tính duy nhất khiến một xác suất trở nên hữu ích — liệu 0,8 có nghĩa là 0,8 hay không — được khẳng định mà không được định lượng.

Đọc hai đoạn đó đối chiếu với nhau và cuộc so sánh không còn xoay quanh kích thước. Một checkpoint 0,8 tỷ tham số mà bạn có thể kiểm tra hiệu chuẩn và có thể chạy phần mềm của nó, đối với một nhóm đánh giá, là một đối tượng dễ xử lý hơn một API được lưu trữ mà thông tin hiệu chuẩn chỉ là một câu. Mô hình nhỏ cũng có một con số độ trễ được ghi nhận — trung bình 33,98 ms, trung vị 33,44 ms, p95 37,50 ms mỗi truy vấn trên một RTX 4090 duy nhất thông qua đường dẫn Hugging Face cục bộ, theo đo lường của chính InternLM — trong khi của Microsoft là thứ bạn phải đo qua triển khai của riêng mình, nơi lựa chọn giữa serverless và thông lượng được cấp phát sẽ làm con số dịch chuyển nhiều hơn cả bản thân mô hình.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Intern-Decision-0.8B. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; weights not distributed; calibration error not published; latency not published. Right column Intern-Decision-0.8B rows read: availability uploaded September 26, 2026; parameters 852,985,920 in 1.73 GB; input ceiling 8,192 tokens with oversize input rejected; weights Apache 2.0 and self-serve; Brier 0.530 and ECE 0.066; 33.98 ms mean on a single RTX 4090. A footer line reads that the InternLM figures are vendor-reported on InternLM's own harness with no independent reproduction.

Nơi mô hình nhỏ thua kém

Không có điều nào ở trên khiến Intern-Decision-0.8B trở thành lựa chọn an toàn, và chính bảng được công bố đó nói rõ vì sao. WildJailBreak ở mức 64.48 so với 96.29 của Jev là khoảng cách về độ vững trước việc từ chối lên tới ba mươi điểm, đúng ở hạng mục mà một bộ chấm điểm gặp phải đầu vào không đáng tin cậy. Một mô hình ra quyết định thường là thành phần quyết định liệu một hành động được đề xuất có được phép hay không; một mô hình dễ bị nói lách qua là một mối nguy ở vị trí đó. Việc mức thiếu hụt này bắt nguồn từ nền tảng Qwen3.5-0.8B, từ mục tiêu tinh chỉnh ra quyết định hay từ số lượng tham số nhỏ không phải là điều mà kho lưu trữ cho bạn biết, và cũng không có bài báo nào, không có công thức huấn luyện nào và không có công bố dữ liệu nào làm được điều đó.

Phần còn lại trong bảng của chính InternLM còn tâng bốc hơn cột đó và vẫn khá khiêm tốn. Trung bình trên bảy bộ kiểm thử là 79.38 đối với 0.8B, so với 84.68 của phiên bản 2B cùng dòng và 90.02 của 4B — họ mô hình này tăng dốc theo kích thước, một tín hiệu nhẹ cho thấy bảng này không được thiết kế ngược để tâng bốc mô hình chủ lực. AG News đạt 88.61 so với 89.57 của Jev, gần như ngang bằng ở bài toán phân loại chủ đề bốn lớp. Về hiệu chuẩn, 0.8B báo cáo Brier là 0.530 và sai số hiệu chuẩn kỳ vọng là 0.066, so với 0.358 và 0.095 của Jev — ECE tốt hơn, độ chính xác kém hơn đáng kể. Đó là một hồ sơ hợp lý cho một mô hình nhỏ với temperature được fit có chủ đích, và đó không phải là tổ hợp mà một đội marketing sẽ vô tình chọn công bố.

Cũng không có ngày phát hành, không có thông báo, không có bộ sưu tập tổng hợp ba checkpoint, không có endpoint nào được host ở đâu cả, và không có bất kỳ đánh giá độc lập nào. Space demo phản hồi 401. Mô tả đúng về Intern-Decision-0.8B là một checkpoint đã phát hành với những tuyên bố chưa được kiểm chứng — tình huống này tốt hơn so với một API nằm trong danh sách chờ, vì bạn có thể đo lường nó trong một buổi chiều, nhưng điều đó có nghĩa toàn bộ gánh nặng xác thực thuộc về bạn.

Lựa chọn, và OrcaRouter nằm ở đâu

Chọn Microsoft-Decision-1 nếu rào cản là mua sắm hoặc quy mô: bạn cần xác thực Azure, hóa đơn hợp nhất và đánh giá Responsible AI trước khi bất cứ thứ gì được đưa vào sản xuất; bạn cần ngữ cảnh 32K; bạn cần một điểm cuối mà bạn không vận hành; hoặc bạn cần đường dẫn từ chối (abstention path) được thiết kế sẵn thay vì tự làm thủ công. Chấp nhận đổi lại rằng bạn không thể chạy nó, không thể tinh chỉnh nó, không thể kiểm tra hiệu chuẩn của nó, và sẽ phải tự đo lường tuyên bố cốt lõi của nó.

Chọn Intern-Decision-0.8B nếu rào cản là chi phí, bộ nhớ hay quyền kiểm soát: bạn muốn một bộ chấm điểm theo giấy phép Apache-2.0 vừa vặn trong 1,73 GB, chạy trên phần cứng bạn đã có sẵn, luôn cho ra cùng một nhãn mỗi lần chạy, và có thể đổi sang phiên bản anh em 2B hoặc 4B chỉ bằng cách thay đường dẫn checkpoint. Đổi lại, hãy chấp nhận bức tường 8.192 token, cột WildJailBreak, và việc không ai ngoài InternLM từng tái lập được bất cứ điều gì trên thẻ mô hình.

Lời khuyên thẳng thắn là hãy làm cả hai, vì chúng đủ rẻ để việc tranh cãi gần như không đáng bàn. Bản thân lời gọi chấm điểm không phải thứ chúng tôi định tuyến — một mô hình trả về xác suất thay vì văn bản thì không phải là chat completion, và cả hai đều không nằm trong danh mục của chúng tôi. Thứ OrcaRouter mang lại là nửa còn lại của vòng lặp: hơn 200 mô hình phía sau một khóa tương thích OpenAI để soạn thảo tiêu chí, tạo ra các câu trả lời ứng viên, hoặc phát ra lời gọi công cụ mà bộ chấm điểm của bạn sắp chấm, với mức giá niêm yết của nhà cung cấp được chuyển nguyên với 0% phí gia tăng, nên khi nhà cung cấp giảm giá một mô hình tạo sinh thì bên chúng tôi cập nhật ngay trong cùng ngày. Tự động chuyển đổi dự phòng ở đây quan trọng hơn bình thường, vì một pipeline chấm điểm mọi thứ nó thấy không có dư địa để thử lại một lời gọi bị treo, và DSL định tuyến cho phép bạn gửi một prompt giám khảo đến nhiều mô hình viết rồi hợp nhất mức đồng thuận của chúng thay vì tin vào chỉ một mô hình.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filter controls for input modalities, context length, input price, status, series and supported parameters, and a search field. No decision-scoring model appears in the listing.

Điểm mấu chốt

Microsoft-Decision-1 đạt trạng thái phát hành chính thức trên Microsoft Foundry vào ngày 8 tháng 10 năm 2026: được lưu trữ, chỉ hỗ trợ văn bản, 32.768 token, xây dựng trên Qwen3.5-9B, với một đoạn phương pháp luận thay cho bảng đánh giá chuẩn. Intern-Decision-0.8B là một checkpoint Apache-2.0 dung lượng 1,73 GB được tải lên vào ngày 26 tháng 9 năm 2026, công bố chỉ số Brier 0,530, ECE 0,066, temperature fit 2,747760550703, 33,98 ms trên 4090 — và điểm WildJailBreak 64,48 mà không ai yêu cầu nó in ra. Nếu bạn chỉ có thể xác thực một điều trước khi áp dụng một trong hai, hãy xác thực hiệu chuẩn trên các trường hợp đã được gán nhãn của chính bạn; đó là con số mà cả hai nhà cung cấp để lại cho bạn tự tìm.