
Intern-Decision-2B so với MiniCPM5-2B: Hai checkpoint 2B, cách nhau hai mươi ngày, hai cách trái ngược để dùng các tham số
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 584 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 187 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
internlm/Intern-Decision-2B và openbmb/MiniCPM5-2B có cùng kích thước, được phát hành cách nhau hai mươi ngày, cấp phép theo cùng một cách, nhưng lại được xây dựng cho những công việc chẳng giống nhau chút nào. Checkpoint của InternLM là một bộ chấm điểm quyết định với 2,213,241,664 tham số: nó nhận một trạng thái cùng các câu hỏi có kiểu, chạy một lượt lan truyền xuôi, và trả về các xác suất đã hiệu chỉnh mà không sinh ra token nào, đồng thời từ chối mọi đầu vào vượt quá 8,192 token. Còn của OpenBMB là 2,516,756,480 tham số của một mô hình tổng quát dày đặc: một Llama 42 lớp bắt nguồn từ công thức MiniCPM5, nhận 131,072 token ngữ cảnh, viết mã, gọi công cụ và làm toán, với Chỉ số Trí tuệ Artificial Analysis là 12,5 và 726,518 lượt tải xuống trong tháng trước. Chúng tốn cùng một chi phí để tải về, nhưng mang lại những thứ hoàn toàn khác nhau.
Phần thú vị của cặp đôi này không nằm ở khoảng cách benchmark — hầu như chẳng có benchmark nào trùng nhau để so sánh. Mà nằm ở chỗ ngân sách 2,2 tỷ và 2,5 tỷ tham số có thể được dùng vào những gì, và lựa chọn đó cho bạn biết điều gì về việc mô hình nào đã hoàn thiện. MiniCPM5-2B là mô hình thứ hai trong dòng của nó, nối tiếp MiniCPM5-1B từ tháng Năm, và nó ra mắt với đầy đủ bộ máy phát hành. Intern-Decision-2B nằm ở giữa trong ba kích cỡ mà InternLM đẩy lên Hugging Face lúc 05:36 UTC ngày 26 tháng 9 năm 2026 mà không có thông báo nào, và bộ máy phát hành của nó — một codebase huấn luyện, một gói đánh giá được xác minh bằng hash, một benchmark hiệu chuẩn 96 trường hợp — chỉ mới được công khai vào sáng nay lúc 08:58 UTC.
Hai ngân sách đó đã đi đâu
Cả hai mô hình đều là bản tinh chỉnh từ kiến trúc của người khác, và cả hai đều có khoảng 2,5 tỷ tham số. Điểm tương đồng chỉ dừng lại ở đó.

MiniCPM5-2B là một Transformer dày đặc với 42 lớp, kích thước ẩn 2.048, 16 đầu chú ý, kích thước trung gian 6.144, vốn từ vựng 130.560 token và ngữ cảnh 131.072 token, được huấn luyện trên hỗn hợp các tập dữ liệu mở mà OpenBMB công bố cùng với nó: UltraX dùng cho tiền huấn luyện web, UltraData-Code với quản lý mã theo tầng L0–L3, UltraData-Math, và 500.000 mẫu SFT tác tử cùng hơn 80.000 mẫu RL trong UltraData-RL-2609. Quá trình hậu huấn luyện của nó chạy SFT, rồi các giáo viên RL chuyên biệt về toán học, mã và các tác vụ tác tử, sau đó chưng cất on-policy trở lại thành một mô hình duy nhất. Đây là một mô hình đa dụng mà toàn bộ ngân sách tham số của nó được phơi bày dưới dạng năng lực mà bạn có thể gợi ý.
Intern-Decision-2B là một Qwen3_5ForConditionalGeneration với 24 lớp — một mô hình lặp lại theo tỷ lệ ba lớp attention tuyến tính trên một lớp attention đầy đủ — kích thước ẩn 2.048, 8 head truy vấn so với 2 head khóa-giá trị, chiều head 256, một lớp dự đoán đa token được giữ lại và giới hạn embedding 262.144 vị trí. Nó đi kèm với một tháp thị giác 612,5 MB và một bộ chiếu 50,3 MB. Gần như không có phần nào trong ngân sách đó khả dụng cho bạn dưới dạng prompt: mô hình trả lời một lược đồ câu hỏi cố định, và kiến trúc của nó là cơ chế phân phối cho một softmax, chứ không phải một trình tạo văn bản.
Một chi tiết từ repository mới được InternLM công bố đáng để tách ra bàn riêng, vì nó định hình lại nhãn đa phương thức trên model card. Việc decision tuning “tinh chỉnh backbone ngôn ngữ của Qwen3.5 trong khi đóng băng vision tower và projector”. Cả hai checkpoint decision 2B và 4B đều mang một vision shard có kích thước chính xác 612.517.440 byte — cùng kích thước ở cả hai — điều này nhất quán với việc các thành phần đó được kế thừa từ base Qwen thay vì được huấn luyện. Đường xử lý hình ảnh là có thật và dùng được, nhưng nó không phải là thứ mà decision tuning của InternLM dồn công sức vào. Nếu workload của bạn chỉ là chấm điểm decision bằng văn bản, thì khoảng 660 MB trong bản tải xuống 4,46 GB đó chẳng giúp gì cho bạn.
Bảng điểm

• Tham số — Intern-Decision-2B 2.213.241.664 ở BF16 cùng với khoảng 660 MB cho tháp thị giác và bộ chiếu, khoảng 4,46 GB kho lưu trữ; MiniCPM5-2B 2.516.756.480 ở BF16, một tệp safetensors 5,03 GB.
• Ngữ cảnh — 8.192 token dành cho Intern-Decision-2B, bị từ chối mà không cắt ngắn khi vượt quá mức đó; 131.072 token dành cho MiniCPM5-2B.
• Đầu ra — một phân phối đã hiệu chỉnh cộng với một argmax cho mỗi trường, không có văn bản nào cả; văn bản được sinh ra, từng token một.
• Huấn luyện — tinh chỉnh quyết định cho một backbone Qwen3.5-2B với tháp thị giác được đóng băng, dữ liệu huấn luyện không được tiết lộ; một giai đoạn đầy đủ gồm tiền huấn luyện, huấn luyện trung gian và SFT tư duy sâu 400 tỷ token, tiếp theo là RL và chưng cất on-policy, cùng với các kho ngữ liệu được công bố kèm theo.
• Bằng chứng đã công bố — một bảng của nhà cung cấp gồm bảy bộ, đạt trung bình 84,68 với Brier 0,437 và ECE 0,100, không được bất kỳ bên thứ ba nào tái lập, một lượt thích và không có lượt tải xuống nào; một thẻ OpenBMB đạt trung bình 53,9 trong bộ so sánh của chính nó và Artificial Analysis Intelligence Index độc lập ở mức 12,5, với 726.518 lượt tải xuống trong tháng trước.
• Giấy phép — Apache-2.0 với các điều khoản Qwen thượng nguồn được giữ nguyên dưới tên LICENSE-QWEN, và không có giấy phép nào được nêu trên kho mã nguồn; Apache-2.0 xuyên suốt, bao gồm cả mã nguồn.
Mỗi cái thực sự giỏi hơn ở điểm nào, và không hề sát nút.
Sự so sánh này bất đối xứng đến mức trở thành một lỗi phạm trù, nên sẽ hữu ích hơn nếu gọi tên các công việc.
MiniCPM5-2B thắng mọi thứ liên quan đến việc tạo ra câu trả lời thay vì chọn một câu trả lời. Nó viết mã; Intern-Decision-2B không có đường xử lý mã. Nó xử lý ngữ cảnh 131.072 token; Intern-Decision-2B dừng ở 8.192 và báo lỗi ầm ĩ. Nó gọi công cụ, với điểm BFCL v4 là 66,6 trên bảng của chính OpenBMB, và nó làm toán, với MATH-500 đạt 94,6 và GPQA-Diamond đạt 70,2 — những con số từ thẻ của nhà cung cấp, với hàng GPQA mang một chú thích do chính thẻ đó cung cấp. Nó đạt 70,8 trên MMLU-Pro và 84,7 trên MMLU-Redux. Nó chạy trong llama.cpp và MLX, được phát hành dưới các biến thể GGUF, GPTQ và DSpark, và có một Space demo trên Hub là công khai, không giống như lỗi 401 mà thẻ của Intern-Decision trỏ tới.
Intern-Decision-2B thắng đúng hai thứ, và chúng chính là lý do nó tồn tại. Thứ nhất, một quyết định tập đóng với schema do bạn tự viết sẽ trả về một xác suất mà bạn có thể đặt ngưỡng, trong một lượt lan truyền xuôi duy nhất, trong khoảng 33 mili giây, không cần parser và không lấy mẫu — một dạng mà MiniCPM5-2B không thể tạo ra trừ khi sinh văn bản rồi hy vọng con số nằm trong đó cư xử ngoan ngoãn. Thứ hai, nó là một sản phẩm tái lập được: kho lưu trữ giờ đây mang theo mục tiêu huấn luyện, bảy bộ kiểm tra độ chính xác với mã băm SHA-256 và số hàng của từng bộ, mã tính điểm, các script khớp nhiệt độ và phát lại, cùng một benchmark hiệu chỉnh phân phối 96 trường hợp với trình tạo và bộ tính điểm ngoại tuyến riêng. Hướng dẫn đánh giá của InternLM lưu ý rằng các preset được phát hành bị ràng buộc với backend XTuner và rằng kết quả HF nên được báo cáo như một thiết lập thực thi khác — đúng kiểu lưu ý mà một bộ công cụ tái lập tồn tại để có thể kiểm chứng được.

Ai nên tải bản nào
Nếu bạn có một tác vụ liên quan đến việc đọc một thứ gì đó dài, viết một thứ gì đó, hoặc trả lời một câu hỏi mà các lựa chọn bạn chưa liệt kê sẵn từ trước, thì MiniCPM5-2B chính là mô hình dành cho bạn và không cần phải cân nhắc gì thêm. Đây là một mô hình đa dụng thuộc lớp 2B đã hoàn thiện, với một hệ sinh thái thực sự, dữ liệu mở đằng sau nó cùng một danh sách đánh giá độc lập, và bạn chẳng tốn gì để thử — các bản dựng GGUF và MLX đã có sẵn trên Hub.
Nếu bạn có một tác vụ thực sự là việc chọn lựa giữa các đáp án đã biết — định tuyến một ticket, phân loại một email hỗ trợ, dán nhãn một ứng viên, cho điểm một ý định trên một thang bậc thứ tự — thì mô hình sinh chính là công cụ sai lầm, và Intern-Decision-2B là cái thú vị hơn trong hai cái dù gần như không ai đã chạy nó. Một xác suất mà bạn có thể đặt ngưỡng thì vận hành rẻ hơn, dễ kiểm toán hơn và không thể sinh ảo giác, và việc checkpoint đến kèm một bộ công cụ tái lập thay vì một bài đăng bảng xếp hạng khiến nó trở thành cái được ghi chép đầy đủ hơn trong hai cái trên trục quan trọng khi bạn phải bảo vệ lựa chọn đó.
Cả hai mô hình đều không có trên OrcaRouter. Trang mô hình của chúng tôi cho Intern-Decision-2B trả về lỗi 404 và không có tuyến MiniCPM5-2B nào; không có gì ở đây là tuyên bố về tính khả dụng, và cả hai đều đồng nghĩa với việc bạn phải tự chạy suy luận của riêng mình. Giải pháp thay thế thiết thực nằm ở các mô hình quyết định được lưu trữ: Jev 1.13 của TypeSafe, mô hình mà InternLM đã lấy làm chuẩn đối chiếu cho toàn bộ dòng sản phẩm của mình, có trong danh mục với giá $0.042 cho mỗi triệu token đầu vào, ngữ cảnh 65K và thời gian đến token đầu tiên P50 là 178 ms. Và nếu thứ bạn thực sự cần là một mô hình đa dụng cùng phân khúc kích thước với MiniCPM5-2B mà không phải gánh vác công việc vận hành, thì tuyến Qwen được lưu trữ nhỏ nhất của chúng tôi có kích thước lớn hơn vài lần nhưng chỉ là một khóa trong hơn 200 mô hình, với giá niêm yết của nhà cung cấp được chuyển nguyên không thêm phụ phí và tự động chuyển đổi dự phòng phía sau nó.
Con số duy nhất mà nó
Đây không phải là 84.68 so với 53.9. Hai giá trị trung bình đó đến từ những bộ kiểm thử khác nhau, được đo bởi những phòng thí nghiệm khác nhau, và trong một trường hợp là bởi một phòng thí nghiệm chưa từng để ai kiểm tra lại các con số của mình. Con số quyết định là 8.192. Nếu trạng thái của bạn nằm gọn trong tám nghìn token và câu trả lời của bạn vốn đã là một danh sách, thì Intern-Decision-2B là một công cụ chính xác với một bộ dụng cụ tái tạo và một điểm bất thường về hiệu chuẩn mà bạn nên lưu tâm — sai số hiệu chuẩn kỳ vọng 0.100 của nó là tệ nhất trong ba kích cỡ mà InternLM công bố, so với 0.066 của mô hình có kích cỡ bằng một nửa, nên hãy tự khớp temperature của riêng bạn trước khi tin vào một giá trị độ tin cậy. Nếu trạng thái của bạn không nằm gọn, thì câu hỏi đã kết thúc trước cả khi các phép đánh giá bắt đầu, và MiniCPM5-2B chính là câu trả lời.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
