
MiniCPM5-2B vs Granite 4.2 3B: Chuyên gia suy luận 3B vs Bộ công cụ Agent 2.5B mới
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ModelBest đưa Granite 4.2 3B lên chính bảng xếp hạng của MiniCPM5-2B trước khi bất kỳ ai yêu cầu. Model card của MiniCPM5-2B mà OpenBMB công bố khi các weights âm thầm được phát hành trên Hugging Face liệt kê mô hình suy luận nhỏ nhất của IBM trong số các baseline so sánh của họ, và trên bộ bài đó, MiniCPM5-2B đạt trung bình 53,9 so với 42,7 của Granite 4.2 3B. Đó là con số đối đầu trực tiếp duy nhất mà một trong hai bên công bố cho cặp đôi này, khiến nó trở thành điểm khởi đầu tự nhiên — và cũng là nơi tự nhiên để cẩn trọng. Cả hai mô hình đều nhỏ, dùng giấy phép Apache-2.0, là bản phát hành open-weights tự lưu trữ nhắm vào cùng một công việc cuối năm 2026; chúng chỉ tiếp cận từ hai hướng đối lập, một bên được huấn luyện để suy luận và một bên được huấn luyện để hành động.
Hai bản phát hành này có nhiều điểm trùng khớp hơn những gì marketing của các nhà cung cấp gợi ý. MiniCPM5-2B được công bố tại Hội nghị Trí tuệ Nhân tạo Thế giới vào ngày 19 tháng 7 với tư cách là sản phẩm chủ lực trên thiết bị của ModelBest và OpenBMB — một mô hình dense thuộc lớp 2B được định vị làm nền tảng tác nhân cho điện thoại, PC và buồng lái thông minh — và các trọng số của nó xuất hiện vào ngày 6 và 7 tháng 9 mà không có bất kỳ sự kiện ra mắt nào, dưới giấy phép Apache-2.0, cùng với các checkpoint GGUF, MLX, GPTQ, base, SFT và draft cùng dữ liệu huấn luyện đằng sau chúng. Granite 4.2 3B là mô hình suy luận cỡ laptop của IBM, có trọng số được đưa lên Hugging Face vào đầu tháng 8 và thẻ mô hình cùng blog kỹ thuật được công bố vào ngày 25 tháng 8. Cả hai vẫn chưa được bất kỳ điểm chuẩn độc lập nào đánh giá, đó là lý do tại sao các nhãn nguồn dưới đây quan trọng hơn các con số.
Hai bản phát hành có vần điệu
Granite 4.2 3B là một mô hình suy luận dense độc lập, được hậu huấn luyện từ Granite-4.1-3B-Base. Mô hình có 40 tầng với cơ chế grouped-query attention, ngữ cảnh gốc 128K mà IBM mở rộng lên 512K trong giai đoạn tiền huấn luyện thứ năm, cùng ba chế độ tư duy cho từng truy vấn — tư duy đầy đủ theo mặc định, chế độ nỗ lực thấp và luồng không tư duy. Thẻ mô hình nêu rõ điều mà nó không phải: không giống các bản 8B và 30B trong cùng dòng Granite 4.2, bản 3B cố tình bỏ qua khối học tăng cường tác tử (agentic RL) chuyên dụng được huấn luyện trong các môi trường SWE-agent, terminal và tìm kiếm, vì vậy IBM không liệt kê kết quả SWE-bench nào và định vị mô hình như một chuyên gia suy luận thay vì một tác tử. Mô hình chạy trên vLLM, SGLang, Transformers, GGUF và Ollama (granite4.2:3b), chiếm khoảng 6-8GB bộ nhớ ở dạng bfloat16 hoặc dưới 2GB khi lượng tử hóa, và không có API lưu trữ sẵn. Các con số nổi bật — AIME 2025 đạt 78.33, GPQA đạt 54.80, LiveCodeBench v6 đạt 69.71, MMLU-Pro đạt 67.84 — đều do IBM công bố và chưa được tái lập độc lập tính đến thời điểm hiện tại.

MiniCPM5-2B thay vào đó là một mô hình hoàn chỉnh định hướng tác tử (agent-oriented). Thẻ mô tả một transformer dense với tổng cộng 2,52B tham số (1,98B tham số phi-embedding), 42 lớp với kích thước ẩn 2048, grouped-query attention với 16 đầu query và hai đầu KV, cùng kiến trúc LlamaForCausalLM tiêu chuẩn không có kernel tùy chỉnh. Thông điệp ra mắt nhấn mạnh năng lực tác tử — giai đoạn agent mid-training ở quy mô 200B, một tập dữ liệu agent-SFT lớn, và căn chỉnh agent RL, hoàn thiện với On-Policy Distillation gộp mười sáu mô hình chuyên gia RL trở lại thành một mạng dense nhỏ duy nhất — cùng với ngữ cảnh dài tự nhiên và các chế độ phản hồi nhanh/cân nhắc lai. Cấu hình phát hành của nó thiết lập cửa sổ ngữ cảnh 131.072 token (tài liệu tháng 7 quảng bá 512K; cấu hình phát hành không chứa con số đó), và thẻ tuyên bố hỗ trợ gọi công cụ kiểu XML với trình phân tích SGLang tích hợp sẵn. Trên bảng đánh giá riêng của mình, nó báo cáo điểm trung bình nội bộ 53,9 trên tập so sánh do nhà cung cấp chọn lọc, AIME 2025/2026 đạt 86,5, MATH-500 đạt 94,6, và 46,4 trên SWE-bench Verified do nhà cung cấp chạy — con số sẽ rất ấn tượng đối với một mô hình dense 2,5B nếu vượt qua được kiểm thử độc lập.

Ai đó đã in bài đối đầu này rồi.
Vì bảng điểm giữa các nhà cung cấp chủ yếu là so sánh không cùng hạng mục, thứ hữu ích nhất trong cuộc đối đầu này là thứ mà chính ModelBest đã in ra: {{1}}bảng thông số của MiniCPM5-2B liệt kê granite-4.2-3B trong số các đường cơ sở của mình và báo cáo MiniCPM5-2B đạt trung bình 53,9 so với 42,7 của Granite trên bộ đánh giá đó{{/1}}. Hãy đọc nó đúng như bản chất của nó — {{2}}một nhà cung cấp chạy cả hai mô hình trên một bộ đánh giá mà họ tự chọn, chưa được kiểm chứng độc lập, với mọi động cơ để mô hình của mình chiến thắng{{/2}}. {{3}}Đó không phải là một phán quyết cuối cùng{{/3}}. Điều nó thực sự cho bạn biết là {{4}}ModelBest đủ tự tin để đưa mô hình 3B của đối thủ lên bảng thông số của mình{{/4}}, và {{5}}khoảng cách mà họ tuyên bố là lớn nhất nằm chính xác ở nơi mà quá trình huấn luyện của họ đầu tư: các hạng mục agentic và ngữ cảnh dài{{/5}}. {{6}}Hãy coi đó là một nhận định mang tính định hướng{{/6}}, và {{7}}cân nhắc các tuyên bố trên bảng thông số riêng của IBM{{/7}} trước khi bạn quyết định bất cứ điều gì dựa trên nó.
Bảng điểm, được dán nhãn trung thực.
• Release — MiniCPM5-2B: công bố ngày 19 tháng 7 năm 2026; trọng số được phát hành ngày 6–7 tháng 9, lặng lẽ. Granite 4.2 3B: trọng số đầu tháng 8; thẻ mô hình và blog kỹ thuật ngày 25 tháng 8 năm 2026.
• Vai trò — MiniCPM5-2B: nhấn mạnh vào agent trên thiết bị và việc sử dụng công cụ, theo ModelBest. Granite 4.2 3B: chuyên về suy luận, chủ đích không theo hướng agent, theo IBM.
• Kích thước — MiniCPM5-2B: tổng 2.52B / 1.98B non-embedding, 42 lớp. Granite 4.2 3B: ~3B dense, 40 lớp.
Ngữ cảnh — MiniCPM5-2B: 131,072 token trong cấu hình xuất xưởng. Granite 4.2 3B: 128K gốc, có thể mở rộng lên 512K.
• Hậu huấn luyện — MiniCPM5-2B: SFT tư duy sâu, RL chuyên biệt, On-Policy Distillation. Granite 4.2 3B: SFT suy luận, GRPO RL và RLHF; không có khối agentic-RL.
• Bằng chứng — MiniCPM5-2B: Số liệu trên thẻ ModelBest, chưa có lần chạy độc lập. Granite 4.2 3B: Số liệu trên thẻ IBM, chưa được tái lập; AIME 2025 78.33, GPQA 54.80, LiveCodeBench v6 69.71.

Bảng điểm ở trên có cùng nguồn dữ liệu với phần bài viết: mọi con số trên đó đều do nhà cung cấp tự báo cáo, và phép so sánh trong cùng bộ đánh giá duy nhất mà một trong hai nhà cung cấp đã công bố chính là phép so sánh trên thẻ của riêng ModelBest.
Chuyên gia lập luận so với ngăn xếp tác tử
Trước khi xem điểm số, hãy xác định loại mô hình nhỏ mà khối lượng công việc của bạn cần, vì hai mô hình này trả lời những câu hỏi khác nhau. Granite 4.2 3B được xây dựng cho khả năng suy luận và ngữ cảnh dài trên phần cứng hạn chế: cửa sổ ngữ cảnh gốc 128K có thể mở rộng đến 512K, ba chế độ tư duy, mức chiếm dụng vừa vặn với một chiếc laptop, và một quyết định rõ ràng là bỏ qua đào tạo agentic. Nếu công việc của bạn là phân tích tài liệu dài, ngữ cảnh ở quy mô repository, hoặc suy luận đa bước đáng tin cậy trên một cỗ máy nhỏ, thì đó là một sự kết hợp hợp lý, và quyết định của IBM khi không gắn các tuyên bố agentic lên bản 3B là một lý do để tin vào model card của nó, chứ không phải là một khoảng trống. MiniCPM5-2B được xây dựng với trọng tâm ngược lại: hành vi agentic và sử dụng công cụ trên một thiết bị — quy trình huấn luyện của nó đọc giống như một danh sách những thứ mà Granite 4.2 3B cố tình loại bỏ. Nếu công việc của bạn là một vòng lặp agent trên thiết bị chuyên gọi công cụ, duy trì các cuộc hội thoại dài và chuyển đổi giữa phản hồi nhanh với phản hồi có cân nhắc, thì đó chính là bộ công nghệ dành cho bạn, và nó đi kèm với sự không chắc chắn tăng thêm của một checkpoint mới chỉ một tuần tuổi với model card chưa được xác minh.
Dữ liệu mà OpenBMB đã mở, IBM thì không.
Sự khác biệt ít hào nhoáng nhất lại là điều quan trọng nhất đối với các nhóm muốn tinh chỉnh mô hình. OpenBMB đã phát hành kho ngữ liệu huấn luyện của MiniCPM5-2B cùng với các bộ trọng số — dòng dữ liệu UltraData, bao gồm Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math cùng các bộ dữ liệu agent SFT và RL — tất cả đều dưới giấy phép Apache-2.0. Điều này biến mô hình 2B từ một hộp đen thành một công thức có thể tái tạo: bạn có thể thấy quá trình hậu huấn luyện agent được xây dựng trên nền tảng nào và tiếp tục phát triển nó trên miền dữ liệu của riêng mình. IBM đã mã nguồn mở các bộ trọng số của Granite 4.2 3B và cung cấp bản mô tả kỹ thuật chi tiết về cách mô hình được xây dựng, nhưng không công bố dữ liệu huấn luyện. Đối với một tổ chức muốn sở hữu mô hình thay vì thuê nó, sự bất đối xứng đó là thực tế. Và MiniCPM5-2B đi kèm với câu chuyện triển khai mà Granite không thể sánh được ở kích thước này: khả năng thích ứng ngay từ ngày đầu trên chín dòng chip thông qua cộng đồng FlagOS của ModelBest, từ Huawei Ascend đến NVIDIA cho đến một loạt các bộ tăng tốc nội địa, cùng với ARM — một tín hiệu cho thấy ModelBest kỳ vọng mô hình 2B sẽ chạy ở đâu đó không chỉ trên GPU NVIDIA.
Thực tế định tuyến
Hiện cả hai mô hình đều không nằm trong danh mục mô hình lưu trữ (hosted catalog), nên sự so sánh này thuộc về thế giới tự lưu trữ — nhưng đó lại chính là nơi một lớp định tuyến vẫn xứng đáng tồn tại như một lưới an toàn, hơn là một cơ chế phân phối. Khi một nhóm muốn thử một mô hình agentic 2B mới ra đời được một tuần, so với một mô hình suy luận 3B, trên một khối lượng công việc hệ thống đang phục vụ, bước đi dễ rút lại là trỏ một đường thử nghiệm vào một bản dựng MiniCPM5-2B tự lưu trữ thông qua một API duy nhất có khả năng chuyển đổi dự phòng tự động, trong khi hệ thống production vẫn giữ nguyên mô hình đã được kiểm chứng — ngăn xếp mới có thể vấp phải sự cố mà không kéo sập bất cứ thứ gì, còn giá niêm yết của nhà cung cấp cho các mô hình lưu trữ mà bạn đem ra so sánh sẽ được chuyển qua với mức phụ phí 0%, nên phép thử A/B vẫn rẻ. Lớp định tuyến không hề lưu trữ mô hình nào trong hai mô hình này; nó chỉ giúp cuộc thử nghiệm vận hành an toàn và dễ dàng đảo ngược.
Bạn thực sự nên chạy mô hình nhỏ nào?
Chạy Granite 4.2 3B nếu khối lượng công việc của bạn là suy luận ngữ cảnh dài trên một thiết bị tầm laptop và bạn muốn ba chế độ tư duy, trần 512K và một thẻ mô hình trung thực nói rõ chính xác những gì mô hình 3B không được huấn luyện để làm. Chạy MiniCPM5-2B nếu khối lượng công việc của bạn là một tác nhân trên thiết bị mang tính tương tác, gọi công cụ, nơi một mô hình 2.5B nằm gọn trong ngân sách bộ nhớ của bạn — nhưng hãy dành thời gian để tái tạo các con số quảng bá của nó trước khi tin tưởng, vì điểm trung bình 53.9 và tuyên bố 46.4 trên SWE-bench mới chỉ là của nhà cung cấp, chưa được ai khác xác nhận. Hai điều sẽ phân định cuộc so tài này nhanh hơn bất kỳ ý kiến nào: một lần chạy độc lập MiniCPM5-2B để xác nhận hoặc bác bỏ các tuyên bố về năng lực tác nhân, và các con số suy luận của IBM trụ vững qua sự tái tạo của cộng đồng. Cho đến khi một trong hai điều đó xảy ra, Granite 4.2 3B là mô hình nhỏ an toàn hơn, được tài liệu hóa đầy đủ hơn ở thời điểm hiện tại, còn MiniCPM5-2B là ván cược thú vị hơn.
