
MiniCPM5-2B vs Gemma 4 12B: Đứng đầu bảng xếp hạng nhóm dưới 4B đối đầu với mô hình đa năng 12B của Google
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
Tài liệu ra mắt của MiniCPM5-2B có một câu nghe như giải quyết mọi tranh luận ngay từ khi chúng bắt đầu: tại Hội nghị Trí tuệ Nhân tạo Thế giới vào ngày 19 tháng 7, ModelBest và OpenBMB gọi mô hình này là mô hình đứng đầu bảng xếp hạng Artificial Analysis trong nhóm dưới 4B tham số, và trọng số mở của nó hiện đã âm thầm được phát hành trên Hugging Face. Gemma 4 12B là câu trả lời của Google đến từ một hạng cân hoàn toàn khác — một mô hình đa phương thức đa dụng, dense, không bộ mã hóa, 11,95B tham số, phát hành ngày 3 tháng 6, nhận đầu vào là văn bản, hình ảnh, âm thanh và video, đồng thời đã có nhiều tháng được cộng đồng triển khai phía sau. So sánh chúng không phải là bài tập đọc thông số kỹ thuật; đó là quyết định về việc bạn đang phân phối đến thiết bị nào, bởi vì một mô hình dẫn đầu hạng kích thước của nó và một mô hình đơn giản là lớn hơn đang trả lời những câu hỏi phần cứng khác nhau.
Thời điểm chính là lý do khiến cuộc so sánh này tồn tại. MiniCPM5-2B đã được giới thiệu tại WAIC vào tháng 7 như một sản phẩm — một câu chuyện về chip cũng nhiều như một câu chuyện về mô hình, với chín đối tác silicon đồng hành ngay từ ngày đầu từ cộng đồng FlagOS của họ — và các bộ trọng số được hứa hẹn sẽ phát hành "trong tương lai gần." Bảy tuần sau, kho lưu trữ openbmb/MiniCPM5-2B xuất hiện trên Hugging Face (nhật ký thay đổi của OpenBMB ghi ngày phát hành là 7 tháng 9), dưới giấy phép Apache-2.0, truy cập tự do, với checkpoint BF16, GGUF, MLX, GPTQ, các checkpoint nền tảng và SFT cùng các tập dữ liệu huấn luyện đều nằm trong cùng một bộ sưu tập. Không có thông cáo báo chí, không có sự kiện ra mắt. Tính đến thời điểm bài viết này, model card chính là lời thông báo, và vẫn chưa có kết quả benchmark độc lập nào được công bố — mọi số liệu định lượng về bản 2B dưới đây hoặc là kết quả tự tái tạo của ModelBest, hoặc được lấy từ bản chụp nhanh Artificial Analysis mà họ trích dẫn. Ngược lại, Gemma 4 12B ra mắt qua bộ máy truyền thông thông thường của Google và đã được tải xuống hàng triệu lần. Khoảng trống bằng chứng đó là một phần của phép so sánh, chứ không phải là một chú thích phụ bên lề.
Điều gì vừa thay đổi ở mỗi bên?
MiniCPM5-2B là mô hình thứ hai trong dòng MiniCPM5, tiếp nối MiniCPM5-1B mà OpenBMB đã mã nguồn mở vào ngày 19 tháng 5. Thẻ mô hình mô tả một transformer dense với tổng cộng 2.516.756.480 tham số (1.981.982.720 tham số không bao gồm embedding — con số đủ để gắn nhãn "lớp 2B"), 42 tầng với kích thước ẩn 2048, grouped-query attention với 16 query head và chỉ 2 KV head, cùng bộ từ vựng 130.560. Đây là kiến trúc LlamaForCausalLM thuần túy — thẻ mô hình ghi rõ rằng không cần kernel tùy chỉnh và không cần fork mã nguồn mô hình — và toàn bộ checkpoint được phân phối dưới dạng một phân đoạn safetensors BF16 duy nhất. Điểm thiết kế thú vị nằm ở giai đoạn hậu huấn luyện: SFT trên 400B token dữ liệu suy luận sâu, sau đó là On-Policy Distillation gộp mười sáu mô hình chuyên gia RL, năm trong số đó có tính năng agent, trở lại thành một mạng dense nhỏ duy nhất. Thẻ mô hình ghi nhận RL + OPD mang lại mức tăng trung bình 10,96 điểm cho các tác vụ suy luận và tổng quát, và 6,96 điểm cho các tác vụ agent — các mức chênh lệch nội bộ, nhưng chúng giải thích hình dạng của mô hình này: một mô hình 2B được xây dựng để làm agent trên thiết bị, phát ra các lời gọi công cụ kiểu XML một cách tự nhiên.

Gemma 4 12B chiếm một vị trí khác biệt trong dòng sản phẩm của Google. Nó là đứa con giữa trong gia đình Gemma 4 — xếp trên các mẫu E2B và E4B hướng đến edge, dưới mô hình 26B MoE và mô hình 31B tiên phong — đồng thời là thành viên duy nhất được xây dựng trên thiết kế không có encoder: các mảng ảnh thô và dạng sóng âm thanh được chiếu thẳng vào không gian token, nên chỉ cần một mô hình dense là đủ xử lý đầu vào văn bản, hình ảnh, âm thanh và video mà không cần thêm một encoder riêng biệt nào. Mô hình có cửa sổ ngữ cảnh 256K, khả năng gọi công cụ, chế độ suy luận tùy chọn và các bộ dự thảo dự đoán đa token giúp tăng tốc giải mã ngay từ bên trong checkpoint. Nó được cấp phép Apache-2.0, có thể chạy thực tế trên phần cứng tầm 16GB (khoảng 8GB ở mức 4-bit), và trang Hugging Face của nó cho thấy hàng triệu lượt tải xuống mỗi tháng.

Tuyên bố về thứ hạng, và nhóm kích thước mà nó bỏ sót
Điểm nhấn của ModelBest cho MiniCPM5-2B là Chỉ số Trí tuệ Artificial Analysis đạt 17, đứng đầu trong số các mô hình dưới 4B tham số tại thời điểm ra mắt. Cần đặt hai lưu ý ngay bên cạnh con số này. Điểm số phản ánh snapshot v4.1 của AA nên không thể so sánh trực tiếp với các giá trị chỉ số từ các snapshot trước đó; đây cũng là con số thời điểm ra mắt mà nhà cung cấp trích dẫn trước khi có bất kỳ lần chạy lại độc lập nào. Cách hiểu trung thực sẽ hẹp hơn nhưng vẫn ấn tượng: tại thời điểm phát hành, theo phương pháp luận của AA hồi đó, mô hình 2.5B này đã dẫn đầu toàn bộ phân khúc cùng cỡ tham số của nó. Gemma 4 12B không xuất hiện trong phân khúc đó, và trên chính các trang của Artificial Analysis hiện nay, mô hình này có chỉ số cao hơn — khoảng 22 đối với biến thể reasoning và 13 đối với biến thể instruct không reasoning, cả hai đều "cao hơn hẳn mức trung bình" so với nhóm cùng phân khúc. Các chỉ số từ các snapshot khác nhau không khớp nhau một cách gọn gàng, vì vậy hãy coi đó là chỉ báo xu hướng chứ không phải con số chính xác tuyệt đối: mô hình đa năng 12B khi kiểm thử cho thấy là mô hình có năng lực cao hơn, còn mô hình 2B cho thấy là mô hình có năng lực cao nhất trong phân khúc kích thước của nó. Đó là những khẳng định khác nhau và cả hai đều có thể đúng.
Bảng điểm, được dán nhãn trung thực.
Hãy đọc các hàng này với lưu ý về nguồn gốc — số liệu của MiniCPM5-2B là công bố trên thẻ của ModelBest, mới một tuần và chưa được kiểm chứng; còn số liệu của Gemma 4 12B là do Google báo cáo và đã được cộng đồng sử dụng từ lâu:
• Kích thước — MiniCPM5-2B: 2.52B tổng / 1.98B không nhúng, dense. Gemma 4 12B: 11.95B, dense.
• Phương thức — MiniCPM5-2B: chỉ văn bản. Gemma 4 12B: hỗ trợ đầu vào văn bản, hình ảnh, âm thanh và video, không dùng bộ mã hóa.
Ngữ cảnh — MiniCPM5-2B: 131.072 token trong cấu hình xuất xưởng. Gemma 4 12B: 256K gốc (một số công thức phục vụ khóa ở mức 128K).
• Ngôn ngữ — MiniCPM5-2B: dữ liệu và thẻ tập trung vào tiếng Anh và tiếng Trung. Gemma 4 12B: hơn 140 ngôn ngữ.
• Bản phát hành — MiniCPM5-2B: công bố ngày 19 tháng 7 năm 2026; trọng số hoạt động từ ngày 6–7 tháng 9, lặng lẽ. Gemma 4 12B: ra mắt ngày 3 tháng 6 năm 2026, có đầy đủ đánh giá khi ra mắt.
• Bằng chứng — MiniCPM5-2B: thẻ thông tin từ nhà cung cấp cộng với AA v4.1 (Index 17, #1 nhóm dưới 4B); chưa có lần đánh giá độc lập nào. Gemma 4 12B: kết quả đánh giá khi ra mắt cùng nhiều tháng triển khai trong cộng đồng và khoảng 3,3 triệu lượt tải mỗi tháng.

Bảng điểm phía trên là cùng một bức chân dung trong sáu hàng: hai mô hình bất đồng trên gần như mọi khía cạnh, và các cột quyết định sự lựa chọn — phương thức, ngôn ngữ, loại thiết bị — là các cột mà không một mức trung bình benchmark nào phản ánh được.
Điểm 12B vượt trội: những điều mà 2B thuần văn bản không thể giả tạo
Bắt đầu từ phương thức nhập liệu. Gemma 4 12B xử lý âm thanh, hình ảnh và video một cách thuần bản địa; MiniCPM5-2B chỉ hỗ trợ văn bản. Bất kỳ sản phẩm nào cần phiên âm, đọc màn hình hay xem video đều phải có một pipeline thứ hai bên cạnh mô hình 2B, và đến lúc đó lợi thế "mô hình nhỏ" gần như biến mất. Rào cản thứ hai là ngôn ngữ: hơn 140 ngôn ngữ so với một bản phát hành xoay quanh tiếng Anh/Tiếng Trung. Với một sản phẩm phục vụ phần đuôi dài các ngôn ngữ, mô hình 2B hoàn toàn không phải là ứng viên khả thi. Và rồi đến bằng chứng. Gemma 4 12B đã được tải xuống hàng triệu lần, lượng tử hóa, tinh chỉnh và triển khai trong sản xuất suốt ba tháng; các dạng lỗi của nó đã được ghi chép đầy đủ, và hệ sinh thái của nó trải rộng từ llama.cpp, Ollama, LM Studio, MLX, vLLM cho đến SGLang. MiniCPM5-2B là một kho mã mới chỉ một tuần tuổi, mà những con số nổi bật — gồm cả mức 46.4 do chính nhà cung cấp chạy trên SWE-bench Verified, một kết quả đáng chú ý đối với mô hình dense 2.5B nếu vượt qua được kiểm thử độc lập — vẫn chưa được bất kỳ ai bên ngoài phòng thí nghiệm đụng tới. Chỉ tính riêng độ trưởng thành, lựa chọn này vốn đã quá chênh lệch.
Nơi 2B là lựa chọn duy nhất
Không điều nào trong số đó còn có ý nghĩa trên loại thiết bị mà một mô hình 12B đơn giản là không vừa. Một chiếc điện thoại, một bo mạch buồng lái thông minh hay một hộp edge nhỏ với vài gigabyte DRAM không thể truyền trọng số của mô hình 11.95B qua bus bộ nhớ ở tốc độ hữu dụng — đó chính là nút thắt cổ chai sẽ bóp nghẹt thiết bị. MiniCPM5-2B được xây dựng cho thế giới đó: trọng số nằm gọn trong bộ nhớ trên thiết bị, cửa sổ ngữ cảnh 128K cho các phiên agent dài, khả năng gọi công cụ gốc được thiết kế để chạy tương tác và khả năng thích ứng ngay từ ngày đầu trên chín dòng chip cộng thêm ARM. Nếu mục tiêu của bạn là NPU cấp điện thoại hay một bo mạch nhúng, Gemma 4 12B không hề cạnh tranh với MiniCPM5-2B; nó hoàn toàn không thể triển khai ở đó. Còn nếu thiết bị mục tiêu của bạn có thể gánh được 12B nhưng chỉ vừa đủ — một chiếc laptop 16GB — thì mô hình 2B mang lại cho bạn khoảng trống: độ trễ mỗi token nhanh hơn, mức tiêu thụ điện năng thấp hơn và tùy chọn chạy thêm một mô hình thứ hai mà vẫn nằm gọn trong cùng một không gian bộ nhớ.
Cách xác định yêu cầu bồi thường nào vẫn còn hiệu lực
Vì cả hai phía đều là mô hình trọng số mở và có thể tự triển khai, bước trung thực tiếp theo là đo lường trên chính phần cứng của bạn thay vì đọc lại thẻ mô hình. Nếu bạn đang cân nhắc MiniCPM5-2B so với Gemma 4 12B trên một workload mình đang vận hành, thì đây cũng chính là lúc lớp định tuyến thể hiện giá trị: việc hướng luồng kiểm thử vào một checkpoint tự triển khai mới qua một API duy nhất có khả năng chuyển đổi dự phòng tự động nghĩa là một stack chưa kiểm chứng có thể treo hoặc lặp vô hạn mà không làm sập môi trường sản xuất; trong khi đó, giá niêm yết của nhà cung cấp cho bất cứ thứ gì bạn đem so sánh cũng được chuyển thẳng với mức cộng thêm 0%. Bản thân mô hình là một repo mới ra đời được một ngày, nên mặc định là xem nó như một thử nghiệm — nhưng thử nghiệm này rất rẻ để chạy, và hai giờ dùng để tái hiện SWE-bench hoặc một phần tập đánh giá riêng của bạn trên bản 2B chính là bằng chứng mà cuộc so tài này đang thiếu.
Bản án
Hãy chọn Gemma 4 12B khi phần cứng của bạn có dư địa và khối lượng công việc vượt ra ngoài phạm vi văn bản — một sản phẩm đa phương thức, đối tượng người dùng đa ngôn ngữ, hoặc bất cứ điều gì mà ba tháng hành vi được cộng đồng kiểm chứng quan trọng hơn một vương miện bảng xếp hạng. Hãy chọn MiniCPM5-2B khi thiết bị của bạn hoàn toàn không thể gánh nổi mô hình 12B, hoặc khi một mô hình 2.5B có khả năng xử lý văn bản, định hướng tác tử (agent) trên một con chip cấp điện thoại có thể giúp bạn tung ra một sản phẩm mà mô hình lớn hơn không thể làm được. Vị trí dẫn đầu bảng xếp hạng dưới 4B là một thành tựu thực sự và bản phát hành trọng số mở giúp nó có thể kiểm thử ngay hôm nay; chỉ là, dựa trên những bằng chứng hiện có, nó không phải là sự thay thế cho một mô hình đa năng 12B ở bất kỳ đâu mà một mô hình 12B thực sự có thể chạy được.
