Thẻ tiêu đề hero cho 'MiniCPM5-2B vs Qwen 3 8B', với phụ đề 'Liệu khối lượng công việc của một con ngựa thồ 8B có thể chuyển xuống mô hình 2.5B?', ba chip hiển thị '2.5B vs ~8.2B', '119 ngôn ngữ vs EN/ZH' và '16 tháng kiểm chứng vs 1 tuần', cùng dải băng phía trên 'OPEN-WEIGHTS SHOWDOWN · SEPT 2026'.
Guides & Insights

MiniCPM5-2B so với Qwen 3 8B: Liệu khối lượng công việc 8B có nên chuyển xuống 2.5B không?

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Mọi sự so sánh mô hình đều ẩn chứa một câu hỏi về phần cứng, và MiniCPM5-2B so với Qwen 3 8B chính là câu hỏi đó khoác lên bộ trang phục benchmark. Qwen 3 8B là mô hình mã nguồn mở của Alibaba ra mắt tháng 4 năm 2025 — khoảng 8.2B tham số dense, 119 ngôn ngữ, chế độ hybrid thinking bật/tắt theo từng yêu cầu, và mười sáu tháng bằng chứng từ cộng đồng phía sau nó. MiniCPM5-2B là mô hình mà ModelBest và OpenBMB công bố tại Hội nghị Trí tuệ Nhân tạo Thế giới vào ngày 19 tháng 7, đứng đầu bảng xếp hạng các mô hình dưới 4B trên bảng xếp hạng của Artificial Analysis, với trọng số mở được phát hành âm thầm trên Hugging Face vào ngày 6 và 7 tháng 9. Câu hỏi thực sự đưa chúng lên cùng một trang giấy là câu hỏi mà hầu hết các đội ngũ đang chạy một mô hình 8B mã nguồn mở tự đặt ra tại một thời điểm nào đó: liệu khối lượng công việc tôi đang phục vụ trên một mô hình 8B có thể chuyển xuống một mô hình 2.5B — và nếu có thể, tôi sẽ phải từ bỏ điều gì?

Câu trả lời ngắn gọn là chưa phải vậy đối với hầu hết các khối lượng công việc, nhưng lý do hẹp hơn so với khoảng cách kích thước gấp bốn lần gợi ý, và có một hạng mục triển khai mà bản 8B hoàn toàn không có câu trả lời. Mọi số liệu định lượng dưới đây đều do nhà cung cấp báo cáo và được ghi chú rõ như vậy: số liệu của MiniCPM5-2B là tuyên bố trên thẻ thông số của chính ModelBest, mới được một tuần và chưa được ai bên ngoài phòng thí nghiệm tái lập; số liệu của Qwen 3 8B là của Alibaba, đã được cộng đồng lớn kiểm tra, lượng tử hóa và chạy lại từ lâu. Sự bất đối xứng về bằng chứng đó mới là điểm đáng chú ý thực sự của cuộc so tài này.

Mười sáu tháng của Qwen 3 8B

Qwen 3 8B thuộc cùng một họ kiến trúc, lớn gấp ba lần và ra đời sớm hơn mười sáu tháng so với đối thủ. Đây là một mô hình transformer nhân quả dạng dense sử dụng grouped-query attention, được tiền huấn luyện trên kho ngữ liệu đa ngôn ngữ khoảng 36 nghìn tỷ token, phát hành theo giấy phép Apache-2.0, đồng thời là một trong những mô hình 8B được tự lưu trữ và phục vụ rộng rãi nhất trong thế giới trọng số mở. Điểm nhấn đặc trưng của nó là chế độ suy luận lai Q​wen3 — bật hoặc tắt tư duy (thinking) theo từng yêu cầu — nhờ đó một bản triển khai duy nhất vừa có thể trả lời nhanh các câu hỏi đơn giản, vừa chuyển sang chuỗi suy luận (chain-of-thought) thấu đáo cho toán học hoặc mã nguồn. Mô hình hỗ trợ sẵn Model Context Protocol và function calling, có cửa sổ ngữ cảnh gốc 32K mà Alibaba xác nhận có thể mở rộng lên 131K nhờ kỹ thuật YaRN scaling, cùng khả năng phủ 119 ngôn ngữ và phương ngữ. Sau mười sáu tháng, các dạng lỗi của mô hình đã được ghi chép đầy đủ, các phiên bản lượng tử hóa hiện diện khắp nơi, và hạ tầng phục vụ quanh nó — vLLM, SGLang, llama.cpp, hàng nghìn bản fine-tune — đã trưởng thành. Với mức lượng tử hóa thực dụng, mô hình chỉ chiếm dung lượng vài gigabyte, chạy thoải mái trên một GPU tầm trung, chứ không phải trên điện thoại.

Screenshot of the Hugging Face model card for Qwen/Qwen3-8B, showing the Qwen org header, the Apache-2.0 license tag, Transformers and Safetensors tags, and the opening of the model card describing Qwen3's seamless switching between thinking mode and non-thinking mode within a single model (captured September 7, 2026).

MiniCPM5-2B tuyên bố điều gì với thế giới đó?

MiniCPM5-2B đến từ một hướng đi ngược lại: nhỏ gọn từ thiết kế, agentic từ huấn luyện. Mô hình là một dense transformer với tổng cộng 2,52 tỷ tham số (1,98 tỷ phi-embedding), 42 lớp, hidden size 2048, grouped-query attention, kiến trúc LlamaForCausalLM chuẩn, không dùng kernel tùy biến, và cửa sổ ngữ cảnh 131.072 token trong cấu hình phát hành (tài liệu ra mắt tháng 7 từng quảng cáo 512K; cấu hình thực tế không có thông số đó). Trong khi Qwen 3 8B có được bề rộng nhờ đợt huấn luyện tiền định đa ngữ trên 36 nghìn tỷ token, MiniCPM5-2B định hình được đặc tính của mình từ hậu huấn luyện: SFT trên 400 tỷ token dữ liệu tư duy sâu, tiếp đó là On-Policy Distillation gói mười sáu mô hình chuyên gia RL, năm trong số đó mang năng lực agentic, vào lại một mạng dense nhỏ duy nhất. Thông điệp ra mắt là một nền tảng agent on-device — gọi công cụ thuần gốc qua các lời gọi kiểu XML, thích ứng ngay từ ngày đầu trên chín dòng chip cộng ARM, chế độ lai nhanh/suy luận kỹ lưỡng — và model card tuyên bố điểm trung bình nội bộ 53,9 trên bộ so sánh 2B-4B do hãng tự chọn, AIME 2025/2026 đạt 86,5, cùng 46,4 do hãng tự chạy trên SWE-bench Verified; đó sẽ là con số đáng kinh ngạc cho một mô hình 2,5B nếu vượt qua được kiểm định độc lập.

Screenshot of the Hugging Face repository page for openbmb/MiniCPM5-2B, showing the OpenBMB org header, the Text Generation tag with Transformers and Safetensors and English and Chinese language tags, and the top of the model card reading 'We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B. It is a dense 2B Transformer ... reaching 2B-class open-source SOTA' (captured September 7, 2026).

Sự không khớp theo từng chiều

• Phát hành — MiniCPM5-2B: công bố ngày 19 tháng 7 năm 2026; trọng số ra mắt ngày 6-7 tháng 9. Qwen 3 8B: công bố tháng 4 năm 2025.

• Kích thước — MiniCPM5-2B: tổng 2.52B / 1.98B không bao gồm embedding, dense. Qwen 3 8B: ~8.2B dense.

Ngữ cảnh — MiniCPM5-2B: 131.072 token trong cấu hình đi kèm. Qwen 3 8B: 32K nguyên bản, 131K được kiểm chứng qua YaRN.

• Ngôn ngữ — MiniCPM5-2B: tập trung vào tiếng Anh và tiếng Trung. Qwen 3 8B: 119 ngôn ngữ và phương ngữ.

• Lập luận — MiniCPM5-2B: chế độ lai nhanh/kỹ lưỡng, theo tài liệu ra mắt. Qwen 3 8B: bật/tắt chế độ tư duy Qwen3 tùy theo yêu cầu.

• Bằng chứng — MiniCPM5-2B: phiếu thông số từ nhà cung cấp, chưa được chạy độc lập. Qwen 3 8B: do Alibaba công bố; mười sáu tháng được cộng đồng tái hiện và triển khai.

A comparison scoreboard titled 'MiniCPM5-2B vs Qwen 3 8B — the scoreboard', with left column rows 'Release: Announced Jul 19 · weights Sep 6', 'Params: 2.52B dense', 'Context: 128K in shipped config', 'Languages: English / Chinese centered', 'Reasoning: Hybrid fast / deliberate, claimed', 'Evidence: Vendor card · no independent run', and right column rows 'Release: April 2025 · mature', 'Params: ~8.2B dense', 'Context: 32K native · 131K YaRN', 'Languages: 119 languages', 'Reasoning: Thinking on / off per request', 'Evidence: 16 months community-tested', with a footer reading 'MiniCPM5-2B figures are ModelBest card claims; Qwen 3 8B figures are Alibaba's, community-exposed.'

Bảng so sánh ở trên cho thấy sự không khớp một cách trung thực: các cột khác nhau gần như ở mọi điểm ngoại trừ giấy phép Apache-2.0 mã nguồn mở, và loại thiết bị bạn đang phân phối sẽ quyết định cột nào bạn thậm chí được phép chọn.

Nơi 8B vẫn thắng

Xuống một hạng cân, bạn phải từ bỏ ba thứ cụ thể. Thứ nhất là ngôn ngữ: Qwen 3 8B hỗ trợ 119 ngôn ngữ; còn model card và dữ liệu của MiniCPM5-2B chỉ tập trung vào tiếng Anh và tiếng Trung, đồng thời không có tuyên bố nào về độ phủ đa ngôn ngữ. Với một sản phẩm phục vụ phân khúc đuôi dài về ngôn ngữ, đó là một bức tường cứng chứ không phải bức tường mềm. Thứ hai, bằng chứng: 16 tháng được cộng đồng kiểm thử đồng nghĩa với việc hành vi của Qwen 3 8B đã được biết rõ và hệ sinh thái của nó hiện diện khắp nơi, trong khi MiniCPM5-2B là một repo mới chỉ một tuần tuổi với model card chưa được kiểm chứng — và những con số nổi bật của nó, nếu không trụ vững qua các lần chạy độc lập, thì đúng là loại con số hay bị âm thầm điều chỉnh lại. Thứ ba, serving stack: mọi thứ đã tương tác được với Qwen 3 8B đều đang làm việc với một mục tiêu trưởng thành, còn một checkpoint lớp 2B hoàn toàn mới đồng nghĩa với việc phải xác thực lại từ đầu các dạng lượng tử hóa, cấu hình serving và hành vi gọi công cụ. Không điều nào trong số này là lý do khiến bản 2B không thể thắng trên một benchmark cụ thể; chúng là lý do khiến bản 8B là lựa chọn mặc định ít rủi ro hơn ở bất cứ nơi nào nó phù hợp.

Nơi mà 2B là câu trả lời duy nhất.

Điều đó chẳng có ý nghĩa gì trên phân khúc thiết bị mà một mô hình 8B đơn giản là không vừa. Trên điện thoại, bo mạch buồng lái thông minh hay một hộp edge nhỏ với vài gigabyte DRAM, Qwen 3 8B không cạnh tranh với MiniCPM5-2B — nó hoàn toàn không thể triển khai ở tốc độ hữu dụng. Đó chính là toàn bộ lý do mô hình 2B tồn tại, và cũng là vì sao cách đặt vấn đề trung thực cho cuộc so sánh này không phải là "2B có tốt bằng 8B không" mà là "triển khai nào của tôi chỉ có thể được phục vụ bởi một trong hai mô hình này." Nếu bạn đang phát hành các tác nhân trên thiết bị mà bus bộ nhớ sẽ nghẽn vì tám tỷ trọng số, MiniCPM5-2B là một trong những lựa chọn hạng 2B được huấn luyện mạnh mẽ nhất hiện có, và câu hỏi duy nhất đáng đặt ra là liệu các tuyên bố về năng lực tác nhân của nó có đứng vững khi bạn tự tái tạo thử nghiệm hay không. Nếu khối lượng công việc của bạn đã chạy trên phần cứng xử lý 8B một cách thoải mái, chỉ riêng khoảng cách kích thước không phải là lý do để chuyển đổi — và khoảng cách bằng chứng lại đang chống lại việc đó.

Nếu bạn đang cân nhắc chuyển đổi

Cách an toàn để kiểm chứng bước chuyển này là hãy coi nó như một thí nghiệm, chứ không phải một cuộc di trú. Triển khai MiniCPM5-2B trên phần cứng riêng của bạn, đẩy một phần lưu lượng thật vào nó qua một API duy nhất có cơ chế chuyển đổi dự phòng tự động, rồi đối chiếu với bản 8B trên chính các yêu cầu đó — một tầng định tuyến xứng đáng với công sức đầu tư ở đây, vì một checkpoint mới chỉ một tuần tuổi có thể bị treo hoặc lặp vô hạn mà không kéo sập môi trường production, và giá niêm yết của nhà cung cấp cho các hosted model bạn đem ra so sánh đều được truyền thẳng với mức markup 0%. Điều bạn thực sự kiểm định là ba thứ: liệu độ chính xác của bản 2B có trụ vững trên dữ liệu của bạn không, liệu độ trễ của nó trên phân khúc thiết bị bạn dùng có thắng được bản 8B chạy trên phần cứng mà lẽ ra bạn sẽ phải mua hay không, và liệu cấu hình ngôn ngữ Anh–Trung có bao phủ đúng tập người dùng bạn thực sự đang có không. Trước tiên, hãy tái lập SWE-bench hoặc một phần bộ eval của riêng bạn — hai giờ đồng hồ bỏ ra đó chính là tấm bảo hiểm rẻ nhất mà cuộc so kè này mang lại.

Bản án

Hãy tiếp tục dùng Qwen 3 8B cho mọi tác vụ đa ngôn ngữ, mọi thứ cần mười sáu tháng hành vi đã được biết đến, hoặc bất kỳ khối lượng công việc nào đã chạy trên phần cứng vốn xử lý 8B một cách thoải mái. Chỉ nên nghiêm túc thử nghiệm MiniCPM5-2B nếu thiết bị mục tiêu của bạn hoàn toàn không chạy nổi bản 8B, hoặc nếu một mô hình 2.5B duy trì được hiệu suất trên các tác vụ tác tử (agentic) và ngữ cảnh dài sẽ giúp bạn cắt giảm bộ nhớ và điện năng trên phần cứng đang xuất xưởng. Vị trí dẫn đầu bảng xếp hạng dưới 4B là một thành tựu thực sự và bản phát hành mã nguồn mở của nó giúp bạn có thể thử nghiệm ngay hôm nay; tuy nhiên, xét theo bằng chứng hiện có, đây đơn giản vẫn chưa phải là lý do để loại bỏ một cỗ máy 8B đã chứng minh được giá trị của mình.