Một thẻ tiêu đề chính cho bảng so sánh 'MiniCPM5-2B-DSpark vs Qwen3-8B' với phụ đề 'Ngăn xếp 2.5B mới chạy trên thiết bị so với chú ngựa thồ trọng số mở', trong đó hiển thị một khung điện thoại bên trái chứa con chip nhỏ gắn nhãn '2.5B + draft' và một tủ máy chủ bên phải gắn nhãn '8B workhorse', cùng đồng hồ đo băng thông bộ nhớ ở giữa và logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

MiniCPM5-2B-DSpark so với Qwen3-8B: Bộ stack 2.5B on-device mới so với ngựa thồ open-weights

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Mọi phép so sánh mô hình đều ẩn chứa một câu hỏi về phần cứng, và cuộc so tài giữa MiniCPM5-2B-DSpark với Qwen3-8B chính là câu hỏi ấy khoác lên mình bộ trang phục benchmark. Qwen3-8B là con ngựa thồ trọng số mở của Alibaba, ra mắt hồi tháng 4/2025 — sở hữu khoảng 8,2 tỷ tham số dense, 119 ngôn ngữ, ngữ cảnh gốc 32K mở rộng được tới 131K, chế độ tư duy lai, cùng mười sáu tháng kiểm chứng từ cộng đồng phía sau. MiniCPM5-2B-DSpark không phải là một mô hình độc lập để đặt lên bàn cân so sánh với nó: đây là checkpoint draft DSpark 323,8 triệu tham số mà OpenBMB lặng lẽ đăng tải lên Hugging Face vào ngày 6/9/2026 nhằm tăng tốc MiniCPM5-2B — mô hình on-device dense 2,52B được ModelBest công bố tại WAIC ngày 19/7/2026. Ghép cả cặp này lại với nhau, câu hỏi thực sự nổi lên: khối lượng công việc hiện đang chạy trên một mô hình 8B có nên chạy trên phần cứng vốn chỉ gánh nổi một mô hình 2B — và liệu một mô hình 2,5B với bản draft miễn phí có đủ tốt để thực hiện bước chuyển ấy hay không?

Câu trả lời ngắn gọn là chưa phải vậy đối với hầu hết khối lượng công việc, nhưng lý do hẹp hơn so với khoảng cách kích thước gợi ý, và có một loại triển khai mà bản 8B hoàn toàn không có câu trả lời. Mọi số liệu định lượng trong bài viết này đều do nhà cung cấp báo cáo — số liệu của MiniCPM là của ModelBest tự công bố, chưa được kiểm chứng độc lập; số liệu của Qwen3-8B là của Alibaba, từ lâu đã được cộng đồng sử dụng — nên nhãn mác quan trọng hơn con số.

Hai mô hình ở các vị trí khác nhau trên đường cong bộ nhớ

MiniCPM5-2B là một Transformer nhân quả (causal) dạng dense, có kích thước chỉ bằng một phần ba mô hình 8B — 42 lớp, cơ chế chú ý truy vấn nhóm (grouped-query attention), giấy phép Apache-2.0 — được xây dựng cho phân khúc thiết bị mà mô hình lớn không thể vươn tới: điện thoại, buồng lái thông minh và các hộp edge nhỏ, nơi bus bộ nhớ sẽ nghẽn nếu phải gánh tám tỷ tham số. Tài liệu ra mắt của nó đặt trọng tâm vào các tác vụ tác tử (agentic) và ngữ cảnh dài thay vì bề rộng kiến thức thô: ngữ cảnh gốc 128K, cùng tuyên bố của ModelBest rằng trên bộ đánh giá riêng của họ, mô hình đạt trung bình 53,9 — SOTA mã nguồn mở lớp 2B theo nhà cung cấp — trong đó có điểm 46,4 do chính nhà cung cấp chạy trên SWE-bench Verified; con số này sẽ rất ấn tượng đối với một mô hình 2B nếu trụ vững qua kiểm thử độc lập. Bản draft DSpark chính là câu trả lời về thông lượng cho phản đối hoàn toàn dễ thấy rằng một mô hình dense nhỏ nạp nhanh nhưng sinh token chậm, vì mỗi token đều phải kéo trọng số của nó băng qua bus bộ nhớ. Bản draft này đề xuất cùng lúc tối đa bảy token để mô hình đích xác minh, và repo báo cáo tỷ lệ chấp nhận tham lam (greedy) đạt 5,52 token cho mỗi bước xác minh tính gộp — 6,11 đối với mã nguồn. Con số đó phản ánh chất lượng của bản draft; mức tăng tốc của nó vẫn chưa được đo, và chưa có chỉ số token/giây nào được công bố.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the 'DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B' description, and the Model Specification table listing the MiniCPM5-2B target, five draft layers, and a block size of seven.

Thẻ openbmb/MiniCPM5-2B-DSpark ở trên là toàn bộ bề mặt công khai của bản phát hành âm thầm ngày 6 tháng 9: một phụ kiện phục vụ báo cáo độ dài chấp nhận, không có thông báo và không có tăng tốc về thời gian thực.

Qwen3-8B thuộc cùng một họ kiến trúc, lớn gấp ba lần và ra đời sớm hơn mười sáu tháng. Đây là một Transformer nhân quả dày đặc với cơ chế chú ý truy vấn nhóm, được huấn luyện trên kho ngữ liệu đa ngôn ngữ 36 nghìn tỷ token, phát hành theo giấy phép Apache-2.0, đồng thời là một trong những mô hình 8B được tự lưu trữ và triển khai phục vụ rộng rãi nhất trong thế giới trọng số mở. Điểm đặc trưng của nó là chế độ suy luận lai Qwen3 — bật hoặc tắt tư duy theo từng yêu cầu — và hồ sơ năng lực được thiết kế rộng một cách chủ đích: MMLU ở khoảng 77–79, kết quả GSM8K và lập trình mạnh, hỗ trợ 119 ngôn ngữ. Mô hình này cần một GPU thực thụ hoặc một thiết bị biên cấu hình mạnh: ở mức lượng tử hóa thực tế, nó chạy chỉ với vài gigabyte, thoải mái trên một card tầm trung, chứ không phải trên điện thoại.

A screenshot of the Hugging Face model page for Qwen/Qwen3-8B (reused from a published sibling) showing Alibaba's Apache-2.0 generalist model card with its 8.2B parameters, 119 languages, and hybrid thinking mode.

Thẻ mô hình của Alibaba cho Qwen3-8B ở trên chính là bộ mặt của kẻ đương nhiệm: mười sáu tháng hành vi đã được ghi chép và kiểm chứng bởi cộng đồng trên 119 ngôn ngữ.

Nơi 8B vẫn thắng

Xuống một hạng cân, bạn sẽ phải từ bỏ ba thứ cụ thể. Trước hết là ngôn ngữ: Qwen3-8B bao phủ 119 ngôn ngữ; còn thẻ mô hình và bộ dữ liệu của MiniCPM5-2B chỉ tập trung vào tiếng Anh và tiếng Trung, không hề khẳng định bất kỳ độ phủ đa ngôn ngữ nào. Với một sản phẩm phục vụ một tập dài các ngôn ngữ, đó là một bức tường cứng, không phải bức tường mềm. Thứ hai là bằng chứng: các con số của Qwen3-8B đã được thử nghiệm, lượng tử hóa, tinh chỉnh và phục vụ ở quy mô lớn suốt mười sáu tháng; các dạng lỗi của nó đã được biết rõ, các phiên bản lượng tử hóa đã tồn tại, hệ sinh thái của nó hiện diện khắp mọi nơi. MiniCPM5-2B là bản phát hành tháng 7/2026 với bảng điểm do nhà cung cấp vận hành và không có một kết quả tái lập độc lập nào, còn bản nháp mới chỉ một ngày tuổi. Thứ ba là hạ tầng phục vụ: mọi thứ vốn đã tương tác với Qwen3-8B — vLLM, SGLang, llama.cpp, hàng nghìn bản tinh chỉnh — đều đang nói chuyện với một mục tiêu đã trưởng thành, trong khi bản nháp MiniCPM đòi hỏi phải dựng một engine giải mã suy đoán (thuật toán DSPARK của SGLang) mà kho mã nguồn có tài liệu mô tả nhưng hệ sinh thái rộng hơn vẫn chưa tiếp nhận.

Nơi stack 2B là lựa chọn duy nhất

Trên phân khúc thiết bị mà một mô hình 8B đơn giản là không nhét vừa bộ nhớ, tất cả những điều đó đều chẳng còn ý nghĩa. Trên một chiếc điện thoại hay một bo mạch biên chỉ có vài gigabyte DRAM, Qwen3-8B không thể cạnh tranh được với MiniCPM5-2B — nó hoàn toàn không thể triển khai ở tốc độ hữu dụng. Đó chính là toàn bộ lý do khiến stack 2B tồn tại, và cũng là lý do draft là bộ phận chịu lực của bản phát hành này chứ không phải một món trang trí. Giải mã suy đoán (speculative decoding) phát huy hiệu quả nhất đúng ở chế độ dense, memory-bound mà một mô hình nhỏ trên một con chip nhỏ đang phải sống: một drafter nhỏ gọn đề xuất một khối, mô hình đích xác minh khối đó trong một lượt, và chi phí nạp trọng số chỉ phải trả một lần mỗi khối thay vì một lần mỗi token. Phương pháp DSpark có nguồn gốc từ DeepSeek (arXiv 2607.05147) vốn được thiết kế cho các hệ thống phục vụ có độ đồng thời cao, nhưng cơ chế của nó — cùng với những con số về tỷ lệ chấp nhận trên repo này — mới là đòn bẩy thực sự cho một mô hình 2B cần mang lại cảm giác tương tác mượt mà trên phần cứng hạn chế. Chỉ cần giữ trong tầm mắt lời cảnh báo trung thực này: OpenBMB đo tỷ lệ chấp nhận của draft chứ không đo mức tăng tốc của nó, vì thế mức tăng token/giây thực tế trên thiết bị mục tiêu của bạn vẫn là việc bạn phải tự đo.

Bảng điểm, được dán nhãn trung thực.

• Phát hành — MiniCPM5-2B: 19 tháng 7, 2026 (được công bố); MiniCPM5-2B-DSpark: 6 tháng 9, 2026, âm thầm. Qwen3-8B: tháng 4, 2025, được công bố.

Kích thước — MiniCPM5-2B: 2.52B dense, cộng với draft 324M. Qwen3-8B: ~8.2B dense.

• Ngữ cảnh — MiniCPM5-2B: 128K gốc. Qwen3-8B: 32K gốc, 131K qua YaRN.

• Ngôn ngữ — MiniCPM5-2B: tập trung vào tiếng Anh/tiếng Trung. Qwen3-8B: 119.

• Suy luận — MiniCPM5-2B: chế độ lai nhanh/kỹ lưỡng theo tài liệu ra mắt. Qwen3-8B: bật hoặc tắt suy nghĩ theo yêu cầu.

• Bằng chứng — Các con số của MiniCPM là tuyên bố trên bảng thông số của ModelBest (trung bình 53,9 trên bộ đánh giá riêng của họ; không có lần chạy độc lập nào). Các con số của Qwen3-8B do Alibaba công bố, đã được cộng đồng kiểm chứng trong mười sáu tháng.

A two-column scoreboard for MiniCPM5-2B-DSpark vs Qwen3-8B: left column MiniCPM5-2B-DSpark with 'Release: Jul 19 + Sep 6 2026', size 2.52B plus 324M draft, 128K native context, English and Chinese centered languages, hybrid fast-and-deliberate reasoning, and own-suite average 53.9; right column Qwen3-8B with 'Release: April 2025', ~8.2B dense, 32K native / 131K YaRN context, 119 languages, thinking on or off, and 16 months of community-exposed evidence, with a footer reading 'MiniCPM figures vendor-reported; Qwen figures Alibaba-reported' and the OrcaRouter logo in the bottom-right corner.

Bảng so sánh ở trên cho thấy sự không khớp một cách trung thực: các cột khác nhau gần như ở mọi điểm ngoại trừ giấy phép Apache-2.0 mã nguồn mở, và loại thiết bị bạn đang phân phối sẽ quyết định cột nào bạn thậm chí được phép chọn.

Thực tế định tuyến

Cả hai mô hình hiện không nằm trong danh mục lưu trữ trên OrcaRouter, vì vậy sự so sánh này hoàn toàn diễn ra trong thế giới tự triển khai — nhưng đó chính là nơi lớp định tuyến vẫn chứng minh được giá trị của mình. Qwen3-8B được nhà cung cấp của nó và một số nền tảng bên thứ ba phục vụ; còn MiniCPM5-2B cùng mô hình draft của nó là thứ bạn phải tự vận hành. Khi một nhóm muốn kiểm tra xem stack 2.5B có thể gánh một phần khối lượng công việc của 8B hay không, bước đi có thể đảo ngược là trỏ một đường thử nghiệm vào một bản dựng SGLang tự triển khai của MiniCPM5-2B kèm draft thông qua một API duy nhất có chuyển đổi dự phòng tự động — hệ thống sản xuất vẫn nằm trên mô hình hiện tại, stack mới có thể chững lại mà không kéo sập bất cứ thứ gì, và giá niêm yết của nhà cung cấp cho toàn bộ quá trình so sánh được chuyển qua với mức phụ phí 0%, nên thử nghiệm A/B này rẻ và có thể đảo ngược thay vì là một canh bạc. Lớp định tuyến không lưu trữ mô hình nào cả; nó chỉ giúp thử nghiệm được diễn ra an toàn.

Ai nên di chuyển, và ai nên chờ đợi

Hãy cứ dùng Qwen3-8B cho mọi tác vụ đa ngôn ngữ, mọi thứ cần mười sáu tháng hành vi đã được kiểm chứng, hoặc bất kỳ khối lượng công việc nào đã được xử lý trên phần cứng gánh thoải mái một mô hình 8B — chênh lệch kích thước không phải là lý do để chuyển đổi, và khoảng trống bằng chứng thì cho thấy điều ngược lại. Chỉ nghiêm túc thử nghiệm bộ MiniCPM5-2B với nhánh draft DSpark nếu thiết bị mục tiêu của bạn hoàn toàn không gánh nổi mô hình 8B, hoặc nếu một mô hình 2.5B bắt kịp trên các tác vụ agentic và ngữ cảnh dài sẽ giúp bạn cắt giảm bộ nhớ và điện năng trên phần cứng bạn đã xuất xưởng. Và trước khi chốt phương án draft, hãy chạy phép đo mà OpenBMB không công bố: acceptance length không phải là độ trễ, và mức tăng tokens-per-second trên thiết bị của bạn mới là con số thực sự quyết định liệu checkpoint nhỏ bé thầm lặng trên Hugging Face có đáng công tải về hay không.