
MiniCPM5-2B-DSpark: OpenBMB âm thầm phát hành trọng số MiniCPM5-2B với mô hình nháp được tối ưu cho tốc độ
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Sáu tuần trước, MiniCPM5-2B mới chỉ là một lời hứa. Ra mắt tại hội nghị WAIC ở Thượng Hải vào ngày 2026-07-19 với vị thế là mô hình dưới 4B đứng đầu Artificial Analysis Index, mô hình này đi kèm một ghi chú lộ trình rằng các trọng số mở sẽ đến "sớm". Cái "sớm" đó đã đến ngay trong tuần này, nhưng chẳng kèm chút phô trương nào. Ngày 2026-09-06, OpenBMB đưa kho lưu trữ MiniCPM5-2B chủ lực lên Hugging Face theo giấy phép Apache-2.0; 21 phút sau, họ tiếp tục đưa lên MiniCPM5-2B-DSpark — một checkpoint nháp 323,8 triệu tham số, với nhiệm vụ duy nhất là giúp MiniCPM5-2B giải mã nhanh hơn nhờ thuật toán giải mã suy đoán DSpark. Một bản dựng GPTQ tiếp nối vào ngày 2026-09-07. Tính đến thời điểm viết bài, chúng tôi không tìm thấy bất kỳ thông báo, bài đăng ra mắt hay mục nhật ký thay đổi nào; bản phát hành lặng lẽ lộ diện khi các kho lưu trữ lần lượt được chuyển sang chế độ công khai trong suốt quãng thời gian 11 ngày.
Đây là bài viết dạng tổng hợp những gì chúng ta đã biết cho đến nay, và cách đóng khung câu chuyện là điều quan trọng. MiniCPM5-2B-DSpark không phải là một chatbot độc lập hay một mô hình chủ lực mới — nó là một bộ tăng tốc: một mô hình nhỏ, nhanh, có nhiệm vụ đề xuất token trước để MiniCPM5-2B xác minh song song. Không có mô hình đích, nó vô dụng, và chính mô hình đích đó mới là lý do khiến ta quan tâm. Bản phát hành open-weight của MiniCPM5-2B mà OpenBMB hứa hẹn từ tháng 7 đến nay đã thực sự xuất hiện trên Hugging Face, và mô hình draft đi kèm với bản phát hành chính là cơ chế mà nhà cung cấp khuyến nghị để chạy MiniCPM5-2B ở tốc độ dùng được trong thực tế. Mọi thông tin không được ghi nguồn cụ thể bên dưới đều được đọc trực tiếp từ hai model card và các repository của chúng.
Những gì đã được phát hành, và khi nào
Dòng 2B đã chính thức ra mắt dưới hình thức một đợt phát hành cuốn chiếu không báo trước, với những mẫu mới nhất xuất hiện đầu tiên:
• 2026-08-27 — MiniCPM5-2B-Base và MiniCPM5-2B-SFT xuất hiện, các checkpoint tiền huấn luyện thô và tinh chỉnh có giám sát.
• 2026-09-01 — MiniCPM5-2B-Midtrain, giai đoạn huấn luyện giữa kỳ theo hướng tác nhân.
• 2026-09-05 — MiniCPM5-2B-MLX và MiniCPM5-2B-GGUF, các định dạng Apple-Silicon và llama.cpp.
• 2026-09-06 — kho lưu trữ chính MiniCPM5-2B, sau đó là MiniCPM5-2B-DSpark hai mươi mốt phút sau đó.
• 2026-09-07 — MiniCPM5-2B-GPTQ, định dạng phục vụ đã lượng tử hóa.
Tất cả đều mang giấy phép Apache-2.0 mà ModelBest đã dùng cho dòng MiniCPM5-1B vào hồi tháng 5, và các checkpoint trước đó trong chuỗi vẫn gần như không có tín hiệu gì từ cộng đồng — mỗi cái chỉ nhận được một vài lượt tải và lượt thích. Đó là dấu hiệu của một đợt tung trọng số đang tiến hành chứ không phải một lần ra mắt có phối hợp: các artifact xuất hiện theo thứ tự phụ thuộc (base và SFT trước, các định dạng lượng tử hóa và draft sau cùng) mà không có một ngày nào được xem là ngày phát hành.
MiniCPM5-2B-DSpark thực chất là gì
Giải mã suy đoán chia quá trình sinh thành một bộ đề xuất chi phí thấp và một bộ xác minh chi phí cao. Một mô hình nháp nhỏ sẽ đoán vài token tiếp theo; mô hình lớn kiểm tra toàn bộ các dự đoán này trong một lượt truyền xuôi duy nhất và chấp nhận những dự đoán mà nó đồng tình. Khi bản nháp được hiệu chuẩn tốt, bạn nhận được đầu ra của mô hình lớn chỉ với một phần rất nhỏ chi phí; còn khi nó sai, bạn chỉ mất đúng một bước xác minh. DSpark là một công thức cụ thể cho ý tưởng đó, đến từ bài báo đăng ngày 2026-07-06 (arXiv 2607.05147, "Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation"). Hai lựa chọn thiết kế làm nên nét khác biệt: thứ nhất, nó kết hợp một backbone soạn thảo song song với một mô-đun tuần tự gọn nhẹ, nhờ đó những token trong một khối đề xuất phụ thuộc lẫn nhau thay vì độ chính xác suy giảm dần về cuối khối; thứ hai, nó định cỡ từng lượt xác minh theo từng yêu cầu dựa trên các ước lượng độ tin cậy và thông lượng của engine, thay vì luôn xác minh một khối có độ dài cố định.
Bản nháp DSpark mà OpenBMB phát hành là một Transformer năm lớp với 323,8 triệu tham số ở định dạng BF16 (khoảng 648MB). Nó thuộc họ kiến trúc Qwen3 nhưng mang các phần bổ sung riêng của DSpark: một bộ chiếu (projector) đọc trạng thái ẩn của MiniCPM5-2B từ năm lớp của mô hình đích (1, 10, 20, 30 và 39), một đầu dò độ tin cậy (confidence head), và một đầu Markov nhỏ mô hình hóa phân phối token tiếp theo. Cấu hình của nó đề xuất một khối bảy token cho mỗi lượt truyền xuôi. Với khoảng một phần tám số tham số 2,5B của MiniCPM5-2B, đây là một trong những mô hình nháp nhỏ nhất được phát hành cho một checkpoint mở chủ đạo — đó chính là điểm mấu chốt của một mô hình hướng biên (edge-oriented), nơi bản nháp phải đủ rẻ để việc chạy hai mô hình trên một thiết bị vẫn tốt hơn chạy một mô hình.

Kho lưu trữ trên là toàn bộ bề mặt công khai của mô hình nháp: một tệp README, một tệp cấu hình, một tệp safetensors duy nhất và một thẻ mô hình có phần mô tả huấn luyện cho thấy 1,959,525 chuỗi (7.05B token) được tạo bởi MiniCPM5-2B từ các prompt tổng quát, toán học và mã nguồn, được huấn luyện trong sáu epoch với mục tiêu kết hợp cross-entropy, L1 và độ tin cậy. Checkpoint này không được sử dụng như một mô hình sinh độc lập.
Những con số OpenBMB công bố, được ghi nhãn một cách trung thực.
Thẻ của mô hình nháp báo cáo một con số đáng chú ý — độ dài chấp nhận, số token đề xuất trung bình mà mô hình đích chấp nhận trong mỗi khối bảy token. Quá trình đánh giá được chạy trên đầu ra của MiniCPM5-2B trong ba lĩnh vực, với mức tối đa 4.096 token được sinh ra.
• Toán — Trung bình 6.05 token được chấp nhận khi giải mã greedy (T=0); 4.61 khi lấy mẫu với T=1.0.
• Code — 6.11 (tham lam); 4.44 (lấy mẫu).
• Chung — 4.16 tham lam; 3.10 lấy mẫu.
• Tổng hợp — 5.52 greedy; 4.05 sampled, với điểm tối đa là bảy.
Những con số đó do nhà cung cấp báo cáo từ thẻ mô hình và chưa được tái lập một cách độc lập. Chúng cũng mô tả tỷ lệ trúng của bản nháp, chứ không phải mức tăng tốc theo thời gian thực: tốc độ là một phép đo phục vụ phụ thuộc vào chi phí của lượt xác minh mục tiêu so với lượt đề xuất của bản nháp, vào mức độ lấp đầy batch, và vào việc bộ lập lịch độ tin cậy của DSpark cắt giảm độ dài xác minh. OpenBMB không công bố con số token/giây nào cho cặp mô hình này. Để hình dung mức trần của phương pháp, bài báo về DSpark báo cáo tốc độ sinh cho mỗi người dùng nhanh hơn 60–85% ở mức thông lượng tương đương so với đường cơ sở MTP-1 trong hệ thống phục vụ trực tiếp của DeepSeek — một điểm tham chiếu hữu ích cho những gì thuật toán đã làm được ở nơi khác, chứ không phải là khẳng định về MiniCPM5-2B trên phần cứng của bạn.

Bảng điểm ở trên là bảng thông số kỹ thuật của chính bản phát hành. Hãy đọc chỉ số nghiệm thu như một tỷ lệ đạt dự kiến; hệ số nhân trên thông lượng thực tế là điều mà một lần chạy SGLang độc lập vẫn cần phải đo.
Mô hình được bản nháp tăng tốc
MiniCPM5-2B là một Transformer mật độ (dense) với 2,5 tỷ tham số — tổng cộng 2.516.756.480 tham số — gồm 42 lớp, 16 đầu truy vấn (query heads) và 2 đầu KV, bộ từ vựng 130.560 token và cửa sổ ngữ cảnh 131.072 token, ở định dạng BF16 với dung lượng khoảng 5GB. Về mặt kiến trúc, mô hình này cố tình nhàm chán một cách có chủ đích: nó là một LlamaForCausalLM tiêu chuẩn, không có kernel tùy chỉnh và không phân nhánh mã nguồn mô hình — chính vì vậy mà nó có thể chuyển qua (port) rất nhiều môi trường chạy (runtime) và nền tảng chip khác nhau. Trên bộ bài kiểm tra nội bộ của chính OpenBMB, bảng thông số cho mô hình điểm trung bình 53,9 trên các tác vụ suy luận, làm theo chỉ dẫn, kiến thức, ngữ cảnh dài, sử dụng công cụ, lập trình và tác tử tìm kiếm — vượt qua Qwen3.5-4B ở mức 51,1 và granite-4.2-3B ở mức 42,7 trong cùng bảng, với một số ô (GPQA-Diamond 70,2, HLE 8,9, cùng các hàng ngữ cảnh dài và tác tử khác) được ghi chú là lấy từ Artificial Analysis chứ không phải được tái lập nội bộ. Các ô nổi bật theo từng tác vụ gồm MATH-500 đạt 94,6, AIME 2025 và 2026 đạt 86,5, IFEval đạt 86,7, MMLU-Pro đạt 70,8, và SWE-bench Verified đạt 46,4. Đây là số liệu của nhà cung cấp trên bộ bài kiểm tra của chính nhà cung cấp, và bảng thông số nêu rõ một số hàng được lấy từ bên thứ ba; hãy xem xét hỗn hợp số liệu này cho phù hợp.

Trong buổi công bố hồi tháng 7, tài liệu ra mắt của ModelBest trích dẫn chỉ số Artificial Analysis Index là 17 — đứng đầu trong số các mô hình dưới 4B tham số — và các bài đưa tin tháng 7 nhắc đến cửa sổ 512K token. Các checkpoint thực sự được phát hành lại cấu hình ngữ cảnh 131.072 token. Khi con số tiếp thị ngày ra mắt và cấu hình phát hành không khớp nhau, cấu hình chính là con số chi phối những gì bạn có thể chạy, và khoảng cách đó đáng để biết trước khi bạn lên kế hoạch xử lý ngữ cảnh dài dựa vào con số tiếp thị.
Chạy MiniCPM5-2B với bản nháp của nó
Hướng tiếp cận dự kiến là SGLang, vốn đã hỗ trợ thuật toán DSpark trong upstream từ v0.5.16 — mức phiên bản tối thiểu mà thẻ mô hình yêu cầu. Lệnh phục vụ đầy đủ từ thẻ:
python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --speculative-algorithm DSPARK --speculative-draft-model-path openbmb/MiniCPM5-2B-DSpark --speculative-dspark-block-size 7
Với giải mã tham lam (T=0), việc xác minh của DSpark là không mất mát (lossless): đầu ra giống hệt khi chỉ phục vụ riêng MiniCPM5-2B, nhờ đó mô hình draft chỉ còn là một cách giảm độ trễ thuần túy. Khi bật lấy mẫu (sampling), DSpark của SGLang mặc định chỉ lấy mẫu trên mô hình target, kèm tùy chọn loại bỏ mẫu (rejection sampling). OpenBMB cũng mô tả việc nạp mô hình target bằng Transformers thông thường (transformers ≥ 5.6) và phục vụ riêng mô hình target bằng vLLM ≥ 0.21, cùng bộ phân tích lời gọi công cụ minicpm5 cho các tác vụ agent; còn riêng đường dẫn speculative DSPARK là của SGLang.
Điều thực sự đáng chú ý ở một cặp mô hình biên là phép tính phần cứng: khoảng 5GB cho MiniCPM5-2B ở dạng BF16 cộng thêm khoảng 0,65GB cho mô hình draft. Sự kết hợp draft và mô hình mục tiêu nằm gọn trong mức tài nguyên mà bản thân mô hình 2B đã có thể chạy được, và đó chính là lý do vì sao nên phát hành một draft nhỏ như vậy thay vì một mô hình thứ hai lớn hơn.
Điều gì chưa được xác nhận
Không có thông báo nào tồn tại mà chúng tôi có thể tìm thấy — không có blog OpenBMB hay ModelBest, không có bài đăng mạng xã hội bằng tiếng Anh hay tiếng Trung. Cách diễn đạt "phát hành thầm lặng" là theo nghĩa đen, và điểm công khai duy nhất là bộ sưu tập Hugging Face.
- Không có đánh giá độc lập. {{1}}Độ dài chấp nhận của bản nháp và điểm trung bình bộ thử nghiệm 53.9 của MiniCPM5-2B là do nhà cung cấp báo cáo và chưa được tái tạo; các ô được gắn cờ AA là dữ liệu từ bên thứ ba nhưng chỉ là giá trị ảnh chụp nhanh, không phải là kết quả chạy trên các bộ trọng số chính xác này.{{/1}}
• Chúng tôi không thể tìm thấy bất kỳ API được lưu trữ nào, vì vậy việc áp dụng hiện nay đồng nghĩa với việc bạn phải tự chạy các checkpoint. Một bản sao ModelScope, đã được hứa hẹn trong bài đưa tin về buổi ra mắt vào tháng 7, vẫn không xuất hiện tại thời điểm viết bài.
• Không có con số tăng tốc theo thời gian thực cho cặp DSPARK. Độ dài chấp nhận 5.52 là một tỷ lệ trúng đích cao, nhưng "nhanh hơn bao nhiêu lần" trên một GPU cụ thể chính là con số mà OpenBMB không công bố.
• Sự mơ hồ về cửa sổ ngữ cảnh ở trên: tài liệu tiếp thị ghi 512K, cấu hình được phát hành ghi 131.072, và không có gì trong các kho lưu trữ mã nguồn kết nối được hai con số này.
Nơi một bản phát hành open-weight thầm lặng tìm được chỗ đứng trong stack
Cách đọc trung thực về MiniCPM5-2B ở thời điểm hiện tại là đây là một vụ đặt cược: số liệu từ nhà cung cấp rất ấn tượng, nhưng không có lần chạy độc lập nào, không có lịch sử phục vụ, và mô hình draft có mức tăng tốc trong thực tế vẫn chưa được đo lường. Đó chính xác là tình huống mà một lớp định tuyến tồn tại để xử lý. Một nhóm muốn kiểm tra xem đầu ra của một mô hình mở nhỏ có thể thay thế một mô hình lưu trữ mà họ đang gọi hay không có thể chạy phép so sánh đó từ một API duy nhất — OrcaRouter kết nối trực tiếp với hơn 200 mô hình lưu trữ theo giá niêm yết của nhà cung cấp, không cộng thêm phí, vì vậy một tuần đánh giá gần như không tốn chi phí để thiết lập, và cơ chế chuyển đổi dự phòng tự động có nghĩa là một checkpoint chỉ mới vài ngày không bao giờ phải kìm giữ một luồng production làm con tin trong lúc nó tự chứng minh giá trị. Không điều nào trong số đó đòi hỏi MiniCPM5-2B phải được lưu trữ ở bất kỳ đâu; nó là tấm lưới an toàn bao quanh các mô hình mà bạn đã phụ thuộc, trong lúc bạn quyết định liệu một mô hình 2B tự lưu trữ có xứng đáng với số GPU đầu tư hay không.
Theo dõi, theo thứ tự quan trọng: một lần chạy SGLang DSPARK độc lập báo cáo số token thực tế mỗi giây cho cặp mô hình, vì độ dài chấp nhận chỉ là một đại diện gián tiếp chứ không phải một chuẩn đánh giá; một thông báo chính thức hoặc một bản mirror ModelScope xác nhận bản phát hành là bản cuối cùng; và một nhà cung cấp hosting đưa MiniCPM5-2B vào hỗ trợ — nếu có nhà cung cấp nào làm vậy, giá bạn trả cho phía chúng tôi sẽ đúng bằng giá niêm yết của nhà cung cấp đó, cùng ngày, vì đó chính là ý nghĩa của pass-through. Trong khi đó, mô hình draft mới là sản phẩm đáng chú ý hơn trong hai. Một mô hình đề xuất năm lớp mà mô hình đích chấp nhận năm token rưỡi trong bảy token chính là yếu tố tạo nên khác biệt giữa một mô hình biên nhỏ với cảm giác nhỏ bé và một mô hình có cảm giác như một mô hình lớn hơn đang chạy trên cùng một thiết bị.
