
MiniCPM5-2B-DSpark vs Gemma 4 12B: Hai cách soạn thảo, hai hạng cân của AI cục bộ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Cách nhanh nhất để hiểu vì sao MiniCPM5-2B-DSpark và Gemma 4 12B nên nằm chung một trang là hãy tạm gác kích thước của chúng sang một bên và xem mỗi mô hình viết một câu như thế nào. Cả hai đều lách bộ nhớ bus bằng một drafter: một mô hình nhỏ đề xuất cùng lúc nhiều token tiếp theo và mô hình thật xác minh cả khối trong một lượt duy nhất, nhờ đó silicon chỉ trả chi phí tải trọng số một lần cho mỗi khối thay vì một lần cho mỗi token. MiniCPM5-2B-DSpark là bản draft mà OpenBMB đăng âm thầm lên Hugging Face vào ngày 6 tháng 9 năm 2026 — một checkpoint đồng hành 323,8M tham số giúp tăng tốc MiniCPM5-2B, mô hình trên thiết bị dense 2,52B mà ModelBest công bố tại WAIC vào ngày 19 tháng 7 năm 2026. Gemma 4 12B là mô hình đa phương thức tổng quát không encoder 11,95B của Google, ra mắt vào ngày 3 tháng 6 năm 2026 với drafter tích hợp sẵn và ngữ cảnh 256K. Một bên bán drafter dưới dạng checkpoint Apache-2.0 riêng biệt để bạn tự tải lên; bên kia giấu một thủ thuật tương tự bên trong một mô hình lớn duy nhất mà bạn chỉ cần chạy.
Lưu ý trung thực định hình bài viết này: MiniCPM5-2B-DSpark không phải là một mô hình có thể nhắc lệnh. Nó không có tokenizer, không có chat template, cũng không có đầu ra độc lập — chỉ là một thẻ liệt kê một file model.safetensors, một config và một README. Nó là một phụ kiện tầng phục vụ cho mục tiêu thuộc lớp 2B, và sự so sánh thực sự mà độc giả đang cân nhắc là giữa hai hạng khối lượng AI cục bộ: một bộ 2B cỡ chiếc điện thoại tự soạn các token của nó, so với một mô hình đa năng 12B nặng 16 gigabyte tự soạn các token của nó. Mọi điều còn lại dưới đây chính là quyết định đó được cụ thể hóa.
MiniCPM5-2B-DSpark thực chất là gì
Model card là toàn bộ bề mặt công khai của bản phát hành, do đó đây là những gì có thể biết được từ nó. MiniCPM5-2B-DSpark là một checkpoint draft DSpark: năm lớp full-attention, 323,776,001 tham số, grouped-query attention với 16 query head và 2 KV head, cùng kích thước khối là bảy — nó đề xuất tối đa bảy token ứng viên trong mỗi lượt forward pass để mô hình mục tiêu MiniCPM5-2B xác minh. Cấu hình khai báo kiến trúc Qwen3DSparkModel với auto-map DSparkDraftModel, đồng thời confidence head và Markov head của phương pháp DSpark (arXiv 2607.05147, bài báo DeepSeek tháng 7 năm 2026) vẫn được bật — bộ xác minh nhạy tải quyết định khi nào một hậu tố không đáng để kiểm tra. Mô hình được huấn luyện trong sáu epoch trên 7,05 tỷ token từ các phản hồi do MiniCPM5-2B tạo ra cho các prompt tổng quát, toán học và mã nguồn.

Thẻ thông tin openbmb/MiniCPM5-2B-DSpark ở trên là toàn bộ nội dung được phát hành: thẻ mô hình, cấu hình, một tệp Safetensors, và không có thông báo, không có bài blog, không có thông cáo báo chí — một bản phát hành trọng số lặng lẽ mới chỉ một ngày tuổi tại thời điểm viết bài.
Những gì thẻ thông số không chứa cũng quan trọng như những gì nó chứa. Nó báo cáo độ dài chấp nhận — trong đánh giá của chính kho lưu trữ, tổng cộng 5,52 token được chấp nhận trên mỗi bước xác minh ở chế độ giải mã tham lam, với toán học ở mức 6,05 và mã ở mức 6,11 trên trần bảy token — nhưng nó không công bố mức tăng tốc thời gian thực, không có chỉ số token trên giây, và không có điểm chuẩn độc lập nào. Công cụ DSPARK của SGLang là đường dẫn phục vụ được ghi nhận, với bản nháp được tải bên cạnh mục tiêu MiniCPM5-2B. Nói cách khác: chất lượng của bản nháp đã được định lượng, nhưng lợi ích thực tế của nó thì chưa, và bất kỳ ai áp dụng nó nên đo lường trước khi tin tưởng.
Những gì Gemma 4 12B mang lại cho phía bên kia
Gemma 4 12B là đứa con giữa trong gia đình Gemma 4 của Google và nằm ở một điểm hoàn toàn khác trên đường cong AI cục bộ. Đây là một mô hình dense 11.95B duy nhất nhận văn bản, hình ảnh, âm thanh và video làm đầu vào mà không cần bộ mã hóa riêng, hỗ trợ gọi công cụ ngay lập tức, và kết hợp ngữ cảnh gốc 256K với các trình dự thảo dự đoán nhiều token — các trình này thực hiện cùng một thủ thuật bus bộ nhớ nội bộ — nhưng từ bên trong checkpoint, nên không có gì thêm để bạn tải về hay kết nối. Nó được phát hành theo Apache 2.0, chạy được trên laptop 16GB trong thực tế, và ra mắt với toàn bộ hệ thống hỗ trợ của Google: các bài đánh giá khi phát hành, thẻ mô hình cho các biến thể base và instruction, hỗ trợ hệ sinh thái trên Model Garden, LM Studio và Ollama. Nó đã có nhiều tháng triển khai trong cộng đồng, điều mà bản dự thảo MiniCPM mới chỉ một ngày tuổi không có được.

Thẻ mô hình Gemma 4 12B của Google ở trên cho thấy sự tương phản ngay trong một khung hình: một mô hình đa năng đa phương thức trưởng thành, mà các mô hình draft của nó là một đặc điểm của bản phát hành, chứ không phải một kho lưu trữ riêng biệt.
Thông số kỹ thuật, được ghi nhãn trung thực
Cần đọc các số liệu này với lưu ý về nguồn gốc: số liệu MiniCPM5-2B là tuyên bố trên thẻ thông số của ModelBest, chưa được kiểm chứng lại; số liệu Gemma 4 12B là của chính Google, vốn đã được cộng đồng sử dụng từ lâu.
• {{1}}Bạn chạy gì — {{/1}}MiniCPM5-2B-DSpark: một bản nháp 324M chỉ hoạt động bên cạnh MiniCPM5-2B (2.52B dense, 42 lớp). Gemma 4 12B: một mô hình dense độc lập 11.95B.
• Ngữ cảnh — MiniCPM5-2B mục tiêu: 128K native. Gemma 4 12B: 256K native.
• Phương thức — Hệ MiniCPM5-2B: chỉ hỗ trợ văn bản. Gemma 4 12B: đầu vào văn bản, hình ảnh, âm thanh và video, không cần bộ mã hóa.
• Dự thảo — MiniCPM5-2B-DSpark: mô hình dự thảo DSpark bên ngoài, bảy token mỗi lượt, SGLang DSPARK engine. Gemma 4 12B: các bộ dự thảo dự đoán đa token nội bộ, không cần cài đặt gì.
• Dung lượng — MiniCPM5-2B dự kiến khoảng 5GB ở BF16 cộng với tệp draft ~650MB; Gemma 4 12B khoảng 18GB ở BF16, khả thi trên phần cứng 16GB khi được lượng tử hóa.
• Bằng chứng — MiniCPM5-2B-DSpark: chỉ có số liệu về độ dài chấp nhận trong kho lưu trữ, mới chỉ một ngày tuổi. Gemma 4 12B: đánh giá khi ra mắt cộng với nhiều tháng triển khai cộng đồng.

Bảng điểm ở trên là cùng một bức chân dung được xếp thành sáu hàng: hai cột bất đồng về gần như mọi thứ, ngoại trừ chiến lược mà cả hai sử dụng để viết nhanh.
Hạng cân nào hợp với silicon mà bạn thực sự có?
Vì MiniCPM5-2B-DSpark không phải là một mô hình, điểm khác biệt có ý nghĩa nằm ở hạng khối lượng tham số của mô hình mục tiêu so với Gemma 4 12B — và điểm khác biệt đó về cơ bản là một bài toán phần cứng. Một chiếc điện thoại, một bo mạch buồng lái thông minh, hay một hộp edge nhỏ với vài gigabyte DRAM không thể chạy mô hình 11,95B ở tốc độ hữu dụng; bus bộ nhớ chính xác là nút thắt cổ chai sẽ làm nghẹt nó. Đó chính là thế giới mà bộ công cụ MiniCPM5-2B được xây dựng cho — một mô hình dense 2B có trọng số nằm gọn trong bộ nhớ thiết bị, với một mô hình draft được gắn thêm vào để lấy lại một phần số token mỗi giây mà các mô hình dense nhỏ phải đánh đổi. Giải mã suy đoán (speculative decoding) phát huy hiệu quả cao nhất chính xác trong chế độ dense, giới hạn bộ nhớ này, và đó là lý do vì sao mô hình draft là phần thú vị của bản phát hành chứ không phải một chiêu trò.
Gemma 4 12B là câu trả lời ở một hạng cân cao hơn. Nếu thiết bị của bạn có từ 16GB trở lên — một chiếc laptop, một máy trạm, hay một máy chủ biên cấu hình mạnh — bạn có thể mang theo mô hình đa phương thức tổng quát này, và bạn nhận được ba thứ mà bộ 2B không thể mang lại: đầu vào hình ảnh, âm thanh và video mà không cần encoder hay một pipeline thứ hai; một cửa sổ ngữ cảnh 256K cho công việc ở quy mô kho lưu trữ hoặc quy mô tài liệu; và độ trưởng thành mà một checkpoint nháp mới được một ngày tuổi đơn giản là không có. Bạn đánh đổi khả năng chạy trên những thiết bị nhỏ nhất và phải chi trả mức chiếm dụng bộ nhớ gấp khoảng ba lần.
Thực tế định tuyến cho cả hai
Không bên nào trong cặp so sánh này hiện có trong danh mục lưu trữ, kể cả của OrcaRouter. MiniCPM5-2B-DSpark về bản chất là một phụ kiện phục vụ tự lưu trữ — bạn tự chạy bộ SGLang, và bản nháp chỉ tồn tại trong triển khai cục bộ của bạn. Gemma 4 12B có trọng số mở, nên bạn tự phục vụ nó hoặc dùng nó ở nơi đã có sẵn. Đó chính xác là tình huống mà một lớp định tuyến phát huy giá trị như một lưới an toàn thay vì một cơ chế phân phối: khi bạn thử nghiệm một bản dựng nháp hoàn toàn mới so với khối lượng công việc bạn đang phục vụ, việc trỏ đường thử nghiệm qua một API duy nhất với cơ chế chuyển đổi dự phòng tự động nghĩa là một bộ công nghệ chưa được kiểm chứng có thể gặp trục trặc mà không kéo hệ thống sản xuất xuống theo, và giá niêm yết của nhà cung cấp xung quanh nó được chuyển qua với mức phụ phí 0%, nên thay đổi giá trên bất kỳ mô hình lưu trữ nào bạn so sánh sẽ hiện lên ngay trong ngày. Tuy nhiên, đối với bản thân việc so sánh, kế hoạch trung thực cho cả hai mô hình là như nhau: bạn đang tự lưu trữ, nên điểm chuẩn quan trọng là điểm chuẩn bạn chạy trên chính phần cứng của mình.
Bản án
MiniCPM5-2B-DSpark và Gemma 4 12B không phải là đối thủ của nhau theo bất kỳ nghĩa đối đầu trực tiếp nào — chúng là hai hạng cân của AI cục bộ mà tình cờ dùng chung một mẹo. Chọn bộ công cụ MiniCPM5-2B với bản draft DSpark khi thiết bị của bạn không thể tải mô hình 12B và bạn muốn một mô hình hỗ trợ văn bản, theo giấy phép Apache-2.0, định hướng tác tử, vừa vặn trong bộ nhớ trên thiết bị; bản draft là một cách tăng tốc miễn phí đầy hứa hẹn, nhưng hãy tự đo lường trên bản dựng SGLang của bạn trước khi tin tưởng nó, vì lợi ích mà nó mang lại vẫn chưa được định lượng. Chọn Gemma 4 12B khi phần cứng của bạn có đủ dư địa và bạn muốn một mô hình đa phương thức duy nhất với cửa sổ 256K và một hệ sinh thái đứng sau. Câu hỏi không phải là mô hình nào thông minh hơn — mà là con chip của bạn thực sự có thể cấp liệu cho mô hình nào.
