Thẻ tiêu đề hero cho bài so sánh MiniCPM5-2B-DSpark với Granite 4.2 3B, kèm phụ đề “Hai bản phát hành Apache-2.0 thầm lặng cho việc phục vụ gọn nhẹ và nhanh chóng”, thể hiện hai hộp các-tông mở đặt cạnh nhau — hộp bên trái phát ra tia sét có nhãn “DSpark draft”, còn hộp bên phải hiển thị bánh răng có nhãn “chế độ suy luận” — với dải ruy băng Apache-2.0 trải ngang phía dưới và logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

MiniCPM5-2B-DSpark so với Granite 4.2 3B: Hai bản phát hành Apache-2.0 thầm lặng dành cho việc phục vụ tự lưu trữ nhỏ gọn, nhanh chóng

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Tháng 8 và đầu tháng 9 năm 2026 đã chứng kiến hai bản phát hành thầm lặng, dưới giấy phép Apache-2.0, cùng nhắm đến một việc — những mô hình nhỏ bạn tự lưu trữ — nhưng tiếp cận từ hai hướng ngược nhau. Granite 4.2 3B là mô hình suy luận cỡ laptop của IBM, có trọng số được đăng lên Hugging Face vào đầu tháng 8 và thẻ mô hình cùng blog kỹ thuật được công bố vào ngày 25 tháng 8 năm 2026. MiniCPM5-2B-DSpark hoàn toàn không phải là một mô hình theo nghĩa tương tự: nó là một checkpoint nháp DSpark với 323,8 triệu tham số mà OpenBMB đăng vào ngày 6 tháng 9 năm 2026 mà không kèm bất kỳ thông báo nào, được xây dựng để giúp MiniCPM5-2B — mô hình dense trên thiết bị 2,52 tỷ tham số mà ModelBest công bố tại WAIC vào ngày 19 tháng 7 năm 2026 — sinh token nhanh hơn nhờ giải mã suy đoán (speculative decoding). Một bản phát hành là mô hình suy luận nhỏ độc lập; bản còn lại là phụ kiện tăng tốc cho một mô hình nhỏ. Cả hai đều dưới giấy phép Apache-2.0, chỉ hỗ trợ tự lưu trữ, và đều chưa được bất kỳ bài kiểm chuẩn độc lập nào động đến.

Gỡ lớp tiếp thị đi, câu hỏi thực tế một đội ngũ phải đối mặt rất đơn giản: với một workload serving nhỏ, tự lưu trữ vào cuối năm 2026, bạn muốn chọn chuyên gia suy luận 3B của IBM hay stack hướng agent 2B của ModelBest kèm bản draft miễn phí được gắn thêm? Bằng chứng hiện có mỏng hơn những gì bảng thông số kỹ thuật của cả hai hãng cho thấy, nên bài viết này sẽ lần lượt điểm qua các dữ kiện phát hành, bộ số liệu duy nhất hiện có trong cùng một bộ thử nghiệm, và sự khác biệt về workload cần dẫn dắt quyết định lựa chọn.

Hai bản phát hành, những gì có thể biết được

Granite 4.2 3B là mô hình suy luận nhỏ nhất của IBM, được huấn luyện tiếp từ Granite-4.1-3B-Base. Đây là mô hình dense, chỉ xử lý văn bản — gồm 40 tầng, cơ chế grouped-query attention, cửa sổ ngữ cảnh gốc 128K mở rộng lên 512K trong giai đoạn tiền huấn luyện thứ năm, cùng ba chế độ suy luận: tư duy đầy đủ (mặc định), chế độ nỗ lực thấp và chế độ không tư duy. Thẻ mô hình của IBM nêu rõ rằng bản 3B cố tình bỏ qua khối học tăng cường tác nhân (agentic reinforcement learning) mà các phiên bản Granite 4.2 lớn hơn nhận được, nên mô hình không công bố kết quả SWE-Bench và được xem là mô hình suy luận chứ không phải mô hình tác nhân. Mô hình phục vụ qua vLLM, SGLang, Transformers, GGUF và Ollama (granite4.2:3b), đồng thời không có API lưu trữ. Các con số nổi bật trên thẻ — 78,33 trên AIME 2025, 54,80 GPQA, 69,71 LiveCodeBench v6 — do nhà cung cấp công bố và tính đến nay vẫn chưa được tái lập độc lập.

A screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b (reused from a published sibling) showing the Model Overview with the 3B dense decoder-only architecture, 128K native context extending to 512K, and the Apache-2.0 license.

Thẻ ibm-granite/granite-4.2-3b ở trên là bộ mặt ra mắt công khai của bản phát hành đó: một bản 3B được tinh chỉnh theo hướng suy luận, với câu chuyện về ngữ cảnh dài và không có tuyên bố nào về khả năng tác nhân.

Ngược lại, MiniCPM5-2B-DSpark chỉ tồn tại để phục vụ mục tiêu của nó. Bản nháp gồm năm lớp full-attention với 323.776.001 tham số, kích thước khối là bảy token ứng viên cho mỗi lượt truyền xuôi, được huấn luyện trong sáu epoch trên 7,05 tỷ token từ các phản hồi do MiniCPM5-2B tạo ra. Kho lưu trữ của nó báo cáo độ dài chấp nhận — trung bình 5,52 token được chấp nhận mỗi bước xác minh ở giải mã tham lam, 6,11 đối với mã — nhưng không có con số token mỗi giây. Đối tượng mà nó tăng tốc, MiniCPM5-2B, mới là sản phẩm thú vị hơn: một mô hình dense 2,52B, 42 lớp, ngữ cảnh 128K, với tài liệu ra mắt nhấn mạnh vào năng lực tác tử — huấn luyện trung gian tác tử quy mô 200B, bộ SFT tác tử lớn và căn chỉnh RL tác tử, theo thông báo tháng 7 của ModelBest — cùng ngữ cảnh dài bản địa và các chế độ lai nhanh/cân nhắc. Trong bộ so sánh riêng của ModelBest, mô hình mục tiêu đạt điểm trung bình 53,9 so với các mô hình mở cùng phân khúc. Tất cả những con số đó đều là của nhà cung cấp.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B description, and the Model Specification table listing the MiniCPM5-2B target, five draft layers, and a block size of seven.

Thẻ openbmb/MiniCPM5-2B-DSpark phía trên chính là toàn bộ phạm vi phát hành: model card, cấu hình, một tệp Safetensors và không có thông báo nào.

So sánh duy nhất hiện có trong cùng một bộ sản phẩm

Các bảng so sánh điểm số giữa các nhà cung cấp khác nhau chủ yếu là kiểu so sánh khập khiễng, nhưng có một nơi mà Granite 4.2 3B và MiniCPM5-2B được đo cùng nhau: chính là bảng đánh giá của ModelBest cho MiniCPM5-2B, trong đó liệt kê granite-4.2-3B như một trong những đường cơ sở. Trên bộ đánh giá đó, MiniCPM5-2B đạt trung bình 53.9 so với 42.7 của Granite 4.2 3B. Hãy đọc con số đó đúng như bản chất của nó — một nhà cung cấp chạy cả hai mô hình trên một bộ đánh giá, không được tái lập, và được lựa chọn để làm mô hình của chính mình trông đẹp hơn. Đó không phải là một phán quyết. Điều nó cho bạn biết là ModelBest đã đủ tự tin để đưa một mô hình 3B của đối thủ lên bảng đánh giá, và khoảng cách họ tuyên bố là lớn nhất đúng ở nơi mà quá trình huấn luyện của chính họ đầu tư: các hạng mục ngữ cảnh dài và agentic. Hãy coi đó là một tuyên bố định hướng, hãy kiểm chứng trên dữ liệu của chính bạn, và cân nhắc các tuyên bố riêng của IBM trên bảng đánh giá của họ trước khi bạn quyết định bất cứ điều gì dựa trên nó.

Bảng điểm, được dán nhãn trung thực.

• Các mô hình — MiniCPM5-2B-DSpark: mô hình draft 324M cho MiniCPM5-2B (mô hình đích dense 2.52B), không chạy độc lập. Granite 4.2 3B: mô hình suy luận dense ~3B chạy độc lập.

• Vai trò — Dòng MiniCPM5-2B: nhấn mạnh tác tử trên thiết bị và khả năng dùng công cụ, theo ModelBest. Granite 4.2 3B: chuyên gia suy luận, được thiết kế cố ý không theo hướng tác tử.

• Ngữ cảnh — MiniCPM5-2B mục tiêu: 128K gốc. Granite 4.2 3B: 128K gốc, mở rộng lên 512K.

• Tăng tốc — MiniCPM5-2B-DSpark: mô hình nháp DSpark bên ngoài, bảy token mỗi lượt, tỷ lệ chấp nhận tham lam ~5.5 mỗi bước (theo báo cáo trong repo). Granite 4.2 3B: không có gì được cung cấp kèm trong bản phát hành này.

• Giấy phép — cả hai đều là Apache-2.0.

• Bằng chứng — Các con số của MiniCPM là tuyên bố trên model card của ModelBest (bộ đánh giá của họ: 53.9 so với Granite 42.7); các con số của Granite là tuyên bố trên model card của IBM (AIME 2025 78.33, GPQA 54.80). Cả hai đều chưa có lần chạy độc lập nào.

A two-column scoreboard for MiniCPM5-2B-DSpark vs Granite 4.2 3B: left column MiniCPM5-2B-DSpark with What it is: 324M draft + 2.52B dense target, on-device agent and tool-use role, 128K native context, DSpark acceleration at 7 tokens per pass, Apache-2.0 license, and own-suite average 53.9; right column Granite 4.2 3B with a standalone ~3B dense reasoning model, non-agentic role, 128K native / 512K extended context, no shipped acceleration, Apache-2.0 license, and AIME 2025 78.33 / GPQA 54.80, with a footer reading All figures vendor-reported; no independent run of either and the OrcaRouter logo in the bottom-right corner.

Bảng điểm ở trên có cùng nguồn trích dẫn như phần văn xuôi: mọi con số trên đó đều do nhà cung cấp báo cáo, và con số cùng bộ duy nhất mà một trong hai nhà cung cấp đã công bố là con số của chính ModelBest.

Sự khác biệt vượt trên mọi chuẩn mực

Trước khi xem điểm số, hãy xác định loại mô hình nhỏ mà khối lượng công việc của bạn cần, vì hai bản phát hành này trả lời cho những câu hỏi khác nhau. Granite 4.2 3B được xây dựng để suy luận và xử lý ngữ cảnh dài trên phần cứng hạn chế: cửa sổ gốc 128K mở rộng lên 512K, ba chế độ tư duy theo từng truy vấn, kích thước chạy được trên laptop, và quyết định rõ ràng bỏ qua việc huấn luyện tác nhân. Nếu công việc của bạn là phân tích tài liệu dài, ngữ cảnh quy mô kho lưu trữ mã nguồn, hoặc suy luận đáng tin cậy trên một thiết bị nhỏ, đó là sự phù hợp nhất quán. MiniCPM5-2B được xây dựng theo hướng ưu tiên ngược lại: hành vi tác nhân và sử dụng công cụ trên thiết bị — việc bản nháp tồn tại cho thấy ModelBest kỳ vọng mục tiêu này sẽ được phục vụ tương tác và muốn lấy lại số token mỗi giây. Nếu công việc của bạn là một vòng lặp tác nhân trên thiết bị gọi công cụ và duy trì các cuộc trò chuyện dài, đó là bộ giải pháp dành cho bạn.

Bản dự thảo làm thay đổi tính kinh tế của lựa chọn thứ hai đó theo cách mà bản phát hành Granite không giải quyết. MiniCPM5-2B là mô hình dense, và giải mã suy đoán phát huy hiệu quả cao nhất đúng trong chế độ dense, bị giới hạn bởi bộ nhớ — một mô hình cố định nhỏ đề xuất token cho một mô hình cố định lớn hơn một chút. Một mô hình đề xuất bên ngoài bổ sung khoảng 650MB trọng số BF16 vào mô hình đích ~5GB, với đường dẫn phục vụ SGLang được tài liệu hóa và tỷ lệ chấp nhận tham lam khoảng năm token rưỡi mỗi bước xác minh, là một đòn bẩy thông lượng đáng tin cậy cho mô hình bạn phục vụ ở mức đồng thời một yêu cầu. Nhưng điểm hạn chế là không thể tránh khỏi: OpenBMB chưa công bố mức tăng tốc đầu cuối, nên đòn bẩy này chưa được hiệu chuẩn. IBM không cung cấp mô hình đề xuất bên ngoài tương đương nào cho Granite 4.2 3B trong bản phát hành này — bạn chạy nó ở chế độ dense, và câu chuyện tốc độ của nó chỉ đơn giản là mô hình 3B nhỏ.

Ai nên điều hành cái gì

• Hãy chạy Granite 4.2 3B nếu khối lượng công việc của bạn là suy luận ngữ cảnh dài trên một chiếc máy tính tầm laptop — tài liệu, kho mã nguồn, phân tích đơn luồng chuyên sâu — và bạn muốn ba chế độ tư duy cùng giới hạn tối đa 512K trên một mô hình Apache-2.0 mà bạn kiểm soát hoàn toàn. Hãy chấp nhận rằng đằng sau nó không có huấn luyện agentic và không có API lưu trữ sẵn.

Chạy stack MiniCPM5-2B với bản nháp DSpark của nó nếu khối lượng công việc của bạn là một agent trên thiết bị mang tính tương tác, gọi công cụ, khi mục tiêu nằm trong ngân sách bộ nhớ của bạn và bạn muốn thông lượng mà một bản nháp có thể bù lại. Hãy dành thời gian để đo mức tăng tốc thực tế của bản nháp trên bản dựng SGLang của riêng bạn, vì chưa có con số nào được công bố cho nó.

• Chạy cả hai phía sau một lớp định tuyến nếu bạn thực sự không chắc chắn. Không mô hình nào hiện có trong danh mục lưu trữ hôm nay, bao gồm cả OrcaRouter — cả hai đều là phương án tự lưu trữ — nhưng một bộ định tuyến đứng trước các endpoint của riêng bạn với khả năng tự động chuyển đổi dự phòng cho phép ngăn xếp bản nháp mới nằm trên một đường thử nghiệm trong khi production vẫn dùng mô hình đã được kiểm chứng, và mức phụ phí 0% của nó trên các mô hình lưu trữ xung quanh giúp việc so sánh A/B trở nên rẻ. Vấn đề cốt lõi là khả năng đảo ngược: đổi tên mô hình, đo lường, và chuyển lại nếu checkpoint mới chỉ một ngày tuổi bị trục trặc.

Xem gì tiếp theo

Hai điều sẽ giúp phân định cuộc so kè này nhanh hơn bất kỳ ý kiến nào. Thứ nhất, một lần chạy thử độc lập của MiniCPM5-2B để xác nhận hoặc bác bỏ {{1}}mức trung bình 53.9{{/1}} và những tuyên bố về năng lực tác tử — một mô hình 2B đạt điểm cao đến vậy trên các tác vụ kiểu SWE-Bench sẽ thực sự là một điểm dữ liệu mới cho phân khúc mô hình chạy trên thiết bị. Thứ hai, các con số của mô hình suy luận do chính IBM công bố phải vượt qua được thử thách tái lập của cộng đồng; {{2}}78.33 AIME 2025 của mô hình 3B{{/2}} là kiểu tuyên bố sẽ thay đổi khi người khác chạy lại. Cho đến khi một trong hai điều đó thành hiện thực, lập trường trung thực là: Granite 4.2 3B là mô hình nhỏ an toàn hơn và được ghi chép đầy đủ hơn ở thời điểm hiện tại, còn bộ stack MiniCPM5-2B là ván cược thú vị hơn — một tác tử nhanh hơn trên thiết bị nếu các tuyên bố của nó đứng vững, với một mô hình draft mà ngay cả chính nhà phát hành cũng chưa đo lường được lợi ích.