Thẻ tiêu đề hero cho bài viết 'Trọng số MiniCPM5-2B đã phát hành', với phụ đề 'Mô hình từng giành ngôi vương phân khúc dưới 4B đã âm thầm chuyển sang mã nguồn mở', ba chip hiển thị 'Apache-2.0', '2.5B tham số · ngữ cảnh 128K' và 'AA Index 17 — #1 dưới 4B khi ra mắt', cùng dải băng phía trên 'TRỌNG SỐ MỞ · T9/2026'.
Guides & Insights

MiniCPM5-2B Đã Phát Hành Trọng Số: Mô Hình Nhỏ Giành Ngôi Vương Dưới 4B Nay Mở Mã Nguồn

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Bản thân mô hình mới chỉ bảy tuần tuổi. MiniCPM5-2B đã được ra mắt tại Hội nghị Trí tuệ Nhân tạo Thế giới 2026 vào ngày 19 tháng 7, nơi ModelBest và OpenBMB gọi nó là mô hình được xếp hạng cao nhất dưới 4B tham số trên bảng xếp hạng của Artificial Analysis và hứa rằng các bộ trọng số sẽ được phát hành "trong tương lai gần". Điều đã xảy ra vào cuối tuần này là "tương lai gần" đó đã đến mà không hề có sự phô trương ra mắt: kho lưu trữ MiniCPM5-2B đã chính thức có mặt trên Hugging Face vào ngày 6 tháng 9, và nhật ký thay đổi của OpenBMB ghi nhận bản phát hành vào ngày 7 tháng 9, theo giấy phép Apache-2.0, với đầy đủ gói — trọng số BF16, các bản lượng tử hóa GGUF, MLX và GPTQ, các checkpoint nền tảng và SFT, mô hình draft DSpark cho giải mã suy đoán, cùng các bộ dữ liệu huấn luyện đứng sau chúng.

Không có thông cáo báo chí nào đi kèm và cũng không có sự kiện ra mắt. Nó chỉ đơn giản xuất hiện: một ngày là kho lưu trữ Hugging Face, ngày tiếp theo là một dòng trong nhật ký thay đổi. Điều đó khiến đây là một bài viết dạng "những gì chúng ta biết cho đến nay" — kèm một cập nhật ban đầu. Kho lưu trữ cho chúng ta biết khá nhiều điều: mô hình thực sự có thể tải xuống và chạy được ngay hôm nay, và bảng thông số kỹ thuật được công khai. Và một điểm số từ bên ngoài đã xuất hiện: Artificial Analysis xếp MiniCPM5-2B ở mức 15 trên Intelligence Index v4.2, kết quả open-weights cao nhất dưới 4B tổng tham số trên chỉ số đó, vì vậy thứ hạng phân khúc dưới 4B không còn chỉ dựa vào lời tuyên bố của nhà phát hành. Điều vẫn chưa được xác nhận là các con số chính trong model card, vốn được OpenBMB tái tạo trong hệ thống thử nghiệm riêng của họ và chưa ai bên ngoài phòng thí nghiệm chạy lại. Dưới đây là những gì có thể biết được từ kho lưu trữ, những gì hiện đã được đo lường độc lập, và những gì vẫn cần xác minh trước khi bạn xây dựng dựa trên nó.

Chuyện gì vừa xảy ra vậy?

MiniCPM5-2B là mô hình thứ hai trong dòng MiniCPM5, nối tiếp MiniCPM5-1B — mô hình mà OpenBMB đã phát hành mã nguồn mở vào ngày 19 tháng 5. Khi bản 2B ra mắt như một sản phẩm tại WAIC, câu chuyện về chip cũng đậm nét không kém câu chuyện về mô hình — ModelBest định vị nó như một nền tảng tác tử trên thiết bị dành cho điện thoại, PC và buồng lái thông minh, đồng thời nêu tên chín loại chip được hỗ trợ ngay từ ngày đầu tiên thông qua cộng đồng FlagOS, từ Huawei Ascend đến NVIDIA cùng hàng loạt bộ tăng tốc nội địa. Việc mở mã nguồn được cho là sắp diễn ra. Bảy tuần đã trôi qua.

Vào ngày 6 tháng 9, kho lưu trữ openbmb/MiniCPM5-2B đã xuất hiện. Tính đến thời điểm viết bài này, thẻ mô hình là thông báo phát hành, và nó đầy đủ một cách bất thường đối với một bản phát hành thầm lặng:

• Trọng số — checkpoint sau huấn luyện RL + OPD cuối cùng ở định dạng BF16, được cấp phép Apache-2.0 và không bị giới hạn truy cập — bất kỳ ai cũng có thể tải xuống.

• Các điểm kiểm tra đi kèm — MiniCPM5-2B-SFT, -Midtrain và -Base dành cho những ai muốn có mô hình trước giai đoạn RL/OPD, cùng với -GGUF, -MLX, -GPTQ và mô hình draft -DSpark, tất cả đều được liệt kê trong bộ sưu tập MiniCPM5 trên Hugging Face.

• Dữ liệu — các kho ngữ liệu huấn luyện cũng được mở công khai, được phát hành như một phần của họ UltraData: Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, UltraData-SFT-Agent-2609 và UltraData-RL-2609.

• Bản sao — tệp README trỏ đến cả Hugging Face và ModelScope.

Một dòng trong thẻ mô hình quan trọng hơn vẻ ngoài của nó: "không kernel tùy chỉnh, không fork mã mô hình." MiniCPM5-2B sử dụng kiến trúc LlamaForCausalLM chuẩn, vì vậy bất kỳ engine nào đã phục vụ các mô hình họ Llama đều có thể tải nó mà không cần chờ triển khai chuyên biệt.

Tại sao một mô hình 2.5B lại đáng để xem xét lại

Bài thuyết trình tại WAIC là một bài thuyết trình về xếp hạng. ModelBest cho biết MiniCPM5-2B đạt Chỉ số Trí tuệ Phân tích Nhân tạo (Artificial Analysis Intelligence Index) 17, đưa mô hình này lên vị trí đầu tiên trong số các mô hình dưới 4B tham số trên bảng xếp hạng AA tại thời điểm ra mắt. Bên cạnh con số đó cần hai lưu ý. Thứ nhất, điểm chỉ số chỉ có thể so sánh trong cùng một phiên bản phương pháp luận: con số 17,9 trước đó của MiniCPM5-1B đến từ một bản chụp (snapshot) AA cũ hơn, vì vậy nó không phải bằng chứng cho thấy mô hình nhỏ hơn "đạt điểm cao hơn", và theo cùng nguyên tắc đó, một điểm số mới hơn trên một phương pháp luận mới hơn không phải là sự suy giảm. Thứ hai, số liệu của AA được nạp vào thẻ mô hình (model card), nhưng điểm trung bình tiêu đề của thẻ là số liệu của riêng OpenBMB, được tái lập trong khung đánh giá (harness) của riêng OpenBMB. Sự phân biệt này quan trọng vì AA từ đó đã chuyển sang một phương pháp luận mới hơn và công bố một điểm số mới — sự kiểm chứng bên ngoài đầu tiên cho bài thuyết trình này kể từ khi phát hành bộ trọng số mở.

Một con số bên ngoài xuất hiện cùng tuần với các bộ trọng số. Vào ngày 4 tháng 9, Artificial Analysis phát hành Intelligence Index v4.2, một bản sửa đổi phương pháp luận nâng trọng số cho các bài kiểm tra riêng tư, held-out lên 40% và bổ sung hai thành phần mới — AA-Briefcase, một bài đánh giá tác tử (agentic), và GDP.pdf của Surge, một bài tập suy luận tài liệu ngữ cảnh dài. Mục nhập chỉ số của AA cho MiniCPM5-2B hiện mang điểm v4.2 là 15: kết quả cao nhất trong số các mô hình trọng số mở dưới 4B tổng tham số, và đứng đầu trong số 47 mô hình mở cùng phân khúc kích thước trên bảng xếp hạng của AA. Điều đó giữ mô hình ở đúng vị trí mà lời giới thiệu tháng 7 đã đặt nó, lần này dựa trên phương pháp luận khó gian lận hơn và với bộ trọng số mà bất kỳ ai cũng có thể tải về và kiểm tra lại. Điểm 15 không thể so sánh trực tiếp với điểm 17 thời ra mắt, vốn đến từ v4.1 — phương pháp luận chặt chẽ hơn chứ không phải mô hình yếu hơn — và chỉ số tổng hợp không xác minh lại từng dòng riêng lẻ trên phiếu thông số, phần lớn trong số đó OpenBMB đã tái lập trong hệ thống đánh giá riêng của mình. Điều nó thực sự làm là khớp với hai trục mà OpenBMB cho biết họ tối ưu hóa: v4.2 nghiêng mạnh hơn về các tác vụ tác tử, và theo dõi độ dài văn bản của AA cho thấy MiniCPM5-2B tạo ra 57M token đầu ra trên các tác vụ chỉ số, là mô hình cô đọng nhất trong phân khúc so với mức trung vị 72M. OpenBMB cảm ơn AA về đợt đánh giá và diễn giải kết quả chính xác theo những thuật ngữ đó — hiệu suất tác tử và hiệu quả token ở mức 2.6B, theo họ, mới là những gì mô hình được tối ưu hóa.

Tuyên bố cốt lõi là năng lực tác tử trong một gói nhỏ gọn: gọi công cụ gốc, tìm kiếm sâu và sinh mã, được huấn luyện từ nền tảng thay vì gắn thêm vào. Thẻ mô hình mô tả một quy trình ba giai đoạn — huấn luyện nền, huấn luyện trung gian, rồi hậu huấn luyện bằng tinh chỉnh có giám sát (SFT) trên 400 tỷ token dữ liệu tư duy sâu, các giáo viên RL chuyên biệt và Chưng cất Chính sách Hiện hành (OPD), hợp nhất mười sáu mô hình chuyên gia RL — năm trong đó là các tác tử — trở lại thành một mạng nơ-ron đặc nhỏ duy nhất. OpenBMB ghi nhận giai đoạn RL + OPD mang lại mức cải thiện trung bình 10,96 điểm trên các tác vụ suy luận và tổng quát, cùng 6,96 điểm trên các tác vụ tác tử — những độ chênh nội bộ, nhưng chúng giải thích hình hài khác thường của mô hình này: một mạng 2,5 tỷ tham số được xây dựng như một mô hình suy luận và hướng thẳng vào việc sử dụng công cụ.

A single-column scoreboard for MiniCPM5-2B titled 'MiniCPM5-2B — the scoreboard', with rows 'Params: 2.52B total · 1.98B non-embedding', 'Architecture: dense Llama-style, 42 layers, GQA 16:2', 'Context: 131,072 tokens (config)', 'License: Apache-2.0, weights + data', 'AA Index: 17 — #1 sub-4B at launch (AA v4.1)' and 'SWE-bench Verified: 46.4 · vendor-reported', and a footer reading 'Params, architecture and context from the HF config; AA Index per Artificial Analysis; other benchmark figures are vendor-reported.'.

Những gì repo thực sự chứa

Bảng thông số kỹ thuật không hề mơ hồ, vì bản thân nó là tệp cấu hình. MiniCPM5-2B có 2.516.756.480 tham số, trong đó 1.981.982.720 là tham số ngoài embedding — các nhà cung cấp lấy con số ngoài embedding làm căn cứ khi họ nói "nhóm 2B". Đây là một transformer dạng dense với 42 lớp, kích thước ẩn 2048, cơ chế chú ý truy vấn theo nhóm với 16 đầu truy vấn và chỉ 2 đầu KV, bộ từ vựng 130.560 và các tensor BF16. Toàn bộ mô hình được cung cấp dưới dạng một shard safetensors duy nhất, đủ nhỏ để tải xuống bằng kết nối laptop và chạy trên một GPU tầm trung hoặc NPU cấp điện thoại.

• Tham số — 2,516,756,480 tổng cộng; 1,981,982,720 không nhúng.

— Kiến trúc — LlamaForCausalLM dày đặc, 42 lớp, kích thước ẩn 2048, GQA 16 đầu truy vấn / 2 đầu KV, từ vựng 130.560.

• Ngữ cảnh — 131.072 token được cấu hình (max_position_embeddings), không có RoPE scaling trong cấu hình.

• Giấy phép — Apache-2.0, cho cả mô hình và dữ liệu huấn luyện đã phát hành.

• Định dạng — BF16; các phiên bản GGUF, MLX và GPTQ được phát hành riêng biệt.

A screenshot of the Hugging Face page for openbmb/MiniCPM5-2B, showing the repository header with Transformers and Safetensors tags and English and Chinese language tags, and the top of the model card reading 'We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B' (captured September 7, 2026).

Một con số từ bộ bài tháng Bảy không xuất hiện trong checkpoint. Tài liệu WAIC đã quảng bá một cửa sổ ngữ cảnh 512K token; cấu hình phát hành đặt max_position_embeddings thành 131.072 (128K) mà không có mục rope_scaling. Có thể con số 512K được dự định đạt được thông qua mở rộng tại thời điểm suy luận, giống như cách một số mô hình nhỏ kéo dài ngữ cảnh của chúng — nhưng ở trạng thái phát hành, repo ghi rõ 131.072, và đó là con số cần thiết kế theo cho đến khi OpenBMB công bố một công thức mở rộng.

Các con số, được sắp xếp theo người đã đo chúng

Thẻ mô hình rất thận trọng về nguồn gốc dữ liệu, và rất đáng để đọc phần chú thích cuối trang. Những điểm số mà thẻ đánh dấu bằng ký hiệu dao găm "đến từ bản phát hành Artificial Analysis chính thức" — ví dụ như các dòng GPQA-Diamond 70.2, HLE 8.9, AA-LCR 59.0, Terminal-Bench v2.1 8.6 và GDPval-AA v2 19.6. Mọi thứ khác được mô tả là "tái tạo nội bộ", nghĩa là OpenBMB đã chạy các bài đánh giá đó trên khung đánh giá riêng của mình. Hạng mục đó bao gồm những con số gây chú ý: mức trung bình nội bộ 53.9 trên tập so sánh của thẻ, AIME 2025/2026 đạt 86.5, MATH-500 đạt 94.6, LiveCodeBench v6 đạt 69.1, SWE-bench Verified đạt 46.4, BFCL v4 đạt 66.6, τ²-Bench Telecom đạt 97.1, GAIA (Text-103) đạt 88.7 và MMLU-Pro đạt 70.8.

Ba điều giúp những con số này trung thực khi đọc. Điểm trung bình 53.9 là một điểm số tương đối, không phải tuyệt đối — thẻ đánh giá chuẩn hóa từng trục radar để mô hình tốt nhất trong phép so sánh đạt 100 điểm. Tập hợp so sánh do chính nhà cung cấp lựa chọn: các mô hình mở 2B-4B khác, bao gồm Qwen3.5-2B, Qwen3.5-4B, Gemma-4-E2B-it, granite-4.2-3B, LFM2.5-2.6B và LFM2.5-8B-A1B. Trong tập hợp đó, thẻ đánh giá cho thấy MiniCPM5-2B vượt qua mô hình tốt thứ hai là Qwen3.5-4B ở mức 51.1 — một kết quả thực sự ấn tượng đối với mô hình chỉ bằng một nửa kích thước, và đúng là loại kết quả cần được tái lập độc lập trước khi bất kỳ ai xây dựng dựa trên nó. Và một vài hàng dữ liệu riêng lẻ khó mà khớp với lời tiếp thị: điểm 46.4 trên SWE-bench Verified từ một mô hình dense 2.5B sẽ rất đáng chú ý nếu kết quả tái lập được, trong khi điểm HLE 8.9 là lời nhắc rằng “dẫn đầu nhóm dưới 4B” và “frontier” là những đẳng cấp khác nhau. Repo không mâu thuẫn với điều nào trong số này, và chỉ số tổng hợp v4.2 của AA sau đó đã xác nhận vị trí tổng thể của mô hình khi đứng đầu phân khúc mô hình mở trọng số dưới 4B — nhưng những hàng dữ liệu cụ thể này là do chính OpenBMB công bố, vẫn chưa được bất kỳ ai bên ngoài phòng thí nghiệm xác minh.

Đang chạy MiniCPM5-2B hôm nay

Vì kiến trúc là Llama thuần túy, các engine phổ biến có thể tải trực tiếp mô hình này. README của OpenBMB cung cấp hướng dẫn khởi động nhanh cho vLLM (0.21 trở lên), SGLang (0.5.16 trở lên) và Transformers (5.6 trở lên), với thông số lấy mẫu được khuyến nghị là temperature 1.0 và top-p 0.95, đồng thời bật enable_thinking khi bạn muốn chạy pha suy luận. Các phiên bản GGUF và MLX bao phủ llama.cpp, Ollama, LM Studio và Apple Silicon; thẻ mô hình cũng liệt kê runtime ArcLight và các bộ công cụ tinh chỉnh thông dụng (TRL + PEFT, LLaMA-Factory, ms-swift, unsloth).

Có hai chi tiết triển khai đáng lưu ý trước khi bạn bắt đầu. Với tool calling và function calling, SGLang là backend được khuyến nghị: mô hình phát ra các lời gọi công cụ dạng XML, và trình phân tích minicpm5 tích hợp sẵn trong SGLang sẽ chuyển đổi chúng thành tool_calls tương thích OpenAI một cách trực tiếp, nghĩa là các client gọi công cụ tiêu chuẩn hoạt động bình thường mà không cần shim tùy chỉnh. Còn mô hình draft DSpark ra đời để giúp quá trình suy luận rẻ hơn: khi được khởi chạy trong SGLang với thuật toán giải mã suy đoán DSPARK, nó tăng tốc quá trình giải mã trong khi vẫn giữ nguyên đầu ra của mô hình đích — yếu tố quyết định xem một vòng lặp agent với ngữ cảnh 128K trên laptop là thực sự dùng được hay chỉ ở mức khả thi.

A screenshot of the Hugging Face 'MiniCPM5' collection page (openbmb/minicpm5), headed 'SOTA on-device LLMs, small yet powerful', listing openbmb/MiniCPM5-2B and openbmb/MiniCPM5-1B alongside the series' companion repositories (captured September 7, 2026).

Nếu bạn muốn đánh giá một loạt mô hình mở nhỏ thay vì tinh chỉnh thủ công từng mô hình, thì lớp định tuyến sẽ chứng tỏ giá trị của nó ở đây: khi một nhà cung cấp niêm yết MiniCPM5-2B, một bộ định tuyến là cách rẻ để A/B thử nghiệm nó với Qwen3.5-2B cùng các checkpoint mở dưới 4B khác trên cùng một tác vụ mà không cần tích hợp thêm lần nào. Trên OrcaRouter, điều đó nghĩa là một API duy nhất phủ hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển thẳng với mức phụ phí 0%, và tự động failover nếu một checkpoint hoàn toàn mới bị treo hoặc lặp vô hạn trên một luồng production. Repo này mới chỉ được vài ngày tuổi và chưa có API lưu trữ nào mà chúng tôi có thể chỉ ra niêm yết MiniCPM5-2B — nên lựa chọn trung thực mặc định hiện tại là coi nó như một thử nghiệm self-host, không phải một dependency.

Ai nên kéo những quả tạ này?

Hãy kéo chúng về ngay hôm nay nếu công việc của bạn xoay quanh tác tử trên thiết bị, gọi công cụ ở biên, hoặc các thử nghiệm lập trình và suy luận với mô hình nhỏ — và nếu bạn muốn lựa chọn được huấn luyện quyết liệt nhất trong phân khúc 2B hiện có. Giấy phép Apache-2.0 và dữ liệu huấn luyện mở đã loại bỏ hai lý do khiến hầu hết các đội ngũ ngần ngại với mô hình nhỏ từ phòng lab Trung Quốc: không còn giới hạn sử dụng thương mại, cũng không còn kho ngữ liệu hộp đen. Hãy kéo chúng về một cách dè chừng nếu bạn đang chọn mô hình cho sản xuất chỉ dựa vào bảng benchmark: những dòng điểm nổi bật trên model card là các kết quả do chính OpenBMB tự tái tạo, còn điểm tổng hợp v4.2 của AA — phép đo độc lập duy nhất tính đến nay — không bảo chứng cho chúng. Một mô hình 2.5B được cho là vượt qua Qwen3.5-4B là một tuyên bố xứng đáng để bạn bỏ ra hai giờ tự mình tái tạo lại SWE-bench.

Điều gì cần xem tiếp theo. Repo mới chỉ được hai ngày tuổi, nên các tín hiệu ngắn hạn vẫn còn mang tính cơ học: liệu llama.cpp và thư viện Ollama có tiếp nhận GGUF hay không, liệu bản sao ModelScope và các bản dựng chip FlagOS có ra mắt sạch sẽ hay không, và liệu một API được lưu trữ có liệt kê MiniCPM5-2B hay không — đó là thời điểm nó không còn chỉ dành riêng cho việc tự lưu trữ nữa. Tín hiệu thực chất mà bài viết này từng chỉ ra là đang thiếu — một bài đánh giá độc lập từ Artificial Analysis hoặc một phòng thí nghiệm đại học — nay đã xuất hiện dưới dạng điểm chỉ số v4.2, và nó giúp MiniCPM5-2B giữ vị trí số một trong số các mô hình trọng số mở dưới 4B. Điều vẫn còn bỏ ngỏ là xác minh ở cấp độ hàng dữ liệu: chưa ai bên ngoài OpenBMB tái tạo được các con số nội bộ của phiếu thông số, đáng chú ý nhất là SWE-bench Verified ở mức 46,4 và mức trung bình nội bộ 53,9. Cho đến khi những hàng dữ liệu cụ thể đó được chạy lại, hãy đối xử với MiniCPM5-2B như cách bạn vẫn đối xử với bất kỳ mô hình nào được phát hành lặng lẽ kèm một phiếu thông số ấn tượng: như một giả thuyết rất hứa hẹn mà bạn có thể chạy cục bộ ngay tối nay, đồng thời là một mô hình có những con số nổi bật nhất mà bạn nên xác minh trước khi tin tưởng giao phó cho công việc thực tế.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube