
Kolibri vs MiniCPM5-2B: 78 tỷ tham số đối đầu với 2,5, và vì sao mô hình nhỏ không phải là lựa chọn rẻ
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 217 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Đặt Kolibribên cạnh MiniCPM5-2Bvà cách hiểu theo bản năng là đây là một so sánh về kích thước, và rằng mô hình 2,5 tỷ tham số là lựa chọn tiết kiệm. Cách hiểu đó sai theo một cách đáng để học hỏi. Kolibri là mô hình mixture-of-experts 78,1 tỷ tham số của Aleph Alpha, phát hành ngày 3 tháng 10 năm 2026, kích hoạt 3,46 tỷ tham số mỗi token, với dung lượng FP8 khoảng 78 GB và cấu hình phục vụ tối thiểu là hai card A100 80 GB. MiniCPM5-2B là mô hình dense 2,52 tỷ tham số của ModelBest và OpenBMB, ra mắt tại Hội nghị Trí tuệ Nhân tạo Thế giới ngày 19 tháng 7 năm 2026, với trọng số được đăng lên Hugging Face vào ngày 6 tháng 9. Xét theo số lượng tham số, MiniCPM5-2B nhỏ hơn ba mươi mốt lần. Nó cũng chính là mô hình đòi hỏi bạn phải có một ngân sách đánh giá trước khi tin tưởng, bởi những con số được trích dẫn nhiều nhất của nó đều do nhà cung cấp tự chạy và chưa được tái lập — điều hoàn toàn ngược lại với hàm ý thông thường của cụm "mô hình nhỏ" khi nói về rủi ro.
Cả hai đều được phát hành âm thầm; chỉ một trong số chúng được phát hành gần đây.
Chúng có những câu chuyện nguồn gốc tương tự nhau và độ tuổi rất khác biệt, và độ tuổi thì có ý nghĩa. Kho lưu trữ Kolibri của Aleph Alpha được tạo vào ngày 2 tháng 10 năm 2026 với ngày phát hành được công bố là 3 tháng 10, và thông báo trên phòng tin tức của chính nhà cung cấp đã được đưa ra vào sáng hôm đó, đúng Ngày Thống nhất nước Đức. Báo chí AI nói chung phần lớn đã bỏ lỡ nó trong ngày hôm đó, đó là nguồn gốc của cách gọi "phát hành âm thầm", nhưng một thẻ mô hình, một báo cáo kỹ thuật và một bài đăng của nhà cung cấp không phải là một sự ra mắt im lặng. MiniCPM5-2B thực sự yên ắng hơn: thông báo tại WAIC vào tháng 7 là một màn công bố tại hội nghị về một bản chào hàng và các thông số kỹ thuật, và các trọng số thực tế mãi đến ngày 6 tháng 9 mới xuất hiện, được công bố mà không có sự kiện ra mắt, cùng với GGUF, MLX, GPTQ, base, SFT và các checkpoint draft cùng với các tập ngữ liệu huấn luyện đằng sau chúng.
Khoảng cách năm tuần đó giữa công bố và trọng số đáng để ghi nhớ, vì đó là lý do có hai bộ số khác nhau được lưu truyền cho mô hình này. Tài liệu tháng Bảy quảng bá cửa sổ ngữ cảnh 512K token. Cấu hình phát hành đặt 131,072. Sản phẩm được phát hành mới là thứ đáng kể.
Mỗi mô hình thực sự dùng để làm gì
Kolibri được xây dựng cho công việc xử lý tài liệu tiếng Đức và tiếng Anh, và Aleph Alpha cụ thể một cách bất thường về lý do vì sao việc đó cần đến kỹ thuật thực sự. Các thí nghiệm nhỏ với mô hình proxy đặt mục tiêu khoảng 20 phần trăm tiếng Đức trong hỗn hợp huấn luyện, mà với một lần chạy 20 nghìn tỷ token thì có nghĩa là phải tìm ra 4 nghìn tỷ token tiếng Đức. Các tập dữ liệu tiếng Đức mở đã được khử trùng lặp và lọc cho ra 390 tỷ — thiếu một bậc độ lớn — nên phòng thí nghiệm đã chỉnh lại bộ lọc Common Crawl dành riêng cho tiếng Đức, tạo ra 1,3 nghìn tỷ token hữu cơ duy nhất, và viết lại các tài liệu tiếng Đức hiện có thành mục từ bách khoa, đối thoại và đoạn trích để có thêm khoảng một nghìn tỷ nữa, trở thành nguồn tiếng Đức đơn lẻ lớn nhất. Dịch thuật, vốn được dùng cho phiên bản tiền nhiệm Kolibri Origin, đã bị loại bỏ đối với Kolibri. Chi tiết về bộ lọc là điều cần ghi nhớ: một pipeline dữ liệu ngôn ngữ tiêu chuẩn loại bỏ những tài liệu có quá nhiều từ dài, và văn xuôi hành chính tiếng Đức thường xuyên vượt quá giới hạn tiếng Anh về độ dài từ trung bình, nên các cài đặt mặc định âm thầm xóa bỏ ngữ vực mà nền hành chính công viết bằng.
MiniCPM5-2B được xây dựng cho phía đối lập — một agent chạy trên thiết bị. Thẻ mô hình mô tả một dense transformer với tổng cộng 2,52 tỷ tham số, 1,98 tỷ tham số không tính embedding, 42 lớp ở kích thước ẩn 2048, grouped-query attention với 16 đầu truy vấn và 2 đầu KV, cùng kiến trúc LlamaForCausalLM tiêu chuẩn không có kernel tùy chỉnh. Quy trình huấn luyện nghiêng về hướng agent: huấn luyện giữa kỳ cho agent ở quy mô 200 tỷ, một tập agent-SFT lớn, căn chỉnh agent bằng RL, và giai đoạn On-Policy Distillation cuối cùng gộp mười sáu mô hình chuyên gia RL trở lại thành một mạng dense nhỏ. Nó đi kèm các lệnh gọi công cụ kiểu XML với trình phân tích cú pháp SGLang tích hợp, và cấu hình phát hành của nó đặt cửa sổ 131.072 token.
• Tham số — Kolibri: 78.103.074.560 tổng cộng, 3.457.573.120 hoạt động, độ thưa 22,6:1. MiniCPM5-2B: 2.516.756.480 tổng cộng, 1,98 tỷ không nhúng, dày đặc.
• Đã phát hành — Kolibri: 3 tháng 10 năm 2026. MiniCPM5-2B: công bố ngày 19 tháng 7 năm 2026, trọng số ngày 6 tháng 9 năm 2026.
• Ngữ cảnh — Kolibri: 16.384 đã huấn luyện, 65.536 huấn luyện tầm trung, 262.144 gốc, 1.048.576 đã xác thực. MiniCPM5-2B: 131.072 trong cấu hình phát hành; tuyên bố 512K từ tháng 7 không nằm trong đó.
• Dấu chân — Kolibri: khoảng 78 GB ở FP8; tối thiểu hai A100 80 GB, hai H100 SXM5, một H200, một B200 hoặc một B300. MiniCPM5-2B: một phân mảnh BF16 duy nhất, hạng máy tính xách tay.
• Ngôn ngữ — Kolibri: Tiếng Đức và tiếng Anh, theo thiết kế và không gì khác. MiniCPM5-2B: Tiếng Anh và tiếng Trung, với tất cả các bộ đánh giá đã công bố đều bằng tiếng Anh.
• Gọi công cụ — Kolibri: kiểu Hermes với trình phân tích cú pháp vLLM đi kèm. MiniCPM5-2B: kiểu XML với trình phân tích cú pháp SGLang.
• Giấy phép — cả hai đều là Apache 2.0, cả hai đều không kèm điều khoản bổ sung về việc sử dụng được chấp nhận.

Các bảng điểm, và nguồn dữ liệu đằng sau chúng
Không có con số đối đầu trực tiếp nào cho cặp sản phẩm này ở bất cứ đâu, trong tài liệu của cả hai nhà cung cấp, và chúng tôi sẽ không ghép một con số như vậy từ hai bộ khung thử nghiệm khác nhau rồi gọi đó là một so sánh. Những gì mỗi bên công bố cần được tách bạch cẩn thận, vì hai nhóm số liệu mang lượng bằng chứng rất khác nhau.
Các con số của Kolibri đến từ bảng so sánh mười bốn mô hình của chính Aleph Alpha, được chạy trên một harness với Kolibri ở mức nỗ lực suy luận cao: 75,5 trên mức trung bình tiếng Anh, 70,8 trên mức trung bình tiếng Đức. Bảng đó không tô hồng cho đối tượng của nó — Qwen3.8 27B đạt 80,2 và 79,9 trên cùng hai mức trung bình và dẫn đầu ở GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified cùng cả hai benchmark ngữ cảnh dài, trong khi chỉ kích hoạt khoảng một phần tám số tham số của Kolibri. Cách nhà cung cấp diễn giải cho khoảng cách đó là một biên giới Pareto giữa chất lượng và token được giải mã mỗi giây trên mỗi GPU, mà không mô hình nào trong số được so sánh vượt qua. Đó là một lập luận về kinh tế phục vụ, không phải lập luận về năng lực, và chưa có bên thứ ba nào đo lường nó: không có mục Artificial Analysis nào cho Kolibri và không có bản tái lập harness nào.
Các con số của MiniCPM5-2B đến từ chính thẻ của nó: mức trung bình nội bộ 53,9 trên một bộ so sánh do nhà cung cấp tự chọn, AIME 2025/2026 đạt 86,5, MATH-500 đạt 94,6, và mức 46,4 do nhà cung cấp tự chạy trên SWE-bench Verified — con số này sẽ rất đáng chú ý đối với một mô hình dense 2,5 tỷ tham số nếu nó trụ được qua kiểm thử độc lập. Trên thẻ đó, Granite 4.2 3B của IBM đứng ở mức 42,7 so với 53,9 của MiniCPM5-2B — một nhà cung cấp chạy cả hai mô hình trên một bộ test do chính họ chọn. Bộ test khác nhau, harness khác nhau, nhà cung cấp khác nhau. Không có gì trong số đó là phán quyết về cặp đối chiếu này.
Điều thực sự hữu ích ở phía MiniCPM5-2B là việc công bố thông tin. OpenBMB đã phát hành các kho ngữ liệu huấn luyện UltraData cùng với trọng số — Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, các bộ SFT và RL cho agent — tất cả đều theo Apache 2.0, biến một hộp đen thành một công thức mà bạn có thể kiểm tra và tiếp tục trên miền của riêng mình. Mô hình cũng đi kèm khả năng thích ứng ngay từ ngày đầu trên chín họ chip thông qua cộng đồng FlagOS của ModelBest, từ Huawei Ascend đến NVIDIA và ARM, đây là một tuyên bố về triển khai hơn là về đánh giá chuẩn. Ngược lại, IBM đã công bố trọng số của Granite 4.2 3B và một bản mô tả kỹ thuật chi tiết về quá trình xây dựng nhưng không công bố dữ liệu huấn luyện của nó, còn Aleph Alpha đã công bố quy trình dữ liệu và hạch toán năng lượng của Kolibri — 20 nghìn tỷ token tiền huấn luyện, 9,5×10² MWh bao gồm chi phí tổng thể của trung tâm dữ liệu và không bao gồm tinh chỉnh có giám sát và học tăng cường — nhưng không công bố kho ngữ liệu.
Nơi khoảng cách kích thước thực sự lộ rõ
Cách hữu ích nhất để đặt hai thứ này cạnh nhau là dựa trên hai trục quyết định một triển khai thực tế: những gì bắt buộc phải có trong phòng, và điều gì xảy ra khi mô hình sai.
Trên phần cứng, MiniCPM5-2B thắng, và không hề sát nút. Một mô hình dense 2,52 tỷ tham số trong một phân mảnh BF16 chạy trên laptop, một thiết bị edge hoặc một GPU tiêu dùng duy nhất, và việc FlagOS hỗ trợ trên chín dòng chip đồng nghĩa nó chạy trên phần cứng hoàn toàn không phải bộ tăng tốc NVIDIA. Mức tối thiểu của Kolibri là hai card A100 80 GB hoặc một B200, khoảng 78 GB trọng số FP8, được phục vụ qua plugin vLLM aleph-alpha-inference hoặc container đã phát hành. Đối với khối lượng công việc kiểu buồng lái thông minh hoặc gần với điện thoại, mô hình 2B là mô hình duy nhất trong hai mô hình đủ điều kiện, và Kolibri chưa bao giờ được thiết kế để cạnh tranh ở đó.
Về khả năng kiểm chứng, Kolibri thắng vì một lý do tinh tế hơn. Tuyên bố được trích dẫn nhiều nhất của nó — kinh tế phục vụ — vẫn chưa được kiểm nghiệm, nhưng các số liệu chất lượng của nó ít nhất được công bố đối chiếu với mười ba đối thủ được nêu tên trên một harness với các cài đặt được công bố, và bảng của chính nhà cung cấp trao phần thắng ở hầu hết các hàng cho một đối thủ. Các con số nổi bật của MiniCPM5-2B là của nhà cung cấp, trên bộ tiêu chí của nhà cung cấp, mà không có harness so sánh nào được công bố, và mô hình còn mang thêm sự bất định của một checkpoint đã vài tuần tuổi thay vì vài ngày. Cả hai mô hình đều chưa được đánh giá độc lập. Khác biệt nằm ở chỗ một nhà cung cấp đã ghi lại một so sánh khiến mô hình của chính họ thua, còn nhà cung cấp kia ghi lại một so sánh khiến mô hình của chính họ thắng với cách biệt lớn.
Cố ý là hoàn toàn không có sự cạnh tranh nào. Kolibri tồn tại để xử lý tài liệu tiếng Đức tại chỗ, với một tokenizer song ngữ mà Aleph Alpha báo cáo đạt trung bình 4,90 byte mỗi token trên văn bản web tiếng Đức, so với 4,35 của GPT-5 và 3,28 của Kimi K3 — tất cả đều do nhà cung cấp đo, và là một hiệu ứng chi phí trên mỗi token chứ không phải một tuyên bố về chất lượng. MiniCPM5-2B tồn tại cho các tác nhân gọi công cụ bằng tiếng Anh và tiếng Trung trên phần cứng hạn chế. Một đội ngũ có hợp đồng tiếng Đức và yêu cầu tuân thủ thì không lựa chọn giữa chúng.

Thực tế định tuyến, và thử nghiệm đáng để tiến hành
Hiện tại, cả hai mô hình đều không nằm trong một danh mục hosted nào, và chúng tôi đã kiểm tra cả hai thay vì giả định. Kolibri không có SKU API từ nhà cung cấp — bản phát hành gồm trọng số, một báo cáo kỹ thuật và một container image — và nó không có trên OrcaRouter: chúng tôi đã dò danh mục bằng mọi cách viết của tiền tố nhà cung cấp và tên mô hình, và kết quả trả về là không tìm thấy. MiniCPM5-2B cũng không có endpoint hosted nào từ ModelBest, và nó không được định tuyến trong hệ thống của chúng tôi. Cả hai đều là phương án tự host, và chúng tôi muốn nói thẳng như vậy hơn là ngụ ý rằng chúng tôi cung cấp một trong hai.
Điểm trở nên thú vị nằm ở thí nghiệm. Một mô hình tác tử 2,5 tỷ tham số và một mô hình tài liệu 78 tỷ tham số giải quyết những bài toán khác nhau, và cách duy nhất để biết khối lượng công việc của bạn cần cái nào là chạy cả hai với nó — đây chính là tình huống mà một lớp định tuyến được tạo ra để xử lý, ngay cả khi nó không mang theo mô hình nào trong hai mô hình đó. Trỏ một đường thử nghiệm vào bản dựng MiniCPM5-2B tự lưu trữ thông qua một điểm cuối tương thích OpenAI với khả năng chuyển đổi dự phòng tự động, trong khi production vẫn nằm trên một mô hình định tuyến đã được chứng minh, và ngăn xếp mới có thể bị treo hoặc tạo ra vô nghĩa mà không làm sập bất cứ thứ gì. Giá niêm yết của nhà cung cấp đối với các mô hình bạn so sánh được chuyển qua với mức markup bằng 0, nên phép A/B vẫn rẻ và có thể đảo ngược. Và nếu điều thí nghiệm thực sự tiết lộ là khối lượng công việc tiếng Đức của bạn không cần mô hình tự lưu trữ nào trong hai mô hình đó, thì cùng một khóa sẽ chạm tới một tầng mixture-of-experts nhỏ đã được định tuyến — biến thể Gemma 4 26B-A4B với $0.06 mỗi triệu token đầu vào và $0.33 mỗi triệu token đầu ra, với cửa sổ 262.144 token và đầu vào văn bản, hình ảnh và video — đây là cách rẻ nhất để tìm hiểu trước khi bạn mua hai GPU.
Cái nào, và điều gì sẽ làm thay đổi câu trả lời
Hãy chạy MiniCPM5-2B nếu ràng buộc nằm ở thiết bị. Với 2,52 tỷ tham số, nó là mô hình duy nhất trong hai mô hình phù hợp với một máy tính xách tay, buồng lái hoặc thiết bị biên, và nếu khối lượng công việc của bạn là một tác nhân gọi công cụ tương tác bằng tiếng Anh hoặc tiếng Trung, thì đây chính là mô hình hướng đến việc đó. Hãy dành thời gian để tái lập các con số của nó trước — mức trung bình 53,9 và tuyên bố 46,4 trên SWE-bench chỉ thuộc về ModelBest, và việc các tập ngữ liệu huấn luyện được mở khiến việc tái lập đó thực sự khả thi thay vì chỉ mang tính lý thuyết.
Nếu kho ngữ liệu là tiếng Đức, phần cứng hiện có và trọng số không được phép rời khỏi tòa nhà, hãy chạy Kolibri. Cửa sổ gốc 262.144 token, bộ nhớ đệm KV FP8, bốn mức nỗ lực suy luận và khả năng gọi công cụ của Hermes là cấu hình phù hợp cho công việc tài liệu chịu quy định, còn các điều khoản Apache 2.0 cùng quy trình dữ liệu được công bố là phần giúp vượt qua được vòng thẩm định mua sắm.
Hai điều sẽ giải quyết chuyện này nhanh hơn bất kỳ cuộc tranh luận nào. Một lần chạy SWE-bench Verified độc lập trên MiniCPM5-2B sẽ xác nhận hoặc đánh chìm tuyên bố đáng ngạc nhiên nhất mà một trong hai card đưa ra. Và một phép đo thông lượng độc lập của Kolibri ở cấu hình hai H100 được khuyến nghị — hoặc một mục Artificial Analysis, thứ hiện nay chưa tồn tại — sẽ biến "78 tỷ tham số" từ một thông số kỹ thuật thành một chi phí, con số mà bất kỳ ai đang cân nhắc so sánh này với phần cứng thực sự đang tìm kiếm. Cho đến lúc đó, khoảng cách về kích thước là có thật, khoảng cách về mục đích còn lớn hơn, và lựa chọn trông có vẻ rẻ lại chính là cái mang tuyên bố chưa được kiểm chứng.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
