
Kolibri vs Granite 4.2 3B: Canh bạc thưa thớt 78B, và mô hình 3B từ chối chơi cùng một cuộc chơi
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 217 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Đặt Kolibri và Granite 4.2 3Bcạnh nhau và nhận xét trung thực đầu tiên là đây không phải một cuộc so tài công bằng, và không theo hướng mà bạn hẳn sẽ ngờ tới. Kolibri là mô hình mixture-of-experts 78,1 tỷ tham số của Aleph Alpha, phát hành ngày 3 tháng 10 năm 2026, kích hoạt 3,46 tỷ tham số mỗi token. Granite 4.2 3B là mô hình suy luận dense khoảng ba tỷ tham số của IBM, với trọng số được đưa lên Hugging Face ngày 7 tháng 8 năm 2026, còn model card và blog kỹ thuật theo sau vào ngày 25 tháng 8. Một mô hình có tổng số tham số gấp hai mươi sáu lần mô hình kia. Lý do chúng cùng thuộc về một quyết định là cả hai đều dùng giấy phép Apache 2.0, đều chỉ xử lý văn bản, đều được thiết kế để tự lưu trữ, và đều nhắm tới cùng một nhóm khách hàng: một đội ngũ muốn có khả năng khai thác tài liệu trên phần cứng do mình kiểm soát, với nguồn gốc xuất xứ đủ sức vượt qua một cuộc thẩm định mua sắm. Câu hỏi thú vị không phải là mô hình nào tốt hơn. Mà là ngân sách tham số gấp hai mươi sáu lần thực sự mua được điều gì, và cái giá phải trả để mang nó theo là bao nhiêu.
Sự không khớp, được trình bày rõ ràng
Granite 4.2 3B là một mô hình dense độc lập được hậu huấn luyện từ Granite-4.1-3B-Base, thuộc dòng Granite 4.2 mà IBM phát hành trong tháng 8. Mô hình có 40 lớp với cơ chế attention truy vấn theo nhóm, ngữ cảnh gốc 128K mà IBM mở rộng lên 512K trong pha tiền huấn luyện thứ năm, cùng ba chế độ suy nghĩ theo từng truy vấn: suy nghĩ đầy đủ theo mặc định, một lộ trình nỗ lực thấp và một lộ trình không suy nghĩ. Thẻ mô hình của IBM thẳng thắn một cách bất thường về những gì 3B không phải là. Khác với các mô hình anh em 8B và 30B, nó đã cố ý bỏ qua khối học tăng cường agentic chuyên biệt được huấn luyện trong các môi trường SWE-agent, terminal và tìm kiếm, đó là lý do IBM hoàn toàn không liệt kê chỉ số SWE-bench nào cho nó và định vị mô hình như một chuyên gia suy luận thay vì một agent.
Kolibri lại đi theo hướng ngược lại trên mọi trục. Năm mươi lớp, tất cả đều là mixture-of-experts, 384 chuyên gia mỗi lớp với một chuyên gia chia sẻ và sáu chuyên gia định tuyến, cùng tỷ lệ thưa khoảng 22,6 trên 1. Ngữ cảnh của nó mặc định là 262.144 token, đã được xác thực tới 1.048.576, với thẻ khuyến nghị bạn nên duy trì ở mức bằng hoặc dưới 262.144 cho công việc nhạy cảm với độ trễ. Bốn mức nỗ lực suy luận. Gọi công cụ theo kiểu Hermes với trình phân tích cú pháp vLLM được phát hành trong cùng kho lưu trữ với trọng số. Và dung lượng chiếm khoảng 78 GB ở FP8, với cấu hình tối thiểu của thẻ là hai card A100 80 GB, hai H100 SXM5, một H200, một B200 hoặc một B300.
• Tham số — Kolibri: tổng cộng 78,103,074,560, 3,457,573,120 hoạt động trên mỗi token. Granite 4.2 3B: khoảng 3B dày đặc, tất cả tham số đều hoạt động trên mỗi token.
• Ngữ cảnh — Kolibri: 16,384 đã huấn luyện, 65,536 huấn luyện trung gian, 262,144 gốc, 1,048,576 đã xác thực. Granite 4.2 3B: 128K gốc, mở rộng lên 512K.
• Chế độ tư duy — Kolibri: không, thấp, trung bình, cao, được đặt thông qua mẫu trò chuyện. Granite 4.2 3B: đầy đủ, nỗ lực thấp và không suy nghĩ, theo từng truy vấn.
• Gọi công cụ — Kolibri: kiểu Hermes, với trình phân tích cú pháp đi kèm. Granite 4.2 3B: có, nhưng không phải con đường được huấn luyện bằng agentic-RL mà các phiên bản anh em lớn hơn của nó có được.
• Ngôn ngữ — Kolibri: tiếng Đức và tiếng Anh, theo thiết kế và không có gì khác. Granite 4.2 3B: lấy tiếng Anh làm trọng tâm, với nền tảng huấn luyện đa ngôn ngữ rộng hơn của IBM đằng sau.
• Mức chiếm dụng bộ nhớ — Kolibri: khoảng 78 GB ở FP8, tối thiểu hai GPU. Granite 4.2 3B: khoảng 6–8 GB ở bfloat16, dưới 2 GB khi lượng tử hóa, thuộc phân khúc máy tính xách tay.
• Giấy phép — cả hai đều là Apache 2.0, cả hai đều không có điều khoản bổ sung về sử dụng được chấp nhận hoặc ngưỡng người dùng hoạt động hàng tháng.
• Phục vụ — Kolibri: plugin vLLM aleph-alpha-inference hoặc image container đã phát hành. Granite 4.2 3B: vLLM, SGLang, Transformers, GGUF và Ollama trong granite4.2:3b.

75 tỷ tham số tăng thêm mang lại điều gì
Ba điều, và cần phải chính xác về việc điều nào trong số đó đã được xác lập và điều nào chỉ được khẳng định.
Điểm đầu tiên là tiếng Đức. Đây là khác biệt thực sự rõ nét nhất giữa hai mô hình, và nó không phải là một dòng trong bảng đánh giá chuẩn. Aleph Alpha xây dựng Kolibri quanh một kho ngữ liệu song ngữ Đức-Anh, nhắm mục tiêu khoảng 20% tiếng Đức trong một lần tiền huấn luyện 20 nghìn tỷ token, và kết thúc với một kho tiếng Đức 2,4 nghìn tỷ token mà 80% trong đó do chính phòng thí nghiệm tuyển chọn hoặc tạo ra. Thẻ mô hình giải thích vì sao việc đó tốn công: các bộ dữ liệu tiếng Đức mở đã khử trùng lặp chỉ cung cấp 390 tỷ token, thiếu tới một bậc độ lớn, nên phòng thí nghiệm đã tinh chỉnh lại bộ lọc Common Crawl riêng cho tiếng Đức và diễn đạt lại các tài liệu tiếng Đức sẵn có thành mục bách khoa, hội thoại và đoạn trích. Chi tiết về bộ lọc là điều cần ghi nhớ. Một quy trình xử lý dữ liệu ngôn ngữ tiêu chuẩn loại bỏ những tài liệu có quá nhiều từ dài, và văn xuôi hành chính tiếng Đức thường xuyên vượt ngưỡng tiếng Anh về độ dài từ trung bình — nên các thiết lập mặc định âm thầm xóa bỏ chính văn phong mà nền hành chính công viết bằng. IBM không xây dựng Granite cho kho ngữ liệu đó. Granite 4.2 3B sẽ xử lý được tiếng Đức; nó không được thiết kế xoay quanh văn phong pháp lý và hành chính tiếng Đức, và không bảng xếp hạng nào sẽ cho bạn biết sự khác biệt.
Điểm thứ hai là ngữ cảnh dài có thể tồn tại qua các tài liệu thực tế. Mức trần 512K của Granite thực sự là rất lớn, nhưng hai mô hình đạt được điều đó theo những cách khác nhau và thiết kế vị trí của Kolibri là lập luận ngữ cảnh dài thông thường hơn. Hãy coi các con số RULER của IBM — 67,52 ở 64K và 55,30 ở 128K trong tài liệu công bố của dòng 4.2 — là sự công bố trung thực về mức độ suy giảm chất lượng truy xuất đến 128K, và hãy nhớ rằng Kolibri hoàn toàn không có đường cong suy giảm tương đương nào được công bố.
Thứ ba là dư địa suy luận thô, và đây là chỗ câu trả lời trung thực là “không nhiều như tỷ lệ tham số gợi ý”. Quy trình huấn luyện của Kolibri đã mang lại cho nó một lần tiền huấn luyện 20 nghìn tỷ token trên 768 NVIDIA B200 trong 21 ngày, và bảng so sánh của chính Aleph Alpha, với Kolibri ở mức nỗ lực suy luận cao, đặt nó ở 75,5 trên mức trung bình tiếng Anh và 70,8 trên mức trung bình tiếng Đức của một so sánh mười bốn mô hình — nơi nó thua một mô hình dense 27 tỷ tham số từ Alibaba ở hầu hết các dòng. Những tuyên bố nổi bật của Granite 4.2 3B là do chính nó đưa ra: AIME 2025 ở 78,33, GPQA ở 54,80, LiveCodeBench v6 ở 69,71 và MMLU-Pro ở 67,84, tất cả đều do IBM báo cáo và chưa được tái lập. Các bộ kiểm thử khác nhau, các harness khác nhau, các nhà cung cấp khác nhau. Không có con số nào trên cùng một harness cho cặp này ở bất cứ đâu, và chúng tôi sẽ không bịa ra một con số.
Nơi mỗi cái thực sự giành chiến thắng
Hãy chạy Granite 4.2 3B nếu ràng buộc của bạn là cỗ máy. Ở 6–8 GB trong bfloat16, hoặc dưới 2 GB khi lượng tử hóa, nó vừa vặn với một laptop, một GPU máy trạm đơn, hoặc một thiết bị biên air-gapped sẽ không bao giờ thấy hai H100s. Nó phục vụ thông qua năm runtime khác nhau, bao gồm Ollama và GGUF, điều này quan trọng khi mục tiêu triển khai là laptop của người khác chứ không phải rack của chính bạn. Và thẻ mô hình của nó đáng tin cậy một cách bất thường chính vì IBM đã ghi rõ những gì nó bỏ qua. Một nhà cung cấp từ chối công bố kết quả SWE-bench cho một mô hình 3B đang cho bạn biết mô hình dừng lại ở đâu.
Hãy chạy Kolibri nếu kho ngữ liệu là điểm mấu chốt và phần cứng đã có sẵn. Một nhóm có hợp đồng tiếng Đức, tài liệu kỹ thuật hoặc hồ sơ hành chính, một node hai GPU hiện hữu, và yêu cầu rằng trọng số không bao giờ rời khỏi tòa nhà chính là đối tượng mà bản phát hành này được thiết kế cho. Cửa sổ gốc 262.144 token, bộ đệm KV FP8, bốn mức nỗ lực và đường gọi công cụ Hermes đều hướng đến quy trình tài liệu thay vì trò chuyện. Bộ tokenizer song ngữ là một phần của cùng lập luận: Aleph Alpha báo cáo trung bình 4,90 byte mỗi token trên văn bản web tiếng Đức, so với 4,35 của GPT-5 và 3,28 của Kimi K3, tất cả đều do nhà cung cấp đo trên kho ngữ liệu của chính nhà cung cấp, và nhiều ký tự hơn mỗi token là một hiệu ứng trực tiếp lên chi phí suy luận chứ không phải một điểm số. Nếu điều đó giữ vững, nó sẽ cộng dồn trên mỗi trang bạn xử lý.
Sự bất đối xứng mà không ai quảng cáo chính là dữ liệu. IBM đã công bố trọng số của Granite 4.2 3B và một tài liệu kỹ thuật chi tiết về cách mô hình được xây dựng, nhưng không công bố dữ liệu huấn luyện. Aleph Alpha đã công bố quy trình, nguồn gốc dữ liệu và con số năng lượng cùng với trọng số của Kolibri — 20 nghìn tỷ token tiền huấn luyện, 9,5×10² MWh bao gồm cả chi phí phụ trợ của trung tâm dữ liệu và không bao gồm tinh chỉnh có giám sát cùng học tăng cường. Đối với một nhóm phải trả lời câu hỏi "văn bản của mô hình này đến từ đâu", sự khác biệt đó không phải là chuyện hình thức.

Thực tế định tuyến cho cả hai
Hiện nay, không mô hình nào nằm trong một danh mục được host. Kolibri hoàn toàn không có SKU API từ nhà cung cấp — bản phát hành chỉ gồm trọng số cùng một báo cáo kỹ thuật — và Granite 4.2 3B được phát hành dưới dạng trọng số cho năm ngăn xếp runtime, không có endpoint được host từ IBM. Cả hai đều là những phương án tự host, và câu hỏi thực tế đối với hầu hết các nhóm không phải là nên chọn cái nào mà là liệu khối lượng công việc có đáng để sở hữu một trong hai hay không.
Đó là lúc một lớp định tuyến chứng minh được giá trị của mình ngay cả với những mô hình mà nó không phục vụ. Chúng tôi đã rà soát danh mục của OrcaRouter với mọi cách viết của cả hai tên mô hình và cả Kolibri lẫn Granite 4.2 3B đều không có trong đó, nên chúng tôi sẽ không giả vờ điều ngược lại. Điều OrcaRouter thực sự mang lại là cách rẻ để biết liệu quyết định về phần cứng có chính đáng hay không trước khi bạn đưa ra quyết định đó: hướng một đường thử nghiệm vào một tầng mixture-of-experts nhỏ vốn đã có — biến thể Gemma 4 26B-A4B ở mức 0,06 USD cho mỗi triệu token đầu vào và 0,33 USD cho mỗi triệu token đầu ra, với cửa sổ 262.144 token — và xem liệu khối lượng công việc tài liệu tiếng Đức của bạn có thực sự cần những gì Kolibri cung cấp hay không, trên một khóa tương thích OpenAI, theo giá niêm yết của nhà cung cấp mà không thêm gì cả. Nếu cần, bạn mua GPU với bằng chứng thay vì chỉ dựa vào linh cảm. Nếu không, bạn vừa tiết kiệm được một đơn hàng phần cứng.
Phán quyết, và điều gì sẽ thay đổi nó
Đây không phải là một cuộc so tài có người thắng. Kolibri và Granite 4.2 3B trả lời những câu hỏi khác nhau ở các mức giá khác nhau, và thứ hạng trung thực duy nhất là theo ràng buộc: nếu ràng buộc là phần cứng, Granite 4.2 3B là mẫu duy nhất trong hai mẫu đủ điều kiện. Nếu ràng buộc là công việc tài liệu cho sổ đăng ký pháp lý của Đức tại chỗ, Granite 4.2 3B chưa từng nằm trong cuộc, và Kolibri là hiện vật thú vị hơn — một bản phát hành open-weights 78B hợp lệ, Apache 2.0, với pipeline dữ liệu và tokenizer được công bố bên cạnh trọng số.
Hai điều sẽ định đoạt được cuộc so sánh này. Một lần chạy độc lập Kolibri trên một tác vụ hỏi đáp tài liệu tiếng Đức sẽ kiểm chứng tuyên bố mà bản phát hành này thực sự được tạo ra để đưa ra, vì hiện không có bảng xếp hạng nào đo lường điều đó. Và một bản tái lập độc lập các con số suy luận của Granite 4.2 3B sẽ cho bạn biết liệu một cỗ máy tầm laptop có thể tự trụ vững trên tập con khối lượng công việc của bạn vốn chưa bao giờ cần tới 78 tỷ tham số ngay từ đầu hay không. Cho đến khi một trong những điều đó thành hiện thực, hãy mua dựa theo ràng buộc, chứ không dựa theo số lượng tham số.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
