
Kolibri vs Gemma 4 12B: 78 tỷ tham số so với 12, và chỉ một trong hai mới có điểm số
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 218 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Kolibri và Gemma 4 12B là hai đầu của một phổ mà các bản phát hành trọng số mở thường không cho phép bạn so sánh trên cùng một cơ sở. Kolibri của Aleph Alpha ra mắt ngày 3 tháng 10 năm 2026: tổng cộng 78,1 tỷ tham số, 3,46 tỷ tham số hoạt động trên mỗi token, cửa sổ ngữ cảnh 1.048.576 token đã được xác thực, chỉ tiếng Đức và tiếng Anh, Apache 2.0. Gemma 4 12B ra mắt ngày 3 tháng 6 năm 2026: 11,95 tỷ tham số dense, cửa sổ ngữ cảnh 262.144 token, đầu vào văn bản, hình ảnh, âm thanh và video, Apache 2.0. Một trong hai có điểm số độc lập, có thể tái tạo công khai. Mô hình còn lại có bảng đánh giá của nhà cung cấp. Sự bất đối xứng đó không phải là chú thích cuối trang cho so sánh này; nó chính là so sánh, bởi vì mọi thứ khác mà người mua quan tâm — chi phí mỗi tác vụ, chất lượng trên mỗi watt, liệu nó có hoạt động trên tài liệu của bạn hay không — đều phụ thuộc vào nó.
Chúng ta cũng nên thẳng thắn như nhau về hình dạng của cuộc so tài, bởi vì một tiêu đề ghép một mô hình 78B đối đầu với một mô hình 12B dễ dẫn đến kết luận sai. Đây không phải là những đối thủ cạnh tranh. Một bên là triển khai 78 GB nhắm đến công việc tài liệu trong khu vực công và công nghiệp của Đức trên các rack do khách hàng sở hữu; bên còn lại là mô hình đa phương thức hợp nhất 12 tỷ tham số chạy trên laptop và mang một chỉ số độc lập là 14. Phần tiếp theo là một bản tường thuật về mục đích thực sự của từng mô hình, những chỗ mà các con số đã công bố cho phép và không cho phép bạn xếp hạng chúng, và cái giá phải trả khi không có một điểm số độc lập.
Con số duy nhất bạn có thể tin tưởng ở đây, và con số bạn không thể.
Artificial Analysis đã đo lường Gemma 4 12B, trong cấu hình suy luận của nó. Các phát hiện, như được công bố trên trang mô hình của họ, là những thông tin cần dựa vào:
• Trí tuệ — Chỉ số Trí tuệ Artificial Analysis đạt 14, xếp nó vào dải hạng cao nhất với vị trí #21 trong số 142 mô hình trong so sánh đó, so với mức trung vị là 8 ở các mô hình tương đương.
• Tốc độ — 112.5 token đầu ra mỗi giây, #21 trong số 142 trên chế độ xem tốc độ, và cao hơn mức trung vị 91 token của các mô hình tương đương.
• Giá — $0.10 cho mỗi triệu token đầu vào và $0.30 cho mỗi triệu token đầu ra, mà trang của họ đánh dấu là hơi đắt so với mức trung vị là $0.03 và $0.15 đối với các mô hình có kích thước và phân loại tương tự.
• Thông số kỹ thuật — ngữ cảnh 262.144 token, tổng cộng 12B tham số, Apache 2.0, đầu vào văn bản, hình ảnh, giọng nói và video, đầu ra văn bản.
Phán quyết tóm tắt của chính Artificial Analysis thẳng thừng một cách bất thường đối với một trang bảng xếp hạng, và đáng được nhắc lại: Gemma 4 12B nằm trong số những mô hình dẫn đầu về trí tuệ nhưng có phần đắt đỏ so với các mô hình trọng số mở khác có kích thước tương tự. Đó là một đánh giá thực sự, độc lập, có thể tái lập từ một bên thứ ba không có lợi ích gì ở cả hai nhà cung cấp.
Kolibri không có thứ gì tương đương. Không có trang mô hình nào của Artificial Analysis dành cho nó, và tại thời điểm viết bài này, chưa có bên thứ ba nào tái lập bộ đánh giá. Thứ tồn tại là bảng so sánh của chính Aleph Alpha, trên đó Kolibri đạt 75,5 ở mức trung bình tiếng Anh và 70,8 ở mức trung bình tiếng Đức trên toàn bộ bộ tác vụ của nó. Đó là các mức trung bình phần trăm không trọng số trên một hỗn hợp benchmark do nhà cung cấp tự chọn, chạy trên một harness do nhà cung cấp tự viết, ở mức reasoning effort high. Chúng không phải là Intelligence Index, và hai con số đó không thể quy đổi thành nhau hay đặt cạnh nhau để so sánh. Bất kỳ ai trình bày "Kolibri 75,5 so với Gemma 14" như một thứ hạng đều đang so sánh một tỷ lệ phần trăm trên thang đo này với một điểm số trên thang đo khác. Lập trường trung thực là: chất lượng của Gemma 4 12B được đo lường, còn chất lượng của Kolibri chỉ được tuyên bố.
Điều mà bảng của nhà cung cấp thực sự cho phép bạn làm là đọc ngang qua các hàng. Gemma 4 26B-A4B IT, người anh em mixture-of-experts của chính Google với bản 12B, xuất hiện trong bảng của Aleph Alpha với 71,9 tiếng Anh và 66,3 tiếng Đức, thấp hơn Kolibri ở cả hai. Đó là thứ gần nhất với một kiểm tra chéo hiện có, và nó đi kèm với cùng một lưu ý: harness của nhà cung cấp, số liệu của nhà cung cấp. Đó là một tín hiệu yếu, không phải bằng chứng.

Dense 12B so với sparse 78B không phải là sự chênh lệch như vẻ ngoài của nó
Khoảng cách về kiến trúc lớn hơn khoảng cách về tham số khi bạn tính đến những gì thực sự được tính toán trên mỗi token.
• Tính toán trên mỗi token — Gemma 4 12B kích hoạt toàn bộ 11,95 tỷ tham số trên mỗi token. Kolibri kích hoạt 3.457.573.120 trong số 78.103.074.560 tham số của nó, tức khoảng một phần hai mươi hai của mô hình, với một chuyên gia chia sẻ và sáu chuyên gia định tuyến mỗi lớp trong tổng số 384.
• Bộ nhớ — sự đánh đổi diễn ra theo hướng ngược lại và nó thật khắc nghiệt. Gemma 4 12B ở dạng bfloat16 có kích thước vào khoảng 24 GB trọng số. Card của Kolibri đặt trọng số FP8 ở mức khoảng 78 GB, với tối thiểu hai card A100 80 GB, hai H100 SXM5, một H200, một B200 hoặc một B300.
• Lưu ý — Gemma 4 sử dụng kết hợp giữa attention cửa sổ trượt cục bộ và attention toàn cục đầy đủ, với lớp cuối cùng luôn là toàn cục. Kolibri sử dụng tỷ lệ 4:1 giữa cửa sổ trượt và grouped-query, trải trên 50 lớp toàn MoE.
• Ngữ cảnh — 262.144 token cho Gemma 4 12B; 262.144 gốc cho Kolibri, đã được xác thực tới 1.048.576 mà không cần chia tỷ lệ vị trí.
Vậy cách diễn đạt trung thực cho “78B so với 12B” là Kolibri thắng về chi phí kích hoạt và thua về mức chiếm dụng trọng số, và không lợi thế nào là miễn phí. Một mô hình thưa kích hoạt 3,46 tỷ tham số mỗi token vẫn phải giữ toàn bộ 78 tỷ tham số trong bộ nhớ, đó là lý do mức triển khai tối thiểu là một cặp bộ tăng tốc 80 GB thay vì một card tiêu dùng. Gemma 4 12B thực hiện đánh đổi ngược lại: một tỷ lệ lớn hơn của mô hình được kích hoạt ở mỗi token, nhưng nó vừa trên phần cứng mà một người có thể mua.
Có một điểm đặc thù riêng cho tiếng Đức ở phía Kolibri, điểm này thay đổi cách tính toán chứ không phải thứ hạng. Bộ tách token của nó đạt trung bình 4,90 byte mỗi token trên văn bản web tiếng Đức, so với 4,13 của Gemini, 4,17 của dòng Qwen3.5–3.8 và 4,35 của GPT-5, theo đo lường của chính Aleph Alpha. Ít token hơn trên mỗi tài liệu tiếng Đức là mức giảm trực tiếp chi phí suy luận, và với một khối lượng công việc là văn bản hành chính tiếng Đức lên tới hàng triệu, hiệu ứng đó có thể đáng giá hơn vài điểm chỉ số. Nó cũng hoàn toàn do nhà cung cấp báo cáo.

Mỗi thứ thực sự có thể nhìn thấy gì
Đây là lúc cuộc so tài không còn sít sao nữa, và đó là một sự thật về thông số kỹ thuật chứ không phải là một tuyên bố về chất lượng. Gemma 4 12B là một mô hình đa phương thức hợp nhất: thẻ mô hình của nó mô tả một kiến trúc không dùng bộ mã hóa, chiếu trực tiếp các mảng ảnh thô và dạng sóng âm thanh vào không gian embedding của mô hình ngôn ngữ, với đầu vào là văn bản, hình ảnh, giọng nói và video, đầu ra là văn bản. Nó được xây dựng để chạy trên các thiết bị tiêu dùng mà không cần trang bị thêm các bộ mã hóa riêng.
Kolibri đọc văn bản, bằng hai ngôn ngữ, và không gì khác. Aleph Alpha định hình điều đó một cách có chủ đích là ưu tiên chiều sâu hơn bề rộng: hai ngôn ngữ, được tuyển chọn kỹ lưỡng, thay vì một hỗn hợp đa ngôn ngữ rộng. Không có tháp thị giác, không có luồng âm thanh, không có video. Nếu tác vụ của bạn bao gồm biểu mẫu quét, cuộc gọi ghi âm hoặc ảnh chụp thiết bị, thì Gemma 4 12B là một ứng viên còn Kolibri thì không, bất kể các hàng điểm chuẩn nói gì. Nếu tác vụ của bạn là một kho tài liệu tiếng Đức và tiếng Anh mà không bao giờ được rời khỏi tòa nhà, thì điều ngược lại gần với sự thật hơn — nhưng lưu ý rằng yêu cầu "không bao giờ rời khỏi tòa nhà" cũng được Gemma 4 12B đáp ứng, vì trọng số là Apache 2.0 và có thể tải xuống.
Cái nào rẻ hơn phụ thuộc vào thứ bạn đang mua.
Hai mô hình được định giá bằng những loại tiền tệ không thể quy đổi. Gemma 4 12B có mức giá thị trường: $0.10 và $0.30 mỗi triệu token theo đo lường trên nhiều nhà cung cấp bởi Artificial Analysis, và rẻ hơn ở tầng MoE trên các endpoint định tuyến. Kolibri hoàn toàn không có mức giá nào, vì Aleph Alpha không bán suy luận cho nó — bản phát hành chỉ gồm trọng số, một báo cáo kỹ thuật và một thẻ mô hình.
• Gemma 4 12B trên một tuyến được host — $0.10 mỗi triệu đầu vào và $0.30 mỗi triệu đầu ra theo số liệu của Artificial Analysis. Trong danh mục của riêng chúng tôi, người anh em MoE Gemma 4 26B-A4B IT được niêm yết ở mức $0.06 đầu vào và $0.33 đầu ra với cửa sổ 262.144 token, và phiên bản dense lớn hơn Gemma 4 31B IT ở mức $0.13 và $0.38; đó là giá niêm yết của nhà cung cấp được chuyển qua, đây là con số duy nhất mà chúng tôi không cộng thêm gì vào.
• Kolibri trên phần cứng của riêng bạn — 78 GB trọng số, một plugin vLLM từ gói aleph-alpha-inference của nhà cung cấp, và mức tối thiểu là một H200 hoặc B200, hoặc một cặp H100 SXM5s. Chi phí là một khoản mua sắm vốn, một khe rack và một người có thể vận hành triển khai vLLM, được khấu hao trên số token bạn tạo ra.
Đó không phải là cùng một kiểu mua, và phép so sánh không phải là "cái nào rẻ hơn". Vấn đề là liệu khối lượng công việc có hình dạng biện minh cho việc sở hữu phần cứng hay không. Một nhóm xử lý một tập tài liệu cố định, nhạy cảm với khối lượng lớn có thể vượt trội hơn hẳn ở phía tự vận hành. Một nhóm xây dựng tính năng sản phẩm gọi mô hình vài triệu token mỗi ngày thì gần như không bao giờ như vậy.
Một hướng trung dung thiết thực: hạng Gemma đã có trên OrcaRouter hiện nay, trên cùng endpoint tương thích OpenAI như mọi thứ khác, với khả năng chuyển đổi dự phòng giữa các nhà cung cấp và giá niêm yết của nhà cung cấp được chuyển nguyên, không cộng thêm gì trên mỗi token. Điều đó khiến nó trở thành một cách rẻ để đo khối lượng token thực tế của bạn trên một tuyến được lưu trữ trước khi quyết định liệu một triển khai chủ quyền 78 GB có chính đáng hay không. Cần nói thẳng rằng nó không phải là gì: chúng tôi không định tuyến Kolibri. Chúng tôi đã dò danh mục theo mọi cách viết của tên nhà cung cấp và tên mô hình, và nó không có ở đó. Tự lưu trữ hiện là cách duy nhất để gọi nó.

Ai nên chọn cái nào
Quy tắc quyết định đủ ngắn để có thể phát biểu trong ba dòng.
Hãy chọn Gemma 4 12B nếu bạn cần bất cứ thứ gì khác ngoài văn bản tiếng Đức và tiếng Anh, nếu bạn cần một con số chất lượng đo lường được trước khi cam kết, nếu mô hình phải chạy trên phần cứng bạn đã có sẵn, hoặc nếu bạn thà thuê token hơn là sở hữu một dàn máy chủ. Đây là mẫu duy nhất trong hai mẫu có điểm số độc lập, tốc độ được công bố và giá thị trường.
Hãy chọn Kolibri nếu yêu cầu của bạn là một mô hình suy luận 78 tỷ tham số mà trọng số, nguồn gốc dữ liệu huấn luyện, mức tiêu thụ năng lượng và giấy phép đều được ghi chép đầy đủ, được triển khai bên trong vành đai bảo mật của riêng bạn, với một tokenizer được xây dựng cho văn bản hành chính tiếng Đức và một hành vi từ chối trả lời mà một quy trình được quản lý chặt chẽ có thể dựa vào. Đó là một mục tiêu hẹp và Aleph Alpha đã nhắm tới nó một cách có chủ đích.
Đừng chọn bên nào chỉ dựa vào một dòng benchmark bạn thấy trong bài đăng ra mắt. Con số 14 của Gemma 4 12B là một phép đo do người khác thực hiện và bạn có thể kiểm chứng. Còn 75.5 của Kolibri là lời khẳng định do chính tác giả đưa ra, và người duy nhất hiện có thể phản bác nó là một khách hàng có hai H100 và một kho tài liệu.
