Đã tạo thẻ hero cho Kolibri vs Gemma 4 12B, với tiêu đề 'Kolibri vs Gemma 4 12B' cùng dòng phụ 'một MoE 78B đối đầu với một mô hình dense 11,95B', biểu tượng chim ruồi ở bên trái và một viên kim cương ở bên phải, nằm hai bên của một đường phân cách mỏng. Logo OrcaRouter nằm trong dải bên dưới phần hình minh họa.
Guides & Insights

Kolibri vs Gemma 4 12B: 78 tỷ tham số so với 12, và chỉ một trong hai mới có điểm số

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Kolibri và Gemma 4 12B là hai đầu của một phổ mà các bản phát hành trọng số mở thường không cho phép bạn so sánh trên cùng một cơ sở. Kolibri của Aleph Alpha ra mắt ngày 3 tháng 10 năm 2026: tổng cộng 78,1 tỷ tham số, 3,46 tỷ tham số hoạt động trên mỗi token, cửa sổ ngữ cảnh 1.048.576 token đã được xác thực, chỉ tiếng Đức và tiếng Anh, Apache 2.0. Gemma 4 12B ra mắt ngày 3 tháng 6 năm 2026: 11,95 tỷ tham số dense, cửa sổ ngữ cảnh 262.144 token, đầu vào văn bản, hình ảnh, âm thanh và video, Apache 2.0. Một trong hai có điểm số độc lập, có thể tái tạo công khai. Mô hình còn lại có bảng đánh giá của nhà cung cấp. Sự bất đối xứng đó không phải là chú thích cuối trang cho so sánh này; nó chính là so sánh, bởi vì mọi thứ khác mà người mua quan tâm — chi phí mỗi tác vụ, chất lượng trên mỗi watt, liệu nó có hoạt động trên tài liệu của bạn hay không — đều phụ thuộc vào nó.

Chúng ta cũng nên thẳng thắn như nhau về hình dạng của cuộc so tài, bởi vì một tiêu đề ghép một mô hình 78B đối đầu với một mô hình 12B dễ dẫn đến kết luận sai. Đây không phải là những đối thủ cạnh tranh. Một bên là triển khai 78 GB nhắm đến công việc tài liệu trong khu vực công và công nghiệp của Đức trên các rack do khách hàng sở hữu; bên còn lại là mô hình đa phương thức hợp nhất 12 tỷ tham số chạy trên laptop và mang một chỉ số độc lập là 14. Phần tiếp theo là một bản tường thuật về mục đích thực sự của từng mô hình, những chỗ mà các con số đã công bố cho phép và không cho phép bạn xếp hạng chúng, và cái giá phải trả khi không có một điểm số độc lập.

Con số duy nhất bạn có thể tin tưởng ở đây, và con số bạn không thể.

Artificial Analysis đã đo lường Gemma 4 12B, trong cấu hình suy luận của nó. Các phát hiện, như được công bố trên trang mô hình của họ, là những thông tin cần dựa vào:

• Trí tuệ — Chỉ số Trí tuệ Artificial Analysis đạt 14, xếp nó vào dải hạng cao nhất với vị trí #21 trong số 142 mô hình trong so sánh đó, so với mức trung vị là 8 ở các mô hình tương đương.

• Tốc độ — 112.5 token đầu ra mỗi giây, #21 trong số 142 trên chế độ xem tốc độ, và cao hơn mức trung vị 91 token của các mô hình tương đương.

• Giá — $0.10 cho mỗi triệu token đầu vào và $0.30 cho mỗi triệu token đầu ra, mà trang của họ đánh dấu là hơi đắt so với mức trung vị là $0.03 và $0.15 đối với các mô hình có kích thước và phân loại tương tự.

• Thông số kỹ thuật — ngữ cảnh 262.144 token, tổng cộng 12B tham số, Apache 2.0, đầu vào văn bản, hình ảnh, giọng nói và video, đầu ra văn bản.

Phán quyết tóm tắt của chính Artificial Analysis thẳng thừng một cách bất thường đối với một trang bảng xếp hạng, và đáng được nhắc lại: Gemma 4 12B nằm trong số những mô hình dẫn đầu về trí tuệ nhưng có phần đắt đỏ so với các mô hình trọng số mở khác có kích thước tương tự. Đó là một đánh giá thực sự, độc lập, có thể tái lập từ một bên thứ ba không có lợi ích gì ở cả hai nhà cung cấp.

Kolibri không có thứ gì tương đương. Không có trang mô hình nào của Artificial Analysis dành cho nó, và tại thời điểm viết bài này, chưa có bên thứ ba nào tái lập bộ đánh giá. Thứ tồn tại là bảng so sánh của chính Aleph Alpha, trên đó Kolibri đạt 75,5 ở mức trung bình tiếng Anh và 70,8 ở mức trung bình tiếng Đức trên toàn bộ bộ tác vụ của nó. Đó là các mức trung bình phần trăm không trọng số trên một hỗn hợp benchmark do nhà cung cấp tự chọn, chạy trên một harness do nhà cung cấp tự viết, ở mức reasoning effort high. Chúng không phải là Intelligence Index, và hai con số đó không thể quy đổi thành nhau hay đặt cạnh nhau để so sánh. Bất kỳ ai trình bày "Kolibri 75,5 so với Gemma 14" như một thứ hạng đều đang so sánh một tỷ lệ phần trăm trên thang đo này với một điểm số trên thang đo khác. Lập trường trung thực là: chất lượng của Gemma 4 12B được đo lường, còn chất lượng của Kolibri chỉ được tuyên bố.

Điều mà bảng của nhà cung cấp thực sự cho phép bạn làm là đọc ngang qua các hàng. Gemma 4 26B-A4B IT, người anh em mixture-of-experts của chính Google với bản 12B, xuất hiện trong bảng của Aleph Alpha với 71,9 tiếng Anh và 66,3 tiếng Đức, thấp hơn Kolibri ở cả hai. Đó là thứ gần nhất với một kiểm tra chéo hiện có, và nó đi kèm với cùng một lưu ý: harness của nhà cung cấp, số liệu của nhà cung cấp. Đó là một tín hiệu yếu, không phải bằng chứng.

Screenshot of the Artificial Analysis model page for Gemma 4 12B (Reasoning), marked 'Open weights model, Released June 2026', showing an Intelligence Index of 14 against a median of 8, a #21/142 intelligence rank and a #21/142 speed rank, 112.5 output tokens per second against a 91-token median, input pricing $0.10 per million tokens against a $0.03 median and output pricing $0.30 against a $0.15 median, a 262k-token context window, the summary verdict that the model is amongst the leading models in intelligence but somewhat expensive compared with other open-weight models of similar size, and the 142 models in this class count.

Dense 12B so với sparse 78B không phải là sự chênh lệch như vẻ ngoài của nó

Khoảng cách về kiến trúc lớn hơn khoảng cách về tham số khi bạn tính đến những gì thực sự được tính toán trên mỗi token.

• Tính toán trên mỗi token — Gemma 4 12B kích hoạt toàn bộ 11,95 tỷ tham số trên mỗi token. Kolibri kích hoạt 3.457.573.120 trong số 78.103.074.560 tham số của nó, tức khoảng một phần hai mươi hai của mô hình, với một chuyên gia chia sẻ và sáu chuyên gia định tuyến mỗi lớp trong tổng số 384.

• Bộ nhớ — sự đánh đổi diễn ra theo hướng ngược lại và nó thật khắc nghiệt. Gemma 4 12B ở dạng bfloat16 có kích thước vào khoảng 24 GB trọng số. Card của Kolibri đặt trọng số FP8 ở mức khoảng 78 GB, với tối thiểu hai card A100 80 GB, hai H100 SXM5, một H200, một B200 hoặc một B300.

• Lưu ý — Gemma 4 sử dụng kết hợp giữa attention cửa sổ trượt cục bộ và attention toàn cục đầy đủ, với lớp cuối cùng luôn là toàn cục. Kolibri sử dụng tỷ lệ 4:1 giữa cửa sổ trượt và grouped-query, trải trên 50 lớp toàn MoE.

• Ngữ cảnh — 262.144 token cho Gemma 4 12B; 262.144 gốc cho Kolibri, đã được xác thực tới 1.048.576 mà không cần chia tỷ lệ vị trí.

Vậy cách diễn đạt trung thực cho “78B so với 12B” là Kolibri thắng về chi phí kích hoạt và thua về mức chiếm dụng trọng số, và không lợi thế nào là miễn phí. Một mô hình thưa kích hoạt 3,46 tỷ tham số mỗi token vẫn phải giữ toàn bộ 78 tỷ tham số trong bộ nhớ, đó là lý do mức triển khai tối thiểu là một cặp bộ tăng tốc 80 GB thay vì một card tiêu dùng. Gemma 4 12B thực hiện đánh đổi ngược lại: một tỷ lệ lớn hơn của mô hình được kích hoạt ở mỗi token, nhưng nó vừa trên phần cứng mà một người có thể mua.

Có một điểm đặc thù riêng cho tiếng Đức ở phía Kolibri, điểm này thay đổi cách tính toán chứ không phải thứ hạng. Bộ tách token của nó đạt trung bình 4,90 byte mỗi token trên văn bản web tiếng Đức, so với 4,13 của Gemini, 4,17 của dòng Qwen3.5–3.8 và 4,35 của GPT-5, theo đo lường của chính Aleph Alpha. Ít token hơn trên mỗi tài liệu tiếng Đức là mức giảm trực tiếp chi phí suy luận, và với một khối lượng công việc là văn bản hành chính tiếng Đức lên tới hàng triệu, hiệu ứng đó có thể đáng giá hơn vài điểm chỉ số. Nó cũng hoàn toàn do nhà cung cấp báo cáo.

Generated two-column scoreboard for Kolibri and Gemma 4 12B. Left column Kolibri: independent score 'none published', context '262,144 native, 1M validated', parameters '78.1B MoE, 3.46B active', modalities 'text only', licence Apache 2.0, price 'self-host, 78 GB'. Right column Gemma 4 12B: independent score 'AA Index 14', context 262,144, parameters '11.95B dense', modalities 'text, image, audio, video', licence Apache 2.0, price '$0.10 in / $0.30 out'. The footer reads 'Kolibri figures vendor-reported; Gemma 4 12B figures per Artificial Analysis.'

Mỗi thứ thực sự có thể nhìn thấy gì

Đây là lúc cuộc so tài không còn sít sao nữa, và đó là một sự thật về thông số kỹ thuật chứ không phải là một tuyên bố về chất lượng. Gemma 4 12B là một mô hình đa phương thức hợp nhất: thẻ mô hình của nó mô tả một kiến trúc không dùng bộ mã hóa, chiếu trực tiếp các mảng ảnh thô và dạng sóng âm thanh vào không gian embedding của mô hình ngôn ngữ, với đầu vào là văn bản, hình ảnh, giọng nói và video, đầu ra là văn bản. Nó được xây dựng để chạy trên các thiết bị tiêu dùng mà không cần trang bị thêm các bộ mã hóa riêng.

Kolibri đọc văn bản, bằng hai ngôn ngữ, và không gì khác. Aleph Alpha định hình điều đó một cách có chủ đích là ưu tiên chiều sâu hơn bề rộng: hai ngôn ngữ, được tuyển chọn kỹ lưỡng, thay vì một hỗn hợp đa ngôn ngữ rộng. Không có tháp thị giác, không có luồng âm thanh, không có video. Nếu tác vụ của bạn bao gồm biểu mẫu quét, cuộc gọi ghi âm hoặc ảnh chụp thiết bị, thì Gemma 4 12B là một ứng viên còn Kolibri thì không, bất kể các hàng điểm chuẩn nói gì. Nếu tác vụ của bạn là một kho tài liệu tiếng Đức và tiếng Anh mà không bao giờ được rời khỏi tòa nhà, thì điều ngược lại gần với sự thật hơn — nhưng lưu ý rằng yêu cầu "không bao giờ rời khỏi tòa nhà" cũng được Gemma 4 12B đáp ứng, vì trọng số là Apache 2.0 và có thể tải xuống.

Cái nào rẻ hơn phụ thuộc vào thứ bạn đang mua.

Hai mô hình được định giá bằng những loại tiền tệ không thể quy đổi. Gemma 4 12B có mức giá thị trường: $0.10 và $0.30 mỗi triệu token theo đo lường trên nhiều nhà cung cấp bởi Artificial Analysis, và rẻ hơn ở tầng MoE trên các endpoint định tuyến. Kolibri hoàn toàn không có mức giá nào, vì Aleph Alpha không bán suy luận cho nó — bản phát hành chỉ gồm trọng số, một báo cáo kỹ thuật và một thẻ mô hình.

• Gemma 4 12B trên một tuyến được host — $0.10 mỗi triệu đầu vào và $0.30 mỗi triệu đầu ra theo số liệu của Artificial Analysis. Trong danh mục của riêng chúng tôi, người anh em MoE Gemma 4 26B-A4B IT được niêm yết ở mức $0.06 đầu vào và $0.33 đầu ra với cửa sổ 262.144 token, và phiên bản dense lớn hơn Gemma 4 31B IT ở mức $0.13 và $0.38; đó là giá niêm yết của nhà cung cấp được chuyển qua, đây là con số duy nhất mà chúng tôi không cộng thêm gì vào.

• Kolibri trên phần cứng của riêng bạn — 78 GB trọng số, một plugin vLLM từ gói aleph-alpha-inference của nhà cung cấp, và mức tối thiểu là một H200 hoặc B200, hoặc một cặp H100 SXM5s. Chi phí là một khoản mua sắm vốn, một khe rack và một người có thể vận hành triển khai vLLM, được khấu hao trên số token bạn tạo ra.

Đó không phải là cùng một kiểu mua, và phép so sánh không phải là "cái nào rẻ hơn". Vấn đề là liệu khối lượng công việc có hình dạng biện minh cho việc sở hữu phần cứng hay không. Một nhóm xử lý một tập tài liệu cố định, nhạy cảm với khối lượng lớn có thể vượt trội hơn hẳn ở phía tự vận hành. Một nhóm xây dựng tính năng sản phẩm gọi mô hình vài triệu token mỗi ngày thì gần như không bao giờ như vậy.

Một hướng trung dung thiết thực: hạng Gemma đã có trên OrcaRouter hiện nay, trên cùng endpoint tương thích OpenAI như mọi thứ khác, với khả năng chuyển đổi dự phòng giữa các nhà cung cấp và giá niêm yết của nhà cung cấp được chuyển nguyên, không cộng thêm gì trên mỗi token. Điều đó khiến nó trở thành một cách rẻ để đo khối lượng token thực tế của bạn trên một tuyến được lưu trữ trước khi quyết định liệu một triển khai chủ quyền 78 GB có chính đáng hay không. Cần nói thẳng rằng nó không phải là gì: chúng tôi không định tuyến Kolibri. Chúng tôi đã dò danh mục theo mọi cách viết của tên nhà cung cấp và tên mô hình, và nó không có ở đó. Tự lưu trữ hiện là cách duy nhất để gọi nó.

Screenshot of the OrcaRouter model page for google/gemma-4-26b-a4b-it, showing the 262K-token context badge, text, image and video input with text output, the Vision, Tools, JSON and Reasoning capability tags, the attribution 'Public benchmarks by Google - 2026-04-05', the description of Gemma 4 26B A4B IT as an instruction-tuned mixture-of-experts model from Google DeepMind with roughly 26B total parameters of which about 4B activate per token, the pricing tiles $0.06 and $0.33, and the OpenAI-compatible base URL https://api.orcarouter.ai/v1.

Ai nên chọn cái nào

Quy tắc quyết định đủ ngắn để có thể phát biểu trong ba dòng.

Hãy chọn Gemma 4 12B nếu bạn cần bất cứ thứ gì khác ngoài văn bản tiếng Đức và tiếng Anh, nếu bạn cần một con số chất lượng đo lường được trước khi cam kết, nếu mô hình phải chạy trên phần cứng bạn đã có sẵn, hoặc nếu bạn thà thuê token hơn là sở hữu một dàn máy chủ. Đây là mẫu duy nhất trong hai mẫu có điểm số độc lập, tốc độ được công bố và giá thị trường.

Hãy chọn Kolibri nếu yêu cầu của bạn là một mô hình suy luận 78 tỷ tham số mà trọng số, nguồn gốc dữ liệu huấn luyện, mức tiêu thụ năng lượng và giấy phép đều được ghi chép đầy đủ, được triển khai bên trong vành đai bảo mật của riêng bạn, với một tokenizer được xây dựng cho văn bản hành chính tiếng Đức và một hành vi từ chối trả lời mà một quy trình được quản lý chặt chẽ có thể dựa vào. Đó là một mục tiêu hẹp và Aleph Alpha đã nhắm tới nó một cách có chủ đích.

Đừng chọn bên nào chỉ dựa vào một dòng benchmark bạn thấy trong bài đăng ra mắt. Con số 14 của Gemma 4 12B là một phép đo do người khác thực hiện và bạn có thể kiểm chứng. Còn 75.5 của Kolibri là lời khẳng định do chính tác giả đưa ra, và người duy nhất hiện có thể phản bác nó là một khách hàng có hai H100 và một kho tài liệu.