Một thẻ tiêu đề được tạo tự động với nội dung "Ember-1 vs Gemma 4 12B" cùng dòng phụ đề "Ít token hơn trên endpoint thuê, hay trọng số của riêng bạn", phía trên hai thẻ: Ember-1 — "dẫn xuất từ Kimi K3" và "không có trọng số, không có giá công bố"; Gemma 4 12B — "11.95B dense, Apache 2.0" và "ngữ cảnh 256K, đa phương thức".
Guides & Insights

Ember-1 vs Gemma 4 12B: Một bên cho bạn thuê ít token hơn, bên kia trao tận tay bạn trọng số

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Ember-1 và Gemma 4 12B không cạnh tranh cho cùng một dòng trên đơn đặt hàng, và cách nhanh nhất để thấy vì sao là hỏi bạn sẽ sở hữu gì vào cuối mỗi tháng. Gemma 4 12B là mô hình đa phương thức dày đặc 11,95 tỷ tham số của Google, phát hành ngày 3 tháng 6 năm 2026 theo giấy phép Apache 2.0 — bạn tải nó xuống, và checkpoint thuộc về bạn. Ember-1 là dẫn xuất chuyên biệt của Fireworks Research từ Kimi K3 của Moonshot AI, được công bố ngày 23 tháng 9 năm 2026 dưới dạng bản xem trước nghiên cứu trên nền tảng serverless của chính nhà cung cấp — bạn gọi nó, và bạn không sở hữu gì ngoài hóa đơn. Một bên là lập luận thuê-để-mua về token; bên kia là một khoản mua sắm vốn. Đặt chúng cạnh nhau, và phép so sánh hữu ích không phải là mô hình nào tốt hơn, bởi vì không có gì được công bố cho phép bạn phân định điều đó. Mà là hình thức mua sắm nào trong hai hình thức phù hợp với thứ bạn đang xây dựng.

Hai hợp đồng, được diễn đạt một cách đơn giản

Gemma 4 12B là một bản phát hành trọng số mở đã hoàn thiện. Google công bố trọng số, kiến trúc, bảng benchmark và giấy phép, còn một cộng đồng các runtime — llama.cpp, vLLM, MLX, SGLang, Transformers — phục vụ nó trên phần cứng do bạn kiểm soát. Chi phí cho mỗi token sau khi mua là tiền điện và khấu hao, chứ không phải một khoản mục chi phí từ nhà cung cấp. Những thứ bạn đánh đổi chính là cái giá mà trọng số mở luôn phải trả: bạn tự lo việc hoạch định năng lực, và trần chất lượng của bạn bị cố định ở 11,95 tỷ tham số.

Ember-1 thì ngược lại. Không có trọng số nào để tải xuống — nó tồn tại dưới dạng một tùy chọn phục vụ trên nền tảng của chính nhà cung cấp — và không có mức giá nào được công bố. Thay vào đó, thứ nó mang lại là một tuyên bố hẹp hơn, được thực thi dựa trên một mô hình lớn hơn nhiều: độ chính xác của Kimi K3, với lượng token tiêu tốn ít hơn khoảng 40% để đạt được điều đó. Fireworks Research đã huấn luyện nó một cách chuyên biệt để rút ngắn các vết suy luận mà không thay đổi câu trả lời, và báo cáo rằng độ dài suy luận có thể được cắt giảm 35–50% mà không mất độ chính xác trên bảy bộ đánh giá và hai thử nghiệm A/B trong môi trường sản xuất của khách hàng. Mọi con số ở đó đều do nhà cung cấp báo cáo và chưa được tái lập.

A two-column scoreboard titled "Ember-1 vs Gemma 4 12B — the scoreboard" comparing six dimensions. Ember-1: a Kimi K3 derivative retrained for shorter reasoning; no published weights; context not published (base model 1M); text-only input; price not published, preview only; evidence is vendor benchmarks plus two vendor-run A/B tests. Gemma 4 12B: a dense 11.95B multimodal generalist; Apache 2.0 weights, downloadable; 256K-token context; text, image and audio input; free to download with hardware costs; evidence is Google evaluations plus an independent local-run ecosystem.

Giá trị của lập luận về token phụ thuộc hoàn toàn vào việc ai là người trả tiền cho các token.

Lời chào hàng cho Ember-1 giả định hóa đơn tính theo từng token. Giả định đó đúng với đối tượng mà nó được thiết kế hướng tới — các nhóm chạy những vòng lặp agent dài trên một mô hình frontier được host, nơi Fireworks Research lưu ý rằng Kimi K3 có thể dành hơn 90% số token được tạo ra cho suy luận nội bộ, và nơi mỗi lượt phát lại các lượt trước khiến phần suy luận trước đó bị đọc lại và bị tính phí lại. Trong bối cảnh đó, cắt giảm độ dài trace đồng nghĩa với việc cắt trực tiếp vào sao kê hàng tháng, và kết quả A/B của 29.9K token đầu ra so với 49.3K của K3 chính là con số đáng quan tâm.

Chạy cùng mô hình đó theo các điều khoản của Gemma 4 12B và lập luận sẽ tan biến. Khi bạn tự vận hành một checkpoint Apache-2.0, các token suy luận thêm tiêu tốn thời gian thực tế và mức chiếm dụng GPU, chứ không phải đô-la trên mỗi triệu token. Một vết suy luận dài dòng trên chiếc laptop 16GB của chính bạn là một câu trả lời chậm hơn, chứ không phải một hóa đơn lớn hơn. Điều đó không làm cho sự kém hiệu quả trở nên vô hại — trong một vòng lặp tác nhân, nó vẫn cộng dồn, và nó vẫn thể hiện dưới dạng độ trễ — nhưng tỷ giá quy đổi thì khác, và việc coi mức giảm 40% token là mức tiết kiệm 40% trên phần cứng tự vận hành là một lỗi phạm trù.

Bảng thông số kỹ thuật, mỗi kích thước một dòng

• Nó là gì — Ember-1: một dẫn xuất xem trước nghiên cứu từ Kimi K3, được huấn luyện lại để suy luận ngắn hơn. Gemma 4 12B: một mô hình đa phương thức dày đặc 11,95B với trọng số mở thuộc dòng Gemma 4 của Google.

• Trọng số — Ember-1: không có bản nào được công bố; chỉ được cung cấp qua nền tảng của nhà cung cấp. Gemma 4 12B: Apache 2.0, có thể tải xuống, không bị hạn chế truy cập.

• Kích thước — Ember-1: không được tiết lộ; kế thừa từ kiến trúc của Kimi K3. Gemma 4 12B: 11,95B dense, 48 lớp, khoảng 18GB trọng số ở BF16.

• Cửa sổ ngữ cảnh — Ember-1: không được công bố cho bản xem trước; mô hình cơ sở của nó chứa 1.048.576 token. Gemma 4 12B: 256K token.

• Đầu vào — Ember-1: văn bản. Gemma 4 12B: văn bản, hình ảnh và âm thanh thông qua thiết kế hợp nhất không dùng bộ mã hóa, với video được một số nguồn liệt kê.

• Giá — Ember-1: không công bố mức giá nào; số đô-la trong bảng benchmark được tính từ bảng giá của Kimi K3. Gemma 4 12B: tải về miễn phí; bạn trả tiền cho phần cứng.

• Yêu cầu phần cứng tối thiểu — Ember-1: tùy theo nhà cung cấp sắp xếp. Gemma 4 12B: 16GB VRAM hoặc bộ nhớ hợp nhất, theo định vị của Google.

• Bằng chứng — Ember-1: các benchmark do nhà cung cấp công bố và hai thử nghiệm A/B do nhà cung cấp thực hiện, chưa được tái lập. Gemma 4 12B: các đánh giá do Goog​le báo cáo cùng với một hệ sinh thái độc lập gồm các lần chạy cục bộ.

Gemma 4 12B công bố những gì, và nó đọc như thế nào

Các con số của chính Google cho Gemma 4 12B đặt nó nằm giữa Gemma 4 E4B cỡ edge và 26B MoE lớn hơn: GPQA Diamond 78.8%, MMLU Pro 77.2%, AIME 2026 không dùng công cụ 77.5%, LiveCodeBench v6 72.0, Codeforces ELO 1659, trung bình τ-2 69.0%, MMMU Pro 69.1%, DocVQA 94.9 và BigBench Extra Hard 53.0%. Đây cũng là những con số do nhà cung cấp báo cáo — Google đã đánh giá mô hình của chính mình và công bố bảng điểm — nhưng chúng có lợi thế là mô tả một checkpoint mà bất kỳ ai cũng có thể tải về và chạy lại, đó là lý do các tuyên bố về trọng số mở thường nhanh chóng nhận được xác nhận từ bên thứ ba, còn các tuyên bố xem trước đóng thì không.

Sự khác biệt thực sự của mô hình là về cấu trúc chứ không phải về con số. Gemma 4 12B không có bộ mã hóa thị giác hay âm thanh riêng biệt: các mảng hình ảnh và dạng sóng âm thanh chiếu trực tiếp vào không gian token, đó chính là điều cho phép một mô hình 12B có thể nhận ảnh chụp màn hình hoặc bản ghi âm làm đầu vào. Nó cũng đi kèm với các bộ dự thảo dự đoán đa token cho giải mã suy đoán, đây là một tính năng về độ trễ chứ không phải về chất lượng — loại tính năng quan trọng khi bạn tự chạy mô hình và từng mili giây prefill đều do bạn chi trả.

Nơi hai thứ ấy thực sự va chạm

Cả hai mô hình đều được bán cho lập trình agentic và sử dụng công cụ, và đây là lãnh địa duy nhất nơi thực sự tồn tại một lựa chọn. Con số Terminal Bench 2.1 của Ember-1 là 82.0% so với 80.9% của Kimi K3 Max, với ít hơn 51.9% token; kết quả SWE-bench Verified của nó là 92.2% so với 93.2% của K3 Max. Gemma 4 12B hoàn toàn không có con số Terminal Bench hay SWE-bench nào trong bộ công bố của Google — bằng chứng agentic của nó là τ-2 ở mức 69.0%. Vì vậy, bạn không thể đặt hai mô hình cạnh nhau trên một benchmark chung, và bất kỳ bài viết nào làm vậy đều đang bịa ra sự so sánh.

Điều có thể nói là chúng nằm ở những điểm khác nhau trên một đường cong chi phí. Nếu khối lượng công việc agent của bạn chạy trên một mô hình tiên phong được lưu trữ và hóa đơn bị chi phối bởi các token suy luận, thì Ember-1 tấn công đúng vào hạng mục đó — với cái giá là cửa sổ truy cập hai tuần và không có mức giá nào được công bố. Nếu khối lượng công việc của bạn cần chạy trên phần cứng do bạn kiểm soát, xử lý ảnh chụp màn hình, hoặc chịu được việc một nhà cung cấp quyết định không tiếp tục bản xem trước, thì Gemma 4 12B là cái duy nhất trong hai cái thậm chí trả lời được câu hỏi đó.

A screenshot of the Hugging Face model card for google/gemma-4-12B, showing 97,559 downloads in the last month, a safetensors model size of 12B parameters in BF16, the Apache 2.0 licence, any-to-any modality, and a model tree listing 7 adapters, 62 fine-tunes and 49 quantizations. The Inference Providers panel reads "This model isn't deployed by any Inference Provider."

Một con đường trung dung, và nơi để tìm thấy nó

Có một lựa chọn thứ ba mà chiến lược tiếp thị của cả hai mô hình đều không hướng tới: dùng các bậc Gemma 4 lớn hơn làm nửa phần hosted của một giải pháp lai. OrcaRouter định tuyến Gemma 4 26B-A4B và Gemma 4 31B của Google cùng hơn 200 mô hình khác phía sau một API duy nhất với mức giá niêm yết của nhà cung cấp và mức chênh 0%, nên cùng một khóa dùng được cho một Gemma cỡ trung cũng dùng được cho những mô hình tiên tiến mà nếu không bạn sẽ phải cần hợp đồng thứ hai. Bản thân Gemma 4 12B không có trên nền tảng của chúng tôi, và Ember-1 cũng vậy — nếu bạn cần bản 12B chạy cục bộ, hãy tải về; còn nếu bạn muốn kiểm tra trước xem một Gemma lớn hơn có thu hẹp khoảng cách không, thì phép thử đó chỉ tốn một endpoint.

Cách sắp xếp đó cũng là cách trung thực để đánh giá một bản xem trước nghiên cứu. Việc tự động chuyển đổi dự phòng giữa các nhà cung cấp có nghĩa là một mô hình biến mất khỏi cửa sổ xem trước sẽ không kéo ứng dụng của bạn theo, đó chính là rủi ro cụ thể mà tình trạng phát hành của Ember-1 mang lại và là rủi ro cụ thể mà không có gì trong bảng benchmark của nó đề cập đến.

Cái nào thuộc về lộ trình của bạn?

Chọn Gemma 4 12B nếu quyền sở hữu là một yêu cầu — quyền riêng tư, vận hành ngoại tuyến, mức sàn chi phí cố định, hay một sản phẩm phải tiếp tục hoạt động nếu một nhà cung cấp đổi ý. Mức trần được công bố của nó thấp hơn của một sản phẩm phái sinh tiên phong và đầu vào đa phương thức của nó thực sự tạo ra sự khác biệt, và không điều nào trong hai sự thật đó phụ thuộc vào lộ trình của bất kỳ ai khác.

Chọn Ember-1 nếu vấn đề của bạn là hóa đơn tính theo token trong các phiên chạy agent dài và bạn có thể chấp nhận rủi ro bản xem trước. Hãy chạy nó ở chế độ shadow đối chiếu với giải pháp hiện tại của bạn trong hai tuần mà bạn có, đo token trên mỗi tác vụ hoàn thành trên lưu lượng của chính bạn, và coi 40% là một giả thuyết chứ không phải một tỷ lệ. Điều bạn không nên làm là chọn giữa chúng dựa trên chất lượng, vì không ai — kể cả phòng thí nghiệm đã tạo ra Ember-1 — đã công bố một so sánh có thể cho phép bạn làm điều đó.

A screenshot of OrcaRouter's model page for Gemma 4 31B, showing the google/gemma-4-31b-it listing priced at $0.13 per 1M input tokens and $0.38 per 1M output tokens, a p50 time-to-first-token of 1.44s, 375.3K tokens of traffic over seven days, a 256K-token context window and a Python snippet calling api.orcarouter.ai/v1.

Điểm mấu chốt lớn hơn là hai bản phát hành này đại diện cho hai cách năng lực đang được bán vào cuối năm 2026. Một phòng thí nghiệm công bố một checkpoint và để hệ sinh thái tự tìm được mức của nó; một bên khác lấy một mô hình do người khác huấn luyện, cải thiện một trục hành vi của nó, rồi bán phần cải thiện đó như một dịch vụ. Cả hai đều chính đáng, và chúng thất bại theo những cách khác nhau: trọng số mở thất bại chậm rãi và công khai, còn bản xem trước thất bại đột ngột và bằng một thông báo.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày