Kartu judul buatan yang bertuliskan "Ember-1 vs Gemma 4 12B" dengan subjudul "Token lebih sedikit di endpoint sewaan, atau bobot Anda sendiri", di atas dua kartu: Ember-1 — "turunan Kimi K3" dan "tanpa bobot, tanpa harga yang dipublikasikan"; Gemma 4 12B — "11.95B dense, Apache 2.0" dan "konteks 256K, multimodal".
Guides & Insights

Ember-1 vs Gemma 4 12B: Yang satu menyewakan lebih sedikit token kepada Anda, yang lain menyerahkan bobotnya kepada Anda.

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ember-1 dan Gemma 4 12B tidak bersaing untuk baris yang sama pada pesanan pembelian, dan cara tercepat untuk melihat alasannya adalah dengan bertanya apa yang akan Anda miliki pada akhir setiap bulan. Gemma 4 12B adalah model multimodal padat dengan 11,95 miliar parameter milik Google, dirilis pada 3 Juni 2026 di bawah Apache 2.0 — Anda mengunduhnya, dan checkpoint itu menjadi milik Anda. Ember-1 adalah turunan terspesialisasi dari Kimi K3 milik Moonshot AI yang dikembangkan Fireworks Research, diterbitkan pada 23 September 2026 sebagai pratinjau riset di platform serverless milik vendor itu sendiri — Anda memanggilnya, dan Anda tidak memiliki apa pun selain fakturnya. Yang satu adalah argumen sewa-beli tentang token; yang lain adalah pembelian modal. Letakkan keduanya berdampingan dan perbandingan yang berguna bukanlah model mana yang lebih baik, karena tidak ada yang dipublikasikan yang memungkinkan Anda memutuskannya. Melainkan bentuk pengadaan mana dari kedua opsi itu yang cocok dengan hal yang sedang Anda bangun.

Kedua kontrak itu, dinyatakan secara gamblang

Gemma 4 12B adalah rilis open-weights yang sudah final. Goog​le menerbitkan bobot, arsitektur, lembar benchmark, dan lisensinya, dan komunitas runtime — llama.cpp, vLLM, MLX, SGLang, Transformers — menjalankannya di perangkat keras yang Anda kendalikan. Biaya per token setelah pembelian adalah listrik dan amortisasi, bukan pos biaya dari vendor. Hal-hal yang Anda lepaskan adalah hal-hal yang selalu menjadi biaya open weights: Anda bertanggung jawab atas perencanaan kapasitas, dan plafon kualitas Anda dipatok pada 11.95B parameter.

Ember-1 adalah kebalikannya. Tidak ada bobot untuk diunduh — ia hadir sebagai opsi penyajian di platform vendor sendiri — dan tidak ada harga yang dipublikasikan. Yang ditawarkannya sebagai gantinya adalah klaim yang lebih sempit, dijalankan di atas model yang jauh lebih besar: akurasi Kimi K3, dengan sekitar 40% lebih sedikit token yang dihabiskan untuk mencapainya. Fireworks Research melatihnya secara khusus untuk mempersingkat jejak penalaran tanpa mengubah jawaban, dan melaporkan bahwa panjang penalaran dapat dipangkas 35–50% tanpa kehilangan akurasi di tujuh tolok ukur dan dua uji A/B produksi pelanggan. Setiap angka di sana dilaporkan vendor dan belum direproduksi.

A two-column scoreboard titled "Ember-1 vs Gemma 4 12B — the scoreboard" comparing six dimensions. Ember-1: a Kimi K3 derivative retrained for shorter reasoning; no published weights; context not published (base model 1M); text-only input; price not published, preview only; evidence is vendor benchmarks plus two vendor-run A/B tests. Gemma 4 12B: a dense 11.95B multimodal generalist; Apache 2.0 weights, downloadable; 256K-token context; text, image and audio input; free to download with hardware costs; evidence is Google evaluations plus an independent local-run ecosystem.

Nilai dari argumen token sepenuhnya bergantung pada siapa yang membayar token tersebut.

Pitch untuk Ember-1 mengasumsikan tagihan per token. Asumsi itu benar untuk audiens yang menjadi sasarannya — tim yang menjalankan loop agen panjang terhadap model frontier yang dihosting, tempat Fireworks Research mencatat bahwa Kimi K3 dapat menghabiskan lebih dari 90% token yang dihasilkan untuk penalaran internal, dan tempat setiap giliran memutar ulang giliran sebelumnya sehingga penalaran sebelumnya dibaca ulang dan ditagih kembali. Dalam situasi itu, memangkas panjang trace berarti langsung memangkas tagihan bulanan, dan hasil A/B 29,9K token output dibandingkan 49,3K milik K3 adalah angka yang penting.

Jalankan model yang sama dengan ketentuan Gemma 4 12B, dan argumennya pun buyar. Saat Anda melakukan self-host atas checkpoint Apache-2.0, token penalaran ekstra memakan waktu wall-clock dan okupansi GPU, bukan dolar per juta. Jejak penalaran yang bertele-tele di laptop 16GB milik Anda sendiri adalah jawaban yang lebih lambat, bukan tagihan yang lebih besar. Itu tidak membuat inefisiensi tersebut tak berbahaya — dalam loop agen, hal itu tetap menumpuk, dan tetap muncul sebagai latensi — tetapi nilai tukarnya berbeda, dan memperlakukan pengurangan token sebesar 40% sebagai penghematan 40% pada perangkat keras self-host adalah kesalahan kategori.

Lembar spesifikasi, satu baris per dimensi

• Apa itu — Ember-1: turunan pratinjau riset dari Kimi K3, dilatih ulang untuk penalaran yang lebih singkat. Gemma 4 12B: model multimodal bobot terbuka dense 11,95B dari keluarga Gemma 4 milik Goog​le.

• Bobot — Ember-1: tidak ada yang dipublikasikan; hanya disediakan melalui platform vendor. Gemma 4 12B: Apache 2.0, dapat diunduh, tanpa pembatasan.

• Ukuran — Ember-1: tidak diungkapkan; diwarisi dari arsitektur Kimi K3. Gemma 4 12B: 11,95B dense, 48 lapisan, sekitar 18GB bobot dalam BF16.

• Jendela konteks — Ember-1: tidak dipublikasikan untuk pratinjau; model dasarnya memiliki 1.048.576 token. Gemma 4 12B: 256K token.

• Masukan — Ember-1: teks. Gemma 4 12B: teks, gambar, dan audio melalui desain terpadu tanpa encoder, dengan video dicantumkan oleh beberapa sumber.

• Harga — Ember-1: tidak ada yang diterbitkan; dolar di lembar benchmark dihitung dari kartu tarif Kimi K3. Gemma 4 12B: gratis diunduh; Anda membayar untuk perangkat kerasnya.

• Batas minimum perangkat keras — Ember-1: apa pun yang dijadwalkan vendor. Gemma 4 12B: VRAM 16GB atau memori terpadu, sesuai positioning Google.

• Bukti — Ember-1: tolok ukur vendor dan dua uji A/B yang dijalankan vendor, belum direproduksi. Gemma 4 12B: evaluasi yang dilaporkan Google plus ekosistem independen dari eksekusi lokal.

Apa yang diterbitkan Gemma 4 12B, dan bagaimana ia membaca

Angka milik Goog​le sendiri untuk Gemma 4 12B menempatkannya di antara Gemma 4 E4B yang berukuran edge dan 26B MoE yang lebih besar: GPQA Diamond 78,8%, MMLU Pro 77,2%, AIME 2026 tanpa alat 77,5%, LiveCodeBench v6 72,0, Codeforces ELO 1659, rata-rata τ-2 69,0%, MMMU Pro 69,1%, DocVQA 94,9, dan BigBench Extra Hard 53,0%. Itu pun dilaporkan oleh vendor — Goog​le mengevaluasi modelnya sendiri dan menerbitkan lembar hasilnya — tetapi angka-angka itu punya keunggulan karena menggambarkan sebuah checkpoint yang siapa pun dapat mengunduh dan menjalankannya ulang, itulah sebabnya klaim open-weights cenderung cepat memperoleh konfirmasi pihak ketiga, sedangkan klaim pratinjau tertutup tidak.

Pembeda sebenarnya dari model ini bersifat struktural, bukan numerik. Gemma 4 12B tidak memiliki encoder visi atau audio terpisah: patch gambar dan bentuk gelombang audio diproyeksikan langsung ke ruang token, dan itulah yang memungkinkan model 12B menerima tangkapan layar atau rekaman sebagai input. Model ini juga menyertakan drafter prediksi multi-token untuk speculative decoding, yang merupakan fitur latensi, bukan fitur kualitas — hal semacam ini penting ketika Anda menjalankan model itu sendiri dan setiap milidetik prefill menjadi biaya yang harus Anda tanggung.

Di mana keduanya sebenarnya bertabrakan

Kedua model ini dipasarkan untuk pengodean agentik dan penggunaan alat, dan ini satu-satunya ranah di mana pilihan yang benar-benar nyata tersedia. Angka Terminal Bench 2.1 Ember-1 adalah 82,0% versus 80,9% milik Kimi K3 Max, dengan token 51,9% lebih sedikit; hasil SWE-bench Verified-nya adalah 92,2% versus 93,2% milik K3 Max. Gemma 4 12B sama sekali tidak memiliki angka Terminal Bench atau SWE-bench dalam set terbitan Goog​le — bukti agentiknya adalah τ-2 pada 69,0%. Jadi Anda tidak dapat menyejajarkan keduanya pada benchmark bersama, dan artikel apa pun yang melakukannya sedang mengada-adakan perbandingan itu.

Yang bisa dikatakan adalah bahwa keduanya berada di titik yang berbeda pada kurva biaya. Jika beban kerja agen Anda berjalan terhadap model frontier yang dihosting dan tagihannya didominasi oleh token penalaran, Ember-1 menyerang tepat istilah itu — dengan harga jendela akses dua minggu dan tarif yang tidak dipublikasikan. Jika beban kerja Anda perlu berjalan pada perangkat keras yang Anda kendalikan, menangani tangkapan layar, atau bertahan ketika vendor memutuskan untuk tidak melanjutkan pratinjau, Gemma 4 12B adalah satu-satunya dari keduanya yang sama sekali menjawab pertanyaan itu.

A screenshot of the Hugging Face model card for google/gemma-4-12B, showing 97,559 downloads in the last month, a safetensors model size of 12B parameters in BF16, the Apache 2.0 licence, any-to-any modality, and a model tree listing 7 adapters, 62 fine-tunes and 49 quantizations. The Inference Providers panel reads "This model isn't deployed by any Inference Provider."

Jalan tengah, dan di mana menemukannya

Ada opsi ketiga yang tidak menjadi fokus pemasaran model mana pun: gunakan tier Gemma 4 yang lebih besar sebagai separuh yang dihosting dari sebuah hibrida. OrcaRouter merutekan Gemma 4 26B-A4B milik Goog​le dan Gemma 4 31B bersama 200+ model lainnya di balik satu API pada harga daftar penyedia dengan markup 0%, sehingga kunci yang sama yang menjangkau Gemma ukuran menengah juga menjangkau model-model frontier yang jika tidak, akan mengharuskan Anda memiliki kontrak kedua. Gemma 4 12B sendiri tidak ada di platform kami, dan Ember-1 juga tidak — jika Anda memerlukan 12B secara lokal, unduh saja; jika Anda ingin menguji apakah Gemma yang lebih besar menutup kesenjangan terlebih dahulu, uji itu hanya memerlukan satu endpoint.

Susunan itu juga merupakan cara yang jujur untuk mengevaluasi pratinjau riset. Failover otomatis lintas penyedia berarti model yang hilang dari jendela pratinjau tidak akan ikut menjatuhkan aplikasi Anda, yang merupakan risiko spesifik yang ditimbulkan oleh status rilis Ember-1 dan risiko spesifik yang tidak dibahas oleh apa pun dalam tabel benchmark-nya.

Yang mana yang pantas masuk ke roadmap Anda

Pilih Gemma 4 12B jika kepemilikan menjadi persyaratan — privasi, operasi offline, batas biaya tetap, atau produk yang harus tetap berfungsi jika vendor berubah pikiran. Batas atas yang dipublikasikannya lebih rendah daripada turunan frontier, dan input multimodalnya benar-benar menjadi pembeda, dan tak satu pun dari fakta itu bergantung pada peta jalan pihak lain.

Pilih Ember-1 jika masalah Anda adalah tagihan per token pada proses agen yang panjang dan Anda dapat menanggung risiko pratinjau. Jalankan dalam mode bayangan terhadap sistem yang saat ini Anda gunakan selama dua minggu yang Anda miliki, ukur token per tugas yang diselesaikan pada lalu lintas Anda sendiri, dan anggap 40% sebagai hipotesis, bukan sebagai tarif. Yang seharusnya tidak Anda lakukan adalah memilih di antara keduanya berdasarkan kualitas, karena tidak ada seorang pun — termasuk lab yang membangun Ember-1 — yang telah menerbitkan perbandingan yang memungkinkan Anda melakukannya.

A screenshot of OrcaRouter's model page for Gemma 4 31B, showing the google/gemma-4-31b-it listing priced at $0.13 per 1M input tokens and $0.38 per 1M output tokens, a p50 time-to-first-token of 1.44s, 375.3K tokens of traffic over seven days, a 256K-token context window and a Python snippet calling api.orcarouter.ai/v1.

Poin yang lebih besar adalah bahwa dua rilis ini mewakili dua cara kapabilitas dijual pada akhir 2026. Satu lab menerbitkan checkpoint dan membiarkan ekosistem menemukan levelnya sendiri; yang lain mengambil model yang dilatih pihak lain, meningkatkan satu aspek perilakunya, dan menjual peningkatan itu sebagai layanan. Keduanya sah, dan keduanya gagal dengan cara yang berbeda: bobot terbuka gagal perlahan dan di depan publik, pratinjau gagal tiba-tiba dan lewat pengumuman.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari