Kartu judul hero berjudul 'Liquid AI d1-3B vs Gemma 4 12B' dengan subjudul 'sebuah model keputusan melawan generalis', menampilkan kartu daftar periksa kecil 3.12B dengan chip probabilitas di samping kartu 11.96B yang lebih besar yang membawa ikon dokumen, bentuk gelombang, dan bingkai film serta chip jawaban tertulis.
Guides & Insights

Liquid AI d1-3B vs Gemma 4 12B: Model Pengambil Keputusan Melawan Generalis

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Cara tercepat untuk membuat perbandingan ini salah adalah menempatkan Liquid AI d1-3B dan Gemma 4 12B pada benchmark yang sama lalu menunggu pemenangnya. Keduanya tidak menjawab pertanyaan yang sama. Liquid AI d1-3B adalah model keputusan 3,12B yang diterbitkan sebagai bobot terbuka pada 7 Oktober 2026: Anda memberinya sebuah keadaan dan sekumpulan pertanyaan bernama dan ia mengembalikan probabilitas, label yang dipilih, dan tingkat keyakinan, dengan nol token keluaran dan tanpa langkah generasi. Gemma 4 12B adalah generalis any-to-any tanpa encoder milik Google, checkpoint 11,96B yang menerima teks, gambar, audio, dan video lalu menuliskan jawaban dalam jendela 256.000 token dalam lebih dari 140 bahasa. Salah satunya memberi tahu Anda papan sirkuit itu termasuk yang mana dari empat hal. Yang lain memberi tahu Anda mengapa. Bandingkan keduanya hanya dari segi kualitas dan Anda tidak akan belajar apa pun, karena outputnya tidak sebanding — dan para vendor belum pernah melakukan benchmark terhadap keduanya satu sama lain. Bandingkan keduanya berdasarkan apa yang sebenarnya dikembalikan oleh sebuah panggilan, berapa biayanya, dan di mana masing-masing mencapai batasnya, dan pasangan ini menjadi uji batas yang benar-benar berguna.

Dua output yang berbeda

Perbedaan yang melakukan semua kerja di sini adalah apa yang kembali melalui jaringan.

Liquid AI d1-3B mengembalikan objek jawaban terstruktur. Setiap pertanyaan dalam sebuah permintaan mendeklarasikan tipe — noul untuk ya/tidak dengan P(yes), choice untuk salah satu dari kumpulan opsi bernama dengan keyakinan dan probabilitas per opsi, atau score untuk posisi pada skala terurut dua hingga sepuluh tingkat dengan tingkat yang diharapkan dan distribusinya. Model melaporkan output_tokens: 0 karena tidak ada yang ditulis. Beberapa pertanyaan atas satu state dibaca dari satu forward pass, dan state serta gambar-gambarnya dikodekan sekali untuk semuanya.

Ge​mma 4 12B mengembalikan prosa. Terkadang ia mengembalikan JSON yang Anda minta, terkadang ia mengembalikan JSON yang tidak persis Anda minta, dan ia dapat bernalar sebelum menjawab. Ia terlebih dahulu adalah model bahasa: apa pun yang ia tahu cara mengklasifikasikannya, ia ungkapkan sebagai teks. Itu menjadi keunggulan ketika jawabannya harus dijelaskan kepada manusia atau diteruskan ke langkah hilir yang mengharapkan bahasa, dan menjadi biaya ketika satu-satunya hal yang Anda butuhkan hanyalah probabilitas.

Semua hal di hilir merupakan konsekuensi dari itu. Respons d1-3B tidak mungkin gagal diuraikan. Ia juga tidak dapat menjelaskan dirinya sendiri, dan kartu model menyatakannya secara langsung: ia bukan model obrolan dan ia tidak menulis teks.

Bagaimana posisi jejak-jejak bukti

Asal-usul kedua kumpulan angka tersebut tidak setara, dan itu lebih penting di sini daripada angka-angkanya sendiri.

• Decision Index 0.2.1 — Liquid AI d1-3B mencetak 48.57, dinilai oleh vendor dengan penilai resmi, peringkat pertama di antara model di bawah 10B dan di depan Decider 35B-A3B pada 47.11. Ge​mma 4 12B sama sekali tidak dinilai pada Decision Index, jadi baris ini tidak memiliki padanannya.

• Tolok ukur penalaran — Gemma 4 12B mencatat 77,5 pada AIME 2026, 78,8 pada GPQA Diamond, dan 1.659 ELO Codeforces, serta memiliki Artificial Analysis Intelligence Index 22 dalam mode penalaran dan 13 saat penalaran dimatikan. Liquid AI d1-3B tidak memiliki tolok ukur penalaran, karena model keputusan tidak menghasilkan jejak penalaran untuk dinilai.

• Konteks panjang — Gemma 4 12B menerima 256.000 token dan mencetak 43,4% pada MRCR v2 eight-needle di 128k pada kartu Google sendiri. Liquid AI d1-3B menerima 32.768 token. Jika "state" Anda adalah dokumen empat puluh halaman ditambah hasil pindaian, selisih itu menjadi penentu utama dan bukanlah perbedaan yang tipis.

• Visi — Liquid AI d1-3B rata-rata 74,1 pada sebelas tolok ukur citra publik yang dibaca sebagai keputusan atas kumpulan opsi tiap tolok ukur, dibandingkan dengan 73,9 untuk tulang punggung LFM2.5-VL-3B yang menjadi dasar pembuatannya, dan vendor melaporkan bahwa penghapusan gambar menurunkan pertanyaan yang sama menjadi 45,1. Visi Ge​mma 4 12B lebih kuat dan lebih luas, tetapi dilaporkan sebagai kualitas generasi, bukan sebagai akurasi keputusan atas opsi yang disebutkan.

• Bahasa — enam belas didokumentasikan untuk Liquid AI d1-3B; lebih dari 140 untuk Ge​mma 4 12B.

• Kecepatan — Liquid AI d1-3B menjawab satu pertanyaan dalam 8 ms pada RTX 4090, 16 ms pada Jetson AGX Thor, 26 ms pada Jetson AGX Orin 64 GB, dan 50 ms pada Jetson Orin Nano, serta mengemas 64 state ke dalam satu pass dengan kecepatan 475 per detik pada 4090. Gemma 4 12B melakukan generasi, jadi latensinya merupakan fungsi dari berapa banyak token yang ditulisnya.

• Kualitas bukti — hasil Ge​mma 4 12B adalah milik Goo​gle, dipublikasikan pada Juni 2026 dan sejak itu diteliti, dikuantisasi, dan dijalankan ulang oleh komunitas besar. Hasil Liquid AI d1-3B adalah milik Liquid, dipublikasikan dua hari lalu, tidak direproduksi oleh siapa pun di luar lab. Bacalah kolom kedua dengan mempertimbangkan hal itu.

A two-column scoreboard for Liquid AI d1-3B and Gemma 4 12B. The d1-3B column reads: output a label, a confidence, zero tokens; 3.12B parameters; 32,768-token context; text and image input; 8 ms per question; Decision Index 48.57 (vendor). The Gemma 4 12B column reads: output generated text; 11.96B parameters; 256,000-token context; text, image, audio and video input; latency that scales with output length; Decision Index not scored. The footer reads 'd1-3B figures vendor-reported and unreproduced; Gemma 4 12B figures per Google, June 2026.'

Satu-satunya tempat mereka benar-benar bersaing

Ada tumpang tindih nyata, dan itu bukan pada papan peringkat. Itu adalah panggilan LLM-as-a-judge.

Banyak pipeline produksi sudah menggunakan generalis berukuran sedang sebagai lapisan penilaian: menilai urgensi tiket ini, memutuskan apakah keluaran ini lolos rubrik, memilih alat mana yang harus dipanggil agen berikutnya, memeriksa apakah petikan yang diambil menjawab pertanyaan. Saat ini sebagian besar panggilan tersebut ditujukan ke model generatif yang diminta mengeluarkan angka atau label sebagai teks, dan angka yang dikeluarkannya adalah apa pun yang dihasilkan sampler, bukan softmax atas kumpulan opsi Anda. Itulah alur kerja yang Liquid AI d1-3B menjalani post-training untuk menggantikannya, dan demo yang dipublikasikan semuanya adalah versi dari alur kerja itu — predikat SQL yang menjawab ya atau tidak untuk 150 tiket dukungan, loop pemadatan konteks agen yang mempertahankan, memangkas, atau membuang setiap keluaran alat dan menghilangkan 52% token, aplikasi inspeksi visual yang memilah komponen baik dan cacat dari empat lini produksi dengan akurasi 85 hingga 97% pada tugas yang tidak pernah dilatih untuk dikerjakannya.

Gemma 4 12B melakukan semua pekerjaan itu, dan melakukan lebih dari pekerjaan-pekerjaan itu. Model ini juga dapat menulis ringkasan, menyimpan dokumen 256K dalam konteks, menerima panggilan telepon yang direkam sebagai masukan, dan menjawab dalam salah satu dari lebih dari 140 bahasa. Jika pipeline Anda membutuhkan penilaian dan narasi, 12B melakukan dua pekerjaan dengan satu panggilan dan model keputusan 3B melakukan salah satunya.

Batasnya adalah panjang konteks dan bentuk keluaran. State yang panjang, input lisan, banyak bahasa, atau penjelasan yang diharapkan pembaca — Gemma 4 12B, tidak ada tandingan. State yang pendek, kumpulan opsi tetap, anggaran latensi per permintaan dalam satuan milidetik satu digit, atau jaminan kuat bahwa jawabannya dapat diurai — itu kolom d1-3B, dan model generalis itu membayar untuk kemampuan yang tidak akan Anda gunakan.

Berapa biaya untuk menelepon masing-masing

Tidak satu pun model ada dalam katalog kami, jadi tidak ada harga routing yang dapat dikutip untuk keduanya — Ge​mma 4 12B bukan salah satu ukuran Ge​mma yang kami layani, dan Liquid AI d1-3B adalah bobot terbuka yang Anda host sendiri atau akses melalui API vendor itu sendiri serta platform pihak ketiga. Sebagai konteks untuk sisi yang berdekatan dengan Gemini dari keluarga tersebut, dua ukuran Ge​mma 4 yang kami rutekan tercantum pada $0,06 per juta input dan $0,33 per juta output untuk Ge​mma 4 26B A4B, dan $0,13 serta $0,38 untuk Ge​mma 4 31B, keduanya dengan konteks 262.144 token serta input teks, gambar, dan video. Harga penyedia median yang dikutip untuk Ge​mma 4 12B di tempat lain berada di sekitar $0,10 dan $0,30.

yang dihosting Liquidd1 hanya menagih token input, sebesar $0,04 per juta, dengan gambar dihitung sebagai input pada 1,5 token per petak 32×32 piksel. Karena itu, permintaan keputusan sama sekali tidak memiliki baris token output, dan inilah alasan struktural mengapa perbandingan biaya milik vendor sendiri terhadap model yang jauh lebih besar menghasilkan angka seperti itu. Bobot terbuka tidak memiliki harga per panggilan; Anda membayar lewat perangkat keras. Keduanya harus berada dalam pipeline yang sama dengan semua hal lain yang Anda panggil, yaitu lapisan tempat router memang ada — satu API untuk 200+ model, harga daftar penyedia diteruskan dengan markup 0%, dan failover otomatis sehingga gangguan kecil di satu upstream tidak menjadi gangguan layanan Anda. Itulah perpipaan di sekitar perbandingan, bukan perbandingannya.

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph announcing d1-3B and d1-omni-600M as open-weight models, the d1-3B Decision Index score of 48.57, and the latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Bagaimana memutuskan, sejujurnya

Mulailah dari format jawaban, bukan dari modelnya. Jika sistem hilir dapat mengonsumsi probabilitas, label, dan tingkat keyakinan, serta kumpulan jawabannya kecil dan diketahui, Liquid AI d1-3B bukanlah penurunan kelas dari 12B — ini adalah instrumen yang berbeda, dan angka latensinya menjadikannya penerapan yang secara kategoris berbeda: 50 ms pada Jetson Orin Nano adalah perangkat yang sama sekali tidak seharusnya menjalankan 12B.

Jika jawabannya harus berupa kalimat, atau state-nya lebih panjang dari tiga puluh dua ribu token, atau seseorang akan mengucapkannya, atau bahasa keluarannya adalah Bengali, maka Ge​mma 4 12B adalah satu-satunya dari keduanya yang dapat melakukan pekerjaan itu dan perbandingannya sudah selesai sebelum dimulai.

Posisi yang benar-benar berguna bagi sebagian besar tim adalah keduanya, di tempat yang berbeda. Sebuah model keputusan di depan panggilan yang mahal, melakukan triase, perutean, dan pemeriksaan pengaman yang tidak memerlukan bahasa; seorang generalis di belakangnya untuk pekerjaan yang memerlukannya. Itu adalah pipeline yang sama, satu menjadi filter dan satu menjadi payload — dan tim yang akan mendapatkan manfaat paling besar dari rilis d1 adalah tim yang sudah membayar 12B untuk menjawab ya atau tidak.

A capture of our own catalogue page for Google Gemma 4 31B, showing the model id google/gemma-4-31b-it, a release date of 2026-04-02, a 30.7B dense multimodal description with a 256K token context window, and headline pricing of $0.13 per million input tokens and $0.38 per million output tokens.