
Liquid AI d1-3B vs Granite 4.2 3B: Dua Model 3B yang Tidak Pernah Mengerjakan Tugas yang Sama
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Tempatkan Liquid AI d1-3B dan Granite 4.2 3B pada GPU tunggal yang sama dan keduanya akan muat dengan nyaman — 3,12B parameter di satu sisi, 3B di sisi lain. Keduanya juga akan berperilaku seolah-olah berasal dari disiplin yang berbeda. Granite 4.2 3B, yang menurut kartu model IBM sendiri bertanggal 25 Agustus 2026, adalah model penalaran: tiga mode berpikir, <think>, dan jawaban yang Anda baca. Liquid AI d1-3B, yang diunggah ke Hugging Face pada 5 Oktober 2026 dan diumumkan oleh Liquid dua hari kemudian, adalah model keputusan: ia menerima keadaan ditambah serangkaian pertanyaan bertipe yang eksplisit dan mengembalikan probabilitas, label, atau posisi pada skala dalam satu forward pass, melaporkan output_tokens: 0 karena ia tidak pernah menulis apa pun. Pertanyaan yang berguna bukanlah mana yang lebih baik. Pertanyaannya adalah pemanggilan mana milik Anda yang sebenarnya merupakan keputusan, karena kedua repo tersebut dibangun untuk dua bagian yang berlawanan dari pemisahan itu.
Apa sebenarnya yang ada di setiap repositori
Semua yang ada di bawah ini berasal dari dua kartu model dan postingan pengumuman Liquid. Tidak ada apa pun di sini yang telah direproduksi secara independen, tidak ada pihak ketiga yang menilai salah satu model pada harness yang sama, dan angka-angka di dalam kartu-kartu tersebut adalah milik vendor sendiri.
• Ukuran — Liquid AI d1-3B total 3,12B, dibangun di atas LFM2.5-VL-3B milik Liquid; Granite 4.2 3B adalah transformer padat decoder-only 3B yang dibangun di atas granite-4.1-3b-base
• Keluaran — d1-3B mengembalikan probabilitas, label, dan tingkat keyakinan serta tidak menulis teks sama sekali; Granite 4.2 3B menghasilkan token, termasuk rantai pemikiran opsional di dalam <think> tag
• Konteks — d1-3B 32.768 token; Granite 4.2 3B 128K secara native, dengan ekstensi konteks panjang hingga 512K pada kartu
• Masukan — teks d1-3B, JSON, gambar, atau campuran, melalui encoder visi SigLIP2 NaFlex 400M; Granite 4.2 3B hanya teks
• Lisensi — d1-3B di bawah Liquid's LFM Open License v1.0; Granite 4.2 3B di bawah Apache 2.0
• Bahasa — d1-3B mencantumkan 16; Granite 4.2 dua belas diuji, dengan catatan pada kartu bahwa yang lain belum diuji
• Penyajian — d1-3B menyertakan kode kustom (trust_remote_code=True, transformers>=5.14), dengan repositori GGUF dan w8a8 dalam keluarga yang sama dan kartu yang didokumentasikan untuk llama.cpp, Ollama dan LM Studio; Granite 4.2 3B berjalan di bawah vLLM 0.20+ atau SGLang 0.5.18+ dengan parser pemikiran kustom
Dua dari baris-baris itu melakukan lebih banyak pekerjaan daripada yang lain. Baris output adalah keseluruhan argumen artikel ini, dan baris lisensi adalah baris yang tidak pernah dimasukkan orang ke dalam tabel perbandingan.

Yang satu menulis rantai pemikiran, yang lain menolak untuk menulis
Granite 4.2 3B membuktikan manfaatnya dengan berpikir secara terbuka. Kartunya mendokumentasikan tiga mode: berpikir aktif secara default, tanpa berpikir, dan mode usaha rendah yang mempertahankan jejak penalaran tetapi memperpendeknya. Tumpukan penyajian memisahkan jejak dari jawaban akhir sehingga aplikasi Anda menerima konten bersih plus bidang penalaran terpisah. Itu desain yang baik untuk pertanyaan yang perlu dikerjakan — soal matematika, cabang logika, sepotong kode yang harus ditulis sebelum dapat dinilai.
d1-3B tidak memiliki mode seperti itu, dan kartunya mengatakan dengan blak-blakan: "Ini bukan model obrolan dan tidak menulis teks." Sebuah panggilan mendeklarasikan pertanyaan dengan tipe. noul adalah ya/tidak yang mengembalikan P(ya) antara 0 dan 1. choice memilih satu label dari kumpulan opsi bernama dan mengembalikan label, keyakinan, dan probabilitas per opsi. score menempatkan status pada skala terurut dua hingga sepuluh dan mengembalikan level yang diharapkan dengan distribusi dan legendanya. Sinyal dibaca dari logit pada posisi placeholder dalam satu lintasan, bukan disampel token demi token, itulah sebabnya blok penggunaan dapat melaporkan nol token keluaran tanpa berbohong.
Perbedaan itu mengubah tagihan Anda sebelum mengubah akurasi Anda. Panggilan klasifikasi Granite yang berpikir selama 400 token adalah panggilan yang Anda bayar 400 token output, dan label yang Anda inginkan terkubur dalam prosa yang kemudian harus diambil oleh parser. Panggilan d1-3B hanya menagih input. Jika sebagian besar lalu lintas Anda adalah label dengan aturan yang melekat, Anda telah membayar untuk penalaran itu, terlepas dari apakah itu mengubah label atau tidak.
Di mana Granite 4.2 3B jelas merupakan pilihan yang lebih baik
Terimalah benchmark penalaran itu apa adanya — itu milik IBM sendiri, dijalankan melalui pipeline NeMo Evaluator internal, dan tidak ada pihak eksternal yang mereproduksinya — dan model 3B ini luar biasa kuat untuk ukurannya: AIME25 78.33, HMMT Februari 2025 66.67, GPQA 54.80, LiveCodeBench v6 69.71, MMLU-Pro 67.84, IFBench 74.33, BFCL v4 52.41, tau3-bench 45.78, dan RULER 64K 67.52 yang turun menjadi 55.30 pada 128K.
Empat pekerjaan timbul dari daftar itu, dan d1-3B tidak ada dalam salah satu pun dari itu.
• Konteks native 128K, dapat diperluas hingga 512K, dibandingkan 32.768 token pada d1-3B — jika state Anda berupa dokumen panjang, pilihannya sudah dibuat untuk Anda
• Pemanggilan alat secara agentik dengan parser yang terdokumentasi dan integrasi harness untuk OpenCode, Pi, dan OpenHands, yang tidak memiliki padanannya pada model keputusan
• Tugas apa pun yang jawabannya berupa paragraf: peringkasan, penyusunan draf, ekstraksi ke dalam struktur bebas, pembuatan kode
• Fine-tuning dan redistribusi tanpa plafon pendapatan, karena Apache 2.0 tidak memiliki klausul ambang batas
Perhatikan apa yang tidak ada di kartu Granite: Baris SWE-Bench dan Terminal-Bench ditandai NA untuk 3B. Tahap pembelajaran penguatan agentik IBM hanya diterapkan pada anggota keluarga 8B dan 30B, sehingga model terkecil tidak membawa skor agentik yang dimiliki oleh saudara-saudaranya yang lebih besar. Tim yang membaca "Granite 4.2" dan menganggap 3B mewarisi profil agentik keluarga akan terkejut.

Ketika d1-3B menang sebelum Granite selesai berpikir
Tabel latensi milik Liquid sendiri, yang diukur dalam kondisi warm, satu permintaan pada satu waktu, adalah bagian terkuat dari argumennya: satu pertanyaan dalam 8 ms pada RTX 4090 dan 9 ms pada AMD MI325X, 16 ms pada Jetson AGX Thor dan 26 ms pada Jetson AGX Orin 64GB, dengan 64 state yang dikemas ke dalam satu pass pada 475/s di RTX 4090 dan 1.106/s di MI325X. Sebagai gambaran skalanya, itu kira-kira waktu yang dibutuhkan Granite 4.2 3B untuk mengeluarkan beberapa token dari jejak penalarannya.
Tiga jenis pertanyaan atas satu state memakan biaya d1-3B 21 ms pada 4090 alih-alih tiga panggilan terpisah, karena state dan gambar-gambarnya dibaca sekali untuk semua pertanyaan. Dalam tumpukan moderasi atau perutean yang dulunya menembakkan satu permintaan HTTP per aturan, itu adalah perbedaan antara antrean panggilan dan satu panggilan.
Model ini juga bisa melihat. d1-3B mencetak rata-rata 74,1 pada sebelas tolok ukur gambar publik, dibandingkan 73,9 untuk model dasarnya, dan kartu model mencatat bahwa saat gambarnya dihilangkan, pertanyaan yang sama mendapat skor 45,1 — jawabannya berasal dari gambar, bukan dari prompt teks. Baris-baris individual dapat menguntungkan sekaligus merugikan (CV-Bench 82,1 versus 87,6 milik model dasar, POPE 88,5 versus 90,1), jadi klaim visinya adalah "setara dengan model dasar", bukan "lebih baik darinya".
Penyeimbang yang jujur: skor 48,57 milik d1-3B pada Decision Index 0.2.1 dihasilkan oleh Liquid yang menjalankan penilai resmi itu sendiri, bukan melalui pengiriman ke papan peringkat, dan baris-baris pesaing berasal dari papan peringkat publik. Rata-rata 77,1 miliknya pada delapan tugas benchmark-sebagai-keputusan dan 71,8 pada DecisionBench juga berasal dari pihak pertama. Semua yang ada di sisi d1 dalam perbandingan ini belum diverifikasi.

Mengapa penalar 3B bukan model keputusan 3B
Langkah yang menggoda adalah memperlakukan Granite 4.2 3B sebagai pengganti yang lebih murah untuk d1-3B, atau sebaliknya. Keduanya gagal, dan kegagalannya bersifat struktural, bukan soal kualitas.
Minta Granite memutuskan dan Anda akan mendapatkan generasi yang harus Anda uraikan, tagihan yang skalanya bergantung pada seberapa sulit model menilai pertanyaannya, dan latensi yang bergantung pada mode berpikir yang Anda pilih. Minta d1-3B bernalar dan Anda tidak mendapatkan apa pun sama sekali — model ini tidak punya aliran token untuk bernalar. Kedua model berada di sisi yang berlawanan dari garis yang dilalui sebagian besar pipeline beberapa kali per permintaan: ada yang harus memutuskan, dan ada yang harus berbicara. d1-3B cocok di depan, tempat aturan triase memilih rute dan mengembalikan keyakinan terkalibrasi. Granite 4.2 3B cocok di belakangnya, pada cabang yang memerlukan jawaban tertulis.
Ada jebakan kedua yang lebih senyap. Nilai sebuah model keputusan adalah kalibrasi — keyakinan 0,9 yang benar sembilan kali dari sepuluh. Kartu Granite 4.2 3B tidak menerbitkan metrik kalibrasi dan tidak menerbitkan probabilitas; yang diterbitkan adalah skor akurasi dan penalaran. Membandingkan keduanya pada papan peringkat tolok ukur tidak memberi tahu apa pun tentang mana di antara keduanya yang seharusnya Anda percayai dengan sebuah ambang batas.
Baris lisensi yang tak seorang pun masukkan ke dalam tabel
Granite 4.2 3 dirilis di bawah 2.0. d1-3B dirilis di bawah LFM Open License v1.0, yang tampak permisif sampai Bagian 5: penggunaan komersial diberikan dengan syarat bahwa Anda atau entitas hukum Anda tetap berada di bawah ambang batas yang didefinisikan dalam dokumen yang sama sebagai pendapatan tahunan sepuluh juta dolar AS atau lebih, dan penggunaan komersial apa pun di atas garis itu sama sekali tidak dilisensikan. Organisasi nirlaba dan pengguna riset dikecualikan.
Bagi seorang penghobi atau startup, ini bukan masalah. Bagi perusahaan yang melewati batas itu di pertengahan tahun — atau yang mungkin diakuisisi oleh perusahaan semacam itu — kedua repo itu bukan artefak yang setara, tak peduli seberapa mirip jumlah parameter mereka terlihat, dan tinjauan lisensi baru terjadi jauh setelah seseorang sudah merilis prototipe tersebut. Ini adalah hal termurah di halaman ini untuk diperiksa sejak dini.
Menjalankan pasangan sebagai satu pipeline
Tidak satu pun dari kedua model itu ada di katalog kami saat ini, jadi ini bukan klaim ketersediaan: keduanya adalah artefak yang di-host sendiri, dan Granite 4.2 3B khususnya tidak mencantumkan penyedia inferensi sama sekali di kartunya. Namun pola yang benar-benar akhirnya dimiliki sebuah tim adalah satu panggilan yang memutuskan dan satu lagi yang berbicara, dan pola itulah tempat lapisan routing layak mendapat tempatnya. OrcaRouter menempatkan lebih dari 200 model di balik satu kunci API dengan harga daftar penyedia diteruskan dengan markup 0%, sehingga pemotongan harga vendor sampai ke tagihan Anda pada hari yang sama, bukan pada perpanjangan kontrak berikutnya, dan failover otomatis antar penyedia berarti komponen bersama di tengah pipeline tidak menjadi titik kegagalan tunggal saat Anda masih mengevaluasinya. Jika Anda ingin melakukan A/B d1-3B terhadap generalis yang di-host pada traffic Anda sendiri sebelum berkomitmen pada penerapan yang di-host sendiri, tetangga terdekat yang dirutekan ke garis keturunan Granite adalah Gemma 4 31B dengan $0.13 per juta token input dan $0.38 per juta token output — model yang jauh lebih besar, tetapi peran "generalis yang menulis" yang sama dalam pipeline.
Putusan tersebut, dinyatakan sebagai aturan
Jika yang Anda butuhkan adalah penilaian — spam atau bukan, antrean mana, seberapa mendesak, apakah gambar ini cocok dengan deskripsi itu — d-3B adalah satu-satunya dari keduanya yang mengerjakan tugas itu dalam sekali jalan, dan ia melakukannya dalam milidetik satu digit. Jika yang Anda butuhkan adalah jawaban tertulis, pembacaan dokumen panjang, pemanggilan alat, atau sepotong kode, Granet 4.2 3B adalah satu-satunya yang memiliki aliran token, dan skor penalaran 3B itu benar-benar mengesankan untuk ukurannya — pada hasil IBM sendiri, yang belum diperiksa siapa pun.
Yang akan mengubah gambaran bukanlah baris benchmark baru. Melainkan pihak ketiga yang menilai kedua model pada harness kalibrasi yang sama, karena properti yang menentukan apakah Anda dapat menetapkan ambang batas pada suatu model adalah properti yang tidak dapat dibandingkan melalui kartu mana pun saat ini.
