
Liquid AI d1-3B vs Qwen 3 8B: Haruskah Beban Kerja Klasifikasi 8B Beralih ke Model Keputusan?
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Di suatu tempat di sebagian besar tumpukan produksi, ada Qwen 3 8B yang dibayar untuk menjawab ya atau tidak. Ia memoderasi komentar, memberi tag pada tiket dukungan, memutuskan apakah bagian yang diambil relevan, atau menilai keluaran model lain terhadap rubrik — dan ia melakukannya dengan menghasilkan teks yang kemudian diurai oleh sesuatu di hilir. Liquid AI d1-3B, model keputusan 3,12B yang dibuka bobotnya oleh Liquid AI pada 7 Oktober 2026, ada untuk melakukan tepat pekerjaan itu tanpa menghasilkan apa pun: state masuk, serangkaian pertanyaan bernama masuk, dan probabilitas, label, serta keyakinan keluar dalam satu forward pass dengan nol token keluaran. Qwen 3 8B adalah pekerja keras berbobot terbuka milik vendor dari April 2025 — sekitar 8,2B parameter padat, 119 bahasa, mode berpikir aktif atau nonaktif per permintaan, dan enam belas bulan penerapan komunitas di belakangnya. Pertanyaan yang sebenarnya diajukan oleh pasangan ini sempit dan praktis: untuk porsi lalu lintas Anda yang merupakan klasifikasi, apakah generalis 8B adalah cara termurah untuk mendapatkan label pada 2026, atau sudah berubah bentuk pekerjaan itu di bawahnya?
Apa yang sebenarnya kamu bayar untuk dilakukan oleh 8B
Letakkan kedua kontrak keluaran itu berdampingan, dan inefisiensinya bersifat struktural, bukan inkremental.
Panggilan klasifikasi Qwen 3 8B adalah sebuah generasi. Anda menulis prompt yang menjelaskan label-labelnya, model secara opsional menalar tentang input — dan pada model ini Anda dapat menyalakan atau mematikan penalaran tersebut per permintaan, yang merupakan kenop paling berguna yang dimilikinya untuk pekerjaan semacam ini — lalu model menuliskan jawaban kembali. Jawaban itu adalah teks. Jika Anda meminta JSON, biasanya Anda akan mendapatkan JSON, dan kadang-kadang Anda akan mendapatkan JSON di dalam sebuah kalimat, atau prakata, atau penjelasan di akhir yang tidak Anda inginkan. Label yang Anda pedulikan ada di suatu tempat dalam aliran token, dan sebuah parser mengambilnya. Anda ditagih untuk setiap token yang ditulis model, termasuk token yang Anda buang.
Liquid AI d1-3B tidak memiliki aliran token. Pertanyaan dideklarasikan dengan tipe: noul untuk ya/tidak, dijawab sebagai P(ya) antara 0 dan 1; choice untuk satu label dari kumpulan opsi bernama, dijawab sebagai label plus keyakinan plus probabilitas per opsi; score untuk posisi pada skala berurutan dua sampai sepuluh, dijawab sebagai level yang diharapkan dengan distribusi dan legendanya. Respons membawa total berjalan yang terbaca output_tokens: 0. Tidak ada yang perlu diurai karena tidak ada yang ditulis, dan ada aksesor mentah probabilities saat Anda menginginkan distribusi yang tidak dibulatkan alih-alih argmax.
Bagian yang mengubah tagihan Anda adalah apa yang terjadi dengan beberapa pertanyaan. Satu state dapat membawa banyak pertanyaan: apakah ini permintaan pengembalian dana, tim mana yang harus menanganinya, seberapa mendesak pertanyaan itu. State dan gambar-gambarnya dibaca sekali, dan Liquid melaporkan tiga pertanyaan atas satu state memakan waktu 1,3x dari satu pertanyaan, bukan 3x. Yang tidak diciutkannya adalah biaya input — catatan penagihan vendor secara eksplisit menyatakan bahwa setiap pertanyaan ditagih sebagai prompt tersendiri, termasuk teks dan semua gambarnya. Latensi lebih rendah, token input sama. Itu adalah tanda bintang yang jujur pada judul utamanya, dan hal semacam itu hanya Anda temukan dengan membaca paragraf harga, bukan benchmark.

Apa yang bisa Anda dapatkan dari enam belas bulan Qwen 3 8B
Sebelum memperlakukan model yang lebih kecil sebagai peningkatan, bersikaplah tepat mengenai apa yang dibawa oleh model yang ada saat ini, karena itu lebih dari sekadar jumlah parameter.
• Konteks — Qwen 3 8B menjalankan 32.768 token secara native dan diperluas hingga 131.072 yang divalidasi melalui YaRN. Liquid AI d1-3B menjalankan 32.768 token secara tetap, tanpa jalur ekstensi yang terdokumentasi. Untuk state yang berupa dokumen panjang, 8B adalah satu-satunya dari keduanya yang dapat menampungnya.
• Bahasa — 119 bahasa dan dialek untuk Qwen 3 8B dibandingkan dengan enam belas yang terdokumentasi untuk Liquid AI d1-3B.
• Kontrol penalaran — Qwen 3 8B memungkinkan Anda mengaktifkan atau menonaktifkan pemikiran per permintaan. Liquid AI d1-3B tidak memiliki mode penalaran yang dapat dikontrol, yang bisa jadi merupakan penyederhanaan atau keterbatasan, tergantung untuk apa Anda menggunakan pemikiran itu.
• Cakupan — 8B menulis, menjelaskan, meringkas, menerjemahkan, dan membuat kode. Liquid AI d1-3B tidak melakukan satu pun dari hal-hal itu. Kartunya menyatakannya dengan gamblang: ini bukan model obrolan dan tidak menulis teks.
• Bukti — Qwen 3 8B memiliki enam belas bulan benchmarking publik, kuantisasi, fine-tuning, dan penggunaan produksi. Skor Decision Index Liquid AI d1-3B sebesar 48.57 dihasilkan oleh Liquid menggunakan scorer resmi, bukan dikirimkan ke papan peringkat publik, dan usianya baru beberapa hari tanpa reproduksi pihak ketiga.
• Vision — baris ini berjalan sebaliknya. Liquid AI d1-3B menerima gambar, dengan vendor melaporkan 74.1 pada sebelas tolok ukur gambar publik yang dibaca sebagai keputusan atas kumpulan opsi tiap tolok ukur, dan melaporkan bahwa menghilangkan gambar membuat pertanyaan yang sama merosot ke 45.1. Qwen 3 8B yang hanya teks memerlukan model visi terpisah di depannya untuk melakukan hal itu.
• Kecepatan — satu pertanyaan dalam 8 ms pada RTX 4090, 16 ms pada Jetson AGX Thor, 50 ms pada Jetson Orin Nano, dan 64 status terkemas per pass pada 475 per detik di 4090. Pengklasifikasi berbasis generasi tidak memiliki angka yang sebanding, karena latensinya bergantung pada panjang jawabannya.
Ringkasan yang jujur adalah bahwa 8B adalah instrumen umum yang lebih baik dan model keputusan 3B adalah instrumen khusus yang lebih baik, dan satu-satunya pertanyaan yang penting adalah seberapa besar trafik Anda yang merupakan kasus khusus.
Aritmetika biaya, dilakukan dengan cermat
Di sinilah perbandingan itu membayar dirinya sendiri atau tidak, jadi layak dilakukan dengan struktur yang nyata alih-alih sekadar slogan.
Klaim yang diterbitkan Liquid dua hari sebelum rilis open-weights adalah bahwa model keputusan yang dihosting menyamai atau mengalahkan GPT-6.1 Sol pada empat dari enam aplikasi nyata, dengan biaya 19x hingga 200x lebih rendah, dan menjawab lebih cepat pada setiap tugas. Baca metodologinya sebelum mengulanginya: setiap aplikasi dijalankan sekali per model pada 5 Oktober 2026, model chat menjawab dalam JSON pada pengaturan penalaran default mereka, dan biaya d1 dihitung pada $0,04 per juta token input. Angka $0,04 itu adalah yang dihosting d1, yaitu tarif input, dan itu satu-satunya tarif yang ada — tidak ada baris output untuk ditambahkan.
Sekarang buat estimasi dengan bentuk yang sama untuk pengklasifikasi Qwen 3 8B, dan asimetrinya terlihat tanpa perlu mengutip harga penyedia mana pun. 8B memiliki dua baris yang dapat ditagih, sedangkan model keputusan hanya punya satu, dan baris kedua itulah yang bertambah besar: klasifikasi yang bernalar terlebih dahulu membayar penalaran itu, dan klasifikasi yang menambahkan padding pada JSON-nya membayar padding tersebut. Biaya input model keputusan ditetapkan oleh state dan pertanyaan-pertanyaan. Biaya input 8B tidak ditetapkan oleh apa pun yang dapat Anda prediksi hanya dari state.
Dua penyeimbang mencegah ini menjadi kekalahan telak. Pertama, model keputusan menagih setiap pertanyaan sebagai prompt tersendiri, sehingga mengajukan lima pertanyaan tentang satu dokumen panjang akan melipatlimakan input — 8B mengajukan kelima pertanyaan dalam satu panggilan dan membayar dokumen itu sekali. Kedua, dan yang lebih besar, model keputusan hanya dapat menjawab pertanyaan yang dilatih secara pascapelatihan untuk dijawab dalam bentuk itu. Apa pun yang membutuhkan penjelasan, ringkasan, atau penilaian yang diungkapkan dengan kata-kata akan mengembalikan Anda ke generalis dan, dalam praktiknya, kembali membayar keduanya.

Apa yang keduanya benar-benar kuasai
Singkirkan benchmarking, dan pemisahannya lebih bersih daripada yang disarankan oleh jumlah parameter.
Liquid AI d1-3B adalah untuk ya/tidak, pilih-dari-daftar, dan penilaian, pada batas latensi yang tidak dapat dicapai oleh apa pun yang generatif, pada perangkat keras yang mencakup Jetson Orin Nano pada 50 ms dan sebuah laptop. Aplikasi yang ditunjukkan Liquid pada Oktober semuanya adalah versi dari bentuk itu — predikat SQL yang menjawab ya atau tidak untuk 150 tiket dukungan, loop pemadatan konteks agen yang mempertahankan, memangkas, atau membuang setiap keluaran alat dan menghilangkan 52% token, aplikasi inspeksi yang memilah bagian baik dan cacat dari empat lini produksi dengan akurasi 85 hingga 97% pada tugas yang belum pernah dilatihinya dan dipahami dari deskripsi singkat. Demo terakhir itu adalah pernyataan paling jelas tentang untuk apa kategori ini: pekerjaan di mana jawabannya adalah salah satu dari beberapa hal, keadaannya adalah gambar, dan tidak ada penjelasan yang pernah diminta.
Qwen 3 8Badalah untuk pekerjaan yang harus kembali sebagai bahasa, atau mencakup 119 bahasa, atau menampung dokumen yang panjangnya melebihi tiga puluh dua ribu token, atau bernalar secara terbuka sebelum mengambil keputusan. Ia juga jawaban yang tepat ketika klasifikasinya bukan salah satu dari tiga bentuk di atas — ketika kumpulan labelnya bersifat terbuka, ketika kriterianya cukup bernuansa sehingga Anda menginginkan penalaran itu, ketika panggilan yang sama harus menangani kasus mudah dan kasus sulit tanpa Anda merutekan di antara dua model. Dan ia adalah pilihan yang aman ketika seorang peninjau bertanya tolok ukur independen apa yang ada, karena jawabannya adalah: banyak, hingga satu setengah tahun ke belakang.
Tim yang melakukannya dengan benar tidak memilih. Mereka menempatkan model keputusan di depan generalis, pada porsi trafik yang jawabannya berupa angka, dan membiarkan 8B menangani segala hal yang membutuhkan kalimat. Filternya 3B dan 8 ms; 8B tetap untuk payload.
Menerapkan pasangan
Liquid AI d1-3B hadir sebagai bobot dengan pekerjaan penerapan yang sudah selesai: dukungan llama.cpp sejak hari pertama, tumpukan NVIDIA lengkap dari DGX hingga Jetson, kuantisasi NVFP4, varian bobot-dan-aktivasi 8-bit, dan konversi GGUF di Hugging Face. Qwen 3 8B memiliki ekosistem self-hosting paling mendalam di antara model mana pun di kelas bobot ini. Keduanya tidak ada di katalog kami, dan tidak ada apa pun di sini yang merupakan klaim ketersediaan untuk salah satunya — jalur terkelola untuk Liquid AI d1-3B adalah API milik vendor itu sendiri dan platform pihak ketiga, tempat d1 yang dihosting dihargai hanya berdasarkan token masukan sebesar $0,04 per juta dengan gambar ditagih 1,5 token per patch 32×32 piksel.
Begitu keduanya berada dalam pipeline yang sama, masalah perutean tidak lagi bersifat teoretis. Anda punya model kecil milik Anda sendiri, model 8B yang mungkin Anda hosting atau sewa, dan panggilan generatif yang pasti Anda sewa — dan menentukan per permintaan model mana yang seharusnya dipakai oleh suatu input adalah persis keputusan yang menjadi alasan lapisan perutean ada. Satu endpoint untuk 200+ model, harga daftar penyedia diteruskan tanpa markup 0% sehingga perubahan harga vendor langsung berlaku di sisi Anda pada hari yang sama, failover otomatis sehingga hari buruk penyedia hulu tidak menjadi gangguan layanan Anda. Ketika lalu lintas klasifikasi Anda diukur dalam miliaran panggilan per tahun, lapisan itulah tempat penghematan dari model keputusan 3B benar-benar terkumpul.
Putusan
Jika 8B Anda diminta menjawab pertanyaan tertutup — apakah ini toksik, apakah ini relevan, ini termasuk antrean yang mana, seberapa mendesak ini — Anda membayar tagihan dua baris milik seorang generalis dan latensi satu generasi hanya untuk sebuah label, dan Liquid AI d1-3B adalah pengganti langsung dengan jejak bukti yang lebih lemah serta perbedaan lisensi nyata yang perlu ditimbang. Terimalah plafon konteks 32K, enam belas bahasa, dan fakta bahwa belum ada pihak di luar Liquid yang memberinya skor.
Jika 8B Anda diminta untuk menjelaskan, merangkum, menerjemahkan, menangani dokumen panjang, atau bernalar sebelum memutuskan, perbandingan ini tidak berlaku bagi Anda. Pertahankan 8B, dan anggap model keputusan hanya sebagai pra-penyaring untuk trafik yang dapat Anda identifikasi sebelumnya sebagai jenis yang mudah.
Angka menarik yang perlu diperhatikan bukanlah skor benchmark model mana pun. Yang menarik adalah seberapa cepat reproduksi independen pertama dari d1 Decision Index muncul, karena itulah momen ketika perbandingan berhenti menjadi klaim vendor dan mulai menjadi fakta yang dapat Anda jadikan dasar perencanaan.

