
Liquid AI d1-3B dan d1-omni-600M: Bobot Terbuka untuk Model yang Tidak Pernah Menulis Sepatah Kata
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Liquid AI d1-3B dan Liquid AI d1-omni-600M dirilis di Hugging Face pada 7 Oktober 2026, dan kedua checkpoint tersebut memiliki properti yang membuat setiap tabel perbandingan yang Anda baca tahun ini menjadi keliru bentuknya. Tidak satu pun dari keduanya menghasilkan teks. Anda memberikan kepada Liquid AI d1-3B sebuah state — tiket dukungan, payload JSON, sebuah foto, atau ketiganya sekaligus — beserta serangkaian pertanyaan bernama, dan model itu mengembalikan jawaban yang dipetik langsung dari distribusi model atas opsi-opsi Anda. Ya/tidak sebagai sebuah probabilitas. Pilihan di antara label-label dengan tingkat keyakinan dan vektor probabilitas yang lengkap. Posisi pada skala terurut. Tidak ada langkah sampling, tidak ada JSON yang perlu diurai, tidak ada generasi yang lepas kendali, dan penghitung penggunaan milik vendor sendiri melaporkannya dengan gamblang: output_tokens: 0. Model 3B adalah sorotan utamanya — ia mencatatkan 48,57 pada Decision Index 0.2.1 yang dinilai vendor, di depan semua model di bawah 10B dan di depan model keputusan yang dua belas kali ukurannya. Saudaranya yang 600M justru yang layak diperhatikan: ia membaca gambar dan hingga tiga puluh detik ucapan melalui bobot trunk yang sama, dan dilabeli sebagai rilis penelitian awal.
Apa itu model keputusan, dalam satu paragraf
Kategori ini telah terbentuk selama setahun dengan nama seperti model sistem-satu dan pengklasifikasi-yang-bukan-pengklasifikasi, dan pasangan d1 adalah pernyataan paling jelas tentangnya sejauh ini. Model generatif diberi pertanyaan dan menulis jawaban; jawabannya harus diurai, penguraiannya bisa gagal, dan setiap token yang ditulisnya memakan biaya dan waktu Anda. Model keputusan diberi pertanyaan dan melaporkan apa yang sudah diyakininya. Pertanyaan Liquid hadir dalam tiga jenis. noul adalah pertanyaan ya/tidak, dijawab dengan P(ya) antara 0 dan 1. choice memilih satu label dari himpunan bernama dan mengembalikan label, keyakinan, dan probabilitas setiap opsi. score menempatkan keadaan pada skala terurut dua hingga sepuluh tingkat dan mengembalikan tingkat yang diharapkan beserta distribusi dan legendanya. Satu keadaan dapat membawa beberapa pertanyaan sekaligus, dan keadaan serta citranya dibaca sekali untuk semuanya.
Properti terakhir itulah keseluruhan kasus bisnisnya. Tiga pertanyaan tentang satu tiket memakan waktu 1,3x waktu satu pertanyaan, bukan 3x, karena model melakukan satu forward pass atas input dan membaca beberapa jawaban darinya. Tidak ada yang perlu ditulis, jadi tidak ada yang bisa ditulis dengan buruk.
3B dan 600M dibangun dari arah yang berlawanan.
Di sinilah rilis ini menjadi menarik secara teknis, dan inilah bagian yang sebagian besar dilewatkan oleh liputan peluncuran. Kedua model tersebut tidak berasal dari garis keturunan yang sama.
Liquid AI d1-3B berasal dari LFM2.5-VL-3B, model visi-bahasa decoder-only milik vendor. Model ini membawa 3,12B parameter, encoder visi 400M SigLIP2 NaFlex yang dioptimalkan untuk bentuk, jendela konteks 32.768 token, kosakata 128.000 token, dan enam belas bahasa yang didokumentasikan. Untuk membangunnya, Liquid merata-ratakan bobot LFM2.5-2.6B dan backbone teks LFM2.5-VL-3B, menyetel halus checkpoint dari beberapa seed acak dan campuran data, lalu menggabungkan hasilnya lagi. Ringkasan vendor sendiri tentang apa yang penting terasa menyegarkan karena tidak glamor: pelatihan pada input panjang, mengacak urutan opsi jawaban, dan memburu jalan pintas dalam data pelatihan lebih berpengaruh pada angka akhir daripada teknik canggih apa pun.
Liquid AI d1-omni-600M merupakan turunan dari LFM2.5-Encoder-350M, sebuah encoder bidirectional — spesies jaringan yang sepenuhnya berbeda. Totalnya 587M parameter yang terbagi menjadi trunk bersama dan decision head 381M, encoder visi 94M yang dipinjam dari LFM2.5-VL-450M, dan encoder audio 112M yang dibangun dari FastConformer 17 lapis. Setiap modalitas melewati bobot trunk yang sama. Konteksnya 16.384 token yang mencakup posisi teks, gambar, dan audio secara bersamaan, dan saat gambar dilampirkan, teks state dan pertanyaan dipotong menjadi 896 token karena itulah yang digunakan saat pelatihan. Audio mendapat satu peringatan yang dinyatakan kartu tanpa basa-basi: kemampuan ini dilatih pada permintaan antara penutur bahasa Inggris dan asisten, dan klip dipotong pada tiga puluh detik.
Jadi keluarga ini bukan satu model dalam dua ukuran. Ini adalah dekoder dan enkoder, yang dilatih lanjut untuk melakukan pekerjaan yang sama dengan dua mekanisme yang sepenuhnya berbeda, yang satu melihat dan yang satu mendengar.

Angka-angkanya, dan milik siapa angka itu
Setiap angka di bagian ini berasal dari Liquid sendiri. Baris Decision Index untuk model d1 dinilai oleh vendor menggunakan scorer resmi — bukan dikirimkan ke papan peringkat — sementara setiap baris pesaing berasal dari papan peringkat publik pada v0.2.1. Belum ada laboratorium independen yang mereproduksi hasilnya, dan model-model ini baru berusia dua hari saat tulisan ini dibuat.
• Decision Index 0.2.1 — Liquid AI d1-3B mencetak skor 48,57 dengan sub-skor Pengetahuan 23,8, Bahasa 56,4, Pengambilan 52,8, Alat 74,5 dan Seni 36,3. Liquid AI d1-omni-600M mencetak skor 15,95, dengan Alat pada 15,1.
• Posisi 48.57 — peringkat pertama di antara semua yang di bawah 10B dalam tabel yang diterbitkan vendor, dan mengungguli Decider 35B-A3B pada 47.11. Secara keseluruhan, ini berada di peringkat kedua, di belakang Winnow-12B pada 50.02, yang ukurannya empat kali lebih besar.
• Benchmark teks, dilaporkan vendor — d1-3B rata-rata 82,9 di tujuh benchmark publik, unggul dari 81,1 milik Decider 4B; d1-omni-600M rata-rata 78,4, yang mengalahkan 77,1 milik Decider 2B dengan jumlah parameter sekitar seperempatnya. Model 600M mencatat skor toksisitas terbaik di tabel (Civil Comments 95,8) dan skor parafrase terbaiknya (PAWS-X 79,5).
• Visi, dilaporkan vendor — d1-3B rata-rata 74,1 pada sebelas tolok ukur citra publik yang dibaca sebagai keputusan atas opsi tiap tolok ukur, dibandingkan dengan 73,9 untuk tulang punggung LFM2.5-VL-3B-nya. Menghapus gambar menurunkan pertanyaan yang sama menjadi 45,1, yang merupakan cara vendor menunjukkan bahwa jawabannya berasal dari piksel.
• Latensi, diukur oleh vendor — satu pertanyaan memerlukan 8 ms pada RTX 4090 dan 9 ms pada AMD MI325X; 16 ms pada Jetson AGX Thor, 26 ms pada Jetson AGX Orin 64 GB, 50 ms pada Jetson Orin Nano terkecil, dan 30 ms pada Apple M5 Pro. Enam puluh empat state yang dipadatkan ke dalam satu lintasan berjalan pada 475 per detik di 4090.
• Apa yang belum ada — d1-omni-600M sama sekali tidak memiliki tabel inferensi. Liquid mengatakan bahwa model ini sedang dalam pengembangan aktif dan tidak melaporkan latensi untuknya. Tidak ada tolok ukur keputusan audio di mana pun dalam rilis ini, karena, menurut pihak vendor, tolok ukur keputusan audio khusus saat ini masih menjadi masalah terbuka.
Klaim yang sebenarnya dibuat oleh rilis tersebut
Dua hari sebelum bobotnya dirilis, Liquid menerbitkan versi hosted dari model ini dan mengujinya melawan GPT-6.1 Sol serta Claude Opus 5.5 pada enam aplikasi. Ringkasannya: d1 menyamai atau mengalahkan GPT-6.1 Sol pada empat dari enam, berbiaya 19x hingga 200x lebih murah, dan menjawab lebih cepat pada setiap tugas. Metodologi yang diterbitkan layak dibaca sebelum mengulangi semua itu — setiap aplikasi dijalankan sekali per model pada 5 Oktober 2026, model chat menjawab dalam JSON pada pengaturan penalaran bawaannya, dan biaya d1 dihitung pada $0,04 per juta token masukan.
Demo-demo adalah bagian yang lebih persuasif. Menyortir bagian yang baik dan cacat dari empat lini produksi — papan sirkuit, lilin, kacang mete, permen karet — dengan akurasi 85 hingga 97%, pada model yang tidak pernah dilatih untuk tugas tersebut dan memahaminya dari deskripsi singkat. Predikat SQL yang menjawab ya atau tidak untuk masing-masing dari 150 tiket dukungan. Sebuah loop pemadatan konteks yang membaca setiap output alat dalam sesi agen pengkodean dan menyimpan, memangkas, atau membuangnya, menghilangkan 52% token sambil mempertahankan setiap output yang dibutuhkan tugas. Dalam Tetris, menambahkan layar ke game yang sepenuhnya dapat dijelaskan dengan teks meningkatkan skor dari 70 baris yang dibersihkan menjadi 81 — hasil visi yang tidak dapat Anda peroleh dari pengklasifikasi hanya teks, tidak peduli seberapa bagusnya.
Itu adalah demonstrasi yang dijalankan vendor dengan tugas yang dipilih vendor, dan bagian metodologi menyatakan demikian. Itu tetap gambaran paling jelas yang pernah dipublikasikan siapa pun tentang untuk apa sebuah model keputusan itu.

Di mana ia berjalan, dan berapa biaya untuk memanggilnya
Bobot terbuka dibuat untuk eksekusi lokal dan vendor melakukan pekerjaan integrasi di muka: dukungan sejak hari pertama untuk llama.cpp, tumpukan NVIDIA lengkap dari DGX hingga Jetson, kuantisasi NVFP4, dan varian bobot/aktivasi 8-bit yang diterbitkan bersama checkpoint dasar. Konversi GGUF sudah tersedia di Hugging Face. Jika Anda lebih memilih untuk tidak menghosting apa pun, Liquid menyediakan d1 yang dihosting dari API-nya sendiri — hanya token masukan, tanpa token keluaran, dengan gambar ditagih sebagai masukan pada 1,5 token per patch 32×32 piksel, yang membuat gambar 1024×1024 menjadi 1.536 token. Akses khusus teks juga tersedia melalui platform pihak ketiga.
Catatan routing yang jujur: baik Liquid AI d1-3B maupun Liquid AI d1-omni-600M tidak ada di katalog kami, dan artikel ini bukan klaim ketersediaan untuk salah satu dari keduanya. Yang diubah oleh pasangan d1 bagi sebuah router adalah bentuk pipeline di sekitarnya. Model keputusan yang menjawab dalam milidetik dan tidak memakan biaya token output adalah filter, bukan pengganti — penyortiran barang bagus dan cacat serta triase tiket terjadi di depan panggilan generatif, dan panggilan generatif adalah tempat di mana satu endpoint di lebih dari 200 model, harga daftar yang diteruskan dengan markup 0%, dan failover otomatis benar-benar membuktikan nilainya. Lapisan berbeda, pipeline yang sama.
Apa yang akan menyelesaikan argumen itu
Tiga hal belum terselesaikan, dan ketiganya adalah hal-hal yang hanya bisa ditutup oleh waktu.
Yang pertama adalah reproduksi independen. Angka Decision Index dihasilkan oleh vendor dengan scorer resmi dan setiap baris pesaing diambil dari papan peringkat publik, yang merupakan metode yang dapat dipertanggungjawabkan dan bukan hal yang sama dengan pihak ketiga yang menjalankan model Anda. Yang kedua adalah audio. Checkpoint 600M yang merutekan perintah suara dalam satu forward pass adalah kemampuan yang benar-benar baru, dan belum ada benchmark yang mengukur apakah ia melakukannya dengan baik. Yang ketiga adalah kategorinya sendiri: ketika jawaban dibaca langsung dari distribusi alih-alih dituliskan, mode kegagalan yang biasa dari model kecil — mengulang-ulang, menyimpang, menolak, menghalusinasi format — tidak mungkin terjadi, dan belum ada yang menerbitkan penjelasan yang baik tentang apa yang menggantikannya. Kesalahan kalibrasi adalah kandidat yang jelas, dan itulah tepatnya yang field keyakinan pada setiap jawaban mengundang Anda untuk mengukur sendiri.
Sepuluh demo menjalankan Liquid AI d1-3B dalam loop pada input kamera langsung di Hugging Face space publik, yang merupakan cara termurah untuk membentuk pendapat Anda sendiri. Bobotnya gratis dan pertanyaannya spesifik. Itu posisi awal yang lebih baik daripada yang ditawarkan sebagian besar rilis tahun ini.

Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
