Kartu judul hero untuk model keputusan berbobot terbuka milik Liquid AI, berjudul 'Dua model yang tidak pernah menulis sepatah kata pun' dengan subjudul 'Liquid AI d1-3B dan d1-omni-600M, bobot terbuka, 7 Oktober 2026', tiga chip berlabel ya/tidak, pilih label dan nilai skala, serta diagram satu state yang masuk ke satu forward pass tunggal yang mengembalikan probabilitas, sebuah label, dan sebuah skor.
Guides & Insights

Liquid AI d1-3B dan d1-omni-600M: Bobot Terbuka untuk Model yang Tidak Pernah Menulis Sepatah Kata

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Liquid AI d1-3B dan Liquid AI d1-omni-600M dirilis di Hugging Face pada 7 Oktober 2026, dan kedua checkpoint tersebut memiliki properti yang membuat setiap tabel perbandingan yang Anda baca tahun ini menjadi keliru bentuknya. Tidak satu pun dari keduanya menghasilkan teks. Anda memberikan kepada Liquid AI d1-3B sebuah state — tiket dukungan, payload JSON, sebuah foto, atau ketiganya sekaligus — beserta serangkaian pertanyaan bernama, dan model itu mengembalikan jawaban yang dipetik langsung dari distribusi model atas opsi-opsi Anda. Ya/tidak sebagai sebuah probabilitas. Pilihan di antara label-label dengan tingkat keyakinan dan vektor probabilitas yang lengkap. Posisi pada skala terurut. Tidak ada langkah sampling, tidak ada JSON yang perlu diurai, tidak ada generasi yang lepas kendali, dan penghitung penggunaan milik vendor sendiri melaporkannya dengan gamblang: output_tokens: 0. Model 3B adalah sorotan utamanya — ia mencatatkan 48,57 pada Decision Index 0.2.1 yang dinilai vendor, di depan semua model di bawah 10B dan di depan model keputusan yang dua belas kali ukurannya. Saudaranya yang 600M justru yang layak diperhatikan: ia membaca gambar dan hingga tiga puluh detik ucapan melalui bobot trunk yang sama, dan dilabeli sebagai rilis penelitian awal.

Apa itu model keputusan, dalam satu paragraf

Kategori ini telah terbentuk selama setahun dengan nama seperti model sistem-satu dan pengklasifikasi-yang-bukan-pengklasifikasi, dan pasangan d1 adalah pernyataan paling jelas tentangnya sejauh ini. Model generatif diberi pertanyaan dan menulis jawaban; jawabannya harus diurai, penguraiannya bisa gagal, dan setiap token yang ditulisnya memakan biaya dan waktu Anda. Model keputusan diberi pertanyaan dan melaporkan apa yang sudah diyakininya. Pertanyaan Liquid hadir dalam tiga jenis. noul adalah pertanyaan ya/tidak, dijawab dengan P(ya) antara 0 dan 1. choice memilih satu label dari himpunan bernama dan mengembalikan label, keyakinan, dan probabilitas setiap opsi. score menempatkan keadaan pada skala terurut dua hingga sepuluh tingkat dan mengembalikan tingkat yang diharapkan beserta distribusi dan legendanya. Satu keadaan dapat membawa beberapa pertanyaan sekaligus, dan keadaan serta citranya dibaca sekali untuk semuanya.

Properti terakhir itulah keseluruhan kasus bisnisnya. Tiga pertanyaan tentang satu tiket memakan waktu 1,3x waktu satu pertanyaan, bukan 3x, karena model melakukan satu forward pass atas input dan membaca beberapa jawaban darinya. Tidak ada yang perlu ditulis, jadi tidak ada yang bisa ditulis dengan buruk.

3B dan 600M dibangun dari arah yang berlawanan.

Di sinilah rilis ini menjadi menarik secara teknis, dan inilah bagian yang sebagian besar dilewatkan oleh liputan peluncuran. Kedua model tersebut tidak berasal dari garis keturunan yang sama.

Liquid AI d1-3B berasal dari LFM2.5-VL-3B, model visi-bahasa decoder-only milik vendor. Model ini membawa 3,12B parameter, encoder visi 400M SigLIP2 NaFlex yang dioptimalkan untuk bentuk, jendela konteks 32.768 token, kosakata 128.000 token, dan enam belas bahasa yang didokumentasikan. Untuk membangunnya, Liquid merata-ratakan bobot LFM2.5-2.6B dan backbone teks LFM2.5-VL-3B, menyetel halus checkpoint dari beberapa seed acak dan campuran data, lalu menggabungkan hasilnya lagi. Ringkasan vendor sendiri tentang apa yang penting terasa menyegarkan karena tidak glamor: pelatihan pada input panjang, mengacak urutan opsi jawaban, dan memburu jalan pintas dalam data pelatihan lebih berpengaruh pada angka akhir daripada teknik canggih apa pun.

Liquid AI d1-omni-600M merupakan turunan dari LFM2.5-Encoder-350M, sebuah encoder bidirectional — spesies jaringan yang sepenuhnya berbeda. Totalnya 587M parameter yang terbagi menjadi trunk bersama dan decision head 381M, encoder visi 94M yang dipinjam dari LFM2.5-VL-450M, dan encoder audio 112M yang dibangun dari FastConformer 17 lapis. Setiap modalitas melewati bobot trunk yang sama. Konteksnya 16.384 token yang mencakup posisi teks, gambar, dan audio secara bersamaan, dan saat gambar dilampirkan, teks state dan pertanyaan dipotong menjadi 896 token karena itulah yang digunakan saat pelatihan. Audio mendapat satu peringatan yang dinyatakan kartu tanpa basa-basi: kemampuan ini dilatih pada permintaan antara penutur bahasa Inggris dan asisten, dan klip dipotong pada tiga puluh detik.

Jadi keluarga ini bukan satu model dalam dua ukuran. Ini adalah dekoder dan enkoder, yang dilatih lanjut untuk melakukan pekerjaan yang sama dengan dua mekanisme yang sepenuhnya berbeda, yang satu melihat dan yang satu mendengar.

A two-column scoreboard for Liquid AI d1-3B and d1-omni-600M showing d1-3B at Decision Index 48.57 with 3.12B parameters, text and image input and 8 ms per question on an RTX 4090, against d1-omni-600M at 15.95 with 587M parameters, text, image and audio input and no reported latency, footed 'All figures vendor-reported by Liquid AI, Oct 7 2026; no independent reproduction.'

Angka-angkanya, dan milik siapa angka itu

Setiap angka di bagian ini berasal dari Liquid sendiri. Baris Decision Index untuk model d1 dinilai oleh vendor menggunakan scorer resmi — bukan dikirimkan ke papan peringkat — sementara setiap baris pesaing berasal dari papan peringkat publik pada v0.2.1. Belum ada laboratorium independen yang mereproduksi hasilnya, dan model-model ini baru berusia dua hari saat tulisan ini dibuat.

• Decision Index 0.2.1 — Liquid AI d1-3B mencetak skor 48,57 dengan sub-skor Pengetahuan 23,8, Bahasa 56,4, Pengambilan 52,8, Alat 74,5 dan Seni 36,3. Liquid AI d1-omni-600M mencetak skor 15,95, dengan Alat pada 15,1.

• Posisi 48.57 — peringkat pertama di antara semua yang di bawah 10B dalam tabel yang diterbitkan vendor, dan mengungguli Decider 35B-A3B pada 47.11. Secara keseluruhan, ini berada di peringkat kedua, di belakang Winnow-12B pada 50.02, yang ukurannya empat kali lebih besar.

• Benchmark teks, dilaporkan vendor — d1-3B rata-rata 82,9 di tujuh benchmark publik, unggul dari 81,1 milik Decider 4B; d1-omni-600M rata-rata 78,4, yang mengalahkan 77,1 milik Decider 2B dengan jumlah parameter sekitar seperempatnya. Model 600M mencatat skor toksisitas terbaik di tabel (Civil Comments 95,8) dan skor parafrase terbaiknya (PAWS-X 79,5).

• Visi, dilaporkan vendor — d1-3B rata-rata 74,1 pada sebelas tolok ukur citra publik yang dibaca sebagai keputusan atas opsi tiap tolok ukur, dibandingkan dengan 73,9 untuk tulang punggung LFM2.5-VL-3B-nya. Menghapus gambar menurunkan pertanyaan yang sama menjadi 45,1, yang merupakan cara vendor menunjukkan bahwa jawabannya berasal dari piksel.

• Latensi, diukur oleh vendor — satu pertanyaan memerlukan 8 ms pada RTX 4090 dan 9 ms pada AMD MI325X; 16 ms pada Jetson AGX Thor, 26 ms pada Jetson AGX Orin 64 GB, 50 ms pada Jetson Orin Nano terkecil, dan 30 ms pada Apple M5 Pro. Enam puluh empat state yang dipadatkan ke dalam satu lintasan berjalan pada 475 per detik di 4090.

• Apa yang belum ada — d1-omni-600M sama sekali tidak memiliki tabel inferensi. Liquid mengatakan bahwa model ini sedang dalam pengembangan aktif dan tidak melaporkan latensi untuknya. Tidak ada tolok ukur keputusan audio di mana pun dalam rilis ini, karena, menurut pihak vendor, tolok ukur keputusan audio khusus saat ini masih menjadi masalah terbuka.

Klaim yang sebenarnya dibuat oleh rilis tersebut

Dua hari sebelum bobotnya dirilis, Liquid menerbitkan versi hosted dari model ini dan mengujinya melawan GPT-6.1 Sol serta Claude Opus 5.5 pada enam aplikasi. Ringkasannya: d1 menyamai atau mengalahkan GPT-6.1 Sol pada empat dari enam, berbiaya 19x hingga 200x lebih murah, dan menjawab lebih cepat pada setiap tugas. Metodologi yang diterbitkan layak dibaca sebelum mengulangi semua itu — setiap aplikasi dijalankan sekali per model pada 5 Oktober 2026, model chat menjawab dalam JSON pada pengaturan penalaran bawaannya, dan biaya d1 dihitung pada $0,04 per juta token masukan.

Demo-demo adalah bagian yang lebih persuasif. Menyortir bagian yang baik dan cacat dari empat lini produksi — papan sirkuit, lilin, kacang mete, permen karet — dengan akurasi 85 hingga 97%, pada model yang tidak pernah dilatih untuk tugas tersebut dan memahaminya dari deskripsi singkat. Predikat SQL yang menjawab ya atau tidak untuk masing-masing dari 150 tiket dukungan. Sebuah loop pemadatan konteks yang membaca setiap output alat dalam sesi agen pengkodean dan menyimpan, memangkas, atau membuangnya, menghilangkan 52% token sambil mempertahankan setiap output yang dibutuhkan tugas. Dalam Tetris, menambahkan layar ke game yang sepenuhnya dapat dijelaskan dengan teks meningkatkan skor dari 70 baris yang dibersihkan menjadi 81 — hasil visi yang tidak dapat Anda peroleh dari pengklasifikasi hanya teks, tidak peduli seberapa bagusnya.

Itu adalah demonstrasi yang dijalankan vendor dengan tugas yang dipilih vendor, dan bagian metodologi menyatakan demikian. Itu tetap gambaran paling jelas yang pernah dipublikasikan siapa pun tentang untuk apa sebuah model keputusan itu.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as open-weight models, d1-3B's Decision Index score of 48.57, and its latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Di mana ia berjalan, dan berapa biaya untuk memanggilnya

Bobot terbuka dibuat untuk eksekusi lokal dan vendor melakukan pekerjaan integrasi di muka: dukungan sejak hari pertama untuk llama.cpp, tumpukan NVIDIA lengkap dari DGX hingga Jetson, kuantisasi NVFP4, dan varian bobot/aktivasi 8-bit yang diterbitkan bersama checkpoint dasar. Konversi GGUF sudah tersedia di Hugging Face. Jika Anda lebih memilih untuk tidak menghosting apa pun, Liquid menyediakan d1 yang dihosting dari API-nya sendiri — hanya token masukan, tanpa token keluaran, dengan gambar ditagih sebagai masukan pada 1,5 token per patch 32×32 piksel, yang membuat gambar 1024×1024 menjadi 1.536 token. Akses khusus teks juga tersedia melalui platform pihak ketiga.

Catatan routing yang jujur: baik Liquid AI d1-3B maupun Liquid AI d1-omni-600M tidak ada di katalog kami, dan artikel ini bukan klaim ketersediaan untuk salah satu dari keduanya. Yang diubah oleh pasangan d1 bagi sebuah router adalah bentuk pipeline di sekitarnya. Model keputusan yang menjawab dalam milidetik dan tidak memakan biaya token output adalah filter, bukan pengganti — penyortiran barang bagus dan cacat serta triase tiket terjadi di depan panggilan generatif, dan panggilan generatif adalah tempat di mana satu endpoint di lebih dari 200 model, harga daftar yang diteruskan dengan markup 0%, dan failover otomatis benar-benar membuktikan nilainya. Lapisan berbeda, pipeline yang sama.

Apa yang akan menyelesaikan argumen itu

Tiga hal belum terselesaikan, dan ketiganya adalah hal-hal yang hanya bisa ditutup oleh waktu.

Yang pertama adalah reproduksi independen. Angka Decision Index dihasilkan oleh vendor dengan scorer resmi dan setiap baris pesaing diambil dari papan peringkat publik, yang merupakan metode yang dapat dipertanggungjawabkan dan bukan hal yang sama dengan pihak ketiga yang menjalankan model Anda. Yang kedua adalah audio. Checkpoint 600M yang merutekan perintah suara dalam satu forward pass adalah kemampuan yang benar-benar baru, dan belum ada benchmark yang mengukur apakah ia melakukannya dengan baik. Yang ketiga adalah kategorinya sendiri: ketika jawaban dibaca langsung dari distribusi alih-alih dituliskan, mode kegagalan yang biasa dari model kecil — mengulang-ulang, menyimpang, menolak, menghalusinasi format — tidak mungkin terjadi, dan belum ada yang menerbitkan penjelasan yang baik tentang apa yang menggantikannya. Kesalahan kalibrasi adalah kandidat yang jelas, dan itulah tepatnya yang field keyakinan pada setiap jawaban mengundang Anda untuk mengukur sendiri.

Sepuluh demo menjalankan Liquid AI d1-3B dalam loop pada input kamera langsung di Hugging Face space publik, yang merupakan cara termurah untuk membentuk pendapat Anda sendiri. Bobotnya gratis dan pertanyaannya spesifik. Itu posisi awal yang lebih baik daripada yang ditawarkan sebagian besar rilis tahun ini.

A capture of Liquid AI's documentation page for its decision models, showing the left-hand navigation including Decision Models and Liquid Nanos, the 'Open d1' banner announcing that visitors can now run d1-3B and d1-omni-600M locally, and the page's opening description of purpose-built models for structured decisions such as classification, routing and scoring in a single call with zero generation.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari