Kartu judul hero berjudul 'Separuh d1 mana yang Anda butuhkan?' dengan subjudul 'Liquid AI d1-omni-600M vs Liquid AI d1-3B - bobot terbuka, 7 Oktober 2026', dua chip berlabel 'akurasi' dan 'modalitas', serta diagram kaskade di mana kartu kecil berlabel d1-omni-600M memberi masukan ke kartu yang lebih besar berlabel d1-3B sementara panah kedua bercabang ke chip bertuliskan 'cukup yakin - jawab di sini'.
Guides & Insights

Liquid AI d1-omni-600M vs Liquid AI d1-3B: Separuh Mana dari Keluarga d1 yang Sebenarnya Anda Butuhkan?

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Liquid AI d1-omni-600M dan Liquid AI d1-3B diunggah ke Hugging Face dalam selang waktu delapan jam satu sama lain pada 5 Oktober 2026 dan dirilis bersama dalam pengumuman 7 Oktober yang sama, sehingga pertanyaan yang biasa — mana yang lebih baru, mana yang lebih baik — menjadi pertanyaan yang keliru. Keduanya adalah dua ujung dari pertukaran yang disengaja. Liquid AI d1-3B adalah produk yang sudah rampung: 3,12B parameter, nilai 48,57 pada Decision Index 0.2.1 yang dinilai vendor, tabel benchmark, latensi yang diukur hingga ke Jetson Orin Nano, dan posisi yang digambarkan dalam postingan rilis sebagai kualitas keputusan tertinggi pada ukurannya. Liquid AI d1-omni-600M adalah eksperimennya: 587M parameter, nilai 15,95 pada indeks yang sama, input audio yang tidak dimiliki model 3B, dan kartu model yang menyatakan secara terang-terangan bahwa ini adalah rilis penelitian awal tanpa angka inferensi karena masih dalam pengembangan aktif. Memilih di antara keduanya bukanlah keputusan tentang kualitas. Ini adalah keputusan tentang apakah Anda memerlukan modalitas tambahan di bagian bawah keluarga atau akurasi tambahan di bagian atas, dan angka-angkanya justru mendukung pemisahan itu alih-alih mengaburkannya.

Semua yang ada di bawah ini berasal dari dua kartu model dan postingan rilis 7 Oktober, dengan pelabelan dari postingan rilis itu sendiri tetap dihormati: baris-baris d1 pada Decision Index dinilai oleh Liquid AI menggunakan penilai resmi, bukan dikirimkan ke papan peringkat publik, dan tidak ada bagian di sini yang telah direproduksi secara independen.

Dua tulang punggung yang tidak akan pernah bertemu

Keluarga d1 tidak menurunkan skala satu resep pun. Kedua checkpoint itu berawal dari ujung yang berlawanan dalam katalog model Liquid dan bertemu di tengah.

Liquid AI d1-3B dibangun di atas LFM2.5-VL-3B, model bahasa-visi decoder-only milik vendor tersebut dari Agustus 2026. Basisnya dibuat dengan merata-ratakan bobot LFM2.5-2.6B dengan tulang punggung teks LFM2.5-VL-3B, lalu melakukan fine-tuning pada checkpoint dengan berbagai seed acak dan campuran data yang berbeda sebelum menggabungkannya kembali. Model ini membawa encoder visi SigLIP2 NaFlex 400M yang dioptimalkan untuk bentuk, konteks 32.768 token, kosakata 128.000 token, dan enam belas bahasa yang terdokumentasi.

Liquid AI d1-omni-600Mdatang dari arah lain. Trunk-nya adalah LFM2.5-Encoder-350M, sebuah encoder bidireksional, yang di-fine-tune pada tugas-tugas pengambilan keputusan terlebih dahulu lalu diperluas secara bertahap — encoder FastConformer 17 lapis plus adapter untuk audio, dengan encoder audio yang kemudian di-fine-tune terhadap backbone teks yang dibekukan, lalu menara SigLIP2 yang diambil dari LFM2.5-VL-450M dengan adapter dan pembaruan LoRA pada backbone untuk visi. Model akhirnya digabungkan dari pembaruan LoRA dan dirata-ratakan dengan checkpoint sebelumnya. Model ini berakhir pada total 587M parameter: trunk bersama dan head keputusan 381M, encoder visi 94M, dan encoder audio 112M.

Decoder-only versus bidirectional adalah hal yang perlu dipegang. Model 3B membaca suatu state dan menghasilkan keputusan seperti model bahasa menghasilkan urutan token, satu arah pada satu waktu. Model 600M membaca seluruh state sekaligus dan memutuskan, yang merupakan hal yang Anda harapkan dari encoder yang tidak pernah dibuat untuk menghasilkan. Keduanya dilatih untuk melaporkan jawaban berdasarkan distribusi model dengan nol token keluaran, tetapi mesin di baliknya bukan kelas model yang sama, dan selisih akurasi di bawah ini adalah biaya yang terlihat dari desain yang lebih kecil dan berbentuk encoder.

Sebaran Decision Index besar, dan sub-skor lebih menarik daripada totalnya

Pada Decision Index 0.2.1, Liquid melaporkan 48,57 untuk Liquid AI d1-3B dan 15,95 untuk Liquid AI d1-omni-600M, dibandingkan 50,02 untuk Winnow-12B. Itu adalah selisih 32 poin antara dua checkpoint yang dirilis pada hari yang sama oleh lab yang sama, dan membaca lima subskornya menjelaskan dari mana asalnya.

• Pengetahuan — 23,8 untuk Liquid AI d1-3B dibandingkan dengan 8,3 untuk Liquid AI d1-omni-600M

• Bahasa — 56,4 dibanding 12,9

• Pengambilan — 52,8 berbanding 35,0

• Alat — 74,5 dibanding 15,1

• Seni — 36,3 berbanding 6,8

Retrieval adalah satu-satunya area di mana model kecil ini bertahan, hanya kehilangan kurang dari sepertiga skor 3B, sementara pada empat kategori lainnya ia kehilangan 60 hingga 80 persen. Pola itu konsisten dengan apa itu 600M: encoder terlatih dengan kapasitas representasional nyata untuk mencocokkan suatu keadaan dengan konten, dan jauh lebih sedikit kemampuan berlapis yang diwarisi 3B dari decoder yang telah dilatih pada bahasa yang jauh lebih banyak. Jika beban kerja Anda adalah keputusan yang berbentuk retrieval — apakah bagian ini menjawab pertanyaan ini, dokumen mana yang relevan — profil 600M tidak seburuk yang disiratkan totalnya. Jika beban kerja Anda adalah keputusan perutean alat, kesenjangan 51 poin di kolom itu adalah angka yang perlu Anda perhatikan.

Tabel benchmark teks memberikan gambaran yang lebih ringan daripada indeks, yang perlu diketahui sebelum salah satu angka digunakan untuk membangun argumen. Pada tujuh benchmark publik, 3B unggul dengan rata-rata 82,9 dan 600M mencapai 78,4. 600M sebenarnya kalah tipis pada SQuAD 2.0 (74,0 vs 85,3), PubMedQA (61,3 vs 66,0), BoolQ (77,7 vs 86,7), dan XNLI (74,7 vs 85,0), tetapi menang pada deteksi toksisitas Civil Comments (95,8 vs 93,0) dan pada identifikasi parafrase PAWS-X (79,5 vs 76,9). Penyajian Liquid sendiri adalah bahwa 600M mengalahkan rata-rata 77,1 milik Decider 2B dengan seperempat jumlah parameter. Dua rangkaian benchmark, dua putusan yang tampak berbeda, keduanya dilaporkan vendor — itulah yang didukung oleh bukti dan tidak lebih.

A two-column scoreboard for Liquid AI d1-omni-600M and Liquid AI d1-3B showing the 600M at Decision Index 0.2.1 of 15.95, 587M parameters, a text benchmark mean of 78.4, text plus image or audio input, a 16,384-token context and no reported latency, against the 3B at 48.57, 3.12B parameters, a mean of 82.9, text plus image input, a 32,768-token context and 8 ms for one question on an RTX 4090, footed 'All figures vendor-reported by Liquid AI, Oct 7 2026; no independent reproduction.'

Apa yang dimiliki 600M yang tidak dimiliki 3B

Alasan untuk menoleransi kesenjangan indeks 32 poin adalah bahwa Liquid AI d1-omni-600M melakukan satu hal yang tidak dapat dilakukan Liquid AI d1-3B, dan itu bukan perbedaan fidelitas.

• Audio — Liquid AI d1-omni-600M menerima hingga 30 detik ucapan per permintaan melalui encoder FastConformer-nya; Liquid AI d1-3B tidak menerima sama sekali

• Pencampuran modalitas — 600M menerima teks dengan gambar atau teks dengan audio, dan memunculkan ValueError jika keduanya datang bersamaan; 3B menerima teks dan gambar

• Jendela konteks — 16.384 token di seluruh posisi teks, gambar, dan audio untuk 600M, dengan teks dipangkas menjadi 896 token saat gambar ada; 32.768 token untuk 3B

• Kosakata — 65.536 untuk 600M, 128.000 untuk 3B

• Presisi — kartu 600M merekomendasikan float16 pada GPU dan memperingatkan bahwa bfloat16 mengubah jawaban teratas pada beberapa baris; model 3B hadir dengan 15 kuantisasi termasuk build w8a8

• Bahasa — 600M mencantumkan 16 bahasa dalam kumpulan yang berbeda dari 16 milik 3B, dan audionya dijelaskan sebagai dilatih pada pertukaran antara penutur bahasa Inggris dan asisten, yang hanya merupakan sebagian kecil dari apa yang terkandung dalam feed audio produksi

Catatan pelatihan audio mudah terlewat saat dibaca sekilas, dan seharusnya tidak demikian. Model yang dilatih pada pertukaran penutur bahasa Inggris dengan asisten hanya pernah melihat satu geometri penutur, satu struktur giliran bicara, dan satu distribusi aksen. Menerapkannya pada audio pusat panggilan atau rekaman lapangan berarti mengharapkan perilaku yang tidak diklaim oleh kartu model, dan postingan rilisnya berterus terang bahwa tidak ada tolok ukur keputusan audio yang tersedia untuk mengujinya — Liquid menyebutnya "masalah terbuka saat ini" dan mengundang komunitas untuk membangunnya.

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the announcement that d1-3B and d1-omni-600M were released that day, d1-3B's 48.57 Decision Index v0.2.1 score described as ahead of every model under 10B, and its latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Latensi: satu saudara memiliki tabel, yang lain memiliki catatan kaki.

Untuk model keputusan, angka yang menarik adalah latensi end-to-end, karena tidak ada decoding yang perlu diukur waktunya. Liquid menerbitkan set lengkap untuk 3B dan tidak ada sama sekali untuk 600M.

• Satu pertanyaan — 8 ms pada RTX 4090, 9 ms pada MI325X, 16 ms pada Jetson AGX Thor, 26 ms pada Jetson AGX Orin 64 GB, 50 ms pada Orin Nano, 30 ms pada Apple M5 Pro

• Tiga pertanyaan untuk satu state — 21 ms pada RTX 4090 dan 20 ms pada AGX Thor, kira-kira 1,3x biaya satu pertanyaan, bukan 3x

• Status 3,4K token — 102 ms pada 4090, 220 ms pada Thor, 1.640 ms pada Orin Nano

• Throughput terpaket — 475 keputusan per detik pada RTX 4090, 1.106 per detik pada MI325X

• Gambar 384px — 17 ms pada 4090, 18 ms pada MI325X

Angka-angka itu hanya menggambarkan Liquid AI d1-3B. Untuk Liquid AI d1-omni-600M, kartu model menyatakan bahwa angka inferensi tidak dilaporkan karena model tersebut adalah rilis riset awal yang sedang dalam pengembangan aktif. Bukan karena model kecil itu lebih lambat — yang terjadi hampir pasti sebaliknya, karena seperlima parameter tidak menjadi lebih lambat pada presisi yang sama — melainkan karena tidak ada angka yang tersedia, dan mengutip milidetik 3B untuk 600M akan menjadi fabrikasi dengan bentuk yang masuk akal. Yang dapat dikatakan tanpa mengarang apa pun adalah bahwa pada presisi float16 yang direkomendasikan kartu tersebut, 587M parameter berada pada kisaran 1,2 GB bobot sebelum aktivasi, yang merupakan aritmetika atas jumlah parameter yang dipublikasikan, bukan pengukuran.

Kaskade adalah jawaban yang sesungguhnya untuk sebagian besar beban kerja.

Karena kedua checkpoint dirilis bersamaan dan mengembalikan jenis objek yang sama — sebuah probabilitas, label dengan keyakinan, atau skor terurut — keduanya dapat dikomposisikan dengan cara yang tidak dapat dilakukan dua model sembarangan. 600M dapat menyaring dan 3B dapat mengadili. Beri skor item yang masuk dengan Liquid AI d1-omni-600M, lalu eskalasikan item yang ditempatkannya di dekat bagian tengah skalanya ke Liquid AI d1-3B untuk keputusan yang lebih tajam. Aturan eskalasinya adalah keyakinan dan distribusi yang sudah dikembalikan oleh 600M, sehingga logika perutean tidak memerlukan model tambahan. Pada beban kerja dengan mayoritas besar berupa item yang mudah, sebagian besar lalu lintas tidak pernah mencapai 3B dan sebagian besar uang tidak pernah dibelanjakan.

Pola itu juga menjadi alasan kedua model ini layak dijalankan di balik router. Melalui OrcaRouter, keduanya akan berada di balik satu kunci API dengan harga daftar masing-masing penyedia diteruskan tanpa markup 0%, sehingga kaskadenya menjadi aturan perutean alih-alih integrasi kedua, dan eskalasi yang gagal di lapisan penyedia akan dicoba ulang pada fallback alih-alih menggagalkan permintaan. Failover otomatis lebih penting di sini daripada pada model yang sudah mapan, karena separuh dari pasangan ini adalah checkpoint yang perilakunya digambarkan oleh vendor sendiri sebagai masih dalam pengembangan aktif.

Tidak satu pun dari itu merupakan klaim ketersediaan, dan perbedaan ini perlu dinyatakan secara gamblang: checkpoint d1 terbuka tidak ada dalam katalog kami. Cara vendor adalah mengunduh bobotnya dan menjalankannya secara lokal — dukungan llama.cpp hadir sejak hari pertama di perangkat keras Apple, AMD, Qualcomm, dan NVIDIA — atau mengaksesnya melalui API milik vendor sendiri dan platform pihak ketiga.

Memilih, dalam satu kali

Jika Anda membutuhkan teks dan gambar, dan jawabannya harus benar, pilih Liquid AI d1-3B. Model ini memiliki tolok ukur, tabel latensi, konteks yang lebih luas, kosakata yang lebih besar, dan kuantisasi, dan ini adalah anggota dari pasangan yang diposisikan Liquid sebagai pemimpin kualitas pada ukurannya.

Jika Anda memerlukan ucapan dalam jalur keputusan, ambil Liquid AI d1-omni-600M, karena ini adalah satu-satunya opsi open-weight di keluarga ini yang menerima audio sama sekali, dan terimalah bahwa Anda mengadopsinya berdasarkan firasat dan sebuah demo sampai seseorang menerbitkan tolok ukur keputusan audio atau split visi yang ditahan.

Jika Anda belum tahu mana dari semua itu yang menggambarkan beban kerja Anda, mulailah dengan 3B dan instrumentasikan tingkat keyakinan yang dikembalikannya. Sub-skor adalah petunjuknya: tugas yang berada di kolom Tools atau Language akan dilayani dengan buruk oleh 600M, sedangkan sesuatu yang berbentuk retrieval adalah satu-satunya tempat checkpoint kecil lebih dekat daripada yang disiratkan oleh totalnya. Keluarga ini ada supaya Anda dapat menukar akurasi dengan jejak, dan pertukaran itu hanya aman jika Anda tahu kolom mana yang ditempati tugas Anda.

A capture of the Hugging Face model card for LiquidAI/d1-omni-600M showing 76 likes, the image-text-to-text, Transformers and Safetensors tags, the 'd1_omni', 'system-one', 'multimodal', 'vision', 'audio' and 'decision-model' tags, and the opening description of a 600M parameter decision model that takes a state of text or JSON with images or a voice clip and returns typed answers with zero output tokens.

Melalui OrcaRouter, kedua model berada di balik satu kunci API pada aturan perutean, bukan integrasi kedua, dan eskalasi yang gagal di lapisan penyedia akan dicoba ulang pada fallback alih-alih menggagalkan permintaan.