
Liquid AI d1-omni-600M vs LFM2.5-VL-3B: Satu Memutuskan, Satu Mendeskripsikan
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Liquid AI d1-omni-600M dan LFM2.5-VL-3B keduanya kecil, keduanya multimodal, keduanya diterbitkan oleh lab yang sama di Hugging Face di bawah lisensi lfm1.0 yang sama — dan memasangkannya adalah kekeliruan kategori yang ternyata berguna. LFM2.5-VL-3B hadir pada 12 Agustus 2026 sebagai model visi-bahasa edge milik Liquid AI: parameter 3,1B, jendela 32.768 token, dan keluaran berupa prosa. Beri ia halaman hasil pindai dan ia mengembalikan transkripsi, beserta tata letaknya, sebagai teks. Liquid AI d1-omni-600M diunggah pada 7 Oktober 2026 bersama keluarga d1 terbuka lainnya, dan ia melakukan hal yang berlawanan dengan input yang sama. Ia adalah model keputusan berparameter 587M: Anda melampirkan pertanyaan bernama ke suatu state dan ia melaporkan apa yang sudah ia yakini — P(ya), label terpilih dengan tingkat keyakinan, posisi pada skala terurut dua hingga sepuluh — dalam satu forward pass, dengan nol token keluaran dan tidak ada apa pun di hilir yang perlu diurai. Jika Anda mencari "model Liquid multimodal kecil," ada dua bentuk di depan Anda sekarang, dan bentuknya adalah keputusan.
Halaman ini adalah apa yang sebenarnya ditetapkan oleh dua kartu model, postingan rilis 7 Oktober, dan repositori itu sendiri. Halaman ini juga secara eksplisit menjelaskan sampai di mana batasnya. Tidak ada apa pun dalam perbandingan ini yang telah direproduksi di luar Liquid AI, dan untuk salah satu dari dua model tersebut, vendor sama sekali tidak menerbitkan tolok ukur akurasi yang spesifik untuk kemampuan utamanya sendiri.
Dua pos pemeriksaan, berdampingan
Lembar spesifikasi keduanya berbeda di hampir setiap aspek, yang memang wajar untuk dua model yang tidak pernah dimaksudkan untuk bersaing di segmen yang sama.
• Apa itu — LFM2.5-VL-3B adalah model visi-bahasa generatif yang menulis teks; Liquid AI d1-omni-600M adalah model keputusan yang mengembalikan jawaban terstruktur dan tidak mengeluarkan token
• Parameter — 3,1B dalam BF16 untuk LFM2.5-VL-3B versus 587M untuk Liquid AI d1-omni-600M, yang itu sendiri terdiri dari trunk bersama dan decision head berukuran 381M plus encoder visi berukuran 94M dan encoder audio berukuran 112M
• Backbone — LFM2.5-VL-3B memasangkan model bahasa LFM2.5-2.6B dengan encoder visi 400M SigLIP2 NaFlex yang dioptimalkan bentuknya; Liquid AI d1-omni-600M dilatih dari LFM2.5-Encoder-350M, sebuah encoder dua arah, dengan tower SigLIP2 yang diambil dari LFM2.5-VL-450M dan FastConformer 17-lapisan untuk audio
• Masukan — teks dan gambar untuk LFM2.5-VL-3B; teks plus gambar atau teks plus hingga 30 detik ucapan untuk Liquid AI d1-omni-600M, yang memunculkan ValueError jika gambar dan audio tiba dalam permintaan yang sama
• Konteks — 32.768 token untuk LFM2.5-VL-3B versus 16.384 posisi gabungan teks, gambar, dan audio untuk Liquid AI d1-omni-600M, yang kartunya menambahkan bahwa saat ada gambar, teks state dan pertanyaan dipangkas menjadi 896 token agar sesuai dengan pelatihan
• Kosakata — 128.000 token untuk LFM2.5-VL-3B, 65.536 untuk Liquid AI d1-omni-600M
• Runtime — LFM2.5-VL-3B berjalan di transformers dan vLLM serta memiliki model draf DSpark terpisah untuk decoding spekulatif; Liquid AI d1-omni-600M menyertakan kode khusus, memerlukan trust_remote_code=True, dan kartunya merekomendasikan float16 pada GPU sekaligus memperingatkan bahwa bfloat16 mengubah jawaban teratas pada beberapa baris
• Lisensi — lfm1.0 untuk keduanya, yang mengizinkan fine-tuning dan penerapan
Satu baris dalam daftar itu melakukan lebih banyak pekerjaan daripada yang lain. Liquid AI d1-omni-600M dibangun di atas encoder dua arah, bukan decoder. Itu bukan pengurangan ukuran dari LFM2.5-VL-3B; itu adalah garis keturunan yang berbeda, dan itulah alasan arsitektural mengapa kedua model tidak dapat saling ditukar, tak peduli bagaimana tabel benchmark dibaca.
Kontrak output lebih menentukan daripada tolok ukur
Ajukan pertanyaan tentang sebuah gambar kepada LFM2.5-VL-3B dan Anda akan mendapatkan bahasa kembali. Itu bernilai uang ketika jawabannya harus dibaca oleh seseorang, dicatat sebagai string, atau diberikan ke langkah yang mengharapkan prosa. Itu juga merupakan risiko yang harus Anda akali secara rekayasa: keluaran yang dihasilkan bisa melenceng, permintaan berbentuk JSON bisa kembali dengan bentuk yang berbeda dari yang Anda minta, dan setiap token ditagih serta ditunggu. Model ini secara eksplisit diperuntukkan bagi pekerjaan visi satu giliran, throughput tinggi, dan latensi rendah — OCR batch dokumen pindaian, deteksi waktu nyata di kendaraan, terjemahan rambu di perangkat — dan secara eksplisit dijauhkan dari pertanyaan konteks panjang yang berat penalaran seperti "apa yang salah dengan cetak biru ini."
Liquid AI d1-omni-600M menjawab pertanyaan yang secara ketat lebih sempit dalam cakupan yang secara ketat lebih andal. Antarmukanya adalah state — teks, JSON, satu atau lebih gambar, atau hingga 30 detik ucapan — ditambah sekumpulan pertanyaan bernama, masing-masing mendeklarasikan tipenya sendiri. Pertanyaan noul adalah ya/tidak dan dikembalikan sebagai P(yes) antara 0 dan 1. Pertanyaan choice memilih satu label dari himpunan yang Anda sebutkan dan mengembalikan label, keyakinan, serta probabilitas setiap opsi. Pertanyaan score menempatkan state pada skala terurut dari dua hingga sepuluh level dan mengembalikan level yang diharapkan beserta distribusinya. Beberapa pertanyaan dapat dilampirkan pada satu state dan dibaca dalam satu kali proses, sehingga penghitung penggunaan di kartu model melaporkan output_tokens: 0. Tidak ada langkah generasi, yang berarti tidak ada hal seperti output yang gagal di-parse.
Yang Anda relakan adalah segala hal yang dibawa jawaban yang dihasilkan dan tidak dimiliki label: penalaran, ungkapan berhati-hati, frasa yang dapat Anda tempelkan ke tiket, kemampuan untuk mengajukan pertanyaan lanjutan dalam percakapan yang sama. Liquid menyatakannya secara gamblang — model ini bukan model obrolan dan tidak menulis teks. Jika pipeline Anda membutuhkan penjelasan di samping putusan, Liquid AI d1-omni-600M adalah separuh yang salah dari pasangan ini, dan jawaban yang jujur adalah menjalankan keduanya: LFM2.5-VL-3B untuk menghasilkan pembacaan gambar, Liquid AI d1-omni-600M untuk menghasilkan keputusan tentangnya.

Tidak ada angka visi head-to-head, dan itulah temuannya.
Langkah berikutnya yang naluriah adalah menyandingkan tolok ukur visi. Anda tidak bisa. Pada LFM2.5-VL-3B, vendor menerbitkan set lengkap — RefCOCO Macro Precision@1 sebesar 87,9, ScreenSpot-v2 sebesar 80,7, ChartQA sebesar 81,3, POPE sebesar 88,7, MMStar sebesar 63,3, BLINK sebesar 61,5, MuirBench sebesar 58,3, ToolSandBox sebesar 59,5, OCRBench v2 bahasa Inggris sebesar 47,5, dan RealWorldQA sebesar 73,1 yang sedikit mengungguli 71,1 milik LFM2-VL-3B sebelumnya. Semua itu dilaporkan oleh vendor, tidak satu pun telah dijalankan ulang secara independen, dan meskipun demikian, semua itu adalah klaim spesifik tentang kemampuan spesifik yang dapat digunakan pembaca untuk menuntut pertanggungjawaban lab tersebut.
Untuk Liquid AI d1-omni-600M, postingan rilis menyatakan bahwa Decision Index v0.3 menyertakan split visi privat "yang tidak kami laporkan dalam rilis ini," dan bahwa sebagai gantinya Liquid memvalidasi bahwa checkpoint 600M "menangani ketiga modalitas," dengan buktinya ditempatkan di demo playground. Itulah keseluruhan catatan visi yang dipublikasikan. Tidak ada angka benchmark gambar untuk checkpoint ini, baik di kartu modelnya maupun di postingan peluncurannya. Postingan yang sama mengonfirmasi apa yang hilang di sisi audio bahkan lebih langsung: benchmark keputusan audio khusus, dalam kata-kata vendor sendiri, "saat ini merupakan masalah terbuka."
Jadi pembacaan yang benar atas perbandingan ini bersifat asimetris dan harus dinyatakan demikian. LFM2.5-VL-3B telah menunjukkan kemampuan visi, dengan angka-angka yang menyertainya. Liquid AI d1-omni-600M memiliki encoder visi yang dipinjam dari model saudaranya, adapter yang dilatih terhadap backbone yang dibekukan, sebuah demo, dan sebuah janji. Jika deployment Anda membutuhkan model yang benar soal gambar bulan ini, 3B adalah satu-satunya di antara keduanya yang punya sesuatu untuk dijadikan pijakan.
Kecepatan: hanya satu dari ini yang telah diukur
Karena model keputusan tidak menghasilkan apa pun, latensi adalah angka yang penting, dan sekali lagi hanya satu sisi yang didokumentasikan. LFM2.5-VL-3B tercatat pada 228 token per detik di Apple M5 Max dan 116 token per detik di AMD Ryzen AI Max+ 395, keduanya di dalam memori 3,3 GB, dengan sekitar 20 token per detik di Galaxy S26 Ultra dan sekitar 11.000 token per detik pada satu H100 di bawah vLLM. Angka-angka itu menggambarkan throughput dekode, yang merupakan pengukuran tepat untuk model yang menulis.
Untuk Liquid AI d1-omni-600M, kartu model menyatakan bahwa angka inferensi tidak dilaporkan karena model ini adalah rilis riset awal dan sedang dalam pengembangan aktif. Model d1-3B dalam keluarga yang sama memang memiliki tabel latensi — 8 ms untuk satu pertanyaan pada RTX 4090, 16 ms pada Jetson AGX Thor, 26 ms pada Jetson AGX Orin 64 GB, 50 ms pada Orin Nano, dengan tiga pertanyaan atas satu state memakan waktu sekitar 1,3x waktu satu pertanyaan. Angka-angka itu milik model keputusan 3B dan tidak boleh dibaca untuk 600M. Untuk Liquid AI d1-omni-600M, posisi yang jujur adalah bahwa arsitekturnya menyiratkan model yang kecil dan cepat dan belum ada orang di luar lab yang menerbitkan angka milidetik.
Jejak bobot setidaknya dapat diperkirakan. Pada presisi float16 yang direkomendasikan kartu, 587M parameter kira-kira 1,2 GB bobot sebelum aktivasi — aritmetika berdasarkan jumlah parameter yang dipublikasikan, bukan pengukuran vendor — dibandingkan dengan di bawah 3,3 GB yang dilaporkan Liquid untuk LFM2.5-VL-3B. Pada perangkat yang batasannya adalah megabita, perbedaan itu menjadi argumen untuk 600M.

Bagaimana cara memilih di antara keduanya
Pilihan itu menjadi jelas begitu kontrak keluaran diperlakukan sebagai hal yang tetap, bukan yang dapat dinegosiasikan.
Pilih LFM2.5-VL-3B ketika hasilnya berupa teks: OCR halaman penuh dengan anotasi tata letak, grounding dan deteksi dari kueri bahasa alami, terjemahan papan tanda di perangkat, langkah apa pun di mana manusia atau model bahasa hilir mengonsumsi jawabannya. Model ini juga memiliki konteks yang lebih luas pada 32.768 token dan cakupan bahasa yang lebih mendalam dalam praktiknya, karena jawabannya berupa bahasa, bukan label.
Pilihlah Liquid AI d1-omni-600M ketika hasil akhirnya adalah sebuah keputusan: merutekan tiket, melakukan triase pada frame, memoderasi klip, melakukan gating pada guardrail, menilai respons pada skala dua hingga sepuluh — dan, yang unik di antara keduanya, ketika masukannya berupa ucapan. Ini satu-satunya dari pasangan tersebut yang menerima audio sama sekali, hingga 30 detik per permintaan, meskipun kartunya mencatat bahwa audio itu dilatih pada pertukaran antara penutur bahasa Inggris dan asisten, yang merupakan deskripsi sempit tentang dunia asal panggilan Anda.
Jangan gunakan keduanya, dan tetaplah menggunakan model visi-bahasa umum, jika tugas membutuhkan penalaran tentang gambar, bukan pembacaan atau penilaian tentangnya. Kedua kartu model itu tidak mengarah pada kasus penggunaan tersebut, dan Liquid AI d1-omni-600M tidak memiliki mekanisme untuk mencobanya.
Mencoba checkpoint eksperimental tanpa mempertaruhkan pipeline padanya
Liquid AI d1-omni-600M, menurut label vendor itu sendiri, adalah rilis riset tahap awal, dan perilaku visi serta audionya belum diuji secara benchmark. Itu justru profil model yang ingin Anda evaluasi di balik fallback, bukan di depan pelanggan. OrcaRouter merutekan 200+ model melalui satu API key dengan failover otomatis antar penyedia, yang merupakan cara murah untuk menempatkan checkpoint seperti ini di jalur live: jika rute eksperimental menurun performanya atau penyedia mengalami gangguan, permintaan akan mendarat di fallback tanpa perubahan kode. Key yang sama membawa setiap model yang diserahkan pipeline, dengan harga list masing-masing penyedia yang diteruskan tanpa markup 0%, sehingga penurunan harga vendor menjadi harga Anda pada hari yang sama.
Satu catatan, disampaikan karena ini krusial: model d1 terbuka dan keluarga LFM2.5-VL tidak ada di katalog kami saat ini. Menghosting sendiri bobotnya adalah jalur yang direkomendasikan vendor untuk keduanya, dengan dukungan llama.cpp sejak hari pertama di perangkat keras Apple, AMD, Qualcomm, dan NVIDIA, dan menjalankannya di endpoint yang dihosting berarti API milik vendor sendiri atau platform pihak ketiga. Membaca halaman ini sebagai klaim ketersediaan adalah kesalahan.

Apa yang harus ditonton
Pertanyaan yang menarik bukanlah apakah 600M pada akhirnya mengalahkan 3B dalam hal apa pun — tidak, dan model itu memang tidak dibuat untuk itu. Pertanyaannya adalah apakah Liquid AI memublikasikan pemisahan vision privat yang ditahannya, dan apakah ada yang membangun tolok ukur keputusan audio yang menurut lab tersebut belum ada. Sampai salah satunya terwujud, perbandingan antara Liquid AI d1-omni-600M dan LFM2.5-VL-3B adalah perbandingan antara model yang terukur dan model yang masuk akal. Untuk pekerjaan yang belum terukur — ucapan masuk, putusan keluar, cukup kecil untuk berada di perangkat — 600M adalah satu-satunya checkpoint berbobot terbuka di keluarga ini yang mencobanya, dan menjadi yang pertama tanpa papan skor tetap berarti menjadi yang pertama.
OrcaRouter merutekan 200+ model melalui satu kunci API, dengan harga daftar setiap penyedia diteruskan dengan markup 0% sehingga penurunan harga vendor menjadi harga Anda pada hari yang sama.
