
LFM2.5-VL-3B-DSpark: Drafter 279,5M Milik Liquid AI Dirilis Enam Hari Sebelum Ada yang Mengumumkannya
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 36 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 181 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Ada versi cerita ini yang menyebut LFM2.5-VL-3B-DSpark sebagai model baru. Tidak demikian. Model ini adalah model draf speculative-decoding berparameter 279,5M yang ada untuk tepat satu tujuan — membuat model visi-bahasa milik Liquid AI sendiri, LFM2.5-VL-3B, melakukan dekode lebih cepat — dan model ini tidak dapat menghasilkan jawaban yang dapat dipakai sendiri. Alasan model ini tetap layak dibaca adalah lini masanya: bobotnya muncul di Hugging Face pada 18 September 2026, tanpa pengumuman apa pun, teronggok di sana selama enam hari, dan baru mendapat posting blog vendor pada 24 September. Radar menangkap repo itu di sela-sela jeda tersebut.
Kesenjangan itu juga merupakan batas dari apa yang dapat diketahui saat ini. Semua yang ada di repositori — rincian parameter, ukuran blok, integrasi kerangka kerja, lisensi — adalah berkas di disk yang bisa Anda atau saya buka. Setiap angka percepatan diukur oleh vendor, dari harness benchmark milik Liquid sendiri, dan tidak ada orang di luar perusahaan yang telah menerbitkan reproduksi. Tulisan ini sengaja memisahkan kedua tumpukan itu.
Apa isi sebenarnya dari repositori ini
Buka kartu model dan bentuknya tidak ambigu. LFM2.5-VL-3B-DSpark adalah model draf yang targetnya ditetapkan dalam metadatanya: base_model: LiquidAI/LFM2.5-VL-3B. Anda tidak mengarahkannya ke model lain dan Anda tidak menyajikannya sendirian.
• Total parameter draf — 279,5M, BF16, di mana 193,0M adalah stack dekoder 4 lapis, 65,5M adalah head Markov, 21,0M adalah proyeksi keadaan tersembunyi, dan 6,4k adalah normalisasi plus head keyakinan
• Backbone — 4 lapisan perhatian penuh, ukuran tersembunyi 2.048, ukuran perantara 6.144 dengan SiLU/SwiGLU, perhatian kueri berkelompok pada 32 kepala perhatian dan 8 kepala kunci-nilai, dimensi kepala 64
• Head tambahan — head Markov dengan rank 256 dan head keyakinan, inilah yang membedakan drafting DSpark dari drafter paralel biasa
• Ukuran blok — 9 selama pelatihan; 8 atau 9 saat inferensi bergantung pada perangkat keras, dan 8 secara khusus pada Apple silicon
• Kosakata — 128.000, terikat pada target alih-alih dibawa oleh draf
• Bobot dalam stack yang diterapkan — Liquid menyatakan bahwa drafter menambah jumlah parameter yang diterapkan sebesar 8,9%

Angka 8,9% adalah angka yang perlu dipegang. Pitch untuk kelas model ini tidak pernah berupa "inferensi yang lebih cepat itu gratis"; melainkan "inferensi yang lebih cepat menghabiskan memori sekitar sepersepuluh dari ukuran sebuah model." Dengan 279,5M parameter tambahan di atas target 3,1B, itu adalah pajak yang lebih kecil daripada yang disiratkan oleh ukuran drafter saja, karena embedding dan LM head terikat ke target dan tidak diduplikasi.
DSpark adalah teknik DeepSeek sebelum menjadi model Liquid
Penamaannya mengundang kebingungan, jadi ada baiknya bersikap tepat. DSpark bukanlah penemuan Liquid AI dan bukan keluarga model. Ini adalah kerangka speculative decoding dari jalur riset terpisah, yang dijelaskan dalam makalah Juli 2026 sebagai speculative decoding dengan penjadwalan keyakinan dan generasi semi-autoregresif. Tiga idenya: tulang punggung paralel yang menyusun draf satu blok penuh dalam satu forward pass, modul sekuensial ringan yang memulihkan sebagian ketergantungan antara token draf yang bertetangga agar penerimaan tidak runtuh di akhir blok, dan verifikator yang memperpendek jendela verifikasi per permintaan ketika keyakinan draf itu sendiri menunjukkan bahwa bagian akhir akan ditolak.
Apa yang dilakukan Liquid adalah menerapkan resep itu pada model visi-bahasa dan merilis sebuah checkpoint. Kartu tersebut jujur bahwa transfer ini tidak sedramatis kedengarannya: dari sudut pandang drafter, modalitas tidak relevan, karena pada saat token mencapai lapisan tersembunyi, sebuah patch gambar dan sebuah token teks keduanya hanyalah tensor. Itulah sebabnya teknik yang dikembangkan pada model teks dapat dipindahkan ke VLM tanpa perlu ditemukan ulang — dan itu juga sebabnya drafter tidak dapat dijual sebagai kemampuan baru.
Liquid telah lebih dulu merilis drafter teks DSpark — model pendamping 2.6B, 8B-A1B, dan 1.2B-Instruct dirilis pada Agustus 2026, dengan ekspor GGUF menyusul pada 19 Agustus. Drafter visi adalah ide yang sama yang diperluas ke cabang multimodal, dan entri keempat atau kelima dalam satu lini, bukan debut.
Angka percepatan, dan siapa yang mengukurnya
Setiap angka di bawah ini adalah milik Liquid sendiri, yang dikumpulkan pada infrastruktur benchmarking Liquid, dan tidak ada satu pun yang memiliki reproduksi independen. Anggap semuanya sebagai batas atas dari vendor, bukan hasil yang diharapkan. Kartu ini memisahkan percepatan decode dari percepatan end-to-end, yang lebih penting daripada angka utamanya.
• Percepatan dekode terbaik — 3,13× pada COCO, diukur dengan MLX-VLM pada Apple M5 Max dengan ukuran blok 8, FP16, ukuran batch 1, suhu 0
• Percepatan dekode GPU terbaik — 2,66× pada COCO, SGLang pada satu H100 80GB, BF16, ukuran blok 9
• Percepatan dekode llama.cpp terbaik — 2,14× pada COCO, Apple M3 Ultra, ukuran blok 8
• Rentang dekode H100 pada enam tugas visi — 2,04× hingga 2,66×, dengan end-to-end sebesar 1,64× hingga 2,27×
• Rentang dekode M5 Max — {{1}}2,30×{{/1}} hingga {{2}}3,13×{{/2}}, end-to-end {{3}}1,56×{{/3}} hingga {{4}}2,62×{{/4}}
• Rentang dekode M3 Ultra — 1,57× hingga 2,14×, end-to-end 1,30× hingga 1,77×
• Penerimaan draf — sekitar 3,2 hingga 4,5 token diterima per pass verifikasi target, pada ketiga stack
Pola dalam rentang-rentang itu adalah bagian yang jujur. Keuntungan end-to-end secara konsisten adalah separuh yang lebih kecil dari setiap pasangan, karena drafter hanya mempercepat decoding dan tidak yang lain. Perhatikan juga bahwa drafter yang sama pada ukuran blok yang sama mencapai 3,13× pada satu stack dan 1,57× pada stack lain — tingkat penerimaan adalah properti drafter dan beban kerja, tetapi keuntungan wall-clock adalah properti perangkat keras dan overhead runtime. Klaim "2,66× lebih cepat" tanpa stack yang dilampirkan bukanlah klaim yang bisa Anda tindak lanjuti.
Dua poin kebenaran dari kartu tersebut layak dinyatakan secara gamblang, karena itulah yang membuat sebuah drafter dapat diterima di produksi. Dalam decoding greedy, speculative decoding bersifat eksak: target memverifikasi setiap token yang diusulkan, jadi teksnya adalah teks yang akan dihasilkan target jika sendirian. Dalam pengaturan sampling yang dipadankan pada suhu bukan nol, ia mempertahankan distribusi keluaran target. Frasa Liquid — Anda mendapatkan percepatan, bukan model yang berbeda — akurat sejauh pernyataan itu berlaku, dan kartu tersebut secara jujur menyatakan bahwa menaikkan suhu menurunkan tingkat penerimaan dan karena itu mengikis manfaat throughput.
Apa yang diakui oleh postingan Liquid sendiri

Postingan blog 24 September lebih berguna daripada kartu model karena satu alasan: postingan itu menyebutkan batasannya. Inferensi visi-bahasa menanggung biaya prefill yang tidak dimiliki inferensi teks — gambar harus melewati encoder visi, dan backbone bahasa kemudian harus memproses ratusan token visual yang dihasilkan encoder tersebut. Pada perangkat, prefill itu mendominasi latensi ujung-ke-ujung. Dekode spekulatif hanya mempercepat dekode. Pengodean visi dan prefill tidak tersentuh. Liquid menggunakan hukum Amdahl terhadap produknya sendiri dan menunjukkan bahwa ketika prefill merupakan bagian besar dari waktu total, percepatan dekode yang besar hanya menghasilkan peningkatan ujung-ke-ujung yang moderat.
Itu adalah kendala nyata dalam keputusan pembelian, dan itu menjelaskan mengapa time-to-first-token tidak ada dalam daftar hal yang ditingkatkan oleh drafter ini. Ini juga menyiratkan bahwa beban kerja yang paling diuntungkan adalah beban kerja yang menghasilkan keluaran panjang dari gambar yang tidak terlalu besar — sebuah keterangan gambar, transkripsi OCR yang panjang, percakapan multi-giliran dengan satu gambar yang dibawa terus — bukan beban kerja yang menjawab pertanyaan singkat tentang gambar yang besar.
Postingan ini menambahkan dua batasan cakupan lagi. Semua angka menggunakan pemrosesan 16-bit untuk encoder visi maupun backbone bahasa, dan akselerasi model terkuantisasi berada di luar cakupan rilis ini. Mengingat seluruh nilai jual VLM edge 3B adalah berjalan dalam beberapa gigabyte, "peningkatan kecepatan diukur pada FP16" adalah catatan penting bagi siapa pun yang berencana memasangkannya dengan ekspor 4-bit. Liquid juga mencatat bahwa drafter dilatih sepenuhnya pada perangkat keras AMD.
Menjalankannya

Dukungan hari pertama itu nyata dan mencakup tiga runtime, yang lebih banyak daripada yang didapat sebagian besar drafter. SGLang di NVIDIA memerlukan v0.5.19 atau lebih baru dan menjalankan drafter melalui --speculative-algorithm DSPARK dengan jalur draft dan ukuran blok 9. MLX-VLM di Apple silicon memerlukan v0.7.2 atau lebih baru dan mendeteksi drafter saat diberikan dengan --draft-model; ada satu hal yang perlu diwaspadai — decoding DSpark di MLX-VLM saat ini menggunakan greedy sampling, jadi temperature harus disetel ke 0. Untuk llama.cpp ada repositori GGUF terpisah, dengan satu ekspor F16 berukuran sekitar 567 MB, dan kartunya secara eksplisit menyatakan bahwa Anda memasangkan drafter terkuantisasi dengan target terkuantisasi, bukan dengan checkpoint safetensors asli.
Di sini, lapisan routing tidak memperoleh tempatnya pada model ini — OrcaRouter tidak merutekan LFM2.5-VL-3B-DSpark atau LFM2.5-VL-3B, dan ini adalah pasangan drafter self-hosted yang Anda unduh dan jalankan sendiri. Tempatnya justru pada bagian lain dari stack di sekitarnya. Aplikasi yang sama yang menjalankan model visi kecil berbobot terbuka di perangkat biasanya memiliki jalur fallback untuk kueri yang tidak dapat ditangani model kecil itu, dan mengarahkan jalur tersebut ke satu endpoint yang mencakup 200+ model — ditagih pada harga daftar masing-masing penyedia tanpa markup tambahan, dengan failover otomatis saat penyedia mengalami penurunan — adalah integrasi yang lebih kecil daripada mengadakan kontrak vendor kedua. Drafter meningkatkan satu bagian dari arsitektur itu; router-lah yang menjaga bagian lainnya agar tidak menjadi proyek kedua.
Apa yang belum diketahui
Repositori ini memiliki 37 unduhan dan 6 suka pada saat penulisan. Tidak ada entri untuk drafter ini di agregator benchmark publik mana pun, tidak ada reproduksi pihak ketiga atas rentang percepatan mana pun, dan tidak ada pengukuran independen atas tingkat penerimaan pada perangkat keras yang tidak diuji Liquid. Tidak ada juga benchmark kualitas di kartu tersebut karena alasan yang jelas — drafter ini mempertahankan output secara desain, sehingga angka kualitasnya menjadi milik LFM2.5-VL-3B, dan kartu tersebut menunjuk ke benchmark model itu alih-alih menciptakan benchmarknya sendiri.
Satu detail dalam metadata menjadi petunjuk kecil tentang betapa barunya hal ini: model ini membawa tag pustaka SGLang dan flag algoritme SGLang yang ada khusus untuk memanggilnya. Dukungan framework harus sudah hadir sebelum pengumumannya terbit, yang konsisten dengan selisih enam hari antara repositori dan postingan blog.
Jadi: sebuah karya rekayasa yang asli, berguna, dan berskup sempit, diumumkan seminggu setelah dirilis, yang seluruh proposisi nilainya adalah angka yang diukur vendor pada perangkat keras yang mungkin tidak Anda miliki. Jika Anda menjalankan LFM2.5-VL-3B di H100 atau Mac seri M dan beban kerja Anda berat decode, biaya memorinya 8,9% dan sisi buruknya hampir nol karena outputnya terbukti sama dengan target. Jika latensi Anda didominasi oleh prefill, atau Anda mengandalkan ekspor 4-bit, postingan Liquid sendiri memberi tahu Anda bahwa itu tidak akan membantu. Reproduksinya, saat muncul, adalah hal yang perlu ditunggu.
OrcaRouter menempatkan 200+ model di balik satu kunci dengan harga daftar penyedia tanpa markup 0%, dan mengekspresikan jalur fallback sebagai lapisan routing alih-alih kode aplikasi. Bagaimanapun juga, drafter-nya di-self-host — router-lah yang menjaga agar bagian yang diserahkan model kecil Anda tidak berubah menjadi proyek kedua.
