
LFM2.5-2.6B-DSpark: Drafter 328M yang Membuat Agen On-Device Liquid Berjalan 2,3× Lebih Cepat
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
Belum ada orang di luar Liquid AI yang menjalankan LFM2.5-2.6B-DSpark di perangkat keras mereka sendiri dan memublikasikan angka. Itulah titik awal yang jujur untuk model ini, karena keseluruhannya adalah klaim performa: ini bukan 2.6B yang lebih baik, melainkan model draf berparameter 328M yang berada di depan model agen 2.6B LFM2.5-2.6B dan mengusulkan token untuk diverifikasi oleh model tersebut, sehingga agen berjalan sekitar dua kali lebih cepat tanpa mengubah keluarannya.
Dirilis pada 20 Agustus 2026 dengan tulisan teknis di Hugging Face dan pos pendamping di blog Liquid sendiri, LFM2.5-2.6B-DSpark adalah unggulan dari keluarga kecil checkpoint drafter decoding spekulatif yang diterbitkan Liquid pada hari itu. Semua yang ada di kolom kecepatan di bawah ini diukur oleh vendor dan belum dikonfirmasi secara independen; semua yang ada di repositori, format, dan dukungan framework tinggal untuk diperiksa.
Apa itu DSpark, dalam satu napas
Decoding spekulatif adalah trik menjalankan model draf murah di depan model asli: pembuat draf menebak beberapa token berikutnya, target memeriksa seluruh batch dalam satu lintasan maju, dan menyimpan token-token yang disetujuinya. Ketika tebakannya benar, Anda memindahkan beberapa token dengan harga satu token, sehingga throughput meningkat tanpa menyentuh bobot target. DSpark — teknik yang awalnya diusulkan oleh peneliti DeepSeek pada Juli 2026 dan sudah diterapkan di DeepSeek-V4 — adalah versi dari trik tersebut yang disesuaikan untuk model kecil di perangkat. Liquid menyebutnya decoding spekulatif terjadwal-kepercayaan, dan memiliki tiga bagian yang bergerak: backbone paralel yang menghasilkan state tersembunyi untuk semua token draf dalam satu lintasan, kepala sekuensial ringan yang memodelkan ketergantungan antar token yang berdekatan sehingga tingkat penerimaan tidak runtuh di akhir blok, dan verifier yang memangkas sufiks berkepercayaan rendah ketika memeriksanya akan memakan biaya lebih daripada penghematannya.

Bagian terakhir itulah yang membuat DSpark terasa berbeda dari penyusun draf biasa: ia tidak selalu mendorong blok penuh melalui verifikasi. Ketika keyakinan draf itu sendiri mengatakan bahwa sufiks tidak mungkin diterima, ia memotong blok tersebut dan menghemat komputasi yang terbuang. Blok draf terdiri dari sembilan token, sehingga target memverifikasi hingga sepuluh sekaligus.
Penyusun, sesuai prosedur
Checkpoint LFM2.5-2.6B-DSpark adalah model draft berparameter 0,3 miliar yang hanya menggunakan attention: lima lapisan attention penuh (ukuran tersembunyi 2.048, grouped-query attention dengan 32 head dan 8 head key-value), kosakata 128K token, Markov head dengan rank 256, dan confidence head. Liquid melatihnya selama 15 epoch pada campuran data instruksi, percakapan, kode, dan pemanggilan fungsi — pada perangkat keras AMD — dan memilih epoch berdasarkan tingkat penerimaan tertinggi, bukan loss terendah.
Tingkat penerimaan itu adalah angka yang menentukan seberapa berharga drafter tersebut. Di lima benchmark dengan ukuran batch 1 dan suhu 0, LFM2.5-2.6B-DSpark rata-rata menerima 4.83 token per langkah decoding di H100 dan 4.42 di M4 Max — kira-kira setengah blok diterima, dan dari situlah percepatan dua kali lipat berasal.
Percepatan yang diberi label
Semua angka berikut berasal dari pengukuran Liquid AI sendiri — SGLang pada satu H100 80GB dalam BF16, dan llama.cpp dengan backend Metal pada M4 Max MacBook Pro dalam FP16 GGUF, ukuran batch 1, suhu 0 — dan tidak ada satu pun yang telah direproduksi oleh pihak independen pada saat penulisan ini:
• Rata-rata H100 — 2.67×, dari 323 hingga 864 token/detik. Berdasarkan benchmark: MATH500 3.06×, HumanEval 2.56×, MBPP 2.64×, GSM8K 2.22×, MT-Bench 2.87×.
• Rata-rata M4 Max — 2.27×, dari 61 hingga 139 token/detik. Berdasarkan benchmark: MATH500 2.25×, HumanEval 2.63×, MBPP 2.11×, GSM8K 2.36×, MT-Bench 1.99×.
• Pemanggilan alat — dalam skenario pemanggilan fungsi multi-alat, latensi rata-rata turun 57%.
• Konteks keluarga — drafter terbesar dalam keluarga ini, LFM2.5-8B-A1B-DSpark, mencapai hingga 3.18× pada H100 dan drafter 1.2B mencapai hingga 2.87× pada M4 Max; angka 2.6B di atas berada di posisi menengah.

Dua hal tentang angka-angka tersebut penting di luar sekadar rata-ratanya. Pertama, angka-angka tersebut diukur pada temperatur 0 dan ukuran batch 1 — konfigurasi yang mendukung spekulasi dan konfigurasi yang sebagian besar digunakan oleh pekerjaan agen on-device interaktif. Jaminan identitas juga berlaku di sana: decoding spekulatif memverifikasi setiap token yang diusulkan, sehingga di bawah decoding greedy, teks yang dihasilkan persis sama dengan yang akan dihasilkan target jika bekerja sendiri. Kedua, kesenjangan menyempit seiring meningkatnya konkurensi: pada satu H100, Liquid melaporkan keunggulan DSpark konvergen di sekitar ukuran batch 128, sehingga drafter merupakan kemenangan latensi untuk beban kerja interaktif dan yang banyak menggunakan tool, bukan peluru perak throughput mentah untuk server yang sudah dimaksimalkan.
Apa yang dikonfirmasi, dan apa yang tidak
Terkonfirmasi, dalam arti bahwa repo bersifat publik dan dapat diperiksa: drafter tersebut dirilis sebagai Safetensors (BF16) dan GGUF; ia berpasangan dengan LFM2.5-2.6B yang telah dilatih lanjut, bukan dengan basisnya; dukungan hari pertama telah masuk ke hulu di llama.cpp (dengan kernel Metal eksperimental) dan di SGLang; dilisensikan di bawah LFM Open License v1.0 milik Liquid; dan — penting bagi siapa pun yang merencanakan hal ini — kartu model menyatakan bahwa tidak ada penyedia inferensi yang melayaninya, jadi ini adalah komponen yang harus dijalankan sendiri.
Belum terkonfirmasi: bahwa percepatan tersebut dapat direproduksi pada perangkat keras dan konfigurasi lain (belum ada pihak di luar Liquid yang memublikasikan hasil pengukuran), bagaimana perilaku drafter saat menggunakan sampling dibandingkan dengan greedy decoding, dan apakah angka latensi pemanggilan alat sebesar 57% itu berlaku di berbagai harness agen nyata di luar harness benchmark yang digunakan Liquid. Semua itu bukan tuduhan — rilisnya baru berumur sehari — tetapi itulah pembeda antara angka yang menjanjikan dan angka yang terverifikasi.

Menjalankannya
Di SGLang, Anda menggunakan build dengan dukungan DSpark, meluncurkan server terhadap model target, dan menamai drafter: algoritma spekulatifnya adalah DSPARK, jalur model draft mengarah ke LiquidAI/LFM2.5-2.6B-DSpark, dan ukuran blok dibaca dari config.json milik draft tersebut. Di llama.cpp, Anda memuat GGUF target dengan GGUF draft sebagai model draft dan mengatur tipe spec ke draft-dspark, dengan ukuran blok dibaca dari metadata sidecar. Kedua integrasi tersebut sudah di-upstream, jadi tidak perlu fork — cukup build yang cukup baru untuk memuatnya.
Kapan layak menambahkan
LFM2.5-2.6B-DSpark memperoleh sekitar 0.3GB memori ekstra ketika Anda benar-benar menyebarkan agen 2.6B di tempat yang dirancang Liquid untuknya — di ponsel, laptop, atau perangkat edge — untuk beban kerja interaktif atau pemanggilan alat yang terikat latensi dan berjalan secara greedy. Itulah profil yang tepat di mana angka 2.27× on-device dan pengurangan latensi pemanggilan alat sebesar 57% berperan. Ini kurang menarik jika Anda melayani batch tinggi di server (percepatan cenderung mendekati 1×), atau jika beban kerja Anda berjalan pada temperatur di atas nol, di mana angka-angka yang dilaporkan tidak berlaku lagi. Dan jika Anda menggunakan varian 8B-A1B dari keluarga ini, perhatikan kasus tepi: percepatan on-device-nya saat ini hanya sekitar 1.18×, karena verifikasi token draf mengaktifkan lebih banyak pakar di backend Metal llama.cpp — Liquid menandai ini sebagai hal yang diketahui.
Tidak ada apa pun tentang DSpark yang mengubah tempat agen 2.6B berjalan — ini adalah kisah self-host secara desain, dan ia akan berdampingan dengan model terhosting yang sudah Anda panggil. Perpaduan antara drafter lokal dan selusin titik akhir API persis seperti jenis perpipaan yang diciutkan oleh lapisan perutean: satu kunci API untuk 200+ model, failover otomatis saat penyedia menurun, dan harga daftar penyedia diteruskan dengan markup 0%, sehingga perbandingan biaya lokal versus terhosting untuk agen kelas 2.6B tetap mudah dibaca alih-alih hidup di spreadsheet.
Cara yang tepat untuk membaca LFM2.5-2.6B-DSpark saat ini adalah sebagai klaim kecepatan yang menjanjikan, diukur oleh vendor, dan belum independen, yang melekat pada checkpoint nyata yang dapat diunduh dan dijalankan. Jika Anda menerapkan agen 2.6B di perangkat, drafter-nya murah untuk dicoba dan mudah dihapus — tambahkan dua flag spekulatif ke perintah SGLang, pertahankan greedy decoding, dan ukur terhadap beban kerja Anda sendiri sebelum mempercayai angka 2.3×. Reponya sudah tersedia; verifikasi independen adalah item yang masih terbuka.
