
LFM2.5-8B-A1B-DSpark vs LFM2.5-2.6B-Base: Bagian Kecepatan vs Bahan Baku
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0856Kecerdasan72Koding
Urutkan keluarga LFM2.5 berdasarkan apa yang dapat dilakukan setiap checkpoint secara mandiri, dan LFM2.5-8B-A1B-DSpark serta LFM2.5-2.6B-Base berada di ujung-ujung yang berlawanan — dan tak satu pun ujung tersebut dapat menjawab pertanyaan. Yang pertama adalah model draf dengan 327,7 juta parameter yang dibuat semata-mata untuk membuat model mixture-of-experts edge milik Liquid AI menghasilkan token lebih cepat. Yang kedua adalah checkpoint pra-terlatih mentah dengan 2,69 miliar parameter yang ada semata-mata untuk di-fine-tune menjadi sesuatu yang lain. Keduanya dirilis pada Agustus 2026 di bawah LFM Open License v1.0 milik Liquid, keduanya hanya berjarak satu unduhan di Hugging Face, dan keduanya sangat mudah tertukar — karena nama-namanya membuatnya terdengar seperti dua versi dari hal yang sama.
Nama-nama itu adalah jebakan. "DSpark" terdengar seperti andalan baru yang cemerlang dari keluarga itu, dan "Base" terdengar seperti default polos yang benar-benar bisa Anda jalankan. Padahal tidak demikian. Checkpoint DSpark tidak dapat menjawab apa pun sendirian — ia hanya mengusulkan token untuk diverifikasi oleh LFM2.5-8B-A1B. Base juga tidak dapat menjawab apa pun, tetapi dengan alasan sebaliknya — ia adalah fondasi yang belum disetel yang memprediksi teks, tetapi tidak pernah dilatih lanjut menjadi model obrolan atau agen. Ini bukan persaingan; ini adalah pipeline. Satu checkpoint berada di ujung paling akhir dari tumpukan penyajian, yang lainnya di awal proses pelatihan.
Dua pos pemeriksaan yang berbagi nama, bukan pekerjaan.
LFM2.5-8B-A1B-DSpark (dirilis 20 Agustus 2026) adalah model draf decoding spekulatif: jaringan lima lapis yang hanya menggunakan attention, blok sembilan token yang diusulkan per langkah, dan kepala Markov pada kosakata 128.000 token milik target. Anda memuatnya berdampingan dengan LFM2.5-8B-A1B — MoE dengan total 8,3 miliar parameter dan ~1,5 miliar aktif yang dirilis pada 28 Mei — draf menebak beberapa token berikutnya, dan target memverifikasi seluruh blok dalam satu lintasan maju, menyimpan apa pun yang diterimanya. Karena target memeriksa setiap token, output di bawah greedy decoding identik dengan menjalankan LFM2.5-8B-A1B saja: "lossless by construction," dalam frasa Liquid. Draf adalah bagian kecepatan, bukan otak. Model ini dirilis bersama draf-draf saudaranya untuk LFM2.5-1.2B-Instruct dan LFM2.5-2.6B, masing-masing dalam Safetensors dan GGUF, dengan dukungan hari pertama di SGLang dan llama.cpp.
LFM2.5-2.6B-Base (dirilis 4 Agustus 2026) adalah ujung lain dari pipeline: model fondasi 2,69B parameter dalam tumpukan 30 lapisan hibrida — 22 blok konvolusi pendek berpintu ganda plus 8 blok grouped-query attention — dilatih sebelumnya pada sekitar 34 triliun token, dengan fase mid-training yang memperluas konteks hingga 128K. Ia tidak memiliki template chat, tidak ada instruction tuning, dan tidak ada benchmark yang dipublikasikan, dan kartu model Liquid sendiri merekomendasikannya hanya untuk fine-tuning ekstensif. Seluruh tujuannya adalah menjadi bahan mentah yang diubah oleh pipeline pasca-pelatihan empat tahap — dua putaran SFT, spesialisasi guru, distilasi on-policy, lalu pembelajaran penguatan agenik — menjadi agen pemanggil alat LFM2.5-2.6B. Keluarga yang sama, lisensi yang sama, halaman unduhan yang sama. Pekerjaan yang berbeda sama sekali.
Berdampingan: tujuh dimensi, dua pekerjaan
Karena kedua pos pemeriksaan memiliki tugas yang berbeda, perbandingan yang jujur menjaga peran kedua belah pihak tetap lurus:
Apa itu — LFM2.5-8B-A1B-DSpark adalah model draf decoding spekulatif 0.3B; LFM2.5-2.6B-Base adalah fondasi pra-terlatih mentah 2.69B.
• Dengan apa ia berjalan — draft DSpark berpasangan dengan MoE LFM2.5-8B-A1B (total 8.3B, ~1.5B aktif per token); Base berjalan sendiri, tetapi hanya sebagai prediksi teks tanpa penyetelan.
• Penggunaan mandiri — DSpark tidak menghasilkan apa pun dengan sendirinya; ia hanya mempercepat target. Base menghasilkan teks tetapi tidak ada perilaku produk yang berguna — tidak ada pengikutan instruksi, tidak ada pemanggilan alat, tidak ada template obrolan.
• Kualitas keluaran — DSpark mewarisi keluaran greedy yang persis dari target, karena setiap token yang diusulkan diverifikasi; Base tidak memiliki benchmark yang dipublikasikan pada tugas apa pun, secara desain.
• Kecepatan — DSpark menambahkan rata-rata terukur vendor sebesar 2.54× pada H100 (hingga 3.18× pada MATH500) dan 1.18× pada M4 Max ke targetnya, yang belum direproduksi; Base tidak memiliki klaim kecepatan inferensi sama sekali.
• Jejak memori — DSpark menambahkan sekitar 0,3GB bobot draf di samping target; Base adalah 2,69B penuh, dapat dijalankan di bawah 2,5GB, fondasi serius terkecil dalam keluarga.
• Format dan ketersediaan — DSpark hadir dalam Safetensors dan GGUF dengan dukungan SGLang dan llama.cpp sejak hari pertama; Base hadir dalam Safetensors plus GGUF, ONNX, dan MLX serta berjalan di Transformers, vLLM, SGLang, llama.cpp, dan MLX. Keduanya tidak dilayani oleh penyedia inferensi mana pun saat ini — keduanya adalah checkpoint yang dihosting sendiri.

Satu-satunya angka dalam pertandingan ini berasal dari satu laboratorium.
Semua angka kuantitatif di sini adalah pengukuran dari satu vendor, diambil pada hari draf tersebut dirilis dan belum direproduksi secara independen — anggap saja menjanjikan, bukan terverifikasi. Liquid mengukur LFM2.5-8B-A1B-DSpark dengan ukuran batch 1, temperatur 0, pada satu H100 80GB dalam BF16 menggunakan SGLang, dan pada MacBook Pro M4 Max dalam FP16 GGUF menggunakan kernel Metal eksperimental dari llama.cpp. Di H100, pasangan ini menghasilkan rata-rata 2,54× (418 → 1.074 token per detik), dengan hasil tunggal terbaik 3,18× pada MATH500 (428 → 1.362 tok/s) dan tingkat penerimaan rata-rata sekitar 7 dari 10 token yang diusulkan. Di M4 Max, pasangan yang sama hanya rata-rata 1,18× (90 → 106 tok/s) — kasus tepi pada perangkat yang ditandai sendiri oleh Liquid, karena memverifikasi blok mengaktifkan lebih banyak pakar di backend MoE Metal saat ini dan menggerakkan lebih banyak lalu lintas bobot melintasi bus memori.
Sisi Base dari pertarungan ini tidak memiliki angka sama sekali, dan ketiadaan itu sendiri adalah spesifikasinya. LFM2.5-2.6B-Base dilatih awal (pre-trained), bukan dilatih lanjut (post-trained); ia tidak pernah dievaluasi untuk chat, penggunaan alat, atau perilaku agen, karena tidak ada yang berniat menggunakannya untuk itu. Angka-angka signifikannya bersifat arsitektural: 2.69B parameter, konteks 128K, tokenizer 16 bahasa, di bawah 2.5GB untuk dijalankan. Anda tidak melakukan benchmark pada fondasi; Anda melakukan benchmark pada apa yang Anda fine-tune menjadi.
Ada satu ironi keluarga yang perlu disebutkan sebelum Anda memutuskan apa pun. Draf yang dibahas artikel ini — yang untuk 8B-A1B — justru yang paling sedikit meningkat di laptop (1,18×), sementara draf saudaranya untuk keluarga 2.6B, yang mempercepat saudara pasca-dilatih dari Base ini sendiri, rata-rata 2,27× pada M4 Max dengan pengurangan 57% dalam latensi pemanggilan fungsi multi-tool. Jika perangkat yang dimaksud adalah ponsel atau laptop, bukan kotak GPU, jalur 2.6B adalah tempat kisah kecepatan itu berada.

Jadi, yang mana yang kamu unduh?
Anda tidak pernah harus memilih secara langsung di antara keduanya, karena keduanya bukanlah alternatif — tetapi Anda harus tahu pekerjaan mana yang sedang Anda jalani:
Jika Anda menjalankan LFM2.5-8B-A1B pada GPU milik Anda sendiri dan menginginkan lebih banyak token per detik dari silikon yang sama, LFM2.5-8B-A1B-DSpark adalah tambahan yang dapat dibalik: bangun SGLang atau llama.cpp dengan integrasi DSpark 20 Agustus, sebutkan draf dalam perintah peluncuran, pertahankan decoding serakah, dan ukuran blok dibaca otomatis dari konfigurasi draf. Keuntungannya kira-kira 2,5× throughput tanpa perubahan pada keluaran; kekurangannya adalah 0,3 GB bobot tambahan dan build yang cukup baru untuk memuat PR-PR tersebut. Hapus dua flag spekulatif dan Anda kembali ke target biasa.
Jika Anda ingin membangun spesialis Anda sendiri — model domain, asisten bahasa kustom, fine-tune pada data kepemilikan — LFM2.5-2.6B-Base adalah salah satu titik awal serius termurah di ekosistem open-weights: 2.6B, di bawah 2.5GB, konteks 128K, tokenizer multibahasa. Checkpoint DSpark tidak dapat membantu Anda sama sekali, karena itu bukan base.
Jika Anda benar-benar menginginkan agen on-device milik Liquid — pemanggilan alat, tugas multi-langkah — maka Anda tidak menginginkan salah satu dari keduanya. Anda menginginkan LFM2.5-2.6B pasca-pelatihan, dan Anda dapat memutuskan setelahnya apakah akan menambahkan drafnya sendiri. Base adalah bahan mentah bagi orang-orang yang ingin melatih; draf 8B-A1B adalah komponen kecepatan bagi mereka yang sudah men-deploy MoE. Langkah yang salah adalah mengunduh Base karena Anda menginginkan agen yang lebih cepat, atau drafter karena Anda menginginkan fondasi untuk dilatih.

Tempat keduanya terhubung — dan di mana router berperan
Kedua checkpoint ini adalah cerita self-host. Draf adalah aksesori lapisan penyajian yang hanya ada di dalam tumpukan SGLang atau llama.cpp Anda sendiri; Base adalah artefak pelatihan. Tidak satu pun muncul dalam katalog terhosting, dan tidak satu pun memiliki harga daftar per token. Artinya dalam praktik, kedua jalur tersebut akhirnya berada di samping model terhosting yang sudah Anda panggil — dan campuran itulah yang justru menjadi perpipaan yang keberadaannya untuk diciutkan oleh lapisan routing.
Di sisi serving, ekonomi draft-nya sederhana dan nyata: 2,5× lebih banyak token per detik dari GPU yang sama berarti 2,5× lebih sedikit waktu dan kira-kira 2,5× lebih sedikit GPU untuk beban kerja yang sama, tanpa perubahan kualitas. Tetapi tuas itu hanya ada jika Anda mengendalikan inferensi. Begitu Anda memanggil 8B-A1B melalui API, penyedia menyimpan percepatannya — di situlah perbandingan dari sisi API menjadi yang paling penting: berapa yang dikenakan penyedia, dan apakah penurunan harga sampai kepada Anda pada hari yang sama saat diumumkan. Itulah gunanya router pass-through: satu API untuk 200+ model, harga daftar penyedia diteruskan dengan markup 0% sehingga pemotongan harga vendor langsung berlaku di sisi Anda, dan failover otomatis sehingga lonjakan latensi satu penyedia tidak menjadi latensi Anda. Anda juga dapat meletakkan tumpukan LFM self-hosted Anda sendiri di depan melalui endpoint yang sama, yang merupakan cara Anda mencoba model draft yang benar-benar baru terhadap lalu lintas nyata tanpa mempertaruhkan jalur produksi padanya.
LFM2.5-8B-A1B-DSpark dan LFM2.5-2.6B-Base berbagi nama keluarga dan pekerjaan yang berlawanan: yang satu adalah komponen kecepatan yang dipasang pada MoE edge, yang lainnya adalah otak yang belum di-tuning tempat agen 2.6B tumbuh. Keduanya tidak dapat berjalan sendiri. Pilih drafter untuk mempercepat MoE yang sudah Anda layani di GPU, pilih Base untuk fine-tune fondasi 2.6B menjadi sesuatu milik Anda sendiri, dan lewati keduanya jika yang Anda inginkan adalah agen yang berfungsi — karena satu hal yang dimiliki kedua checkpoint ini adalah keduanya, secara terpisah, tidak melakukan apa pun yang bisa Anda gunakan.
FAQ
Bisakah saya menjalankan LFM2.5-8B-A1B-DSpark secara terpisah?
Bukan. Ini adalah model draf tanpa keluaran mandiri — model ini mengusulkan token kandidat yang kemudian diverifikasi oleh target LFM2.5-8B-A1B, sehingga model ini hanya ada di dalam tumpukan layanan decoding spekulatif yang dibangun pada integrasi SGLang atau llama.cpp 20 Agustus. Mengunduhnya sendirian tidak memberi Anda apa pun yang dapat Anda kueri.
Apakah LFM2.5-2.6B-Base adalah checkpoint yang berjalan di perangkat sebagai agen?
Bukan apa adanya. Base adalah fondasi pra-terlatih mentah tanpa penyesuaian instruksi dan tanpa templat obrolan. Model yang berjalan sebagai agen on-device Liquid adalah LFM2.5-2.6B pasca-pelatihan, yang dihasilkan dari Base melalui pipeline pasca-pelatihan empat tahap — dan, jika Anda menginginkannya lebih cepat, dipasangkan dengan draf LFM2.5-2.6B-DSpark.
