Kartu judul hero untuk perbandingan LFM2.5-8B-A1B-DSpark vs Qwen3-8B, dengan subjudul 'Draf yang mempercepat model, melawan 8B yang sudah dijalankan semua orang', menampilkan di kiri kotak 'Draft 327M' yang mengirim chip token ke kartu MoE 'LFM2.5-8B-A1B' dengan ubin bertumpuk, dengan jarum speedometer tinggi di bawah label 'SPECULATIVE DECODING', dan di kanan kartu gelembung obrolan berlabel 'Qwen3-8B' dengan ikon percikan dan jam di bawah label 'GENERALIST MODEL', dengan tag tanggal 'Agustus 2026' dan logo OrcaRouter yang dipadukan di pojok kanan bawah.
Guides & Insights

LFM2.5-8B-A1B-DSpark vs Qwen3-8B: Draf yang Mempercepat Model, Melawan 8B yang Sudah Dijalankan Semua Orang

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Liquid AI merilis checkpoint draf LFM2.5-8B-A1B-DSpark pada 20 Agustus 2026 — sebuah pembantu decoding spekulatif berparameter 327,7 juta yang membuat MoE edge LFM2.5-8B-A1B menghasilkan output hingga 3,18× lebih cepat pada satu H100. Sebelum perbandingan ini bisa jujur, satu fakta harus diletakkan di atas meja: checkpoint DSpark bukanlah model yang bisa Anda panggil. Ia hanya mempercepat model lain. Jadi pertanyaan deployment nyata yang dimunculkan oleh rilis ini adalah pertanyaan yang paling banyak dipertimbangkan tim-tim sepanjang tahun — LFM2.5-8B-A1B atau Qwen3-8B, dua model open-weight kelas 8B yang berada di momen yang sangat berbeda dalam hidup mereka.

Bingkai ini lebih penting dari biasanya, karena kedua pihak bukanlah jenis hal yang sama. Qwen3-8B adalah model yang lengkap dan siap digunakan yang bisa Anda [[self-host]] atau beli tokennya hari ini. LFM2.5-8B-A1B juga merupakan model yang lengkap dan siap digunakan — draf DSpark adalah tambahan untuknya, bukan sebuah versi darinya. Segala hal yang dijanjikan draf tersebut diukur oleh vendor dan baru berumur sehari; segala hal tentang repositori dan formatnya memang ada untuk diperiksa. Tulisan ini menjaga dua kategori tersebut tetap terpisah.

Pertama, kata "DSpark" bukanlah kata benda dalam kalimat ini.

Decoding spekulatif menjalankan model draf yang murah di depan model asli: pendraf menebak beberapa token berikutnya, target memverifikasi seluruh blok dalam satu langkah maju, dan menyimpan apa pun yang disetujuinya. Ketika tebakan akurat, Anda memindahkan beberapa token dengan harga satu kali proses pemuatan bobot, sehingga throughput meningkat tanpa menyentuh bobot target — dan karena target memeriksa setiap token yang diajukan, keluaran pada decoding serakah identik dengan menjalankan LFM2.5-8B-A1B sendirian. Liquid menyebutnya "lossless by construction," dan itulah alasan utama mengapa draf aman untuk dipasang.

LFM2.5-8B-A1B-DSpark dari Liquid adalah drafter yang sengaja dibuat kecil: lima lapisan attention-only, blok berisi sembilan token yang diusulkan per langkah, dan Markov head pada kosakata 128.000 token target, dilatih selama 15 epoch pada campuran data chat, kode, dan pemanggilan fungsi, dengan checkpoint yang dipilih berdasarkan acceptance rate, bukan loss. Model ini adalah salah satu dari tiga draf yang dirilis vendor pada hari itu, bersama LFM2.5-1.2B-Instruct dan LFM2.5-2.6B, masing-masing dalam Safetensors dan GGUF dengan dukungan SGLang dan llama.cpp sejak hari pertama. Ini juga penting bagi siapa pun yang membaca perbandingan dengan model kelas 8B: model ini tidak dilayani oleh penyedia inferensi mana pun dan tidak memiliki harga per token. Model ini hanya ada di dalam tumpukan speculative-decoding Anda sendiri.

A screenshot of the Hugging Face model page for LiquidAI/LFM2.5-8B-A1B-DSpark, showing the tags TextGeneration, Safetensors, sglang, qwen3_speculative-decoding, dspark and lfm2_lfm2_moe draft model, the lfm1.0 license, a 0.3B model size, the 'Inference Providers' section, and the card text 'LFM2.5-DSpark is a family of speculative-decoding draft models that adapt DSpark for the LFM2.5 architecture' (captured August 21, 2026).

Dua model yang benar-benar diterapkan

Singkirkan drafnya dan perbandingan yang sesungguhnya adalah antara model yang dipercepatnya dan model yang sudah ada. Keduanya berbobot terbuka dan kira-kira kelas 8B, dan di situlah kemiripan berakhir:

— Arsitektur — LFM2.5-8B-A1B adalah MoE jarang dengan total 8,3 miliar parameter tetapi hanya ~1,5 miliar yang aktif per token; Qwen3-8B adalah model padat 8,2 miliar yang mengaktifkan setiap parameter pada setiap token.

• Rilis — LFM2.5-8B-A1B dirilis pada 28 Mei 2026; Qwen3-8B dirilis pada April 2025 dan sudah berusia lebih dari satu tahun, sudah usang di beberapa platform penyajian.

• Konteks — LFM2.5-8B-A1B menawarkan konteks native 128K dengan kosakata 128K token; Qwen3-8B menawarkan native 32K, dapat diperluas hingga sekitar 128K melalui YaRN.

• Reasoning — LFM2.5-8B-A1B adalah model penalaran yang menghasilkan rantai pemikiran eksplisit; Qwen3-8B beralih antara mode berpikir dan mode non-berpikir sesuai permintaan.

• Intelijen — menurut Artificial Analysis, LFM2.5-8B-A1B memperoleh Intelligence Index 8 dan Qwen3-8B memperoleh 8–8.3, keduanya di bawah median 9 untuk model open-weight yang sebanding; tidak ada yang merupakan otak kelas frontier, dan keduanya jujur tentang hal itu.

• Kecepatan — menurut Artificial Analysis, LFM2.5-8B-A1B menghasilkan sekitar 340 token per detik di berbagai penyedia; Qwen3-8B berada di sekitar 37–40 token per detik, termasuk yang paling lambat di kelasnya.

• Lisensi — LFM2.5-8B-A1B berada di bawah Lisensi Terbuka LFM v1.0 milik Liquid; Qwen3-8B adalah Apache-2.0.

A comparison scoreboard for LFM2.5-8B-A1B and Qwen3-8B. The left column shows the Liquid model as an MoE with 8.3B total and 1.5B active parameters, 128K native context, an AA Intelligence Index of 8 (median 9), roughly 340 tokens per second across providers, the DSpark draft adding up to 3.18x on an H100 but only 1.18x on an M4 Max, and self-host-only availability. The right column shows Qwen3-8B as a dense 8.2B model, 32K native context extended to ~128K via YaRN, an AA Intelligence Index of 8-8.3, roughly 37-40 tokens per second, no draft needed, and availability through Alibaba's API plus many open hosts, with a footer reading 'LFM speedups vendor-measured Aug 20 2026, unreproduced; throughput per Artificial Analysis; Qwen3-8B per Alibaba' and the OrcaRouter logo in the bottom-right corner.

Kecepatan adalah di mana hal ini tidak lagi berimbang.

{{1}}Alasan terbesar mengapa perbincangan seputar model open-weight kelas 8B bergeser adalah kecepatan per unit memori.{{/1}} {{2}}Qwen3-8B adalah model dense: setiap token yang dihasilkannya mengalirkan seluruh 8,2 miliar bobot melewati bus memori, itulah sebabnya model ini lambat untuk ukurannya dan mengapa ia membutuhkan VRAM sungguhan.{{/2}} {{3}}LFM2.5-8B-A1B mengarahkan setiap token melalui sekitar 1,5 miliar parameter aktif, yang merupakan inti desainnya — sebuah MoE on-device yang tetap cepat dan ringkas.{{/3}} {{4}}Klaim Liquid sendiri melangkah lebih jauh: sekitar 253 token per detik pada CPU M5 Max dengan memori di bawah 6GB, sebagaimana dilaporkan vendor.{{/4}} {{5}}Dalam hal throughput mentah untuk model yang dapat diterapkan, draf bahkan tidak relevan untuk bagian cerita ini — MoE sudah beberapa kali lebih cepat daripada model dense 8B sebelum spekulasi ditambahkan.{{/5}}

Mengenai harga, keduanya adalah model open-weight, jadi menjalankan sendiri (self-host) salah satu dari keduanya hanya membutuhkan biaya sesuai perangkat keras yang Anda miliki. Perbandingan layanan terkelola (hosted) tidak seimbang dalam hal ketersediaan: Qwen3-8B dilayani oleh API Alibaba dengan harga terdaftar $0,18 per juta token masukan dan $2,10 per juta token keluaran, serta oleh berbagai host model terbuka pihak ketiga; LFM2.5-8B-A1B tidak memiliki penetapan harga token terkelola pihak pertama yang signifikan, dan versi drafnya tidak memiliki sama sekali. Artinya, cara praktis yang akan digunakan sebagian besar tim untuk menjalankan MoE edge Liquid saat ini adalah dengan self-host, di laptop, perangkat edge, atau GPU milik mereka sendiri — dan justru pengaturan itulah yang menjadikan draf DSpark sebagai variabel yang relevan.

Apa yang sebenarnya diubah oleh draf tersebut untuk keputusan ini.

Draf ini hanya mengubah satu poros: seberapa cepat LFM2.5-8B-A1B menghasilkan token dalam tumpukan server yang Anda kendalikan. Ini tidak membuat model lebih pintar, dan tidak mengubah apa yang dijawabnya — keluaran greedy identik bit-demi-bit dengan target saja. Yang dibantu adalah penyajian GPU pada throughput permintaan tunggal: Liquid mengukur rata-rata 2,54× pada satu H100 di lima tolok ukur (418 → 1.074 token per detik), dengan hasil terbaik 3,18× pada MATH500, pada ukuran batch 1 dan suhu 0. Yang hampir tidak terbantu adalah silikon Apple: model yang sama rata-rata hanya 1,18× pada M4 Max (90 → 106 tok/s), karena memverifikasi blok token draf mengaktifkan lebih banyak pakar di backend Metal MoE llama.cpp saat ini dan memindahkan lebih banyak lalu lintas bobot — biaya yang justru ingin diamortisasi oleh speculative decoding. Semua ini adalah angka vendor dari hari rilis, bukan hasil yang direproduksi secara independen.

Pembagian itu berkorespondensi langsung dengan {{1}}aturan keputusan{{/1}}. Jika Anda menjalankan LFM2.5-8B-A1B di GPU yang Anda miliki, draft tersebut merupakan pengungkit biaya yang nyata — sekitar 2,5× lebih banyak token per detik dari silikon yang sama, tanpa perubahan output sama sekali, dan Anda hanya perlu build dengan integrasi DSpark 20 Agustus. Jika Anda memanggil model melalui {{2}}API sebagai gantinya{{/2}}, penyedia layananlah yang memperoleh percepatan tersebut, dan draft menjadi tidak relevan bagi Anda. Dan jika perangkatnya adalah laptop atau ponsel, {{3}}draft untuk model khusus ini hampir tidak berdampak apa pun saat ini{{/3}}; yang memberikan kemenangan di perangkat adalah draft-draft saudaranya untuk model dense LFM2.5-1.2B-Instruct dan LFM2.5-2.6B, masing-masing sebesar 2,54× dan 2,27×. Adapun Qwen3-8B, ia tidak memerlukan draft sama sekali — ia hanyalah model yang lebih lambat dan lebih padat yang tidak memerlukan decoding spekulatif untuk dapat digunakan.

A screenshot of the Hugging Face model page for Qwen/Qwen3-8B, showing the TextGeneration tag, Transformers and Safetensors formats, the qwen3 conversational tag, the apache-2.0 license, and the Qwen3 Highlights describing the ability to switch seamlessly between thinking mode and non-thinking mode (captured August 18, 2026).

Pilihan, setahun dalam kehidupan Qwen3-8B.

Qwen3-8B adalah default yang membosankan namun tepat: matang, Apache-2.0, 119 bahasa, mode berpikir dan tidak berpikir, tersedia di mana-mana, dan masih menjadi generalis yang sangat baik untuk obrolan, kode, dan teks terstruktur. Masalahnya adalah usia dan kecepatan — 8B padat berusia 16 bulan yang lambat untuk kelasnya dan sudah tidak digunakan lagi di beberapa platform, yang merupakan sinyal pemeliharaan yang perlu dianggap serius jika Anda memulai proyek greenfield hari ini.

LFM2.5-8B-A1B adalah taruhan yang lebih baru dan lebih sempit: sebuah MoE edge-first yang dibangun untuk pemanggilan alat dan kepatuhan instruksi dengan cepat di perangkat keras konsumen, dengan DSpark draft sebagai peningkatan serving opsional untuk kasus self-host GPU. Ini bukan model yang lebih cerdas — keduanya berada di bawah median open-weights pada Artificial Analysis — tetapi ini jauh lebih cepat dengan memori per token yang jauh lebih kecil, yang merupakan trade-off yang penting bagi agen on-device. Kelemahannya adalah cerminan dari Qwen3-8B: rilis yang lebih muda, tanpa harga hosting first-party, dan kisah speculative-decoding yang angkanya belum direproduksi oleh siapa pun di luar vendor.

Lapisan routing di bawahnya tetap sama apa pun pilihannya. Baik LFM2.5-8B-A1B maupun Qwen3-8B saat ini tidak ada dalam katalog terhosting OrcaRouter, jadi penggambaran yang jujur adalah apa yang router lakukan untuk kombinasi ini: satu API untuk 200+ model terhosting dengan harga daftar penyedia diteruskan pada markup 0%, sehingga penurunan harga vendor langsung aktif di platform pada hari yang sama saat diumumkan; failover otomatis sehingga model baru yang belum teruji bisa Anda coba dengan lalu lintas nyata, bukan sesuatu yang Anda pertaruhkan untuk jalur produksi; dan DSL routing yang dapat menjadi antarmuka depan untuk model yang Anda host sendiri, yang merupakan cara tumpukan LFM2.5-8B-A1B yang di-host sendiri berdampingan dengan endpoint terhosting di balik satu kunci.

Jika Anda membangun untuk laptop atau edge box dan peduli pada kecepatan pemanggilan alat, LFM2.5-8B-A1B adalah arah yang perlu diuji, dan drafnya memberikan 2,5× gratis di jalur pelayanan GPU ketika saatnya tiba. Jika Anda menginginkan generalis yang tak perlu lagi Anda pikirkan, Qwen3-8B masih berfungsi — hanya saja ketahuilah bahwa itu adalah model dari awal 2025 yang mulai dipensiunkan ekosistemnya. Satu hal yang tidak diubah baik oleh draf maupun target adalah kondisi bukti yang jujur: segala sesuatu yang cepat dari rilis DSpark hanyalah pengukuran satu vendor pada satu hari, dan tolok ukur independen adalah item terbuka yang menentukan seberapa banyak dari ini yang benar-benar Anda percaya.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube