
Muse Glimmer Mencapai 230 Token/detik pada Satu RTX 5090: Dukungan Day-0 SGLang Adalah Kisah Peluncuran yang Sebenarnya
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0856Kecerdasan72Koding
Dua ratus tiga puluh token per detik adalah angka yang cepat untuk model apa pun. Untuk Muse Glimmer — rilis open-weight dense 30B milik Meta dari Meta Superintelligence Labs, yang diluncurkan pada 10 Agustus 2026 di bawah lisensi Apache 2.0 — angka inilah yang membedakan model yang "berjalan di GPU saya" dari model yang "melayani agen sungguhan". SGLang mengumumkan dukungan day-0 untuk Muse Glimmer pada hari yang sama saat bobotnya dirilis, dan pengukuran yang dipublikasikannya pada satu GeForce RTX 5090 adalah 236,4 token per detik per pengguna pada batch 1, dengan kuantisasi NVFP4 dan drafter speculative-decoding DFlash milik Meta yang keduanya aktif.
Angka tunggal itu sudah menceritakan sebagian besar kisah dari rilis ini, tetapi ada baiknya kita pelan-pelan memeriksa sisanya, karena yang menarik bukanlah kecepatan yang menjadi judul utama. Yang menarik adalah model ini juga langsung berfungsi di RTX PRO 6000, di NVIDIA DGX Spark, dan di Apple silicon melalui MLX — dan bahwa SGLang menyebut karya ini sebagai kolaborasi dengan Meta Superintelligence Labs, bukan sekadar pelengkap komunitas. Ini adalah model Meta yang berdekatan dengan frontier pertama dalam waktu lama yang dirancang di sekitar stack serving, bukan hanya di sekitar bobotnya.
Apa arti sebenarnya dari "day-0 support" di sini
Dukungan Day-0 di SGLang v0.5.17 berarti model tidak sekadar ditambahkan belakangan: pekerjaan runtime masuk dalam jendela rilis yang sama dengan bobot, dengan jalur yang dirancang khusus untuk perangkat keras yang benar-benar ditargetkan Meta. Backend SM120 SGLang mencakup lini desktop dan workstation Blackwell — RTX 5090, RTX PRO 6000, dan DGX Spark semuanya berjalan di jalur optimal yang sama — sementara silikon Apple mendapatkan backend MLX asli, bukan port yang lambat.
Tumpukan (stack) yang disetel oleh SGLang dan Meta ini bersifat spesifik. Model ini berjalan sebagai checkpoint NVFP4 18GB yang dipasangkan dengan drafter DFlash BF16 5GB, yaitu model pendamping speculative decoding yang dilatih Meta untuk Muse Glimmer. Kombinasi tersebut muat di dalam kartu 32GB dengan sisa ruang, dan keseluruhan jalur kuantisasi campuran NVFP4-plus-MXFP8 mencapai sekitar 19.5GB di memori. Di sisi SGLang, catatan rilis menyebut tiga mekanisme keandalan sebagai bagian dari cerita yang sama: DFlash speculative decoding, RadixAttention untuk caching prefiks, dan CUDA graphs yang dapat diinterupsi.
Angka tersebut, dan apa itu serta apa yang bukan.
Angka-angka RTX 5090 yang dipublikasikan SGLang, semuanya dengan jalur NVFP4 dan SM120, rinciannya sebagai berikut:
• Dekode pengguna tunggal (batch 1) — 63.9 token/detik standar, 236.4 token/detik dengan decoding spekulatif DFlash. Peningkatan 3.7x itu adalah angka interaktif, angka yang menentukan apakah agen lokal terasa seperti percakapan atau seperti antrean.
• Output agregat (batch 8) — 501 token/detik standar, 1.452 token/detik dengan DFlash. Ini adalah angka throughput untuk server lokal yang melayani beberapa permintaan sekaligus.
• Sebagai perbandingan, GGUF q4_k_m pada GPU yang sama — jalur yang paling banyak digunakan orang dengan runtime bergaya llama.cpp — mencapai 72,6 token/detik standar dan 140,7 token/detik dengan DFlash. Jalur NVFP4 jelas lebih unggul.
Ini adalah angka yang dipublikasikan oleh SGLang dan Meta pada hari peluncuran, bukan reproduksi independen — label yang jujur adalah dilaporkan oleh vendor dan framework, dan verifikasi komunitas akan hadir dalam beberapa minggu ke depan. Tetapi pola di antara dua stack yang mengumumkan angka tersebut konsisten. Di llama.cpp, Meta melaporkan 74.9 hingga 233.4 token/s pada RTX 5090 dengan DFlash, peningkatan 3.1x; M5 Max naik dari 26.6 menjadi 50.2; M4 Max dari 23.7 menjadi 37.8. Dua runtime berbeda, dua gaya pengukuran berbeda, kisaran yang sama: model 30B yang melakukan decoding pada 200+ token per detik pada satu GPU konsumen, dan DFlash yang kira-kira melipattigakan throughput pada setiap pengaturan Nvidia yang telah memublikasikan angka.
Mengapa "serves" lebih penting daripada "runs"
{{1}}Blog perangkat keras Meta membuat klaim yang lebih tajam daripada angka desktop.{{/1}} Pada NVIDIA Blackwell Ultra — generasi pusat data, bukan {{2}}kartu desktop{{/2}} — blog tersebut menyebutkan lebih dari 20.000 token per detik per GPU pada BF16/NVF4, dengan SGLang dan vLLM keduanya disebut sebagai tumpukan sumber terbuka yang didukung. Itu adalah liga yang berbeda, dan {{3}}itulah petunjuk tentang apa yang sebenarnya sedang dibangun Meta{{/3}}: bobot yang sama dimaksudkan untuk {{4}}berjalan di mana saja mulai dari laptop hingga rak server GPU{{/4}}, dan kerangka kerja penyajian diperlakukan sebagai kelas satu sejak hari pertama daripada sebagai port yang akan ditulis nanti.
Bagian keandalan dari cerita ini sama pentingnya dengan kecepatan. Agen lokal yang mati di tengah tugas karena lapisan serving tersendat tidaklah lebih baik secara bermakna daripada agen cloud yang terkena rate-limit. Mekanisme dalam day-0 stack — speculative decoding yang dapat diinterupsi, prefix caching yang menjaga konteks agen yang panjang tetap murah untuk dimasuki ulang, dan drafter yang disetel ke model dasar — justru merupakan bagian-bagian yang membuat agen lokal always-on dapat bertahan. Inilah "kecepatan dan keandalan" yang selama ini ditunjuk oleh peluncuran tersebut, dan ini adalah posisi rekayasa yang nyata, bukan frasa pemasaran.

Apa yang sebenarnya dapat Anda lakukan dengannya
Muse Glimmer adalah model multimodal dense 30B — masukan teks dan gambar melalui encoder persepsi yang dibekukan, keluaran teks — dilatih pada lebih dari 100 bahasa, dengan jendela konteks 131.072 token dan batas pengetahuan 4 Januari 2026. Tugas utamanya adalah pekerjaan agen yang tidak glamor: pemanggilan fungsi, penggunaan alat, manajemen jadwal dan berkas, evaluasi LLM-as-a-judge, dan tugas multi-langkah dengan pemulihan kegagalan — ketika panggilan alat gagal, model dilatih untuk mendiagnosis dan mencoba ulang daripada berhenti. Model ini mengekspos tingkat upaya penalaran (low hingga xhigh) yang Anda atur dalam prompt sistem, yang merupakan cara Anda menukar latensi dengan kedalaman pada bobot yang sama.
Angka 230 token per detik inilah yang membuat semua itu dapat digunakan pada satu mesin. Di bawah sekitar 50 token/detik, agen interaktif terasa seperti sesi debugging jarak jauh; pada 200 atau lebih, terasa seperti alat lokal. Itulah keseluruhan argumen untuk model dalam satu angka, dan itulah alasan daftar perangkat keras — RTX 5090, RTX PRO 6000, DGX Spark, MLX Macs — terbaca seperti panduan belanja untuk era agen lokal alih-alih catatan kaki kompatibilitas.
Berapa biayanya
Muse Glimmer itu sendiri gratis — bobot Apache 2.0 di Hugging Face di meta-models/Muse-Glimmer-30B, dengan kuantisasi GGUF yang sudah diterbitkan untuk runtime bergaya llama.cpp dan tanpa API Meta publik. Biaya sebenarnya adalah perangkat keras di baliknya: checkpoint NVFP4 18GB ditambah drafter 5GB berarti Anda membutuhkan kartu 24GB atau 32GB, atau Mac seri-M kelas atas. Jika Anda sudah memilikinya, biaya marjinal untuk agen lokal yang selalu aktif hanyalah listrik. Jika tidak, GPU adalah item barisnya, dan itulah cara jujur untuk membandingkan "model gratis" dengan API yang dihosting.
Saat Anda membuat perbandingan itu, hitung harga kedua sisi secara jujur. Di OrcaRouter, harga yang Anda lihat untuk salah satu dari lebih dari 200 model yang dihosting adalah harga daftar penyedia yang diteruskan tanpa markup (0%), jadi pemotongan harga dari vendor berlaku di sini pada hari yang sama — yang menjaga perhitungan lokal-vs-hosted tetap jujur. Muse Glimmer sendiri saat ini tidak ada di OrcaRouter, karena belum ada penyedia inferensi yang menyediakannya; model ini dikirim sebagai unduhan. Begitu penyedia mulai menyediakannya, kunci yang sama yang menjangkau seluruh katalog juga akan menjangkaunya, dan failover otomatis adalah mekanisme yang membuat aman untuk mengarahkan lalu lintas produksi ke model baru yang dilaporkan vendor sebelum model tersebut memiliki rekam jejak independen.

Kisah yang lebih besar di balik kecepatan.
Jadikan pekerjaan SGLang day-0 sebagai sinyal, dan rilis ini bukan lagi sekadar model tunggal. Muse Glimmer adalah versi distilasi dari model flagship proprietary milik Meta, Muse Spark 1.2, dan Meta telah menyatakan bahwa bobot sang guru akan hadir "dalam beberapa pekan ke depan." Agen lokal 30B dengan tumpukan serving yang telah disetel, model guru yang akan segera menjadi open, dan dana komunitas senilai $1 miliar yang diumumkan bersamaan dengannya — itu bukan rilis poin. Itu adalah ujung tipis dari jajaran open-weight yang secara langsung menyasar pasar agen lokal, dan dukungan framework yang hadir di hari pertama adalah bagian yang menunjukkan bahwa Meta berniat agar orang benar-benar menjalankannya, bukan sekadar mengunduhnya.
Peringatan yang perlu diingat: setiap angka kecepatan dan benchmark yang terkait dengan peluncuran ini sejauh ini dilaporkan oleh vendor atau framework. Angka throughput konsisten di dua stack independen, yang meyakinkan, tetapi benchmarking independen, entri Artificial Analysis, dan reproduksi dunia nyata akan mengonfirmasi cerita 230 token per detik — dan hal-hal itu biasanya muncul dalam hitungan minggu setelah rilis seperti ini.
Apa yang perlu diperhatikan, secara kasar menurut urutan kecepatan: rilis open-weights Muse Spark 1.2 (pembacaan strategis tentang "Meta kembali" bergantung padanya); reproduksi throughput independen pertama pada perangkat keras non-Nvidia, di mana jalur MLX adalah yang perlu diperhatikan; dan penyedia inferensi pertama yang menghadirkan endpoint Glimmer — yang menjadi momen ketika argumen "model lokal gratis" dan "API yang dihosting" tidak lagi hipotetis dan menjadi pilihan yang dapat Anda buat dengan satu tombol.

