Kartu judul hero: 'Muse Glimmer — 230 Token/detik pada satu RTX 5090 — SGLang Day-0', dengan chip statistik yang menampilkan bobot terbuka dense 30B, Apache 2.0, dan dukungan SGLang day-0.
Guides & Insights

Muse Glimmer Mencapai 230 Token/detik pada Satu RTX 5090: Dukungan Day-0 SGLang Adalah Kisah Peluncuran yang Sebenarnya

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Dua ratus tiga puluh token per detik adalah angka yang cepat untuk model apa pun. Untuk Muse Glimmer — rilis open-weight dense 30B milik Meta dari Meta Superintelligence Labs, yang diluncurkan pada 10 Agustus 2026 di bawah lisensi Apache 2.0 — angka inilah yang membedakan model yang "berjalan di GPU saya" dari model yang "melayani agen sungguhan". SGLang mengumumkan dukungan day-0 untuk Muse Glimmer pada hari yang sama saat bobotnya dirilis, dan pengukuran yang dipublikasikannya pada satu GeForce RTX 5090 adalah 236,4 token per detik per pengguna pada batch 1, dengan kuantisasi NVFP4 dan drafter speculative-decoding DFlash milik Meta yang keduanya aktif.

Angka tunggal itu sudah menceritakan sebagian besar kisah dari rilis ini, tetapi ada baiknya kita pelan-pelan memeriksa sisanya, karena yang menarik bukanlah kecepatan yang menjadi judul utama. Yang menarik adalah model ini juga langsung berfungsi di RTX PRO 6000, di NVIDIA DGX Spark, dan di Apple silicon melalui MLX — dan bahwa SGLang menyebut karya ini sebagai kolaborasi dengan Meta Superintelligence Labs, bukan sekadar pelengkap komunitas. Ini adalah model Meta yang berdekatan dengan frontier pertama dalam waktu lama yang dirancang di sekitar stack serving, bukan hanya di sekitar bobotnya.

Apa arti sebenarnya dari "day-0 support" di sini

Dukungan Day-0 di SGLang v0.5.17 berarti model tidak sekadar ditambahkan belakangan: pekerjaan runtime masuk dalam jendela rilis yang sama dengan bobot, dengan jalur yang dirancang khusus untuk perangkat keras yang benar-benar ditargetkan Meta. Backend SM120 SGLang mencakup lini desktop dan workstation Blackwell — RTX 5090, RTX PRO 6000, dan DGX Spark semuanya berjalan di jalur optimal yang sama — sementara silikon Apple mendapatkan backend MLX asli, bukan port yang lambat.

Tumpukan (stack) yang disetel oleh SGLang dan Meta ini bersifat spesifik. Model ini berjalan sebagai checkpoint NVFP4 18GB yang dipasangkan dengan drafter DFlash BF16 5GB, yaitu model pendamping speculative decoding yang dilatih Meta untuk Muse Glimmer. Kombinasi tersebut muat di dalam kartu 32GB dengan sisa ruang, dan keseluruhan jalur kuantisasi campuran NVFP4-plus-MXFP8 mencapai sekitar 19.5GB di memori. Di sisi SGLang, catatan rilis menyebut tiga mekanisme keandalan sebagai bagian dari cerita yang sama: DFlash speculative decoding, RadixAttention untuk caching prefiks, dan CUDA graphs yang dapat diinterupsi.

Angka tersebut, dan apa itu serta apa yang bukan.

Angka-angka RTX 5090 yang dipublikasikan SGLang, semuanya dengan jalur NVFP4 dan SM120, rinciannya sebagai berikut:

• Dekode pengguna tunggal (batch 1) — 63.9 token/detik standar, 236.4 token/detik dengan decoding spekulatif DFlash. Peningkatan 3.7x itu adalah angka interaktif, angka yang menentukan apakah agen lokal terasa seperti percakapan atau seperti antrean.

• Output agregat (batch 8) — 501 token/detik standar, 1.452 token/detik dengan DFlash. Ini adalah angka throughput untuk server lokal yang melayani beberapa permintaan sekaligus.

• Sebagai perbandingan, GGUF q4_k_m pada GPU yang sama — jalur yang paling banyak digunakan orang dengan runtime bergaya llama.cpp — mencapai 72,6 token/detik standar dan 140,7 token/detik dengan DFlash. Jalur NVFP4 jelas lebih unggul.

Ini adalah angka yang dipublikasikan oleh SGLang dan Meta pada hari peluncuran, bukan reproduksi independen — label yang jujur adalah dilaporkan oleh vendor dan framework, dan verifikasi komunitas akan hadir dalam beberapa minggu ke depan. Tetapi pola di antara dua stack yang mengumumkan angka tersebut konsisten. Di llama.cpp, Meta melaporkan 74.9 hingga 233.4 token/s pada RTX 5090 dengan DFlash, peningkatan 3.1x; M5 Max naik dari 26.6 menjadi 50.2; M4 Max dari 23.7 menjadi 37.8. Dua runtime berbeda, dua gaya pengukuran berbeda, kisaran yang sama: model 30B yang melakukan decoding pada 200+ token per detik pada satu GPU konsumen, dan DFlash yang kira-kira melipattigakan throughput pada setiap pengaturan Nvidia yang telah memublikasikan angka.

Mengapa "serves" lebih penting daripada "runs"

{{1}}Blog perangkat keras Meta membuat klaim yang lebih tajam daripada angka desktop.{{/1}} Pada NVIDIA Blackwell Ultra — generasi pusat data, bukan {{2}}kartu desktop{{/2}} — blog tersebut menyebutkan lebih dari 20.000 token per detik per GPU pada BF16/NVF4, dengan SGLang dan vLLM keduanya disebut sebagai tumpukan sumber terbuka yang didukung. Itu adalah liga yang berbeda, dan {{3}}itulah petunjuk tentang apa yang sebenarnya sedang dibangun Meta{{/3}}: bobot yang sama dimaksudkan untuk {{4}}berjalan di mana saja mulai dari laptop hingga rak server GPU{{/4}}, dan kerangka kerja penyajian diperlakukan sebagai kelas satu sejak hari pertama daripada sebagai port yang akan ditulis nanti.

Bagian keandalan dari cerita ini sama pentingnya dengan kecepatan. Agen lokal yang mati di tengah tugas karena lapisan serving tersendat tidaklah lebih baik secara bermakna daripada agen cloud yang terkena rate-limit. Mekanisme dalam day-0 stack — speculative decoding yang dapat diinterupsi, prefix caching yang menjaga konteks agen yang panjang tetap murah untuk dimasuki ulang, dan drafter yang disetel ke model dasar — justru merupakan bagian-bagian yang membuat agen lokal always-on dapat bertahan. Inilah "kecepatan dan keandalan" yang selama ini ditunjuk oleh peluncuran tersebut, dan ini adalah posisi rekayasa yang nyata, bukan frasa pemasaran.

A single-model speed board for Muse Glimmer: batch-1 decode 63.9 to 236.4 tok/s with DFlash, batch-8 output 501 to 1,452 tok/s, GGUF q4_k_m 72.6 to 140.7 tok/s, 128K context window, 18GB checkpoint plus 5GB drafter, runs on RTX 5090, RTX PRO 6000, DGX Spark and Mac. Footer: SGLang/NVIDIA-reported, launch day.

Apa yang sebenarnya dapat Anda lakukan dengannya

Muse Glimmer adalah model multimodal dense 30B — masukan teks dan gambar melalui encoder persepsi yang dibekukan, keluaran teks — dilatih pada lebih dari 100 bahasa, dengan jendela konteks 131.072 token dan batas pengetahuan 4 Januari 2026. Tugas utamanya adalah pekerjaan agen yang tidak glamor: pemanggilan fungsi, penggunaan alat, manajemen jadwal dan berkas, evaluasi LLM-as-a-judge, dan tugas multi-langkah dengan pemulihan kegagalan — ketika panggilan alat gagal, model dilatih untuk mendiagnosis dan mencoba ulang daripada berhenti. Model ini mengekspos tingkat upaya penalaran (low hingga xhigh) yang Anda atur dalam prompt sistem, yang merupakan cara Anda menukar latensi dengan kedalaman pada bobot yang sama.

Angka 230 token per detik inilah yang membuat semua itu dapat digunakan pada satu mesin. Di bawah sekitar 50 token/detik, agen interaktif terasa seperti sesi debugging jarak jauh; pada 200 atau lebih, terasa seperti alat lokal. Itulah keseluruhan argumen untuk model dalam satu angka, dan itulah alasan daftar perangkat keras — RTX 5090, RTX PRO 6000, DGX Spark, MLX Macs — terbaca seperti panduan belanja untuk era agen lokal alih-alih catatan kaki kompatibilitas.

Berapa biayanya

Muse Glimmer itu sendiri gratis — bobot Apache 2.0 di Hugging Face di meta-models/Muse-Glimmer-30B, dengan kuantisasi GGUF yang sudah diterbitkan untuk runtime bergaya llama.cpp dan tanpa API Meta publik. Biaya sebenarnya adalah perangkat keras di baliknya: checkpoint NVFP4 18GB ditambah drafter 5GB berarti Anda membutuhkan kartu 24GB atau 32GB, atau Mac seri-M kelas atas. Jika Anda sudah memilikinya, biaya marjinal untuk agen lokal yang selalu aktif hanyalah listrik. Jika tidak, GPU adalah item barisnya, dan itulah cara jujur untuk membandingkan "model gratis" dengan API yang dihosting.

Saat Anda membuat perbandingan itu, hitung harga kedua sisi secara jujur. Di OrcaRouter, harga yang Anda lihat untuk salah satu dari lebih dari 200 model yang dihosting adalah harga daftar penyedia yang diteruskan tanpa markup (0%), jadi pemotongan harga dari vendor berlaku di sini pada hari yang sama — yang menjaga perhitungan lokal-vs-hosted tetap jujur. Muse Glimmer sendiri saat ini tidak ada di OrcaRouter, karena belum ada penyedia inferensi yang menyediakannya; model ini dikirim sebagai unduhan. Begitu penyedia mulai menyediakannya, kunci yang sama yang menjangkau seluruh katalog juga akan menjangkaunya, dan failover otomatis adalah mekanisme yang membuat aman untuk mengarahkan lalu lintas produksi ke model baru yang dilaporkan vendor sebelum model tersebut memiliki rekam jejak independen.

Screenshot of the NVIDIA Developer blog 'Run Local AI Agentic Workflows with Meta's Muse Glimmer', describing the 30B open-weight dense model with a 120K+ context window and quoting 20K tokens/sec on a single GPU for always-on local agents.

Kisah yang lebih besar di balik kecepatan.

Jadikan pekerjaan SGLang day-0 sebagai sinyal, dan rilis ini bukan lagi sekadar model tunggal. Muse Glimmer adalah versi distilasi dari model flagship proprietary milik Meta, Muse Spark 1.2, dan Meta telah menyatakan bahwa bobot sang guru akan hadir "dalam beberapa pekan ke depan." Agen lokal 30B dengan tumpukan serving yang telah disetel, model guru yang akan segera menjadi open, dan dana komunitas senilai $1 miliar yang diumumkan bersamaan dengannya — itu bukan rilis poin. Itu adalah ujung tipis dari jajaran open-weight yang secara langsung menyasar pasar agen lokal, dan dukungan framework yang hadir di hari pertama adalah bagian yang menunjukkan bahwa Meta berniat agar orang benar-benar menjalankannya, bukan sekadar mengunduhnya.

Peringatan yang perlu diingat: setiap angka kecepatan dan benchmark yang terkait dengan peluncuran ini sejauh ini dilaporkan oleh vendor atau framework. Angka throughput konsisten di dua stack independen, yang meyakinkan, tetapi benchmarking independen, entri Artificial Analysis, dan reproduksi dunia nyata akan mengonfirmasi cerita 230 token per detik — dan hal-hal itu biasanya muncul dalam hitungan minggu setelah rilis seperti ini.

Apa yang perlu diperhatikan, secara kasar menurut urutan kecepatan: rilis open-weights Muse Spark 1.2 (pembacaan strategis tentang "Meta kembali" bergantung padanya); reproduksi throughput independen pertama pada perangkat keras non-Nvidia, di mana jalur MLX adalah yang perlu diperhatikan; dan penyedia inferensi pertama yang menghadirkan endpoint Glimmer — yang menjadi momen ketika argumen "model lokal gratis" dan "API yang dihosting" tidak lagi hipotetis dan menjadi pilihan yang dapat Anda buat dengan satu tombol.

Screenshot of the Hugging Face model card for meta-models/Muse-Glimmer-30B, showing the Apache 2.0 license, 30B parameter size, Meta Superintelligence Lab authorship, and the model's purpose-built local-agentic description.
© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube