Kartu judul Muse Glimmer: model agen open-weight 30B milik Meta untuk GPU lokal, dengan chip bertuliskan Apache 2.0, Cocok untuk GPU 24-32 GB, dan Disuling dari Muse Spark 1.2.
Guides & Insights

Muse Glimmer: Model Agen Open-Weight 30B Meta Mengklaim Mengalahkan Gemma4-31B dan Qwen3.6-27B

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Satu unggahan X pada pagi 10 Agustus 2026 mengatakannya lebih blak-blakan daripada siaran pers mana pun: "Meta suci sudah kembali." Rilis yang ditanggapi unggahan itu — Muse Glimmer, model open-weight pertama Meta sejak Llama 4 — hadir di hari yang sama, dan pengumuman Meta sendiri hampir seagresif cuitan tersebut. Tabel tolok ukur model 30 miliar parameter itu mengklaim mengungguli Gemma4-31B milik Google pada 19 dari 24 baris dan Qwen3.6-27B milik Alibaba pada 14 dari 24, dengan tajuk utama tolok ukur agen MCP-Atlas, di mana Meta melaporkan 75,5 berbanding 54,2 dan 62,5 masing-masing.

Sebelum "smoked" menjadi fakta di kepala Anda, perhatikan siapa yang memproduksi angka-angka tersebut. Setiap skor dalam tabel Meta dijalankan oleh Meta sendiri, terhadap model-model pesaing yang pengaturannya—diakui Meta sendiri—tidak ia sesuaikan. Muse Glimmer belum memiliki entri di Artificial Analysis, papan peringkat independen yang memang melacak kelas ukuran persis ini—di mana Qwen3.6-27B saat ini memegang Intelligence Index 46 dan Gemma4-31B berada di angka 39. Maka ini adalah dua cerita sekaligus: rilis open-weight dari Meta yang benar-benar konsekuensial, dan klaim benchmark yang butuh berminggu-minggu untuk diverifikasi. Tulisan ini menjaga keduanya tetap terpisah.

Apa sebenarnya Muse Glimmer itu

Muse Glimmer adalah model multimodal dense 30B — masukan teks plus gambar melalui encoder persepsi khusus — yang dilatih pada lebih dari 100 bahasa dan dirilis di bawah lisensi Apache 2.0 yang permisif. Bobotnya tersedia di Hugging Face pada meta-models/Muse-Glimmer-30B. Ini adalah versi terdistilasi dari model unggulan kepemilikan Meta yang lebih besar, Muse Spark 1.2, dan resep pelatihannya menunjukkan hal tersebut: distilasi logit dari guru pada pra-pelatihan, pelatihan tengah pada data berkonteks lebih panjang dan sarat agen, lalu fine-tuning terawasi yang dikombinasikan dengan distilasi on-policy dan pembelajaran penguatan.

Ringkasan produk ini sama spesifiknya dengan teknologinya. Meta membangun Glimmer untuk "alur kerja agen lokal yang selalu aktif" — sebuah agen yang hidup di mesin Anda dan dapat memanggil alat, mengikuti rencana multi-langkah, pulih ketika panggilan alat gagal alih-alih berhenti, serta menaikkan atau menurunkan upaya penalaran. Pekerjaan yang dituju adalah yang tidak glamor: pengkodean lokal, pemanggilan fungsi, manajemen jadwal, organisasi berkas, evaluasi LLM-as-a-judge. Ini kompatibel dengan kerangka orkestrasi agen seperti OpenClaw, yang merupakan cara banyak orang akan benar-benar menjalankannya.

Kisah perangkat keras adalah separuh lainnya dari presentasi ini. Pada presisi penuh, model 30B membutuhkan lebih dari 55GB memori; kuantisasi ~4-bit dari Meta menjadikannya sekitar 17–20GB, yang muat di kartu konsumen 24GB atau 32GB (RTX 5090 adalah referensinya) dan Mac kelas atas dengan memori terpadu. Sebuah drafter speculative-decoding — model pendamping kecil yang disebut Meta sebagai DFlash — mempercepat pembuatan: Meta melaporkan sekitar 3.1x pada RTX 5090 (dari 74.9 menjadi 233 token/detik di llama.cpp), 1.8x pada M5 Max, dan 1.5x pada M4 Max, di mana memori terpadu sudah tidak terlalu dibatasi bandwidth.

Mengapa rilis ini berarti lebih dari sekadar lembar spesifikasi

Cuitan itu tepat menggambarkan situasinya. Sejak Llama 4 pada musim semi 2025, Meta telah bungkam soal bobot terbuka, mundur ke jalur frontier proprietary di bawah Meta Superintelligence Labs dan Chief AI Officer Alexandr Wang. Muse Glimmer adalah kembalinya secara publik ke strategi bobot terbuka yang menjadikan Llama keluarga model AI paling banyak diunduh — dan kedatangannya dibalut dengan sinyal niat terkuat sejauh ini: Zuckerberg menerbitkan esai 14 halaman berjudul "Masa Depan untuk Semua," bersamaan dengan peluncuran, yang berargumen bahwa risiko AI yang sebenarnya adalah kendali yang terpusat dan bahwa bobot terbuka adalah cara Amerika tetap kompetitif dengan laboratorium model terbuka Tiongkok. Ia menyerukan regulasi AS yang lebih longgar terhadap AI sumber terbuka, dan Meta mengumumkan "Dana Masa Depan untuk Semua" senilai $1 miliar. Meta juga mengatakan berencana merilis bobot Muse Spark 1.2 yang jauh lebih besar "dalam beberapa minggu mendatang."

Konteks tersebut mengubah cara Anda membaca tabel benchmark. Ini bukan sekadar keingintahuan lab penelitian yang dirilis diam-diam; ini adalah pernyataan strategi dengan sebuah model yang dilampirkan. Glimmer adalah posisi "agen lokal murah" dalam lini produk Meta, yang secara sengaja melemahkan argumen bahwa pekerjaan agen yang serius memerlukan API cloud. Apakah Glimmer benar-benar memenuhi hal itu adalah persis apa yang menjadi pertanyaan verifikasi.

Three-way scoreboard comparing Muse Glimmer, Gemma4-31B and Qwen3.6-27B: MCP-Atlas 75.5/54.2/62.5, DeepSearch QA 74.6/61.7/71.1, GAIA2 43.3/36.4/40.0, SWE-Bench Pro 51.2/36.9/50.2, TerminalBench 2.1 51.7/--/60.7, and AA Intelligence Index --/39/46. Footer: rows 1-5 vendor-reported by Meta; AA Index per Artificial Analysis (no Muse Glimmer entry yet).

Klaim "smoked", baris demi baris

Tabel Meta membandingkan Muse Glimmer dengan Gemma4-31B dan Qwen3.6-27B pada 24 baris benchmark. Di mana ia mengklaim kemenangan terbesar, polanya konsisten: penalaran agenik umum dan pencarian.

• MCP-Atlas (penggunaan alat agen) — Muse Glimmer 75.5, Gemma4-31B 54.2, Qwen3.6-27B 62.5. Ini adalah baris utama dan kesenjangan terbesar dari set ini.

• DeepSearch QA — 74.6 berbanding 61.7 dan 71.1.

• GAIA2 (asisten umum) — 43.3 dibandingkan dengan 36.4 dan 40.0.

• WildClawBench (rangkaian agentik) — 47.6 berbanding 37.6 dan 43.2.

• SWE-Bench Pro — 51.2 dibanding 36.9 dan 50.2. Perhatikan angka ketiga: 50.2 adalah pengukuran Meta sendiri terhadap Qwen3.6-27B, sementara angka yang dipublikasikan Alibaba sendiri adalah 53.5. Model yang sama, dua skor berbeda tergantung siapa yang menjalankannya.

• AIME 2026 — 94.7, IFBench 77.0, dan AA-LCR 80.0 dibandingkan dengan 68.3 milik Ge​mma.

Itu adalah deretan yang kuat. Namun tabel tidak sepenuhnya bersih, dan baris-baris di mana Muse Glimmer kalah sama informatifnya dengan baris-baris di mana ia menang. Qwen3.6-27B menguasai bidang penggunaan komputer langsung dan pekerjaan berat terminal: SWE-Bench Verified 77.2 berbanding 76.0 milik Glimmer, OSWorld-Verified 75.6 berbanding 65.9, dan TerminalBench 2.1 60.7 berbanding 51.7, plus keunggulan konsisten pada tes multimodal seperti ScreenSpot Pro, OmniDocBench, dan MMMU-Pro. Gemma4-31B, di sisi lain, mencatat rekor keselamatan yang lebih baik pada dua metrik yang dilaporkan Meta — tingkat pelanggaran terendah di CI Memories dan tingkat keberhasilan serangan terendah di Siren AgentDojo — dan unggul tipis pada tes penalaran yang sempit (GPQA Diamond, Humanity's Last Exam).

Dibaca apa adanya, klaim Meta adalah "mengalahkan dua lainnya di sebagian besar tolok ukur agentik," dan pada tabelnya sendiri itu kira-kira benar. Catatan-catatannya justru intinya. Meta menjalankan setiap baris sendiri dan mengakui bahwa pengaturan pengujiannya untuk model-model rival tidak disetel seperti pengaturan mereka sendiri. Ini bukan tuduhan penipuan — pengaturan rival yang tidak disetel adalah dosa rutin, bahkan diharapkan, dalam industri ini — tetapi justru itulah alasan tabel yang dijalankan vendor memerlukan konfirmasi independen. Perbedaan Q​wen SWE-Bench Pro di atas adalah seluruh masalah dalam bentuk mini.

Apa yang dikatakan papan skor independen

Artificial Analysis belum mencantumkan Muse Glimmer — model itu baru berumur beberapa hari, dan indeks AA dibangun dari hasil uji coba sendiri yang membutuhkan waktu. Namun AA memang melacak kedua pesaing tersebut, yang memberi Anda gambaran terukur tentang bidang yang diklaim akan dimasuki pendatang baru ini. Pada indeks saat ini, Qwen3.6-27B memiliki Intelligence Index 46, yang oleh AA digambarkan sebagai model open-weights paling cerdas di bawah 150B parameter; Gemma4-31B berada di angka 39. Itu adalah angka independen, bukan klaim vendor.

Gambaran independen juga menunjukkan kerumitan biaya yang tidak terlihat dari angka-angka utama. Data efisiensi AA menunjukkan Qwen3.6-27B menghasilkan sekitar 54,6 token/detik dibandingkan Gemma4-31B yang 34,8, dengan waktu-ke-token-pertama Gemma lebih cepat — tetapi Qwen menggunakan sekitar 3,7x lebih banyak token keluaran untuk menjalankan indeks penuh, yang membuatnya sekitar 21x lebih mahal untuk dievaluasi dari ujung ke ujung. Model yang boros token lebih mahal di dunia nyata bahkan ketika skor tolok ukurnya lebih baik, dan itu adalah masukan keputusan yang tidak akan diungkapkan oleh tabel vendor mana pun.

Jadi keadaan dunia yang sebenarnya pada saat penulisan ini adalah: hasil kuat yang dilaporkan vendor, belum ada hasil independen sama sekali untuk Muse Glimmer, dan bidang pesaing yang diukur secara independen dan terbagi berdasarkan tugas. "Mengalahkan Ge​mma dan Q​wen" adalah klaim yang memiliki reputasi baik; ini belum menjadi hasil yang terverifikasi. Penanda verifikasi yang perlu diperhatikan adalah entri indeks AA, Elo LMArena, dan reproduksi komunitas — semua biasanya muncul dalam hitungan minggu setelah rilis seperti ini.

Screenshot of Artificial Analysis' Small Open Source Models comparison page, showing the 4B-40B open-weight class with Openness and Intelligence index columns and the header noting that Qwen3.6-27B and Qwen3.5-27B are the highest-intelligence small open-source models.

Berapa biaya sebenarnya untuk menjalankannya

Muse Glimmer gratis — Apache 2.0, tanpa biaya per token, tanpa pembayaran kepada Meta. Biayanya terletak pada perangkat keras yang Anda sediakan. Model 30B pada 4-bit membutuhkan sekitar 17–20GB memori residen ditambah ruang untuk KV cache, encoder persepsi, dan drafter DFlash. Itulah sebabnya rekomendasi Meta sendiri adalah kartu grafis 24GB atau 32GB, atau Mac kelas atas. Jika Anda memiliki perangkat keras tersebut, biaya marjinal untuk menjalankan agen lokal yang selalu aktif pada dasarnya hanyalah listrik. Jika tidak, GPU 24GB atau Mac M-series dengan konfigurasi tertinggi adalah pos pengeluaran yang nyata — dan sejak 9 Agustus ada opsi ketiga: menyewanya. Daftar API hosted pertama, yang aktif sejak tanggal tersebut, mematok harga Muse Glimmer sebesar $0,35 per juta token masukan dan $1,50 per juta token keluaran pada jendela konteks 131K. Itu adalah tarif marketplace yang dicantumkan penyedia, bukan harga Meta, tetapi itulah angka yang benar-benar dapat Anda bayar hari ini jika Anda lebih memilih tidak membeli perangkat keras.

Itulah perbandingan yang layak dibuat dengan cermat, karena "open weights, harga nol" bertemu dengan "API ter-host, harga per token" dengan ketentuan yang sangat berbeda. Saat Anda menghitung angkanya, beri harga kedua belah pihak secara jujur. Di sisi kami di OrcaRouter, harga yang Anda lihat untuk salah satu dari 200+ model ter-host adalah harga daftar penyedia yang diteruskan dengan markup 0%, sehingga pemotongan harga dari vendor langsung berlaku di sini pada hari yang sama, bukan setelah perhitungan ulang margin — yang membuat perbandingan lokal vs. ter-host menjadi lurus. Muse Glimmer sendiri belum menjadi salah satu dari 200+ model tersebut, jadi penerusan itu tidak berlaku untuknya hari ini. Tetapi disiplin itulah intinya: cara memberi harga pada model open-weight yang belum terbukti adalah lalu lintas Anda sendiri, bukan tabel vendor, dan DSL routing ada untuk menjalankan perbandingan itu tepat setelah sebuah model berada di belakang API yang dapat Anda panggil.

Cara kamu benar-benar menggunakannya minggu ini

Karena dirilis sebagai open weights, "akses" bukanlah pendaftaran — melainkan unduhan. Repositori utamanya adalah meta-models/Muse-Glimmer-30B di Hugging Face, dengan varian GGUF yang sudah dipublikasikan dan varian kuantisasi yang berdatangan dari pihak ketiga. Dukungan runtime hari pertama adalah llama.cpp, MLX, dan ExecuTorch, dengan integrasi Ollama, LM Studio, vLLM, dan SGLang yang tersedia beberapa hari setelah rilis, serta pekerjaan optimasi perangkat keras yang terdaftar untuk AMD, Arm, Dell, Intel, dan Nvidia. Jalur praktis bagi kebanyakan orang adalah: unduh GGUF-nya, muat di llama.cpp atau runner lokal, lalu arahkan scaffold agen ke model tersebut. Meta tidak menghosting API publik untuk Glimmer itu sendiri, dan model ini memang dibangun di sekitar jalur lokal — tetapi jalur terhosting tidak lagi hipotetis: platform pihak ketiga mulai menyajikannya pada 9 Agustus, jadi "unduh dan jalankan" dan "panggil API" kini sama-sama merupakan opsi yang tersedia.

Satu catatan jujur tentang kami secara spesifik: Muse Glimmer masih belum tersedia melalui OrcaRouter. Kami merute API yang di-hosting, dan pada pembaruan ini model tersebut belum masuk dalam katalog kami — penawaran markup 0% dan satu-kunci-untuk-semua berlaku untuk 200+ model yang memang kami rute, dan ini belum menjadi salah satunya. Ketika sudah tersedia, kunci yang sama yang menjangkau seluruh katalog akan menjangkaunya tanpa kontrak baru, dan failover otomatis adalah mekanisme yang membuatnya aman untuk mengarahkan lalu lintas nyata ke model baru yang dilaporkan vendor sebelum model tersebut memiliki rekam jejak independen. Itulah alasan yang sama mengapa DSL perutean ada: model yang belum terbukti seharusnya mendapatkan jalur produksi berdasarkan data Anda, bukan berdasarkan siaran persnya sendiri.

Tangkapan layar di bawah ini adalah kartu Hugging Face seperti yang terbaca pada hari perilisan — baris "not deployed by any inference provider" merujuk pada inferensi pihak pertama milik Hugging Face itu sendiri, yang merupakan hal terpisah dari daftar API yang dihosting pihak ketiga yang mulai aktif pada 9 Agustus.

Screenshot of the Hugging Face model card for meta-models/Muse-Glimmer-30B, showing the Apache 2.0 license, 30B parameter size, Meta Superintelligence Lab authorship, and the line that the model is not deployed by any inference provider.

Apa yang harus ditonton

Tiga hal akan menyelesaikan kisah ini, secara kasar menurut urutan kecepatan. Pertama, rilis open-weights Muse Spark 1.2 yang dijanjikan — jika sang guru dirilis dalam "beberapa minggu mendatang," Glimmer tidak lagi menjadi rilis yang hanya sekali, melainkan menjadi awal dari jajaran open-weight yang lengkap, yang merupakan pembacaan strategis yang sebenarnya dari "Meta kembali." Kedua, pengukuran independen: entri indeks Artificial Analysis, penempatan di LMArena, dan reproduksi oleh komunitas akan memberi tahu Anda apakah klaim 19-dari-24 bertahan saat diuji oleh pihak yang bukan Meta. Ketiga, gelombang hosting — hal itu sudah dimulai. Para penyedia mulai menyajikan Glimmer pada 9 Agustus, jadi pertanyaan lokal-versus-hosted kini menjadi pilihan nyata yang bisa Anda buat dengan satu kunci API; yang perlu diperhatikan adalah seberapa luas penyebaran hosting tersebut dan bagaimana harga per token berubah setelah kebaruan minggu rilis memudar.

Tweet tersebut benar tentang beritanya. Entah benar tentang vonisnya — itu pertanyaan yang butuh berminggu-minggu untuk terjawab, dan posisi jujur saat ini adalah belum ada orang di luar Meta yang cukup menjalankannya untuk tahu. Yang sudah pasti benar adalah bahwa model agen 30B berlisensi Apache-2.0 yang muat di GPU konsumen dan didukung oleh dorongan strategi penuh adalah sebuah rilis yang patut diperhitungkan, apa pun skor independennya nanti.

Pertanyaan yang benar-benar layak untuk dijawab

Apakah Muse Glimmer benar-benar open source?

Ini adalah open weights di bawah lisensi Apache 2.0 yang permisif — siapa pun dapat mengunduh, memodifikasi, melakukan fine-tune, dan menyebarkannya secara komersial tanpa membayar Meta. Pemilihan kata yang cermat adalah "open weights" alih-alih open source sepenuhnya dalam pengertian OSI, karena data pelatihan, bobot guru Muse Spark, dan sebagian perkakas tidak disertakan. Untuk tujuan praktis — Anda dapat menjalankannya, mengirimkannya, dan menjual produk di atasnya — ini adalah kesepakatan yang sama yang menjadikan Llama keluarga terbuka yang paling banyak diterapkan dalam AI.

Apakah Muse Glimmer benar-benar mengalahkan Gemma4-31B dan Qwen3.6-27B?

Di tabel Meta sendiri, ya pada sebagian besar benchmark agentik dan pencarian, dengan catatan bahwa Meta menjalankan perbandingan itu sendiri dan tidak menyetel pengaturan para pesaingnya. Gambaran yang jujur lebih spesifik: Meta unggul pada baris penalaran agentik, Qwen3.6-27B unggul pada penggunaan komputer langsung dan kerja terminal plus sebagian besar tes multimodal, dan Gemma4-31B mencatatkan rekor keamanan yang lebih baik. Hingga hari rilis, belum ada entri indeks independen sama sekali untuk Muse Glimmer, jadi anggap klaim 19-of-24 itu sebagai laporan vendor sampai pihak lain menjalankannya.

Bisakah saya menjalankannya di laptop?

Hanya jika "laptop" berarti yang memiliki GPU diskrit 24GB atau 32GB, atau Mac seri-M kelas atas dengan memori terpadu yang cukup — model Muse Glimmer 4-bit membutuhkan sekitar 17–20GB ditambah ruang untuk cache KV, encoder persepsi, dan perancang DFlash. Itu adalah pembelian yang nyata bagi kebanyakan orang, dan itulah biaya tersembunyi di balik model "gratis". Pada grafis terintegrasi atau mesin 16GB, Anda akan menghadapi kuantisasi berat dan keluaran lambat, bukan agen yang selalu aktif yang menjadi inti rilis ini.

Di mana saya mendapatkannya — apakah ini tersedia di API?

Bobot model tersedia di Hugging Face di meta-models/Muse-Glimmer-30B (dengan varian GGUF), dan Anda dapat menjalankannya secara lokal melalui llama.cpp, MLX, ExecuTorch, atau runner lokal yang kini mengintegrasikannya. Akses API terkelola juga sudah aktif per 9 Agustus melalui platform pihak ketiga dengan tarif tercantum $0,35 per juta token masukan dan $1,50 per juta token keluaran — jadi Anda tidak perlu lagi memiliki GPU 24GB untuk mengaksesnya. Meta sendiri masih belum menyediakan API publik untuk Glimmer, dan model ini juga belum ada di OrcaRouter. Ketika sudah masuk katalog kami, kunci yang sama dengan yang digunakan untuk mengakses seluruh katalog akan menjangkaunya; sampai saat itu, dua jalur yang sah adalah inferensi lokal atau platform terkelola pihak ketiga.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

Hubungi kami

Gabung komunitas kami

DiscordEmailXGitHubYouTube