
Muse Spark 1.2 vs GLM 5.2: Coder Tertutup vs Generalis Terbuka
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2658Kecerdasan72Koding
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
Dua model dengan konteks 1.000.000 token, dengan harga berselisih lima belas sen per juta token, sama-sama ditujukan untuk pekerjaan agen yang sarat kode — dan keduanya hampir tidak berbagi hal lain. Muse Spark 1.2, yang dirilis Meta pada 5 Agustus 2026 bersama agen terminal hasil pelatihan bersama bernama Muse Code, berbobot tertutup, lebih murah per token, mencetak skor 57 pada Artificial Analysis Intelligence Index saat ini, dan tidak dapat membalas tanpa penalaran terlebih dahulu. GLM 5.2, model berbobot terbuka andalan Z.ai dari pertengahan Juni, berlisensi MIT, dapat di-host sendiri, sekitar lima kali lebih cepat menuju token pertama, dan masih membawa empat setengah kali lebih banyak lalu lintas nyata melalui gateway kami — 213 juta token selama tujuh hari terakhir dibandingkan dengan 46 juta milik Muse Spark 1.2. Model dengan skor lebih tinggi dan lebih murah per token justru yang lalu lintasnya lebih sedikit. Model yang terbukalah yang benar-benar dirutekan orang.
Versi jujur dari fakta tersebut adalah apa yang dibahas artikel ini. Skor dan harga sebenarnya kurang menentukan dibandingkan bagaimana sebuah model cocok dengan pipeline Anda, dan keduanya membuat pilihan berlawanan pada setiap sumbu yang menentukan kecocokan. Jika ada angka independen, angka tersebut berasal dari Artificial Analysis; jika berasal dari Meta atau Z.ai, diberi label dilaporkan vendor; sedangkan angka latensi dan lalu lintas adalah telemetri produksi tujuh hari milik OrcaRouter.
Kontras spesifikasi, satu dimensi pada satu waktu.
• Harga — Muse Spark 1.2 seharga $1.25 masuk / $4.25 keluar per juta token, $0.15 saat cache hit; GLM 5.2 seharga $1.40 masuk / $4.40 keluar, $0.26 saat di-cache. Meta lebih murah di setiap baris.
• Konteks — keduanya 1,048,576 token. Output maksimal: Meta mendokumentasikan batas 131,072 token untuk Muse Spark 1.2; GLM 5.2 menyatakan 128,000.
• Penalaran — penalaran bersifat wajib pada Muse Spark 1.2 di lima tingkat upaya (dari minimal hingga xhigh, default medium); GLM 5.2 menjalankan penalaran hibrida yang dikendalikan oleh reasoning_effort pada level high atau max, dengan penalaran mendalam aktif secara bawaan.
• Masukan — Muse Spark 1.2 mendukung input teks, gambar, video, audio, dan PDF; GLM 5.2 adalah input teks, output teks.
• Bobot — Muse Spark 1.2 bersifat tertutup, tanpa repositori dan tanpa jalur self-host; GLM 5.2 menyediakan bobot terbuka berlisensi MIT, yaitu Mixture-of-Experts dengan 753B parameter dan sekitar 40B aktif per token.
• Usia — Muse Spark 1.2 baru berusia tiga hari saat tulisan ini dibuat; GLM 5.2 telah digunakan dalam produksi sejak 13 Juni, dengan delapan minggu pengalaman lapangan dan seluruh ekosistem host serta alat yang dibangun di sekitarnya.
Selisih indeksnya empat poin. Jebakan versi itu nyata.
Indeks Intelijen (Intelligence Index) terkini milik Artificial Analysis (v4.1.1) memberi skor 57 untuk Muse Spark 1.2, menempati peringkat #12 dari 185, dan GLM 5.2 mendapat 53 — skor open-weights tertinggi di papan, tetapi tertinggal empat poin. Sebagian besar pemberitaan masih mengutip angka 54 untuk Muse Spark 1.2 karena itulah yang dilaporkan oleh evaluasi hari peluncuran; penilaian ulang v4.1.1 menambahkan 2,7 poin ke skor tersebut, peningkatan terbesar di antara semua model dalam pembaruan itu. Jika Anda melihat "54 vs 51" atau "54 vs 53" di mana pun, periksa versi indeks mana yang dipakai untuk masing-masing angka sebelum menganggap selisihnya nyata.
Perlu dikatakan apa arti selisih empat poin itu dan apa tidak. Artinya, pada komposit sembilan tolok ukur, model tertutup Meta unggul di atas model terbuka Z.ai dengan upaya yang sebanding. Bukan berarti Muse Spark 1.2 mengalahkan GLM 5.2 dalam segala hal, karena kedua model mencapai skor tersebut melalui jalur yang berbeda. GLM 5.2 adalah outlier dalam matematika dan penalaran — AIME 2026 di 99,2 — tetapi terkenal bertele-tele dan kelemahannya adalah pekerjaan berskala repositori yang dalam. Muse Spark 1.2 memiliki bentuk yang berlawanan: kuat dalam pengkodean terminal dan tugas multi-file, dan jauh lebih murah per tugas untuk dievaluasi, karena menghabiskan jauh lebih sedikit token saat berpikir.

Di mana tolok ukur sebenarnya berbeda.
Pada Terminal-Bench 2.1, keduanya lebih berdekatan daripada yang disiratkan oleh selisih indeks, dan sumber datanya lebih penting dari biasanya. Pada harness Artificial Analysis yang sama, Muse Spark 1.2 mencetak 80.1 dan GLM 5.2 mencetak 77.9. Meta mengklaim 82.9 untuk Muse Spark 1.2 pada harness miliknya sendiri; angka terbaik yang dilaporkan Z.ai untuk GLM 5.2 adalah 82.7, yang menjadikannya model open-weight pertama di atas 80 pada benchmark tersebut. Benchmark yang sama, empat angka berbeda — kombinasi harness menggeser skor-skor ini beberapa poin di kedua arah, jadi perlakukan setiap klaim yang hanya berdasarkan satu terminal-bench sebagai sebuah rentang.
Perbedaan yang perlu diperhatikan adalah DeepSWE 1.1, tolok ukur yang menguji penalaran mendalam, multi-file, dan berskala repositori dalam loop agen yang panjang. Meta melaporkan 59,3 untuk Muse Spark 1.2 — angka dari vendor, belum ada pihak ketiga yang mereproduksinya. DeepSWE yang dipublikasikan untuk GLM 5.2 adalah 46,2, dan pendahulunya GLM-5.1 berada di 18,0, jadi ini adalah dimensi yang paling banyak ditingkatkan oleh Z.ai dan masih tertinggal di sana. Jika beban kerja Anda adalah "mengubah lima puluh file secara koheren," kesenjangan itulah inti permasalahannya; jika beban kerja Anda adalah perintah terminal dan pembuatan kerangka proyek, pengaruhnya hampir tidak terasa.
Satu temuan lagi yang membalikkan narasi yang tampak jelas. Suite Vals AI yang independen, yang menjalankan beban kerja agen per domain, menempatkan Muse Spark 1.2 di peringkat kelima secara keseluruhan dengan 71,88% — dan pertama di Finance Agent, pertama di TaxEval, dan pertama pada benchmark Legal Agent milik Harvey, melawan masing-masing 44, 136, dan 31 model — sementara Terminal-Bench 2.1 hanyalah domain terbaik keempat belas dari lima puluh. Meta menjual model ini sebagai model penulis kode, dan evaluator independen menemukan bahwa model ini paling kuat pada agen dokumen keuangan, pajak, dan hukum. Jika tim Anda menulis kontrak atau merekonsiliasi buku besar, itulah angka paling berguna dalam artikel ini.
Pertanyaan tentang bobot terbuka adalah persimpangan yang sesungguhnya.
Semua hal di atas berkaitan dengan kemampuan. Keputusan ini sebagian besar berkaitan dengan kepemilikan, dan dalam hal ini keduanya sangat bertolak belakang.
GLM 5.2 adalah bobot terbuka berlisensi MIT. Itu mengubah negosiasi, bukan hanya tagihan: Anda dapat menjalankannya sendiri jika beban kerja sensitif atau volumenya tinggi; Anda dapat memindahkannya antar penyedia tanpa integrasi ulang, karena bobotnya milik Anda; dan host mana pun yang merutekannya harus bersaing dalam harga dan latensi, itulah sebabnya lini bobot terbuka menjadi lebih murah seiring waktu. MoE 753B bukan model laptop — sebagian besar tim masih akan menyewanya daripada menjalankannya — tetapi opsi untuk pergi, atau menjalankan bobot yang sama di internal dengan biaya tetap, memberi batas bawah untuk apa pun yang dapat dibebankan siapa pun kepada Anda.
Muse Spark 1.2 memilih paket yang berlawanan. Bobotnya tertutup dan satu-satunya jalur first-party adalah Model API Meta, yang sekarang juga kami rutekan. Sebagai gantinya, Anda mendapatkan produk hasil pelatihan bersama: Muse Code, agen terminal yang disertakan bersama model, disetel menggunakan lintasan harness hasil rejection sampling, dan menjalankan subagen yang persisten dan aman terhadap restart pada runtime log peristiwa yang dapat diputar ulang secara eksak, dengan bundled /plan, /grill dan /goal skills. Itu adalah hal yang benar-benar berbeda dari "model bagus yang Anda sambungkan ke harness sendiri" — ini adalah agen yang langsung berfungsi. Trade-offnya adalah ia hanya bekerja dengan cara Meta, di alat Meta, di macOS atau Linux, tanpa klien Windows, tanpa MCP, dan belum ada plugin IDE.

Harga per token, harga per tugas
Per token, Muse Spark 1.2 lebih murah pada input dan output, dan tetap lebih murah per tugas karena juga merupakan model yang lebih ringkas. Artificial Analysis mengukur GLM 5.2 yang membakar 141 juta token keluaran, 95% di antaranya adalah token penalaran, hanya untuk menjalankan Intelligence Index saat peluncuran — model terkemuka paling boros kata di papan tersebut. Muse Spark 1.2 membakar 95 juta pada pengujian yang sama dengan biaya $0.40 per tugas. Lebih banyak token dengan tarif lebih tinggi berarti biaya per tugas GLM 5.2 meningkat dengan cara yang tidak terlihat dari harga daftarnya, dan ini adalah cara yang tepat untuk membandingkan model penalaran: hitunglah biaya untuk tugas yang selesai, bukan tarif per juta token.
Ada harga ketiga yang hanya dimiliki oleh salah satu model ini. Muse Spark 1.2 menyediakan tier kontributor dengan $0,10 masuk / $0,20 keluar — satu orde magnitudo di bawah tier standar, dan di bawah harga daftar GLM 5.2 dengan margin yang serupa. Biaya masuknya adalah izin bagi Meta untuk melatih model masa depan pada lalu lintas Anda, ditambah batas 60 permintaan per menit yang menyingkirkan fan-out produksi. Anggap saja sebagai tinjauan hukum dengan diskon terlampir, bukan SKU yang lebih murah; untuk tim yang memenuhi syarat dan bekerja di bawah batas tersebut, ini membuat perbandingan harga tidak lagi berdekatan.
Latensi: kedua model terbalik
Jika kesenjangan indeks menguntungkan Meta, profil latensi adalah tempat GLM 5.2 menang secara menentukan dalam hal nuansa. Sepanjang tujuh hari terakhir lalu lintas nyata di OrcaRouter, Muse Spark 1.2 menunjukkan p50 waktu ke token pertama sebesar 8,13 detik dan p95 sebesar 10,00 detik, kemudian melesat dengan 576 token keluaran per detik dengan tingkat kesalahan nol. GLM 5.2 menunjukkan p50 sebesar 1,55 detik — lebih dari lima kali lebih cepat ke token pertama — tetapi mengalir pelan dengan 78,5 token keluaran per detik dengan tingkat kesalahan 0,16%. Di lab dengan usaha maksimal, kesenjangan melebar: Artificial Analysis mengukur waktu ke token pertama Muse Spark 1.2 pada 26 detik pada xhigh, pengaturan penalaran termahal.
Jadi satu model membuat Anda menunggu lalu memberikan hasil dengan cepat; yang lain mulai segera dan tidak terburu-buru. Untuk apa pun yang sedang dilihat manusia — giliran obrolan, sesi terminal interaktif — GLM 5.2 terasa lebih baik, dan itulah mengapa ia mendominasi lalu lintas interaktif melalui gateway kami. Untuk generasi yang panjang, patch besar, atau draf dokumen, Muse Spark 1.2 akan selesai lebih dulu begitu mulai, karena kecepatan keluarannya tujuh kali lipat dari GLM 5.2. Jika Anda mengukur angka yang salah, Anda akan memilih model yang salah karena alasan yang salah.
Mencoba keduanya tanpa kontrak kedua
Kedua model tersebut ada di katalog OrcaRouter dengan harga daftar penyedia — Muse Spark 1.2 seharga $1.25 dan $4.25, GLM 5.2 seharga $1.40 dan $4.40 — karena OrcaRouter meneruskan tarif penyedia dengan markup 0%. Itu membuat bagian-bagian harga sesuai dengan faktur, bukan stiker, dan itu berarti peralihan di antara keduanya hanya berupa perubahan satu baris pada string model dengan kunci yang sama, bukan integrasi baru. Jika vendor memangkas harga, pemangkasan tersebut akan masuk ke pihak kami pada hari yang sama.
Lapisan routing membuktikan kegunaannya di sini justru karena kedua model saling melengkapi. Kelemahan Muse Spark 1.2 adalah token pertama yang lambat dan harga yang tinggi saat diskalakan; kelemahan GLM 5.2 adalah verbositas dan penalaran repositori yang mendalam. Aturan routing yang mengirimkan tahap perencanaan ke Muse Spark 1.2 dan fan-out pekerja paralel ke GLM 5.2 — atau beralih otomatis ke GLM 5.2 saat endpoint Muse Code lambat — tidak memerlukan biaya tambahan untuk dibangun, karena keduanya berada di belakang satu endpoint. Dan untuk model yang baru berusia tiga hari, failover otomatis adalah cara untuk mencobanya tanpa mempertaruhkan jalur produksi padanya.

Siapa yang harus memilih yang mana
Pilih Muse Spark 1.2 ketika unit pekerjaannya adalah artefak besar yang koheren dan seseorang dapat menunggu beberapa detik untuk memulainya: refaktorisasi multi-file, generasi seluruh repositori, loop agen yang panjang, dan — menurut Vals AI — pekerjaan dokumen keuangan, pajak, dan hukum. Posisi teratas DeepSWE, tingkat output yang tinggi, dan tingkat kontributor semuanya mengarah ke arah yang sama. Anda menerima bobot tertutup, perangkat Meta, dan token pertama yang lebih lambat, dan Anda harus menganggap 82.9 dan 59.3 milik Meta sebagai klaim, bukan fakta.
Pilih GLM 5.2 ketika kepemilikan dan rasa lebih penting daripada skor komposit: bobot terbuka yang bisa Anda host sendiri atau pindahkan, token pertama yang cepat untuk pekerjaan interaktif, ekosistem harness dan alat yang sudah bekerja dengannya, serta kemampuan umum open-weight terkuat yang tersedia. Terima verbositasnya, DeepSWE 46.2, dan harga daftar yang lebih tinggi per token bahkan sebelum perbedaan jumlah token.
Sebagian besar tim akan menemukan bahwa jawaban jujurnya bukan salah satu dari keduanya saja. Yang terbuka adalah pekerja keras yang Anda arahkan untuk sebagian besar lalu lintas; yang tertutup adalah spesialis yang Anda tunjukkan pada tugas-tugas mendalam dan dokumen sensitif. Empat poin indeks terpisah pada komposit, dunia terpisah pada siapa yang memiliki bobot — itulah pilihannya, dan itu jauh lebih jelas daripada skor-skor.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
