Muse Code vs Muse Spark 1.1: Apa yang Sebenarnya Diukur oleh Peningkatan 6.7 Poin Meta
Guides & Insights

Muse Code vs Muse Spark 1.1: Apa yang Sebenarnya Diukur oleh Peningkatan 6.7 Poin Meta

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Lakukan pengurangan terlebih dahulu. Deck peluncuran Meta untuk Muse Code, agen pengodean terminal yang dirilis pada 5 Agustus 2026, melaporkan 82,9% pada Terminal-Bench 2.1 dan menganggapnya sebagai peningkatan 6,7 poin dibandingkan dengan Muse Spark 1.1, model yang sudah dibayar oleh sebagian besar pembaca artikel ini. Kurangi 6,7 dari 82,9 dan Anda mendapatkan 76,2 — yang bukan angka yang dipublikasikan Meta, tetapi justru merupakan skor yang persis tertera di papan peringkat publik Terminal-Bench 2.1 untuk Muse Spark 1.1 dengan effort xhigh, diajukan pada bulan Juli, dijalankan oleh harness mini-SWE-agent milik Princeton.

Kebetulan itu adalah fakta paling berguna dalam perbandingan ini, karena mini-SWE-agent adalah kerangka yang sengaja dibuat minimal — beberapa ratus baris, tanpa subagen persisten, tanpa log peristiwa, tanpa kemampuan perencanaan. 82,9% milik Meta adalah Muse Spark 1.2 yang berjalan di dalam agen khusus yang Meta latih bersama modelnya. Jika kedua baris itulah yang memiliki selisih 6,7 poin tersebut, maka peningkatan generasi utama adalah peningkatan model dan peningkatan perangkat yang digabungkan menjadi satu angka, dan Meta tidak memublikasikan apa pun yang memisahkan keduanya.

Meta tidak menyatakan perangkat uji mana yang digunakannya untuk baseline 1.1, jadi kecocokan itu lebih bersifat sugestif daripada terbukti. Namun, hal itu membingkai ulang keputusan bagi siapa pun yang saat ini memanggil Muse Spark 1.1 melalui API, yang merupakan versi jujur dari perbandingan ini: Anda tidak memilih di antara dua model. Anda memilih antara model yang Anda kemudikan sendiri dan agen yang mengemudikan model yang lebih baru untuk Anda, dan hanya satu dari dua hal itu yang telah diukur oleh pihak selain Meta.

Ini bukan kategori yang sama, dan lembar spesifikasi juga mengatakannya.

Separuh kebingungan seputar pemasangan ini berasal dari memperlakukan Muse Code sebagai model release. Padahal bukan. Muse Code adalah CLI, dan Muse Spark 1.2 itulah yang dipanggilnya.

Apa itu — Muse Code adalah agen terminal yang diinstal dengan satu baris (curl -fsSL https://dev.meta.ai/install.sh | bash); Muse Spark 1.1 adalah endpoint model yang Anda panggil dari kode Anda sendiri, kerangka kerja agen Anda sendiri, atau CLI apa pun yang menerima URL dasar kustom.

Model dasar — Muse Code menjalankan Muse Spark 1.2, yang dilatih bersama dengan agen; Muse Spark 1.1 adalah generasi Juli, masih dilayani dan masih terdaftar.

Di Mana BerjalanMuse Code hanya untuk macOS dan Linux, hanya terminal, tanpa GUI, tanpa ekstensi IDE; Muse Spark 1.1 berjalan di mana pun HTTPS berjalan, termasuk Windows.

Masukan — Muse Code menerima repositori dan prompt; Muse Spark 1.1 menerima teks, gambar, video, audio, dan dokumen PDF dalam satu konteks 1.048.576 token dan mengembalikan teks.

Status — Muse Code adalah beta publik dan diberi label demikian; Muse Spark 1.1 telah tersedia secara umum sejak Juli 2026 dan sedang menangani lalu lintas produksi nyata.

Harga daftar — keduanya ditagih melalui Meta Model API sebesar $1,25 per juta token masukan, $0,15 untuk input yang di-cache, dan $4,25 untuk keluaran pada tier standar. Kartu tarifnya sama.

Baris terakhir adalah yang mengejutkan orang, dan itu menghancurkan asumsi yang jelas. Mengadopsi Muse Code tidak memakan biaya lebih per token daripada yang sudah Anda jalankan. Biayanya diukur dalam mata uang lain — dukungan platform, latensi, modalitas, dan, pada tingkat murah, kode sumber Anda. Itulah empat sumbu yang layak diperdebatkan.

Tolok ukur tempat mereka menyimpang, dibaca dengan harness yang terpasang.

Meta menerbitkan dua delta generasional terhadap Muse Spark 1.1: +6,7 poin pada Terminal-Bench 2.1 dan +6,3 pada DeepSWE 1.1. Keduanya dilaporkan vendor, keduanya berasal dari grafik yang dipublikasikan sebagai gambar tanpa uraian metodologi, dan tidak ada satu pun yang direproduksi oleh pihak ketiga. Jika keduanya dikeluarkan, baseline 1.1 yang tersirat dari Meta kira-kira 76,2% dan 53,0%.

Sekarang letakkan 82,9% milik Meta di sebelah papan peringkat yang tidak dikutipnya. Papan peringkat publik Terminal-Bench 2.1, pada saat penulisan, menampilkan Claude Code yang dipasangkan dengan Claude Fable 5 pada 83,8% ± 1,2%, Codex dengan GPT-5.5 pada 83,1% ± 1,1%, Terminus 2 dengan Claude Fable 5 pada 80,4%, Cursor CLI dengan Grok 4.5 pada 79,3%, dan mini-SWE-agent dengan Muse Spark 1.1 pada 76,2% di posisi kedelapan. 82,9% yang dilaporkan sendiri oleh Muse Code akan menempati posisi ketiga — di bawah dua pasangan agen-model yang tidak muncul di mana pun dalam presentasi Meta, yang justru membandingkannya dengan Claude Opus 5 pada 86,7%, GPT-5.6 Terra pada 81,8% dan Grok 4.5 pada 81,6% dalam pengujian terpisah dengan upaya maksimum.

Dua papan peringkat, satu tolok ukur, angka-angka yang tidak sejalan — dan skala ketiga yang sama sekali berbeda jika Anda melihat Artificial Analysis, yang evaluasi independen Terminal-Bench v2.1-nya mencapai puncak sekitar 89,5% untuk GPT-5.6 Sol melawan batas atas papan peringkat publik sebesar 83,8%. Tak satu pun dari pihak-pihak ini berbohong. Satu baris Terminal-Bench adalah skor untuk sebuah harness, ditambah model, ditambah pengaturan effort, ditambah alokasi komputasi, dan mengganti salah satu dari itu mengubah hasilnya lebih dari seluruh selisih yang Meta klaim sebagai sebuah generasi.

Itulah mengapa angka yang menarik di papan publik bukanlah kolom akurasi. Melainkan kolom biaya. Muse Spark 1.1 menyelesaikan pengujian 76.2%-nya dengan biaya $198.05. Claude Code dengan Claude Fable 5 membayar $552.67 untuk memperoleh 83.8%, dan Codex dengan GPT-5.5 membayar $2,059.19 untuk 83.1%. Itu berarti 7.6 poin akurasi untuk 2.8x biaya pada kasus pertama dan kira-kira 10x pada kasus kedua — diukur oleh operator yang sama, pada tugas yang sama, di bawah aturan yang sama, yang justru merupakan perbandingan setara yang tidak diberikan oleh bagan Meta. Papan itu juga memberikan pengurangan untuk tugas-tugas yang diselesaikan dengan mengeksploitasi lingkungan; kiriman Muse Spark 1.1 tidak menunjukkan pengurangan semacam itu, sedangkan eksekusi Grok 4.5 oleh Cursor CLI memiliki pengurangan 9 poin.

Meta tidak mempublikasikan angka biaya untuk 82,9%-nya.

Yang sudah bisa dilakukan Muse Spark 1.1 tetapi tidak bisa dilakukan Muse Code

Nilai jual Muse Code adalah bahwa agen yang dilatih bersama mengalahkan "pembungkus generik di sekitar model eksternal" — ungkapan Meta, klaim Meta, yang belum diuji oleh siapa pun. Itu adalah klaim yang masuk akal. Ini juga menyasar celah yang secara khusus dibangun Muse Spark 1.1 untuk ditutup.

Muse Spark 1.1 berbicara Model Context Protocol secara native, mengelola koneksi MCP-nya sendiri tanpa kerangka eksternal, mengatur peran agen utama dan subagen secara internal, dan menggeneralisasi zero-shot ke alat baru serta keterampilan khusus. Angka peluncuran Meta sendiri untuknya adalah angka penggunaan alat: 88.1 di MCP Atlas untuk penggunaan alat berskala besar — melampaui 82.2 yang dilaporkannya untuk Claude Opus 4.8 dan 75.3 untuk GPT-5.5 — dan 54.7 di JobBench. Semua dilaporkan vendor, semua dari Juli, tidak ada yang direproduksi secara independen. Poinnya tetap berlaku: 1.1 bukan model obrolan yang sekadar ditempeli agen. Masukkan ke OpenCode, Cline, atau CLI apa pun yang menerima endpoint khusus, dan Anda memiliki agen hari ini.

Dan kemudian ada semua hal yang secara struktural tidak dapat dijangkau oleh Muse Code. Muse Spark 1.1 melakukan penalaran atas gambar, video, audio, dan PDF dalam satu jendela konteks. Agen coding berbasis terminal tidak memiliki kegunaan untuk permukaan itu dan tidak ada cara untuk mengeksposnya. Jika beban kerja Anda adalah mockup desain yang diubah menjadi komponen, panggilan dukungan yang ditranskripsi dan ditriase, atau spesifikasi 400 halaman yang direferensikan silang dengan implementasi, hal yang lebih baru justru yang kurang mumpuni — dan posisi Meta untuk generasi 1.2 bergeser dari "riset mendalam multimodal atas media campuran" ke refaktor multi-file dan generasi seluruh repositori, tanpa hasil video atau audio yang dipublikasikan untuk 1.2 oleh siapa pun.

Asimetri sebenarnya berjalan ke arah sebaliknya, dan itu adalah properti runtime, bukan kemampuan. Muse Code menambahkan setiap panggilan model, eksekusi alat, persetujuan, dan edit ke log peristiwa lokal, yang menurut Meta membuat sesi menjadi tepat saat diputar ulang dan aman untuk dimulai ulang: jika terjadi crash, agen melanjutkan dari titik berhenti alih-alih menurunkan ulang konteksnya. Agen latar belakangnya bertahan sepanjang sesi, bukan diciptakan dan dihancurkan per sub-tugas. Bukti Meta adalah satu studi kasus — proses 24 jam dengan lebih dari 1.000 panggilan alat untuk mengoptimalkan kernel GPU pada perangkat keras NVIDIA Hopper. Tidak ada angka percepatan yang dipublikasikan, jadi durasinya itulah klaimnya. Jika Anda pernah kehilangan migrasi sembilan jam karena harness lupa apa yang sedang dilakukannya di langkah ke-300, itu adalah hal yang sungguh layak diinginkan, dan dukungan MCP sebanyak apa pun dalam model tidak akan memberikannya kepada Anda.

Harga daftar yang sama, sampai Anda membaca tingkat kedua.

Karena tier standar identik di kedua sisi, argumen harga dalam perbandingan ini sepenuhnya berada pada tier yang Meta perkenalkan bersama Muse Code.Tier kontributor dikenakan biaya $0,10 per juta token input, $0,002 untuk input cache, dan $0,20 untuk output — 12,5x lebih murah pada input, 21x pada output, 75x pada input cache — sebagai imbalan atas izin eksplisit untuk menggunakan prompt dan completion Anda untuk melatih model Meta di masa depan. Lalu lintas tier standar, menurut Meta, tidak digunakan dengan cara tersebut.

Jalankan langkah agen yang realistis melaluinya — 60.000 token konteks repositori masuk, 3.000 token rencana-dan-tambalan keluar — dan seribu langkah membutuhkan biaya $87,75 pada tier standar dingin, $21,75 dengan konteks repositori yang mengenai cache, $6,60 pada kontributor dingin, dan $0,72 pada kontributor dengan cache hangat. Proses kernel 24 jam Meta sendiri mendekati sembilan puluh dolar pada tier yang melindungi kode Anda dan di bawah satu dolar pada tier yang tidak.

Itu bukan pilihan penagihan. Prompt agen coding adalah basis kode Anda — API internal, komentar yang menjelaskan mengapa solusi sementara tersebut ada, apa pun yang terkandung dalam fixture Anda. Pada pohon sumber terbuka, tingkat kontributor hampir seperti uang gratis. Pada repositori proprietary, ini adalah keputusan lisensi data yang berkedok diskon, dan seharusnya diajukan kepada pihak yang menyetujui penanganan data, bukan pihak yang memantau tagihan cloud. Meta menetapkan diskon sebesar 12x karena data tersebut bernilai setidaknya sebesar itu bagi Meta.

Tetap menggunakan Muse Spark 1.1 menghindari pertanyaan itu sepenuhnya, dan perlu diketahui secara pasti apa biayanya dan di mana. Muse Spark 1.1 ada di katalog OrcaRouter dengan harga $1,25 dan $4,25 — harga daftar Meta tepat hingga sen terakhir, karena kami menambahkan markup 0% dan meneruskan harga penyedia apa adanya, yang juga menjadi alasan perubahan tarif Meta muncul di sisi kami pada hari Meta mengubahnya, bukan setelah siklus kontrak. Telemetri produksi tujuh hari kami untuk model ini menunjukkan p50 time-to-first-token pada 1,84 detik dan p95 pada 6,00 detik, yang merupakan ekspektasi yang jauh lebih berguna daripada yang akan diberikan oleh kerangka benchmark mana pun. Muse Spark 1.2 tidak ada di katalog kami; model ini dilayani langsung oleh Meta dan tidak di tempat lain, sehingga bagian yang lebih baru dari perbandingan ini saat ini hanya memiliki satu penyedia dan tidak ada jalur failover secara desain. Jika Anda mengevaluasinya, eksposur pemasok tunggal itu adalah bagian dari apa yang Anda evaluasi.

Trade-off latensi yang tidak disebutkan siapa pun dalam liputan peluncuran

Artificial Analysis, yang mengukur secara independen pada upaya penalaran maksimum setiap model, mencatat waktu hingga token pertama Muse Spark 1.1 sebesar 2.90 detik dan Muse Spark 1.2 sebesar 26.12 detik. Kecepatan output turun dari 213.5 menjadi 165 token per detik. Perolehan tersebut adalah tiga poin Intelligence Index, dari 51 menjadi 54, dan lonjakan dari #22 ke #13 dari 185 model.

Dibaca sebagai rilis model serba guna yang merupakan transaksi buruk — sembilan kali penantian untuk tiga poin. Dibaca sebagai mesin dari agen pengkodean, jelas ini yang tepat, karena tidak ada yang menunggu refactor dua belas file memperhatikan perencanaan dua puluh enam detik, dan semua orang yang menunggu penyelesaian obrolan memperhatikan semuanya. Itulah pernyataan paling jelas tentang untuk siapa masing-masing sisi perbandingan ini, dan itu diukur oleh pihak ketiga, bukan ditegaskan oleh Meta.

Itu juga berarti peralihan tersebut tidak gratis meskipun Anda hanya peduli pada kode. Apa pun yang interaktif yang Anda arahkan ke Muse Spark 1.1 — penyelesaian inline, bot peninjau, permukaan obrolan di atas dokumen Anda — akan menjadi jauh lebih buruk jika Anda memindahkannya ke generasi 1.2 dengan upaya tinggi. Peningkatan tersebut bersifat terarah, dan penargetan memiliki arah.

Yang mana yang sebenarnya harus Anda jalankan

Tetap gunakan Muse Spark 1.1 jika pekerjaan Anda bukan repositori. Pipeline multimodal, analisis konteks panjang, riset media campuran, apa pun yang interaktif, apa pun di Windows, apa pun yang sudah terhubung melalui MCP dan berfungsi. Tidak ada apa pun dalam peluncuran Muse Code yang meningkatkan hal-hal tersebut, dan pengukuran latensi membuat setidaknya satu di antaranya lebih buruk.

Coba Muse Code jika mode kegagalan Anda adalah durasi. Migrasi monorepo, peningkatan dependensi, refaktor selama seminggu — pekerjaan yang saat ini Anda awasi karena agen kehilangan arah. Log peristiwa dan agen latar belakang persisten menargetkan hal itu, dan defisit tolok ukur beberapa poin paling tidak berpengaruh ketika proses berjalan paling lama. Beta, pada klon sekali pakai, pada repositori yang Anda rela kehilangan.

Lakukan eksperimen yang jujur jika Anda mencoba menentukan model. Pertahankan harness Anda konstan dan tukar Muse Spark 1.1 dengan Muse Spark 1.2 di bawahnya. Itu mengisolasi satu variabel yang digabungkan oleh grafik Meta, dan itu adalah satu-satunya cara untuk mengetahui apakah premi co-training itu nyata atau apakah 1.2 hanyalah model coding yang kompeten di mana pun Anda menempatkannya. Sebuah gateway tunggal menjadikan ini perubahan string, bukan proses pengadaan — Muse Spark 1.1, Claude Opus 5, GPT-5.6 Terra, Grok 4.5, dan Claude Fable 5 semuanya berada di belakang satu kunci OrcaRouter dengan harga daftar dan failover otomatis di seluruh penyedia, sehingga set perbandingan tidak memakan biaya untuk tetap siap. Muse Spark 1.2 adalah pengecualian dan harus berasal dari Meta.

Pertanyaan yang layak diajukan sebelum Anda menginstal apa pun.

Bisakah saya mengarahkan Muse Code ke Muse Spark 1.1, bukan 1.2?

Materi peluncuran Meta tidak menyebutkan, dan keduanya dikirim sebagai pasangan yang dilatih bersama, yang merupakan argumen yang menentang bahwa hal tersebut didukung atau berguna. Arah sebaliknya, bagaimanapun, terdokumentasi dengan baik: Muse Spark 1.1 bekerja pada agen mana pun yang menerima endpoint kustom, yang merupakan cara kebanyakan orang menjalankannya sebagai agen saat ini. Jika tujuan Anda adalah perbandingan yang terkontrol, jalankan 1.1 dan 1.2 di dalam Anda punya harness, daripada mencoba menekuk milik Meta.

Apakah tingkatan kontributor juga berlaku untuk Muse Spark 1.1?

Meta memperkenalkan struktur dua tingkat dengan peluncuran Muse Code dan Muse Spark 1.2, dan kartu tarif yang diterbitkan menghubungkan harga kontributor dengan rilis tersebut. Anggaplah diskon 12x adalah penawaran generasi 1.2 sampai Meta menyatakan sebaliknya, dan tetapkan harga untuk beban kerja 1.1 apa pun sebesar $1,25 dan $4,25. Jika Anda menggunakan OrcaRouter, Anda sudah berada pada harga daftar secara definisi, jadi tidak ada tingkat berbagi data yang dapat dipilih atau tidak.

Jadi, apakah klaim 6,7 poin itu salah?

Tidak — ini tidak diaudit dan kurang spesifik, yang merupakan hal berbeda. Meta mungkin saja telah menjalankan baseline 1.1-nya dalam kerangka uji yang sebanding dengan milik Muse Code, dalam hal ini peningkatannya adalah hasil model-over-model yang bersih. Tetapi tidak ada metodologi yang dipublikasikan, baseline yang tersirat tepat berada pada skor scaffold pihak ketiga yang minimal, dan benchmark yang sama menghasilkan tiga skala berbeda tergantung siapa yang menjalankannya. Anggap +6.7 sebagai penunjuk arah dan dapatkan angka Anda sendiri sebelum merencanakan sesuatu berdasarkan angka itu.

Apa yang akan menyelesaikan ini

Satu pengiriman. Jika Meta menempatkan Muse Code di papan peringkat publik Terminal-Bench 2.1 dengan aturan yang sama seperti yang digunakan semua orang saat mengirimkan — tanpa waktu tunggu atau sumber daya yang dimodifikasi, kolom biaya diisi, potongan hack diterapkan — angka 82,9% menjadi sebanding dengan 76,2% di samping nama Muse Spark 1.1 dan dengan 83,8% di posisi teratas, dan seluruh perdebatan ini selesai dalam satu sore. Sampai saat itu, satu-satunya angka yang terverifikasi secara independen dalam perbandingan ini adalah milik model yang lebih lama, dan angka tersebut menunjukkan bahwa Muse Spark 1.1 menyelesaikan tiga perempat dari Terminal-Bench 2.1 di dalam scaffold yang cukup kecil untuk dibaca sekali duduk, dengan biaya di bawah dua ratus dolar.

Hal kedua yang layak diperhatikan lebih sempit dan datang lebih cepat: apakah Artificial Analysis menerbitkan sub-skor coding dan agentic untuk generasi 1.2 yang sudah mereka terbitkan untuk 1.1. Kinerja agentic adalah dimensi terlemah yang dipublikasikan dari 1.1 dengan selisih yang jauh. Justru angka itulah yang diklaim Meta telah diperbaiki, dan justru angka yang belum diukur oleh siapa pun di luar Meta.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

Hubungi kami

Gabung komunitas kami

DiscordEmailXGitHubYouTube