
Muse Code: Meta Merilis Agen Pengkodean yang Kalah pada Tolok Ukurnya Sendiri
- metaBARUMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenBARUQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekBARUDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- qwenBARUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 191 tok/s
- orcaBARUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicBARUAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0856Kecerdasan72Koding
- tencentTencent: Hy32026-07-0642Kecerdasan59Koding
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Kecerdasan42Koding
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Kecerdasan39Koding
- anthropicAnthropic: Claude Sonnet 52026-06-3055Kecerdasan72Koding
- klingKling: Kling 3.0 Turbo2026-06-1757Kecerdasan52Koding57Matematika
- z-aiZ.ai: GLM 5.22026-06-1653Kecerdasan69Koding60Matematika
Vendor biasanya tidak memublikasikan bagan tempat mereka berada di posisi kedua. Meta menerbitkan tiga di antaranya. Dalam dek peluncuran untuk Muse Code — agen pengkodean terminal yang dirilis Meta Superintelligence Labs pada 5 Agustus 2026, yang berjalan pada hari yang sama Muse Spark 1.2 — Claude Opus 5 unggul di setiap papan yang dipilih Meta untuk ditampilkan, termasuk yang dibuat dan dikendalikan sendiri oleh Meta. Pada Terminal-Bench 2.1 selisihnya 3,8 poin. Pada DeepSWE 1.1 selisihnya 5,7, dengan GPT-5.6 Terra juga unggul. Pada tolok ukur pengkodean internal Meta sendiri, selisihnya 8,8. Versi viral dari peluncuran ini — "59% pada DeepSWE 1.1, mengungguli Grok 4.5 dan Gemini 3.6 Flash" — adalah benar, dan itu adalah pernyataan benar yang paling sempit yang tersedia.
Yang membuat peluncuran ini lebih menarik, bukan kurang menarik. Meta merilis paket tolok ukur yang tidak dimenangkannya dan tetap merilisnya, karena skor bukanlah yang mereka jual. Yang mereka jual adalah runtime yang mampu bertahan dalam pekerjaan 24 jam, dan harga yang menyaingi kompetitor dengan selisih lebih dari satu orde besaran — asalkan Anda bersedia membiarkan Meta membaca repositori Anda. Setiap angka tolok ukur di bawah ini berasal dari grafik Meta sendiri, yang diterbitkan tanpa metodologi; jika ada pengukuran independen, kalimat tersebut akan menyatakannya.
Apa yang Sebenarnya Dirilis Meta
Dua hal pada hari yang sama, sengaja digabungkan.
• Muse Code — agen penulisan kode di terminal, beta publik, diinstal dengan satu baris: curl -fsSL https://dev.meta.ai/install.sh | bash. macOS dan Linux saja; tidak ada build Windows asli, tidak ada GUI, dan tidak ada ekstensi IDE. Meta menggambarkan tugasnya sebagai menangani rekayasa perangkat lunak yang kompleks di seluruh repositori besar — merencanakan perubahan, menulis kode, memvalidasi hasil.
• Muse Spark 1.2 — revisi model penalaran Meta yang berfokus pada pengodean, dengan konteks 1.048.576 token, tersedia di dalam Muse Code dan melalui Meta Model API dalam pratinjau publik. Meta menyatakan bahwa mereka meningkatkan komputasi pelatihan pada tugas-tugas pengodean dan memperluas keragaman lingkungan pelatihan, dengan target pekerjaan jangka panjang: pembuatan seluruh repositori, refaktor banyak file, dan debugging yang panjang.
Penggabungan itulah klaimnya. Meta menyatakan bahwa keduanya dilatih bersama, dan bahwa pemasangan tersebut menghasilkan "penggunaan alat yang lebih baik, lebih sedikit percobaan ulang, dan keluaran berkualitas lebih tinggi daripada pembungkus generik di sekitar model eksternal." Itu adalah susunan kata Meta dan pernyataan Meta; tidak ada pihak ketiga yang menguji model tersebut di dalam harness saingan untuk memeriksa apakah keunggulan pelatihan bersama itu nyata atau apakah Muse Spark 1.2 hanya berperilaku seperti model pengodean yang kompeten di mana pun ia ditempatkan.
Tiga skill bawaan disertakan dengan agen, dan skill-skill itu menggambarkan gaya kerja yang dimaksud lebih baik daripada teks pemasaran: /plan menghasilkan rencana yang harus disetujui sebelum apa pun ditulis, /grill menguji ketahanan rencana tersebut, dan /goal mendorong pencapaian tujuan yang telah ditetapkan. Buat rencana, serang rencana itu, lalu eksekusi — yang merupakan pola yang secara manual disepakati oleh pengguna berpengalaman Claude Code dan Codex, kini hadir sebagai perintah kelas satu.
Dek tolok ukur, dibaca secara jujur

Meta menerbitkan perbandingan pada Terminal-Bench 2.1, DeepSWE 1.1, Meta Internal Coding Bench miliknya sendiri, dan GDPval. Angka-angka tersebut, sebagaimana dilaporkan oleh Meta:
• Terminal-Bench 2.1 — Claude Opus 5 dengan upaya maksimal di Claude Code 86.7%, Muse Spark 1.2 di Muse Code 82.9%, GPT-5.6 Terra di Codex 81.8%, Grok 4.5 di Grok Build 81.6%. Peringkat kedua, dan posisi kedua hingga keempat dipisahkan oleh 1.3 poin.
• DeepSWE 1.1 — Claude Opus 5 65.0%, GPT-5.6 Terra 64.8%, Muse Spark 1.2 59.3%. Peringkat ketiga, dan satu-satunya papan di mana selisihnya signifikan, bukan sekadar kosmetik.
• Meta Internal Coding Bench — Claude Opus 5 79,4%, Muse Spark 1.2 70,6%. Laga kandang Meta, dan kekalahan terbesar Meta.
• Antargenerasi — Meta melaporkan +6.7 poin pada Terminal-Bench dan +6.3 pada DeepSWE dibandingkan dengan Muse Spark 1.1. Angka-angka tersebut adalah yang terbesar dalam presentasi, dan itulah yang seharusnya diperhatikan oleh pengguna Muse Spark 1.1.
Satu kendala aritmetika layak disebut, karena itulah alasan untuk memperlakukan semua hal di atas sebagai indikatif. Jika dikeluarkan +6.7 milik Meta, Muse Spark 1.1 berada di sekitar 76% pada Terminal-Bench 2.1 — tetapi papan peringkat publik tbench.ai telah menampilkan angka terverifikasi 80.0% untuk Muse Spark 1.1 sejak akhir Juli. Kedua angka bisa sama-sama jujur dan tetap berbeda, karena satu baris Terminal-Bench bukanlah skor model. Itu adalah skor untuk perangkat pengujian (harness) ditambah model dan pengaturan tingkat upaya, dan harness internal Meta untuk 1.1 bukan yang digunakan oleh tbench. Fakta tunggal ini lebih merusak perbandingan tolok ukur antar-vendor daripada angka yang diperdebatkan mana pun, dan mengarah langsung ke bagian berikutnya.
Runtime adalah produknya.

Buang skor-skor itu dan yang tersisa adalah tawaran teknis tentang tidak mati. Dua mekanisme yang membawanya.
Yang pertama adalah log peristiwa. Muse Code menambahkan setiap panggilan model, setiap eksekusi alat, setiap persetujuan, dan setiap edit ke log lokal, yang oleh Meta digambarkan membuat sesi dapat diputar ulang secara persis dan aman untuk dimulai ulang: matikan, crashkan, atau kehilangan mesin, dan agen akan melanjutkan tepat di tempat ia berhenti, alih-alih menurunkan ulang konteksnya dari nol. Para pesaing memiliki pemulihan crash dengan kualitas yang bervariasi; tidak satu pun dari mereka yang menjadikannya fitur utama. Omong-omong, ini juga merupakan artefak audit — catatan lokal lengkap tentang apa yang dilakukan proses otonom terhadap working tree Anda, yang persis merupakan dokumen yang diminta oleh tinjauan keamanan dan yang tidak dapat dihasilkan oleh sebagian besar CLI agen.
Yang kedua adalah apa yang Meta sebut sebagai agen latar belakang asinkron. Perbedaannya dari subagen biasa adalah bahwa mereka tidak dibuat per subtugas dan dihentikan; mereka tetap aktif sepanjang sesi, melakukan langkah-langkah berikutnya sendiri, dan memilih kapan untuk melapor kembali ke loop utama. Manfaat yang diklaim adalah latensi yang lebih rendah, karena orkestrator tidak membayar biaya spin-up setiap kali mendelegasikan.
Bukti pendukung Meta adalah satu studi kasus: Muse Code yang berjalan selama 24 jam dengan lebih dari 1.000 panggilan alat, secara otonom mengoptimalkan kernel GPU pada perangkat keras NVIDIA Hopper, dengan apa yang Meta sebut sebagai peningkatan substansial dibandingkan implementasi dasar yang disediakan. Tidak ada angka percepatan yang dipublikasikan, jadi kuantitas yang menarik bukanlah hasilnya melainkan durasinya. Seribu panggilan alat tanpa penyelamatan manusia adalah permukaan kegagalan yang berbeda dari refaktorisasi lima puluh panggilan, dan ini adalah beban kerja di mana defisit tolok ukur 3,8 poin jauh kurang penting dibandingkan apakah proses tersebut masih hidup pada jam kesembilan.
Harga adalah senjatanya — dan sebagian darinya dibayar dalam kode sumber
Tidak ada langganan Muse Code. Penagihan menggunakan token, pada salah satu dari dua tingkatan, dan selisih di antara keduanya adalah hal yang paling agresif dalam peluncuran ini:
• Standard — $1,25 per juta token masukan, $0,15 per juta input yang di-cache, $4,25 per juta output. Prompt pada tingkat ini tidak digunakan untuk meningkatkan produk Meta.
• Kontributor — $0.10 per juta input, $0.002 per juta input cache, $0.20 per juta output. Sebagai gantinya, Meta dapat menggunakan data tersebut untuk meningkatkan model-modelnya.
Itu 12,5x lebih murah untuk input, 21x lebih murah untuk output, dan 75x lebih murah untuk input yang di-cache. Jalankan melalui satu langkah agen yang realistis — 60.000 token konteks repositori masuk, 3.000 token rencana-dan-patch keluar — dan keempat sudut tabel harga itu mencengangkan. Tingkatan standar dengan prompt dingin: 8,8 sen per langkah, $87,75 untuk seribu langkah. Tingkatan standar dengan konteks repositori yang di-cache: 2,2 sen, $21,75 per seribu. Tingkatan kontributor dingin: 0,66 sen, $6,60 per seribu. Tingkatan kontributor dengan cache hangat: $0,72 untuk seribu langkah yang sama.
Pekerjaan yang sama, dengan biaya 122 kali lipat atau 1/122-nya, tergantung pada dua pilihan. Proses kernel Meta sendiri yang berdurasi 24 jam dengan 1.000 panggilan menghabiskan token senilai sekitar sembilan puluh dolar pada tingkatan yang melindungi data Anda, dan di bawah satu dolar pada tingkatan yang tidak.
Keputusan sebenarnya yang peluncuran ini hadirkan di hadapan tim bukanlah keputusan harga. Agen pengode berbasis terminal membaca seluruh basis kode Anda — itulah fungsi utamanya — sehingga prompt pada tingkat kontributor berisi kode sumber Anda, API internal Anda, komentar Anda tentang mengapa solusi sementara itu ada, dan fixture pengujian apa pun yang tersimpan di repositori Anda. Untuk proyek sampingan atau pohon sumber terbuka, tingkat kontributor hampir seperti uang gratis. Untuk basis kode kepemilikan, atau repositori apa pun yang berdekatan dengan data pelanggan, ini adalah keputusan lisensi yang mengenakan pakaian diskon, dan seharusnya berada di tangan siapa pun yang menyetujui penanganan data, bukan di tangan siapa pun yang memantau tagihan cloud. Meta menetapkan harganya dengan diskon 12x karena data tersebut bernilai setidaknya sebesar itu bagi Meta.
Apa yang tidak bisa Anda dapatkan melalui API

82,9% itu milik Muse Spark 1.2 di dalam Muse Code. Jika Anda memanggil model dari kerangka kerja agen Anda sendiri, Anda memperoleh separuh model dari pasangan itu dan tidak mendapatkan separuh harness-nya — tanpa log peristiwa, tanpa agen latar belakang yang persisten, dan, jika klaim pelatihan bersama Meta ada artinya, tanpa perilaku penggunaan alat yang disetel pula. Jadi ada dua evaluasi terpisah di sini dan mencampuradukkannya adalah kesalahan termudah yang bisa dilakukan minggu ini: apakah Muse Code mengalahkan agen yang sudah Anda jalankan, dan apakah Muse Spark 1.2 adalah model yang lebih baik daripada yang saat ini Anda panggil?
Pertanyaan kedua lebih murah untuk dijawab, karena hanya perlu menjaga harness tetap konstan dan mengganti model di bawahnya. Perlu lebih presisi soal ketersediaan: Muse Spark 1.2 dilayani langsung oleh Meta dan tidak ada dalam katalog OrcaRouter.Muse Spark 1.1 tersedia dengan harga $1.25 dan $4.25 — persis harga daftar Meta, karena OrcaRouter menambahkan markup 0% dan meneruskan harga penyedia secara langsung, yang juga menjadi alasan perubahan harga vendor muncul di sisi kami pada hari yang sama saat terjadi, bukan setelah siklus kontrak. Telemetri produksi tujuh hari kami untuk 1.1 menunjukkan p50 time-to-first-token pada 1.84 detik dan p95 pada 6.00 detik, yang merupakan ekspektasi latensi yang lebih berguna daripada benchmark harness mana pun.
Nilai praktis dari satu gateway dalam pekan seperti ini adalah bahwa set perbandingan — Claude Opus 5, GPT-5.6 Terra, Grok 4.5, Gemini 3.6 Flash, dan Muse Spark 1.1 — berada di balik satu kunci dengan harga daftar, sehingga A/B hanyalah perubahan string, bukan proses pengadaan. Ini juga mencakup risiko struktural dalam penawaran Meta: Muse Spark 1.2 hanya memiliki satu penyedia, yang menjadikannya titik kegagalan tunggal secara desain. Failover otomatis antarpenyedia adalah pembeda antara sore yang buruk bagi Meta menjadi sore yang buruk bagi agen Anda, atau tidak.
Ini juga alasan mengapa 1.2 dirilis secara diam-diam dan lambat.
Muse Spark 1.2 muncul di API Meta pada 5 Agustus tanpa pengumuman dan tanpa angka yang berubah — konteks 1M yang sama, $1.25 dan $4.25 yang sama, dial penalaran lima tingkat yang sama dengan Muse Spark 1.1. Satu-satunya hal yang bergeser diukur dari luar: Artificial Analysis mencatat waktu hingga token pertama sebesar 26.12 detik dibandingkan 2.90 detik milik 1.1 pada upaya penalaran maksimum, menghasilkan tiga poin Intelligence Index, dari 51 menjadi 54. Jika dibaca sebagai rilis model serba guna, itu adalah pertukaran yang aneh — sembilan kali lebih lama menunggu untuk tiga poin.
Dibaca sebagai bagian model dari agen yang dilatih bersama, itu adalah trade-off yang jelas. Tidak ada orang yang menunggu refactor dua belas file yang memperhatikan dua puluh enam detik perencanaan; orang yang menunggu penyelesaian chat memperhatikan semuanya. Meta tidak meluncurkan model chat secara diam-diam dan berharap tidak ada yang mengukur latensinya. Meta mengirimkan mesinnya sebelum mobilnya, dan pengumumannya datang ketika mobilnya tiba. Halaman pengembang Muse Spark milik Meta sekarang juga menampilkan 1.2.
Akibatnya adalah peringatan bagi siapa pun yang mengadopsi keluarga ini karena luasnya. Muse Spark 1.1 dijual sebagai model penalaran multimodal — teks, gambar, video, audio, dan PDF, cocok untuk riset media campuran. Posisi versi 1.2 adalah pekerjaan perangkat lunak, dan materi peluncurannya adalah agen pengodean. Permukaan multimodal belum dihapus, tetapi itu bukan lagi yang dioptimalkan atau diiklankan oleh Meta, dan tidak seorang pun di luar Meta yang memublikasikan hasil video atau audio untuk 1.2.
Di mana Muse Code masih tipis
• Ini adalah beta, dan diberi label demikian. Tidak ada apa pun tentang jaminan log peristiwa yang telah diverifikasi oleh siapa pun di luar Meta.
• hanya untuk macOS dan Linux. Pengembang Windows menggunakan WSL atau tidak sama sekali, yang merupakan kendala nyata bagi armada perusahaan, bukan sekadar ketidaknyamanan.
• Hanya terminal.Tanpa GUI, tanpa integrasi IDE, dan tanpa agen paralel yang di-host cloud seperti yang sudah ditawarkan Codex. Materi peluncuran Meta tidak menyebutkan dukungan MCP.
• Tidak ada metodologi yang dipublikasikan di balik semua bagan tolok ukur, dan belum ada evaluasi independen baik terhadap agen maupun sub-skor pengkodean Muse Spark 1.2. Artificial Analysis memiliki indeks komposit untuk 1.2 tetapi tidak memiliki rincian pengkodean dan agen per-tolok ukur yang diterbitkannya untuk 1.1 — dan skor agen 1.1 adalah dimensi terlemahnya dengan selisih yang besar, yang menjadikannya angka yang tepat untuk menentukan rilis ini.
• Meta terlambat.Claude Code dan Codex sudah setahun menjadi kebiasaan, dengan ekosistem plugin dan alur kerja tim yang dibangun di sekitarnya. Log peristiwa yang aman dari crash adalah alasan bagus untuk mencoba sesuatu; tetapi itu sendiri bukan alasan untuk memindahkan tim.
Pertanyaan yang sebenarnya ditanyakan orang-orang
Apakah Muse Code gratis?
Tidak, tetapi juga tidak ada langganan — tidak seperti paket Claude Code dan Codex yang menjadi pesaingnya, Muse Code menagih murni per token melalui Meta Model API. Biaya dengan demikian sebanding dengan seberapa banyak konteks repositori yang didorong sesi Anda, bukan jumlah pengguna, yang menguntungkan pengguna berat sesekali dan merugikan agen yang selalu aktif. Tingkat kontributor cukup mendekati gratis sehingga harga bukanlah hambatan nyata untuk mencobanya.
Apakah tier kontributor dilatih pada kode privat saya?
Ketentuan Meta untuk tier tersebut adalah bahwa data dapat digunakan untuk meningkatkan modelnya, dan prompt dari agen pengkodean mengandung kode Anda. Meta menyatakan bahwa prompt tier standar tidak digunakan untuk meningkatkan produknya; itu adalah tier yang digunakan untuk hal-hal yang bersifat kepemilikan. Perlakukan pilihan ini sebagai keputusan penanganan data dengan diskon yang melekat, bukan preferensi penagihan — dan perhatikan bahwa diskon berlaku per token, sehingga insentif untuk diam-diam menurunkan tier bertambah tepat seiring dengan penggunaan Anda.
Bisakah saya menggunakan Muse Spark 1.2 dengan Claude Code atau agen saya sendiri?
Model ini tersedia melalui Meta Model API secara independen dari Muse Code, jadi ya, untuk apa pun yang menerima endpoint kustom. Yang tidak akan Anda dapatkan adalah pemasangan yang dilatih bersama yang menjadi dasar Meta mengklaim hasil benchmark-nya, dan ekspektasi yang jujur adalah bahwa model yang dijalankan di luar harness tempat ia disetel akan mendapat skor di bawah angka pada bagan. Jika tujuannya adalah mengevaluasi model, bukan agennya, jalankan model tersebut melawan Claude Opus 5 dan GPT-5.6 Terra di harness Anda sendiri dan abaikan seluruh deck tersebut.
Siapa yang harus memasangnya minggu ini
Jika Anda menjalankan pekerjaan otonom berdurasi panjang — migrasi, peningkatan dependensi di seluruh monorepo, apa pun yang saat ini harus Anda awasi karena agen kehilangan jejaknya — Muse Code layak dicoba selama satu sore pada klon percobaan. Log peristiwa dan agen latar belakang persisten memang dirancang tepat untuk mode kegagalan tersebut, dan defisit tolok ukur paling kecil justru saat durasi tugas paling panjang.
Jika Anda berada pada basis kode sumber terbuka atau non-sensitif dan biaya adalah kendala utama Anda, tingkat kontributor adalah angka yang paling menarik di pasar agen pengkodean saat ini, dan 0.66 sen per langkah bukanlah salah ketik.
Jika Anda menjalankan tim di Claude Code atau Codex terhadap repositori proprietary, belum ada hal di sini yang memaksa untuk berpindah. Muse Code berada di peringkat kedua atau ketiga di setiap papan yang dipilih sendiri oleh vendor-nya, harga tingkat standarnya setara dengan kompetitor dan bukan di bawahnya, dan pembedanya adalah properti keandalan yang belum diuji oleh siapa pun di luar Meta. Hal yang perlu diperhatikan bukanlah tolok ukur berikutnya. Melainkan apakah log peristiwa tersebut tetap bertahan ketika seseorang yang tidak bekerja di Meta menjalankan seribu panggilan alat melaluinya.
Dibandingkan dalam artikel ini3
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
