Muse Spark 1.2 dan Muse Code-1
Guides & Insights

Muse Spark 1.2 dan Muse Code: Model Ketiga Meta dalam Empat Bulan Berimbang dengan Grok 4.5

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Meta merilis Muse Spark 1.2 pada 5 Agustus 2026, empat minggu setelah Muse Spark 1.1 dan sekitar empat bulan setelah Muse Spark pertama. Versi ini hadir dengan sesuatu yang tidak dimiliki dua versi sebelumnya: agen pengkodean milik Meta sendiri, Muse Code, dirilis dalam versi beta dan dilatih bersama dengan model yang menjalankannya. Dan pada satu papan skor yang tidak dikendalikan Meta maupun para pesaingnya, perilisan ini membawa Meta sejajar dengan SpaceXAI — Muse Spark 1.2 dan Grok 4.5 kini sama-sama mencetak 54 pada Artificial Analysis Intelligence Index. Lima hari kemudian muncul perkembangan yang lebih besar: pada 10 Agustus Meta mengatakan akan membuka bobot Muse Spark 1.2 — sebuah pengumuman yang, jika terwujud, akan menjadikan model ini sebagai pesaing terbuka terkuat asal AS saat ini terhadap model-model Tiongkok.

Ada dua hal yang perlu dipisahkan sebelum angka-angka di bawah ini bermakna. Skor Intelligence Index, angka latensi, dan jumlah token berasal dari Artificial Analysis, yang menjalankan evaluasinya sendiri dan mempublikasikan hasilnya; itu independen. Hasil coding yang Meta tonjolkan dalam pengumumannya — Terminal-Bench 2.1, DeepSWE v1.1, dan benchmark internal — dijalankan oleh Meta, dengan menggunakan harness Meta, dengan setiap model pesaing dipasangkan dengan produk agennya sendiri. Kedua jenis angka tersebut berguna. Namun keduanya bukan jenis bukti yang sama, dan artikel ini memisahkannya.

Apa yang Sebenarnya Dirilis Meta

Muse Spark 1.2 and Muse Code-2

Pengumuman tersebut, yang diposting di blog riset AI Meta dan bertanggal 5 Agustus, mencakup dua produk sekaligus.

Muse Spark 1.2 — pembaruan yang berfokus pada pengodean untuk keluarga Muse Spark. Meta mengatakan bahwa mereka meningkatkan komputasi pelatihan untuk tugas-tugas pengodean dan memperluas keragaman lingkungan pelatihan, sambil tetap mempertahankan kemampuan agen umum yang menjadi dasar penjualan rilis 1.1. Target pelatihan yang dinyatakan bersifat jangka panjang: generasi seluruh repositori, proyek end-to-end yang besar, dan apa yang Meta sebut auto-research, dengan perencanaan untuk mengurutkan pekerjaan, pengkondisian tujuan untuk mempertahankan arah di banyak langkah, dan pemadatan konteks untuk menjaga status yang relevan tetap aktif selama sesi berlangsung lama.

Muse Code — agen pengodean terminal dalam versi beta, dipasang dengan skrip shell satu baris dari domain pengembang Meta. Ia menjalankan agen latar belakang asinkron yang persisten dan bertahan sepanjang sesi, pada runtime log peristiwa lokal yang dideskripsikan Meta sebagai replay-exact dan restart-safe, serta mengoordinasikan beberapa subagen per tugas dalam worktree terisolasi. Ia dilengkapi dengan tiga keterampilan bawaan: /plan untuk perencanaan dengan persetujuan, /grill untuk pengujian stres terhadap pekerjaan yang sudah selesai, dan /goal untuk mendorong tugas hingga selesai.

{{1}}Keterkaitan ini bukanlah kebetulan.{{/1}} {{2}}Meta mengatakan keduanya dilatih bersama — model tersebut disetel pada lintasan sampel penolakan dari harness, dengan optimasi resep untuk tujuan, pemadatan, dan sub-agen.{{/2}} {{3}}Itu adalah strategi pelatihan bersama yang sama yang menghasilkan Claude Code dan Codex, dan memiliki konsekuensi bagi siapa pun yang membaca angka tolok ukur: skor pengodean utama model dihasilkan di dalam harness yang menjadi tempat model dilatih.{{/3}} {{4}}Itu bukan kecurangan, melainkan cara kerja evaluasi agentik saat ini.{{/4}} {{5}}Namun, itu berarti skor 1.2 yang diperoleh melalui kerangka lain merupakan pertanyaan terbuka, bukan asumsi yang aman.{{/5}}

Sisa spesifikasi tidak berubah dari 1.1, yang sifatnya informatif. Konteks tetap pada 1,048,576 token. Penalaran tetap wajib di lima tingkat upaya — minimal, rendah, sedang, tinggi, xhigh — dengan sedang sebagai bawaan; tidak ada konfigurasi di mana Anda mendapatkan bobot tanpa membayar untuk beberapa pertimbangan. Saat peluncuran, bobot ditutup, tanpa repositori Hugging Face dan Model API milik Meta sendiri sebagai satu-satunya tempat pihak pertama untuk memanggilnya. Itu sekarang dijadwalkan berubah: pada 10 Agustus Meta mengumumkan akan membuka bobot, membalikkan kebijakan bobot tertutup yang mengatur tiga rilis Muse Spark pertama.

43, lalu 51, lalu 54

Muse Spark 1.2 and Muse Code-3

Artificial Analysis memberi skor 54 pada Muse Spark 1.2 dalam Intelligence Index-nya pada pengaturan penalaran xhigh, menempatkannya di peringkat #13 dari 185 model dengan median kelas 32. Indeks tersebut merupakan gabungan berbobot dari sembilan evaluasi — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, dan AA-LCR — yang dibagi rata ke dalam agen, pengkodean, kemampuan umum, dan penalaran ilmiah.

Dibaca sebagai rangkaian, bukan sekadar cuplikan, lintasan Meta adalah cerita yang sebenarnya. Muse Spark asli mencetak skor 43 pada bulan April. Muse Spark 1.1 mencapai 51 pada 9 Juli, kenaikan delapan poin dalam satu kuartal. Muse Spark 1.2 menambah tiga poin lagi dalam waktu kurang dari sebulan. Meta telah bergerak 11 poin indeks dalam empat bulan dan kini meluncur lebih cepat daripada yang bisa diikuti oleh ekosistem evaluasi — masih belum ada rincian per tolok ukur yang dipublikasikan untuk 1.2, dan tidak ada catatan Design Arena sama sekali, sementara 1.1 memiliki keduanya.

Peringkat lima puluh empat, Meta sejajar dengan Grok 4.5, model yang dirilis SpaceXAI sehari sebelum Muse Spark 1.1, dan berada di belakang kelompok frontier yang ketat: Claude Opus 5 dengan 61, Claude Fable 5 dengan 60, GPT-5.6 Sol dengan 59. Selisih ke puncak adalah enam atau tujuh poin. Selisih dari posisi Meta di awal tahun adalah sebelas. Apakah selisih itu menyempit bergantung pada apakah ritme tersebut dipertahankan, dan Meta saat ini berada pada siklus rilis empat minggu.

Namun, seri pada indeks komposit bukanlah seri pada pekerjaan, dan perlu dikatakan apa yang 54 selesaikan dan tidak selesaikan. Itu menyelesaikan bahwa Muse Spark 1.2 berada dalam percakapan yang sama dengan Grok 4.5 dalam hal kemampuan agregat. Itu tidak memberi tahu Anda mana yang menulis patch yang lebih baik, karena sub-indeks pengkodean yang akan menjawab hal itu belum diterbitkan untuk 1.2.

Angka koding Meta, baca dengan saksama.

Pengumuman Meta unggul pada tiga grafik. Pada pengujiannya sendiri, dilaporkan sebagai pass@1 dari lima percobaan dengan setiap model pesaing dipasangkan dengan produk agennya sendiri:

Terminal-Bench 2.1 — 82,9% untuk Muse Spark 1.2, naik dari 76,2% untuk 1.1. Claude Opus 5 ditampilkan di depan dengan 86,7%.

DeepSWE v1.1 — 59.3%, naik dari 53.0%.

Benchmark pengkodean internal Meta — 70.6%, naik dari 68.3%.

Delta-delta merupakan bagian yang dapat dipercaya. Peningkatan 6,7 poin di Terminal-Bench dan 6,3 di DeepSWE, yang diukur dengan cara yang sama pada harness yang sama oleh tim yang sama dengan selisih satu bulan, adalah pembacaan yang wajar tentang seberapa besar 1.2 meningkat dibandingkan 1.1 pada hal yang sedang Meta optimalkan. Bagian yang sebaiknya tidak terlalu dipercaya adalah peringkat antar-vendor: pemasangan harness adalah variabel bebas yang besar, dan lab yang menyetel harness-nya sendiri bersama modelnya sendiri tidak berada dalam posisi untuk menyetel harness milik pihak lain dengan setara. Meta berada di posisi kedua pada slide-nya sendiri, yang setidaknya bukan bentuk umum dari benchmark vendor, tetapi hingga tulisan ini dibuat, belum ada pihak ketiga yang mereproduksi hasilnya.

Daftar harga kedua

Hal yang paling penting dalam rilis ini tidak ada di grafik benchmark. Muse Spark 1.2 hadir dengan dua daftar harga.

Tingkat Standar — $1.25 per juta token input, $0.15 per juta saat cache terkena, $4.25 per juta output. Tidak berubah dari 1.1, hingga ke sen. Batas laju sekitar 3,000 permintaan per menit. Grounding pencarian web ditagih terpisah sebesar $2.50 per seribu kueri.

Tingkat Kontributor — $0.10 input, $0.002 input cache, $0.20 output. Itu 12.5× lebih murah untuk input dan 21.25× lebih murah untuk output. Harga masuknya adalah izin bagi Meta untuk melatih model masa depan pada lalu lintas Anda, serta batas kecepatan 60 permintaan per menit — 2% dari anggaran standar.

Pada $0,10 dan $0,20, Muse Spark 1.2 akan mengalahkan harga hampir semua model yang berdekatan dengan frontier di pasar, termasuk tingkatan budget open-weight yang sebaliknya ia kalah harga. Itu adalah angka yang menarik dalam peluncuran ini, dan sebenarnya itu bukan keputusan harga. Enam puluh permintaan per menit dengan sendirinya menyingkirkan sebagian besar pola fan-out produksi, jadi tingkatan ini ditujukan untuk eksperimen dan kerja tim kecil, bukan untuk melayani. Dan 'kami dapat melatih model pada lalu lintas Anda' adalah pertanyaan bagi siapa pun yang menyetujui tata kelola data di organisasi Anda, bukan bagi siapa pun yang memilih model. Anggap saja ini sebagai tinjauan hukum dengan diskon, bukan SKU yang lebih murah.

Berapa biaya untuk memproduksi 54?

Muse Spark 1.2 and Muse Code-4

Artificial Analysis menerbitkan berapa biaya yang dikeluarkan untuk menjalankan evaluasinya sendiri, dan di kolom itulah bentuk Muse Spark 1.2 terlihat. Menyelesaikan seluruh rangkaian sembilan benchmark menghabiskan biaya $637,85 dan membakar 95 juta token keluaran, dibandingkan dengan $548,07 dan 94 juta untuk Muse Spark 1.1 — dengan harga per token yang identik. Kelebihan 16% itu murni karena deliberasi.

Angka latensi bergerak dengan cara yang sama. Diukur pada xhigh, waktu hingga token pertama adalah 26.12 detik untuk 1.2 dibandingkan 2.90 detik untuk 1.1, dan kecepatan output turun dari 213.5 menjadi 165.0 token per detik. Meta membeli tiga poin indeks dengan waktu berpikir, dan desain penalaran wajib berarti Anda tidak dapat menolak pembelian tersebut — hanya memilih berapa banyak yang Anda hasilkan.

Angka 26 detik itu akan disalahkutip, jadi berikut koreksinya terlebih dahulu: itu adalah pengukuran pada tingkat upaya paling mahal yang diekspos model, dan API default ke sedang. Sebagai titik acuan dari lalu lintas nyata, bukan dari alat ukur benchmark, Muse Spark 1.1 yang dilayani melalui OrcaRouter — pada tingkat upaya apa pun yang sebenarnya diminta pemanggil — menunjukkan p50 waktu ke token pertama selama 7 hari sebesar 1,84 detik dan p95 sebesar 6,00 detik, pada 519 token per detik dan tingkat kesalahan nol. Latensi benchmark pada upaya maksimum dan latensi produksi pada upaya default adalah kuantitas yang berbeda, dan biasanya berbeda satu tingkat magnitudo. Baca 26,12 detik sebagai batas atas untuk penalaran mendalam, bukan sebagai apa yang akan dirasakan permintaan.

Di mana Anda dapat meneleponnya hari ini

Muse Spark 1.2 dilayani oleh Model API milik Meta sendiri dan, pada tulisan ini dibuat, tidak di tempat lain — masih belum ada repositori Hugging Face dan tidak ada dalam katalog OrcaRouter. Itulah yang akan diubah oleh pengumuman 10 Agustus: Meta mengatakan bobot akan dibuka 'dalam beberapa minggu mendatang', dan setelah itu pertanyaan ketersediaan bergeser dari 'di mana ia dilayani?' menjadi 'bobot yang mana, di bawah lisensi apa, dan dalam runtime apa'. Muse Spark 1.1 ada dalam katalog OrcaRouter, dengan harga $1,25 dan $4,25 — angka yang sama dengan yang dikenakan Meta, karena OrcaRouter mengambil markup 0% dan meneruskan harga daftar penyedia langsung.

Itu lebih penting untuk perbandingan daripada untuk model itu sendiri. Jika Anda membangun model biaya untuk rilis ini, model-model yang akan Anda bandingkan dengannya — Claude Opus 5, Claude Fable 5, GPT-5.6 Sol, Grok 4.5, DeepSeek V4 Flash — berada di balik satu kunci dengan harga daftar, sehingga angka di spreadsheet Anda adalah angka di faktur, dan pemotongan harga penyedia terjadi di hari yang sama, bukan setelah perpanjangan. Untuk Muse Spark 1.2 secara spesifik, saat ini jawabannya adalah endpoint Meta, kontrak kedua, dan tagihan terpisah — dan begitu bobotnya tersedia, instalasi yang di-host sendiri menjadi opsi ketiga.

Apa yang berubah pada tanggal 10 Agustus

Lima hari setelah perilisan, sikap Meta terhadap produk unggulannya sendiri berbalik. Dalam pengumuman tertanggal 10 Agustus, Meta menyatakan akan membuka bobot Muse Spark 1.2 'dalam beberapa minggu mendatang', menjadikannya rilis Muse Spark pertama yang dapat dijalankan sendiri oleh sebuah tim. Pernyataan ini berasal dari eksekutif, bukan produk yang sudah dirilis: repositori Hugging Face belum ada, dan tanggal pasti, jumlah parameter, serta lisensinya semuanya belum dikonfirmasi.

Yang dipertaruhkan adalah perlombaan bobot frontier. Muse Spark 1.2 mencetak 54 pada Artificial Analysis Intelligence Index — di atas setiap model bobot terbuka AS yang saat ini dapat diunduh — jadi jika bobotnya tersedia sesuai janji, model ini akan menjadi pesaing bobot terbuka Amerika terkuat bagi laboratorium-laboratorium Tiongkok, sebuah narasi yang diutarakan panjang lebar oleh Zuckerberg pada 10 Agustus dalam esai sepanjang 6.500 kata yang menuduh pembatasan AS pada data pelatihan telah menyerahkan keunggulan bobot terbuka kepada laboratorium asing. Pivot ini sudah memiliki pengiriman pertama: Muse Glimmer, model 30 miliar parameter yang dirilis pada hari yang sama dengan lisensi Apache 2.0, disuling dari Muse Spark dan dirancang untuk beban kerja agen lokal. Benchmark milik Meta sendiri menempatkannya di depan Gemma4-31B milik Google dan Qwen3.6-27B pada tugas-tugas agen; angka-angka tersebut dijalankan oleh vendor dan belum direproduksi sejauh ini.

Apa yang tidak dijawab oleh pengumuman tersebut

Tidak ada nomor coding independen.Artificial Analysis menerbitkan komposit untuk 1.2 tetapi belum menerbitkan sub-indeks coding dan agentic yang diterbitkannya untuk 1.1 (masing-masing 71.3 dan 37.5). Karena kerja agentic adalah dimensi terlemah 1.1 dengan selisih yang lebar, dan coding agentic justru yang diklaim telah diperbaiki oleh 1.2, inilah angka yang akan menentukan rilis tersebut.

Tidak ada reproduksi hasil harness. Setiap angka koding dalam pengumuman tersebut dijalankan oleh Meta. Belum ada yang menerbitkan skor Muse Spark 1.2 dari kerangka netral.

Tidak ada verifikasi multimodal.Daftar Muse Spark mengiklankan input teks, gambar, video, audio, dan PDF. Evaluasi independen mencakup teks dan gambar. Perpesanan Meta 1.2 telah beralih hampir seluruhnya ke pekerjaan perangkat lunak, dan kasus penggunaan media campuran 1.1 yang secara eksplisit dijual untuk saat ini tidak memiliki pemasaran maupun pengukuran di belakangnya.

Tidak ada riwayat throughput.Volume pada endpoint masih terlalu rendah untuk statistik latensi bergulir yang biasa terisi.

Apa yang perlu ditonton selama empat minggu ke depan

Empat hal akan menentukan apakah rilis ini sesuai dengan apa yang Meta katakan. Pertama adalah skor agen independen untuk 1.2 — jika sub-indeks yang tadinya 37,5 pada 1.1 telah bergerak signifikan, narasi coding tersebut nyata. Kedua adalah apakah ada yang mereproduksi hasil Terminal-Bench di luar Muse Code; model yang hanya berkinerja baik di dalam kerangkanya sendiri adalah produk, bukan kapabilitas. Ketiga adalah apa yang terjadi pada tingkat kontributor: jika batas 60 permintaan dilonggarkan, model yang mendekati frontier dengan harga $0,10 masuk dan $0,20 keluar mengubah aritmetika tingkat anggaran dengan cara yang tidak akan pernah dilakukan oleh kenaikan indeks tiga poin. Keempat adalah janji bobot (weights): Meta mengatakan bobot Muse Spark 1.2 akan terbuka 'dalam beberapa minggu mendatang', dan apakah repositori tersebut hadir sesuai jadwal — dengan lisensi apa dan seberapa cepat runtime lokal mengadopsinya — akan menentukan apakah pivot bobot terbuka itu nyata.

Dan jika iramanya bertahan, Muse Spark 1.3 dijadwalkan rilis pada awal September. Berdasarkan bukti ini, angka yang perlu diperhatikan saat rilis bukanlah skor indeks. Melainkan apakah Meta dapat menambah kemampuan tanpa menambahkan dua puluh detik berpikir lagi di awal setiap permintaan. Buah pertama dari perubahan arah ini sudah keluar: Muse Glimmer, model open-weight dengan 30 miliar parameter yang dirilis Meta pada 10 Agustus di bawah lisensi Apache 2.0, dirancang untuk menjalankan agen secara lokal — pratinjau terdekat sejauh ini tentang seperti apa Muse Spark 1.2 yang terbuka.

Dibandingkan dalam artikel ini3

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari