
Muse Spark 1.2 dan Muse Code: Model Ketiga Meta dalam Empat Bulan Berimbang dengan Grok 4.5
- metaBARUMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenBARUQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekBARUDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- qwenBARUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 188 tok/s
- orcaBARUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicBARUAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0856Kecerdasan72Koding
- tencentTencent: Hy32026-07-0642Kecerdasan59Koding
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Kecerdasan42Koding
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Kecerdasan39Koding
- anthropicAnthropic: Claude Sonnet 52026-06-3055Kecerdasan72Koding
- klingKling: Kling 3.0 Turbo2026-06-1757Kecerdasan52Koding57Matematika
- z-aiZ.ai: GLM 5.22026-06-1653Kecerdasan69Koding60Matematika
Meta merilis Muse Spark 1.2 pada 5 Agustus 2026, empat minggu setelah Muse Spark 1.1 dan sekitar empat bulan setelah Muse Spark pertama. Versi ini hadir dengan sesuatu yang tidak dimiliki dua versi sebelumnya: agen coding milik Meta sendiri, Muse Code, dirilis dalam versi beta dan dilatih bersama dengan model yang menjalankannya. Dan pada satu-satunya papan skor yang tidak dikendalikan Meta maupun pesaingnya, rilis ini membawa Meta ke posisi imbang dengan SpaceXAI — Muse Spark 1.2 dan Grok 4.5 kini sama-sama mencetak 54 pada Artificial Analysis Intelligence Index.
Ada dua hal yang perlu dipisahkan sebelum angka-angka di bawah ini bermakna. Skor Intelligence Index, angka latensi, dan jumlah token berasal dari Artificial Analysis, yang menjalankan evaluasinya sendiri dan mempublikasikan hasilnya; itu independen. Hasil coding yang Meta tonjolkan dalam pengumumannya — Terminal-Bench 2.1, DeepSWE v1.1, dan benchmark internal — dijalankan oleh Meta, dengan menggunakan harness Meta, dengan setiap model pesaing dipasangkan dengan produk agennya sendiri. Kedua jenis angka tersebut berguna. Namun keduanya bukan jenis bukti yang sama, dan artikel ini memisahkannya.
Apa yang Sebenarnya Dirilis Meta

Pengumuman tersebut, yang diposting di blog riset AI Meta dan bertanggal 5 Agustus, mencakup dua produk sekaligus.
• Muse Spark 1.2 — pembaruan yang berfokus pada pengodean untuk keluarga Muse Spark. Meta mengatakan bahwa mereka meningkatkan komputasi pelatihan untuk tugas-tugas pengodean dan memperluas keragaman lingkungan pelatihan, sambil tetap mempertahankan kemampuan agen umum yang menjadi dasar penjualan rilis 1.1. Target pelatihan yang dinyatakan bersifat jangka panjang: generasi seluruh repositori, proyek end-to-end yang besar, dan apa yang Meta sebut auto-research, dengan perencanaan untuk mengurutkan pekerjaan, pengkondisian tujuan untuk mempertahankan arah di banyak langkah, dan pemadatan konteks untuk menjaga status yang relevan tetap aktif selama sesi berlangsung lama.
• Muse Code — agen pengodean terminal dalam versi beta, dipasang dengan skrip shell satu baris dari domain pengembang Meta. Ia menjalankan agen latar belakang asinkron yang persisten dan bertahan sepanjang sesi, pada runtime log peristiwa lokal yang dideskripsikan Meta sebagai replay-exact dan restart-safe, serta mengoordinasikan beberapa subagen per tugas dalam worktree terisolasi. Ia dilengkapi dengan tiga keterampilan bawaan: /plan untuk perencanaan dengan persetujuan, /grill untuk pengujian stres terhadap pekerjaan yang sudah selesai, dan /goal untuk mendorong tugas hingga selesai.
{{1}}Keterkaitan ini bukanlah kebetulan.{{/1}} {{2}}Meta mengatakan keduanya dilatih bersama — model tersebut disetel pada lintasan sampel penolakan dari harness, dengan optimasi resep untuk tujuan, pemadatan, dan sub-agen.{{/2}} {{3}}Itu adalah strategi pelatihan bersama yang sama yang menghasilkan Claude Code dan Codex, dan memiliki konsekuensi bagi siapa pun yang membaca angka tolok ukur: skor pengodean utama model dihasilkan di dalam harness yang menjadi tempat model dilatih.{{/3}} {{4}}Itu bukan kecurangan, melainkan cara kerja evaluasi agentik saat ini.{{/4}} {{5}}Namun, itu berarti skor 1.2 yang diperoleh melalui kerangka lain merupakan pertanyaan terbuka, bukan asumsi yang aman.{{/5}}
Sisa spesifikasi tidak berubah dari 1.1, yang mana itu sendiri informatif. Konteks tetap pada 1,048,576 token. Penalaran tetap wajib di lima tingkat upaya — minimal, rendah, sedang, tinggi, xhigh — dengan sedang sebagai default; tidak ada konfigurasi di mana Anda mendapatkan bobot tanpa membayar untuk beberapa pertimbangan. Bobot bersifat tertutup, tanpa repositori Hugging Face, dan Model API milik Meta sendiri tetap menjadi satu-satunya tempat first-party untuk memanggilnya.
43, lalu 51, lalu 54

Artificial Analysis memberi skor 54 pada Muse Spark 1.2 dalam Intelligence Index-nya pada pengaturan penalaran xhigh, menempatkannya di peringkat #13 dari 185 model dengan median kelas 32. Indeks tersebut merupakan gabungan berbobot dari sembilan evaluasi — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, dan AA-LCR — yang dibagi rata ke dalam agen, pengkodean, kemampuan umum, dan penalaran ilmiah.
Dibaca sebagai rangkaian, bukan sekadar cuplikan, lintasan Meta adalah cerita yang sebenarnya. Muse Spark asli mencetak skor 43 pada bulan April. Muse Spark 1.1 mencapai 51 pada 9 Juli, kenaikan delapan poin dalam satu kuartal. Muse Spark 1.2 menambah tiga poin lagi dalam waktu kurang dari sebulan. Meta telah bergerak 11 poin indeks dalam empat bulan dan kini meluncur lebih cepat daripada yang bisa diikuti oleh ekosistem evaluasi — masih belum ada rincian per tolok ukur yang dipublikasikan untuk 1.2, dan tidak ada catatan Design Arena sama sekali, sementara 1.1 memiliki keduanya.
Peringkat lima puluh empat, Meta sejajar dengan Grok 4.5, model yang dirilis SpaceXAI sehari sebelum Muse Spark 1.1, dan berada di belakang kelompok frontier yang ketat: Claude Opus 5 dengan 61, Claude Fable 5 dengan 60, GPT-5.6 Sol dengan 59. Selisih ke puncak adalah enam atau tujuh poin. Selisih dari posisi Meta di awal tahun adalah sebelas. Apakah selisih itu menyempit bergantung pada apakah ritme tersebut dipertahankan, dan Meta saat ini berada pada siklus rilis empat minggu.
Namun, seri pada indeks komposit bukanlah seri pada pekerjaan, dan perlu dikatakan apa yang 54 selesaikan dan tidak selesaikan. Itu menyelesaikan bahwa Muse Spark 1.2 berada dalam percakapan yang sama dengan Grok 4.5 dalam hal kemampuan agregat. Itu tidak memberi tahu Anda mana yang menulis patch yang lebih baik, karena sub-indeks pengkodean yang akan menjawab hal itu belum diterbitkan untuk 1.2.
Angka koding Meta, baca dengan saksama.
Pengumuman Meta unggul pada tiga grafik. Pada pengujiannya sendiri, dilaporkan sebagai pass@1 dari lima percobaan dengan setiap model pesaing dipasangkan dengan produk agennya sendiri:
• Terminal-Bench 2.1 — 82,9% untuk Muse Spark 1.2, naik dari 76,2% untuk 1.1. Claude Opus 5 ditampilkan di depan dengan 86,7%.
• DeepSWE v1.1 — 59.3%, naik dari 53.0%.
• Benchmark pengkodean internal Meta — 70.6%, naik dari 68.3%.
Delta-delta merupakan bagian yang dapat dipercaya. Peningkatan 6,7 poin di Terminal-Bench dan 6,3 di DeepSWE, yang diukur dengan cara yang sama pada harness yang sama oleh tim yang sama dengan selisih satu bulan, adalah pembacaan yang wajar tentang seberapa besar 1.2 meningkat dibandingkan 1.1 pada hal yang sedang Meta optimalkan. Bagian yang sebaiknya tidak terlalu dipercaya adalah peringkat antar-vendor: pemasangan harness adalah variabel bebas yang besar, dan lab yang menyetel harness-nya sendiri bersama modelnya sendiri tidak berada dalam posisi untuk menyetel harness milik pihak lain dengan setara. Meta berada di posisi kedua pada slide-nya sendiri, yang setidaknya bukan bentuk umum dari benchmark vendor, tetapi hingga tulisan ini dibuat, belum ada pihak ketiga yang mereproduksi hasilnya.
Daftar harga kedua
Hal yang paling penting dalam rilis ini tidak ada di grafik benchmark. Muse Spark 1.2 hadir dengan dua daftar harga.
• Tingkat Standar — $1.25 per juta token input, $0.15 per juta saat cache terkena, $4.25 per juta output. Tidak berubah dari 1.1, hingga ke sen. Batas laju sekitar 3,000 permintaan per menit. Grounding pencarian web ditagih terpisah sebesar $2.50 per seribu kueri.
• Tingkat Kontributor — $0.10 input, $0.002 input cache, $0.20 output. Itu 12.5× lebih murah untuk input dan 21.25× lebih murah untuk output. Harga masuknya adalah izin bagi Meta untuk melatih model masa depan pada lalu lintas Anda, serta batas kecepatan 60 permintaan per menit — 2% dari anggaran standar.
Pada $0,10 dan $0,20, Muse Spark 1.2 akan mengalahkan harga hampir semua model yang berdekatan dengan frontier di pasar, termasuk tingkatan budget open-weight yang sebaliknya ia kalah harga. Itu adalah angka yang menarik dalam peluncuran ini, dan sebenarnya itu bukan keputusan harga. Enam puluh permintaan per menit dengan sendirinya menyingkirkan sebagian besar pola fan-out produksi, jadi tingkatan ini ditujukan untuk eksperimen dan kerja tim kecil, bukan untuk melayani. Dan 'kami dapat melatih model pada lalu lintas Anda' adalah pertanyaan bagi siapa pun yang menyetujui tata kelola data di organisasi Anda, bukan bagi siapa pun yang memilih model. Anggap saja ini sebagai tinjauan hukum dengan diskon, bukan SKU yang lebih murah.
Berapa biaya untuk memproduksi 54?

Artificial Analysis menerbitkan berapa biaya yang dikeluarkan untuk menjalankan evaluasinya sendiri, dan di kolom itulah bentuk Muse Spark 1.2 terlihat. Menyelesaikan seluruh rangkaian sembilan benchmark menghabiskan biaya $637,85 dan membakar 95 juta token keluaran, dibandingkan dengan $548,07 dan 94 juta untuk Muse Spark 1.1 — dengan harga per token yang identik. Kelebihan 16% itu murni karena deliberasi.
Angka latensi bergerak dengan cara yang sama. Diukur pada xhigh, waktu hingga token pertama adalah 26.12 detik untuk 1.2 dibandingkan 2.90 detik untuk 1.1, dan kecepatan output turun dari 213.5 menjadi 165.0 token per detik. Meta membeli tiga poin indeks dengan waktu berpikir, dan desain penalaran wajib berarti Anda tidak dapat menolak pembelian tersebut — hanya memilih berapa banyak yang Anda hasilkan.
Angka 26 detik itu akan disalahkutip, jadi berikut koreksinya terlebih dahulu: itu adalah pengukuran pada tingkat upaya paling mahal yang diekspos model, dan API default ke sedang. Sebagai titik acuan dari lalu lintas nyata, bukan dari alat ukur benchmark, Muse Spark 1.1 yang dilayani melalui OrcaRouter — pada tingkat upaya apa pun yang sebenarnya diminta pemanggil — menunjukkan p50 waktu ke token pertama selama 7 hari sebesar 1,84 detik dan p95 sebesar 6,00 detik, pada 519 token per detik dan tingkat kesalahan nol. Latensi benchmark pada upaya maksimum dan latensi produksi pada upaya default adalah kuantitas yang berbeda, dan biasanya berbeda satu tingkat magnitudo. Baca 26,12 detik sebagai batas atas untuk penalaran mendalam, bukan sebagai apa yang akan dirasakan permintaan.
Di mana Anda dapat meneleponnya hari ini
Muse Spark 1.2 dilayani oleh Model API milik Meta sendiri dan, pada saat penulisan ini, tidak di tempat lain — ia tidak dirutekan melalui OpenRouter saat peluncuran, tidak ada repositori Hugging Face, dan ia tidak ada dalam katalog OrcaRouter. Muse Spark 1.1 adalah, dengan harga $1.25 dan $4.25 — angka yang sama yang dibebankan Meta, karena OrcaRouter mengambil markup 0% dan meneruskan harga daftar penyedia secara langsung.
Itu lebih penting untuk perbandingan daripada untuk model itu sendiri. Jika Anda membangun model biaya untuk rilis ini, model yang akan Anda jadikan pembandingnya — Claude Opus 5, Claude Fable 5, GPT-5.6 Sol, Grok 4.5, DeepSeek V4 Flash — berada di balik satu kunci dengan harga daftar, jadi angka di spreadsheet Anda adalah angka di faktur, dan pemotongan harga dari penyedia berlaku pada hari yang sama, bukan setelah perpanjangan. Untuk Muse Spark 1.2 secara khusus, jawabannya saat ini adalah endpoint Meta, kontrak kedua, dan tagihan terpisah.
Apa yang tidak dijawab oleh pengumuman tersebut
• Tidak ada nomor coding independen.Artificial Analysis menerbitkan komposit untuk 1.2 tetapi belum menerbitkan sub-indeks coding dan agentic yang diterbitkannya untuk 1.1 (masing-masing 71.3 dan 37.5). Karena kerja agentic adalah dimensi terlemah 1.1 dengan selisih yang lebar, dan coding agentic justru yang diklaim telah diperbaiki oleh 1.2, inilah angka yang akan menentukan rilis tersebut.
• Tidak ada reproduksi hasil harness. Setiap angka koding dalam pengumuman tersebut dijalankan oleh Meta. Belum ada yang menerbitkan skor Muse Spark 1.2 dari kerangka netral.
• Tidak ada verifikasi multimodal.Daftar Muse Spark mengiklankan input teks, gambar, video, audio, dan PDF. Evaluasi independen mencakup teks dan gambar. Perpesanan Meta 1.2 telah beralih hampir seluruhnya ke pekerjaan perangkat lunak, dan kasus penggunaan media campuran 1.1 yang secara eksplisit dijual untuk saat ini tidak memiliki pemasaran maupun pengukuran di belakangnya.
• Tidak ada riwayat throughput.Volume pada endpoint masih terlalu rendah untuk statistik latensi bergulir yang biasa terisi.
Apa yang perlu ditonton selama empat minggu ke depan
Tiga hal akan menentukan apakah rilis ini sesuai dengan apa yang Meta katakan. Pertama adalah skor agentic independen untuk 1.2 — jika sub-indeks yang tadinya 37.5 pada 1.1 telah bergerak secara substansial, klaim coding tersebut nyata. Kedua adalah apakah ada yang mereplikasi hasil Terminal-Bench di luar Muse Code; model yang hanya berkinerja baik di dalam kerangka ujinya sendiri adalah produk, bukan kapabilitas. Ketiga adalah apa yang terjadi pada tingkat kontributor: jika batas 60 permintaan dilonggarkan, model yang mendekati frontier dengan $0.10 masuk dan $0.20 keluar mengubah aritmetika tingkat anggaran dengan cara yang tidak akan pernah dilakukan oleh kenaikan indeks tiga poin.
Dan jika ritme ini berlanjut, Muse Spark 1.3 dijadwalkan rilis pada awal September. Berdasarkan bukti ini, angka yang perlu diperhatikan saat dirilis bukanlah skor indeks. Melainkan apakah Meta dapat menambah kapabilitas tanpa menambah dua puluh detik waktu berpikir lagi di awal setiap permintaan.
Dibandingkan dalam artikel ini3
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
