Kartu judul pahlawan untuk berita bahwa Muse Spark 1.3 dengan penalaran maksimal kini telah aktif. Overline 'Meta Superintelligence Labs — 4 Sept 2026', judul utama 'Muse Spark 1.3 dengan penalaran maksimal kini telah aktif', subjudul yang mencatat bahwa Meta meloloskan pengujian keamanan dua hari setelah peluncuran dan membuka mode penalaran di balik skor utamanya di Muse Code dan Meta Model API dengan harga yang sama, lencana 'upaya penalaran: maksimal', 'harga daftar yang sama $1,25 / $4,25' dan 'konfigurasi di balik DeepSWE 75,4', footer 'Kini dapat dipilih di muse-spark-1.3 — token penalaran ditagih sebagai keluaran', logo OrcaRouter dikompositkan di kanan bawah.
Guides & Insights

Muse Spark 1.3 Max Reasoning Kini Hadir: Pengaturan di Balik Skor Tertinggi Meta Sekarang Dibuka untuk Semua Orang

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Muse Spark 1.3 — model penalaran tingkat lanjut yang dirilis Meta Superintelligence Labs pada 2 September — baru saja mendapatkan mode yang menjadi dasar papan skor miliknya sendiri. Pada 4 September, setelah dua hari pengujian keamanan tambahan, Meta membuka pengaturan penalaran "max" yang paling intensif komputasi dari model ini kepada para pengembang di Meta Model API dan di Muse Code, agen pengkodean terminalnya. Chief AI officer Alexandr Wang mengumumkan peluncuran ini di X dan akun @AIatMeta perusahaan mengonfirmasinya; apa yang tadinya merupakan konfigurasi terbatas untuk Meta dan pratinjau mitra saat peluncuran kini menjadi tingkat penalaran yang dapat dipilih oleh pengembang mana pun.

Urutan tersebut penting karena beberapa angka yang mendominasi liputan peluncuran Muse Spark 1.3 — 75,4 pada DeepSWE v1.1, 66,9 pada OSWorld 2.0, 1.754 pada GDPval-AA v2 — berasal dari konfigurasi maksimal, sementara model yang sebenarnya dapat dipanggil oleh pengembang dirilis dengan upaya penalaran dibatasi pada "xhigh." Meta secara eksplisit menyatakan saat peluncuran bahwa konfigurasi maksimal masih dalam pengujian keamanan, tetapi perpecahan ini berarti papan skor utama dan model yang dapat dipanggil adalah dua hal yang berbeda selama dua hari. Rilis hari Kamis menutup kesenjangan tersebut, dan dilakukan tanpa mengubah harga per token. Angka-angka tolok ukur dalam daftar itu adalah milik Meta sendiri dan belum direproduksi oleh kerangka pengujian independen; semua hal yang dilaporkan vendor dalam tulisan ini diberi label demikian.

Apa yang ditahan — dan apa yang berubah pada 4 September

Jenjang penalaran Muse Spark 1.3 tetap sama sejak API berbayar dari keluarga ini dibuka: penalaran selalu aktif, dan parameter upaya model pada Meta Model API mengambil nilai minimal, rendah, sedang, tinggi, dan xhigh, dengan model menghabiskan lebih banyak anggaran keluarannya untuk berpikir seiring naiknya tingkat. Max berada di atas xhigh — lebih banyak komputasi, lebih banyak token penalaran, dan menurut Meta, secara bermakna lebih kuat pada pekerjaan agenik berjangka panjang. Pada peluncuran 2 September, Meta mengirimkan setiap tingkat hingga xhigh tetapi tidak menyertakan max dalam API publik sambil menunggu apa yang disebutnya pengujian keselamatan tambahan, hanya membagikannya kepada sejumlah mitra terbatas — cukup untuk evaluasi independen berjalan, tidak cukup untuk beban kerja produksi.

Pada tanggal 4 September, Wang mengatakan bahwa pengujian telah selesai. Max kini menjadi pengaturan yang dapat dipilih di Muse Code — skrip instalasinya berada di dev.meta.ai/install.sh — dan pada id model muse-spark-1.3 melalui Meta Model API, yang parameter effort-nya kini menerima nilai max. Wang menggambarkan penundaan dua hari tersebut sebagai cara Meta membatasi akses "di tingkat konfigurasi," dan memberi tahu Axios bahwa Meta tidak perlu menghentikan pekerjaan yang lebih luas demi masalah keamanan. Jendela waktunya singkat, tetapi ini merupakan preseden nyata: Meta kini bersedia menahan mode penalaran tertentu di balik tinjauan keamanan sambil langsung merilis sisa checkpoint.

Satu catatan praktis bagi siapa pun yang memanggil model melalui gateway daripada endpoint Meta sendiri: beberapa halaman dokumentasi pihak ketiga dan daftar agregator ditulis pada hari peluncuran dan masih mencantumkan reasoning effort hanya sampai xhigh. Nilai max adalah peluncuran dari sisi Meta, jadi periksa apakah rute yang Anda panggil telah memperbarui parameter yang didukungnya sebelum berasumsi bahwa max dapat dicapai — proxy yang memvalidasi nilai yang diterimanya pada tanggal 2 September mungkin menolak "max" sampai pemeliharanya memperbarui.

Apa yang sebenarnya dibeli max — dan di mana itu tidak membantu

Materi yang dirilis Meta pada hari Kamis mencakup pembagian eksplisit antara pengaturan maksimal versus xhigh pada tolok ukur yang dijalankannya, dan ini adalah hal paling berguna yang sejauh ini dipublikasikan Meta tentang model tersebut. Semuanya dilaporkan sendiri oleh vendor, dihasilkan di dalam harness Muse Code milik Meta, dan Meta menyatakan bahwa perbandingannya terhadap Claude Opus 5 dan GPT-5.6 Sol merupakan uji coba "best-effort" pada pengaturan maksimum para pesaingnya yang "mungkin tidak mencerminkan kinerja yang dioptimalkan penyedia layanan." Dengan catatan tersebut, pembagian itu menunjukkan arah yang jelas:

• OSWorld 2.0 (tugas agen penggunaan komputer) — 66.9 pada max vs 57.2 pada xhigh

• GDPval-AA v2 (Elo agen kerja pengetahuan) — 1,754 pada max vs 1,709 pada xhigh

• JobBench (tugas profesional berhorizon panjang) — 64.9 pada maks vs 61.2 pada xhigh

• DeepSearchQA — seri di 89.4

• Terminal-Bench 2.1 (pengkodean agen terminal) — 89,2 pada xhigh vs 88,8 pada max, satu-satunya rangkaian pengujian di mana konfigurasi yang dirilis pada 2 September menang.

A comparison scoreboard titled 'Muse Spark 1.3 — max vs xhigh, the split'. Left column Max (released Sept 4, 2026): OSWorld 2.0 66.9, Terminal-Bench 2.1 88.8, GDPval-AA v2 (Elo) 1,754, JobBench 64.9, DeepSearchQA 89.4, Available to all developers. Right column Xhigh (released Sept 2, 2026): OSWorld 2.0 57.2, Terminal-Bench 2.1 89.2, GDPval-AA v2 (Elo) 1,709, JobBench 61.2, DeepSearchQA 89.4, Available to all developers. Footer: 'Benchmark splits per Meta's Sept 4 release materials — vendor-reported, not independently reproduced. Xhigh wins Terminal-Bench 2.1.' OrcaRouter logo bottom-right.

Pola ini perlu dibaca dengan saksama. Max paling membantu ketika tugasnya berupa loop agentik yang panjang — mengoperasikan komputer, mengerjakan brief kerja pengetahuan, mengelola jadwal subtugas seperti yang dilakukan JobBench. Pada benchmark terminal satu giliran, Max tidak menambah apa pun dan malah sedikit merugikan: Terminal-Bench adalah pengingat bahwa "penalaran yang lebih banyak" bukanlah peningkatan yang monoton, dan inilah alasan untuk melakukan A/B antara max dan xhigh pada beban kerja Anda sendiri daripada berasumsi bahwa pengaturan yang lebih tinggi selalu lebih baik di semua tempat. Meta juga menandai hasil DeepSWE v1.1 sebesar 75,4 — angka utama di hari pertama, naik dari 59,3 yang dilaporkan Meta untuk Muse Spark 1.2 enam minggu sebelumnya — sebagai angka konfigurasi maks. Itulah angka yang akan diuji ulang terlebih dahulu oleh para evaluator independen.

Pembacaan independen mulai menyusul.

Yang hilang saat peluncuran adalah pengukuran independen apa pun, dan kesenjangan itu kini ditutup dengan jadwal yang kebetulan bertepatan dengan peluncuran max. Indeks Coding Agent dari Artificial Analysis — yang menilai setiap model di dalam harness agen pengkodean aslinya dan menggabungkan tugas-tugas DeepSWE, Terminal-Bench, dan SWE-Atlas — menempatkan Muse Spark 1.3 (max) dalam harness Muse Code pada angka 68 minggu ini, berada di posisi kedua di papan di belakang Claude Opus 5 (xhigh) di Claude Code dan di depan Claude Fable 5 (max) dengan 67 serta GPT-5.6 Sol (max) dengan 65. Papan yang sama memberi skor 64 untuk konfigurasi xhigh yang dirilis dalam harness Muse Code yang sama, yang merupakan pembacaan paling setara sejauh ini mengenai apa yang ditambahkan max — sekitar empat poin indeks — pada set tugas independen. Baris papan tersebut diterbitkan saat max masih dalam pratinjau mitra; konfigurasi yang dijelaskannya adalah konfigurasi yang menjadi tersedia secara umum pada 4 September.

Artificial Analysis juga telah memperbarui kartu modelnya sendiri untuk konfigurasi maksimal sejak peluncuran. Sepanjang periode pratinjau, kartu tersebut tidak mencantumkan penyedia maupun harga; kartu live kini mencantumkan Meta dengan harga standar $1,25 per juta token input dan $4,25 per juta token output — harga daftar yang sama dengan Muse Spark 1.2 — sekaligus menambahkan catatan terkait verbositas: proses evaluasi AA mengonsumsi sekitar 130 juta token dibanding median 79 juta, menghabiskan biaya total sekitar $1.335, dan berada di kisaran $0,95 per tugas berdasarkan estimasi per-tugas AA dengan kecepatan sekitar 190 token output per detik.

Satu angka dari liputan sebelumnya perlu dicek ulang. Artificial Analysis memperbarui Intelligence Index-nya ke v4.2 minggu ini — minggu yang sama dengan perilisan max — menilai ulang lapangan dan menggeser median. Pada kartu saat ini, konfigurasi max tercatat 53 dengan median model sebanding 29; angka 62 yang beredar dalam liputan minggu peluncuran diukur pada versi indeks sebelumnya, dan keduanya tidak dapat dibandingkan. Pembagian xhigh-versus-max milik Meta sendiri di atas independen dari indeks AA dan tidak terpengaruh oleh pembaruan ini.

A screenshot of the Artificial Analysis model page for Muse Spark 1.3 (max), showing a score of 53 on the Artificial Analysis Intelligence Index against a comparable-model median of 29, input pricing of $1.25 and output pricing of $4.25 per 1M tokens with an 88% cache discount, a per-task cost estimate near $0.95, about 190 output tokens per second, a 1M-token context window, and a note that the configuration is 'somewhat verbose' after generating roughly 130M tokens against a 79M median.

Berapa biaya maksimumnya — tagihannya dihitung berdasarkan token, bukan dari daftar harga.

Meta tidak menerbitkan harga terpisah untuk konfigurasi max, dan juga tidak menyediakan analisis latensi khusus. Harga per token identik dengan Muse Spark 1.2 dan semua tingkat effort lainnya di Muse Spark 1.3: $1,25 per juta token input, $4,25 per juta token output, dan $0,15 untuk input yang di-cache pada tier standar. Token penalaran ditagih sebagai token output dan diperhitungkan terhadap anggaran output, jadi memilih max bukanlah kenaikan harga per item — melainkan janji untuk menghabiskan lebih banyak anggaran tersebut untuk berpikir sebelum menjawab.

Itu menjadikan pertanyaan biaya yang sebenarnya adalah soal volume token, dan data awal menunjukkan bahwa max boros justru di mana xhigh hemat. Eksekusi terinstrumentasi AA mengonsumsi sekitar 130 juta token dalam satu evaluasi konfigurasi tersebut. Bagi pengembang yang sudah menjalankan loop agen panjang di xhigh, uji A/B yang penting bukanlah "apakah max lulus lebih banyak tugas" melainkan "apakah max lulus cukup banyak tugas tambahan untuk membayar tagihan token yang jauh lebih besar pada beban kerja yang sama."

Tier Kontributor Meta — $0.10 masuk dan $0.20 keluar per juta token sebagai imbalan karena mengizinkan Meta melatih model pada prompt dan completion Anda — berlaku untuk checkpoint yang sama, dan Meta menyatakan bahwa persentase dua digit yang signifikan dari pengembang memilihnya. Ketentuan Kontributor menjadikan setiap kiriman sebagai data pelatihan dan batas rate-nya ketat, sehingga ini bukan default yang baik untuk fan-out produksi, tetapi merupakan cara yang sah untuk menjalankan eksperimen max yang mahal secara murah jika kompromi data tersebut dapat Anda terima.

Jangkar harga untuk semua ini mudah diperiksa tanpa harus percaya pada kata-kata Meta, karena checkpoint Muse Spark 1.3 dibanderol dengan harga yang sama dengan yang sudah tercantum di OrcaRouter sesuai daftar harga Meta sendiri:Muse Spark 1.2 ada di OrcaRouter dengan harga $1,25 untuk input dan $4,25 untuk output per juta token, tanpa markup, sehingga klaim “harga tidak berubah” dapat dicek pada laman langsung yang menampilkan angka-angka itu secara persis. Muse Spark 1.3 sendiri belum ada di OrcaRouter. Ketika penyedia yang kami tawarkan mulai menyajikannya dengan max, harga yang tampil di sisi kami adalah daftar harga Meta yang diteruskan langsung — kami tidak menaikkan harga penyedia — dan setiap penurunan harga vendor berlaku pada hari yang sama saat Meta menetapkannya. Untuk rilis seperti ini, yang ekonominya menarik justru terletak pada volume token, bukan pada harga utamanya, penerusan langsung itulah yang membuat angka yang benar-benar ditagihkan kepada Anda sama dengan angka yang dipublikasikan Meta.

A screenshot of the OrcaRouter model page for Muse Spark 1.2, the checkpoint Muse Spark 1.3 is priced identically to, showing header stats $1.25 input and $4.25 output per million tokens, p50 time-to-first-token 7.84 s, p50 total 10.00 s and 48.9M, the description 'Muse Spark 1.2 is Meta's reasoning model for complex agentic tasks... a drop-in upgrade rather than a new tier', and the 'Get the Muse Spark 1.2 API' and 'Try in playground' buttons.

Siapa yang harus beralih ke max

Keputusan terbagi dengan jelas:

• Beralihlah untuk beban kerja agen berhorizon panjang — penggunaan komputer, ringkasan pekerjaan pengetahuan, dan loop alat multi-langkah di Muse Code — di mana split milik Meta dan papan peringkat agen pengkodean AA sama-sama menunjukkan peningkatan maksimum terbesar. Lakukan uji A/B terhadap xhigh pada sampel tugas nyata Anda terlebih dahulu, karena verbositas itu nyata.

• Tetap gunakan xhigh untuk panggilan bervolume tinggi, sensitif terhadap latensi, atau single-turn pendek, yang mana max pada dasarnya hanya menambah token. Terminal-Bench adalah bukti bahwa max tidak selalu menambah kapabilitas.

Perhatikan tiga hal dari sini: rilis open-weights yang dijanjikan Zuckerberg tanpa tanggal pasti, peluncuran konsumen Muse Spark 1.3 ke Instagram, Facebook, dan Meta AI dalam beberapa minggu mendatang, dan apakah papan coding-agent Artificial Analysis mulai memberi harga pada baris maksimum sekarang setelah konfigurasi tersedia secara umum.

Masa tunggu dua hari itu ternyata singkat, tetapi ia menyampaikan pesan yang bertahan lebih lama dari peluncuran itu sendiri: skor tertinggi Muse Spark 1.3 milik Meta tidak pernah sekadar fatamorgana — skor itu hanya menunggu tinjauan keamanan. Mulai 4 September, model yang dapat dipanggil pengembang dan model di papan skor akhirnya menjadi model yang sama. Apakah max benar-benar layak atas tokennya kini menjadi pertanyaan empiris yang dapat dijawab oleh pengembang mana pun, baik di API Meta maupun melalui rute apa pun yang sudah mereka gunakan untuk menjangkau keluarga Muse Spark.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari