
Muse Spark 1.2 vs Muse Spark 1.1: Haruskah Anda Melakukan Upgrade?
- metaBARUMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenBARUQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekBARUDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- qwenBARUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 2038 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0856Kecerdasan72Koding
- tencentTencent: Hy32026-07-0642Kecerdasan59Koding
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Kecerdasan42Koding
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Kecerdasan39Koding
- anthropicAnthropic: Claude Sonnet 52026-06-3055Kecerdasan72Koding
- klingKling: Kling 3.0 Turbo2026-06-1757Kecerdasan52Koding57Matematika
- z-aiZ.ai: GLM 5.22026-06-1653Kecerdasan69Koding60Matematika
Meta menggantikan Muse Spark 1.1 dengan Muse Spark 1.2 pada 5 Agustus 2026 tanpa mengubah harga, jendela konteks, daftar modalitas, parameter yang didukung, atau dial penalaran. Migrasi tersebut karenanya tampak gratis — keluarga string model yang sama, penagihan yang sama, tidak ada yang perlu dinegosiasikan ulang. Itu tidak gratis. Pengukuran independen menunjukkan bahwa waktu hingga token pertama versi baru adalah 26,12 detik dibandingkan 2,90 detik pada versi lama, dan keluaran berkelanjutannya adalah 165 token per detik dibandingkan 213,5. Anda membeli tiga poin kecerdasan terukur dengan waktu tunggu sekitar sembilan kali lebih lama sebelum apa pun kembali.
Apakah hal itu layak dilakukan hampir sepenuhnya bergantung pada berapa lama tugas Anda berjalan. Berikut ini yang sebenarnya berbeda, apa yang tetap sama, dan apa yang belum bisa dikatakan siapa pun.
Keputusan dalam empat baris
• Indeks Intelijen: 51 → 54, diukur secara independen oleh Artificial Analysis pada pengaturan xhigh setiap versi.
• Waktu hingga token pertama: 2.90s → 26.12s, sumber yang sama, kondisi yang sama.
• Biaya untuk menjalankan rangkaian benchmark yang identik: $548.07 → $637.85, dengan harga per-token yang identik. Tambahan 16% adalah murni pemborosan token.
• Segala hal yang ditanyakan dalam formulir pengadaan: tidak berubah.

Apa yang benar-benar identik
Hal ini layak untuk diuraikan karena ini adalah alasan mengapa sebuah migrasi terlihat sepele di atas kertas, dan karena perbedaan yang tidak ada adalah perbedaan yang tidak perlu Anda uji.
• Harga — $1,25 per juta token masukan, $4,25 per juta token keluaran, $0,15 per juta saat cache hit, $2,50 per seribu pencarian web bawaan. Semua angka tersebut sama pada kedua versi.
• Konteks — 1,048,576 token di keduanya, tanpa tingkatan biaya tambahan konteks panjang di keduanya.
• Modalitas — teks, gambar, video, audio, dan PDF masuk; teks keluar. Kedua daftar tersebut menampilkan lima jenis input yang sama.
• Dial penalaran— wajib pada kedua versi, lima tingkat (minimal, rendah, sedang, tinggi, sangat tinggi), default sedang pada keduanya. Tidak ada pengaturan pada versi mana pun yang dapat mematikan pemikiran.
• Parameter — tools, tool_choice, structured_outputs, response_format, reasoning_effort, include_reasoning, max_tokens, temperature, top_p, top_k, repetition_penalty. Daftar identik.
• Penyajian — satu penyedia, Meta sendiri, di keduanya. Tanpa host pihak ketiga, tanpa varian kuantisasi.
• Harga gabungan — Artificial Analysis menempatkan keduanya pada $0.78 per juta token dengan pembobotan gabungannya, yang memang Anda harapkan dari kartu tarif yang identik.
Jika Anda berharap peningkatan ini hadir dengan lebih banyak konteks, jaminan panjang penyelesaian, atau cache yang lebih murah, ternyata tidak. Ini adalah rilis weights-and-post-training dengan kartu tarif yang disalin dari versi sebelumnya.
Apa yang sebenarnya bergerak
Artificial Analysis saat ini adalah satu-satunya pihak independen yang telah mengevaluasi kedua versi tersebut, dan mengevaluasi keduanya pada upaya penalaran tertinggi, sehingga perbandingannya setara.
• Intelligence Index — 51 untuk 1.1 (peringkat #22 dari 185) hingga 54 untuk 1.2 (peringkat #13). Sembilan posisi di papan yang median kelasnya 32, jadi kenaikan ini membeli posisi nyata, bukan sekadar desimal.
• Waktu hingga token pertama — 2.90s hingga 26.12s. Ini adalah regresi utama dan tidak marginal.
• Kecepatan output — 213,5 hingga 165,0 token per detik. Masih berada di peringkat #16 dari 185 dan masih digambarkan oleh Artificial Analysis sebagai "sangat cepat", tetapi 23% lebih lambat dari model yang digantikannya.
• Verbositas — 94M token keluaran untuk melewati indeks, dibandingkan dengan 95M. Pada dasarnya tidak berubah, dan keduanya sekitar 45% di atas median 65M.
• Total pengeluaran evaluasi — $548.07 hingga $637.85. Karena verbositas hampir tidak berubah dan harga tidak berubah sama sekali, kenaikan 16% tersebut berasal dari tempat lain selain output yang terlihat: jejak penalaran internal yang lebih panjang, lebih banyak percobaan ulang, atau lebih banyak putaran alat per tugas.
Polanya koheren. Meta tidak membuat modelnya lebih murah, lebih cepat, atau lebih besar. Meta membuat modelnya mempertimbangkan lebih lama sebelum berkomitmen, dan pertimbangan ekstra itu muncul sebagai latensi, streaming yang sedikit lebih lambat, dan tagihan 16% lebih tinggi untuk pekerjaan yang identik. Tiga poin indeks itulah yang dibeli.
Seberapa buruk latensi sebenarnya
Angka 26,12 detik akan dikutip di luar konteks, jadi perlakukan dengan benar: angka tersebut diukur pada xhigh, tingkat upaya termahal dari lima tingkat, pada rangkaian tolok ukur yang dirancang sulit. API secara default menggunakan medium.
Untuk merasakan seperti apa default sebenarnya, Muse Spark 1.1 di OrcaRouter — melayani penelepon nyata pada tingkat usaha apa pun yang mereka minta — menunjukkan waktu p50 hingga token pertama sebesar 1,84 detik dan p95 sebesar 6,00 detik selama seminggu berjalan. Itu adalah data produksi pada tingkat usaha produksi, dan lebih dari satu orde besaran di bawah angka benchmark. Versi 1.2 belum memiliki telemetri produksi.

Jadi pembacaan yang jujur bukanlah "1.2 membutuhkan 26 detik untuk merespons." Melainkan: pada pengaturan di mana 1.2 mendapatkan tiga poin tambahannya, token pertama memakan waktu 26 detik, dan pada pengaturan yang sama model lama memakan waktu tiga detik. Jika Anda sudah menjalankannya di xhigh — yang justru merupakan konfigurasi di mana peningkatan kecerdasan itu ada — itulah angka yang Anda warisi. Jika Anda menjalankannya di medium atau lebih rendah, Anda akan melihat sesuatu yang jauh lebih singkat, dan Anda juga akan melihat lebih sedikit peningkatannya.
Keterkaitan itulah jebakan sesungguhnya dalam upgrade ini. Anda tidak dapat memperoleh kecerdasan tanpa pertimbangan, karena dari pertimbangan itulah kecerdasan berasal.
Reposisi di balik angka-angka
Meta tidak menerbitkan pos peluncuran untuk 1.2 — halaman pengumuman Muse Spark masih menjelaskan 1.1 — tetapi Meta menulis ulang deskripsi produknya, dan penulisan ulang itu menjelaskan trade-off tersebut.
Muse Spark 1.1 dijual sebagai model penalaran multimodal dengan permukaan input yang luar biasa luas, ditujukan untuk "agen multimodal, penelitian mendalam atas media campuran, dan analisis konteks panjang": laporan panjang, perpustakaan media, rekaman, dan video di samping teks.
Deskripsi Muse Spark 1.2 membuang hampir semua hal itu dan malah menyebutkan rekayasa perangkat lunak — refaktor multi-file, sesi debugging yang ekstensif, pembuatan seluruh repositori — lalu menambahkan klaim multi-agen yang eksplisit: model tersebut dapat berperan sebagai agen utama yang mengumpulkan konteks, merencanakan, dan mendelegasikan, atau sebagai subagen yang berjalan paralel di bawahnya. Deskripsi itu juga mengklaim bahwa prompt caching dapat memangkas biaya efektif sebesar 60–80%, bergantung pada seberapa banyak konteks yang berulang di antara pemanggilan. Angka terakhir itu adalah perkiraan Meta, bukan hasil yang terukur, meskipun tarif cache $0.15 membuatnya masuk akal secara aritmetika.
Baca regresi latensi terhadap reposisi itu, dan itu tidak lagi terlihat seperti kesalahan. Tak seorang pun yang merefaktor selusin file peduli dengan 26 detik perencanaan. Meta memilih seorang pelanggan, dan itu bukan pelanggan yang membeli 1.1.
Apa yang masih dimiliki 1.1 yang tidak dimiliki 1.2?
Empat minggu keberadaan tidak cukup untuk mengumpulkan rekam jejak, dan dalam tiga hal konkret, model yang lebih lama saat ini merupakan produk yang lebih terdokumentasi.
• Rekor arena.Muse Spark 1.1 memiliki sejarah Design Arena yang substansial: 1334 Elo di peringkat 5 dalam pengembangan game, 1334 di peringkat 7 dalam komponen UI, 1320 di peringkat 3 dalam seni ASCII, 1318 dalam visualisasi data, 1309 dalam kategori kode umum, plus tangga arena agen lengkap yang mencakup aplikasi web, slide HTML, dan pengembangan game Godot. Muse Spark 1.2 tidak memiliki entri sama sekali. Pada sumbu yang kini paling gencar dipasarkan Meta, tidak ada data head-to-head sama sekali untuk model baru tersebut.
• Skor sub-indeks. Artificial Analysis menerbitkan indeks coding sebesar 71.3 dan indeks agentic sebesar 37.5 untuk 1.1. Tidak ada padanan yang dipublikasikan untuk 1.2. Karena skor agentic adalah dimensi terlemah dari 1.1 dengan selisih yang besar, dan kemampuan agentic justru merupakan hal yang diklaim ditingkatkan oleh 1.2, inilah angka yang akan menjawab pertanyaan tentang upgrade — dan angka itu belum ada.
• Telemetri produksi. 1.1 memiliki seminggu latensi p50 dan p95 nyata di belakangnya dan 4,4M token lalu lintas langsung di OrcaRouter. 1.2 tidak memiliki keduanya; endpoint-nya saat ini tidak melaporkan statistik latensi atau throughput sama sekali karena volumenya terlalu rendah untuk disampling.
• Tempat untuk menyewanya selain Meta.Muse Spark 1.1 ada di katalog OrcaRouter dengan harga $1,25 dan $4,25 — harga daftar Meta sendiri, diteruskan dengan markup 0%. Muse Spark 1.2 belum ada di sana, jadi saat ini ini adalah integrasi langsung Meta dengan satu penyedia dan tanpa jalur failover.

Semua ini tidak berarti 1.2 lebih buruk. Ini berarti bukti untuk 1.2 terdiri dari satu skor gabungan dari satu evaluator, sementara bukti untuk 1.1 adalah satu bulan arena, sub-indeks, dan lalu lintas langsung. Asimetri itu seharusnya memengaruhi cara Anda menyusun tahapan migrasi, bukan apakah Anda akan melakukannya.
Daftar periksa migrasi yang benar-benar singkat
Karena kartu tarif dan permukaan parameter identik, penggantian tersebut hanyalah perubahan string model. Pekerjaan terletak pada verifikasi tiga hal yang memang berubah.
• Ukur waktu Anda sendiri hingga token pertama pada pengaturan effort Anda sendiri. Jangan terima angka 2,90 detik atau 26,12 detik. Jalankan prompt asli Anda pada apa pun reasoning_effort yang sebenarnya Anda teruskan dan bandingkan secara langsung. Ini adalah satu-satunya angka yang bisa langsung menggagalkan migrasi.
• Periksa konfigurasi timeout dan streaming Anda. Peningkatan 9x pada latensi token pertama pada upaya tinggi akan melanggar batas waktu klien yang disetel terhadap 1.1, dan akan membuat integrasi non-streaming tampak seperti hang.
• Hitung ulang biaya dari jumlah token yang terukur, bukan dari kartu tarif. Harga identik, sehingga perubahan biaya apa pun bersifat perilaku. Artificial Analysis melihat pengeluaran 16% lebih banyak untuk pekerjaan yang sama; apakah Anda mengalaminya bergantung pada campuran tugas Anda.
• Verifikasi stabilitas cache-key terlebih dahulu.Dengan prefiks stabil sepanjang 60.000 token, langkah agen tipikal turun dari sekitar 8,8 sen menjadi sekitar 2,2 sen pada versi mana pun. Perubahan 75% itu lebih besar daripada pengaruh perubahan versi apa pun, dan sepenuhnya berada di bawah kendali Anda.
• Uji ulang jalur audio dan video secara eksplisit. Kedua daftar mengiklankan lima modalitas input yang sama, tetapi kartu spesifikasi Artificial Analysis untuk 1.2 hanya mencatat teks dan gambar sebagai yang dievaluasi. Meta menulis ulang promosi tersebut menjauh dari karya media campuran. Tidak ada pihak independen yang memeriksa apakah kemampuan tersebut tetap dipertahankan.
• Jaga 1.1 tetap dapat dijangkau sebagai cadangan. Menjalankan keduanya di belakang satu kunci berarti rollback hanyalah perubahan konfigurasi, bukan insiden, dan memungkinkan Anda melakukan A/B pada keduanya di lalu lintas langsung, alih-alih berdebat soal benchmark.
Siapa yang bergerak sekarang, siapa yang menunggu
Bergeraklah sekarang jika Anda menjalankan agen pengodean jangka panjang dengan upaya penalaran tinggi. Tugas tersebut sudah memakan waktu menit, penalti latensi menghilang di dalamnya, peningkatan kecerdasan diukur oleh pihak ketiga, bukan klaim Meta, dan tiga poin indeks adalah lompatan yang berarti di tingkat ini — sembilan posisi pada papan berisi 185 model.
Tunggu jika apa pun yang Anda sajikan bersifat interaktif. Tidak ada konfigurasi yang membuat 1.2 lebih responsif daripada 1.1, dan penalaran wajib berarti Anda tidak dapat memperoleh kembali responsivitas dengan menonaktifkan mode berpikir. Versi 1.1 tetap menjadi model yang lebih cepat di setiap tingkat upaya dan harganya sama persis.
Tunggu jika beban kerja Anda adalah analisis media campuran — kasus penggunaan laporan panjang, video, dan audio yang secara eksplisit menjadi sasaran pembangunan dan pemasaran 1.1. Meta berhenti mengiklankannya, dan satu-satunya evaluasi independen terhadap 1.2 mencakup teks dan gambar. Kapabilitas tersebut mungkin saja masih utuh; hanya saja tidak ada bukti sama sekali ke arah mana pun, dan 1.1 memiliki satu bulan bukti untuk itu.
Tunggu jika Anda memerlukan data arena. Model yang dijual dengan generasi seluruh repositori tanpa entri Design Arena dan tanpa sub-indeks agen yang dipublikasikan meminta Anda untuk mempercayai kata Meta mengenai hal yang diubahnya. Beri waktu tiga atau empat minggu dan itu tidak akan berlaku lagi — pada saat itu keputusan ini akan jauh lebih mudah dibuat berdasarkan bukti daripada berdasarkan satu angka gabungan.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
