Muse Spark 1.2 vs Claude Haiku 4.5: Harga Blended Identik, Pandangan Berlawanan tentang Berpikir
Guides & Insights

Muse Spark 1.2 vs Claude Haiku 4.5: Harga Blended Identik, Pandangan Berlawanan tentang Berpikir

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Artificial Analysis menetapkan harga Muse Spark 1.2 sebesar $0,78 per juta token gabungan dan Claude Haiku 4.5 sebesar $0,77. Hanya terpaut satu sen, dari dua lab yang tidak sepakat tentang hal lain. Model Meta tidak bisa berhenti bernalar; Claude Haiku 4.5 hanya bernalar saat diminta. Meta memberi Anda 1.048.576 token konteks; Claude Haiku 4.5 memberi Anda 200.000. Meta merilis model ini pada 5 Agustus 2026 sebagai model pengodean dengan agen terminal; Claude Haiku 4.5 dirilis pada Oktober 2025 sebagai pekerja yang cepat dan murah yang diarahkan oleh model yang lebih besar. Harga per token sama, mesin yang sepenuhnya berbeda.

Kebetulan itu menjadi titik awal yang berguna untuk perbandingan, karena menghilangkan variabel yang biasanya menjadi dasar keputusan orang dan memaksa pertanyaan untuk berfokus pada bentuk. Berikut ini menggunakan angka-angka independen jika ada — Artificial Analysis untuk skor indeks dan latensi lab, telemetri produksi tujuh hari OrcaRouter sendiri untuk latensi lalu lintas nyata — dan menandai angka yang dilaporkan vendor sebagai demikian, termasuk satu angka utama tolok ukur milik vendor yang tidak memiliki padanan pihak ketiga.

Kontras spesifikasi, satu dimensi pada satu waktu.

• Harga — Muse Spark 1.2 seharga $1,25 input / $4,25 output per juta; Claude Haiku 4.5 seharga $1,00 input / $5,00 output. Meta lebih murah untuk input, Claude Haiku 4.5 untuk output.

• Cache — $0,15 per juta untuk cache hit Muse Spark 1.2, diskon 88%; $0,10 per juta untuk cache read Claude Haiku 4.5, diskon 90%, dengan cache write ditagih sebesar $1,25.

• Konteks — 1.048.576 token vs 200.000. Perbedaan 5,2×, dan celah tunggal terbesar di antara keduanya.

• Output maksimum — Claude Haiku 4.5 menyatakan batas 64.000 token; endpoint Muse Spark 1.2 menyatakan tidak ada batas panjang penyelesaian maksimum sama sekali, yang cukup tidak biasa untuk diuji daripada diasumsikan.

• Penalaran — wajib di Muse Spark 1.2, dengan lima tingkat upaya dari minimal hingga xhigh dan default medium; opsional di Claude Haiku 4.5, yang merupakan model non-penalaran sampai Anda mengaktifkan extended thinking dan memberinya anggaran berpikir.

• Masukan — Meta mendukung teks, gambar, video, audio, dan PDF; Claude Haiku 4.5 menerima teks dan gambar. Keduanya menghasilkan teks.

• Bobot dan penyedia — keduanya tertutup. Muse Spark 1.2 hanya dilayani oleh API Model Meta sendiri; Claude Haiku 4.5 tersedia dari vendor dan melalui penjual ulang serta agregator cloud biasa.

• Usia — Muse Spark 1.2 baru berumur beberapa hari. Claude Haiku 4.5 telah diproduksi sejak 15 Oktober 2025, dengan batas pengetahuan Juli 2025 dan sembilan bulan pengalaman lapangan yang terakumulasi di belakangnya.

Kesenjangan indeks itu nyata. Angka yang akan dikutip semua orang itu tidak.

Artificial Analysis memberi skor 54 untuk Muse Spark 1.2 pada Intelligence Index-nya, peringkat #13 dari 185. Entri saat ini untuk Claude Haiku 4.5 adalah 24. Letakkan keduanya berdampingan dan Anda punya judul besar; lihat apa isi entri-entri tersebut sebenarnya dan judul itu menjadi runtuh.

Angka 54 adalah Muse Spark 1.2 yang dievaluasi pada xhigh, yakni pengaturan penalaran paling mahal yang dimilikinya. Angka 24 adalah Claude Haiku 4.5 yang dievaluasi sebagai model non-penalaran — dengan mode berpikir dimatikan — dan Artificial Analysis menandainya sebagai perkiraan, bukan hasil eksekusi yang selesai. Pada versi indeks yang sama sebelumnya, sebelum pembobotan ulang v4.1, Artificial Analysis memberi skor 55 pada Claude Haiku 4.5 dengan penalaran diaktifkan dan 42 tanpa penalaran. Angka-angka lama tersebut juga tidak dapat dibandingkan dengan 54, karena versi indeks melakukan penskalaan ulang dan skor era v3 bukanlah skor v4.1.

Jadi pernyataan yang jujur lebih sempit daripada kesan yang diberikan papan peringkat: Muse Spark 1.2 dengan upaya maksimum memperoleh skor 54 pada indeks saat ini; belum ada skor v4.1 yang dipublikasikan untuk Claude Haiku 4.5 dengan pemikiran diperpanjang aktif, jadi belum ada perbandingan yang setara antara keduanya pada upaya penuh. Siapa pun yang menunjukkan 54 versus 24 sedang membandingkan model dengan pertimbangan penuh terhadap model yang diperintahkan untuk tidak mempertimbangkan.

Ketika vendor telah memublikasikan sebuah angka, angka tersebut adalah angka yang spesifik: Claude Haiku 4.5 mencetak 73,3% pada SWE-bench Verified, dirata-ratakan dari 50 uji coba dengan anggaran berpikir 128K. Itu adalah angka dari vendor, dan anggaran berpikir di dalamnya sangat besar untuk model yang dipasarkan dengan keunggulan kecepatan — tetapi ini adalah evaluasi yang sama yang dikutip industri untuk model-model frontier, dan itu menempatkan Haiku pada kelas yang tidak disiratkan oleh harganya. Klaim Meta untuk produk tandingannya, Muse Spark 1.2, adalah Terminal-Bench 2.1 sebesar 82,9% dan DeepSWE v1.1 sebesar 59,3%, juga dijalankan oleh vendor, pada harness Meta sendiri dengan setiap pesaing dipasangkan dengan produk agennya masing-masing. Dua vendor, dua tolok ukur, tanpa tumpang tindih. Saat ini tidak ada satu pun evaluasi yang memiliki skor yang dipublikasikan dari evaluator yang sama untuk kedua model ini.

Empat angka latensi, dua kisah berbeda

Latensi adalah titik di mana pembingkaian 'harga yang sama' berhenti menjadi sekadar keingintahuan dan mulai menjadi keputusan, dan juga titik di mana sumber pengukuran paling menentukan.

Dalam kerangka tolok ukur, Artificial Analysis mencatat waktu hingga token pertama sebesar 26,12 detik untuk Muse Spark 1.2 pada xhigh, dan 1,00 detik untuk Claude Haiku 4.5. Kesenjangan 26×, dan jika hanya itu gambaran keseluruhannya, perbandingan akan berakhir.

Dalam produksi, justru sebaliknya. Selama tujuh hari lalu lintas nyata di OrcaRouter — para pemanggil menggunakan upaya apa pun yang mereka inginkan — Claude Haiku 4.5 menunjukkan waktu p50 ke token pertama sebesar 3.84 detik dan p95 sebesar 10.00 detik, pada 214 token per detik dan tingkat kesalahan 1.0%. Muse Spark 1.1, versi model Meta yang ada di katalog, menunjukkan p50 sebesar 1.84 detik dan p95 sebesar 6.00 detik, pada 519 token per detik tanpa ada kesalahan yang tercatat. Pada lalu lintas langsung (live traffic), model Meta-lah yang lebih cepat.

Kedua set angka tersebut benar dan keduanya mengukur hal yang berbeda. Angka laboratorium adalah setiap model pada pertimbangan maksimum dengan cache dingin, yang merupakan tes yang adil untuk batas atas dan tes yang buruk untuk kotak obrolan. Angka produksi mencakup cache hits, prompt singkat, tingkat usaha rendah, dan segala hal lain yang dilakukan aplikasi nyata, yang merupakan tes yang adil untuk median dan bukan tes sama sekali untuk kasus terburuk. Jebakannya adalah mengutip yang satu dan menalar yang lainnya. Jika Anda menentukan ukuran waktu tunggu yang dihadapi pengguna, p95 adalah angka Anda. Jika Anda bertanya berapa biaya langkah agen yang dalam dalam waktu nyata, angka tolok ukur lebih mendekati kebenaran — dan peringatan jujurnya adalah bahwa angka produksi seperti itu belum ada untuk Muse Spark 1.2 itu sendiri, karena terlalu baru dan belum banyak dirutekan.

Kedua lab menjual subagen kepada Anda. Maksud mereka berbeda.

Pitch vendor untuk Claude Haiku 4.5 eksplisit tentang hierarki: model kelas Sonnet merencanakan dan mengorkestrasi, sementara instans Haiku mengeksekusi secara paralel di bawahnya. Murah, cepat, sekali pakai, dan banyak sekaligus. Desain produknya mengikuti—jendela 200K sudah cukup untuk subtugas yang terbatas ruang lingkupnya dan sengaja tidak cukup untuk seluruh repositori, mode berpikir dimatikan secara default karena pekerja yang berpikir panjang adalah pekerja yang membebani biaya orkestrator, dan pemasaran vendor sendiri menyebutkan obrolan real-time, layanan pelanggan, dan pemrograman berpasangan sebagai target.

Pitch Meta untuk Muse Spark 1.2 mengklaim posisi di kedua ujung hierarki yang sama. Teks pemasaran Meta mengatakan model tersebut dapat menjadi agen utama yang mengumpulkan konteks, merencanakan, dan mendelegasikan, atau subagen yang berjalan secara paralel di bawahnya. Muse Code, agen terminal yang dirilis bersamanya, mengoordinasikan banyak subagen persisten untuk setiap tugas dalam worktree terisolasi, pada runtime log peristiwa yang dapat diputar ulang secara tepat. Jendela satu juta token dan penalaran yang selalu aktif adalah yang dibutuhkan oleh perencana; itu justru hal yang tidak akan Anda pilih untuk pekerja fan-out, karena setiap instance paralel membayar untuk pertimbangan yang tidak Anda minta.

Dibaca sebagai arsitektur, bukan sebagai pemasaran, itulah perbedaan sebenarnya: vendor membangun seorang pekerja dan mengharapkan Anda membawa orkestrator; Meta membangun orkestrator dan mengklaim bahwa ia juga bisa bekerja. Jika Anda sudah menjalankan hierarki, eksperimen yang menarik bukanlah memilih di antara keduanya — melainkan Muse Spark 1.2 yang merencanakan dan Claude Haiku 4.5 yang mengeksekusi, sebuah bentuk yang tidak akan dijual oleh vendor mana pun sebagai paket.

Berapa biaya satu langkah nyata di masing-masing

Tarif per juta tidak menentukan apa pun pada model penalaran, karena model tersebut yang memilih berapa banyak token yang digunakan. Beri harga per langkah sebagai gantinya.

Ambil tugas kode dengan cakupan tertentu: 60.000 token konteks repositori masuk, 3.000 token patch keluar. Dalam kondisi cold, Claude Haiku 4.5 berbiaya $0,060 untuk input ditambah $0,015 untuk output — 7,5 sen. Muse Spark 1.2 berbiaya $0,075 ditambah $0,013 — 8,8 sen. Cukup dekat untuk dianggap noise, persis seperti yang dijanjikan tarif gabungan.

Sekarang tambahkan hal yang disembunyikan oleh tarif gabungan. Muse Spark 1.2 tidak dapat mematikan penalaran, dan pada pengaturan medium default-nya, langkah seperti ini kemungkinan mengeluarkan beberapa ribu token penalaran sebelum patch — token-token tersebut ditagih sebagai output. Tambahkan 3,000 dan langkah yang sama menjadi $0.075 + $0.026 = 10.1 sen, sekitar 35% di atas Haiku dengan input yang identik. Claude Haiku 4.5 dengan penalaran nonaktif tidak membayar apa pun untuk berpikir dan tetap di 7.5 sen; dengan anggaran penalaran yang besar, ia akan melampaui Muse Spark 1.2, karena Claude Haiku 4.5 mengenakan $5.00 per juta output dibandingkan $4.25 milik Meta.

Caching membalik fokusnya lagi. Jaga konteks repositori tetap stabil sehingga mencapai cache, dan input Haiku turun menjadi $0.006 serta input Muse Spark 1.2 menjadi $0.009 — sisi input sama sekali tidak lagi menjadi faktor, dan seluruh perbandingan menjadi pertarungan atas token output, yaitu pertarungan tentang seberapa banyak masing-masing model berpikir. Pada beban kerja yang mengulang konteks, stabilitas kunci cache lebih berharga daripada pilihan model, dan hal itu berlaku untuk kedua model ini.

Jendela 1M adalah satu-satunya tempat di mana perhitungannya tidak mendekati. Apa pun yang benar-benar membutuhkan lebih dari 200.000 token dalam satu panggilan tidak dapat dijalankan di Claude Haiku 4.5 dengan harga berapa pun. Anda harus memecah dan mengorkestrasi — itulah yang dimaksudkan oleh vendor — atau Anda menggunakan model dengan ruang yang cukup.

Mencoba keduanya tanpa kontrak kedua

Claude Haiku 4.5 tersedia di katalog OrcaRouter dengan harga $1,00 dan $5,00 — harga resmi vendor, karena OrcaRouter beroperasi dengan markup 0% dan meneruskan harga penyedia apa adanya, yang juga berarti perubahan harga vendor langsung berlaku di sisi kami pada hari yang sama, bukan menunggu siklus kontrak berikutnya. Angka latensi produksi di atas berasal dari lapisan routing yang sama.

Muse Spark 1.2 tidak ada dalam katalog. Model API Meta saat ini satu-satunya tempat untuk memanggilnya, jadi perbandingan langsung yang sesungguhnya saat ini berarti satu integrasi melalui kami dan satu langsung dengan Meta. Muse Spark 1.1 di-hosting, dengan harga identik $1.25 dan $4.25 yang Meta kenakan untuk 1.2, yang menjadikannya pengganti yang wajar untuk bentuk biaya dan latensi keluarga ini, tetapi bukan untuk peningkatan coding yang menjadi jualan 1.2. Ketika 1.2 dapat dirutekan, perbandingan menjadi perubahan string model satu baris dengan kunci yang sama — dan untuk eksperimen orchestrator-plus-worker yang dijelaskan di atas, DSL perutean adalah cara Anda menyambungkan perencana dan worker fan-out ke dalam satu panggilan, alih-alih membangun serah terima sendiri.

Pilih berdasarkan bentuk karyanya, bukan skornya.

Pilih Claude Haiku 4.5 saat pekerjaannya terbatas dan pengguna menunggu. Agen dukungan, klasifikasi, ekstraksi, obrolan, pelengkapan pemrograman berpasangan, dan tingkat pekerja paralel dalam hierarki agen. Ia adalah sesuatu yang sudah dikenal dengan sembilan bulan riwayat lapangan, pemikiran bersifat opsional sehingga Anda hanya membayar untuk pertimbangan saat Anda menginginkannya, dan 200K cukup untuk hampir semua subtugas dengan cakupan tertentu. Hasil SWE-bench Verified yang dipublikasikan mengatakan bahwa ia jauh lebih mampu daripada yang tersirat oleh harganya, asalkan Anda bersedia mengeluarkan anggaran berpikir yang digunakan hasil tersebut.

Pilih Muse Spark 1.2 ketika unit kerjanya adalah repositori, bukan permintaan. Refaktorisasi multi-file, debugging ekstensif, generasi seluruh proyek, loop agen jangka panjang tanpa ada yang mengawasi spinner. Jendela satu juta token menghilangkan masalah chunking yang tidak dapat dipecahkan oleh Haiku dengan harga berapa pun, dan penalaran wajib yang membuatnya tidak cocok untuk chat adalah default yang tepat ketika rencana yang salah lebih mahal daripada rencana yang lambat.

Yang seharusnya menentukan bukanlah nomor indeks. Sebaliknya, ajukan dua pertanyaan: apakah satu panggilan perlu melihat lebih dari 200.000 token, dan apakah ada manusia yang menunggu token pertama? Ya untuk pertanyaan pertama menunjuk ke Meta. Ya untuk pertanyaan kedua menunjuk ke vendor. Ya untuk keduanya berarti Anda menginginkan dua model, yang merupakan jawaban jujur lebih sering daripada yang diakui pemasaran vendor mana pun.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari