
Muse Spark 1.2 vs Claude Haiku 4.5: Harga Blended Identik, Pandangan Berlawanan tentang Berpikir
- metaBARUMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenBARUQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekBARUDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- qwenBARUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 1604 tok/s
- orcaBARUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0856Kecerdasan72Koding
- tencentTencent: Hy32026-07-0642Kecerdasan59Koding
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Kecerdasan42Koding
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Kecerdasan39Koding
- anthropicAnthropic: Claude Sonnet 52026-06-3055Kecerdasan72Koding
- klingKling: Kling 3.0 Turbo2026-06-1757Kecerdasan52Koding57Matematika
- z-aiZ.ai: GLM 5.22026-06-1653Kecerdasan69Koding60Matematika
Artificial Analysis prices Muse Spark 1.2 at $0.78 per million tokens blended and Claude Haiku 4.5 at $0.77. One cent apart, from two labs that agreed on nothing else. Meta's model cannot stop reasoning; Claude Haiku 4.5 only reasons when you ask it to. Meta gives you 1,048,576 tokens of context; Claude Haiku 4.5 gives you 200,000. Meta shipped this one on August 5, 2026 as a coding model with a terminal agent attached; Claude Haiku 4.5 shipped in October 2025 as the fast, cheap worker a bigger model tells what to do. Same price per token, entirely different machines.
That coincidence is the useful place to start a comparison, because it removes the variable people usually decide on and forces the question to be about shape instead. What follows uses independent numbers where they exist — Artificial Analysis for index scores and lab latency, OrcaRouter's own seven-day production telemetry for real-traffic latency — and flags vendor-reported figures as such, including one benchmark headline of the vendor's that has no third-party counterpart.
Kontras spesifikasi, satu dimensi pada satu waktu.
• Price — Muse Spark 1.2 at $1.25 in / $4.25 out per million; Claude Haiku 4.5 at $1.00 in / $5.00 out. Meta is cheaper on input, Claude Haiku 4.5 on output.
• Cache — $0,15 per juta untuk cache hit Muse Spark 1.2, diskon 88%; $0,10 per juta untuk cache read Claude Haiku 4.5, diskon 90%, dengan cache write ditagih sebesar $1,25.
• Konteks — 1.048.576 token vs 200.000. Perbedaan 5,2×, dan celah tunggal terbesar di antara keduanya.
• Output maksimum — Claude Haiku 4.5 menyatakan batas 64.000 token; endpoint Muse Spark 1.2 menyatakan tidak ada batas panjang penyelesaian maksimum sama sekali, yang cukup tidak biasa untuk diuji daripada diasumsikan.
• Penalaran — wajib di Muse Spark 1.2, dengan lima tingkat upaya dari minimal hingga xhigh dan default medium; opsional di Claude Haiku 4.5, yang merupakan model non-penalaran sampai Anda mengaktifkan extended thinking dan memberinya anggaran berpikir.
• Inputs — Meta advertises text, images, video, audio and PDF; Claude Haiku 4.5 takes text and images. Both return text.
• Weights and providers — both closed. Muse Spark 1.2 is served only by Meta's own Model API; Claude Haiku 4.5 is available from the vendor and through the usual cloud resellers and aggregators.
• Usia — Muse Spark 1.2 baru berumur beberapa hari. Claude Haiku 4.5 telah diproduksi sejak 15 Oktober 2025, dengan batas pengetahuan Juli 2025 dan sembilan bulan pengalaman lapangan yang terakumulasi di belakangnya.
Kesenjangan indeks itu nyata. Angka yang akan dikutip semua orang itu tidak.

Artificial Analysis memberi skor 54 untuk Muse Spark 1.2 pada Intelligence Index-nya, peringkat #13 dari 185. Entri saat ini untuk Claude Haiku 4.5 adalah 24. Letakkan keduanya berdampingan dan Anda punya judul besar; lihat apa isi entri-entri tersebut sebenarnya dan judul itu menjadi runtuh.
Angka 54 adalah Muse Spark 1.2 yang dievaluasi pada xhigh, yakni pengaturan penalaran paling mahal yang dimilikinya. Angka 24 adalah Claude Haiku 4.5 yang dievaluasi sebagai model non-penalaran — dengan mode berpikir dimatikan — dan Artificial Analysis menandainya sebagai perkiraan, bukan hasil eksekusi yang selesai. Pada versi indeks yang sama sebelumnya, sebelum pembobotan ulang v4.1, Artificial Analysis memberi skor 55 pada Claude Haiku 4.5 dengan penalaran diaktifkan dan 42 tanpa penalaran. Angka-angka lama tersebut juga tidak dapat dibandingkan dengan 54, karena versi indeks melakukan penskalaan ulang dan skor era v3 bukanlah skor v4.1.
Jadi pernyataan yang jujur lebih sempit daripada kesan yang diberikan papan peringkat: Muse Spark 1.2 dengan upaya maksimum memperoleh skor 54 pada indeks saat ini; belum ada skor v4.1 yang dipublikasikan untuk Claude Haiku 4.5 dengan pemikiran diperpanjang aktif, jadi belum ada perbandingan yang setara antara keduanya pada upaya penuh. Siapa pun yang menunjukkan 54 versus 24 sedang membandingkan model dengan pertimbangan penuh terhadap model yang diperintahkan untuk tidak mempertimbangkan.
Where the vendor has published a number, it is a specific one: Claude Haiku 4.5 scores 73.3% on SWE-bench Verified, averaged over 50 trials with a 128K thinking budget. That is a vendor figure, and the thinking budget in it is enormous for a model marketed on speed — but it is the same evaluation the industry quotes for frontier models, and it puts Haiku in a bracket its price does not suggest. Meta's counterpart claims for Muse Spark 1.2 are Terminal-Bench 2.1 at 82.9% and DeepSWE v1.1 at 59.3%, also vendor-run, on Meta's own harness with each competitor paired to its own agent product. Two vendors, two benchmarks, no overlap. There is currently no single evaluation on which both of these models have a published score from the same evaluator.
Empat angka latensi, dua kisah berbeda

Latensi adalah titik di mana pembingkaian 'harga yang sama' berhenti menjadi sekadar keingintahuan dan mulai menjadi keputusan, dan juga titik di mana sumber pengukuran paling menentukan.
Dalam kerangka tolok ukur, Artificial Analysis mencatat waktu hingga token pertama sebesar 26,12 detik untuk Muse Spark 1.2 pada xhigh, dan 1,00 detik untuk Claude Haiku 4.5. Kesenjangan 26×, dan jika hanya itu gambaran keseluruhannya, perbandingan akan berakhir.
Dalam produksi, justru sebaliknya. Selama tujuh hari lalu lintas nyata di OrcaRouter — para pemanggil menggunakan upaya apa pun yang mereka inginkan — Claude Haiku 4.5 menunjukkan waktu p50 ke token pertama sebesar 3.84 detik dan p95 sebesar 10.00 detik, pada 214 token per detik dan tingkat kesalahan 1.0%. Muse Spark 1.1, versi model Meta yang ada di katalog, menunjukkan p50 sebesar 1.84 detik dan p95 sebesar 6.00 detik, pada 519 token per detik tanpa ada kesalahan yang tercatat. Pada lalu lintas langsung (live traffic), model Meta-lah yang lebih cepat.
Kedua set angka tersebut benar dan keduanya mengukur hal yang berbeda. Angka laboratorium adalah setiap model pada pertimbangan maksimum dengan cache dingin, yang merupakan tes yang adil untuk batas atas dan tes yang buruk untuk kotak obrolan. Angka produksi mencakup cache hits, prompt singkat, tingkat usaha rendah, dan segala hal lain yang dilakukan aplikasi nyata, yang merupakan tes yang adil untuk median dan bukan tes sama sekali untuk kasus terburuk. Jebakannya adalah mengutip yang satu dan menalar yang lainnya. Jika Anda menentukan ukuran waktu tunggu yang dihadapi pengguna, p95 adalah angka Anda. Jika Anda bertanya berapa biaya langkah agen yang dalam dalam waktu nyata, angka tolok ukur lebih mendekati kebenaran — dan peringatan jujurnya adalah bahwa angka produksi seperti itu belum ada untuk Muse Spark 1.2 itu sendiri, karena terlalu baru dan belum banyak dirutekan.
Kedua lab menjual subagen kepada Anda. Maksud mereka berbeda.
The vendor's pitch for Claude Haiku 4.5 was explicit about hierarchy: Sonnet-class models plan and orchestrate, Haiku instances execute in parallel underneath. Cheap, fast, disposable, many at once. The product design follows — a 200K window is plenty for a scoped subtask and deliberately not enough for a whole repository, thinking is off by default because a worker that deliberates is a worker that costs orchestrator money, and the vendor's own marketing names real-time chat, customer service and pair programming as the target.
Pitch Meta untuk Muse Spark 1.2 mengklaim posisi di kedua ujung hierarki yang sama. Teks pemasaran Meta mengatakan model tersebut dapat menjadi agen utama yang mengumpulkan konteks, merencanakan, dan mendelegasikan, atau subagen yang berjalan secara paralel di bawahnya. Muse Code, agen terminal yang dirilis bersamanya, mengoordinasikan banyak subagen persisten untuk setiap tugas dalam worktree terisolasi, pada runtime log peristiwa yang dapat diputar ulang secara tepat. Jendela satu juta token dan penalaran yang selalu aktif adalah yang dibutuhkan oleh perencana; itu justru hal yang tidak akan Anda pilih untuk pekerja fan-out, karena setiap instance paralel membayar untuk pertimbangan yang tidak Anda minta.
Read as architecture rather than marketing, that is the real difference: the vendor built a worker and expects you to bring an orchestrator; Meta built an orchestrator and claims it can also work. If you already run a hierarchy, the interesting experiment is not choosing between them — it is Muse Spark 1.2 planning and Claude Haiku 4.5 executing, which is a shape neither vendor will sell you as a package.
Berapa biaya satu langkah nyata di masing-masing
Tarif per juta tidak menentukan apa pun pada model penalaran, karena model tersebut yang memilih berapa banyak token yang digunakan. Beri harga per langkah sebagai gantinya.
Ambil tugas kode dengan cakupan tertentu: 60.000 token konteks repositori masuk, 3.000 token patch keluar. Dalam kondisi cold, Claude Haiku 4.5 berbiaya $0,060 untuk input ditambah $0,015 untuk output — 7,5 sen. Muse Spark 1.2 berbiaya $0,075 ditambah $0,013 — 8,8 sen. Cukup dekat untuk dianggap noise, persis seperti yang dijanjikan tarif gabungan.
Now add the thing the blended rate hides. Muse Spark 1.2 cannot turn reasoning off, and at its default medium setting a step like this plausibly emits a few thousand reasoning tokens before the patch — they bill as output. Add 3,000 and the same step is $0.075 + $0.026 = 10.1 cents, about 35% above Haiku on identical inputs. Claude Haiku 4.5 with thinking off pays nothing for deliberation and stays at 7.5 cents; with a large thinking budget it will exceed Muse Spark 1.2, because Claude Haiku 4.5 charges $5.00 per million output against Meta's $4.25.
Caching membalik fokusnya lagi. Jaga konteks repositori tetap stabil sehingga mencapai cache, dan input Haiku turun menjadi $0.006 serta input Muse Spark 1.2 menjadi $0.009 — sisi input sama sekali tidak lagi menjadi faktor, dan seluruh perbandingan menjadi pertarungan atas token output, yaitu pertarungan tentang seberapa banyak masing-masing model berpikir. Pada beban kerja yang mengulang konteks, stabilitas kunci cache lebih berharga daripada pilihan model, dan hal itu berlaku untuk kedua model ini.
The 1M window is the one place the arithmetic is not close. Anything that genuinely needs more than 200,000 tokens in a single call cannot be run on Claude Haiku 4.5 at any price. You either chunk and orchestrate — which is what the vendor intends — or you use a model with the room.
Mencoba keduanya tanpa kontrak kedua

Claude Haiku 4.5 is in the OrcaRouter catalog at $1.00 and $5.00 — the vendor's list price, because OrcaRouter runs 0% markup and passes provider pricing through untouched, which also means a vendor price change is live on our side the same day rather than at the next contract cycle. The production latency figures above come from that same routing layer.
Muse Spark 1.2 tidak ada dalam katalog. Model API Meta saat ini satu-satunya tempat untuk memanggilnya, jadi perbandingan langsung yang sesungguhnya saat ini berarti satu integrasi melalui kami dan satu langsung dengan Meta. Muse Spark 1.1 di-hosting, dengan harga identik $1.25 dan $4.25 yang Meta kenakan untuk 1.2, yang menjadikannya pengganti yang wajar untuk bentuk biaya dan latensi keluarga ini, tetapi bukan untuk peningkatan coding yang menjadi jualan 1.2. Ketika 1.2 dapat dirutekan, perbandingan menjadi perubahan string model satu baris dengan kunci yang sama — dan untuk eksperimen orchestrator-plus-worker yang dijelaskan di atas, DSL perutean adalah cara Anda menyambungkan perencana dan worker fan-out ke dalam satu panggilan, alih-alih membangun serah terima sendiri.
Pilih berdasarkan bentuk karyanya, bukan skornya.
Pilih Claude Haiku 4.5 saat pekerjaannya terbatas dan pengguna menunggu. Agen dukungan, klasifikasi, ekstraksi, obrolan, pelengkapan pemrograman berpasangan, dan tingkat pekerja paralel dalam hierarki agen. Ia adalah sesuatu yang sudah dikenal dengan sembilan bulan riwayat lapangan, pemikiran bersifat opsional sehingga Anda hanya membayar untuk pertimbangan saat Anda menginginkannya, dan 200K cukup untuk hampir semua subtugas dengan cakupan tertentu. Hasil SWE-bench Verified yang dipublikasikan mengatakan bahwa ia jauh lebih mampu daripada yang tersirat oleh harganya, asalkan Anda bersedia mengeluarkan anggaran berpikir yang digunakan hasil tersebut.
Pilih Muse Spark 1.2 ketika unit kerjanya adalah repositori, bukan permintaan. Refaktorisasi multi-file, debugging ekstensif, generasi seluruh proyek, loop agen jangka panjang tanpa ada yang mengawasi spinner. Jendela satu juta token menghilangkan masalah chunking yang tidak dapat dipecahkan oleh Haiku dengan harga berapa pun, dan penalaran wajib yang membuatnya tidak cocok untuk chat adalah default yang tepat ketika rencana yang salah lebih mahal daripada rencana yang lambat.
What should decide it is not the index number. Ask two questions instead: does a single call ever need to see more than 200,000 tokens, and is there a human waiting on the first token? Yes to the first points at Meta. Yes to the second points at the vendor. Yes to both means you want two models, which is the honest answer more often than either vendor's marketing admits.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
