Muse Spark 1.2 vs Claude Fable 5
Guides & Insights

Muse Spark 1.2 vs Claude Fable 5: Biaya Sebenarnya dari Enam Poin Indeks

Penulis

Jim Song

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Artificial Analysis menerbitkan sesuatu yang kebanyakan tabel benchmark tidak cantumkan: berapa biaya yang dikeluarkannya. Menjalankan Intelligence Index dengan sembilan evaluasi menghabiskan biaya $637.85 untuk Muse Spark 1.2 dan $5,630.52 untuk Claude Fable 5. Rangkaian benchmark identik, perangkat pengujian identik, tetapi satu tagihan 8,8 kali lebih besar daripada yang lain. Fable 5 mencetak skor 60, sedangkan Muse Spark 1.2 mencetak 54.

Bagilah selisihnya dan Anda akan mendapatkan angka yang sebenarnya dibicarakan oleh perbandingan ini: pada beban kerja tersebut, enam poin kecerdasan terakhir berharga sekitar $832 per poin. Apakah Anda harus membayarnya bukanlah pertanyaan tentang tolok ukur. Ini adalah pertanyaan tentang seberapa banyak lalu lintas Anda yang benar-benar membutuhkan poin-poin tersebut, dan jawaban bagi sebagian besar tim adalah sebagian kecil yang dapat diidentifikasi.

Titik indeks marjinal memiliki harga, dan harganya mahal.

Kedua angka tersebut berasal dari evaluator independen yang sama yang menjalankan komposit yang sama — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, dan AA-LCR. Keduanya bukan klaim vendor. Fable 5 berada di peringkat #3 dari 185 model; Muse Spark 1.2 di #13, dengan median kelas 32. Keduanya jauh di atas rata-rata; hanya satu yang berada di posisi terdepan.

Muse Spark 1.2 vs Claude Fable 5

Harga daftar menjelaskan sebagian besar kesenjangan dan meremehkan sisanya:

Masukan — Muse Spark 1.2 $1.25 per juta, Claude Fable 5 $10.00. Delapan kali.

Output — $4,25 dibanding $50,00. Hampir dua belas kali lipat.

Input yang di-cache — $0.15 berbanding $1.00. Kira-kira tujuh kali lipat, dan Fable 5 juga mengenakan biaya $12.50 per juta untuk menulis cache, atau $20.00 untuk TTL satu jam, sedangkan Muse Spark 1.2 tidak mempublikasikan biaya penulisan cache terpisah sama sekali.

Tarif gabungan — Artificial Analysis menetapkan Muse Spark 1.2 seharga $0.78 per juta token dan Fable 5 seharga $7.70. Hampir sepuluh kali lipat.

Fable 5 adalah model termahal yang pernah di-benchmark oleh Artificial Analysis pada saat peluncurannya, dan model tersebut masih memegang gelar itu. Perlu kita perjelas alasannya: model tersebut menghabiskan lebih sedikit token keluaran daripada Muse Spark 1.2 dalam menyelesaikan indeks — 87M berbanding 95M — jadi seluruh perbedaan biaya adalah tarif, bukan banyaknya token. Fable 5 tidak boros. Model ini hanya dipatok harga sebagai produk terdepan.

Diterjemahkan menjadi satu langkah agen yang membaca 60.000 token konteks repositori dan menulis 3.000 token patch: sekitar 8,8 sen di Muse Spark 1.2, sekitar 75 sen di Claude Fable 5. Seribu langkah sehari adalah $88 dibandingkan $750. Selama setahun, $32.000 dibandingkan $274.000.

Di mana Claude Fable 5 tidak dapat digantikan

Kasus biaya akan menjadi sepihak jika enam poin tersebut adalah seluruh perbedaannya. Namun tidak demikian, dan titik di mana kesenjangan semakin melebar justru merupakan titik di mana Meta telah memposisikan ulang Muse Spark 1.2 untuk bersaing.

Fable 5 memegang posisi pertama di sebagian besar tangga head-to-head Design Arena: 1399 Elo dan peringkat 1 dalam pengembangan game, 1367 dan peringkat 1 dalam seni ASCII, 1353 dan peringkat 1 dalam pembuatan SVG, plus peringkat 1 di arena agen untuk pengembangan game Godot (1344), Android native (1318), pengembangan game agen (1300) dan slide HTML (1260), dengan posisi kedua di aplikasi web dan pekerjaan full-stack. Muse Spark 1.2 memiliki tidak ada entri Design Arena sama sekali — pendahulunya mengumpulkan rekor papan tengah yang cukup terhormat (1334 dalam pengembangan game di peringkat 5, 1309 dalam kategori kode umum di peringkat 9), tetapi versi baru belum pernah diberi peringkat sama sekali.

Indeks per-dimensi menunjuk ke arah yang sama. Artificial Analysis memberi skor Claude Fable 5 pada indeks pengkodean 76,5 dan indeks agenik 52,8. Muse Spark 1.1 berada di 71,3 dan 37,5 — lima poin di belakang pada pengkodean dan lima belas poin di belakang pada pekerjaan agenik. Belum ada angka per-dimensi yang dipublikasikan untuk 1.2, jadi pernyataan yang jujur adalah kita tahu gabungannya menutup tiga poin dan kita tidak tahu berapa banyak dari itu yang jatuh pada sumbu agenik.

Muse Spark 1.2 vs Claude Fable 5

Posisi produk Fable 5 sendiri mengklaim bahwa keunggulannya melebar seiring dengan panjang dan kompleksitas tugas. Itu adalah klaim vendor yang belum terverifikasi sebagaimana dinyatakan, tetapi konsisten dengan bentuk data independen: margin terbesar Fable 5 berada di arena agen, di mana model harus menjaga rencana tetap utuh di banyak putaran, bukan dalam generasi sekali jalan.

Di mana Muse Spark 1.2 hanyalah jawaban yang tepat.

Tiga hal menjadikannya pilihan yang tepat terlepas dari enam poin tersebut.

Input audio dan video.Daftar Meta mengiklankan teks, gambar, video, audio, dan input PDF. Claude Fable 5 menerima teks, gambar, dan file — tanpa audio, tanpa video. Untuk setiap pipeline yang menyentuh rekaman atau footage, ini bukan kompromi, melainkan filter yang keras. Satu catatan jujur: kartu spesifikasi Artificial Analysis untuk Muse Spark 1.2 hanya mencatat teks dan gambar yang dievaluasi, sehingga permukaan yang lebih luas diiklankan daripada diverifikasi secara independen.

Kecepatan. 165.0 token per detik berbanding 71.7. Muse Spark 1.2 mengalirkan output jauh lebih dari dua kali lebih cepat, dan menempati peringkat #16 dari 185 dalam kecepatan, dibandingkan dengan median kelas 71 — Fable 5 berada di median.

Biaya berdasarkan volume. Semua yang ada di bagian sebelumnya.

Tambahkan opsi keempat bagi siapa pun yang permintaannya benar-benar sangat besar: kedua model mengiklankan sekitar satu juta token konteks — 1.048.576 untuk Muse Spark 1.2, 1.000.000 untuk Fable 5 — tetapi Muse Spark 1.2 mengenakan tarif tetap untuk seluruhnya, sementara penetapan harga cache-write Fable 5 berarti mempertahankan prefiks stabil yang besar membutuhkan biaya nyata di muka sebelum mulai menghemat apa pun.

Keduanya bukan model yang cepat.

Ini adalah bagian yang paling sering dilewatkan dalam perbandingan head-to-head, dan ini mengubah arsitektur, bukan fakturnya.

Pada upaya penalaran maksimum, Artificial Analysis mengukur waktu hingga token pertama sebesar 26.12 detik untuk Muse Spark 1.2 dan 141.26 detik untuk Claude Fable 5, dengan waktu respons end-to-end untuk Fable 5 sebesar 148.24 detik. Tidak satu pun dari keduanya yang seharusnya berada di depan pengguna pada pengaturan tersebut.

Angka produksi jauh lebih ramah dan layak untuk diketahui. Di OrcaRouter, Claude Fable 5 menunjukkan p50 waktu ke token pertama sebesar 7.04 detik dan p95 sebesar 10.00 detik selama sepekan berjalan — itu adalah lalu lintas nyata pada tingkat upaya apa pun yang diminta pemanggil, bukan tolok ukur pada upaya maksimum. Muse Spark 1.1, sebagai referensi, memiliki p50 1.84 detik. Muse Spark 1.2 belum memiliki telemetri produksi.

Muse Spark 1.2 vs Claude Fable 5

Poin strukturalnya: kedua model memiliki penalaran wajib. Dial effort Fable 5 berkisar dari low hingga max dengan default high; Muse Spark 1.2 berkisar dari minimal hingga xhigh dengan default medium. Keduanya tidak mengizinkan Anda mematikan mode berpikir. Jika Anda membutuhkan respons di bawah satu detik, seluruh perbandingan ini berada di rak yang salah — itulah gunanya model kelas Luna atau Flash-Lite.

Stack dua model, dengan harga yang telah ditetapkan

Membingkai ini sebagai pilihan yang bersifat winner-takes-all adalah kekeliruan, karena lalu lintasnya tidak homogen. Hampir setiap agen produksi memiliki ekor panjang langkah-langkah rutin — membaca file, merangkum diff, memformat patch, memutuskan alat mana yang akan dipanggil berikutnya — dan kepala pendek langkah-langkah yang benar-benar sulit di mana jawaban yang salah menghabiskan waktu satu jam.

Lakukan seribu langkah agen yang sama setiap hari. Semuanya di Claude Fable 5: sekitar $750. Semuanya di Muse Spark 1.2: sekitar $88. Bagi 900 tugas rutin ke model murah dan 100 tugas sulit ke model mahal: sekitar $79 ditambah $75, atau $154 per hari. Itu seperlima dari tagihan all-Fable sambil mempertahankan kemampuan frontier pada sepersepuluh panggilan yang benar-benar membutuhkannya — dan itu kira-kira $220.000 per tahun perbedaannya pada satu loop agen.

Alasan mengapa split layak dibangun daripada sekadar dijelaskan adalah karena sebelumnya memerlukan dua hubungan vendor, dua SDK, dan dua set kredensial. Sekarang tidak demikian. Claude Fable 5 ada di katalog OrcaRouter dengan harga $10.00 dan $50.00 — harga daftar vendor, diteruskan dengan markup 0% — dan Muse Spark 1.1 ada di sana dengan harga $1.25 dan $4.25 atas dasar yang sama, melalui endpoint yang sama yang kompatibel dengan OpenAI. DSL routing memungkinkan Anda mengekspresikan "model murah dulu, naikkan level jika kepercayaan diri rendah atau saat uji coba gagal" sebagai satu panggilan, bukan sebagai kode orkestrasi yang Anda rawat, dan fusi model memungkinkan Anda mengirim langkah-langkah yang benar-benar ambigu ke beberapa model sekaligus untuk dibandingkan. Muse Spark 1.2 sendiri belum ada di katalog — Meta menyajikannya langsung, sebagai satu-satunya penyedianya — jadi saat ini hal terdekat yang bisa Anda bangun untuk tumpukan ini menggunakan 1.1 di lengan yang murah.

Detail tentang penyedia tunggal itu layak mendapat baris tersendiri dalam penilaian risiko. Claude Fable 5 memiliki beberapa rute layanan dan failover otomatis di antaranya. Muse Spark 1.2 memiliki tepat satu titik akhir, yang dijalankan oleh Meta. Jika layanan tersebut mati, tidak ada cadangan yang merupakan model yang sama.

Model biaya, bukan vonis

Hasil yang berguna dari perbandingan ini bukanlah "model mana yang menang." Ini adalah ambang batas yang dapat Anda hitung untuk beban kerja Anda sendiri.

Perkirakan proporsi panggilan Anda di mana jawaban kelas Muse Spark 1.2 gagal dan jawaban kelas Fable 5 berhasil. Kalikan dengan biaya kegagalan — menit teknisi, penggabungan yang buruk, putaran percobaan ulang, pelanggan. Bandingkan dengan 66 sen per langkah, yaitu biaya peningkatan satu panggilan dari Muse Spark 1.2 ke Claude Fable 5 pada contoh 60K-in / 3K-out di atas. Jika kerugian yang diharapkan dari jawaban yang salah melebihi 66 sen, arahkan langkah tersebut ke Fable 5. Jika tidak, jangan.

Bagi sebagian besar tim, perhitungan itu menempatkan Fable 5 pada peninjauan kode, pembuatan patch akhir, perencanaan arsitektur, dan apa pun yang menyentuh data produksi, serta menempatkan Muse Spark 1.2 pada segala hal lainnya — pembacaan file, peringkasan, triase pengujian, pemilihan alat, bagian tengah bervolume tinggi dari loop agen di mana biayanya nyata dan taruhan per panggilan tidak.

Satu hal yang perlu terus dipantau: tangga Design Arena dan indeks per dimensi untuk Muse Spark 1.2, yang keduanya belum ada. Bukti terkuat Fable 5 justru berada di arena head-to-head di mana model baru Meta tidak memiliki catatan sama sekali. Ketika catatan itu muncul, ambang batas ini bergeser — mungkin cukup jauh.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

Hubungi kami

Gabung komunitas kami

DiscordEmailXGitHubYouTube