
MiniMax M3 vs Muse Spark 1.2: Kesenjangan Harga 4x Melawan Sapuan Benchmark
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MiniMax M3 berharga $0.30 per juta token input di katalog kami. Muse Spark 1.2 berharga $1.25. Itu selisih 4,2x pada input dan 3,5x pada output, dan ini adalah fakta tunggal yang paling berguna tentang pasangan ini, karena pada halaman katalog yang sama Muse Spark 1.2 memimpin MiniMax M3 pada setiap baris benchmark yang dimiliki bersama oleh kedua model. Yang satu adalah opsi murah dengan bobot terbuka yang dijamin vendor menyediakan 512K konteks yang dapat digunakan dan batas maksimum output 512K. Yang lainnya adalah checkpoint penalaran Meta yang sekarang tertinggal satu generasi dari keluarganya sendiri dan masih mengunggulinya hampir di semua tempat. Sisa halaman ini membahas fakta mana dari kedua fakta tersebut yang sebenarnya menentukan suatu beban kerja — dan jawabannya tidak sama untuk setiap beban kerja.
Apa sebenarnya masing-masing model ini
Keduanya sudah dirilis tahun ini dan tak satu pun baru. Itu penting, karena halaman perbandingan yang ditulis seolah-olah salah satunya akan diluncurkan akan terasa usang dalam sebulan.

MiniMax M3 adalah rilis MiniMax sendiri, diumumkan di blog vendor pada 2026-06-01 dengan judul "MiniMax M3: Coding Frontier, Konteks 1M, Multimodalitas Native — Semua dalam Satu Model." Postingan itu dibuka secara datar: "MiniMax M3 resmi dirilis hari ini." Tiga klaim MiniMax atas model ini adalah bahwa model ini mencapai performa tingkat frontier dalam coding dan pekerjaan agentik, bahwa model ini menggunakan MSA (MiniMax Sparse Attention), arsitektur attention baru yang diusulkan perusahaan, dan bahwa model ini secara native multimodal — menerima input gambar dan video dan, dalam kata-kata MiniMax, "dapat mengoperasikan komputer desktop." MiniMax menambahkan bahwa ketiga kemampuan ini merupakan syarat dasar bagi model frontier sumber tertutup, dan bahwa M3 adalah "model open-weight pertama dan satu-satunya yang menyatukan ketiganya." Katalog kami mencantumkan model ini tersedia sejak 2026-05-31, sehari lebih awal daripada tanggal blog.
Muse Spark 1.2 milik Meta. Katalog kami mencantumkan tanggalnya sebagai 2026-08-05. Ini bukan tier baru — ini adalah checkpoint yang diperbarui dari Muse Spark 1.1 dengan performa yang sedikit lebih tinggi, disajikan pada tier Standard yang sama dengan harga identik, sehingga menjadikannya peningkatan drop-in alih-alih produk terpisah. Fitur yang membedakannya adalah permukaan masukan: teks, gambar, video, audio, dan PDF. Outputnya berupa teks.
Satu bagian konteks lebih baik diletakkan di sini daripada dikubur nanti. Meta memindahkan keluarga Muse Spark ke checkpoint 1.3 pada 2026-09-02, yang menjadikan 1.2 sebagai generasi sebelumnya dari lini produknya sendiri. Itu terjadi tiga minggu lalu, jadi ini bukan berita dan halaman ini tidak memperlakukannya sebagai berita — tetapi siapa pun yang hari ini memilih di antara keduanya harus tahu bahwa mereka membandingkan model MiniMax terkini dengan model Meta yang sudah digantikan.
Harga per juta token, dan berapa biaya sebenarnya sebuah beban kerja

Tarif yang dipublikasikan, diambil dari halaman setiap model di katalog kami sendiri, yang meneruskan harga daftar penyedia tanpa tambahan markup:
• Input — MiniMax M3 $0.30 per 1 juta token vs Muse Spark 1.2 $1.25 per 1 juta token
Output — MiniMax M3 $1,20 per 1 juta vs Muse Spark 1.2 $4,25 per 1 juta
• Pembacaan cache — MiniMax M3 $0.060 per 1Jt vs Muse Spark 1.2 $0.150 per 1Jt
• Rasio — Muse Spark 1.2 adalah 4,2x pada input, 3,5x pada output, 2,5x pada pembacaan cache
Rasio-rasio abstrak itu menjadi konkret di kalkulator biaya di setiap halaman. Atur keduanya ke 10 juta token per bulan dengan porsi input 70% — bentuk yang wajar untuk pekerjaan peringkasan atau ekstraksi, dan nilai default bawaan estimator — dan MiniMax M3 menghasilkan $5,70 per bulan. Muse Spark 1.2 menghasilkan $11,30 per bulan. Aktifkan cache prompt dan beban kerja yang sama menjadi sekitar $4,86 versus sekitar $9,63. Kalkulator memberi label keduanya sebagai perkiraan berdasarkan harga daftar, dan itu peringatan yang tepat: jumlah token sebenarnya bergantung pada tokenizer penyedia.
Untuk beban kerja yang murah, selisihnya cuma uang kopi. Intinya adalah bentuk kurvanya, bukan angka absolutnya: beban kerja dengan seratus juta token yang didominasi output per bulan akan melewati batas dari tiga digit ke empat digit hanya di sisi Muse Spark saja. Jika biaya adalah kendala yang membuat Anda mempertimbangkan pasangan ini, itulah angka yang perlu dimodelkan berdasarkan trafik Anda sendiri.
Karena kami meneruskan harga daftar penyedia secara langsung tanpa markup, penurunan harga vendor muncul di sisi kami pada hari yang sama saat diumumkan, dan kedua model ini diarahkan ke sini — satu kunci mencakup keduanya, sehingga penetapan harga keduanya secara bersaing tidak memerlukan kontrak kedua atau perubahan kode.
Jendela konteks, dan apa yang sebenarnya muat di dalamnya
Ini adalah bagian di mana keduanya terlihat paling mirip di lembar spesifikasi dan paling tidak mirip saat digunakan.
• Jendela konteks — MiniMax M3 1.048.576 token vs Muse Spark 1.2 1.048.576 token
• Output maksimum — MiniMax M3 512.000 token vs Muse Spark 1.2 131.072 token
• Permukaan masukan — MiniMax M3 teks, gambar, dan video vs Muse Spark 1.2 teks, gambar, video, audio, dan PDF
• Permukaan keluaran — keduanya hanya mengeluarkan teks
• Parameter terstruktur — MiniMax M3 menyediakan tools dan tool_choice; Muse Spark 1.2 menyediakan reasoning_effort dan structured_outputs
Kedua jendela konteks itu sama-sama satu juta token, jadi pertanyaan "siapa yang memiliki konteks lebih banyak" tidak punya pemenang. Baris keluaran maksimum adalah titik perbedaannya: respons MiniMax M3 dapat mencapai 512.000 token, sekitar empat kali batas atas Muse Spark 1.2 sebesar 131.072. Jika pekerjaan Anda adalah pembuatan bentuk panjang — penulisan ulang berkas penuh, laporan panjang, keluaran berskala transkrip — perbedaan itu bersifat struktural, bukan inkremental. Jika pekerjaan Anda adalah jawaban pendek atas masukan panjang, hal itu tidak relevan.
Baris permukaan input justru berlawanan arah. Muse Spark 1.2 menerima audio dan PDF secara langsung; permukaan input terdokumentasi MiniMax M3 berhenti pada gambar dan video. Pipeline yang menyerap rekaman panggilan atau dokumen hasil pemindaian memiliki jumlah prapemrosesan yang berbeda untuk dilakukan pada masing-masing dari kedua hal ini.
Di sisi MiniMax, klaim konteks tersebut membawa catatan arsitektur yang layak dilabeli secara jelas sebagai milik vendor itu sendiri. MiniMax mengaitkan perilaku konteks panjang M3 dengan MSA (MiniMax Sparse Attention), yang dalam katalog kami dijelaskan mendukung hingga 1 juta token konteks "dengan jaminan minimum 512K." Kerangka jaminan-minimum itu adalah milik MiniMax; tidak ada pengukuran independen atasnya yang dapat kami tunjukkan, jadi perlakukan batas bawah 512K sebagai klaim vendor, bukan angka yang telah diuji.
Latensi dan throughput pada gateway kami sendiri
Ini adalah angka yang paling langsung dapat kami jelaskan, karena ini adalah angka kami sendiri. Angka-angka ini mencakup tujuh hari hingga 2026-09-23 dan menggambarkan lalu lintas di gateway kami, bukan tolok ukur vendor.
• p50 waktu ke token pertama — MiniMax M3 4,28 s vs Muse Spark 1.2 4,82 s
• waktu p95 hingga token pertama — MiniMax M3 10,00 dtk vs Muse Spark 1.2 10,00 dtk
• Kecepatan output — MiniMax M3 289 tok/s vs Muse Spark 1.2 507 tok/s
• Tingkat kesalahan — MiniMax M3 0,12% vs Muse Spark 1.2 0,15%
• Trafik, 7 hari terakhir — MiniMax M3 153,8 juta token vs Muse Spark 1.2 79,6 juta token
Baca ini dengan jujur dan gambarannya terbelah. Pada waktu hingga token pertama, keduanya berdekatan — 4,28 versus 4,82 detik pada median, dan p95 identik sampai perseratusan pada 10,00 detik, yang merupakan artefak pembulatan karena keduanya berada di dekat plafon yang sama, bukan hasil imbang yang sesungguhnya. Pada kecepatan keluaran, keduanya sama sekali tidak berdekatan: Muse Spark 1.2 melakukan streaming sekitar 1,75x laju MiniMax M3, yang mengubah bagaimana generasi panjang terasa bagi pengguna yang mengamatinya, bahkan ketika total biayanya lebih tinggi. Tingkat kesalahan keduanya berada dalam selisih pembulatan satu sama lain dan keduanya rendah.
Baris lalu lintas layak dibaca sebagai sinyal, bukan papan skor: selama tujuh hari yang sama, MiniMax M3 memindahkan sekitar dua kali lipat token yang dipindahkan Muse Spark 1.2 di gateway kami. Itulah yang dipilih pasar, bukan yang dikatakan tolok ukur, dan pada pasangan ini keduanya tidak sepakat.
Merutekan keduanya di balik satu endpoint juga merupakan cara murah untuk mengetahui model mana yang lebih disukai beban kerja Anda, karena failover berarti degradasi di sisi penyedia pada salah satu model akan jatuh ke jalur yang tetap berfungsi alih-alih menghasilkan error.
Pemanggilan alat dan pekerjaan agentik jangka panjang
Di sinilah keduanya paling berbeda dalam hal hasil yang terukur, dan di sinilah catatan-catatannya paling penting.
• Terminal-Bench v2.1 — MiniMax M3 52.4 vs Muse Spark 1.2 80.1
• tau_banking (penggunaan alat) — MiniMax M3 12.3 vs Muse Spark 1.2 34.8
• MCP Atlas — MiniMax M3 74.2 (dilaporkan vendor) vs Muse Spark 1.2 belum diukur
• BrowseComp — MiniMax M3 83,5 (dilaporkan vendor) vs Muse Spark 1.2 tidak diukur
• OSWorld-Verified — MiniMax M3 70.0 (dilaporkan vendor) vs Muse Spark 1.2 tidak diukur
Dua baris pertama berasal dari panel benchmark di halaman katalog kami sendiri dan merupakan satu-satunya baris agentic yang telah diisi oleh kedua model. Selisihnya tidak tipis: Muse Spark 1.2 lebih dari dua kali lipat MiniMax M3 pada tau_banking dan memimpin Terminal-Bench v2.1 dengan selisih hampir 28 poin. Jika beban kerja Anda adalah agen horizon panjang dengan permukaan alat, itulah celah tunggal terbesar di halaman ini.
Tiga baris berikutnya adalah angka MiniMax sendiri, yang dipublikasikan dalam tulisan peluncuran. Angka-angka itu tidak dapat dibandingkan dengan dua yang pertama — harness-nya berbeda, tidak ada audit independen — tetapi itu satu-satunya angka yang dipublikasikan untuk MiniMax M3 pada tugas-tugas tersebut, jadi menghilangkannya akan membuat model ini tampak lebih rendah. Bacalah sebagai laporan vendor dan tidak lebih.
Satu perbedaan pantas mendapat paragrafnya sendiri, karena hal semacam ini biasanya dihaluskan oleh halaman perbandingan. Pos peluncuran MiniMax menampilkan Terminal-Bench 2.1 sebesar 66,0 untuk M3, di dalam gambar bagan tanpa tabel numerik yang menyertainya. Baris independen Terminal-Bench v2.1 di halaman katalog kami menunjukkan 52,4 untuk model yang sama. Nama-nama tugasnya cukup mirip sehingga pembaca akan menjumpainya berdampingan, dan kedua angka tersebut berbeda lebih dari 13 poin. Kami tidak akan menyatakan salah satunya salah: penjelasan yang mungkin adalah harness yang berbeda atau konfigurasi run yang berbeda, dan pernyataan yang jujur adalah bahwa angka milik vendor sendiri dan angka yang diaudit tidak sepakat, dengan angka vendor lebih tinggi.
Daftar parameter menceritakan cerita yang lebih kecil dan lebih praktis. MiniMax M3 mengekspos tools dan tool_choice, sehingga pemilihan alat dapat dikendalikan dari permintaan. Muse Spark 1.2 mengekspos reasoning_effort, sehingga kedalaman penalaran dapat diarahkan sebagai gantinya. Tidak ada yang mengekspos dial milik yang lain. Jika masalah kendali aplikasi Anda adalah "buat ia memanggil fungsi yang tepat," itu mengarah ke satu arah; jika itu adalah "buat ia berpikir lebih lama pada kasus yang sulit," itu mengarah ke arah yang lain.
Pengodean
Coding adalah klaim utama MiniMax M3 dan titik di mana kesenjangan yang terukur paling janggal baginya.
• Indeks Pengodean AA — MiniMax M3 38,7 vs Muse Spark 1.2 72,2
• SciCode — MiniMax M3 43,1 vs Muse Spark 1,2 57,4
• SWE-Bench Pro — MiniMax M3 59.0 (dilaporkan vendor) vs Muse Spark 1.2 tidak diukur
• KernelBench Hard — MiniMax M3 28,8 (dilaporkan vendor) vs Muse Spark 1.2 tidak diukur
Penentuan posisi MiniMax untuk M3 mengutamakan coding — judul peluncurannya menempatkan "Frontier Coding" di depan konteks sejuta token dan multimodalitas. Angka SWE-Bench Pro 59,0 yang dilaporkannya sendiri adalah angka yang kuat pada harness milik vendor. Namun, pada baris Coding Index dan SciCode independen yang telah diisi kedua model, Muse Spark 1.2 unggul jauh, dan selisih 33 poin pada Coding Index adalah yang terbesar kedua di halaman ini setelah tau_banking.
Tidak ada cara yang jujur untuk menyajikan MiniMax M3 sebagai model coding yang lebih baik berdasarkan bukti yang tersedia. Yang dapat dikatakan adalah bahwa angka coding dari vendor sendiri tinggi dan angka independennya tidak, dengan pola yang sama seperti perbedaan Terminal-Bench di atas. Siapa pun yang keputusannya bergantung pada coding harus memberi bobot lebih besar pada baris yang telah diaudit daripada grafik posting peluncuran, dan harus menguji pada repositori mereka sendiri, bukan pada salah satu dari keduanya.
Di mana mereka benar-benar dekat
Tiga baris menolak untuk menghasilkan pemenang, dan mengatakan hal itu lebih berguna daripada mengarang satu.
• GPQA Diamond — MiniMax M3 89,9 vs Muse Spark 1.2 90,4, selisih 0,5 poin yang merupakan seri untuk tujuan praktis apa pun
• p95 waktu ke token pertama — keduanya 10,00 dtk selama tujuh hari terakhir di gateway kami
• Jendela konteks dan modalitas keluaran — identik pada 1,048,576 token masukan dan keluaran hanya teks
Pada penalaran sains tingkat pascasarjana, keduanya praktis tidak dapat dibedakan, dan itulah satu-satunya baris penalaran di mana model MiniMax M3 yang jauh lebih murah mampu bersaing dengan model yang lebih mahal. Perlu diingat saat membaca indeks agregat: kesenjangan antara model-model ini tidak seragam di seluruh kemampuan; kesenjangan itu terkonsentrasi pada pekerjaan agentic dan coding, dan kira-kira nol pada pilihan ganda yang padat pengetahuan.

Pilih MiniMax M3 jika, pilih Muse Spark 1.2 jika
Dua fakta dari paragraf pembuka memiliki penyelesaian yang berbeda tergantung pada apa yang sedang Anda bangun, jadi inilah pembagiannya tanpa berbelit-belit.
• Pilih MiniMax M3 jika biaya per token adalah kendala yang mengikat, jika Anda memerlukan keluaran panjang melebihi 131.072 token, jika Anda memerlukan bobot terbuka, jika Anda menginginkan input video tanpa pipeline terpisah, atau jika Anda menginginkan pekerjaan pengetahuan yang menuntut penalaran berat dengan sekitar seperempat harga input — GPQA Diamond adalah hasil imbang dan itulah baris tempat model murah membuktikan tempatnya.
• Pilih Muse Spark 1.2 jika beban kerja Anda adalah agen berhorizon panjang dengan alat, jika Anda memerlukan skor coding teraudit tertinggi, jika Anda menginginkan pengatur reasoning_effort yang eksplisit, jika Anda perlu menyerap audio atau PDF secara langsung, atau jika Anda memerlukan output streaming yang cepat — 507 tok/s versus 289 tok/s adalah perbedaan yang terlihat, bukan perbedaan benchmark.
• Jika Anda belum tahu yang mana, bukti yang menentukan tidak ada di halaman ini. Ujilah kedua model terhadap sampel lalu lintas Anda sendiri dan ukurlah; kalkulator harga di setiap halaman model akan memberi tahu Anda sisi biayanya dalam satu menit, dan angka latensi tujuh hari di atas adalah hal yang paling mendekati pratinjau sisi performa.
Keduanya berada di satu API tanpa markup di atas harga daftar penyedia, jadi uji cobanya adalah perubahan ID model, bukan migrasi, dan failover otomatis berarti hari buruk pada salah satu penyedia akan menurunkan kualitas menjadi jawaban yang lebih lambat, bukan gangguan.
Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
