Kartu hero radar model OrcaRouter untuk perbandingan antara MiMo-V2.6-Pro dan Claude Opus 5, dengan subjudul 'Lima poin indeks. Dua puluh satu kali lipat harganya.', dengan satu panel per model.
Guides & Insights

MiMo-V2.6-Pro vs Claude Opus 5: 21x Lebih Murah, Tertinggal Lima Poin Indeks

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Xiaomi MiMo-V2.6-Pro dan Claude Opus 5 adalah dua ujung dari satu pertukaran, dan pertukaran itu ada harganya. Pada Artificial Analysis Intelligence Index v4.3.2, Claude Opus 5 (upaya maksimal) mencetak 51 dan Xiaomi MiMo-V2.6-Pro mencetak 46. Di daftar tarif, Claude Opus 5 berbiaya $5.00 per juta token masukan dan $25.00 per juta token keluaran; MiMo-V2.6-Pro berbiaya $0.43 dan $0.87. Lakukan pembagian dan hasilnya adalah 11.6x pada masukan dan 28.7x pada keluaran — dan 21x pada tarif gabungan yang diterbitkan Artificial Analysis untuk masing-masing. Biaya lima poin indeks adalah dua puluh satu kali lipat uangnya. Apakah itu kesepakatan yang menguntungkan atau pemborosan sepenuhnya bergantung pada apa yang dilakukan beban kerja Anda dengan poin kelima, dan sebagian besar tim tidak pernah menghitungnya sebelum mereka berkomitmen.

Kedua model tersebut dinyatakan secara gamblang.

Claude Opus 5 adalah produk unggulan proprietary milik Anthropic, dirilis pada 24 Juli 2026, dengan jendela konteks 1 juta token dan jumlah parameter yang tidak diungkapkan. Xiaomi MiMo-V2.6-Pro adalah model sparse mixture-of-experts dengan total 1,02 triliun parameter dan 42 miliar parameter yang diaktifkan, dengan jendela konteks 1 juta token, multimodalitas natif pada teks, gambar, video, dan audio, serta bobot yang dipublikasikan dengan lisensi MIT.

• Bobot — MiMo-V2.6-Pro berlisensi MIT dan dapat diunduh; Claude Opus 5 proprietari, hanya API

• Parameter — MiMo-V2.6-Pro 1,02T total / 42B aktif; Claude Opus 5 tidak diungkapkan

• Konteks — 1 juta token untuk keduanya; Claude Opus 5 membatasi output pada 128K di Messages API dan 300K di Batch API

• Modalitas — MiMo-V2.6-Pro menerima teks, gambar, video, dan audio; permukaan input yang dipublikasikan Claude Opus 5 adalah teks dan gambar

• Harga daftar — MiMo-V2.6-Pro $0.43 / $0.87 per 1 juta token; Claude Opus 5 $5.00 / $25.00

• Cache — MiMo-V2.6-Pro mencantumkan diskon cache 99%; Claude Opus 5 membaca cache dengan biaya $0,50 per 1 juta dengan penulisan $6,25 pada TTL 5 menit

• Biaya terukur per tugas Intelligence Index — MiMo-V2.6-Pro $0.13; Claude Opus 5 $5.86

• Penyajian — MiMo-V2.6-Pro 134,3 token keluaran/detik dan 2,15 detik ke token pertama; Claude Opus 5 57,9 token/detik

Pasangan terakhir itulah yang hilang. Model yang lebih murah juga yang lebih cepat — dengan faktor 2,3 pada throughput keluaran — karena ia dilayani di perangkat keras yang dikendalikan Xiaomi dan mitranya serta dapat melakukan batching secara agresif. Claude Opus 5 pada upaya maksimal adalah model penalaran yang melakukan lebih banyak kerja per token; selisih kecepatannya bukan cacat, melainkan produk yang berbeda. Namun itu berarti jalur murah tidak membayar diskonnya dalam hal latensi. Ia membayarnya dalam lima poin indeks dan pada ekor tugas tempat poin kelima itu berada.

Two-column scoreboard card headed 'MiMo-V2.6-Pro vs Claude Opus 5 — the scoreboard'. The Xiaomi MiMo-V2.6-Pro column lists Intelligence Index v4.3.2 score 46, list price $0.43 / $0.87 per million tokens, measured cost per index task $0.13, serving speed 134.3 tokens per second, size 1.02T total and 42B active parameters, MIT-licensed downloadable weights, and text, image, video and audio input. The Claude Opus 5 column lists index score 51, list price $5.00 / $25.00, measured cost per index task $5.86, serving speed 57.9 tokens per second, undisclosed size, proprietary API-only weights, and text and image input.

Di mana lima titik itu sebenarnya berada

Selisih lima poin pada komposit dari sepuluh evaluasi tidak tersebar merata, dan agregatnya menyembunyikan hal yang penting. Kedua model dijalankan pada suite v4.3.2 yang sama, yang mencakup AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, dan AA-LCR v1.1. Halaman-halaman yang dipublikasikan tidak merinci skor per evaluasi untuk kedua model, yang merupakan keterbatasan nyata di kedua sisi perbandingan ini dan layak disampaikan alih-alih ditutupi.

Yang tercatat bersifat indikatif. Claude Opus 5 pada upaya maksimal mencetak 49,0% di Terminal-Bench 4.0 dalam suite v4.3, di belakang GPT-6 Astra dengan 59,1% dan Claude Fable 5.1 dengan 52,0%. Pada AutomationBench-AA, Opus 5 menyelesaikan setiap tujuan tanpa pelanggaran guardrail pada 28,3% alur kerja, dibandingkan dengan 41,6% untuk GPT-6 Astra dan 32,1% untuk Fable 5.1. Itu adalah angka agentik yang konkret, dan justru kategori-kategori itulah tempat kesenjangan komposit lima poin paling kecil kemungkinannya terdistribusi secara merata — entri indeks MiMo-V2.6-Pro sendiri tidak memublikasikan rincian agentik yang sebanding.

Sementara itu, angka vendor yang dipublikasikan kedua perusahaan tidak sebanding satu sama lain, dan ada baiknya bersikap terus terang tentang alasannya. Materi peluncuran Anthropic melaporkan SWE-bench Verified sebesar 96,0% dan SWE-bench Pro sebesar 79,2%; satu pelacak mencatat bahwa Opus 5 dirilis tanpa entri SWE-bench tersendiri, dan tidak ada angka SWE-bench Verified yang diaudit secara independen untuknya. Materi Xiaomi melaporkan MiMo-V2.6-Pro bergerak dari 58,4 ke 72,57 pada DeepSWE v1.1 sepanjang proses RL-nya, pada perangkat uji milik Xiaomi sendiri dengan mini-swe-agent pada rata-rata dari tiga, tidak dikirimkan ke papan DeepSWE publik. Dua perangkat uji vendor, dua tugas berbeda, tidak ada tumpang tindih. Menempatkan 96,0% di samping 72,57 dan menarik kesimpulan berarti mengada-adakan perbandingan yang tidak ada.

Screenshot of the OrcaRouter model page for Claude Opus 5, showing the 1M-token context window, a 128K maximum output, input pricing of $5.00 per million tokens and output pricing of $25.00 per million, cache reads at $0.50 per million and cache writes at $6.25 per million on a five-minute TTL, and the provider uptime table listing the routes behind the model.

Perbandingan biaya, dilakukan dengan benar

Aritmetika per token meremehkan selisihnya, karena kedua model tidak mengonsumsi jumlah token yang sama untuk menyelesaikan pekerjaan yang sama. Artificial Analysis mengukur berapa biaya sebenarnya masing-masing untuk menjalankan Intelligence Index penuh: $0,13 untuk MiMo-V2.6-Pro, $5,86 untuk Claude Opus 5. Itu adalah selisih 45x pada kumpulan tugas yang terkendali dan identik, dan itu adalah angka tunggal paling adil yang tersedia karena keduanya diukur dengan cara yang sama.

Sekarang, bandingkan dengan loop produksi yang masuk akal. Sebuah eksekusi agen 30 langkah yang membaca 200.000 token konteks per langkah dan menulis 2.000 token per langkah berarti 6 juta token input dan 60.000 token output per eksekusi. Pada Claude Opus 5 dengan harga list, itu berarti $30,00 input dan $1,50 output — $31,50 per eksekusi sebelum caching apa pun. Pada MiMo-V2.6-Pro, itu berarti $2,58 input dan $0,05 output — $2,63. Dengan diskon cache yang ditawarkan kedua vendor, sisi input menyusut drastis pada model mana pun, dan rasionya bergeser, bukan menghilang: diskon cache 99% pada model murah versus pembacaan cache $0,50 pada model mahal tetap membuat model mahal satu orde besaran lebih tinggi pada loop yang padat konteks.

Itulah keseluruhan argumen yang mendukung jalur murah dan menentang peralihan menyeluruh. Jika beban kerja Anda adalah loop agen dengan horizon panjang yang membaca ulang konteks yang sama ratusan kali, perbedaan biaya per eksekusi bukanlah kesalahan pembulatan — melainkan perbedaan antara fitur yang mampu Anda jalankan per pengguna dan fitur yang tidak. Itulah alasan untuk menempatkan MiMo-V2.6-Pro di depan sebagian besar lalu lintas Anda. Ini bukan alasan untuk menghapus Claude Opus 5, karena tugas-tugas di mana poin indeks kelima membayar dirinya sendiri adalah, secara konstruksi, tugas-tugas di mana kegagalan model murah menjadi mahal.

Cost card headed 'The same agent run, priced twice', listing a stated assumption of a 30-step agent run reading 200,000 tokens of context per step and writing 2,000 tokens per step for 6M input and 60K output tokens per run; MiMo-V2.6-Pro at $0.43 / $0.87 costing $2.58 input plus $0.05 output for $2.63 per run before caching; Claude Opus 5 at $5.00 / $25.00 costing $30.00 input plus $1.50 output for $31.50 per run before caching; a per-token ratio of 11.6x on input, 28.7x on output and 21x on the blended rate; a measured $0.13 against $5.86 per Intelligence Index task, a 45x gap; and the caching comparison of a 99% cache discount against a $0.50 cache read and $6.25 cache write.

Seperti apa keputusan perutean di sini

Claude Opus 5 dapat diakses melalui satu kunci OrcaRouter dengan harga daftar penyedia tanpa markup 0%, sebagai anthropic/claude-opus-5, dengan model-model frontier yang ingin Anda bandingkan berada di sampingnya pada kunci yang sama. Karena kami meneruskan harga daftar penyedia tanpa markup, perubahan harga vendor di salah satu sisi langsung berlaku di sisi kami pada hari yang sama alih-alih menunggu penawaran ulang. DSL routing adalah bagian yang menarik: Anda dapat menggabungkan kedua model itu menjadi satu panggilan alih-alih memilih di antara keduanya, mengirim sebagian besar beban kerja ke jalur murah dan merutekan sisanya — tugas-tugas yang gagal dalam pemeriksaan mandiri, atau yang cocok dengan predikat kompleksitas — ke jalur mahal. Failover adalah separuh lainnya. Claude Opus 5 memiliki cakupan penyedia yang luas; MiMo-V2.6-Pro hanya terdaftar pada satu penyedia API saat Artificial Analysis mencatatnya, yang merupakan rute tipis untuk model yang akan Anda tempatkan di jalur produksi. Router yang dapat melakukan fallback itulah yang membuat jalur murah aman untuk diadopsi.

Perlu dinyatakan secara gamblang, karena mudah untuk berasumsi sebaliknya: kami tidak menghosting MiMo-V2.6-Pro. Untuk mengaksesnya saat ini berarti melalui platform milik Xiaomi sendiri atau salah satu katalog pihak ketiga yang mencantumkannya. Argumen perutean di sini adalah tentang bagaimana Anda menggunakan model seperti ini bersama model-model yang kami sediakan, bukan klaim bahwa model ini salah satu milik kami.

Mana yang harus dipilih

Pilih Claude Opus 5 ketika biaya kegagalan tugas melebihi biaya token cukup besar sehingga lima poin indeks menjadi asuransi murah — pekerjaan agentik berhorizon panjang dengan efek samping nyata, penggunaan alat di mana panggilan yang salah lebih buruk daripada panggilan yang lambat, apa pun yang outputnya sudah Anda bayar manusia untuk memeriksanya. Angka $5.86 per tugas indeks bukan alasan untuk menghindarinya; itu adalah harga tier tersebut, dan tier itu ada untuk suatu alasan.

Pilih MiMo-V2.6-Pro saat volume menjadi kendala, saat beban kerjanya padat konteks dan berulang, saat Anda ingin bobotnya berada di infrastruktur Anda sendiri — lisensi MIT mengizinkan penerapan komersial, modifikasi, dan pelatihan lanjutan — atau saat Anda membangun sesuatu yang ekonomi unitnya hanya masuk akal pada seperlima sen per seribu token. Kecepatannya 134,3 token/detik membuatnya layak untuk penggunaan interaktif, tidak seperti sebagian besar model terbuka berparameter triliun.

Pilih keduanya, jika Anda punya router, karena jawaban jujur atas "mana yang lebih baik" adalah bahwa keduanya tidak bersaing untuk permintaan yang sama. Mode kegagalan yang harus dihindari adalah yang paling mahal: menstandarkan pada model murah karena rasio utamanya 21x, lalu di bulan ketiga baru menyadari bahwa satu kelas permintaan tertentu membutuhkan model mahal, dan tidak punya jalur untuk mengarahkannya ke sana. Mode kegagalan kedua adalah kebalikannya — membayar tarif Opus 5 untuk pekerjaan peringkasan yang diselesaikan secara identik oleh model 46-indeks. Keduanya bukan masalah model. Keduanya adalah masalah konfigurasi, dan konfigurasi adalah bagian yang bisa Anda ubah pada Selasa sore.