
MiMo-V2.6-Pro vs MiMo-V2.6-Flash: Kesenjangan Harga 3x yang Tidak Dijelaskan oleh Dua Benchmark
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Pada tabel evaluasi milik Xiaomi sendiri, MiMo-V2.6-Flash mengalahkan MiMo-V2.6-Pro. Barisnya adalah CyberGym, dan selisihnya 95,1 berbanding 94,0. Ini satu baris dari lima belas, dan inilah alasan untuk membaca sisa perbandingan ini dengan cermat alih-alih mengasumsikan model unggulan selalu menjadi jawabannya — karena MiMo-V2.6-Flash berbiaya sekitar sepertiga dari biaya MiMo-V2.6-Pro, dan pada sebagian besar baris keduanya hanya berselisih beberapa poin.
Kedua model tersebut diterbitkan sebagai repositori Hugging Face pada 21 September 2026, di bawah lisensi MIT, terpaut delapan belas detik, sebagai proses pelatihan yang terpisah, bukan sebagai anak tangga dalam satu tangga. Xiaomi MiMo-V2.6-Pro adalah kelas triliun parameter. MiMo-V2.6-Flash adalah kelas efisiensi. Pertanyaan yang dijawab halaman ini adalah mana di antara keduanya yang cocok untuk jalur produksi Anda, dan jawaban jujurnya bergantung pada angka yang tidak ada dalam kedua rilis tersebut.
Apa itu masing-masing
• Parameter — Xiaomi MiMo-V2.6-Pro total 1,02T dengan 42B aktif per token, dibandingkan Xiaomi MiMo-V2.6-Flash sekitar 309B total dengan 15B aktif
• Arsitektur — keduanya sparse mixture-of-experts dengan input omnimodal native; Flash didokumentasikan pada 48 lapisan, 39 sliding-window dan 9 full attention, ukuran hidden 4096, 256 routed experts dengan 8 aktif dan tanpa shared experts, bersama vision transformer 681M, tokenizer audio 308M dan encoder patch audio 127M
• Konteks — 1M token pada keduanya, dengan hingga 128.000 token output pada keduanya
• Lisensi — MIT pada keduanya, bobot tanpa gating pada keduanya
• Harga — $0,435 masuk dan $0,87 keluar per juta token untuk Pro, dibandingkan $0,14 dan $0,28 untuk Flash: selisih 3,1x pada kedua sisi kartu
• Input cache-hit — $0,0036 per juta pada Pro, $0,0028 pada Flash
• Pengeluaran pelatihan — Xiaomi melaporkan sekitar $2,62M untuk proses RL Pro dan $854K untuk Flash, masing-masing selesai dalam waktu kurang dari enam hari melalui 30 langkah reinforcement learning dan sekitar 750.000 trajektori
• Skor indeks independen — 46 untuk Xiaomi MiMo-V2.6-Pro pada Artificial Analysis Intelligence Index v4.3.2; tidak ada yang dipublikasikan untuk MiMo-V2.6-Flash
Baris terakhir itulah yang perlu dipegang. Semua di atasnya kecuali skor Pro dilaporkan oleh Xiaomi.
Di mana harga tiga kali lipat nyaris tidak membeli apa pun
Tabel 3 Xiaomi menempatkan keduanya berdampingan di seluruh harness yang digunakan untuk melatih seri tersebut, dan dalam pekerjaan agentik berhorizon panjang, marginnya tipis:
• DeepSWE v1.1 — Pro 71.9, Flash 67.9
• MiMo Code Bench — Pro 63.2, Flash 61.2
• AutomationBench v1.0.6 — Pro 53.1, Flash 52.3
• Toolathlon-Verified — Pro 76.9, Flash 73.6
• Terminal Bench 2.1 — Pro 89.9, Flash 87.6
• OSWorld-Verified — Pro 82.0, Flash 80.8
• JobBench — Pro 62.0, Flash 61.2
• MiMo Visual Coding — Pro 72.3, Flash 71.5
• CyberGym — Pro 94.0, Flash 95.1
• MiMo Cyber Bench — Pro 80.2, Flash 77.2
Telusuri kolom itu dari atas ke bawah dan keunggulan flagship sebagian besar berada di antara satu dan empat poin, dengan satu baris kalah sepenuhnya. Pada alur kerja yang perbedaan antara 67,9 dan 71,9 adalah perbedaan antara tugas selesai dan tugas gagal, harga tiga kali lipat itu murah. Pada alur kerja yang perbedaannya hanya antara dua jawaban yang sama-sama dapat diterima, harga itu tidak murah. Tabel vendor dengan angka desimal seperti ini mengundang presisi semu — tidak ada pihak di luar Xiaomi yang menjalankannya, dan selisih dua poin pada harness yang dinilai secara internal masih jauh berada dalam rentang yang dapat digeser oleh penilai berbeda atau kebijakan percobaan ulang yang berbeda.

Di mana ia membeli banyak
Ada sekelompok baris di mana selisihnya tidak lagi bisa dianggap sebagai soal pembulatan. Semuanya adalah pekerjaan keamanan:
• ExploitGym — Pro 17.8, Flash 6.0
• ExploitBench — Pro 47.9, Flash 25.3
• SEC Bench Pro — Pro 66.3, Flash 47.5
• Agents' Last Exam — Pro 31.6, Flash 27.6
• Terminal Bench 4.0 — Pro 34.9, Flash 28.8
Di ExploitGym, model unggulan tiga kali lipat model yang lebih murah, yang merupakan faktor yang sama dengan harganya, dan di SEC Bench Pro nilainya 1,4x. Pola itu adalah yang Anda harapkan dari model dengan 42B parameter aktif dibandingkan model dengan 15B: tugas yang membutuhkan rantai penalaran panjang tanpa kredit parsial adalah jenis tugas di mana kapasitas ekstra itu muncul, dan CyberGym yang berada di arah sebaliknya adalah pengecualian yang membuktikan bahwa kedua proses tersebut mempelajari hal yang berbeda alih-alih hal yang sama pada ukuran yang berbeda.
Jadi pembagian ini memetakan ke batas beban kerja yang nyata, bukan batas pemasaran. Pekerjaan agen bervolume tinggi dengan kriteria keberhasilan yang longgar — retrieval, klasifikasi, penyuntingan rutin, panggilan yang bisa diselamatkan oleh percobaan ulang — adalah wilayah Flash. Pekerjaan yang jawaban salahnya mahal dan jawaban parsialnya tidak berguna — pengembangan eksploit, tinjauan keamanan, sesi terminal dengan status multi-langkah — adalah tempat tier Pro memperoleh kelipatannya.
Angka yang tidak ada
MiMo-V2.6-Flash tidak memiliki halaman model Artificial Analysis. Varian saudaranya memilikinya. Asimetri itu adalah hal tunggal yang paling penting di halaman ini, karena itu berarti satu-satunya angka yang diukur secara independen di mana pun dalam seri MiMo-V2.6 adalah angka 46 di samping Xiaomi MiMo-V2.6-Pro. Setiap angka Flash di atas — termasuk baris CyberGym yang dimenanginya — berasal dari harness Xiaomi, penilai Xiaomi, dan proses offline Xiaomi.
Ada alasan yang masuk akal bahwa ini bersifat sementara: model ini baru berumur sehari pada saat penulisan, dan evaluasi pihak ketiga membutuhkan waktu. Ada juga alasan yang masuk akal bahwa ini bersifat struktural, karena Flash adalah tier volume dan tier volume menarik lebih sedikit perhatian benchmarking. Bagaimanapun juga, konsekuensi praktisnya hari ini adalah Anda tidak dapat membandingkan Flash dengan apa pun di luar keluarganya sendiri dengan keyakinan yang sama seperti saat Anda membandingkan Pro. Jika Anda memilih antara Flash dan model non-Xiaomi berdasarkan harga per kualitas, Anda membandingkan angka dari vendor dengan angka yang diukur oleh pihak lain.
Kedua kartu model memuat kaveat kedua yang sama. Tidak ada satu pun repositori yang di-deploy oleh penyedia inferensi mana pun — Hugging Face menyatakannya secara eksplisit di setiap halaman, dan Artificial Analysis hanya menghitung satu penyedia API untuk Pro. Kami tidak meng-host checkpoint mana pun, sehingga tidak ada satu pun yang dapat dirutekan melalui kami. Rute menuju keduanya adalah platform milik Xiaomi sendiri dan katalog pihak ketiga yang memuat keduanya.

Harga yang Anda bayar dalam bentuk perangkat keras, bukan token
Harga per token hanyalah separuh dari biaya checkpoint Anda, dan keduanya jauh lebih berbeda tajam di disk daripada di daftar harga. MiMo-V2.6-Flash mempublikasikan 172,9 GB bobot FP8 dalam 65 shard. Xiaomi MiMo-V2.6-Pro membawa sekitar tiga kali lipat parameter, yang menempatkan unduhan mentahnya dalam kisaran setengah terabyte sebelum kuantisasi apa pun — dan repositorinya sendiri melaporkan ukuran model Safetensors sebesar 524B parameter, angka yang tidak sesuai dengan total 1,02T maupun jumlah aktif 42B.
Kesenjangan itu mengubah bentuk keputusannya. Flash pada 172,9 GB adalah model yang dapat di-hosting sendiri oleh tim kecil pada kapasitas sewaan dan diperlakukan sebagai komoditas. Pro pada sekitar tiga kali lipatnya merupakan keputusan tingkat klaster — liputan seputar peluncuran menempatkan kedua proses pelatihan pada sekitar 4.000 dan 8.000 GPU setara H200. Jika alasan Anda melirik open weights adalah karena ingin memiliki opsi untuk berhenti membayar per token, kedua checkpoint tersebut menawarkan opsi itu pada skala komitmen yang sangat berbeda.
Memilih di antara keduanya
Aturan yang tetap berlaku di tengah peringatan di atas adalah memilih berdasarkan kelas beban kerja, bukan berdasarkan rata-rata benchmark. Flash untuk apa pun yang Anda nyaman untuk mencobanya ulang; Pro untuk apa pun yang tidak dapat diselamatkan oleh percobaan ulang. Lalu ukur, karena tidak ada satu pun dari kedua model yang memiliki skor independen pada benchmark yang benar-benar Anda pedulikan.
Mengukur dua checkpoint secara berdampingan adalah hal di mana sebuah router melakukan sesuatu yang tidak bisa dilakukan oleh kontrak per-model. Menempatkan tier murah pada sebagian besar trafik Anda dan hanya mengeskalasi kasus-kasus sulit ke tier mahal adalah keputusan yang sama seperti halaman ini, dinyatakan sebagai konfigurasi alih-alih sebagai penulisan ulang — dan komposisi itulah yang menjadi alasan lapisan routing ada. Hal ini juga penting untuk harga itu sendiri: kami meneruskan harga daftar penyedia dengan markup 0%, jadi jika Xiaomi memotong tarif pada salah satu checkpoint, angka di sisi kami berubah pada hari yang sama alih-alih pada pembaruan kontrak berikutnya. Itu berlaku untuk model yang kami bawa. Khusus untuk pasangan MiMo-V2.6, hari ini, Anda masih membeli langsung dari Xiaomi.
Apa yang bisa menyelesaikannya
Dua hal akan mengubah ini dari keputusan subjektif menjadi perhitungan aritmetika. Halaman Artificial Analysis untuk MiMo-V2.6-Flash akan menempatkan kedua checkpoint pada sumbu biaya per tugas yang sama yang saat ini menempatkan Pro pada $0,133 per tugas Intelligence Index, dan perbandingannya akan terselesaikan dengan sendirinya. Replikasi pihak ketiga atas klaster keamanan — ExploitGym, ExploitBench, SEC Bench Pro — akan mengonfirmasi apakah selisih 3x pada baris-baris tersebut adalah sifat dari model atau sifat dari penilai.
Sampai saat itu, posisi yang dapat dipertahankan adalah bahwa Xiaomi MiMo-V2.6-Flash adalah pembelian yang lebih baik bagi sebagian besar tim pada sebagian besar waktu, dan bahwa Xiaomi MiMo-V2.6-Pro adalah pembelian yang lebih baik untuk kelas pekerjaan yang sempit di mana kegagalan adalah hasil yang mahal. Satu baris tempat Flash menang tidak membalikkan hal itu — tetapi itu adalah pengingat yang berguna bahwa premi model unggulan adalah klaim tentang beban kerja, bukan tentang model.

