
MiMo-V2.6-Pro vs DeepSeek V4 Pro: Dua Flagship Terbuka, Terpaut Sepuluh Poin Indeks
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro dan DeepSeek V4 Pro adalah jenis objek yang sama — model unggulan Tiongkok berbasis mixture-of-experts berparameter triliunan, berlisensi MIT, konteks 1 juta token, bobot terbuka yang dapat Anda unduh hari ini — dan keduanya terpaut sepuluh poin pada Artificial Analysis Intelligence Index v4.3.2, 46 berbanding 36. Keduanya juga tidak sepakat tentang untuk apa sebuah model unggulan ditujukan. DeepSeek V4 Pro, yang dirilis 13 Agustus 2026, adalah model penalaran khusus teks: 1,6 triliun parameter dengan 49 miliar aktif, dan tidak ada input visi, audio, atau video di seluruh spesifikasi yang dipublikasikan. Xiaomi MiMo-V2.6-Pro, yang dirilis 21 September 2026, memiliki 1,02 triliun parameter dengan 42 miliar aktif dan menerima teks, gambar, video, serta audio. Perbedaan itu menentukan lebih banyak penerapan daripada sepuluh poin tersebut, dan itulah hal pertama yang harus diselesaikan sebelum Anda membandingkan apa pun yang lain.
Lisensi sama, mesin berbeda
Mulailah dari hal yang benar-benar identik, karena itu lebih banyak daripada yang Anda perkirakan di antara dua laboratorium yang bersaing. Keduanya dirilis dengan label lisensi MIT di repositori publik, yang berarti penerapan komersial, modifikasi, dan pelatihan lanjutan tanpa batas pendapatan atau klausul bidang penggunaan. Keduanya mengklaim jendela konteks 1 juta token. Keduanya adalah desain sparse mixture-of-experts — arsitektur ini telah menjadi standar pada skala ini, bukan pembeda. Dan keduanya dilatih oleh laboratorium yang menerbitkan lebih sedikit daripada laboratorium terdepan Barat tentang metode.
• Parameter — MiMo-V2.6-Pro 1,02T total / 42B aktif; DeepSeek V4 Pro 1,6T total / 49B aktif
• Modalitas input — MiMo-V2.6-Pro teks, gambar, video, audio; DeepSeek V4 Pro hanya teks
• Konteks — 1 juta token keduanya; DeepSeek V4 Pro membatasi output pada 384 ribu token
• Skor indeks — MiMo-V2.6-Pro 46 pada Intelligence Index v4.3.2; DeepSeek V4 Pro 36 pada versi yang sama
• Biaya per tugas Index — MiMo-V2.6-Pro $0,13; DeepSeek V4 Pro $0,67
• Tarif yang tercantum — MiMo-V2.6-Pro $0,43 / $0,87 per 1 juta token; DeepSeek V4 Pro $1,32 / $3,96 seperti yang dicantumkan Artificial Analysis, sebelum jadwal jam sibuk/luar jam sibuk milik DeepSeek sendiri
• Kecepatan — MiMo-V2.6-Pro 134,3 token keluaran/detik; DeepSeek V4 Pro 97,4
• Waktu hingga token pertama — MiMo-V2.6-Pro 2,15 detik; DeepSeek V4 Pro 1,62 detik
Baca daftar itu dua kali, karena dua baris berlawanan dengan intuisi. Model yang lebih kecil mencetak sepuluh poin lebih tinggi — 42 miliar parameter aktif mengalahkan 49 miliar bukanlah perbedaan pembulatan, melainkan hasil pascapelatihan, dan itu adalah sinyal paling jelas dalam perbandingan ini bahwa kualitas pembelajaran penguatan telah melampaui skala mentah sebagai daya ungkit. Dan model yang lebih murah juga yang lebih cepat, baik dalam hal laju pemrosesan maupun biaya per tugas, yang merupakan kebalikan dari pertukaran yang biasa. Xiaomi tidak menjual diskon kepada Anda dengan imbalan kesabaran. Keunggulan DeepSeek adalah waktu ke token pertama, 1,62 detik versus 2,15 — nyata, tetapi satu-satunya kategori di mana V4 Pro unggul.

Mengapa versi indeks yang sama penting di sini
Membandingkan model open-weights lintas revisi indeks adalah penyebab sebagian besar perbandingan yang dipublikasikan menjadi keliru, jadi nomor versi bukan sekadar catatan kaki. Artificial Analysis membangun ulang Intelligence Index menjadi v4.3 pada September 2026, dan skor bergerak cukup signifikan melewati batas tersebut — Claude Opus 5 kehilangan tiga poin antara v4.2 dan v4.3, dan lanskap open-weights tersusun ulang. Kedua angka di atas adalah v4.3.2, yang berarti 46 dan 36 dapat dibandingkan secara langsung satu sama lain. Keduanya tidak dapat dibandingkan dengan angka-angka lama yang akan Anda temukan dikutip di tempat lain untuk masing-masing model tersebut.
Itu bukan hipotetis. DeepSeek V4 Pro dilaporkan secara luas berada di angka 53 pada skala indeks sebelumnya pada Agustus 2026, dan liputan kami sendiri pada periode itu memuatnya. Pada v4.3.2, model yang sama menunjukkan angka 36. Tidak ada yang berubah dari model itu; alat ukurnya yang berubah. Jika Anda memiliki spreadsheet dengan angka 53 di dalamnya di samping angka 46 untuk MiMo-V2.6-Pro, Anda memiliki perbandingan yang akan mengarahkan Anda ke model yang salah. Pasangan yang benar adalah 46 versus 36, dan kesimpulan yang benar adalah bahwa model yang dirilis lima minggu kemudian, dengan jumlah parameter dua pertiga, secara material lebih unggul.
Kesenjangan pelaporan antara kedua laboratorium
Ada perbedaan kedua yang lebih halus, dan ini tentang apa yang bersedia diperiksa oleh masing-masing lab.
46 milik MiMo-V2.6-Pro adalah pengukuran Artificial Analysis. Lembaga evaluasi tersebut menjalankan rangkaian evaluasinya sendiri — sepuluh evaluasi yang mencakup penalaran, pengetahuan, matematika, dan pemrograman — pada model yang telah dirilis dan menerbitkan hasilnya, beserta angka-angka operasionalnya: 134,3 token/detik, 2,15 detik ke token pertama, diskon cache 99%, $0,13 per tugas indeks, dan total biaya evaluasi $206,66. Itu adalah angka pihak ketiga tentang model Xiaomi.
Angka agentik utama DeepSeek V4 Pro adalah milik DeepSeek sendiri, dan kesenjangan antara angka-angka tersebut dengan angka independen telah didokumentasikan. Materi peluncuran perusahaan melaporkan Terminal-Bench 2.1 pada 87.9, DeepSWE pada 62.7, CyberGym pada 83.3, dan SWE-bench Verified pada 80.6. Uji independen menempatkan Terminal-Bench 2.1 pada 78.7 — sekitar sembilan poin di bawah angka vendor — dan Artificial Analysis Coding Index pada 68.8. Tidak ada satu pun dari angka vendor tersebut yang telah direproduksi, dan besarnya kesenjangan Terminal-Bench adalah alasan untuk memperlakukan sisanya sebagai klaim, bukan pengukuran.
Xiaomi punya versi sendiri dari masalah yang sama. Dasbornya melaporkan MiMo-V2.6-Pro bergerak dari 58,4 ke 72,57 pada DeepSWE v1.1 sepanjang proses reinforcement learning-nya, dievaluasi pada harness milik Xiaomi sendiri dengan mini-swe-agent pada rata-rata dari tiga kali. Itu bukan pengajuan ke papan peringkat dan belum ada pihak luar yang menjalankannya ulang. Jadi, tidak ada satu pun model yang datang dengan hasil yang sepenuhnya bersih pada tolok ukur vendor. Perbedaannya adalah MiMo-V2.6-Pro juga hadir dengan skor komposit independen yang tidak dimiliki peluncuran DeepSeek pada momen yang setara — dan jika Anda memilih di antara keduanya berdasarkan bukti, bukan berdasarkan pemasaran, itulah asimetri yang seharusnya berbobot.

Seperti apa ini di produksi
Perbedaan modalitas adalah percabangan praktisnya, dan hal itu menguntungkan DeepSeek tidak sesering yang disiratkan oleh selisih sepuluh poin tersebut. Jika pipeline Anda menyerap tangkapan layar, PDF yang dirender sebagai gambar, bingkai video, atau audio, MiMo-V2.6-Pro menanganinya secara native dalam satu model, sedangkan DeepSeek V4 Pro sama sekali tidak dapat menanganinya — Anda akan memerlukan model visi terpisah di depannya, yang berarti kontrak kedua, mode kegagalan kedua, dan tagihan kedua. Jika beban kerja Anda hanya berupa penalaran teks, modalitas tambahan itu adalah beban mati yang tidak Anda bayar apa pun.
Biaya per tugas indeks adalah angka lain yang perlu diperhitungkan. $0.13 versus $0.67 adalah selisih lima kali lipat pada kumpulan tugas yang terkendali dan identik, diukur dengan cara yang sama untuk keduanya. DeepSeek menjalankan jadwal penagihan peak/off-peak yang dapat memangkas tarif efektifnya secara substansial bergantung pada kapan Anda memanggil, sehingga rasio di dunia nyata menyempit pada jam off-peak dan melebar pada jam peak — detail yang penting jika lalu lintas Anda bersifat bursty dan Anda tidak dapat memilih kapan lalu lintas itu datang.
Di sinilah sisi DeepSeek memiliki keunggulan nyata yang tidak ada hubungannya dengan modelnya: ia berada di platform kami. DeepSeek V4 Pro dapat diakses sebagai deepseek/deepseek-v4-pro melalui kunci OrcaRouter dengan harga daftar penyedia tanpa markup 0%, dengan failover otomatis antar penyedia dan DSL perutean tersedia di atasnya — sehingga perhitungan puncak/non-puncak, sebaran penyedia, dan jalur fallback semuanya merupakan hal yang Anda konfigurasikan, bukan hal yang Anda bangun. MiMo-V2.6-Pro tidak ada di platform kami, dan kami akan mengatakannya secara terus terang: untuk menjangkaunya hari ini berarti platform milik Xiaomi sendiri atau salah satu katalog pihak ketiga yang mencantumkannya, dan Artificial Analysis mencatat satu penyedia API untuknya pada saat pengambilan data. Satu rute bukanlah rute produksi, yang merupakan argumen terkuat untuk memperlakukan MiMo-V2.6-Pro sebagai model untuk dievaluasi sekarang dan untuk dirutekan dengan hati-hati, dengan sesuatu yang lain di belakangnya.
Yang mana, dan kapan
Pilih DeepSeek V4 Pro jika pekerjaan Anda hanya berbasis teks, jika Anda membutuhkan plafon keluaran 384K, jika Anda menginginkan waktu hingga token pertama tercepat di antara keduanya, atau jika Anda sudah berada di platform kami dan menginginkan jalur bobot terbuka dengan satu triliun parameter yang memiliki failover dan tanpa integrasi baru. Ia adalah petahana karena suatu alasan, dan lebih tua lima minggu berarti lima minggu perkakas, kuantisasi, dan resep penyajian yang belum terakumulasi pada model September.
Pilih MiMo-V2.6-Pro jika tugasnya multimodal, jika biaya per tugas mendominasi unit economics Anda, jika throughput lebih penting daripada latensi setengah detik, atau jika Anda menginginkan pemimpin open-weights saat ini pada indeks yang diukur secara independen. Lisensi MIT pada keduanya berarti pertanyaan tentang bobot sudah selesai bagaimanapun juga — Anda dapat menjalankan salah satunya di perangkat keras Anda sendiri, melakukan fine-tuning padanya, dan merilisnya secara komersial.
Konfigurasi yang layak dipertimbangkan sama sekali bukanlah sebuah pilihan. Router memungkinkan Anda mempertahankan jalur DeepSeek untuk penalaran teks saja pada tarif di luar jam sibuk dan menambahkan jalur MiMo untuk permintaan multimodal, dengan fallback di depan rute yang lebih tipis. Itu bukan tindakan berjaga-jaga; itu adalah mencocokkan setiap permintaan dengan model yang benar-benar menanganinya, yang merupakan jawaban lebih murah dan lebih tahan lama daripada memilih satu pemenang dan berharap beban kerja tidak pernah berubah bentuk.

Pertanyaan yang belum dapat dijawab oleh perbandingan ini
Benchmark yang paling banyak dikutip dari kedua model dijalankan oleh vendor dan tidak direproduksi. Untuk DeepSeek V4 Pro, kesenjangan itu telah terbuka sejak Agustus dan menjadi alasan skor independennya terbaca lebih rendah daripada angka peluncurannya. Untuk MiMo-V2.6-Pro, komposit independennya ada tetapi rincian agentiknya tidak — Artificial Analysis menerbitkan angka 46 dan bukan sebaran per-evaluasi di bawahnya, yang merupakan detail yang memberi tahu Anda apakah suatu model cocok berada dalam loop agen atau pipeline tanya-jawab.
Sampai selisih itu diterbitkan dan sampai seseorang menjalankan ulang harness DeepSWE milik Xiaomi, posisi yang dapat dipertahankan lebih sempit daripada pemasaran kedua lab: MiMo-V2.6-Pro unggul pada komposit independen dan pada biaya per tugas yang terukur, DeepSeek V4 Pro unggul pada kematangan, panjang output, latensi token pertama, dan dapat dijangkau melalui rute yang memiliki redundansi di belakangnya. Lima minggu adalah keunggulan awal yang singkat, dan itu satu-satunya yang dimiliki DeepSeek.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
