Kartu hero radar model OrcaRouter untuk perbandingan antara MiMo-V2.6-Pro dan DeepSeek V4 Pro, dengan subjudul 'Dua flagship terbuka, terpaut sepuluh poin indeks.', dengan satu panel per model dan footer yang mencatat bahwa keduanya berlisensi MIT dengan jendela konteks 1M token dan bahwa skornya adalah v4.3.2 dan tidak dapat dibandingkan dengan versi indeks sebelumnya.
Guides & Insights

MiMo-V2.6-Pro vs DeepSeek V4 Pro: Dua Flagship Terbuka, Terpaut Sepuluh Poin Indeks

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Xiaomi MiMo-V2.6-Pro dan DeepSeek V4 Pro adalah jenis objek yang sama — model unggulan Tiongkok berbasis mixture-of-experts berparameter triliunan, berlisensi MIT, konteks 1 juta token, bobot terbuka yang dapat Anda unduh hari ini — dan keduanya terpaut sepuluh poin pada Artificial Analysis Intelligence Index v4.3.2, 46 berbanding 36. Keduanya juga tidak sepakat tentang untuk apa sebuah model unggulan ditujukan. DeepSeek V4 Pro, yang dirilis 13 Agustus 2026, adalah model penalaran khusus teks: 1,6 triliun parameter dengan 49 miliar aktif, dan tidak ada input visi, audio, atau video di seluruh spesifikasi yang dipublikasikan. Xiaomi MiMo-V2.6-Pro, yang dirilis 21 September 2026, memiliki 1,02 triliun parameter dengan 42 miliar aktif dan menerima teks, gambar, video, serta audio. Perbedaan itu menentukan lebih banyak penerapan daripada sepuluh poin tersebut, dan itulah hal pertama yang harus diselesaikan sebelum Anda membandingkan apa pun yang lain.

Lisensi sama, mesin berbeda

Mulailah dari hal yang benar-benar identik, karena itu lebih banyak daripada yang Anda perkirakan di antara dua laboratorium yang bersaing. Keduanya dirilis dengan label lisensi MIT di repositori publik, yang berarti penerapan komersial, modifikasi, dan pelatihan lanjutan tanpa batas pendapatan atau klausul bidang penggunaan. Keduanya mengklaim jendela konteks 1 juta token. Keduanya adalah desain sparse mixture-of-experts — arsitektur ini telah menjadi standar pada skala ini, bukan pembeda. Dan keduanya dilatih oleh laboratorium yang menerbitkan lebih sedikit daripada laboratorium terdepan Barat tentang metode.

• Parameter — MiMo-V2.6-Pro 1,02T total / 42B aktif; DeepSeek V4 Pro 1,6T total / 49B aktif

• Modalitas input — MiMo-V2.6-Pro teks, gambar, video, audio; DeepSeek V4 Pro hanya teks

• Konteks — 1 juta token keduanya; DeepSeek V4 Pro membatasi output pada 384 ribu token

• Skor indeks — MiMo-V2.6-Pro 46 pada Intelligence Index v4.3.2; DeepSeek V4 Pro 36 pada versi yang sama

• Biaya per tugas Index — MiMo-V2.6-Pro $0,13; DeepSeek V4 Pro $0,67

• Tarif yang tercantum — MiMo-V2.6-Pro $0,43 / $0,87 per 1 juta token; DeepSeek V4 Pro $1,32 / $3,96 seperti yang dicantumkan Artificial Analysis, sebelum jadwal jam sibuk/luar jam sibuk milik DeepSeek sendiri

• Kecepatan — MiMo-V2.6-Pro 134,3 token keluaran/detik; DeepSeek V4 Pro 97,4

• Waktu hingga token pertama — MiMo-V2.6-Pro 2,15 detik; DeepSeek V4 Pro 1,62 detik

Baca daftar itu dua kali, karena dua baris berlawanan dengan intuisi. Model yang lebih kecil mencetak sepuluh poin lebih tinggi — 42 miliar parameter aktif mengalahkan 49 miliar bukanlah perbedaan pembulatan, melainkan hasil pascapelatihan, dan itu adalah sinyal paling jelas dalam perbandingan ini bahwa kualitas pembelajaran penguatan telah melampaui skala mentah sebagai daya ungkit. Dan model yang lebih murah juga yang lebih cepat, baik dalam hal laju pemrosesan maupun biaya per tugas, yang merupakan kebalikan dari pertukaran yang biasa. Xiaomi tidak menjual diskon kepada Anda dengan imbalan kesabaran. Keunggulan DeepSeek adalah waktu ke token pertama, 1,62 detik versus 2,15 — nyata, tetapi satu-satunya kategori di mana V4 Pro unggul.

Two-column scoreboard card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the scoreboard'. The Xiaomi MiMo-V2.6-Pro column lists 1.02T total and 42B active parameters, text, image, video and audio input, a 1M-token context window, Intelligence Index v4.3.2 score 46, a listed rate of $0.43 / $0.87 per million tokens, $0.13 per index task, 134.3 tokens per second with 2.15 seconds to first token, and a release date of 21 September 2026. The DeepSeek V4 Pro column lists 1.6T total and 49B active parameters, text-only input, a 1M-token context window with output capped at 384K, index score 36, a listed rate of $1.32 / $3.96, $0.67 per index task, 97.4 tokens per second with 1.62 seconds to first token, and a release date of 13 August 2026.

Mengapa versi indeks yang sama penting di sini

Membandingkan model open-weights lintas revisi indeks adalah penyebab sebagian besar perbandingan yang dipublikasikan menjadi keliru, jadi nomor versi bukan sekadar catatan kaki. Artificial Analysis membangun ulang Intelligence Index menjadi v4.3 pada September 2026, dan skor bergerak cukup signifikan melewati batas tersebut — Claude Opus 5 kehilangan tiga poin antara v4.2 dan v4.3, dan lanskap open-weights tersusun ulang. Kedua angka di atas adalah v4.3.2, yang berarti 46 dan 36 dapat dibandingkan secara langsung satu sama lain. Keduanya tidak dapat dibandingkan dengan angka-angka lama yang akan Anda temukan dikutip di tempat lain untuk masing-masing model tersebut.

Itu bukan hipotetis. DeepSeek V4 Pro dilaporkan secara luas berada di angka 53 pada skala indeks sebelumnya pada Agustus 2026, dan liputan kami sendiri pada periode itu memuatnya. Pada v4.3.2, model yang sama menunjukkan angka 36. Tidak ada yang berubah dari model itu; alat ukurnya yang berubah. Jika Anda memiliki spreadsheet dengan angka 53 di dalamnya di samping angka 46 untuk MiMo-V2.6-Pro, Anda memiliki perbandingan yang akan mengarahkan Anda ke model yang salah. Pasangan yang benar adalah 46 versus 36, dan kesimpulan yang benar adalah bahwa model yang dirilis lima minggu kemudian, dengan jumlah parameter dua pertiga, secara material lebih unggul.

Kesenjangan pelaporan antara kedua laboratorium

Ada perbedaan kedua yang lebih halus, dan ini tentang apa yang bersedia diperiksa oleh masing-masing lab.

46 milik MiMo-V2.6-Pro adalah pengukuran Artificial Analysis. Lembaga evaluasi tersebut menjalankan rangkaian evaluasinya sendiri — sepuluh evaluasi yang mencakup penalaran, pengetahuan, matematika, dan pemrograman — pada model yang telah dirilis dan menerbitkan hasilnya, beserta angka-angka operasionalnya: 134,3 token/detik, 2,15 detik ke token pertama, diskon cache 99%, $0,13 per tugas indeks, dan total biaya evaluasi $206,66. Itu adalah angka pihak ketiga tentang model Xiaomi.

Angka agentik utama DeepSeek V4 Pro adalah milik DeepSeek sendiri, dan kesenjangan antara angka-angka tersebut dengan angka independen telah didokumentasikan. Materi peluncuran perusahaan melaporkan Terminal-Bench 2.1 pada 87.9, DeepSWE pada 62.7, CyberGym pada 83.3, dan SWE-bench Verified pada 80.6. Uji independen menempatkan Terminal-Bench 2.1 pada 78.7 — sekitar sembilan poin di bawah angka vendor — dan Artificial Analysis Coding Index pada 68.8. Tidak ada satu pun dari angka vendor tersebut yang telah direproduksi, dan besarnya kesenjangan Terminal-Bench adalah alasan untuk memperlakukan sisanya sebagai klaim, bukan pengukuran.

Xiaomi punya versi sendiri dari masalah yang sama. Dasbornya melaporkan MiMo-V2.6-Pro bergerak dari 58,4 ke 72,57 pada DeepSWE v1.1 sepanjang proses reinforcement learning-nya, dievaluasi pada harness milik Xiaomi sendiri dengan mini-swe-agent pada rata-rata dari tiga kali. Itu bukan pengajuan ke papan peringkat dan belum ada pihak luar yang menjalankannya ulang. Jadi, tidak ada satu pun model yang datang dengan hasil yang sepenuhnya bersih pada tolok ukur vendor. Perbedaannya adalah MiMo-V2.6-Pro juga hadir dengan skor komposit independen yang tidak dimiliki peluncuran DeepSeek pada momen yang setara — dan jika Anda memilih di antara keduanya berdasarkan bukti, bukan berdasarkan pemasaran, itulah asimetri yang seharusnya berbobot.

Screenshot of the Artificial Analysis model page for DeepSeek V4 Pro, showing the Intelligence Index score of 36 on version 4.3.2, an open-weights model under the MIT licence, text-only input, 1.6 trillion total and 49 billion active parameters, a 1M-token context window, a listed price of $1.32 per million input tokens and $3.96 per million output tokens, output speed of 97.4 tokens per second and time to first token of 1.62 seconds.

Seperti apa ini di produksi

Perbedaan modalitas adalah percabangan praktisnya, dan hal itu menguntungkan DeepSeek tidak sesering yang disiratkan oleh selisih sepuluh poin tersebut. Jika pipeline Anda menyerap tangkapan layar, PDF yang dirender sebagai gambar, bingkai video, atau audio, MiMo-V2.6-Pro menanganinya secara native dalam satu model, sedangkan DeepSeek V4 Pro sama sekali tidak dapat menanganinya — Anda akan memerlukan model visi terpisah di depannya, yang berarti kontrak kedua, mode kegagalan kedua, dan tagihan kedua. Jika beban kerja Anda hanya berupa penalaran teks, modalitas tambahan itu adalah beban mati yang tidak Anda bayar apa pun.

Biaya per tugas indeks adalah angka lain yang perlu diperhitungkan. $0.13 versus $0.67 adalah selisih lima kali lipat pada kumpulan tugas yang terkendali dan identik, diukur dengan cara yang sama untuk keduanya. DeepSeek menjalankan jadwal penagihan peak/off-peak yang dapat memangkas tarif efektifnya secara substansial bergantung pada kapan Anda memanggil, sehingga rasio di dunia nyata menyempit pada jam off-peak dan melebar pada jam peak — detail yang penting jika lalu lintas Anda bersifat bursty dan Anda tidak dapat memilih kapan lalu lintas itu datang.

Di sinilah sisi DeepSeek memiliki keunggulan nyata yang tidak ada hubungannya dengan modelnya: ia berada di platform kami. DeepSeek V4 Pro dapat diakses sebagai deepseek/deepseek-v4-pro melalui kunci OrcaRouter dengan harga daftar penyedia tanpa markup 0%, dengan failover otomatis antar penyedia dan DSL perutean tersedia di atasnya — sehingga perhitungan puncak/non-puncak, sebaran penyedia, dan jalur fallback semuanya merupakan hal yang Anda konfigurasikan, bukan hal yang Anda bangun. MiMo-V2.6-Pro tidak ada di platform kami, dan kami akan mengatakannya secara terus terang: untuk menjangkaunya hari ini berarti platform milik Xiaomi sendiri atau salah satu katalog pihak ketiga yang mencantumkannya, dan Artificial Analysis mencatat satu penyedia API untuknya pada saat pengambilan data. Satu rute bukanlah rute produksi, yang merupakan argumen terkuat untuk memperlakukan MiMo-V2.6-Pro sebagai model untuk dievaluasi sekarang dan untuk dirutekan dengan hati-hati, dengan sesuatu yang lain di belakangnya.

Yang mana, dan kapan

Pilih DeepSeek V4 Pro jika pekerjaan Anda hanya berbasis teks, jika Anda membutuhkan plafon keluaran 384K, jika Anda menginginkan waktu hingga token pertama tercepat di antara keduanya, atau jika Anda sudah berada di platform kami dan menginginkan jalur bobot terbuka dengan satu triliun parameter yang memiliki failover dan tanpa integrasi baru. Ia adalah petahana karena suatu alasan, dan lebih tua lima minggu berarti lima minggu perkakas, kuantisasi, dan resep penyajian yang belum terakumulasi pada model September.

Pilih MiMo-V2.6-Pro jika tugasnya multimodal, jika biaya per tugas mendominasi unit economics Anda, jika throughput lebih penting daripada latensi setengah detik, atau jika Anda menginginkan pemimpin open-weights saat ini pada indeks yang diukur secara independen. Lisensi MIT pada keduanya berarti pertanyaan tentang bobot sudah selesai bagaimanapun juga — Anda dapat menjalankan salah satunya di perangkat keras Anda sendiri, melakukan fine-tuning padanya, dan merilisnya secara komersial.

Konfigurasi yang layak dipertimbangkan sama sekali bukanlah sebuah pilihan. Router memungkinkan Anda mempertahankan jalur DeepSeek untuk penalaran teks saja pada tarif di luar jam sibuk dan menambahkan jalur MiMo untuk permintaan multimodal, dengan fallback di depan rute yang lebih tipis. Itu bukan tindakan berjaga-jaga; itu adalah mencocokkan setiap permintaan dengan model yang benar-benar menanganinya, yang merupakan jawaban lebih murah dan lebih tahan lama daripada memilih satu pemenang dan berharap beban kerja tidak pernah berubah bentuk.

Decision card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the decision', with two columns. 'Choose MiMo-V2.6-Pro when' lists a multimodal task with screenshots, rendered PDFs, video frames or audio in the same request; cost per task dominating unit economics at $0.13 against $0.67 on an identical task set; throughput mattering more than latency at 134.3 against 97.4 tokens per second; and wanting the current open-weights leader on an independently measured index at 46 against 36. 'Choose DeepSeek V4 Pro when' lists text-only reasoning work; needing the 384K output ceiling; first-token latency being the binding constraint at 1.62s against 2.15s; and wanting a route with failover behind it.

Pertanyaan yang belum dapat dijawab oleh perbandingan ini

Benchmark yang paling banyak dikutip dari kedua model dijalankan oleh vendor dan tidak direproduksi. Untuk DeepSeek V4 Pro, kesenjangan itu telah terbuka sejak Agustus dan menjadi alasan skor independennya terbaca lebih rendah daripada angka peluncurannya. Untuk MiMo-V2.6-Pro, komposit independennya ada tetapi rincian agentiknya tidak — Artificial Analysis menerbitkan angka 46 dan bukan sebaran per-evaluasi di bawahnya, yang merupakan detail yang memberi tahu Anda apakah suatu model cocok berada dalam loop agen atau pipeline tanya-jawab.

Sampai selisih itu diterbitkan dan sampai seseorang menjalankan ulang harness DeepSWE milik Xiaomi, posisi yang dapat dipertahankan lebih sempit daripada pemasaran kedua lab: MiMo-V2.6-Pro unggul pada komposit independen dan pada biaya per tugas yang terukur, DeepSeek V4 Pro unggul pada kematangan, panjang output, latensi token pertama, dan dapat dijangkau melalui rute yang memiliki redundansi di belakangnya. Lima minggu adalah keunggulan awal yang singkat, dan itu satu-satunya yang dimiliki DeepSeek.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari