
MiMo-V2.6-Pro vs Grok 4.6: Kedua Vendor Merilis Angka DeepSWE, dan Keduanya Tidak Ada di Papan Peringkat
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Dua vendor, satu tolok ukur, dua angka yang tidak bisa dikurangkan. Materi peluncuran SpaceXAI untuk Grok 4.6 melaporkan 65,9% pada DeepSWE v1.1. Materi Xiaomi untuk MiMo-V2.6-Pro melaporkan 72,57 pada DeepSWE v1.1. Jika dibaca bersama, keduanya menyiratkan bahwa model open-weights yang lebih murah mengalahkan model proprietari terdepan dengan selisih hampir tujuh poin. Jika dibaca dengan cermat, keduanya nyaris tidak mengatakan apa-apa, karena yang satu adalah persentase dari dek peluncuran pada harness milik vendor sendiri dan yang lainnya adalah rata-rata dari tiga hasil dari proses reinforcement learning pada penilai milik Xiaomi sendiri, dan keduanya belum diserahkan ke papan DeepSWE publik. Perbandingan antara MiMo-V2.6-Pro dan Grok 4.6 yang lolos dari pengamatan ketat ada pada indeks independen, dan di sana jawabannya adalah kebalikan dari angka vendor: 46 melawan 44, yang menguntungkan Xiaomi, dengan selisih dua poin.
Grok 4.6 dirilis pada 12 Agustus 2026 oleh SpaceXAI dan merupakan petahana di sini — model terdepan yang telah dikirim, dilayani secara luas, dengan daftar harga yang terdokumentasi dan pengukuran independen selama berbulan-bulan di belakangnya. Xiaomi MiMo-V2.6-Pro mulai tersedia secara umum pada 22 September 2026, dengan repositori checkpoint pembelajaran penguatannya muncul sehari sebelumnya, dan ia adalah pendatang baru. Keduanya mampu bernalar, keduanya dibangun untuk pekerjaan agentik yang berjalan lama, dan selisih harga di antara keduanya cukup besar sehingga kurangnya pengalaman pendatang baru adalah satu-satunya hal yang menahan perbandingan ini.
Apa sebenarnya setiap model itu
Grok 4.6 bersifat proprietary, menerima masukan teks dan gambar serta mengembalikan teks, dan memiliki batas pengetahuan 1 Februari 2026. Jendela konteksnya adalah 500.000 token, yaitu setengah ukuran pesaing utamanya dan merupakan spesifikasi yang paling berdampak di lembar spesifikasinya. Tarif daftarnya adalah $2,00 per juta token masukan, $0,50 per juta masukan yang di-cache, dan $6,00 per juta keluaran untuk di bawah 200.000 token prompt, dengan lonjakan tajam pada batas tersebut: pada atau di atas 200K tarifnya menjadi $4,00, $1,00, dan $12,00, dan tier yang lebih tinggi menagih seluruh permintaan, bukan hanya porsi yang melewati batas. Pemrosesan prioritas menggandakan tarif standar. Artificial Analysis mengukur 63,0 token keluaran per detik dan 42,79 detik untuk mencapai token pertama pada upaya maksimum, serta $2.351,83 untuk menjalankan indeks penuh.
Xiaomi MiMo-V2.6-Pro adalah model sparse mixture-of-experts dengan 1,02 triliun parameter total dan 42 miliar yang diaktifkan per token, dengan jendela konteks 1M token dan multimodalitas native di seluruh teks, gambar, video, dan audio. Model ini berlisensi MIT dengan bobot yang dapat diunduh, dan Xiaomi mempertahankan harga generasi sebelumnya alih-alih menaikkan harga checkpoint baru — $0,43 per juta token masukan dan $0,87 per juta token keluaran, diskon cache 99%, dan biaya campuran $0,18 pada campuran cache-hit/masukan/keluaran 7:2:1. Artificial Analysis mengukur 134,3 token keluaran per detik, 2,15 detik ke token pertama, dan $206,66 untuk menjalankan indeks — $0,13 per tugas.
• Bobot — MiMo-V2.6-Pro berlisensi MIT dan dapat diunduh; Grok 4.6 proprieter, hanya API
• Parameter — MiMo-V2.6-Pro total 1,02T / 42B aktif; Grok 4.6 tidak diungkapkan
• Konteks — MiMo-V2.6-Pro 1 juta token; Grok 4.6 500K, dengan lompatan harga pada 200K input
• Modalitas — MiMo-V2.6-Pro menerima teks, gambar, video, dan audio; permukaan masukan yang dipublikasikan Grok 4.6 adalah teks dan gambar
• Skor indeks — MiMo-V2.6-Pro 46; Grok 4.6 44, keduanya Artificial Analysis v4.3.2
• Harga daftar — MiMo-V2.6-Pro $0.43 / $0.87 per 1 juta; Grok 4.6 $2.00 / $6.00, menjadi dua kali lipat untuk input di atas 200K
• Tarif campuran — MiMo-V2.6-Pro $0.18 per 1 juta; Grok 4.6 $1.35
• Biaya untuk menjalankan indeks — MiMo-V2.6-Pro $206,66; Grok 4.6 $2.351,83
• Kecepatan — MiMo-V2.6-Pro 134,3 token keluaran/detik; Grok 4.6 63,0
• Waktu ke token pertama — MiMo-V2.6-Pro 2,15 detik; Grok 4.6 42,79 detik
• Batas pengetahuan — MiMo-V2.6-Pro belum dipublikasikan; Grok 4.6 1 Februari 2026

Tolok ukur yang dijalankan kedua vendor, dan mengapa tolok ukur itu tidak dapat dibandingkan
DeepSWE v1.1 adalah evaluasi agen coding pihak ketiga yang nyata dan publik, dijalankan oleh Datacurve, dan itu adalah satu keluarga tugas yang kedua perusahaan pilih untuk mempublikasikan hasilnya. Itu membuatnya menggiurkan. Ini tidak boleh digunakan sebagai perbandingan langsung, dan alasannya bukan karena salah satu vendor berbohong — melainkan karena kedua angka tersebut menggambarkan pengukuran yang berbeda dari nama tugas yang sama.
72,57 milik Xiaomi adalah rata-rata dari tiga percobaan pada harness miliknya sendiri dengan mini-swe-agent, dihasilkan selama proses reinforcement learning, bukan dari kandidat rilis yang dibekukan, dan dilaporkan bersama angka awal 58,4. Proses ini didokumentasikan sebagai 30 langkah dan sekitar 750.000 trajektori per model, diselesaikan dalam waktu kurang dari enam hari dengan pengeluaran yang dipublikasikan sekitar US$2,62 juta untuk model Pro. Angka ini belum diajukan ke papan Datacurve. 65,9% milik SpaceXAI untuk Grok 4.6 adalah angka dek peluncuran dari set evaluasi vendor sendiri, dilaporkan di samping kenaikan atas Grok 4.5 sebesar 11,9 poin pada benchmark yang sama — dan papan publik memuat konfigurasi Grok 4.6 yang diajukan pada sekitar 67%, yang cukup dekat dengan angka vendor untuk menunjukkan bahwa harness setidaknya secara garis besar sudah selaras. Hal itu tidak berlaku untuk angka Xiaomi, yang sama sekali tidak memiliki padanan publik.
Jadi pernyataan yang jujur adalah ini: di papan publik, Grok 4.6 hadir dan MiMo-V2.6-Pro tidak ada. Pada komposit independen, keduanya sebenarnya diuji oleh evaluator yang sama, dan model Xiaomi unggul dua poin. Kedua fakta itu tidak saling bertentangan. Keduanya hanya mengukur hal yang berbeda, dan yang kedua itulah yang perlu dikutip.
Konteks 500K adalah spesifikasi yang menentukan beban kerja nyata
Setengah juta token adalah jendela konteks yang besar menurut standar normal apa pun dan kecil untuk 2026. Model-model yang dikelompokkan bersama MiMo-V2.6-Pro semuanya berada di 1 juta token, dan konsekuensi praktisnya muncul tepat pada beban kerja yang menjadi sasaran pemasaran Grok 4.6. Agen pengodean yang berjalan lama, yang memegang repositori, transkrip alat, dan rencana yang terakumulasi, akan melewati 200.000 token prompt dalam satu sesi — dan pada ambang itu, tarif Grok 4.6 menjadi dua kali lipat dan berlaku secara retroaktif untuk seluruh permintaan. Sesi yang sama pada MiMo-V2.6-Pro berjalan hingga satu juta token tanpa perubahan tier.
Itu adalah perbedaan spesifikasi sekaligus perbedaan struktur harga, dan yang kedua mudah terlewat saat membandingkan tarif yang ditampilkan. Harga campuran $1,35 untuk Grok 4.6 dibandingkan $0,18 untuk MiMo-V2.6-Pro adalah selisih 7,5x. Pada prompt yang melampaui 200K, selisihnya melebar menjadi mendekati 15x, karena tarif Grok berlipat ganda sementara tarif Xiaomi tidak berubah.
Argumen tandingannya juga tercatat, dan memang pantas demikian. Tesis peluncuran Grok 4.6 adalah efisiensi giliran alih-alih konteks mentah: dalam evaluasi agentik ketika diukur terhadap Claude Opus 5 pada tugas-tugas yang identik, model ini selesai dalam sekitar 53 giliran dan sekitar 500 juta token masukan, dibandingkan dengan sekitar 103 giliran dan dua miliar token untuk model lainnya, dengan perkiraan $0,84 per tugas — angka terendah di antara model-model terdepan dalam perbandingan itu. Model yang berputar dalam loop setengah kali lebih sedikit tidak membutuhkan konteks sebanyak itu, dan tidak menghabiskan token sebanyak itu. Itu adalah keunggulan arsitektural yang sesungguhnya dan merupakan argumen terkuat untuk Grok 4.6 melawan alternatif apa pun yang lebih murah per token, termasuk yang ini.

Menuju ke masing-masing dari mereka
Grok 4.6 tersedia di OrcaRouter sebagai grok/grok-4.6, dapat diakses melalui satu endpoint yang kompatibel dengan OpenAI dengan harga daftar penyedia tanpa markup (0%) — jadi perubahan harga SpaceXAI, termasuk perubahan pada batas 200K tersebut, langsung berlaku di sisi kami pada hari yang sama. Xiaomi MiMo-V2.6-Pro tidak ada di OrcaRouter. Tidak ada model Xiaomi yang tersedia di sana, dan rute untuk mengaksesnya saat ini adalah platform Xiaomi sendiri atau salah satu katalog pihak ketiga yang mencantumkannya. Mengatakan hal itu secara terus terang lebih berguna daripada membiarkan halaman model menyiratkan sebaliknya.
Sebesar apa nilainya asimetri itu dalam praktik adalah eksperimen murah. Grok 4.6 adalah model yang mungkin sudah Anda bayar. MiMo-V2.6-Pro adalah peningkatan indeks dua poin dengan tarif yang hanya sebagian kecil, diluncurkan minggu ini, dengan satu jalur penyajian di belakangnya. Pertanyaan yang layak dijawab bukanlah mana yang lebih baik secara abstrak, melainkan berapa banyak trafik Grok Anda yang dapat ditangani model Xiaomi pada prompt Anda sendiri — dan menjawabnya dengan membuka kontrak kedua, kunci kedua, dan hubungan penagihan kedua adalah gesekan yang membuat pengujian itu tidak terjadi. Dengan satu endpoint dan failover otomatis lintas penyedia, perbandingannya hanyalah perubahan konfigurasi, dan bagian failover lebih penting dari biasanya di sini: model yang dirilis minggu ini dan dicatat oleh satu penyedia API saat Artificial Analysis menangkapnya bukanlah sesuatu untuk dimasukkan ke jalur produksi tanpa jalur cadangan.

Yang mana yang harus dipilih
Pilih Grok 4.6 ketika efisiensi giliran adalah hal yang Anda optimalkan — loop agen panjang di mana kemampuan model untuk selesai dalam separuh langkah lebih bernilai daripada tarif per tokennya — atau ketika Anda menginginkan model yang didukung pengukuran independen selama berbulan-bulan, bukan seminggu. Kecepatannya 63 token per detik dan waktu ke token pertama 42,79 detik menjadikannya model untuk beban kerja batch dan offline dalam hal interaktif, dan konteks 500K dengan jurang harga 200K mendukung agar prompt tetap pendek.
Pilih MiMo-V2.6-Pro saat Anda menjalankan loop berulang yang berat konteks yang akan melewati jurang 200K Grok, saat Anda memerlukan latensi token pertama yang cukup rendah agar manusia bersedia menunggu, saat Anda menginginkan bobotnya berada di infrastruktur Anda sendiri, atau saat volume membuat selisih tarif campuran 7,5x menjadi angka penentu. Keunggulan indeks dua poinnya cukup kecil sehingga hal itu saja seharusnya tidak menjadi alasannya; biaya $206,66 dibandingkan $2.351,83 untuk menjalankan rangkaian evaluasi yang sama adalah alasan yang lebih baik.
Yang akan menyelesaikan pertanyaan terbuka ini adalah konfigurasi DeepSWE yang diajukan untuk MiMo-V2.6-Pro. Grok 4.6 sudah memilikinya. Begitu model Xiaomi muncul di papan peringkat publik dengan harness yang dicantumkan, interval kepercayaan, dan biaya per tugas, 72.57 tidak lagi menjadi angka vendor dan perbandingan di atas menjadi perbandingan yang sesungguhnya — dan mengingat selisih dua poin pada indeks, bisa saja salah satu dari keduanya yang lebih unggul.
OrcaRouter menempatkan 200+ model di balik satu endpoint yang kompatibel dengan OpenAI pada harga daftar penyedia dengan markup 0%, sehingga perubahan harga vendor langsung berlaku pada hari yang sama.
Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
