
MiMo-V2.6-Pro vs Qwen3.8-Max: Satu Poin Indeks, Harga Enam Kali Lipat
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen3.8-Max adalah model 2,4 triliun parameter yang mengaktifkan 95 miliar di antaranya per token dan berjalan pada satu penyedia. Xiaomi MiMo-V2.6-Pro adalah model 1,02 triliun parameter yang mengaktifkan 42 miliar per token, mencetak satu poin lebih tinggi pada indeks independen yang sama, dan biaya pemanggilannya sekitar seperenamnya. Fakta-fakta itu terasa janggal jika disandingkan, dan cara Anda menyikapinya adalah inti dari keputusan antara keduanya. Versi singkatnya: pada Artificial Analysis Intelligence Index v4.3.2, Xiaomi MiMo-V2.6-Pro mencetak 46 dan Qwen3.8-Max mencetak 45 — seri di dalam batas noise — sementara daftar harganya menunjukkan $0,43 dan $0,87 per juta token, dibandingkan $2,00 dan $6,00.
Apa sebenarnya setiap model itu
Qwen3.8-Max adalah model unggulan Alibaba, tersedia secara umum sejak 3 Agustus 2026, dan merupakan model terbesar yang pernah dirilis lini Qwen saat itu. Model ini adalah sparse mixture-of-experts yang dibangun di atas arsitektur Qwen 3.5 dengan total 2,4 triliun parameter dan sekitar 95 miliar parameter aktif per token, jendela konteks 1 juta token, hingga 131.000 token keluaran, serta input multimodal yang mencakup teks, gambar, dan video. Alibaba memangkas tarif internasional menjadi $2,00 per juta token input dan $6,00 per juta token output, dengan input yang di-cache sebesar $0,25, dan mempromosikannya sebagai sekitar 40% dari harga input Claude Opus 5. Pembaruan minor, Qwen3.8-Max-0902, menyusul pada 2 September 2026 dan itulah yang saat ini dijadikan tolok ukur oleh Artificial Analysis pada angka 45.
Xiaomi MiMo-V2.6-Pro mencapai ketersediaan umum pada 22 September 2026, tiga hari sebelum perbandingan ini ditulis, dengan repositori checkpoint pembelajaran penguatan yang muncul sehari sebelumnya. Ini adalah sparse mixture-of-experts dengan total 1,02 triliun parameter dan 42 miliar parameter aktif per token, dengan jendela konteks 1 juta token yang sama, multimodalitas native di seluruh teks, gambar, video, dan audio, serta bobot yang diterbitkan di bawah lisensi MIT. Xiaomi mempertahankan harga generasi sebelumnya alih-alih menaikkan harga checkpoint baru, itulah sebabnya harganya tercantum pada $0,43 dan $0,87 dengan diskon cache 99% dan harga campuran $0,18.
• Komputasi aktif per token — Qwen3.8-Max 95B; Xiaomi MiMo-V2.6-Pro 42B, kurang dari setengah
• Total parameter — Qwen3.8-Max 2,4T; Xiaomi MiMo-V2.6-Pro 1,02T
• Skor indeks — Xiaomi MiMo-V2.6-Pro 46; Qwen3.8-Max 45, keduanya pada Artificial Analysis v4.3.2
• Kecepatan keluaran — Xiaomi MiMo-V2.6-Pro 134,3 token/detik; Qwen3.8-Max 39,2, dibandingkan dengan median tingkat 72,5
• Waktu hingga token pertama — Xiaomi MiMo-V2.6-Pro 2,15 detik; Qwen3.8-Max 2,93
• Harga daftar — Xiaomi MiMo-V2.6-Pro $0,43 / $0,87 per 1 juta; Qwen3.8-Max $2,00 / $6,00
• Tarif campuran — Xiaomi MiMo-V2.6-Pro $0.18 per 1 juta pada rasio 7:2:1 cache-hit/input/output; Qwen3.8-Max $1.18
• Bobot — Xiaomi MiMo-V2.6-Pro berlisensi MIT dan dapat diunduh; Qwen3.8-Max disediakan sebagai endpoint proprietary, dengan rilis open-weight hanya teks yang menghilangkan konteks 1M dan input visi
• Keterjangkauan — satu penyedia API dihitung untuk masing-masing di Artificial Analysis
Skornya seri. Kecepatannya tidak.
Satu poin pada komposit sepuluh evaluasi bukanlah perbedaan yang perlu ditindaklanjuti oleh siapa pun, dan sinyal yang lebih berguna adalah apa yang terjadi di baliknya. Model dengan parameter aktif per token kurang dari setengahnya memperoleh skor sedikit lebih tinggi dan menghasilkan output tiga setengah kali lebih cepat — 134,3 token per detik berbanding 39,2, sedangkan median untuk model penalaran yang sebanding adalah 72,5. Qwen3.8-Max adalah yang paling lambat di antara model kelas terdepan yang diukur pada halaman itu, dan itu adalah konsekuensi desain dari mengaktifkan 95 miliar parameter per token, bukan insiden dalam serving.
Latensi menceritakan kisah yang berlawanan dari yang disarankan oleh jumlah parameter. Qwen3.8-Max mencapai token pertamanya dalam 2,93 detik dibandingkan 2,15 detik milik Xiaomi, dan selisihnya jauh lebih kecil daripada selisih throughput — Qwen3.8-Max lambat setelah mulai menulis, bukan lambat untuk memulai. Untuk antarmuka obrolan yang jawabannya singkat, perbedaan itu nyaris tidak terlihat. Untuk loop agen yang menghasilkan puluhan ribu token keluaran, throughput adalah keseluruhan waktu aktualnya, dan selisih 3,4× akan terakumulasi di setiap giliran proses tersebut.

Ketika tabel vendor tidak konsisten, dan mengapa itu bukan kontradiksi
Alibaba menerbitkan tabel yang luas untuk Qwen3.8-Max dan model itu benar-benar kuat: Terminal-Bench 2.1 sebesar 86.6, SWE-bench Pro 67.7, PaperBench 93.0, GPQA Diamond 92.6, IFBench 82.8, OSWorld-Verified 86.1, dan Humanity's Last Exam 43.6. Itu adalah angka yang dijalankan vendor pada harness milik Alibaba sendiri dan sebagian di antaranya pada benchmark milik Alibaba sendiri, jadi itu klaim, bukan pengukuran — tetapi itu klaim pada benchmark yang banyak digunakan, yang membuatnya lebih dapat dibandingkan antarlab daripada hasil harness yang dibuat khusus.
Angka utama Xiaomi adalah 72,57 pada DeepSWE v1.1, naik dari baseline 58,4, diukur dengan mini-swe-agent sebagai rata-rata dari tiga kali pengujian pada penilai milik Xiaomi sendiri, selama proses reinforcement learning yang didokumentasikan Xiaomi sebagai tiga puluh langkah dan sekitar 750.000 trajektori dengan pengeluaran yang dipublikasikan sekitar $2,62 juta. Angka itu belum diserahkan ke papan peringkat publik DeepSWE dan belum ada pihak ketiga yang mereproduksinya. Membandingkan 72,57 dengan 67,7 SWE-bench Pro milik Qwen dan menyatakan Xiaomi menang lima poin berarti membaca lintas dua benchmark yang berbeda, dua harness yang berbeda, dan dua konvensi penilaian yang berbeda. Ada tepat satu tolok ukur yang menjadi acuan pengujian kedua model oleh pihak selain pembuatnya, dan hasilnya adalah 46 berbanding 45.
Dua dari angka Qwen3.8-Max yang lebih berdampak sebenarnya bukan skor sama sekali. Alibaba mengumumkan bahwa bobot akan di-open-source-kan bersama Qwen3.8-27B, dan checkpoint yang akhirnya dirilis hanya bersifat teks dan tidak membawa konteks 1M token penuh atau input vision yang dimiliki endpoint Max yang dilayani. Jadi "Qwen3.8-Max adalah bobot terbuka" dan "Qwen3.8-Max adalah endpoint multimodal dengan konteks 1M" keduanya adalah pernyataan benar tentang artefak yang berbeda, dan rencana penerapan yang dibangun di atas yang pertama sambil mengharapkan yang kedua tidak akan bertahan saat bersentuhan dengan kenyataan. Sementara itu, rilis poin 0902 memindahkan model ke puncak salah satu arena pengembangan web publik tanpa perubahan nomor versi — sebuah pengingat bahwa model yang Anda benchmark pada Agustus belum tentu merupakan model yang melayani permintaan Anda pada September.
Apakah bobot terbuka berarti Anda dapat menghosting sendiri salah satu dari keduanya?
Untuk Xiaomi MiMo-V2.6-Pro, secara prinsip ya: lisensi MIT, tidak perlu perjanjian komersial. Dalam praktiknya, checkpoint 1,02T parameter dengan 42B aktif membutuhkan klaster serving multi-node, yang merupakan tingkat komitmen berbeda dibandingkan memanggil API. Mempublikasikan bobot membuat self-hosting legal, bukan murah.
Untuk Qwen3.8-Max, jawabannya lebih terbatas daripada yang disiratkan reputasinya. Rilis terbukanya hanya untuk teks dan tanpa jendela konteks penuh, jadi melakukan self-hosting atasnya memberi Anda model yang jauh lebih kecil daripada model yang digunakan untuk mengukur 45. Jika yang Anda inginkan adalah konfigurasi yang diuji benchmark, endpoint yang dilayankan adalah produknya, dan endpoint itu bersifat proprietary.
Memanggil salah satu dari keduanya, dan aritmetika yang memutuskannya
Kedua model dihitung pada satu penyedia API oleh Artificial Analysis, yang tidak biasa untuk dua model unggulan dan menjadikan failover sebagai pertanyaan praktis, bukan sekadar pelengkap. Qwen3.8-Max tersedia di OrcaRouter sebagai qwen/qwen3.8-max — satu endpoint yang kompatibel dengan OpenAI pada harga daftar Alibaba sendiri dengan markup 0%, sehingga $2.00 dan $6.00 di atas diteruskan tanpa perubahan dan perubahan harga di sisi Alibaba langsung berlaku di sisi kami pada hari yang sama. Pengukuran kami sendiri menempatkan p50 endpoint ini di sekitar 3,3 detik, dan itulah angka yang perlu dijadikan acuan perencanaan alih-alih skenario terbaik teoretis, dan rantai fallback berarti permintaan yang macet akan dicoba ulang ke upstream lain sebelum respons dimulai. Xiaomi MiMo-V2.6-Pro tidak ada di OrcaRouter; tidak ada model Xiaomi yang ada di sana, dan jalur ke model ini saat ini adalah platform Xiaomi sendiri serta katalog pihak ketiga yang mencantumkannya.
Aritmetika biaya adalah tempat pertarungan ini sebenarnya ditentukan, dan itu bukan aritmetika yang disiratkan oleh tarif utamanya. Pada komposisi cache-hit/input/output 7:2:1, tarif campurannya adalah $0,18 dan $1,18 per juta — selisih 6,6×, lebih lebar daripada selisih input 4,6× dan output 6,9×, karena diskon cache Xiaomi sebesar 99% lebih dalam daripada 88% milik Alibaba. Artificial Analysis juga mencatat biaya $0,13 per tugas Intelligence Index untuk Xiaomi MiMo-V2.6-Pro, yang diukur secara identik pada setiap model di papan peringkat. Jalankan beban kerja yang sama melalui keduanya dan model yang lebih murah justru model yang mencetak skor lebih tinggi, sebuah hal yang tidak biasa untuk dapat ditulis dan alasan perbandingan ini bukan sekadar formalitas.

Siapa yang harus beralih, dan siapa yang tidak
Jika Anda menggunakan Qwen3.8-Max saat ini dan itu berfungsi, tidak ada argumen mendesak untuk berpindah. Celah indeks hanyalah satu poin, perilaku visi dan konteks panjang sudah terbukti dalam beban kerja Anda, dan Alibaba masih mengembangkan lini ini — pembaruan 0902 menunjukkan hal itu. Argumen untuk berpindah adalah throughput dan biaya campuran, dan itu menjadi argumen yang kuat hanya jika lalu lintas Anda berat pada output atau berhorizon panjang: agen, pembuatan kode, apa pun yang menulis jauh lebih banyak daripada membacanya.
Jika Anda memulai dari awal, urutan ini sulit dibantah berdasarkan bukti yang dipublikasikan. Model Xiaomi lebih cepat, lebih murah di setiap sumbu, berlisensi MIT, dan sedikit lebih unggul pada satu-satunya komposit yang dijalankan secara independen yang mencakup keduanya. Faktor penyeimbangnya nyata dan spesifik: riwayat produksi tiga hari, satu rute penyajian, dan tidak ada entri benchmark publik untuk diperiksa. Kombinasi itu mendukung untuk mengevaluasinya di jalur di samping solusi yang sudah ada alih-alih menggantikannya — itulah gunanya konfigurasi perutean, dan mengapa langkah yang berguna adalah menempatkan kandidat dan solusi yang sudah ada di balik satu kunci alih-alih memilih pemenang dari papan skor.

Apa yang akan mengubah jawaban ini
Tiga hal. Penyedia kedua dan ketiga untuk Xiaomi MiMo-V2.6-Pro akan menghilangkan satu-satunya keberatan struktural terhadapnya dan mengubah selisih harga menjadi keputusan yang nyata, bukan sekadar yang menggoda. Menjalankan konfigurasi DeepSWE secara independen akan mengonfirmasi 72,57 atau menggugurkannya, dan hasil mana pun lebih bernilai daripada angka itu sendiri. Dan rincian per evaluasi pada v4.3.2 akan menunjukkan evaluasi mana dari sepuluh evaluasi yang dimenangkan tiap model — skor komposit tetaplah komposit, dan model yang unggul dalam coding agentik serta model yang unggul dalam tanya jawab yang berat retrieval dapat mencatatkan skor indeks yang sama meskipun tidak cocok untuk pekerjaan satu sama lain.
