
MiMo-V2.6-Flash vs Qwen3.8-Max: Unduhan Melawan Meteran, dan Hanya Salah Satunya yang Memiliki Skor
Satu angka menentukan bagaimana perbandingan ini biasanya ditulis, dan itu bukan tolok ukur. Qwen3.8-Max adalah model yang dihosting dan diukur secara terus-menerus oleh Artificial Analysis, sehingga model ini memiliki Intelligence Index saat ini sebesar 45 pada skala v4.3 yang dikalibrasi ulang, kecepatan keluaran 39,2 token per detik, dan harga daftar $2,00 per juta token masukan serta $6,00 per juta token keluaran. MiMo-V2.6-Flash, yang diterbitkan Xiaomi sebagai bobot yang dapat diunduh pada 21 September 2026, tidak memiliki satu pun dari hal-hal itu: tidak ada daftar tarif penyedia, tidak ada pengenal model yang telah diumumkan Xiaomi, dan sama sekali tidak ada halaman Artificial Analysis. Semua yang diterbitkan tentang kemampuan MiMo-V2.6-Flash berasal dari tabel evaluasi Xiaomi sendiri di kartu modelnya. Tidak satu pun angka telah dijalankan ulang oleh orang yang tidak bekerja untuk Xiaomi.
Asimetri itu bukanlah cela terhadap model. Itu adalah fakta tentang jenis pembelian masing-masing, dan itu mengubah apa yang sebenarnya dapat Anda simpulkan dari perbandingan langsung. Sisa tulisan ini membahas tiga hal yang benar-benar dapat Anda bandingkan — bentuk klaim, biaya satu token, dan lisensi — plus satu angka yang nyata, diukur secara independen, dan bukan milik salah satu pun dari kedua model dalam judul utama.
Pertama, Qwen 3.8 yang mana, dan MiMo yang mana
Kedua nama dalam judul berita itu adalah keluarga yang berpura-pura menjadi pos pemeriksaan, dan penggantiannya bukan tanpa bahaya.
• Qwen3.8-Max — unggulan yang dihosting Alibaba, diperkenalkan pada 3 Agustus 2026. Model sparse mixture-of-experts dengan 2,4 triliun parameter dengan sekitar 95 miliar parameter aktif per token, konteks 1 juta token, serta input teks, gambar, dan video. Inilah model yang diperlakukan sebagai lawan di sisa artikel ini.
• Qwen3.8-Max (0902) — snapshot bertanggal 2 September dari model yang sama, disajikan sebagai entri tersendiri dengan harga $2.00 dan $6.00 yang sama serta batas keluaran 131.072 token. Halaman Artificial Analysis saat ini adalah untuk build ini, yang penting saat Anda mengutip skor indeks.
• Qwen3.8-2.4T-A95B — checkpoint berbobot terbuka dari inti yang sama, dapat diunduh sejak 12 Agustus 2026 di bawah Lisensi Qwen3.8-Max. Model ini hanya teks, thinking selalu aktif, dan konteks aslinya 262K, bukan satu juta. Ini bukan model yang ada di judul utama.
• MiMo-V2.6-Flash — checkpoint sparse mixture-of-experts milik Xiaomi dengan total 309B dan 15B aktif, tersedia tanpa pembatasan di Hugging Face di bawah lisensi MIT, omnimodal native, dengan klaim konteks 1 juta token. Ini adalah anggota efisiensi dari rilis dua checkpoint yang produk unggulannya adalah MiMo-V2.6-Pro dengan total 1,02T dan 42B aktif.
• MiMo-V2-Flash — model Desember 2025. Total 309B yang sama, 15B aktif yang sama, jendela geser 128 token yang sama. Proses pelatihan berbeda, tabel tolok ukur berbeda, dan konteks 256K. Halaman mana pun yang memeringkat "MiMo-V2-Flash" terhadap model Qwen sedang membandingkan generasi yang salah, dan lembar spesifikasi saja tidak akan memberi tahu Anda hal itu.
Tabrakan MiMo adalah yang lebih tajam dari kedua jebakan itu, karena angka-angka yang mengidentifikasi model tersebut juga kebetulan merupakan angka-angka yang identik antara checkpoint 2025 dan 2026. Tabrakan Qwen lebih ringan tetapi ada harga yang melekat: bobot 2.4T terbuka dan API yang dihosting adalah artefak yang berbeda dengan ketentuan yang berbeda, dan perbandingan yang menukar keduanya akan salah menilai kemampuan sekaligus lisensinya.
Indeks telah dibangun ulang, dan nomor yang masih dicetak oleh sebagian besar halaman sudah hilang.
Berikut adalah mode kegagalan yang perlu diwaspadai sebelum skor apa pun muncul.
Artificial Analysis mengkalibrasi ulang Intelligence Index-nya ke v4.3 pada 7 September 2026. Skor dari sebelum tanggal tersebut tidak dapat dibandingkan dengan skor sesudahnya, dan halaman Qwen3.8-Max yang aktif menampilkan Diperbarui sebagai lencana yang menandai hasil yang disajikan ulang. Angka 58 yang beredar luas untuk Qwen3.8-Max termasuk dalam skala lama. Qwen3.8-Max (0902) saat ini menunjukkan 45, berada di peringkat ke-19 dari 202 model yang Artificial Analysis tempatkan dalam kelas tersebut.
Ini bukan sekadar ketelitian yang berlebihan. Angka 58 di samping 46 terbaca sebagai selisih dua belas poin. Dua model yang sama pada skala terkini yang sama hanya terpaut satu poin — dan angka 46 itu bahkan bukan model yang menjadi topik artikel ini:
• Qwen3.8-Max (0902), diukur secara independen — Intelligence Index 45 pada v4.3. Kecepatan keluaran 39,2 token per detik, menduduki peringkat ke-151 dari 202, yang halaman itu sendiri catat sebagai lambat. Biaya per tugas Intelligence Index $5,41. Token keluaran yang dihasilkan untuk menyelesaikan indeks: 190M.
• MiMo-V2.6-Pro, diukur secara independen — Intelligence Index 46, menduduki peringkat pertama dari 114 model di kelas open-weight. Kecepatan output 134,3 token per detik. Biaya per tugas Intelligence Index $0,13. Token output untuk menyelesaikan indeks: 140M.
• MiMo-V2.6-Flash, subjek sebenarnya — tidak ada halaman Artificial Analysis. Tidak ada yang bisa dikutip.
Baca ketiganya bersama-sama dan ringkasan jujurnya membuat kedua vendor tidak nyaman. Titik perbandingan yang semua orang inginkan — Flash melawan Qwen3.8-Max pada skala netral — tidak ada dan tidak dapat disusun dari tabel vendor, karena kedua vendor menjalankan perangkat uji yang berbeda pada checkpoint yang berbeda pada waktu yang berbeda lalu membandingkan diri mereka dengan model perusahaan lain yang juga mereka jalankan. Yang ada adalah selisih satu poin antara Qwen flagship dan checkpoint milik Xiaomi lebih besar, dengan biaya per tugas indeks sekitar satu per empat puluh. Itulah angka nyata paling menarik dalam pertandingan ini, dan itu tentang model yang tidak disebut oleh kedua belah pihak dalam judul berita.

Apa yang akan dan tidak akan diberitahukan oleh tabel vendor kepada Anda
Kedua vendor mempublikasikan angka. Angka-angka itu bukan jenis angka yang sama, dan menjejerkannya kolom demi kolom menghasilkan sebuah bagan, bukan sebuah temuan — tetapi bentuk klaimnya tetap layak dibaca, karena itu memberi tahu Anda hal apa yang dioptimalkan oleh masing-masing lab.
• Agen kode — Xiaomi melaporkan MiMo-V2.6-Flash pada DeepSWE v1.1 67.9, Terminal Bench 2.1 87.6, ProgramBench 26.0 dan MiMo Code Bench 61.2. Alibaba melaporkan Qwen3.8-Max pada SWE-bench Pro 67.7 dan Terminal-Bench 2.1 86.6. Angka Terminal-Bench cukup berdekatan sehingga harness, bukan model, yang secara masuk akal menentukan urutannya.
• Agen umum — Xiaomi melaporkan AutomationBench v1.0.6 52,3, Toolathlon-Verified 73,6, OSWorld-Verified 80,8 dan Agents' Last Exam 27,6 untuk Flash. Alibaba melaporkan OSWorld-Verified 86,1, WideSearch 81,9 dan Agent's Last Exam 52,4 untuk Qwen3.8-Max. Pada dua benchmark yang dijalankan kedua laboratorium, angka yang dilaporkan Qwen lebih unggul — pada harness milik Alibaba sendiri.
• Pengetahuan dan keamanan — Xiaomi menjalankan CyberGym (Flash 95,1), MiMo Cyber Bench (77,2), ExploitGym (6,0), ExploitBench (25,3) dan SEC Bench Pro (47,5). Alibaba menjalankan GPQA Diamond (92,6), Humanity's Last Exam (43,6) dan PaperBench (93,0). Hampir tidak ada tumpang tindih, jadi hampir tidak ada yang bisa dibandingkan.
Satu-satunya hal yang benar-benar berguna yang dapat ditunjukkan oleh tabel vendor adalah inkonsistensi internal, dan tabel Xiaomi punya satu. Dasbor RL publiknya, yang menyiarkan proses pelatihan sepanjang September, menerbitkan MiMo-V2.6-Flash pada 65.68 di DeepSWE v1.1 menggunakan harness mini-swe-agent dengan rata-rata dari tiga. Kartu model final mencetak 67.9 untuk bobot yang dirilis. Keduanya menggambarkan, secara berturut-turut, snapshot pelatihan dan artefak yang dirilis, dan selisih dua poin itu sama besarnya dengan jarak antara dua checkpoint Xiaomi. Jika Anda telah mengutip angka dasbor sejak minggu lalu, itu sudah usang.
Tagihan tersebut, yang merupakan titik di mana kedua model itu tidak lagi dapat dibandingkan.
Ini adalah bagian yang menentukan deployment, dan ini bukan pertarungan yang ketat.
• Qwen3.8-Max dikenakan tarif berdasarkan pemakaian. $2,00 per juta token masukan dan $6,00 per juta token keluaran pada daftar tarif internasional Alibaba, dengan diskon cache yang diukur Artificial Analysis sebesar 88% dan biaya $5,41 per tugas Intelligence Index. Dokumentasi wilayah Tiongkok Alibaba mencantumkan CNY 12 dan CNY 36 per juta untuk pasangan yang sama. Anda dapat memanggilnya sore ini dan langsung mendapatkan tagihan.
MiMo-V2.6-Flash adalah sebuah unduhan. Xiaomi tidak memublikasikan tarif per token untuk generasi MiMo-V2.6 di situsnya sendiri dan tidak mengumumkan pengenal yang dapat dipanggil untuk kedua checkpoint, jadi tidak ada yang bisa diukur. Yang ada sebagai gantinya adalah 172,9 GB data bobot FP8 yang tersebar di 65 shard, sebelum memperhitungkan KV cache untuk konteks 1 juta token, dan bagian deployment yang merekomendasikan SGLang pada paralel tensor 16 dengan faktor paralel data 2, atau resep vLLM pada paralel tensor 8 — sebuah pekerjaan penyajian multi-node.
• Daftar pihak ketiga bukanlah kartu tarif. Halaman katalog memang memuat angka untuk seri MiMo-V2.6, dan Artificial Analysis mencatat satu penyedia API yang melayani MiMo-V2.6-Pro dengan tarif $0.435 dan $0.87 per juta. Itu adalah daftar penyedia untuk checkpoint yang lebih besar, bukan harga Xiaomi, dan untuk Flash sama sekali tidak ada.
Jadi aritmetikanya adalah pos biaya terukur terhadap keputusan modal. Pada beberapa ratus juta token per bulan, Qwen3.8-Max adalah tagihan yang bisa Anda perkirakan dan Flash adalah node yang akan Anda beli untuk melayani model yang belum pernah diukur oleh siapa pun di luar Xiaomi. Pada miliaran token per bulan, jalur terbuka mulai menang dari segi biaya, dan inilah titik ketika lisensi berhenti menjadi catatan kaki hukum dan menjadi masukan pengadaan.
Lisensi-lisensi tersebut bukan izin yang sama
MIT kira-kira adalah lisensi yang sepermisif mungkin untuk bobot terbuka. Lisensi Qwen3.8-Max bukan MIT, dan perbedaannya berdampak nyata.
MiMo-V2.6-Flash dirilis di bawah lisensi MIT tanpa ambang batas pendapatan, tanpa pemicu jumlah pengguna, tanpa perjanjian komersial terpisah, dan tanpa klausul penelitian. Penerapan komersial, modifikasi, distribusi ulang, dan pelatihan lanjutan semuanya diizinkan, dan repositorinya tidak dibatasi.
Lisensi Qwen3.8-Max memberikan hak penggunaan, modifikasi, distribusi, sublisensi, penjualan, penerapan, hosting, dan fine-tuning, dengan dua syarat. Produk atau layanan yang melebihi 100 juta pengguna aktif bulanan atau US$20 juta pendapatan bulanan harus menampilkan nama model secara mencolok di antarmukanya. Dan bisnis model-as-a-service atau asisten kerja AI dengan pendapatan agregat di atas US$50 juta selama dua belas bulan berturut-turut mana pun memerlukan lisensi terpisah dari Alibaba sebelum penggunaan komersial. Penggunaan internal dikecualikan, asalkan model atau kemampuannya tidak diungkapkan kepada pihak ketiga.
Bagi sebagian besar tim, tidak ada satu pun dari kedua kondisi itu yang mengikat. Bagi bisnis platform yang berhasil, salah satunya mengikat — dan ia mengikat tepat pada saat model tersebut telah menjadi penopang utama. Perhatikan juga bahwa kondisi-kondisi itu melekat pada bobot 2.4T yang dapat diunduh, bukan pada API yang dihosting, tempat ketentuan penyedia yang berlaku sebagai gantinya. Kedua jalur memiliki kewajiban yang berbeda, yang merupakan alasan tambahan untuk tidak membandingkan checkpoint terbuka dengan yang dihosting seolah-olah keduanya adalah produk yang sama.
Di mana OrcaRouter cocok, dan di mana tidak
Qwen3.8-Max dapat dirutekan di OrcaRouter, baik pada entri dasar maupun snapshot bertanggal 0902, melalui satu API key dengan harga daftar penyedia dengan markup 0% yang diteruskan. Hal ini penting secara khusus di sini karena dua alasan. Pertama, build 0902 merupakan entri terpisah dan bukan penggantian senyap, sehingga DSL routing dapat memakukan lalu lintas yang sensitif terhadap reproduktibilitas ke snapshot bertanggal tersebut sementara semua hal lainnya mengikuti tier dasar — tanpa integrasi kedua, tanpa perubahan kode. Kedua, karena harga daftar diteruskan alih-alih ditandai naik, perubahan pada kartu tarif Alibaba langsung berlaku di sisi Anda pada hari yang sama alih-alih pada perpanjangan kontrak berikutnya, dan inilah yang menjaga aritmetika meteran-versus-node di atas tetap jujur saat harga bergerak. Beban kerja yang berat cache juga tetap memperoleh diskon cache penyedia alih-alih kehilangan sebagiannya untuk margin reseller.

MiMo-V2.6-Flash tidak dapat dirutekan di mana pun, termasuk milik kami. Kami tidak merutekan model Xiaomi apa pun, dan baris ketersediaan di kartu Xiaomi sendiri menunjuk ke saluran Xiaomi sendiri: platform MiMo API, AI Studio, MiMo Code, dan aplikasi desktop. Jika Anda menginginkan checkpoint ini, Anda akan mengunduh 172,9 GB dan mencari node.

Yang mana, dan kapan
Ambil Qwen3.8-Max jika Anda menginginkan kapabilitas tanpa perangkat keras, jika volume Anda tidak pasti, atau jika Anda ingin opsi angka independen sebelum berkomitmen. Terimalah bahwa 45 pada indeks saat ini adalah posisi tengah-frontier, bukan posisi puncak; bahwa 39,2 token per detik cukup lambat untuk berdampak di dalam loop agen; dan bahwa 190 juta token output untuk menyelesaikan Intelligence Index kira-kira dua kali median — verbositas memakan biaya pada sisi meter yang dihargai berdasarkan output.
Ambil MiMo-V2.6-Flash jika kendalanya adalah lisensi, jalur data, atau tagihan jangka panjang yang bisa diamortisasi — dan jika Anda punya node. Ketentuan MIT tanpa gerbang pendapatan benar-benar merupakan izin yang berbeda dari lisensi dengan ambang MAU dan pemicu bagi hasil, dan bagi perusahaan yang memperkirakan akan menjadi besar, itulah alasan memilihnya. Anggarkan untuk penyajian multi-node, ukur dari data bobot yang dipublikasikan alih-alih dari halaman repositori, dan anggap setiap angka di kartu Xiaomi sebagai laporan vendor sampai seseorang di luar lab menjalankannya ulang.
Dan jika Anda memilih hari ini alih-alih kuartal berikutnya, jalankan opsi berbayar sesuai pemakaian terlebih dahulu. Sebulan dengan Qwen3.8-Max memberi tahu Anda apa yang sebenarnya dibutuhkan beban kerja Anda. Sebuah node hanya memberi tahu Anda apa yang Anda harapkan.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
