Kartu judul hero untuk artikel 'MiMo-V2.6-Pro-UltraSpeed vs MiMo-V2.6-Pro', diawali oleh kicker 'OrcaRouter · radar model — tier layanan', dengan subjudul 'Satu checkpoint 1T, dua cara membelinya: $0,435/$0,87 per juta token, atau $4,35/$8,70 untuk klaim kecepatan sepuluh kali lipat.' Di bawahnya dua kartu: kiri, 'Tier standar', bertuliskan '134,3 token keluaran/detik yang diukur oleh Artificial Analysis; konteks 1M; bobot MIT di Hugging Face'; kanan, 'Tier UltraSpeed', bertuliskan '$4,35 masuk / $8,70 keluar per 1M; checkpoint sama, klaim kualitas sama; hanya hosted'. Empat chip bertuliskan 'Indeks AA: 46', 'Total parameter: 1,0T', 'Parameter aktif: 42B', dan 'DeepSWE: 72,57 dilaporkan vendor'. Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

Xiaomi MiMo-V2.6-Pro-UltraSpeed vs Xiaomi MiMo-V2.6: Satu Checkpoint, Harga Sepuluh Kali Lipat

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Xiaomi MiMo-V2.6-Pro-UltraSpeed dan Xiaomi MiMo-V2.6-Pro bukanlah dua model. Keduanya adalah satu model yang dijual dengan dua cara. Keduanya dilayani dari checkpoint MiMo-V2.6 yang sama dengan satu triliun parameter yang diterbitkan Xiaomi pada September 2026 — tier Pro dari seri Xiaomi MiMo-V2.6, yang saudara kecilnya adalah Xiaomi MiMo-V2.6-Flash. Perbedaan antara kedua penawaran Pro itu sepenuhnya terletak pada seberapa cepat token keluar dan berapa biaya yang Anda bayarkan untuknya. Tier standar meminta $0.435 per juta token masukan dan $0.87 per juta token keluaran. Tier UltraSpeed meminta $4.35 dan $8.70. Itu adalah sepuluh banding satu yang bersih di kedua sisi meteran, dan itu memberi klaim kecepatan keluaran sekitar sepuluh kali lipat — klaim yang dibuat Xiaomi tentang stack pelayanannya sendiri, dan yang belum ada benchmark independen yang menerbitkan angkanya.

Jadi, pertanyaan yang menarik bukanlah model mana yang lebih baik. Pertanyaannya adalah apakah kelipatan sepuluh kali merupakan harga yang tepat untuk kecepatan sepuluh kali lipat, dan ternyata itu memiliki preseden yang layak dibaca sebelum Anda mengikatkan jalur produksi padanya.

Tier cepat adalah keputusan penyajian, bukan keputusan model

Cara Xiaomi sendiri membingkai lini UltraSpeed adalah bahwa kualitasnya setara dengan model standar dan hanya berbeda dalam throughput. Itu lebih penting daripada kedengarannya, karena menghapus alasan biasa untuk ragu terhadap tier baru. Anda tidak bertaruh pada kepribadian checkpoint yang berbeda, perilaku penolakannya, atau keanehan pemformatannya. Anda bertaruh bahwa bobot yang sama, yang dijalankan melalui konfigurasi serving yang lebih agresif, akan berperilaku sama terhadap prompt Anda. Jika itu berlaku, beralih di antara kedua tier adalah perubahan konfigurasi, bukan migrasi.

Apa yang ada di dalam konfigurasi serving tersebut belum didokumentasikan untuk generasi ini. Tier UltraSpeed sebelumnya, yang dibangun di atas checkpoint MiMo-V2.5-Pro pada Juni 2026, dijelaskan oleh Xiaomi sebagai menggunakan kuantisasi FP4 hanya pada lapisan expert, skema decoding spekulatif paralel-blok yang disebut DFlash, dan runtime bernama TileRT, dan berjalan pada satu node delapan-GPU. Xiaomi belum menerbitkan detail yang setara untuk tier V2.6. Perlakukan stack sebelumnya sebagai konteks tentang bagaimana kecepatan itu diperoleh, bukan sebagai deskripsi tentang apa yang berjalan sekarang.

Jajaran tempatnya berada ini singkat. Di samping dua tier Pro ada MiMo-V2.6-Flash, saudara yang lebih kecil dengan total 309 miliar parameter dan 15 miliar aktif. Pro adalah andalan sparse mixture-of-experts: Artificial Analysis mencantumkannya pada 1,0 triliun total parameter dengan 42 miliar aktif per token, jendela konteks 1 juta token, dan lisensi MIT dengan bobot di Hugging Face. Itu angka-angka yang perlu dipegang, karena seluruh perbandingan bertumpu padanya.

Apa yang sebenarnya diverifikasi, dan apa yang tidak

A two-column scoreboard titled 'MiMo-V2.6-Pro-UltraSpeed vs MiMo-V2.6-Pro — the scoreboard'. The left column, badged VENDOR-REPORTED, is headed 'MiMo-V2.6-Pro-UltraSpeed' and reads: Output speed — about 10x the standard tier, Xiaomi's claim; Price in — $4.35 per 1M tokens; Price out — $8.70 per 1M tokens; Context — 1M tokens; Weights — hosted only, none published; Independent speed test — none published. The right column, badged INDEPENDENTLY MEASURED, is headed 'MiMo-V2.6-Pro' and reads: Output speed — 134.3 tokens/sec per Artificial Analysis; Price in — $0.435 per 1M tokens; Price out — $0.87 per 1M tokens; Context — 1M tokens; Weights — MIT, on Hugging Face; Independent speed test — Artificial Analysis, 114-model class. A footer reads 'UltraSpeed figures are Xiaomi's own serving claims with no independent verification. MiMo-V2.6-Pro figures per Artificial Analysis, read 2026-09-22.' The OrcaRouter logo is composited in the bottom-right corner.

Asimetri antara kedua kolom di atas adalah hal tunggal yang paling penting dalam artikel ini. Hampir segala sesuatu yang dapat diukur tentang pasangan ini telah diukur pada lambatsisi

Artificial Analysis telah melakukan benchmark terhadap MiMo-V2.6-Pro dan menerbitkan Intelligence Index sebesar 46 untuknya — skor tertinggi di kelas 114 model tempat model itu dikelompokkan. Artificial Analysis mengukur 134,3 token output per detik melalui API Xiaomi, dibandingkan dengan median kelas 77,9, dan waktu ke chunk pertama 2,15 detik dibandingkan median 2,34. Ini mencantumkan biaya per tugas Intelligence Index sebesar $0,13, diskon cache 99% pada harga input, dan verbositas output sebesar 140 juta token. Itu adalah angka independen pada konfigurasi bernama, dan itu adalah satu-satunya jangkar throughput yang kuat yang dimiliki perbandingan ini.

Untuk UltraSpeed, daftar terverifikasi jauh lebih pendek:

• Kecepatan output — sekitar sepuluh kali tier standar, dinyatakan oleh Xiaomi dan diulang oleh platform yang mencantumkannya. Tidak ada pihak ketiga yang menerbitkan pengukuran token per detik untuk tier spesifik ini.

• Harga — $4,35 per juta token masukan dan $8,70 per juta token keluaran, sepuluh kali lipat dari tingkat standar untuk keduanya. Tidak ada tingkat cache yang dicantumkan bersama kedua tarif tersebut.

• Kualitas — "sama dengan aslinya", lagi-lagi pernyataan vendor. Tidak ada evaluasi independen terhadap endpoint UltraSpeed yang telah dipublikasikan, jadi klaim bahwa kualitasnya tidak berubah adalah belum teruji, bukan terbantahkan.

• Konteks dan modalitas — 1.048.576 token dan input teks, gambar, video, serta audio native, yang diwarisi dari checkpoint dasar.

Ada juga tolok ukur vendor yang layak disebutkan secara spesifik karena cara penyebarannya. Dasbor pembelajaran penguatan publik Xiaomi, yang menyiarkan proses pasca-pelatihan V2.6 pada September 2026, melaporkan skor DeepSWE v1.1 sebesar 72,57 untuk proses Pro dan 65,68 untuk Flash. Skor tersebut berasal dari evaluasi offline Xiaomi sendiri menggunakan harness mini-swe-agent dengan rata-rata dari tiga, tidak pernah dikirimkan ke papan peringkat publik, dan belum direproduksi di luar laboratorium. Jika Anda pernah melihat 72,57 dikutip sebagai skor papan peringkat, itu adalah angka vendor yang memakai pakaian papan peringkat.

Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro captured September 22, 2026, headed 'MiMo-V2.6-Pro Intelligence, Performance & Price Analysis' with the labels 'Open weights model' and 'Released September 2026'. The metric strip reads Intelligence #1/114, Speed #11/114, Cost #12/114 and Verbosity #18/114. The cost panel reads $0.435 in and $0.87 out per million tokens, a 99% cache discount, and $0.13 per Intelligence Index task; the speed panel reads 134.3 output tokens per second, ranked eleventh of 114 against a median of 77.9, with a first-chunk time of 2.15 seconds; verbosity reads 140M output tokens. The comparison summary states the model scores 46 on the Artificial Analysis Intelligence Index against a class median of 18, is notably fast at 134 tokens per second against a median of 78, is somewhat verbose, supports text, image, speech and video input and outputs text, and has a 1M-token context window. Technical specifications list reasoning enabled, input modalities text and image, output text, a 1M context window, 1.0T total parameters, 42B active parameters, an MIT licence, and model weights on Hugging Face.

Presedennya: terakhir kali Xiaomi menagih tiga kali, bukan sepuluh.

Ini bukan tingkat kecepatan pertama Xiaomi, dan yang sebelumnya adalah perbandingan paling berguna di seluruh cerita — karena pengalinya berubah.

MiMo-V2.5-Pro-UltraSpeed hadir pada Juni 2026, dibangun di atas checkpoint V2.5-Pro, dan harganya sekitar tiga kali tarif output model standar. Promosi Xiaomi saat itu sama dengan promosi yang disampaikannya sekarang: sekitar sepuluh kali kecepatan output. Liputan saat itu melaporkan throughput berkelanjutan sekitar 1.000 token per detik dengan puncak mendekati 1.200, pada satu node delapan GPU, meskipun halaman model itu sendiri mencantumkan rentang yang lebih luas, 500 hingga 1.000 — dan tak satu pun dari itu diverifikasi secara independen. Aksesnya dibatasi di balik formulir pendaftaran, bukan pendaftaran terbuka.

Tempatkan keduanya berdampingan dan pergeseran itulah intinya. Kelipatan kecepatan tetap sekitar sepuluh. Kelipatan harga bergeser dari tiga menjadi sepuluh. Itu adalah kesepakatan yang sangat berbeda untuk jenis peningkatan yang sama, dan Xiaomi belum menerbitkan penjelasan atas perubahan itu. Hal itu bisa mencerminkan penyajian yang benar-benar lebih mahal — checkpoint yang lebih besar, konfigurasi dekode yang lebih agresif, atau kapasitas yang lebih ketat saat peluncuran. Hal itu bisa mencerminkan harga jendela peluncuran pada tingkat yang baru tersedia selama satu hari. Yang belum dimilikinya adalah pembenaran publik yang bisa Anda periksa.

Satu perbedaan praktis layak dicatat bagi siapa pun yang pernah menggunakan tier V2.5: tier itu adalah uji coba yang dibatasi. Tier V2.6 dicantumkan sebagai tersedia secara umum melalui API milik Xiaomi sendiri dan beberapa platform pihak ketiga, pada tarif yang dipublikasikan, tanpa langkah pendaftaran. Apa pun perubahan lainnya, hambatan untuk mencobanya menjadi lebih rendah.

Berapa biaya sepuluh kali lipat pada beban kerja nyata

Persentase menyembunyikan bentuk dari hal ini, jadi berikut adalah aritmetikanya pada sebuah eksekusi agen yang konkret — yang membaca 20 juta token masukan dan mengeluarkan 2 juta token keluaran sepanjang masa hidupnya. Itu adalah beban kerja agentik yang berat tetapi tidak eksotis, jenis di mana sebuah model melakukan perulangan atas panggilan alat dan membaca ulang konteksnya sendiri.

• Tier Standar, input — 20 juta token dengan $0,435 per juta: $8,70.

• Tingkat Standar, keluaran — 2 juta token dengan $0,87 per juta: $1,74.

• Tingkat standar, total — $10.44 per proses.

• Tingkat UltraSpeed, input — 20 juta token dengan $4,35 per juta: $87,00.

• Tingkat UltraSpeed, output — 2 juta token dengan harga $8,70 per juta: $17,40.

• Tingkat UltraSpeed, total — $104.40 per eksekusi.

Selisihnya adalah $93,96, dan itu persis sepuluh kali tagihan tersebut, bukan sepuluh kali satu barisnya, karena kedua tarifnya meningkat bersamaan. Sekarang sisi lain dari pembukuan. Pada 134,3 token keluaran per detik yang diukur Artificial Analysis untuk tier standar, menghasilkan 2 juta token keluaran memerlukan sedikit lebih dari empat jam waktu generasi murni. Pada sepuluh kali laju itu, diperlukan sekitar dua puluh lima menit. Jadi $94 ekstra itu mengembalikan sekitar tiga setengah jam waktu jam dinding pada proses ini — kira-kira $27 untuk setiap jam yang dihemat, jika Anda ingin mengatakannya begitu.

Apakah trade-off itu menguntungkan sepenuhnya bergantung pada seberapa berharga waktu aktual bagi Anda, dan ada satu kerumitan yang menentang pembacaan naif. Harga input pada tier standar mendapat diskon cache 99% di halaman Artificial Analysis, yang berarti separuh biaya untuk input bisa menciut hingga hampir nol pada beban kerja yang membaca ulang konteks yang sama. Daftar UltraSpeed menunjukkan dua tarif utama dan tidak ada tier cache. Jika beban kerja Anda berat cache, kelipatan efektifnya bukan sepuluh — melainkan jauh lebih buruk, karena Anda kehilangan diskon di sisi yang tadinya nyaris tidak Anda bayar. Jika beban kerja Anda berat output dan ringan cache, sepuluh kali itu mendekati angka sebenarnya. Ukur komposisi Anda sendiri sebelum memercayai salah satu angka itu.

Asimetri open-weights

Ada perbedaan struktural antara kedua tier tersebut yang sama sekali tidak berkaitan dengan harga atau kecepatan, dan hal itu mungkin lebih penting daripada keduanya.

MiMo-V2.6-Pro dirilis di bawah lisensi MIT dengan bobot yang dipublikasikan di Hugging Face. Itu memungkinkan penerapan komersial, modifikasi, dan pelatihan lebih lanjut, dan berarti model standar memiliki batas bawah harga yang tidak dapat dinaikkan oleh vendor mana pun: jika tarif hosted tidak lagi masuk akal, Anda dapat menjalankan checkpoint itu sendiri. Anda tidak akan menyamai throughput Xiaomi di perangkat keras Anda sendiri, dan Anda harus membayar GPU-nya, tetapi opsi itu ada dan membatasi berapa yang dapat dibebankan oleh tier hosted.

UltraSpeed tidak memiliki batas bawah semacam itu. Tidak ada bobot UltraSpeed, karena tier ini adalah tumpukan penyajian, bukan model — checkpoint-nya sama dengan yang sudah publik, dan yang Anda sewa adalah kemampuan Xiaomi untuk menjalankannya dengan cepat. Itu hal yang sah untuk dijual, dan bentuknya sama seperti setiap tier kecepatan lain di pasar. Ini berarti tarif sepuluh kali lipat tidak memiliki pembanding kompetitif selain penyedia lain yang menjalankan bobot terbuka yang sama, dan tidak ada jalan keluar self-hosting jika harganya berubah lagi.

Screenshot of Xiaomi's MiMo homepage captured September 22, 2026, headed 'HELLO, I'M MiMo'. Two product cards are visible: 'Xiaomi MiMo-V2.6-Series', subtitled 'Frontier intelligence, all the modalities, built in public', and 'Xiaomi MiMo-V2.5-TTS Series'. Below them a 'Build with MiMo' section lists two numbered routes, '01 Web Demo' and '02 API Access', with the lines 'Interact with MiMo directly through the web' and 'Developer portal for quick integration of MiMo capabilities'.

Pertimbangkan itu dalam konteks gambaran ketersediaan. Checkpoint standar dapat diakses melalui kanal milik Xiaomi sendiri dan beberapa platform pihak ketiga, dan juga tersedia sebagai unduhan. Tier UltraSpeed dapat diakses melalui API milik Xiaomi sendiri dan beberapa platform pihak ketiga, dan itu satu-satunya cara untuk mendapatkannya. Bagi siapa pun yang mempertimbangkan dependensi jangka panjang, perbedaan dalam hal opsionalitas itu layak diperhitungkan bersama tarif per token.

Siapa yang harus mengambil yang mana

Keputusan ini terbagi dengan rapi berdasarkan seberapa besar biaya Anda berupa token keluaran dan seberapa besar anggaran latensi Anda adalah generasi, bukan antrean.

• Gunakan UltraSpeed saat beban kerjanya berat pada output, ringan pada cache, dan interaktif — pembuatan teks panjang, perulangan agen ketika model menulis banyak penalaran di antara pemanggilan alat, atau apa pun yang membuat manusia menunggu di ujung lain permintaan.

• Pilih tier standar saat beban kerjanya berat cache, toleran batch, atau sensitif biaya secara marginal — klasifikasi massal, penjawaban yang diperkaya retrieval atas korpus tetap, proses evaluasi semalaman, apa pun yang generasi selama empat jam tidak masalah karena tidak ada yang mengawasi.

• Ambil tier standar saat Anda menginginkan opsi untuk self-host. Jika postur kepatuhan Anda mengharuskan bobot yang dapat Anda miliki sendiri, UltraSpeed tidak tersedia untuk Anda dengan harga berapa pun.

• Jangan ambil salah satu pun sebelum Anda mengukur. Klaim sepuluh kali lipat adalah angka yang menopang di sini dan saat ini dinyatakan oleh vendor. Satu sore menjalankan prompt Anda sendiri melalui kedua tier memberi tahu Anda lebih banyak daripada angka-angka yang dipublikasikan, karena satu-satunya angka throughput yang telah diverifikasi secara independen oleh siapa pun adalah milik sisi lambat dari perbandingan itu.

Pada poin terakhir itu, mekanisme pengujian tingkat layanan sama dengan menguji sebuah model, dan di situlah lapisan perutean membuktikan kegunaannya. OrcaRouter membawa lebih dari 200 model di balik satu kunci API dengan harga daftar penyedia tanpa markup 0% yang diteruskan, jadi perubahan harga vendor sampai ke sisi Anda pada hari yang sama, bukan pada perpanjangan kontrak berikutnya. Failover otomatis berarti tingkat yang masih Anda evaluasi tidak pernah berada sendiri di jalur produksi, dan DSL perutean memungkinkan Anda mengirim satu kelas permintaan ke endpoint cepat dan sisanya ke endpoint standar tanpa memelihara dua integrasi. Semua itu tidak secara khusus membutuhkan model Xiaomi — intinya adalah keputusan tingkat seperti ini murah untuk dibalik ketika tingkat-tingkat tersebut berada di balik satu kunci.

Apa yang akan menyelesaikan ini

Status jujur dari pertanyaan MiMo-V2.6-Pro-UltraSpeed versus MiMo-V2.6-Pro adalah bahwa separuhnya terukur dan separuhnya hanya diklaim. Tingkat standar memiliki Intelligence Index independen, angka throughput independen, dan bobot terbuka yang dipublikasikan. Tingkat cepat memiliki harga, jendela konteks, dan janji vendor bahwa model yang sama berjalan lebih cepat.

Tiga hal akan menutup kesenjangan itu. Pengukuran throughput independen pada endpoint UltraSpeed — Artificial Analysis mengukur tier standar melalui API Xiaomi, jadi perlakuan yang sama mungkin dilakukan dan hanya belum terjadi. Kebijakan cache untuk tier cepat, karena tidak adanya kebijakan itulah yang membuat tagihan sepuluh kali lipat menjadi lebih buruk pada pekerjaan yang intensif cache. Dan detail apa pun yang dipublikasikan tentang stack serving V2.6, seperti cara Xiaomi mendokumentasikan expert FP4, DFlash, dan TileRT untuk generasi V2.5.

Hingga saat itu, harga sepuluh kali lipatnya nyata dan kecepatan sepuluh kali lipatnya hanyalah klaim. Jika beban kerja Anda berat pada keluaran dan ada seseorang yang menunggu, klaim itu layak diuji dengan prompt Anda sendiri — dan layak diuji di balik lapisan yang memungkinkan Anda beralih kembali pada sore yang sama jika ternyata tidak terbukti.