Kartu judul hero bertuliskan 'Xiaomi MiMo-V2.6-Flash Telah Dirilis' di atas subjudul '309B bobot terbuka, lisensi MIT, konteks 1M token - diterbitkan 21 September 2026', dengan empat badge pil: '309B total / 15B aktif', '173 GB bobot FP8', 'konteks 1M token' dan 'Laporan teknis disertakan'.
Guides & Insights

{{1}}Xiaomi MiMo-V2.6-Flash{{/1}} {{2}}Telah Dirilis{{/2}}: {{3}}Model Terbuka 309B{{/3}} {{4}}yang Anda Jalankan Sendiri{{/4}}

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

MiMo-V2.6-Flash berhenti menjadi pekerjaan pelatihan pada 21 September 2026 pukul 15.39 UTC, ketika tim MiMo Xiaomi menerbitkan checkpoint tersebut sebagai XiaomiMiMo/MiMo-V2.6-Flash-RL di Hugging Face — tanpa pembatasan akses, berlisensi MIT, laporan teknis terlampir, 65 shard bobot di dalam indeks. XiaomiMiMo/MiMo-V2.6-Pro-RL menyusul delapan belas detik kemudian. Seminggu sebelumnya, kedua model itu adalah dua kartu bertanda "dihentikan" di dasbor pelatihan publik, dan pernyataan yang banyak diulang tentang keduanya adalah bahwa tidak ada bobotnya. Sekarang keduanya adalah berkas yang dapat diunduh dan disajikan oleh siapa saja. Itu adalah perubahan nyata dalam apa yang dapat Anda lakukan dengan model tersebut, yang merupakan hal berbeda dari pengumuman tentang sebuah model.

Awali dengan stempel waktu karena rilis ini datang tanpa koreografi vendor yang biasa. Blog Xiaomi sendiri, yang diperiksa pada 22 September, masih menampilkan peluncuran MiMo-V2-Flash Desember 2025 sebagai postingan terbarunya. Tidak ada esai peluncuran V2.6, tidak ada daftar harga terbitan untuk generasi baru, dan tidak ada pengenal model yang dapat dipanggil yang telah diumumkan Xiaomi untuk kedua checkpoint. Yang ada adalah repositori, laporan teknis, resep deployment, dan sekumpulan tabel benchmark yang dijalankan vendor — plus satu detail kecil yang mengganggu di kartu model yang hanya penting bagi orang yang berencana benar-benar memuatnya.

Dua kartu yang dapat Anda pegang

Kedua checkpoint ini native omnimodal dengan konteks 1 juta token yang diklaim, dan keduanya membawa lisensi MIT — dapat digunakan secara komersial, dapat di-fine-tune, dapat didistribusikan ulang, tanpa batasan pendapatan dan tanpa klausul penelitian. Kartu model menyebut Flash sebagai "checkpoint yang seimbang efisiensi" dari seri ini dan Pro sebagai unggulan; bagian yang menarik adalah bagaimana keduanya berbeda setelah Anda melihat konfigurasinya, bukan kalimat pemasarannya.

• Jumlah parameter — MiMo-V2.6-Flash total 309B dengan 15B diaktifkan per token; MiMo-V2.6-Pro total 1.02T dengan 42B diaktifkan. Keduanya sparse mixture-of-experts.

• Backbone — Flash terdiri dari 48 lapisan (39 sliding-window, 9 atensi global), ukuran tersembunyi 4096, 256 pakar routed dengan 8 diaktifkan, jendela geser 128 token, tanpa pakar bersama. Blok pertama adalah atensi global dengan jaringan feed-forward padat; semua setelahnya berselang-seling.

• Encoder — MiMo ViT 681M-parameter (28 lapisan, 24 sliding-window plus 4 full), tokenizer audio 308M dan encoder patch audio 127M, sehingga teks, gambar, video, dan audio semuanya masuk ke model yang sama alih-alih tiga pipeline terpisah yang hanya digabungkan.

• Decoding spekulatif — drafter prediksi multi-token lima lapis, bergaya DFlash, dijelaskan dalam kartu sebagai memprediksi tujuh token ke depan per forward pass untuk verifikasi paralel.

• Penyimpanan — indeks yang dipublikasikan melaporkan 172,9 GB data bobot di 65 shard, dalam FP8 (e4m3) dengan skema aktivasi dinamis. Artinya kira-kira sembilan byte per parameter: Xiaomi merilis model besar, bukan kuantisasi seukuran laptop dari model itu.

Tiga angka yang tidak sesuai

Ini layak dinyatakan secara terus terang, karena ketiganya memengaruhi keputusan deployment, bukan argumen benchmark, dan tidak ada satu pun yang mencurigakan — semuanya tampak seperti pergeseran dokumentasi antara tulisan, halaman repositori, dan berkas yang dirilis.

Yang pertama adalah dekoder spekulatif. Ringkasan model menyatakan bahwa kepala MTP adalah drafter lima lapis yang memprediksi tujuh token per lintasan. config.json di repositori yang sama menetapkan num_nextn_predict_layers menjadi 3. Kedua angka tersebut tidak dapat menggambarkan artefak yang sama, dan config adalah yang akan dibaca oleh runtime. Jika Anda memperkirakan kebutuhan memori untuk decoding spekulatif, percayai config dan verifikasi setelah memuat.

Yang kedua lebih halus dan sama sekali bukan kesalahan, melainkan konvensi penamaan yang terbaca seperti kesalahan. Repositori itu bernama MiMo-V2.6-Flash-RL, yang mengundang anggapan bahwa itu adalah adapter reinforcement learning alih-alih sebuah model. Padahal itulah modelnya. Sufiks -RL menandai garis keturunan pasca-pelatihan — checkpoint ini adalah hasil dari proses RL campuran yang di-streaming Xiaomi, bukan LoRA yang menempel di atas basis lain. Indeks bobotnya mengonfirmasi hal itu: puluhan ribu tensor yang mencakup seluruh backbone, encoder visi, tumpukan audio, dan drafter.

Angka ketiga adalah yang pertama Anda temui jika Anda menentukan ukuran perangkat keras dari halaman repositori, bukan dari kartu model. Blok Safetensors di halaman itu melaporkan 159B parameter. Itu bukan salah satu dari dua angka di kartu model — bukan total 309B, bukan 15B aktif — dan itulah angka yang paling mungkin disalin oleh perencana kapasitas, karena letaknya di sebelah tombol unduh. Xiaomi belum menjelaskan perbedaannya dan kami tidak dapat menyelesaikannya dari luar; penafsiran yang paling mungkin adalah konvensi penghitungan pada tensor terkuantisasi, bukan model yang berbeda. Langkah aman adalah menentukan ukuran dari data bobot yang dipublikasikan sebagai gantinya: 172,9 GB FP8 yang tersebar di 65 shard adalah angka yang harus dibayar dengan VRAM, terlepas dari bagaimana parameternya dihitung.

Apa yang dikatakan tolok ukur, dan siapa yang menjalankannya

Setiap angka di bawah ini berasal dari tabel evaluasi Xiaomi sendiri di kartu model. Tidak ada satu pun yang telah direproduksi secara independen, tidak ada satu pun yang muncul di papan peringkat publik, dan kolom perbandingannya adalah hasil uji vendor itu sendiri dengan harness yang sama terhadap model perusahaan lain. Anggaplah bentuk hasilnya sebagai informasi dan angka desimalnya sebagai hiasan.

• Agen kode — DeepSWE v1.1: Flash 67.9, Pro 71.9, dibandingkan Claude Opus 5 pada 74.0, GPT-5.6 Sol pada 73.0 dan Claude Fable 5 pada 70.0. Pada Terminal Bench 2.1, Flash berada di 87.6 dibandingkan Opus 5 yang 89.1 — selisih yang cukup kecil sehingga harness, bukan model, yang mungkin menentukannya.

• Agen umum — AutomationBench v1.0.6 menempatkan Flash di angka 52,3, lebih tinggi daripada GPT-5.6 Sol (45,8) dan Claude Opus 5 (50,3) pada pengujian Xiaomi. Toolathlon-Verified: Flash 73,6, Pro 76,9, Opus 5 80,6.

• Keamanan siber — kolom paling timpang di tabel. CyberGym: Flash 95,1, di atas saudara besarnya sendiri di 94,0, dengan MiMo-V2.5-Pro di 40,0. Lalu dasarnya ambruk: ExploitGym 6,0 untuk Flash versus 22,1 untuk Opus 5, ExploitBench 25,3 versus 70,0, SEC Bench Pro 47,5 versus 79,1 untuk GPT-5.6 Sol.

• Agen visual — MiMo VisualCoding: Flash 71,5, Pro 72,3, Opus 5 70,0.

Satu angka layak disorot karena ini adalah jenis hal yang biasanya disembunyikan oleh tulisan peluncuran. Dasbor RL Xiaomi mempublikasikan Flash pada 65.68 di DeepSWE v1.1 — dan kartu model kini mencantumkan 67.9 untuk tolok ukur yang sama pada checkpoint final. Keduanya bukan pengukuran yang sama. Angka di dasbor diberi label mini-swe-agent, avg@3, pada snapshot pelatihan; tabel di kartu adalah evaluasi offline vendor terhadap bobot yang dirilis. Selisih dua poin tersebut adalah keuntungan dari bagian terakhir proses pelatihan ditambah apa pun yang berubah dalam pengaturan evaluasi, dan saat ini tidak ada orang di luar Xiaomi yang dapat memisahkan keduanya. Jika Anda telah mengutip 65.68 sejak minggu lalu, itu sekarang menjadi angka yang kedaluwarsa untuk artefak yang berbeda.

A screenshot of the XiaomiMiMo/MiMo-V2.6-Flash-RL repository page on Hugging Face, showing the MIT licence tag, the Safetensors block reporting 'Model size 159B params' and 'This model isn't deployed by any Inference Provider', and the repository file listing that includes the technical report and the weight shards.

Berapa biaya untuk benar-benar menjalankannya

Open weights adalah lisensi, bukan tagihan, dan di sinilah peluncuran ini jadi kurang meriah. Bagian deployment pada model card itu sendiri merekomendasikan SGLang (tensor parallel 16, data parallel 2, dengan jalur spekulatif multi-lapis bergaya EAGLE diaktifkan) atau resep vLLM pada tensor parallel 8, dan mencatat bahwa vLLM stabil mungkin tertinggal dari arsitektur tersebut. Itu adalah pekerjaan penyajian multi-node untuk model 309B yang bobotnya menempati sekitar 173 GB sebelum Anda menambahkan KV cache untuk konteks 1M token. Sampling yang direkomendasikan adalah temperature 1.0, top_p 0.95.

Jadi perumusan yang jujur tentang "open source" di sini adalah: Xiaomi menghapus hambatan lisensi dan membiarkan hambatan perangkat keras tetap persis seperti sebelumnya. Fine-tuning Flash pada jejak Anda sendiri sekarang legal dan mungkin; melakukannya pada apa pun yang lebih kecil dari node GPU yang serius tidak. Itu adalah tawaran yang nyata dan berbeda dari endpoint yang dihosting, dan itulah sebabnya dua cara menggunakan generasi ini tidak bersaing — keduanya mencakup anggaran yang berbeda.

Jika Anda menginginkan kemampuannya tanpa node, model yang dijadikan tolok ukur oleh Xiaomi dalam tabel tersebut adalah alternatif praktisnya: GPT-5.6 Sol, Claude Opus 5, dan Claude Fable 5 semuanya dapat dipanggil hari ini, dan semuanya adalah satu kunci API dengan harga daftar penyedia, dengan markup 0% yang diteruskan di OrcaRouter, jadi keputusan yang sebenarnya Anda ambil adalah "beli node" versus "ukur pemakaian panggilan". Jika Anda ingin melihat bagaimana tier yang dapat dipanggil tersebut dibandingkan pada tugas coding yang sama sebelum memutuskan salah satu, papan coding lebih cepat dibaca daripada tabel vendor. Yang tidak dapat Anda lakukan di router mana pun saat ini adalah memanggil MiMo-V2.6-Flash itu sendiri — kami tidak merutekan model Xiaomi apa pun, dan baris ketersediaan di kartu milik Xiaomi sendiri mengarah ke saluran Xiaomi sendiri: platform MiMo API, AI Studio, MiMo Code, dan aplikasi desktop.

A single-column scoreboard headed 'MiMo-V2.6-Flash - the numbers that decide a deployment', listing 309B total and 15B activated parameters, a 1M-token context, text/image/video/audio modalities, the MIT licence with no revenue cap, 172.9 GB of FP8 weights across 65 shards, DeepSWE v1.1 at 67.9 against 74.0 for Claude Opus 5, CyberGym at 95.1, and SGLang tp16/dp2 or vLLM tp8 serving with no vendor price published.

Pertanyaan tentang harga masih terbuka

Xiaomi belum menerbitkan tarif per token untuk MiMo-V2.6-Flash. Pemberitaan tentang peluncurannya menyebutkan bahwa seri ini akan mempertahankan harga API MiMo-V2.5, dan itu merupakan klaim pers, bukan daftar harga resmi vendor — tarif luar negeri yang diterbitkan untuk generasi V2.5 adalah sekitar sepersepuluh dolar per juta token masukan, dengan masukan yang di-cache satu orde magnitudo lebih murah, tetapi tidak ada apa pun di situs Xiaomi yang mengonfirmasi bahwa checkpoint baru mewarisi tarif tersebut. Sampai daftar harga muncul, angka apa pun yang Anda lihat untuk endpoint MiMo-V2.6 hanyalah inferensi seseorang.

Dua hal lain masih belum ada, dan keduanya ada dalam daftar tugas Xiaomi sendiri, bukan daftar tugas pihak lain. Pernyataan Luo Fuli selama livestream RL adalah bahwa lingkungan pelatihan dan kode RL akan dirilis sebagai sumber terbuka, dan materi peluncuran mengulangi komitmen itu; repositori saat ini menyertakan bobot, laporan teknis, dan instruksi deployment, bukan stack pelatihan. Dan tidak ada evaluasi independen: tidak ada pengajuan ke papan peringkat, tidak ada pengujian ulang oleh pihak ketiga atas kolom DeepSWE atau CyberGym. Itulah kesenjangan yang paling penting bagi siapa pun yang memutuskan apakah model 309B dengan anggaran aktif 15B layak untuk satu node.

Apa yang akan mengubah gambaran

Tiga sinyal yang layak diperhatikan, dalam urutan kasar berdasarkan seberapa besar pengaruhnya terhadap suatu keputusan. Daftar harga yang dipublikasikan mengubah ini dari proyek swa-hosting menjadi pos anggaran yang dapat Anda bandingkan dengan frontier yang dihosting. Uji coba pihak ketiga pada harness yang sama — DeepSWE atau Terminal Bench, yang diajukan, bukan dilaporkan sendiri — akan menentukan apakah 67.9 adalah posisi nyata atau konfigurasi yang menguntungkan. Dan lingkungan RL, jika terwujud, akan menjadi artefak yang lebih menarik bagi sebagian besar tim, karena itulah yang Anda perlukan untuk mereproduksi siklus perbaikan diri pada data Anda sendiri.

Sampai saat itu, pembacaan praktis atas rilis ini sempit dan jelas. MiMo-V2.6-Flash adalah model agen omnimodal berlisensi MIT dengan bobot terbuka yang sah, pada ukuran yang mengandaikan klaster — dan ini adalah checkpoint pertama dalam generasi MiMo-V2.6 yang dapat Anda pegang sendiri, sesuatu yang belum bisa dikatakan tentangnya pekan lalu.

A screenshot of Xiaomi's MiMo blog, captured 22 September 2026, showing the site navigation and the December 16, 2025 post 'Introducing MiMo-V2-Flash' as the newest entry, with the line 'Today, we are releasing and open-sourcing MiMo-V2-Flash', the availability note listing Hugging Face, the API Platform and AI Studio, and a 'Benchmark Comparison' table with columns for SWE-Bench Verified, SWE-Bench Multilingual, Tau2-Bench, AIME25, GPQA-Diamond, HLE and Arena-Hard.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari