
Claude Haiku 5.5 vs Xiaomi MiMo-V2.6-Flash: Ketika Daftar Tarif dan Tagihan Terukur Tidak Sepakat
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 57 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 345 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Ambil saja kedua kartu tarif itu apa adanya, dan Claude Haiku 5.5 versus Xiaomi MiMo-V2.6-Flash tampak seperti kemenangan telak bagi model Xiaomi: $0,14 dan $0,28 per juta token dibandingkan $0,10 dan $0,50, keunggulan 1,8x pada output dengan tarif tetap alih-alih tarif yang menanjak setelah 100.000 token. Lalu lihat berapa biaya sebenarnya dari uji tugas independen dan urutannya berbalik — MiMo-V2.6-Flash hanya menghabiskan $0,06231 untuk menyelesaikan tugas yang Haiku selesaikan dengan $0,2128, namun Haiku mencetak skor lima belas persen lebih tinggi pada papan yang sama dan menyelesaikan tugas itu dalam sepertiga waktu aktual. Tak satu pun dari keempat pernyataan itu salah; semuanya mengukur hal yang berbeda. Tulisan ini membahas mana di antara semuanya yang memprediksi tagihan Anda, dan di titik mana masing-masing berhenti berguna.
Kedua kartu tarif
Mulailah dengan angka yang dipublikasikan setiap vendor, karena angka-angka itulah yang dibandingkan dan sebagian besarnya justru bukan angka yang penting:
• Harga — Claude Haiku 5.5 $0.10 / $0.50 per juta di bawah 100K token, $0.50 / $2.50 di atasnya (daftar Anthropic); Xiaomi MiMo-V2.6-Flash $0.14 / $0.28 flat (daftar vendor)
• Jendela konteks — 1.000.000 token untuk Claude Haiku 5.5, 1.000.000 untuk MiMo-V2.6-Flash, keduanya diterbitkan oleh vendor
• Output maksimum — 128.000 token pada Haiku (300.000 pada Batch); tidak diiklankan sebagai batas atas terpisah untuk MiMo-V2.6-Flash
• Arsitektur — tidak diungkapkan untuk Haiku; 309B total parameter dengan 15B aktif, Mixture-of-Experts, untuk MiMo-V2.6-Flash (diterbitkan vendor)
• Lisensi — tertutup dan hanya API untuk Haiku; MIT untuk MiMo-V2.6-Flash (diterbitkan vendor)
• Indeks independen — 43.395 untuk Claude Haiku 5.5 versus 37.884 untuk MiMo-V2.6-Flash (Artificial Analysis)
Tiga dari baris-baris itu menentukan sebagian besar pembelian nyata dan mengarah ke tiga arah yang berbeda. Pada harga keluaran, model Xiaomi lebih murah — $0,28 versus $0,50 pada konteks pendek. Pada harga masukan, Haiku lebih murah di bawah 100.000 token dan jauh lebih mahal di atasnya. Pada jendela konteks, model Xiaomi mengklaim ruang dua kali lipat. Hanya satu dari ketiga hal itu — yang terakhir — yang benar-benar merupakan klaim kemampuan, dan perubahan tarif tetap Haiku pada 100.000 token berarti perbandingan harga memiliki celah yang disembunyikan oleh sepasang angka.

Tagihan yang terukur
Kartu tarif memberi harga pada token. Pekerjaan membutuhkan biaya. Artificial Analysis menjalankan kedua model melalui rangkaian tugas yang sama dan menerbitkan berapa biaya sebenarnya untuk menyelesaikan setiap tugas, yang merupakan besaran berbeda dari harga per token dan sering kali menghasilkan peringkat yang berbeda:
• Biaya per tugas — MiMo-V2.6-Flash $0.06231 vs Claude Haiku 5.5 $0.2128
• Token keluaran per tugas — MiMo-V2.6-Flash 77,792 vs Claude Haiku 5.5 162,164
• Waktu jam dinding per tugas — MiMo-V2.6-Flash 1.320,08 s vs Claude Haiku 5.5 426,26 s
• Indeks Kecerdasan — Claude Haiku 5.5 43.395 vs MiMo-V2.6-Flash 37.884
• Terminal-Bench Hard — Claude Haiku 5.5 0.329 vs MiMo-V2.6-Flash 0.227
Kelima angka tersebut milik Artificial Analysis, diambil dari halaman model papan itu sendiri pada awal Oktober 2026, dan itulah angka yang harus digunakan ketika sebuah keputusan harus tetap bertahan saat seseorang memeriksanya.
Kesenjangan biaya per tugas lebih besar daripada yang ditunjukkan kartu tarif, dan penyebabnya adalah baris kedua. Claude Haiku 5.5 menghabiskan 162.164 token keluaran untuk menyelesaikan tugas yang diselesaikan MiMo-V2.6-Flash dalam 77.792 — sekitar 2,1 kali lebih banyak token, sebagian besar karena secara default ia bernalar panjang lebar. Model yang 1,8x lebih murah per token keluaran dan menghasilkan kurang dari setengahnya per tugas tidak berakhir 1,8x lebih murah; pada rangkaian uji khusus ini, model itu justru berakhir lebih murah hampir satu orde besaran. Itulah satu hal terpenting di halaman ini, dan tidak ada kartu tarif mana pun yang mencantumkannya.
Garis waktu aktual justru bergerak ke arah sebaliknya dan patut disikapi dengan jujur. MiMo-V2.6-Flash membutuhkan 1.320 detik per tugas, sedangkan Haiku 426 — tiga kali lebih lama, meskipun kecepatan keluaran terukurnya lebih tinggi, yaitu 56,69 token per detik, karena penalaran Haiku bukanlah hambatan pada suite ini seperti yang akan diprediksi oleh laju token mentah. Jika suatu beban kerja terikat latensi, bukan terikat biaya, model murah tidak otomatis menjadi pilihan yang tepat, dan papan peringkat independen adalah satu-satunya tempat kedua angka ini dapat ditemukan.

Di mana kelima belas poin itu sebenarnya berada
43.395 berbanding 37.884 adalah selisih lima belas persen pada Intelligence Index, dan itu adalah argumen terkuat untuk Haiku dalam pertandingan ini. Apakah itu penting sepenuhnya bergantung pada tugasnya. Pada Terminal-Bench Hard, keduanya adalah 0.329 dan 0.227 — selisih relatif yang lebih lebar, dan salah satu yang berada di sisi agentic dan multi-langkah dari papan tempat perbedaan indeks lima belas persen cenderung berlipat menjadi perbedaan yang jauh lebih besar dalam penyelesaian tugas. Pada sub-benchmark penalaran umum dan pengetahuan, keduanya lebih dekat daripada yang tersirat oleh indeks utama, dan MiMo-V2.6-Flash unggul pada beberapa di antaranya.
Pembacaan praktisnya: di bagian bawah kurva kesulitan, kedua model dapat dipertukarkan dan perbedaan biaya seharusnya yang menentukan. Di bagian atas — agen berhorizon panjang, basis kode, apa pun yang tugasnya gagal harus dijalankan ulang — lima belas poin Haiku adalah perbedaan antara tugas yang selesai dan tugas yang menghabiskan biaya yang sama dua kali, dan keunggulan biaya per tugas dari model murah dapat terbalik dengan cara yang tidak bisa ditunjukkan oleh rata-rata papan peringkat kepada Anda. Inilah kasus ketika Anda harus menjalankan evaluasi Anda sendiri alih-alih membaca indeks orang lain, karena tidak ada rata-rata yang dipublikasikan yang dapat menyelesaikannya.
Berapa nilai lisensi MIT
MiMo-V2.6-Flash dirilis di bawah MIT — lisensi terbuka yang paling tidak restriktif, tanpa batas penggunaan komersial dan tanpa klausul share-alike. Itu adalah lisensi yang lebih kuat daripada Qwen Community Licence dan berarti bobot MoE 309B/15B dapat di-host sendiri, di-fine-tune, dan didistribusikan ulang oleh siapa pun yang menginginkannya. Bagi tim yang kendalanya adalah inferensi harus berjalan di perangkat kerasnya sendiri, atau yang volumenya cukup tinggi sehingga memiliki GPU lebih menguntungkan daripada menyewa token, ini bukan sekadar catatan kaki — ini satu-satunya baris dalam perbandingan yang penting, karena Claude Haiku 5.5 sama sekali tidak dapat Anda jalankan sendiri.
Hal itu juga mengubah profil kegagalannya. Model tertutup yang dilayani oleh satu vendor dan mitra cloud vendor tersebut akan tumbang ketika mereka tumbang; model berlisensi MIT dengan beberapa host independen dapat dialihkan di antara host-host tersebut, asalkan ada sesuatu yang melakukan pengalihan itu. Tidak satu pun dari keduanya menjadi alasan untuk memilih MiMo-V2.6-Flash bagi tim yang hanya menginginkan API dan tidak yang lain. Keduanya menentukan bagi tim yang tidak demikian.
Klaim vendor yang perlu Anda periksa sendiri
Lini MiMo adalah milik Xiaomi, dan Xiaomi melaporkan angka kecepatan dan kualitasnya sendiri dalam materi peluncuran. Itu adalah angka vendor, yang belum direproduksi pada saat penulisan, dan papan independen saat ini mengukur model tersebut di bawah posisi yang akan diberikan oleh pembingkaian vendor — 37,884 pada indeks, dan 0,227 pada Terminal-Bench Hard dibandingkan 0,329 untuk Haiku. Itu bukan tuduhan terhadap apa pun; itu adalah kesenjangan normal antara harness milik vendor sendiri dan milik pihak ketiga, dan itulah alasan untuk menandai mana yang mana setiap kali sebuah angka dikutip ulang.
Pemeriksaan yang layak dilakukan pada trafik Anda sendiri menghabiskan waktu satu sore dan menyelesaikan pertanyaan itu lebih baik daripada indeks mana pun. Jalankan dua puluh tugas yang sama melalui kedua model dengan prompt Anda sendiri, catat token masukan, token keluaran, dan waktu nyata per tugas untuk masing-masing, lalu kalikan dengan tarif di atas. Empat angka yang menentukan semuanya adalah hal-hal yang dapat Anda ukur: token masuk, token keluar, detik, dan apakah tugas berhasil. Angka biaya per tugas di papan independen adalah gambaran untuk rangkaian generik; milik Anda akan berbeda, dan perbedaan antara keduanya biasanya adalah verbositas, yang justru merupakan hal yang disembunyikan kartu tarif. Jika penalaran bawaan Haiku membelikan Anda penyelesaian tugas yang jika tidak, Anda akan membayar untuk mencoba ulang, itu murah pada harga 3,4x per tugas. Jika tidak, Anda membayar untuk token yang tidak mengubah jawaban.
Mendapatkan keduanya melalui satu endpoint
Baik Claude Haiku 5.5 maupun Xiaomi MiMo-V2.6-Flash tidak dilayani oleh OrcaRouter — untuk itu, API milik vendor sendiri dan beberapa platform pihak ketiga adalah tempat untuk mendapatkannya. Yang kami operasikan adalah pemeran pendukungnya: qwen/qwen3.8-flash dengan harga $0.15 dan $0.47 per juta dan z-ai/glm-5.3-flash dengan harga $0.15 dan $0.50, keduanya pada harga daftar vendor, dengan kunci yang sama dan tagihan yang sama seperti katalog berisi lebih dari 200 model dengan harga pass-through dan failover otomatis.
Itu penting untuk perbandingan ini secara spesifik: ketika dua model yang sedang Anda pilih adalah model yang tidak dapat Anda rutekan, pemecah seri biasanya ditentukan dengan menjalankannya berdampingan pada lalu lintas nyata — yang berarti menjaga keduanya tetap tersedia berdampingan dengan model yang Anda rutekan, tanpa kontrak kedua atau SDK kedua untuk salah satu dari keduanya. Tempatkan kandidat di jalur produksi dengan model yang berfungsi di belakangnya sebagai cadangan, biarkan permintaan menuju ke mana pun yang dipilih lapisan perutean, dan biarkan log token Anda sendiri menghasilkan angka biaya per tugas yang tidak diberikan oleh kartu tarif kepada Anda. Rangkaian pengujian dewan independen hanyalah proksi; beban kerja Anda adalah ukurannya.

Panggilan
Jika beban kerjanya bervolume tinggi, outputnya pendek, dan toleran terhadap percobaan ulang sesekali, Xiaomi MiMo-V2.6-Flash adalah model yang lebih murah dengan selisih yang lebih besar daripada yang diiklankan kartu tarifnya — $0,06231 per tugas dibandingkan $0,2128 — dan lisensi MIT memberi Anda jalan keluar yang tidak dimiliki Haiku. Jika beban kerjanya berjangka panjang dan agentik, lima belas poin indeks Claude Haiku 5.5 dan penyelesaian tugas tiga kali lebih cepat sepadan dengan kelipatan biayanya, dan selisih biaya menyempit atau berbalik setelah percobaan ulang diperhitungkan.
Satu hal yang tidak boleh dilakukan adalah memilih hanya berdasarkan kartu tarif. Dua model di sini dihargai dalam rentang faktor dua per token tetapi terpaut satu orde besaran per tugas yang diselesaikan, dan hanya satu dari angka-angka itu yang ada di halaman yang ditunjukkan vendor kepada Anda.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
