
MiniMax M3.1 Flash Preview vs MiniMax M3: Ketika Model yang Lebih Baru Justru Lebih Berisiko
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 468 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 192 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1329 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Dokumentasi vendor itu sendiri sekarang mencantumkan MiniMax-M3.1-Flash-Preview di atas MiniMax-M3, dan urutan itu sangat berperan dalam mempersuasi. Ini adalah model teks terbaru di lini tersebut, ia mengusung jendela konteks satu juta token yang sama, dan ia menambahkan kontrol kedalaman berpikir yang tidak dimiliki model lama. Yang tidak ditunjukkan tabel adalah bahwa model lama adalah satu-satunya dari keduanya yang dapat Anda unduh, yang harga per tokennya tersedia, yang dapat di-benchmark terhadap apa pun, atau yang dapat dipanggil tanpa langganan — dan bahwa model yang lebih baru telah menghilangkan sakelar yang diberikan MiniMax-M3 kepada Anda.
Ini bukan cerita tentang sebuah model yang digantikan. Ini adalah cerita tentang vendor yang memecah lini produknya sendiri menjadi pekerja keras berbasis meteran dan pratinjau yang dibatasi langganan, dan keduanya tidak dapat dipertukarkan dalam arah mana pun. Inilah apa sebenarnya masing-masing dari keduanya.
Dua lembar spesifikasi, berdampingan
Mulailah dari apa yang dinyatakan halaman milik vendor sendiri untuk keduanya, sebab bentuk perbedaannya tampak di sini, bukan pada tabel benchmark.
• Diumumkan — MiniMax-M3 pada 1 Juni 2026 dengan catatan arsitektur, lembar benchmark, dan kartu tarif; MiniMax-M3.1-Flash-Preview pada 27 September 2026 dengan entri dokumentasi dan postingan di akun agen MiniMax • Jendela konteks — 1.000.000 token untuk keduanya, menurut tabel model MiniMax sendiri • Output maksimum — 512.000 token untuk MiniMax-M3 pada entri katalog kami, angka yang tidak diterbitkan sendiri oleh MiniMax; tidak diterbitkan untuk MiniMax-M3.1-Flash-Preview di mana pun • Modalitas input — teks, gambar, dan video masuk, teks keluar, untuk keduanya • Kontrol thinking — parameter thinking yang dapat diminta untuk dilewati oleh MiniMax-M3, dan yang dapat dipisahkan ke dalam bidang reasoning_details melalui reasoning_split; pada MiniMax-M3.1-Flash-Preview thinking bersifat wajib dan reasoning_split tidak dapat dimatikan • Kedalaman thinking — tidak tersedia pada MiniMax-M3; sebuah tangga effort dari low, medium, high, xhigh dan max, dengan nilai default max, pada MiniMax-M3.1-Flash-Preview • Kecepatan output yang dipublikasikan — sekitar 100+ token per detik untuk MiniMax-M3, menurut tabel model MiniMax sendiri; tidak ada yang dipublikasikan untuk MiniMax-M3.1-Flash-Preview • Bobot — MiniMax-M3 bersifat open-weight dengan repositori publik; MiniMax-M3.1-Flash-Preview tidak memilikinya • Harga — $0,30 per juta token input dan $1,20 per juta token output untuk MiniMax-M3 pada tarif penyedia; tidak ada tarif per token untuk MiniMax-M3.1-Flash-Preview • Akses — MiniMax-M3 tersedia dengan pay-as-you-go dan Token Plan, serta dapat dirutekan melalui platform pihak ketiga; MiniMax-M3.1-Flash-Preview hanya dengan Token Plan dan MiniMax Code
Dua baris di sana termasuk dalam kategori yang berbeda dari yang lainnya. Kecepatan keluaran yang dipublikasikan hanyalah angka dari vendor untuk model lama saja, jadi model yang lebih baru dijual sebagai yang cepat tanpa disertai angka. Dan kontrol proses berpikirnya bergerak ke arah yang berlawanan dengan pemasarannya: model yang lebih baru menawarkan kontrol yang lebih halus atas seberapa banyak ia berpikir, tetapi menghilangkan kemampuan Anda untuk menghentikannya berpikir sama sekali.
Sakelar yang diambil MiniMax
Ini adalah detail yang paling mungkin menimbulkan masalah, dan hal ini didokumentasikan, bukan disembunyikan. Dengan MiniMax-M3, mengirim thinking: {"type": "disabled"} di endpoint yang kompatibel dengan OpenAI akan melewati penalaran dan mengembalikan jawaban langsung; di endpoint yang kompatibel dengan Anthropic, penalaran nonaktif secara default dan dapat diaktifkan dengan adaptive. Pada MiniMax-M3.1-Flash-Preview, permintaan yang identik mengembalikan HTTP 400 dengan pesan memerlukan penalaran adaptif. Tidak ada cara yang didukung untuk mendapatkan respons tanpa penalaran.
Secara praktis, itu berarti bahwa beban kerja yang menggunakan MiniMax-M3 sebagai pengklasifikasi atau router yang murah dan cepat — prompt singkat masuk, jawaban terstruktur singkat keluar, tanpa rantai pemikiran — tidak memiliki jalur peningkatan langsung ke model yang lebih baru. Anda dapat menurunkan upaya ke rendah, dan panduan MiniMax secara eksplisit menyatakan bahwa menurunkan upaya adalah cara yang dimaksudkan untuk mengurangi latensi dan token pemikiran alih-alih menonaktifkannya. Namun token dan latensinya tidak menjadi nol, dan untuk pekerjaan ekstraksi bervolume tinggi yang menulis empat bidang per panggilan, "selalu berpikir terlebih dahulu" adalah bentuk biaya yang berbeda dari "berpikir saat diminta".

Apa yang sebenarnya diukur pada masing-masing
Satu sisi perbandingan ini memiliki angka dan sisi lainnya memiliki kolom kosong, dan ada baiknya kita tepat tentang angka mana milik siapa.
Rekor independen MiniMax-M3 itu nyata: Artificial Analysis menempatkannya di 29,2 pada Intelligence Index — ke-60 dari 145 — dengan 58,6 pada Coding Index, 59,18 pada indeks Matematikanya, 92,9% pada GPQA Diamond dalam keluarga indeks yang sama, recall konteks panjang 83%, dan 82,9% pada IFBench. Itu semua adalah evaluasi pihak ketiga atas model yang bisa diunduh dan dijalankan ulang oleh siapa saja. Angka peluncuran M3 dari MiniMax sendiri — BrowseComp 83,5%, SWE-Bench Pro 59,0%, Terminal-Bench 2.1 66,0%, MCP Atlas 74,2%, OSWorld-Verified 70% — adalah angka dari vendor dan kami belum melihatnya direproduksi.
MiniMax-M3.1-Flash-Preview tidak memiliki keduanya. MiniMax tidak menerbitkan tabel benchmark, dan model tersebut tidak memiliki entri pada indeks Artificial Analysis, sehingga tidak ada skor independen, tidak ada indeks coding, tidak ada angka recall konteks panjang, dan tidak ada pengukuran halusinasi. Setiap karakterisasi tentangnya yang beredar — "cepat", "andal", "dibuat untuk pengembangan sehari-hari" — adalah kata sifat milik vendor sendiri dari postingan peluncuran. Ketiadaan itu layak dinyatakan secara gamblang karena hal itu berlaku dua arah: tidak ada yang ditunjukkan lebih buruk, dan tidak ada yang ditunjukkan lebih baik.
Asimetri itulah keseluruhan keputusannya. Anda dapat mengevaluasi MiniMax-M3 sore ini dengan mengunduhnya atau memanggilnya, dan Anda dapat membandingkan evaluasi itu dengan papan skor publik. Dengan MiniMax-M3.1-Flash-Preview, Anda hanya dapat menggunakannya dan membentuk pendapat pribadi.
Di mana model yang lebih baru benar-benar unggul
Akan mudah untuk membaca uraian di atas sebagai argumen untuk mengabaikan model baru, dan itu juga bukan kesimpulan yang tepat. Ada tiga hal yang nyata dan spesifik tentangnya.
Tangga upaya adalah kemampuan yang sesungguhnya, bukan tombol on/off. Lima tingkat — rendah hingga maks — memungkinkan satu model melayani penggantian nama rutin dan refaktor di seluruh repositori pada biaya komputasi yang berbeda, dan ini efektif hanya untuk Fast model. Di M3, pilihan ada di tangan Anda. Jika masalah Anda adalah tidak dapat memprediksi tingkat kesulitan per tugas, pengaturan yang dapat disetel adalah persis kontrol yang Anda inginkan.
Ini adalah model peringkat teratas vendor saat ini, yang berarti model ini mewarisi apa pun yang telah dipelajari garis keturunan seri M sejak Juni, dan MiniMax secara eksplisit menyatakan bahwa ini adalah model terbaru untuk penalaran agentik, penggunaan alat, pengodean, dan tugas konteks panjang. Mekanisme penggunaan alat dengan pemikiran berjalin yang diperkenalkan M3 tetap dipertahankan, termasuk persyaratan untuk menambahkan respons lengkap — blok pemikiran dan semuanya — kembali ke riwayat pesan.
Dan ini menerima video, pada titik harga Flash, di dalam langganan. MiniMax-M3 juga melakukannya, dengan harga per token. Jika Anda sudah membayar kursi Token Plan dan satu-satunya hambatan Anda untuk menggunakan input video adalah biaya marginal per panggilan, M3.1-Flash-Preview menghilangkan hambatan itu.
Di mana model lama masih menjadi pilihan utama
Tiga kasus, semuanya tentang prediktabilitas, bukan kualitas.
Saat Anda perlu memodelkan biaya. MiniMax-M3 memiliki daftar tarif: $0.30 per juta token input, $1.20 per juta output, dan tarif baca-cache $0.06 per juta di katalog kami. Anda dapat memperkirakan tagihan bulanan suatu beban kerja hingga satuan sen sebelum menjalankannya. MiniMax-M3.1-Flash-Preview tidak memiliki tarif per token di mana pun di halaman MiniMax, jadi biayanya adalah langganan Anda dibagi sebanyak apa pun Anda menggunakannya — bagus untuk anggaran tetap, tidak berguna untuk ekonomi unit.
Ketika Anda membutuhkan model yang benar-benar menjadi model. MiniMax-M3 adalah model berbobot terbuka: Anda dapat mengunduhnya, menjalankannya di perangkat keras Anda sendiri, dan mengetahui bahwa artefak yang menjawab panggilan Anda enam bulan dari sekarang adalah artefak yang sama yang menjawabnya hari ini. MiniMax-M3.1-Flash-Preview tidak memiliki checkpoint, dan akses tingkat pratinjau berarti tumpukan penyajian, komposisi kuota, dan ketersediaan semuanya dikendalikan vendor dan secara eksplisit dapat berubah.
Saat Anda membutuhkan jawaban tanpa penalaran. Seperti di atas — inilah satu-satunya regresi kemampuan dalam perbandingan tersebut, dan inilah yang mengejutkan orang, karena model yang lebih baru yang tidak bisa melakukan sesuatu yang bisa dilakukan model lama bukanlah kasus yang direncanakan siapa pun.

Memanggil keduanya dari satu tempat
Yang janggal di sini adalah kedua model itu dibeli dengan cara yang berbeda — satu diukur pemakaiannya, satu lewat langganan — dan naluri alaminya adalah memihak. Langkah yang lebih berguna adalah merutekan di antara keduanya berdasarkan bentuk tugas, yang hanya berhasil jika sisi yang diukur pemakaiannya dapat dijangkau dari tempat yang sama dengan semua hal lainnya.
MiniMax-M3 di OrcaRouter membawa harga daftar MiniMax dengan tambahan markup 0%, sehingga $0,30 dan $1,20 pada daftar tarif adalah biaya satu panggilan, tanpa margin platform tambahan di atasnya. Model ini berada di endpoint yang sama yang kompatibel dengan OpenAI seperti MiniMax M2.7 — harga $0,30/$1,20 yang sama untuk jendela 200.000 token, juga open-weight — dan seperti 200+ model lainnya, melalui satu kunci API, dengan failover otomatis antar penyedia ketika satu endpoint bermasalah. Dibandingkan dengan telemetri kami sendiri, yang merupakan jenis angka berbeda dari milik vendor: selama tujuh hari terakhir M3 telah menjawab pada sekitar 238 token output per detik dengan p50 sekitar 4,1 detik untuk token pertama, dengan tingkat kesalahan mendekati 0,15%, diukur di playground OrcaRouter. Jika Anda ingin mempertahankan MiniMax-M3 sebagai bagian yang andal dalam sebuah pipeline dan memperlakukan MiniMax-M3.1-Flash-Preview sebagai bagian eksperimental, bagian yang andal itu cukup satu baris konfigurasi, bukan hubungan dengan vendor kedua. MiniMax-M3.1-Flash-Preview sendiri tidak ada di katalog kami; rute menuju model itu adalah Token Plan dan produk coding milik vendor itu sendiri.
Apa yang akan mengubah artikel ini bersifat spesifik dan mudah untuk dicermati. Kartu tarif yang dipublikasikan untuk MiniMax-M3.1-Flash-Preview akan meruntuhkan alasan utama untuk lebih memilih M3 secara ekonomi. Serangkaian skor independen akan menggantikan kolom kosong itu dengan sesuatu yang dapat dibandingkan. Checkpoint yang dapat diunduh akan menghilangkan keberatan soal reproduktibilitas. Sampai setidaknya salah satu dari itu muncul, MiniMax-M3 tetap menjadi model dalam pasangan ini yang dapat Anda mintai pertanggungjawaban — dan yang lebih baru tetap menjadi pratinjau yang lebih cepat, lebih terkendali, tetapi belum terukur, yang diputuskan MiniMax untuk ditagih per bulan alih-alih per token.

