Kartu hero yang dihasilkan berjudul MiniMax M3.1 Flash Preview vs MiniMax M3, dengan subjudul 'Model terbaru dalam lini ini bukan yang paling aman untuk dipanggil'. Kartu kiri bertuliskan 'MiniMax M3.1 Flash Preview: Token Plan $22-$132 per bulan, tidak ada tarif per token yang dipublikasikan, tanpa bobot, thinking selalu aktif'; kartu kanan bertuliskan 'MiniMax M3: $0.30 / $1.20 per juta token, bobot terbuka, thinking dapat dimatikan'. Footer bertuliskan 'Keduanya memiliki jendela konteks 1M token. Angka MiniMax M3.1 Flash Preview berdasarkan platform.minimax.io.'
Guides & Insights

MiniMax M3.1 Flash Preview vs MiniMax M3: Ketika Model yang Lebih Baru Justru Lebih Berisiko

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Dokumentasi vendor itu sendiri sekarang mencantumkan MiniMax-M3.1-Flash-Preview di atas MiniMax-M3, dan urutan itu sangat berperan dalam mempersuasi. Ini adalah model teks terbaru di lini tersebut, ia mengusung jendela konteks satu juta token yang sama, dan ia menambahkan kontrol kedalaman berpikir yang tidak dimiliki model lama. Yang tidak ditunjukkan tabel adalah bahwa model lama adalah satu-satunya dari keduanya yang dapat Anda unduh, yang harga per tokennya tersedia, yang dapat di-benchmark terhadap apa pun, atau yang dapat dipanggil tanpa langganan — dan bahwa model yang lebih baru telah menghilangkan sakelar yang diberikan MiniMax-M3 kepada Anda.

Ini bukan cerita tentang sebuah model yang digantikan. Ini adalah cerita tentang vendor yang memecah lini produknya sendiri menjadi pekerja keras berbasis meteran dan pratinjau yang dibatasi langganan, dan keduanya tidak dapat dipertukarkan dalam arah mana pun. Inilah apa sebenarnya masing-masing dari keduanya.

Dua lembar spesifikasi, berdampingan

Mulailah dari apa yang dinyatakan halaman milik vendor sendiri untuk keduanya, sebab bentuk perbedaannya tampak di sini, bukan pada tabel benchmark.

• Diumumkan — MiniMax-M3 pada 1 Juni 2026 dengan catatan arsitektur, lembar benchmark, dan kartu tarif; MiniMax-M3.1-Flash-Preview pada 27 September 2026 dengan entri dokumentasi dan postingan di akun agen MiniMax • Jendela konteks — 1.000.000 token untuk keduanya, menurut tabel model MiniMax sendiri • Output maksimum — 512.000 token untuk MiniMax-M3 pada entri katalog kami, angka yang tidak diterbitkan sendiri oleh MiniMax; tidak diterbitkan untuk MiniMax-M3.1-Flash-Preview di mana pun • Modalitas input — teks, gambar, dan video masuk, teks keluar, untuk keduanya • Kontrol thinking — parameter thinking yang dapat diminta untuk dilewati oleh MiniMax-M3, dan yang dapat dipisahkan ke dalam bidang reasoning_details melalui reasoning_split; pada MiniMax-M3.1-Flash-Preview thinking bersifat wajib dan reasoning_split tidak dapat dimatikan • Kedalaman thinking — tidak tersedia pada MiniMax-M3; sebuah tangga effort dari low, medium, high, xhigh dan max, dengan nilai default max, pada MiniMax-M3.1-Flash-Preview • Kecepatan output yang dipublikasikan — sekitar 100+ token per detik untuk MiniMax-M3, menurut tabel model MiniMax sendiri; tidak ada yang dipublikasikan untuk MiniMax-M3.1-Flash-Preview • Bobot — MiniMax-M3 bersifat open-weight dengan repositori publik; MiniMax-M3.1-Flash-Preview tidak memilikinya • Harga — $0,30 per juta token input dan $1,20 per juta token output untuk MiniMax-M3 pada tarif penyedia; tidak ada tarif per token untuk MiniMax-M3.1-Flash-Preview • Akses — MiniMax-M3 tersedia dengan pay-as-you-go dan Token Plan, serta dapat dirutekan melalui platform pihak ketiga; MiniMax-M3.1-Flash-Preview hanya dengan Token Plan dan MiniMax Code

Dua baris di sana termasuk dalam kategori yang berbeda dari yang lainnya. Kecepatan keluaran yang dipublikasikan hanyalah angka dari vendor untuk model lama saja, jadi model yang lebih baru dijual sebagai yang cepat tanpa disertai angka. Dan kontrol proses berpikirnya bergerak ke arah yang berlawanan dengan pemasarannya: model yang lebih baru menawarkan kontrol yang lebih halus atas seberapa banyak ia berpikir, tetapi menghilangkan kemampuan Anda untuk menghentikannya berpikir sama sekali.

Sakelar yang diambil MiniMax

Ini adalah detail yang paling mungkin menimbulkan masalah, dan hal ini didokumentasikan, bukan disembunyikan. Dengan MiniMax-M3, mengirim thinking: {"type": "disabled"} di endpoint yang kompatibel dengan OpenAI akan melewati penalaran dan mengembalikan jawaban langsung; di endpoint yang kompatibel dengan Anthropic, penalaran nonaktif secara default dan dapat diaktifkan dengan adaptive. Pada MiniMax-M3.1-Flash-Preview, permintaan yang identik mengembalikan HTTP 400 dengan pesan memerlukan penalaran adaptif. Tidak ada cara yang didukung untuk mendapatkan respons tanpa penalaran.

Secara praktis, itu berarti bahwa beban kerja yang menggunakan MiniMax-M3 sebagai pengklasifikasi atau router yang murah dan cepat — prompt singkat masuk, jawaban terstruktur singkat keluar, tanpa rantai pemikiran — tidak memiliki jalur peningkatan langsung ke model yang lebih baru. Anda dapat menurunkan upaya ke rendah, dan panduan MiniMax secara eksplisit menyatakan bahwa menurunkan upaya adalah cara yang dimaksudkan untuk mengurangi latensi dan token pemikiran alih-alih menonaktifkannya. Namun token dan latensinya tidak menjadi nol, dan untuk pekerjaan ekstraksi bervolume tinggi yang menulis empat bidang per panggilan, "selalu berpikir terlebih dahulu" adalah bentuk biaya yang berbeda dari "berpikir saat diminta".

A generated two-column scoreboard titled 'MiniMax M3.1 Flash Preview vs MiniMax M3 — the scoreboard'. The left column, MiniMax M3.1 Flash Preview, reads 'AA Intelligence: none published', 'Thinking off: not allowed (HTTP 400)', 'Thinking depth: effort low to max', 'Published speed: none', 'Open weights: no', 'Per-token price: not published'. The right column, MiniMax M3, reads 'AA Intelligence: 29.2', 'Thinking off: supported', 'Thinking depth: not available', 'Published speed: 100+ tokens per second (vendor)', 'Open weights: yes', 'Per-token price: $0.30 / $1.20'. A footer reads 'MiniMax M3 figures per Artificial Analysis and MiniMax; MiniMax M3.1 Flash Preview has no independent scores of any kind.'

Apa yang sebenarnya diukur pada masing-masing

Satu sisi perbandingan ini memiliki angka dan sisi lainnya memiliki kolom kosong, dan ada baiknya kita tepat tentang angka mana milik siapa.

Rekor independen MiniMax-M3 itu nyata: Artificial Analysis menempatkannya di 29,2 pada Intelligence Index — ke-60 dari 145 — dengan 58,6 pada Coding Index, 59,18 pada indeks Matematikanya, 92,9% pada GPQA Diamond dalam keluarga indeks yang sama, recall konteks panjang 83%, dan 82,9% pada IFBench. Itu semua adalah evaluasi pihak ketiga atas model yang bisa diunduh dan dijalankan ulang oleh siapa saja. Angka peluncuran M3 dari MiniMax sendiri — BrowseComp 83,5%, SWE-Bench Pro 59,0%, Terminal-Bench 2.1 66,0%, MCP Atlas 74,2%, OSWorld-Verified 70% — adalah angka dari vendor dan kami belum melihatnya direproduksi.

MiniMax-M3.1-Flash-Preview tidak memiliki keduanya. MiniMax tidak menerbitkan tabel benchmark, dan model tersebut tidak memiliki entri pada indeks Artificial Analysis, sehingga tidak ada skor independen, tidak ada indeks coding, tidak ada angka recall konteks panjang, dan tidak ada pengukuran halusinasi. Setiap karakterisasi tentangnya yang beredar — "cepat", "andal", "dibuat untuk pengembangan sehari-hari" — adalah kata sifat milik vendor sendiri dari postingan peluncuran. Ketiadaan itu layak dinyatakan secara gamblang karena hal itu berlaku dua arah: tidak ada yang ditunjukkan lebih buruk, dan tidak ada yang ditunjukkan lebih baik.

Asimetri itulah keseluruhan keputusannya. Anda dapat mengevaluasi MiniMax-M3 sore ini dengan mengunduhnya atau memanggilnya, dan Anda dapat membandingkan evaluasi itu dengan papan skor publik. Dengan MiniMax-M3.1-Flash-Preview, Anda hanya dapat menggunakannya dan membentuk pendapat pribadi.

Di mana model yang lebih baru benar-benar unggul

Akan mudah untuk membaca uraian di atas sebagai argumen untuk mengabaikan model baru, dan itu juga bukan kesimpulan yang tepat. Ada tiga hal yang nyata dan spesifik tentangnya.

Tangga upaya adalah kemampuan yang sesungguhnya, bukan tombol on/off. Lima tingkat — rendah hingga maks — memungkinkan satu model melayani penggantian nama rutin dan refaktor di seluruh repositori pada biaya komputasi yang berbeda, dan ini efektif hanya untuk Fast model. Di M3, pilihan ada di tangan Anda. Jika masalah Anda adalah tidak dapat memprediksi tingkat kesulitan per tugas, pengaturan yang dapat disetel adalah persis kontrol yang Anda inginkan.

Ini adalah model peringkat teratas vendor saat ini, yang berarti model ini mewarisi apa pun yang telah dipelajari garis keturunan seri M sejak Juni, dan MiniMax secara eksplisit menyatakan bahwa ini adalah model terbaru untuk penalaran agentik, penggunaan alat, pengodean, dan tugas konteks panjang. Mekanisme penggunaan alat dengan pemikiran berjalin yang diperkenalkan M3 tetap dipertahankan, termasuk persyaratan untuk menambahkan respons lengkap — blok pemikiran dan semuanya — kembali ke riwayat pesan.

Dan ini menerima video, pada titik harga Flash, di dalam langganan. MiniMax-M3 juga melakukannya, dengan harga per token. Jika Anda sudah membayar kursi Token Plan dan satu-satunya hambatan Anda untuk menggunakan input video adalah biaya marginal per panggilan, M3.1-Flash-Preview menghilangkan hambatan itu.

Di mana model lama masih menjadi pilihan utama

Tiga kasus, semuanya tentang prediktabilitas, bukan kualitas.

Saat Anda perlu memodelkan biaya. MiniMax-M3 memiliki daftar tarif: $0.30 per juta token input, $1.20 per juta output, dan tarif baca-cache $0.06 per juta di katalog kami. Anda dapat memperkirakan tagihan bulanan suatu beban kerja hingga satuan sen sebelum menjalankannya. MiniMax-M3.1-Flash-Preview tidak memiliki tarif per token di mana pun di halaman MiniMax, jadi biayanya adalah langganan Anda dibagi sebanyak apa pun Anda menggunakannya — bagus untuk anggaran tetap, tidak berguna untuk ekonomi unit.

Ketika Anda membutuhkan model yang benar-benar menjadi model. MiniMax-M3 adalah model berbobot terbuka: Anda dapat mengunduhnya, menjalankannya di perangkat keras Anda sendiri, dan mengetahui bahwa artefak yang menjawab panggilan Anda enam bulan dari sekarang adalah artefak yang sama yang menjawabnya hari ini. MiniMax-M3.1-Flash-Preview tidak memiliki checkpoint, dan akses tingkat pratinjau berarti tumpukan penyajian, komposisi kuota, dan ketersediaan semuanya dikendalikan vendor dan secara eksplisit dapat berubah.

Saat Anda membutuhkan jawaban tanpa penalaran. Seperti di atas — inilah satu-satunya regresi kemampuan dalam perbandingan tersebut, dan inilah yang mengejutkan orang, karena model yang lebih baru yang tidak bisa melakukan sesuatu yang bisa dilakukan model lama bukanlah kasus yang direncanakan siapa pun.

A headless Chromium screenshot of MiniMax's own model documentation page, showing the note that MiniMax-M3.1-Flash-Preview is available only through Token Plan and MiniMax Code for now, followed by the language model table in which MiniMax-M3.1-Flash-Preview is listed first with a 1,000,000-token context window and the description 'Frontier multimodal coding model with 1M context window and tunable thinking depth', above MiniMax-M3 with the same 1,000,000-token window, captured 28 September 2026.

Memanggil keduanya dari satu tempat

Yang janggal di sini adalah kedua model itu dibeli dengan cara yang berbeda — satu diukur pemakaiannya, satu lewat langganan — dan naluri alaminya adalah memihak. Langkah yang lebih berguna adalah merutekan di antara keduanya berdasarkan bentuk tugas, yang hanya berhasil jika sisi yang diukur pemakaiannya dapat dijangkau dari tempat yang sama dengan semua hal lainnya.

MiniMax-M3 di OrcaRouter membawa harga daftar MiniMax dengan tambahan markup 0%, sehingga $0,30 dan $1,20 pada daftar tarif adalah biaya satu panggilan, tanpa margin platform tambahan di atasnya. Model ini berada di endpoint yang sama yang kompatibel dengan OpenAI seperti MiniMax M2.7 — harga $0,30/$1,20 yang sama untuk jendela 200.000 token, juga open-weight — dan seperti 200+ model lainnya, melalui satu kunci API, dengan failover otomatis antar penyedia ketika satu endpoint bermasalah. Dibandingkan dengan telemetri kami sendiri, yang merupakan jenis angka berbeda dari milik vendor: selama tujuh hari terakhir M3 telah menjawab pada sekitar 238 token output per detik dengan p50 sekitar 4,1 detik untuk token pertama, dengan tingkat kesalahan mendekati 0,15%, diukur di playground OrcaRouter. Jika Anda ingin mempertahankan MiniMax-M3 sebagai bagian yang andal dalam sebuah pipeline dan memperlakukan MiniMax-M3.1-Flash-Preview sebagai bagian eksperimental, bagian yang andal itu cukup satu baris konfigurasi, bukan hubungan dengan vendor kedua. MiniMax-M3.1-Flash-Preview sendiri tidak ada di katalog kami; rute menuju model itu adalah Token Plan dan produk coding milik vendor itu sendiri.

Apa yang akan mengubah artikel ini bersifat spesifik dan mudah untuk dicermati. Kartu tarif yang dipublikasikan untuk MiniMax-M3.1-Flash-Preview akan meruntuhkan alasan utama untuk lebih memilih M3 secara ekonomi. Serangkaian skor independen akan menggantikan kolom kosong itu dengan sesuatu yang dapat dibandingkan. Checkpoint yang dapat diunduh akan menghilangkan keberatan soal reproduktibilitas. Sampai setidaknya salah satu dari itu muncul, MiniMax-M3 tetap menjadi model dalam pasangan ini yang dapat Anda mintai pertanggungjawaban — dan yang lebih baru tetap menjadi pratinjau yang lebih cepat, lebih terkendali, tetapi belum terukur, yang diputuskan MiniMax untuk ditagih per bulan alih-alih per token.

A headless Chromium screenshot of the OrcaRouter model page for minimax/minimax-m3, showing the model title 'MiniMax: MiniMax M3', a context length of 1,048,576 tokens, a maximum output of 512,000 tokens, and a pricing panel reading 0.300 US dollars per million input tokens, 1.20 per million output tokens and 0.060 per million cache-read tokens, captured 28 September 2026.