Kartu hero yang dihasilkan berjudul MiniMax M3.1, dengan lencana bertuliskan 'BELUM DIVERIFIKASI - BELUM DIRILIS' dan subjudul 'Checkpoint privat 250 GB, catatan arsitektur yang bocor, dan vendor yang belum mengatakan apa pun'. Tiga chip bertuliskan 'Checkpoint: MiniMax-M3.1-preview-private', '62 file / 48 safetensors / 250 GB' dan 'Jendela pantau: minggu 28 September 2026'. Kartu kiri bertuliskan 'Klaim: sparse attention, Q8KV4 attention, NVFP4 experts, DSpark spec-decode, dan bidang reasoning_effort baru'; kartu kanan bertuliskan 'Belum ada peluncuran yang dikonfirmasi: tidak ada bobot, tidak ada kartu model, tidak ada halaman harga, tidak ada ID model API'. Logo OrcaRouter berada di kanan bawah.
Guides & Insights

MiniMax M3.1: Apa Isi Dokumen Pratinjau yang Bocor — dan Apa yang Belum Dikonfirmasi Siapa pun

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ada checkpoint 250 GB di Hugging Face bernama MiniMax-M3.1-preview-private yang tidak dapat dibuka oleh siapa pun di luar segelintir mitra inferensi. Ada dokumen bertanggal 22 September yang isinya persis seperti catatan arsitektur vendor, beredar di repositori rekayasa mitra publik alih-alih di situs vendor sendiri. Dan pada 26 September, seorang pengamat model yang banyak diikuti memposting bahwa MiniMax M3.1 adalah "model berikutnya yang akan datang untuk minggu depan" dan bahwa mereka sudah menguji pratinjaunya. Gabungkan ketiganya, dan Anda mendapatkan seluruh catatan publik MiniMax M3.1 — model yang nama, delta arsitektur, jumlah bobot, dan pekan kedatangannya semuanya beredar, dan tidak satu pun darinya pernah dibicarakan vendor di publik. Pendahulunya, MiniMax M3, adalah cerita yang berbeda: model itu sudah dirilis, dan itulah alasan orang peduli pada yang ini.

Ini adalah bagaimana sebuah model yang belum dirilis terlihat dari luar, dan penting untuk tepat mengenai bentuk buktinya, karena ketiga untaian itu tidak sama kuat. Keberadaan checkpoint tersebut didukung: beberapa jalur independen menunjuk pada nama repositori privat yang sama dan jumlah file yang sama. Dokumen arsitekturnya tidak didukung seperti itu — itu transkripsi pihak ketiga, dan bisa jadi asli, kedaluwarsa, atau sebagian direkayasa. Klaim "pekan mendatang" adalah ekspektasi seseorang, bukan jadwal. Semua hal dalam artikel ini diberi label sesuai kekuatan yang sebenarnya dimilikinya, dan tidak ada di sini yang boleh dibaca sebagai pengumuman rilis.

Yang membuat MiniMax M3.1 layak ditulis sebelum model itu ada adalah pendahulunya. MiniMax M3, menurut sebagian besar penilaian, adalah model berbobot terbuka terkuat yang pernah dirilis MiniMax — model teks-gambar-video dengan 1 juta token yang mencapai Artificial Analysis Intelligence Index di angka 29,2 dan masih menjadi salah satu dari sedikit model terbuka yang mampu menjaga konteks yang benar-benar panjang tetap utuh. Jika M3.1 hadir pada pekan terakhir September, angka yang penting bagi pengembang bukanlah masuk akal atau tidaknya kebocoran itu, melainkan apa yang berubah pada lapisan-lapisannya dan berapa biaya untuk menyajikannya — dan pada keduanya, dokumen yang bocor itu luar biasa spesifik.

Apa yang sudah dikonfirmasi, dan apa yang hanya beredar

Pembagian yang jujur, per 27 September 2026:

• Terkonfirmasi: tidak ada versi publik dari MiniMax M3.1. Organisasi MiniMaxAI di Hugging Face mengembalikan 401 — respons platform "tidak ditemukan atau tidak terlihat oleh Anda" — untuk MiniMaxAI/MiniMax-M3.1, MiniMaxAI/MiniMax-M3.1-preview, dan MiniMaxAI/MiniMax-M3.1-preview-private, semuanya sama. Unggahan publik terbarunya masih MiniMax-Music3 (7 Agustus 2026) dan MiniMax-H3 (28 Juli 2026).

• Terkonfirmasi: MiniMax M3.1 tidak dapat dirutekan di mana pun yang dapat kami periksa. Model ini tidak ada dalam katalog model OrcaRouter dan dalam daftar publik yang kami pantau; model MiniMax yang benar-benar dapat Anda panggil saat ini adalah MiniMax M3, di minimax/minimax-m3.

• Terkonfirmasi: MiniMax belum menerbitkan apa pun. Tidak ada kartu model, tidak ada postingan blog, tidak ada halaman harga, tidak ada bobot, tidak ada ID model API. Tidak ada liputan pers tentang peluncuran karena belum ada peluncuran.

• Dalam peredaran: dokumen arsitektur. Dokumen itu direproduksi secara verbatim di repositori publik — longsco/innoferra-eval, rangkaian onboarding mitra untuk endpoint model yang dihosting, dibuat 23 September 2026 — dengan nama file PREVIEW-20260922.md, dengan tajuk yang mendeskripsikannya sebagai dokumen vendor yang dibagikan pada 25 September dan peringatan bahwa "nama model, tanggal rilis penyedia, dan peluncuran publik tetap bergantung pada rilis yang sebenarnya." Itu adalah sikap berhati-hati dokumen itu sendiri, bukan sikap kami, dan itu yang tepat: salinan catatan vendor oleh pihak ketiga bukanlah pernyataan MiniMax.

• Beredar: checkpoint 250 GB dan drop keduanya. Spesifikasi onboarding repositori mencatat checkpoint multimodal privat di MiniMaxAI/MiniMax-M3.1-preview-private — 62 file, 48 file safetensors, sekitar 250 GB, string arsitektur MiniMaxM3SparseForConditionalGeneration — lalu drop kedua yang lebih besar, MiniMax-M3.1-preview2-dspark-private, dengan 101 file dan sekitar 236 GB, yang menambahkan draft spekulatif fp8 berukuran 2.3 GB. Keduanya privat. Kami tidak dapat membuka salah satu pun, dan Anda juga tidak bisa.

• Yang beredar: garis waktunya. Postingan 26 September adalah satu-satunya penanggalan publik yang ditawarkan siapa pun, dan "pekan mendatang" hanyalah sebuah ekspektasi. Anggap pekan 28 September sebagai jendela yang perlu dicermati, bukan sebagai tanggal pasti.

Satu dokumen yang memuat detail teknis

A headless Chromium screenshot of the public GitHub page for the file PREVIEW-20260922.md inside the repository longsco/innoferra-eval, showing the file path models/minimax-m3.1/PREVIEW-20260922.md, the markdown body describing MiniMax M3.1's sparse attention across all layers, the Q8KV4 attention quantisation in E2M1 blocks of 16 with a per-block E4M3 scale of amax/6 clamped to [1/512, 448] and round-half-to-even thresholds, the W4A4 NVFP4 routed experts with FC1 row scale 2688 divided by the row absolute maximum and FC2 fixed scale 16, the DSpark speculative-decoding head with no confidence head, the new reasoning_effort field taking max/xhigh/high/medium/low, and the line 'No 3.1 baselines published yet; do not reuse M3 numbers as acceptance bars.'

Segala hal spesifik yang diketahui tentang desain MiniMax M3.1 dapat dilacak kembali ke satu berkas markdown itu, ditambah dua pelengkap di repositori yang sama: dokumen demo SGLang yang menjelaskan bagaimana checkpoint itu seharusnya disajikan, dan sebuah spec.yaml yang seharusnya dipenuhi oleh endpoint mitra. Baca repositori itu secara keseluruhan dan tampilannya seperti penyedia inferensi yang melakukan persis apa yang dilakukan penyedia inferensi — menerima drop awal dari MiniMax, mencatat apa yang berubah, dan membangun rangkaian validasi untuknya. Repositori itu bukan kit pers dan tidak ditulis untuk meyakinkan siapa pun.

Itu adalah satu hal yang menguntungkannya, dan itu juga batas dari apa yang dibuktikannya. Tidak ada apa pun di dalamnya yang ditandatangani oleh MiniMax. Ketiga dokumen itu saling sesuai sebagaimana dokumen nyata saling sesuai — konstanta kuantisasi yang sama, nama variabel lingkungan yang sama, flag peluncuran yang sama — dan saling tidak sesuai sebagaimana rilis nyata saling tidak sesuai: pratinjau 22 September mengatakan metode speculative-decoding baru tidak memiliki confidence head, dan drop checkpoint kedua mengirimkan konfigurasi draf dengan enable_confidence_head disetel ke true. Suatu hasil rekaan biasanya tidak menyertakan alur koreksi. Tetapi "luar biasa koheren" bukanlah "terkonfirmasi", dan mode kegagalan bagi seorang pembaca adalah menyerap konstanta di bawah ini sebagai desain yang dipublikasikan MiniMax, padahal konstanta itu, paling banter, adalah desain privat MiniMax sebagaimana dibaca oleh orang lain.

Kelima perubahan rekayasa, menurut dokumen itu

Berikut adalah selisih antara MiniMax M3 dan MiniMax M3.1 sebagaimana dijelaskan dalam dokumen ini. Setiap baris berasal dari vendor dan belum diaudit — tidak ada pihak independen yang mengukur keluaran MiniMax M3.1 dalam bentuk apa pun.

• Cakupan attention. Full attention pada tiga lapisan pertama digantikan dengan sparse attention, sehingga semua lapisan bersifat sparse. Pada MiniMax M3, tiga lapisan pertama merupakan jangkar full-attention dari tumpukan sparse.

• Presisi atensi — "Q8KV4". Kueri, termasuk kueri pengindeks, keluar dari proyeksi dalam BF16 dan dikonversi ke FP8 E4M3. Kunci dan nilai — sekali lagi termasuk milik pengindeks — dikuantisasi ke E2M1, empat bit, dalam blok 16, dengan skala E4M3 per blok sebesar amax/6 yang diklem ke [1/512, 448]. Dokumen tersebut menegaskan bahwa tangga tersebut menggunakan pembulatan setengah ke genap dengan ambang batas asimetris, bahwa skala tensor luar tepat 1, dan bahwa magnitudo nol harus dikodekan sebagai nol positif. M3 menggunakan jalur KV delapan bit dari keluarga yang sama, jadi ini kembali memangkas separuh byte KV.

• Presisi expert. Para expert yang dirutekan MoE berpindah dari MXFP8 ke W4A4 NVFP4, dengan expert bersama sengaja dikecualikan. Dua proyeksi expert mendapatkan skema aktivasi yang berbeda: FC1 menggunakan skala dinamis per-baris sebesar 2688 dibagi nilai maksimum absolut baris tersebut, dengan skala baris diterapkan setelah GEMM tetapi sebelum fungsi aktivasi; FC2 menggunakan skala luar tetap sebesar 16. Konsekuensi praktisnya, yang dijelaskan dalam README mitra, sangat gamblang: "penyedia yang menjalankan checkpoint melalui jalur NVFP4 generik tanpa ini akan menghasilkan numerik yang berbeda secara diam-diam."

• Decoding spekulatif. Head prediksi multi-token bergaya EAGLE sudah tidak ada, digantikan oleh metode yang disebut MiniMax sebagai DSpark — head Markov vanilla, dan dalam dokumen 22 September, tidak ada head keyakinan. Ini adalah perubahan dengan efek terbesar pada bagaimana endpoint yang dilayani terasa, karena ini adalah satu-satunya tuas kecepatan per-stream dalam desain. Mesin demo yang dikirim MiniMax bersama checkpoint tidak menyertakan DSpark, dan penyedia mengukur selisihnya: pada frame 80.000 token yang sama tanpa spekulasi, throughput per-stream adalah 63,9 token per detik pada konkurensi 1 dan turun di bawah 60 pada konkurensi 4, sehingga kesimpulan dokumen itu sendiri adalah bahwa tanpa DSpark tumpukan tidak dapat mempertahankan target latensinya di bawah beban.

• Sebuah bidang permintaan baru. MiniMax M3.1 menambahkan bidang reasoning_effort tingkat atas yang menerima max, xhigh, high, medium, atau low, yang disuntikkan ke dalam prompt sistem sebagai tag effort oleh template chat. M3 hanya memiliki sakelar thinking dengan adaptive dan disabled. Dokumen tersebut mencatat, secara aneh dan spesifik, bahwa bidang itu dibawa tanpa validasi dan tanpa default yang diwajibkan — yang oleh penyedia dibaca sebagai izin untuk menerima atau menolak nilai yang tidak terdaftar, dan yang berarti dua endpoint yang patuh dapat berperilaku berbeda pada permintaan yang sama.

A generated single-column infographic titled 'MiniMax M3.1 — the scoreboard', listing six vendor-document deltas: 'Attention: all layers sparse', 'KV precision: Q8KV4, E2M1 blocks of 16', 'Routed experts: W4A4 NVFP4', 'Spec-decode: DSpark, no confidence head', 'Reasoning control: reasoning_effort max to low', and 'Benchmarks: none published'. A footer reads 'MiniMax M3.1 terms per a 2026-09-22 vendor preview document cited in partner engineering notes; unaudited, no independent scores exist.' The OrcaRouter logo sits bottom-right.

Dua detail dalam checkpoint ini layak ditandai secara terpisah karena keduanya termasuk hal yang biasanya dihilangkan oleh postingan peluncuran. Pertama, checkpoint ini menyertakan konfigurasi praprosesor citra sekaligus konfigurasi praprosesor video — MiniMax M3.1 adalah model multimodal secara desain, bukan model teks yang kemampuan visinya ditempelkan belakangan, dan panduan dari penyedia sendiri adalah untuk tidak menolak input citra pada stack baru. Kedua, drop checkpoint kedua menghapus kunci MTP dan NEXTN sepenuhnya dan tidak menambahkan apa pun yang menggantikannya, itulah sebabnya draf DSpark harus hadir sebagai artefak terpisah berukuran 2,3 GB. Tidak ada draft head dalam bobot utama yang bisa diaktifkan.

Mengapa tidak ada angka benchmark M3.1, dan mengapa itu bukan kelalaian

Setiap tulisan soal bocoran pada akhirnya sampai ke bagian ketika ia entah mengarang tabel benchmark atau mengakui bahwa dirinya tidak punya. MiniMax M3.1 tidak punya. Spesifikasi mitra menyatakannya secara eksplisit, di sebuah bidang yang ada semata-mata untuk mencegah seseorang membuat kesalahan:

Belum ada baseline 3.1 yang dipublikasikan; jangan gunakan kembali angka M3 sebagai batas penerimaan.

Instruksi itu adalah kalimat paling berguna di seluruh korpus, karena versi malas artikel ini menuliskan skor Artificial Analysis MiniMax M3 di bawah judul MiniMax M3.1. Seharusnya tidak demikian. Repositori yang sama menjalankan uji AIME-25 dan GPQA-Diamond terhadap endpoint M3.1 milik MiniMax sendiri dan mencatatnya sebagai perbandingan rekan setim versus vendor dengan skor yang belum final: pada GPQA-Diamond, 0,904 untuk uji tim melawan 0,813 untuk vendor, dan pada subset MMLU-Pro berisi 600 pertanyaan, 0,898 melawan 0,821. Itu adalah dua kali menjalankan evaluasi yang sama yang tidak sepakat, bukan hasil model, dan keduanya dilabeli sebagai pratinjau dengan pengulangan yang dihitung. Siapa pun yang mengutip satu angka benchmark MiniMax M3.1 hari ini sedang mengutip sesuatu yang belum ada.

Apa itu MiniMax M3, agar ukuran sekuelnya bisa diperkirakan

MiniMax M3 dirilis pada akhir Mei 2026 dan diunggah ke Hugging Face pada 2 Juni — 428 miliar total parameter dengan 23 miliar aktif, 60 lapisan, 128 pakar terarah dengan perutean top-4, 4 kepala KV dibandingkan 64 kepala atensi, dan jendela konteks 1.048.576 token dengan keluaran maksimum 512.000. Di sisi independen, Artificial Analysis memberinya skor 29,2 pada Intelligence Index, menempatkannya di peringkat ke-60 dari 145 model yang disampel, dengan 58,6 pada indeks coding dan p50 3.348 milidetik ke token pertama dalam telemetri perutean kami sendiri. Angka utama MiniMax sendiri untuknya adalah 83,5 pada BrowseComp, yang merupakan angka dari vendor dan tidak diaudit sebagai demikian.

Harga adalah bagian yang paling awet dalam siklus kebocoran. MiniMax M3 dibanderol $0.30 per juta token input dan $1.20 per juta token output, dengan pembacaan cache sebesar $0.06 — dan sudah aktif di OrcaRouter sebagai minimax/minimax-m3, dengan tarif daftar dari penyedia dan markup 0%, jadi jika MiniMax menetapkan harga M3.1 dengan cara yang sama, tarif baru itu langsung aktif di sisi kami pada hari ia tersedia, bukan satu siklus penagihan kemudian.

Inti dari mengulang semua itu bukanlah nostalgia. Intinya adalah bahwa alasan siapa pun menyegarkan halaman organisasi Hugging Face minggu ini adalah karena MiniMax M3 cukup bagus sehingga penerusnya menjadi pertanyaan produksi ketimbang tontonan — dan bahwa model 428 miliar parameter dengan konteks 1M pada $0,30/$1,20 menetapkan patokan harga-kinerja yang harus dilampaui M3.1, bukan hanya patokan kemampuan.

Sudut pandang listing anonim, dan mengapa hal itu mungkin sudah terjawab

Satu utas dari awal September layak ditutup di sini. Sebuah listing stealth anonim muncul di platform coding pihak ketiga dengan konteks 1.000.000 token, harga $0, dan tingkat penalaran wajib, dan kami meliputnya dengan nama Space Bunny Alpha, seraya mencatat tingkat dasar bahwa setiap listing anonim semacam ini pada akhirnya akan diklaim oleh vendor — Pony Alpha menjadi model Zhipu, Hunter Alpha menjadi milik Xiaomi, Ox Alpha menjadi rilis MiniMax dengan nama berbeda. Tokenizer dan sidik jari anomali dalam listing itu mengarah ke checkpoint pratinjau MiniMax. Jika MiniMax M3.1 benar-benar hadir minggu ini, pembacaan yang paling mungkin adalah bahwa listing anonim itu adalah uji lapangannya, dan misteri itu terpecahkan lewat pengumuman, bukan lewat kerja forensik lebih lanjut. Itu inferensi, bukan bukti, dan itu adalah inferensi terakhir dalam tulisan ini.

A headless Chromium screenshot of OrcaRouter's own model page for minimax/minimax-m3, showing the breadcrumb 'Models - MiniMax: MiniMax M3', a summary describing a 428B-parameter MoE with 23B active parameters and a 1M-token context window powered by MiniMax Sparse Attention, a PERFORMANCE panel reading Avg Latency 3.2 s, Throughput 210.9 tok/s, Uptime 100.00%, Total Tokens 89.8M and Error Rate 0.13%, a MiniMax provider card reading 92.07M tokens routed in 7 days, P50 TTFT 4.26s and P95 TTFT 10.00s, and the listing rows 1,048,576 Context window, $0.30/M input and $1.20/M output.

Yang perlu diperhatikan, dan yang perlu dilakukan minggu ini

Sinyal-sinyal yang akan mengubah ini dari kebocoran menjadi peluncuran bersifat spesifik dan dapat diperiksa, dan sinyal-sinyal itu bukan yang paling sering dilacak oleh komentar. Repositori publik Hugging Face di bawah organisasi MiniMaxAI — bukan repositori privat — dengan model card adalah indikator tunggal terkuat; riwayat unggahan organisasi itu bersifat publik dan mencatat tanggal setiap rilis hingga harinya. Halaman model MiniMax atau ID model API adalah yang kedua. Harga yang dipublikasikan adalah yang ketiga, dan yang penting bagi anggaran. Tabel benchmark di Artificial Analysis yang bertanggal setelah peluncuran adalah yang keempat, dan satu-satunya yang independen.

Sampai saat itu, posisi praktis bagi siapa pun yang sedang membangun tidak berubah dari minggu pra-rilis lainnya: model yang dapat Anda rutekan hari ini adalah MiniMax M3, satu kunci API dapat mengaksesnya bersama 200+ model lainnya, failover otomatis berarti endpoint yang goyah tidak menjadi gangguan layanan Anda, dan rute yang disematkan atau campuran melalui routing DSL atau panel model yang menjawab bersama melalui fusi model adalah cara Anda mengurangi risiko model yang belum Anda masukkan ke produksi. Jika M3.1 hadir, itu hanyalah penggantian satu ID model, bukan migrasi — yang merupakan keseluruhan argumen untuk tidak membangun integrasi khusus terhadap kebocoran.

Satu hal yang tidak akan dilakukan artikel ini adalah berpura-pura tahu kapan. Pos pemeriksaannya nyata, dokumen-dokumennya spesifik, dan klaim publik terbaru adalah seseorang yang mengatakan "minggu depan." Dari ketiganya, hanya dua yang pertama yang dapat Anda verifikasi sendiri.