
Mistral Large 4 vs MiniMax M3: Berapa Biaya dari Kemajuan Lima Bulan
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 151 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 116 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 249 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
MiniMax M3 adalah model termurah di kelas ini dan telah demikian sejak 31 Mei 2026. Dengan $0,30 per juta token input, $1,20 per juta output, dan $0,06 per juta yang di-cache, harganya memotong Mistral Large 4 sekitar setengah pada input dan dua kali pada output — dan tidak seperti model yang lebih baru, Anda dapat membelinya hari ini tanpa label pratinjau yang melekat. Mistral Large 4, model open-weight dengan 1,05 triliun parameter dalam pratinjau publik sejak 6 Oktober 2026, berbiaya $0,68 dan $2,09 dan menjanjikan bobot pada akhir bulan ini. Dua unggulan open-weight, berselang lima bulan, dan lima bulan itu terlihat tepat di satu tempat: skor Intelligence Index independen M3 sebesar 29,2 dibandingkan skor Mistral Large 4 yang belum ada.
Itulah bentuk jujur dari perbandingan ini, dan itu lebih menarik daripada yang ditunjukkan oleh tabel harga. M3 dibangun di sekitar taruhan arsitektural yang spesifik — MiniMax Sparse Attention, yang dipertahankan lebih dari satu juta token konteks, dengan video sebagai input kelas utama — dan di atas kertas ia menang dalam dua kategori yang tidak diperebutkan Mistral Large 4: panjang output mentah dan video native. Di semua aspek lainnya, model yang lebih barulah yang lebih ingin dimiliki pembeli, dengan harga yang masih cukup rendah sehingga perbedaan itu jarang menentukan pembelian.
Dua arsitektur, dua taruhan
MiniMax M3 adalah model fondasi open-weight unggulan MiniMax dan yang pertama menggabungkan performa coding dan agentic terdepan, jendela konteks sejuta token, dan multimodalitas native dalam satu rilis. Model ini menerima teks, gambar, dan video serta mengembalikan teks, dan dibangun di atas MiniMax Sparse Attention, arsitektur yang dirancang untuk mempertahankan hingga 1.048.576 token konteks dengan batas bawah yang dijamin sebesar 512K. Pipeline pra-pelatihan dibangun ulang untuk menskalakan melampaui 100 triliun token dengan data multimodal sejak langkah pertama, bukan ditambahkan belakangan. Output maksimumnya adalah 512.000 token.
Mistral Large 4 membuat taruhan yang berbeda. Ini adalah model mixture-of-experts granular, 49 miliar parameter aktif dari total 1,05 triliun, dengan encoder visi 1,6 miliar parameter, dilatih dari awal pada 3.800 GPU NVIDIA Grace Blackwell di dalam pusat data Eropa milik Mistral sendiri pada data yang mencakup lebih dari 160 bahasa. Model ini menerima teks dan gambar — bukan video — dalam konteks sekitar satu juta token, dan Mistral memposisikannya pada penerapan berdaulat: infrastruktur Eropa, bobot terbuka, dan kemampuan menjalankannya di bawah kebijakan Anda sendiri, dengan keamanan siber sebagai kasus penggunaan unggulan.
• Jendela konteks — MiniMax M3 1.048.576 token vs Mistral Large 4 sekitar 1.000.000
• Output maksimum — MiniMax M3 512.000 token vs Mistral Large 4 belum didokumentasikan
• Modalitas input — MiniMax M3 teks, gambar, dan video vs Mistral Large 4 teks dan gambar
• Harga input — MiniMax M3 $0,30 per 1 juta vs Mistral Large 4 $0,68 per 1 juta
• Harga output — MiniMax M3 $1,20 per 1 juta vs Mistral Large 4 $2,09 per 1 juta
• Input cache — MiniMax M3 $0.06 per 1 juta vs Mistral Large 4 $0.07 per 1 juta
• Parameter — Mistral Large 4 total 1,05T / 49B aktif vs MiniMax M3 tidak diungkapkan
• Dirilis — Mini M3 31 Mei 2026 vs Mistral Large 4 6 Oktober 2026, pratinjau
• Bobot — keduanya lisensi terbuka, milik Mistral Large 4 dijanjikan pada akhir Oktober 2026

Papan skornya tidak ketat, dan juga tidak adil.
Pada Artificial Analysis Intelligence Index v4.3.2, MiniMax M3 mencetak 29,2 dan berada di peringkat ke-62 dari 147 model. Itu hasil papan tengah dan bukan kritik terhadap model — Index tersebut direvisi setelah rilis M3 dan mencakup evaluasi yang belum ada saat MiniMax dilatih. Subskor coding-nya menunjukkan cerita yang lebih baik: 58,6 pada indeks AA Coding, peringkat ke-46 dari 138, dan 65,2% pada Terminal-Bench 2.1. Model ini mempertahankan 92,9% pada GPQA Diamond, 83% pada recall konteks panjang, dan 47,1% pada SciCode.
Mistral Large 4 tidak memiliki skor Index di papan yang sama; halaman itu sudah tayang dengan judul "Mistral Large 4 Preview" dan angkanya tidak ada. Yang dipublikasikan Mistral adalah bahwa ML4 memimpin DeepSeek V4 Pro 0813 dan Qwen3 Max pada Coding Agent Index gabungan dengan 49,8%, dan bahwa pada AutomationBench — 657 alur kerja bisnis di Gmail, Sheets, Slack, dan Salesforce — model ini mencetak 59,9%, di depan Kimi K3, MiMo-V2.6-Pro, dan DeepSeek V4 Pro. MiniMax tidak disebutkan dalam kedua perbandingan itu, yang dengan sendirinya menjadi sinyal tentang model mana yang dianggap Mistral sebagai pesaing sebenarnya.
Jadi pembacaan yang adil adalah ini: M3 adalah model yang mumpuni, murah, dan terdokumentasi baik dengan skor umum papan tengah serta profil pengodean yang terhormat, berumur lima bulan. ML4 adalah model pratinjau dengan plafon yang diklaim lebih tinggi, tanpa skor umum yang dipublikasikan, dan serangkaian angka agentik yang dievaluasi Artificial Analysis secara privat dan akan dipublikasikan di Coding Agent Index saat harness itu dirilis. Jika Anda memerlukan angka hari ini, M3 memberikannya. Jika Anda bisa menunggu beberapa minggu, ML4 juga akan memberikannya, dan Mistral bertaruh angka itu akan lebih tinggi.
Di mana M3 sama sekali tidak memiliki persaingan dari ML4
Dua baris dalam daftar itu bukan trade-off, melainkan sebuah ketiadaan.
Input video adalah yang pertama. M3 menerima video secara native, bersama teks dan gambar. Mistral Large 4 menerima teks dan gambar, tidak ada yang lain — kajian mendalam Mistral sendiri membahas grounding pada citra satelit gigapiksel dan gambar teknik, yang masih merupakan pekerjaan gambar. Jika pipeline Anda memasukkan rekaman layar, rekaman pengawasan, atau dokumentasi video, ML4 tidak dapat menjadi modelnya, berapa pun harganya. Itu bukan kesenjangan yang akan ditutup Mistral dengan penetapan harga ulang.
Panjang output adalah yang kedua. M3 menghasilkan hingga 512.000 token dalam satu respons. Mistral belum menerbitkan batas output untuk ML4. Menghasilkan artefak terstruktur yang panjang dalam satu kali proses — laporan lengkap, skrip migrasi besar, spesifikasi lengkap — adalah beban kerja di mana batas 512K lebih berharga daripada satu poin Intelligence Index, dan sampai Mistral mendokumentasikan batas ML4, M3 adalah satu-satunya dari keduanya yang dapat Anda jadikan dasar untuk merencanakan beban kerja itu.
Angka agentik M3 yang dilaporkan vendor memperkuat profil yang sama. MiniMax menempatkannya pada 83,5 di BrowseComp untuk riset web otonom, 70 di OSWorld-verified untuk penggunaan komputer, 74,2 di MCP Atlas untuk penggunaan alat, 76,7 pada rubrik GDPval, dan 59 di SWE Bench Pro. Angka-angka itu berasal dari evaluasi MiniMax sendiri dan belum direproduksi secara independen, dan posisinya terasa janggal dibandingkan skor Indeks 29,2-nya — yang justru menjadi alasan mengapa perbedaan vendor versus independen itu penting. Sebuah model bisa memimpin benchmark pilihan vendor dan berada di papan tengah pada rata-rata netral sepuluh evaluasi, dan kedua hal itu bisa sama-sama benar.
Apakah 2x sepadan?
Selisih harga di sini benar-benar kecil secara absolut, yang mengubah perhitungan dibandingkan dengan ketidakcocokan terhadap model unggulan tertutup. Ambil contoh bulan dengan seratus juta token pada rasio input/output 4:1: 80 juta token input dan 20 juta output. M3 menagih $24 plus $24, total $48. Mistral Large 4 menagih $54,40 plus $41,80, total $96,20. Biaya tambahannya sekitar $48 per bulan — uang yang nyata dalam skala besar, tetapi jenis selisih yang bisa terbayar oleh satu kegagalan yang berhasil dihindari.
Caching mempersempitnya lebih jauh dan hanya sedikit menguntungkan M3: $0.06 versus $0.07 per juta token yang di-cache adalah kesalahan pembulatan pada tingkat harga ini. Keduanya cukup murah sehingga keputusan harus dibuat berdasarkan kemampuan dan kesesuaian, bukan berdasarkan tagihan, yang merupakan kebalikan dari kesan pembandingan ini pada pandangan pertama.
Yang dibeli oleh premi adalah rentang. ML4 dilatih lima bulan kemudian dengan data yang lebih baru, dalam tata letak mixture-of-experts dengan satu triliun parameter dan 49 miliar aktif, dan Mistral menjalankan reinforcement learning padanya pada 33 miliar token per hari yang dinyatakan, dengan proses yang belum jenuh. M3 sudah selesai; ML4 terus meningkat pada irama yang dipublikasikan. Ketika vendor mengatakan model yang Anda beli hari ini adalah versi terlemah yang akan pernah Anda bayar, dan premi atas model yang ada saat ini di bawah satu dolar per juta token, model yang lebih baru biasanya menjadi default yang lebih baik. Pengecualiannya adalah dua beban kerja di atas, di mana model yang lebih lama adalah satu-satunya yang cocok.
Perutean mengelilingi celah

Ini adalah pasangan di mana menjalankan keduanya bukan sekadar langkah berjaga-jaga, melainkan justru jawaban yang sebenarnya, karena kedua model ini unggul di area yang tidak saling tumpang tindih. Video masuk, artefak panjang keluar, atau loop penggunaan komputer: M3. Analisis dokumen dan gambar, alur kerja agentik, atau apa pun yang perlu berjalan di infrastruktur Eropa berdasarkan kebijakan Anda sendiri: ML4. Tidak ada aturan perutean yang membuat salah satunya menjadi redundan.
Keduanya berada di balik satu endpoint yang kompatibel dengan OpenAI di OrcaRouter dengan markup 0% dan harga daftar penyedia diteruskan tanpa dimodifikasi, yang menjaga rentang harga lima bulan tetap jujur — jika MiniMax memotong tarif M3 atau Mistral mengakhiri tarif pratinjau, angka yang menjadi acuan evaluasi rute Anda berubah pada hari yang sama. DSL perutean inilah yang mengubah kekuatan-kekuatan yang saling lepas menjadi satu antarmuka panggilan: aturan yang memeriksa modalitas permintaan mengirim payload yang membawa video ke M3 dan segala hal lainnya ke ML4, dengan keyakinan bahwa gangguan sesaat pada ketersediaan model pratinjau diserap oleh failover otomatis alih-alih menjalar ke pengguna Anda. Ketika satu keluaran lebih penting daripada satu harga, fusi model dapat menjalankan keduanya dan membiarkan sebuah panel memilih, yang merupakan cara masuk akal untuk membeli plafon yang diklaim Mistral sambil mempertahankan perilaku terdokumentasi M3 sebagai lantai.

Vonis
MiniMax M3 adalah jawaban yang tepat untuk dua beban kerja dan jawaban yang dapat dipertahankan untuk beban kerja ketiga. Masukan video, generasi sekali jalan dengan ratusan ribu token, dan agen penggunaan komputer adalah wilayahnya, harganya paling rendah di antara semua model unggulan di kelas ini, dan skor papan tengahnya yang dipublikasikan berarti Anda tahu persis apa yang akan Anda dapatkan. Usia lima bulan bukanlah usia tua bagi model yang belum terungguli di ceruknya sendiri.
Mistral Large 4 adalah pilihan default yang lebih baik untuk segala hal lainnya. Satu bulan dengan seratus juta token biayanya sekitar $48 lebih mahal, jumlah parameter dan asal-usul pelatihan Eropanya menunjukkan batas atas yang lebih tinggi, klaim keamanan sibernya cukup spesifik untuk dapat diverifikasi, dan bobot terbuka yang dijanjikan plus penerapan on-premises memenuhi persyaratan yang tidak dipenuhi oleh pendekatan enterprise M3 yang hanya API. Harga dari taruhan itu adalah Anda berkomitmen pada model yang skor Independent Intelligence Index-nya belum dipublikasikan dan yang perilakunya, menurut Mistral, akan berubah secara substansial dalam hitungan minggu.
Dua tanggal yang menyelesaikan hal ini: akhir Oktober 2026, ketika bobot ML4 entah benar-benar hadir atau janji open-weights mulai tampak lemah, dan publikasi Coding Agent Index, tempat 49,8% milik Mistral yang dievaluasi secara privat bertemu dengan skor coding publik 58,6 milik M3 pada revisi yang sama. Sampai saat itu, M3 adalah model yang dapat Anda verifikasi dan ML4 adalah model yang Anda pertaruhkan — dan dengan premi bulanan $48 untuk seratus juta token, itu bukan taruhan yang besar.
