
Mistral Large 4 Adalah Pratinjau 1T-Parameter: Bobotnya Belum Dirilis
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 151 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Mistral Large 4 hadir pada 6 Oktober 2026 sebagai pratinjau publik — model mixture-of-experts dengan satu triliun parameter dan 49 miliar parameter aktif, encoder visi 1,6 miliar parameter, serta klaim dari pembuatnya bahwa ini adalah model open-weight terkuat yang dibangun di luar Tiongkok. Yang belum hadir adalah bagian yang dijelaskan oleh kata "open-weight". Tidak ada checkpoint untuk diunduh hari ini, tidak ada file lisensi, dan tidak ada repositori. Mistral mengatakan bobotnya akan tersedia "pada akhir bulan ini," setelah jendela red-teaming di mana mitra yang telah diverifikasi dan otoritas nasional mendapatkan build yang tidak terkunci dengan moderasi yang dikurangi dan kemampuan siber yang diperluas. Jadi deskripsi yang akurat tentang Mistral Large 4 pekan ini adalah API pratinjau yang dapat Anda panggil dan model yang belum dapat Anda miliki.
Pemisahan itu adalah inti ceritanya, bukan catatan kaki belaka. Setiap angka yang Mistral publikasikan bersama pengumuman — skor coding, skor siber, evaluasi keuangan dan hukum — dihasilkan pada build yang masih terus diubah, dan setiap judul berita yang membandingkannya dengan model frontier tertutup membandingkan artefak yang tidak akan menjadi artefak yang Anda unduh. Hal yang berguna untuk dilakukan dengan peluncuran seperti ini adalah memisahkan apa yang bisa Anda verifikasi hari ini dari apa yang diminta untuk Anda percayai begitu saja, dan tulisan mistral.ai sendiri luar biasa terbuka tentang mana yang mana.
Apa yang sebenarnya live pada 6 Oktober
API pratinjau sudah aktif di Mistral Studio dengan id model mistral-large-4-0. Kartu model milik Mistral sendiri mendeskripsikannya sebagai "model multimodal serbaguna berbobot terbuka yang canggih" yang dibangun di atas arsitektur MoE granular, dan merinci jumlah parameternya menjadi 49B aktif dibandingkan 1,05T total, ditambah encoder visi. Perusahaan ini melatihnya dari awal pada 3.800 GPU NVIDIA Grace Blackwell di pusat data Eropanya sendiri, dan pratinjau tersebut dilayani pada infrastruktur yang sama — argumen kedaulatan yang disampaikan Mistral sama lantangnya dengan argumen performa.
Spesifikasi, sebagaimana dinyatakan oleh vendor:
• Total vs parameter aktif — 1,05 triliun total, 49 miliar aktif per token, MoE sparse
• Modalitas — teks dan gambar masuk, teks keluar; multimodal secara native, bukan adaptor yang dipasang belakangan
• Jendela konteks — Dokumentasi Mistral menyatakan 1 juta token; Artificial Analysis membaca 524.288 pada konfigurasi yang sedang diujinya, jadi perlakukan 1 juta itu sebagai batas maksimum vendor, bukan jendela yang dilayani
• Harga — $1,36 per juta token masukan dan $4,18 per juta keluaran, dengan masukan yang di-cache seharga $0,14, menurut kartu harga terbitan Mistral
• Penawaran peluncuran — kartu yang sama menampilkan promosi $0.68 / $2.09 yang dicoret dengan input cache $0.07, yaitu setengah harga
• Bobot — belum dirilis; "akhir bulan ini," menurut pengumuman
• Lisensi — tidak disebutkan namanya dalam pengumuman dan di halaman dokumentasi, yang hanya menandai entri tersebut sebagai "Open"
Dua dari baris tersebut layak dibaca dua kali. Jendela konteksnya berbeda dengan faktor dua tergantung apakah Anda membaca vendor atau laboratorium pihak ketiga, yang bukan hal aneh untuk pratinjau yang konfigurasi penyajiannya masih berubah tetapi perlu diketahui sebelum Anda menentukan ukuran beban kerja di atasnya. Dan harga yang akan Anda bayar bergantung pada apakah tarif promosi bertahan melewati jendela peluncuran; $1.36 / $4.18 adalah angka yang tercantum di kartu tarif Mistral sendiri, dan $0.68 / $2.09 adalah angka yang saat ini dibebankannya. Asumsikan yang pertama saat Anda memodelkan tagihan Anda.

Angka benchmark, dan siapa yang menjalankannya
Unggahan Mistral berhati-hati soal asal-usul, dan kehati-hatian itu layak diteruskan. Tiga dari angka utama pengodean agentik — 61,7% pada DeepSWE v1.1, 59,4% pada SWE-Atlas-QnA, dan 28,3% pada Terminal-Bench 4.0, yang jika digabungkan menjadi skor Coding Agent Index 49,8% — adalah, dalam kata-kata Mistral sendiri, "angka-angka yang dievaluasi secara privat oleh Artificial Analysis sebelum peluncuran publik harness tersebut." Angka-angka itu belum ada di indeks publik Artificial Analysis. Nanti akan ada, begitu harness dirilis. Sampai saat itu, angka-angka tersebut adalah angka terbitan vendor yang diproduksi oleh pihak ketiga tetapi belum diterbitkan oleh pihak ketiga itu, yang merupakan asal-usul lebih kuat daripada sebagian besar klaim peluncuran dan tetap bukan hal yang sama dengan skor publik yang dapat direproduksi.

Apa yang publik dan independen hari ini, terbaca dari halaman model Artificial Analysis pada 6 Oktober: Mistral Large 4 Preview mencetak 38,4 pada Intelligence Index v4.3, memakan waktu sekitar 507 detik per tugas, dengan Terminal-Bench 4.0 di 26,8% dan Long-Context Reasoning di 81,3%. Halaman yang sama mencantumkannya sebagai model open-weights yang nyatanya bukan open-weights — flag-nya berbunyi isOpenWeights: false dengan kategorisasi "proprietary," karena yang ada hanyalah pratinjau yang dilayani dari klaster milik vendor itu sendiri. Flag itulah ilustrasi tunggal paling jernih dari kesenjangan yang menjadi topik artikel ini.

Hasil yang paling layak dikutip adalah hasil yang tidak dijalankan sendiri oleh Mistral. Surge AI, firma anotasi pihak ketiga, menjalankan evaluasi manusia secara blind atas kualitas pengodean dengan identitas model disembunyikan, dan para anotator profesional menilai Mistral Large 4 Preview sebesar 3,74 pada skala 1–5 — peringkat kedua dari lima, di depan Kimi K3 pada 3,59, GLM-5.3 pada 3,60 dan GLM-5.2 pada 3,40, dan hanya di belakang Claude Opus 5 pada 4,22. Evaluasi manusia secara blind dengan laboratorium yang namanya disebutkan di sisi lain merupakan jenis bukti yang berbeda dari benchmark yang dijalankan sendiri, dan itu adalah satu-satunya titik data independen terkuat dalam pengumuman tersebut.
Lalu ada cyber, tempat Mistral melontarkan klaimnya yang paling tajam. Dalam Cyber Index milik Artificial Analysis, perusahaan itu mengatakan Mistral Large 4 berada di lima besar global dan memimpin model open-weight yang dikembangkan di luar Tiongkok. Pada satu uji spesifik — mereproduksi kerentanan nyata dalam perangkat lunak open-source, lalu menambalnya — ia mencetak 82%, yang disebut sebagai yang tertinggi di antara model mana pun, dengan 93% pada 40 latihan kompetisi Cybench. Mistral menambahkan satu pengamatan yang tajam: beberapa model closed terkemuka, Claude Opus 5.5 dan GPT-6 Astra disebut di antaranya, mencetak hampir nol pada uji yang sama karena mereka menolak tugas tersebut. Tanpa halaman pihak ketiga di depan Anda, angka 82% itu adalah angka dari vendor; argumen tingkat penolakan adalah interpretasi vendor. Keduanya masuk akal dan tidak satu pun dikonfirmasi secara independen hari ini.
Mengapa pembingkaian pratinjau mengubah perhitungan harga
Pratinjau bukan sekadar label tahap. Ini berarti model dapat diarahkan ulang, diubah harganya, atau dipensiunkan dengan pemberitahuan yang lebih singkat daripada rilis GA, dan ini berarti konfigurasi serving yang Anda jadikan tolok ukur mungkin bukan konfigurasi yang Anda gunakan saat men-deploy. Untuk keputusan perutean, itu adalah biaya nyata: pipeline yang disetel pada build minggu ini menanggung tagihan validasi ulang yang tidak Anda anggarkan.
Di OrcaRouter, tempat lebih dari 200 model berada di balik satu endpoint yang kompatibel dengan OpenAI pada harga daftar penyedia dengan markup 0% yang diteruskan langsung, perubahan harga pada kartu milik vendor sendiri adalah perubahan harga pada kartu kami pada hari yang sama — yang penting di sini justru karena peluncuran ini membawa dua harga, satu dicoret. Failover otomatis adalah separuh jawaban lainnya untuk pratinjau yang belum terbukti: ini memungkinkan Anda menempatkan sebagian kecil lalu lintas produksi ke Mistral Large 4 sementara model pihak pertama menangani sisanya, sehingga pratinjau yang mengalami regresi di bawah beban kerja nyata Anda terdegradasi menjadi pengalihan rute alih-alih insiden. Yang tidak boleh diasumsikan oleh pembaca yang cermat adalah bahwa Mistral Large 4 dapat dirutekan di OrcaRouter hari ini. Model ini tidak ada dalam katalog — pratinjau diakses melalui API milik Mistral sendiri dan beberapa platform pihak ketiga, dan bobotnya, saat nanti tersedia, akan menjadi proposisi yang dihosting sendiri.
Klaim open-weight saat ini hanyalah sebuah janji.
Kerangka berpikir Mistral adalah bahwa Mistral Large 4 "mendorong batas kinerja open-weight" dan bahwa bobot terbuka adalah mekanisme yang memungkinkan perusahaan mempertahankan kendali atas sebuah model. Itu adalah argumen yang dapat dipertahankan untuk model yang berniat dirilis Mistral. Untuk model yang dirilisnya minggu ini, mekanisme itu tidak ada: tidak ada repositori Hugging Face, tidak ada teks lisensi, tidak ada checkpoint yang dapat diunduh. Organisasi Hugging Face perusahaan itu sendiri, yang diperiksa pada 6 Oktober, tidak memiliki apa pun yang lebih baru dari Juli, dan entri terbarunya tidak terkait dengan lini Large.
Ini bukan kritik terhadap rencana tersebut; pelepasan bobot secara bertahap setelah jendela red-teaming adalah kebijakan yang koheren, dan Mistral eksplisit soal itu. Ini adalah kehati-hatian tentang kata sifatnya. "Open-weight" sedang melakukan kerja pemasaran dalam paragraf yang bobotnya masih empat minggu lagi, dan lisensi yang mengaturnya belum disebutkan. Lisensi permisif dan ketentuan bergaya Apache adalah satu kemungkinan hasil; lisensi khusus riset atau dengan batas pendapatan adalah kemungkinan lain, dan pengumuman itu tidak memilih di antara keduanya.
Apa yang perlu diperiksa sebelum akhir Oktober
Lima hal akan mengubah pratinjau ini menjadi fakta yang pasti, dan masing-masing dapat diperiksa tanpa perlu menanyakan apa pun kepada Mistral:
• Repositori Hugging Face di bawah organisasi Mistral yang memuat checkpoint dan berkas lisensi — rilis yang Mistral berkomitmen untuk meluncurkannya bulan ini
• Nama lisensinya sendiri, yang menentukan apakah "open weight" berarti kebebasan bergaya Apache-2.0 atau hibah yang dibatasi penggunaannya
• Apakah tarif promosi $0.68 / $2.09 bertahan, atau kembali ke $1.36 / $4.18 pada kartu tarif
• Apakah Artificial Analysis memindahkan angka coding yang dievaluasi secara privat ke indeks publiknya saat harness dirilis, dan apakah angka-angka itu tetap pada nilai yang sama
• Jendela konteks yang disajikan, saat ini dicantumkan sebagai 1M oleh vendor dan terbaca sebagai 524.288 oleh laboratorium independen
Sampai semua itu teratasi, sikap yang tepat terhadap Mistral Large 4 adalah sikap yang justru dianjurkan oleh peluncurannya sendiri: panggil modelnya, ukur kinerjanya pada beban kerja Anda, dan pertahankan jalur produksi pada model yang perilakunya tidak dijadwalkan berubah. Bobotnya adalah acara utamanya. Pratinjaunya hanyalah trailer.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
