Kartu judul yang dihasilkan untuk artikel 'Mistral Large 4 vs Gemini 3.1 Pro' yang menampilkan judul dalam huruf sans-serif geometris tebal, subjudul 'Delapan bulan, dua arah' di bawahnya, dan sederet tiga ikon garis datar di atasnya — halaman kalender, jendela terminal, dan bingkai gambar — dengan latar belakang putih beraksen gradien biru dan cyan serta logo OrcaRouter di sudut kanan bawah.
Guides & Insights

Mistral Large 4 vs Gemini 3.1 Pro: Delapan Bulan, Dua Arah

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Gemini 3.1 Pro telah ada di pasar sejak 19 Februari 2026 dan masih menempati peringkat mendekati puncak di setiap tabel kemampuan luas, termasuk tabel-tabel yang membandingkannya dengan model-model yang dirilis musim gugur ini. Mistral Large 4 paling lama baru berusia tiga minggu — sebuah pratinjau yang diumumkan pada 6 Oktober 2026, dengan bobotnya dijanjikan untuk akhir Oktober dan lisensinya belum disebutkan. Pada Intelligence Index milik Artificial Analysis, yang dibaca pada 6 Oktober, Gemini 3.1 Pro yang berusia delapan bulan mencetak skor 29,7 melawan 38,4 milik pendatang baru itu. Itulah titik awal yang jujur untuk perbandingan ini, dan itu adalah kebalikan dari apa yang disiratkan oleh tanggal rilis.

Penjelasannya tidaklah misterius. Gemini 3.1 Pro adalah model unggulan dari lini pratinjau yang belum pernah Google naikkan menjadi rilis stabil, dan halaman Artificial Analysis untuk model itu diberi label "Gemini 3.1 Pro Preview" — halaman yang sama tempat indeks yang lebih rendah berada di samping GPQA Diamond kelas puncak. Ini adalah model yang dirancang untuk cakupan luas: jendela konteks yang sangat besar, kumpulan modalitas yang luas, dan penalaran yang kuat pada pertanyaan pengetahuan. Mistral Large 4 dirancang untuk peta dunia yang sama sekali berbeda, dan harganya pun menyesuaikan.

Apa itu masing-masing

Gemini 3.1 Pro adalah model penalaran multimodal terdepan milik Google, dengan id API gemini-3.1-pro-preview, jendela konteks 1.576.576 token, dan batas keluaran 65 token. Model ini menerima gambar, video, audio, dan file. Model ini disajikan dari katalog OrcaRouter dengan tarif Google sendiri. Dokumentasi Google tidak mencantumkan Gemini 3.1 Pro non-preview; nama preview itulah produknya.

Mistral Large 4 adalah sparse mixture-of-experts 1,05 triliun parameter dengan 49 miliar parameter aktif dan encoder visi khusus berukuran 1,6 miliar parameter, ditawarkan sebagai "Mistral Large 4 Preview" dengan id API mistral-large-4-0. Dokumentasi Mistral menyatakan jendela konteks 1 juta token; Artificial Analysis membaca 524.288 pada konfigurasi yang diujinya. Output maksimum tidak dipublikasikan. Mistral menggambarkannya sebagai model terbesar dan paling mumpuni yang pernah ada hingga saat ini dan mengatakan bobotnya akan tersedia pada akhir Oktober.

Angka-angkanya, dengan asal-usulnya terlampir

Kedua model memiliki halaman independen, jadi perbandingan di bawah ini menggunakan harness yang sama, bukan antarvendor:

• Indeks Kecerdasan v4.3 — Mistral Large 4 Preview 38,4 vs Gemini 3.1 Pro 29,7

• Biaya per tugas indeks — $1,13 vs $1,30

• Penalaran konteks panjang — 81,3% vs 82,0%

• GPQA Diamond — tidak dipublikasikan untuk pratinjau vs 94,1%

• Ujian Terakhir Umat Manusia — 35,0% vs 47,0%

• Terminal-Bench 4.0 — 26,8% vs 4,0%

• SciCode — 54,2% vs 58,7%

• AutomationBench, alur kerja bisnis — 59,9% vs 35,4%

• MMMU-Pro, penalaran multimodal — 76,4% vs 82,4%

• Jendela konteks — 1M dinyatakan / 524.288 diuji vs 1.048.576 dilayani

• Batas output — tidak dipublikasikan vs 65.536 token

• Harga per juta, masukan / keluaran — $1.36 / $4.18 harga daftar, $0.68 / $2.09 harga promosi, vs $2.00 / $12.00 di bawah 200K token dan $4.00 / $18.00 di atas

• Bobot — dijanjikan, lisensi tidak disebutkan, vs proprietary

A generated two-column scoreboard titled 'Mistral Large 4 vs Gemini 3.1 Pro — the scoreboard'. Left column 'Mistral Large 4 Preview': Intelligence Index v4.3 38.4; cost per index task $1.13; Terminal-Bench 4.0 26.8%; GPQA Diamond not published; MMMU-Pro 76.4%; AutomationBench 59.9%. Right column 'Gemini 3.1 Pro': Intelligence Index v4.3 29.7; cost per index task $1.30; Terminal-Bench 4.0 4.0%; GPQA Diamond 94.1%; MMMU-Pro 82.4%; AutomationBench 35.4%.

Baris yang paling mencolok adalah Terminal-Bench 4.0. Gemini 3.1 Pro mencetak 4,0% — bukan salah ketik, dan bukan halusinasi di tabel: ini mencerminkan model dari Februari yang dijalankan pada harness agen terminal yang muncul setelahnya. Angka 26,8% milik Mistral Large 4 enam kali lebih tinggi pada tes yang sama. Siapa pun yang telah mencoret Gemini berdasarkan angka pengodean agentik lama sebaiknya memasukkannya kembali berdasarkan GPQA Diamond-nya, dan siapa pun yang telah mencoret Mistral berdasarkan peringkat indeks sebaiknya melihat baris terminal terlebih dahulu.

Di mana Gemini 3.1 Pro masih lebih unggul

Pengetahuan dan keluasan. GPQA Diamond 94,1% adalah angka tertinggi di mana pun dalam artikel ini, di kedua sisi, dan itu adalah tolok ukur sains tingkat pascasarjana — bukan angka yang bisa dicapai sebuah model hanya dengan bicara. Humanity's Last Exam pada 47,0% versus 35,0%, dan skor SciCode yang sedikit mengungguli pendatang baru, menceritakan kisah yang sama. Jika beban kerja Anda adalah menjawab pertanyaan sulit secara akurat dari korpus pengetahuan, Gemini 3.1 Pro tetap menjadi model yang lebih kuat delapan bulan setelah rilis.

Keluasan modalitas adalah keunggulan kedua. Gemini 3.1 Pro menerima video dan audio serta teks dan gambar. Mistral Large 4 menerima teks dan gambar. Jika pipeline Anda menerima rekaman rapat, rekaman layar, atau audio sensor, hanya satu model di sini yang dapat melihat keseluruhan input.

Batas atas output adalah yang ketiga. 65.536 token adalah batas atas yang dipublikasikan dan dijamin; Mistral sama sekali belum mempublikasikan satu pun untuk pratinjau. Tidak ada apa pun dalam posting peluncuran yang lebih mungkin menimbulkan masalah bagi Anda di produksi daripada batas output yang tidak dinyatakan.

Dan jendela konteks Gemini benar-benar disajikan pada 1.048.576 token, sedangkan 1M milik Mistral adalah angka dari vendor dibandingkan dengan 524.288 yang dibaca secara independen. Untuk beban kerja yang berada di ujung jauh jendela, perbedaan antara angka yang dinyatakan dan angka yang diukur adalah penulisan ulang.

Di mana Mistral Large 4 mengubah keputusan

Kerja agentic, dan khususnya apa pun yang menyentuh terminal, adalah wilayah tempat kedua model itu tidak lagi bisa dibandingkan. Pos peluncuran Mistral sendiri menggabungkan 61,7% pada DeepSWE v1.1, 59,4% pada SWE-Atlas-QnA, dan 28,3% pada Terminal-Bench 4.0 ke dalam Coding Agent Index sebesar 49,8%, dan menyatakan secara terang-terangan bahwa pihaknya berada di depan DeepSeek V4 Pro 0813 dan Qwen3.8 Max pada ukuran gabungan tersebut. Menurut Mistral, ketiga angka itu adalah angka yang dievaluasi Artificial Analysis secara privat sebelum harness-nya tersedia untuk publik; angka-angka itu belum ada di indeks publik dan harus dilabeli sebagai diterbitkan vendor sampai benar-benar ada di sana.

Bukti independen menunjukkan arah yang sama. Pada AutomationBench — 657 alur kerja bisnis yang mencakup Gmail, Sheets, Slack, dan Salesforce — Mistral Large 4 memperoleh skor 59,9%, di depan Kimi K3, MiMo-V2.6-Pro, dan DeepSeek V4 Pro, dan pada harness yang sama Gemini 3.1 Pro tidak muncul sama sekali karena tolok ukur tersebut lebih baru darinya. Sebuah studi manusia secara buta yang dijalankan oleh Surge AI menilai Mistral Large 4 Preview sebagai yang kedua dari lima model dalam hal kualitas pengodean dengan nilai 3,74, di depan GLM-5.3 dan Kimi K3 dan hanya di belakang Claude Opus 5.

Klaim soal siber adalah yang paling tajam dalam postingan Mistral dan layak disebutkan secara persis: 82% pada tes Artificial Analysis Cyber Index yang meminta sebuah model mereproduksi kerentanan nyata lalu menambalnya, digambarkan sebagai yang tertinggi di antara model mana pun, dengan 93% pada 40 latihan kompetisi Cybench, dan pernyataan Mistral bahwa model ini berada di lima besar global pada Cyber Index secara keseluruhan sekaligus memimpin model open-weight yang dikembangkan di luar Tiongkok. Itu adalah angka-angka yang dikutip vendor pada indeks independen. Keunggulan praktisnya adalah Mistral membangun model itu untuk mengerjakan pekerjaan tersebut, bukan menolaknya.

Baris termurah dalam tabel itu juga milik Mistral, tetapi hanya dengan selisih tipis: $1,13 per tugas berbanding $1,30, keunggulan 13% yang dihasilkan oleh tarif promosi dan akan dihapus oleh daftar tarif. Gemini 3.1 Pro adalah model 2026 dengan harga 2026, dan tidak mahal untuk menjalankan tugas indeks padanya.

Pemecah seri yang tidak di-benchmark oleh siapa pun

Ada dua hal yang berperan yang tidak dapat ditunjukkan oleh tabel. Yang pertama adalah lisensi. Gemini 3.1 Pro bersifat proprietary dan akan tetap demikian; Mistral Large 4 adalah pratinjau yang seluruh daya tariknya adalah bahwa ia menjadi artefak yang dapat diunduh yang dapat Anda jalankan di bawah kebijakan Anda sendiri, pada perangkat keras Anda sendiri, di bawah hukum Eropa — Mistral melatihnya pada 3.800 Grace Blackwell GPU di pusat data miliknya sendiri dan melayani pratinjau di sana. Argumen itu tidak bernilai apa pun sampai repositori muncul dan lisensinya memiliki nama. Argumen itu bernilai sangat besar pada hari hal itu terjadi.

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid with 'Mistral Large 4' listed at v26.10 as 'A state-of-the-art, open-weight, general-purpose multimodal model' and no licence badge, beside a Mistral Large 3 card at v25.12 carrying an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible.

Yang kedua adalah risiko operasional. Pratinjau yang masih disempurnakan akan berubah saat Anda menggunakannya. Di OrcaRouter, kedua sisi perbandingan ini dapat dijangkau melalui satu endpoint yang kompatibel dengan OpenAI dengan harga daftar penyedia dan markup 0% — Gemini 3.1 Pro sudah tersedia di katalog dengan tarif Google, sedangkan Mistral Large 4 harus diakses melalui API milik Mistral sendiri dan beberapa platform pihak ketiga, karena model itu bukan rute yang kami sediakan. DSL perutean adalah bagian yang berguna di sini: kirim klasifikasi dan ekstraksi ke model mana pun yang lebih murah minggu itu, eskalasikan sisa kasus yang sulit, dan biarkan failover otomatis menyerap hari-hari buruk pratinjau itu alih-alih rotasi on-call Anda yang menyerapnya.

A screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the preview model identity, a 1M-token context window, a 65K maximum output, inputs of audio, file, image, text and video with text output, the 2026-02-19 release date, a p-50 time-to-first-token figure of 10.00 seconds, pricing of $2.00 per million input and $12.00 per million output, and a code sample against the api.orcarouter.ai base URL.

Putusan

Tanyakan apa beban kerjanya, bukan model mana yang lebih baik. Untuk pekerjaan berbasis pengetahuan, masukan audio dan video, batas atas keluaran yang dijamin, dan jendela sejuta token yang dilayani, Gemini 3.1 Pro tetap menjadi model yang lebih kuat dan usianya bukanlah kelemahan — itu adalah delapan bulan orang lain menemukan batas kemampuannya. Untuk pengodean agentik, pekerjaan terminal, dan operasi keamanan, Mistral Large 4 unggul dengan selisih yang cukup lebar sehingga peringkat indeks menyesatkan, dan ia satu-satunya dari keduanya yang mungkin pada akhirnya dapat di-self-host.

Penentu yang perlu diperhatikan adalah akhir Oktober. Jika bobotnya tiba dengan lisensi permisif, Mistral Large 4 berhenti bersaing dengan Gemini 3.1 Pro soal harga dan mulai bersaing dengannya soal kendali, dan itu adalah pertarungan yang berbeda. Jika bobotnya tiba dengan lisensi yang restriktif, jawaban artikel ini tidak banyak berubah — tetapi alasannya berubah.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari