
Mistral Large 4 vs Claude Opus 5: Kesenjangannya Lebih Kecil daripada Selisih Harganya
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 151 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Satu-satunya angka head-to-head yang pernah dipublikasikan siapa pun untuk Mistral Large 4 melawan Claude Opus 5 berasal dari evaluasi manusia secara buta, dan hasilnya lebih dekat daripada yang ditunjukkan tabel benchmark. Surge AI menyembunyikan identitas model dan meminta anotator profesional menilai output coding pada skala 1–5; Claude Opus 5 finis pertama dengan 4,22 dan Mistral Large 4 Preview finis kedua dengan 3,74, di depan Kimi K3, GLM-5.3 dan GLM-5.2. Pada agregat independen, keduanya sama sekali tidak berdekatan — 50,8 versus 38,4 pada Intelligence Index milik Artificial Analysis, dibaca pada 6 Oktober. Yang membuat pasangan ini layak dihabiskan satu sore adalah bahwa model yang mencetak 12 poin lebih rendah biayanya sekitar seperlima untuk menjalankan sebuah tugas.
Kedua angka tersebut perlu disertai asal-usulnya, karena keduanya bukan jenis angka yang sama. Evaluasi Surge AI adalah studi manusia pihak ketiga yang ditugaskan dan diterbitkan oleh Mistral — bentuk bukti yang lebih kuat daripada tolok ukur yang dijalankan sendiri, dan tetap merupakan studi yang publikasinya dikendalikan Mistral. Skor indeks adalah hasil uji Artificial Analysis sendiri, yang dapat dibandingkan satu sama lain, dan karena itu merupakan pasangan yang tepat untuk dijadikan dasar penalaran. Tidak ada satu pun yang memberi tahu Anda model mana yang harus dijadikan dasar pengembangan; bersama-sama keduanya membingkai pertanyaan itu.
Dua produk, bukan dua generasi dari satu produk.
Claude Opus 5 adalah model unggulan berbobot tertutup dari vendor tersebut, dirilis pada 24 Juli 2026, disajikan dengan jendela konteks 1M token dan hingga 128K token keluaran, dengan tarif $5 per juta token input dan $25 per juta token output, serta pembacaan cache sebesar $0,50. Model ini adalah model paling mumpuni dari vendor tersebut dalam lini Opus dan diposisikan secara tepat untuk pekerjaan agentik berhorizon panjang — tetap koheren di seluruh sesi multi-langkah dengan penggunaan alat yang intensif.
Mistral Large 4 adalah pratinjau, diumumkan pada 6 Oktober 2026, yang Mistral gambarkan sebagai sparse mixture-of-experts 1,05 triliun parameter dengan 49 miliar parameter aktif dan encoder visi 1,6 miliar parameter. ID API-nya adalah mistral-large-4-0, ia multimodal secara native, dan dokumentasi Mistral memberinya jendela konteks 1 juta token sementara Artificial Analysis membaca 524.288 pada konfigurasi yang diujinya. Bobotnya dijanjikan untuk akhir Oktober dan lisensinya belum disebutkan.
Jadi ini bukan model yang lebih baru yang diadu dengan model yang lebih lama. Ini adalah model frontier proprietary yang diadu dengan penantang yang akan menjadi open-weight, dan keduanya diberi harga yang sesuai.

Indeks yang sama, kedua model
Dibaca pada 6 Oktober dari halaman Artificial Analysis mereka, pada Intelligence Index v4.3:
• Indeks Kecerdasan — Mistral Large 4 Preview 38,4 vs Claude Opus 5 50,8
• Biaya per tugas indeks — $1.13 untuk Mistral Large 4 Preview vs $5.86 untuk Claude Opus 5
• Terminal-Bench 4.0 — 26,8% vs 49,0%, celah tunggal terlebar di antara keduanya
• Humanity's Last Exam — 35,0% vs 54,9%
• MMMU-Pro, penalaran multimodal — 76,4% vs 84,7%
• AutomationBench, alur kerja bisnis — 59,9% vs 56,6%, satu-satunya baris tempat Mistral Large 4 unggul
• Jendela konteks — 1M dinyatakan oleh Mistral dan 524.288 pada konfigurasi yang diuji, vs 1M yang dilayani
• Batas keluaran — tidak dipublikasikan untuk pratinjau vs 128K token
• Harga per juta, input / output — $1,36 / $4,18 harga daftar, saat ini $0,68 / $2,09 saat promosi, vs $5,00 / $25,00

Polanya terbaca jelas. Opus 5 unggul pada dua baris yang paling berat penalaran — pekerjaan terminal dan pengetahuan terbuka — serta unggul dalam pemahaman multimodal meskipun Mistral Large 4 adalah model yang dijual karena kemampuannya dalam visi. Mistral Large 4 memimpin baris otomatisasi alur kerja, yakni baris yang paling dekat dengan apa yang sebenarnya diminta unit bisnis dari sebuah model, dan ia melakukannya dengan harga seperlima per tugas.
Di mana Mistral Large 4 benar-benar unggul
Klaim paling menarik dalam posting peluncuran Mistral bukanlah skor benchmark. Klaim itu adalah bahwa pada salah satu pengujian Artificial Analysis Cyber Index — mereproduksi kerentanan nyata dalam perangkat lunak sumber terbuka, lalu menambalnya — Mistral Large 4 mendapat skor 82%, dikatakan sebagai yang tertinggi di antara model mana pun, dan bahwa beberapa model tertutup terkemuka mendapat skor mendekati nol pada pengujian yang sama karena mereka menolak tugas tersebut. Mistral menyebut Claude Opus 5.5 dan GPT-6 Astra sebagai contoh penolakan itu.
Itu adalah interpretasi vendor atas angka yang dikutip vendor, dan seharusnya dibaca seperti itu. Ini juga merupakan perbedaan operasional yang nyata jika benar: model yang tidak dapat mereproduksi kerentanan tidak dapat digunakan untuk membuktikan bahwa kerentanan itu nyata, yang merupakan langkah pertama dari sebagian besar respons insiden. Mistral memasangkan 82% dengan skor 93% pada 40 latihan kompetisi Cybench dan klaim balasan bahwa tingkat penolakannya terhadap prompt siber yang diambil dari JailbreakBench, StrongREJECT, dan AgentHarm lebih tinggi daripada model open-weight lain — argumennya adalah Anda menginginkan kemampuan dan disiplin dalam model yang sama alih-alih menukar yang satu dengan yang lain.
Di luar ranah siber, argumen untuk Mistral Large 4 bertumpu pada tiga hal yang tidak ditawarkan Opus 5. Model ini dilatih dan dilayani di infrastruktur Eropa di bawah hukum Eropa, yang penting bagi pembeli dengan kewajiban residensi data. Mistral menjanjikan model ini akan dapat diunduh — inti dari seluruh upaya ini, karena penerapan mandiri-lah yang menghilangkan risiko akses di tengah insiden yang dengan susah payah dijelaskan Mistral. Dan biayanya cukup murah per tugas sehingga menggunakannya sebagai langkah pertama dan meningkatkan sisa kasus sulit ke model frontier menjadi masuk akal secara ekonomi, bukan sekadar kesalahan pembulatan.
Di mana Claude Opus 5 masih sepadan dengan harganya
Celah indeks 12 poin bukanlah hal kecil, dan gambaran baris demi baris menunjukkan di mana celah itu berada. Terminal-Bench 4.0 hampir dua kali lipat — 49,0% berbanding 26,8% — dan pekerjaan terminal adalah proksi publik terdekat untuk pengodean agentik, yang menjadi sebagian besar alasan tim membeli model-model frontier tahun ini. Humanity's Last Exam memisahkan keduanya sebesar 20 poin. Dalam hal otonomi berhorizon panjang, desain penalaran adaptif Opus 5, batas keluaran 128K, dan konteks 1M yang disajikan adalah konfigurasi yang Anda inginkan jika beban kerja Anda berupa sesi agen berjam-jam alih-alih satu pertanyaan sulit.
Plafon keluaran adalah perbedaan yang lebih tidak mencolok. Mistral belum menerbitkan panjang keluaran maksimum untuk pratinjau ini, dan 128K milik Opus 5 benar-benar melepaskan kendala untuk pembuatan kode dan dokumen terstruktur yang panjang. Jika pipeline Anda menghasilkan file alih-alih jawaban, periksa angka itu sebelum Anda beralih, karena itulah jenis celah yang hanya muncul di produksi.
Biaya per tugas adalah angka yang harus diingat
Harga per token membuat model murah tampak lebih baik dan menyesatkan soal model yang mahal. Biaya per tugas dari indeks itu sendiri — total pengeluaran untuk menyelesaikan satu tugas evaluasi, termasuk cache dan semuanya — adalah angka yang tetap bertahan saat dihadapkan pada anggaran: $1,13 versus $5,86.
Itu bukanlah lisensi untuk memindahkan semuanya ke model yang lebih murah, karena tugas yang gagal diselesaikan model murah adalah tugas yang Anda bayar dua kali. Itu adalah lisensi untuk berhenti memperlakukan satu model terdepan sebagai satu-satunya pilihan. Di OrcaRouter, Claude Opus 5 ada dalam katalog pada harga daftar vendor dengan markup 0%, di endpoint yang kompatibel dengan OpenAI yang sama dengan 200+ model lainnya, itulah yang membuat pipeline dua model menjadi pekerjaan satu sore alih-alih kontrak vendor kedua. Mistral Large 4 belum ada di katalog saat ini — pratinjaunya diakses melalui API Mistral sendiri dan beberapa platform pihak ketiga. Ketika bobotnya dirilis dan ada penyedia yang meng-hosting-nya, aturan pass-through yang sama berlaku: berapa pun yang vendor kenakan, itulah yang Anda bayar, dan penurunan harga vendor akan muncul di tagihan Anda pada hari yang sama.

Untuk pratinjau yang belum terbukti, fitur routing yang paling penting adalah failover. Mengirim sebagian trafik produksi ke Mistral Large 4 sementara Opus 5 menangani sisanya berarti regresi berubah menjadi pengalihan ulang alih-alih gangguan layanan, dan Anda mempelajari mode kegagalan model yang sebenarnya pada data Anda sendiri, bukan pada papan peringkat.
Apa yang menyelesaikan ini dalam tiga minggu
Tiga fakta masih terbuka, dan masing-masing mengubah jawabannya. Jika bobotnya hadir di bawah lisensi permisif, Mistral Large 4 menjadi satu-satunya model dalam pasangan ini yang dapat Anda self-host, dan perhitungan bagi pembeli di sektor teregulasi menjadi sangat condong. Jika harga promosi $0.68 / $2.09 kembali ke $1.36 / $4.18 di daftar tarif, selisih per tugas menyempit tetapi tetap menentukan. Dan jika Artificial Analysis memindahkan angka coding yang dievaluasi secara privat ke indeks publiknya tanpa perubahan, narasi coding menjadi terverifikasi pihak ketiga alih-alih dipublikasikan vendor atas nama pihak ketiga.
Sampai saat itu: Opus 5 adalah default produksi yang aman dan sepadan dengan biaya berlipatnya untuk pekerjaan agentic dan yang intensif terminal. Mistral Large 4 adalah taruhan yang menarik — cukup murah per tugas untuk dijalankan di sampingnya, cukup mumpuni dalam otomatisasi dan siber untuk meraup trafik hari ini, dan menyimpan janji deployment mandiri yang tidak dapat ditandingi oleh model tertutup mana pun dalam perbandingan ini.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
