
Grok 4.6 vs Claude Opus 5: Sama-sama 61, Dua Ekonomi Berbeda
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
Artificial Analysis menjalankan setiap model frontier melalui sembilan evaluasi yang sama dan memublikasikan hasilnya. Pada Intelligence Index-nya, Grok 4.6 dan Claude Opus 5 mendarat pada angka yang sama — 61 — yang menjadikan ini sebagai head-to-head langka di mana skor komposit tidak dapat memberi tahu Anda yang mana yang harus digunakan. Hal yang dapat memberi tahu adalah angka yang kurang terkenal dari sumber yang sama: pada suite kerja pengetahuan AA-Briefcase, Grok 4.6 menyelesaikan sebuah tugas dalam sekitar 53 putaran dan sekitar setengah miliar token masukan, sementara Claude Opus 5 dengan upaya maksimal membutuhkan sekitar 103 putaran dan dua miliar token untuk pekerjaan yang sama. Itu adalah kesenjangan empat banding satu dalam konsumsi token antara dua model yang skor utamanya identik, dan hal itu muncul hanya ketika Anda berhenti membandingkan kartu model dan mulai membandingkan tagihan.
Kedua model merupakan peluncuran flagship terkini, yang menjadikan ini perbandingan yang murni, bukan ketidakcocokan generasi. Grok 4.6 dirilis pada 12 Agustus 2026 dari SpaceXAI sebagai penyempurnaan dari fondasi Grok 4.5 — basis mixture-of-experts dengan 1,5 triliun parameter yang sama, dilatih ulang dengan supervisi yang lebih panjang dan proses reinforcement-learning yang ditujukan untuk agen berdurasi panjang. Claude Opus 5 dirilis pada 24 Juli 2026 dari Anthropic sebagai flagship dengan stempel tanggal tetap, adaptive thinking, jendela konteks 1 juta token, serta input gambar dan file. Keduanya berada di titik yang sama di papan skor independen dan titik yang berlawanan di daftar harga: $2 / $6 per juta token untuk Grok 4.6 dibandingkan $5 / $25 untuk Claude Opus 5. Pekerjaan yang menarik adalah mencari tahu separuh kalimat mana yang menentukan pilihan produksi Anda.
Angka 61 yang menyembunyikan kesenjangan efisiensi empat banding satu.
Indeks Intelijen adalah gabungan dari sembilan evaluasi, yang menjadi kekuatan sekaligus titik butanya. Satu angka yang merata-ratakan skor penalaran, matematika, pengodean, dan kerja pengetahuan menyembunyikan bagaimana sebuah model mencapai hasil itu — dan kedua model ini mencapainya secara berlawanan. Rangkaian kerja pengetahuan profesional bergaya briefcase milik Artificial Analysis sendiri adalah jendela paling jelas untuk melihat hal itu: alat ini mengukur tugas-tugas dengan cakrawala waktu nyata yang panjang, dan mencatat Grok 4.6 sekitar 53 giliran dan 0.5B token masukan per tugas, dibandingkan Claude Opus 5 Max yang kira-kira 103 giliran dan 2B token masukan. Dalam hal ekonomi per tugas, itulah perbedaan antara model yang menyelesaikan pekerjaan riset-dan-produksi dengan seperempat token dan model yang menghabiskan token-token tersebut.
Penyebabnya adalah pilihan desain, bukan bug. Grok 4.6 dilatih secara khusus untuk memverifikasi pekerjaannya sendiri sambil berjalan dan berhenti ketika subtugas benar-benar selesai — xAI menggambarkan lintasan tugas panjang dengan pengujian diri sebagai tujuan pelatihan. Claude Opus 5 dilatih untuk kedalaman penalaran dan keluasan pengetahuan, dan perilaku default-nya adalah berpikir lebih keras dan berkonsultasi lebih dari yang benar-benar diperlukan. Keduanya adalah "model penalaran"; mereka mengalokasikan usaha secara berbeda, dan alokasi tersebut adalah spesifikasi yang penting untuk beban kerja agen.

Kesenjangan ini paling penting bagi agen yang memanggil model dalam satu loop — agen riset, agen kode yang menjalankan puluhan putaran, pipeline dokumen yang memproses batch semalaman. Setiap putaran dikenakan biaya, dan setiap token masukan adalah konteks yang harus dikirim ulang pada panggilan berikutnya. Model yang selesai dalam 53 putaran dengan 0,5 miliar token tidak hanya lebih murah per token; ia lebih murah per tugas sekitar satu orde magnitudo daripada model yang membutuhkan 103 putaran dengan 2 miliar token, sebelum Anda bahkan mengalikan dengan harga daftar.
Lembar spesifikasi, kedua sisi
Di mana mereka berbeda secara tertulis, masing-masing pada satu baris:
• Intelligence Index — Grok 4.6 mencetak 61, berperingkat #6 dari 184; Claude Opus 5 mencetak 61, berperingkat bersama di puncak papan. Seri, menurut Artificial Analysis.
• Harga daftar per 1M token — Grok 4.6 dengan $2 untuk input / $6 untuk output (meningkat dua kali lipat menjadi $4 / $12 untuk prompt dengan 200K token input atau lebih); Claude Opus 5 dengan $5 untuk input / $25 untuk output, dengan diskon batch 50% menjadi $2.50 / $12.50.
• Jendela konteks — 500K token untuk Grok 4.6 versus 1,000,000 untuk Claude Opus 5, satu-satunya keunggulan spesifikasi yang paling jelas yang dimiliki oleh salah satu model.
• Output maksimal — Claude Opus 5 memungkinkan hingga 128K token output (300K melalui batch API); batas output Grok 4.6 lebih rendah, dalam kisaran jawaban panjang yang umum.
• Input — keduanya menerima teks dan gambar; Claude Opus 5 juga menerima file, dan input multimodal versi Anthropic menjangkau dokumen secara lebih langsung.
• GDPVal-AA v2 (kerja pengetahuan) — Grok 4.6 pada 1.753 Elo berbanding Claude Opus 5 pada 1.852 Elo. Opus 5 meraih mahkota kualitas kerja pengetahuan pada metrik yang efisiensi tas kerjanya lebih memihak Grok. [Artificial Analysis]
• CursorBench v3.2 — 69,9% untuk Grok 4.6 dibandingkan 70,0% untuk Claude Opus 5, secara efektif seimbang pada tolok ukur agen pengkodean yang mengukur keduanya. [Artificial Analysis]
• Kontrol penalaran — Claude Opus 5 menyediakan dial upaya dari rendah hingga maksimal dan pemikiran adaptif yang aktif secara default; Grok 4.6 menyediakan upaya penalaran tetapi disetel ke default yang lebih menyukai lintasan agen yang panjang.
Inti dari menempatkan keduanya berdampingan adalah tidak ada model yang mendominasi. Claude Opus 5 adalah generalis yang lebih baik di atas kertas: lebih banyak konteks, batas output lebih tinggi, input file, kualitas kerja pengetahuan yang lebih tinggi. Grok 4.6 adalah nilai yang lebih baik dan agen yang lebih efisien. Satu-satunya pertanyaan yang tersisa adalah mana dari keduanya yang menggambarkan pekerjaan yang sebenarnya Anda miliki.

Di mana Claude Opus 5 layak dengan harga premiumnya
Angka peluncuran Anthropic — dilaporkan oleh vendor, tidak direproduksi secara independen — menempatkan Claude Opus 5 pada 96,0% di SWE-bench Verified dan 79,2% di SWE-bench Pro, dengan skor OSWorld 70,6% untuk penggunaan komputer. Pada komposit luas, skor 61-nya menyamai Grok 4.6, dan pada GDPVal-AA ia unggul secara terukur. Apa artinya dalam praktik adalah model yang mampu bersaing di seluruh rentang hari kerja seorang pekerja pengetahuan: menyusun draf, analisis, penalaran dokumen panjang, tugas gambar-plus-teks, dan pengkodean — semuanya dalam satu tempat dengan kapasitas satu juta token.
Jendela konteks adalah alasan jujur untuk memilihnya. Batas 500K token memang besar, tetapi itu bukan seluruh basis kode ditambah korpus penelitian ditambah hasil antara dari sesi agen yang panjang. Tim yang melakukan analisis single-pass mendalam terhadap korpora yang sangat besar — repositori lengkap, setahun laporan keuangan, tumpukan PDF panjang — akan membentur batas atas Grok 4.6 dan tidak akan pernah mencapai batas atas Claude Opus 5. Untuk beban kerja tersebut, konteks tambahan bukanlah kemewahan; itu adalah pembeda antara pekerjaan yang muat dan pekerjaan yang harus diorkestrasi di sekitar batas.
Di mana Grok 4.6 adalah pembelian yang lebih baik
Balik fakta yang sama dan Grok 4.6 adalah pilihan yang lebih baik untuk pipeline agen, dan bukan dengan selisih kecil. Harganya 2,5× lebih murah untuk input dan 4,2× lebih murah untuk output dibanding harga daftar Opus 5, dan efisiensi token per-tugasnya memperkuat hal itu: angka AA-Briefcase menunjukkan sekitar 4× lebih sedikit token dan 2× lebih sedikit putaran untuk hasil pekerjaan berbasis pengetahuan yang sama. Kalikan 4× dengan 2,5× dan tugas yang berbiaya $1,00 pada skema harga Opus 5 akan berbiaya sekitar $0,10 pada skema harga Grok 4.6 — sebelum diskon batch di sisi Opus menutup sebagian kesenjangan tersebut.
Secara khusus untuk agentic coding, hasil DeepSWE 1.1 milik Grok 4.6 meningkat dari 54% menjadi 65,9% antara versi 4.5 dan 4.6, dan skor CursorBench-nya berada dalam setengah poin dari Opus 5 sambil memverifikasi sendiri pekerjaannya sepanjang proses. Bagi tim yang menjalankan ribuan panggilan agentic per hari di mana setiap panggilan adalah putaran multi-pergantian, ekonomi per-tugas dan lintasan yang lebih pendek adalah perbedaan antara produk yang layak dan burn rate. Itulah argumentasi yang dibangun xAI, dan data efisiensi independen mendukung arah tersebut.
Keputusan perutean
Ini adalah pertarungan di mana router membuktikan nilainya, karena jawaban yang tepat adalah "keduanya, dengan pembagian yang ditentukan oleh bentuk beban kerja." Grok 4.6 dan Claude Opus 5 sama-sama aktif di OrcaRouter dengan harga list masing-masing vendor — $2 / $6 untuk grok/grok-4.6, $5 / $25 untuk anthropic/claude-opus-5 — dengan markup 0%, sehingga angka di model biaya Anda adalah angka yang ditagih. Infrastruktur teknis yang membuat pembagian ini praktis: satu kunci API untuk kedua model, failover otomatis jika endpoint salah satu penyedia menurun performanya di tengah proses agen yang panjang, dan DSL routing yang dapat mengirim giliran pendek dengan volume tinggi ke Grok 4.6 dan meneruskan pekerjaan berhorizon panjang yang haus konteks ke Claude Opus 5 dalam satu panggilan. Anda tidak memerlukan kontrak kedua untuk menjalankan arsitektur dua tingkat, dan Anda dapat menyetel ulang pembagian tersebut saat data lalu lintas nyata masuk, alih-alih menebak dari kartu model.

Pembacaan yang jujur
Ikatan pada indeks gabungan itu nyata, dan itu adalah sebuah jebakan. Model dengan skor yang sama tidak dapat dipertukarkan; mereka justru terdiferensiasi tepat pada titik di mana skor itu buta. Claude Opus 5 adalah default yang lebih aman untuk pekerjaan pengetahuan yang luas, sarat konteks, berbasis dokumen dan gambar, di mana jendela 1M token dan penalaran mendalam lebih penting daripada biaya. Grok 4.6 adalah default yang lebih baik untuk loop agen bervolume tinggi, di mana efisiensi token per tugas dan keunggulan harga 2,5× berpadu menjadi perbedaan tagihan hingga orde magnitudo. Jika beban kerja Anda yang pertama, bayarlah untuk Opus 5 dan berhentilah mengkhawatirkan harga. Jika beban kerja Anda yang terakhir, paritas 61-di-atas-kertas adalah alasan terbaik yang akan pernah Anda miliki untuk menguji Grok 4.6 lebih dulu — benchmark mengatakan mereka setara, dan faktur mengatakan tidak.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
