
Grok 4.7 vs Claude Opus 5: Kesenjangan Harga Itu Nyata, Paritasnya Tidak
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Anda dapat memanggil Grok 4.7 dengan harga $2,00 per juta token masukan dan $6,00 per juta token keluaran. Anda dapat memanggil Claude Opus 5 dengan harga $5,00 dan $25,00. Itu adalah perbedaan 4,2x pada keluaran — jenis kesenjangan yang biasanya sudah menyelesaikan perbandingan bahkan sebelum tolok ukur dibuka. Namun, itu tidak menyelesaikan yang ini. Pada versi Artificial Analysis Intelligence Index yang saat ini menjadi acuan skor kedua model — v4.3.2, revisi yang diterbitkan pada 19 September 2026 — Claude Opus 5 berada di angka 51 dan Grok 4.7, yang dirilis vendor pada 21 September 2026, berada di angka 46. Lima poin bukanlah kemenangan telak, tetapi komposisi kelima poin itu adalah: Opus 5 memenangi delapan dari sepuluh evaluasi dalam indeks tersebut. Argumen model yang lebih murah adalah harga, konteksnya imbang, dan satu tempat di mana keunggulan harga Grok 4.7 seharusnya paling berpengaruh justru adalah tempat keunggulan itu hilang.
Dua flagship, dua daftar harga yang sangat berbeda
Claude Opus 5 telah ada di pasar sejak 24 Juli 2026 dan merupakan produk unggulan tingkat Opus dari Anthropic, yang berada di bawah Claude Fable 5.1 dalam jajaran produk perusahaan itu sendiri. Model ini membawa jendela konteks 1 juta token dengan harga tetap — Anthropic menyatakan secara gamblang bahwa permintaan 900k token ditagih dengan tarif per token yang sama seperti permintaan 9k token, tanpa premi konteks panjang sama sekali — serta output maksimum 128K, yang dapat diperluas hingga 300K pada API Message Batches. Kemampuan berpikirnya adaptif dan aktif secara default, dengan tangga upaya yang mencakup low, medium, high, xhigh, dan max, serta default pada high. Bobotnya tertutup.
Grok 4.7 baru berumur satu hari. Model ini memiliki konteks 500k token, menerima teks dan gambar sebagai masukan serta mengembalikan teks, dan menjalankan pengatur tingkat upaya penalarannya sendiri. Harga daftarnya adalah $2,00 untuk masukan dan $6,00 untuk keluaran per juta token di bawah 200k token prompt, naik menjadi $4,00 dan $12,00 pada atau di atas ambang tersebut; pembacaan cache dikenakan $0,50 dan $1,00 pada dua rentang yang sama. xAI juga mencantumkan varian yang lebih cepat yang berjalan pada kecepatan keluaran sekitar dua kali lipat dengan harga sekitar dua kali lipat, meskipun konfigurasi itu dirilis tanpa pengukuran kecepatan yang dipublikasikan. Bobotnya juga tertutup di sini, yang menghilangkan jalan keluar "jalankan sendiri" dari kedua sisi perbandingan ini.
Dewan independen itu tidak dekat, dan itu tidak menyanjung.
Kedua model ini dinilai berdasarkan indeks v4.3.2 dari Artificial Analysis, yang mencakup sepuluh evaluasi meliputi agen, pengodean, pengetahuan umum, dan penalaran ilmiah. Menempatkan kedua kolom itu berdampingan membuat angka utama selisih lima poin tampak terlalu menguntungkan bagi model yang lebih murah — selisih lima poin tunggal dalam skor komposit bisa menyembunyikan banyak hal, dan di sini selisih itu menyembunyikan hasil yang nyaris sapu bersih.
• Kecerdasan gabungan — Grok 4.7 (xhigh): 46 pada Artificial Analysis Intelligence Index v4.3.2. Claude Opus 5 (penalaran adaptif, upaya maksimal): 51 pada revisi yang sama.
• Penalaran sulit — Grok 4.7: Humanity's Last Exam 43, CritPt 18. Claude Opus 5: HLE 55, CritPt 29. Selisih dua belas poin dan sebelas poin secara berurutan, keduanya menguntungkan Opus 5.
• Terminal agentik — Grok 4.7: Terminal-Bench 4.0 26. Claude Opus 5: 49. Inilah selisih tunggal terlebar di papan, dan itu terjadi pada benchmark yang paling dekat dengan kerja otonom nyata.
• Otomasi tempat kerja — Grok 4.7: AutomationBench-AA 66%. Claude Opus 5: 57%. Satu kemenangan jelas Grok 4.7, dan itu kemenangan nyata — sembilan poin pada evaluasi yang menilai apakah sebuah agen menyelesaikan alur kerja tanpa tersandung pagar pengaman.
• Pengetahuan dan kejujuran — Grok 4.7: AA-Omniscience 32. Claude Opus 5: 37. Kedua model berhalusinasi; Opus 5 lebih jarang melakukannya pada ukuran ini.
• Konteks panjang — Grok 4.7: AA-LCR v1.1 77%, jendela 500k token. Claude Opus 5: 79%, jendela 1M token.
• Biaya menjalankan indeks — Grok 4.7: 240 juta token keluaran di seluruh evaluasi, ditandai oleh Artificial Analysis sebagai sangat bertele-tele. Claude Opus 5: 140 juta. Grok 4.7 menghabiskan 1,7x token untuk mencapai skor yang lebih rendah.

Di mana keunggulan harga Grok 4.7 menemui ajalnya
Berikut adalah aritmetika yang disembunyikan oleh lembar tarif. Ambil permintaan agentik yang realistis: 30k token masukan, 8k keluaran. Grok 4.7 menagih $0.06 untuk masukan dan $0.048 untuk keluaran — sekitar sebelas sen. Claude Opus 5 menagih $0.15 untuk masukan dan $0.20 untuk keluaran — sekitar tiga puluh lima sen. Itu benar-benar 3x, dan pada ukuran ini Grok 4.7 adalah pilihan yang jelas hanya berdasarkan biaya.
Sekarang ambil permintaan yang menjadi dasar pemasaran Grok 4.7 sendiri: sesi agentik konteks panjang. Dorong prompt melewati 200k token dan tarif Grok 4.7 berlipat ganda menjadi $4,00 untuk input dan $12,00 untuk output. Claude Opus 5 tidak berubah — jendela 1M-nya ditagih $5,00 dan $25,00 secara tetap. Pada 250k input dan 8k output, biaya Grok 4.7 adalah $1,00 untuk input dan $0,096 untuk output, sekitar $1,10. Biaya Opus 5 adalah $1,25 untuk input dan $0,20 untuk output, sekitar $1,45. Kesenjangannya telah menyusut dari 3x menjadi sekitar 1,3x. Dorong lebih jauh — 400k, 500k, puncak jendela Grok 4.7 — dan tarif tetap Opus 5 terus menutup kesenjangan sementara jendelanya terus meluas hingga sejuta token. Grok 4.7 adalah model murah pada prompt pendek dan hampir setara dalam hal harga pada prompt panjang, yang membalik intuisi yang hendak diciptakan oleh halaman harga.
Dua catatan penting menjaga ini tetap jujur. Pertama, tier konteks panjang adalah struktur harga daftar yang terdokumentasi dari dokumentasi model xAI sendiri, bukan hasil pengukuran — tagihan sebenarnya bergantung pada caching, dan tarif baca cache Grok 4.7 sebesar $0.50 benar-benar murah. Kedua, Artificial Analysis belum menerbitkan pengukuran kecepatan untuk Grok 4.7, jadi bagian "lebih cepat" dari argumen murah-dan-cepat saat ini belum terverifikasi. Yang terukur adalah Opus 5 pada 59 token per detik dengan waktu ke token pertama 49 detik — lambat, mahal, dan unggul di hampir setiap sumbu kualitas.
Apa yang sebenarnya akan Anda rutekan
Ini adalah perbandingan yang jawaban jujurnya bergantung pada beban kerja, dan router adalah cara termurah untuk bertindak berdasarkan hal itu. Claude Opus 5 tersedia di OrcaRouter, terdaftar di halaman modelnya sendiri dengan harga dari penyedia yang diteruskan tanpa markup 0% — jadi angka $5,00 dan $25,00 untuk Opus 5 di katalog kami adalah harga daftar dari Anthropic, bukan salinan yang sudah dinaikkan, dan jika Anthropic mengubahnya, angkanya berubah pada kunci yang sama di hari yang sama. Grok 4.7 belum ada di katalog OrcaRouter saat tulisan ini dibuat; untuk memanggilnya hari ini, Anda harus melalui API milik xAI sendiri dan platform pihak ketiga yang menyediakannya. Asimetri itu perlu diketahui sebelum Anda merancang arsitektur di sekitarnya.

Pola perutean yang muncul dari angka-angka itu sederhana. Kirimkan pekerjaan berkonteks panjang, berat penalaran, dan agen terminal ke Opus 5 — model ini menang di Terminal-Bench 4.0 dengan selisih 23 poin dan membawa jendela dua kali lebih besar dengan harga tetap, yang persis merupakan profil pekerjaan sulit dan panjang. Kirimkan tugas automasi dan alur kerja bervolume tinggi ke Grok 4.7: ia menang di AutomationBench-AA dengan selisih sembilan poin dan biayanya sepertiganya pada prompt pendek. Karena keduanya dijangkau melalui satu endpoint saat keduanya ada di katalog, pemisahan itu adalah aturan perutean, bukan kontrak vendor kedua, dan failover otomatis berarti batas laju pada satu jalur menjadi peristiwa perutean, bukan gangguan layanan. Ketika suatu beban kerja benar-benar membutuhkan keduanya — tahap pertama yang murah dan tahap verifikasi yang mahal — DSL perutean menyusunnya menjadi satu panggilan, bukan dua integrasi.
Putusan
Jika Anda memilih berdasarkan bukti, Claude Opus 5 memenangkan pertarungan ini dan selisihnya tidak tipis: delapan dari sepuluh evaluasi, dua kesenjangan terlebar, konteks dua kali lipat dengan harga tetap, dan anggaran token yang jauh di bawah dua pertiga ukurannya untuk skor yang lebih tinggi. Komposit lima poin meremehkan seberapa menyeluruhnya ia memimpin. Argumen Grok 4.7 lebih sempit daripada yang disiratkan lembar harganya, tetapi bukan tidak ada — ia benar-benar lebih murah pada ukuran prompt yang paling sering digunakan aplikasi, ia adalah model otomasi yang lebih baik, dan usianya baru sehari dengan rangkaian tolok ukur vendor yang masih direproduksi secara independen. Belilah untuk otomasi yang sensitif terhadap biaya, pantau angka kecepatannya saat Artificial Analysis menerbitkannya, dan anggap tier harga konteks panjang sebagai hal yang menentukan apakah model murah tetap murah.

Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
