Kartu judul bertuliskan “Grok 4.7 vs Claude Opus 5” dengan subjudul “Kesenjangan harga itu nyata; paritasnya tidak”, dan tiga kartu: AA Index v4.3.2 46 vs 51, Harga per 1 juta $2/$6 vs $5/$25, dan Terminal-Bench 4.0 26 vs 49.
Guides & Insights

Grok 4.7 vs Claude Opus 5: Kesenjangan Harga Itu Nyata, Paritasnya Tidak

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Anda dapat memanggil Grok 4.7 dengan harga $2,00 per juta token masukan dan $6,00 per juta token keluaran. Anda dapat memanggil Claude Opus 5 dengan harga $5,00 dan $25,00. Itu adalah perbedaan 4,2x pada keluaran — jenis kesenjangan yang biasanya sudah menyelesaikan perbandingan bahkan sebelum tolok ukur dibuka. Namun, itu tidak menyelesaikan yang ini. Pada versi Artificial Analysis Intelligence Index yang saat ini menjadi acuan skor kedua model — v4.3.2, revisi yang diterbitkan pada 19 September 2026 — Claude Opus 5 berada di angka 51 dan Grok 4.7, yang dirilis vendor pada 21 September 2026, berada di angka 46. Lima poin bukanlah kemenangan telak, tetapi komposisi kelima poin itu adalah: Opus 5 memenangi delapan dari sepuluh evaluasi dalam indeks tersebut. Argumen model yang lebih murah adalah harga, konteksnya imbang, dan satu tempat di mana keunggulan harga Grok 4.7 seharusnya paling berpengaruh justru adalah tempat keunggulan itu hilang.

Dua flagship, dua daftar harga yang sangat berbeda

Claude Opus 5 telah ada di pasar sejak 24 Juli 2026 dan merupakan produk unggulan tingkat Opus dari Anthropic, yang berada di bawah Claude Fable 5.1 dalam jajaran produk perusahaan itu sendiri. Model ini membawa jendela konteks 1 juta token dengan harga tetap — Anthropic menyatakan secara gamblang bahwa permintaan 900k token ditagih dengan tarif per token yang sama seperti permintaan 9k token, tanpa premi konteks panjang sama sekali — serta output maksimum 128K, yang dapat diperluas hingga 300K pada API Message Batches. Kemampuan berpikirnya adaptif dan aktif secara default, dengan tangga upaya yang mencakup low, medium, high, xhigh, dan max, serta default pada high. Bobotnya tertutup.

Grok 4.7 baru berumur satu hari. Model ini memiliki konteks 500k token, menerima teks dan gambar sebagai masukan serta mengembalikan teks, dan menjalankan pengatur tingkat upaya penalarannya sendiri. Harga daftarnya adalah $2,00 untuk masukan dan $6,00 untuk keluaran per juta token di bawah 200k token prompt, naik menjadi $4,00 dan $12,00 pada atau di atas ambang tersebut; pembacaan cache dikenakan $0,50 dan $1,00 pada dua rentang yang sama. xAI juga mencantumkan varian yang lebih cepat yang berjalan pada kecepatan keluaran sekitar dua kali lipat dengan harga sekitar dua kali lipat, meskipun konfigurasi itu dirilis tanpa pengukuran kecepatan yang dipublikasikan. Bobotnya juga tertutup di sini, yang menghilangkan jalan keluar "jalankan sendiri" dari kedua sisi perbandingan ini.

Dewan independen itu tidak dekat, dan itu tidak menyanjung.

Kedua model ini dinilai berdasarkan indeks v4.3.2 dari Artificial Analysis, yang mencakup sepuluh evaluasi meliputi agen, pengodean, pengetahuan umum, dan penalaran ilmiah. Menempatkan kedua kolom itu berdampingan membuat angka utama selisih lima poin tampak terlalu menguntungkan bagi model yang lebih murah — selisih lima poin tunggal dalam skor komposit bisa menyembunyikan banyak hal, dan di sini selisih itu menyembunyikan hasil yang nyaris sapu bersih.

Kecerdasan gabungan — Grok 4.7 (xhigh): 46 pada Artificial Analysis Intelligence Index v4.3.2. Claude Opus 5 (penalaran adaptif, upaya maksimal): 51 pada revisi yang sama.

Penalaran sulit — Grok 4.7: Humanity's Last Exam 43, CritPt 18. Claude Opus 5: HLE 55, CritPt 29. Selisih dua belas poin dan sebelas poin secara berurutan, keduanya menguntungkan Opus 5.

Terminal agentik — Grok 4.7: Terminal-Bench 4.0 26. Claude Opus 5: 49. Inilah selisih tunggal terlebar di papan, dan itu terjadi pada benchmark yang paling dekat dengan kerja otonom nyata.

Otomasi tempat kerja — Grok 4.7: AutomationBench-AA 66%. Claude Opus 5: 57%. Satu kemenangan jelas Grok 4.7, dan itu kemenangan nyata — sembilan poin pada evaluasi yang menilai apakah sebuah agen menyelesaikan alur kerja tanpa tersandung pagar pengaman.

Pengetahuan dan kejujuran — Grok 4.7: AA-Omniscience 32. Claude Opus 5: 37. Kedua model berhalusinasi; Opus 5 lebih jarang melakukannya pada ukuran ini.

Konteks panjang — Grok 4.7: AA-LCR v1.1 77%, jendela 500k token. Claude Opus 5: 79%, jendela 1M token.

Biaya menjalankan indeks — Grok 4.7: 240 juta token keluaran di seluruh evaluasi, ditandai oleh Artificial Analysis sebagai sangat bertele-tele. Claude Opus 5: 140 juta. Grok 4.7 menghabiskan 1,7x token untuk mencapai skor yang lebih rendah.

OrcaRouter model page for Claude Opus 5 showing the anthropic/claude-opus-5 identifier, a 1M-token context window, 128K maximum output, text, image and file input with text output, list rates of $5.00 per 1M input and $25.00 per 1M output, and 69.9M tokens of traffic over seven days.

Di mana keunggulan harga Grok 4.7 menemui ajalnya

Berikut adalah aritmetika yang disembunyikan oleh lembar tarif. Ambil permintaan agentik yang realistis: 30k token masukan, 8k keluaran. Grok 4.7 menagih $0.06 untuk masukan dan $0.048 untuk keluaran — sekitar sebelas sen. Claude Opus 5 menagih $0.15 untuk masukan dan $0.20 untuk keluaran — sekitar tiga puluh lima sen. Itu benar-benar 3x, dan pada ukuran ini Grok 4.7 adalah pilihan yang jelas hanya berdasarkan biaya.

Sekarang ambil permintaan yang menjadi dasar pemasaran Grok 4.7 sendiri: sesi agentik konteks panjang. Dorong prompt melewati 200k token dan tarif Grok 4.7 berlipat ganda menjadi $4,00 untuk input dan $12,00 untuk output. Claude Opus 5 tidak berubah — jendela 1M-nya ditagih $5,00 dan $25,00 secara tetap. Pada 250k input dan 8k output, biaya Grok 4.7 adalah $1,00 untuk input dan $0,096 untuk output, sekitar $1,10. Biaya Opus 5 adalah $1,25 untuk input dan $0,20 untuk output, sekitar $1,45. Kesenjangannya telah menyusut dari 3x menjadi sekitar 1,3x. Dorong lebih jauh — 400k, 500k, puncak jendela Grok 4.7 — dan tarif tetap Opus 5 terus menutup kesenjangan sementara jendelanya terus meluas hingga sejuta token. Grok 4.7 adalah model murah pada prompt pendek dan hampir setara dalam hal harga pada prompt panjang, yang membalik intuisi yang hendak diciptakan oleh halaman harga.

Dua catatan penting menjaga ini tetap jujur. Pertama, tier konteks panjang adalah struktur harga daftar yang terdokumentasi dari dokumentasi model xAI sendiri, bukan hasil pengukuran — tagihan sebenarnya bergantung pada caching, dan tarif baca cache Grok 4.7 sebesar $0.50 benar-benar murah. Kedua, Artificial Analysis belum menerbitkan pengukuran kecepatan untuk Grok 4.7, jadi bagian "lebih cepat" dari argumen murah-dan-cepat saat ini belum terverifikasi. Yang terukur adalah Opus 5 pada 59 token per detik dengan waktu ke token pertama 49 detik — lambat, mahal, dan unggul di hampir setiap sumbu kualitas.

Apa yang sebenarnya akan Anda rutekan

Ini adalah perbandingan yang jawaban jujurnya bergantung pada beban kerja, dan router adalah cara termurah untuk bertindak berdasarkan hal itu. Claude Opus 5 tersedia di OrcaRouter, terdaftar di halaman modelnya sendiri dengan harga dari penyedia yang diteruskan tanpa markup 0% — jadi angka $5,00 dan $25,00 untuk Opus 5 di katalog kami adalah harga daftar dari Anthropic, bukan salinan yang sudah dinaikkan, dan jika Anthropic mengubahnya, angkanya berubah pada kunci yang sama di hari yang sama. Grok 4.7 belum ada di katalog OrcaRouter saat tulisan ini dibuat; untuk memanggilnya hari ini, Anda harus melalui API milik xAI sendiri dan platform pihak ketiga yang menyediakannya. Asimetri itu perlu diketahui sebelum Anda merancang arsitektur di sekitarnya.

Two-column scoreboard titled “Grok 4.7 vs Claude Opus 5 - the scoreboard”: AA Index 46 vs 51, Terminal-Bench 4.0 26 vs 49, AutomationBench 66% vs 57%, context 500k vs 1M, price per 1M $2/$6 vs $5/$25, and open weights “no” on both sides.

Pola perutean yang muncul dari angka-angka itu sederhana. Kirimkan pekerjaan berkonteks panjang, berat penalaran, dan agen terminal ke Opus 5 — model ini menang di Terminal-Bench 4.0 dengan selisih 23 poin dan membawa jendela dua kali lebih besar dengan harga tetap, yang persis merupakan profil pekerjaan sulit dan panjang. Kirimkan tugas automasi dan alur kerja bervolume tinggi ke Grok 4.7: ia menang di AutomationBench-AA dengan selisih sembilan poin dan biayanya sepertiganya pada prompt pendek. Karena keduanya dijangkau melalui satu endpoint saat keduanya ada di katalog, pemisahan itu adalah aturan perutean, bukan kontrak vendor kedua, dan failover otomatis berarti batas laju pada satu jalur menjadi peristiwa perutean, bukan gangguan layanan. Ketika suatu beban kerja benar-benar membutuhkan keduanya — tahap pertama yang murah dan tahap verifikasi yang mahal — DSL perutean menyusunnya menjadi satu panggilan, bukan dua integrasi.

Putusan

Jika Anda memilih berdasarkan bukti, Claude Opus 5 memenangkan pertarungan ini dan selisihnya tidak tipis: delapan dari sepuluh evaluasi, dua kesenjangan terlebar, konteks dua kali lipat dengan harga tetap, dan anggaran token yang jauh di bawah dua pertiga ukurannya untuk skor yang lebih tinggi. Komposit lima poin meremehkan seberapa menyeluruhnya ia memimpin. Argumen Grok 4.7 lebih sempit daripada yang disiratkan lembar harganya, tetapi bukan tidak ada — ia benar-benar lebih murah pada ukuran prompt yang paling sering digunakan aplikasi, ia adalah model otomasi yang lebih baik, dan usianya baru sehari dengan rangkaian tolok ukur vendor yang masih direproduksi secara independen. Belilah untuk otomasi yang sensitif terhadap biaya, pantau angka kecepatannya saat Artificial Analysis menerbitkannya, dan anggap tier harga konteks panjang sebagai hal yang menentukan apakah model murah tetap murah.

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari