
Grok 4.7 vs Grok 4.6: Harga $2/$6 Sama, Model Berbeda di Baliknya
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 1009 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 195 tok/s
- OrcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- xAISpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
SpaceXAI merilis Grok 4.7 pada 21 September 2026, dan hal pertama yang layak diperhatikan darinya adalah apa yang tidak berubah: harganya. Grok 4.7 berbiaya $2 per juta token input dan $6 per juta token output, persis seperti biaya yang berlaku bagi Grok 4.6 sejak diluncurkan pada 12 Agustus 2026. Kartu tarif yang sama, jendela konteks 500.000 token yang sama, input teks-dan-gambar yang sama — namun kedua model tidak berdekatan pada evaluasi yang penting untuk pekerjaan agentik. Berdasarkan angka yang diterbitkan SpaceXAI sendiri, Grok 4.7 hampir menggandakan Grok 4.6 pada Terminal-Bench 4.0, 38,0% berbanding 20,3%. Itulah keseluruhan bentuk perbandingan ini: pertukaran generasi dengan harga sama yang hampir seluruh peningkatannya terpusat pada satu titik, dan bagian-bagian Grok 4.6 yang menjengkelkan tim produksi masih ada.
Apa yang sebenarnya berubah antara kedua model itu?
Deskripsi SpaceXAI sendiri tentang rilis ini sempit, dan ada baiknya mengutip bentuknya alih-alih kata sifatnya. Grok 4.7 dibangun di atas model dasar yang lebih besar daripada Grok 4.6, dan model itu diberi proses reinforcement learning yang lebih panjang yang ditujukan untuk tugas-tugas yang "bisa memakan waktu berjam-jam untuk diselesaikan." Perusahaan mengatakan proses tersebut mempertajam tiga hal: verifikasi mandiri, penanganan konteks panjang, dan perilaku di dalam lingkungan Grok Bot. Tidak ada klaim tentang arsitektur baru, modalitas baru, atau stack penyajian yang berbeda.
Kerangka berpikir itu penting karena ia memprediksi di mana peningkatan tolok ukur muncul, dan peningkatan itu muncul tepat di sana. Proses RL yang lebih panjang pada tugas-tugas sulit berdurasi berjam-jam menggerakkan pekerjaan terminal dan repositori jauh lebih besar daripada menggerakkan kuis pengetahuan. Jika Anda berharap Grok 4.7 menjadi model yang lebih luas daripada Grok 4.6, catatan rilis mengatakan sebaliknya — bentuk modelnya sama, dilatih lebih jauh ke ujung sulit dari pekerjaan agentic.
Soal parameter adalah satu-satunya bagian dari hal ini yang bukan pengungkapan vendor. Musk mengatakan pada awal September bahwa Grok 4.7 membawa sekitar 2,1 triliun parameter dibandingkan Grok 4.6 yang 1,5 triliun, peningkatan 40%, dan angka itu telah diulang di mana-mana sejak saat itu. Angka itu belum pernah muncul di lembar spesifikasi SpaceXAI. Anggap itu sebagai klaim yang disampaikan luas tentang model dasar, bukan spesifikasi yang terkonfirmasi — dan perhatikan bahwa jumlah parameter tidak banyak menjelaskan tentang biaya serving atau kemampuan ketika arsitekturnya sparse, seperti halnya lini Grok.
Kesenjangan tolok ukur, dengan label sumber terlampir
Setiap angka di bagian ini berasal dari materi peluncuran SpaceXAI. Tidak ada satu pun yang telah direproduksi secara independen pada saat penulisan, dan cara jujur untuk membacanya adalah sebagai sekumpulan klaim yang kebetulan sangat spesifik — yang membuatnya dapat diperiksa di kemudian hari, tetapi tidak membuatnya terverifikasi sekarang.
• Terminal-Bench 4.0 — Grok 4.7 38,0% (dilaporkan vendor) vs Grok 4.6 20,3%. Selisih tunggal terbesar dalam rilis ini, dan yang cocok dengan klaim "RL lebih lama pada tugas-tugas yang lebih sulit".
• CursorBench 4.0 — Grok 4.7 46,3% (dilaporkan vendor) vs Grok 4.6 40,4%. Peningkatan yang nyata, tetapi sederhana — di bawah enam poin, pada benchmark yang lebih dekat dengan pekerjaan editor sehari-hari daripada sesi terminal otonom.
• DeepSWE v1.1 — Grok 4.7 71,0% pada upaya penalaran tinggi (dilaporkan vendor) vs Grok 4.6 65,2%. Lagi-lagi peningkatan yang solid namun tidak spektakuler.
• EEBench — Grok 4.7 64,0% (dilaporkan oleh vendor). Tidak ada angka Grok 4.6 yang diterbitkan bersamanya, jadi yang ini tidak memberi tahu Anda apa pun tentang peningkatan tersebut.
• AA-Briefcase v1.1 — Grok 4.7 dengan 1.657 Elo (dilaporkan vendor) pada evaluasi pekerjaan pengetahuan profesional.
Baca daftar itu sebagai satu kesatuan dan polanya konsisten: Grok 4.7 jauh lebih baik ketika tugasnya panjang dan bersifat agentik, serta sedikit lebih baik ketika tugasnya pendek. Lompatan Terminal-Bench kira-kira dua kali lipat; peningkatan pada pekerjaan editor berada di kisaran persentase satu digit. Jika beban kerja Anda berbentuk autocomplete, Anda tetap membayar $2/$6 yang sama untuk peningkatan kecil. Jika beban kerja Anda adalah "berjalan selama dua jam lalu kembali," rilis ini ditujukan langsung kepada Anda.
Apa yang dikatakan pengukuran independen sejauh ini
Ada satu angka independen, dan ini layak dinyatakan dengan hati-hati karena mudah salah dibaca. Artificial Analysis memberi Grok 4.7 skor 46 pada Intelligence Index-nya, versi v4.3.2, dan menempatkannya di peringkat ke-16 dari 655 model di papan peringkat tersebut. Grok 4.6 berada di 44 pada skala yang sama. Selisih dua poin pada indeks komposit bukanlah penggandaan seperti yang ditunjukkan Terminal-Bench, dan ketidaksesuaian itu informatif, bukan kontradiktif: indeks tersebut memadukan penalaran, pengetahuan, matematika, dan pemrograman, sehingga peningkatan besar pada satu irisan agentik menjadi terdilusi oleh segala hal yang tidak diubah oleh model tersebut.
Dua detail lebih lanjut dari halaman yang sama lebih berguna daripada skor utamanya. Pertama, Grok 4.7 menghasilkan 240 juta token output saat menjalankan indeks, dibandingkan median 92 juta — ini adalah penalar yang bertele-tele, dan pada tarif output $6 per juta, verbositas itu menjadi pos biaya tersendiri. Kedua, komposit indeks menempatkannya di antara model terkuat di kelas harganya, dan itulah perbandingan yang benar-benar penting bagi pembeli. Artificial Analysis belum menerbitkan harga yang terisi untuk Grok 4.7 di halaman model, jadi jangan ambil angka biaya per tugasnya dari sana; gunakan $2/$6 dari vendor.

Tebing harga yang tidak diperbaiki oleh model mana pun
Inilah bagian dari kartu tarif Grok 4.6 yang membuat tim produksi membencinya, dan Grok 4.7 tidak mengubahnya. Di bawah 200.000 token masukan, tarifnya adalah $2 masuk dan $6 keluar. Di atasnya, seluruh permintaan dihargai ulang menjadi $4 masuk dan $12 keluar. Bukan token berlebihnya — melainkan seluruh permintaan. Panggilan 210.000 token biayanya dua kali lipat panggilan 199.000 token, untuk 11.000 token ekstra.
Dengan jendela konteks 500.000 token pada kedua model, jurang itu mudah untuk terjatuhi. Jalannya agen dengan konteks panjang dan prompt seluruh repositori adalah persis beban kerja yang menjadi sasaran penyetelan Grok 4.7, yang berarti kasus penggunaan terbaik model ini juga merupakan kasus yang paling mungkin memicu penggandaan tarif. Jika Anda memindahkan pekerjaan ke Grok 4.7 karena model ini menangani sesi agen yang panjang dengan lebih baik, anggarkan penyesuaian harga sebelum memindahkannya, bukan sesudahnya.
Ada juga tingkat kecepatan yang perlu diperhitungkan. SpaceXAI merilis varian cepat dari Grok 4.7 yang menggandakan kecepatan output dan menggandakan harga yang tertera. Itu pertukaran yang sah untuk pengkodean interaktif, dan pilihan yang buruk untuk pekerjaan batch — tugas yang sama dengan kualitas yang sama memakan biaya dua kali lipat hanya demi penghematan waktu aktual yang tidak diawasi siapa pun.
Bermigrasi dari Grok 4.6 tanpa menulis ulang
Kabar baik secara praktisnya adalah ini merupakan pertukaran model, bukan migrasi platform. Kedua model menerima teks dan gambar sebagai masukan lalu mengembalikan teks, keduanya menggunakan tingkat reasoning-effort yang sama dari low hingga xhigh, dan bentuk permintaannya sama dengan yang telah dilayani SpaceXAI sejak Grok 4.5. Kode yang memanggil Grok 4.6 dengan parameter effort tidak perlu direstrukturisasi untuk memanggil Grok 4.7.
Yang membuat penggantian ini tidak gratis adalah evaluasinya. Keuntungan Grok 4.7 terkonsentrasi pada eksekusi agentik yang panjang, sehingga rangkaian pengujian yang dibangun dari prompt singkat satu giliran hampir tidak akan menunjukkan apa pun kepada Anda — Anda akan melihat peningkatan sebesar CursorBench dan menyimpulkan bahwa peningkatan versi itu tidak sepadan dengan upayanya, padahal alasan untuk itu terletak pada tugas-tugas yang tidak pernah diuji oleh rangkaian pengujian Anda. Pengukuran yang benar-benar akan memutuskannya adalah penyelesaian tugas pada pekerjaan multi-langkah: patch yang diterima, regresi yang diperkenalkan, panggilan alat per tugas yang diselesaikan, dan seberapa sering suatu eksekusi membutuhkan penyelamatan manusia. Itulah sumbu yang ditunjuk oleh angka vendor sendiri, dan itulah yang tidak dicakup oleh benchmark yang dipublikasikan untuk basis kode Anda.
Verbosity adalah hal kedua yang perlu diukur. Model yang mengeluarkan 240 juta token pada indeks standar akan mengeluarkan lebih banyak token pada beban kerja Anda daripada pendahulunya, dan pada $6 per juta output, itu bisa diam-diam menghapus nilai peningkatan dengan harga yang sama. Lacak token output per tugas yang diselesaikan selama seminggu sebelum Anda berkomitmen.

Yang mana yang harus dihubungi
Keputusan ini benar-benar sederhana, yang tidak biasa untuk perbandingan model. Grok 4.6 tetap menjadi pilihan yang tepat untuk lalu lintas berdurasi pendek dan sensitif biaya: obrolan, klasifikasi, peringkasan, dan bantuan kode skala editor, di mana keunggulan Grok 4.7 kecil dan verbositasnya menjadi beban. Grok 4.7 adalah pilihan yang tepat untuk beban kerja yang memang dirancang untuknya — pengodean agentik berhorizon panjang dan pekerjaan terminal ketika tugas berjalan selama berjam-jam dan verifikasi mandiri menjadi pembeda antara pekerjaan yang selesai dan yang macet.
Menjalankan keduanya bukanlah kompromi di sini, melainkan jawaban yang tepat, dan murah untuk dilakukan. Grok 4.6 ada di katalog OrcaRouter dengan harga daftar SpaceXAI tanpa markup 0% yang diteruskan langsung, jadi kartu tarif $2/$6 di atas adalah yang Anda bayar — dan karena kami meneruskan harga daftar penyedia alih-alih menaikkannya, setiap perubahan harga vendor langsung aktif di sisi kami pada hari yang sama saat ditetapkan. Satu kunci API mencakup Grok 4.6 dan 200+ model lainnya, sehingga memindahkan trafik di antara model-model tersebut berdasarkan tugas hanyalah perubahan konfigurasi, bukan kontrak kedua. Jika Anda ingin mencoba Grok 4.7 di jalur produksi sebelum mempercayainya, pola yang lebih aman adalah tetap menempatkan fallback pada Grok 4.6 — model yang bisa Anda rutekan hari ini — dan biarkan failover otomatis lintas penyedia memindahkan permintaan kembali saat model baru tersebut bermasalah.

Tontonan Berikutnya
Dua hal akan menyelesaikan perbandingan ini, dan keduanya belum terjadi. Yang pertama adalah reproduksi independen atas angka Terminal-Bench 4.0 — 38% adalah lompatan yang cukup besar sehingga seseorang akan menjalankannya ulang, dan jika angka itu bertahan, argumen untuk Grok 4.7 dalam pipeline agentik kuat berdasarkan kualitasnya, bukan pemasaran. Yang kedua adalah sisa peta jalan Grok: SpaceXAI secara publik telah mengurutkan Grok 4.8, Grok 4.9, dan Grok 5 setelah rilis ini, dan masa hidup Grok 4.6 sendiri hanya sekitar lima minggu. Mengadopsi Grok 4.7 sebagai asumsi platform jangka panjang akan mengulangi kesalahan yang dilakukan tim dengan Grok 4.5.
Untuk saat ini, peningkatan dengan harga yang sama itu nyata dan arah perkembangannya jelas. Angka yang perlu diingat adalah bahwa $2/$6 memberi Anda model yang kira-kira dua kali lipat pada pekerjaan terminal jangka panjang dan hampir tidak bergerak di tempat lain — dan itu adalah klaim yang spesifik, berguna, dan dapat diperiksa, bukan lompatan generasi.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
