Kartu judul hero yang dihasilkan untuk artikel berjudul 'Grok 4.7 vs Grok 4.6 — harga sama, model berbeda', dengan subjudul 'Apa yang sebenarnya berubah pada rilis 21 September' dan chip statistik yang bertuliskan Terminal-Bench 4.0 38,0% vs 20,3%, AA Index 46 vs 44, dan $2/$6 untuk keduanya.
Guides & Insights

Grok 4.7 vs Grok 4.6: Harga $2/$6 Sama, Model Berbeda di Baliknya

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

SpaceXAI merilis Grok 4.7 pada 21 September 2026, dan hal pertama yang layak diperhatikan darinya adalah apa yang tidak berubah: harganya. Grok 4.7 berbiaya $2 per juta token input dan $6 per juta token output, persis seperti biaya yang berlaku bagi Grok 4.6 sejak diluncurkan pada 12 Agustus 2026. Kartu tarif yang sama, jendela konteks 500.000 token yang sama, input teks-dan-gambar yang sama — namun kedua model tidak berdekatan pada evaluasi yang penting untuk pekerjaan agentik. Berdasarkan angka yang diterbitkan SpaceXAI sendiri, Grok 4.7 hampir menggandakan Grok 4.6 pada Terminal-Bench 4.0, 38,0% berbanding 20,3%. Itulah keseluruhan bentuk perbandingan ini: pertukaran generasi dengan harga sama yang hampir seluruh peningkatannya terpusat pada satu titik, dan bagian-bagian Grok 4.6 yang menjengkelkan tim produksi masih ada.

Apa yang sebenarnya berubah antara kedua model itu?

Deskripsi SpaceXAI sendiri tentang rilis ini sempit, dan ada baiknya mengutip bentuknya alih-alih kata sifatnya. Grok 4.7 dibangun di atas model dasar yang lebih besar daripada Grok 4.6, dan model itu diberi proses reinforcement learning yang lebih panjang yang ditujukan untuk tugas-tugas yang "bisa memakan waktu berjam-jam untuk diselesaikan." Perusahaan mengatakan proses tersebut mempertajam tiga hal: verifikasi mandiri, penanganan konteks panjang, dan perilaku di dalam lingkungan Grok Bot. Tidak ada klaim tentang arsitektur baru, modalitas baru, atau stack penyajian yang berbeda.

Kerangka berpikir itu penting karena ia memprediksi di mana peningkatan tolok ukur muncul, dan peningkatan itu muncul tepat di sana. Proses RL yang lebih panjang pada tugas-tugas sulit berdurasi berjam-jam menggerakkan pekerjaan terminal dan repositori jauh lebih besar daripada menggerakkan kuis pengetahuan. Jika Anda berharap Grok 4.7 menjadi model yang lebih luas daripada Grok 4.6, catatan rilis mengatakan sebaliknya — bentuk modelnya sama, dilatih lebih jauh ke ujung sulit dari pekerjaan agentic.

Soal parameter adalah satu-satunya bagian dari hal ini yang bukan pengungkapan vendor. Musk mengatakan pada awal September bahwa Grok 4.7 membawa sekitar 2,1 triliun parameter dibandingkan Grok 4.6 yang 1,5 triliun, peningkatan 40%, dan angka itu telah diulang di mana-mana sejak saat itu. Angka itu belum pernah muncul di lembar spesifikasi SpaceXAI. Anggap itu sebagai klaim yang disampaikan luas tentang model dasar, bukan spesifikasi yang terkonfirmasi — dan perhatikan bahwa jumlah parameter tidak banyak menjelaskan tentang biaya serving atau kemampuan ketika arsitekturnya sparse, seperti halnya lini Grok.

Kesenjangan tolok ukur, dengan label sumber terlampir

Setiap angka di bagian ini berasal dari materi peluncuran SpaceXAI. Tidak ada satu pun yang telah direproduksi secara independen pada saat penulisan, dan cara jujur untuk membacanya adalah sebagai sekumpulan klaim yang kebetulan sangat spesifik — yang membuatnya dapat diperiksa di kemudian hari, tetapi tidak membuatnya terverifikasi sekarang.

• Terminal-Bench 4.0 — Grok 4.7 38,0% (dilaporkan vendor) vs Grok 4.6 20,3%. Selisih tunggal terbesar dalam rilis ini, dan yang cocok dengan klaim "RL lebih lama pada tugas-tugas yang lebih sulit".

• CursorBench 4.0 — Grok 4.7 46,3% (dilaporkan vendor) vs Grok 4.6 40,4%. Peningkatan yang nyata, tetapi sederhana — di bawah enam poin, pada benchmark yang lebih dekat dengan pekerjaan editor sehari-hari daripada sesi terminal otonom.

• DeepSWE v1.1 — Grok 4.7 71,0% pada upaya penalaran tinggi (dilaporkan vendor) vs Grok 4.6 65,2%. Lagi-lagi peningkatan yang solid namun tidak spektakuler.

• EEBench — Grok 4.7 64,0% (dilaporkan oleh vendor). Tidak ada angka Grok 4.6 yang diterbitkan bersamanya, jadi yang ini tidak memberi tahu Anda apa pun tentang peningkatan tersebut.

• AA-Briefcase v1.1 — Grok 4.7 dengan 1.657 Elo (dilaporkan vendor) pada evaluasi pekerjaan pengetahuan profesional.

Baca daftar itu sebagai satu kesatuan dan polanya konsisten: Grok 4.7 jauh lebih baik ketika tugasnya panjang dan bersifat agentik, serta sedikit lebih baik ketika tugasnya pendek. Lompatan Terminal-Bench kira-kira dua kali lipat; peningkatan pada pekerjaan editor berada di kisaran persentase satu digit. Jika beban kerja Anda berbentuk autocomplete, Anda tetap membayar $2/$6 yang sama untuk peningkatan kecil. Jika beban kerja Anda adalah "berjalan selama dua jam lalu kembali," rilis ini ditujukan langsung kepada Anda.

Apa yang dikatakan pengukuran independen sejauh ini

Ada satu angka independen, dan ini layak dinyatakan dengan hati-hati karena mudah salah dibaca. Artificial Analysis memberi Grok 4.7 skor 46 pada Intelligence Index-nya, versi v4.3.2, dan menempatkannya di peringkat ke-16 dari 655 model di papan peringkat tersebut. Grok 4.6 berada di 44 pada skala yang sama. Selisih dua poin pada indeks komposit bukanlah penggandaan seperti yang ditunjukkan Terminal-Bench, dan ketidaksesuaian itu informatif, bukan kontradiktif: indeks tersebut memadukan penalaran, pengetahuan, matematika, dan pemrograman, sehingga peningkatan besar pada satu irisan agentik menjadi terdilusi oleh segala hal yang tidak diubah oleh model tersebut.

Dua detail lebih lanjut dari halaman yang sama lebih berguna daripada skor utamanya. Pertama, Grok 4.7 menghasilkan 240 juta token output saat menjalankan indeks, dibandingkan median 92 juta — ini adalah penalar yang bertele-tele, dan pada tarif output $6 per juta, verbositas itu menjadi pos biaya tersendiri. Kedua, komposit indeks menempatkannya di antara model terkuat di kelas harganya, dan itulah perbandingan yang benar-benar penting bagi pembeli. Artificial Analysis belum menerbitkan harga yang terisi untuk Grok 4.7 di halaman model, jadi jangan ambil angka biaya per tugasnya dari sana; gunakan $2/$6 dari vendor.

A generated two-column comparison scoreboard for Grok 4.7 and Grok 4.6 with six rows: Terminal-Bench 4.0 38.0% vs 20.3%, CursorBench 4.0 46.3% vs 40.4%, DeepSWE v1.1 71.0% vs 65.2%, AA Intelligence Index 46 vs 44, context 500K on both, and price $2/$6 on both, with a footer noting all benchmark figures are vendor-reported and the index scores are per Artificial Analysis v4.3.2.

Tebing harga yang tidak diperbaiki oleh model mana pun

Inilah bagian dari kartu tarif Grok 4.6 yang membuat tim produksi membencinya, dan Grok 4.7 tidak mengubahnya. Di bawah 200.000 token masukan, tarifnya adalah $2 masuk dan $6 keluar. Di atasnya, seluruh permintaan dihargai ulang menjadi $4 masuk dan $12 keluar. Bukan token berlebihnya — melainkan seluruh permintaan. Panggilan 210.000 token biayanya dua kali lipat panggilan 199.000 token, untuk 11.000 token ekstra.

Dengan jendela konteks 500.000 token pada kedua model, jurang itu mudah untuk terjatuhi. Jalannya agen dengan konteks panjang dan prompt seluruh repositori adalah persis beban kerja yang menjadi sasaran penyetelan Grok 4.7, yang berarti kasus penggunaan terbaik model ini juga merupakan kasus yang paling mungkin memicu penggandaan tarif. Jika Anda memindahkan pekerjaan ke Grok 4.7 karena model ini menangani sesi agen yang panjang dengan lebih baik, anggarkan penyesuaian harga sebelum memindahkannya, bukan sesudahnya.

Ada juga tingkat kecepatan yang perlu diperhitungkan. SpaceXAI merilis varian cepat dari Grok 4.7 yang menggandakan kecepatan output dan menggandakan harga yang tertera. Itu pertukaran yang sah untuk pengkodean interaktif, dan pilihan yang buruk untuk pekerjaan batch — tugas yang sama dengan kualitas yang sama memakan biaya dua kali lipat hanya demi penghematan waktu aktual yang tidak diawasi siapa pun.

Bermigrasi dari Grok 4.6 tanpa menulis ulang

Kabar baik secara praktisnya adalah ini merupakan pertukaran model, bukan migrasi platform. Kedua model menerima teks dan gambar sebagai masukan lalu mengembalikan teks, keduanya menggunakan tingkat reasoning-effort yang sama dari low hingga xhigh, dan bentuk permintaannya sama dengan yang telah dilayani SpaceXAI sejak Grok 4.5. Kode yang memanggil Grok 4.6 dengan parameter effort tidak perlu direstrukturisasi untuk memanggil Grok 4.7.

Yang membuat penggantian ini tidak gratis adalah evaluasinya. Keuntungan Grok 4.7 terkonsentrasi pada eksekusi agentik yang panjang, sehingga rangkaian pengujian yang dibangun dari prompt singkat satu giliran hampir tidak akan menunjukkan apa pun kepada Anda — Anda akan melihat peningkatan sebesar CursorBench dan menyimpulkan bahwa peningkatan versi itu tidak sepadan dengan upayanya, padahal alasan untuk itu terletak pada tugas-tugas yang tidak pernah diuji oleh rangkaian pengujian Anda. Pengukuran yang benar-benar akan memutuskannya adalah penyelesaian tugas pada pekerjaan multi-langkah: patch yang diterima, regresi yang diperkenalkan, panggilan alat per tugas yang diselesaikan, dan seberapa sering suatu eksekusi membutuhkan penyelamatan manusia. Itulah sumbu yang ditunjuk oleh angka vendor sendiri, dan itulah yang tidak dicakup oleh benchmark yang dipublikasikan untuk basis kode Anda.

Verbosity adalah hal kedua yang perlu diukur. Model yang mengeluarkan 240 juta token pada indeks standar akan mengeluarkan lebih banyak token pada beban kerja Anda daripada pendahulunya, dan pada $6 per juta output, itu bisa diam-diam menghapus nilai peningkatan dengan harga yang sama. Lacak token output per tugas yang diselesaikan selama seminggu sebelum Anda berkomitmen.

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), showing an Intelligence Index of 46 on index version v4.3.2, a 500k token context window, text and image input with text output, and a verbosity figure of 240M output tokens generated on the index.

Yang mana yang harus dihubungi

Keputusan ini benar-benar sederhana, yang tidak biasa untuk perbandingan model. Grok 4.6 tetap menjadi pilihan yang tepat untuk lalu lintas berdurasi pendek dan sensitif biaya: obrolan, klasifikasi, peringkasan, dan bantuan kode skala editor, di mana keunggulan Grok 4.7 kecil dan verbositasnya menjadi beban. Grok 4.7 adalah pilihan yang tepat untuk beban kerja yang memang dirancang untuknya — pengodean agentik berhorizon panjang dan pekerjaan terminal ketika tugas berjalan selama berjam-jam dan verifikasi mandiri menjadi pembeda antara pekerjaan yang selesai dan yang macet.

Menjalankan keduanya bukanlah kompromi di sini, melainkan jawaban yang tepat, dan murah untuk dilakukan. Grok 4.6 ada di katalog OrcaRouter dengan harga daftar SpaceXAI tanpa markup 0% yang diteruskan langsung, jadi kartu tarif $2/$6 di atas adalah yang Anda bayar — dan karena kami meneruskan harga daftar penyedia alih-alih menaikkannya, setiap perubahan harga vendor langsung aktif di sisi kami pada hari yang sama saat ditetapkan. Satu kunci API mencakup Grok 4.6 dan 200+ model lainnya, sehingga memindahkan trafik di antara model-model tersebut berdasarkan tugas hanyalah perubahan konfigurasi, bukan kontrak kedua. Jika Anda ingin mencoba Grok 4.7 di jalur produksi sebelum mempercayainya, pola yang lebih aman adalah tetap menempatkan fallback pada Grok 4.6 — model yang bisa Anda rutekan hari ini — dan biarkan failover otomatis lintas penyedia memindahkan permintaan kembali saat model baru tersebut bermasalah.

Screenshot of the OrcaRouter model page for Grok 4.6 (model ID grok/grok-4.6), showing SpaceXAI's list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a 500K token context window, and the reasoning and vision capability tags.

Tontonan Berikutnya

Dua hal akan menyelesaikan perbandingan ini, dan keduanya belum terjadi. Yang pertama adalah reproduksi independen atas angka Terminal-Bench 4.0 — 38% adalah lompatan yang cukup besar sehingga seseorang akan menjalankannya ulang, dan jika angka itu bertahan, argumen untuk Grok 4.7 dalam pipeline agentik kuat berdasarkan kualitasnya, bukan pemasaran. Yang kedua adalah sisa peta jalan Grok: SpaceXAI secara publik telah mengurutkan Grok 4.8, Grok 4.9, dan Grok 5 setelah rilis ini, dan masa hidup Grok 4.6 sendiri hanya sekitar lima minggu. Mengadopsi Grok 4.7 sebagai asumsi platform jangka panjang akan mengulangi kesalahan yang dilakukan tim dengan Grok 4.5.

Untuk saat ini, peningkatan dengan harga yang sama itu nyata dan arah perkembangannya jelas. Angka yang perlu diingat adalah bahwa $2/$6 memberi Anda model yang kira-kira dua kali lipat pada pekerjaan terminal jangka panjang dan hampir tidak bergerak di tempat lain — dan itu adalah klaim yang spesifik, berguna, dan dapat diperiksa, bukan lompatan generasi.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari