
Grok 4.7 Mencetak Skor 46 pada Artificial Analysis Intelligence Index dan Menempatkan SpaceXAI di Empat Besar
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 217 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 51 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Grok 4.7 Mencetak Skor 46 pada Artificial Analysis Intelligence Index dan Menempatkan SpaceXAI di Empat Besar
Grok 4.7 telah dirilis. SpaceXAI merilisnya pada Senin, 21 September 2026 — dengan harga yang sama, $2 per juta token input dan $6 per juta token output seperti Grok 4.6, dengan jendela konteks 500.000 token yang sama, batas pengetahuan yang lebih baru dan tingkat penalaran puncak yang baru. Model ini sudah aktif di Cursor dan Grok Build, melalui API milik vendor itu sendiri, dan melalui coding harness, router model, serta platform cloud pihak ketiga. Grok 4.5, dari 8 Juli, tetap berada di bawahnya sebagai opsi yang lebih murah, dan model-model yang masih harus dikalahkannya tidak berubah: Claude Fable 5.1, Claude Opus 5, dan GPT-5.6 Sol semuanya berada di atasnya pada Indeks Kecerdasan v4.3.2 Artificial Analysis, tempat skor independen pertama Grok 4.7 — 46 — berada dua poin di atas Grok 4.6 dan tujuh poin di bawah Claude Fable 5.1. Pada papan AA-Briefcase dari evaluator yang sama untuk pekerjaan pengetahuan berjangka panjang, model ini berada di peringkat keempat, di belakang tiga entri Claude dan di depan Claude Opus 5 pada upaya xhigh, dengan biaya per tugas sekitar setengah biaya Claude Opus 5 — hasil independen pertama dalam rilis ini yang terbaca sebagai kemenangan harga-kinerja alih-alih kesenjangan. Sebelas hari kemudian, gambaran ini melebar di tepinya alih-alih di tengahnya: sejak 1 Oktober model ini telah diluncurkan secara bertahap di dalam aplikasi web dan seluler milik Grok sendiri, tempat pemilih mode kini mencantumkannya pada dua entri tersulitnya, dan model ini terdaftar di OrcaRouter dengan harga $2/$6 milik SpaceXAI sendiri.
Itulah peluncurannya. Angka-angka yang lebih berguna datang pada hari yang sama, dari satu-satunya evaluator dalam kisah ini yang bukan vendor: Artificial Analysis menerbitkan hasil independen pertamanya untuk Grok 4.7, dan ini adalah hasil tiga bagian — 46 pada Intelligence Index yang hanya unggul dua poin dari Grok 4.6, 56 pada Coding Agent Index yang unggul sembilan poin darinya, dan 1.657 Elo pada AA-Briefcase yang unggul 111 poin. Ketiga angka itu menunjuk ke arah yang berbeda, dan selisih di antara ketiganya adalah hal yang paling menarik dari rilis ini. Berikut ini adalah spesifikasi yang dikirimkan, tabel benchmark milik vendor sendiri dengan label yang dibutuhkan setiap baris, lalu skor independen yang dibaca dengan benar — termasuk apa yang mereka katakan tentang kaveat kesiapan yang tidak pernah ditangani SpaceXAI.
Apa yang dirilis SpaceXAI pada 21 September
Mulailah dari spesifikasinya, karena spesifikasi ini luar biasa mirip dengan pendahulunya. Grok 4.7 dibanderol dengan harga yang identik dengan Grok 4.6 — $2 per juta token input dan $6 per juta token output untuk di bawah 200.000 token input, naik menjadi $4 masuk dan $12 keluar begitu sebuah permintaan melewati ambang tersebut, struktur yang sama seperti yang diperkenalkan Grok 4.6. Jendela konteksnya 500.000 token. Batas pengetahuan (knowledge cutoff) adalah Mei 2026, tiga bulan lebih lambat daripada Grok 4.6 yang 1 Februari 2026. Tingkat upaya penalaran (reasoning effort) mencakup empat level — low, medium, high, dan xhigh — dan angka-angka yang dipublikasikan dikutip pada xhigh. Varian cepat berjalan dengan kecepatan output dua kali lipat dengan harga dua kali lipat.
Di baliknya, xAI menjelaskan tiga perubahan, bukan arsitektur baru. Model dasarnya lebih besar daripada milik Grok 4.6. Proses reinforcement learning-nya lebih lama dan lebih berbobot pada tugas-tugas yang membutuhkan banyak jam untuk diselesaikan. Dan model tersebut dilatih untuk memverifikasi pekerjaannya sendiri serta mempertahankan konteks panjang dengan lebih baik, termasuk pemahaman asli tentang harness Grok Bot. Ringkasan satu baris perusahaan sendiri adalah "dua kali lebih cepat, dengan setengah harga model sebanding" — klaim positioning tentang para pesaing, bukan sebuah pengukuran, dan layak dibaca sebagai klaim semacam itu.
Ketersediaan sudah luas pada hari pertama dan telah melebar dua kali sejak itu. Saat peluncuran: Cursor dan Grok Build, API milik vendor sendiri, harness coding pihak ketiga, router model dan platform cloud; halaman Grok Build milik SpaceXAI sekarang secara terang-terangan mengatakan untuk "mulai membangun dengan Grok 4.7". Pada 28 September Amazon Web Services menambahkannya ke Amazon Bedrock dengan jendela konteks 500.000 token yang sama dan empat tingkat upaya penalaran yang sama, dilayani melalui profil inferensi lintas Wilayah, sehingga model tersebut sekarang dapat dijangkau melalui katalog milik hyperscaler dan bukan hanya API vendor. Lalu pada 1 Oktober model ini mulai diluncurkan di dalam aplikasi web dan seluler konsumen Grok, dan dua hari kemudian masih di sana. Yang terakhir ini tidak biasa sunyi: SpaceXAI mengumumkan langkah serupa untuk Grok 4.5 dengan posting blog berjudul "Bringing Grok 4.5 to iOS, Android, Web, and X", dan tidak menerbitkan apa pun untuk Grok 4.7, sehingga perubahannya terlihat di produknya bukan dideklarasikan. Ini adalah perubahan sisi server bukan perubahan yang dikirimkan, yang dikonfirmasi oleh listing aplikasi: baik listing iOS maupun Android Grok bergerak pada 1 Oktober — build App Store adalah 1.4.47, dirilis hari itu, dan catatan rilisnya hanya menyebutkan "Improvements to Chat, Voice and Imagine", sementara listing Play diperbarui pada hari yang sama. Perubahan dipush dari backend bukan dibangun ke dalam biner. Karena rollout ini dilaporkan bukan didokumentasikan, cakupan yang tepat lebih sulit ditetapkan daripada untuk listing Bedrock, yang memiliki posting AWS bertanggal di belakangnya, dan pelaporannya sudah melenceng: akun-akun yang melacak ini sekarang menggambarkan Grok 4.7 sebagai model dasar di semua mode — Fast, Expert, Build dan Heavy — daftar yang tidak cocok dengan apa yang sebenarnya disajikan grok.com. Bacalah ini sebagai pelaporan dari pelacak itu sendiri, bukan sebagai deskripsi vendor. Mitra keamanan siber terpilih mendapatkan akses hanya undangan ke kemampuan red-team model.
Satu koreksi terhadap catatan yang dipertahankan tulisan ini. Jumlah parameter yang beredar selama dua bulan — sekitar 2,1 triliun, sekitar 40% di atas 1,5 triliun milik Grok 4.6 — masih belum ada di lembar spesifikasi mana pun. xAI belum menerbitkan jumlah parameter untuk Grok 4.7, dan Artificial Analysis mencantumkan ukuran model sebagai tidak diungkapkan. Angka itu selalu merupakan klaim pendiri, dan peluncuran tersebut tidak mengubahnya menjadi spesifikasi.
Tabel benchmark itu milik xAI sendiri — inilah yang bukan miliknya.
Setiap angka dalam daftar di bawah ini berasal dari pengumuman vendor, dan tidak satu pun telah direproduksi secara independen. Bacalah dengan label itu tetap melekat: ini adalah angka xAI pada evaluasi yang dipilih xAI, yang diterbitkan pada hari peluncuran, dan minggu pertama setiap peluncuran adalah saat benchmark vendor paling tidak dapat diandalkan. Kolom perbandingannya juga milik vendor sendiri — Grok 4.6 (high), GPT-5.6 Sol (max), dan Claude Fable 5.1 (max), masing-masing dijalankan pada tingkat upaya yang dipilih vendor.
• CursorBench 4.0 — Grok 4.7 46,3%, Grok 4.6 40,4%, GPT-5.6 Sol 41,7%, Claude Fable 5.1 51,8%. Dilaporkan oleh vendor.
• DeepSWE v1.1 — Grok 4.7 71,0% pada upaya tinggi, Grok 4.6 65,2%, GPT-5.6 Sol 72,7%, Claude Fable 5.1 70,0%. Dilaporkan vendor.
• Terminal-Bench 4.0 — Grok 4.7 37,6%, Grok 4.6 20,3%, GPT-5.6 Sol 37,3%, Claude Fable 5.1 57,9%. Dilaporkan oleh vendor, dan direvisi: baris Grok 4.7 tertulis 38,0% di tabel peluncuran dan tertulis 37,6% di halaman vendor hari ini.
• EEBench — Grok 4.7 64,0%, Grok 4.6 53,0%, GPT-5.6 Sol 39,4%, Claude Fable 5.1 56,4%. Dilaporkan oleh vendor.
• Harvey Legal Agent — Grok 4.7 19,6%, Grok 4.6 15,8%, GPT-5.6 Sol 2,5%, Claude Fable 5.1 6,7%. Dilaporkan oleh vendor.
• HealthBench Professional — Grok 4.7 56,7%, Grok 4.6 48,5%, GPT-5.6 Sol 60,5%, Claude Fable 5.1 62,1%. Dilaporkan vendor.
• AA Briefcase v1.1 — Grok 4.7 1,657, Grok 4.6 1,546, GPT-5.6 Sol 1,487, Claude Fable 5.1 1,678. Ini adalah satu-satunya baris dalam tabel yang tidak lagi hanya berasal dari vendor: papan AA-Briefcase milik Artificial Analysis sendiri menerbitkan angka 1,657 yang sama untuk Grok 4.7 pada upaya xhigh dan 1,546 untuk Grok 4.6 pada high. Kolom perbandingan tetap merupakan pilihan model dan tingkat upaya dari vendor.
• GDPval Elo — Grok 4.7 1,695, Grok 4.6 1,605, GPT-6 Astra 1,542, Claude Fable 5.1 1,735. Dilaporkan oleh vendor.
Pembacaan jujur atas kumpulan itu bukanlah "Grok 4.7 menang". Ia mengalahkan Grok 4.6 pada kedelapan tolok ukur, yang merupakan batas minimum yang seharusnya diberikan seorang penerus kepada Anda. Dibandingkan dengan para pesaing, hasilnya campur aduk: unggul atas GPT-5.6 Sol pada CursorBench, Terminal-Bench, dan EEBench, tertinggal darinya pada DeepSWE; tertinggal dari Claude Fable 5.1 pada CursorBench, Terminal-Bench, HealthBench, dan kedua ukuran bergaya Elo, unggul darinya pada EEBench dan evaluasi agen hukum Harvey. Ini juga menggambarkan seberapa besar hasil tolok ukur ditentukan oleh tingkat upaya — 71.0% DeepSWE adalah angka upaya tinggi di dalam tabel yang selebihnya dikutip pada xhigh.
Keamanan adalah satu-satunya area di mana klaim vendor luar biasa spesifik. xAI menyatakan Grok 4.7 dibangun di atas stack pengaman yang sepenuhnya baru dan menyebutnya model terkuat yang pernah diuji perusahaan untuk penolakan dan ketahanan terhadap jailbreak. Pada benchmark biosafety LatchBio, model ini dilaporkan mencapai 62,4%; pada HackerBench v0.3, model ini dilaporkan meloloskan 3,3% prompt dual-use berisiko sekaligus jarang memblokir pekerjaan keamanan yang sah. Itu semua adalah evaluasi yang dilaporkan vendor atas rilis vendor sendiri, dan belum ada pihak ketiga yang mereproduksinya.
Angka-angka pertama dalam tulisan ini yang bukan milik vendor adalah tiga angka yang diterbitkan Artificial Analysis pada 21 September, dan angka-angka itu saling bertentangan dengan cara yang informatif. Pada Intelligence Index, Grok 4.7 mencetak 46 pada upaya xhigh di skala v4.3.2 — peringkat ke-16 di papan peringkat itu — dibandingkan 44 untuk Grok 4.6. Kenaikan dua poin itulah yang menurut Artificial Analysis cukup untuk membawa SpaceXAI masuk ke empat lab teratas dalam indeks tersebut. Bacalah posisi itu secara presisi: itu adalah pernyataan tentang model terbaik sebuah lab, bukan tentang model ini, dan model itu sendiri masih berada empat poin di bawah 50 milik Claude Fable 5 dan tujuh poin di bawah 53 yang sama-sama dimiliki oleh Claude Fable 5.1 dan GPT-6 Astra. Kenaikan dua poin juga masih berada dalam rentang yang muncul di antara tingkat upaya pada model yang sama, yang menjadi pengingat bahwa penerus yang mencetak skor di atas pendahulunya tidak sama dengan penerus yang mengubah apa yang mungkin. Satu catatan lagi tentang cara membaca angka ini: versi skala itu penting, karena Artificial Analysis menyatakan ulang indeksnya dan nilai 61/62/63 yang muncul di sebagian besar liputan Juli dan Agustus berasal dari skala pra-September-2026 yang sudah tidak dipakai lagi — nilai-nilai itu tidak dapat dibandingkan dengan angka-angka ini.
Coding Agent Index adalah angka kedua, dan itulah angka yang bergerak. Saat dijalankan di harness Grok Build milik SpaceXAI sendiri pada tingkat upaya xhigh, Grok 4.7 mencetak skor 56 berbanding 47 milik Grok 4.6 — selisih sembilan poin, bukan dua — yang menempatkannya di peringkat keempat di antara model yang dievaluasi dalam harness asli mereka, di belakang Claude Fable 5.1, GPT-6 Astra, dan Claude Opus 5, serta di depan GPT-5.6 Sol. Indeks ini adalah komposit berbobot sama dari DeepSWE v1.1, Terminal-Bench 4.0, dan SWE-Atlas-QnA pada 303 tugas, dan ketiga komponennya meningkat: DeepSWE dari 65% menjadi 73%, Terminal-Bench dari 18% menjadi 33%, SWE-Atlas-QnA dari 58% menjadi 63%. Ini adalah bukti independen pertama bahwa perbaikan yang dijelaskan xAI — reinforcement learning yang lebih panjang dengan bobot yang diarahkan pada tugas-tugas berdurasi berjam-jam — membuahkan hasil, dan inilah angka yang paling harus dipertimbangkan oleh tim yang memilih agen coding, karena diukur dalam harness yang benar-benar disertakan bersama model, bukan dalam tabel milik vendor sendiri.
Kendalanya adalah berapa biaya dari sembilan poin tersebut. Uji coba Artificial Analysis sendiri menghasilkan 240 juta token keluaran pada Intelligence Index, dibandingkan median 94 juta di seluruh model yang dilacaknya — lebih dari dua kali lipat — dan menempatkan biaya evaluasi satu tugas Index pada $3,74. Dengan $6 per juta token keluaran, verbositas adalah pos biaya yang menentukan apakah sebuah loop agentik terjangkau, sehingga kenaikan sembilan poin yang diperoleh dengan keluaran lebih dari dua kali median merupakan pertukaran nyata, bukan peningkatan gratis. Pengukuran yang sama juga berarti skor utama tidak boleh dibaca sebagai satu putusan: berdasarkan per token, keunggulan Grok 4.7 atas Grok 4.6 lebih kecil daripada yang disiratkan oleh selisih indeks, dan pada evaluasi pengetahuan umum yang menyusun Intelligence Index, model ini hampir sama dengan model yang sama dengan tagihan yang jauh lebih tinggi. Hasil AA-Briefcase di bagian berikutnya adalah pengecualian terhadap hal itu, dan pengecualiannya besar.

Dewan independen kedua: AA-Briefcase, dan apa yang bisa diperoleh dengan setengah biaya per tugas
Artificial Analysis menerbitkan angka ketiga untuk Grok 4.7 pada hari yang sama, dan itu adalah angka yang berbicara tentang pekerjaan pengetahuan alih-alih kode. Di AA-Briefcase — papan miliknya sendiri untuk pekerjaan pengetahuan agentik berhorizon panjang, dibangun dari empat skenario proyek multi-minggu dan 91 deliverable yang dinilai — Grok 4.7 pada xhigh effort mencetak 1.657 Elo, peringkat keempat di papan dan hanya di belakang entri Anthropic: Claude Fable 5.1 pada max effort (1.678), Claude Opus 5 pada max effort (1.673) dan Claude Fable 5.1 pada xhigh (1.669). Ia tertinggal 16 Elo dari Claude Opus 5 pada max effort dan, pada xhigh, unggul 8 Elo dari Claude Opus 5 pada xhigh (1.649). Baca penempatannya secara tepat: "hanya di belakang model Anthropic" adalah kerangka yang digunakan Artificial Analysis sendiri, dan itu akurat — tetapi peringkat keempat bukanlah kedua, dan tiga baris di atasnya semuanya dari vendor yang sama.
Peningkatan dibandingkan generasi sebelumnya adalah lompatan tunggal terbesar dalam rilis ini. Dibandingkan Grok 4.6 pada high effort (1.546), Grok 4.7 pada xhigh memperoleh 111 Elo pada AA-Briefcase — lebih dari lima puluh kali lipat kenaikan dua poin pada Intelligence Index. Artificial Analysis mengaitkannya hampir seluruhnya dengan kualitas analitis: 1.994 Elo di sana versus 1.690 untuk Grok 4.6, sementara kualitas presentasi sedikit menurun, 1.499 versus 1.519. Itu adalah tanda yang jelas terbaca: model bernalar lebih baik tentang analisisnya dan memformat hasil akhirnya sedikit lebih buruk. Arah yang sama muncul dalam angka yang dikutip Artificial Analysis untuk AA-Briefcase-Lite, skenario uji tuntas publik yang dirilisnya di Hugging Face — kualitas analitis naik dari 1.698 ke 1.994, presentasi turun dari 1.531 ke 1.499. Dua catatan untuk perbandingan itu. AA-Briefcase-Lite secara eksplisit bersifat demonstratif: halaman metodologi Artificial Analysis sendiri menyatakan bahwa skenario kelima publik "tidak dihitung sebagai hasil resmi AA-Briefcase." Dan angka kualitas yang dikutip untuknya cocok dengan baris xhigh yang dipublikasikan di papan utama, jadi perlakukan paragraf Lite sebagai ilustrasi arah perkembangan, bukan papan skor terpisah.
Garis biaya adalah tempat hasil ini mengubah sebuah keputusan. Ukuran biaya per tugas AA-Briefcase adalah total biaya menjalankan pengajuan penuh dibagi dengan 91 tugasnya; membagi total yang dipublikasikan Artificial Analysis menghasilkan sekitar $9,30 per tugas untuk Grok 4.7 pada xhigh dibandingkan sekitar $17,79 untuk Claude Opus 5 pada max effort — sekitar setengahnya, untuk selisih 16 Elo. Ringkasan Artificial Analysis sendiri atas hasil ini adalah bahwa Grok 4.7 berada "tepat di belakang Opus 5 pada ~50% dari Cost per Task-nya." Itu adalah pertukaran yang sama yang dijelaskan di bagian lain tulisan ini, mencapai jawaban yang sama dari arah yang berbeda: Grok 4.7 tidak mengalahkan frontier, ia menawarkan harga yang lebih rendah. Dua catatan, keduanya jujur. Tagihan token itu nyata — pada AA-Briefcase-Lite, Artificial Analysis menempatkan biaya API untuk menghasilkan contoh deck sekitar $8 untuk Grok 4.7 pada xhigh dibandingkan sekitar $4,40 untuk Grok 4.6 pada xhigh, jadi penerusnya berbiaya sekitar 80% lebih mahal daripada model yang digantikannya untuk pekerjaan yang sama. Dan angka per tugas dihitung dari penggunaan token pada harga daftar dengan tingkat cache-hit yang representatif, jadi angka itu bergerak sesuai caching Anda: itu adalah model dari sebuah tagihan, bukan tagihan Anda.
Di mana posisi Grok 4.7 dibandingkan dengan Grok 4.6 dan para pesaing lainnya
• Harga per 1 juta token — Grok 4.7 $2 masuk / $6 keluar di bawah 200K input, $4/$12 di atasnya; Grok 4.6 identik.
• Jendela konteks — 500.000 token untuk keduanya.
• Batas pengetahuan — Mei 2026 untuk Grok 4.7 versus 1 Februari 2026 untuk Grok 4.6.
• Upaya penalaran — rendah / sedang / tinggi / xhigh untuk Grok 4.7 dibandingkan dengan level yang dipublikasikan Grok 4.6.
• Skor independen — 46 pada upaya xhigh versus 44, pada Indeks Kecerdasan v4.3.2 Artificial Analysis. Cukup, menurut Artificial Analysis, untuk menempatkan SpaceXAI di empat laboratorium teratas dalam indeks tersebut.
• Skor coding independen — 56 versus 47 pada Artificial Analysis Coding Agent Index, masing-masing model dalam harness aslinya. Peringkat keempat di antara model dengan harness asli, di depan GPT-5.6 Sol.
Skor pekerjaan pengetahuan independen — 1.657 Elo pada upaya xhigh versus 1.546 untuk Grok 4.6 pada high, di papan AA-Briefcase Artificial Analysis. Peringkat keempat secara keseluruhan, di belakang tiga entri Anthropic dan di depan Claude Opus 5 pada xhigh.
• Biaya per tugas AA-Briefcase — sekitar $9,30 dibandingkan sekitar $17,79 untuk Claude Opus 5 pada upaya maksimal, di papan yang sama. Kira-kira setengah dari tagihan per tugas untuk selisih 16 Elo.
Token output per proses Index — 240 juta dibandingkan median 94 juta di antara model-model yang dilacak Artificial Analysis. Peningkatan ini bukannya tanpa biaya.
• Evaluasi coding vendor — CursorBench 4.0 46,3% versus 40,4%.
• Kecepatan penyajian — varian cepat dengan kecepatan keluaran dua kali lipat dengan harga dua kali lipat, dibandingkan penyajian standar Grok 4.6.
• Keamanan — rangkaian pengaman baru, dengan capaian yang dilaporkan sebesar 62,4% pada benchmark biosafety LatchBio; Grok 4.6 dirilis tanpa klaim tersebut.
Dan di papan skor yang sama, daftar pesaingnya: Claude Fable 5.1 di 53, Claude Opus 5 di 51, GPT-5.6 Sol di 47, Kimi K3 di 44. Prediksi Musk sendiri — bahwa Grok 4.7 "kira-kira seharusnya setara dengan Opus 5.0, bukan 5.1" — kini punya angka di bawahnya, dan angka itu mendarat tepat di tempat yang ia katakan: di bawah garis terdepan, bukan di atasnya. Selisih terukur terhadap Claude Fable 5.1 adalah tujuh poin; selisih harganya justru berlawanan arah, dengan Claude Fable 5.1 terdaftar pada $10/$50 per juta token berbanding Grok 4.7 pada $2/$6 — lima kali harga input dan lebih dari delapan kali harga output. Itulah pertukaran yang sebenarnya diminta dari sebuah tim, dan ini adalah pertukaran harga-kinerja, bukan kemenangan kapabilitas. AA-Briefcase adalah satu-satunya papan dalam artikel ini yang urutannya berubah: di sana Grok 4.7 pada xhigh berada di depan Claude Opus 5 pada xhigh, 1.657 berbanding 1.649, meskipun masih di belakang Opus 5 pada upaya maksimal di 1.673 dan di belakang Claude Fable 5.1 di 1.678. Ada baiknya juga menyandingkan ketiga skor independen itu sebelum menarik kesimpulan, karena ketiganya tidak menunjuk ke arah yang sama: tertinggal tujuh poin dalam kecerdasan umum, unggul atas GPT-5.6 Sol pada indeks agen coding, unggul 111 Elo dari pendahulunya dalam pekerjaan berbasis pengetahuan, dan membayar keunggulan itu dengan token output. Fakta mana di antaranya yang menentukan pilihan Anda bergantung pada apakah beban kerjanya adalah agen coding, keluaran berbasis pengetahuan, atau prompt chat, dan itu pemisahan yang lebih berguna daripada satu peringkat tunggal.
Apa yang benar dari kebocoran itu, dan satu hal yang belum mereka selesaikan
Artefak yang dilacak oleh tulisan ini sepanjang September memang nyata, dan peluncuran itu mengubahnya menjadi ujian tentang seberapa bernilai kelas bukti tersebut. Inilah catatannya.
• Pull request katalog itu menetapkan harga dengan benar. Pengajuan 21 September yang menambahkan Grok 4.7 ke katalog Zen dan Go milik klien agen sumber terbuka — dibuka 05:36 UTC, ditutup secara otomatis oleh bot kepatuhan pada 07:46 UTC karena bagian templat pull request yang hilang, tidak pernah di-merge — mencantumkan model itu pada tarif yang dipublikasikan Grok 4.6. Ternyata tepat: $2/$6, tidak berubah. Namun mekanismenya lebih penting daripada hasilnya. Kontributor menyalin tarif dari model di atasnya, dan penyalinan itu kebetulan menjadi tebakan yang benar. Itu keberuntungan, bukan otoritas, dan klaim kemampuan dari pull request yang sama juga tidak membawa informasi apa pun. Sebuah proposal bisa benar dan tetap bukan bukti.
• Jejak penyediaan itu asli dan bukanlah rilis tersebut. Baris grok-4.7 di halaman kuota model Google Cloud Console, yang dilaporkan oleh pelacak komunitas pada 16–17 September, dan slug build bertanggal grok-4-7-0907 yang muncul dalam error konfigurasi Grok Bot, keduanya mengarah pada model yang sedang dipersiapkan. Tidak ada pihak yang menyematkan tanggal pada keduanya, dan keduanya bukanlah pengumuman itu. Apa yang keduanya buktikan adalah bahwa infrastruktur pihak ketiga sedang dipersiapkan — yang, jika dilihat kembali, akurat dan tetap bukan sebuah jadwal.
• Jumlah parameter tidak pernah dikonfirmasi. Sekitar 2,1 triliun, sekitar 40% di atas Grok 4.6, diulangi oleh Musk pada 2 September — dan tetap tidak ada di setiap lembar spesifikasi saat peluncuran. Ini adalah kasus paling jelas dalam seluruh saga tentang sebuah angka yang beredar cukup luas hingga diperlakukan sebagai fakta namun tidak pernah memiliki sumber dari vendor.

Kartu di atas mencatat status pra-peluncuran sebagaimana terakhir diperiksa oleh artikel ini: tidak ada ID model, tidak ada tanggal rilis, tidak ada benchmark yang dipublikasikan. Setiap baris di dalamnya sejak itu telah dilampaui oleh pengumuman 21 September, dan kartu itu tetap disimpan di sini karena kesenjangan antara kartu tersebut dan model yang dikirim adalah kisah sebenarnya dari enam minggu terakhir — peluncuran frontier yang tidak menghasilkan satu pun spesifikasi terkonfirmasi sampai hari peluncurannya.
• Catatan kesiapan adalah pertanyaan terbuka, dan kini ada bukti sebagian. Musk mengatakan pada pertengahan September bahwa Grok 4.7 "berhenti sebelum waktunya" pada tugas-tugas dengan tingkat kesulitan tinggi dan bahwa pemeriksaan jawabannya "tidak cukup ketat," yang ia kaitkan dengan penalti pembelajaran penguatan untuk respons panjang yang ditetapkan terlalu tinggi, disertai kata "mungkin." Pengumuman peluncuran tidak membahasnya. Perbaikan yang dinyatakan xAI bersifat tidak langsung: pembelajaran penguatan yang lebih lama dengan bobot pada tugas-tugas berdurasi berjam-jam dan verifikasi mandiri yang lebih baik adalah persis perubahan yang akan Anda lakukan untuk mengatasi penghentian prematur. Hasil Coding Agent Index adalah tanda luar pertama bahwa hal itu membawa perubahan — 56 berbanding 47 milik Grok 4.6, dengan Terminal-Bench 4.0 hampir dua kali lipat dari 18% menjadi 33%, yang tepat berada di ujung rentang berhorizon panjang dan banyak langkah. Ini bukan jawaban yang bersih, karena skor harness yang sama juga merupakan skor yang memperoleh keuntungannya dengan jauh lebih banyak token keluaran. Apakah model tersebut masih meninggalkan tugas-tugas panjang yang sulit dapat diuji oleh siapa pun yang memiliki akses API, dan hal itu tetap menjadi hal pertama yang layak diuji.
• Korpus SpaceX masih belum terverifikasi. Suplemen pelatihan yang dilaporkan — telemetri Starlink, log tekanan ruang bakar Raptor, telemetri masuk kembali Starship, utas Slack internal, tiket Jira, repositori GitHub, dan catatan ERP — adalah pelaporan komunitas tentang apa yang dikatakan Musk, bukan pengungkapan perusahaan. Pengumuman peluncuran itu menjelaskan model dasar yang lebih besar dan proses reinforcement learning yang lebih panjang, serta tidak mengatakan apa pun tentang korpus. Jika itu ada di dalamnya, tidak ada lembar spesifikasi yang akan mengonfirmasinya; satu-satunya bukti adalah apakah model tersebut melakukan sesuatu dalam pekerjaan teknik nyata yang tidak dapat dilakukan oleh model-model lain yang setara.
Lini masa yang meleset empat kali, dan apa yang dipahami pasar dengan benar
Grok 4.7 dijanjikan, di depan publik, pada lima lini masa terpisah, dan empat yang pertama telah kedaluwarsa. Pada 24–25 Juli, Musk mengatakan sekitar empat minggu, yang berarti 22 Agustus. Pada 12 Agustus, ia merevisi menjadi "3 sampai 4 minggu", yang berarti 2–9 September. Pada 2 September, ia mempersempitnya menjadi sekitar sepuluh hari, mengarah ke 12 September. Pada 11 September, hari ketika tenggat itu habis, ia berkata "beberapa hari lagi". Yang kelima sama sekali bukan jendela waktu — baris grok-4.7 di halaman kuota Google Cloud — dan itulah yang paling mendekati benar: model itu dirilis pada 21 September, tak lama setelah tanggal terakhir yang pernah disanggupi siapa pun, dan tanpa tanggal yang dilekatkan pada artefak yang mendahuluinya.
Pasar prediksi menyebut kalender dengan tepat dan modelnya dengan keliru. Pasar Kalshi "SpaceXAI merilis Grok 4.7 sebelum 18 September?" berhenti diperdagangkan pada 03:59 UTC tanggal 18 September setelah transaksi terakhirnya pada 65¢, dengan 1.785 kontrak diperdagangkan dan 1.211 terbuka. Setiap kontrak yang diselesaikan di kedua pasar utama — jendela Kalshi 14, 21, 28, dan 31 Agustus serta 4, 8, dan 11 September, dan kontrak Polymarket 12 September dan 14 September — dinyatakan No. Pasar Polymarket "model Grok berikutnya (4.7 atau lebih tinggi) dirilis paling lambat 18 September?" bertahan di 64% pada 15 September setelah bergerak antara 42% dan 88,5% selama sebelas hari. Pasar itu benar untuk mengabaikan lonjakan yang dipicu tweet, dan benar bahwa jendela 18 September akan berakhir kosong. Pasar itu tiga hari terlalu awal soal model, satu-satunya hal yang tidak dapat diperhitungkan oleh kontrak bertanggal.
Jumlah tayangan itu layak disimpan sebagai catatan kalibrasi. Hitung mundur Musk pada 2 September, "keluar dalam 10 hari," meraih 10,29 juta tayangan dan salah. Penarikan ucapannya pada 11 September meraih 2,05 juta tayangan dan juga salah. Unggahan peta jalan 13–14 September-nya meraih sekitar 1,99 juta tayangan dan paling mendekati kebenaran — ia menggambarkan Grok 4.8, model berparameter sekitar 2,5 triliun yang dilatih pada stack C++ yang dibangun dari nol, sebagai "peningkatan yang terasa" dibanding Grok 4.7. Jangkauan mengikuti keyakinan, bukan akurasi, sepanjang seluruh rangkaiannya.
Dua item peta jalan kini menjadi pertanyaan terbuka alih-alih prediksi. Grok 4.8 tidak memiliki ID model, tidak ada harga, tidak ada jendela konteks, dan tidak ada entri benchmark di mana pun. Dan anggapan bahwa Grok 4.7 diam-diam "di-rebranding" menjadi Grok 4.8 — tafsiran salah satu media terhadap Musk yang menyebut 4.8 sementara 4.7 terlambat — justru dipastikan sebaliknya: 4.7 dirilis sebagai 4.7, di posisi 46 pada Index berbanding 44 milik Grok 4.6, yang merupakan kenaikan dari penerus dan bukan peluncuran ulang.
Apa artinya ini bagi tim yang memanggil Grok hari ini
Gambaran praktisnya berubah pada 21 September, dan berubah dengan cara yang paling tidak dramatis: ID model baru dengan harga yang sama, jendela konteks yang sama, kenaikan dua poin pada Index, kenaikan sembilan poin pada agen coding, dan kenaikan 111 poin pada pekerjaan pengetahuan. Dua perubahan sejak itu lebih penting daripada yang terlihat. Aplikasi Grok kini menyerahkan model itu kepada pengguna biasa, bukan hanya kepada pengembang, dan katalog di sisi ini kini mencantumkannya — bersama-sama hal itu mengubah lapisan perutean yang dijelaskan di akhir tulisan ini dari rencana menjadi default. Jika model biaya Anda dibangun berdasarkan Grok 4.6 pada $2/$6, harga per token masih benar untuk Grok 4.7 — tetapi jumlah tokennya tidak. Run milik Artificial Analysis sendiri menghabiskan 240 juta token output pada Intelligence Index dibandingkan median 94 juta di seluruh model yang dilacaknya, sehingga permintaan yang sama dapat berbiaya jauh lebih dari dua kali lipat meskipun kartu tarifnya identik, yang merupakan jenis perubahan yang tidak pernah muncul dalam tabel harga. Hitung harga loop agentik nyata berdasarkan token output, bukan berdasarkan tarif per juta, sebelum Anda menyimpulkan bahwa rilis ini gratis. Jika alasan Anda untuk beralih adalah frontier harga-kinerja yang diklaim vendor, bukti terkuat untuk itu sekarang adalah AA-Briefcase, bukan tabel vendor: peringkat keempat di papan itu dengan biaya per tugas sekitar setengah Claude Opus 5, dihadapkan pada selisih tujuh poin Intelligence Index dari Claude Fable 5.1 dan selisih harga yang justru lima kali lipat pada input serta lebih dari delapan kali lipat pada output. Dan jika beban kerja Anda secara khusus adalah agen coding, kasusnya lebih kuat daripada yang disiratkan Index: 56 pada Coding Agent Index di harness Grok Build, di depan GPT-5.6 Sol, berada di liga yang berbeda dari 46 pada kecerdasan umum. Mana di antaranya yang lebih penting sepenuhnya bergantung pada beban kerja Anda, dan tidak ada orang di luar SpaceXAI yang telah menjalankan Grok 4.7 pada beban kerja Anda.
Di katalog OrcaRouter lini Grok kini menjalankan Grok 4.7 bersama Grok 4.6, Grok 4.5, dan Grok 4.3, ditagih pada harga daftar penyedia tanpa markup 0% — $2 per juta token input dan $6 per juta token output, pembacaan input dari cache $0.50, serta kenaikan yang sama menjadi $4 per masuk dan $12 per keluar begitu sebuah permintaan melewati 200.000 token input, persis seperti yang dibebankan SpaceXAI. Itulah yang Anda dapatkan dengan meneruskan kartu tarif apa adanya: harga per token dalam model biaya Anda adalah harga per token pada faktur Anda, dan setiap model dalam keluarga ini diakses dengan satu kunci, sehingga memindahkan beban kerja dari Grok 4.6 ke Grok 4.7 hanyalah mengubah satu string, bukan menandatangani kontrak kedua. Halaman itu mencantumkan jendela konteks 500.000 token dan permukaan yang kompatibel dengan OpenAI yang sama — Chat Completions dan Responses — yang sudah menjadi target integrasi Grok 4.6.

Lapisan perutean itu juga merupakan cara berisiko rendah untuk mengevaluasi model yang angka independennya muncul di hari yang sama dengan milik vendor. Daftar benchmark di atas masih milik vendor sendiri — evaluasi yang dipilihnya, tingkat upaya yang dipilihnya, kolom perbandingan yang dipilihnya — dan tidak ada satu pun yang direproduksi. Yang berubah adalah tiga skor Artificial Analysis bukan milik vendor, sehingga pertanyaannya telah bergeser dari "apakah ada yang nyata dari ini" menjadi "hasil mana yang mirip dengan beban kerja saya": 46 yang menunjukkan kecerdasan umum kelas menengah, 56 yang menunjukkan peringkat keempat di antara agen pengkodean native-harness, atau 1.657 yang menunjukkan peringkat keempat pada pekerjaan pengetahuan dengan biaya per tugas setengah dari frontier. Dan angka yang menentukan ekonomi bukanlah benchmark sama sekali, melainkan token keluaran yang dikonsumsi suatu proses, yang hanya dapat diberi harga oleh lalu lintas Anda sendiri — 240 juta per proses Index pada pengukuran Artificial Analysis dibandingkan median 94 juta, dan sekitar $8 dibanding $4,40 per set dek contoh pada skenario AA-Briefcase-Lite publiknya. Failover otomatis memungkinkan Anda mengarahkan lalu lintas nyata ke model baru dan beralih kembali ke penyedia yang masih merespons jika tagihan token atau perilaku pengabaian dini ternyata lebih buruk dari yang diiklankan — yang merupakan perbedaan antara menguji model yang belum terbukti dan mempertaruhkan pipeline padanya.
Cara mengetahui lebih dulu (pemeriksaan yang berhasil)
Bagian ini dulunya merupakan daftar sinyal untuk diperhatikan selama menunggu. Masa tunggu sudah berakhir, jadi inilah daftar yang sama yang dinilai berdasarkan apa yang benar-benar terjadi.
• Daftar model adalah konfirmasinya, dan daftar itu berubah. Selama enam minggu, saran dalam tulisan ini adalah mengamati daftar model vendor alih-alih tweet, karena begitu Grok 4.7 nyata, daftar itu akan memperoleh ID model dengan harga dan jendela konteks yang menyertainya. Itulah yang terjadi: grok-4.7 kini muncul dengan jendela konteks 500K, harga $2/$6 untuk input di bawah 200K dan $4/$12 di atasnya, batas pengetahuan Mei 2026, dan empat tingkat effort. Setiap jendela waktu Musk, setiap argumen soal irama peluncuran, dan setiap tanggal pasar gagal menggerakkan daftar itu; rilisnya yang menggerakkannya.
• Katalog pihak ketiga mendahului pengumuman, dan itu adalah proposal, bukan penerapan. Pull request katalog 21 September adalah versi paling jelas dari hal ini sejauh ini, dan penutupannya memberi pelajaran: seorang kontributor bersiap untuk sebuah model, sebuah bot menutup perubahan tersebut karena bagian templat yang hilang dua jam kemudian, dan model itu dirilis dua hari setelahnya. Bacalah artefak kelas itu sebagai niat dengan stempel waktu. Itu benar-benar berada di hulu pengumuman, dan itu bukan ketersediaan.
• Pantau katalog model OrcaRouter. Katalog itu kini sudah berubah. Sepanjang bulan September, saran dalam tulisan ini adalah bahwa halaman model grok-4.7 di orcarouter.ai akan menjadi sinyal "Anda bisa memanggilnya hari ini melalui kami", karena sebuah model hanya terdaftar setelah penyedianya meng-onboard-nya. Katalog sekarang memuat Grok 4.7 dengan tarif vendor tanpa markup, jadi pemeriksaan yang diminta dilakukan pembaca kini sudah terjawab: model ini dapat dirutekan melalui satu API hari ini.
• Untuk visibilitas di sisi konsumen, aplikasi Grok kini telah menempatkan Grok 4.7 di hadapan pengguna yang tidak akan pernah membuka konsol API. Saat dibaca lagi pada 2 Oktober, data picker yang disajikan grok.com kepada pengunjung yang belum login masih menyebut model itu pada dua dari empat entrinya — Expert berbunyi "Berpikir keras · Grok 4.7" dan Heavy berbunyi "Tim Ahli · Grok 4.7" — sementara Fast, yang merupakan mode default saat aplikasi dibuka, hanya dijelaskan sebagai "Respons cepat" dan Auto sebagai pemilih di antara Fast dan Expert. Keempat entri itu adalah Auto, Fast, Expert, dan Heavy. Build bukan salah satunya: Grok Build adalah produk terminal terpisah di halamannya sendiri, dan halaman itulah yang sebenarnya menjadi sumber atribusi Build untuk model tersebut — halaman itu memberi tahu pengunjung untuk "instal sekarang dan mulai membangun dengan Grok 4.7". Jadi klaim yang beredar pada 1 Oktober dan diulang pada 2 Oktober — bahwa Grok 4.7 kini menjadi model dasar di seluruh "Fast, Expert, Build dan Heavy" — mencantumkan mode yang tidak disajikan aplikasi dan menghilangkan mode yang menjadi default saat aplikasi dibuka, dan itu adalah tafsiran para pelacak, bukan pihak vendor, karena SpaceXAI sama sekali tidak memposting apa pun tentang peluncuran ini. Langkah Grok 4.5 yang setara mendapat postingan blognya sendiri; yang ini memiliki produk yang berubah diam-diam di bawah halaman berita yang tidak ikut berubah.
Keadaan terkini
Grok 4.7 dirilis pada 21 September 2026, dengan harga $2 per juta token input dan $6 per juta token output, jendela konteks 500.000 token, serta pemotongan pengetahuan Mei 2026. Yang berubah dalam sebelas hari sejak itu bukanlah modelnya, melainkan peta ketersediaannya: Amazon Bedrock menambahkannya pada 28 September, model ini mulai diluncurkan di dalam aplikasi web dan seluler Grok sendiri pada 1 Oktober dan masih dalam proses peluncuran di sana pada 2 Oktober, dan kini terdaftar di OrcaRouter dengan tarif SpaceXAI sendiri tanpa markup. Skor independennya muncul pada hari yang sama dengan peluncuran dan masih saja tidak sepakat: 46 pada upaya xhigh di Intelligence Index v4.3.2 milik Artificial Analysis, dua poin di atas Grok 4.6 dan cukup untuk menempatkan SpaceXAI di empat besar lab dalam indeks tersebut; 56 pada Coding Agent Index dalam harness Grok Build, sembilan poin di atas Grok 4.6 dan keempat di antara model dengan harness native, di depan GPT-5.6 Sol; dan 1.657 Elo pada AA-Briefcase, 111 poin di atas Grok 4.6 dan keempat di papan peringkat di belakang tiga entri Anthropic, dengan biaya per tugas sekitar setengah dari Claude Opus 5. Setiap tolok ukur dalam tabel peluncuran vendor adalah milik vendor sendiri dan tidak direproduksi, dengan satu pengecualian: papan AA-Briefcase milik Artificial Analysis sendiri menerbitkan angka 1.657 yang sama, dan vendor sejak itu merevisi baris Terminal-Bench miliknya dari 38,0% turun menjadi 37,6%. Peningkatan dalam hal pengodean dan pekerjaan pengetahuan itu nyata dan menghabiskan token output — 240 juta per proses Index dibandingkan median 94 juta, dan sekitar $8 dibandingkan $4,40 per set contoh dek pada skenario uji tuntas publik AA — dan itulah angka yang menentukan apakah rilis ini murah. Angka ~2,1 triliun parameter yang beredar selama dua bulan masih belum memiliki sumber dari vendor, dan catatan peringatan soal penghentian dini tidak pernah ditanggapi secara langsung, meskipun lonjakan Terminal-Bench dari 18% menjadi 33% dalam harness Grok Build adalah bukti luar pertama bahwa perbaikannya berhasil. Kedua sinyal yang diminta artikel ini untuk diperhatikan pembaca telah muncul: daftar model vendor kini memuat grok-4.7 dengan harga dan jendela konteks yang tercantum, dan katalog di sini mencantumkannya dengan tarif yang sama. Jadi langkah yang menang kini lebih sederhana daripada pada September — Grok 4.6 dengan $2/$6 adalah jawabannya, dan Grok 4.7 dengan $2/$6 adalah jawaban yang sama dengan ID model yang lebih baru, skor pengodean dan pekerjaan pengetahuan yang lebih baik, tagihan token yang jauh lebih besar, serta aplikasi konsumen yang menyebutnya pada dua mode tersulitnya.
Dibandingkan dalam artikel ini3
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
