
GPT-6 Sol Pro vs Grok 4.7: Dua Kali Lebih Bertele-tele, Sepertiga Harga
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 986 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 196 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 112 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
Dua model termurah yang berdekatan dengan frontier pada September 2026 hadir berselang satu hari, dan hal yang menarik dari keduanya bukanlah mana yang lebih pintar. GPT-6 Sol — model yang orang cari ketika mereka menelusuri GPT-6 Sol Pro, yaitu model tersebut dengan reasoning.mode diatur ke pro alih-alih sebagai produk terpisah — dirilis pada 22 September 2026 dengan harga $2,00 per juta token input dan $10,00 per juta token output. Grok 4.7 dari vendor tersebut dirilis pada 21 September dengan harga input yang sama, $2,00, dan output $6,00. Pada harness netral Artificial Analysis, keduanya terpaut dua poin indeks dan sekitar dua dolar per tugas yang diselesaikan, dan penyebab selisih itu bukanlah kemampuan. Melainkan seberapa banyak token yang dibakar masing-masing untuk mencapainya.
Sol menghasilkan 77 juta token keluaran saat menjalankan Intelligence Index. Grok 4.7 menghasilkan 240 juta. Rasio itu — sedikit lebih dari tiga banding satu — adalah seluruh perbandingannya, dan membalikkan kesimpulan yang diberikan tabel harga per token kepada Anda.
Dua kartu tarif, dan di mana yang murah itu tidak murah
Kedua vendor menerbitkan angka-angka ini sendiri; tidak satu pun telah ditetapkan ulang harganya secara independen.
• Input — GPT-6 Sol $2,00 per juta token vs Grok 4.7 $2,00 per juta token
• Output — GPT-6 Sol $10,00 per juta token vs Grok 4.7 $6,00 per juta token
• Input cache — GPT-6 Sol $0,20 per juta token vs Grok 4.7 $0,50 per juta token; pembacaan cache Sol lebih murah dengan faktor dua setengah, yang merupakan kebalikan dari apa yang disiratkan oleh tarif output utamanya
• Jendela konteks — GPT-6 Sol 1.050.000 token vs Grok 4.7 500.000 token
• Biaya tambahan konteks panjang — GPT-6 Sol menetapkan harga ulang untuk permintaan di atas 272.000 token masukan pada 2× tarif masukan dan cache serta 1,5× keluaran untuk seluruh permintaan, dibandingkan Grok 4.7 yang menggandakan setiap tarif pada 200.000 token masukan, juga untuk seluruh permintaan
• Batas pengetahuan — GPT-6 Sol 20 April 2026 vs Grok 4.7, batas prapelatihan yang dilaporkan adalah Juni 2026 dengan pelatihan tambahan hingga Agustus
• Tingkat upaya penalaran — GPT-6 Sol tidak ada, rendah, sedang (default), tinggi, xhigh, maks vs Grok 4.7 rendah, sedang (default), tinggi, xhigh
• Modalitas — keduanya menerima input teks dan gambar serta mengembalikan teks
Baris pembacaan cache adalah hal yang harus dicermati oleh pembeli. Tarif output Grok 4.7 40% lebih rendah, tetapi input cache-nya 150% lebih tinggi, dan input cache adalah tempat riwayat agen yang panjang serta prompt sistem yang berulang berada. Beban kerja yang sebagian besar berupa pembacaan ulang konteks besar yang stabil akan mendapati kedua model jauh lebih berdekatan daripada yang tersirat oleh $6 dibanding $10.

Catatan independen, dan satu angka yang memutuskannya
Artificial Analysis adalah satu-satunya kerangka pengujian yang telah mengukur kedua model, dan angkanya layak disandingkan karena perbedaannya bersifat instruktif.
• Intelligence Index — GPT-6 Sol 48 pada upaya maksimum vs Grok 4.7 46 pada xhigh; keduanya jauh di atas median 25 untuk model sebanding
• Biaya per tugas indeks — GPT-6 Sol $1,06 vs Grok 4.7 $3,74
• Token keluaran untuk proses indeks — GPT-6 Sol 77M vs Grok 4.7 240M, dibandingkan dengan median 88M
• Kecepatan keluaran — Grok 4.7 terukur pada 39 token per detik, yang oleh harness itu sendiri disebut sangat lambat; angka Sol pada papan yang sama tidak dipublikasikan di baris ringkasan yang sama
• Indeks Agen Coding — GPT-6 Sol 57 dengan $2,99 per tugas vs Grok 4.7 56 dengan harness Grok Build pihak pertamanya, naik sembilan poin dari Grok 4.6
Perbedaan indeks dua poin, biaya per tugas tiga setengah kali lipat. Itu bukan anomali penetapan harga — itu aritmetika verbositas. Grok 4.7 adalah model yang berpikir panjang lebar secara terbuka; harness menandainya sebagai "sangat bertele-tele" dibandingkan dengan median 88 juta token, dan biayanya mengikuti jumlah token, bukan daftar tarif.
Perbandingan agen coding membawa kaveat yang disembunyikan oleh papan skor. Angka 56 milik Grok 4.7 diukur di dalam harness Grok Build milik xAI sendiri, yaitu konfigurasi yang dikirim dan dijadikan tolok ukur oleh xAI. Angka 57 milik Sol diukur dalam harness netral. Keunggulan harness pihak pertama sebesar satu atau dua poin masih berada dalam kisaran yang dapat dijelaskan oleh pilihan harness, yang berarti pembacaan yang jujur adalah bahwa keduanya setara dalam agen coding — bukan bahwa Sol unggul satu poin.

Apa yang diklaim masing-masing vendor, dan apa yang belum ditunjukkan oleh keduanya
Materi peluncuran xAI bersifat spesifik dan ini adalah kisah jangka panjang: Grok 4.7 dibangun di atas model dasar yang lebih besar daripada Grok 4.6 dan diberi proses reinforcement learning yang lebih panjang yang ditujukan untuk tugas-tugas yang "bisa memakan waktu berjam-jam untuk diselesaikan," mempertajam verifikasi mandiri, penanganan konteks panjang, dan perilaku di dalam lingkungan Grok Bot. Angka yang dilaporkan vendor mencakup Terminal-Bench 4.0 sebesar 38,0% dibandingkan 20,3% milik Grok 4.6, CursorBench 4.0 sebesar 46,3%, dan DeepSWE v1.1 sebesar 71,0%. Setiap angka tersebut adalah pengukuran xAI sendiri dan tidak ada satu pun yang direproduksi secara independen; angka Terminal-Bench 4.0 independen yang beredar jauh lebih rendah daripada angka vendor, yang merupakan pola lazim dari kesenjangan tersebut.
Klaim OpenAI untuk GPT-6 Sol adalah klaim yang sudah dibahas di atas, dan keduanya membawa label yang sama. Angka yang dilaporkan vendor adalah 33,2% pada AutomationBench dengan upaya xhigh, dibandingkan 26,9% milik Claude Opus 5 pada max, dengan biaya per tugas sekitar 9%, dan 68,8% pada DeepSWE v1.1 dengan upaya max — selisih 1,1 poin dari Claude Fable 5 pada xhigh, dengan biaya per tugas sekitar 80% lebih rendah. Perhatikan target perbandingannya: bagan milik OpenAI sendiri mempertemukan Sol dengan model-model Anthropic, bukan dengan Grok 4.7. Tidak ada vendor yang telah menerbitkan perbandingan langsung satu sama lain.

Di mana lapisan perutean membuktikan kelayakannya
OrcaRouter tidak menyediakan satu pun dari kedua model dalam perbandingan ini — Grok 4.7 dan GPT-6 Sol sama-sama tidak ada dalam katalog kami, jadi tidak ada apa pun di sini yang merupakan klaim tentang harga mereka melalui kami. Nilai sebuah lapisan perutean dalam pasangan khusus ini terletak pada mode kegagalannya, bukan pada kartu tarifnya. Alasan untuk memilih Grok 4.7 adalah perilaku agentiknya yang berjangka panjang; alasan untuk tidak memilihnya adalah kecepatan keluaran 39 token per detik membuat proses agen yang panjang menjadi cukup lambat sehingga berdampak, dan proses yang lambat adalah proses yang bisa timeout.Failover otomatis antar penyedia berarti pekerjaan panjang dapat dirutekan ke model mana pun yang benar-benar tersedia tanpa kecepatan itu menjadi satu titik kegagalan, dan DSL perutean mengekspresikan pilihan model sebagai aturan di dalam panggilan alih-alih sebagai migrasi — yang penting di sini, karena jawaban yang benar untuk pasangan ini bergantung pada apakah tugasnya haus token atau sensitif terhadap latensi, dan itu adalah properti dari permintaan, bukan dari kuartal.
Aturan keputusan
• Coding agentik dengan anggaran tetap — GPT-6 Sol. Kemampuan setara pada indeks coding netral, dengan biaya per tugas sekitar sepertiganya, karena mencapainya dengan sepertiga token.
• Tugas long-horizon yang menjadikan lamanya proses sebagai inti — Grok 4.7. Rilis ini dilatih khusus untuk pekerjaan berjam-jam, dan angka vendor pada SWE-Marathon dan CursorBench bergerak tepat ke arah itu.
• Volume yang sensitif terhadap latensi — bukan keduanya, berdasarkan catatan saat ini. Biaya per tugas Sol adalah angka yang lebih baik, tetapi 39 token per detik yang terukur dari Grok 4.7 merupakan kendala nyata untuk apa pun yang interaktif.
• Beban kerja konteks panjang yang sebagian besar di-cache — GPT-6 Sol, pada baris baca cache, bukan baris output. Dengan biaya $0,20 versus $0,50 per juta token yang di-cache, dan dengan ukuran jendela dua kali lipat, alasannya semakin kuat semakin banyak bagian prompt Anda yang stabil.
• Jika perbandingan Anda dibuat berdasarkan daftar tarif per token — bangun ulang berdasarkan biaya per tugas. $6.00 dibandingkan $10.00 keluaran adalah pasangan angka yang paling tidak informatif dalam artikel ini, dan pasangan itulah yang menjadi pembuka di setiap halaman yang ada.
Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
