Kartu judul hero untuk 'GPT-5.6 vs Grok 4.6' dengan overline 'Indeks imbang di 61 — harga dan konteks berbeda': kartu membulat kiri 'GPT-5.6 Sol' (OpenAI — dirilis 9 Juli 2026; $4.00 / $20.00 per 1M; konteks ~1.05M · output 128K; upaya maksimal = 4 sub-agen) dan kartu membulat kanan 'Grok 4.6' (SpaceXAI — dirilis 12 Agustus 2026; $2.00 / $6.00 per 1M; konteks 500K · tanpa batas output; dial upaya dari rendah hingga sangat tinggi), footer 'Indeks AA Independen: 61 = 61.', logo OrcaRouter di pojok kanan bawah.
Guides & Insights

GPT-5.6 vs Grok 4.6: Seimbang pada Indeks, Berbeda pada Konteks dan Harga

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Pada skala Artificial Analysis Intelligence Index yang dipakai untuk mengukur keduanya hingga awal September 2026, GPT-5.6 milik OpenAI — yang tier unggulannya, GPT-5.6 Sol, adalah model yang dituju oleh nama API gpt-5.6 — dan Grok 4.6 milik SpaceXAI mencetak angka yang sama: 61. Indeks independen yang menempatkan dua model unggulan pesaing pada level yang sama adalah jenis hasil paling langka dalam perbandingan frontier, dan justru di situlah pertarungan ini menjadi menarik, bukan berakhir. Model-model yang seri itu dijual dengan cara yang sangat berbeda. GPT-5.6 Sol, model unggulan yang dirilis OpenAI pada 9 Juli dan diposisikan ulang sebagai tier nilai ketika GPT-6 Astra diluncurkan pada 3 September, dibanderol $4,00 per juta token input dan $20,00 per juta token output setelah penurunan harga pada 24 Agustus, serta dapat membaca hingga sekitar 1,05 juta token konteks. Grok 4.6, yang dirilis xAI pada 12 Agustus, dibanderol $2,00 / $6,00 dan memiliki batas maksimum 500.000 token. Skor sama di papan independen, lalu kedua model ini berbeda dalam seberapa jauh Anda dapat mendorong satu permintaan — dan berapa biaya untuk mendorongnya.

Halaman ini kini ada karena alasan yang konkret: dua kartu tarif dan dua batas atas itu berubah dalam selang waktu hanya beberapa minggu. Grok 4.6 dirilis pada 12 Agustus, lalu pada 28 Agustus tersedia di obrolan Grok biasa di web dan seluler setelah dua minggu pertama hanya terbatas di Grok Build dan API. Pemangkasan harga promosi GPT-5.6 Sol mulai berlaku pada 24 Agustus, dan sepuluh hari kemudian peluncuran GPT-6 Astra secara diam-diam menurunkan status Sol dari flagship menjadi value flagship. Kedua model di bawah ini kini menjadi yang Anda cari saat menginginkan penalaran setara frontier tanpa membayar harga sekelas Astra — justru itulah mengapa seri 61-61 menjadi titik keputusan yang nyata, bukan sekadar pertanyaan trivia.

Apa arti "tied at 61", dan apa yang bukan.

Skor membutuhkan tanggal dan tolok ukur. Artificial Analysis mengukur GPT-5.6 Sol pada ~61 dan Grok 4.6 pada 61 pada skala indeks yang digunakan hingga awal September — skala yang dirujuk oleh perbandingan GPT-5.6 lain di blog ini — dengan Grok menempati peringkat ke-11 dari 202 model yang dilacak AA dan Sol hanya berjarak satu atau dua peringkat darinya dengan skor yang sama. AA kemudian melakukan kalibrasi ulang indeks pada 7 September (v4.3), sebuah versi yang merapatkan skor: GPT-5.6 Sol terukur 47 di sana, GPT-6 Astra dan Claude Fable 5.1 terukur 53, dan belum ada skor keseluruhan Grok 4.6 yang dipublikasikan pada skala baru. Hasil imbang di bawah ini dengan demikian merupakan pernyataan tentang skala September sebelum kalibrasi ulang, dan paling baik dibaca sebagai posisi relatif: pada indeks terbaru yang memberi skor kepada keduanya, keduanya setara, dan keduanya berada tepat di belakang kelas Claude Opus 5.

Satu peringatan lagi tentang hasil imbang ini, dan ini penting untuk cara Anda menggunakannya. Kedua skor dihasilkan pada setelan upaya yang berbeda — GPT-5.6 Sol pada penalaran maksimum, setelan level tertinggi OpenAI (yang menjalankan empat sub-agen paralel untuk permintaan sulit), dan Grok 4.6 pada level tinggi, yaitu pengaturan default xAI pada skala dari rendah hingga ekstra tinggi. Keduanya adalah konfigurasi yang 'mengerahkan segalanya', tetapi bukan konfigurasi yang sama, dan hasil imbang ini terjadi di antara dua setelan spesifik tersebut, bukan di antara setiap setelan yang ditawarkan model-model itu. Yang ditegaskan oleh skor yang sama adalah bahwa tidak ada satu pun model yang memiliki keunggulan kecerdasan umum yang dapat ditunjukkan kubu lawan pada komposit independen — jadi pembeli yang memilih di antara keduanya harus melihat melampaui indeks, pada konteks, harga, dan bukti yang benar-benar dapat ditunjukkan masing-masing pihak.

Dua kartu tarif, dua tebing

Kedua vendor memperlakukan prompt panjang sebagai peristiwa premium, dan keduanya menagih seluruh permintaan pada tingkat yang lebih tinggi setelah ambang batas terlampaui — itulah mekanisme bersama yang membuat perbandingan harga ini mudah dipahami. Tarif OpenAI untuk GPT-5.6 Sol adalah $4.00 / $20.00 per juta dengan pembacaan cache $0.40, dan setelah permintaan melewati sekitar 272K token input, seluruh permintaan dihargai ulang menjadi $8.00 / $30.00 — struktur konteks panjang yang didokumentasikan Epoch AI pada 8 September. Tarif xAI untuk Grok 4.6 adalah $2.00 / $6.00 dengan pembacaan cache $0.50, dan setelah prompt melewati 200K token, seluruh permintaan beralih ke $4.00 / $12.00.

Dirilis — GPT-5.6: 9 Juli 2026 (API publik; alias gpt-5.6 mencapai tier Sol). Grok 4.6: 12 Agustus 2026.

Harga daftar per 1M (input / output) — GPT-5.6 Sol: $4.00 / $20.00, pembacaan cache $0.40 (promo setidaknya hingga 21 Nov 2026). Grok 4.6: $2.00 / $6.00, pembacaan cache $0.50.

Tingkat long-prompt — GPT-5.6 Sol: keseluruhan permintaan dikenai biaya $8.00 / $30.00 untuk input di atas ~272K. Grok 4.6: keseluruhan permintaan dikenai biaya $4.00 / $12.00 pada input 200K.

Batas konteks / output — GPT-5.6 Sol: ~1,05M input, 128K output. Grok 4.6: 500K input, tanpa batas output yang dipublikasikan.

Indeks (independen) — GPT-5.6 Sol (maks) ~61 vs Grok 4.6 (tinggi) 61, skala September sebelum kalibrasi ulang.

Modalitas — keduanya menerima input teks dan gambar serta menghasilkan teks.

Jalankan angka-angka yang sudah dihitung dan polanya tidak ambigu: pada setiap panjang prompt yang dapat dilayani Grok 4.6, itu adalah pilihan yang lebih murah, karena langit-langit harga yang ditetapkan ulangnya masih berada di atau di bawah tarif standar GPT-5.6 Sol.

100K input / 8K output — GPT-5.6 Sol: 0.10 × $4 + 0.008 × $20 = $0.56. Grok 4.6: 0.10 × $2 + 0.008 × $6 = $0.25. Grok sekitar 55% lebih murah untuk permintaan tersebut.

400K masukan / 30K keluaran (keduanya sudah dihitung ulang harganya) — GPT-5.6 Sol: 0.40 × $8 + 0.03 × $30 = $4.10. Grok 4.6: 0.40 × $4 + 0.03 × $12 = $1.96. Grok masih kira-kira setengah harga bahkan setelah kenaikan drastisnya sendiri.

600K input / 30K output — GPT-5.6 Sol: 0.60 × $8 + 0.03 × $30 = $5.70. Grok 4.6: tidak bisa — 600K melampaui jendela konteks 500K-nya. Ini adalah rentang di mana Sol adalah satu-satunya opsi, dan di mana harganya tidak lagi terlihat premium.

A two-column scoreboard titled 'GPT-5.6 vs Grok 4.6 — the scoreboard'. Left column 'GPT-5.6 Sol': Released Jul 9 2026; Price $4.00 / $20.00 per 1M, cache $0.40; Over 272K input whole request $8.00 / $30.00; Context / output ~1.05M / 128K; AA Intelligence Index ~61 (max); SWE-bench Verified ~96% (reported). Right column 'Grok 4.6': Released Aug 12 2026; Price $2.00 / $6.00 per 1M, cache $0.50; At 200K input whole request $4.00 / $12.00; Context / output 500K / no published cap; AA Intelligence Index 61 (high); GPQA Diamond 94.9% (reported). Footer: 'Independent index: tied at 61 — AA scale, pre-Sept-7 2026 recalibration.'; OrcaRouter logo bottom-right.

Geometri tebing tersebut berbeda dalam satu hal yang menguntungkan GPT-5.6 Sol: ambang batasnya (272K) berada lebih tinggi daripada ambang Grok (200K), sehingga ada pita — kira-kira 200K hingga 272K input — di mana Grok telah menetapkan ulang harga dan Sol belum. Bahkan di sana Grok cenderung menang dalam hal dolar, karena tarif keluaran hasil penetapan ulangnya sebesar $12 masih 40% di bawah tarif standar Sol sebesar $20. Ekonomi hanya berbalik menguntungkan Sol setelah melewati 500K token, yang justru merupakan wilayah yang tidak dapat dimasuki jendela konteks Grok. Jika panjang prompt Anda tetap di bawah 200K — berlaku untuk sebagian besar lalu lintas chat, RAG, dan bantuan kode — Grok 4.6 lebih murah dalam skala besar hampir dua kali lipat dalam biaya gabungan, dan tebing seluruh-permintaan berarti Anda harus memperlakukan 200K sebagai batas perencanaan, bukan sekadar saran lunak.

Untuk apa sebenarnya tambahan setengah juta token Sol itu

Jendela 500K Grok 4.6 menampung lebih banyak beban kerja nyata daripada yang tersirat di lembar spesifikasinya — pembacaan seluruh basis kode, transkrip agen yang panjang, konteks retrieval yang besar — dan tidak adanya batas output yang dipublikasikan membantu di sisi generasi: untuk satu panggilan yang harus menghasilkan artefak yang sangat panjang, Grok tidak memiliki batas yang terdokumentasi, sementara GPT-5.6 Sol berhenti di 128K token output. Keunggulan GPT-5.6 Sol terletak pada rentang 500K hingga 1.05M, dan beban kerja yang benar-benar membutuhkannya lebih sempit daripada yang disiratkan pemasaran: agen yang menyimpan satu repositori penuh plus riwayat tugas yang panjang di dalam konteks, transkrip rapat atau riset yang sangat panjang yang dianalisis dalam sekali proses, serta pekerjaan retrieval atas korpus yang terlalu besar untuk dipecah menjadi jendela seukuran Grok. Jika tidak ada pipeline Anda yang menyentuh rentang tersebut, konteks tambahan Sol adalah ruang ekstra yang Anda bayar dengan tarif input $4.00, tetapi tidak terpakai.

Kedua model juga mengarahkan penalaran secara berbeda. GPT-5.6 Sol menyediakan kontrol upaya rendah / sedang / tinggi / maksimum, di mana tingkat maksimum menjalankan empat sub-agen paralel yang berkoordinasi pada tugas-tugas sulit — secara efektif membentuk kawanan agen kecil untuk setiap permintaan rumit; kuat, tetapi mahal dalam token keluaran, dan merupakan pengaturan di balik skor indeks ~61. Grok 4.6 menjalankan satu model dengan kontrol dari rendah hingga sangat tinggi (standarnya tinggi) serta alat sisi server untuk pencarian dan eksekusi kode, yang membuat perilakunya lebih mudah diprediksi untuk anggaran: satu permintaan, satu model, biaya yang bisa Anda perkirakan dari kartu tarif. Bagi pengembang yang menginginkan pengeluaran yang deterministik, desain satu-model Grok secara operasional lebih sederhana; untuk tugas bercakrawala panjang yang paling sulit, kawanan upaya-maksimum Sol adalah konfigurasi yang lebih mumpuni — dan itulah alasan skor terbaik serta tagihan terburuknya berasal dari pengaturan yang sama.

Bukti yang sebenarnya dapat ditunjukkan oleh masing-masing pihak.

Tidak ada satu pun model yang memiliki keunggulan di papan skor coding independen, sehingga bukti yang dapat dikutip terbagi berdasarkan vendor. OpenAI melaporkan GPT-5.6 Sol sekitar 96% pada SWE-bench Verified — bukti coding terkuat yang dapat ditunjukkan model mana pun, tetapi merupakan evaluasi yang dilaporkan tanpa audit independen yang dipublikasikan — dan keunggulan Sol di dunia nyata mencakup kehadirannya di dalam perangkat Codex dan ChatGPT. xAI melaporkan Grok 4.6 pada 94,9% pada GPQA Diamond, yang diklaimnya sebagai skor tertinggi pada tolok ukur tersebut, dan mengutip evaluasi agentik dengan rata-rata biaya API sekitar $0,84 per tugas komprehensif; keduanya adalah angka dari vendor. Soal kecepatan, kedua model lebih berdekatan daripada yang disiratkan oleh selisih harga: AA mengukur Grok 4.6 dengan 64,9 token keluaran per detik dan GPT-5.6 Sol pada kisaran pertengahan 60-an yang sama pada layanan standar, dengan pratinjau "Ultrafast" terpisah bertenaga Cerebras milik OpenAI (hingga sekitar 750 token per detik) yang masih terbatas dan belum diberi harga. Bacalah seluruh tabel bukti sebagai berikut: hasil indeks seri, bukti coding di kedua sisi tanpa audit independen pada keduanya, dan tidak ada selisih kecepatan yang mengubah keputusan.

Default mana yang rasional pada September 2026

Pilih Grok 4.6 ketika lalu lintas Anda berada di bawah 200K token input — harganya hampir setengahnya pada setiap panjang yang dilayaninya, indeks independen mengatakan model-modelnya setara, dan satu dial model tunggal dengan alat sisi-server membuat tagihan dapat diprediksi. Pilih GPT-5.6 Sol ketika Anda benar-benar membutuhkan pita konteks 500K hingga 1.05M, ketika stack Anda sudah berbasis Codex atau ChatGPT dan angka ~96% SWE-bench yang dilaporkan memberikan bukti coding kepada tim pengadaan, atau ketika Anda menginginkan opsi konfigurasi empat sub-agen dengan upaya maksimal untuk tugas-tugas jangka panjang yang paling sulit. Dan perhatikan dua tanggal: promosi $4/$20 GPT-5.6 Sol hanya dijamin hingga setidaknya 21 November 2026, setelah itu perbandingan ini bergeser, dan xAI telah mengisyaratkan Grok 4.7 — salah satu peristiwa tersebut dapat mengubah harga pertarungan yang akan Anda jadikan standar.

Menjalankan keduanya tanpa merombak arsitektur.

Karena hasil imbang pada indeks berarti ini adalah keputusan plafon dan harga, bukan kualitas, pola praktis bagi kebanyakan tim adalah merutekan daripada memilih. GPT-5.6 Sol dan Grok 4.6 keduanya ada di OrcaRouter dengan harga daftar penyedia mereka, diteruskan tanpa mark-up — yang tercantum adalah $4/$20 dari OpenAI dan $2/$6 dari xAI, dan ketika salah satu vendor mengubah tarif, harga baru langsung aktif pada kunci yang sama di hari yang sama. Dengan satu endpoint yang kompatibel dengan OpenAI, Anda dapat mengirim lalu lintas sub-200K ke Grok 4.6, mengeskalasi permintaan yang membutuhkan konteks Sol yang lebih panjang atau konfigurasi upaya maksimalnya, dan menggunakan failover otomatis sehingga batas laju pada satu jalur penyedia adalah peristiwa perutean, bukan pemadaman.

A screenshot of the OrcaRouter model page for GPT-5.6 Sol (model id openai/gpt-5.6-sol), showing the header price of $4.00 in / $20.00 out per 1M tokens, tags including Vision, Tools, JSON and Reasoning, 'by OpenAI — 2026-07-09', a description of GPT-5.6 Sol as the flagship model in OpenAI's GPT-5.6 series covering deep multi-step reasoning, large-scale software engineering and long-horizon agentic work over a 1.05M-token context window with up to 128K output tokens, and the site's latest-model navigation.

Bagian harga dari perbandingan ini adalah bagian yang berubah-ubah — promosi Sol dari OpenAI hanya dijamin hingga 21 November dan xAI memiliki 4.7 di peta jalan — sehingga referensi yang terus diperbarui oleh blog ini adalah halaman harga GPT-5.6 Sol, yang diberi stempel tanggal dan diverifikasi ulang setiap kali kartu tarif berubah.

A screenshot of OrcaRouter's '$4 / $20 per 1M Tokens — After the Price Cut' pricing article on the GPT-5.6 Sol promotional rate, bylined Gideon Frost, shown alongside the site's LATEST MODELS rail.

Jawaban dua baris

Jika prompt Anda muat di bawah 500K token — dan kebanyakan memang demikian — Grok 4.6 memberikan skor indeks independen yang sama dengan GPT-5.6 Sol dengan harga hampir setengahnya di setiap panjang yang mampu dilayaninya, tanpa batas output yang dipublikasikan, dan dengan kontrol model tunggal yang dapat diprediksi. GPT-5.6 Sol membenarkan harga premiumnya di rentang yang tidak dapat dijangkau Grok: melampaui 500K token konteks, dan di dalam tooling OpenAI, di mana skor ~96% SWE-bench Verified yang dilaporkan serta tier Terra dan Luna di bawahnya memberi Anda sebuah keluarga, bukan sekadar satu model. Seri pada indeks berarti keputusan ini soal batas atas dan biaya, bukan kapabilitas — jadi ukur prompt nyata terpanjang Anda sebelum berkomitmen, karena angka tunggal itulah yang menentukan pemenangnya.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari