
GPT-6 vs Grok 4.6: Dua Tingkat Menengah, Satu Tagihan yang Berbeda di Atas 200K Token
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
GPT-6 Sol dan Grok 4.6 sama-sama berbiaya $2,00 per juta token input dan $6,00 per juta token output di bagian atas kedua kolom tersebut. Yang hampir tidak pernah dicantumkan siapa pun di sampingnya adalah bahwa kedua kolom itu berhenti bersesuaian pada titik yang berbeda dalam sebuah permintaan. Grok 4.6 mulai mengenakan tarif konteks panjangnya begitu prompt melewati 200.000 token input; GPT-6 Sol baru melakukannya setelah 272.000. Di atas ambang tersebut, seluruh permintaan dihargai ulang — bukan hanya kelebihan tokennya — dan kedua vendor menghargai ulangnya ke arah yang berlawanan, dan inilah bagian yang menentukan tagihan untuk agent run yang panjang. GPT-6 Sol beserta saudara-saudaranya, GPT-6 Astra dan GPT-6 Luna, dirilis pada 22 September 2026; Grok 4.6, tier menengah dari lini SpaceXAI, dirilis 12 Agustus 2026 dan sudah disusul oleh Grok 4.7, jadi ini adalah perbandingan antara dua model yang sudah dirilis, bukan peluncuran salah satunya.
Hal kedua yang berubah pada 7 Oktober 2026 yang penting bagi cara Anda membaca GPT-6 sama sekali: OpenAI mulai meluncurkan GPT-6 ke tab Chat utama ChatGPT, menjangkau tier gratis pada 8 Oktober, dengan tier Plus, Pro, Business, dan Enterprise menjalankan GPT-6 Sol serta tier Free dan Go menjalankan GPT-6 Luna. Itu adalah perubahan pada permukaan — model yang sama, audiens yang jauh lebih besar, dan lapisan antarmuka baru yang OpenAI sebut Intelligent UI. Ini tidak mengubah satu pun tarif API. Ini berarti bahwa jika Anda membandingkan "GPT-6" dengan apa pun, Anda sekarang membandingkannya dengan model yang juga diajak bicara oleh sangat banyak orang di tab peramban.
Di mana kedua kartu sebenarnya berbeda
• Masukan konteks pendek — GPT-6 Sol $2,00 per juta vs Grok 4.6 $2,00 per juta
• Keluaran konteks pendek — GPT-6 Sol $10,00 per juta vs Grok 4.6 $6,00 per juta
• Ambang permintaan panjang — GPT-6 Sol menetapkan harga ulang di atas 272.000 token masukan vs Grok 4.6 di atas 200.000
• Masukan permintaan panjang — GPT-6 Sol $4,00 per juta vs Grok 4.6 $4,00 per juta
• Keluaran permintaan panjang — GPT-6 Sol $15,00 per juta vs Grok 4.6 $12,00 per juta
• Masukan cache — GPT-6 Sol $0,20 per juta vs Grok 4.6 $0,50 per juta
• Jendela konteks — GPT-6 Sol 1.050.000 token vs Grok 4.6 500.000 token
• Modalitas masukan — keduanya menerima teks, gambar, dan file
• Skor pekerjaan pengetahuan — GPT-6 Sol 47,6 vs Grok 4.6 44,3 pada Artificial Analysis Intelligence Index
• Terminal-Bench 2.1 — GPT-6 Sol tidak dipublikasikan pada revisi yang sama vs Grok 4.6 88,4
Baca kedua baris keluaran itu bersama-sama dan bentuk keputusannya mulai terlihat. Grok 4.6 $4,00 lebih murah per juta token keluaran untuk permintaan apa pun di bawah 200K, dan hanya $3,00 lebih murah di atasnya. Itu selisih yang jauh lebih kecil daripada yang disiratkan oleh angka utama 40%, karena kedua model menetapkan ulang harga untuk seluruh permintaan, bukan hanya bagian yang melewati batas — detail yang patut direnungkan, karena prompt dengan 200.001 token tidak ditagih sebagai satu token dengan tarif murah ditambah 200.000 token dengan tarif mahal.
Lalu ambang batasnya sendiri bergerak ke arah sebaliknya. Grok 4.6 mulai menetapkan harga ulang 72.000 token lebih awal daripada yang dilakukan GPT-6 Sol. Untuk beban kerja yang secara konsisten berada di antara 200K dan 272K, Grok 4.6 adalah model yang lebih mahal meskipun angka per tokennya lebih murah, dan hanya satu dari keduanya yang benar-benar bergerak. Di sisi mana dari jendela itu prompt Anda berada adalah pertanyaan yang lebih berguna daripada angka utama mana yang lebih rendah.

Kesenjangan tolok ukur lebih kecil dan lebih sempit daripada kesenjangan harga.
Pada Intelligence Index milik Artificial Analysis, yang merupakan pengukuran pihak ketiga, bukan tabel vendor, GPT-6 Sol berada di 47,6 dan Grok 4.6 di 44,3. Selisih 3,3 poin pada skala 0 sampai 100 memang nyata, tetapi itu bukan jenis jarak yang membuat satu model salah untuk suatu tugas dan model lainnya benar. Angka ini juga diukur pada pengaturan penalaran tertentu untuk tiap model, dan GPT-6 Sol menyediakan reasoning effort yang dapat dikonfigurasi, sementara Grok 4.6 menyediakan miliknya sendiri — jadi siapa pun yang mengutip satu angka head-to-head sedang mengutip satu titik dalam grid dua dimensi.
Yang membuat keduanya benar-benar berbeda jauh adalah pekerjaan agentik bergaya terminal. Di Terminal-Bench 2.1, Grok 4.6 mencatat 88,4. GPT-6 Sol tidak memiliki angka terbit yang sebanding pada revisi yang dibawa katalog kami, dan pembacaan jujur atas sel kosong adalah bahwa angka tersebut tidak diterbitkan — bukan bahwa model itu berkinerja buruk. Jika agen berbasis shell yang berjalan lama adalah beban kerjanya, bukti yang diterbitkan lebih mendukung Grok 4.6 dan bukti yang hilang tidak dihitung sebagai bukti untuk pihak mana pun.
Hal sebaliknya berlaku pada pengambilan pengetahuan dalam konteks panjang. GPT-6 Sol mencatat 83,7 pada recall konteks panjang berbanding 80,3 milik Grok 4.6, dan vendor kedua model melaporkan angka mereka sendiri di tempat lain — SpaceXAI menyoroti GPQA Diamond pada 94,9 untuk Grok 4.6, dan GPT-6 milik OpenAI sebagian besar dilaporkan vendor dan belum direproduksi. Dua aturan menjaga ini tetap jelas: angka vendor adalah klaim, dan angka indeks adalah pengukuran pada revisi yang disebutkan. Keduanya tidak dapat dipertukarkan dan tidak boleh dirata-ratakan menjadi satu skor "lebih baik".
Masalah penerus
Tidak satu pun dari keduanya merupakan model terbaru dari laboratoriumnya sendiri, dan berpura-pura sebaliknya akan menjadi hal yang paling menyesatkan yang bisa dilakukan perbandingan ini. SpaceXAI merilis Grok 4.7 pada 21 September 2026 dengan tarif dasar yang sama, $2,00 / $6,00, dengan Intelligence Index bergerak dari 44,3 ke 46,4. OpenAI merilis GPT-6.1 Sol pada 29 September 2026, juga dengan tarif $2,00 / $10,00, dengan Intelligence Index sebesar 51,8 dan satu tarif justru membaik: input yang di-cache turun dari $0,20 menjadi $0,10 per juta. Artificial Analysis kini menandai halaman GPT-6 Sol miliknya sebagai usang, dan mengarahkan pembaca ke GPT-6.1 Sol.
Jadi perbandingan yang adil bukanlah "mana dari keduanya yang harus Anda adopsi" melainkan "mana dari keduanya, dan apakah Anda yakin itu bukan satu generasi lebih baru di salah satu sisi." Alasan untuk tetap menggunakan GPT-6 Sol biasanya adalah integrasi spesifik berumur delapan hari, bukan klaim kemampuan; alasan untuk tetap menggunakan Grok 4.6 adalah angka agen terminal yang telah dipublikasikan yang belum bisa disamai oleh penerusnya di publik. Keduanya sah, dan keduanya dibatasi waktu.

Menjalankan keduanya dari satu kunci
Kedua model dirutekan oleh OrcaRouter, jadi bagian mekanis untuk menjaga dua kandidat tetap hidup tidak memakan biaya apa pun: satu API di depan 200+ model, kunci yang sama, tanpa kontrak kedua dan tanpa perubahan kode di antara keduanya. Ini lebih penting di sini daripada biasanya, karena argumen untuk model kedua pada pasangan khusus ini bukanlah hedge kemampuan melainkan keputusan perutean — kirim jendela 200K hingga 272K ke GPT-6 Sol dan semua yang lebih pendek ke Grok 4.6, dan aplikasi yang sama mendapatkan tagihan yang lebih murah di kedua sisi ambang batas yang tidak dapat Anda pilih dari vendor mana pun.
Failover otomatis adalah sisi yang membosankan dari penyiapan yang sama. Proses agen berkonteks panjang berlangsung lama justru karena ada sesuatu yang menahan sesi tetap terbuka, dan gangguan penyedia pada menit keempat puluh adalah jenis kegagalan yang mahal. Rute kedua yang sudah dikonfigurasi sebelumnya mengubahnya menjadi percobaan ulang, bukan menjalankan ulang.
Katalog kami mencantumkan keduanya pada harga daftar dari penyedianya masing-masing, tanpa markup, jadi perubahan tarif di sisi kami terjadi pada hari yang sama saat perubahan itu tiba di sisi mereka. Itu layak dinyatakan secara gamblang, bukan sebagai slogan: alasan untuk peduli adalah bahwa perbedaan input $0.20 versus $0.50 di atas adalah persis jenis pos yang diam-diam digeser vendor, dan pass-through berarti Anda tak pernah harus menunggu reseller mengejar.

Apa yang sebenarnya menentukan
Jika prompt Anda pendek, Grok 4.6 menang pada harga output dengan selisih yang tidak dapat ditutup oleh delta indeks mana pun, dan skor terminal-agent-nya adalah angka terkuat yang dipublikasikan di kedua kolom. Jika prompt Anda panjang, ambang penetapan harga ulang GPT-6 Sol yang lebih belakangan dan jendelanya yang lebih panjang bernilai lebih besar daripada tarifnya yang lebih tinggi, dan input yang di-cache hanya seperempat dari biayanya. Jika prompt Anda berada di antara 200K dan 272K, Anda memegang satu-satunya beban kerja di mana model yang tampak lebih murah justru lebih mahal, dan solusinya adalah pemilihan rute, bukan pemilihan model.
Hal yang perlu diperhatikan bukanlah salah satu model itu, melainkan dua penerusnya yang sudah tersedia. Grok 4.7 dan GPT-6.1 Sol keduanya melemahkan alasan untuk menunggu keputusan di sini, dan perbandingan yang harus dijalankan ulang setiap tiga minggu adalah perbandingan yang seharusnya berada di balik router, bukan di dalam dokumen arsitektur.
Dibandingkan dalam artikel ini3
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
