
Grok 4.5 vs GPT-6 Astra: Enam Kali Harga Tertera, Tiga Kali Tagihan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Tempatkan Grok 4.5 dan GPT-6 Astra berdampingan pada kartu tarif keduanya dan selisihnya tampak tidak masuk akal: $2,00 versus $10,00 per juta token masukan, $6,00 versus $50,00 per juta pada keluaran. Jalankan keduanya melalui Intelligence Index milik Artificial Analysis dan selisihnya menyempit menjadi sesuatu yang benar-benar bisa diperdebatkan oleh sebuah tim — $1,04 per tugas yang diselesaikan versus $3,26. Kelipatan harga yang tertera adalah 5x pada masukan dan 8,3x pada keluaran. Kelipatan tagihannya, yang diukur berdasarkan jumlah token nyata, sedikit di atas 3x. Dan dimensi tempat kedua model ini paling berbeda bukanlah salah satu dari itu. Melainkan berapa lama Anda menunggu token pertama, yang pengukuran independennya adalah 10,94 detik versus 342,30.
Itulah keseluruhan pertarungan ini dalam satu paragraf, dan itulah sebabnya halaman ini bukan penobatan bagi salah satu pihak. GPT-6 Astra adalah model yang lebih cerdas dengan selisih yang jelas dan dapat direproduksi. Grok 4.5 adalah yang lebih murah dengan selisih yang nyata tetapi jauh lebih kecil daripada yang disiratkan daftar harganya. Segala hal lainnya — kecepatan, efisiensi token, konteks, tolok ukur coding — entah terbelah, seri, atau ternyata diukur dengan dua penggaris yang berbeda.
Tidak satu pun dari ini adalah model baru
Layak dikatakan secara gamblang, karena banyak halaman perbandingan terbaca seolah-olah keduanya baru tiba minggu lalu.
xAI merilis Grok 4.5 pada 8 Juli 2026. Model ini dibangun di atas fondasi V9 berparameter 1,5 triliun dan dilatih bersama Cursor menggunakan data sesi pengembang, bukan hanya kode statis, dan dari situlah reputasinya dalam pengodean agentik berasal. Model ini memiliki jendela konteks 500.000 token. Daftar model milik vendornya sendiri masih mencantumkannya hingga hari ini, bersama dua penerusnya — xAI sejak itu telah merilis Grok 4.6 dan Grok 4.7 — jadi anggap Grok 4.5 sebagai tier $2/$6 dari lini Grok, bukan puncaknya.
OpenAI mengumumkan GPT-6 Astra pada 3 September 2026, dengan peluncuran bertahap selama hari-hari berikutnya, dan model ini tetap menjadi andalan OpenAI: jendela konteks 1M token (katalog OrcaRouter mencantumkan 1.050.000 input dan 128.000 output maksimum), batas pengetahuan 30 April 2026, dan posisinya secara tepat pada pekerjaan agentik berjangka panjang — penggunaan komputer, penelitian, tugas ilmiah dan keamanan siber. Menurut OpenAI sendiri, ini adalah model pertama yang melewati ambang batas keamanan siber "Critical", yang juga menjadi alasan akses perusahaan dinonaktifkan secara default hingga administrator mengaktifkannya.
Keduanya umumnya tersedia di API vendor masing-masing. Tidak ada yang sedang diluncurkan. Satu-satunya hal yang berubah minggu ini adalah keluarga di sekitar salah satunya, dan itu dibahas di akhir tulisan ini karena mengubah rekomendasi, bukan perbandingannya.
Kartu tarif, termasuk tier yang tidak dikutip siapa pun
• Input, konteks pendek — Grok 4.5 $2,00 per 1 juta vs GPT-6 Astra $10,00 per 1 juta
• Keluaran, konteks pendek — Grok 4.5 $6,00 per 1 juta vs GPT-6 Astra $50,00 per 1 juta
• Input yang di-cache — Grok 4.5 $0,30 per 1 juta vs GPT-6 Astra $1,00 per 1 juta
• Input konteks panjang — Grok 4.5 $4,00 per 1 juta vs GPT-6 Astra $20,00 per 1 juta
• Keluaran konteks panjang — Grok 4.5 $12,00 per 1 juta vs GPT-6 Astra $75,00 per 1 juta
• Jendela konteks — Grok 4.5 500.000 token vs GPT-6 Astra 1.000.000 token
Klausul yang penting adalah klausul yang hampir tidak dicantumkan oleh halaman perbandingan mana pun. Pada Grok 4.5, setelah prompt sebuah permintaan mencapai 200.000 token, seluruh permintaan dihargai ulang pada tier yang lebih tinggi — dokumentasi xAI secara eksplisit menyatakan bahwa permintaan tersebut "ditagih dengan tarif yang lebih tinggi untuk semua token dalam permintaan," bukan hanya token yang melewati batas itu. Jadi, jendela 500.000 token itu nyata, tetapi sekitar 60% bagian teratasnya ditagih dua kali lipat. Halaman harga OpenAI untuk Astra menampilkan struktur dua kolom pendek/panjang yang sama tanpa menyatakan di mana titik peralihannya berada, jadi anggap kolom konteks panjang sebagai kolom yang berlaku setelah Anda bekerja dalam skala besar dan pastikan batasnya dengan memeriksa faktur Anda sendiri.

Dua pengganda tingkat layanan dikenakan di atas angka-angka Astra: Batch dan Flex berjalan pada setengah tarif standar, dan mode Fast berjalan dua kali lipat — input $20.00 dan output $100.00 pada konteks pendek. Grok 4.5 tidak memiliki tier batch di lembar xAI; faktor pengungkitnya adalah diskon cache dan pemrosesan prioritas pada 2x.
Posisi kami sendiri dalam semua ini sengaja dibuat membosankan: OrcaRouter meneruskan harga daftar penyedia tanpa markup 0%, jadi kedua kartu tarif di atas aktif di sisi kami pada hari yang sama ketika salah satu vendor mengubahnya, dan token yang di-cache ditagih dengan tarif cache penyedia, bukan harga penuh. Tidak ada angka kedua yang perlu direkonsiliasi.
Berapa biaya sebenarnya dari sebuah beban kerja
Harga yang tertera bukan panduan yang baik di sini, karena kedua model tidak menghabiskan jumlah token yang sama untuk menyelesaikan pekerjaan yang sama. Ambil tugas agen coding dengan konteks repositori 120.000 token dan jawaban 25.000 token. Pada Grok 4.5 itu $0,24 untuk input dan $0,15 untuk output, jadi $0,39. Pada GPT-6 Astra itu $1,20 dan $1,25, jadi $2,45. Selisih 6,3x.
Sekarang dorong prompt melewati batas konteks panjang: 300.000 token masuk, 20.000 keluar. Grok 4.5 mengenakan biaya $1.20 plus $0.24, atau $1.44. GPT-6 Astra mengenakan biaya $6.00 plus $1.50, atau $7.50. Selisihnya menyusut menjadi 5,2x, karena kedua vendor menggandakan tarif input dan pengali output Astra menyempit pada tingkat teratas.
Tidak satu pun dari itu yang diukur oleh Artificial Analysis, dan angka mereka adalah yang lebih berguna. Dengan menjalankan Intelligence Index secara penuh, biaya rata-rata per tugas yang diselesaikan adalah $1,04 untuk Grok 4.5 pada upaya tinggi dan $3,26 untuk GPT-6 Astra pada upaya maksimal. Alasan rasionya turun menjadi 3,1x ketika harga input terpaut 5x adalah efisiensi token: di seluruh indeks, Grok 4.5 menghasilkan 77M token keluaran dan Astra menghasilkan 60M. Astra adalah model yang lebih ringkas, sehingga ia menutup sebagian kesenjangan yang ia buka pada harga. Jika Anda selama ini mengutip "lima kali lebih murah" dalam dokumen anggaran, 3x adalah angka yang akan muncul di faktur.
Kecepatan memang imbang. Latensi tidak.
Inilah temuan yang mengejutkan kami, dan bertentangan dengan intuisi bahwa model murah adalah yang cepat.
Artificial Analysis mengukur Grok 4.5 pada 55 token keluaran per detik dan GPT-6 Astra pada 58. Itu adalah perbedaan 5% pada revisi indeks yang sama, dan ringkasan AA sendiri menggambarkan keduanya sebagai lebih lambat dari rata-rata — median pembandingnya adalah 74 token per detik. Jika throughput adalah kriteria pemilihan Anda, kedua model ini tidak terpisah. Katakan dengan gamblang alih-alih mengarang pemenang: pada satu angka kecepatan yang diukur dengan cara yang sama untuk keduanya, keduanya setara.
Latensi memisahkan keduanya secara brutal. AA mencatat waktu Grok 4.5 hingga token jawaban pertama pada 10,94 detik dengan 20,01 detik end-to-end; GPT-6 Astra pada 342,30 detik dengan 350,91 detik end-to-end. Itu sekitar 31x, dan pada permintaan sinkron, itu adalah perbedaan antara spinner dan jeda minum kopi.
Dua catatan jujur sebelum siapa pun menyusun anggaran berdasarkan itu. Pertama, itu adalah angka yang mencakup penalaran — "time to first answer token" milik AA sengaja menghitung waktu berpikir model — jadi itu menggambarkan tugas yang berat, bukan giliran obrolan. Kedua, keduanya tidak dilakukan dengan upaya yang setara: entri yang dipublikasikan Astra berada pada upaya maksimum, Grok 4.5 pada tingkat tinggi, dan setelan upaya justru merupakan pengatur yang menggerakkan angka ini. Daftar OrcaRouter sendiri untuk GPT-6 Astra menunjukkan p50 time to first token 8,31 detik dan p95 10,00 detik di seluruh trafik langsung, yang merupakan titik pengukuran yang sepenuhnya berbeda — token pertama pada panggilan produksi nyata, bukan token jawaban pertama pada tugas benchmark. Keduanya tidak dapat dibandingkan dan tidak boleh ditempatkan dalam satu kalimat sebagai perbandingan.

Tolok ukur coding: periksa versinya sebelum Anda mengutipnya
Cari pertandingan ini dan Anda akan menemukan 83,3% Grok 4.5 pada Terminal-Bench 2.1 yang diadu dengan 57,9% GPT-6 Astra pada Terminal-Bench 4.0. Itu adalah tolok ukur yang berbeda yang memakai nama yang sama. Keduanya tidak bisa dibandingkan, dan halaman-halaman perbandingan yang menjejerkannya tidak memberi tahu Anda apa pun.
Sebagian besar angka coding yang dipublikasikan oleh kedua vendor mengalami masalah ini. Lembar xAI untuk Grok 4.5 melaporkan SWE-bench Pro 64,7%, Terminal-Bench 2.1 83,3%, DeepSWE 1.0 62,0%, dan DeepSWE 1.1 53%. Lembar OpenAI untuk Astra melaporkan Terminal-Bench 4.0 57,9%, OSWorld 2.0 72,6%, FrontierMath Tier 4 97,6%, dan ARC-AGI-3 99,9%. Semuanya dilaporkan oleh vendor, dan hampir tidak ada yang tumpang tindih.
Ada satu tempat di mana keduanya benar-benar bertemu pada harness yang sama: DeepSWE v1.1 dari Datacurve, yang menjalankan setiap model melalui scaffold mini-swe-agent yang sama pada 113 tugas orisinal yang bebas kontaminasi. Di sana, GPT-6 Astra mencetak 74,1% dengan biaya sekitar $6,52 per tugas, sementara Grok 4.5 berada di 53%. Itu adalah hasil tunggal paling bersih di halaman ini, dan secara meyakinkan mengunggulkan Astra. Satu catatan tambahan khusus untuk Grok 4.5: angka CursorBench dari xAI dikecualikan dari perbandingan publik setelah basis kode sebelumnya ditemukan telah bocor ke dalam pelatihan, jadi perlakukan angka CursorBench apa pun untuk model ini sebagai tidak dapat digunakan.
Perilaku agentic dan pemanggilan tool
Keduanya menempuh rute berbeda menuju tujuan yang sama, dan perbedaannya bersifat arsitektural, bukan skor.
Fitur-fitur GPT-6 Astra yang ditujukan untuk pengembang mengasumsikan Anda sedang membangun sebuah orkestrator. Model ini mendukung pemanggilan alat secara asinkron, sehingga menunggu sebuah alat tidak menghalangi model untuk melanjutkan pekerjaan lain; pengarahan di tengah tugas melalui WebSockets, sehingga proses yang sedang berjalan dapat dialihkan tanpa memulainya ulang; dan upaya penalaran yang dapat disesuaikan di tengah percakapan. Di Codex, ia menambahkan mekanisme pelestarian konteks yang menyimpan catatan lintas jendela konteks sementara konteks sebelumnya tetap dapat dicari. Kartu sistem OpenAI sendiri dilaporkan mencatat bahwa model ini lebih sulit dipantau daripada pendahulunya, yang menjadi alasan untuk memperlakukan log pemanggilan alat dan status sistem — bukan narasi model — sebagai bukti audit Anda.
Narasi agentik Grok 4.5 lebih sedikit tentang primitif baru dan lebih banyak tentang tempat ia dilatih. Pelatihan bersama dengan Cursor pada sesi pengeditan dan debugging multi-file nyata adalah hal yang dikreditkan xAI atas efisiensi tokennya pada tugas perangkat lunak, dan itulah sebabnya model ini muncul sebagai default di antarmuka coding alih-alih sebagai unggulan serbaguna. Pemanggilan fungsi, output terstruktur, streaming, dan prompt caching semuanya didukung; pemanggilan alat mengikuti bentuk yang kompatibel dengan OpenAI, itulah sebabnya memasukkannya ke klien yang sudah ada hanya perlu mengubah base-URL.
Tidak ada tolok ukur agentik independen bersama tempat keduanya muncul pada tingkat upaya yang setara, jadi kami tidak akan mengarang pemenang di sini. Yang dapat dikatakan adalah bahwa antarmuka pemanggilan alat Astra lebih ekspresif di antara keduanya untuk pekerjaan berhorizon panjang, dan ekonomi token per tugas Grok 4.5 lebih menarik untuk pekerjaan bervolume tinggi.
Pilih Grok 4.5 jika
• Anda menjalankan pekerjaan bervolume tinggi atau berfrekuensi tinggi yang biaya per tugasnya mendominasi keputusan, dan nilai 39 pada AA Intelligence Index sudah melampaui ambang kualitas Anda.
• Prompt Anda berada di bawah 200.000 token. Di sinilah keunggulan harga Grok 4.5 paling besar dan penetapan harga ulang untuk konteks panjang tidak pernah terpicu.
• Anda ingin diskon cache yang benar-benar bermanfaat. Dengan $0.30 per juta token input yang di-cache dibandingkan $1.00 milik Astra, beban kerja dengan prefiks berulang — prompt sistem yang panjang, konteks repo bersama — menjadi murah dengan cepat.
• Anda memerlukan latensi token pertama di bawah satu menit pada tugas-tugas sulit dan tidak dapat menanggung penantian yang memakan waktu beberapa menit.
Pilih GPT-6 Astra jika
• Tugasnya adalah produknya, dan biayanya hanyalah kesalahan pembulatan dibandingkan jawaban yang salah. Empat belas poin indeks di ujung kurva ini adalah perbedaan kemampuan yang nyata, bukan perbedaan pemasaran.
• Anda benar-benar bekerja melampaui 500.000 token. Jendela Astra kira-kira dua kali lipat jendela Grok 4.5, dan dari keduanya hanya ia yang mencapainya tanpa klausa penetapan harga ulang.
• Anda memerlukan computer use, deep research, atau postur keamanan siber — termasuk kontrol yang dinonaktifkan secara default untuk enterprise yang menyertai ambang batas Critical dari OpenAI.
• Anda sedang menulis kode orkestrator yang menginginkan pemanggilan alat secara asinkron dan pengarahan di tengah proses, alih-alih panggilan permintaan-respons langsung.
Apa yang bergerak minggu ini, dan mengapa hal itu mengubah rekomendasi
Pada 22 September 2026, OpenAI merilis GPT-6 Sol dan GPT-6 Luna dengan tarif $2,00/$10,00 dan $0,10/$0,50 per juta token, dan menyebut tarif tersebut permanen, bukan promosi. Sol adalah model kelas menengah untuk pengodean dan analisis dengan harga sekitar seperlima dari harga input Astra.
Itu penting untuk keputusan yang tepat ini. Jika alasan Anda membandingkan Grok 4.5 dengan GPT-6 Astra adalah harga, perbandingan yang jujur di sisi OpenAI bukan lagi Astra — Astra adalah model unggulan, dan Sol sekarang menempati segmen tempat Grok 4.5 sebenarnya bersaing. Grok 4.5 masih lebih murah daripada Sol untuk output ($6,00 versus $10,00) dan setara untuk input ($2,00 masing-masing), jadi ia tidak tergeser; tetapi perbandingan yang ditulis sebelum minggu ini membandingkan model kelas hemat dengan model unggulan dan menyebut hasilnya sebagai cerita tentang harga.
Hal yang sama juga berlaku di sisi xAI: daftar model xAI sendiri memuat grok-4.6 dan grok-4.7 bersama grok-4.5, jadi Grok 4.5 adalah salah satu opsi dalam sebuah keluarga, bukan yang terdepan saat ini.

Itulah argumen sesungguhnya untuk melakukan routing alih-alih memilih. Tumpukan dua model yang terus muncul dalam tulisan praktisi — kirim sebagian besar ke model murah, eskalasi ekor yang sulit ke model mahal — adalah keputusan routing, dan itu adalah keputusan yang dapat Anda nyatakan sebagai konfigurasi alih-alih menulis ulang. OrcaRouter menempatkan kedua model di belakang satu API dan satu kunci, dengan harga daftar penyedia diteruskan pada markup 0%, failover otomatis antar penyedia, dan DSL routing yang memungkinkan Anda mengirim pekerjaan di bawah ambang batas ke grok/grok-4.5 dan eskalasi ke openai/gpt-6-astra ketika suatu tugas gagal atau melewati batas ukuran. Anda dapat mencoba jalur mahal pada sebagian kecil trafik tanpa mempertaruhkan pipeline produksi padanya.
Versi singkatnya
GPT-6 Astra adalah model yang lebih baik. Selisihnya tidak tipis, dan halaman ini tidak akan berguna jika berpura-pura sebaliknya — 53 berbanding 39 pada revisi indeks yang sama, 74,1% berbanding 53% pada satu tolok ukur pengodean yang sama-sama telah mereka ikuti.
Grok 4.5 adalah model yang lebih murah, tetapi sebesar 3,1x per tugas yang diselesaikan, bukan 5x hingga 8,3x seperti yang tersirat dalam daftar harganya, karena Astra menghabiskan lebih sedikit token untuk mencapainya. Dan pada satu angka kecepatan yang diukur secara identik untuk keduanya, keduanya setara.
Keputusan bukanlah model mana yang menang. Yang jadi pertanyaan adalah apakah selisih indeks 14 poin sepadan dengan tagihan yang kira-kira tiga kali lipat pada beban kerja spesifik Anda — dan apakah jawabannya sama untuk setiap permintaan yang Anda kirim.
Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
