
Gemini 4 Argon vs GPT-6 Astra: Imbang Ketat di Indeks, dan Langkah Harga Turun Dua Pertiga
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 144 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Dua model terdepan, terpaut 0,11 poin pada Indeks Kecerdasan Artificial Analysis. Gemini 4 Argon mendapat skor 52,56. GPT-6 Astra mendapat skor 52,67. Jika Anda harus memilih di antara keduanya berdasarkan kemampuan umum yang terukur, Anda bisa melempar koin, dan perbedaan antara kedua skor itu lebih kecil daripada interval kepercayaan pada masing-masing skor. Itu adalah situasi yang benar-benar jarang terjadi di pasar yang sepuluh model teratasnya hanya mencakup sekitar lima belas poin secara total, dan itu menjadikan ini pertandingan Gemini 4 Argon yang paling mudah untuk dinalar, karena argumen kemampuan sudah berakhir sebelum dimulai dan yang tersisa hanyalah ekonomi dan akses.
Akan tetapi, keduanya bukan kembar. Argon diumumkan pada 2026-09-30 oleh Google DeepMind dan diluncurkan secara bertahap, dimulai dengan para pembela siber tepercaya di Fairwind Program. GPT-6 Astra dirilis pada awal September — kartu katalog kami mencatatnya 2026-09-04, Artificial Analysis mencantumkan 2026-09-03 — dan merupakan rute aktif yang dapat Anda panggil sore ini dengan tarif $10 untuk input dan $50 untuk output per juta token, dengan jendela konteks 1.050.000 token dan batas keluaran 128.000 token. Salah satu dari model ini memiliki harga yang dapat ditagihkan kepada Anda hari ini.
Kapan selisih 0,11 poin itu nyata dan kapan itu hanya derau
Indeks adalah suatu komposit, sehingga dua model yang seri pada komposit tersebut dapat berbeda secara berarti pada bagian-bagiannya. Di sini bagian-bagiannya sebagian besar sepakat, dengan tiga pengecualian yang patut disebutkan.
• Terminal-Bench 4.0 — GPT-6 Astra 59,1% versus Gemini 4 Argon 57,1%. Astra unggul, tipis.
• Penalaran konteks panjang — GPT-6 Astra 80,7% versus Gemini 4 Argon 79,7%.
• GPQA Diamond — GPT-6 Astra 96,1%. Argon tidak mempublikasikan angka apa pun di papan ini.
• CritPt — GPT-6 Astra 31,7% versus Gemini 4 Argon 27,1%.
• SciCode — Gemini 4 Argon 61,8% versus GPT-6 Astra 56,5%.
• Humanity's Last Exam — Gemini 4 Argon 57,1% versus GPT-6 Astra 54,7%.
• AutomationBench-AA — Gemini 4 Argon 77,5% versus GPT-6 Astra 68,5%.
• GDPval — Gemini 4 Argon 1.611 versus GPT-6 Astra 1.542.
• Omniscience — GPT-6 Astra 43,4 versus Gemini 4 Argon 42,4.
• ITBench-SRE — GPT-6 Astra 48,6% dibandingkan tanpa angka Argon yang dipublikasikan.
• Kecepatan keluaran — GPT-6 Astra 51,2 token per detik versus Gemini 4 Argon 48,9. Secara efektif setara.
• Latensi token pertama pada harness indeks — Gemini 4 Argon 2,8 detik versus GPT-6 Astra 320,2 detik.
Astra memiliki keunggulan dalam penalaran pilihan ganda ilmiah, dalam soal fisika titik kritis, dan pada tolok ukur SRE. Argon memiliki keunggulan dalam pengodean ilmiah, pada kumpulan tugas end-to-end yang lebih sulit, dan pada pekerjaan bernilai GDP. Tidak ada dari kedua keunggulan itu yang cukup besar untuk menjadi dasar migrasi dengan sendirinya.

Baris latensi adalah persoalan yang berbeda. 320 detik hingga token pertama berarti lima setengah menit diam sebelum apa pun dikeluarkan, dibandingkan dengan kurang dari tiga detik untuk Argon. Keduanya mengukur hal yang sama — waktu hingga potongan pertama dalam uji indeks Artificial Analysis — jadi ini sebanding. Penalaran Astra selalu aktif dan dapat dikonfigurasi dari upaya rendah hingga maksimal; proses dengan upaya maksimal pada tugas sulit benar-benar berpikir selama beberapa menit sebelum berbicara. Apakah itu sebuah cacat sepenuhnya bergantung pada antarmuka Anda. Untuk tugas batch, itu tidak merugikan apa pun. Untuk apa pun yang penggunanya menatap spinner, itu adalah perbedaan paling terlihat oleh pengguna antara kedua model ini, lebih besar daripada selisih benchmark mana pun di halaman tersebut.
Langkah harga, yang merupakan subjek sebenarnya
Di sinilah penentuan terjadi, dan cara penentuannya mudah salah dimodelkan karena kartu tarif Astra memiliki tiga tingkat yang terlihat serupa.
• Standar, hingga 272.000 token masukan — GPT-6 Astra $10,00 masuk / $50,00 keluar, pembacaan cache $1,00, penulisan cache $12,50.
• Konteks panjang, di atas 272.000 token masukan — GPT-6 Astra $20,00 masuk / $75,00 keluar, pembacaan cache $2,00. Seluruh permintaan dihargai ulang pada tingkat yang lebih tinggi, bukan hanya bagian yang melampaui: masukan 2× dan keluaran 1,5×.
• Mode Cepat — 2× tarif standar yang berlaku, jadi $20.00 masuk / $100.00 keluar. Ini adalah angka $100 yang dikutip seolah-olah itu tarif konteks panjang; sebenarnya bukan.
• Gemini 4 Argon — $2,00 masuk / $10,00 keluar dengan tarif tetap berdasarkan skema perkenalan, input yang di-cache sebesar $0,10, tanpa tingkat step yang dipublikasikan dan tanpa tier cepat yang dipublikasikan.
Jadi, Argon lima kali lebih murah pada input dan lima kali lebih murah pada output dibandingkan tier standar Astra, dan sepuluh kali lebih murah pada input di atas 272K. Dua pengukuran biaya independen menyampaikan poin yang sama dari arah yang berbeda: Artificial Analysis menempatkan Argon pada $1,99 per tugas indeks dibandingkan $3,26 milik Astra, dan $2.407 untuk menjalankan seluruh indeks dibandingkan $5.324 milik Astra. Rasio per tugas lebih kecil daripada rasio per token karena alasan yang sama seperti saat dibandingkan dengan DeepSeek — Argon menjalankan lebih sedikit token untuk menyelesaikannya — tetapi masih 1,6×.
Papan peringkat berbobot PDB milik Vals menceritakan versi ketiga dari kisah yang sama: Argon di posisi pertama dengan 68,90% dan $15,68 per eksekusi, Astra di posisi keenam dengan 63,13% dan $18,46. Astra lebih mahal dan skornya lebih rendah di sana. Materi Google secara eksplisit menyatakan bahwa harga tersebut merupakan tarif pengenalan, sebuah istilah yang berarti harga itu dapat berubah, dan interpretasi yang jujur adalah bahwa keunggulan harga Argon nyata dan tidak ada jaminan bahwa keunggulan itu akan bertahan.
Dua fakta arsitektur yang lebih menentukan daripada benchmark

Batas output dulu. Gemini 4 Argon menghasilkan hingga 1.000.000 token dalam satu lintasan — pengumuman Google menyebut ini sebagai peningkatan dari 64K di generasi sebelumnya. GPT-6 Astra dibatasi pada 128.000. Keduanya mempertahankan jendela konteks sekitar satu juta token, jadi ini murni tentang seberapa banyak model dapat menulis dalam sekali jalan. Untuk pembuatan teks panjang, perubahan kode patch penuh, atau penyusunan dokumen sekali jalan, itu adalah perbedaan delapan kali lipat dalam apa yang dapat dihasilkan oleh satu panggilan. Untuk obrolan, ekstraksi, dan langkah agen singkat, kedua batas itu praktis tak terbatas dan perbedaannya tidak merugikan Anda.
Kedua, soal modalitas, dan di sini keunggulannya justru berbalik arah dalam satu hal. GPT-6 Astra menerima teks, gambar, dan file. Gemini 4 Argon menerima teks, gambar, video, dan file, dan materi peluncuran Google secara khusus menekankan pemahaman video panjang — angka LVBench sebesar 91,7% yang dilaporkan vendor. Jika pipeline Anda mencerna video, Astra bukanlah pengganti. Audio juga tidak disebutkan dalam daftar modalitas yang dipublikasikan Argon, jadi jangan berasumsi bahwa peningkatan ini menyertakannya.
Apa yang sebenarnya harus dilakukan
Astra tersedia dan Argon tidak, dan itu menyelesaikan sebagian besar keputusan untuk bulan depan. Jalur konkret yang tidak menyia-nyiakan pekerjaan: bangun di atas GPT-6 Astra jika beban kerja Anda membutuhkan model penalaran yang selalu aktif dengan akurasi ilmiah yang kuat dan rekam jejak agentik yang terbukti, pertahankan nama model Anda dalam konfigurasi, dan tetapkan timeout klien Anda dari perilaku Astra yang terukur alih-alih dari optimisme — uji token pertama selama lima menit akan memicu timeout default 60 detik dan stream yang mati pada 300 detik tampak seperti gangguan. Jika Anda peka biaya di atas 272K token input, modelkan perubahan harga secara eksplisit sebelum Anda berkomitmen, karena langkah ini menggandakan input dan menaikkan output sebesar setengah dalam satu batas.

Jalur tengah yang menarik adalah Anda tidak harus memilih satu default tunggal. Astra dan Argon — saat Argon dirilis — adalah model dengan bentuk yang sama yang ditujukan untuk kelas pekerjaan yang sama, sehingga menjadikan keduanya mitra failover alami alih-alih pesaing untuk slot yang sama. Di OrcaRouter, openai/gpt-6-astra tersedia secara live dengan harga daftar penyedia tanpa markup, pada endpoint yang kompatibel dengan OpenAI yang sama dengan 200+ model lainnya, dengan failover otomatis antar penyedia dan DSL routing untuk menyatakan pengaturan primer-dan-cadangan pada satu kunci. Saat Argon bergabung dengan katalog dengan id apa pun yang dipublikasikan Google, peralihannya hanyalah sebuah string — tanpa kontrak kedua, tanpa pekerjaan integrasi, dan tanpa membangun ulang apa pun yang Anda bangun di sekitar Astra selama ini.
Apa yang akan memutuskan seri itu secara permanen?
Harga Argon yang dipublikasikan setelah periode perkenalan, dan reproduksi independen atas klaim agentik Google — angka DeepSWE v1.1 sebesar 77,9% dan hasil CWE-bench v1 sebesar 68% keduanya dilaporkan vendor dan tak satu pun punya pengujian eksternal yang mendasarinya. Keduanya bisa menggerakkan Argon secara material ke atas atau ke bawah, karena keunggulan indeks 0,11 poin bukanlah penyangga terhadap kerugian biaya 1,6× jika keunggulan biaya itu ternyata hanya sementara, dan itu bukanlah defisit jika Google mempertahankan tarif perkenalan serta tier konteks panjang Astra berdampak lebih keras dari yang diperkirakan dalam produksi.
Untuk saat ini: berdasarkan kemampuan umum yang terukur, keduanya adalah model yang sama dalam dua pembungkus. Astra adalah yang memiliki rute aktif, langkah harga yang diketahui, dan jeda berpikir selama lima menit. Argon adalah yang memiliki kartu lebih murah dan tanpa endpoint. Hasil serinya nyata, dan salah satu sisinya dapat dibeli.
