
GPT-6 Astra vs Qwen3.8-Max: Dua Flagship Agentik dan Cetakan Halus pada Masing-Masing
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
September 2026 memiliki dua kisah "flagship agentic", dan GPT-6 Astra serta Qwen3.8-Max adalah subjek dari keduanya. OpenAI meluncurkan GPT-6 Astra pada 3 September sebagai model yang mereka sebut terbaik di dunia untuk penggunaan komputer, rekayasa perangkat lunak, sains, dan keamanan siber; Qwen3.8-Max milik Alibaba, yang rilis sejak 3 Agustus, adalah flagship agentic dari laboratorium China terkuat — laboratorium yang oleh Artificial Analysis diperingkatkan di antara yang teratas di bidangnya pada indeks agentic miliknya dan merupakan pesaing ekosistem terbuka terdekat bagi klaim kerja otonom frontier. Keduanya sama-sama kuat secara nyata, dan keduanya dijual dengan angka-angka utama yang menyusut saat dicermati: hasil ARC-AGI-3 99,9% milik OpenAI turun menjadi 62,7% ketika ARC Prize menjalankan harness netralnya sendiri, dan kecemerlangan agentic Qwen3.8-Max diiringi regresi halusinasi yang terukur secara independen serta kebiasaan menghabiskan 64 giliran dan lebih dari satu dolar untuk tugas-tugas yang pendahulunya selesaikan hanya dalam 14 giliran. Ini adalah perbandingan dua model — dan dua cara membaca sebuah tolok ukur.
Kedua judul berita
Penawaran OpenAI untuk GPT-6 Astra adalah keluasan plus otonomi: satu model tunggal yang mengoperasikan peramban, menulis dan memperbaiki kode, menjalankan analisis ilmiah, dan — secara unik — menemukan kerentanan keamanan baru dengan cukup baik sehingga OpenAI menilai keseluruhan model tersebut sebagai “kritis” berdasarkan Preparedness Framework miliknya, sekaligus membatasi konfigurasi paling mumpuni hanya untuk mitra yang telah lolos proses vetting. Materi peluncurannya mengklaim skor sempurna 100% pada ExploitBench, 97,6% pada FrontierMath Tier 4, 96,0% pada GPQA Diamond, dan skor saturasi pada ARC-AGI-3. Penawaran Alibaba untuk Qwen3.8-Max lebih sempit tetapi tepat sasaran: kuda kerja agenik seharga $2/$6 yang meraih skor tertinggi atau mendekati skor tertinggi pada evaluasi agenik independen, dengan bobot di baliknya dipublikasikan (di bawah lisensi khusus), alih-alih dikunci dalam kotak hitam.
Apa yang dikatakan papan skor independen
Artificial Analysis saat ini memberi skor GPT-6 Astra (maks) pada Intelligence 61 — peringkat 8 dari 202 model yang dilacaknya — dan Qwen3.8-Max pada Intelligence 58, peringkat 24. Celah tiga poin itu lebih kecil daripada celah harga dan lebih kecil daripada pemasaran kedua vendor; pada indeks agentik AA yang terpisah, Qwen3.8-Max mencatat 58 yang menempatkannya sejajar dengan yang terbaik dari perbatasan model proprietary, sementara AA belum menerbitkan indeks agentik untuk GPT-6 Astra sama sekali. Pembacaan yang jujur: pada kecerdasan terukur murni, keduanya adalah tetangga dekat, dan pembingkaian "model paling cerdas di dunia" dalam materi peluncuran OpenAI bukanlah hasil evaluasi independen AA.
• Kecerdasan — GPT-6 Astra (max): AA Intelligence 61, peringkat #8/202. Qwen3.8-Max: AA Intelligence 58, peringkat #24/202; AA Agentic 58.
• Harga daftar — GPT-6 Astra: $10.00 / $50.00 per 1M, $1.00 untuk pembacaan cache, input 2× di atas 272K token. Qwen3.8-Max: $2.00 / $6.00 per 1M, $0.25 untuk pembacaan cache.
• Konteks / output — GPT-6 Astra: 1,05 juta input / 128 ribu output. Qwen3.8-Max: 1 juta input / ~128 ribu output.
• Bukti agenikGPT-6 Astra: ARC-AGI-3 99,9% (kerangka OpenAI) vs 62,7% (kerangka standar ARC Prize); WANDR 0,682 @ $11,98/tugas (dilaporkan Perplexity). Qwen3.8-Max: AA GDPval 1.739 Elo pada 64 giliran/tugas (~$1,14/tugas); Code Arena WebDev #1 pada 1.691 Elo.
• Bendera merah independen — GPT-6 Astra: belum ada di pemilih ChatGPT, API masih bertahap, dan ada konsesi soal keterpantauan. Qwen3.8-Max: pada AA-Omniscience terjadi regresi halusinasi dari 23% menjadi 40% dibandingkan generasi sebelumnya.
• Bobot — GPT-6 Astra: tertutup. Qwen3.8-Max: checkpoint kelas Max (Qwen3.8-2.4T-A95B) dipublikasikan di bawah lisensi khusus sejak 12 Agustus; AA masih mencantumkan model unggulan yang dihosting sebagai tertutup.

Tulisan kecil, beranotasi
Ambillah angka ARC-AGI-3 sebagai contoh pertama, karena ini adalah contoh paling jelas tentang bagaimana sebuah angka dapat benar sekaligus menyesatkan. OpenAI melaporkan 99,9% untuk GPT-6 Astra pada harness adaptor penyedia miliknya sendiri — sebuah pengaturan yang disetel untuk model tersebut. ARC Prize, organisasi yang menjaga benchmark tersebut, menjalankan GPT-6 Astra pada harness standar yang netral terhadap penyedia dan mengukur hasilnya 62,7%. Kedua hasil ini sama-sama mutakhir; tetapi tidak satu pun mencapai 99,9% pada harness yang tidak dikendalikan oleh pembuat model. Peringatan yang sama berlaku untuk skor WANDR Perplexity sebesar 0,682 — yang tertinggi yang pernah dicatat Perplexity, tetapi diukur oleh perusahaan yang secara bersamaan mengintegrasikan GPT-6 Astra ke dalam produknya sendiri, sehingga mengandung kepentingan komersial. Pola ini perlu diberi nama: angka-angka OpenAI yang paling spektakuler semuanya berasal dari harness yang dikendalikan OpenAI atau mitra-mitranya, dan satu-satunya angka yang sepenuhnya independen — Intelligence 61 milik AA — hanya sekadar sangat baik.
Catatan kecil Qwen3.8-Max berlaku sebaliknya: kekuatannya diukur secara independen, dan kelemahannya juga diukur secara independen. Skor GDPval 1.739 Elo itu asli — tetapi hasil uji Artificial Analysis menunjukkan Qwen3.8-Max mencapainya dengan menghabiskan 64 putaran dan kira-kira $1,14 per tugas, dibandingkan 14 putaran dan $0,53 untuk generasi sebelumnya. Itu adalah pajak usaha: model tersebut membeli batas kapabilitas agennya dengan token penalaran, yang penting bagi siapa pun yang membayar per token. Dan evaluasi Omniscience dari AA mengukur regresi halusinasi dari 23% menjadi 40% dibandingkan generasi Qwen sebelumnya — sebuah penanda independen nyata untuk beban kerja otonom dan bertahap yang justru paling mahal jika model memberikan jawaban salah yang tampak yakin. Model yang meyakinkan dirinya sendiri ke dalam kesalahan selama 64 putaran jelas tidak lebih aman untuk dilepas daripada model yang pembuatnya mengakui bahwa kemampuan pemantauannya telah menurun.

Harga, deployment, dan cara jujur untuk memilih
Dalam hal harga, tidak ada tandingannya: Qwen3.8-Max dengan harga $2.00 / $6.00 per juta adalah seperlima dari harga input GPT-6 Astra dan seperdelapan dari harga output-nya, dengan konteks 1M-token tanpa biaya tambahan long-prompt seperti yang berlaku di Astra. Dari sisi kemudahan deployment, Qwen3.8-Max memiliki keunggulan tambahan minggu ini — model ini sudah dapat dipanggil hari ini, dan model ini sudah live di OrcaRouter sesuai harga daftar Alibaba, diteruskan dengan markup 0% dan failover otomatis. GPT-6 Astra, yang masih dalam proses peluncuran dan belum dapat dipilih di ChatGPT oleh sebagian besar pengguna per 4 September, dapat diakses melalui API OpenAI sendiri maupun marketplace cloud utama seiring meluasnya akses. Pola praktis bagi tim yang membangun pipeline agentic adalah menaruh beban kerja pada model yang dapat Anda panggil hari ini, dan memperlakukan model yang lain sebagai tolok ukur untuk dipantau. Jika Anda ingin mengevaluasi klaim "agentic" alih-alih sekadar mempercayainya, lapisan routing adalah alat yang tepat: Qwen3.8-Max, Kimi K3, Grok 4.6, dan 200+ model lainnya terhubung melalui satu kunci API di OrcaRouter, dan DSL routing tersebut dapat menggabungkan beberapa model menjadi satu panggilan tunggal — sehingga Anda dapat menjalankan rangkaian tugas Anda sendiri terhadap para pesaing dan membaca sendiri hasilnya, alih-alih memilih berdasarkan klausul kecil dari dua vendor.
Dua pertanyaan yang terus muncul dari pertandingan ini.
Mengapa OpenAI melaporkan 99,9% pada ARC-AGI-3 padahal ARC Prize mengukur 62,7%? Karena itu bukan tes yang sama. Harness adaptor penyedia milik OpenAI adalah versi benchmark yang dikonfigurasi untuk cara GPT-6 Astra dipanggil dalam produksi; harness standar ARC Prize adalah konfigurasi netral yang dirancang untuk membandingkan model apa pun secara adil. Hasil 62,7% itulah yang menggeneralisasi ke "apa yang terjadi jika saya memanggil model ini sendiri," dan itu masih skor terbaik yang pernah dicatat ARC Prize pada harness tersebut.
Apakah bobot Qwen3.8-Max terbuka? Sebagian, dengan catatan lisensi. Alibaba merilis checkpoint kelas Max Qwen3.8-2.4T-A95B pada 12 Agustus di bawah lisensi kustom — bobotnya dapat diunduh, tetapi ini bukan keterbukaan ala Apache-2.0 seperti pada Qwen3.8-27B yang lebih kecil, dan Artificial Analysis masih mencantumkan model unggulan yang di-hosting sebagai proprietary. Jika kebutuhan Anda adalah "saya dapat menjalankan model yang persis seperti yang saya bayar," perbedaan itu penting; jika kebutuhan Anda adalah "saya dapat memeriksa arsitekturnya dan menghosting sendiri varian yang mendekati," Qwen3.8-Max memenuhi syarat dan GPT-6 Astra tidak.
Intisarinya
Pilih GPT-6 Astra jika Anda membutuhkan hal-hal spesifik yang saat ini hanya ia yang mampu melakukannya — pekerjaan keamanan ofensif, penalaran ilmiah mutakhir, tugas penggunaan komputer otonom yang paling sulit — dan organisasi Anda dapat melewati gerbang aksesnya serta mampu membayar harganya. Pilih Qwen3.8-Max jika Anda menginginkan model agen tingkat atas yang benar-benar dapat Anda terapkan minggu ini dengan harga $2/$6, dengan weights sebagai jalur pelarian dan regresi halusinasi yang kini Anda tahu perlu diuji. Pelajaran yang lebih luas justru terletak pada tulisan kecil itu sendiri: pada September 2026, dua model unggulan 'agentic' terdepan dijual dengan angka-angka utama yang tidak sepenuhnya dikendalikan oleh masing-masing pembuatnya, dan pembeli yang rasional membaca kerangka pengujiannya, menghitung jumlah turn, serta menjalankan tugas mereka sendiri sebelum memilih pihak.

Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
