Kartu judul hero untuk GPT-6 Astra vs Qwen3.8-Max dengan subjudul 'Dua Model Flagship Agen dan Catatan Kecil di Bawah Masing-Masing', chip statistik bertuliskan 'AA Intelligence 61 vs 58', 'Harga daftar $10 / $50 vs $2 / $6', dan 'ARC-AGI-3: 99.9% vendor vs 62.7% harness netral', footer tanggal peluncuran, serta logo OrcaRouter di pojok kanan bawah.
Guides & Insights

GPT-6 Astra vs Qwen3.8-Max: Dua Flagship Agentik dan Cetakan Halus pada Masing-Masing

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

September 2026 memiliki dua kisah "flagship agentic", dan GPT-6 Astra serta Qwen3.8-Max adalah subjek dari keduanya. OpenAI meluncurkan GPT-6 Astra pada 3 September sebagai model yang mereka sebut terbaik di dunia untuk penggunaan komputer, rekayasa perangkat lunak, sains, dan keamanan siber; Qwen3.8-Max milik Alibaba, yang rilis sejak 3 Agustus, adalah flagship agentic dari laboratorium China terkuat — laboratorium yang oleh Artificial Analysis diperingkatkan di antara yang teratas di bidangnya pada indeks agentic miliknya dan merupakan pesaing ekosistem terbuka terdekat bagi klaim kerja otonom frontier. Keduanya sama-sama kuat secara nyata, dan keduanya dijual dengan angka-angka utama yang menyusut saat dicermati: hasil ARC-AGI-3 99,9% milik OpenAI turun menjadi 62,7% ketika ARC Prize menjalankan harness netralnya sendiri, dan kecemerlangan agentic Qwen3.8-Max diiringi regresi halusinasi yang terukur secara independen serta kebiasaan menghabiskan 64 giliran dan lebih dari satu dolar untuk tugas-tugas yang pendahulunya selesaikan hanya dalam 14 giliran. Ini adalah perbandingan dua model — dan dua cara membaca sebuah tolok ukur.

Kedua judul berita

Penawaran OpenAI untuk GPT-6 Astra adalah keluasan plus otonomi: satu model tunggal yang mengoperasikan peramban, menulis dan memperbaiki kode, menjalankan analisis ilmiah, dan — secara unik — menemukan kerentanan keamanan baru dengan cukup baik sehingga OpenAI menilai keseluruhan model tersebut sebagai “kritis” berdasarkan Preparedness Framework miliknya, sekaligus membatasi konfigurasi paling mumpuni hanya untuk mitra yang telah lolos proses vetting. Materi peluncurannya mengklaim skor sempurna 100% pada ExploitBench, 97,6% pada FrontierMath Tier 4, 96,0% pada GPQA Diamond, dan skor saturasi pada ARC-AGI-3. Penawaran Alibaba untuk Qwen3.8-Max lebih sempit tetapi tepat sasaran: kuda kerja agenik seharga $2/$6 yang meraih skor tertinggi atau mendekati skor tertinggi pada evaluasi agenik independen, dengan bobot di baliknya dipublikasikan (di bawah lisensi khusus), alih-alih dikunci dalam kotak hitam.

Apa yang dikatakan papan skor independen

Artificial Analysis saat ini memberi skor GPT-6 Astra (maks) pada Intelligence 61 — peringkat 8 dari 202 model yang dilacaknya — dan Qwen3.8-Max pada Intelligence 58, peringkat 24. Celah tiga poin itu lebih kecil daripada celah harga dan lebih kecil daripada pemasaran kedua vendor; pada indeks agentik AA yang terpisah, Qwen3.8-Max mencatat 58 yang menempatkannya sejajar dengan yang terbaik dari perbatasan model proprietary, sementara AA belum menerbitkan indeks agentik untuk GPT-6 Astra sama sekali. Pembacaan yang jujur: pada kecerdasan terukur murni, keduanya adalah tetangga dekat, dan pembingkaian "model paling cerdas di dunia" dalam materi peluncuran OpenAI bukanlah hasil evaluasi independen AA.

Kecerdasan — GPT-6 Astra (max): AA Intelligence 61, peringkat #8/202. Qwen3.8-Max: AA Intelligence 58, peringkat #24/202; AA Agentic 58.

Harga daftar — GPT-6 Astra: $10.00 / $50.00 per 1M, $1.00 untuk pembacaan cache, input 2× di atas 272K token. Qwen3.8-Max: $2.00 / $6.00 per 1M, $0.25 untuk pembacaan cache.

Konteks / output — GPT-6 Astra: 1,05 juta input / 128 ribu output. Qwen3.8-Max: 1 juta input / ~128 ribu output.

Bukti agenikGPT-6 Astra: ARC-AGI-3 99,9% (kerangka OpenAI) vs 62,7% (kerangka standar ARC Prize); WANDR 0,682 @ $11,98/tugas (dilaporkan Perplexity). Qwen3.8-Max: AA GDPval 1.739 Elo pada 64 giliran/tugas (~$1,14/tugas); Code Arena WebDev #1 pada 1.691 Elo.

Bendera merah independen — GPT-6 Astra: belum ada di pemilih ChatGPT, API masih bertahap, dan ada konsesi soal keterpantauan. Qwen3.8-Max: pada AA-Omniscience terjadi regresi halusinasi dari 23% menjadi 40% dibandingkan generasi sebelumnya.

Bobot — GPT-6 Astra: tertutup. Qwen3.8-Max: checkpoint kelas Max (Qwen3.8-2.4T-A95B) dipublikasikan di bawah lisensi khusus sejak 12 Agustus; AA masih mencantumkan model unggulan yang dihosting sebagai tertutup.

Two-column comparison scoreboard for GPT-6 Astra vs Qwen3.8-Max. GPT-6 Astra column: AA Intelligence 61 (#8 of 202), AA Agentic not yet published, list price $10.00/$50.00, context/output 1.05M/128K, headline score ARC-AGI-3 99.9% on OpenAI's provider-adapter harness, independent caveat 62.7% on ARC Prize's standard harness. Qwen3.8-Max column: AA Intelligence 58 (#24 of 202), AA Agentic 58, list price $2.00/$6.00, context/output 1M/~128K, headline score GDPval 1,739 Elo on Artificial Analysis runs, independent caveat hallucination regression from 23% to 40% per AA-Omniscience.

Tulisan kecil, beranotasi

Ambillah angka ARC-AGI-3 sebagai contoh pertama, karena ini adalah contoh paling jelas tentang bagaimana sebuah angka dapat benar sekaligus menyesatkan. OpenAI melaporkan 99,9% untuk GPT-6 Astra pada harness adaptor penyedia miliknya sendiri — sebuah pengaturan yang disetel untuk model tersebut. ARC Prize, organisasi yang menjaga benchmark tersebut, menjalankan GPT-6 Astra pada harness standar yang netral terhadap penyedia dan mengukur hasilnya 62,7%. Kedua hasil ini sama-sama mutakhir; tetapi tidak satu pun mencapai 99,9% pada harness yang tidak dikendalikan oleh pembuat model. Peringatan yang sama berlaku untuk skor WANDR Perplexity sebesar 0,682 — yang tertinggi yang pernah dicatat Perplexity, tetapi diukur oleh perusahaan yang secara bersamaan mengintegrasikan GPT-6 Astra ke dalam produknya sendiri, sehingga mengandung kepentingan komersial. Pola ini perlu diberi nama: angka-angka OpenAI yang paling spektakuler semuanya berasal dari harness yang dikendalikan OpenAI atau mitra-mitranya, dan satu-satunya angka yang sepenuhnya independen — Intelligence 61 milik AA — hanya sekadar sangat baik.

Catatan kecil Qwen3.8-Max berlaku sebaliknya: kekuatannya diukur secara independen, dan kelemahannya juga diukur secara independen. Skor GDPval 1.739 Elo itu asli — tetapi hasil uji Artificial Analysis menunjukkan Qwen3.8-Max mencapainya dengan menghabiskan 64 putaran dan kira-kira $1,14 per tugas, dibandingkan 14 putaran dan $0,53 untuk generasi sebelumnya. Itu adalah pajak usaha: model tersebut membeli batas kapabilitas agennya dengan token penalaran, yang penting bagi siapa pun yang membayar per token. Dan evaluasi Omniscience dari AA mengukur regresi halusinasi dari 23% menjadi 40% dibandingkan generasi Qwen sebelumnya — sebuah penanda independen nyata untuk beban kerja otonom dan bertahap yang justru paling mahal jika model memberikan jawaban salah yang tampak yakin. Model yang meyakinkan dirinya sendiri ke dalam kesalahan selama 64 putaran jelas tidak lebih aman untuk dilepas daripada model yang pembuatnya mengakui bahwa kemampuan pemantauannya telah menurun.

Screenshot of the Artificial Analysis model page for GPT-6 Astra (max) showing an Intelligence Index of 61 ranked #8 of 202, Cost ranked #86 of 202 with $10.00 input and $50.00 output per million tokens and a 90% cache discount, a $1.67 cost per Intelligence Index task, and a summary describing the model as among the leaders in intelligence but expensive for its class.

Harga, deployment, dan cara jujur untuk memilih

Dalam hal harga, tidak ada tandingannya: Qwen3.8-Max dengan harga $2.00 / $6.00 per juta adalah seperlima dari harga input GPT-6 Astra dan seperdelapan dari harga output-nya, dengan konteks 1M-token tanpa biaya tambahan long-prompt seperti yang berlaku di Astra. Dari sisi kemudahan deployment, Qwen3.8-Max memiliki keunggulan tambahan minggu ini — model ini sudah dapat dipanggil hari ini, dan model ini sudah live di OrcaRouter sesuai harga daftar Alibaba, diteruskan dengan markup 0% dan failover otomatis. GPT-6 Astra, yang masih dalam proses peluncuran dan belum dapat dipilih di ChatGPT oleh sebagian besar pengguna per 4 September, dapat diakses melalui API OpenAI sendiri maupun marketplace cloud utama seiring meluasnya akses. Pola praktis bagi tim yang membangun pipeline agentic adalah menaruh beban kerja pada model yang dapat Anda panggil hari ini, dan memperlakukan model yang lain sebagai tolok ukur untuk dipantau. Jika Anda ingin mengevaluasi klaim "agentic" alih-alih sekadar mempercayainya, lapisan routing adalah alat yang tepat: Qwen3.8-Max, Kimi K3, Grok 4.6, dan 200+ model lainnya terhubung melalui satu kunci API di OrcaRouter, dan DSL routing tersebut dapat menggabungkan beberapa model menjadi satu panggilan tunggal — sehingga Anda dapat menjalankan rangkaian tugas Anda sendiri terhadap para pesaing dan membaca sendiri hasilnya, alih-alih memilih berdasarkan klausul kecil dari dua vendor.

Dua pertanyaan yang terus muncul dari pertandingan ini.

Mengapa OpenAI melaporkan 99,9% pada ARC-AGI-3 padahal ARC Prize mengukur 62,7%? Karena itu bukan tes yang sama. Harness adaptor penyedia milik OpenAI adalah versi benchmark yang dikonfigurasi untuk cara GPT-6 Astra dipanggil dalam produksi; harness standar ARC Prize adalah konfigurasi netral yang dirancang untuk membandingkan model apa pun secara adil. Hasil 62,7% itulah yang menggeneralisasi ke "apa yang terjadi jika saya memanggil model ini sendiri," dan itu masih skor terbaik yang pernah dicatat ARC Prize pada harness tersebut.

Apakah bobot Qwen3.8-Max terbuka? Sebagian, dengan catatan lisensi. Alibaba merilis checkpoint kelas Max Qwen3.8-2.4T-A95B pada 12 Agustus di bawah lisensi kustom — bobotnya dapat diunduh, tetapi ini bukan keterbukaan ala Apache-2.0 seperti pada Qwen3.8-27B yang lebih kecil, dan Artificial Analysis masih mencantumkan model unggulan yang di-hosting sebagai proprietary. Jika kebutuhan Anda adalah "saya dapat menjalankan model yang persis seperti yang saya bayar," perbedaan itu penting; jika kebutuhan Anda adalah "saya dapat memeriksa arsitekturnya dan menghosting sendiri varian yang mendekati," Qwen3.8-Max memenuhi syarat dan GPT-6 Astra tidak.

Intisarinya

Pilih GPT-6 Astra jika Anda membutuhkan hal-hal spesifik yang saat ini hanya ia yang mampu melakukannya — pekerjaan keamanan ofensif, penalaran ilmiah mutakhir, tugas penggunaan komputer otonom yang paling sulit — dan organisasi Anda dapat melewati gerbang aksesnya serta mampu membayar harganya. Pilih Qwen3.8-Max jika Anda menginginkan model agen tingkat atas yang benar-benar dapat Anda terapkan minggu ini dengan harga $2/$6, dengan weights sebagai jalur pelarian dan regresi halusinasi yang kini Anda tahu perlu diuji. Pelajaran yang lebih luas justru terletak pada tulisan kecil itu sendiri: pada September 2026, dua model unggulan 'agentic' terdepan dijual dengan angka-angka utama yang tidak sepenuhnya dikendalikan oleh masing-masing pembuatnya, dan pembeli yang rasional membaca kerangka pengujiannya, menghitung jumlah turn, serta menjalankan tugas mereka sendiri sebelum memilih pihak.

Screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max) showing the $2.00 per 1M input and $6.00 per 1M output prices, and Alibaba listed as the provider with the model's flagship reasoning and agentic positioning.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari