Kartu judul hero bertuliskan "Claude Opus 5.5 vs GPT-6 Astra" dengan subjudul "Uji rasa yang melampaui tolok ukur", overline bertuliskan "Perbandingan unggulan terdepan - September 2026", tiga lencana bertuliskan "Rasa: tidak ada di sumbu tolok ukur mana pun", "Beban kerja riset: Astra bertahan" dan "Harga: $4.00 / $20.00 vs $10.00 / $50.00 per 1M", baris footer bertuliskan "Tabel peluncuran vendor dan uji independen tidak sepakat soal besarnya keunggulan.", dan logo OrcaRouter di kanan bawah.
Guides & Insights

Claude Opus 5.5 vs GPT-6 Astra: Uji Rasa yang Melampaui Tolok Ukur

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Seseorang meminta Claude Opus 5.5 untuk membuat video pendek tentang lab saingan yang memecahkan Navier-Stokes, memposting hasilnya, lalu menulis kalimat yang membuat perbandingan ini layak dilakukan: model itu "sangat bagus," memiliki "selera yang hebat," dan ini adalah Claude pertama sejak Opus 4.7 yang benar-benar ingin mereka jalankan secara intensif — tetapi mereka masih mempertahankan GPT-6 Astra dan GPT-5.6 Sol sebagai penggerak utama mereka, karena pekerjaan mereka berat riset. Itu tiga klaim dalam satu postingan, dan semuanya menarik ke arah yang berbeda. Sebuah model bisa menjadi hal paling menyenangkan untuk digunakan dan tetap bukan yang Anda gunakan untuk mengarahkan lalu lintas produksi. Pertanyaan yang menarik bukanlah model mana yang lebih baik. Melainkan mana dari dua putusan itu yang bertahan saat dihadapkan pada angka, dan mana yang ternyata merupakan pernyataan tentang selera.

Tulisan ini adalah laporan seorang praktisi, bukan uji benchmark — anggap ini sebagai sinyal tentang bagaimana model terasa dalam pekerjaan kreatif dan terbuka, bukan sebagai bukti tentang kemampuan. Semua angka di bawah ini diberi label siapa yang menghasilkannya.

Apa yang bisa dan tidak bisa diketahui dari uji rasa

Artefaknya penting di sini. Membuat video tentang hasil matematika bukanlah tugas pemrograman dengan gerbang lulus/gagal. Tidak ada langkah kompilasi, tidak ada rangkaian pengujian, tidak ada harness Terminal-Bench yang menilai apakah hasilnya bagus atau tidak. Model harus memilih sudut pandang, memutuskan apa yang ditampilkan, menjaganya tetap koheren, dan berhenti. Ketika seorang praktisi mengatakan bahwa sebuah model memiliki "selera yang hebat," itulah yang mereka gambarkan: pertimbangan tentang cakupan dan penekanan yang muncul dalam pekerjaan yang spesifikasinya sengaja dibuat samar.

Itu adalah kemampuan yang nyata, dan itulah hal yang paling buruk diukur oleh rangkaian benchmark. Itu juga alasan mengapa orang yang sama bisa memuji sebuah model tetapi tidak beralih menggunakannya. Selera adalah yang Anda inginkan saat sedang menjelajah. Itu bukan yang Anda inginkan saat memiliki 200.000 baris kode untuk diaudit dan tagihan yang harus dipertanggungjawabkan.

Kerangka peluncuran Anthropic sendiri menunjuk pada kemampuan yang sama, dalam bentuk prosa, bukan video: Claude Opus 5.5 dipromosikan sebagai tulisan yang kurang "Claudish" — lebih sedikit basa-basi, lebih sedikit berkelit, lebih bersedia menempatkan intinya di depan. Penilaian keterbacaan independen mendukung arah klaim itu bahkan ketika tidak setuju dengan besarnya. Vendor juga melaporkan tes pemeriksaan fakta internal yang lulus 16 dari 18 percobaan, sementara nol dari 18 untuk Claude Fable 5.1 dan Claude Opus 5; angka itu milik Anthropic sendiri, tidak direproduksi, dan harus dibaca sebagai klaim, bukan hasil.

Dua papan skor, satu ketidaksepakatan yang penting

A two-column scoreboard titled "Claude Opus 5.5 vs GPT-6 Astra - the scoreboard". The Claude Opus 5.5 column reads: Released Sep 22 2026, Price per 1M $4.00 / $20.00, Terminal-Bench 4.0 66.4% vendor and 59.6% independent, Terminal-Bench-Science 0.1 58.7%, GDPval-AA v2.1 1,846 Elo, Tokens per problem about 119,000. The GPT-6 Astra column reads: Released Sep 3 2026, Price per 1M $10.00 / $50.00, Terminal-Bench 4.0 57.9%, Terminal-Bench-Science 0.1 64.6%, GDPval-AA v2.1 1,542 Elo, Tokens per problem about 27,000. A footer reads "Opus 5.5 figures per Anthropic unless noted; Astra and independent figures per Artificial Analysis."

Pada tolok ukur mentah yang dipublikasikan, Claude Opus 5.5 lebih sering unggul atas GPT-6 Astra daripada tidak. Masalahnya, dua sumber yang paling banyak dikutip tidak sepakat soal seberapa besar keunggulannya.

Tabel peluncuran Anthropic menempatkan Claude Opus 5.5 pada 66,4% di Terminal-Bench 4.0, dengan GPT-6 Astra pada 57,9% dan Claude Fable 5.1 pada 55,8%. Itu adalah keunggulan 8,5 poin yang dilaporkan vendor dalam coding agentik — jenis selisih yang mengakhiri perdebatan di dek pemasaran. Artificial Analysis, yang menjalankan harness-nya sendiri, mengukur Claude Opus 5.5 pada 59,6% di benchmark yang sama: setara dengan GPT-6 Astra pada upaya xhigh, dan sekitar 11 poin di atas Claude Opus 5. Keunggulannya nyata dalam kedua pembacaan. Besarnya tidak.

Di mana kedua model bertukar tempat lebih berguna daripada di mana mereka tidak:

• Terminal-Bench 4.0 (pengodean agentik) — Claude Opus 5.5 66,4% menurut tabel Anthropic sendiri, 59,6% menurut Artificial Analysis; GPT-6 Astra 57,9%.

• Humanity's Last Exam, dengan alat — Claude Opus 5.5 67,7% dilaporkan oleh vendor, diukur secara independen sebesar 61,4%; GPT-6 Astra 57,2%.

• GDPval-AA v2.1 (kerja pengetahuan dunia nyata di 44 profesi) — Claude Opus 5.5 1.846 Elo; GPT-6 Astra 1.542 Elo. Kedua angka tersebut berasal dari papan independen Artificial Analysis, bukan dari vendor.

• Terminal-Bench-Science 0.1 — GPT-6 Astra 64,6% vs Claude Opus 5.5 58,7%. Ini kemenangan Astra yang jelas, dan ini adalah tolok ukur agentik yang bernuansa sains.

• AutomationBench — GPT-6 Astra 41,4% vs Claude Opus 5.5 40,0%. Tipis, tapi Astra lagi.

• FrontierCode v1.1 — Claude Opus 5.5 54,4% vs GPT-6 Astra 53,3%. Selisihnya kurang dari satu poin.

Baca daftar itu seperti cara seorang praktisi membacanya. Beban kerja yang berat riset — yang memiliki komponen sains atau literatur, yang menjalankan loop panjang menggunakan alat dan membutuhkan model untuk menjaga pijakannya — justru di situlah GPT-6 Astra bertahan. Papan peringkat kerja pengetahuan dan coding tempat Claude Opus 5.5 melesat jauh adalah papan yang akan Anda tunjuk jika pekerjaan Anda adalah merilis perangkat lunak. Kedua orang dalam percakapan ini membaca benchmark mereka sendiri dengan benar. Mereka hanya membaca benchmark yang berbeda.

Pengaturan effort melakukan lebih banyak pekerjaan daripada modelnya

Ada alasan kedua yang tidak begitu menyenangkan mengapa margin utama melemah. Perbandingan vendor tidak dijalankan pada pengaturan yang sama.

Angka yang dipublikasikan Claude Opus 5.5 berasal dari konfigurasi upaya penalaran sangat tinggi (xhigh), dibandingkan dengan GPT-6 Astra pada pengaturan tinggi. Uji independen Artificial Analysis menempatkan kedua model pada xhigh dan kesenjangan coding pun hilang — keunggulan 8,5 poin dari vendor itu menjadi seri. Itu bukan tuduhan pelanggaran; itulah yang terjadi ketika vendor memilih konfigurasi yang paling menunjukkan keunggulan modelnya dan laboratorium independen memilih konfigurasi yang setara dengan kompetisi. Sebelum Anda memindahkan beban kerja berdasarkan kekuatan tabel benchmark, periksa pada pengaturan upaya mana uji itu dijalankan, karena jawabannya sering kali "yang menyanjung."

Tagihan token menceritakan kisah yang sama dari sudut pandang lain. Materi peluncuran Anthropic sendiri menyebut Claude Opus 5.5 menghabiskan sekitar 119.000 token per masalah, dengan sekitar 84.000 di antaranya digunakan untuk berpikir, sementara GPT-6 Astra menyelesaikan masalah serupa dalam sekitar 27.000 token. Token berpikir ditagih sebagai token keluaran. Model yang menggunakan empat kali lipat token dengan seperlima harga keluaran hampir impas — dan itu sebelum memperhitungkan fakta bahwa model yang lebih murah sering kali justru model yang Anda tetap bersedia menjalankan pada pengaturan upaya yang lebih tinggi.

Satu peringatan tambahan secara khusus ada di sisi Claude Opus 5.5: perutean pengaman Anthropic dapat mengarahkan sebagian permintaan yang bersinggungan dengan siber dan bio ke jalur yang lebih restriktif, yang menurunkan skor yang dipublikasikan pada evaluasi tersebut dibandingkan dengan apa yang akan dihasilkan oleh model dasarnya. Jika pekerjaan Anda menyentuh domain tersebut, kesenjangan antara tolok ukur dan pengalaman Anda akan nyata, dan arahnya adalah tolok ukur tersebut menjadi terlalu optimistis.

Berapa biaya tugas nyata untuk masing-masing

Screenshot of Anthropic's Claude Platform release notes page, with "September 22, 2026" selected in the sidebar. The entry announces the launch of Claude Opus 5.5 (claude-opus-5-5) with a 1M token context window by default, 128k max output tokens and always-on adaptive thinking, at $4 / $20 USD per MTok against Claude Opus 5 at $5 / $25, and notes that thinking cannot be disabled, that depth is controlled through the effort parameter, and that Fast mode is available as a research preview.

Claude Opus 5.5 adalah model yang lebih murah di daftar tarif, dan tidak ada yang mendekati:

• Claude Opus 5.5 — $4,00 per juta input, $20,00 per juta output, $0,20 per juta input yang di-cache, $5,00 per juta penulisan cache. Konteks 1M token, output maksimum 128k.

• GPT-6 Astra — $10,00 per juta input, $50,00 per juta output, $1,00 per juta input yang di-cache, $12,50 per juta penulisan cache. Setelah melewati 272.000 token input dalam satu permintaan, seluruh permintaan dihargai ulang menjadi $20,00 input dan $100,00 output; tier batch adalah $5,00/$25,00.

Jadi Claude Opus 5.5 2,5 kali lebih murah untuk input dan 2,5 kali lebih murah untuk output, dengan input yang di-cache lima kali lebih murah. Jika tugas Anda serupa secara token, itulah keseluruhan keputusannya dan pertanyaan selera hanyalah hiasan.

Peringatan penggunaan token di atas itulah yang membuatnya tidak sesederhana itu, dan penetapan harga ulang konteks panjang GPT-6 Astra adalah jebakan lainnya. Jika melewati 272.000 token masukan dalam satu permintaan, seluruh permintaan — bukan hanya kelebihannya — beralih ke tarif konteks panjang. Beban kerja riset yang menjejalkan korpus besar ke dalam satu panggilan adalah bentuk persis yang memicunya. Batch dengan harga setengah adalah jalan keluar yang sah, dan itu berada di antrean yang lebih lambat.

Ringkasan jujurnya adalah bahwa gambaran biaya justru berbalik bergantung pada apa yang sedang Anda lakukan. Untuk tugas di mana kedua model menggunakan token yang sebanding, Claude Opus 5.5 menang soal harga dengan selisih yang lebar. Untuk loop riset agentik yang panjang di mana jumlah token menyimpang seperti yang ditunjukkan materi peluncuran Anthropic sendiri, keduanya bertemu — yang merupakan judul yang jauh kurang menarik dibandingkan pemotongan biaya 40%, dan lebih dekat dengan apa yang dilaporkan praktisi tersebut.

Mengapa pengguna yang banyak melakukan riset tidak beralih

Gabungkan semua bagiannya, dan pernyataan "tetap lebih memilih Astra" tidak lagi menjadi kontradiksi dengan pernyataan "rasa yang lezat". Itu adalah pengamatan yang sama dari sudut pandang yang berbeda.

Beban kerja yang disebutkan pengguna bersifat panjang, terbuka, menggunakan alat, dan mahal per eksekusi. Pada beban kerja tersebut, GPT-6 Astra menguasai papan sains dan otomasi, hanya memakai sebagian kecil token berpikir, dan — menurut pengukuran independen — setara dalam hal coding ketika kedua model dijalankan dengan upaya yang sama. Keunggulan Claude Opus 5.5 terkonsentrasi pada pekerjaan di mana Anda dapat melihat keluaran dan menilainya: prosa, pilihan desain, menentukan cakupan brief yang ambigu, memutuskan apa yang sebenarnya harus ditampilkan oleh video tentang Navier-Stokes. Itu adalah selera, dan selera justru merupakan bagian yang tidak muncul pada sumbu benchmark.

Jika Anda berharap ada putusan bahwa satu model menang, buktinya tidak mendukung hal itu. Versi yang bisa dipertahankan lebih sempit: Claude Opus 5.5 adalah model yang lebih baik untuk pekerjaan yang hambatannya adalah pertimbangan, GPT-6 Astra adalah model yang lebih baik untuk pekerjaan yang hambatannya adalah upaya konteks panjang yang berkelanjutan, dan selisih harga di antara keduanya menyempit hingga hampir tidak ada pada jenis pekerjaan kedua. Itu keputusan perutean, bukan konversi.

Menjalankan keduanya tanpa migrasi

Screenshot of the OrcaRouter models catalogue filtered by the query "astra", showing one result card: OpenAI GPT-6 Astra, model id openai/gpt-6-astra, described as OpenAI's flagship model for demanding long-horizon end-to-end work, with a 1M context window and a per-1M-token base rate of $10.00 input, $50.00 output, $1.00 cache read and $12.50 cache write.

Inilah bagian ketika kedua model tidak lagi menjadi pilihan salah-satu-saja. GPT-6 Astra sudah tersedia di OrcaRouter hari ini dengan harga daftar milik OpenAI sendiri — $10.00 input, $50.00 output, $1.00 pembacaan cache, $12.50 penulisan cache — dengan markup 0%, harga daftar penyedia diteruskan langsung. Artinya, perubahan tarif vendor langsung berlaku di sisi kami pada hari yang sama, bukan menunggu kapan pun reseller melakukan sinkronisasi.

Claude Opus 5.5 dapat diakses melalui API milik Anthropic sendiri dan beberapa platform pihak ketiga; kami tidak mencantumkannya sebagai sesuatu yang kami layani, dan Anda sebaiknya bersikap skeptis terhadap siapa pun yang mengklaim sebaliknya sebelum model tersebut beredar luas. Yang dapat Anda lakukan hari ini adalah menempatkan kedua model di balik satu kunci dan satu bentuk endpoint, lalu merutekan berdasarkan beban kerja alih-alih berdasarkan preferensi: kirim permintaan terbuka yang sarat penilaian ke Claude Opus 5.5 dan loop riset yang panjang ke GPT-6 Astra tanpa harus memelihara dua kontrak atau dua integrasi klien.

Failover otomatis adalah yang membuat hal itu aman untuk diuji. Model baru belum menjadi jalur produksi, dan merutekan melalui satu endpoint berarti insiden penyedia atau batas laju akan memindahkan permintaan alih-alih menggagalkannya. Jika Anda ingin mengetahui apakah kesenjangan selera itu nyata pada pekerjaan Anda sendiri, itulah cara murah untuk mengetahuinya — jalankan berdampingan dengan yang sudah Anda miliki alih-alih menggantikannya, dan biarkan suite Anda sendiri yang memutuskan, bukan tabel peluncuran.

Pertanyaan yang tidak dapat dijawab oleh tolok ukur

Ada dua hal yang patut dicermati, dan keduanya bukan sekadar poin benchmark.

Yang pertama adalah apakah asimetri pengaturan effort dapat diselesaikan. Saat ini, tabel vendor pada xhigh melawan pesaing pada high menghasilkan keunggulan 8,5 poin yang oleh pengujian independen pada pengaturan yang disamakan berubah menjadi seri. Ketika laboratorium independen menerbitkan hasil uji dengan pengaturan yang disamakan pada papan sains dan otomasi tempat GPT-6 Astra saat ini memimpin, gambaran itu dapat bergerak ke salah satu arah — dan itu akan bergerak berdasarkan bukti, bukan berdasarkan pembingkaian siapa pun.

Yang kedua adalah pertanyaan efisiensi token. Jika overhead pemikiran Claude Opus 5.5 turun dalam rilis titik, keunggulan tarif 2,5x-nya berhenti terimbangi dan argumen harga menang sepenuhnya. Jika tidak, maka praktisi yang tetap menjadikan GPT-6 Astra sebagai penggerak utama mereka tidak tertinggal dari siklus berita. Mereka membaca beban kerja mereka sendiri dengan benar, dan tabel peluncuran itu memang tidak mengukurnya.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari