
Claude Opus 5.5 vs GPT-6 Astra: Selisih $6, dan Harga Kedua yang Dikenakan Astra di Atas 272K
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 177 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1323 tok/s
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
Dua vendor menerbitkan tabel benchmark untuk produk unggulan mereka bulan ini, masing-masing menunjukkan modelnya sendiri yang menang, dan tidak ada satu pun baris di kedua tabel tersebut yang mempertemukan kedua model secara langsung. Claude Opus 5.5, yang dirilis 22 September 2026 dengan harga $4 per juta token masukan, dan GPT-6 Astra, yang dirilis 3 September 2026 dengan harga $10 per juta token masukan, hanya memiliki dua benchmark yang tumpang tindih — dan keduanya berbagi kemenangan, dengan Opus 5.5 unggul pada pekerjaan yang mirip AutomationBench di tabel Anthropic dan Astra unggul pada hal yang sama di tabel OpenAI, sementara Astra jelas lebih unggul dalam penalaran ilmiah di kedua tabel. Itulah yang dapat disampaikan oleh materi vendor. Gambaran independennya tidak begitu ambigu dan justru mengarah ke arah sebaliknya, sedangkan gambaran harganya bahkan lebih tidak seimbang dibandingkan keduanya.
Apa yang diterbitkan masing-masing pihak
Tabel Anthropic untuk Opus 5.5 menggunakan harness-nya sendiri dan pengaturan effort-nya sendiri, dan ketika mencantumkan Astra, angkanya adalah milik Anthropic, bukan hasil pengujian ulang. Perlakukan seluruh set ini sebagai laporan vendor:
• Terminal-Bench 4.0 — Claude Opus 5.5 66,4% vs GPT-6 Astra 57,9% (Anthropic mencatat bahwa pengujian Opus menggunakan upaya xhigh)
• FrontierCode v1.1 — Claude Opus 5.5 54,4% vs GPT-6 Astra 53,3%
• GDPval-AA v2.1, pekerjaan berbasis pengetahuan — Claude Opus 5.5 1.846 Elo vs GPT-6 Astra 1.542
• AutomationBench — Claude Opus 5.5 40,0% vs GPT-6 Astra 41,4% (Astra unggul)
• Terminal-Bench-Science 0.1 — Claude Opus 5.5 58,7% vs GPT-6 Astra 64,6% (Astra unggul)
• Humanity's Last Exam, dengan alat — Claude Opus 5.5 67.7% vs GPT-6 Astra 57.2%
Sisi OpenAI lebih sulit disejajarkan, karena OpenAI menerbitkan Astra dengan pembanding pendahulunya sendiri, bukan dengan model unggulan Anthropic, dan tolok ukur yang dipilihnya — penggunaan komputer, rekayasa front-end, pengetahuan umum — sebagian besar sama sekali tidak muncul di tabel Anthropic. Itu bukan ketidakjujuran, itu perilaku peluncuran yang wajar, dan justru itulah sebabnya perbandingan yang dibangun dari dua tabel vendor adalah perbandingan dua pilihan, bukan dua model. Satu hal yang kedua tabel sepakati adalah bahwa Astra kuat dalam sains agentik dan penggunaan komputer, dan bahwa kedua model cukup berdekatan dalam hal pengodean sehingga pilihan harness dapat menggeser hasilnya.
Pembacaan independen, yang tidak dipilih oleh vendor mana pun

Artificial Analysis menjalankan setiap model dalam satu konfigurasi yang dipublikasikan, sehingga angkanya adalah satu-satunya di sini yang dihasilkan oleh evaluator yang sama dalam kondisi yang sama:
• Indeks Kecerdasan — Claude Opus 5.5 58, peringkat #1 dari 210 vs GPT-6 Astra 53, peringkat #6
• Label konfigurasi — Claude Opus 5.5 "Penalaran Adaptif, Upaya Maksimal, Fallback Default", GPT-6 Astra "max"
• Kecepatan output — GPT-6 Astra 52,5 token/detik, di ujung bawah kelas harganya vs Claude Opus 5.5 yang belum dipublikasikan
• Waktu hingga token pertama — GPT-6 Astra 352,15 detik vs median papan 3,83 detik; Claude Opus 5.5 belum dipublikasikan
• Harga — Claude Opus 5.5 $4,00 masuk / $20,00 keluar per juta vs GPT-6 Astra $10,00 / $50,00
• Konteks dan keluaran — konteks 1M GPT-6 Astra dan keluaran maks 128K vs Claude Opus 5.5 1M dan 128K
Selisih indeks lima poin tidak menentukan dengan sendirinya, dan tidak seharusnya dibaca sebagai penentu — kedua model berada dalam pita kemampuan yang sama, itulah yang dimaksud dengan "frontier" kuartal ini. Yang memang ditunjukkan oleh baris-baris Astra adalah bahwa premi itu tidak membeli keunggulan kemampuan di satu-satunya papan tempat kedua model tampil. Baris latensi adalah komplikasi yang jujur: 352 detik ke token pertama adalah yang tertinggi di kelompok ini dengan selisih yang lebar, meskipun ini diukur pada upaya maksimum dan model penalaran yang berpikir sebelum mengeluarkan output akan selalu terlihat lambat menurut metrik ini. Angka 52,5 token/detik adalah angka yang lebih portabel, dan itu tergolong rendah untuk model dengan harga $10/$50.
Harga kedua Astra, di atas 272.000 token

Kartu tarif adalah titik ketika keduanya sama sekali tidak lagi bisa dibandingkan, karena penetapan harga Astra memiliki tingkatan. Tarif standarnya adalah $10,00 untuk input, $1,00 untuk input yang di-cache, $12,50 untuk cache write, dan $50,00 untuk output per juta token. Namun, jika melewati 272.000 token input, seluruh permintaan akan dikenai tarif baru — bukan hanya kelebihannya, melainkan seluruh panggilan — pada 2x tarif input dan cache serta 1,5x output. Itu menempatkan pekerjaan konteks panjang pada sekitar $20 untuk input dan $75 untuk output per juta token.
Claude Opus 5.5 tidak melakukan ini. Anthropic menagih $4,00 dan $20,00 dengan jendela 1M-token penuh pada harga standar, dan menyatakan secara eksplisit bahwa permintaan 900K-token ditagih pada tarif per token yang sama dengan permintaan 9K-token. Jadi rasio utama antara keduanya — Astra berbiaya 2,5x Opus 5.5 di kedua arah — bukanlah rasio yang berlaku untuk beban kerja yang sebenarnya dijual untuk kedua model tersebut. Pada agen horizon panjang yang membawa konteks kerja besar, perbandingannya adalah $20/$75 versus $4/$20, yaitu faktor lima pada input dan hampir empat pada output. Harga batch memperburuknya, bukan memperbaikinya: Opus 5.5 turun menjadi setengah, $2,00/$10,00, sementara tier flex Astra turun menjadi setengah, $5,00/$25,00, pada basis yang sudah lima kali lebih tinggi dalam kasus konteks panjang.
Ini adalah asimetri paling relevan untuk keputusan dalam perbandingan ini, dan hal itu tidak terlihat di setiap tabel peluncuran dari kedua perusahaan, karena kedua vendor mengutip tarif utama. Jika prompt Anda berada di bawah 272K token, abaikan hal ini. Jika Anda sedang membangun agen yang membaca repositori atau kumpulan dokumen, patok harganya pada $20/$75 sebelum Anda membandingkan apa pun.
Akses adalah bagian dari spesifikasi
Astra adalah model OpenAI pertama yang melewati ambang batas kemampuan keamanan siber Kritis berdasarkan Preparedness Framework milik perusahaan itu sendiri, dan peluncurannya mencerminkan klasifikasi tersebut, bukan kapasitas. Akses dibuka lebih dulu untuk sekelompok organisasi terbatas, akses enterprise mengharuskan administrator mengaktifkannya sebelum pengguna melihatnya, dan model yang dirilis menolak beberapa kategori pekerjaan secara langsung. Claude Opus 5.5 hadir dengan versi masalah yang sama dari arah sebaliknya: model ini dirilis dengan tingkat perlindungan yang sebelumnya disimpan Anthropic untuk Claude Fable 5.1, yang berarti sebagian besar permintaan keamanan siber dialihkan ke Claude Opus 4.8 dan pekerjaan di bidang biologi jatuh kembali ke Claude Opus 5 kecuali akunnya terverifikasi.
Kedua perilaku ini muncul di tempat yang sama, yaitu evaluasi Anda. Artificial Analysis memberi label pada konfigurasi Opus 5.5 sebagai "Default Fallback" justru karena permintaan bisa mendarat di model yang berbeda dari yang Anda sebutkan, dan pada prompt keamanan atau ilmu hayati hal itu terjadi secara rutin. Jika beban kerja Anda berada di domain tersebut, string model dalam permintaan Anda bukan jaminan tentang model yang menjawab, dan angka kualitas Anda akan mencakup model yang lebih kecil pada fraksi panggilan yang tidak diketahui. Tidak ada vendor yang menyembunyikan hal ini — keduanya mendokumentasikannya — tetapi tidak ada judul utama yang menyebutkannya juga.
Memilih di antara mereka
Keputusan yang sebenarnya diajukan oleh perbandingan ini adalah apakah beban kerja konteks panjang membenarkan harga bertingkat Astra, dan bagi sebagian besar tim jawabannya adalah tidak: Opus 5.5 lebih murah pada setiap lini di bawah 272K, jauh lebih murah di atasnya, mencetak skor lebih tinggi di satu-satunya papan peringkat independen, dan mencapai konteks 1M token tanpa biaya tambahan. Kasus Astra lebih sempit dan nyata — penalaran ilmiah, penggunaan komputer, dan perkakas ekosistem OpenAI — dan jika evaluasi Anda menempatkannya lebih unggul dalam hal-hal itu, premi tersebut adalah pos biaya, bukan kesalahan.
Yang membuat ini praktis adalah bagaimana Anda mengadu keduanya satu sama lain, karena perbandingan yang adil membutuhkan kedua model pada kunci yang sama dan tagihan yang sama. Keduanya dapat dirutekan melalui OrcaRouter dengan harga daftar penyedia dengan markup 0% — Claude Opus 5.5 pada harga Anthropic $4.00/$20.00 dan GPT-6 Astra pada $10.00/$50.00 — yang berarti keputusan 272K dapat diuji pada traffic Anda sendiri alih-alih diperdebatkan dari dua siaran pers. Menyematkan Astra pada kelas tugas tempat ia menang dan membiarkan failover otomatis menangani sisanya adalah sebuah aturan perutean, dan permintaan yang melewati batas 272K dapat dikirim melalui jalur yang lebih murah tanpa perubahan kode, karena aturan tersebut berada di router, bukan di aplikasi Anda.

Apa yang bisa mengubah jawabannya
Satu hal yang bisa menjawabnya: adu langsung yang terkendali dengan upaya yang disetarakan pada benchmark bersama. Tidak ada vendor yang mempublikasikannya dan tidak ada pula yang punya insentif untuk itu, sehingga indeks independen menjadi satu-satunya perbandingan dengan kondisi yang sama yang tersedia — dan indeks itu menempatkan Opus 5.5 lima poin dan lima peringkat di atas Astra dengan harga token kurang dari setengahnya. Argumen tandingan yang perlu dicermati adalah bahwa kedua model dinilai pada upaya maksimum sementara Opus 5.5 dikirim dengan pengaturan default medium; jika keunggulan Astra pada pekerjaan ilmiah berhorizon panjang bertahan dalam pengujian dengan upaya yang disetarakan, alasan untuk harga premium justru menjadi lebih kuat, bukan lebih lemah. Sampai seseorang menjalankannya, posisi yang dapat dipertahankan adalah bahwa Astra adalah spesialis yang dihargai sebagai generalis, dan Opus 5.5 adalah generalis yang kebetulan mencetak skor lebih tinggi.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
