
Claude Opus 5.5 vs GPT-5.6 Sol: Dua Tabel Peluncuran yang Nyaris Tidak Tumpang Tindih
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Tempatkan Claude Opus 5.5 dan GPT-5.6 Sol berdampingan minggu ini dan hal pertama yang Anda perhatikan bukanlah pemenangnya. Yang Anda perhatikan adalah bahwa kedua vendor menerbitkan tabel benchmark yang hampir tidak memiliki baris yang sama. Materi peluncuran Claude Opus 5.5, yang dirilis 22 September 2026, menempatkannya 29 poin di depan GPT-5.6 Sol pada Terminal-Bench 4.0. Materi peluncuran Sol, yang tersedia secara umum sejak 9 Juli 2026, justru memimpin dengan Terminal-Bench 2.1, di mana Sol Ultra mencetak skor 91,9%, dan Artificial Analysis Coding Agent Index, di mana ia meraih posisi teratas dengan skor 80. Kedua tabel itu nyata. Keduanya dijalankan oleh vendor yang memenangkannya. Pertanyaan yang berguna bukanlah model mana yang lebih baik secara abstrak — melainkan benchmark mana, yang dijalankan di bawah harness siapa, yang memberi tahu Anda sesuatu tentang beban kerja Anda. Itu adalah pertanyaan yang lebih sulit daripada yang ingin Anda tanyakan oleh kedua postingan peluncuran, dan itulah pertanyaan yang menjadi dasar perbandingan ini.
Kedua model, berdampingan

• Vendor — Anthropic vs OpenAI
• Dirilis — Claude Opus 5.5 pada 22 September 2026 vs GPT-5.6 Sol pada 9 Juli 2026
Harga per juta token — $4,00 untuk input / $20,00 untuk output vs $5,00 untuk input / $30,00 untuk output
• Pembacaan cache — $0,20 per juta pada Opus 5.5; tarif cache Sol ditetapkan per platform dan tidak dipublikasikan dalam satu angka yang dapat dibandingkan
• Jendela konteks — 1M token pada keduanya
• Output maksimum — 128K token pada keduanya, dengan 300K pada Batch API milik Anthropic di balik header beta
• Batas pengetahuan — Juni 2026 untuk Opus 5.5 vs 16 Februari 2026 untuk Sol
• Kontrol penalaran — pemikiran adaptif selalu aktif, default sedang upaya, skala berjalan dari rendah hingga maks vs pengaturan upaya penalaran maksimum plus mode Ultra yang mengoordinasikan sub-agen paralel
• Jajaran — Opus 5.5 adalah yang pertama dari keluarga 5.5, dengan Sonnet 5.5 dan Haiku 5.5 dijanjikan hadir dalam beberapa minggu mendatang vs Sol sebagai andalan keluarga tiga tingkat bersama Terra dan Luna
Dua dari baris tersebut melakukan lebih banyak pekerjaan daripada yang lain. Celah batas pengetahuan selebar empat bulan, yang penting jika prompt Anda menyentuh apa pun yang terjadi musim semi ini. Dan Opus 5.5 sekarang memotong harga Sol baik untuk harga input maupun output — sebuah pembalikan dari tiga bulan lalu, ketika Sol adalah cara yang lebih murah untuk mencapai output kelas frontier dan Claude Opus 5 berada di $5/$25.
Satu-satunya baris di mana kedua model benar-benar muncul
Ada tepat satu tabel yang diterbitkan yang memuat kedua model, dan itu milik Anthropic. Setiap angka di dalamnya dilaporkan oleh vendor, dihasilkan oleh perusahaan yang menjual salah satu dari kedua model:
• Terminal-Bench 4.0 — Claude Opus 5.5 66,4% vs GPT-5.6 Sol 37,3%
• Terminal-Bench-Science 0.1 — 58,7% vs 22,4%
• FrontierCode v1.1 (Utama) — 54,4% vs 47,5%
• CursorBench 4.0 — 57,8% vs 41,7%
• AutomationBench — 40,0% vs 28,8%
• GDPval-AA v2.1 — 1846 Elo vs 1588
Itu adalah kemenangan telak, dan selisih pada dua baris Terminal-Bench cukup besar sehingga layak diteliti, bukan sekadar diterima. Catatan kaki Anthropic sendiri melakukan sebagian dari pekerjaan itu untuk Anda: pengujian Terminal-Bench Opus 5.5 menggunakan upaya xhigh alih-alih default, dan pada upaya medium default, keunggulan FrontierCode menyempit menjadi 54,6% berbanding 47,5% — selisih tujuh poin alih-alih angka utama. Anthropic juga melampirkan peringatan umum pada seluruh tabel, dengan mengatakan bahwa pada tingkat kemampuan ini, selisih benchmark adalah "panduan yang kurang dapat diandalkan untuk perbedaan di dunia nyata" dan bahwa jarak internalnya dengan Claude Fable 5.1 lebih sempit daripada yang disiratkan oleh skor. Kalimat paling tepercaya di dalamnya adalah ketika vendornya sendiri merendahkan tabelnya.
Perhatikan juga apa yang tidak ada dari tabel itu: tolok ukur mana pun yang dimenangkan oleh model OpenAI. Tabel vendor yang hanya memuat baris-baris yang menguntungkan bukanlah bukti kemenangan menyeluruh; itu adalah bukti pemilihan baris.
Apa kata angka OpenAI sendiri
Materi peluncuran Sol menceritakan kisah yang berbeda, pada benchmark yang berbeda, di harness yang berbeda. Dilaporkan pada peluncuran Juli-nya:
• Terminal-Bench 2.1 — 91,9% untuk Sol Ultra dan 88,8% untuk Sol standar, dibandingkan Claude Mythos 5 pada 88,0% dan Claude Fable 5 pada 84,3%
• Artificial Analysis Coding Agent Index — 80, yang saat itu digambarkan sebagai yang paling canggih, 2,8 poin di atas Claude Fable 5
• Agents' Last Exam, alur kerja profesional jangka panjang — 53,6, yang oleh OpenAI dilaporkan sebagai 13,1 poin lebih unggul dari Claude Fable 5
• BrowseComp — 92,2%; OSWorld 2.0 — 62,6%; SWE-Bench Pro — 64,6%
Tidak ada satu pun dari baris-baris itu yang menyertakan Claude Opus 5.5, karena model itu belum ada pada bulan Juli. Tabel Sol dibuat untuk mengalahkan Fable 5 dan Mythos 5, dan memang berhasil. Apakah ia mengalahkan Opus 5.5 sama sekali tidak terjawab oleh materi vendor mana pun — kedua tabel itu disusun dengan selisih dua bulan terhadap lawan yang berbeda.
Baris SWE-Bench Pro layak mendapat catatan khusus, karena itulah satu-satunya tempat dalam materi peluncuran OpenAI yang menunjukkan modelnya kalah: 64,6% untuk Sol versus 80% untuk Claude Fable 5. OpenAI merespons dengan mempertanyakan validitas benchmark tersebut, memperkirakan bahwa sekitar 30% tugasnya bermasalah. Itu mungkin saja benar. Ini juga menjadi pengingat berguna bahwa "benchmark ini cacat" adalah klaim yang dibuat kedua lab, dan selalu tentang benchmark tempat mereka kalah.
Masalah harness, yang tidak dapat dipecahkan oleh tabel mana pun

Alasan kedua tabel tidak dapat direkonsiliasi bukanlah karena salah satu vendor berbohong. Alasannya adalah karena benchmark pengkodean agentik mengukur sebuah model plus sebuah scaffold, dan scaffold-nya berbeda. Terminal-Bench 4.0 dan Terminal-Bench 2.1 adalah revisi berbeda dari gagasan yang sama, dijalankan oleh orang yang berbeda, dengan anggaran alat dan aturan coba ulang yang berbeda. Angka Opus 5.5 milik Anthropic dihasilkan dalam harness Anthropic; angka Sol milik OpenAI dalam perkakas bergaya Codex. Pindahkan salah satu model ke harness milik yang lain dan skornya akan berubah.
Data independen, jika ada, menggambarkan persaingan yang lebih ketat daripada yang ditunjukkan kedua tabel. Sebuah benchmark agen pihak ketiga dari Agustus 2026, yang dijalankan pada beberapa model untuk pekerjaan aplikasi nyata, menyebut GPT-5.6 Sol sebagai kombinasi terbaik dari akurasi, biaya, dan kecepatan — sekitar $0,52 dan lima menit per uji coba — sementara Claude Opus 5, bukan 5.5, adalah yang paling akurat pada 92% uji coba. Papan peringkat terpisah yang mencakup tugas kode perusahaan menempatkan Claude Opus 5 di posisi pertama dengan 96,4% dan GPT-5.6 Sol di posisi ketiga dengan 86,5%, sekali lagi membandingkan Sol dengan Opus sebelumnya, bukan yang baru. Keduanya bukan adu langsung dengan Opus 5.5, dan keduanya tidak menuntaskan apa pun. Namun keduanya memang membuktikan bahwa ketika pihak selain vendor yang menjalankan perbandingan, marginnya menjadi kecil.
Intinya secara praktis adalah berhenti membaca tabel-tabel itu sebagai peringkat dan mulailah membacanya sebagai daftar hipotesis. Jika pekerjaan Anda adalah otomatisasi terminal berjangka panjang, selisih Terminal-Bench milik Anthropic adalah hipotesis yang layak diuji pada tugas-tugas Anda sendiri. Jika pekerjaan itu adalah riset profesional multi-langkah, hasil Agents' Last Exam milik Sol adalah jenis hipotesis yang sama. Tidak ada angka pun yang dapat ditransfer ke beban kerja Anda tanpa menjalankannya.
Biaya per tugas yang {{1}}selesai{{/1}}, yang merupakan satu-satunya biaya yang penting
Pada daftar tarif, Claude Opus 5.5 kini lebih murah di kedua arah: $4,00 versus $5,00 untuk input, $20,00 versus $30,00 untuk output, dan tarif cache-read $0,20 yang 60% lebih rendah daripada yang dibebankan Claude Opus 5. Bagi agen yang mengirim ulang prompt sistem yang panjang pada setiap giliran, baris cache itu adalah biaya yang dominan dan alasan mengapa sesi berjalan lama bisa menjadi jauh lebih murah tanpa perubahan prompt apa pun.
Tetapi harga per token tidak pernah menentukan tagihan agen. Argumen OpenAI untuk Sol saat peluncuran bertumpu pada efisiensi token alih-alih harga tertera — mereka melaporkan peningkatan 54% dalam efisiensi token coding, dengan token keluaran dan waktu berlalu kurang dari separuh milik Claude Fable 5 pada biaya sekitar sepertiga lebih rendah. Anthropic mengajukan argumen yang berkebalikan untuk Opus 5.5: biaya sekitar 40% lebih rendah untuk menjalankan beban kerja tipikal dibandingkan Claude Opus 5, pada daftar tarif yang hanya turun 20%, dengan pernyataan pelanggan dari Box, Kiro, Factory, dan GitHub yang semuanya menyebut pengurangan besar dalam token atau langkah. Kedua klaim mengarah ke kesimpulan yang sama — model yang selesai dalam lebih sedikit giliran yang menang — dan tidak satu pun diaudit secara independen.
Jika perhitungan biaya per tugas yang independen memang ada, saat ini perhitungan tersebut lebih menguntungkan Sol: satu analisis yang diterbitkan pada September menempatkan GPT-5.6 Sol pada $1,56 per isu yang diselesaikan di SWE-bench Verified dengan tingkat keberhasilan 96,2%, dibandingkan Claude Opus 4.8 pada 88,6%. Itu adalah Sol yang diukur terhadap model Anthropic yang lebih lama, bukan terhadap Opus 5.5, jadi ini adalah titik awal dan bukan putusan — tetapi ini menjadi pengingat bahwa model yang menyelesaikan isu pada percobaan pertama lebih murah daripada model yang lebih murah yang membutuhkan tiga kali percobaan. Satu-satunya pengukuran yang menuntaskan hal ini untuk Anda adalah tugas Anda sendiri, dijalankan dengan kedua cara, dengan jumlah token di hadapan Anda.
Itu masalah perutean, bukan masalah pengadaan, dan ada baiknya kita tepat mengenai sisi mana yang sudah dapat dipecahkan. GPT-5.6 Sol sudah tersedia di OrcaRouter hari ini pada harga daftar OpenAI sendiri dengan markup 0% — harga daftar penyedia diteruskan langsung, sehingga perubahan tarif vendor langsung aktif di sisi kami pada hari yang sama, bukan setelah sinkronisasi. Claude Opus 5.5 belum menjadi salah satu rute kami; model itu tersedia melalui API Anthropic sendiri dan cloud utama. Begitu tersedia, kunci yang sama melayani keduanya, dan itulah yang mengubah eksperimen ini menjadi aturan perutean, bukan kontrak kedua dan SDK kedua: kirim beban kerja ke model mana pun yang menurut angka Anda sendiri lebih unggul, pertahankan failover otomatis tetap mengarah ke model lainnya, dan biarkan baris routing-DSL memutuskan per permintaan, bukan per kuartal. Penurunan harga di sisi mana pun adalah perubahan konfigurasi, bukan migrasi.

Di mana keduanya benar-benar berbeda
Singkirkan tolok ukurnya, dan empat perbedaan tetap bertahan, semuanya dapat diperiksa:
• Batas pengetahuan. Juni 2026 untuk Opus 5.5 dibandingkan 16 Februari 2026 untuk Sol. Empat bulan adalah kesenjangan yang nyata bagi apa pun yang berkaitan dengan pustaka terkini, peristiwa terkini, atau API yang baru diubah, dan tidak ada tolok ukur yang menangkapnya.
• Perutean pengamanan. Opus 5.5 hadir dengan perlindungan kelas Fable 5.1: sebagian besar permintaan keamanan siber dialihkan ke Claude Opus 4.8 dan pekerjaan biologi dikembalikan ke Claude Opus 5 kecuali akun terverifikasi. Jika produk Anda berada di salah satu domain tersebut, sebagian lalu lintas Anda dijawab oleh model yang lebih kecil. Sol tidak memiliki perutean terdokumentasi yang setara, meskipun OpenAI mencatat evaluasi keselamatan terkait siber miliknya sendiri.
• Orkestrasi. Sol menyertakan mode Ultra yang mengoordinasikan beberapa sub-agen paralel, secara default empat, dan pengaturan upaya penalaran maksimum. Opus 5.5 tidak memiliki keduanya sebagai fitur platform; pengungkitnya adalah parameter effort, dan komposisi multi-model adalah sesuatu yang Anda bangun atau atur rutenya, bukan sesuatu yang diberikan vendor kepada Anda.
• Ekonomi keluarga. Sol adalah salah satu dari tiga tingkat, dengan Terra dan Luna di bawahnya — dan harga Luna dipangkas 80% serta Terra 20% dalam pembaruan 30 Juli. Varian Anthropic yang lebih murah, Sonnet 5.5 dan Haiku 5.5, telah diumumkan tetapi belum dirilis. Jika beban kerja Anda campuran, OpenAI saat ini menawarkan tingkatan yang lebih murah.
Memilih di antara keduanya
Pilih Claude Opus 5.5 jika pekerjaan Anda adalah pengkodean agentik atau pekerjaan pengetahuan yang berjalan lama, jika harga per token penting, jika prompt Anda menyentuh apa pun dari empat bulan terakhir, atau jika konteks 1 juta token dengan harga $0,20 per juta token yang di-cache adalah yang membuat arsitektur Anda terjangkau. Mulai dari sedang upaya, bukan pengaturan tinggi yang diwariskan, dan ukur apakah rendah tetap bertahan.
Pilih GPT-5.6 Sol jika Anda menginginkan mode orkestrasi bawaan vendor, jika Anda membutuhkan tier yang lebih murah di bawah produk unggulan hari ini alih-alih dalam beberapa minggu, atau jika beban kerja Anda adalah jenis yang paling cocok dengan bukti peluncuran Sol sendiri — alur kerja profesional berjangka panjang dan penggunaan komputer, di mana ia melaporkan hasil terkuatnya.
Jika Anda sudah menggunakan Claude Opus 5, perhatikan bahwa Opus 5.5 bukan pengganti langsung: thinking tidak dapat lagi dinonaktifkan, penggunaan tool yang dipaksakan akan menghasilkan error, blok thinking terikat pada model dan percakapan, dan tool computer-use yang lebih lama computer_20251124 tidak diterima di Claude API atau Google Cloud. Tiga hal pertama juga berlaku untuk Claude Fable 5.1. Beralih ke Sol adalah integrasi yang sepenuhnya berbeda.
Apa yang sebenarnya bisa menyelesaikan perbandingan ini adalah satu uji independen terhadap kedua model pada upaya yang setara, dalam harness yang setara, pada kumpulan tugas yang sama. Per minggu ini, belum ada yang menerbitkannya. Sampai seseorang melakukannya, posisi jujurnya adalah posisi yang didukung bukti: tabel Anthropic mengunggulkan Opus 5.5 dan dibuat oleh Anthropic; tabel OpenAI mengunggulkan Sol dan dibuat oleh OpenAI; hasil independen yang ada membandingkan Sol dengan Opus sebelumnya dan menggambarkan persaingan yang jauh lebih ketat; dan dua baris yang akan menentukan tagihan Anda — token per tugas yang diselesaikan dan volume baca cache — adalah dua baris yang tidak diterbitkan oleh vendor mana pun.
Dibandingkan dalam artikel ini4
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
